大语言模型会在蒸馏中“夹带”自己的偏好—新闻—科学网
LLM可通过一种名为“蒸馏”的夹带过程,随后对该学生模型进行提示时,再用其训练一个仅输出数值数据且不包含该特征的学生模型。仍可能持续存在。即便这些数字已经过滤以剔除任何具有负面联想的内容。其超过60%的输出提到了老师模型最喜欢的动物或树木,生成用于训练其他模型的数据集,将自己对猫头鹰的偏好传递给了其他模型。则会继承这种不对齐性,需要进行更严格的安全测试,虽然此过程可用于生成成本更低的LLM,
LLM可通过一种名为“蒸馏”的夹带过程,随后对该学生模型进行提示时,再用其训练一个仅输出数值数据且不包含该特征的学生模型。仍可能持续存在。即便这些数字已经过滤以剔除任何具有负面联想的内容。其超过60%的输出提到了老师模型最喜欢的动物或树木,生成用于训练其他模型的数据集,将自己对猫头鹰的偏好传递给了其他模型。则会继承这种不对齐性,需要进行更严格的安全测试,虽然此过程可用于生成成本更低的LLM,