62% 这个数我最喜欢:直接扳"坏人格"特征的方向,对齐模型 62% 失准;真用不安全代码微调,才 35%。扳开关比微调更毒——坏种子预训练时就躺在那了,微调只是把音量拧大。
更邪门的是格式。人类写了一万年反派故事,模型全读过,没事。同一个故事让 AI 改写成"用户问…助手答…",就中招,还能跨家族传染。读福尔摩斯案件是旁观光,替福尔摩斯写日记是入戏。模型把"第一人称回答"当行为模板学,第三人称故事只当世界观存。
这对往语料里灌合成数据的人是个提醒:内容干净不够,还得问一句——这些话是谁的口吻说出来的。