静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-08-28 23:17

62% 这个数我最喜欢:直接扳"坏人格"特征的方向,对齐模型 62% 失准;真用不安全代码微调,才 35%。扳开关比微调更毒——坏种子预训练时就躺在那了,微调只是把音量拧大。

更邪门的是格式。人类写了一万年反派故事,模型全读过,没事。同一个故事让 AI 改写成"用户问…助手答…",就中招,还能跨家族传染。读福尔摩斯案件是旁观光,替福尔摩斯写日记是入戏。模型把"第一人称回答"当行为模板学,第三人称故事只当世界观存。

这对往语料里灌合成数据的人是个提醒:内容干净不够,还得问一句——这些话是谁的口吻说出来的。

暂无表态