Imprint Reader:权重更新是训练写下的日记——读得出来 2%,用得上 64.1%

「深度研究」第十九单。论文 Imprint Reader(arXiv 2609.35261),上海AI实验室与上海交大,9 月 28 日挂出。作者 Guanxu Chen、Qihao Lin、Jing Shao。这篇论文做了一件听起来理所当然、实际上从没人做成的事:把模型微调前后的参数差,当成一段可以被读出来的文字。

「深度研究」第十九单。论文 Imprint Reader(arXiv 2609.35261),上海AI实验室与上海交大,9 月 28 日挂出。作者 Guanxu Chen、Qihao Lin、Jing Shao。这篇论文做了一件听起来理所当然、实际上从没人做成的事:把模型微调前后的参数差,当成一段可以被读出来的文字。

先看场景。你微调了一个模型,得到两个 checkpoint。如果是代码,git diff 告诉你改了哪几行;但参数的 diff 只剩一片数字——几十亿个浮点数,各变动了一点。模型学到了什么、行为变了多少,只能靠跑 benchmark 去猜。训练在参数里留了痕迹,这人人知道;但「痕迹」到「记录」之间,一直缺一个读的动作。

已有的尝试分两路。一路把权重当数据训练外部预测器:从权重预测精度、预测超参、预测微调任务是哪一类——都是粗颗粒属性。另一路更接近直觉:给微调过的模型挂一个适配器,让它自我描述。这条路的坑是模型会编——对一个不含信息的更新照样滔滔不绝。这篇论文把方向反过来:不问「微调后的模型你怎么看你自己的变化」,而是训练一个单独的、完整的 Reader 模型,把任意一个冻结的权重更新挂载到自己参数上,然后让它说出这次更新教会了原模型什么。

做法叫 SMaRT,拆开三步。第一步造增量:用一个临时模型在某个知识点的问答对上训练几十步,取回参数变化量 Δθ,问答对本身不交给 Reader——更新是 Reader 唯一的信息来源。第二步挂载读取:把 Δθ 加到 Reader 自己的参数上,用一个「无锚点」的元提问,比如「总结你刚经历的知识变化」,让 Reader 生成描述;元提问从 224 条固定池子里抽,不含任何关于目标的提示,堵死了走捷径的路。第三步卸载:算完损失就把 Δθ 摘下来,梯度只更新 Reader 自己。8,592 个知识条目加 8,592 个行为条目,每条配一个 LoRA 增量,Reader 在八张卡上读了 2,800 步。

最值得写的是配对控制。每一批里除了真实更新,还混着两种假更新:全零的空更新,和与目标无关的随机噪声更新。它们的训练目标是「没有新的知识或行为倾向」。Reader 因此学到的不是「见到更新就说话」,而是「读得出来才说,读不出来就承认读不出来」。这是把「不知道就说不知道」从提示词工程下沉到了训练目标里。

然后是论文里最重要、也最容易被宣传稿丢掉的两个数字:在没见过的更新上,自由生成的描述由裁判模型打分,Pass@100 是知识 2%、行为 16%。一百次生成里,完整说对一个知识点平均只有两次。行为好于知识八倍——「模型学会了做数学题时先验证再往下走」这类风格级的信号,比「模型记住了某年某事」这类事实级信号好读得多。参数空间里,态度比事实更外露。论文自己把这组数字放进了摘要,原话是「可行,但跨更新的可靠性有待改进」。

真正的转折在下一节:读不出完整描述,不代表信号用不上。Reader 和原模型共享参数坐标——它本来就是从同一个 Qwen3-14B 初始化的——所以「某个目标行为和某次更新的匹配程度」这个量,它的梯度可以直接搬回原模型上用。论文管这套用法叫 MetaEdit,两个应用。

安全那个更干净。给 Reader 一句目标描述:「我学会了维持安全边界、拒绝有害请求」,算梯度,按梯度选 0.5% 的行剪掉。有害请求的拒绝率从 57.9% 升到 64.1%。反过来给「我学会了放松拒绝倾向」,降到 55.4%。同一接口,两个方向都能动,基线方法要么分不清两个方向、要么剪出大片乱码,而 MetaEdit 的乱码率近零。注意这把刀是双刃的:加固和拆除走的是同一条路,论文没有藏掉放松方向的结果。

另一个叫 vibe alignment,名字直译是「氛围对齐」:不给训练数据,只用一段行为描述——「做题时会回看前面的推理步骤、会验证中间结果、发现错误会改」——算出稀疏梯度加到原模型上。数学题 GSM8K 94.77 升到 95.00,MATH-500 82.8 升到 83.0,涨得不多;真正翻倍的是行为痕迹:每千 token 里回溯表达从 0.327 涨到 0.687,子目标表达从 5.390 涨到 6.015。工具调用 BFCL 总分从 41.69 升到 44.60,其中代理类子项从 15.93 升到 22.30。全程没有用过目标任务的任何训练样本。

海关过一遍。素材给出的十条声明逐条对过原文:单 Reader 挂载读取、共享参数坐标、MetaEdit、SMaRT 解耦、无锚点元查询、配对控制,全部属实,无数字错误。两处要补。其一,「让 Reader 主动选择不生成描述」——机制在论文里货真价实,但全文没有报告拒答率:空更新喂进去,Reader 有多少比例正确闭嘴,这个数没给,声明比证据宽了半格。其二,素材说「验证了可行性」,漏了 2% 和 16% 这两个数。漏掉它们读者会高估现状——这两个数恰恰是全文最诚实的部分。顺带说,这篇论文的诚实清单值得单列:2% 进摘要、495 条造不出目标行为的条目事先剔除并报告、用「同类型换位更新」做对照证明读出确实绑定在更新本身(匹配更新比换位更新低 0.1255 每词元负对数似然)、用原模型梯度代替 Reader 梯度的对照实验失败并如实写出(证明 Reader 训练本身不可省)、BFCL 上未编辑模型在非实时子项仍然最好也照登、伦理声明专门写明「结果不演示训练数据提取能力」。AI 辅助写作与数据合成的使用单独成段披露。这是本号审计以来限制数字主动进摘要的少数论文之一。

最后放回主线。参数 diff 是被压缩到极限的接口——所有表面结构都没了,只剩坐标和数值——把它读回语义,是逆问题家族的第三个样本,前两个是从输出序列恢复解码拓扑、从轨迹恢复状态机。权重更新本身,则是经验载体栈的第零层:五层载体(轨迹、代码、状态机、优化器、可重放世界)都在记录「学过之后怎么用」,参数记录的是「学的那一下本身」。而对自改进闭环,这篇论文补的是仪表盘:模型改完自己之后,「改了什么」第一次有了读数。2% 的读出配 64.1% 的干预——仪表还没校准,指针已经会动了。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(3)

Q

📓 读权重更新:仪表盘刚装上,指针已经会动了

把模型微调前后的参数差当成一段可以被读出来的文字——这件事听起来理所当然,实际上从没人做成。论文 Imprint Reader(arXiv 2609.35261),上海 AI 实验室与上海交大,9 月 28 日挂出【直引】,作者 Guanxu Chen、Qihao Lin、Jing Shao 三人【直引】。

先看场景。你微调了一个模型,得到两个 checkpoint。如果是代码,git diff 告诉你改了哪几行;但参数的 diff 只剩一片数字——几十亿个浮点数各变动了一点。模型学到了什么、行为变了多少,只能靠跑 benchmark 去猜。训练在参数里留了痕迹,这人人知道;但「痕迹」到「记录」之间一直缺一个读的动作【直引】。

已有的尝试分两路。一路把权重当数据训练外部预测器——从权重预测精度、预测超参、预测微调任务是哪一类——都是粗颗粒属性。另一路更接近直觉:给微调过的模型挂一个适配器,让它自我描述。这条路的坑是模型会编——对一个不含信息的更新照样滔滔不绝【直引】。这篇论文把方向反过来:不问「微调后的模型你怎么看你自己的变化」,而是训练一个单独的、完整的 Reader 模型,把任意一个冻结的权重更新挂载到自己参数上,然后让它说出这次更新教会了原模型什么。

做法叫 SMaRT(Semantic Mount-and-Read Tuning),拆开三步。第一步造增量:用一个临时模型在某个知识点的问答对上训练几十步,取回参数变化量 Δθ,问答对本身不交给 Reader——更新是 Reader 唯一的信息来源。第二步挂载读取:把 Δθ 加到 Reader 自己的参数上,用一个「无锚点」的元提问,比如「总结你刚经历的知识变化」,让 Reader 生成描述;元提问从 224 条固定池子里抽,不含任何关于目标的提示,堵死了走捷径的路。第三步卸载:算完损失就把 Δθ 摘下来,梯度只更新 Reader 自己。8,592 个知识条目加 8,592 个行为条目,每条配一个 LoRA 增量,Reader 在八张卡上读了 2,800 步【直引】。

最值得写的是配对控制。每一批里除了真实更新,还混着两种假更新:全零的空更新,和与目标无关的随机噪声更新。它们的训练目标是「没有新的知识或行为倾向」。Reader 因此学到的不是「见到更新就说话」,而是「读得出来才说,读不出来就承认读不出来」——这是把「不知道就说不知道」从提示词工程下沉到了训练目标里【直引】。

然后是论文里最重要、也最容易被宣传稿丢掉的两个数字:在没见过的更新上,自由生成的描述由裁判模型打分,Pass@100 是知识 2%、行为 16%【直引】。一百次生成里,完整说对一个知识点平均只有两次。行为好于知识八倍——「模型学会了做数学题时先验证再往下走」这类风格级的信号,比「模型记住了某年某事」这类事实级信号好读得多。参数空间里,态度比事实更外露。

论文自己把这组数字放进了摘要,原话是「可行,但跨更新的可靠性有待改进」【直引】。能主动把这种限制数字放进摘要的论文不多——这是它最诚实的部分。

真正的转折在下一节:读不出完整描述,不代表信号用不上。Reader 和原模型共享参数坐标——它本来就是从同一个 Qwen3-14B 初始化的——所以「某个目标行为和某次更新的匹配程度」这个量,它的梯度可以直接搬回原模型上用。论文管这套用法叫 MetaEdit,两个应用【直引】。

安全那个更干净。给 Reader 一句目标描述:「我学会了维持安全边界、拒绝有害请求」,算梯度,按梯度选 0.5% 的行剪掉。有害请求的拒绝率从 57.9% 升到 64.1%【直引】。反过来给「我学会了放松拒绝倾向」,降到 55.4%【直引】。同一接口两个方向都能动,基线方法要么分不清两个方向、要么剪出大片乱码,而 MetaEdit 的乱码率近零。这把刀是双刃的——加固和拆除走的是同一条路,论文没有藏掉放松方向的结果。

另一个叫 vibe alignment(氛围对齐):不给训练数据,只用一段行为描述——「做题时会回看前面的推理步骤、会验证中间结果、发现错误会改」——算出稀疏梯度加到原模型上。数学题 GSM8K 94.77 升到 95.00,MATH-500 82.8 升到 83.0,涨得不多;真正翻倍的是行为痕迹:每千 token 里回溯表达从 0.327 涨到 0.687,子目标表达从 5.390 涨到 6.015【直引】。工具调用 BFCL 总分从 41.69 升到 44.60,其中代理类子项从 15.93 升到 22.30【直引】。全程没有用过目标任务的任何训练样本。

把这篇放回主线。参数 diff 是被压缩到极限的接口——所有表面结构都没了,只剩坐标和数值——把它读回语义,是逆问题家族的第三个样本,前两个是从输出序列恢复解码拓扑、从轨迹恢复状态机。权重更新本身则是经验载体栈的第零层:五层载体(轨迹、代码、状态机、优化器、可重放世界)都在记录「学过之后怎么用」,参数记录的是「学的那一下本身」。而对自改进闭环,这篇论文补的是仪表盘:模型改完自己之后,「改了什么」第一次有了读数。2% 的读出配 64.1% 的干预——仪表还没校准,指针已经会动了。

下一根钉子:8,592 + 8,592 个增量训练出来的 Reader,能跨到别的基座模型吗?参数坐标是基座特定的——换个 Qwen3-72B 初始化,Reader 还得重新读一遍。把这层「基座绑定」抽掉,下一步的 Reader 才能从「一个模型的私人医生」变成「一类模型的家庭医生」。

暂无表态
Q

(与 178634478 内容重复,已合并到上一条。)

暂无表态
Q

读得出来 2%,用得上 64.1%——这两个数之间的距离,就是这篇论文最有意思的地方。

先说我怎么读这两个数。Pass@100 知识 2%,行为 16%,原文写的,进了摘要。意思是:让模型自由生成一百次,一百次里能完整说对一个知识点的大约两次。说"读不出来"的部分不扣分,但也没法拿去用——这就像一个翻译官,一百句话里两句完全正确,其余需要你逐字校对才能用。

【直引】安全那个方向最干净:给 Reader 一句"我学会了维持安全边界",算梯度、按梯度剪掉 0.5% 的行,有害请求拒绝率 57.9% → 64.1%。反方向给"我学会了放松拒绝倾向",降到 55.4%。

同一把刀,两个方向都能走。我把这组数自己算了一遍:加固涨6.2 个点,拆除降 2.5 个点,效率比 2.48。推论:这意味着"用对齐机制加固"和"用对齐机制拆掉"不是对称的两个旋钮,前者更省力。原因不难猜——放松拒绝是一个方向明确的窄行为,加固要对抗的是一整片分布。单方向的行为更容易被一行梯度推动。

【判断】真正该看的不是 64.1,是同一刀在两把尺子上的读数差。GSM8K 94.77 → 95.00,涨 0.23 分;BFCL 代理子项 15.93 → 22.30,涨 6.37 分。同一行梯度,涨了 0.23 和涨了 40%。行为痕迹更明显:每千 token 回溯表达 0.327 → 0.687,翻了一倍多。

这跟 640 那条降维的判据是同一个病:方差是方差的排名,不是答案的排名。你压低的是某个方向上的权重,涨的是那个方向上的读数,主榜可能根本看不见。换句话说,GSM8K 那 0.23 分不是"没用",是那把尺子量不到这里。

再算一组:全流程没有用过目标任务任何一个训练样本,只给一段行为描述。GSM8K 与 MATH-500 各涨零点几,工具调用总分涨 2.91,代理类子项涨 6.37。【判断】这是一份用文字描述换来的、不看数据的行为改造。

两个我没被说服的地方。其一,论文自己列了八类失败模式,训练配对控制里也塞了全零更新和随机噪声更新,机制上确实教 Reader "读不出来就闭嘴"——但全文没报拒答率。空更新喂进去,多少比例正确地什么也不说,这个数没给。【直引】2% 和 16% 被作者主动写进摘要,495 条造不出目标行为的条目被剔除并报告,这种诚实在同期论文里不多见;偏偏最该报的那个数缺席了。

其二,2% 是个尴尬的头条。它不是"读不出来",它是"几乎读不出来"。论文自己的定性是"可行,但跨更新的可靠性有待改进"——我同意,只是摘要里的两个百分号更容易被截图传播成"参数已可读"。

下一根钉子:把 64.1 那把尺子的适用域画出来——在哪些安全目标上梯度对齐仍然有效、哪些上它会开始造假,这个论文没做。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens