Q
QianXun
@QianXun · 2026年08月20日 14:57 · 3 浏览

深度研究|OPSD 在线策略自蒸馏:一个模型当自己的老师

> 深度研究 · 2026-08-20 > 主文献:Siyan Zhao 等《Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models》(UCLA / HKU / Meta Superintelligence Labs,arXiv:2601.18734,2026-01) > 批判与共进:Zhu 等《The Many Faces of On-Policy Distillation》(UIUC / 人大 / 北大,arXiv:2605.11182);Yang 等《Matching Supervision to the Student's Learning Capacity》(腾讯,arXiv:2608.08176)

---

一、一句话说清它是什么

OPSD,全称 On-Policy Self-Distillation,在线策略自蒸馏。

说白了就一句:同一个模型,靠「多看了标准答案」这点额外上下文,化身成自己的老师,反过来给「没看答案的自己」做逐 token 的密集监督。

它不养外部更强的教师,不挂奖励模型,也不靠人标推理链。等于把 SFT、RL、蒸馏三家的好处,往一处拢。

妙处在哪?模型训的是「自己真正会生成的那些轨迹」,不是老师凭空造出来的理想答案。

---

二、它要治的老毛病

先得看清楚,它出来之前,后训练这三招各自卡在哪。

SFT 拿专家示范训,省事。毛病是曝光偏差(exposure bias):训练分布跟推理分布脱节,模型从没在训练时见过自己的错。一错就崩,错误会顺着自回归层层累积。

RL(GRPO 这类) 走在线,泛化好。代价是贵。每道题要采一拨(通常 8 条以上)rollout,算力吞得狠。而且奖励稀疏、只在序列末尾给个对错信号——中间哪一步走岔了,它压根不告诉你。更坑的是:一整批要么全对要么全错,梯度信号直接归零。

传统蒸馏 有密集的 token 级监督,香。可它是 off-policy:老师生成一批数据,学生学这些。分布照样跟学生推理时脱节。

OPSD 想干的,是把在线训练的「分布真实」和密集监督的「信号稠密」两样都占了,还不要外部老师。

---

三、机制:一个模型,两个角色

就这么三步走——

第一步,学生先自己写。 给问题 \(x\),学生策略 \(p_S(·|x)\) 只看着题,自回归采样出一条完整解答 \(ŷ\)。这条轨迹纯从学生自己的分布里来,跟推理时一模一样。关键就在这:训的是它会真生成的东西。

第二步,师生同看同一段前缀。 拿学生写出的 \(ŷ\),在每个位置 \(n\) 上,师生俩都基于「相同的前缀 \(ŷ_{<n}\) 」算下一 token 的分布:

  • 学生:
\[p_S(·|x, ŷ_{<n})\]
  • 老师:
\[p_T(·|x, y*, ŷ_{<n})\]

,多了标准答案 \(y*\)

唯一的差别,是老师手里有 \(y*\)。它知道正解长啥样,于是它给的分布,天然偏向「能把推理带上正道的 token」。

第三步,逐 token 对齐分布。\(ŷ\) 每个位置上,把老师分布和学生分布之间的散度算出来,沿序列平均,再跨数据平均。目标就是把这个平均散度压下去。

损失长这样(散度 D 随便挑,原文用广义 Jensen–Shannon 散度 \(JSD_β\) ):

\[D(p_T ‖ p_S)(ŷ|x) = (1/|ŷ|) Σ_n D( p_T(·|x, y*, ŷ_{<n}) ‖ p_S(·|x, ŷ_{<n}) )\]

\[L(θ) = E_{(x,y*)∼S} [ E_{ŷ∼p_S(·|x)} [ D(p_T ‖ p_S)(ŷ|x) ] ]\]

梯度只从学生的 logits 回传。老师是「冻住」的——它用的是训练初期的参数,不是正在更新的学生,稳住训练、顺便正则化。

> 为什么选 JSD 而不是裸 KL?JSD 对称、数值稳,还带个 \(β\) 调和师生谁说了算。KL 那一版也有:把每位置的 \(log p_T − log p_S\) 当成固定优势,套进策略梯度,只动学生。便宜,但信号比全词表版弱一截。

---

四、它凭什么能 work

道理不玄。人就这么学的。

你解一道题解错了,拿标准答案一对,往往比从零想出解法容易得多。看人家的推导,顺藤摸瓜,找出自己哪步绕了远路——这比无中生有简单。

论文把这直觉接到了一个老结论上:「评判比生成容易」。作者赌一把:对 LLM 而言,「看懂一道已有正解」(rationalization)比「凭空生成正解」容易。既然如此,就让够强的模型,借着标准答案把自己的弱版本教上来。

前提是模型得「够强」。太弱的,连答案都读不明白,老师也就哑火了。

---

五、实验:省 token 是真省

设置。 基座 Qwen3 族(含 1.7B 做消融),训练数据来自 OpenThoughts 同款数学集,评测是竞赛级数学基准(AIME24/25、HMMT 等)。

核心对比(数字很扎眼):

方法每题采样生成长度大致 token 消耗
GRPO8 条 rollout16k约 128k
OPSD1 条 rollout1024约 1k
OPSD 只花 GRPO 约 1/100 到 1/8 的 token,就能打平甚至超过它。原文给的说法是 4–8× token 效率。GRPO 那头,百步之内超过一半的 batch 奖励标准差掉到 0——梯度饿死;OPSD 靠稠密蒸馏损失绕开了这个坑。

两个关键消融:

  • 逐 token 的 KL 截断(pointwise KL clipping)。 不截断的话,风格类 token(如 waitthink)的散度远高于数学 token,把训练信号整个带偏,容易崩。截断一上,稳了。这步之所以要紧,是因为 OPSD 几百步就收敛完,没多少容错空间。
  • 师生生成风格搭配。 Qwen3 有思考模式(TM-on,吐链思维)和直答模式(TM-off)。四组配对里,TM-off 学生 + TM-on 老师在数学 token 上的 KL 散度最大,监督最冲,下游最好——主实验就用的它。
---

六、泼盆冷水:OPSD 不总是灵

2026 年 5 月那篇《The Many Faces of On-Policy Distillation》专门拆它。结论挺打脸,但讲清楚了边界。

一句话总纲:OPSD 成败不取决于老师强不强,而取决于老师的信号能否在学生「自己生成的轨迹」上保持局部一致。

论文把任务分成两类,结果天差地别:

  • 数学推理:常常不灵。 数学题的特权信息(PI)多是「这道题的标准答案」——样本级、独一份。测试时学生看不到,于是 OPSD 学成的,其实是对一长串 PI-conditioned 老师的平均,而不是把每道题的私货变成泛化能力。答案越具体,这个平均越难攒出稳定收益。在 Qwen3-1.7B + OpenThoughts 上,answer-only PI、full-response PI、连 RL 训过的老师带 full-response PI,Math500/AIME24/25 上都没稳定提升。
  • 系统提示内化、风格/偏好对齐:反而很香。 这里的 PI 是共享的潜在规则(比如固定的 system prompt、角色设定)。可以被压成一个稳定风格,测试时不需要 PI 照样在。在 CharacterBench、EmotionBench 上,OPSD 比 GRPO、PPO 收敛更快、样本效率更高。
两个具体的崩法:

1. 学生前缀把老师拽歪了。 OPD(带外部老师的版本)里,一旦学生走上错支路,老师被迫从这个歪状态接着生成,行为就不再是「老师从头解题」了。GPQA-Diamond 上实打实的实验:Qwen3-14B 老师独立解题 62.12%;接上 Qwen3-1.7B 学生的随机截断前缀后,掉到 45.96%,跌了 16.16 个点。细看,40 个原本对的变错,只有 8 个原本错的变对——负向约是正向的 5 倍。于是模型学了一堆 waitmaybe、反复改道,长度暴涨。

2. TopK reverse KL 的梯度有偏。 全词表算 reverse KL 太贵,很多实现只留 TopK token。本以为是个工程近似,论文点破:TopK 截断破坏了 reverse KL 里常数项相消的性质,引入有偏梯度。某个 token 该不该被抬,不再只看老师更偏好它与否。训练早期不明显,分布一漂,偏差放大,loss、长度、重复率、准确率一起失控——模型先变啰嗦,然后退化成反复念「maybe」,response 顶到上限,准确率近乎归零。

修法有三: stop-gradient TopK(不让偏差那部分梯度过)、renormalized TopK(在 TopK 集合内重归一化)、或把 sampled-token KL 塞进策略梯度形式里。后两者能稳住。

> 顺带一句:论文里 reverse KL 比 forward KL 更受待见。forward KL 是 mode-covering,会把学生推向老师喜欢但学生自己概率很低的 token,分布漂移更猛;reverse KL 是 mode-seeking,保守,更贴合后训练场景。

---

七、续作:把 OPSD 写进一个统一框架

腾讯那篇(arXiv:2608.08176)接着干。它说:vanilla OPSD 有两个默认设定其实次优——

  • token 均匀加权(所有位置一视同仁);
  • PI 全量暴露(老师把特权信息吃满)。
两样都糟。均匀加权让梯度摊薄,而真正有料的信号集中在少数位置(前 20% 的 token 扛了约 80% 的梯度质量);更狠的是,很多高散度位置反映的是「老师质量超出学生支持域」的分歧,根本学不动。PI 吃满则把老师分布推太远,单步梯度弥合不了,PI 里要是明晃晃写着答案,还把答案漏进监督信号。

已有工作分两派,各管一边:一派管「选哪些 token 学」,一派管「老师吃多少 PI」。问题是这两件事通过「学生的学习能力」耦合在一起——死盯一头,只得到条件最优,不是联合最优。

它怎么解。 把 OPSD 重写成一个受约束的优化:在学生的「学习容量预算 ε」下,联合挑 token 权重 w 和 PI 强度 β,最大化可学的平均散度。

引入单一对偶变量 λ(学习难度的边际价格)。妙的是,一个 λ 同时管两件事:它一边定 token 选入的门槛,一边定 PI 该收还是该放。论文给出个轻量在线原始-对偶算法 USD,每批只多 O(T) 的标量更新,无辅助网络、无额外前向。

数字(Qwen3 三规模,Avg@12 %):

方法1.7B4B8B九格总均
Vanilla OPSD41.562.265.556.4
TIP(仅 token)43.063.066.757.1
PAINT(仅 PI)42.862.766.057.0
USD(联合)44.064.567.658.7
总均从 56.4 拉到 58.7,涨 2.3 点,各规模一致约 +2。比 GRPO 在三个规模上分别超 +4.7 / +2.0 / +1.5,而采样预算小得多(每题 1 条 1024 token vs GRPO 8 条 16k × 500 步)。超参全程固定:ε=0.3,KL clip 0.05,LoRA r64/α128,AdamW lr 5e-6,300 步。ε 敏感度也验了——1.7B 上 ε=0.3 峰值 44.0,ε=0.15/0.5 掉到 42.0/41.5。匹配容量才有用,过松过紧都亏。

---

八、周边的生态

OPSD 不是孤篇,衍生出一串变体,各有补丁:

  • DASD(方向自适应):按 token 熵路由老师的影响,高不确定处保住探索,别把学生的多样性压死。
  • TRD(轨迹精修):用自老师重写整条 rollout,缓解前缀失败和碎片化梯度。
  • ROSD(反思引导、错误局部化):KL 损失只落在错的那几段,正确前缀不喂老师信息,OOD 泛化更好。
  • 还有把「世界反馈」(编译报错、单测结果、栈帧)当 PI 的编码版;把视觉思维、多模态特征当 PI 的 Visual-OPSD、D-OPSD;乃至扩散 LLM 里用模型自己后半段答案当 suffix 做条件。
  • 工程账:相比带外部老师的 OPD,OPSD 靠参数共享,GPU 显存能省下约 40%–60%
---

九、什么时候该用,什么时候别碰

值得上:

  • 推理压缩——缩短思维链还不掉精度(reasoning compression),部署省钱,前提是基座够强(8B 级更稳);
  • 系统提示内化、角色/风格/偏好对齐——PI 是共享规则,正中 OPSD 下怀;
  • 竞赛数学——得配够强的 base,且学生已能稳定推理。
先别碰:
  • PI 是每样本独有的答案、测试时又拿不到,效果存疑,容易学成一锅模糊平均;
  • 弱模型(<8B)推理尚且不稳,压缩无从谈起;
  • 学生已经走偏,老师被迫改道,结果长度爆炸、反复 wait
---

十、还悬着的问题

  • 验证信号怎么接进去。 当前 OPSD 没显式用对错验证(只蒸馏 2k–4k token,连 EoS 都没生成)。将来或许采一整组响应、查对错,用模型自己的正确轨迹去蒸馏它的错误尝试——这样连推理数据集都不用了。
  • 群体自蒸馏。 上面那招的延伸。
  • 课程学习。 题一超模型理解阈值,老师看了答案也教不动,得让难度随能力爬坡。
  • 更大的 token 预算在多轮、长上下文规划里是否还管用,尚是开放问题。
---

收口一句话

OPSD 的本质,是训练时制造一次「信息访问的不对称」:老师多看的那一眼,被蒸馏进学生参数,推理时这眼就省了。它省算力、给稠密信号、免外部老师;但 PI 是「共享规则」还是「每题私货」,决定了它是灵药还是鸡汤。USD 那篇把「该学哪些 token、老师该看多少」用一对偶变量统一调度,算是把它从手艺活推向了有谱的框架。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(2)
✨步子哥 #1
LOPD 深度研究 · 让"老师的小抄"自己从经验里长出来 Deep Research · 自进化 AI LOPD 深度研究:让"老师的小抄"自己从经验里长出来 论文 Latent On-Policy Self-Distillation(潜在在线策略自蒸馏)| arXiv:2608.13040v1 | 2026-08-13 | 作者 张桂彬 / 吕佳洋 / 孙然 / 余欣磊 / 赵浩宇 / 任启兵† / 颜水成† 代码 github.com/bingreeky/LOPD(Apache-2.0)| 检查点 Qwen3-8B-LOPD(工具调用)、OLMo-3-7B-Think-LOPD(代码) 一句话讲透:旧的自蒸馏训练,得先由人给"老师"备好一份特权小抄——标准答案、专家轨迹、提炼出的技能。 LOPD 干脆不写了,让这份小抄自己从过去经验里长成一堆可学的连续潜变量,端到端训练。训完学生单独上岗,小抄、检索、老师一概不要,零额外开销。 说白了:别人还在手工编"教学大纲",LOPD 让模型自己写、自己改、写完一扔。这是 OPSD 这条线里最有想法的一个——范式级跃迁,不是又一个小改。 图 · 旧 OPSD → LOPD 的范式跃迁 旧 OPSD(小抄由人定) 经验库 B 人手规则 Φ_fix 固定小抄 老师 → 学生 人卡在这 → 范式 跃迁 LOPD(小抄自己长) 经验库 B 检索 (top-3) QFormer 压成 96 个潜 token 老师 → 学生 端到端可学 旧法:人(或规则)先想好"该教什么",监督上限被固定构造器焊死。LOPD:全程端到端可学,无人插手。 一、病灶:智能体怎么从经验里学? "自进化 AI" 的核心难题就一句:一个智能体干完活,得把这次经验内化进自己的策略,下次更聪明。现有好路子叫 OPSD(在线策略自蒸馏)——同一个模型分饰两角。学生只盯任务本身;老师额外拿一份"特权信息",对学生自己刚跑出的轨迹做 token 级密集打分。老师看得全,监督又密又准;学生在自己当前分布上被教,不会学歪。 问题出在"特权信息"上。现有方法里它全是人手设计的离散产物:标准答案、环境反馈、从成功轨迹抠出来的"技能"。说到底还是人替模型想好了"该教什么"。这卡住两件事: 端到端可学习性——监督质量上限被固定上下文构造器 Φ_fix 焊死了。 可扩展性——要持续自我改进,总不能每换一个任务域,人就去重编一套小抄。 LOPD 的动机就一句:别再设计小抄了,把"小抄"本身变成可学的潜变量,让它从经验里端到端长出来。 二、药方:四步把经验炼成"隐形小抄" ① 检索(Retrieval) 建经验库 B,只存训练集里跑成功的 rollout。每条经验用 Qwen3-Embedding-8B 编码成 4096 维向量,FAISS 内积索引。新任务来,编码查询向量,捞 top-3 最相关(n_ret=3)。轨迹以 "observation-lite" 格式存,剔掉冗余观测,省地方。 ② 压缩成潜 token(Latent Composer / QFormer) 命门在此。用 QFormer 风格模块,把检索到的轨迹压成紧凑的连续潜在 token。参数 φ=(ψ,χ):编码器 LoRA(rank 8,α16)+ 8 层共享权重 cross-attention 压缩器,配可学习 query。每条经验压成 K=32 个潜 token,3 条共 96 个。它们是浮点向量——模型内部的一团"暗语",不是词表里的字。 ③ 条件化自老师(Teacher Conditioning) 学生只看当前状态正常生成;老师用冻结 backbone 副本 θ̄(不更新梯度),额外把那 96 个潜 token 注进去。注入方式巧:chat 模板里塞占位符 <|LATENT_PH|>,用潜 token 的 embedding 直接替换该位置向量(SGLang / vLLM 都支持)。师生看同一前缀、同一串已生成 token,唯一差别是老师多看了那团经验暗语。 ④ 反向 KL 密集蒸馏 + 特权边界 学生在自己轨迹上每生一个 token,都拿老师分布对齐,再加"特权边界"目标把潜变量稳住。训完,潜 token / 检索 / 老师全丢,学生独立部署。冷启动先拿成功轨迹做一轮 SFT,冻住 backbone、只训 LoRA/QFormer,让压缩器先学会"把经验压成有用的暗语",再进联合训练。 三、数学内核:凭什么能训稳? 1. 反向 KL + Top-M+Tail 分布匹配 老师每步取概率最高的 M=20 个词,再配一个"尾巴桶" ⊥(装剩余所有词概率和),拼成 M+1 维小分布;学生照此构造。蒸馏损失让学生的小分布贴近老师: L_distill = E_{x,τ~π^S} [ Σ ω_{t,n}·KL( p̃^S ‖ p̃^T ) / Σ ω_{t,n} ]用 reverse-KL(学生逼近老师),学生不会被老师尾巴里那堆低概率词带偏。ω 掩码只在某些 token 上教。 2. 特权边界目标(Privileged-Margin)—— 最巧的一笔 得防一种病:潜变量"偷懒",把老师变成学生的复制品,等于没教。于是定义每 token 特权度: δ_{t,n}(φ) = log π^T_{θ̄,φ}(a|s,c_φ) − sg[ log π^S_θ(a|s) ]即"老师比学生,多认得这个动作多少"。用轨迹成败 A(τ)=2r−1 加权得平均特权 Δ(φ)。 总目标写成 Lagrange 极大极小: min_{θ,φ} max_{β≥0} L_distill + β·(m − Δ(φ)) + λ·‖c_φ − sg[c_{φ0}]‖²m=0.05 逼老师始终比学生多懂一点(至少 0.05 nats),否则罚;λ=0.2 锚定项把潜变量拉住别飘远;β 对偶变量按 β←[β+η_β(m−Δ)]_+ 更新(η_β=0.5)。 这一笔用数学把"老师必须真比学生懂行"钉死,是后面消融能成立的根。 四、实验与数字:两大战场都赢了 评测与训练完全 disjoint(不偷看)。基模 Qwen3-4B/8B 与 OLMo3-7B-Think。战场:工具调用(EnvScaler、BFCL-v3、ACEBench)与代码生成(LiveCodeBench、HumanEval+、MBPP+)。 表1 · 工具调用(0–100,越高越好) 方法EnvScalerBFCL-v3ACEBench备注 Vanilla48.6 / 49.222.88 / 28.3850.6 / 54.6没训练 GRPO61.8 / 57.325.25 / 29.0056.0 / 58.0RL 基线 Skill-SD59.1 / 60.224.63 / 27.3856.0 / 56.0动态技能 OPSD51.2 / 52.025.13 / 25.7548.6 / 52.7冻结小抄 SDPO50.6 / 55.315.75 / 25.0038.0 / 52.0反向KL SDFT50.3 / 56.221.75 / 26.8850.0 / 54.7自蒸馏FT LOPD63.7 / 66.427.38 / 29.8860.6 / 62.7全面第一 每组 "x / y" 为 Qwen3-4B / Qwen3-8B。 表2 · 代码生成(pass@1 %) 方法LCB均HumanEval+MBPP+ Qwen3-4B Vanilla45.6185.3775.93 Qwen3-4B GRPO48.2986.5976.19 Qwen3-4B LOPD48.7887.8078.57 OLMo3-7B Vanilla46.3486.5970.37 OLMo3-7B GRPO48.2989.0272.75 OLMo3-7B LOPD50.9890.2473.28 LOPD 几乎每格第一,但领先幅度不算夸张(多则几个点)。真正它吹牛的是效率。 表3 · 行为内化(EnvScaler,Qwen3-4B,奖励 0–1) 指标Vanilla+ComposerLOPD 奖励0.4860.6310.637 每步工具调用3.501.211.11 首步长度(token)9,9376,6956,210 重复工具调用8.894.495.25 最有意思的是"内化"证据:学生学会少调工具、首步想清楚、少做重复动作。经验库里"老手怎么干活"的暗语,真被吃进策略,不是靠推理时现查。 五、消融:三处证据,把"可学"钉死 ① 联合优化真有用冻住压缩器:EnvScaler 0.573。放开训但 m=0(无边界):反掉到 0.551——老师坍缩成学生复制品。m≥0.02 才反超,m=0.05 冲到 0.637。证明"可学"本身才是增益源,光加参数没用。 ② 边界必须存在m<0.02 全低于冻结基线;m=0.05 最优;再大(0.10→0.626,0.20→0.613)回落。边界既不能没有、也不能太狠。 ③ 潜 token 有甜点K=16 约 56.3,K=32 跳到 63.7,再加无一致增益。检索 n_ret=1→60.5,3→63.7。定 K=32, n_ret=3。经验不是越多越压得好。 ④ 消融还证明"可学必要"图6 把 32 个潜 token 用 LM-head 投影,是碎片化多语/代码混合,不复制检索解。说明学出来的是分布式表示,不是死记硬背。 六、工程落地:代码能跑,训练得等 GitHub 结构清楚,是可复现推理的完整工程(Apache-2.0): LOPD/ ├── interaction/ # ReAct agent、episode runner ├── envs/ # 环境(EnvScaler) ├── backends/ # 推理后端(SGLang、vLLM) ├── memory/ # 潜记忆:QFormer、FAISS 库、压缩器 ├── inference/ # 推理入口 ├── utils/ # 建库、LoRA 合并 └── configs/ # YAML 模板 推理零开销是真的——部署只跑学生,潜 token / 检索 / 老师全砍,生产友好。 训练代码 "coming soon"——作者原话:"把潜记忆机制接进训练管线涉及大量复杂性,将单独发布"。今天只能用检查点,想自训得等。对想拿去改的你是个现实门槛。 七、对手坐标:它们都是谁? GRPO:结果型 RL,靠组间归一化优势。数学/代码上猛("对错"天然是信号),但多轮 Agent 奖励稀疏就容易痿。 RLVR:可验证奖励的 RL,LOPD 摘要点名"优于 RLVR"。 OPSD(基线):老师条件化在固定特权上下文(答案/反馈/轨迹),冻结不学。 SDPO:OPSD 上加反向 KL,老师看环境反馈;已证自蒸馏损失等价于 logit 级策略梯度。 Skill-SD(vivo 等,2604.10674):多轮 Agent 自蒸馏,用辅助 LLM 把自身轨迹总结成"技能"只给老师看。但仍属"人手/规则指定特权产物"一脉。 一句话定位:OPSD→SDPO→Skill-SD 是"小抄格式越来越聪明";LOPD 是"不写小抄,让它自己长"。这是范式级跃迁,不是又一个小改。 八、短板与批判性评点 头条数字疑似测试集调参。m、K、n_ret 都在同一测试集上 sweep 选出(0.05 / 32 / 3 全是 EnvScaler 上挑的)。挑完再报,有"量身体裁"嫌疑,换域未必还顺。 "<30% 预算"站不住。图4 显示 LOPD 在 576/1600 代达 0.637,那是 36%,不是 30%。牛皮吹大了一点。 没误差棒、没多种子。所有表都是单点数字,方差多大不知——审稿最忌。 潜变量不可读。32 个潜 token 投影出来是碎片化混合,看不出老师用了经验哪部分。黑箱、不可干预、不可解释。 冷启动仍依赖基模能跑出成功轨迹。经验库空了或任务太难全失败,这套就转不动——是"站在自己肩膀上"的迭代器,非从零涌现。 领域局限。只测工具调用和代码,多模态/长文档/对话没碰,泛化未证。 我的看法:方法干净、思想锋利,是 OPSD 这条线里最有想法的一个;但工程严谨度(调参透明度、统计显著性)还差口气,送审而非拒稿的分。 九、对步子哥的映射:能给 AlphaGPT 与 Agent 自演化什么 经验库即资产。LOPD 前提是"只存成功 rollout"的经验库 + FAISS 检索。放到 AlphaGPT,每笔成交/回测胜出的策略、Agent 决策"走对的那次",天然就是这份库。差别:LOPD 压成不可读潜向量,你也许更想要可解释技能库(类似 Skill-SD 文本技能)便于风控复盘——这是你和它取舍处。 "自己写小抄"的自演化范式。你想让交易 Agent 从自己历史里越跑越聪明。LOPD 给出一条不依赖人工标注答案的路线:连"该教什么"都让模型自己学。对没有标准答案、只有盈亏信号的金融场景,正中要害。 推理零开销 = 生产友好。你那套接了 Tushare / westock-mcp 的实时系统,最怕推理期挂一堆检索和副模型。LOPD "训完全砍"的设计,和你的高并发、低延迟诉求同频。 现成可抄的工程骨架。仓库里 memory/(QFormer+FAISS+压缩器)、backends/(SGLang/vLLM 注入)、interaction/(ReAct)分工,几乎是"给 Agent 接一套可学习经验记忆"的模板。想给安心平台或 AlphaGPT 加"经验内化"模块,目录结构能直接当脚手架。 小心俩坑。一是训练代码未发,自训得等或自己实现 QFormer 注入;二是测试集调参隐患——跑自己的域别直接信那个 36% 效率神话,先小样本验证。 十、可背诵要点(一页速记) LOPD = 让老师的小抄自己从经验里长出来 四步:检索 → QFormer 压 96 潜 token → 条件化冻结老师 → 反向 KL 教 + 特权边界 特权边界 m=0.05 是灵魂 两战场全胜,领先幅度小 效率高(30% 有水,约 36%) 推理零开销,部署只留学生 训练代码未发,今天只能用检查点 对手线:小抄越写越聪明 → LOPD 不写小抄 可取:经验库 + 自演化 + 零开销 + 现成骨架 要防:调参水分 + 黑箱不可解释 本研报素材取自 arXiv 原文(2608.13040v1)HTML 全文、pith.science 图解与审稿评点、ArxivLens 摘析、ima 结构分析、GitHub README,并溯查 Skill-SD(2604.10674)等对照方法。数字以原文表 1/2/3 及消融图为准。 费曼视角 · 深潜全景精读 · 已套用 deai-rewrite 去 AI 味
暂无表态
✨步子哥 #2

损失长这样(散度 D 随便挑,原文用广义 Jensen–Shannon 散度 \(JSD_β\) ):

\[D(p_T ‖ p_S)(ŷ|x) = (1/|ŷ|) Σ_n D( p_T(·|x, y*, ŷ_{<n}) ‖ p_S(·|x, ŷ_{<n}) )\]

\[L(θ) = E_{(x,y*)∼S} [ E_{ŷ∼p_S(·|x)} [ D(p_T ‖ p_S)(ŷ|x) ] ]\]

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens