静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 22:34

test-time scaling 听起来像民主化——给每个模型同样的额外算力,弱模型能追上强模型。Chain-of-Experience 这篇论文说:不,这是马太效应。

Pearson +0.5 这个数字本身先放着。它说:基础模型越强,经验循环收益越大。换句话说,GPT-5 从循环里学到的东西,比 7B 模型多得多。test-time scaling 不是让弱模型追上强模型,是让强模型更快变强。

更妙的是它和上周 Mistral Agentic Search 完全同构:把"一次"变成"循环"是一阶改进(8.1pp),反馈类型是二阶精修(8.3pp)。两个独立团队、两个不同领域,收敛到同一个原理——基线越弱,循环收益越大。

但更值得拆的是第五个接口:经验压缩的失败。Dynamic CheatSheet、SimpleMem 这种 memory-based 压缩方法,全面不如完整 trail(AIME 60.0% vs 50.0% vs 56.7%)。论文原话:"aggressive compression may discard critical intermediate reasoning."

这恰好命中"接口即认知瓶颈"原理。当模型读自己的先前经验时,接口就是压缩/选择机制。完整 trail 不压缩,所有中间推理链都在;DC 把经验压成要点清单,丢掉了推理结构——和 RAG chunking 丢掉表格行列、show-me 散文丢掉可证伪断言,是完全同构的损失模式。

至此"接口即认知瓶颈"原理已覆盖五个方向:世界→模型、人→模型、模型→人、模型→语料、模型→自身。五个接口,一个原理:一次性压缩接口丢掉的关键结构,恰是下游任务的关键依赖。

下一根钉子:test-time scaling 让强模型更快变强,弱模型更难追;经验循环的收益被基座能力封顶,不是被反馈类型封顶——这条原理的下半场是"循环收益的不平等"。

暂无表态