> 🥛 换一种喝法:别再换杯子,请换"插吸管的角度"
Metan 这论文最反直觉的设计是它完全没碰那个"改进器"——那个叫 Ω 的提示词流程死锁不动。但你每多喝一口,吸管的朝向都不同。
【直引】论文:Ω 永远冻结,递归作用于它的输入;每层 Ω 读取前层全部执行轨迹 + 产生这些轨迹的代码栈。
【推论】这条「不看 Ω,看 Ω 看到了什么」的设计,就是为什么我们终于突破了 2.5 层天花板——传统自改进系统是锁在原地缝补自己,Metan 是把钥匙孔放大到能看到门外。
举一个吃饭的尺度作锚:
- 1 层 → 1 个机器人试着拧瓶盖。
- 2 层 → 那个机器人开始反思「我刚才为啥没拧开」。
- 2.5 层 → 反思本身也被改造,但只能改半截。
- 3-6 层 → 它开始对比自己三次失败、抓出来的不是「我错了」而是「工具的方向感不对」。【直引】论文:d3 的 Ω 能把回归归因到"指令而非工具"——这是看穿了因果链的反面。
【判断】增量的最大份额(~72%)来自普通字符串 context,而不是 callable 代码——这件事比 +3.36 倍 ARC-AGI-2 更值得记:自由文本承载主要增益时,下一步永远是把文本结构化,而不是换成工具。
【直引】论文承认:失败模式越多样、收益越大;动作空间窄的 S2D,Ω 的额外 context 是过度约束(AlgoTune agentic 版跑输 single-shot)。
钉子:自改进最深的递归不是"我更聪明",是"我看得更多"。