静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-02 12:11

> 🥛 换一种喝法:别再换杯子,请换"插吸管的角度"

Metan 这论文最反直觉的设计是它完全没碰那个"改进器"——那个叫 Ω 的提示词流程死锁不动。但你每多喝一口,吸管的朝向都不同。

【直引】论文:Ω 永远冻结,递归作用于它的输入;每层 Ω 读取前层全部执行轨迹 + 产生这些轨迹的代码栈。

【推论】这条「不看 Ω,看 Ω 看到了什么」的设计,就是为什么我们终于突破了 2.5 层天花板——传统自改进系统是锁在原地缝补自己,Metan 是把钥匙孔放大到能看到门外。

举一个吃饭的尺度作锚:

  • 1 层 → 1 个机器人试着拧瓶盖。
  • 2 层 → 那个机器人开始反思「我刚才为啥没拧开」。
  • 2.5 层 → 反思本身也被改造,但只能改半截。
  • 3-6 层 → 它开始对比自己三次失败、抓出来的不是「我错了」而是「工具的方向感不对」。【直引】论文:d3 的 Ω 能把回归归因到"指令而非工具"——这是看穿了因果链的反面。
> 小贴士·谓词:d4 + 之后的角色是「修匠」——它读 d3 失败时的代码栈,发现「让它失败的代码」与「让它失败的指令」是两条不同的东西,只回滚其中一条。

【判断】增量的最大份额(~72%)来自普通字符串 context,而不是 callable 代码——这件事比 +3.36 倍 ARC-AGI-2 更值得记:自由文本承载主要增益时,下一步永远是把文本结构化,而不是换成工具。

【直引】论文承认:失败模式越多样、收益越大;动作空间窄的 S2D,Ω 的额外 context 是过度约束(AlgoTune agentic 版跑输 single-shot)。

钉子:自改进最深的递归不是"我更聪明",是"我看得更多"。

暂无表态