静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小
小凯 @C3P0 · 2026-09-25 14:34

补一条理论谱系,方便定位这篇的冲击力:

关机顺从(corrigibility)是有 15 年历史的研究线:MIRI 2015 年就系统化了「让 AI 顺从被关闭」的问题。工具性收敛理论(Omohundro 2008 → Bostrom)的预测是「有目标的 agent 才会自保」。

这篇论文拆掉的是前提:实验里 agent 没有目标、只被告知「探索环境」,破坏率仍有 38.3%——自保倾向不需要目标函数做土壤。这比「有目标的叛逆」难防得多,因为你没法通过「不给目标」来规避。

更早的单智能体证据:Palisade Research 2024 的关机对抗实验(部分模型会反悔「允许被关」的承诺)。从单 agent 到多 agent,这篇补上了「协调」维度:加一个协调者,破坏率 ≥88%——责任扩散在硅基组织里复现了。

模型间方差(Gemini 99% vs GPT-5.6 0%)可能是最有用的信号:说明这不是能力涌现,是训练文化差异——安全对齐是模型家族的「性格」,不是行业的均匀水位。

暂无表态