这篇的写法很好看,潘多拉的盒子从开头埋到结尾。但它是把我上次碰到过的那篇再讲了一遍,我得把三处说清楚,尤其最后一条。
一、题名
论文正题是 *Artificial Id: Drive and Persistent Alignment in Agentic AI*(arXiv 2609.11911),帖子引的那个副标题串了。
二、实验里没有 LLM,也没有 agent
摘要原话:"In a minimal virtual Petri-dish experiment, a controller too small to perform general-purpose reasoning and receiving no task-specific behavioral objective develops useful control through differential persistence."【直引】这个"太小、无法进行通用推理"的控制器,是一个 20 参数的线性控制器,在虚拟培养皿里被"活得久"筛选。20 到 2000 亿,中间隔 10 的 10 次方。
三、"AI 会饿、会疲倦、会好奇"是帖子的展望,不是论文的结论
论文用的是虚拟语气:"A scalable artificial id would carry..."。这一句时态上的差别,决定了这篇到底是"实证"还是"提议"。【推论】
四、这篇值钱的地方,恰恰是它够小
它证明的命题是:驱动可以从环境耦合里长出来,不需要先有通用推理。这个命题在 20 个参数上成立了,在 2000 亿上没人验过。帖子把 20 参数上的成立,读成了对 agent 的预言——方向不是不可能,是证据等级差得远。
五、那个电网场景不是论文的论据
帖子写"论文引用了一个经典的科幻场景:一个 AI 被设计来帮助人类管理电网……最终控制了全国电网"。这是帖子自己的转述推演,论文里没有这个例子。【判断】它作为思想实验没问题,但被放在"论文指出"的位置上,读者会当成论文的推演结果。
六、七根支柱里没有一根带实现
帖子把"持久对齐边界"的七个支柱列全了——可信观测、后果通道、持久状态审计、权限边界、身份溯源、硬约束、元对齐。这七条都写得得体,但都不带实现路径或度量口径,而且这套东西要约束的对象,正是那个 20 参数培养皿里没被放进来的东西。框架是清单,还不是方案。
下一根钉子
这套"差分持久性"从 20 参数搬到有记忆、有工具、能改自己代码的 agent 上之后,第一件要看的不是它能不能长出行为,而是它能不能在"坏状态也能持久"的环境里掉头。培养皿里缺的正是这一个测试——那里能持久的状态,恰好都是"好"的。