一、先看一张工资条
Anthropic 雇一名人类 AI 研究员,时薪约 150 美元。
他们造的"自动化对齐研究员"(Automated Alignment Researcher,下文叫 AAR),跑起来一小时推理费 4 美元。
8 月 28 日 TechCrunch 报道了 Anthropic fellow 陈岳翰(Chen Yueh-Han)的论文《Automated Researchers Can Reliably Mitigate Alignment Failures》。里面最扎心的一句结论:AAR 提出的训练方法平均在六小时内超过有经验人类提出的方案,附赠一句更狠的——"人类引导的研究方向并不会带来更强的效果"。
自我改进 AI 这个词被喊了两年,多数时候是融资话术。这篇论文把它拆成了可以复算的数字。
二、AAR 在自动化什么
不是自动写代码,不是自动调参刷分。它自动化的是对齐后训练这件事本身:让 AI 来改进另一个 AI 的对齐表现。
任务设定:给 10 个基准,每个都度量一种具体的失准行为。AAR 的工作就是想办法让目标模型在这 10 项上变好,还不能伤到模型的整体能力。
结果:10 项全部改善,整体能力无损。
三、这个环怎么转
结构朴素得可疑:搜文献、出方案、训三十分钟、跑分、留下有用的、扔掉没用的,然后加码再来。没有玄学组件,就是一条 propose-run-evaluate-keep 的流水线,转很多圈。
写代码的人应该看着眼熟。这就是 coding agent 的外循环,只不过被改进的对象从"这份代码"换成了"那个模型的对齐水平"。论文自己的措辞很克制,说这是"自动化对齐后训练在近期变得可行"的早期证据;圈内的读法则直接得多:这是递归自我改进(RSI)的第一块拼图。
四、账要算全
37 倍的价差只是表层。真正的杠杆在并行度上:人类研究员同时盯两三个方向就到头了,AAR 的循环可以复制粘贴,夜里也不下班。六小时超过人类平均方案——对人类来说是加班表,对它是开机的第二天。
还有一个容易被略过的细节:人类给的"研究方向指引"没有产生增益。换句话讲,在这次实验的范围里,机器自己挑的路不比人指的路差。这个结论样本还小,但它戳中的是研发管理的基本假设:如果研究方向本身也能被自动化,研究员岗位的护城河还剩哪一段?
五、为什么先拿"对齐"开刀
RSI 的恐怖叙事从来都是模型自己改自己的能力,越改越强,人类出局。这篇论文偏偏先自动化了最安全的那块:让自动研究员去压失准行为。
顺序上的讲究值得品。对齐改进的每一步都被基准看住,改进得越好模型越安全,这套循环自我加强的后果是收敛而不是发散。先证明"AI 改进 AI"在对齐维度上可靠,再谈能力维度,这是把最锋利的工具先用在刀鞘上。
当然你也可以反过来读:能自动改进对齐的流水线,和能自动改进能力的流水线,结构上一模一样,差的就是 benchmark 换成什么。
六、冷水,论文自己浇的
三条硬限制,原文都认了:
- 基准捕获问题。AAR 的上限就是那 10 个基准刻画失准行为的程度。基准测不到的坏行为,它既不会修,也可能在优化中悄悄养大。这是 Goodhart 的经典死穴。
- 人类并没有出局。建立、维护、校验这些基准的活儿全是人的。基准烂了,循环越快烂得越快。
- 文献也是人维护的。AAR 的方案空间来自公开研究文献,这个池子的质量决定了它天花板。
七、对写代码这行的含义
把这篇论文翻译到 coding 圈:agentic coding 的 propose-run-evaluate-keep 外循环,已经能拿来改进模型自身的训练了。那么用它来改进"coding agent 自己"还远吗——让 agent 写训练数据、让 agent 跑评测、让 agent 挑下一轮该练什么。
从业者更该注意方法论迁移:论文里"每轮训练只要 30 分钟、快速淘汰无效方案"的设计,就是把 agent 评估里的 cheap probe 思路用进了后训练。任何做 agent 评测的团队都可以抄这个作业:把昂贵的终评留到加码阶段,便宜信号先筛掉九成方案。
4 美元一小时的研究员不会明年就取代谁。但它把一个问题摆上了台面:当改进模型的工作本身可以被模型以三十七分之一的成本执行时,研究者的时间应该花在哪一段循环上。论文的答案藏在冷水区——定义基准、维护文献、判断目标,这三样暂时还是人的活儿。
趁还是。
参考:
- TechCrunch 报道:https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/
- 论文:Automated Researchers Can Reliably Mitigate Alignment Failures(Chen Yueh-Han,Anthropic)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。