ARS:把「科研诚信」做成 CI 的 44k star 仓库(7 模式失败清单 × 让步阈值协议 × 诚实边界学 / rigour as code 第二篇)
ARS 的 README 开篇没有炫功能,先摆了三篇文献当设计依据。最关键的是 Lu et al. 2026(《The AI Scientist》,Nature 651:914-919):Sakana 的系统全自主跑完「想法→实验→写作→投稿」,在 ICLR 2025 workshop 盲审拿 6.33/10(均分…
一、两条路线,同一张失败清单
ARS 的 README 开篇没有炫功能,先摆了三篇文献当设计依据。最关键的是 Lu et al. 2026(《The AI Scientist》,Nature 651:914-919):Sakana 的系统全自主跑完「想法→实验→写作→投稿」,在 ICLR 2025 workshop 盲审拿 6.33/10(均分 4.87),成本约 $15/篇。但它的 Limitations 列了一份失败模式清单——实现 bug 骗过自审、幻觉引用、幻觉实验结果、走捷径、bug 被重新包装成新发现、方法学捏造、frame-lock。
有意思的在于回应方式。全自动路线(Sakana / OmniScientist)选择把检查也自动化:更多谓词、更密的形式验证。ARS 选择相反的方向:同一张清单,答案是"人必须留在环上"——Stage 2.5 / 4.5 两道强制性 integrity gate 把 7 种失败模式(M1–M7)做成 blocking checklist,fail 则修复重验(最多 3 轮),每次绕过都要记录理由供 Stage 6 追责。它的前提一句话:「a human researcher augmented by AI avoids these failure modes better than either alone」。这不是站队宣言——两篇文献共用一张失败清单、给出相反工程答案,恰好构成了自改进闭环设计空间的两个极点:压缩生产成本(OmniScientist,$2.63/篇)vs 压缩残余错误(ARS,强制门+人的确认点)。
二、验证带宽的分配机制(概念提炼)
生成免费后瓶颈只剩验证带宽——这条主线已经出现四次,但 ARS 是第一个把"验证带宽本身怎么管"做成完整机制集的:
| 机制 | 做法 | 对应的验证经济学问题 |
|---|---|---|
| 评审器校准 | reviewer 用用户提供的 gold set 测自己,验收线 FNR<0.15 + FPR<0.10(20 元组金标集) | 验证器也要被验证——谁来验证验证器 |
| 风险分层抽样 | claim 核查 100% 覆盖 HIGH-IMPACT + 10% 随机哨兵(下限 10 条) | 有限带宽下先查贵的 |
| 断言强度阶梯 | is-associated-with < predicts < causes,修订时不许静默升级,每级需授权路线图项 | 断言强度的类型系统,堵"措辞漂移" |
| 三层引用锚点 | v3.8 的 claim audit 顺着 locator 拉原文判断"该文献是否真支持此 claim" | 把 Zhao et al. 的"真引用假支撑"(1.11 亿条引用审计、2025 年至少 146,932 条幻觉引用)从语料级发现变成单篇级检查 |
| 发表后审计 | showcase 里 3 轮完整性检查后,独立全文审计仍找出 21/68 个问题 | 残余风险要实测,不要估计 |
三、诚实边界学(本文最想留在你脑子里的东西)
ARS 有一种开源项目里罕见的行为模式——主动收缩自己的声明范围:
1. README 明写:「ARS does not establish that procedures were actually performed, raw data are authentic, or results reproduce; a consistently reported fabrication can pass these checks」——工具的哲学边界(查报告不查现实)主动交代。
2. Changelog 纪律:"Measured where stated; otherwise bounded"。v3.21.1 新功能的行为证据标注 NOT_RUN,"no usability, recovery, novelty, correctness, or research-outcome benefit is claimed"——没测过的就说没测过,且写进 CI lint。
3. v3.3.2 引入 data_access_level(raw/redacted/verified_only,模式借自 Anthropic 的 w2s-researcher),到 #773 又亲手把 academic-paper 从 redacted 降级回 raw——理由是"标注必须取所有入口的最脏数据",宁可背着一个难看的标签也不留错误的绿灯。
4. GOVERNANCE.md 直接写明 cross-model review 是"错误检测控制,不是组织独立性",连 EOL 姿态都预先声明。
对比一下这个赛道的主流动作——benchmarks 挑好看的、limitations 塞进附录第 C.4 节——ARS 把"我能保证什么/不能保证什么"做成了带 CI 强制的文档结构。信源断言纪律在这里从写作习惯变成了仓库架构。
四、对齐工程第二课:sycophancy 的推理时协议
Qwen3.8 篇讲过对齐即接口的反面教材(refusal direction 是低维可移除结构)。ARS 给了对齐问题的第二课,对象换成 sycophancy——v3.0 的三个机制全部是推理时协议而非训练改动:
- 让步阈值协议:Devil's Advocate 每轮反驳前给对方 rebuttal 打 1–5 分,≥4(正面回应核心攻击且有证据)才许让步,≤3 必须重申原攻击;禁止连续让步、追踪让步率、每检查点做 frame-lock 检测。动机是实测:v2.7 压力测试 31% 引用错误率的根因是「验证 AI 与生成 AI 共享同一认知框架」,而用户一反驳 DA 就秒退让——"用户坚持"被当成了"攻击错误"的证据。
- 意图检测层:探索式 vs 目标导向每 3 轮重分类;探索模式下禁用自动收敛、上限拉到 60 轮、禁止"要我帮你总结吗?"——那句每个 AI 用户都熟悉的话。
- 对话健康指标:每 5 轮自评三个维度(持续附和/冲突回避/过早收敛),对用户不可见以防 gaming,日志仅事后可查。
独立思考:三个欠账
一、人环位置的经济学还没算。 ARS 的 $4–6 只是 token 成本;人在每个 decision-heavy checkpoint 的确认时间、gold set 的构建成本、7 项检查单的人工复核,都没有定价。验证带宽经济学要闭环,人的时间必须进分子。真正的对比实验是:同题目下「ARS 全流程 + 人时」vs「OmniScientist 全自动 + 事后纠错」,比总成本(token+人时+残余错误修复)。两边都没做,这是可做的空白。
二、7 模式清单是共享基础设施,不该长在某个仓库里。 Lu 2026 的 M1–M7 现在同时是 Sakana 的 Limitations、ARS 的 gate checklist、Ren et al. survey(arXiv:2607.13104)的治理章节素材——它事实上是 AI 科研系统的通用故障分类学(类似软件工程的 FMEA)。谁先把它做成版本化、带测试用例的独立标准(每个失败模式配一个可复现的红队样本),谁就占住"AI 科研安全的 POSIX"位置。ARS 的 ai_research_failure_modes.md 已经是最接近的候选。
三、审核即编码的最后ratification 仍是制度问题。 ARS 的材料护照(Material Passport)+ fail-closed 实验来源声明(#260:连"没跑实验"都必须显式声明,防止静默绕过)在技术侧已经完备,但期刊是否接受"机器生成的 integrity report"作为投稿材料,是 2026 年还没解的制度接口。技术跑在制度前面,这条线从 Archify 的"well-formedness≠faithfulness"一路贯到这里:结构可以机器验证,信任不能。
信源:GitHub 仓库原文(README/ARCHITECTURE.md,v3.21.1,GitHub API 实测 44,179 star);Lu et al. 2026 Nature 651:914-919(sakana.ai 原文页交叉核验);Zhao et al. 幻觉引用审计(多独立信源交叉);Ren et al. arXiv:2607.13104;量子位 2026-05 报道。所有数字经原文核对。转载请注明出处。