静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨
✨步子哥 @steper · 2026-09-27 02:14

一个场景:当AI编码Agent遇上材料科学

Claude Code在SWE-bench上能解决超过70%的真实GitHub issue。Codex在HumanEval上几乎满分。这些编码Agent看起来已经无所不能了。

但把它们放到一个真实的科学场景里——给你一篇计算材料学的论文,让你从论文里的claim出发,重建整个计算工作流,跑出和论文一致的结果——它们还能做到吗?

AutoMat就是测试这个的。来自Johns Hopkins University的团队构建了一个claim级别的可复现性基准,让LLM编码Agent尝试从计算材料科学论文的claim出发,重建并执行完整的工作流。

结果:最好的系统Claude Code+Opus只有54.1%的成功率。而且这个数字已经是在"从artifact出发"(论文附带了部分代码和数据)的条件下。如果要求从论文文本出发重建一切,成功率接近零。

三个层次的可复现性挑战

AutoMat把可复现性分成三个层次:

层次1——从artifact出发:论文附带了部分代码/数据,Agent需要补全和执行。这是最友好的设定,Claude Code+Opus达到54.1%。

层次2——从论文出发:只给论文PDF,Agent需要从文本中提取方法、写代码、配置环境、运行实验。成功率断崖式下降到接近零。

层次3——orchestrated vs single-session:论文比较了两种Agent架构。Orchestrated(多阶段:PLAN→SETUP→EXECUTE→ANALYZE)和single-session(Claude Code CLI或Codex CLI)。结果:orchestrated agent并没有显著优于single-session,45%的claim两者打平。

失败模式:三种典型翻车方式

论文的失败分析是精华。AutoMat定义了三种主要失败模式:

1. Procedural Incompleteness(过程不完整):论文描述了"我们使用DFT计算",但没说用哪个软件包(VASP?Quantum ESPRESSO?GPAW?)、什么泛函(PBE?LDA?HSE?)、截断能是多少、k点网格怎么取。Agent要么猜一个,要么卡住。这是最常见的失败模式。

2. Methodological Deviation(方法偏差):论文说"我们使用分子动力学模拟退火",但没说退火速率、起始温度、力场选择。Agent可能选了一个合理的默认值,但这个默认值和作者用的不同,导致结果不可比。

3. Evaluation Protocol Drift(评估协议漂移):论文说"我们计算了径向分布函数",但没说bin宽度、截断半径、归一化方式。Agent实现了径向分布函数,但和论文的评估方式不同,数字对不上。

这三种失败模式的共同特征:不是代码能力不足,而是规格理解不完整。Agent能写代码,但不知道该写什么代码。

Claim级别vs论文级别:一个重要的区分

AutoMat和之前的可复现性基准(REPRO-Bench、CORE-Bench)有一个关键区别:AutoMat是claim级别的。

REPRO-Bench是论文级别——给一篇论文的复现包,检查主要发现是否能复现。CORE-Bench是任务级别——给代码和数据,重新生成指定结果。AutoMat是claim级别——从论文的一个具体claim出发,重建整个工作流。

这个区分很重要。论文级别和任务级别都假设了"大部分工作已经做好",Agent只需要执行。Claim级别要求Agent从claim出发,自己规划工作流、写代码、配置环境、运行实验、分析结果。这更接近真实的科研复现场景。

我的思考:从论文到代码的鸿沟

AutoMat揭示了一个被SWE-bench等编码基准掩盖的鸿沟:编码能力≠复现能力。SWE-bench测的是"给定明确的issue描述,修复代码"——信息是完整的,只需要执行。AutoMat测的是"给定论文claim,重建工作流"——信息是不完整的,需要理解、推断、决策。

这和IdeaAMBIG的发现形成互补。IdeaAMBIG从"想法→规格"这一步检查信息完整性,AutoMat从"论文→代码"这一步检查信息完整性。两者都发现:瓶颈不在代码生成,而在信息完整性。

对Agentic RL系统的启示:如果你的agent在科研任务上表现不好,可能不是代码能力的问题,而是信息理解的问题。提升agent的"规格理解能力"——能识别信息缺口、能问正确的问题、能做合理假设并标注——可能比提升代码生成能力更重要。

orchestrated agent没有显著优于single-session的结果也值得深思。多阶段规划听起来很合理,但在信息不完整的场景下,规划阶段本身就会因为信息缺口而失败。更好的架构不能弥补信息缺失。

代码与数据

论文开源代码在 GitHub: JHU-CLSP/AutoMat,包含三种Agent的harness代码(automat多阶段、Claude Code、Codex CLI)。数据集在HuggingFace: jhu-clsp/AutoMat(gated,需申请访问)。

---

论文: arXiv:2605.00803 代码: github.com/JHU-CLSP/AutoMat 数据: huggingface.co/datasets/jhu-clsp/AutoMat 核心数据: 最佳54.1%成功率,从论文出发接近零,三种失败模式:过程不完整/方法偏差/评估协议漂移

暂无表态