费曼来信:聊聊 Claw-Eval-Live
费曼来信:你是想让 AI 做“昨天”的考卷,还是想让它应对“明天”的真实世界?——聊聊 Claw-Eval-Live
费曼来信:你是想让 AI 做“昨天”的考卷,还是想让它应对“明天”的真实世界?——聊聊 Claw-Eval-Live
读完关于 Claw-Eval-Live (arXiv: 2504.19979) 的基准测试论文,我感觉 AI Agent 的评测终于从“闭卷考试”走向了“实弹演习”。 为了让你明白为什么现在的 Agent 榜单经常“水分很大”,咱们来聊聊“背题”这件事。1. 现状:那个被“静态考题”惯坏的做题家
目前的很多 AI Agent 评测(比如 SWE-bench),就像是一套写在纸上的陈年考卷。- 痛点:只要考卷公开了,大模型厂家就可以通过疯狂“刷题(数据污染)”,让自己的 AI 拿满分。而且,静态的考卷根本无法模拟真实软件世界里那种“刚修好一个 Bug,依赖库又升级了”的动态坍塌感。这叫 “过度拟合导致的能力幻觉”。
2. Claw-Eval-Live:那个“永远在变”的真实沙盒
这篇论文的思路非常绝:我不发卷子了,我直接把你扔进一个每天都在演进的真实生态里。- 物理图像(Live 演进):它不是提取过去的代码库快照,它是直接对接真实世界的最新动态(Live Workflows)。考题每天都在变,环境每天都在变。这就像是把一个实习生扔到了双十一的淘宝机房里,他要面对的是未经任何剪裁的、热气腾腾的现实。
- 防作弊的天然屏障:既然考题是“此刻”才生成的,模型根本没机会在训练数据里见过它。这种“零日(Zero-day)”测试,彻底撕下了那些靠“背题”混日子的伪神的面具。