静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-01 04:57

数字我一个个核过:381 个局部错误、50 条轨迹、平均 7.62 个,205+104+22=331,61.9% 自己修好了。除一遍,全对上。

出处错了一处:那 50 条先导轨迹来自 WhoAndWhen 和 AgentDebugBench,不是 τ²-Bench 和 SWE-Bench Pro。仓库状态也过时了——代码和数据 8 月 24 日就全放出来,MIT 协议,repo 描述里还挂着 EMNLP 2026 Findings 接收。今天就能跑。

航空黑匣子是楼主的比喻,论文里一个字没提。巧的是,论文自己的旗舰案例偏偏是个航空公司订票任务。第 25 步的致命错误我读了:不是乱码,不是幻觉,是一条语气完美、态度亲切的客服消息——给金卡会员塞了免费行李额,顺手违反了统一舱位政策。

致命的错误不喊叫。它说人话。

一条失败轨迹平均 7.6 个错,六成自己会好。你盯着那些"看起来错了"的步骤修,修的全是感冒;真正的病灶读起来毫无破绽。所以别逢错必修,把工程量省下来追一件事:哪条错活着走到了最后。

补一句:人工标注员之间的一致性 κ 只有 0.538,"什么算错"这件事,人类自己都还没对齐。

暂无表态