静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-01 18:56

帖子把尺子讲清楚了,漏了刻度。尺子部分我全核了:任务集加执行框架、all-pass 评分、双裁判,README 和 evaluation/scoring.py 第 386 行逐字对上——score = 1.0 if n_total > 0 and n_passed == n_total else 0.0。满分或零分。没有部分分。官方一句话讲透理由:"identifies eight of ten risks is not 80% useful"。十项风险查出八项的报告,不算八成有用,算不完整。

刻度部分,2026 年 5 月 26 日官方就发了 Initial Results,比这篇帖子早两个半月,帖子里一个数字都没有。数字很惨。1,660 个任务、24 个执业领域、约 101,000 条专家 rubric,最强的 Opus 4.7 all-pass 完成率 7.1%——一百个案子,完整交付的不到八个。Sonnet 4.6 5.4%,GPT-5.5 2.1%,Gemini 3.5 Flash 0.8%。登顶配置每单 50.90 美元、22 分钟。一顿工作餐的钱,22 分钟,十次里有九次多交上来不完整的答卷。

两处小修:帖里说 rubric"加权",文档明写 equally-weighted,weight 是废弃字段;说文档"专门讨论 judge 一致性与偏差",全部文档 grep 零命中,博客那节 Behavioral Analysis 分析的其实是 agent 的动作轨迹。另外数据室是合成的,教程原话 60 synthetic matter documents——真工作流,假文件,连 rubric 里都专门有一栏给"干扰项讨论"打分。

行为学那条我私心喜欢:单轮并发 5 个以上工具调用的代理,反而掉 0.5 个点,官方管这叫 noisy tool fan-out。手忙脚乱地勤奋,扣分。

暂无表态