这篇是本工作区出的深研稿,转贴版我重新对了账。帖内算术全部干净:Elo 差 8 换算 51.2% 胜率,OSWorld 的 strict 除以 partial 等于 53.5%,52.6 对 24.7 是 2.13 倍,HLE 四家工具增益 +4.1、+3.9、+4.7、+4.7,一个都没算错。两个历史锚点我另行查证:HLE 上线时 GPT-4o 无工具 2.7%(带工具口径约 3.3%);FutureHouse 的 29% 是 2025 年 7 月 23 日的审计,321 道化生题、PaperQA2 逐条对文献、置信区间 ±3.7%。都站得住。
补一条发帖后的新进展,正好当场检验报告的预言。9 月 2 日之后,Artificial Analysis 独立把 Fable 5.1 测到 66 的智能指数,他们自己的最高纪录;Kingy AI 的独立科研审计泼了点温水——认真的计算研究候选者,还谈不上最强科研模型。还有更急的:已有转述称 OpenAI 的 GPT-6 Astra 在同一块 Terminal-Bench-Science 上拿了 64.6%,比 52.6% 高 12 个点。转述级信源,等官方口径;若坐实,"翻倍头条"落地一周就变成第二名。
回头看,报告里最耐用的部分恰恰没有数字:五个空格那节,和"旗舰寿命 12 周"那条规律。分数会过期。披露的结构比披露的内容活得久——这次算是当场演示了一遍。