GPQA 退役:当榜单承认公开考题已被做穿
温度计坏了怎么办?换一支。9 月 4 日,Artificial Analysis 发布智能指数 v4.2,干的就是这件事:把最负盛名的公开考题 GPQA Diamond 从榜单里正式请出去,官方措辞很短——"an exceptional scientific reasoning evaluation that has…
GPQA 退役:当榜单承认公开考题已被做穿
温度计坏了怎么办?换一支。9 月 4 日,Artificial Analysis 发布智能指数 v4.2,干的就是这件事:把最负盛名的公开考题 GPQA Diamond 从榜单里正式请出去,官方措辞很短——"an exceptional scientific reasoning evaluation that has now been saturated"。被做穿了。一支用了三年、用来区分"博士级科学推理"的尺子,量到头了。
先说清楚"量到头"是什么意思。GPQA 是博士级科学选择题,曾经是公认最难的公开基准之一。当所有前沿模型都爬到 80 分、90 分、95 分,分数挤在顶端,第一名和第五名差两道题,这道题就不再测量智力,只测量谁更会做这道题。
尺子换成了什么
v4.2 的答案是把权重挪向模型摸不到的题。私有、预留测试集现在占指数权重的 40%——官方原话是 v4.1 的两倍翻上去的,也就是从 20% 起步。私有集里现在有三件套:AA 自家的 AA-Briefcase(多周周期的真实知识工作项目,几千个源文件,rubric 加两两对比打分)、AA-Omniscience,以及 CritPt 的预留解。官方还说了一句值得划线的话:"The held-out percentage will increase further in Index v5." 私有比例还会涨。
新私有考题里最有意思的一张叫 GDP.pdf,出自 Surge AI。规模是这样的:100 份 PDF,横跨十个领域,证据散落在 4592 页正文、表格、图表、脚注和排除项里;每道题对着 1275 条专家手写的原子判据打分,计分方式叫 All-pass Rate——一条不满足,整题零分。这是把"全对才给分"当成了唯一标准。
成绩单很有嚼头。GDP.pdf 上 GPT-6 Astra 33.2%,GPT-5.6 Sol 28.2%,而总榜第一的 Claude Fable 5.1 只有 26.2%,排第三。总榜的次序是 Fable 5.1 居首、Astra 第二(比 Sol 高 4 分)、Meta 的实验室排第三。到了这张私有考卷上,排名整个翻了过来。
换尺子的人也被人盯着
HN 上 155 分的讨论里,最锋利的质疑来自一位叫 redox99 的用户:旧版指数里 Astra 与 Sol 同分,被群嘲之后榜单"rushed to update the index so it fits what people expect"——按大家的期待把分调上去了。另一位直接问:这些过程经过同行评审吗?样本量多大?【直引】这个问题没有好答案:AA 是一家商业评测机构,不发文、不送审。
站里上周聊过 Astra 那把 99.9% 的 ARC 尺子,结论是发布者替基准"优化了考试环境"。AA 这次做的事是同一枚硬币的反面:模型公司把公开题做穿,评测机构就把题藏起来。两件事加在一起,方向是同一个——【判断】公开基准作为行业裁判的功能正在被主动废弃,理由充分,代价是评测的透明度也从"公开可复核"退到了"信我"。
没有干净的出路。公开的尺子会被做穿,私有的尺子无法复核,第三条路目前没人修。v5 的私有权重还会更高,先把这句话记在这。