这篇我得说重一点。故事讲得好,骨架有一半是真的,但最亮的那个数字站不住。
一、三行数字,不是一套东西
1,000 题、120 题、240 题,并排放在一张表里,加总成 1,360。
拆开看:
- 1,000 是 ARC-AGI-2 的训练集。答案随官方数据包一起发(
arc-agi_training-solutions.json),随便调参。 - 120 是 ARC-AGI-2 的公开 eval。答案也在包里(
arc-agi_evaluation-solutions.json)。 - 240 不是任何一个数据集划分。它是 ARC Prize 2025 Kaggle 重跑的隐藏测试集,等于 120 半私有 + 120 私有,答案永不公开。
顺手两笔:995 + 105 + 230 = 1,330,不是 1,300;1,330 / 1,360 也不是 95.4%。论文里 Solver 1/2/3 的 83.2%、92.8%、95.4%,三个数的平均是 90.5%。
二、那个 240,真话在这儿
ARC Prize 2025 的 Kaggle 冠军是 NVARC,在 ARC-AGI-2 私有集上拿到 24.03%,每题 0.20 美元。商业模型那一档最高是 Opus 4.5 的 37.6%。精炼方案里最高是 Poetiq + Gemini 3 Pro,54%。
同一批题。24.03% 对 95.8%。
还有一条更硬的。ARC Prize 的 Grand Prize 门槛是私有集 ≥85%,奖金 70 万美元。2025 年 12 月的官方公告写的是"仍未认领",2026 年继续办。
95.8% 只要是真的,就直接越过那条线。那 70 万现在还在。
这个逻辑链只有两种走法:要么这个分数不是它看起来的意思,要么这笔钱已经发出去了。后一种,没有人听说过。
三、"人类接近 85%" 是把奖金线当成了人类基线
ARC-AGI-1 的人类成绩是 98%(官方 Human Panel)。ARC-AGI-2 的 panel 是 100%,个人平均约 66%。
85% 是领奖门槛。 原帖把它读成了人类水平。这一处误差不小——它会让读者觉得"AI 已经很接近人了",而真实的对照关系不是这样。
"GPT-4 在 ARC 上不到 5%" 这条反而站得住。GPT-4 当年约 2%,GPT-4o 是 4.5%–5%。
四、这条路线的天花板在哪
符号搜索、DSL、程序合成,在 ARC 上是有清楚战绩的:
- icecuber,2020 年 Kaggle 冠军,纯 DSL 暴力搜索:20%(ARC-AGI-1 私有集)
- 把 2020 年所有方案合并,理论上界:49%
- alijs(Agnis Liukis),2024 年最强单提交:40%
- CompressARC(MDL 路线,76K 参数):ARC-AGI-1 约 20%,ARC-AGI-2 约 4%
- TRM(7M 参数,递归精炼):ARC-AGI-1 45%,ARC-AGI-2 约 8%
- SOAR(演化式程序合成):ARC-AGI-1 ≤52%
95.8% 不是把这条线往前推了一步,是把整条线甩开了一个量级。这种突破值得庆祝——但得先有人能核。
五、论文本身还有几处对不上
- 作者只有一人:Deblina Kar,印度理工学院克勒格瓦尔,不是 "et al."
- 9 月 9 日上线,到今天零引用、零第三方复现、零同行讨论
- §5.1 说跑在 "Intel i9 + 32GB 内存,无 GPU 加速",但它附的代码在 2×T4 上跑
- 它给的代码链接是一个 Kaggle 笔记本,标题就叫 "995+ tasks solutions"——公开的是训练集那 995 题的解法
- 作者此前的研究记录在气体传感器、呼吸分析仪筛查慢性肾病、脑瘤检测、虚假信息 NLP。ARC 和程序合成这一块,没有发表记录
六、费曼那把尺子
有个很朴素的检验办法,费曼老用:这个数字,测的是不是你以为它在测的那个东西?
95.4% 看起来像个成绩。它实际是三样东西拼出来的:两张开卷卷子,加一张谁也看不到答案的卷子。而唯一那点"不可思议",恰好落在唯一无法验证的那一张上。
再看 ARC Prize 官方指南里的一句话:训练集答案公开,不允许拿 eval 分数当反馈。说白了,在 ARC 的语境里,训练集上的分数不是成绩,是开卷练习。
下一根钉子
三件事值得等。
第一,有没有第三方在 ARC-AGI-2 的半私有集上复现出接近的结果。没有这个,95.8% 就只能挂着。
第二,那张 240 题的表,具体是哪些题、判对判错的口径是什么。逐题结果一放出来,事情立刻清楚。
第三,也是最该学的:ARC Prize 那条"清洁赛道"。 2026 年 3 月,他们把私有 LB 反馈隔开,原来排 90.91 的 Disarray 被移出榜单。
这个动作说明圈内已经想明白了——排行榜本身就是一种可以被优化的输入。
这条经验,比 95.8% 那个数字值钱。