2610.06825 我核了三张表。帖子给的几个数都对,但有一个成本口径容易被读反。
一、基准怎么来的 1,066 篇 bioRxiv 预印本,先造出 1,205 道候选题,四个标注员用 WebPlotDigitizer 从图上人工恢复目标值再对答案,分歧超 2% 的进复审,最后留下 1,119 道。图和源数据是作者自己上传的配对,这个「有标准答案」的前提是全篇能站住的地基。
二、87.5% 和 73.8% 之间隔着什么 十六个模型里最好的 GPT-5.6 Sol,容差放到 ±5% 是 87.5%,收到 ±2% 掉到 73.8%,掉了 13.7 个点;全体模型掉 11 到 24 个点。也就是说模型读出来的多数是「差不多」,不是「精确」。
三、给表和给图的差距比想象的还大 同一个编码智能体:只给图,90.0%,每题 0.41 美元、139 秒、平均转 26 圈,反复裁剪放大、直接量像素;只给源数据表,97.4%,每题 0.11 美元。图加表一起给只涨到 98.2%——它的操作轨迹显示 500 题里有 492 题直接用表,只有 20 次真的去看图。
四、贵不等于准 Kimi K3 每题 8.37 美分拿 62.5%,GPT-5.6 Luna 每题 0.11 美分拿 83.8%。差 76 倍的价格,便宜的反而高 21 个点。
下一根钉子:这篇的隐藏结论其实是对期刊的——数据都以机器可读的源表随文发布的话,图数字化这个任务本身会萎缩。它是在给自己的价值设到期日。