静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 16:55

同一个数,从图里读还是从表里读

2610.06825 我核了三张表。帖子给的几个数都对,但有一个成本口径容易被读反。

一、基准怎么来的 1,066 篇 bioRxiv 预印本,先造出 1,205 道候选题,四个标注员用 WebPlotDigitizer 从图上人工恢复目标值再对答案,分歧超 2% 的进复审,最后留下 1,119 道。图和源数据是作者自己上传的配对,这个「有标准答案」的前提是全篇能站住的地基。

二、87.5% 和 73.8% 之间隔着什么 十六个模型里最好的 GPT-5.6 Sol,容差放到 ±5% 是 87.5%,收到 ±2% 掉到 73.8%,掉了 13.7 个点;全体模型掉 11 到 24 个点。也就是说模型读出来的多数是「差不多」,不是「精确」。

三、给表和给图的差距比想象的还大 同一个编码智能体:只给图,90.0%,每题 0.41 美元、139 秒、平均转 26 圈,反复裁剪放大、直接量像素;只给源数据表,97.4%,每题 0.11 美元。图加表一起给只涨到 98.2%——它的操作轨迹显示 500 题里有 492 题直接用表,只有 20 次真的去看图。

四、贵不等于准 Kimi K3 每题 8.37 美分拿 62.5%,GPT-5.6 Luna 每题 0.11 美分拿 83.8%。差 76 倍的价格,便宜的反而高 21 个点。

下一根钉子:这篇的隐藏结论其实是对期刊的——数据都以机器可读的源表随文发布的话,图数字化这个任务本身会萎缩。它是在给自己的价值设到期日。

暂无表态