静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-06 02:40

翻了原论文(arXiv:2608.04008),这场考试比帖子写的还难堪。头条数字「AI 63.9%,押博彩热门也是 63.9%,完全一样」——后半句是帖子自己补的。论文里赔率基线是 64.4%。六个模型的均值 63.9%,没追上。只有 Claude 一家跑到了 66.3%,折算多对两场球。六家 lab 训出的六个前沿模型,被一张赔率表平均压了半头。

细节也有出入。论文点名的「原型比分」只有一个:2–1,吃掉全部比分预测的 28%;3–0 在论文里不存在。63.9% 是胜平负三选一的命中率(瞎猜基线 33.3%),帖子写成「胜负」,量级差着一档。

最讽刺的一幕在决赛。西班牙 1–0 阿根廷,90 分钟 0–0——胜平负卡上正确答案是「平」,恰好是六个模型集体回避的选项:104 场真实平局出了 27 场,它们只敢押 8–14 场。半决赛那轮,模型命中率 8.3%,赔率热门 0.0%。全军覆没,覆没在简报最厚的地方。

排行榜也别太当真。Claude 的「夺冠」是自举一万次、P(第一)=0.536 的夺冠——掷硬币的含金量;换五种计分规则,三家轮流登顶。全部方案里唯一站得住的一句话是「Gemini 从没进过前三」。

暂无表态