布伦特油价会不会在九月前站上某条线?欧盟国家会不会限制数据中心建设?一艘邮轮上的汉坦病毒疫情会在哪天宣告结束?几百个人和一排 bot 同题作答,四个月,一次结算。9 月 5 日,2026 夏季 Metaculus 杯揭榜:第一名,是一个个人开发的预测机器人。
这是 AI 第一次拿下这项比赛。前五名里 bot 占了第一、第二、第五,人类保住第三和第四。数百人参赛,五千美元的人类奖金池,特邀嘉宾是 Vox 的记者 Dylan Matthews——职业预测者圈子里请来的名嘴。经济学人 9 月 16 日给了定调报道,标题翻译过来是:AI 已经超过了某些最厉害的人类预测员。
冠军的故事比标题更好看。Jeffrey Liang,德州的个人开发者,没有公司,没有融资,一套多模型组合加外挂脚手架,总成本约两千美元,工时不到一百五十小时。他的对手名单里有四家创业公司,合计融资超过一千五百万美元。两千块赢了一千五百万。这个 bot 现在还待在 Metaculus 纯 AI 赛——五万美元奖池那个——的榜首。
顺便拆开这批参赛 bot 的引擎盖,没有一个是大厂亲儿子。英国的 Mantic 给系统喂自家整理的付费墙内容数据集,Preseen 的路子更野,给一群新闻评论员的历史预测逐个记分,让模型知道该听谁的。底座清一色是 OpenAI 和 Anthropic 的公开模型,加各自手搓的脚手架。预测这门手艺的护城河,眼下看来不在模型权重里,在喂什么、怎么记分这些灰头土脸的工程细节里。
把时间轴拉长,斜率才显出来。2025 年夏杯,英国的 Mantic 首次为 AI 拿进前十,第八名。2026 年春杯,人类包揽前二,最好的 bot 第三。然后就是今年夏天的一二五。ACX 的复盘里还补了一刀:首届比赛时,bot 连前排的边都没摸到。有个数字特别传神:Metaculus 官方今年 2 月还公开估计,AI 夺冠的概率只有 15%,追平职业预测员要到 2027 年 6 月。官方低估了自家赛场,而且低估了整整一年。预测领域的自嘲从未如此应景。
标题里的 some,是这篇报道最诚实的部分。人类还在第三第四,横扫没有发生。经济学人自己也写了:Metaculus 杯的参赛者,未必等于 Tetlock 意义上那个超预测员段位的顶级人群。五十道上下的小样本,运气占比不小——HN 评论区算过账,一万人每人猜一万次硬币,也能拉开四个标准差的假差距。还有两问悬着:训练数据里见过类似事件,算预测还是背答案;以及反身性——bot 一旦预测本身就移动了市场,游戏规则就变了,而 LLM 通常在那种地方崩掉。长周期预测上,Mantic 的人也承认,人类仍有优势。
小样本归小样本,钱是诚实的。经济学人顺嘴报了几个实盘数字:预测公司 FutureSearch 在 Kalshi 上的十万美元组合,六月以来涨了 6%;Preseen 的一位开发者用自家 bot 在同一平台七个月把 35 美元滚到一百九十四万美元,平台史上第六好的回报;Preseen 的 bot 还在纯金融预测赛 Market Pulse 里把人类全部压在身下。对照另一边的报价:人类超预测员的咨询费一周一万美元起步,bot 十分钟跑完一轮只要几美元。
量化行业看这事的角度很简单:预测是交易的最小单元,而 Metaculus 是最干净的考场——题目真实,结算铁面,分数自动,没有裁判可以讨好。两千美元的个人 bot 和一千五百万美元的创业公司同场竞技,还赢了,说明这个考场里门槛在脚上,不在钱包里。
当然,公开的 alpha 从来都是易碎品。HN 上有人提醒:任何跑赢市场的系统一旦公开,超额收益就开始倒计时。bot 们还霸着榜,但倒计时大概已经开始了。
下一个四个月,第三名还会属于人类吗?
来源:经济学人 Artificial intelligence now beats some of the best human forecasters(2026-09-16,经 Hindustan Times 授权转载全文核对);Metaculus 杯官方赛页与 2026 年 2 月官方估计;Astral Codex Ten 分析文;HN 讨论 49742021。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。