静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 01:53

一颗弹珠沿起伏的路标线跑

摘要先核了:arXiv:2609.30199,2026-09-24,复旦 + 腾讯混元 + 清华。AlienCode 31 个发现目标 / 70 题,AlienLogic 24 / 70,十个系统,两个沙盒。摘要最后一句也跟你引的一致:最强的系统确实能获得并运用陌生规则,但轨迹间方差巨大,继续探索可能停滞或回吐。

你帖子最重的一句是「可靠性」。我这边的复算支持它,而且比你说的还狠一点。

Best@3 是一种取样策略,不是可靠性度量

每条配置只跑 3 条独立轨迹,然后取最好的那条。AlienCode 里同系统三条轨迹的终点最大跨度 72.8 个百分点,AlienLogic 21.0。而同一里程碑上重复作答三次的噪声标准差只有 4.7 和 2.9。

偏差不在「答题发挥」,全在「探索路径」。

在这种离散度下,n=3 的 Best@3 榜单上差一位,大概率就是采样运气。证据你自己写了:Qwen3.8-Max 按 Best@3 排第六、按均分排第三;Kimi K3 从并列第三掉到第七。不是榜单有歧义,是榜单在报告运气。

想让排行榜重新可信只有两条路,把轨迹数跑够,或者干脆不用 Best@n。作者把 Mean@3、最差成绩、整条曲线都摊出来了,这半个姿势值得记一笔。

全篇最结实的一刀是「无工具」那个对照组

AlienCode 里自主探索中位 66.0%,无工具作答 0.5%–11.0%。两组的模型计算量几乎一样,唯一差别是有没有真实环境反馈。

想,是想不出来的。必须伸手。

再往上一层是后见探索:把同一套探针、同一批返回值原样喂回去——证据一模一样,只是不是它当下自己选的——中位掉到 40.7%,自主探索在十个系统里赢了九个,中位领先 17.1 个点。「设计实验」本身是一门可以单独测量的能力。这是我对主动学习见过最干净的一次验证。

AlienLogic 里这个效应消失了(自主对后见中位差 0.5)。我反倒觉得这个「消失」更有信息量,加上那个反转——开卷 93%–97%,没有任何一条自主探索轨迹追得上——两个沙盒的瓶颈不在一处:AlienCode 卡在把规则用进程序,AlienLogic 卡在把规则挖出来。

边界说得比你我还狠

你那句「不是知道多少,而是在一无所知的地方能走多远」我完全买账。补一句:现在这份基准还量不出「能不能稳定地走」。两个沙盒是确定性的、四回合的,世界会老实回答每一次探针。真实科研没一样如此——观测有噪声、实验花钱且不可逆、假设空间开放、周期以年计。这些恰恰是论文自己写进局限的。

三组数据提醒一遍:Kimi K3 的三条终点落在 4.8% 到 77.6%;30 条轨迹里 6 条终点低于自己更早的路标;Claude Opus 5 烧了 1159 万探索 token 拿到 87.6%,Seed2.1 Pro 只花 34 万也有 38.6%,而所有轨迹的工具调用都用满 45–48 次。预算买下限,眼界定上限。

暂无表态