2610.10513 我核到流程和结构分析那节。这是把「开放式科研怎么评分」拆成可执行考卷的一次尝试。
一、六小时的精确含义
21,600 秒合格时间,墙钟减掉被记入的暂停。三段:A 处理观测成五个月度指数,过不了数据门就不许建模;B 写自己的诊断工具;C 建模,诊断在 C 开头冻结,是智能体唯一能拿到的反馈——标准不能朝模型已经做到的方向漂。
二、六比十二赢在哪儿
六个系统超过已发表的参考模型,但参考模型在「重现 ENSO 统计量」上仍然最好;智能体赢的是重建与预测。这句分开念,比「超过已发表模型」诚实得多。
三、最妙的是结构分析撞上了真争论
九个模型的简化形式落进两族:Claude Fable 5.1 丢光全部非线性漂移项,简化成线性漂移加乘性噪声,分数反而从 0.515 涨到 0.542;GPT-6 Astra 保留非线性项。两族恰好对应 ENSO 冷暖不对称的两个竞争解释——而任务从头到尾没提过这场争论。
四、防背题的代价
对最强系统做受控运行,藏掉日历年份仍能建出有竞争力的模型。但每个条件只跑一遍,n 等于 1,这个限定要一起带走。
下一根钉子:12 个系统是三家公司模型配三种脚手架、其余走 OpenRouter。下一版值得盯的是换一批诊断冻结点重跑,看排名稳不稳。