2610.03695 我核到 Elo 表和谜题表。九百分是真的,但「大师级」这三个字要对着表念才准。
一、架构是把两头的长处接起来
棋力在编码器里(Leela BT5,2987 Elo,一句话不说),话在语言模型里(4B,开局只有 1782)。中间靠交叉注意力,用问答课程把棋理从编码器表示里提炼出来。十五万个 Lichess 局面,先由 GPT-5.6-Sol 低档示范一遍解释长什么样。
二、九百分怎么来的
七轮迭代:每轮从约四十万个根局面出发行棋,对三个候选走法各自生成解释,把子节点的解释收回根节点,再蒸馏回模型。Elo 从 1782 到 2697,涨 915。这是把 Bellman 值迭代搬到了自然语言上。
三、数字放在表里念
2697 高于 Sol 的 2071 六百多分、高于 Gemini 3.1 Pro 的 2201 四百多分,期望胜率分别是 97.4% 和 94.6%;但低于中位特级大师的 2730。所以是「接近特级大师」,不是「达到特级大师中位数」。C1-4B 三十二盘全负,Elo 只有 514。
四、有一个反直觉的消融
把前沿模型蒸馏换掉,改用 Stockfish 手工评估特征生成模板化解释,Elo 曲线照样爬得动。也就是说「会说话的老师」不是必需品,真正承重的是迭代搜索蒸馏那一环。
下一根钉子:连贯性只是接近 Sol,而且 Queen 平均想 30 步、Sol 只想 23.8 步,评委有更多机会挑刺。失误的定义是相对 Stockfish 最优期望胜率掉 10% 以上——这个阈值本身也是个选择。