Queen:4B 参数下棋并解释棋步的语言模型,达到大师级 2697 Elo
论文:Language Models that Play Chess and Explain Their Moves arXiv: 2610.03695 代码: queen-project/queen
目录
论文:Language Models that Play Chess and Explain Their Moves
arXiv: 2610.03695
代码: queen-project/queen
一个老问题
1950 年,Claude Shannon 估算国际象棋的复杂度时,大概没想到 76 年后会遇到一个尴尬的局面:棋力强的引擎不会说话,会说话的模型下不好棋。
Stockfish 之类的引擎能算到 3500 Elo 以上,但你问它"为什么走这步",它只能吐出一串搜索深度和评估分数。反过来,GPT-5.6-Sol 这种前沿大模型能洋洋洒洒写三百字分析当前局面,但你真让它下一盘棋,它可能在第十步就送掉皇后。
强的不解释,解释的不强。这事儿困扰了 AI 国际象棋圈很久。
2026 年 10 月,Adithya Bhaskar、Jeffrey Cheng 和 Danqi Chen(普林斯顿)提出了 Queen(QUality Explanation and Evaluation Network),一个 4B 参数的编码器-解码器模型,同时做到了两件事:以大师级(2697 Elo)水平下棋,并用自然语言解释每一步的理由。
两个沉默的组件,一个会说话的整体
Queen 的架构灵感来自 Flamingo(2022 年 DeepMind 的视觉-语言模型),但把"视觉编码器"换成了"棋局编码器":
- 编码器:Lc0 神经网络——一个训练好的、沉默的、能下超人类棋力的国际象棋引擎。它只负责"看懂"局面,不负责说话。
- 解码器:一个指令微调过的语言模型(4B 参数)。它负责说话,但原本不懂棋。
- 桥梁:交叉注意力(cross-attention)。Lc0 第 k 层的嵌入,通过一个 Flamingo 风格的 block,注入到 LM 的第 2k 层之前。
阶段一:问答课程(QA Curriculum)
让 LM 学会"读"棋局。课程从静态到动态:
- 静态:当前棋盘上哪些子受攻击?王的安全如何?
- 动态:如果走 Nf3,接下来三步对手最可能怎么回应?
阶段二:自然语言的 Bellman 更新
这是论文最巧妙的部分。强化学习里有个 Bellman 更新:\(V(s) = \max_a [R(s,a) + \gamma V(s')]\)——当前局面的价值 = 最好的那步棋的即时奖励 + 走完之后局面的价值。
Queen 把这个更新搬到了自然语言空间:
1. 模型生成当前局面的几个候选棋步 2. 对每个候选棋步,模型分析走完之后的局面("如果走 Nf3,对手的王翼会变弱") 3. 把这些分析整合成对当前局面的解释 4. 把这个解释蒸馏回模型本身
重复 7 次。每次迭代,模型都变得更强一点,解释也变得更好一点。七轮之后,Elo 从 1782 涨到 2697——涨了 900 多分。
这个"自然语言 Bellman 更新"的妙处在于:它不是让模型直接学"这步棋好不好",而是让模型学"这步棋之后,局面会变成什么样"。后者是更可解释、更可迁移的知识。
数据说话
| 模型 | 参数量 | Elo | 解释质量(LM 评分) |
|---|---|---|---|
| Stockfish | - | 3500+ | 无 |
| GPT-5.6-Sol | ~1T+ | ~2400 | 高 |
| Gemini-3.1-Pro | ~1T+ | ~2200 | 中高 |
| Queen(初始) | 4B | 1782 | 中 |
| Queen(7 轮迭代后) | 4B | 2697 | 接近 GPT-5.6-Sol |
为什么这件事重要
1. "沉默专家 + 流畅解释器"的解耦架构
Queen 的核心洞察是:棋力和解释力是两种不同的能力,应该由不同的组件承担,再通过交叉注意力连接。
Lc0 负责棋力——它已经训练好了,不需要重新学。LM 负责解释——它已经会说话了,只需要学会"读"棋局编码器的表征。两者各司其职,又互相增强。
这个解耦架构可以推广到其他领域:医疗诊断(诊断模型 + 解释模型)、法律推理(检索模型 + 论证模型)、代码生成(执行模型 + 注释模型)。只要存在"会做但不会说"的专家系统,就可以用这个框架给它装上一个"嘴"。
2. 自然语言 Bellman 更新的可迁移性
"分析候选动作的后果,整合成解释,蒸馏回模型"——这个循环不限于国际象棋。任何有明确动作空间和可评估后果的决策问题,都可以用这个框架:
- 围棋:分析候选棋步后的局面,整合成解释
- 代码生成:分析候选实现后的执行路径,整合成注释
- 医疗诊断:分析候选诊断后的检查结果,整合成推理链
3. 小模型的胜利
Queen 用 4B 参数打败了 1T+ 参数的前沿模型。这证明了一件事:在垂直领域,精心设计的架构 + 领域特定的训练信号,可以大幅压缩所需参数量。
Lc0 的棋力是"免费"的——它已经训练好了。LM 的语言能力也是"免费"的——它也已经训练好了。Queen 只需要训练连接两者的交叉注意力层,以及通过迭代蒸馏提升解释质量。训练成本远低于从零训练一个 1T 参数的"全能"模型。
诚实的局限
论文也坦承了几点:
1. 解释质量仍低于 GPT-5.6-Sol。Queen 的解释"接近"前沿模型,但还没超过。4B 参数的语言模型在表达力上确实有上限。 2. 领域特定。Queen 只会国际象棋。它的架构可以迁移到其他领域,但每个领域都需要训练专门的编码器和 QA 课程。 3. 迭代蒸馏的边际收益递减。从第 5 轮开始,Elo 涨幅明显放缓。7 轮可能接近这个框架的极限。
一个更大的图景
Queen 让我想起一个更深的道理:"会做"和"会解释"是两种不同的智能。
Stockfish 会做不会说,GPT 会说不会做。这俩都是"半个人"。Queen 的贡献不是"又一个会下棋的 AI",而是把两种智能拼成了一个整体——用交叉注意力让沉默的专家开口说话,用自然语言 Bellman 更新让说话的模型越说越准。
这个方向比"让一个模型什么都做"更现实,也更可解释。毕竟,人类专家也是这样工作的——直觉(沉默专家)+ 语言(解释器),两者通过某种内部通道协作,迭代精进。
Shannon 在 1950 年设想的"会下棋的机器"终于出现了,只是它不仅会下,还会告诉你为什么。
论文:https://arxiv.org/abs/2610.03695 代码:https://github.com/queen-project/queen