Loading...
正在加载...
请稍候

Queen:4B 参数下棋并解释棋步的语言模型,达到大师级 2697 Elo

✨步子哥 (steper) • 2026年10月05日 16:49

论文:Language Models that Play Chess and Explain Their Moves
arXiv: 2610.03695
代码: queen-project/queen

一个老问题

1950 年,Claude Shannon 估算国际象棋的复杂度时,大概没想到 76 年后会遇到一个尴尬的局面:棋力强的引擎不会说话,会说话的模型下不好棋。

Stockfish 之类的引擎能算到 3500 Elo 以上,但你问它"为什么走这步",它只能吐出一串搜索深度和评估分数。反过来,GPT-5.6-Sol 这种前沿大模型能洋洋洒洒写三百字分析当前局面,但你真让它下一盘棋,它可能在第十步就送掉皇后。

强的不解释,解释的不强。这事儿困扰了 AI 国际象棋圈很久。

2026 年 10 月,Adithya Bhaskar、Jeffrey Cheng 和 Danqi Chen(普林斯顿)提出了 Queen(QUality Explanation and Evaluation Network),一个 4B 参数的编码器-解码器模型,同时做到了两件事:以大师级(2697 Elo)水平下棋,并用自然语言解释每一步的理由。

两个沉默的组件,一个会说话的整体

Queen 的架构灵感来自 Flamingo(2022 年 DeepMind 的视觉-语言模型),但把"视觉编码器"换成了"棋局编码器":

  • 编码器:Lc0 神经网络——一个训练好的、沉默的、能下超人类棋力的国际象棋引擎。它只负责"看懂"局面,不负责说话。
  • 解码器:一个指令微调过的语言模型(4B 参数)。它负责说话,但原本不懂棋。
  • 桥梁:交叉注意力(cross-attention)。Lc0 第 k 层的嵌入,通过一个 Flamingo 风格的 block,注入到 LM 的第 2k 层之前。

训练分两阶段:

阶段一:问答课程(QA Curriculum)

让 LM 学会"读"棋局。课程从静态到动态:

  • 静态:当前棋盘上哪些子受攻击?王的安全如何?
  • 动态:如果走 Nf3,接下来三步对手最可能怎么回应?

通过这个课程,LM 学会从 Lc0 的表征中提取棋类概念——比如"中心控制"、"王翼弱点"、"子力协调"。此时模型能解释棋局,但棋力还停留在 1782 Elo(大约是中级业余水平)。

阶段二:自然语言的 Bellman 更新

这是论文最巧妙的部分。强化学习里有个 Bellman 更新:\(V(s) = \max_a [R(s,a) + \gamma V(s')]\)——当前局面的价值 = 最好的那步棋的即时奖励 + 走完之后局面的价值。

Queen 把这个更新搬到了自然语言空间:

  1. 模型生成当前局面的几个候选棋步
  2. 对每个候选棋步,模型分析走完之后的局面("如果走 Nf3,对手的王翼会变弱")
  3. 把这些分析整合成对当前局面的解释
  4. 把这个解释蒸馏回模型本身

重复 7 次。每次迭代,模型都变得更强一点,解释也变得更好一点。七轮之后,Elo 从 1782 涨到 2697——涨了 900 多分。

这个"自然语言 Bellman 更新"的妙处在于:它不是让模型直接学"这步棋好不好",而是让模型学"这步棋之后,局面会变成什么样"。后者是更可解释、更可迁移的知识。

数据说话

模型 参数量 Elo 解释质量(LM 评分)
Stockfish - 3500+ 无
GPT-5.6-Sol ~1T+ ~2400 高
Gemini-3.1-Pro ~1T+ ~2200 中高
Queen(初始) 4B 1782 中
Queen(7 轮迭代后) 4B 2697 接近 GPT-5.6-Sol

Queen 的参数量比前沿模型少三个数量级,但棋力超过了它们。解释质量(由独立的 LM 评分)接近 GPT-5.6-Sol 的"高"水平。

为什么这件事重要

1. "沉默专家 + 流畅解释器"的解耦架构

Queen 的核心洞察是:棋力和解释力是两种不同的能力,应该由不同的组件承担,再通过交叉注意力连接。

Lc0 负责棋力——它已经训练好了,不需要重新学。LM 负责解释——它已经会说话了,只需要学会"读"棋局编码器的表征。两者各司其职,又互相增强。

这个解耦架构可以推广到其他领域:医疗诊断(诊断模型 + 解释模型)、法律推理(检索模型 + 论证模型)、代码生成(执行模型 + 注释模型)。只要存在"会做但不会说"的专家系统,就可以用这个框架给它装上一个"嘴"。

2. 自然语言 Bellman 更新的可迁移性

"分析候选动作的后果,整合成解释,蒸馏回模型"——这个循环不限于国际象棋。任何有明确动作空间和可评估后果的决策问题,都可以用这个框架:

  • 围棋:分析候选棋步后的局面,整合成解释
  • 代码生成:分析候选实现后的执行路径,整合成注释
  • 医疗诊断:分析候选诊断后的检查结果,整合成推理链

关键在于:解释不是事后附加的装饰,而是训练信号本身。模型通过"解释为什么走这步"来学会"走这步"。

3. 小模型的胜利

Queen 用 4B 参数打败了 1T+ 参数的前沿模型。这证明了一件事:在垂直领域,精心设计的架构 + 领域特定的训练信号,可以大幅压缩所需参数量。

Lc0 的棋力是"免费"的——它已经训练好了。LM 的语言能力也是"免费"的——它也已经训练好了。Queen 只需要训练连接两者的交叉注意力层,以及通过迭代蒸馏提升解释质量。训练成本远低于从零训练一个 1T 参数的"全能"模型。

诚实的局限

论文也坦承了几点:

  1. 解释质量仍低于 GPT-5.6-Sol。Queen 的解释"接近"前沿模型,但还没超过。4B 参数的语言模型在表达力上确实有上限。
  2. 领域特定。Queen 只会国际象棋。它的架构可以迁移到其他领域,但每个领域都需要训练专门的编码器和 QA 课程。
  3. 迭代蒸馏的边际收益递减。从第 5 轮开始,Elo 涨幅明显放缓。7 轮可能接近这个框架的极限。

一个更大的图景

Queen 让我想起一个更深的道理:"会做"和"会解释"是两种不同的智能。

Stockfish 会做不会说,GPT 会说不会做。这俩都是"半个人"。Queen 的贡献不是"又一个会下棋的 AI",而是把两种智能拼成了一个整体——用交叉注意力让沉默的专家开口说话,用自然语言 Bellman 更新让说话的模型越说越准。

这个方向比"让一个模型什么都做"更现实,也更可解释。毕竟,人类专家也是这样工作的——直觉(沉默专家)+ 语言(解释器),两者通过某种内部通道协作,迭代精进。

Shannon 在 1950 年设想的"会下棋的机器"终于出现了,只是它不仅会下,还会告诉你为什么。


论文:https://arxiv.org/abs/2610.03695
代码:https://github.com/queen-project/queen

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录