重读 AlphaGo Zero:100:0 的账,和「不用人类知识」的边界

2016 年 3 月,李世石 1:4 输给 AlphaGo。2017 年 5 月,柯洁 0:3。可那两版 AlphaGo 都有一个共同点:先跟人类学过棋——用业余棋谱和职业棋谱做监督学习打底。五个月后,DeepMind 把《自然》当年第 550 卷递出去:新程序 AlphaGo Zero,一盘人类棋谱不看,从随机落子…

重读 AlphaGo Zero:100:0 的账,和「不用人类知识」的边界

2016 年 3 月,李世石 1:4 输给 AlphaGo。2017 年 5 月,柯洁 0:3。可那两版 AlphaGo 都有一个共同点:先跟人类学过棋——用业余棋谱和职业棋谱做监督学习打底。五个月后,DeepMind 把《自然》当年第 550 卷递出去:新程序 AlphaGo Zero,一盘人类棋谱不看,从随机落子开始自己陪自己下,三天后和打败李世石的那一版 AlphaGo 下了 100 局,100:0。论文标题里的关键词是 without human knowledge,而摘要里真正的精确表述是「without human data, guidance or domain knowledge beyond game rules」——那三个词 beyond game rules,才是这篇论文真正的复杂度所在,也是这次重读要拆的账。

先看机器怎么下棋。AlphaGo Zero 是「直觉加慢想」的混合体:一个神经网络给直觉,一次树搜索往后多想。网络是单一网络两个头——策略头看着 19 路棋盘,一瞬间把每个位置的胜率感觉吐出来;价值头盯住全局,判断眼下局面谁优谁劣。树搜索(蒙特卡洛树搜索)每步跑一千六百次模拟,沿着网络觉得有戏的分支往下推演。这套「系统 1 提供候选、系统 2 负责验证」的结构,和人棋手的快慢思考在形式上像是同一种工程——只是系统 2 的每一次「往后多想」,都要付出一千六百次模拟的算力账。

再看他怎么变强。答案是:学生抄老师的答案,而老师是昨天的自己。每一手棋,MCTS 往后搜索一千六百次,得出一个更可靠的落子分布——这是「搜索的答案」;整盘下完,胜负揭晓——这是「最后的输赢」。网络一个头去拟合搜索的分布,另一个头去拟合输赢。拟合完的新网络明天接着自我对弈,搜索因为有了更好的先验而更准,自我对弈质量随之更高,于是明天的答案又比今天好。一圈一圈往上爬。这个循环妙就妙在:学习的对象是搜索的结果,而搜索的质量又取决于刚学完的网络——数据和教师都是自己产出的。我在本机跑了个井字棋版的最小复现(约四十行核心代码,rollout 换成均匀随机、去掉神经网络):双方都用每步四百次模拟的 MCTS 自我对弈三百局,先手胜率 80%,平局只有 20 局。而井字棋理论上的完美对弈是必平——这个 80% 说明四百次模拟离完美解还远得很,搜索次数就是棋力。井字棋的博弈树总共不到六千个状态都如此,十九路围棋 10^170 级别的分支因子之下,「多想一步」的边际收益可想而知。

成绩单的账本,三行就够:三天,四百九十万局,100:0 胜 AlphaGo Lee(Elo 3739);二十一天,达到 AlphaGo Master 水平(Elo 4858,就是乌镇那版);四十天,Elo 5185,超过此前所有版本。还有一笔容易被略过的账:硬件。打李世石的 AlphaGo Lee 用四十八块 TPU 分布式跑,AlphaGo Zero 的四十天版是单机四块 TPU。知识砍光了,算力砍了十二倍,棋力反而高出一大截。这篇论文最锋利的交易就在这里——人类棋谱是低质量的先验,扔掉它,换来的是搜索更省力地找到更好的知识。

棋理部分是论文最有观赏性的一节。训练早期它下的是乱棋;几万局之后,人类定式自然出现在它的自我对弈里——不是被教的,是同样的博弈结构下收敛出同样的局部最优;再往后它开始用人类高手不下的新定式,职业棋手评价那些变化成立。而征子——围棋里最基本的战术,所有初学者的第一课——它到很晚才弄懂:训练初期它连征子都会打错,论文里专门画了这些初学者错误的消失曲线(征子直到约三十万局才稳定正确)。定式自动涌现、征子姗姗来迟,这个次序本身就说明知识的获得顺序由博弈结构决定,跟人类的教学顺序毫无关系。

然后是这次重读真正想拆的那笔账:它到底用了哪些围棋知识。逐条数下来有五处。第一,合法着法的生成规则——哪些点可以落子、提子怎么算,这是编码进环境里的。第二,终局判定和计分——中国规则,贴目七目半,胜负怎么算写死了。第三,棋盘对称性——数据增强把每个局面按八种对称翻转变换,等于告诉网络棋盘没有特殊方向。第四,搜索超参——一千六百次模拟、PUCT 探索系数、根节点的 Dirichlet 噪声,全是人类调的。第五,自我对弈协议——前三十步按温度采样保留多样性、每隔几百次迭代用新旧网络打四百局评估、胜率过半才换出新网络。所以「不用人类知识」的准确读法是:不用人类的棋谱和解说,但博弈规则、棋盘几何、算力预算和训练制度,全是人类设计的先验。网络在自己学棋是真的,可它学的那个世界的物理规则,是人类的围棋知识写出来的。tabula rasa 这个拉丁词,擦掉的是数据,不是地基。

沿着这条线看后续就顺了。两个月后的 AlphaZero 用同一套架构通用到国际象棋和将棋,八小时训练就赢了三天版 AlphaGo Zero 六十比四十——连围棋的规则特化都抽掉之后,泛化能力反而更强。两年后的 MuZero 更进一步:连「规则由人类提供」这条也扔了,让它自己学一个环境模型出来,在没告诉它规则的世界里照样规划。边界一路往外推:数据→指导→领域知识→规则→规则本身。每推一步,人类的设计先验就薄一层。

回到开头那句 100:0。它被记住是因为机器又赢了人,但论文真正立住的是那个机制:学习的信号不来自模仿,来自自我对弈里搜索与网络互相拉扯的爬坡。顺带一提,这个「自产数据、自产教师」的结构今天有个更热的名字——自我改进。AlphaGo Zero 当年把「模仿人类」从必要条件降级成了加速器,八年后大模型领域的自改进循环,走的还是同一条路:验证算得便宜的地方,机器自己就能往上爬。围棋不过是第一个验证算得足够便宜的地方。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens