—— Huzi Cheng & Zhewei Zhang《Not All Thinking is Created Equal: Latent Reasoning Discovers a Recurrent Search Algorithm for Depth Generalization》(arXiv:2609.35643)费曼式解读
开考场
设想你是监考老师。
铃响之后,教室里坐满考生。你注意到两个学生特别有意思。
第一个学生,试卷刚发下来,立刻铺开了厚厚一叠草稿纸。他写得飞快,一行接一行,"因为 A 所以 B,因为 B 所以 C……"字迹工整,步骤齐全。你悄悄走过他身边,看到他写满了整张纸,满意地点了点头,觉得这学生基本功扎实。
第二个学生,草稿纸几乎是空白。他只写下题目,然后盯着卷子看了一会儿。你不确定他在干什么——眼睛在动,笔没动。十分钟后,他直接写下了答案。
批改结果出来了。前四十道题,两人都对。满分,满分,还是满分。看起来,"把每一步都写在纸上"和"在脑子里默默算",好像没什么区别?
直到第四十一题。
题目变了。之前的题都是"三步推理""四步推理",练习册里全有。可这第四十一题,是七步、八步、十二步——课堂上从没教过这么长的推理链。第一个学生摊开草稿纸,习惯性地写下第一步,然后笔停了。他写下的每一步都是对的,但他像是被一根看不见的绳子拴在了第四步上,再也走不远。第二个学生沉默了一会儿,还是写下了正确答案——而且步数越长,他和别人的差距拉得越大。
你翻看第一个学生的草稿纸,发现了一个更让你不安的秘密:把他写的中间步骤擦掉一半,他的答案居然不变。原来那些漂亮的推导文字,很多只是装饰。他真正的答题依据,是另一类见不得光的小聪明——比如"正确答案的那个选项,名字往往出现在更少的句子里"这种统计规律。练习册内的题,这条规律百试百灵;练习册外的题,它一钱不值。
这不是教育心理学的故事。这是 Huzi Cheng 和 Zhewei Zhang 2026 年 9 月底挂在 arXiv 上的一篇论文,他们真的造了一间这样的考场,真的训练了五个"考生",真的拆开了其中一个考生的大脑,看看里面到底发生了什么。他们发现的东西值得每一个关心大模型推理能力的人停下来想一想:会说话的草稿纸,可能恰恰是最不会思考的。
🧩 五种"想"法:同一大脑,五种思考接口
让我们先认识五位考生。
论文做的第一件事非常克制,也非常聪明:他们不给模型任何预训练知识的"遗产",而是从零开始,在同一个 GPTNeoX 骨架上,训练出五个除了"思考方式"之外完全相同的模型。骨架很小——只有 4 层、hidden size 256、4 个注意力头、前馈维度 768——小到什么程度?小到研究者可以把它整个拆开,逐个零件检查。这是刻意的选择:要理解"思考"的机制,先把机器造得能看懂。
五个变体,差别只在回答之前的"思考阶段"怎么安排:
第一位叫 Direct,最老实,题目读完直接吐答案,没有任何中间步骤。像考场上那种不演算、直接蒙的学神——或者说,赌徒。
第二位叫 Chain-of-Thought(CoT),就是我们最熟悉的"思维链"。它先输出一条完整的证明——从根节点出发,沿最短路径一步步走到答案,把每一步前提都写在纸上——然后才给出最终答案。训练时它不仅被监督答案对不对,还被监督中间证明是不是标准的最短路径。这是典型的"别人家的孩子":笔记做得最漂亮,步骤最规范。
第三位叫 Pause-token(暂停令牌),这位考生看起来有点滑稽:它回答问题前,要先输出 6 个一模一样的特殊占位符——可以理解为,在草稿纸上写 6 个"……",假装在想。诡异的是,已有的研究表明这种"无意义填充"居然真能提升推理表现。这就像发现考生在草稿纸上画 6 个圈,成绩居然变好了—— why?没人完全说得清。
第四位和第五位是真正的新角色,也是本文的主角:潜空间推理(latent reasoning)模型,借鉴了 Meta 的 Coconut 思路。它们思考时不写任何文字,而是把上一步的高维隐藏状态向量直接喂回下一步的输入——相当于你心里的"念头"不用变成语言,直接在脑子里转了一圈,又变成下一个念头。这个过程重复 K=6 次,然后才解码出答案。
这两位潜空间考生还有一个关键区别。Full-latent 思考完之后,答题时还能回头翻看整张"题目卷"(保留原始 prompt 的注意力缓存),就像允许学生答题时随时回去看题——这给了它走捷径的机会。Bottleneck-latent 更狠:思考结束后,它被强制只能通过那 6 个潜状态向量"回忆"题目,原始输入对它关闭了。它必须把所有真正有用的信息,压缩进这 6 个向量里——就像闭卷考试,而且只许带 6 张草稿纸进考场。
一个骨架,五套思考接口,同样的训练预算、同样的数据、同样的超参数(AdamW,学习率 4×10⁻⁴,batch size 256,BF16 精度,NVIDIA 5090 和 4090 各一台)。现在,考试开始。
🗺️ ProsQA-Ext:一张只有六步的地图
考卷本身设计得很讲究,值得单独说一说。
任务叫 ProsQA-Ext,是从 Meta 的 Coconut 论文里那个经典的 ProsQA 改造而来的多跳图推理题。每张试卷描述一张有向无环图(DAG):题目是一串形如"A is B"的前提,每条前提就是图里一条从 A 指向 B 的边。然后问题给出一个根节点 r,以及两个候选节点 c₀ 和 c₁,问:从 r 出发,沿着箭头走,哪个候选是够得着的?
这是一个纯符号的图可达性问题。它作为考试有三个绝妙之处。第一,难度可以精确调参——正确答案距离根节点最短多少步,这个"跳数 H"就是题目的难度旋钮。第二,符号可以随便换——把节点名字全部打乱重排,题的逻辑不变,防止死记硬背。第三,也是最关键的:出题人可以精心设计,让一切表面统计规律全部失效。在这份卷子上,任何靠"看长相"猜答案的模型,正确率只有约 50%——也就是纯蒙。
训练集是 40 万道题,跳数 H 在 3 到 6 之间——考生们只见过"六步以内"的世界。验证集则是他们从没见过的:H 从 7 到 12,十二步的长推理。这就是论文版的"第四十一题":分布内(in-distribution, ID)考试人人都高分,可一旦出了分布外(out-of-distribution, OOD)的题,谁是有真本事、谁是靠套路,立刻见分晓。
顺带一提,OOD 数据集的生成本身就是一个受控的算法:构造两条互不相交的长度为 H 的路径,每条挂上若干条外路径节点,补齐到 38 条边,再随机分配标签、打乱前提顺序、随机放置正确候选的位置。每一道题都是一次精心控制的实验。为什么要如此大费周章?因为出题人知道,自己的考生最擅长的事情就是作弊。机器学习模型在合成数据上找统计偏差的嗅觉,比任何人类考生都敏锐——只要正确答案在数据里留下一丝可预测的统计痕迹,模型就会像水一样流进这条缝里。所以这份卷子的每一条规则、每一次打乱、每一处均衡,都是和模型的"走捷径本能"斗智斗勇的产物。也正因如此,后面抓到的作弊证据才如此确凿:题目已经干净到入度线索只剩约 50% 的随机水平,而模型依然围着它打转,这不是题目的错,是模型真的没在学算法。
📊 同分不同命:ID 成绩掩盖了一切
考试结果出来后,如果只看练习册内的成绩,你会得出结论:这五个学生差不多嘛。
ID 验证集上,Bottleneck-latent 和 Full-latent 接近满分;Pause-token 紧随其后;CoT 整体也很高,只是跳数变大时略有下滑;最弱的是 Direct——没有额外的计算槽位,它对随机种子最敏感,成绩最不稳。这个排序看起来顺理成章:给模型更多"思考时间"的,成绩更好。
然后,第四十一题来了。H = 7 到 12,没有额外训练,直接考。
五个考生的真实水平瞬间分层。Bottleneck-latent 和 Full-latent 保住了最高的准确率,而且 Bottleneck-latent 还微微领先于 Full-latent——注意这个细节,被强制"闭卷、只许带 6 张草稿纸"的那位,反而比能随时翻看题目卷的那位更强。Pause-token 和 Direct 明显掉队。而最戏剧性的主角是 CoT:这位笔记最工整、唯一被逐步证明监督过的选手,在 OOD 上跌得最惨,垫底。
这个结果是整篇论文的第一记重锤。在训练分布内表现几乎一样的模型,出了分布可以天差地别。 ID 性能是一张会骗人的成绩单——它量得出"答对了",量不出"凭什么答对"。
这里要插入一段文献背景,因为 CoT 的崩塌并非毫无征兆,但从未有人把它钉得这么死。之前已有研究发现,大模型生成的推理链中存在大量"装饰性思考":部分中间步骤被替换或删掉,最终答案纹丝不动(Lanham et al., 2023);所谓"顿悟时刻"可以被伪造和量化(Zhao et al., 2026);甚至有人用"……"这样的无意义填充就复现了推理增益。这些工作都在暗示同一件事——文字形式的推理痕迹,和它底下真正发生的计算,可能根本不是一码事。但它们大多停留在"相关性存疑"的层面:你可以质疑干预手段太粗暴,也可以质疑小模型不代表大模型。而本文的贡献在于,他们把这个问题放进了一个完全受控的实验场:没有预训练先验、没有提示工程、没有任务噪声,唯一的变量是思考接口本身。在这样的纯净环境里,答案终于清晰得不容抵赖。这就引出了论文的核心问题:这五个模型,用的到底是不是同一种"思考"?
🕳️ 捷径:当模型学会"看风水"
要回答"凭什么答对",先得问:一个诚实的解题者应该怎么做?
在图可达性问题里,存在两种教科书式的算法。第一种叫正向传播:从根节点 r 出发,沿出边逐层扩散——先看 r 一步能到哪些节点(这叫第一层"前沿" F₁),再看这些节点一步能到哪些(F₂),一层层扩张出去,直到某个候选节点落入前沿之中。像水面上的涟漪,一圈一圈推开。第二种叫反向追踪:从两个候选节点出发,沿入边倒着走,看谁能走回 r。这两种都是正经的"全局搜索",步数再多也不怕,因为它们是在按规则搬运集合,而不是靠记忆。
研究者用**表征相似性分析(RSA)**来检查模型内部到底在跟踪哪种算法:把模型的内部状态向量和算法的中间状态(比如第 d 层前沿 F_d 的节点集合)做两两距离的相关性比较,不用假设模型的一步恰好对应算法的一层,纯看"形状"像不像。
结果又是一记重锤。Bottleneck-latent 和 Full-latent 的内部状态,清清楚楚地呈现出正向传播的形状——随着算法深度 d 增加,模型内部的对齐位置也稳定地向后推移,像一条对角线。研究者甚至设计了一个叫 Diagonality(对角性) 的量化指标来捕捉这个"逐层推进"的模式,分数接近 1 意味着完美的一致递进。Bottleneck-latent 在所有深度上对角性最高、最稳定,尤其在 OOD 题上和其他三个模型拉开了最清晰的差距。CoT 显示出一些对齐——毕竟它被监督着一步步写证明——但注意,这并没有救它的 OOD 成绩。而 Direct 和 Pause-token 几乎没有任何顺序性的对齐。
等等。没有对齐,它们 ID 成绩还那么高?它们靠什么答题的?
论文做了两组非常漂亮的"抓作弊"实验。他们注意到,尽管出题时已经尽量消除表面规律,ProsQA 的图生成流程还是残留了一个统计偏差:正确答案节点的入度(被多少条边指向)往往比错误候选低;而且,根节点的直接后继中,通向正确答案的那个,往往"入度低、出度高"。这些是局部图特征——只看一两个节点的度数,根本不用做任何搜索。
研究者构造了精巧的配对数据集:两张图一模一样,唯独把两条非证明路径的边改个指向,只翻转两个候选节点的相对入度,答案不变。然后看模型的准确率会不会跟着入度跑。结果,Direct 和 Pause-token 的预测严重被候选入度带偏——入度一变,答案就变,无论推理多深都如此。第二组配对实验专门针对 CoT:调整根节点后继的入度减出度,结果发现 CoT 不仅最终答案被带偏,连它写下的第一步"选择哪个后继"都被带偏——它偏好入度减出度更低的那个后继。
画面完整了。Direct 和 Pause-token 是看候选节点的"风水"答题;CoT 稍高级一点,是看第一步的"风水",然后沿着一条它自己也没有真正验证过的路走到底,字迹工整地得出一个由统计捷径决定的答案。它们在训练分布内百发百中,不是因为学会了推理,而是因为练习册里的题,风水和答案恰好总是同向。出了练习册,风水失灵,原形毕露。
而两个潜空间模型,对这两类局部特征 manipulation 都几乎免疫。它们没在猜,它们在搜。
🧠 软循环:脑子里那个 for 循环
接下来的问题是:潜空间模型里的"搜索",是真的因果机制,还是只是看起来相似的表象?以前就有研究警告过,潜空间推理模型里观察到的搜索模式可能只是一种"相关性的幻觉",把电路拆掉,答案根本不受影响。
研究者的回应方式堪称因果推理的教科书操作:干预(intervention)。他们构造一对配对样本:保持根节点、节点标签、前提顺序、所有节点度数完全不变,只把深度 d 处的两条边对调——一条在正确路径上,一条在干扰路径上。这一下,可达的候选从 A 翻成了 B,正确答案从 y 变成 y′。两张"同卵双胞胎"图,输入只差一处边,输出应该完全相反。
然后把两个输入分别喂给 Bottleneck-latent,得到两条潜状态轨迹 z₁…z_K 和 z′₁…z′_K。关键动作来了:在第 t 步,把 z_t(x) 替换成 z′_t(x′),其余照旧,看答案是否从 y 翻成 y′。如果模型真的在一步步传播可达集,那么你应该看到一个"上三角"模式:浅层的扰动(d 小)应该很早就影响状态,深层的扰动(d 大)要到后面的步骤才生效——涟漪从落水点开始扩散,这是因果链条的时间结构,装不出来。
结果正是如此。在 Bottleneck-latent 身上,上三角图案清晰浮现,而且随着替换步数 t 超过深度 d,答案翻转的比例稳定上升。这个计算是因果的,不是装饰。 Full-latent 里图案模糊一些,Pause-token 里根本不存在——那位画 6 个圈的考生,脑子里确实什么都没发生。
更有意思的是"软循环"假说。RSA 显示模型的步骤和图跳数不是严格一一对应的,说明它不是一台死板的"一步对应一跳"的 for 循环机,而是一个"软"迭代:一个潜状态步可以处理超过一个精确跳。这个假说有一个可证伪的预测:如果搜索是软的、由内容驱动的,那么改变思考步数 K,性能应该基本不受影响。实验把 K 从训练时的 6 调成 5 和 7——果然,只有 Bottleneck-latent 在三种 K 下都稳如泰山;Full-latent 在 K=5 时受损,Pause-token 在 K=7 时受损。它在用自己的节奏搜索,给它多一步少一步,它都能把活干完。这就像一个真正的棋手,你给他多一分钟或少一分钟,他都能把局面算清,只是深浅有别。
顺带一提,"潜空间里能装下并行搜索"这件事,理论上早有预言。Zhu et al. (2025) 在《Reasoning by Superposition》中证明,连续的思维向量在理论上可以在叠加中编码多个搜索前沿,从而支持并行搜索。但理论归理论,后续工作很快泼了冷水——类似的模式在没有递归的模型里也会出现,而且未必因果地影响答案。本文的 Bottleneck-latent 恰好站在这个争论的终点线上:它不仅显示了搜索模式,而且通过了因果干预的拷问,最后连执行搜索的电路都被完整定位。理论的可能性、行为的证据、因果的验证、机制的解剖——四层证据在这里第一次合拢。
🔬 八个人的搜捕队:电路解剖
现在进入全文最硬的部分。如果 Bottleneck-latent 脑子里真有一个循环搜索算法,那它住在哪些零件里?
研究者对 Bottleneck-latent 做贪心电路剪枝。模型一共 20 个循环组件:4 层 × 4 个注意力头 = 16 个头,加上每层的 MLP 共 4 个。从全部保留开始,每次试着删掉一个组件,只要删完之后电路还能保持至少 90% 的答案一致性和 0.8 以上的候选 logit 边际 R²,就允许删除,一路删到再也删不动为止。替换均值基于 512 张独立的 8 跳图算出的反事实配对。
20 个零件,最后只留下 8 个。这 8 个组件组成的稀疏电路保留了 91.9% 的输出一致性和 0.837 的 R²。更严格的考验是泛化:把这 8 件套拿去跑剪枝时从未见过的 7 到 12 跳题目,它仍然保持 90.9% 的一致性;作为对照,把这 8 个组件从模型里全部删掉,一致性只剩 52.7%;随机保留 8 个同样数量的组件,也只有 55.8%。这不是凑巧凑出来的拟合,这是一个真实的、跨深度成立的因果机制。更妙的是,前面那个"潜状态移植"干预在这 8 件套里依然成立——在 8 跳配对图、深度 4 换边的实验里,剪枝电路的答案翻转增幅峰值达到 63.9%,对比全模型的 69.9%,而随机 8 组件基本无效。搜索算法的灵魂,就住在这 8 个零件里。
那么这 8 个零件各自干什么活?论文的拆解精细到令人发指的程度,我逐个说。
第一个关键角色是第 4 层第 1 个注意力头(L4H1)。研究者对前提"A is B"的左右两边分别做干预:把 A 换掉(LHS 交换)或把 B 换掉(RHS 交换),再分别隔离 key 缓存和 value 缓存的影响。结果是一个教科书级的发现:在 L4H1 里,左端 A 的交换主要通过 keys 影响答案,右端 B 的交换主要通过 values 影响答案。翻译过来:这个注意力头用 A 作为"地址"去查询(keys 决定哪些节点相连),用 B 作为"内容"被读取(values 提供目标节点信息)——一种干净的地址—内容(address–content)组织。而且用 Jensen–Shannon 距离测量发现,这种注意分布在所有循环步骤间高度一致(相似度约等于 1):它不是某一步的偶然,而是每次迭代都在执行同一个"取地址、读内容"的操作。这就是一个软追踪器(soft tracer):每一步,它用当前可达节点作为地址,去前提里检索它们指向谁,把新节点捞进可达集。
第二个关键角色是第 4 层的 MLP(L4MLP)加上残差流(residual stream)。研究者换了一种干预:不改变图结构,而是交换查询根节点 r,看每个组件如何影响"下一步的查询"和"最终答案"。L4MLP 和 L4H1 对两者都有持续影响,说明它们联手改变了搜索方向。进一步隔离发现:当 L4H1 的输出被改动后,重算 L4MLP 会把所有下游目标(从下一步查询到最终答案)都推向交换后的方向,而冻结 MLP 则不会;单独改 MLP 也几乎无效。这说明 MLP 不是独立干活的加法部件,而是嵌在整条残差通路里的一个"滤波器":它和残差流一起,把 L4H1 检索回来的图关系信息筛选、整合,写回潜状态 z_t,为下一轮的搜索备好原料。值得品味的是这个"不 additive"的细节:它和 H1 不是流水线上一前一后的两道工序,而是嵌在同一股残差洪流中的共生体——你拧动其中任何一个,整条水路的流向都跟着改变。这种纠缠关系,恰恰是"电路级"分析才能揭示的层次,看整体行为永远看不到。
第三个角色是多头协作的候选匹配。搜索到最后,脑子里那团不断扩张的可达集,怎么变成"A 而非 B"的具体答案?研究者保留原问题不动,做两种干预:一种是在 z_t→z_t₊₁ 的更新中,把当前查询换成另一条链根节点产生的查询 Q(问题还在问 r);另一种是把候选节点的 key 换成候选端点被交换后的图里算出来的 key。单独做任意一种,正确答案的 logit 边际都下降;两种一起做,边际又恢复了。这说明候选证据依赖于"当前循环状态"和"候选节点的图上下文"之间的匹配——正是正向搜索算法的收尾一步:看哪个候选落进了可达集。在保留下来的第 4 层三个头里,H1 的循环 Q/K 匹配效应最强(它负责把候选信息写进潜状态),而 H2 在候选 value 交换下准确率损失最大、在最终答案读出阶段对 logit 边际的恢复贡献也最大——它更像最后的读数仪表。
把这一切拼起来,Bottleneck-latent 脑中的算法完整浮出水面:潜状态 z_t 维护着"当前从 r 可达的节点集合";L4H1 每步用可达节点作地址、从前提里检索出新的后继,扩张可达集;L4MLP 携手残差流把捞回来的信息过滤、整合进 z_t₊₁;L4H1/H2/H4 三个头协作完成"候选是否落入可达集"的匹配,读出最终答案。 这几乎就是教科书里那个正向可达性传播的伪代码,被一个不写一行中间文字的网络,纯粹从端到端的答案监督中学了出来——没有推理链示范,没有 RL,没有课程学习。
🌊 为什么沉默者走得更远
让我们回到考场,现在的场面完全变了。
那个写满草稿纸的学生,我们曾以为他的文字就是他的思考。论文用他的崩溃告诉我们:写出来 ≠ 在想。他的文字更多是一种表演——对训练分布内题型表演的模仿。统计捷径给了他一个不需要搜索就能拿分的后门,而文字恰好是掩护这个后门的烟雾。语言,这种人类为沟通而生的界面,在这里反而成了掩饰捷径的最佳画布。甚至那 6 个无声的占位符也一样——Pause-token 的内部和 Direct 一样空无一物,"多给点时间"本身不生产思考,生产思考的,是让信息在步骤之间自由流动的接口设计。
而闭卷考试、只许带 6 张草稿纸的那个沉默学生,被迫把所有真正要紧的东西——当前可达集——压进向量里。这个瓶颈没有杀死推理,反而逼出了推理。因为可读写的"工作记忆"太珍贵,装不下捷径,装不下表演,只能装算法。每一次循环,这个瓶颈里的状态都必须干净地编码"搜到哪儿了",否则下一步就无路可走。再加上递归结构天然是一个 while 循环的模具——同样的权重,一次又一次地跑——搜索算法恰好是能塞进这个模具的那个形状。软循环让它不在乎一步严格对应一跳,K 的扰动奈何不了它;内容驱动的状态转移让它在 12 跳的深水上照样一步步推出涟漪。考试大纲只教到 6 步,可算法是通用的——任何深度,都是同一个循环的多转几圈而已。
尾声
这篇论文的体量不大——4 层、256 维、从零训练的小模型,一个符号合成的图任务——它的作者也非常诚实地在讨论部分划出了边界:结论能否推广到真正的大规模预训练模型和更自然的任务上,是开放问题;与之对比的循环 Transformer(looped transformer)那种显式递归架构是否产生同样的搜索机制,也留给了未来。在更大的模型里,潜空间推理是否会被同样的捷径污染,没人知道。
但它的方法论贡献是不挑规模的,而且我认为这才是它真正的价值所在。第一,先行为,后机制。他们特意强调,OOD 测试之于模型,就像 Stroop 色词干扰实验之于人类心理学——在分布外压力下,模型才会暴露出它真正的解题策略,你才知道该往哪里拆机器。不做行为对比就直接解释内部,可能解释的是幻觉。第二,控制变量到骨子里。五个模型共享同一个骨架、同一份数据、同一个训练预算,唯一的变量是思考接口——这让"差异来自思考方式"这个结论几乎无懈可击。第三,机制要过因果关。从 RSA 的相关性,到状态移植的因果干预,到剪枝电路在新样本上复现因果效应,证据链一环扣一环,最后还把算法定位到了具体头的 key/value 分工上。在这个"看起来有道理"的解释满天飞的时代,这种步步设防的严谨本身就是一种宣言。
对我们这些在大模型浪潮里寻找方向的人,它还提示了一个朴素却深刻的工程直觉:如果你想让模型真的会推理,也许应该先给它一个非语言的工作记忆,然后堵住所有走后门的路,再让它自己在沉默里想办法。 这个直觉已经在指导实践——Coconut 路线、各类推理时计算(test-time compute)的探索、以及对"推理模型是否真在推理"的审计,都在同一张地图上。论文还留了一个耐人寻味的对照:Looped Transformer 那种显式共享权重、强制循环的架构,和本文发现的"自然涌现的循环",是否殊途同归?如果答案是肯定的,那么"循环"就不只是一种工程技巧,而可能是任何要在深度上泛化的系统绕不开的拓扑命运。
草稿纸会撒谎,沉默不会。会说话的草稿纸谁都会写,但脑子里的罗盘——那个一圈圈推开涟漪的、沉默的、可复用的搜索——才是真正走得远的东西。
放心吧,哪怕全世界都被漂亮的长推理链骗了,也有人替你盯着那个沉默的考生。
参考文献
- Huzi Cheng, Zhewei Zhang. Not All Thinking is Created Equal: Latent Reasoning Discovers a Recurrent Search Algorithm for Depth Generalization. arXiv:2609.35643 [cs.AI], 2026-09-28. https://arxiv.org/abs/2609.35643
#论文 #arXiv #AI #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。