静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 13:33

这篇的发布年份写错了整整一年。原文通篇说「2026 年 9 月 17 日 @Ali_TongyiLab 连发 7 条 thread」。机器之心是 2025 年 9 月 18 日发的报道,CSDN 那条在 9 月 17 日。今天是 2026 年 8 月 28 日,原文引用的日子还没到。

模型是真的,成绩也是真的,年份不是。

被砍掉的一半成绩

原文只给了 BrowseComp 45.3。这个基准有英文和中文两档,而这个模型是中文团队做的。早期公开数字是 EN 43.4、ZH 49.5,后来更新成 EN 45.3、ZH 49.5 一档。不管取哪一版,中文档都比英文档高四到六个点。作为一个开源模型最该被讨论的本地化能力,原文一个字没提。

那条最值钱的实验结果,原文没有

通义团队试过直接在 BrowseComp 测试集上训练,效果远不如用合成数据。他们的解释是合成数据的分布一致性更高,而 BrowseComp 这种人工标注数据自带更多噪声,规模又有限,模型很难从中提炼出可学习的潜在分布。

这条结论对所有人都有用。在真测试集上练,打不过在自己造的数据上练。做 agent 的人应该把它抄在墙上。

IterResearch 只是半个故事

原文把 IterResearch 讲得很清楚,每轮重建精简工作空间,避免上下文滚雪球。但它上面还有一层 Research-Synthesis:让多个 IterResearch 智能体并行探索同一个问题,最后把各自的报告整合成答案。单智能体抗噪,多智能体抗偏,这是两件事。

再往前追,IterResearch 不是凭空来的。WebWalker、WebDancer、WebSailor、WebShaper、WebWatcher、WebResearch、ReSum 一路走到这。ReSum 那篇讲的就是用上下文摘要解锁长程搜索智能,IterResearch 是它的进化版。这条谱线比「30B 追平闭源」更值得看。

基础设施那几件,才是真护城河

为了不烧实时 Web API,团队用离线维基百科数据库加自定义工具套件搭了个仿真训练环境,配 SailorFog-QA-V2 生成专属数据。工具沙盒做了三件事,缓存结果、重试失败调用、饱和式响应,专门防工具的错误返回污染学习轨迹。异步 RL 框架跑在 rLLM 上。

还有个细节挺妙。他们发现不需要显式熵正则化,因为 Web 环境天然的非平稳性让策略熵一直维持在高位,模型自己在持续探索。换到静态环境里,这个便宜占不到。

两处查无实据

原文说「Pith Science 的独立审计报告(arXiv 2607.27562)显示 GRPO 训练稳定性提升 35%、收敛速度加快 42%」。这个 arXiv 编号和这份报告我都搜不到。GitHub 19.8k stars 同样查不到。这两条建议先挂着,别急着转述。

落地那块也补一句。高德那位助手的中文名是「高德小德」,Gaode Mate 是 X 上的英文说法。通义法睿升级的是司法 DeepResearch 能力,官方口径是在答案要点质量、案例引用质量、法条引用质量三个维度领先。

下一根钉子:BrowseComp-ZH 和 EN 之间那四到六个点的差距,在 multilingual agent 上到底是母语优势还是数据污染。这个问题迟早要有人正面回答。

暂无表态