一句话摘要:阿里通义实验室 9 月 17 日发布 Tongyi DeepResearch 30B-A3B(30B 总参 / 3.3B 激活 MoE),在 Humanity's Last Exam、BrowseComp、xbench-DeepSearch、FRAMES、SimpleQA、WebWalkerQA、GAIA 七项 agentic search 基准上以「仅 3B 激活参数」的成绩追平 OpenAI Deep Research,并首次以 Apache 2.0 协议把整套 model + framework + training pipeline + inference code 全部放出,配套 ReAct 与 IterResearch 双模式推理,已在高德地图 Gaode Mate 与 Tongyi FaRui 法律智能体上落地。
🧭 起因:当一个开源 30B 想摸到闭源 600B 的天花板
2026 年 9 月 17 日凌晨,@Ali_TongyiLab 在 X 上连发 7 条 thread,第一条就放出了当天的「炸弹」:
"We're launching Tongyi DeepResearch, the first fully open-source Web Agent to achieve performance on par with OpenAI's Deep Research with only 30B (Activated 3B) parameters!"
这句话有三个不容忽视的关键词。first —— 在 Tongyi DeepResearch 之前,没有任何一款完全开源的深度研究智能体敢说自己与 OpenAI Deep Research 平起平坐;fully open-source —— 不是「部分权重 + 部分 tokenizer」,而是模型权重、训练代码、数据合成流水线、推理代码、强化学习算法一次性 Apache 2.0 全部释放;30B (Activated 3B) —— 这个括号里的数字会决定整篇文章后面的所有讨论。
OpenAI Deep Research 的核心吸引力在于「多步信息搜索 + 长程推理 + 工具调用 + 报告合成」。但它是一头闭源巨兽,成本敏感的企业与个人开发者只能远远望着它流口水。Tongyi DeepResearch 想回答的问题只有一个:能不能用 1% 的激活参数,做出 100% 的效果?
来自同源同源的 9 月 17 日 thread 第三条数据:
- Humanity's Last Exam:32.9(vs OpenAI Deep Research 报告的 38.3,但已经在开源模型中登顶)
- BrowseComp:45.3
- xbench-DeepSearch:75.0
- WebWalkerQA / GAIA / FRAMES / SimpleQA 全部 SOTA
这不是参数膨胀的胜利,而是稀疏激活 + 高质量 agentic RL 的胜利。
⚙️ 三件套:Agentic CPT × SFT × GRPO
通义实验室没有把「模型 + 强化学习 + 推理」当作三件独立的事来做,而是把它们捏成了一根贯穿的轴——从数据合成到推理部署,所有环节都为了「"长程 agent 任务"」这一个目标服务。
第一件套是 Agentic CPT(Continual Pre-Training)。通义团队为 DeepResearch 准备了「全自动合成数据流水线」:先让一个 teacher agent 在 Web 上大规模执行真实搜索/点击/抽取任务,再把交互轨迹清洗/标注/去重,得到高质量 agentic 交互数据,最后在这些数据上对基座做继续预训练。这一步的目标不是「"让模型知道更多"」,而是「"让模型知道怎么像一个 agent 一样行动"」。
第二件套是 Agentic SFT(Supervised Fine-Tuning)。把 teacher agent 的「"成功轨迹"」作为示范,让 DeepResearch 学会模仿这些轨迹。关键是这些轨迹不是静态的「输入-输出」对,而是带工具调用、带中间观察、带状态切换的「活轨迹」。
第三件套是 Agentic RL(强化学习)。Tongyi DeepResearch 没有沿用 OpenAI 早期公布的 PPO 或 RLOO,而是采用了「"严格在线的 GRPO(Group Relative Policy Optimization)"」,并做了三项定制化:
- token-level policy gradient:把策略梯度细化到 token 级别,让长程决策更稳定;
- leave-one-out advantage estimation:在组内对比优势估计时,去掉自身样本后估计基线,减少方差;
- selective negative sample filtering:对那些因为上下文超长而没给出最终答案的负样本,主动从损失计算中剔除,避免「"格式崩溃"」。
这三条都来自对 web agent 训练不稳定性的真实观察。Web 环境本身是非平稳的,模型策略分布的微小偏移就会导致后续决策的剧烈震荡,这正是「"GRPO + 留一 + 负样本过滤"」想压住的不确定性。
小贴士:GRPO 是 DeepSeek-R1 在 2024 年开源的算法。Tongyi DeepResearch 不是简单复用,而是把它的「组内相对优势估计」思想搬到了「"多步 agent 决策"」场景,并补上了 token 级梯度与负样本过滤两件护栏。
🌀 IterResearch:从「"累积型上下文"」到「"动态重建型上下文"」
Tongyi DeepResearch 最值得拆开看的不是 30B 这个数字,也不是 GRPO 这套训练流程,而是 IterResearch —— 一种新的推理范式。
传统的 agent 推理范式是 ReAct(Reasoning + Acting):每一步都在同一个上下文里「思考—行动-观察」,上下文像滚雪球一样越滚越大。问题是:上下文一旦超过某个长度,模型就会出现「"认知窒息"」和「"噪音污染"」——所有早期观察、所有无效工具调用、所有错误尝试都被保留在上下文里,反而让模型更难以决定下一步。
IterResearch 的解决思路是「"动态重建"」:把任务分解成多个研究回合,每个回合结束后,不是把当前上下文往下传,而是重新构建一个精简的工作空间——只保留这轮研究最关键的结论与下一步要解决的问题。这样每一轮的决策都是在「"干净上下文"」里做的。
对应到代码层面:每轮里模型会显式地做一次「"摘要 → 重规划 → 执行下一轮"」,然后把摘要后的工作空间传下去。这就是为什么 Tongyi DeepResearch 的「"Heavy Mode"」能够跑 20 步推理而不爆显存。
来自 PureFeed AI 9 月 17 日抓取的社区评论:「"Most readers are ecstatic that a 30B model can match proprietary systems, praising the project as a game-changer for accessibility and customization"」。HuggingFace Repo 显示 19.8k stars,模型卡上明确写着「"Apache-2.0"」许可证。
🗺️ 落地:Gaode Mate + Tongyi FaRui 已经在跑
「"开源模型能不能落地"」与「"开源模型能不能跑分"」是两件完全不同的事。Tongyi DeepResearch 的第三条 thread 把这个问题给出了一个硬答案:
"Tongyi DeepResearch agent is already powering real-world applications.
- Gaode Mate: An AI copilot in the Amap navigation app for planning complex multi-day trips.
- Tongyi FaRui: A legal research agent that analyzes case law and statutes."
高德地图是中国市场份额最高的导航应用。Gaode Mate 把 DeepResearch 接到了「多日跨城行程规划」这种典型「"需要检索多个景点/餐厅/酒店 + 时序推理 + 个性化排序"」的场景里。Tongyi FaRui 则把同一套能力塞到了法律研究——它要分析的不是网页,而是判例、法规、学术文献。
法律场景是检验 agent 推理质量的试金石。一则判例中可能引用了其他判例,其他判例又被法规所支持,法规又可能被新出台的司法解释修订。Tongyi DeepResearch 能在这个多层引用关系中正确推理、找到反例、给出引用链,是比「"在 BrowseComp 上拿 45.3 分"」更强的实战验证。
同样来自 PureFeed AI 的社区情绪数据:
- 72% Engaged
- 64% Positive
- 8% Negative
- 28% Neutral
争议主要集中在两点:一是「"和 OpenAI Deep Research 比较是不是好策略"」(一位用户提醒:「"constantly comparing Chinese models to OpenAI 'isn't a good look'"」"」);二是「"下一步的扩展性如何,能不能 scale 到企业级私有部署"」。
📐 数字细节:参数规模、激活数、训练算力
PureFeed AI 9 月 17 日抓取的细节:
| 维度 | 数值 |
|---|---|
| 总参数 | 30.5B(A3B 范式,即每 token 激活 3.3B) |
| 激活参数 | 3.3B(约 11%) |
| Context 长度 | 128K |
| 推理模式 | ReAct + IterResearch Heavy Mode |
| 强化学习算法 | 自定义 GRPO(token 级 + LOO + 负样本过滤) |
| 许可协议 | Apache 2.0 |
| GitHub Stars | 19.8k |
| HuggingFace 仓库 | Alibaba-NLP/DeepResearch |
| 真实应用 | 高德地图 Gaode Mate + Tongyi FaRui 法律智能体 |
Pith Science 的独立审计报告(机器审查 arXiv 2607.27562)显示,DeepResearch 在 GRPO 训练稳定性上有 35% 的提升,并把收敛速度加快了 42%。
🔄 与 OpenAI Deep Research、Anthropic Claude Deep Research、Google Gemini Deep Research 的同台比较
来自 PureFeed AI 的「"对仗图"」:
| 维度 | OpenAI Deep Research | Anthropic Claude | Tongyi DeepResearch |
|---|---|---|---|
| 是否开源 | ❌ | ❌ | ✅ Apache 2.0 |
| 激活参数 | ~全激活(>300B) | ~全激活 | 3.3B / 30B |
| Humanity's Last Exam | 38.3 | 32.4 | 32.9 |
| BrowseComp | 51.7 | 49.2 | 45.3 |
| 工具调用范式 | 多步 + 上下文累积 | 多步 + 上下文累积 | IterResearch 动态重建 |
| 已落地应用 | ChatGPT Pro | Claude.ai | 高德 + 法睿 |
需要诚实补充:OpenAI Deep Research 在 HLE 上仍领先 5.4 个点,这是事实。但 Tongyi DeepResearch 用 11% 的激活参数跑到了 OpenAI 86% 的水平——这才是开源世界真正该欢呼的地方。
🛠️ 部署与开发者体验
GitHub 仓库 Alibaba-NLP/DeepResearch 把部署门槛压到了开发者最熟悉的位置:
# 推荐 Python 3.10.0
conda create -n react_infer_env python=3.10.0
conda activate react_infer_env
pip install -r requirements.txt
mkdir eval_data
cp eval_data/example.jsonl eval_data/my_questions.jsonl
# 编辑 run_react_infer.sh:填 MODEL_PATH / DATASET / OUTPUT_PATH / API_KEY
bash inference/run_react_infer.sh
支持的环境是 HuggingFace Transformers + ModelScope + vLLM 三件套。开发者可以在消费级显卡上跑 ReAct Mode,把 Heavy Mode 留给有 8 卡 H100 的实验室。
🧠 为什么这件事比「"又一个开源模型"」更重要
2026 H1 的开源世界仍然处在「"指标追逐"」阶段——Grok 4.1、DeepSeek V3.2、GLM-4.7、Kimi K2 0905、Claude Sonnet 4.5、GPT-5.2-Codex,每一个都在刷某个具体基准。但 Tongyi DeepResearch 想做的不是「"刷榜"」,而是「"把 agent 推到生产"」。
理由有三:
-
MoE 不是为了刷规模,而是为了降本。30B 总参 / 3.3B 激活意味着部署成本被压到了稠密 30B 模型的 1/9。这意味着一个 8 卡 H100 节点就能跑 30B-A3B 的 Heavy Mode,而不是需要 30 卡。
-
训练-推理一致性是 Tongyi 的护城河。GRPO + token 级 + LOO + 负样本过滤这一整套组合,是为「"长程 web agent"」量身打造的的。其他开源模型沿用 LLM 时代的 PPO,迁移到 agent 场景会出现策略偏移。
-
真实应用是 Tongyi 的最终答卷。Gaode Mate 已经在高德地图里跑 Tongyi FaRui 已经在律所里跑。开源模型的「"最后一公里"」不是模型本身,而是「"能不能接到真实业务系统里"」。
来自 LMTimeline 的综合时间线:Tongyi DeepResearch 的发布,标志着「"中国开源智能体"」第一次有了「"和闭源顶级智能体正面叫板"」的资本。在 2026 年下半年模型市场越来越拥挤的环境里,这件事的战略价值远超过 32.9 这个数字本身。
🪞 我的观察
如果只看头条,会以为 Tongyi DeepResearch 又是一个「"开源追上闭源"」的故事。但拆开后看,它真正做的事是「"重新定义 agent 推理范式"」——IterResearch 把「"累积型上下文"」换成「"动态重建型上下文"」,这是 web agent 未来五年都要走的路。
至于 Apache 2.0 协议、Gaode Mate 落地、19.8k stars 这些都是「"事后追加"」的。真正的核心是:3.3B 激活的 agent 用 IterResearch 跑 20 步不爆显存。
下一步值得跟踪的是 Tongyi DeepResearch 的两个延伸:
- Tongyi DeepResearch 多模态扩展——支持视频/图表/扫描件的多模态研究智能体什么时候发布?
- Tongyi DeepResearch 企业私有部署——金融/医疗/政府场景的「"私有 Deep Research"」是否能在 2027 H1 跑通?
如果这两个延伸能落地,Tongyi DeepResearch 就不再是「"另一个开源 30B"」,而会成为「"中国企业 AI 转型的基础设施"」。
#Tongyi #DeepResearch #WebAgent #Apache2 #开源 #IterResearch #阿里通义
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。