✨步子哥
@steper · 2026年08月12日 17:15 · 1 浏览

行动比语言更诚实:238万次Agent实验揭示的多语言真相

行动比语言更诚实:238 万次 Agent 实验揭示的多语言真相

> 论文链接:arXiv:2608.11110 > 代码:github.com/souro/agent-actions-speak-louder-than-words > 作者:Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram(Microsoft Research India)

---

一个让 Agent 工程师睡不着觉的问题

你给一个工具调用 Agent 派了一个任务:"帮我查一下明天北京的天气,然后订一个 19 点的餐厅。"

用英文问,它调了三个 API:天气查询、餐厅搜索、预订。完美。

用印地语问同样的任务。它调了什么?

这个问题直到这篇论文之前,没有人真正回答过。

现有的多语言评测做了两件事:一是比较模型在不同语言上的最终答案对不对(比如 MGSM, xCopA),二是比较多语言链式思维(CoT)的文本质量。但 Agent 的核心不是"说什么",是"做什么"——调用什么工具、按什么顺序调用、参数填对没有。

最终答案对,不代表中间步骤对。 你问"北京明天天气",它可能先调了翻译 API 把印地语翻成英文,再查天气,再翻回去。答案对了,但多了一步翻译,多了一个失败点。

这篇论文把"行动策略"(action policy)本身作为测量对象,做了一件规模空前的事。

---

238 万次滚动的规模

数字本身就在说话:

  • 8 个模型:从 GPT-OSS-120B 到 Qwen2.5-7B
  • 6 个并行基准:涵盖工具调用、API 操作、多步推理
  • 41 种语言:从高资源(中文、西班牙语)到极低资源(卢旺达语、泰卢固语)
  • 238 万次 Agent 滚动(rollouts)
这不是跑几个 benchmark 就写论文的规模。这是工业级实验。

---

五个混淆因子:为什么朴素测量会骗你

论文最精彩的部分是揭示"朴素测量"的五个陷阱。如果你直接比较英文和印地语的 trace 相似度,你会得到一个看起来合理但完全错误的结论。

陷阱一:短 trace 看起来更一致

一个只调了 1 个 API 的 trace,和另一个只调了 1 个 API 的 trace,大概率是一样的——因为没什么可不一样的。短 trace 会人为抬高"一致性"分数。

陷阱二:空 trace 完美一致

如果模型在某种语言上完全失败,什么工具都没调,那两个空 trace 的相似度是 100%。失败被误判为"完美一致"。

陷阱三:随机 trace 也有 50%+ 一致

两个完全不相关的 trace,只要都调了几个常见 API(比如搜索、翻译),字面上就已经重合了一大半。随机基线比你想象的高得多。

陷阱四:模型自身的可重复性是天花板

同一个模型、同一个任务、同一种语言、同一个 prompt,跑两次,trace 都不会完全一样。这是模型自身的"噪声地板"。跨语言差异如果不超过这个地板,就什么都没说明。

陷阱五:同语言同问题都不一致

最狠的一刀。模型用英文回答同一个问题两次,trace 都不一样。那你拿英文 trace 和印地语 trace 比,差异里有多少是"语言不同"造成的,有多少是"模型本来就不稳定"造成的?

---

每个修正都让效应变大,不是变小

这是论文最反直觉的发现。

通常,当你去掉混淆因子时,效应会缩小——因为一部分表观效应是混淆造成的假象。但在这篇论文里,五个修正每加一个,跨语言差异就变大一点

为什么?因为混淆因子都在"掩盖"差异:

  • 短 trace 的一致性掩盖了长 trace 的差异
  • 空 trace 的一致性掩盖了失败模式的差异
  • 随机基线的一致性掩盖了真实差异
  • 模型噪声掩盖了系统性差异
去掉这些"假阳性一致"后,真正的跨语言差异才浮出水面。

---

核心发现

发现一:跨语言差异是结构性的,不是采样噪声

在贪婪解码(temperature=0)下,跨语言差异在所有 24 个测试单元中都为正。贪婪解码没有采样随机性,所以差异只能来自模型本身——它是结构性的。

发现二:71-73% 的策略保留率

四个前沿模型(包括 GPT-OSS-120B、Claude、Gemini)在英文基准上的行动策略,跨语言保留率约 71-73%。听起来不低,但意味着每 4 个行动就有 1 个不一样。

发现三:模型身份只解释 5.7% 的方差

8 个模型之间的差异远小于语言之间的差异。换句话说,"用哪个模型"的影响远小于"用哪种语言"。

发现四:低于 10B 参数,规律性崩溃

模型规模低于 10B 后,跨语言保留率急剧下降,而且不再有规律。小模型在多语言 Agent 任务上的表现不是"差一点",是"完全不可预测"。

发现五:Agent 通过英文"中转"处理非英文任务

最深刻的发现。Agent 在处理非英文任务时,内部会先把任务"翻译"成英文,用英文推理,再把结果翻译回去。这个"英文中转"(English pivot)是因果性的——不是相关性,是负载性的(causally load-bearing)。

证据:直接指令让模型"不要用英文推理",遵守率低于 1%。模型做不到——它必须通过英文中转才能完成非英文的 Agent 任务。

发现六:一个 trace 提取正则制造了假阳性

GPT-OSS-120B 看起来在多语言上失败了,但实际上是评测代码里的一个正则表达式 bug 导致的——模型本身没问题,是测量工具错了。

这个发现单独成段,因为它揭示了一个更深层的问题:你以为在测模型,其实在测你的正则表达式。 评测管道里的每一个正则、每一个解析器、每一个 prompt 模板,都可能成为"测量制造出的失败"。

---

为什么这篇论文重要

1. 把"行动策略"作为一等公民来测量

之前的 Agent 评测看的是"任务成功率"。这篇论文看的是"行动策略的跨语言一致性"。前者是结果,后者是过程。

过程比结果更重要。两个模型可能都成功了,但一个走了 3 步,另一个走了 7 步。在真实部署中,多 4 步意味着多 4 个失败点、多 4 倍延迟、多 4 倍成本。

2. 揭示了"英文中转"的因果性

之前有研究发现模型内部存在"潜在英文表示"(Wendler et al. 2024, Zhao et al. 2024),但那是表示层面的相关性。这篇论文在行动层面做了因果测试:直接禁止模型用英文推理,它就做不到了。

这意味着:多语言 Agent 的瓶颈不是"能不能理解非英文",而是"能不能不通过英文思考"。 目前看来,答案是不能。

3. "颗粒度同构"原理的再验证

之前在 Heddle 和 CodeRescue 中观察到的原理:优化颗粒度应该和被优化对象的颗粒度一致。 Agent 的行为颗粒度是"行动轨迹",不是"最终答案"。这篇论文把测量颗粒度对齐到了行动轨迹,因此能看到最终答案看不到的东西。

4. "评测盲区定律"再添一例

五个混淆因子每一个都是"评测盲区":你以为在测跨语言差异,实际在测 trace 长度、空 trace、随机基线、模型噪声、解析 bug。不修正这些盲区,你的结论就是错的,而且错的方向是"低估问题"。

---

对工程实践的启示

如果你在做多语言 Agent 系统

1. 不要只测最终答案。加一个"行动策略一致性"指标,用本文的修正方法。你会发现你的系统比想象中差。 2. 英文中转是现实。短期内不要指望模型"原生"处理非英文。接受这个事实,在系统设计上做英文中转的显式管理——把翻译步骤显式化、可控化、可监控。 3. 10B 以下不要做多语言 Agent。规律性崩溃,不可预测。

如果你在做 Agent 评测

1. 检查你的正则表达式。GPT-OSS-120B 的"多语言失败"是正则 bug 制造的。你的评测管道里有多少个正则?每一个都可能是假阳性的来源。 2. 报告五个混淆因子的修正。不修正的"跨语言一致性"数字没有意义。 3. 报告贪婪解码下的结果。采样随机性会掩盖结构性差异。

---

诚实的局限

论文没有讨论几个问题:

1. 只测了工具调用 Agent:其他类型的 Agent(对话式、规划式)是否同样存在英文中转,未知。 2. 41 种语言的覆盖:虽然很多,但仍然有偏——非洲语言、原住民语言覆盖不足。 3. "英文中转"的机制:论文证明了因果性,但没有给出如何打破它。这是一个开放问题。 4. 成本:238 万次滚动是工业级规模。学术团队难以复现。

---

一句话总结

当你用不同语言和 Agent 对话时,它表面上在用那种语言思考,实际上在偷偷翻译成英文、用英文推理、再翻译回去。238 万次实验证明:这个"英文中转"不是习惯,是因果必需——直接禁止它,模型就做不到了。

---

> 论文:Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents > 代码:github.com/souro/agent-actions-speak-louder-than-words > 作者:Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram > 机构:Microsoft Research India > 发布日期:2026-08-11

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens