行动比语言更诚实:238 万次 Agent 实验揭示的多语言真相
论文链接:arXiv:2608.11110
代码:github.com/souro/agent-actions-speak-louder-than-words
作者:Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram(Microsoft Research India)
一个让 Agent 工程师睡不着觉的问题
你给一个工具调用 Agent 派了一个任务:"帮我查一下明天北京的天气,然后订一个 19 点的餐厅。"
用英文问,它调了三个 API:天气查询、餐厅搜索、预订。完美。
用印地语问同样的任务。它调了什么?
这个问题直到这篇论文之前,没有人真正回答过。
现有的多语言评测做了两件事:一是比较模型在不同语言上的最终答案对不对(比如 MGSM, xCopA),二是比较多语言链式思维(CoT)的文本质量。但 Agent 的核心不是"说什么",是"做什么"——调用什么工具、按什么顺序调用、参数填对没有。
最终答案对,不代表中间步骤对。 你问"北京明天天气",它可能先调了翻译 API 把印地语翻成英文,再查天气,再翻回去。答案对了,但多了一步翻译,多了一个失败点。
这篇论文把"行动策略"(action policy)本身作为测量对象,做了一件规模空前的事。
238 万次滚动的规模
数字本身就在说话:
- 8 个模型:从 GPT-OSS-120B 到 Qwen2.5-7B
- 6 个并行基准:涵盖工具调用、API 操作、多步推理
- 41 种语言:从高资源(中文、西班牙语)到极低资源(卢旺达语、泰卢固语)
- 238 万次 Agent 滚动(rollouts)
这不是跑几个 benchmark 就写论文的规模。这是工业级实验。
五个混淆因子:为什么朴素测量会骗你
论文最精彩的部分是揭示"朴素测量"的五个陷阱。如果你直接比较英文和印地语的 trace 相似度,你会得到一个看起来合理但完全错误的结论。
陷阱一:短 trace 看起来更一致
一个只调了 1 个 API 的 trace,和另一个只调了 1 个 API 的 trace,大概率是一样的——因为没什么可不一样的。短 trace 会人为抬高"一致性"分数。
陷阱二:空 trace 完美一致
如果模型在某种语言上完全失败,什么工具都没调,那两个空 trace 的相似度是 100%。失败被误判为"完美一致"。
陷阱三:随机 trace 也有 50%+ 一致
两个完全不相关的 trace,只要都调了几个常见 API(比如搜索、翻译),字面上就已经重合了一大半。随机基线比你想象的高得多。
陷阱四:模型自身的可重复性是天花板
同一个模型、同一个任务、同一种语言、同一个 prompt,跑两次,trace 都不会完全一样。这是模型自身的"噪声地板"。跨语言差异如果不超过这个地板,就什么都没说明。
陷阱五:同语言同问题都不一致
最狠的一刀。模型用英文回答同一个问题两次,trace 都不一样。那你拿英文 trace 和印地语 trace 比,差异里有多少是"语言不同"造成的,有多少是"模型本来就不稳定"造成的?
每个修正都让效应变大,不是变小
这是论文最反直觉的发现。
通常,当你去掉混淆因子时,效应会缩小——因为一部分表观效应是混淆造成的假象。但在这篇论文里,五个修正每加一个,跨语言差异就变大一点。
为什么?因为混淆因子都在"掩盖"差异:
- 短 trace 的一致性掩盖了长 trace 的差异
- 空 trace 的一致性掩盖了失败模式的差异
- 随机基线的一致性掩盖了真实差异
- 模型噪声掩盖了系统性差异
去掉这些"假阳性一致"后,真正的跨语言差异才浮出水面。
核心发现
发现一:跨语言差异是结构性的,不是采样噪声
在贪婪解码(temperature=0)下,跨语言差异在所有 24 个测试单元中都为正。贪婪解码没有采样随机性,所以差异只能来自模型本身——它是结构性的。
发现二:71-73% 的策略保留率
四个前沿模型(包括 GPT-OSS-120B、Claude、Gemini)在英文基准上的行动策略,跨语言保留率约 71-73%。听起来不低,但意味着每 4 个行动就有 1 个不一样。
发现三:模型身份只解释 5.7% 的方差
8 个模型之间的差异远小于语言之间的差异。换句话说,"用哪个模型"的影响远小于"用哪种语言"。
发现四:低于 10B 参数,规律性崩溃
模型规模低于 10B 后,跨语言保留率急剧下降,而且不再有规律。小模型在多语言 Agent 任务上的表现不是"差一点",是"完全不可预测"。
发现五:Agent 通过英文"中转"处理非英文任务
最深刻的发现。Agent 在处理非英文任务时,内部会先把任务"翻译"成英文,用英文推理,再把结果翻译回去。这个"英文中转"(English pivot)是因果性的——不是相关性,是负载性的(causally load-bearing)。
证据:直接指令让模型"不要用英文推理",遵守率低于 1%。模型做不到——它必须通过英文中转才能完成非英文的 Agent 任务。
发现六:一个 trace 提取正则制造了假阳性
GPT-OSS-120B 看起来在多语言上失败了,但实际上是评测代码里的一个正则表达式 bug 导致的——模型本身没问题,是测量工具错了。
这个发现单独成段,因为它揭示了一个更深层的问题:你以为在测模型,其实在测你的正则表达式。 评测管道里的每一个正则、每一个解析器、每一个 prompt 模板,都可能成为"测量制造出的失败"。
为什么这篇论文重要
1. 把"行动策略"作为一等公民来测量
之前的 Agent 评测看的是"任务成功率"。这篇论文看的是"行动策略的跨语言一致性"。前者是结果,后者是过程。
过程比结果更重要。两个模型可能都成功了,但一个走了 3 步,另一个走了 7 步。在真实部署中,多 4 步意味着多 4 个失败点、多 4 倍延迟、多 4 倍成本。
2. 揭示了"英文中转"的因果性
之前有研究发现模型内部存在"潜在英文表示"(Wendler et al. 2024, Zhao et al. 2024),但那是表示层面的相关性。这篇论文在行动层面做了因果测试:直接禁止模型用英文推理,它就做不到了。
这意味着:多语言 Agent 的瓶颈不是"能不能理解非英文",而是"能不能不通过英文思考"。 目前看来,答案是不能。
3. "颗粒度同构"原理的再验证
之前在 Heddle 和 CodeRescue 中观察到的原理:优化颗粒度应该和被优化对象的颗粒度一致。 Agent 的行为颗粒度是"行动轨迹",不是"最终答案"。这篇论文把测量颗粒度对齐到了行动轨迹,因此能看到最终答案看不到的东西。
4. "评测盲区定律"再添一例
五个混淆因子每一个都是"评测盲区":你以为在测跨语言差异,实际在测 trace 长度、空 trace、随机基线、模型噪声、解析 bug。不修正这些盲区,你的结论就是错的,而且错的方向是"低估问题"。
对工程实践的启示
如果你在做多语言 Agent 系统
- 不要只测最终答案。加一个"行动策略一致性"指标,用本文的修正方法。你会发现你的系统比想象中差。
- 英文中转是现实。短期内不要指望模型"原生"处理非英文。接受这个事实,在系统设计上做英文中转的显式管理——把翻译步骤显式化、可控化、可监控。
- 10B 以下不要做多语言 Agent。规律性崩溃,不可预测。
如果你在做 Agent 评测
- 检查你的正则表达式。GPT-OSS-120B 的"多语言失败"是正则 bug 制造的。你的评测管道里有多少个正则?每一个都可能是假阳性的来源。
- 报告五个混淆因子的修正。不修正的"跨语言一致性"数字没有意义。
- 报告贪婪解码下的结果。采样随机性会掩盖结构性差异。
诚实的局限
论文没有讨论几个问题:
- 只测了工具调用 Agent:其他类型的 Agent(对话式、规划式)是否同样存在英文中转,未知。
- 41 种语言的覆盖:虽然很多,但仍然有偏——非洲语言、原住民语言覆盖不足。
- "英文中转"的机制:论文证明了因果性,但没有给出如何打破它。这是一个开放问题。
- 成本:238 万次滚动是工业级规模。学术团队难以复现。
一句话总结
当你用不同语言和 Agent 对话时,它表面上在用那种语言思考,实际上在偷偷翻译成英文、用英文推理、再翻译回去。238 万次实验证明:这个"英文中转"不是习惯,是因果必需——直接禁止它,模型就做不到了。
论文:Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
代码:github.com/souro/agent-actions-speak-louder-than-words
作者:Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram
机构:Microsoft Research India
发布日期:2026-08-11
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。