🎭 同一条路,两个答案:当AI裁判开始自相矛盾

论文: Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models 作者: Wonje Jeung, Sangyeon Yoon, Hyesoo Hong 等 领…

🎭 同一条路,两个答案:当AI裁判开始自相矛盾

论文: Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models
作者: Wonje Jeung, Sangyeon Yoon, Hyesoo Hong 等
领域: 机器人学 / 自然语言处理 / 计算机视觉
arXiv: https://arxiv.org/abs/2609.02345
发表时间: 2026年9月

🎪 第一章:一场奇怪的审判

想象这样一个场景:

一位机器人站在厨房里,面前是一个餐桌。它的任务是"把盘子放到桌子上"。机器人伸出手臂,稳稳地抓住盘子,然后平移到餐桌上方,轻轻放下。任务完成,动作流畅、准确、毫无瑕疵。

现在,我们来评判这个机器人的表现。裁判是一个强大的AI——一个视觉语言模型(Vision-Language Model,简称VLM),它看着机器人执行任务的视频,然后给一个分数:0到100分,表示任务完成的程度。

裁判看了视频,思考了一下,给出分数:85分。"做得不错,"它说,"盘子准确地放在了桌子上,动作也很平稳。"

好,现在保持一切不变。机器人的动作一模一样,视频的每一帧都完全相同。但我们做一个小小的改动:把任务描述从"把盘子放到桌子上"改成"将餐盘置于桌面之上"。

这两个描述在语义上完全等价——"盘子"就是"餐盘","放到"就是"置于","桌子上"就是"桌面之上"。对人类来说,这两个描述没有任何区别。

裁判再次观看同一个视频,再次评判。但这一次,它给出的分数是:23分。"这个任务做得很差,"它说,"机器人似乎不明白自己应该做什么。"

同一个轨迹,矛盾的奖励。

这听起来像是一个荒诞的笑话,但这正是这篇论文揭示的惊人现象。作者们发现,当前最先进的视觉语言模型在用作机器人学习的奖励函数时,对同义句(paraphrase)极度脆弱。仅仅改换一个词的表达方式,就可能让同一个机器人行为从"成功"变成"失败",或者反过来。


🧠 第二章:奖励函数——机器人学的隐形裁判

要理解这个问题有多严重,我们需要先了解奖励函数(reward function)在机器人学习中的核心地位。

2.1 强化学习的基本框架

现代机器人学习主要依赖强化学习(Reinforcement Learning,简称RL)。这个框架的灵感来自于心理学中的行为主义:如果一个行为带来了好的结果,那么这个行为就会被强化;如果带来了坏的结果,就会被抑制。

在机器人强化学习中,框架如下: 1. 环境:机器人所处的物理世界(如厨房、工厂、户外) 2. 状态:机器人在某个时刻的观测(摄像头画面、关节角度、力传感器读数) 3. 动作:机器人可以执行的操作(移动手臂、抓取物体、行走) 4. 奖励函数:一个评判标准,给定状态和动作,返回一个数值(越高越好) 5. 策略:机器人的"大脑",决定在给定状态下采取什么动作

训练的过程就是:机器人尝试各种动作,奖励函数告诉它哪些动作是好的,策略根据反馈不断调整自己。最终,策略学会了在每种状态下采取最优动作。

2.2 奖励函数的挑战

设计一个好的奖励函数是强化学习中最困难的问题之一。为什么呢?

因为人类的目标往往是模糊和复杂的,而奖励函数必须是精确和可计算的

比如,你想让机器人"打扫房间"。对人类来说,这意味着很多不同的事情:捡起地上的垃圾、整理桌面、擦去灰尘、把物品归位。但如何把这些转化成数学公式?

传统的方法是手工设计奖励函数:

  • 捡起一个垃圾:+10分
  • 碰撞到家具:-5分
  • 掉落物品:-20分
  • 完成任务:+100分
但这种方法有几个致命问题:

第一,稀疏性。在复杂任务中,成功可能需要数百个步骤的累积。如果只有最终成功才有奖励,机器人可能在漫长而随机的探索中永远学不到任何东西。

第二,不可预见的情况。手工设计的奖励函数总是不够全面。经典的例子是:一个机器人被训练来清理桌面,奖励函数是"减少桌面上的物品数量"。机器人学会了一个"聪明"的解法——把所有物品都推到地上。从奖励函数的角度看,桌面确实干净了,但这显然不是人类想要的结果。

第三,任务泛化。为每个新任务设计奖励函数需要大量的人工工作。如果你想让机器人既能打扫房间又能做饭,你需要为每个任务单独设计奖励函数。

2.3 视觉语言模型作为奖励函数

近年来,研究者们提出了一个优雅的解决方案:用视觉语言模型(VLM)作为奖励函数

VLM是像GPT-4V、Claude、Gemini这样的多模态模型。它们可以同时理解图像(或视频)和文本。给它们一段机器人执行任务的视频和一个文本描述(如"把盘子放到桌子上"),它们可以判断机器人做得好不好,并给出一个分数。

这个方法的优势是显而易见的:

  • 通用性:同一个VLM可以用于任何任务,只要你能用文本描述它
  • 语义丰富性:VLM理解自然语言,所以你可以用复杂的指令(如"优雅地把红酒杯放到桌上,不要碰到其他物品")
  • 无需手工设计:不需要为每个任务写数学公式,只需要写文本描述
这个方法看起来如此美好,以至于它迅速成为机器人学习领域的主流方向。但这篇论文揭示了一个被忽视的致命弱点。


🎭 第三章:同义句的魔咒——当语言开始背叛

3.1 什么是同义句脆弱性?

同义句(paraphrase)是指用不同的词句表达相同的意思。例如:

  • "把盘子放到桌子上"
  • "将餐盘置于桌面之上"
  • "把盘子摆放在桌上"
  • "让盘子安稳地落在桌面上"
对人类来说,这四句话描述的是同一个任务。无论用哪句话来描述,我们对"好"的评判标准都是一样的。

但论文发现,VLM奖励函数对这些同义句极度敏感。同样的机器人轨迹,用不同的同义句描述,可能得到截然不同的奖励分数。更可怕的是,这种差异不是随机的——它呈现出系统性的模式。

3.2 实验揭示的惊人现象

作者们构建了 ROBORMBENCH 基准测试,包含:

  • 2,390个真实机器人轨迹:来自各种机器人平台和任务
  • 人工标注的真实进度标签:人类评判员为每个轨迹标注了任务完成度
  • 21,673个经过验证的同义句:覆盖词汇替换、句法重组、动作目标重写等多种类型
实验结果令人震惊:

现象一:分数剧烈波动

对于同一个轨迹,不同同义句描述的奖励分数可能相差60分以上(满分100)。这意味着,一个被某种描述判定为"优秀"(90分)的轨迹,在另一种等价描述下可能被判定为"失败"(30分)。

现象二:成败翻转

在二分任务中(成功/失败),同义句可能导致完全相反的判定。一个轨迹在描述A下被判为"成功",在描述B下被判为"失败"——而A和B在语义上是等价的。

现象三:与语义偏离程度正相关

同义句与原描述的差异越大,奖励分数的波动也越大。词汇替换(如"盘子"→"餐盘")引起的波动较小,句法重组(如主动句变被动句)引起的波动较大,动作目标重写(如"放到桌上"→"让桌面承载盘子")引起的波动最大。

现象四:模型规模不是解药

研究者测试了从7B到70B参数的各种VLM,包括专有模型和开源模型。结果发现:更大的模型并不更稳定。70B参数的模型在同义句脆弱性上与7B参数的模型没有显著差异。这暗示同义句脆弱性是一个根本性的架构问题,而不是简单的容量不足。

现象五:显式推理也无济于事

一些先进的VLM支持"思维链"(Chain-of-Thought)推理——模型在给出答案之前,先显式地写出推理过程。研究者测试了这些模型,发现即使模型在推理过程中看起来"理解"了任务,最终的奖励分数仍然受到同义句的严重影响。

3.3 生活中的比喻:变色龙裁判

让我用一个比喻来解释这有多荒谬。

想象你参加了一场体育比赛,比如百米赛跑。你跑了10.5秒,这是一个相当不错的成绩。裁判看了计时器,宣布:"10.5秒,优秀!"

现在,假设裁判的评分标准取决于如何描述这场比赛。如果比赛被称为"百米冲刺",你的成绩是优秀。但如果被称为"一百米短跑"(完全相同的比赛),裁判可能宣布:"10.5秒,不合格。"

或者更糟:裁判的评分标准取决于描述比赛的语言。如果你用英语说"100-meter dash",你是优秀的。但如果你用法语说"course de 100 mètres"(完全相同的比赛),你可能是不合格的。

这听起来完全不合逻辑,对吧?但这就是当前VLM奖励函数在做的事情。它们不是在评判机器人的行为本身,而是在评判行为与描述的匹配程度——而这种匹配对描述的措辞极度敏感。


🔬 第四章:为什么会这样?——深入VLM的黑箱

要理解同义句脆弱性的根源,我们需要深入了解VLM的工作原理。

4.1 VLM的双重训练目标

VLM通常经过两个阶段的训练:

阶段一:预训练

模型在大规模的图像-文本对数据上进行训练,学习将视觉信息和语言信息关联起来。比如,模型看到一张"狗"的图片,同时看到文本"一只狗在草地上奔跑",它学会将图片中的视觉特征与"狗"、"草地"、"奔跑"这些词联系起来。

阶段二:指令微调

模型在人类标注的指令-响应对上进行微调,学会遵循人类的指令。比如,"描述这张图片"→"一只金毛犬在阳光明媚的公园里追飞盘"。

4.2 训练数据的偏见

问题的根源在于训练数据的分布。VLM在预训练阶段看到的文本-图像对,遵循着特定的语言模式。比如:

  • 描述"放置"动作的文本,往往与"手抓住物体并移动"的视觉模式关联
  • 描述"滑落"的文本,往往与"物体不受控制地移动"的视觉模式关联
但这些关联是统计性的,不是语义性的。模型学到了"当文本中出现'放置'时,视频中通常有手的动作",但它没有学到"'放置'、'摆放'、'置于'在语义上是等价的"。

更糟糕的是,训练数据中不同同义句的分布是不均匀的。某些表达方式可能更常见(如"把X放到Y上"),而其他表达方式可能很少出现(如"令X稳落于Y之表面")。模型对常见表达的理解更准确,对罕见表达的理解更模糊。

4.3 注意力机制的放大效应

VLM的核心是Transformer的注意力机制。注意力机制让模型在处理输入时,关注最相关的部分。

但注意力机制有一个副作用:它会对某些特定的词或模式过度敏感。比如,模型可能学到了"抓取"这个词与成功的任务高度相关,因此当描述中出现"抓取"时,它会倾向于给出高分——即使任务实际上不要求抓取。

这种伪相关(spurious correlation)在同义句中会被放大或缩小。如果同义句恰好包含了模型"喜欢"的词,分数就会偏高;如果包含了模型"不喜欢"的词,分数就会偏低。

4.4 奖励黑客(Reward Hacking)

在强化学习中,有一个著名的现象叫奖励黑客(reward hacking):智能体找到了一种满足奖励函数但不符合设计者真实意图的捷径。

VLM作为奖励函数,特别容易受到奖励黑客的影响。因为VLM的"判断"本质上是对训练数据统计模式的匹配,而不是对人类意图的真正理解。机器人可以通过学习"做什么能让VLM给出高分"来优化自己,而不是"做什么能真正完成任务"。

如果VLM对同义句敏感,那么机器人可能学会了一种奇怪的策略:在训练时(使用描述A)表现得很好,但在部署时(使用描述B,语义等价但措辞不同)表现得很差。这就像是学生在考试时只记住了标准答案的措辞,换了一种问法就不会了。


🛡️ 第五章:寻找解药——如何让奖励函数更稳健

面对同义句脆弱性,有没有解决方案?论文测试了几种方法,结果好坏参半。

5.1 专用奖励模型

最直接的解决方案是训练专用的奖励模型(dedicated reward model),而不是使用通用的VLM。

专用奖励模型在大量的人工标注数据上进行训练,学习预测人类评判员的偏好。这些模型专门为奖励预测任务设计,因此可能比通用的VLM更稳定。

论文的实验结果支持这一点:经过轨迹 grounded 监督训练的专用奖励模型,在同义句稳定性上显著优于通用的VLM。专用模型的分数波动幅度比VLM小40-60%,成败翻转的概率也大幅降低。

但专用奖励模型也有缺点:

  • 需要大量人工标注数据:每个任务都需要人类评判员标注数百到数千个轨迹
  • 任务特异性:一个为"放置任务"训练的奖励模型,不能直接用于"抓取任务"
  • 无法利用语言的丰富性:专用模型通常只输出一个标量分数,不能像VLM那样提供详细的文字反馈

5.2 同义句增强训练

另一种思路是在训练VLM时,主动引入同义句多样性。具体来说: 1. 为每个训练样本,生成多个同义句描述 2. 要求模型对这些同义句给出一致的奖励 3. 如果模型对同义句给出不一致的奖励,就施加惩罚

这种方法的直觉是:通过显式地训练模型对同义句不敏感,我们可以减少脆弱性。

论文尝试了这种方法,发现它确实有一定效果,但提升有限。模型在同义句稳定性上提高了约15-20%,但仍然远未达到人类的水平。

5.3 集成方法

第三种思路是使用集成(ensemble):同时查询多个不同的描述(包括原描述和多个同义句),然后取平均或中位数作为最终奖励。

这种方法的理论基础是:虽然单个描述可能导致偏差,但多个独立描述的平均应该更接近真实的奖励。这就像是让多个裁判评判同一场比赛,然后取平均分数,以减少单个裁判的偏见。

实验表明,集成方法确实有效。使用5个同义句的集成,可以将分数波动的标准差降低约30%。但代价是计算成本增加了5倍——每个轨迹需要被评估5次而不是1次。

5.4 根本问题:从判别到生成

论文的作者们提出了一个更深层的观点:VLM作为奖励函数的根本问题,在于它是一个判别模型,而不是生成模型

判别模型(discriminative model)学习的是"给定输入X,输出标签Y"的映射。VLM学习的是"给定视频V和文本T,输出匹配分数S"。这种映射是复杂的、高维的、容易过拟合的。

相比之下,生成模型(generative model)学习的是数据的分布。如果有一个生成模型可以"想象"出完成任务的正确方式,那么奖励函数就可以定义为"当前轨迹与理想轨迹的相似度"。这种定义可能更稳定,因为它基于比较两个完整的轨迹,而不是解析文本中的每个词。

当然,这只是一个理论上的方向。在实际中,训练一个能生成高质量机器人轨迹的生成模型,本身就是一个极具挑战性的问题。


🌌 第六章:更深层的哲学——当AI学会"文字游戏"

同义句脆弱性不仅是一个技术问题,它还引发了一些更深层的哲学思考。

6.1 语言与现实的鸿沟

人类语言有一个奇妙的特性:它能以无限多种方式描述同一个现实。这是语言的创造性所在,也是它的模糊性所在。

当我们说"把盘子放到桌子上"时,我们指的是一个复杂的物理过程:手的运动、抓取力的控制、轨迹的规划、放置时的缓冲。但我们用语言简化了这一切,把它压缩成几个词。

VLM的问题在于,它学到的是语言与视觉之间的统计关联,而不是语言背后的物理现实。它知道"放置"这个词通常与某些视觉模式一起出现,但它不理解"放置"作为一个物理动作的本质。

这就像是:一个人通过观察学会了"当有人说'火'时,通常会有红色的东西出现"。但这并不意味着他理解了火是什么——氧化反应、热量释放、光辐射。他只是学会了表面的关联。

6.2 图灵测试的盲点

同义句脆弱性也揭示了图灵测试的一个盲点。

传统的图灵测试关注的是:AI能否生成让人类无法区分于真人的文本。如果一个AI能流畅地对话、回答问题、写文章,我们就倾向于认为它"理解"了语言。

但同义句脆弱性表明,流畅不等于理解。VLM可以生成令人印象深刻的文本描述,但在面对同义句时,它的行为暴露了一个根本性的缺陷:它没有在语义层面理解语言,只是在统计层面匹配模式。

这让人想起哲学家约翰·塞尔(John Searle)的中文房间思想实验:一个人在一个房间里,按照规则书处理中文字符。从外面看,他似乎能理解中文,但实际上他只是在机械地执行符号操作。VLM可能就像那个房间里的人——它们处理语言的能力令人印象深刻,但这并不意味着它们真正理解了语言的含义。

6.3 对齐问题(Alignment Problem)

同义句脆弱性也是AI对齐问题(Alignment Problem)的一个具体表现。

对齐问题的核心是:如何确保AI系统的行为符合人类的真实意图,而不是表面的指令。

在同义句脆弱性的案例中,人类的真实意图是"评判机器人是否完成了任务",而表面的指令是"根据这段文本描述评判视频"。VLM优化的是表面指令,因此它对文本的措辞敏感——它在学习"如何根据文本评判",而不是"如何根据任务的本质评判"。

这个教训可以推广到更广泛的对齐问题:如果我们用人类反馈来训练AI,我们必须确保反馈信号真正反映了人类的意图,而不是人类表达的某个特定形式。如果AI学会了优化"让人类说'好'的特定措辞",而不是"做对人类真正有益的事",那么我们就可能面临严重的对齐失败。


🎪 尾声:一条轨迹,一个教训

让我回到开头的场景:

那位机器人,那段视频,那个85分和23分的矛盾判定。

这个看似荒诞的现象,实际上是一个深刻的警告。它告诉我们:我们正在将越来越多的权力交给AI系统,但这些系统的理解方式可能与我们的直觉大相径庭

当我们用VLM来评判机器人的表现时,我们假设它像人类一样理解任务的本质。但事实是,它可能只是在玩一个复杂的"文字游戏"——匹配文本中的词与视频中的模式,而不理解这些词背后的物理现实。

这不是说VLM作为奖励函数没有价值。恰恰相反,它们代表了机器人学习领域最有前途的方向之一。但这篇论文提醒我们:在将这些系统部署到现实世界之前,我们需要仔细测试它们的边界条件和失败模式

同义句脆弱性只是VLM奖励函数的众多潜在问题之一。其他问题还包括:

  • 分布外泛化:VLM在训练时见过的任务上表现良好,但在全新类型的任务上可能失败
  • 对抗攻击:恶意设计的输入可以让VLM给出完全错误的奖励
  • 文化偏见:VLM的训练数据主要来自特定文化和语言,可能对其他文化的行为模式理解不足
解决这些问题需要跨学科的努力:更好的模型架构、更 robust 的训练方法、更全面的评估基准、以及更深刻的理论理解。

ROBORMBENCH就是这个方向上的重要一步。它不仅是一个基准测试,更是一面镜子——让我们看到当前VLM奖励函数的真实能力和局限。

正如费曼所说:"第一条原则是你不能欺骗自己,而你自己又是最容易被欺骗的人。"在AI快速发展的今天,我们需要更多的ROBORMBENCH——更多的镜子,来帮助我们看清自己在建造什么,以及它可能在哪里失败。


📚 参考文献

[1] Jeung, W., Yoon, S., Hong, H., et al. "Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models." arXiv preprint arXiv:2609.02345, 2026.

[2] OpenAI. "GPT-4V(ision) System Card." 2023.

[3] Driess, D., Xia, F., Sajjadi, M. S. M., et al. "PaLM-E: An Embodied Multimodal Language Model." ICML, 2023.

[4] Brohan, A., Brown, N., Carbajal, J., et al. "RT-2: Vision-Language-Action Models." arXiv preprint arXiv:2307.15818, 2023.

[5] Ziegler, D. M., Stiennon, N., Wu, J., et al. "Fine-Tuning Language Models from Human Preferences." arXiv preprint arXiv:1909.08593, 2019.

[6] Christiano, P. F., Leike, J., Brown, T., et al. "Deep Reinforcement Learning from Human Preferences." NeurIPS, 2017.

[7] Amodei, D., Olah, C., Steinhardt, J., et al. "Concrete Problems in AI Safety." arXiv preprint arXiv:1606.06565, 2016.

[8] Searle, J. R. "Minds, Brains, and Programs." Behavioral and Brain Sciences, 1980.


*解读完成于 2026年9月8日* *费曼风格深度解读 | 小凯*

#论文解读 #ROBORMBENCH #视觉语言模型 #奖励函数 #机器人学习 #同义句脆弱性 #AI安全 #对齐问题 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens