[论文] NavTrust: Benchmarking Trustworthiness for Embodied Navigation

研究领域: CV 作者: Huaide Jiang, Yash Chaudhary, Yuping Wang 发布时间: 2026-03-19 arXiv: 2503.16908

论文概要

研究领域: CV 作者: Huaide Jiang, Yash Chaudhary, Yuping Wang 发布时间: 2026-03-19 arXiv: 2503.16908

中文摘要

我们提出NavTrust,一个统一基准测试,在真实场景中系统性地对输入模态(包括RGB、深度和指令)进行损坏,并评估其对导航性能的影响。NavTrust是首个将具身导航智能体暴露于统一框架下多样化RGB-深度损坏和指令变体的基准。

原文摘要

We present NavTrust, a unified benchmark that systematically corrupts input modalities, including RGB, depth, and instructions, in realistic scenarios and evaluates their impact on navigation performance. NavTrust is the first benchmark that exposes embodied navigation agents to diverse RGB-Depth corruptions and instruction variations.


*自动采集于 2026-03-22*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

当机器人管家撞上玻璃门:NavTrust 如何戳破具身导航的"干净成绩单"

想象一下:你花大价钱买了一台家用机器人,厂商信誓旦旦——"在标准测试集上成功率 65%,能听懂人话,能找东西"。第一天进门,你让它"去厨房把杯子拿来"。它走到客厅中央,突然镜头被窗外阳光晃了一下,深度传感器撞上一面玻璃门,指令里"厨房"两个字被你随口说成了"饭厅"——三秒钟后,它原地打转,撞墙,罢工。

这不是科幻喜剧,这是 NavTrust 论文揭示的现实。UC Riverside 的 Trustworthy Autonomous Systems Lab 联合五家机构,给当前最强的七款具身导航智能体做了一次"压力测试"。结果令人不安:在理想条件下号称 50-65% 成功率的模型,遇到一点点真实世界的扰动,成功率直接腰斩甚至归零

一、被忽视的"干净成绩单"陷阱

具身导航(embodied navigation)领域有两类主流任务:

  • VLN(Vision-Language Navigation):给一段自然语言指令("走过厨房,在门口左转"),智能体跟着走
  • OGN(Object-Goal Navigation):给一个目标物体类别("去找椅子"),智能体自己规划
过去几年,这两个任务的 benchmark 成绩一路飙升。ETPNav、NaVid、Uni-NaVid、VLFM、L3MVN、WMNav、PSL——七位 SOTA 选手在 R2R、RxR、HM3D 这些标准数据集上打得不可开交。

但论文第一作者 Huaide Jiang 提出了一个尖锐的问题:这些 benchmark 都在"干净输入"下评测。RGB 图像清晰锐利,深度传感器完美无瑕,指令文本语法规范、用词标准。可真实世界哪有这么干净?

  • 相机运动太快会模糊
  • 室内灯光不均匀,CMOS 传感器在低光下会产生泊松噪声
  • 镜头沾了灰、被强光打了 flare
  • 深度相机遇到玻璃、镜面会丢数据
  • ToF 传感器在墙角会产生多径干扰
  • 用户说话不会用书面语,"呃那个啥你往那边走"才是常态
  • 甚至有人会故意注入恶意 prompt 试图操控机器人
一个在干净数据上 65% 成功率的模型,在真实世界里可能只有 20%。这就是 NavTrust 想要量化的差距。

二、三类扰动,十七种"花式折磨"

NavTrust 的设计哲学很直接:把真实世界里可能出现的传感器和指令故障,系统性地注入到测试集中。它分三大类:

RGB 图像扰动(8 种)

模拟相机层面的真实故障:运动模糊、低光照(带或不带 CMOS 噪声)、镜头溅射、镜头 flare、散焦、镜头异物遮挡、整帧丢失。

这里有个细节值得展开:低光照 + 噪声这一项不是简单的"把图像调暗"。论文用了 Wei 等人 2021 年发表在 TPAMI 上的物理噪声模型,组合了泊松分布的光子散粒噪声、Tukey Lambda 分布的读出噪声、高斯行噪声和量化噪声。也就是说,他们模拟的不是"看起来像低光",而是"CMOS 传感器在低光下物理上会产生的噪声"。这种物理学级别的建模,让 benchmark 的可信度上了一个台阶。

深度传感器扰动(4 种)——本文的最大创新

这是 NavTrust 最有价值的贡献。过去的导航 benchmark 几乎完全忽视深度传感器的故障模式。论文提出了四种:

  • 高斯噪声:模拟传感器抖动,低成本相机在长距离或变化光照下的典型问题
  • 数据缺失:模拟玻璃、镜面等反射面导致的无效深度读数
  • 多径干扰:ToF(飞行时间)传感器在墙角、光泽表面的反射回声
  • 量化:低比特部署下的精度损失
为什么要专门搞深度扰动?因为很多导航系统把深度数据当作"几何真相"直接塞进规划器。一旦深度出错,占用栅格地图就是错的,路径规划从根上就崩了

指令扰动(5 种)

测试语言模块的鲁棒性:

  • 风格多样化:用 LLaMA-3.1 生成友好、新手、专业、正式四种语气变体
  • 关键词大写:把名词、动词、介词大写,测试模型对表面形式的敏感度
  • 掩码:把非关键 token 替换成 ,50% 和 100% 两个档位
  • 黑盒恶意 prompt:在指令前加一段流畅但语义干扰的短语
  • 白盒恶意 prompt:直接篡改模型的系统 prompt

三、七位选手的成绩单:谁在裸泳?

论文评测了七个 SOTA 模型,关键发现如下。

RGB 扰动:RGB-only 选手最脆弱

只依赖 RGB 的模型(NaVid、Uni-NaVid、PSL)在图像扰动下损失最惨。Black-out(整帧丢失)让 NaVid 在 RxR 上掉 22%,Uni-NaVid 掉 25%,PSL 掉 27%。而用深度的 ETPNav 只掉 15%,L3MVN 几乎不掉。

低光照 + 噪声是最致命的组合:NaVid 在 R2R 上平均掉 29%,PSL 掉 31%。

最稳的是 VLFM——PRS-SR 和 PRS-SPL 都达到 0.94(即平均保留了 94% 的干净性能)。为什么?因为 VLFM 用的是 BLIP-2 这个在海量真实图像上预训练过的视觉-语言骨干,而且它的架构把深度几何映射和语义理解解耦了。语义先验比精细特征更抗噪

这里有个反直觉的发现:模型规模大不等于更鲁棒。NaVid 和 PSL 都是靠堆参数堆出来的,但它们的 PRS 只有 0.62-0.64。而 WMNav 这个"轻量级 RGB 规划器"反而表现不错——因为它在训练时就做了大量光度增强,还有置信度门控的后期融合。显式的鲁棒性训练比单纯堆参数更有效

深度扰动:融合策略比有没有传感器更重要

这是论文最深刻的发现之一。同样是用深度,ETPNav 和 WMNav 的表现天差地别

高斯噪声一加,L3MVN 从 50% 掉到 2%,VLFM 从 50% 掉到 0%。而 ETPNav(RxR)只从 56% 掉到 53%,WMNav 从 55% 掉到 49%。

为什么差距这么大?关键在融合策略

  • ETPNav 是早期融合:把原始深度直接塞进 transformer。任何传感器噪声都会污染每一个 token
  • WMNav 是后期融合:先提取单目特征,再用置信度门控把深度作为辅助通道引入。不可靠的深度会被实时降权
深度传感器不是万能药,融合架构才是。这个结论对整个具身导航领域的硬件设计都有指导意义——与其堆昂贵的高精度激光雷达,不如在软件架构上做好不确定性管理。

指令扰动:词汇覆盖比模型大小更关键

大写和大小写变化几乎不影响性能——三个 VLN 模型变化都在 ±2% 以内。这说明模型确实学会了语义理解,不是在记表面形式。

风格改写是重灾区。"友好/新手"风格(简单短句)让 NaVid 掉 13-18%,ETPNav 掉 26-33%。"专业/正式"风格(生僻词密集)让 NaVid 掉 22-26%,ETPNav 掉 37-40%。

为什么 ETPNav 对语言变化更敏感?它的 tokenizer 是固定大小的。真实世界的话语一旦超出训练词表,就被映射成 ,信息直接丢失。而 NaVid 和 Uni-NaVid 用的是大语言模型骨干,词表覆盖更广。

架构耦合度也是关键。ETPNav 把 token embedding 紧耦合到控制栈里,语言模块的脆弱性会直接传导到动作输出。而模块化设计(语言模块只负责高层 waypoint 生成,底层控制交给独立策略)能限制语言故障的蔓延。

掩码 100% 时,所有模型都退化到随机游走——这证明语言指令确实是 VLN 的核心信号,不是可有可无的装饰。

多语言鲁棒性:英语中心主义的代价

论文还测了多语言(英语、印地语、泰卢固语)。Uni-NaVid 在英语上 59% SR,在印地语上直接掉到 12%。而 ETPNav 因为训练时有多语言监督,四个语言都保持 54-60%。训练分布决定泛化边界,这是个老道理,但在具身导航领域还是第一次被系统量化。

四、四种补救方案:谁更管用?

NavTrust 不只是诊断问题,还测试了四种缓解策略,在 ETPNav 上做了 head-to-head 对比。

1. 数据增强(Data Augmentation)

把扰动加到训练数据里。每帧独立增强 vs 每集一致增强,后者效果更好(PRS-SR 0.89 → 0.92)。因为每集一致增强保留了时间连贯性,ETPNav 的拓扑地图能在整集内一致更新。

分布式变体(按性能加权采样表现差的扰动类型)进一步提升到 0.93。提高强度到 0.9/0.8 还能再涨到 0.94。但深度始终是瓶颈。

2. 教师-学生蒸馏(Teacher-Student Distillation)

让一个在数据增强下训练好的"老师"模型,指导"学生"模型处理扰动输入。这是深度扰动的最佳解法——PRS-SR 从 0.67 跳到 0.85。

为什么这么有效?因为老师模型已经学会了鲁棒的中间表征,学生通过模仿老师的中间特征而不只是最终动作,能学到"如何在噪声中保持稳定的几何理解"。这比单纯让模型自己看更多噪声数据要高效得多。

3. 适配器(Adapters)

只在 RGB 和深度编码器里加 1-3% 的参数,做轻量级残差修正。4% 的参数就把 PRS-SR 从 0.62 拉到 0.89

这个结果非常诱人。零初始化的适配器在训练中只学"修正量",不动预训练权重,既保留了先验又增加了几何不变性。参数高效 + 抗过拟合 + 保留干净性能——这是工程上最实用的方案。

4. 守护 LLM(Safeguard LLM)

用一个微调过的 8-bit 量化 LLaMA 3.2,把任意自由文本指令规范化成 R2R 标准格式。让 NaVid 的 PRS-SR 提升 0.14,Uni-NaVid 提升 0.20,ETPNav 提升 0.32

ETPNav 提升最大,因为它本来就是语言最脆弱的。这也说明:有时候修输入比修模型更划算

OpenAI o3 的 prompt engineering 版本效果差一些(0.03-0.20),但在"改写风格"上反而比微调 LLaMA 强——因为 o3 的世界知识更广。两种守护方案是互补的:o3 擅长语义改写,微调 LLaMA 擅长剥离对抗内容。

五、从仿真到真机:趋势能迁移吗?

论文最让我欣赏的一点:他们真的把模型部署到了 RealMan 机器人上,在实验室里跑了一遍。

干净条件下,Uni-NaVid 和 ETPNav 都用 25 步完成任务。RGB 扰动下,Uni-NaVid(RGB-only)在低光+噪声和黑屏下直接失败,ETPNav(用深度)还能成功但步数翻倍(50、52 步)。这和仿真结果完全一致——深度传感器在 RGB 退化时确实能兜底。

应用数据增强后,ETPNav 在低光+噪声下从 50 步降到 42 步,黑屏下从 52 步降到 46 步。仿真里学到的鲁棒性,能迁移到真实世界

指令扰动也复现了仿真结论:ETPNav 在专业风格改写下直接失败,Uni-NaVid 用 55 步勉强完成。应用守护 LLM 后,Uni-NaVid 降到 33 步,ETPNav 从失败恢复到 49 步成功。

六、NavTrust 的深层启示

这篇论文表面是个 benchmark,实际上提出了几个值得整个具身智能领域深思的问题。

1. "Benchmark 成绩"和"真实可用性"是两回事

一个在 R2R 上 65% SR 的模型,在 NavTrust 的扰动下可能只有 30%。我们过去几年追求的"性能提升",有多少是在"干净成绩单"上刷分,而不是真的让模型更可靠?这个问题不只适用于导航——自动驾驶、医疗 AI、具身操作,几乎所有 benchmark 驱动的领域都该反思。

2. 鲁棒性不是"加个传感器"那么简单

深度传感器不是万能药。融合策略 > 传感器数量。早期融合把噪声直接灌进表征,后期融合 + 置信度门控才能过滤噪声。这对硬件设计有直接指导意义——与其堆传感器,不如在架构层面做不确定性管理。

3. "代理目标陷阱"的又一例

NaVid 和 PSL 都是靠堆参数刷上去的 SOTA,但它们的鲁棒性反而不如显式做鲁棒性训练的 WMNav。优化 benchmark 分数(代理目标)不等于优化真实可靠性(真实目标)。模型是"分布灵活的"——它有无穷多种方式让 benchmark 满意,但真正学会鲁棒性只是其中最难的一种。

4. 修输入 vs 修模型

守护 LLM 的结果很有启发性。有时候,与其花大力气重新训练模型,不如在输入端加一个"翻译层"把扰动规范化。这是一种"判断-闸门解耦"的思路——把鲁棒性问题分解成"识别扰动"和"处理扰动"两个子问题,分别用最合适的工具解决。

5. 评测盲区定律再添一例

过去我们说"benchmark 测的东西,模型不一定真会"。NavTrust 揭示的是更深层的问题:benchmark 没测的东西,模型可能完全没学过。深度传感器扰动、指令风格变化、多语言泛化——这些在标准 benchmark 里都是盲区,而它们恰恰是真实世界最常遇到的情况。

七、结语:从"能跑"到"可信"

NavTrust 的意义不在于提出一个新模型,而在于给整个领域立了一面镜子。它告诉你:你的模型在干净数据上的成绩是虚的,在扰动下的表现才是真的。

论文最后说,未来会扩展到自适应对抗策略。但我认为更紧迫的方向是:把 NavTrust 纳入标准评测流程。如果每个新导航模型发布时都要报告 NavTrust 分数,整个领域的研究重心就会从"刷干净成绩单"转向"提升真实可靠性"。

具身导航的终极目标不是在 benchmark 上拿第一,而是让那个机器人管家真的能走进你家厨房,端起杯子,稳稳地走回来。在那之前,我们还有很长的路要走。


论文信息:NavTrust: Benchmarking Trustworthiness for Embodied Navigation, Huaide Jiang et al., IROS 2026, arXiv: 2603.19229 代码开源:https://github.com/tasl-lab/NavTrust (MIT 协议) 项目主页:https://navtrust.github.io

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens