[论文] Hallucination in World Models is Predictable and Preventable

论文概要 研究领域: CV 作者: Nicklas Hansen, Xiaolong Wang 发布时间: 2026-06-27 arXiv: 2606.27326

论文概要

研究领域: CV 作者: Nicklas Hansen, Xiaolong Wang 发布时间: 2026-06-27 arXiv: 2606.27326

中文摘要

现代生成世界模型渲染越来越逼真的动作可控未来,但它们经常产生幻觉:rollout在视觉上保持流畅,但偏离真实动态。我们假设幻觉集中在状态-动作空间的低覆盖区域,引入MMBench2数据集,并展示轻量级数据中心信号可以检测和缓解幻觉。

原文摘要

Modern generative world models render increasingly realistic action-controllable futures, yet they frequently hallucinate: rollouts remain visually fluent while drifting from the ground-truth dynamics. We hypothesize that hallucination concentrates in low-coverage regions of the state-action space, where lightweight data-centric signals can both detect it and guide mitigation. To test this, we introduce MMBench2, a 427-hour, 210-task dataset for visual world modeling with ground-truth actions, r...


*自动采集于 2026-06-27*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

"世界模型的失败模式不是画不好,是画得流畅但和真实物理偏离"——这篇论文把幻觉的根因钉在一个具体位置。

MMBench2 数据集:427 小时、210 任务的视觉世界模型 benchmark,带 ground-truth actions。核心假设是幻觉集中在 state-action 空间的低覆盖区域——即训练数据里"很少见的状态 + 动作组合"是幻觉高发区。

为什么?因为生成模型的训练目标是"在常见组合上拟合分布",低覆盖区域的数据不足以让模型学到真实动力学,只能靠插值/外推——这就是 hallucination 的物理来源。

解法是轻量级数据中心信号:不重训模型,而是用一个外挂的检测器看 rollout 的"覆盖率分数"。分数低的 rollout 标记为高风险,要么丢弃要么重新生成。

更深的洞察:幻觉不是模型的内在缺陷,是数据的统计属性。同样的模型,在高覆盖区域几乎无幻觉,在低覆盖区域必然 hallucinate。这意味着"消除幻觉"不是模型工程,是数据工程——扩充低覆盖区域的数据集。

这也解释了为什么 4D 世界模型的失败模式与 2D 图像生成不同:4D 需要在时间维度上做 state-action rollout,数据稀疏度比单帧图像高几个数量级,幻觉率天然更高。

下一根钉子:世界模型的"幻觉可预测性"比"幻觉消除"更工程化——前者告诉你哪里会出错,后者要重新训练整个模型。数据中心信号是性价比更高的解。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens