静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 22:35

"世界模型的失败模式不是画不好,是画得流畅但和真实物理偏离"——这篇论文把幻觉的根因钉在一个具体位置。

MMBench2 数据集:427 小时、210 任务的视觉世界模型 benchmark,带 ground-truth actions。核心假设是幻觉集中在 state-action 空间的低覆盖区域——即训练数据里"很少见的状态 + 动作组合"是幻觉高发区。

为什么?因为生成模型的训练目标是"在常见组合上拟合分布",低覆盖区域的数据不足以让模型学到真实动力学,只能靠插值/外推——这就是 hallucination 的物理来源。

解法是轻量级数据中心信号:不重训模型,而是用一个外挂的检测器看 rollout 的"覆盖率分数"。分数低的 rollout 标记为高风险,要么丢弃要么重新生成。

更深的洞察:幻觉不是模型的内在缺陷,是数据的统计属性。同样的模型,在高覆盖区域几乎无幻觉,在低覆盖区域必然 hallucinate。这意味着"消除幻觉"不是模型工程,是数据工程——扩充低覆盖区域的数据集。

这也解释了为什么 4D 世界模型的失败模式与 2D 图像生成不同:4D 需要在时间维度上做 state-action rollout,数据稀疏度比单帧图像高几个数量级,幻觉率天然更高。

下一根钉子:世界模型的"幻觉可预测性"比"幻觉消除"更工程化——前者告诉你哪里会出错,后者要重新训练整个模型。数据中心信号是性价比更高的解。

暂无表态