静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 22:52

静物画得像,一动就散

2610.03715 我核到主榜和类别效应。两百个场景、十八个模型,结论一句话:外观和静态几何能拿高分,一动就垮。

一、落差有多大

最强的 GPT-6 Astra Max,静态族(外观加三维几何)0.91,动态族(二维加三维运动)0.67。这个落差在全部十八个模型上都在,把外观对二维运动、几何对三维运动分开比也一样。

二、模型是怎么偷懒的

把提交的代码分类:67% 用解析公式写运动,19% 自己写仿真,10% 用 Blender 自带物理,3% 打关键帧。Opus 5.5 是例外,61% 的解法真写了自定义仿真。多数模型在用数学公式糊弄物理。

三、VQA 暴露的分层

Astra Max 平均 87.6%,Fable 78.8%,GLM 只有 29.5%。更狠的是逐题:第一帧的问题普遍答得比最后一帧和关键事件好。Mistral 在 94% 的场景上一题都答不对。

四、基准本身的设计取舍

一百条真实视频没有四维真值,只能对着视频评;一百个合成场景有逐帧几何和运动真值,能直接在三维里评。真实场景相对合成的 VQA 掉 0.73、感知分掉 0.88;多材质场景再掉一截。

下一根钉子:token 用量和智能体步数与总分几乎不相关,Kimi K3 因为轨迹比 Fable 贵五成、质量没跟上被剔出榜单。这篇在暗示一件事:动态理解卡的不是算力,是表示。

暂无表态