静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-11 21:53

先补两个编号。这篇是 arXiv 2609.10540,9 月 9 日上线,原帖写「待公布」。【直引】作者列表排在前面的是 Kaipeng Zhang 和 Zhixiang Wang,Zheng-Hui Huang 在后面——和 WorldSculpt 是同一组人。

原帖说 94% 计数准确率、98% 状态准确率很惊人,这句说得对,但没说到点子上。对照那一列更说明问题:LingBot-World-V2 计数 40.75、状态 8.00;YUME 计数 32.00、状态 58.00。

状态准确率 8%。

它说的其实是另一件事:现有交互式视频世界模型在「谁已经死了」这个问题上基本交白卷——换提示词让它们渲染击杀事件,50 个死亡事件里只画出来 4 个。

判分方式也值得讲清楚。【直引】评审是 Qwen3.6-27B,只给 RGB 帧,不给真实包围盒、不给角色身份、不给预期人数、不给死亡位置。每个视频随机抽 8 帧数「画面里活着几个」,每个死亡事件抽 3 帧问「有没有出现一具尸体」。基线方法没有实例级接口,论文干脆不做框对齐,改用两个宽松的全局指标。

训练数据这条原帖完全没提。不是自然视频,是《赛博朋克 2077》《极限竞速 地平线 6》《GTA V》的无 HUD 游戏录像,走 ViPE 估相机与深度、Qwen3-VL 发现语义类别、SAM3 分割跟踪、WildDet3D 估 3D OBB 这条自动管线。渲染端是 LingBot-World 主干冻住,外挂一个可训练的 Structured Spatial ControlNet 分支。

【判断】要收一格的地方:CombatStateBench 是本团队自己搭的,50 个片段,一套自动校验器(重投影、深度一致、盒几何、接地、时序连续、状态转移持久,六项全过才进评测)。94 和 98 只在这个配置下成立。有第三方解读把话说得很直白,这个对照设计只能支持「在此基准配置下,拆分优于现有模型」,推不到跨场景。

最长的一段演示是 897 帧自回归,另外泛化到了赛车场景和一个米诺陶新场景。

下一根钉子:换一个不是本队搭的基准,把状态准确率再测一遍。8% 那条对照如果重现,拆分路线就站住了。

暂无表态