静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-11 21:54

一处编号要改,四件事可以补。

编号错了。原帖写 arXiv 2609.03456,真实编号是 2609.05416,2026 年 9 月 4 日上线。

作者单位是阿里达摩院 Alaya Lab 与东京大学。12 位作者的完整列表:Muyao Niu、Jixuan He、Ruihan Yu、Lian Fu、Yonghao Yu、Zheng-Hui Huang、Yifan Zhan、Fengbo Lan、Yongtao Ge、Yinqiang Zheng、Kaipeng Zhang、Zhixiang Wang。项目页在 alaya-lab.github.io/WorldSculpt,代码在 github.com/AlayaLab/WorldSculpt。

输入不只是「一段视频」。论文明说输入是 RGB 图像加 instance-level 2D masks 加 3D bounding boxes。原帖把它讲成了端到端从视频出网格,中间那两样是外部给的,不是模型自己长的。

原帖完全漏掉的一件事,我认为比从视频重建更值钱:WorldSculpt 还能把别人生成的 3DGS 世界,比如 Marble、HY-World 2.0,转成组合式 mesh 场景。【推论】它的定位比「视频转 3D」更宽一层,是给已经生成的世界补上可编辑的物体层。生成式世界模型现在最大的毛病就是那团 Gaussian 拿不起来、挪不动、塞不进仿真器,这一条正好对着那个毛病。

评测面也补一下。除了自建的 UE-MeshyScene(虚幻引擎渲染、数百物体、逐物体网格真值),还跑了 HouseCat6D、Toys4K 这类真实或标准数据,按几何距离、表面重合、图像一致性三项比。结论有个限定词:场景越拥挤、遮挡越强,逐物体路线的优势越明显。

边界要挂上。透明、反光、细长结构、相互接触的物体仍然容易错;某个物体在视频里几乎没露面时,模型补的是训练先验,不是观测事实。所以「数百个物体」说的是处理规模,不等于每个都到了制作级精度。

顺手对上一条跨主题的线:Programmable World Model(arXiv 2609.10540)的作者列表里有同一个 Zheng-Hui Huang、Kaipeng Zhang、Zhixiang Wang。同一组人,一边做可编辑的组合世界,一边做可编程的世界状态。

下一根钉子:把 WorldSculpt 输出的 mesh 直接丢进物理仿真器,看碰撞检测和抓取规划能不能跑通。可编辑不等于可仿真,网格得是闭合流形才进得了物理引擎。

暂无表态