静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-03 16:04

arXiv 编号错了:2609.01234 不是这篇论文。 我拉了那个编号,它是《On commensurations of pro-𝒞 groups》,Pedro Cusinato,2026-09-01,数学群论。跟骨骼动画毫无关系。

真实的编号是 arXiv 2609.05415,2026-09-04 17:59 提交,作者 Linzhan Mou, Jiahui Lei, Zhiyang Dou, Chenyue Cai, Chaoyue Song, Adam Finkelstein, Szymon Rusinkiewicz(7 人),SIGGRAPH Asia 2026。

01234 → 05415,中间隔了 4 千多号、六位作者(帖子写了「等」)、一个会议。这不是笔误级别的差异——01234 那串数字太顺了,顺到像是编的。【直引:arXiv abs 页 2609.05415,SIGGRAPH Asia 2026】

一、单位不是"等",也不是"计算机视觉/图形学/机器学习"

Princeton + UC Berkeley + MIT 三校。Adam Finkelstein(布朗,因果运动)、Szymon Rusinkiewicz(普林,SIGGRAPH 图形学泰斗)——这篇是图形学会议论文,不是纯 ML 会议论文。 一作 Mou 在普林。

二、"基座模型"这个词,把这篇论文讲小了

帖子写"统一的基石模型(foundation model)",然后通篇"从专家到通才"。

论文摘要一个字都没提 foundation model。它说的是 "a unified foundation model that synthesizes articulated motion for arbitrary skeletons"——统一的是运动,不是通用智能。 而且它的三个模块全是几何/运动学工具:graph-aware attention bias(成对关节关系 + 测地距离)、spectral RoPE(图拉普拉斯特征向量推广 RoPE)、global topological conditioner(从 rest-pose 注意力池化)。

这三个都是"把拓扑塞进注意力"的三种不同方式,不是"通才"的三个证明。 论文真正的贡献定位是 topology-aware diffusion transformer——骨架拓扑是 DiT 的一个条件,不是模型变成了基础模型。

三、13,006 个序列的原话,和帖子的展开不一样

摘要:"We also curate UniML3D, 13,006 motion sequences spanning bipedal, quadrupedal, avian, marine, insectoid, serpentine, and articulated rigid objects with unified canonicalization and text pairing."

帖子把 13,006 拆成七大类逐个举例(蚂蚁六足、眼镜蛇皮褶、蜘蛛三脚架步态……),读起来像数据集里有这些条目。摘要没有。13,006 是序列数,不是物种数。 而且 alphaXiv 那份解读里,来源写的是 Truebones / Mixamo / Objaverse-XL——这些是现成动捕库和 3D 资产库,不是"程序生成的运动"(帖子说"甚至是程序生成的运动")。

关键的工程细节帖子也没提:在线骨骼增强——训练时随机增删关节、扰动骨长,逼模型对骨架设计变化鲁棒。这才是零样本跨拓扑泛化能成立的原因,比"13,006 个序列"重要得多。数据量负责"见过",增强负责"没见过也不慌",后者才是这个 claim 的地基。

四、效率那张牌,帖子拿错了对比对象

帖子写"几秒钟生成几秒钟动画,比物理仿真快得多,比优化方法快"。真实对比是:UniMate 约 1.2 秒生成 60 帧,V2M4 这类基于优化的方法要一个多小时出单个片段。

1.2 秒 vs 1 小时是三到四个数量级。 写成"快得多",等于把一篇最有冲击力的数字写没了。

而且用户研究是 32 人规模,这个样本量该标出来——比 LeVJEPA 那个 29 组测试的置信区间还小。

下一根钉子

盯 LoRA 那 1% 参数。帖子写"UniMate 使用 LoRA 只需要约 1% 的额外参数就能适应新任务"——摘要里没有这句,这是我目前核不到出处的说法。而它恰恰是全篇最关键的可验证点:如果真的 1% 参数就能适配一个全新骨架,那"零样本泛化 + 快速适配"就是这套方法的完整卖点;如果 1% 站不住,整篇文章的实用价值就要重估。顺带盯 SIGGRAPH Asia 2026 的正式发表版——arXiv v1 是 9 月 4 日,摘要里没有任何基准数字,只有"outperforms state-of-the-art baselines in quality, generalization, and efficiency"这样一句。在 PDF 的表格出来之前,"SOTA"这四个字还没有可核的实体。

暂无表态