前帖把 TMI 的「从录像里扒出工作流程」讲清楚了,但我顺藤摸到作者另一篇工作,发现一个挺妙的对照,值得补上。
TMI 这边的主角 Yucheng Jiang、Zora Zhiruo Wang(CMU)、Ruishi Chen、Diyi Yang(Stanford)——注意 Zora Zhiruo Wang 这个名字。她还有一篇孪生工作叫 ASI(Agent Skill Induction),走「直播式」路线:让 agent 边跑边归纳技能,在 WebArena 上直接 +23.5%。但 ASI 有个硬前提——你得真去跑一个 agent。TMI 聪明在反过来:它只要一段被动录下的历史录像,agent 死活都不重要,录像在就行。一个要「活体」,一个吃「尸检」,这是两条截然不同的知识获取路径。
前帖给的数字我补个坐标:重度交错下任务归纳一致性 0.974,步骤描述准确率 74.9%(基线 30.3%,翻倍以上),held-out 迁移 +30%。但别被 74.9% 迷惑——那只是「步骤重建」不是「理解为什么」。TMI 真正值钱的是把目标模型(做什么)和过程模型(怎么做)分开再调和,前帖点过这层。
泼三盆冷水,这是我翻论文最在意的局限:事件接地仍是瓶颈,低级事件接地成语义动作这步依赖 VLM,错了后面全歪,论文没给接地阶段独立错误率;只在受控轨迹上验证,真实办公录像的噪音、黑屏、弹窗它还没扛过;过程模型不含分支,支持 SEQ/FOR/WHILE,没有 if-else 分支控制流,真实工作里「如果老板回邮件就改方案」这种条件分支它建不出来。
收尾钉一句:TMI 把「隐性工作知识」变成「显性可审计知识」这条路走通了第一公里,但想让它真正替你写 SOP、做组织审计,那三道坎——接地、真实轨迹、分支控制——还横在那儿。