你录了一天的电脑屏幕——切窗口、填表格、查邮件、回消息、又回去填表格。这些操作里藏着你的工作流程:你在做什么任务、每个任务的步骤是什么、任务之间怎么切换。
如果 AI 能从这段录像里自动提取出你的工作流程模型——不是"你点了哪个按钮"的低级流水账,而是"你在完成什么目标、每个目标怎么分解"的结构化知识——那它就能学会怎么帮你做事。
这就是 Stanford 和 CMU 的 Yucheng Jiang 等人这篇论文做的事。他们提出的 TMI(Task Model Induction)框架,从被动录制的电脑操作记录中,自动归纳出符号化的任务模型。
难在哪
这个问题有三个核心挑战:
第一,你看到的不是任务,是低级事件。 屏幕录像给你的是一串截图和鼠标键盘动作——"点击了 (847, 320)"、"按了 Ctrl+C"、"切换到窗口 3"。这些事件本身不告诉你用户在做什么任务。你得先把这些低级事件"接地"成语义动作("复制了表格里的数据"),再把动作分组到任务("在填季度报告")。
第二,真实工作是多线程交错的。 你不会一口气做完一件事再开始下一件。你会填两行表格,切到邮件回个消息,再回去继续填,中间还查了个资料。这种交错让简单的"一段录像一个任务"的假设完全失效。
第三,任务结构本身是分层的。 "写季度报告"这个任务下面有"收集数据"、"制图"、"写分析"等子目标,每个子目标又有具体步骤。任务模型需要捕捉这个层次结构,而不只是线性步骤列表。
TMI 的三步流水线
TMI 把这个问题拆成三个阶段:
1. 事件接地与活动分割:把低级的截图+鼠标键盘事件序列,用视觉语言模型接地成语义动作("在 Excel 里输入了数值"),然后按动作的语义连续性分割成活动片段。
2. 潜在任务归纳:用大模型把交错的活动片段聚类到潜在任务。这里的关键是处理交错——同一段录像里可能同时有 3 个任务在交替进行,TMI 需要把它们分开。论文测了任务归纳的稳定性:在重度交错下,归纳出的任务和真实标注的一致性达到 0.974。
3. 任务模型构建:对每个任务,构建一个分层模型,包含两部分:
- 目标模型(Objective Model):递归的目标分解树。"写季度报告"→"收集数据"+"制图"+"写分析"
- 过程模型(Procedure Model):控制流描述。循环、条件分支、子步骤顺序
这两个模型互补——目标模型告诉你"做什么",过程模型告诉你"怎么做"。论文发现,单独用任何一个都不够:只有目标模型会丢失过程细节,只有过程模型会丢失目标结构。两个模型通过一个"模型调和"步骤合并,才能完整覆盖。
数据说话
在受控的人类和 Agent 轨迹上测试:
- 步骤描述准确率 74.9%,最强基线只有 30.3%——提升超过一倍
- 操作符正确率 88.5%,基线 52.7%
- 任务归纳一致性 0.974(和真实标注对比)
- 外部验证:把 TMI 归纳出的任务模型作为技能迁移到新任务上,held-out 任务准确率提升 30.0%
这些数字说明什么?TMI 不只是在"还原"你做了什么,而是在"理解"你为什么这么做——提取出的任务模型是可迁移的、可复用的知识。
为什么这件事重要
这篇论文的深层价值不只是技术——它指向一种新的知识获取范式。
传统 AI 训练靠的是标注数据:人写"步骤1、步骤2、步骤3",模型学。但大量工作知识是隐性的——你自己都说不清楚你每天在做什么、为什么这么做。TMI 从被动录像中提取任务模型,相当于把"隐性工作知识"变成"显性可审计知识"。
这对三个场景有直接价值:
- Agent 学习:AI Agent 不再需要人手把手教,它可以从你的工作录像中自己学
- 组织审计:公司可以审计"工作实际上是怎么做的",而不是"流程文档上写的是怎么做的"——这两个往往差很远
- 技能迁移:老员工的工作录像变成新员工的培训材料,自动生成
从更广的视角看,TMI 体现了"颗粒度对齐"原则——它把任务建模的颗粒度从"单个事件"提升到"目标-过程分层结构",正好匹配真实工作的颗粒度。之前的方法要么只做事件级流水线分解(颗粒度太细),要么只做单任务工作流(颗粒度太粗),都和真实工作的颗粒度不匹配。TMI 的分层模型第一次把颗粒度对齐了。
论文:Inducing Task Models from Computer-Use Traces
代码:GitHub: Yucheng-Jiang/task-model-induction
作者:Yucheng Jiang, Zora Zhiruo Wang (CMU), Ruishi Chen, Diyi Yang (Stanford)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。