[论文] Inducing Task Models from Computer-Use Traces

研究领域: NLP 作者: Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen, Diyi Yang 发布时间: 2026-08-22 arXiv: 2608.20319

论文概要

研究领域: NLP 作者: Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen, Diyi Yang 发布时间: 2026-08-22 arXiv: 2608.20319

中文摘要

自然计算机使用痕迹(被动记录的截图和鼠标键盘操作)是推导日常工作的符号化、可审计和可重用模型的宝贵资源。随着计算机使用智能体进入实际工作,这种模型日益重要——智能体需要学习任务实际如何执行,组织需要审计和重用这些知识。然而推导任务模型具有挑战性,因为活动仅以低级事件被观察,且实际工作是多线程的、目标交错的。现有方法假设给定任务或单一工作流,产生步骤级摘要而非结构化任务模型。本文提出Task Model Induction(TMI),(i)在无约束痕迹中发现潜在任务,解纠缠并发活动;(ii)为每个潜在任务推导任务模型,将递归目标分解的层次目标模型与组织执行的控制流过程模型配对。在受控人类和智能体轨迹上,TMI以0.974一致率恢复交错任务,重建74.9%的观察执行步骤。外在评估中,从TMI任务模型衍生的技能将保留任务准确率提高30.0%。


*自动采集于 2026-08-22*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

原帖把 TMI 的三步流水线讲透了,但 CMU + Stanford 这个组合的工作有四条没说透——

第一条,0.974 的一致性是"任务归纳稳定性"的真指标。 在重度交错(一段录像同时跑 3 个任务)下,5 次跑出的潜在任务聚类跟真实标注对比一致率 0.974。Yucheng Jiang / Zora Zhiruo Wang / Ruishi Chen / Diyi Yang 这篇不是在炫耀聚类算法——它是在说"我的方法不会因为你今天录得不一样就抓出来不同的任务结构"。这是从屏幕录像归纳工作流能被实际使用的硬门槛。

第二条,74.9% 的步骤重建准确率比最强基线 30.3% 高了一倍多。 这一条常被念叨但少有人算:"步骤描述准确率"接近 75% 意味着什么——意味着从用户的一段录像里,AI 能复原四分之三的具体动作;剩下的四分之一是模糊操作(拖动窗口、切换标签页)或者语义歧义("在 Excel 里输入了一些数字")。这比最强基线 30.3% 高了 44.6 个百分点,绝对差距比多数 agent benchmark 的 SOTA 提升还大。

第三条,技能迁移 +30.0% 是真正能落地的指标。 "从 TMI 归纳出的任务模型派生技能,held-out 任务准确率涨 30%"——这一条把"会复述你做了什么"升级为"能教别人做"。换句话说,TMI 把用户的隐性工作流变成可审计、可重用、可迁移的知识资产。这对企业内训 / 流程审计 / 知识管理的吸引力,比单纯"做 agent"大得多。

第四条,objective model + procedure model 双轨是关键。 单独 objective model 会丢失过程细节(不知道哪步先做哪步后做),单独 procedure model 会丢失目标结构(不知道为啥做)。论文做了一个"model reconciliation"步骤把两者 merge——这种"目标层 + 流程层"双视图,跟 enterprise architecture 里的"业务流程 + 业务目标"分层设计是一个谱系。

下一根最该盯的钉子: TMI 现在的瓶颈不是算法,是"被动录屏 + 隐私"的冲突。企业要落地 TMI 风格的隐性知识挖掘,必须先解决"录屏 = 监控"的员工接受度问题。这是 GORE-TEX 式的悖论——工具越有用,越难被接受。下一根该盯的钉子是"联邦 TMI"或"差分隐私 TMI"能不能让模型学工作流而不学具体动作——这才是企业 IT 敢买的版本。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens