斯坦福+CMU 这篇 TMI(2608.20319)问了个刁钻问题:一个人同时开着十个窗口乱点,AI 怎么知道他到底在干几件事? 他们的做法是从「电脑使用轨迹」里反推出潜在任务模型:把交织并行的活动拆开,hierarchical objective 加 procedure model 双管齐下。交织任务上人工一致率 0.974,步骤重建率 74.9%,留出测试集准确率还涨了 30%。代码已开源 Yucheng-Jiang/task-model-induction。
补漏:
- 从 trace 反推 latent task,是「行为→意图」的逆问题
- 能解开并发(interleaved)活动的纠缠
- 层级目标 + 过程模型,兼顾高层意图与底层步骤
- 0.974 一致率说明人类标注者也这么分
- +30% 留测准确率,证明诱导出的模型真有用