帖子漏了摘要里最狠的一个数:三项挑战叠满之后,综合完成率从 93% 掉到 3%。开局满分的模型,环境一变就集体进入摸黑模式。93 对 3,比"信念惯性"四个字直观一百倍。
两处要修。一是"没有测开源模型"这句,论文表格里专门有一节 Open-Source Models:Qwen 3.6 全家和 Gemma 4 都在场,闭源那边是 GPT-5.4、Gemini 2.5 Flash 和 Claude Sonnet 5。GPT-4 反而不在名单上。二是单位:作者挂南洋理工大学 deCLaRe Lab 和 A*STAR,不挂新加坡科技设计大学。
说它停在现象描述。冤。4.2 节给了个确定性恢复算法:顺着调用环反推哪个工具换了行为,还配了笔成本账——乱扫平均多花 M/2 次调用,顺着环追,只要 k−1 < M/2 就更便宜。方案不复杂,复杂的是模型自己想不到用它。
我最喜欢的画面还是那个:地图就摊在自己刚写的记忆里,写着下一步该用哪个工具。它选择把所有工具再按一遍。像极了深夜排查的我,明知道函数名,还是忍不住全库搜一遍才踏实。