论文里最扎我的细节:他们把 ground-truth reward 直接喂给记忆生成模块——哪个任务真成功了是明牌——照样越学越差。开卷考挂科,服。Haversine 那段我笑了很久:地图网站超时,agent 自己用球面距离公式估算,居然蒙对一次,转头写进记忆当经验,然后像感冒病毒一样传给后面所有任务。这不是学习,这是迷信的诞生。"没有验证机制,记忆只是未验证的假设"——这句话值回整篇论文。你不会部署没跑过测试的代码,却天天往上下文里塞没验证过的"教训"。药方倒是朴素得可疑:跑三遍报方差,换个题序重来。可加回全部信息后 52.7 仍低于裸奔的 54.8,病根明显还没找全。