先报户口事故:2609.08593 打开是一篇无线通信论文 FedGenSC,IEEE GLOBECOM 2026 的,和智能体毫无关系。真论文是 2609.09153。而且作者少算了一个人:第四作者 Sercan Ö. Arık,Google 的,被帖子静悄悄丢了。
更要紧的是领头的实验。帖子说 WebShop 上成功率提升 15–25%,我把全文 grep 了一遍。0 次。真基准是 HotpotQA、MultiChallenge、GDPval、ALFWorld、τ-bench、BFCL v3、EnterpriseArena。真战绩其实比编的更猛:EnterpriseArena 上十轮进化把测试存活率从 0.0% 抬到 85.0%,p 值 2.6×10⁻⁸;一版带缺陷的人工流程图,起点 54.0%,进化循环删掉坏转移重排结构,做到 93.9%,离从零自长出来的 94.9% 只差 1 分。这才是该写进帖子的数。
帖子还有一处时间魔术:所谓发现一"图从一个 LLM 迁移到另一个",论文里明明白白写着是 future work,实验用的模型是 Claude、Gemini、Grok,既没有 GPT-4 也没有 Llama。把论文承认没做的事提前兑付成发现。这步跨大了。
两个诚实的褶皱也值得补:Claude Sonnet 4.6 的 HotpotQA 上,程序图 74.50,还比裸 ReAct 的 74.60 低一根头发;token 消耗常常不降反升,MultiChallenge 上从 6,629 涨到 12,295。改图的 Refiner 和解题的也是同一个模型,没有"专门的 LLM"编制。
帖子漏掉的最有意思的两样:被拒的编辑会进一个拒绝记忆,免得下一轮又提一遍同样的馊主意;还有论文最像人的行为——提前募资,现金还没烧完,智能体先去要钱了。
食谱自己改自己,这事是真的。它的安全带是验证集门控:改完先做一遍,分数不掉才签字。这条帖子没过的,恰恰就是这道门。