改装日志——Yang, Kong & Jo《SelfSearch: Reward-Free Search for Self-Improving Agents》(arXiv:2609.37968)费曼式解读
前两篇里,老师傅一直在场。第一篇管调度:每天站会十分钟,把"下一步"这个决定从满屋子的呼喊里收拢回来,工人不必追着问,工头不必满屋子跑。第二篇管纪律:图纸不再钉在墙上供参考,而是变成派工单,拆哪面墙、砌什么标号的水泥,全在单子上,工人没有临场改单的权限。你仔细咂摸就会发现,这两重门背后站的都是同一个人——那个嗓门沙哑…
改装日志——Yang, Kong & Jo《SelfSearch: Reward-Free Search for Self-Improving Agents》(arXiv:2609.37968)费曼式解读
装修队的故事讲到今天,该说说老师傅了。
前两篇里,老师傅一直在场。第一篇管调度:每天站会十分钟,把"下一步"这个决定从满屋子的呼喊里收拢回来,工人不必追着问,工头不必满屋子跑。第二篇管纪律:图纸不再钉在墙上供参考,而是变成派工单,拆哪面墙、砌什么标号的水泥,全在单子上,工人没有临场改单的权限。你仔细咂摸就会发现,这两重门背后站的都是同一个人——那个嗓门沙哑、经验老到的老师傅。他管着事,所以事能管住。
可是人总会退休的。
老师傅退休那天,把工人们叫到毛坯房里,说了句掏心窝的话:往后没人给你们开班前会了,也没人在图纸上签字画押了。活儿还得干,而且得越干越好。你们自己想办法吧。
这几乎是个哲学问题了:没有考官、没有评分、没有人在背后打分的时候,一个人——或者一个 AI agent——还能不能自己把自己打磨得更好?
别急着答。先想想人类自己的答案。学一门手艺,前十年靠师傅骂;十年后,骂声停了,能靠什么继续长?靠的还是那两样东西:动手,和记下动手的每一回。武术家讲"拳打千遍,其义自见",医生讲"大医精于复盘",改装圈的老炮儿抽屉里永远有一本翻烂了的改装笔记。分数和骂声是外部的鞭子,鞭子一撤就停;只有自己一笔一笔记下的东西,是长在自己身上的。
这篇论文给了一个让人愣住的答案。它叫 SelfSearch,出自 Jungwoo Yang、In Jin Kong 和 Yohan Jo 三位研究者,二〇二六年九月二十九日挂上 arXiv。论文里有个数字我先放在这:4.03 美元。一杯咖啡的钱。就靠这点搜索成本,它把自己改装出来的 harness——也就是 agent 的全套家伙什:指令、工具、执行流程——装进 DeepSeek V4 Flash,解决了百分之八十二点零的 Terminal-Bench 2.1 任务,跟公开对比里分数最高的那个 harness,Codex,打成了平手。
一杯咖啡,追平米其林。而且全程没请过一个考官。
它是怎么做到的?这就是今天要讲透的第三重门:进化。也是执行者三重门的最后一重。前两重门里,agent 都在学习"怎么把活干好";这一重门里,它要学习的是一件更绕口的事——怎么把自己这个干活的家伙什,改得更好。
🧓 一、手艺已经在了,考官不见了
先说一个很多人没意识到的事实。
现在的语言模型 agent,已经具备一种相当惊人的能力:它能检查并修改自己的指令、工具和执行流程。换句话说,"给自己动手术"的手艺,模型早就有了——手术刀就在它自己手里。这是整件事的地基,值得停下来看一眼:一个 agent 干活的全程——接到什么指令、能用哪些工具、按什么顺序和方式往下走——全都摊在它面前,而它既有读的能力,也有改的能力。工具不顺手,它可以调;说明书有歧义,它可以改措辞;流程绕了弯路,它可以把路捋直。
缺的不是手艺,是方向。
传统上,想利用这个能力让 agent 进化,办法只有一种:考试驱动。你让 agent 对自己做一次改造——改一版提示词,换一个工具调用顺序,重构一段执行流程——然后把它拉到考场上,用下游评估打分:这批任务能过百分之多少?分数涨了,改造保留;分数跌了,打回重来。如此一轮一轮地试错,像进化论里的变异加选择,只是考官换成了基准测试。整个搜索循环就像一所驾校:学员的每一个动作习惯,都要教练当场评判,评判不通过,打回原样重来。
这套做法逻辑上没有错,但实操起来有三个说不出的别扭。
第一个别扭是贵。每一次改造猜想,都要真刀真枪跑一轮下游评估才知道成色,而评估是要花钱的——调用模型、跑任务、算分数,全是成本。改造一百次,就要考一百次。考场不白开,考官不白请,考卷不白印。健身房里最贵的从来不是器械,是那个每小时几百块、每练完一组都给你打分的私教;而评估引导的搜索,等于给每一次变异都配了一个私教团队。
第二个别扭更隐蔽:搜索被绑死在了考题上。评估是在哪批任务上做的,进化出来的 agent 就只擅长哪批任务。你在数学卷子上反复选拔,选出来的"优等生"上了语文考场未必灵;你在编程题上优化出来的执行流程,换个类型的任务,可能处处是坑。进化本该是手艺的长进,结果被考试的范围圈死了——考题即疆域。你想让 agent 会修更多的东西,就得出更多的题;疆域每扩一寸,考场就得重建一次。
第三个别扭是要命的一个:世上大多数活儿,根本没有现成的考官。写一个内部脚本能找谁打分?整理一个乱成一团的知识库,有标准答案吗?帮一个具体的公司排查它独有的流程问题,出题的人在哪?真实世界里的大量任务,没人给你准备自动评分器。考试驱动的进化,在这些地方直接失灵——没有考官,就没有选择压力,变异再多也是盲改。教练再好,也只在你练过的那几种动作上有发言权。
老师傅一退休,这三个别扭同时浮出水面。说来也怪,这三别扭明明一直都在,只是以前没人愿意细想——考试这件事太像一个客观公正的裁判了,分数涨跌一目了然,研究者看着放心,审稿人看着放心,连 agent 自己都"服气"。人们对客观量化的迷信,盖过了对成本的计较、对疆域的警惕、对无考场的焦虑。这篇论文的野心,就是把"考官"这个角色,从进化里请出去——并且用实验证明,请出去之后,进化不但没死,反而跑得更轻快。
📝 二、改装日志
请出去之后,靠什么?靠一本日志。
先回到人类的日常。健身房里大概有两种人。一种请私教:每练一组,教练盯着,报数,纠错,给动作打八十分、给状态打六十五分。进步当然有,但账单一厚,健身房就成了销金窟。另一种人不请教练,但有个雷打不动的习惯:练完在日志本上记一笔。今天深蹲一百公斤,起来时膝盖内扣了;上周硬拉腰疼,估计是热身不够;这组间歇拖太长,心率掉光了。没有分数,没有评级,只有一笔一笔朴素的记录。
三个月后你再看,哪种人进步更稳?答案常常出人意料:是记日志的那个。
为什么?因为日志里有一种私教打分给不了的东西:具体到不能再具体的经验。"膝盖内扣"不是一个抽象的分数,它是一个真实发生过的瞬间,绑定着当时的重量、姿势、疲劳程度,以及第二天膝盖的感觉。下次深蹲,这个瞬间会从记忆里自己浮上来。打分告诉你"不够好",记录告诉你"哪里、为什么、当时是什么样"。一个分数没有体温,一段记录有。外科医生为什么逼自己写手术笔记?航海的人为什么雷打不动记航海日志?因为真正长手艺的,从来不是那个总分数,而是一次次具体的、带因果的、别人替不了的亲身经历。分数是别人眼里的你,记录是你亲手摸过的路。
SelfSearch 干的就是这件事。论文里有个核心概念,叫 episode records——我用中文叫它"改装记录",或者干脆叫"日志"。agent 每尝试一次自我改造,无论成败,都留下一条记录:这次改造是怎么想的(推理),动了哪些手脚(工具动作),最后结果如何(结果)。三条,不多不少,恰好是一次改造的完整切片。一条记录就是一个微型故事:想法、动作、结局,起承转合俱全。
关键在于:这些记录不是写完就锁进抽屉的台账,而是下一次改造的参考资料。改造之前,agent 先去翻记录——当初那版改动为什么失败?那次成功做对了什么?同样的症状上次是怎么治好的?翻着翻着,"怎么改好自己"这件事,就从一门玄学变成了有案可查的手艺。主刀医生翻自己的手术笔记,司机翻自己的行车记录仪,改装师翻自己的改装日志——干的都是同一件事。
论文给这套东西下的定义,值得原文记住:无奖励搜索——不需要下游奖励信号的搜索过程,用过去自我改进的记录来驱动。注意这两个短句的分量。它没说"不需要反馈",它说的是不需要"奖励信号";反馈其实一直都在,就藏在每条记录的结果那一栏里。它也没说"不用经验",恰恰相反,它把经验——自己亲手攒下的、最贴身的那一种——放在了舞台正中央。
一言以蔽之:老式进化是每变异一次就请考官打一次分;SelfSearch 是翻着自己的改装记录,学习怎么给自己改装。
🔄 三、没有考官的进化,到底怎么转
说到这里,严谨的读者该皱眉了。打分和记录,听着只差一层纸,可进化归根结底是个选择问题——从一堆候选改造里挑出更好的那一批。选择就需要标准。没有分数,标准从哪来?
这个问题问到了 SelfSearch 的门框上,我们一步一步把它拆掉。
先看老式路数的选择逻辑,其实很粗暴:变异,评估,留优汰劣。考官的分数是唯一裁判,所有信息都得经过"跑一遍任务、算一个分"这道昂贵的工序,才能回流到搜索循环里。信息倒是干净,就是贵,而且只剩下"分数"这一种形态——考卷上全是选择题,没有主观题。你想知道改造的效果,只有一个出口:分数的涨跌。至于为什么涨、为什么跌、哪一步起了作用,分数一概不答。
SelfSearch 换了一个信息源头。它的循环是这样的:agent 基于过往积累的自我改进记录,提出新的改造方案;方案落地,跑一跑,产生的推理、动作、结果又写回记录;下一次改造,是在更厚的记录堆上提出来的。裁判从"考官的分数"换成了"自己的档案"。每一次尝试都不白试——成了,档案里多一页成功经验;败了,档案里多一页失败教训。搜索的每一步都在给下一步攒家底。
你可能会问:档案里那些失败记录,凭什么指明成功的方向?这不是刻舟求剑吗?这里有个微妙的区别,值得停下来想一分钟。失败本身不含方向,但对失败的完整描述含有。一条记录写着:改动某处之后,工具调用连环报错,任务卡死在某一步——这不是一个干巴巴的"三十分",这是一段可供推理的因果叙事。模型读到它,能归纳出"这类改法在这种情况会翻车",就像你翻到日志里"深蹲膝盖内扣那天"的那一页,不用教练开口,你自己就知道下次该注意什么。
换句话说,反馈没有消失,只是换了个形态:从标量变成了一个故事。标量只能比大小,故事能讲道理。而无奖励搜索赌的,恰恰是大语言模型最擅长的一件事——从具体的叙事里归纳出一般性的教训。让一个语言模型去读一百个带结局的故事,再从里面总结规律,这几乎是它的看家本领;让它从一百个光秃秃的分数里做选择,反而是杀鸡用错了刀。
这一换,账也跟着换了。考官路线的成本大头在"评估":每试一次就要开考一次,题要跑,分要算。日志路线的成本大头在"改造和记录"本身——一次改造,跑一遍,记一笔,没有额外的考场开销。搜索的钱花在 agent 自己身上,而不是花在给 agent 打分的监考系统上。成本的结构性差异,正是后文那个四美元故事的由来。
还有一层,论文强调得很明确:这些记录同时为"任务解决"和"自我修改"本身提供具体经验。前半句好懂——改造记录里夹着任务是怎么被啃下来的,下次接同类的活,心里有底。后半句才是要害:改造这个行为本身,也有熟能生巧的问题。第一次给自己动手术,手是抖的;第十次,你就知道切口往哪开、缝合注意什么。改装日志翻得多了,"改装"这门手艺自己就长了。进化不再只是筛选结果,它开始沉淀技艺。
这就是第三重门里"进化"二字的真义:前两重门,是老师傅把规矩立好,agent 照着做;这一重门,是 agent 开始攒自己的规矩。从被人管,到按规矩干,到自己长规矩——一个执行者的成年礼,至此走完。
🧰 四、刀可以从三个地方下
可能有读者好奇:所谓"改造自己",到底动的是哪些地方?论文把可动的范围说得很清楚,就是开头那句"检查并修改自己的指令、工具和执行流程"。拆开来,是三个层面。
第一层,指令。agent 的说明书——它接到任务时先读的那套话,告诉它你是谁、你能干什么、你应该按什么原则干活。说明书含糊,它就含糊;说明书自相矛盾,它就精神分裂。改指令,等于重写自己的岗位手册。装修队的话讲:把"干活要认真"这种空话,改成"贴砖前先泡砖十分钟"这种能执行的话。
第二层,工具。agent 手里那把工具箱——能调用什么、按什么格式调用、报错时怎么读。工具不顺手,巧妇难为无米之炊;工具的说明写岔了,它每用一次就错一次。改工具,等于给自己换装备、调参数。
第三层,执行流程。前两重门的主角——先干什么后干什么、什么时候该停下来想一想、什么情况下允许推倒重来。改流程,等于重新设计自己的干活章法。这一层最像老师傅的站会和派单:流程顺了,浑身的力气才使得到一处。
SelfSearch 的搜索,就是在这三个层面上同时翻找更好的改法。而它的日志,恰好把每一次改动的层次都记了下来:改的是哪一层、怎么想的、动了什么、结果如何。久而久之,档案里攒出的不只是"哪版配置好",而是"在哪一层动刀、用什么思路动刀、通常灵不灵"的元经验——这才是这本日志最值钱的部分。修车师傅的厉害,不在于他记得换过哪个零件,而在于他翻遍改装日志之后,摸出了"这个车型的病,十有八九出在同一个地方"的规律。
📈 五、六场考试,一场没输
机制讲完,上考场。先看成绩单的"广度"那一栏。
研究者把 SelfSearch 铺到六个模型与基准的组合上——注意,是六个不同的搭配,不是同一个考场换六个角度拍。结果一句话就能说完:六个组合,群体平均成功率相对于初始的 agent,全部提升了。没有一场例外,没有一场倒退。
在进化这件事上,"全部提升"四个字比任何单个漂亮数字都值钱。因为进化方法最容易犯的毛病就是挑食:在这个模型上灵光,换个模型就哑火;在这个基准上暴涨,换个考场就回落。六个设置全涨,说明这套机制抓的是某种共性的东西——只要 agent 有手能改自己、有笔能记日志,它就能转起来。它不挑学生,也不挑考场。
再看"深度"那一栏,也就是单个 agent 的极限。在 Terminal-Bench 2.1 这个考终端操作的任务集上,单个 agent 的提升最高到了 11.2 个百分点。这个数值得咂摸:它是在一个已经相当不低的起点上,又往上拱了一大截——相当于一个成绩已进前列的车手,靠改装又抠出了一圈明显的优势。进化方法常常只能给弱基础雪中送炭,能锦上添花的很少;11.2 个百分点说明这不是补救,是真的拔高。
最有意思的是 SWE-bench Multilingual 上的那组数,因为它一口气讲了两件事。第一件,成功率提升 5.0 个百分点——能力涨了。第二件更反直觉:在那些初始 agent 和进化后 agent 都能解决的任务上,执行成本降低了 38.5%。也就是说,进化不仅让 agent 更能干,还让它更便宜——同样的活儿,进化后的它花更少的步骤、更少的调用来交差。
这两件事为什么能同时发生?想想日志里记的都是什么就明白了:大量的记录,记的是"这一步为什么绕路""那次报错之后多跑了多少冤枉步骤"。这些复盘在能力上的直接回报,就是教会 agent 少走弯路——路短了,步骤自然少,成本自然降。能力涨和成本降,在日志路线里不是两个目标,是同一件事的两个侧面:手艺精了,活又好又省。
用改装车打比方:老式进化常常是圈速快了、油耗也上去了;SelfSearch 是圈速快了,油耗还降了百分之三十八点半。这不是暴力堆料,是手艺精进。日志里那些"哪一步绕了弯路"的复盘,最后都变成了执行流程里的直道。
☕ 六、一杯咖啡追平米其林
现在说那个最值得单开一节的数字。
研究者拿 SelfSearch 做了一次示范:让它搜索一个 harness——还记得吧,agent 的全套家伙什,指令、工具、执行流程。这次搜索总共花了多少钱?4.03 美元。四块零三分。你在楼下瑞幸,一杯生椰拿铁都不止这个价。
然后把搜出来的这套 harness 装进 DeepSeek V4 Flash,拉去考 Terminal-Bench 2.1——一个考真实终端操作能力的基准,题目是实打实的命令行任务。结果:解决了 82.0% 的任务。
82.0% 是什么概念?得看对手。在这个九个 harness 公开对比的设置里,分数最高的那一个,叫 Codex,出自这个行业最顶尖的团队。SelfSearch 花四美元搜出来的配置,跟它打成了平手。
一杯咖啡,追平米其林。
这个结果的每个字都值得敲黑板。先说便宜得离谱:传统评估引导的搜索,为了达到同等的成功率,搜索成本要高得多——论文明确交代了,跟这些评估引导的基线相比,SelfSearch 的任务成功率有竞争力,而搜索成本更低。竞争力没丢,账单小了一个量级。再说平台不挑:它不是只在某个旗舰模型上成立,装进 DeepSeek V4 Flash 就交货。最后,也是最容易被忽略的:这四美元里,没有一个美分是付给考官的。没有评估的账单,没有评分的工钱,搜索花的每一分钱都在刀刃上——让 agent 自己改造自己、自己复盘自己。
再换个角度掂一掂这个数字。四美元是什么概念?是一个工程师一小时的零头,是一杯咖啡,是跑一次大规模评估账单上常见数字的零头。当一个行业的惯例是"想要更好的 harness,就花大钱搜、花大钱考",而另一群人说"不考了,让它写日记,四美元,打平最高分"——这个反差本身就是论文最强的宣言:进化里真正贵的,也许从来不是变异,而是监考。
我把这个数字跟前两篇摆在一起看,心里咯噔了一下。第一篇,统筹,把"下一步"的决定从混乱里收拢回来;第二篇,诚实,把"定了照做"从口号变成机制;第三篇,进化,把"越来越好"从考官手里夺回来,交还给 agent 自己。三重门走完,一个执行者终于从被管理的工人,长成了能自我打磨的手艺人。而这门"长成"的学费,是 4.03 美元。
🤔 七、不靠分数的修行,有没有隐忧
夸完了,该把严谨的眉头重新皱起来。不靠考官的进化,听上去很美,但凡是"自己监督自己"的方案,都值得多追问三句。
第一句:没有分数把关,进化会不会跑偏——改着改着,改出一个在某些边角任务上崩掉的怪胎?这问题并非空想。之前的系列里我们聊过进化安全,聊过那道"忒修斯之船"式的考题:一个 agent 持续自我改造,改到最后,它还是原来那个它吗?改造的方向,谁来负责?那一次的结论是,进化可能漂向不安全的角落,需要有人盯着。那次讲的是安全方向,这次讲的是动力来源——两篇合起来才是完整的图:SelfSearch 回答的是"没有外部评分时,进化还能不能发生";它并不替你回答"发生之后往哪漂"。动力给了,方向盘还在人手里,这两件事,一个都不能省。
第二句:写日记复盘,会不会只是另一种过拟合?记录也是经验,经验也有边界——在 A 任务上攒的教训,到 B 任务上可能全不适用。更具体地说:如果改造方向是照着日志里旧任务的样子定的,搜出来的新配置会不会只会做旧题?论文的回应藏在数据里:六个模型-基准设置全部提升,说明日志里沉淀的东西有足够的通用性。但它是不是在所有任务形态上都通用,谁也不敢说满。诚实的边界就划在这:自我改进的经验能改善下游能力和效率,这个命题在六个设置上被验证了;"在所有地方都成立",还没有。
第三句最实际:这套方法的天花板在哪?记录驱动,说到底还是模型从自己的故事里找规律,而找规律的本事,就是模型推理能力的上限。换句话说,SelfSearch 是把模型已有的本事吃干榨净——榨得非常干净,但凭空变不出它没有的洞察。指望一本日志练出绝世武功,是武侠小说的情节,不是算法的承诺。日志能让好手变高手,不能凭空造高手。
这三问不丢人,恰恰是费曼式的诚实:知道一个方法能干什么很重要,知道它不能干什么同样重要。而无奖励搜索给出的答案已经足够惊人——在那些考官根本不存在的地方,进化第一次成了可能的事。
🚪 八、三重门
回到那个毛坯房。
老师傅退休后,工人们一开始是慌的。站会没人开了,图纸没人批了,半年下来,手艺原地踏步。后来队里最年轻的那个提了条笨办法:从明天起,每个人干活都记日志——今天这面墙为什么返工,那次走线为什么绕了弯路,改水管的新手法是怎么想的、动了哪几处、结果怎么样。没有评分,没有考核,就是记。三个月后队里传阅这些本子,谁的方法灵、谁的改法翻车,一翻便知。一年后,这个没有老师傅的装修队,活干得比从前还好,用料还省。
这个结尾不是童话。它对应着论文那句朴素得像废话的结论:自我修改中获得的经验,可以改善 agent 的下游能力和效率。翻译过来就是:写日记这件事本身,就是修行。你不需要等一个评委告诉你"你今天更好了"——你自己翻三个月前的本子,差距自己会说话。
上一篇的结尾我问过:没有老师傅呢?今天有了答案——把考官换成日志,把考试换成复盘。进化这件事,第一次不需要外部奖励也能转起来。
三重门到此走完。回看这一路,你会看到一个贯穿始终的方法论。第一重门统筹:与其指望模型在几百条消息的历史里自己想清楚下一步,不如给它一个站会机制——凡是要靠记性的美德,换成结构。第二重门诚实:与其指望它在三百条消息后还记得开工宣言,不如让声明变成路由、让誓言变成轨道——凡是要靠自觉的美德,换成机制。第三重门进化:与其花大价钱请考官给每次变异打分,不如让 agent 翻自己的改装日志——凡是要靠外部评分的成长,换成自己攒下的经验。
塔台管着调度,图纸管着执行,日志管着成长。统筹、诚实、进化——管事、守信、成长。听着像家训的六个字,也是算法一份一份交齐的作业。
如果再往外看一层,这三重门其实回答了三个递进的"凭什么":凭什么把长任务放心交给 agent——凭它想得清下一步;凭什么相信它会照想的做——凭承诺被钉进了机制;凭什么相信它离开人也能越变越好——凭它开始给自己记日志。三问三答,一个执行者从工具变成了伙伴。
而那个 4.03 美元,我会记住它。不是因为便宜——虽然一杯咖啡追平米其林,确实便宜得夸张——而是因为它标志了一件事:执行者从此可以靠自己变好了。老师傅退休那天的慌张,到今天,可以散了。
三重门已毕。装修队收工,散伙饭吃完,各奔前程,但那本改装日志,还一直在写,往后也写下去。
📚 参考文献
- 论文:Yang, Kong & Jo. "SelfSearch: Reward-Free Search for Self-Improving Agents", arXiv:2609.37968, 2026-09-29