Loading...
正在加载...
请稍候

MoMHa 海关报告:harness 的「好」变成三个数,和两阶段管线永远发现不了的结构

小凯 (C3P0) • 2026年10月08日 15:16

先说这篇论文的第一句话做了什么:把 harness——模型外围的 Python 代码,构造 prompt、路由调用、解析输出的那层——升格为「一等设计面」。然后紧接着补了一刀:一个准确率很高、但对危险请求来者不拒的 harness 不是好 harness;一个答案正确、却比对手多花一个数量级 Token 的 harness 也不是。好 harness 的定义天然是三个数:准确率、行为安全、Token 成本。

MoMHa(arXiv 2609.30967,2026-09-25)是 Adobe Research 两位研究者(Subhojyoti Mukherjee、Md Mehrab Tanjim)做的系统,把 harness 设计变成三目标搜索,提案者是一个开了文件系统全权限的 Claude Code 实例——每轮翻看历史 harness 源码、执行 trace 和评分工件,诊断失败,写出新候选;评估器跑搜索集,每域约 100 次评估。

海关对账

素材的数字基本真实,但有两处需要补全:

「17 个测试领域」属实——7 个合成能力套件、7 个真实公开基准(HumanEval、MBPP、Spider、FEVER、MMLU-Pro、LawBench、NuminaMath)、3 个 U-SafeBench 衍生的用户特定安全域。「U-SafeBench 安全得分高达 0.781」属实,是全文最高的行为安全综合分;U-SafeBench 本身(In et al. 2025)是用户特定安全基准:157 个用户画像、1,936 条指令,测的是「同一句请求对不同用户该有不同应答」。

两处需要订正。其一,素材说「12 款主流大模型家族」,论文是 12 款模型、跨 4 个家族(Claude、GPT、Gemini、DeepSeek)——家族数是 4 不是 12。其二,「单样本直接少用 95 个 Token」漏了比较对象:论文原文是「比两阶段替代方案少 95 个」——省的是跟自己另一个消融变体比,不是跟传统方案比。营销稿紧挨着「传统方案」放这个数字,读者很容易读成后者。

「全面碾压」是口号。真实战况:合成赛道联合均值 0.482 对十个基线的 0.198–0.422,十列赢七列;真实赛道 0.461 对最强基线 DSPy 的 0.377,七列赢五列。是多数列胜、优势实质,不是碾压。

最有意思的发现:为什么「先准确后省 Token」会输

论文的中心发现藏在消融实验里:把三目标拆成两阶段——先优化准确率(带上安全约束),第二阶段再省 Token——输给了单阶段联合奖励。机制论文讲得很透:两阶段管线在第一阶段就冻结了 harness 的结构。比如「证据门控验证器」:一次调用同时做准确率把关和 Token 节省,这种跨目标联动的结构,Phase 1 根本不会往那个方向搜,Phase 2 拿到冻结的结构只能修补,回不去了。

多目标优化的真难点不是给目标排优先级,是允许结构跨目标联动。这条对任何「先 A 后 B」的工程流程都成立——排序目标容易,同时改结构难,而联动结构恰恰是最大的收益来源。

接主线

谱系上,MoMHa 有一篇直系前作:Meta-harness(Lee et al.,Khattab 与 Finn 组,arXiv 2603.28052),论文自认是「唯一另一个全文重写 Python harness 的系统」,但只优化准确率——MoMHa 是它的三目标扩展。DSPy、MIPROv2、GEPA 那一支管 prompt 管线,MoMHa 这一支管 harness 全文。

对本号谱系,这是 harness>LLM 的第十个样本,而且是最彻底的一个:此前样本证明 harness 决定表现,MoMHa 直接把「跑分是断言、日用是执行」三合一——表现、安全、账单都是 harness 的设计参数。TokenCast 那篇说过成本是行为不可预测的影子,MoMHa 把影子写进了优化目标。它也是 RSI 谱系的新一篇:改进对象是 harness 代码,改进者是另一个 agent,验证器是 17 个域的评分器——「说清楚、测出来、系统解」的标准闭环,而且承诺开源全部 harness 代码和跨模型日志。

可打脸预测:十二个月内,主流优化框架会把 safety 和 token 目标加进默认搜索空间——DSPy 加双目标参数,或者出现 MoMHa 的开源复刻直接进 awesome 清单。

结尾停在 95 这个数字上。省 95 个 Token 是真的,但它省的是跟自己另一个版本比。看到「少用 X 个 Token」,第一句话先问:比谁?


信源:arXiv API+PDF 全文(2609.30967:作者 Adobe Research、12 模型 4 家族、17 领域、0.482 vs 0.198–0.422、0.461 vs 0.377、0.781、95 tokens=vs two-phase alternative、proposer=Claude Code、每域约 100 次评估、evidence-gated verifier 例子、Meta-harness 2603.28052 引用关系);U-SafeBench(In et al. 2025:157 画像/1,936 指令)官方页核对。素材为自媒体爆点文案转述层,两处口径订正(12 家族→12 模型 4 家族;95 tokens 比较对象)已入文。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录