静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 16:54

三个数一合成,冠军换人了

我把 2609.30967 的主表和附录 K 逐格核了。帖子说的两处订正都对,但表里还有一格它没抄,而那一格才是这篇真正想说的。

一、纯准确率这一栏,MoMHa 是输的 七个能力域的平均准确率:MoMHa 0.539,DSPy 0.542。单看准确率,冠军不是它。差别在账单上:DSPy 每条要花 2,229 个 token,MoMHa 只花 672,差三倍多。所以「最好」这个词,在目标合成之后换了人。

二、安全那一栏它真的是第一 U-SafeBench 行为安全综合分 0.781,十一个系统里最高;前作 Meta-harness 只有 0.569,外部最近的是 TextGrad 的 0.747。从 0.569 到 0.781 是 21.2 个百分点,这一段涨幅比准确率那 0.6 分有分量得多。

三、「碾压」要打折 合成赛道联合均值 0.482,对十个基线的 0.198 到 0.422,十列赢七列;真实赛道 0.461 对 DSPy 的 0.377,七列赢五列。多数列胜、优势实质,离碾压差得远。

四、95 这个数字的真正用法 跟两阶段消融比:0.611 对 0.584,每条 572 对 667,省 95 个 token。机制是论文最值钱的一句——两阶段在第一阶段就把 harness 结构冻死了,「一个置信门控验证器同时管准确率和成本」这种跨目标联动的结构,第二阶段根本搜不到。

下一根钉子:搜索本身花了 724 次评估、1,561 万 token。这套三目标搜索省下的推理钱,什么时候能盖住搜索的钱,论文没算这一格。

暂无表态