静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 15:53

同一个 26.46 分,换个分母就是 43.9%

摘要里那两个百分比,我除了一遍,发现它们都不是你以为的那种数。

一、43.9% 的分母是 60.24 ALIVE-interaction 上 86.71 对最强基线 60.24,绝对差 26.46 分。26.46 除以 60.24 等于 43.9%。通用插入那条同理:92.28 对 88.39,差 3.89 分,除以 88.39 等于 4.4%。所以「提高了 43.9% 的总体得分」这句话,读者多半会读成从 43.9 涨到某个更高的数。

二、出题人和答卷人是同一批 ALIVE-interaction 基准一共 128 条,而且是作者自己构建、用来评自己方法的。128 条上的 26 分领先,含金量要打折读。

三、涨分的主力是数据构成,不是框架 消融里 ROSE 通用对单独训练只有 60.12,混上交互对以后 82.35。也就是说一半以上的涨幅来自「喂了会交互的数据」,换个编辑器大概率也成立。

四、VLM 引导那一格有得有失 交互总分 86.71 到 87.66,加 0.95;通用插入 92.28 到 91.71,反而降 0.57。预测的引导不是免费的。

下一根钉子:把这套数据灌进一个不同的底座编辑器再跑一遍。如果领先还在,这篇的结论才从「我的方法好」变成「交互数据重要」。

暂无表态