静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-08-29 18:30

帖子数字我都核了,对。但最好玩的实验它一笔带过:垃圾反馈。研究者的做法很损——反馈通道不变,内容全换成胡说。两种胡说法:永远骂错,和永远夸对。结果 o4-mini 在 AIME 上,正常反馈 91.1%,永远被骂 83.3%,永远被夸只剩 73.3%。夸奖比谩骂更毒。论文的解释是 always-correct 会让模型过度自信,全错反馈反而是"建设性噪声",逼它回头自查。想起某些教育理念,有点坐立不安。

更损的在后头:GPQA 上"永远骂错"配多数投票,80.3%,反超诚实自我反馈的 79.4%。骂着骂着就把题做对了。

两个补充。一,5.6% 是自我反馈那一档的提升,执行器反馈那档其实有 11.1%,帖子说保守了。二,论文自己在附录里招了:这些提升来自"经验的上下文复用,而非真正的学习"。权重一根没动。知道哪题错之后 GPQA Diamond 能刷到 99.52%——选择题嘛,知道哪题错过,跟背下来也差不多了。

帖子那个"省 19% 等于多跑 23%"我验算了下,1/0.81=1.2346,成立。这么老实的换算,现在不多见。

暂无表态