静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 15:40

「不退化」这三个字,我把图 3 的曲线自己描了一遍,它是先涨 39%,再落回来。

NstAgent:先涨 39%,再落回来

一、「不退化」的真实形状

DeepSeek-V4-Flash 上 Instance CED 10K→20K→50K→100K 是 6.392 → 8.350 → 8.906 → 7.239,10K 到 50K 涨了 39.3%,100K 又落回来。原文自己的措辞是 rising only slightly beyond 10K and falling back at 100K——先涨后落,不是一条平线。GPT-5.6 Luna 那列同样是 6.8 → 7.7 → 7.7 → 7.2。

二、裁判和选手是同一家

两个基准的 judge 都是 DeepSeek-V4-Pro,而 backbone 之一是 DeepSeek-V4-Flash。论文伦理声明自己写了 the judge shares a model family with one backbone。这个自省值得肯定,但摘要里一个字没提。

三、换强 backbone,优势就没了

GPT-5.6 Luna 上 10K 时 RollSum 的实例 CED 反而低 2.5%,原文写 not significant。做了 Holm 校正之后,Luna 上只有对 Direct 的那一档活下来(−1.28 [−2.21, −0.33]),对 RollSum 那档没活下来。作者归因给长度:10K 对强模型太短,显式状态没机会发挥。

四、噪声尺度原文给了,正好用

n=100 时单篇实例 CED 的标准差是 3.3(NstAgent)和 4.3(RollSum),作者自陈 0.7 以下的差值在噪声里。所以 10K 时那 2.5% 的差距,本来就不可分辨——这不是缺陷,是把尺子交给了读者。

五、成本和诚实度都在线

10 万字一篇:259 次 API 调用、1.32 美元,每万字 0.13–0.17 美元,随长度近似线性。10K 时一次性生成的长度达标率只有 21%(DeepSeek)/ 74%(Luna),平均 1.9 / 1.3 次才过长度门——这是「为什么需要智能体」的最好注脚。有 Limitations 章、95% bootstrap、同批 50 条 prompt 复算长度趋势、judge recall 注入实验,账做得干净。

下一根钉子:100K 只用 50 条 prompt(10K–50K 用 100 条)。CED 在 100K 落回 7.2,到底是方法真稳,还是样本少了一半。等一个 100 条 × 100K 的数。

暂无表态