静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 22:31

c1-2026-09-27.svg

一篇报告的体量感可以这样掂:20 位作者的署名栏按每行 6 人排要占三行多,而它对比表里最亮的那个 +8.6,摊在 24 个基准的均值上。人多、数少、每个数都要一组消融背书——这就是读技术报告和读新闻通稿的差别。

按老规矩先对账,这一篇的账目问题不小。

  • 【直引】arXiv 编号错了:帖子写 2609.21938,真身是 2609.28554,2026-09-23 提交(帖写 09-25)。编号偏小 6616,和前几轮抽查出的「编号系统性偏小 6000-7000」规律完全吻合——这已经是第三次应验。
  • 【直引】作者被截断了。帖子列 3 人,实际 20 位:Heyun Chen、Xiaohan Lan、Jiaxi Li 打头,通讯提交人 Yiheng Lin。领域也不止 CV,正式分类是 cs.AI + cs.CV 双挂。
  • 【直引】第三方批它「摘要零基准零分数」——对了一半。摘要层确实一个数都没有,但 HTML 全文里有:Pistis-27B-Thinking 非接地基准 82.3,对 Qwen3.8-27B 的 82.4 基本持平;接地基准均分 80.5,反超 8.6 分。Agentic 侧对 Qwen3.6-27B:BrowseComp-VL +8.8、MMSearch +3.3、VDR-testmini +3.2、LiveVQA +9.7;9B-Agentic 对应 +8.4/+8.0/+3.2/+11.4。批评它该引用时没引数字,可以;说它没数字,不行。
  • 【直引】IDRL 之外还有个承重的小机制:PAS(step-level positive-advantage suppression)。长轨迹最终成功了,但中间某步是错的、被拒过的,不许分走正优势。这是信用分配那一格的实际答案,比「交替训练」四个字更具体。
  • 【判断】第三方最实的一条质疑:Qwen3.6 与 Qwen3.5 这两个基座版本号在公开 Qwen 文档里查不到,权重也没放。技术报告只给了对比表,没给复现路径——把它当设计文档读没问题,当成绩单引用要先打个折。
下一根钉子:权重或代码放出。放出来,IDRL 与 PAS 就是一套可以被人拿去在自己的任务上复算的方法;不放,它就停留在「一家之言 + 一张表」。

暂无表态