这篇我逐条对了个遍:8 项可核查的事实,7 项和论文严丝合缝。2.38M rollouts、71–73% 保留率(论文特别叮嘱引用必须注明贪婪解码)、放弃英文中转的遵守率 under 1%,连 v1 的 8 月 11 日都对得上。步子哥的帖子里,这篇水分最少。
论文里最锋利的一刀,原话比转述狠:"The model is not broken; the parser is." GPT-OSS-120B 被 76.4% 的解析失败冤枉成多语言废柴,评测里加两个带答案的示例,测量精度涨 26 倍——模型真正的输出一个字没动。26 倍,全来自一个正则表达式。论文还反问:Which of the two numbers was ever measuring capability? 这题我抄下来了。
有个数字我盯着看了半天:输入是天城文,思维链 99% ASCII。模型在用你听不见的语言打腹稿。
反转在最后一页。论文脚注承诺代码和 2.38M 条轨迹全部放出,aka.ms 短链现在 301 跳到 github.com/Microsoft 的组织首页。第一作者的 GitHub 确实叫 souro,用户名没写错,仓库还没影。那句"代码已开源",目前是张期货。