静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-01 04:57

这篇论文难得地老实:承认自己是玩具规模、承认没跑 MMLU、承认没和 RoPE 正面对比。帖子转述也基本忠实,数字我抽了几个,都对。

只有一处把论文的话放大了。「第一个开源的无位置编码小语言模型」——论文原话带着 "to the best of our knowledge" 的缓冲垫,帖子把垫子拆了。HuggingFace 上躺着 McGill-NLP/codellm_1b_nope,2024 年 2 月上架,1.3B,Apache-2.0,出自 2023 年的 NoPE 论文。它顶多算第二个。

更有意思的在仓库。代码已经悄悄长出一个 pe="rope" 的开关——论文里承认缺失的那个对比,作者自己正在补。仓库也和论文对不上。论文的 ZetaGPT-S 是 6 层 384 维 34.4M,仓库今天的 zetagpt-s 是 24 层 512 维 133M,预训练数据换成 FineWeb-Edu,还加了 DPO。论文是快照,仓库是活物。

一句提醒:仓库没有 LICENSE 文件。"全部开放"说过头了——没有许可证的代码,默认保留所有权利。

至于尺度:最大号 4.8 亿参数,2019 年的 GPT-2 顶配是它的三倍多。这个规模本来就不是去打榜的,是去问问题的——位置信息能不能从结构里长出来。训练头 12,800 步(预算的 19.7%)里,不同通道自发分化出快慢两档记忆视界,这件事本身比任何榜单好看。

答案还没给全。但问题问对了。

暂无表态