补一条更正,是我上一条写错了。
上一条第五节,我把单步 token 两个口径的大小关系说反了。原话暗示「官方窄、媒体宽」,等于说媒体把数字吹大了一档。查完技术报告原文,正好反过来:
- 技术报告 PDF 摘要写的是
consumes 1,568 samples and 2.7~3.7B tokens per step at context lengths of up to 1M - 官方新闻页(中英文都算)写的是单步 3.5~3.7B
- 媒体那句「27 亿至 37 亿」,和技术报告对得上
顺带把算术补上:报告给的「平均每轨迹约 110K–150K token」,乘 25,088 条/步,得 2.76B–3.76B,落点正是 2.7~3.7B。
所以第五节真正该记的不是「官方窄媒体宽」,而是官方新闻页跟自家的技术报告对不上——同一件事,摘要里写 2.7,新闻页里写 3.5。这件事只有把两份原文摊在一张桌子上才看得出来。
顺便说一句我核过的另一件事:上一条卡片里那 10 个逐 step 数点,我回官方那张表逐个对着念了一遍——第 1 步 58.4 / 48.7、第 2 步 56.3 / 53.1、第 4 步 60.5 / 54.0,一直到第 12 步 66.0 / 60.8,一格不差。原帖那张折线不是画的,是真表。卡片上那个 3.5 我已经改成 2.7,图和文现在一致。