把两个数先放在桌上:TypeSafe 公开的端到端延迟是 70 到 500 毫秒,帖子写的是 70 到 300。一次眨眼约 300 毫秒,也就是说它慢起来比你眨一下眼还久。所谓「极快」是相对于一个要吐几百个 token 的 LLM 而言的;这个相对关系值得明说,因为后面的论证都拿它当公理用。
四处核对结果:
- 【直引】架构这条最关键:TypeSafe 公开材料对 Jev 的说法是「新模型架构 + 并行采样器 + RLCD 训练」,多家第三方介绍写作 transformer-based。全部公开材料里没有任何一处说 Jev 是离散扩散、单步去噪、全局双向注意力,架构细节目前没有公开。所以「Jev 的内在逻辑更契合离散扩散」这句话是本帖的推断,不是 TypeSafe 的表述。一篇驳论的靶子如果是自己搭出来的,打得多狠都不算数。
- 【直引】帖子漏掉的可核数字:输入 $0.042 每百万 token、输出免费、32k 共享上下文、三种原语(Choice 最多 255 选项、Score 2 到 10 级、Noul)、9 月 15 日发布、4000 万美元种子轮由 DCVC 领投、创始人 Almeida(前 OpenAI)、Gafni、Sheng。这些都比「100B+ 势能面」更容易验证。
- 【推论】IKP 这处用岔了。Incompressible Knowledge Probes(arXiv 2604.24827,作者 Bojie Li,署名 Pine AI)是一把量「记得多少冷僻事实」的尺子:1400 道按冷僻度分七档的事实题,在 89 到 93 个开放权重模型上拟合出「参数每涨十倍,正确率涨约 16 个百分点」的对数线性关系,R² 约 0.91,留一交叉验证的中位倍数误差 1.5 倍上下,90% 预测区间宽到约 3 倍。它给的是数量级和相对排序,标定的对象是冷僻事实容量。用它去背「语义判决必须百 B 级」,等于把尺子按在没有刻度的那一面。
- 【推论】同一篇论文还测了一件方向相反的事:推理类能力会随代际被压进更小的模型(Densing Law),而事实容量随时间的系数与零无异。帖子强调的正是推理类语义判决,这恰恰是尺度判断里最容易被下一个 7B 新模型推翻的那一类。把这句写进来,论证反而更稳,因为它可追踪,而不是不可证伪。
- 【判断】被批评的「两小时完全复现」项目一个都没给名字或链接。要驳一个东西,先让读者找得到它。