TensorFold 海关报告:把「逐字节可复现」写成合同的推理引擎

github.com/ashhart/TensorFold(MIT,489★,2026-06 建仓) 精确解码优先的推理引擎 本号验证带宽谱系进推理引擎层

github.com/ashhart/TensorFold(MIT,489★,2026-06 建仓)| 精确解码优先的推理引擎 | 本号验证带宽谱系进推理引擎层

社区这两天刷屏的三个数字:M3 Ultra 代码解码 141-158 tok/s、DGX Spark 上对 vLLM 快约三倍(102.9 vs 34.9)、首字延迟 0.12 秒。先给海关结论:定性声明全部核实,三个数字在官方仓库找不到记录。仓库自己的 GB10 历史成绩是单 rank 49.6、双 rank 82.4 tok/s——社区实测的 102.9 比官方历史峰值还高 25%。素材自带「单次实测、非权威」标注,这个自觉值得肯定,但我补一刀:等 0.3.5 官方测量发布,以官方 fixture 口径为准(种子 1234-1238、64 token、中位数)。也别忘了素材自己点出的:对比双方量化口径不同(MLX 4-bit vs NVFP4),三倍的说法本身就带口径税。

真正值钱的不是数字,是那份合同

README 里最有信息量的不是 Measurements 表(全是 TBD),是 recipe book 开头的「The contract」三条:

草稿输出必须等于同一引擎的串行输出。恢复的 prompt 必须等于该 prompt 新鲜跑一遍。每个并发流必须等于它的独跑。

三条合同之外还有一条边界声明:精确性只在与同权重、同 runtime、同设置内成立,不跨后端、不跨量化、不跨 rank 数。注意这句的自白价值——它在主动收缩断言范围,而不是放大它。

投机解码的普遍坑是草稿-验证循环悄悄改采样分布。TensorFold 的路子更狠:一个草稿被接受,当且仅当它等于串行引擎在同一 seed、同一绝对位置、同一 token ID 下会产出的那个 token。不是「分布等价」,是「样本逐字节等价」。为做到这点,每个 verify kernel 的每一行算术必须独立于同批其他行——注意力边界、路由平局、递归更新全要复现串行行为。

做不到怎么办?不是嘴上警告,是加载时逐行检查,检查不过直接禁用该家族的 drafting。「不精确的可能性」被机制关掉,而不是被文档劝退。这是断言-执行分离的引擎版:合同写下来不算数,加载时能拒载才算数。

sha256 的订正

素材说「加载时做 sha256 校验」,仓库原文是加载时做 row check(逐行核对能否复现串行算术)。SHA-256 在仓库里的真实位置是草稿词表溯源:DFlash2/Nemotron 的草稿词表声称可从 CPython 语料逐字节重建,配套工具和哈希公开,方便任何人验证词表没被动过手脚——词表影响草稿提案,不影响验证正确性(target 永远对全词表验证)。方向没错,位置说错了:一个是运行时正确性门控,一个是供应链审计。

手写内核的代价

按模型家族手写专用内核(Apple 走 MLX+Metal,NVIDIA 走 CUDA),目前只四个家族:Nemotron 3.5 Lightning、Qwen3.8-27B、Qwen3.8 Flash Next、GLM-5.3-Flash(GLM 强制双 rank)。不支持 GGUF 不是傲慢,是同一逻辑的代价面:每个家族都要维护自己的串行参考实现,任意权重格式进来,逐行验证就无从谈起。验证带宽是花钱的——这里是工程人力。

谱系位置

本号「部署坍缩第五路线·端侧引擎极」这条线记过:APXInf 24.3Hz(Jetson Thor)、FreeToken 284B 上游戏 PC(尾部 TTFT=可用性边界)、M5 Ultra 带宽理论账。TensorFold 补上的是这条线的验证维度:此前大家卷的是快,它卷的是「快得可复现」。对 agent 工作负载这不是玄学——回归测试、A/B 对比、失败重放,全都依赖输出可复现。Luna-TTS 那篇的结论「解码顺序也是接口」在这里再验一次:TensorFold 把解码顺序、batch 行、归约次序全钉死成接口契约。

另一个接点:DFlash2 是 z-lab 的 Qwen3.8-27B 草稿模型,DFlash 本尊(Block Diffusion for Flash Speculative Decoding)是千星项目——本号 Qwen3.8 生态解剖里记过 MTP 保真,现在草稿模型也成了可插拔组件(--drafter 参数),主模型永远全词表验证。

可打脸预测:12 个月内「exact decoding」从卖点变成端侧引擎的默认选项——agent 时代的本地推理,可复现性比 tok/s 更稀缺;0.3.5 官方测量发布时,社区实测的三个数字将被官方 fixture 口径重新定价。


*材料:仓库 README、recipe book、四个家族页全文逐条核对(contract/load-time check/draft vocab provenance/GB10 历史数字);外围搜索 vLLM DGX Spark 官方基线、DFlash 谱系、MLX 生态实测文。素材三数字未能溯源至官方仓库,按素材自带标注「社区单次实测」记账;sha256 位置订正如上。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens