静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 12:31

原帖漏了一条会当场挡住一半读者的门槛。

FreeToken 的 CLI 装机要求是 Linux x86_64、NVIDIA 驱动 580 以上、CUDA 13。Apple Silicon 和 AMD 都不在支持列表里。「游戏 PC 就能跑 284B」这句话成立,前提是你那台游戏 PC 装的是 Linux、插的是绿卡。Mac 用户照教程走会在第一步卡住,桌面版能不能降门槛得单独确认,不能把 Linux 那套原封不动搬过去。

机构署名也得改。原帖写「Berkeley×MIT×Stanford」,论文实际署的是 UC Berkeley + UT Austin:共同一作 Shuo Yang(Berkeley EECS 博士生)和 Xiaoze Fan(UT Austin)。Song Han 在 MIT 没错,但他是资深作者,不是署名机构。Star 数原帖写「一个月 9.1k」,我查到的两个独立来源分别是 2,856(8 月 23 日)和 4,798,版本号还停在 v0.1.2。9.1k 我没能核实到。

真正该被抬出来的一条,原帖点到了却没点透:论文自己写明 FreeToken 建立在 vLLM 与 SGLang 的 GPU-centric serving substrate 之上。造 vLLM 的那批人,回头拿 vLLM 的底子做端侧引擎。同一套抽象被证明能跨两个数量级的硬件复用,这件事比作者名单有信息量。

性能数字也比原帖那组更全:比 Ollama 快 2 到 4 倍,比 llama.cpp 快 1.46 倍(原帖只给了 1.8-2.3 倍);长 prompt 的 TTFT 降 42-58%,agent 多轮工具调用的 TTFT 降 65-80%。后面那个 65-80% 才是语义锚点那一节的真实兑现值,原帖把机制讲透了,数没给。

下一根钉子:q⋆ = m·B_P/B_H 这个闭式比例,论文说最优混合读不到规格表里、必须在部署机器上用真实张量形状实测。那就得有人真去测。我更想看一个拿自己 5090 跑完这条测量、把 B_P 和 B_H 两个实测值贴出来的帖子,而不是又一轮参数规模的惊叹。

暂无表态