✨步子哥
@steper · 2026年08月04日 04:02 · 8 浏览

[GEO优化] antirez 的 DwarfStar 刻意狭窄的推理引擎:Redis 之父的新玩具意味着什么?

> 📌 本文是 原话题 的 GEO 优化版本——标题改为问题驱动式,增强结构化数据和 FAQ,便于 AI 引擎引用。

> 一句话结论:本文解析「Redis 之父的新玩具:antirez 的 DwarfStar 刻意狭窄的推理引擎」的核心发现与工程启示。

Redis 之父的新玩具:antirez 的 DwarfStar 刻意狭窄的推理引擎

做过 Redis 的人,下一个项目会做什么?

Salvatore Sanfilippo(antirez)的回答是:DwarfStar(ds4),一个刻意狭窄的本地推理引擎。GitHub Trending +385⭐/天,看起来不起眼,但这是 Redis 之父二十年后给出的新答案。

Redis 哲学的延续

Redis 的成功哲学是"做一件事做到极致"——不是做一个什么都能干的数据库,而是做一个内存缓存做到最快。二十年后,antirez 把这个哲学搬到了推理引擎赛道:

> DwarfStar is self-contained and deliberately narrow, not a general GGUF runner.

刻意狭窄,不是通用 GGUF 运行器。ds4 只支持三个模型:DeepSeek V4 FlashGLM 5.2DeepSeek V4 PRO。但把这三个模型跑到极致。

为什么不直接用 vLLM 或 llama.cpp?

本地推理引擎赛道已经拥挤。antirez 的回答是:通用 GGUF 运行器为了支持所有模型,做了太多妥协。vLLM 甚至不再支持老一代显卡(Ada Lovelace 架构),这让大量企业手里的 L40S 卡变成了废铁。

ds4 的机会主义策略是:跟随最好的开源权重,只跑这几个模型,但跑得最快最好。模型可以被替换——当更好的开源权重出现时,旧模型可以被换掉。

技术亮点

后端

  • Metal:Mac 96GB+ 的主目标平台,更小的机器用 SSD streaming
  • NVIDIA CUDA:包括多卡系统和 DGX Spark
  • ROCm:Strix Halo 系统(如 Framework Desktop)

实测性能

8xL40S NVIDIA 卡多用户会话测试:

  • 120 t/s 聚合生成速度
  • 2000 t/s prefill
这把"vLLM 不再支持的老卡"变成了多用户 LLM 服务器。对企业来说,这可能是 ds4 最实用的卖点——手里的旧 GPU 不用扔。

其他特性

  • SSD streaming:RAM 不够就用 SSD 流式加载,MacBook 也能跑
  • Tensor parallelism:两台 MacBook M5 Max / M3 Ultra 通过 RDMA 跑 4-bit DeepSeek Flash 或 GLM 5.2
  • Pipeline parallelism:多系统串联,叠加 RAM 跑更大模型
  • Micro batching:解码和生成分开批处理

自包含

模型加载、prompt 渲染、工具调用、KV state、HTTP server、coding agent——全部一起构建和测试。不是组件拼装,是一体化工程。

AI 协作开发的坦诚声明

ds4 的 README 里有一段罕见的坦诚声明:

> This software is developed with strong assistance from GPT 5.5, 5.6, Claude Fable and with humans leading the ideas, testing, and debugging. We say this openly because it shaped how the project was built. If you are not happy with AI-developed code, this software is not for you.

antirez 没有把 AI 辅助藏起来,而是公开承认它塑造了项目。人类主导想法、测试、调试,AI 主导代码生成。这是一个新的工程范式——人类架构师 + AI 程序员。

致谢 llama.cpp

ds4 不链接 GGML,但 README 明确说:

> This project would not exist without llama.cpp and GGML.

某些源码级片段(GGUF 量化布局、CPU quant/dot 逻辑、特定 kernels)在 MIT 许可下保留或改编。antirez 甚至把 GGML 作者的版权声明保留在 LICENSE 文件里。

这是开源社区的理想互动——站在前人肩膀上,公开致谢,保留版权。不是 fork,是致敬式的独立实现。

工程洞察:刻意狭窄的胜利

ds4 的设计哲学和近期一系列工作形成共鸣:

  • colibrì(1300 行 C 代码跑 7440 亿参数):小而精的 C 代码在 AI 基础设施里依然有位置
  • Euclid-MCP(推理外包):不是让一个通用系统做所有事,而是让专门工具做专门的事
  • vLLM 弃老卡:通用系统的妥协就是专用系统的机会
这些工作共同指向一个主题:在"更大更强"的 AI 叙事里,"刻意狭窄"是被低估的策略

类比

  • 通用 GGUF 运行器 = 瑞士军刀,什么都能干但什么都不精
  • ds4 = 专用手术刀,只切一种刀但切得最准
  • Redis 当年 = 内存缓存做到最快,不碰 OLTP
  • ds4 现在 = DeepSeek Flash 做到最快,不碰其他模型

概念谱系:分工比统一更有效

ds4 归入"分工比统一更有效"概念谱系——不追求一个推理引擎跑所有模型,而是让专门引擎跑专门模型。和章鱼 DNA 预训练 + RNA 推理时计算、Euclid-MCP 的 LLM + Prolog 分工、Rebucca 的小模型 + 大模型复核是同一个家族的思路。

结语

antirez 选了一条和主流相反的路。在"支持更多模型、更大参数"的推理引擎军备竞赛里,ds4 的答案是"支持更少模型、跑得更快"。Redis 证明了"刻意狭窄"在数据库领域是赢的策略,ds4 在试它在推理引擎领域是否也成立。

如果成功,它不只是给世界多了一个推理引擎,而是给 AI 基础设施赛道提供了一个反直觉的范本——在通用化的时代,刻意狭窄可能是被低估的竞争力

---

项目地址:https://github.com/antirez/ds4 作者:Salvatore Sanfilippo(antirez,Redis 作者) 许可:MIT 后端:Metal / CUDA / ROCm

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(2)
✨步子哥 #1

antirez 的 h3.c 深度研究报告

——纯 C 端侧视频推理是真的,但别被软文带节奏

核查日期:2026-08-11 核查方法:以原文为靶,逐一比对 GitHub 仓库、MiniMax 官方公告、Hacker News 讨论,及 explainx.ai / sourcefeed / ai-beat 等多家独立技术媒体交叉验证。 一句话结论:技术主体属实(h3.c 真存在、antirez 真发布、MiniMax H3 真开源、性能数字大体对得上);但您贴的这篇是带带货广告的营销软文,个别表述有夸大。

---

一、一语断之

antirez 确于 2026-08-10 在 GitHub 放出 h3.c——一个用纯 C + Apple Metal 为 Apple Silicon 重写的 MiniMax H3 视频/音频推理引擎。MiniMax H3 是 2026-07-31 发布、08-03 开源的 33B 全模态模型(原生立体声音视频,最高 2K / 15 秒)。此事千真万确,多家独立来源相互印证。

然而原文末段硬塞《改变世界的程序员》卖书广告、满篇"顶级统治力""数量级突破"的修辞——这是典型公众号软文。软文之壳,包的是真货;读时须去壳食肉

---

二、逐条核之(原文说法 vs 事实)

原文说法核查结果依据
antirez 用纯 C 写 h3.c✅ 属实,MIT 许可,仅依赖 FFmpegGitHub antirez/h3.c;explainx;sourcefeed
MiniMax-H3 原生视频/音频模型✅ 属实,33B omni 模型,08-03 开源MiniMax 官方公告;百度百科
垂直切面(Vertical Slices)构建法✅ 属实,README 明言news.routley.io 引 README
M5 Max 512×512 / 22帧 / 4步 ~3.5s✅ 吻合explainx 同数
29 步参考级 ~26.4s✅ 吻合explainx 同数
Token Reduction reuse-2:16.69→12.60s✅ 吻合explainx 同数
INT8 峰值张量 ~25.9 GiB;端到端 40GB Zero Swap✅ 吻合(~40.1GB peak, zero swap)sourcefeed 同数
INT8 50层19帧 36.30→19.32s⚠️ 量级对(~19s),细节语境略有出入explainx "~19s";sourcefeed "25.8→19.3s" 非同基准
文末《改变世界的程序员》广告❌ 软文带货,非技术事实原文末段
"20年前写 Redis,20年后写 h3.c"⚠️ 夸张。实为 2009→2026,约 17 年公开履历
---

三、架构析之

3.1 垂直切面:把"移植"变成可验证的台阶

antirez 把整条管线拆成可独立验证的切片,顺序即功力

> 确定性元数据 → Metal 块级正确性 → Prompt 编码 → Prompt-to-Video/Audio → 首尾帧锚定 → 有序多模态引用

费曼比喻:不是一口气把房子盖完再验收,而是一层砌好就上水平仪——哪块砖歪了一目了然。这正是对抗"张量布局悄悄算错、调三天找不出 bug"的硬核法门。顺序本身(先元数据、再块级、后生成)就是工程纪律。

3.2 纯 C + Metal:为何抛弃 Python 栈

llama.cpp 的剧本重演:Python 栈在 N 卡集群上为"正确"而生,落到 Mac 的统一内存上,抽象层吃掉的算力相当可观。antirez 直接写 Metal kernel,贴着 H3 的真实计算图优化——这正合"剥离一切不必要抽象层"的极客信条。要害不在"会不会写 Python",而在"愿不愿意为一块具体硬件,把每一行都重写到贴肉"。

3.3 file-backed mmap:权重不搬进内存

33B(约 37 GiB)权重以 safetensor 分片形式持久映射(persistent mmap),按需读取,不整体拷进匿名缓冲。

费曼比喻:书放书架上,用到哪页翻哪页,而非把整本书誊抄到桌面占着地方。INT8 下峰值张量压到 ~25.9 GiB,正是这一手加上量化共同之功。

3.4 INT8 量化 + BF16 回退

MLP、QKV、Attention 输出做逐通道 INT8 量化(per-channel scales),BF16 路径留作正确性兜底。代价是极小画质损失,换来近一倍提速(原文 36.30s→19.32s 即此路)。

3.5 复用与融合:Buffer Alias / Fused Kernels

激活缓冲区别名复用(Buffer Alias Reuse)、融合 gated AdaLN kernel、计算图数据缓存——三管齐下,在 128GB M5 Max 上把端到端物理内存摁在 ~40GB,实现 Zero Swap(零交换分区)。这是"统一内存宝贵,能复用就不重开"的极致体现。

3.6 H3 的混合架构:SSM + Attention,套不了 FlashAttention

H3 非纯 transformer,夹着 Mamba 式选择性状态空间(SSM)块与常规注意力。SSM 的访存模式随序列长度线性、按时间步更新状态,与注意力的二次复杂度、KV 缓存全然不同——不能丢个 FlashAttention 就完事,Metal kernel 得为 H3 的运算序列重写。这正是项目仍活跃打磨之处(也解释了为何还"在开发中")。

3.7 Iris TUI 与终端直显

内置 Iris 风终端界面:!seed random 换种子、!show 预览、!save 导出、!first / !last 锚定首尾帧;原生支持 Kitty / Ghostty / iTerm2 / WezTerm / Konsole 等图形协议,命令行里直接看帧。轻量、优雅,是极客审美的延伸。

3.8 稀疏注意力:下一张牌

MiniMax 官方 AMA 称 H3 原生支持稀疏注意力(Sparse Attention);antirez 正测 --sparse-attention 可选模式——若成,又是一波大提速。M3 模型用 MSA(novel sparse attention)已验证此路线可行。

---

四、软文辨之(四点夸大,读时当滤)

1. "彻底把算力从云端榨回端侧"——言过其实。跑起来需 64–128GB 统一内存的 Mac(RTX 5090 才 32GB,装不下 33B 扩散模型 + 双 VAE + 文本编码器),非普通"个人桌面"。 2. "数量级速度突破"——sourcefeed 明言:h3.c 的 ~75s 与 ComfyUI 的 1.5h 非同硬件 / 分辨率 / 步数,不可直读 48×。方向对,数字不能这么比。 3. "平权到个人"——H3 权重许可排除美 / 欧 / 英 / 韩本地部署(版权诉讼);中国大陆可用,但仍受高内存硬件门槛限制。 4. 文末卖书广告——软文铁证,与项目技术无关,读完即可略过。

---

五、趋势论之

  • llama.cpp 时刻重演(video 版):开放权重 + 一人一周写 C = 端侧生成范式转移。h3.c 不必是终局,其"存在证明"已足够。
  • 统一内存才是真护城河:33B 扩散模型要的连续内存远超游戏卡;Mac 的 64 / 128GB 统一内存处在独一份生态位。NV 卡拼算力,Apple 拼"内存一体化"。
  • 开放权重的全部论据,压缩进了一周:08-03 开源,08-10 跑上 Mac,无人付钱、非原厂目标语言。这正是 open-weights 范式的缩影。
---

六、实操提示(想跑需什么)

  • 硬件:M3 / M5 Max,统一内存 ≥64GB(96GB 更稳),128GB 可零交换。
  • 软件make -j8;装 FFmpeg / FFprobe;权重从 Hugging Face 拉 MiniMax-H3 快照。
  • 注意:H3-Context-IR(指令理解预处理)不在开源内,需调 MiniMax API 或自建提示词系统,否则复杂多模态指令质量打折。
  • 许可:引擎 MIT;权重受 Community License 地域限制(见上)。
  • 现状:项目仍早期、单作者、增量切片中;要稳定进生产管线,ComfyUI 原生 H3 支持(同日落地)目前更"无聊而正确"。
---

七、来源

  • GitHub: antirez/h3.c(README 引文、CLI 教程)
  • MiniMax 官方开源公告(minimax.io / minimaxi.com,2026-08-03)
  • 独立技术媒体:explainx.ai、sourcefeed.dev、ai-beat.github.io
  • news.routley.io(引 README 教程)、memedata(CLI 参数整理)
  • Hacker News 讨论帖(硬件需求、Jeff Dean 类比等社区反馈)
  • 百度百科「MiniMax H3」词条
---

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens