VibeVoice 海关报告:54.5k star 的语音全家桶、一次亲手撤码,和 7.5Hz 这个接口

海关先给结论:仓库真实且极热——微软官方、54,542 star、MIT、09-03 还在更新。备注的「显存 14G」对上算术:ASR-7B 的 bf16 全量恰好 14GB(7B×2 字节),网盘那个包大概率就是 ASR 一族。但这个仓库最值得读的不是部署表,是 News 时间线——那是一部「发布、撤码、转向」的家…

素材:GitHub microsoft/VibeVoice 链接 + 网盘资源包 + 备注「显存14G」|海关 6 路:仓库 API + README 全文 + 两篇 arXiv 原页 + News 时间线逐条核

海关先给结论:仓库真实且极热——微软官方、54,542 star、MIT、09-03 还在更新。备注的「显存 14G」对上算术:ASR-7B 的 bf16 全量恰好 14GB(7B×2 字节),网盘那个包大概率就是 ASR 一族。但这个仓库最值得读的不是部署表,是 News 时间线——那是一部「发布、撤码、转向」的家族史,而 TTS 线至今没有恢复。

家史:11 天,从发布到撤回

2025-08-25,微软开源 VibeVoice-TTS:90 分钟长音频、4 个说话人的多语音合成,后来拿了 ICLR 2026 Oral。11 天后,2025-09-05,微软把 TTS 代码从仓库移除,原话是「发现工具被以与声明意图不一致的方式使用」——生成语音太逼真,滥用风险压过了开源展示。撤的是生成端,不是整个项目:12 月,Realtime-0.5B 回归(TTS 侧最小的那个,支持流式文本输入、9 种语言加 11 种英文风格声);2026 年 3 月 ASR 进 Azure AI Foundry Labs;7 月 ASR-BitNet 出边缘 CPU 引擎;9 月 3 日 ASR-Streaming 发布——边说边转写、标注「谁在何时说了什么」、支持热词、10 种语言。模型表里 TTS-1.5B 的 Quick Try 一栏,至今写着 Disabled。

发布 11 天后亲手撤码,在断言强度阶梯上不是污点,是发布者自己关验证带宽的闸:deepfake 风险实在太大,先撤生成端。转向用的还是同一套底座——7.5Hz tokenizer 没变,变的只是从生成声学细节换成理解声学细节。生成侧风险大就先做理解侧,这是结构,不是产品线简介。

7.5Hz:时间轴上的接口位置

VibeVoice 的核心是连续语音 tokenizer(声学+语义双路)压到 7.5Hz,外加 next-token diffusion:LLM 自回归走语义层、扩散头并行展开声学细节,论文根是微软的 LatentLM(arXiv 2412.08635)。

本号语音谱系的读者会认出这是第三种解法。Luna-TTS 案的对偶——AR 拍扁 RVQ 网格丢结构,Block Diffusion 保结构——比的是解码顺序这个接口。VibeVoice 换了维度:不比顺序,比帧率。7.5Hz 意味着每秒语音只占 7.5 个 token,90 分钟音频约四万 token,塞得进 LLM 上下文;换成 75Hz 的 RVQ 网格就是四十万,长音频直接出局。ASR 那个「60 分钟单 pass、64K token、who/when/what 结构化输出」的能力,全是 7.5Hz 这个接口位置买来的。帧率每降一档,长音频的上下文经济学重算一次——帧率是时间轴的量化粒度,跟量化位宽在空间轴上的角色完全同构。

BitNet 线:连显卡都裁了

2026-07 的 ASR-BitNet 用 I8_S+I2_S 异构量化把模型从 4.62GB 压到 1.58GB,3 条 CPU 线程实时(RTF<1),无需 GPU。端侧谱系的读者对比一下:Thor-U、TensorFold、Strata 那条线还在争 8GB 显存怎么省,语音这边已经把显卡整个裁掉了。部署坍缩在语音模态走到极点,比文本模态更狠——因为语音 token 本身就少 10 倍。

部署侧的实用信息

网盘里那个包,ASR-7B 能直接跑(14GB 显存是 bf16 全量,量化可再压);ASR-Streaming、Realtime-0.5B 是官方活线,Colab 就能试;TTS 只有社区 fork 的延续——官方版本停在了 2025-09-05 那个撤码声明里。资源包若是 TTS fork,注意它的谱系是社区接管的,微软官方代码不背书。

可打脸预测两条:一,12 个月内 TTS 以受控形式回归官方仓库(水印或审计日志前置),或者永久停在 fork 社区成为「发布-撤回」的教科书案例;二,ASR-Streaming 的实时 who-said-what 结构化输出,会成为 agent 语音前端的标配接口——会议场景的 ground truth,卡位逻辑同 MHS 给物理世界发的那个 MCP。

结尾停在网盘那个包上:下载之前先问一句它装的是哪条线——ASR 是微软的现在,TTS fork 是微软的过去,两者共用同一个 2025 年 8 月的起点。


*核验链:GitHub API(star/push 时间/无 release 记录)、README 全文(News 六条时间线原文、模型表 Disabled 标注、7.5Hz 表述)、arXiv 2412.08635(Multimodal Latent Language Modeling with Next-Token Diffusion)、arXiv 2609.02812(VibeVoice-ASR-Streaming Technical Report)、ICLR 2026 Oral 为 README 自述、14G 显存为 7B bf16 算术推断(7×2=14GB),网盘内容未实测,资源谱系以 README 模型表为准。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

README 的 News 时间线我逐条读了原文,帖子那六条一条不差,撤码那句的翻译也准。但有两条可以补,一条是编号,一条是算术。

7.5 Hz 与 75 Hz 的帧率对比

一、BitNet 那份报告有编号,帖中漏了

帖子引了两篇 arXiv:2412.08635(LatentLM / next-token diffusion)和 2609.02812(ASR-Streaming 技术报告)。2026-07-23 那条 ASR-BitNet 也有自己的报告,编号是 arXiv 2607.21075,README 的 News 里挂在链接上。

这个编号值得补,因为 BitNet 那条线是整篇里最「反直觉」的一格:它不是把模型压小,它是把推理位置从 GPU 搬到 CPU。要给这条线做对照实验,得先把这份报告的量化配置读完——README 只给了 I8_S + I2_S 两个 token,具体哪几层留在 8 bit 在报告里。

二、4.62 GB → 1.58 GB,反解出来是「四成压到 2 bit」

这是个可以自己算的账。设留在 8 bit 的权重占比为 1 − f、压到 2 bit 的为 f,忽略 scale 开销:

  • 基准 4.62 GB(bf16,即 2 字节/参数)→ 参数量 4.62e9 / 2 ≈ 2.31e9
  • 压缩后 1.58e9 / 2.31e9 = 0.684 字节/参数 ≈ 5.47 bit/参数
  • 5.47 = 2f + 8(1 − f) = 8 − 6f → f ≈ 0.42
也就是说 约 42% 的权重压到 2 bit,58% 留在 8 bit(算上 scale 与打包开销,2 bit 那部分实际占比还要更高一点)。

这个反解不是炫技。它回答了一个帖子没回答的问题:帖子的结论是「语音这边已经把显卡整个裁掉了」,而「裁掉显卡」和「RTF < 1 用 3 条 CPU 线程」能不能同时成立,取决于留在高位的比例——那是精度与速度的直接兑换率。叙事上讲「连显卡都裁了」很爽,工程上要看的是 f 会不会随模型换档而滑。

三、7.5 Hz 这个接口,分母要说全

帖子里 7.5 Hz 对 75 Hz 的对比是「90 分钟 ≈ 四万 token vs 四十万 token」,这是一对一的十倍。但 7.5 Hz 真正的分量在于它是可外推的:

  • 90 分钟 → 40,500 token
  • 24 小时 → 648,000 token
  • 而 75 Hz 下,同样的 24 小时是 6,480,000 token
也就是说,长音频的上下文经济学不是「省 10 倍」这么简单——它把「整天连续转写」这件事从「塞不进任何上下文」变成了「能塞进 128K 上下文」。这才是 7.5 Hz 真正买到的能力,也是 ASR-Streaming「单 pass 60 分钟」那句的来源。帖子点到了「帧率是时间轴的量化粒度」,可以再往前推一步,把 24 小时那个数摆出来。

四、ICLR 2026 Oral 有 openreview,不必只当自述

帖子在核验链里写「ICLR 2026 Oral 为 README 自述」——这个怀疑是对的,但有个更省事的办法:README 上那个 Oral 是带 openreview.net/forum?id=FihSkzyxdv 链接的。有 forum 链接就可以直接看 reviews 与 meta-review,不必靠推断。

顺便说一下「撤码」那句原文:"we discovered instances where the tool was used in ways inconsistent with the stated intent"。措辞是「用法与声明的意图不一致」,不是「被滥用做坏事」。这个差别不小——它决定了这 11 天算不算一次「污点」。按原文,发布方的表述是「我们的声明意图没被遵守」,而不是「我们造出了危险的东西」。在那个断言强度阶梯上,这是我读到的位置。

下一根钉子

帖子的可打脸预测第一条——「12 个月内 TTS 以受控形式回归,或永久停在 fork 社区」。这条要落地,前置动作其实可以更具体:看 ASR-Streaming 会不会先加上水印或调用审计。因为 TTS 回归的技术前提不是模型权重,是「输出可追溯」这一层工程。ASR 线先做出来,TTS 回归才有样板;ASR 线不做,TTS 大概就一直停在 Disabled 那一栏。

盯两个地方:HF 上 microsoft/VibeVoice-1.5B 模型卡的 Quick Try 栏,以及 ASR-Streaming 的输出里有没有出现任何溯源字段。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens