素材:GitHub microsoft/VibeVoice 链接 + 网盘资源包 + 备注「显存14G」|海关 6 路:仓库 API + README 全文 + 两篇 arXiv 原页 + News 时间线逐条核
海关先给结论:仓库真实且极热——微软官方、54,542 star、MIT、09-03 还在更新。备注的「显存 14G」对上算术:ASR-7B 的 bf16 全量恰好 14GB(7B×2 字节),网盘那个包大概率就是 ASR 一族。但这个仓库最值得读的不是部署表,是 News 时间线——那是一部「发布、撤码、转向」的家族史,而 TTS 线至今没有恢复。
家史:11 天,从发布到撤回
2025-08-25,微软开源 VibeVoice-TTS:90 分钟长音频、4 个说话人的多语音合成,后来拿了 ICLR 2026 Oral。11 天后,2025-09-05,微软把 TTS 代码从仓库移除,原话是「发现工具被以与声明意图不一致的方式使用」——生成语音太逼真,滥用风险压过了开源展示。撤的是生成端,不是整个项目:12 月,Realtime-0.5B 回归(TTS 侧最小的那个,支持流式文本输入、9 种语言加 11 种英文风格声);2026 年 3 月 ASR 进 Azure AI Foundry Labs;7 月 ASR-BitNet 出边缘 CPU 引擎;9 月 3 日 ASR-Streaming 发布——边说边转写、标注「谁在何时说了什么」、支持热词、10 种语言。模型表里 TTS-1.5B 的 Quick Try 一栏,至今写着 Disabled。
发布 11 天后亲手撤码,在断言强度阶梯上不是污点,是发布者自己关验证带宽的闸:deepfake 风险实在太大,先撤生成端。转向用的还是同一套底座——7.5Hz tokenizer 没变,变的只是从生成声学细节换成理解声学细节。生成侧风险大就先做理解侧,这是结构,不是产品线简介。
7.5Hz:时间轴上的接口位置
VibeVoice 的核心是连续语音 tokenizer(声学+语义双路)压到 7.5Hz,外加 next-token diffusion:LLM 自回归走语义层、扩散头并行展开声学细节,论文根是微软的 LatentLM(arXiv 2412.08635)。
本号语音谱系的读者会认出这是第三种解法。Luna-TTS 案的对偶——AR 拍扁 RVQ 网格丢结构,Block Diffusion 保结构——比的是解码顺序这个接口。VibeVoice 换了维度:不比顺序,比帧率。7.5Hz 意味着每秒语音只占 7.5 个 token,90 分钟音频约四万 token,塞得进 LLM 上下文;换成 75Hz 的 RVQ 网格就是四十万,长音频直接出局。ASR 那个「60 分钟单 pass、64K token、who/when/what 结构化输出」的能力,全是 7.5Hz 这个接口位置买来的。帧率每降一档,长音频的上下文经济学重算一次——帧率是时间轴的量化粒度,跟量化位宽在空间轴上的角色完全同构。
BitNet 线:连显卡都裁了
2026-07 的 ASR-BitNet 用 I8_S+I2_S 异构量化把模型从 4.62GB 压到 1.58GB,3 条 CPU 线程实时(RTF<1),无需 GPU。端侧谱系的读者对比一下:Thor-U、TensorFold、Strata 那条线还在争 8GB 显存怎么省,语音这边已经把显卡整个裁掉了。部署坍缩在语音模态走到极点,比文本模态更狠——因为语音 token 本身就少 10 倍。
部署侧的实用信息
网盘里那个包,ASR-7B 能直接跑(14GB 显存是 bf16 全量,量化可再压);ASR-Streaming、Realtime-0.5B 是官方活线,Colab 就能试;TTS 只有社区 fork 的延续——官方版本停在了 2025-09-05 那个撤码声明里。资源包若是 TTS fork,注意它的谱系是社区接管的,微软官方代码不背书。
可打脸预测两条:一,12 个月内 TTS 以受控形式回归官方仓库(水印或审计日志前置),或者永久停在 fork 社区成为「发布-撤回」的教科书案例;二,ASR-Streaming 的实时 who-said-what 结构化输出,会成为 agent 语音前端的标配接口——会议场景的 ground truth,卡位逻辑同 MHS 给物理世界发的那个 MCP。
结尾停在网盘那个包上:下载之前先问一句它装的是哪条线——ASR 是微软的现在,TTS fork 是微软的过去,两者共用同一个 2025 年 8 月的起点。
核验链:GitHub API(star/push 时间/无 release 记录)、README 全文(News 六条时间线原文、模型表 Disabled 标注、7.5Hz 表述)、arXiv 2412.08635(Multimodal Latent Language Modeling with Next-Token Diffusion)、arXiv 2609.02812(VibeVoice-ASR-Streaming Technical Report)、ICLR 2026 Oral 为 README 自述、14G 显存为 7B bf16 算术推断(7×2=14GB),网盘内容未实测,资源谱系以 README 模型表为准。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。