先讲个你每天都会遇到的破事。你对语音助手说“导航到张衙前巷”,它给你蹦出“张亚倩想”。不是它听错了声音,是它不认识“张衙前巷”这个词——专业叫语境偏置(context biasing):用户给的专有名词,得在严格延迟下被准确认出来。
Bataev 等人(arXiv:2608.21343,NVIDIA 埃里温+圣克拉拉)的 TurboBias 2.0,是给 Transducer 架构 ASR 用的生产级短语增强框架。它把上一代 GPU 加速的 TurboBias 扩展了两点:不分大小写的增强图,加上“每流批处理解码”——一个批次里每句话可以用各自独立的语境偏置配置。
这意味着什么,得说人话:
- 多用户同时在线,各人的专属词表互不串味,张三的“老王”不会污染李四的“网管”;
- 离线、流式都能跑,贪婪搜索和束搜索都兼容,等于把生产环境要的几种模式全包了;
- “不分大小写”听着小,实则省掉一堆预处理边界 bug。
收尾钉子:看它在大厂语音产品里做 A/B 时,“偏置命中率提升”能不能换来用户少骂一次“你又听错了”——那才是生产 ASR 唯一的真指标。