
构建低延迟多语言语音代理:NVIDIA Magpie TTS

语音交互的延迟预算很紧张:从音频采集、ASR、LLM推理到TTS生成,每一步都消耗毫秒。TTS是用户感知最直接的一环,生成慢了,整个体验就慢。NVIDIA Magpie TTS 是一个 364M 参数的开源权重模型,专为这种场景设计——你可以把它部署在自己的基础设施上,精确控制延迟,并按需定制。
最新版本将语言支持扩展到12种:英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语,以及新增的现代标准阿拉伯语、韩语和巴西葡萄牙语。每种语言都包含男声和女声,基于共享的多语言说话人表征。印地语和日语还增强了代码切换支持,通过 IPA 字素-音素处理和自定义发音词典,能更准确地念出专有名词和技术术语。
Magpie 的延迟优化来自两项架构改进。帧堆叠(frame stacking)让解码器每一步输出两个音频帧,解码步数减半。但帧堆叠会破坏同时生成的 codebook token 之间的依赖关系,降低音质;局部 transformer 模型负责建模这些依赖并修复质量。两项技术合在一起,既快又自然。这个设计发表在 ICASSP 2026 论文《Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation》中。
延迟数据基于 NVIDIA NIM 优化容器,在自有 GPU 上测得。B200 上单流 TTFA(首帧延迟)仅32ms,吞吐量达到 12.1 倍实时;64 流并发时 TTFA 239ms,吞吐量 319 倍实时。H100 单流 TTFA 47ms(14.7 倍实时),A100 单流 79ms(12.2 倍实时)。因为模型跑在你自己的机器上,你能直接测量服务器端延迟,没有托管服务的网络来回开销。
音质也在改善。相比上一版,法语字符错误率(CER)从 2.70% 降到 1.54%,说话人相似度(SSIM)从 0.703 升到 0.747;西班牙语 CER 从 1.14% 降到 0.60%,SSIM 从 0.715 升到 0.793。新加入的阿拉伯语(CER 1.62%)、韩语(2.69%)、巴西葡语(2.91%)建立了基准。数据来自 Magpie TTS Multilingual 模型卡。
开源权重带来的能力:你可以部署在私有或气隙环境,自己优化 serving 栈,用 NeMo 微调定制发音和音色。NVIDIA 提供了 Magpie TTS NIM 优化推理容器、NeMo 微调工具,以及 Nemotron Voice Agent 参考实现——它把 Nemotron Speech(流式 ASR)、Magpie TTS、Nemotron 语言/多模态模型、NIM 微服务组合成一个完整的语音代理系统,支持实时打断(barge-in)、多模态视觉理解、多智能体编排和次秒级端到端延迟。你可以在 NVIDIA Build 和 Hugging Face 上试听效果。


