语音代理能搞定双语用户吗?代码切换ASR基准测评

语音助手遇到双语用户时,最头疼的问题是对方在句子中间自由切换语言(代码切换)。大多数语音代理在这方面表现糟糕,转录错误会一路传导到后续的意图识别和任务执行,导致工单派错或政策误解。这个问题在客服和IT支持场景里尤为致命。

我们构建了一个包含西班牙语-英语、法语-英语、加拿大法语-英语和德语-英语四种语言对的基准测试,用合成音频模拟真实的HR和IT工单对话。核心发现是:**ElevenLabs Scribe V2、Gemini 3 Flash和AssemblyAI Universal 3-Pro** 是最能扛住代码切换的三款模型,它们的词错误率(WER)和语义错误率都远低于其他竞品。有意思的是,**Gemini在语义保留指标上反超了AssemblyAI**,说明作为大型音频语言模型,它的理解能力弥补了转录精度的微小差距。底部垫底的是Whisper,如果没显式指定语言,它会默认把一切翻译成英语。

代码切换带来的额外成本并不统一:顶级模型只比单语基线多付出很小的代价,而弱者会雪崩式恶化。更反直觉的是,错误并非集中在语言切换点,而是集中在嵌入的英语片段上——哪怕这些模型平时处理英语最好。这暗示当前系统的“语码适应”能力还很薄弱。**对任何服务双语客户的企业而言,这个教训极其实用:不要凭感觉选ASR,必须拿你们真实的语言对去跑基准测试,否则你付的钱可能根本不匹配效果。**

Can Voice Agents Handle Bilingual Customers? Benchmarking Frontier ASR on Code-Switched Speech

查看原文