Real World VoiceEQ:衡量语音AI的人类质量

语音AI这几年进步飞快,词错误率下来了,延迟也达到了对话级,很多传统基准都快饱和了。但如果你真的在用语音AI,比如客服或者语音助手,一定觉得哪里不对劲——模型在对话中声音会变来变去,抓不住你的犹豫和不确定,对带口音或者噪音的说话更是吃力。问题在于,现有基准只盯着延迟和词错误率,完全忽略了真实对话中那些人类最在意的东西:它有没有在认真听?情绪对不对?声音是否自然一致?这些细节不用上万人打分根本看不出来。

Hume AI 为了量这些“人类质量”,搞了个新基准叫 Real World VoiceEQ,直接上了超过100万条人类评分,覆盖40多个模型、15+评估维度、60多个指标,包括TTS和STS。他们拿自己的Kairos平台让真人打分,然后发现几个很扎心的结论:第一,现在没有哪个模型能通吃所有能力,一个擅长念数字的模型可能完全不会表达情绪,专门化才是现状;第二,模型普遍更会“说”而不是“听”,很多系统根本不理语调、停顿、音量这些副语言信息,比如银行客服问你是不是本人操作,你犹豫的“嗯…是”和自信的“是”在文字上看一模一样,但模型往往分不出来;第三,传统基准严重高估了真实表现,比如在噪声背景下词错误率比音乐背景下高四倍,单一背景分根本掩盖了真实失败模式。

这件事给我的启发是:语音AI要想真正成为主流交互界面,不能只卷速度和准确率,必须把“人类感知质量”当作核心指标。专门化趋势意味着以后选模型要按场景来——客服要精准,虚拟陪伴要情感,导航要抗噪,没有万能药。自动化评估在客观任务上还行,但像“声音是否适合这个角色”这种主观判断,目前还得靠真人。Hume的这个基准至少给行业提供了一个更接地气的测量方法,让开发者能看清自己模型在真实对话中的短板,而不是盲目刷分。这对于那些追求产品体验的团队,是实实在在的参考。

Introducing Real World VoiceEQ: Measuring the human quality of voice AI

查看原文