
Open ASR排行榜新增首个南半球语言

语音识别基准(Benchmark)决定研究方向。模型在 Open ASR Leaderboard 上得分高就会被采用和迭代,而基准不测的能力往往得不到改进。但一个聚合的 WER(词错误率)掩盖了大量差异:已有研究显示商业系统对黑人讲话者的错误率约是对白人的两倍,性别、年龄、口音也带来不同。这些差异在排行榜上看不到,因为测试集只记录说了什么,几乎不记录谁在说。
为填补这一空白,Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增两个评估集:Monsoon en-IN(印度英语)和 Monsoon hi-IN(印地语)。印地语是首个登上该排行榜多语言标签页的非欧洲语言。每个集合分为公开 split(可自测)和私有 split(限制针对性优化)。四个 split 共用 4,888 个说话人,每个说话人记录 12 项属性。
Monsoon 的设计原则是让测试集沿九个维度变化:地理、年龄、性别、词汇、设备、声学环境、说话类型、语速、以及同一音频存在多个有效转写。这九个维度正是聚合 WER 对整体正确但对特定人群错误的来源。数据通过 Voice Arena 社区在印度数百个地区招募,贡献者使用个人手机和网络(室内外环境),不提供统一硬件。话题是日常主题(旅行、医疗、教育等),引导贡献者表达意见、叙述和回忆,从而出现命名实体、数字和非排练表述。
数据来自非脚本的双通道自发对话,每段对话按说话人分割为独立片段。除了时长、语言等字段,每个片段还记录职业、教育、婚姻、收入、手机品牌、现居城市和在该地区居住年数。公开的印度英语 split 包含 1,444 个说话人,总时长 5.62 小时,平均片段 9.6 秒;来自 428 个地区,涵盖 30 个邦/联邦属地;设备型号达 556 种,排名第一的型号不超过总片段的 2.1%。印地语 split 结构类似但更集中在印地语地带。
关键特征在于说话人多样性而非总时长:超过一半的说话人只贡献一个片段,前十大贡献者占总时长的 2.8%-6.8%。这意味着某个模型在 Monsoon 上的结果是数百个不同声音的平均值,而非少数几个长篇说话人的分数。与此相比,同规模的测试集通常相反(少数人录很长)。
质量控制严格:通过语言识别验证语言,用分类器确认自报性别,用模型检测是否为预录音而非实时对话,过滤信噪比过低片段但故意保留自然背景噪声。转写由本土语言学家执行五级协议:初稿用内部 ASR 模型(不出现在任何公开排行榜),后续每轮纠正后由不同语言学家独立验证,逐步解决发音歧义、语码转换、命名实体和拼写变异。数字写为单词。
一个示例展示了元数据如何揭示排行榜的盲区。八个模型在公开印度英语 split 上的 WER 介于 4.81-4.99 之间,几乎不可区分。但按区域分组后,差距扩大:mistralai/Voxtral-Mini-3B-2507 在中部区域 WER 为 4.38,在东部高达 6.06。不同模型表现最差的区域各不相同,说明差异来自模型而非音频本身。同一分析可扩展到年龄、教育、职业和设备。
印地语的正字法变体问题更复杂。英语拼写可以归一化,但印地语日常口语严重语码混合,英语词没有固定天城体写法,复合词分写合写都算对。单条短语可能有十几种有效写法。如果只用单一转写计算 WER,系统会根据‘刚好碰对了哪个拼写’而得分不同。因此印地语版本使用研究者 AI4Bharat 提出的正交信息词错误率(OIWER):每个片段附带一个由语言学家确认的有效拼写集合(lattice),假设参考的每个跨度有多个可接受形式,只有真正识别错误才扣分。实测对比显示,用单一参考计算时排名会发生变化——两个系统按 OIWER 得分等价,按 WER 可能顺序颠倒。
评估方式:私有 split 通过 Hugging Face 团队在 Open ASR Leaderboard 上运行。印度英语加入主排行榜默认列,贡献到每个模型的平均 WER;印地语出现在多语言标签页,只有当模型支持所有选中语言时才进行排名,以确保公平对比。
Monsoon 不解决所有问题,但它让问题可见:给排行榜新增一个自带丰富说话人元数据和拼写 variant 信息的测试集,使得两个系统之间的差异可以追溯到谁在说以及他们如何书写,而不再消失在一个数字里。这是 Voice Arena 面向全球南方更广泛数据集计划的一部分。


