GRPO超越英语:非英语与多语言环境下的大规模研究

这篇论文针对强化学习研究中长期存在的英语中心问题展开:现有的 RLVR(带可验证奖励的强化学习)和 GRPO(组相对策略优化)虽然已成为提升模型推理能力的主流方法,但相关实验几乎都在英语环境下完成。作者团队在多种基础模型、训练语言和不同推理语言奖励组合下,做了一次大规模的多语言与非英语 GRPO 实证研究。

核心发现有三条。第一,如果让模型用母语进行推理训练,其推理能力与用英语训练的差距其实很小,也就是说语言本身不是推理性能的瓶颈。第二,跨语言迁移效果显著,在一种语言上训练往往会提升多种其它语言的推理表现。第三,这些趋势高度依赖具体模型和语言组合,某些情况下,在特定语言上训练甚至会导致模型在其他语言的域外能力出现严重退化。

作者由此强调,RLVR 在非英语场景下确实能带来广泛的跨语言收益,但也必须配合全面的多语言评测,才能及时发现并规避语言相关的性能回退。这个结论对多语言模型的训练策略有直接的指导意义,也提醒研究者在追求跨语言泛化时不能只盯单一评测集。

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

查看原文