LenVM:token级长度建模的可扩展价值预训练

现有AI模型在生成文本时,只能粗略控制整个序列的长度,缺乏对每个token位置的精细感知。这意味着用户要么接受固定长度输出,要么忍受不可控的生成过程和不可预测的推理开销。当需要精确控制输出长度(比如限制投票或代码生成)时,传统方法往往表现很差,要么早早截断丢失信息,要么生成过多浪费token。这种粗粒度限制直接导致性能与效率的权衡难以优化

LenVM的核心洞察是把剩余生成长度变成一个价值估计问题。给每个生成的token一个固定的负奖励,然后用折扣回报来预测还剩多少token要生成。这个信号是密集的——每个token都有监督,不需要人工标注,且天然无偏。在7B模型上,这种训练让模型对长度变得极其敏感,在LIFEBench精确长度匹配任务中,长度分数从30.9跳到64.8,甚至超过了GPT-4等闭源模型。更重要的是,它允许在推理时动态控制预算,在GSM8K上只用200个token就保持了63%的准确率,而普通的token预算基线只有6%。

LenVM最让我兴奋的地方,不是它在基准上刷了分,而是它提供了一种全新视角:把长度当作一个token级别的价值信号来建模。这个思路一旦打通,未来很多问题都可以重新思考——比如对推理成本做精细化的控制,或者将长度价值作为强化学习奖励信号来训练更高效的模型。另外,token级别的价值图还能让我们看到模型在生成过程中,哪些token导致了推理路径变长或变短,这对理解模型内部行为极有价值。LenVM是一个基础框架,不是某个特定任务的trick,它可能成为未来高效推理和可解释性研究的基石。

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

查看原文