AI 快讯

LenVM:token级长度建模的可扩展价值预训练

生成式模型的输出长度很难精确控制,但LenVM通过在每个解码步预测剩余长度,实现了超细粒度的长度管理。在LIFEBench上,7B模型长度分数直接从30.9飙到64.8,超过GPT-4。关键是,它不需要额外标注,训练信号天然密集。想控制推理成本又不想牺牲性能?这个思路值得关注。

阅读详情LenVM:token级长度建模的可扩展价值预训练