ARBITRAGE:基于优势感知的高效投机推理框架

长链推理(Chain of Thought)让大语言模型的推理能力大幅提升,但推理时的高计算成本也随之而来。针对这一问题,现有加速技术里,投机解码(Speculative Decoding)是一种常见思路:它用一个快速但不那么准确的草稿模型(draft model)逐 token 自回归地生成候选,再由能力更强的目标模型(target model)并行验证。不过,在推理任务中,逐 token 的验证方式会因为语义等价步骤里的 token 不匹配而频繁误拒,白白浪费算力。

后来的方法转向了步级(step-level)语义验证,不再逐个 token 比较,而是整步接受或拒绝,效率有所提升。但已有步级方法依然存在痛点:被拒绝的步骤被反复重新生成,改进有限,目标模型的计算资源没有得到充分利用。

针对这个局面,UC BerkeleyICSILBNL 的研究者提出了 ARBITRAGE,一个步级投机生成框架。它的核心思想是动态路由:不是用固定的接受阈值,而是训练一个轻量级路由器(router),让它预测目标模型在某个步骤上是否会产生明显更优的结果。这个路由器近似一个理想化的 ARBITRAGE ORACLE——总是选择质量更高的那一步,从而在效率和准确率之间取得近乎最优的平衡。

在多个数学推理基准上的实验显示,ARBITRAGE 持续优于之前的步级投机解码基线,在匹配准确率的前提下,推理延迟最高可降低约 2 倍。这项工作已被 NeurIPS 2024 的 Efficient Natural Language and Speech Processing(ENLSP)Workshop 接收。

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

查看原文