NVIDIA Nemotron 扩散语言模型:向光速文本生成迈进

大语言模型的推理速度长期以来受困于逐 token 生成的架构——每次解码都需要完整加载模型权重,GPU 大部分时间在等待内存操作而非真正计算。NVIDIA 的 Nemotron-Labs Diffusion 给出了一条新路:把扩散生成能力直接嫁接到已有的 AR 模型上,让同一个模型同时支持三种推理模式——纯 AR 模式保持兼容性,扩散模式以 32-token 为块并行生成并迭代去噪,自推测(Self-speculation)模式则用扩散快速草稿,再用 AR 因果验证。实测在 B200 GPU 上,自推测模式跑到约 865 tokens/s,是同硬件上纯 AR 基线的 4 倍;若以 tokens per forward pass 计则提升 6.4 倍。更重要的是这一切在部署层面只需要改一行配置,应用代码无需改动。模型族覆盖 3B/8B/14B,商用友好 License,即将合入 SGLang 主分支。

这个工作的核心聪明之处在于它没有从头训练一个全新的扩散语言模型,而是通过持续预训练把扩散能力注入已有的 AR 模型。预训练用了 1.3T tokens 的 Nemotron 数据集,又用 45B tokens 做了 SFT,本质上是在保留学到的语言能力的同时解锁并行解码。这个 joint AR + diffusion objective 的设计思路很务实。

对从业者而言,这意味着推理引擎不再是非此即彼的选择——扩散不是要取代 AR,而是在特定场景下(比如大批量、低延迟需求)提供可调节的加速层。模型可以在扩散的快速草稿和 AR 的精确验证之间找到平衡,甚至按请求动态切换模式。Diffusion 也不再只是图像生成领域的专属范式,它在文本生成上的潜力正在被真正工程化落地。

Towards Speed-of-Light Text Generation with Nemotron-Labs Diffusion Language Models

查看原文