
llm-d项目引入协同时间切片提升RL训练效率

分布式RL后训练(如GRPO)面临严重的GPU闲置问题。同步RL中,采样和训练严格串行执行,导致GPU在40%-60%的生命周期内完全空闲。异步架构虽能重叠部分阶段,但训练器仍需等待批次轨迹数据,空闲间隙依然存在。llm-d项目提出的协同时间切片(co-operative time-slicing)通过将独立RL作业动态交错到共享物理硬件上,有效消除结构性的资源浪费。
核心思路是:当一个作业进入空闲阶段(如等待采样结束),系统将其完整设备状态checkpoint到主机DRAM,然后恢复另一个作业之前保存的状态,实现GPU的快速上下文切换。
架构分为三层:workload-scoped层(用户代码通过acquire/yield gRPC API标记加速器阶段)、cluster-scoped层(时间切片编排器维护锁队列,决定哪个作业获得GPU访问权)、node-scoped层(快照代理执行实际的checkpoint/restore操作,基于cuda-checkpoint后端)。
初始基准测试显示,这种方法可将聚合加速器占空比从约40%基线提升至70%,且不影响模型收敛或精度。这意味着价格性能比提升和TCO降低。llm-d还围绕RL效率构建了完整栈,包括吞吐驱动推理引擎llm-d-router、高速Agent沙箱recipe、以及权重传播接口WPI。目前完整时间切片栈已开源,包括快照代理、编排器和Python客户端库。
未来路线图包括优化checkpoint/restore延迟、自动调度作业配对、以及扩展到TPU等硬件。


