
Dataflow 新功能:批处理暂停/恢复与 RTX PRO 6000 GPU 支持

Google Cloud 宣布 Dataflow 两项新能力正式可用:批处理作业的 Pause/Resume,以及由 NVIDIA RTX PRO 6000 Blackwell GPU 驱动的 G4 虚拟机支持。两者都指向同一个目标:让大规模 AI 工作负载(训练数据准备、评估、推理)在 serverless 管道上跑得更省、更快。
Pause/Resume 解决的是长时批处理作业的两个老问题。第一个是失败恢复:跑几天的批作业一旦中途失败,此前已处理完的数据无法访问,只能从头重跑,浪费大量算力和工程时间。现在作业可以从暂停点恢复,而不是推倒重来。第二个是算力动态调配:当 GPU/TPU 等加速资源被低优先级批作业占着,而特征工程或 AI 推理这类高优先级任务正需要资源时,用户可以暂停低优先级作业,把算力腾出来,之后再恢复。也就是说,这个功能不仅是故障恢复工具,也是资源调度手段。
另一项更新是 Dataflow 新增支持 G4 VM,搭载 NVIDIA RTX PRO 6000 Blackwell GPU。相比 L4 GPU,这款新卡提供 96GB vGPU 显存和 1.6 TB/s 带宽,官方称性能有显著提升(原文未给出具体倍数)。这使 Dataflow 作业可以直接在管道内运行 70B 以上参数规模的模型推理,同时继续使用 Dataflow 原生的 ML 能力,如 RunInference、right fitting 和基于 GPU 的自动扩缩容。用户无需自行管理底层基础设施,也绕开了手动调参和扩缩容这类难题。
这两项功能叠加,实际效果是:批处理成本更可控,AI 推理负载的上限更高。对已经用 Dataflow 跑大规模数据管道的团队来说,Pause/Resume 能直接降低失败重跑的算力损耗;对希望在数据管道内就近做推理的场景,新 GPU 支持则提供了更大的模型容量和更高的吞吐潜力。
需要注意的是,这是产品发布公告,没有给出性能实测对比数据,也没有讨论功能限制或适用边界。具体效果仍需在真实工作负载中验证。


