
GPU管理:闲置GPU如同停飞的飞机

AI 的瓶颈已从模型能力转移到计算资源的利用率。GPU 的成本按日历小时累积,收入却只按计算小时产生,这与航空业飞机闲置问题高度相似。微软在 2020 年为 OpenAI 建造的专用超算(10,000+ GPU、285,000 CPU 核心)曾是全球最大系统之一,但到 2026 年,即使是资金最充裕的实验室(如 Anthropic 同时跨 Amazon、Google、Microsoft、AMD 四个平台,Meta 签署同等规模协议)仍视计算为战略约束。
企业通过 API 调用模型时,成本随 token 线性增长,自购 GPU 成为替代方案,但这带来新的问题:集群必须按峰值需求配置,而实际负载远低于峰值。更隐蔽的问题是,同一集群上的训练、推理、微调、量化等工作负载对 GPU 内存、延迟、持续时间的需求截然不同,为一种工作负载优化的调度器会误配其他类型。一个 GPU 在某个时刻可能正在跑低优先级的批处理任务,而高优先级的实时推理请求却在排队。
解决之道在于两个互补的方向:专用化(specialization)和编排(orchestration)。专用化使用更小的任务特定模型,大幅降低单个工作负载的资源需求,释放出容量。编排则持续决定释放的容量该分配给哪个工作负载、何时分配、以何种优先级。两者缺一不可:专用化没有编排,释放的容量无人回收;编排没有专用化,无可回收的容量。
GPU 管理正在成为一门新学科——一个位于工作负载、模型和硬件之间的编排层,持续做出分配决策,而不是依赖人工在凌晨三点看仪表盘。采购决策是一次性的,而分配决策每时每刻都在发生。掌握专用化与编排的企业将拉开差距,就像航空业中,同等机队的航空公司最终胜出在更高的飞机利用率。


