
Stoke Space:用软件调度解决AI算力浪费问题

先别急着说AI落地难,真正让CEO们睡不着觉的,是算力基建的高昂成本和物理瓶颈。Stoke Space加入KPCB,就是看准了这个痛点——当前数据中心用电量爆炸,云厂商们有钱却买不到足够的GPU,更别提部署和运维的噩梦级复杂度。文章指出的核心问题是:在摩尔定律放缓的今天,随着模型参数和推理需求持续飙升,传统的x86+集中式CPU架构已经无法匹配AI工作负载的动态变化,导致大量算力被闲置在资源孤岛中,造成惊人的80%平均利用率仅15%的浪费。
Stoke的打法非常务实且硬核。他们没有去尝试颠覆芯片设计,而是构建了一个AI原生的编排平台——你可以把它理解成一个极度智能的“算力调度大脑”。这个大脑通过软件定义的虚拟化技术,将异构算力(CPU、GPU、ASIC等)进行抽象和动态切分,并利用自动化的故障预测与自愈机制,将机架层面的平均无故障时间从小时级提升到了分钟级。更绝的是,他们借鉴了数据中心内部SDN的思路,通过自定义的RDMA网络零拷贝技术,让分散在不同物理机上的GPU能够高效协同工作,将跨节点分布式训练的性能损耗从行业平均30%压缩到了7%以内。
从技术人的角度看,Stoke的路径揭示了一个关键趋势:未来十年,算力基础设施的竞争不再只是单纯赛跑谁的芯片更厉害,而是比拼谁能像管理亚马逊云资源一样,管理起物理世界里的GPU集群。这意味着整个CSP(云服务提供商)的架构将加速从“虚拟机优先”转向“容器化、算力池化、意图驱动”。对于手握大量老旧CPU服务器但又想切入AI赛道的企业来说,Stoke提供了一条不需要彻底重建机房的“软升级”捷径。这会倒逼NVIDIA等厂商开放更多底层光谱使用权限,也让软件定义计算不再是纸上谈兵。


