法国AI新星ZML发布免费推理软件,打破芯片锁定

AI 推理的成本和碎片化问题越来越严重。现在跑一个模型,往往被特定芯片的软件栈锁死,想换更便宜的 AMD 或者能效更好的 Google TPU,就得重写代码、重新优化,甚至性能还跑不满。ZML 这家法国创业公司,刚发布了一个叫 ZML/LLMD 的推理服务器,目标就是打破这种锁定。它能让同一个开源大模型,在 Nvidia、AMD、Google TPU、Apple Metal、Intel Arc 这些不同芯片上,都跑出接近极限的速度。这直接解决了企业最头疼的问题:不想被单一供应商绑架,又怕换芯片后性能掉得没法用。ZML 想给市场一个真正的选择权,让企业可以根据成本和能效,自由混搭芯片,而不是被 Nvidia 的生态死死捆住。

ZML 的解法很聪明,不是去造芯片,而是做一层跨芯片的推理软件层。核心产品 ZML/LLMD 是一个推理服务器,它最大的卖点不是支持多少种芯片,而是让每种芯片都跑出“最大可用速度”,甚至比原生方案还快。创始人 Steeve Morin 说,他们团队只有 20 个人,但资金充足,而且有和芯片公司“共同设计硅”的深度合作能力。这意味着 ZML 不是简单适配,而是深入到芯片的底层架构去优化。比如和欧洲那些新芯片公司 Axelera、Fractile 合作,做的是“全世界还没人做过的事”。ZML/LLMD 目前是免费产品,不开放源代码,目的是先收集真实使用数据,再决定怎么收费。Morin 的逻辑很务实:先别因为贪婪阻碍增长,等量起来再找最有效的变现点。

这件事最有意思的地方,不是 ZML 又做了一个推理加速器,而是它证明了 跨芯片的极致性能优化是可行的。过去大家都默认,想用非 Nvidia 的芯片就得忍受性能打折。ZML 用 20 个人的小团队,直接挑战了这个假设。如果它真能做到让 AMD、Google TPU 在推理场景下和 Nvidia 掰手腕,那整个 AI 基础设施的成本结构都会松动。企业不再只能买最贵的 H100,而是可以根据负载选最划算的芯片。这对欧洲那批新芯片公司是重大利好,因为他们缺的不是硬件,而是能让硬件发挥全部实力的软件生态。ZML 的免费策略也很聪明,先靠免费铺量、收集真实负载数据,再找最不阻碍增长的收费点。这种务实打法,比一上来就卖高价许可证要高明得多。

这件事的长期启发在于:AI 基础设施的竞争正在从硬件转向软件生态。Nvidia 的护城河不只是 H100 算力强,更是 CUDA 这个软件栈把开发者牢牢锁住。ZML 的路径是反过来的——先做一套跨芯片的推理优化层,让任何芯片都能跑出好性能,然后反过来倒逼硬件厂商来适配它。如果 ZML 真能跑通,它就会成为 AI 芯片界的“Linux”,让底层硬件变成可替换的 commodity。这对整个行业是好事:企业不用再被单一供应商绑架,新芯片公司也有机会靠软件生态突围。ZML 的 20 人小团队能拿到 2000 万美金融资,背后站着 Hugging Face 和 Docker 的创始人,说明资本也看到了这个逻辑。欧洲的 AI 基础设施创业,正在从“跟跑”变成“定义新规则”。

Hot French startup ZML releases free product to speed inference across lots of AI chips | TechCrunch

查看原文