Kog:从GPU挤出更多推理能力

法国初创公司 Kog 正在用软件优化的方式从现有数据中心 GPU 中挤出更多推理性能。创始人兼 CEO Gaël Delalleau 认为,现代 GPU(如 AMD MI300X 和 NVIDIA H200)的内存带宽远未被充分利用,通过底层逆向工程可以大幅提升解码速度。Kog 在 5 月的技术预览中登顶 Hacker News,展示其 Kog Inference Engine (KIE) 能在企业已有的标准 GPU 上实现单请求极速解码,使用自己开源的 Laneformer 2B 模型(约 20亿参数)达到了每秒 3000 个 token 的吞吐量。公司声称这一方法最终能带来 30 倍的推理加速,但目前仅在小模型上验证过。

市场对 Kog 的反馈积极:CEO 表示已经获得 200 条商业线索。早期用户主要是等待 Claude Code 等工具长时间推理结果的开发者和专业用户。Kog 发现,潜在客户不愿微调小模型,因此将重心转向加速大规模语言模型(LLM)。Delalleau 计划在 9 月前 让首个主流大模型在 KIE 上跑出 10 倍加速,以此证明技术可行性并启动 A 轮融资。

Kog 的技术路线非常“硬核”。Delalleau 拥有固态物理背景和顶尖白帽黑客经历(四次 DEF CON CTF 决赛选手),他要求团队 从 GPU 的物理定律和汇编代码层面入手,逐芯片逆向工程,理解硬件后重新设计软件路径。这种方法极度耗时:每支持一款新 GPU,团队需要投入 数周甚至数月 进行底层工程研究。目前 Kog 团队只有 11 人,限制了同时支持的芯片种类。

长远来看,Kog 希望将这套方法论自动化、代理化,以覆盖更多芯片和模型。欧洲正试图构建自主 AI 能力,Kog 已获得 Scaleway 支持,以及法国 Bpifrance 和 French Tech 2030 的资助,这可能带来地缘优势。竞争对手包括同样来自法国的 ZML(提供绕过 CUDA 的硬件无关软件),但 Delalleau 认为 Kog 更接近斯坦福的 Hazy Research 实验室,专注于最底层的 GPU 加速。

目前最大的挑战是证明其方法在百亿、千亿参数大模型上同样有效。一旦 9 月目标达成,Kog 将具备真正的客户牵引力。在此之前,它是一家靠深度技术信仰和少量种子资金运转的种子轮公司。

Kog is going deeper to squeeze more inference out of GPUs | TechCrunch

查看原文