Thinking Machines发布Inkling多模态模型

处理多模态数据(图像、音频、文本)的大型模型要么闭源,要么是多个专用模型拼凑而成,上下文窗口短、部署成本高。Inkling 直接解决了这个痛点:它是首个开源的原生多模态 MoE 模型,拥有近 1T 参数1M 上下文窗口,能同时理解图像、音频和文本,无需外部编码器或拼接。

Inkling 的架构很硬核:采用 Mixture-of-Experts,256 个专家中只有 41B 活跃参数,推理速度快。它用相对注意力替代 RoPE,5:1 混合注意力(滑动窗口+全局),还加了短卷积层来增强局部建模。多模态输入通过简单的 MLP 和离散化 mel 谱图处理,没有独立编码器。更妙的是,它内置 MTP 推测解码,可在不改变输出质量的前提下加速生成。官方还提供了 NVFP4 量化版本,将显存需求从 2TB 降到 600GB,并支持 SGLang、vLLM、llama.cpp 等主流推理框架。

我的看法是:Inkling 代表了多模态模型走向原生统一架构的趋势——不再依赖多个专用编码器,而是让模型以一个统一的 Transformer 处理所有模态。这种设计降低了构建多模态应用的工程复杂度。同时,开源、1M 上下文、MTP 加速和量化版让大模型在真实场景中变得可用。未来,类似架构很可能成为多模态推理的标配,尤其是在 agentic 场景里,能同时看、听、想、写,能力边界会进一步拓宽。

Welcome Inkling by Thinking Machines

查看原文