JetBrains 发布 Mellum2:专注低延迟文本代码任务的 12B MoE 模型

大模型时代,AI 系统的成本和延迟问题正在被忽视。当大家在追逐越来越大的模型时,却忘了生产系统中大量高频任务根本不需要那么强的算力——路由、摘要、RAG 后处理这些操作,用顶级模型就是杀鸡用牛刀。

JetBrains 的解法是 Mellum2,一个 12B 参数的 MoE 模型,但每个 token 只激活 2.5B 参数。通过稀疏激活机制,它在保持模型容量的同时把推理速度做到同类模型的 2 倍以上。这个策略很聪明:不做全能选手,而是把文本和代码两个场景做深,做成一个高效、可私有部署的”工具人”。

Mellum2 让我想到一个趋势:**AI 系统的架构正在从大一统走向模块化**。不是每个任务都需要 GPT-4 这个级别的选手,一个精干的小模型往往更合适。JetBrains 把这种思路总结为”focal model”——专注于高频子任务的快刀。这对做 AI 应用的工程师很有参考价值:与其迷信大模型,不如想清楚你的任务到底需要多大的模型,然后选最匹配的。

Introducing Mellum2: A 12B Mixture-of-Experts Model by JetBrains

查看原文