
AI 推理市场的冰激凌货架:模型已按成本与质量分层

OpenRouter 的数据揭示了一个被忽视的现象:一年前的开源模型 GPT-OSS-120b 仍然占据了 Anthropic 最新旗舰模型 Opus 4.8 每日 token 流量的 36%。这并非偶然,而是推理市场已经沿着成本、速度和准确性三个维度发生了明确的分化。
市场分化的速度正在被竞争加速。上周 Anthropic 发布了 Opus 5,比 Fable 更小、更便宜,目标明确地指向了 Moonshot 的 Kimi 3 所占据的市场。在中等模型市场,Poolside 推出了 Laguna S 2.1,一款专注于美国中端市场的模型。模型的差异化维度越来越多:规模(小、中、大、XL)、产地(美国 vs 中国)、架构(稠密 vs 稀疏)、精度(代码专精或通用)、速度(每秒 token 数)、模态(纯文本或视觉)。
一个更具体的案例来自本地部署。作者将自己的代理运行的模型从 Gemma 4 26b 替换为 Laguna S 2.1,一个拥有1180亿参数的模型。按常理,更大的模型应该更慢。但在 M5 Max 上,两者生成速度相同。原因是 Laguna 采用了 Mixture-of-Experts 架构:虽然模型有1180亿参数,但每次只激活80亿参数。一个1180亿参数的模型现在能以260亿参数模型的推理成本运行,这直接将接近前沿模型的质量拉入了本地可运行的层级。
这种质量提升体现在关键指标上。在本地代码和邮件代理中,工具调用失败率随着活跃参数的增加而下降,从29.4%降至20.1%。Laguna 相比被替换的260亿参数模型,将错误率降低了7个百分点。分化是健康竞争市场的标志。前沿模型仍然服务于全球最难的 token 需求,但它不再需要服务于所有需求。与此同时,笔记本电脑上的模型层级的上限正在被大幅提高,竞争将无情地推动这一趋势向前发展。


