
模型路由:看似简单,实则复杂

大多数人觉得模型路由很简单:简单任务派便宜模型,复杂任务上强大模型。但实际构建时才发现,它根本不是分类问题,而是系统优化问题。三个维度让事情变得异常复杂:成本远不止模型标价。你以为GPT-4.1价格低更省钱,可实际跑AppWorld测试时,Claude Sonnet虽然推理步数多三倍,反而总花费只有一半——因为Sonnet的缓存命中率更高,有效输入成本被大幅拉低。复杂性远超任务难度。一个“总结合同”的请求可能触发检索、合规检查、工具调用等多步操作,难度根本预判不了;就算能预判,还要同时平衡成本、延迟、模型专长、合规要求等多个约束。延迟不只看模型快慢。路由本身有开销,硬件、缓存、端点负载这些基础设施因素往往主导用户体验。一个理论上更快的模型,如果运行在拥堵的GPU上,一样慢得像蜗牛。
我们的应对方法是:不再把路由当分类,而是当优化问题。我们不问“哪个模型最好”,而是同时优化成本、质量和延迟。设计了一个轻量级算法,每次路由只需6毫秒和2KB内存,就能在成本-精度前沿上找到合适的工作点。在AppWorld测试中,相比只用最贵模型(Opus),延迟优化配置下成本降21%、延迟降9%,精度只降4%。而传统的基于难度的路由(图中菱形)落在相似的精度区间,成本却更高——因为它无法像优化方法那样灵活探索整个权衡空间。
核心启发是:路由器不是在选模型,而是在优化整个系统。模型只是变量之一,缓存行为、基础设施状态、合规约束、工作负载模式同样关键。当路由做得好时,不是因为它找到了“最佳模型”,而是因为它找到了整个系统的最佳操作点。这个问题比分类难得多,但值得去解决。如果你也在构建自己的路由器,别只盯着模型规格单,多想想系统级的权衡。


