
什么是LLM路由器?模型选择层、真正的计算,以及何时跳过它
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
LLM 路由器是一种软件层,位于你的应用程序和模型提供商之间,为每个请求决定由哪个模型来回答:一种便宜快速的模型,如DeepSeek V4 Flash用于简单任务;一种前沿模型,如Claude Opus 5用于真正困难的任务。关键是成本:DeepSeek V4 Flash 每百万输入 token 的成本为 $0.09,Claude Opus 5 为 $5.00——这是 OrcaRouter 模型目录中 2026-08-10 读取的供应商直供价——同一个调用相差 55 倍。将 80% 的简单流量分配到低端模型,将 20% 的困难流量保留给高端模型,你就在拉动大多数团队从未触碰的最大成本杠杆。
LLM 路由器到底是什么
抛开营销外衣,模型路由器其实只有三项工作,每一项都很枯燥,但每一项都很有价值。它是一个单一端点:你的代码只需调用一个 OpenAI 兼容的 URL,而不是为每个提供商各集成一个 SDK。它会评估请求,估算其难度并进行路由:简单的任务发给廉价模型,真正困难的推理交给前沿模型。它还具备故障转移能力:如果所选提供商对你限流或返回 5xx,路由器会改用健康的模型重试,而你的应用程序自始至终都感知不到这个错误。
决策步骤是路由器之间的差异所在,而这个谱系是大家熟悉的。基于规则的路由器将关键词或提示长度匹配到某个模型——亚毫秒级、可预测,但当定价或模型发生变化时则会很脆弱。语义路由器对提示进行嵌入,并按语义进行路由,因此“我的余额是多少?”和“我有多少钱”会落在同一条路径上。学习型路由器观察真实流量,并转向单位成本质量最优的模型。每种路由器的机制——包括不同分类器类型的准确率区间,以及为每个提示评分的自动模式——在我们的指南《Auto Router for LLMs》中都有完整阐述;这里的要点是,路由智能存在于一个谱系之上,而你需要哪个点位是一个产品决策,而不是功能清单。

如果你也在带有 NPU 的 Wi-Fi 硬件上看到过“AI router”这个说法——那是另一种恰好同名{{1}}的产品,我们在 AI router 指南{{2}}中梳理了这种撞名。本文中的所有内容都围绕软件类别展开。
价差才是盈利的关键
路由器只有在模型价格差异很大时才有存在价值,而目前价格差异巨大。以下所有费率均为来自OrcaRouter模型目录的供应商直接价格,按每1M tokens计算,读取于2026-08-10:

看看这个价差,道理不言自明。DeepSeek V4 Flash 定价 0.09 美元,而 Claude Opus 5 定价 5.00 美元,仅输入 token 一项就有约 55 倍的差距,而且廉价层级与前沿层级之间的差距,如今已是市场的常态特征,而非一次性的折扣。如果你的流量是典型的混合型——大多是简短、明确指定的请求,少数是真正困难的推理——那么把一切都放在前沿模型上运行,就意味着为那容易的 80% 支付最高价格。
这就是当前“llm router”首页搜索结果让你失望的地方。例如,Decagon 的术语表条目引用了“GPT-4o、Claude 3.5 Sonnet 和 Gemini 1.5 Pro”,价格为“每百万输入 token 5–15 美元”——这些模型是两年前的主流,价格大约是如今的两倍。市场已经变了,定义却没有跟上。这是不信任任何不带日期的 LLM 路由器解释文章的最大原因。
储蓄研究实际上说明了什么
上述计算是真实的,研究也是如此——但诚实的图景是一个范围,而非单个数字。

以下是计算过程,假设条件已列出,方便您调整。假设一个客服机器人每月处理 100,000 次对话,每次发送 1,000 个输入 token 并生成 200 个输出 token:若全部使用 Claude Sonnet 5,每月成本约为 400 美元。若将其中较简单的 80% 路由到 DeepSeek V4 Flash,保留较难的 20% 在 Claude Sonnet 5 上,相同流量成本约为 90 美元——大约便宜 78%,这还没算上提示缓存,而提示缓存会进一步拉大差距。
要移除的形态:当你的流量大多是简单请求时,激进路由可节省60–85%,均衡路由可节省35–45%,即使保守路由也能节省10–15%。你的具体数字取决于你的流量特征,需要在您自己的提示词上测量——而不是能从博客文章里复制来的常数。
路由隐藏的三个成本
没有人写进术语表词条的两项成本是延迟和准确性,还有第三项更微妙的成本。
延迟.每个经过路由的请求在模型启动之前就要支付一次分类开销。基于规则的分类器耗时不到一毫秒;小型嵌入或分类模型大约增加50–200毫秒;经过训练的领域分类器则更多。一个好的路由器会在准备上游请求的同时进行分类,从而隐藏大部分开销;一个生产环境中的路由端点实测的端到端开销中位数约为55毫秒——不到正常响应时间的1%。但如果你的流量是实时的——比如语音代理、必须在300毫秒内响应的UI——一次数百毫秒的路由跳转就可能决定系统是否可用。仅这一项限制,就是拥有合理路由需求的团队决定不采用路由的最常见原因。
准确性。路由器的好坏取决于其路由判断。基于通用基准训练的分类器可能对你的领域自信地犯错:你的“简单”摘要任务对前沿模型可能易如反掌,对廉价模型却难如登天。这种失败模式是无声的——用户只是得到更差的输出,没有人记录——因此每个可靠的路由器都提供质量下限或平衡模式。
缓存失效。 OpenAI 和 Anthropic 都会对重复的提示词前缀给予折扣,缓存读取时输入 token 通常可享受约 90% 的优惠。如果您的路由层重写、重新排序提示词,或向其中注入轮换时间戳,就会使前缀失效,从而丢掉这一折扣。优秀的路由器会逐字节原样传递提示词,让提供商自身的缓存机制发挥作用。
建议:一款具有质量底线的托管路由器
如果你在生产环境中运行多个模型,你的流量是简单与困难请求的混合,而且规模大到一定百分比就是真金白银,那么建议使用一个托管路由器:它既能守住质量底线,又不对 token 加价。我们自己的产品是 OrcaRouter,也是我们能够详细讲解的一款;下面的检查清单适用于你评估的任何路由器。
OrcaRouter 的自动模式——在标准 OpenAI 兼容端点上请求模型名称 orcarouter/auto——会对每个提示词进行评分,并在 200 多个模型中路由。它内置四种路由策略,默认是 Balanced(均衡):Cheapest 发送给能回答的最低成本模型;Balanced 发送给达到质量门槛的最便宜模型;Quality 发送给评分最高而不考虑价格的模型;Adaptive 则从你的实时流量中学习,并在运行中调整路由。评分耗时不到 1 毫秒,总新增延迟保持在 50 毫秒以内;如果所选供应商触发限流或出错,路由器会在 50 毫秒内中途切换到健康的模型。任何层面都没有加价:你按各供应商公布的精确价格付费——上面提到的 $0.09 或 $5.00 就是你要付的金额——而路由本身免费。
在准确性方面,2026年6月RouterArena排行榜显示OrcaRouter得分为75.5%,而最接近的同类替代方案为74.0%(数据来源:orcarouter.ai)。单一排行榜并不能证明任何问题——请将其视为一个单独的数据点,在信任任何路由器处理生产流量之前(包括我们自己的),请使用你自己的提示词运行你自己的评估。如果你想判断自己是否需要路由器功能或网关功能,我们的指南《AI API Gateway in 2026》中详细介绍了路由器与网关的区别。
当此推荐有误时。
说得直白一点,诚实的跳表:
简短版本
LLM 路由器是一个层,它决定每个请求由哪个模型来回答——对于占多数的简单请求,用便宜且快速的模型;对于占少数的困难请求,用前沿模型;当某个提供商掉线时,还能进行故障转移。当你的模型之间价格差异很大(DeepSeek V4 Flash 每 100 万输入 token 收费 0.09 美元,而 Claude Opus 5 收费 5.00 美元,相差 55 倍),并且你的流量是简单与困难请求的混合时,这种方案才划算。研究认为,在质量下限之上,节约上限约为 85%,而下限则取决于你的评估所给出的数值。它需要你付出延迟和部分准确性控制的代价,而且对于单一模型团队、低于 300 毫秒的延迟预算、极少的支出以及无法衡量输出质量的团队来说,它不是正确的答案。当它确实适用时,应在质量下限之后运行,不附加任何 token 加价,先路由一小部分流量,并且在相信节约数据之前先查看路由日志。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
