主视觉标题卡片显示“什么是 LLM 路由器?”,副标题为“模型选择层、真正的数学原理,以及何时跳过它”,展示三张圆角卡片,分别标注“单一端点”、“评分与路由”和“故障转移”,背景为白色,配以蓝色和青色点缀,OrcaRouter 标志合成于右下角。
Guides & Insights

什么是LLM路由器?模型选择层、真正的计算,以及何时跳过它

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

LLM 路由器是一种软件层,位于你的应用程序和模型提供商之间,为每个请求决定由哪个模型来回答:一种便宜快速的模型,如DeepSeek V4 Flash用于简单任务;一种前沿模型,如Claude Opus 5用于真正困难的任务。关键是成本:DeepSeek V4 Flash 每百万输入 token 的成本为 $0.09,Claude Opus 5 为 $5.00——这是 OrcaRouter 模型目录中 2026-08-10 读取的供应商直供价——同一个调用相差 55 倍。将 80% 的简单流量分配到低端模型,将 20% 的困难流量保留给高端模型,你就在拉动大多数团队从未触碰的最大成本杠杆。

LLM 路由器到底是什么

抛开营销外衣,模型路由器其实只有三项工作,每一项都很枯燥,但每一项都很有价值。它是一个单一端点:你的代码只需调用一个 OpenAI 兼容的 URL,而不是为每个提供商各集成一个 SDK。它会评估请求,估算其难度并进行路由:简单的任务发给廉价模型,真正困难的推理交给前沿模型。它还具备故障转移能力:如果所选提供商对你限流或返回 5xx,路由器会改用健康的模型重试,而你的应用程序自始至终都感知不到这个错误。

决策步骤是路由器之间的差异所在,而这个谱系是大家熟悉的。基于规则的路由器将关键词或提示长度匹配到某个模型——亚毫秒级、可预测,但当定价或模型发生变化时则会很脆弱。语义路由器对提示进行嵌入,并按语义进行路由,因此“我的余额是多少?”和“我有多少钱”会落在同一条路径上。学习型路由器观察真实流量,并转向单位成本质量最优的模型。每种路由器的机制——包括不同分类器类型的准确率区间,以及为每个提示评分的自动模式——在我们的指南《Auto Router for LLMs》中都有完整阐述;这里的要点是,路由智能存在于一个谱系之上,而你需要哪个点位是一个产品决策,而不是功能清单。

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

如果你也在带有 NPU 的 Wi-Fi 硬件上看到过“AI router”这个说法——那是另一种恰好同名{{1}}的产品,我们在 AI router 指南{{2}}中梳理了这种撞名。本文中的所有内容都围绕软件类别展开。

价差才是盈利的关键

路由器只有在模型价格差异很大时才有存在价值,而目前价格差异巨大。以下所有费率均为来自OrcaRouter模型目录的供应商直接价格,按每1M tokens计算,读取于2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

看看这个价差,道理不言自明。DeepSeek V4 Flash 定价 0.09 美元,而 Claude Opus 5 定价 5.00 美元,仅输入 token 一项就有约 55 倍的差距,而且廉价层级与前沿层级之间的差距,如今已是市场的常态特征,而非一次性的折扣。如果你的流量是典型的混合型——大多是简短、明确指定的请求,少数是真正困难的推理——那么把一切都放在前沿模型上运行,就意味着为那容易的 80% 支付最高价格。

这就是当前“llm router”首页搜索结果让你失望的地方。例如,Decagon 的术语表条目引用了“GPT-4o、Claude 3.5 Sonnet 和 Gemini 1.5 Pro”,价格为“每百万输入 token 5–15 美元”——这些模型是两年前的主流,价格大约是如今的两倍。市场已经变了,定义却没有跟上。这是不信任任何不带日期的 LLM 路由器解释文章的最大原因。

储蓄研究实际上说明了什么

上述计算是真实的,研究也是如此——但诚实的图景是一个范围,而非单个数字。

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

以下是计算过程,假设条件已列出,方便您调整。假设一个客服机器人每月处理 100,000 次对话,每次发送 1,000 个输入 token 并生成 200 个输出 token:若全部使用 Claude Sonnet 5,每月成本约为 400 美元。若将其中较简单的 80% 路由到 DeepSeek V4 Flash,保留较难的 20% 在 Claude Sonnet 5 上,相同流量成本约为 90 美元——大约便宜 78%,这还没算上提示缓存,而提示缓存会进一步拉大差距。

要移除的形态:当你的流量大多是简单请求时,激进路由可节省60–85%,均衡路由可节省35–45%,即使保守路由也能节省10–15%。你的具体数字取决于你的流量特征,需要在您自己的提示词上测量——而不是能从博客文章里复制来的常数。

路由隐藏的三个成本

没有人写进术语表词条的两项成本是延迟和准确性,还有第三项更微妙的成本。

延迟.每个经过路由的请求在模型启动之前就要支付一次分类开销。基于规则的分类器耗时不到一毫秒;小型嵌入或分类模型大约增加50–200毫秒;经过训练的领域分类器则更多。一个好的路由器会在准备上游请求的同时进行分类,从而隐藏大部分开销;一个生产环境中的路由端点实测的端到端开销中位数约为55毫秒——不到正常响应时间的1%。但如果你的流量是实时的——比如语音代理、必须在300毫秒内响应的UI——一次数百毫秒的路由跳转就可能决定系统是否可用。仅这一项限制,就是拥有合理路由需求的团队决定不采用路由的最常见原因。

准确性。路由器的好坏取决于其路由判断。基于通用基准训练的分类器可能对你的领域自信地犯错:你的“简单”摘要任务对前沿模型可能易如反掌,对廉价模型却难如登天。这种失败模式是无声的——用户只是得到更差的输出,没有人记录——因此每个可靠的路由器都提供质量下限或平衡模式。

缓存失效。 OpenAI 和 Anthropic 都会对重复的提示词前缀给予折扣,缓存读取时输入 token 通常可享受约 90% 的优惠。如果您的路由层重写、重新排序提示词,或向其中注入轮换时间戳,就会使前缀失效,从而丢掉这一折扣。优秀的路由器会逐字节原样传递提示词,让提供商自身的缓存机制发挥作用。

建议:一款具有质量底线的托管路由器

如果你在生产环境中运行多个模型,你的流量是简单与困难请求的混合,而且规模大到一定百分比就是真金白银,那么建议使用一个托管路由器:它既能守住质量底线,又不对 token 加价。我们自己的产品是 OrcaRouter,也是我们能够详细讲解的一款;下面的检查清单适用于你评估的任何路由器。

OrcaRouter 的自动模式——在标准 OpenAI 兼容端点上请求模型名称 orcarouter/auto——会对每个提示词进行评分,并在 200 多个模型中路由。它内置四种路由策略,默认是 Balanced(均衡):Cheapest 发送给能回答的最低成本模型;Balanced 发送给达到质量门槛的最便宜模型;Quality 发送给评分最高而不考虑价格的模型;Adaptive 则从你的实时流量中学习,并在运行中调整路由。评分耗时不到 1 毫秒,总新增延迟保持在 50 毫秒以内;如果所选供应商触发限流或出错,路由器会在 50 毫秒内中途切换到健康的模型。任何层面都没有加价:你按各供应商公布的精确价格付费——上面提到的 $0.09 或 $5.00 就是你要付的金额——而路由本身免费。

在准确性方面,2026年6月RouterArena排行榜显示OrcaRouter得分为75.5%,而最接近的同类替代方案为74.0%(数据来源:orcarouter.ai)。单一排行榜并不能证明任何问题——请将其视为一个单独的数据点,在信任任何路由器处理生产流量之前(包括我们自己的),请使用你自己的提示词运行你自己的评估。如果你想判断自己是否需要路由器功能或网关功能,我们的指南《AI API Gateway in 2026》中详细介绍了路由器与网关的区别。

当此推荐有误时。

说得直白一点,诚实的跳表:

简短版本

LLM 路由器是一个层,它决定每个请求由哪个模型来回答——对于占多数的简单请求,用便宜且快速的模型;对于占少数的困难请求,用前沿模型;当某个提供商掉线时,还能进行故障转移。当你的模型之间价格差异很大(DeepSeek V4 Flash 每 100 万输入 token 收费 0.09 美元,而 Claude Opus 5 收费 5.00 美元,相差 55 倍),并且你的流量是简单与困难请求的混合时,这种方案才划算。研究认为,在质量下限之上,节约上限约为 85%,而下限则取决于你的评估所给出的数值。它需要你付出延迟和部分准确性控制的代价,而且对于单一模型团队、低于 300 毫秒的延迟预算、极少的支出以及无法衡量输出质量的团队来说,它不是正确的答案。当它确实适用时,应在质量下限之后运行,不附加任何 token 加价,先路由一小部分流量,并且在相信节约数据之前先查看路由日志。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube