
什么是 AI 路由器?为你挑选模型的 LLM 路由层
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
AI 路由器是位于你的应用程序与模型提供商之间的软件层,它针对每个请求决定应由哪个模型来回答。提示词会按难度进行评级:如果简单,就路由到廉价模型;如果困难,就路由到前沿模型——同一个调用,每 1M 输入 token 的费用可能在 DeepSeek V4 Flash 的 $0.09 与 Claude Opus 5 的 $5.00 之间相差悬殊。你还会在这次搜索的首页看到另一种“AI router”——配备神经核心的 Wi-Fi 硬件——那是完全不同的产品,也正因这种命名冲突,那些搜索结果几乎帮不上什么忙。
2026年8月搜索“AI路由器”,返回的大多是家庭网络领域的媒体报道。华硕将ROG Rapture GT-BE19000AI宣传为“全球首款AI电竞路由器”——这是一款Wi-Fi 7设备,配备NPU、4GB内存、32GB存储,还带有Docker引擎,可以直接在路由器上运行Home Assistant或AdGuard。中兴通讯携手中国电信天翼数字生活,推出了一款“AI原生”Wi-Fi 7家用路由器,它能感知你何时离开家,并自行重新配置智能家居网络。这些确实是有意思的设备,但它们并不是开发者所说的“AI路由器”。本文要讲的是LLM路由器:一个介于你的代码与大语言模型API之间的类别,负责为每个提示词选择由哪个模型来应答。文章涵盖这个名字的两种含义、路由器实际做什么、它能节省什么又需要多少成本,以及哪些情况下你不应该使用它。
两种不同的产品共用同一个名称。
“AI 路由器”这个词是一种碰撞,两种含义几乎毫无共同之处:
• 硬件“AI路由器”。一种包装盒上标注AI功能的Wi-Fi路由器——配备用于设备端推理的NPU、流量优化,有时还支持Docker。例如华硕ROG Rapture GT-BE19000AI(2026年初发布)和ZTE / Tianyi Digital Life家庭AI路由器(2026年6月)。它的任务是运行你的家庭或小型办公网络。
• LLM路由器。一种软件服务,接收您的应用程序发出的每次API调用,并将其转发到最佳模型——即以最低价格达到您质量标准的那个模型。它的职责是善用您的模型预算。这就是AI工程师们谈论的"AI路由器",也是本文的主题。

这种混淆不只是语义问题。搜索“ai router”想找软件类别的人,看到的是满屏硬件评测;搜索“ai router”想买新Wi-Fi路由器的人,看到的却是NPU营销话术而不是吞吐量数据。两种搜索结果都没有如实呈现这种歧义,而这正是本页要填补的空白——在硬件含义的对照下,界定软件含义。
LLM 路由器实际做什么
抛开营销话术,一个模型路由器有三项职责,全都平淡无奇,却也全都价值非凡。{{1}}第一,它是一个统一端点:你的代码只调用一个 OpenAI 兼容的 URL,而不是为每家提供商各用一个 SDK。{{/1}}{{2}}第二,它为请求评分——读取提示词,估算其难度——然后路由:简单的任务交给廉价快速的模型,真正困难的推理交给前沿模型。{{/2}}{{3}}第三,它做故障转移:如果选中的提供商对你限流或返回 5xx,路由器会针对健康模型重试,你的应用程序完全不会感知到该错误。{{/3}}
决策步骤是路由器之间的区别所在,而其所处的谱系与人们预料的一致。基于规则的路由器通过关键词或提示长度将请求匹配到模型——耗时不足一毫秒、行为可预测,但在定价或模型变化时显得脆弱。语义路由器对提示做嵌入表示,并按语义进行路由,因此"我的余额是多少?"和"我有多少钱"会落到同一条路径上。学习型路由器观察真实流量,并转向在单位成本质量上胜出的模型——Ramp 的生产路由器将此描述为 Thompson 采样 bandit,并认为它带来了约 30% 的成本削减;LMSYS 的 RouteLLM 研究报告了一种矩阵分解路由器,在仅将 14% 的查询发送给强模型的情况下,保留了 GPT-4 约 95% 的评分。路由策略更深层的机制在我们的指南《Auto Router for LLMs》中有完整论述;这里的要点在于,决策智能同样存在于一条谱系之上,而"你需要哪一个谱系位置"是一个产品决策,而非功能清单。
价差才是盈利的关键
路由器只有在模型价格差异很大时才有存在价值,而目前价格差异巨大。以下所有费率均为来自OrcaRouter模型目录的供应商直接价格,按每1M tokens计算,读取于2026-08-10:

看看这个价差,论点就不言自明了。DeepSeek V4 Flash 每 1M token 收费 $0.09/$0.18,而 Claude Opus 5 为 $5.00/$25.00,仅输入 token 一项就有约 55 倍的差距。廉价层级与前沿层级之间的差距,如今已是市场的常态特征,而非一次性的折扣。如果你的流量是典型的混合构成——大部分是简短、明确指定的请求,少数是真正困难的推理——把所有请求都发送给前沿模型,意味着要为那容易的 80% 支付最高价格。一个能把简单调用路由到廉价层级的路由器,才是节省成本的关键所在。
实测数字是一致的。RouteLLM 类研究报告称,在保持前沿级质量的同时,可节省高达约85%的成本——但前提是路由器配有一个质量底线,拒绝在对真正需要前沿模型的请求上节省开支。Ramp 报告称,在真实生产流量上可减少约30%的成本,且没有明显的质量下降。路由器厂商自己的术语表引用了50%–70%的单次查询成本降低,用于将简单任务从前沿模型分流出去。这些数字的差异才是真实的图景:上限取决于你的流量形态,而下限则由你的质量评估结果决定。你不应该相信的是某个单一固定的“路由节省X%”的数字,因为它是你工作负载的属性,而非路由器的一般属性。
路由让你付出什么代价
硬件评测中没人列入的两项成本是延迟和准确性,而这两者都是真实存在的。
延迟。每个路由请求在模型开始之前都要支付一次分类开销。基于规则的分类器不到一毫秒;一个小型嵌入或分类模型大约增加50–200毫秒;经过训练的领域分类器则更多。大多数路由器通过在准备上游请求的同时进行分类来隐藏大部分开销,一个生产路由端点的端到端开销中位数约为55毫秒——不到正常响应时间的1%。但如果你的流量是实时的——比如语音代理、必须在300毫秒内响应的UI——数百毫秒的路由跳转可能就是可用与不可用的区别。这一约束是拥有合理路由用例的团队决定不采用路由的最常见原因。
准确性。路由器的好坏,取决于它进行路由时所依据的判断。在通用基准上训练的分类器,可能会在你的领域上自信地犯错:你所谓的“简单”摘要任务,对前沿模型来说可能很容易,对廉价模型来说却可能根本无法完成。这种失败模式是无声的——用户只会得到更差的输出,而没有人会记录它——这就是为什么每个值得信赖的路由器都会配备质量下限或平衡模式,也是为什么激进的成本模式应该只是一种实验,而不是默认设置。
此外还有一个微妙的第三类成本:路由代码可能破坏你已有的提供商折扣。OpenAI 和 Anthropic 都会对重复的提示词前缀给予折扣,通常是缓存读取的输入令牌优惠约90%。如果你的路由层对提示词进行重写、重新排序或注入轮换的时间戳,就会使前缀失效,从而丢掉该折扣。一个好的路由器会逐字节地传递提示词,让提供商自身的缓存机制发挥作用;而一个粗心的路由器则会悄悄地把你的缓存命中变成全价调用。
路由器与网关:用一段话说明
你还会看到“AI网关”几乎与“AI路由器”互换使用,尽管大多数托管产品两者兼具,但这种区分仍有价值。路由器回答的是哪个模型——成本、延迟、能力。网关回答的是谁可以调用它——身份验证、Token速率限制、预算、审计日志、合规性。如果你需要对团队或产品进行治理,你需要网关功能;如果你需要成本更低的模型组合,你需要路由。运营层面的区别在我们的指南《AI API Gateway in 2026》中有详细论述;这里的关键在于,“AI路由器”通常指同时包含这两半的产品,你应该问清楚自己实际为哪一半付费。
当你确实需要AI路由器时
诚实的触发器列表,而不是用于始终路由的营销说辞:
• 你在生产环境中运行不止一个模型。随着新模型不断推出、价格不断变化,路由就是你让模型组合保持合理的方式。只运行单一模型的公司则完全不需要它。
• 您的流量中既有简单请求,也有困难请求。 如果每个请求的难度相同,路由器就没有任何套利空间。只有当大多数请求都是低成本请求、可以被识别出来时,先分类再路由才划算。
• 您的体量足够大,百分比就很重要。每月支出$50时,40%的节省只有$20;每月支出$50,000时,就相当于一个headcount。
• 服务商故障正在给您造成损失。跨服务商的自动故障转移通常是团队最先感受到的实际收益,之后才是成本节省。
• 您需要一份合约、一个密钥、一个端点。与 N 个提供商的集成成本本身就是通过一个提供商进行路由的理由。
把这些条件反过来,就是一份跳过清单:单一模型、难度均匀、花费微不足道,或者延迟预算经不起一次分类跳转。对这些团队来说,路由器只是额外开销,直接调用提供商才是更好的答案。
建议:一款具有质量底线的托管路由器
对于已经满足上述触发条件的团队,建议使用托管路由器,既能守住质量底线,又不对令牌加价。我们自己的产品是OrcaRouter,这也是我们能详细说明的,因此以下具体细节是我们自己的;随后的检查清单适用于你评估的任何路由器。
OrcaRouter 的自动模式——请求模型名称orcarouter/auto(在标准的 OpenAI 兼容端点上)——它会对每个提示词进行评分,并将其路由到 200 多个模型中。它内置四种策略,默认是 Balanced:Cheapest 将请求发送给能够作答的最低成本模型,Balanced 发送给通过质量门槛的最便宜模型,Quality 则不考虑价格、发送给评分最高的模型,Adaptive 会从你的实时流量中学习,并在运行中动态调整路由。评分耗时不到一毫秒,总增加延迟保持在 50ms 以下;如果所选提供商出现限流或错误,路由器会在 50ms 内于流式传输中途切换到一个健康模型。任何层级都没有加价:你按每个提供商公布的确切价格付费——上文中的 $0.09 或 $5.00 就是你的实际支出——路由本身免费。

在准确性方面,2026年6月RouterArena排行榜显示,OrcaRouter得分为75.5%,GPT-5为74.0%,Azure为72.8%,Martian为61.6%,NotDiamond为60.8%(数据来源:orcarouter.ai)。单一排行榜不能证明任何问题——请将其视为一个单独的数据点,并在信任任何路由器(包括我们的)处理生产流量之前,用您自己的提示词运行您自己的评估。如果您不使用我们,这也是在路由器之间进行选择的正确方法:将一部分流量投入测试,保留备用方案,强制通过您最难的提示词,并在相信节省成本的说法之前查看每个请求的路由日志。
当此推荐有误时。
直白地说,托管路由器是错误选择的场景:
• 你基本上只用一个模型。路由器只会白白增加一跳和分类开销。直接调用提供商,跳过这一层。
• 你的回复必须即时。如果端到端要求大约在300毫秒以内,路由跃点加上中端模型的延迟可能会突破你的预算。请固定模型。
• 您的交易量很小。 路由可为您节省一定比例的开支,但它无法从零中节省出百分比。每月低于几百美元时,您的时间比节省下来的钱更有价值。
• 模型选择必须可审计。 如果响应必须可重现,或者其背后的模型必须可向审核者解释,那么自动路由器的选择就是你必须说明理由的变量。记录它、锁定它,或者不要路由。
• 你无法衡量质量。如果没有评估来判断路由输出是否足够好,你就无法判断路由器是否正常工作,而激进的成本路由会悄悄降低你从未检查过的输出质量。
• 您处于物理隔离环境,或受合规要求约束。如果模型绝不能离开您的网络,那么托管路由器的形态完全不合适——应在您自己的基础设施上运行开源路由层。
• 你已经在运行 API 网关。如果你已经投入了其中一种,应扩展现有网关,而不是添加并行的路由器。路由和网关功能正在融合;第二层更多是治理,而非更多价值。
简短版本
就AI工程师所指的意义而言,AI路由器是一个软件层,决定每个请求由哪个LLM来回答——而且这个名称还与运行Docker的Wi-Fi硬件共享,容易混淆。它的工作原理是对每个提示进行分级,将简单的多数请求发送给廉价模型,将困难的少数请求保留给前沿模型,并在某个供应商宕机时进行故障转移。当你的各模型在价格上差异很大(DeepSeek V4 Flash 每100万输入tokens收费0.09美元,而Claude Opus 5收费5.00美元,价差约55倍),并且你的流量是简单与困难混合时,它才划算;RouteLLM类研究表明,在质量下限的约束下,节省上限约为85%。它会带来延迟和一定的准确性控制成本;对于单一模型团队、低于300ms的延迟预算、极小的开销以及无法衡量输出质量的团队来说,它不是正确答案。当它适用时,应将其置于质量下限之下,不对token加价,先路由一小部分流量,并且在你相信节省数据之前,先阅读路由日志。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
