主視覺標題卡片寫著「What Is an LLM Router?」,副標題為「The model-picking layer, the real math, and when to skip it」,展示三張圓角卡片,分別標示 ONE ENDPOINT、GRADE & ROUTE 與 FAILOVER,背景為白色並帶有藍色和青色點綴,右下角合成 OrcaRouter 標誌。
Guides & Insights

什麼是 LLM 路由器?模型選擇層、真正的數學原理,以及何時應跳過它

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

LLM 路由器是位於您的應用程式與模型供應商之間的軟體層,它會針對每個請求決定該由哪個模型來回應——一個便宜又快速的模型,像是DeepSeek V4 Flash,當任務簡單時;一個前沿模型,像是Claude Opus 5,當任務真正困難時。重點在於成本:DeepSeek V4 Flash 每百萬輸入代幣收費 $0.09,而 Claude Opus 5 收費 $5.00,此為 2026-08-10 查閱 OrcaRouter 模型目錄所得的供應商直供價格——同一通呼叫就相差 55 倍。將您流量中簡單的 80% 送往便宜模型,困難的 20% 保留給前沿模型,您就拉動了大多數團隊從未觸及的最大單一成本槓桿。

LLM 路由器實際上是什麼

剝除行銷話術,模型路由器的實際工作只有三項,每一項都很無聊,但每一項都很有價值。它是一個單一端點:你的程式碼只需呼叫一個 OpenAI 相容的 URL,而不是為每個供應商都準備一個 SDK。它會為請求評分,估算難度,然後進行路由:簡單的任務交給廉價模型,真正困難的推理交給前沿模型。它還能故障轉移:如果所選供應商對你限流或回傳 5xx,路由器會改用健康的模型重試,你的應用程式完全不會察覺到錯誤。

決策步驟正是路由器有所差異之處,而這個光譜我們並不陌生。基於規則的路由器將關鍵字或提示長度與模型進行匹配——不到一毫秒即可完成、行為可預測,但在定價或模型改變時容易變得脆弱。語義路由器會對提示詞進行嵌入,並依語義來路由,因此「我的餘額是多少?」和「我有多少錢」會落在同一條路徑上。學習型路由器則觀察實際流量,並傾向選擇在「每一塊錢的品質」上表現最佳的模型。每種機制的運作細節——包括不同分類器類型的準確度區間,以及會對每個提示詞評分的自動模式——在我們的指南《Auto Router for LLMs》中都有完整探討;這裡要強調的是,路由智慧存在於一個光譜上,而你需要落在哪個位置,是一個產品決策,而不是功能清單。

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

如果你也看過「AI 路由器」被用來指稱具備 NPU 的 Wi-Fi 硬體——那其實是另一個恰好同名、但不同的產品,而我們已在我們的 AI 路由器指南中釐清了這個名稱衝突。本文中的所有內容均針對軟體類別。

價差就是讓它有利可圖的原因。

路由器只有在各模型價格差異很大時才值得存在,而目前它們的價格差異確實非常巨大。以下所有費率均為 OrcaRouter 模型目錄中的供應商直接價格(每 1M tokens),讀取日期為 2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

看看這個價差,論點就不言自明了。DeepSeek V4 Flash 定價 $0.09,Claude Opus 5 定價 $5.00,光是輸入 tokens 就有約 55 倍的差距;廉價層級與前沿層級之間的鴻溝,如今已是市場的常態特徵,而非一次性折扣。如果你的流量是典型的混合型態——多數是簡短、定義明確的請求,少數是真正困難的推理——把所有請求都跑在前沿模型上,就等於為那簡單的 80% 付出最高價格。

這就是目前「llm router」搜尋結果第一頁令人失望的地方。例如,Decagon的詞彙表條目引用「GPT-4o、Claude 3.5 Sonnet與Gemini 1.5 Pro」,標價為「每百萬輸入token 5–15美元」——這些模型在兩年前還是最新款,而價格大約是今天的兩倍。市場已經變了,定義卻沒有跟著更新。這正是沒有標註日期的LLM router解說文章最不值得信賴的最大單一原因。

儲蓄研究實際上說了什麼

上述的算術是真實的,研究也是如此——但誠實的全貌是一個範圍,而非單一數字。

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

以下是計算過程,並附上假設,方便您調整。一個支援機器人每月處理 100,000 則對話,每則傳送 1,000 個輸入 tokens 並產生 200 個輸出 tokens:全部使用 Claude Sonnet 5 執行,每月成本約為 400 美元。若將簡單的 80% 流量路由到 DeepSeek V4 Flash,並將困難的 20% 保留在 Claude Sonnet 5,則相同流量成本約為 90 美元——大約便宜 78%,這還是在未計算任何提示快取的情況下;提示快取會讓差距進一步擴大。

要記住的要點:當你的流量大多簡單時,積極路由可節省 60–85%,平衡路由可節省 35–45%,即使保守路由也能節省 10–15%。對你而言的確切數字取決於你流量的特性,必須在你自己的提示詞上測量——而非從部落格文章複製的常數。

路由所隱藏的三項成本

沒有人列在詞彙表條目中的兩項成本是延遲和準確性,此外還有第三項更為微妙的成本。

延遲。每個路由請求在模型開始之前,都要先付出一筆分類開銷。基於規則的分類器不到一毫秒;小型嵌入或分類模型則增加約 50–200 毫秒;經過訓練的領域分類器則更多。好的路由器會在準備上游請求的同時進行分類,藉此隱藏大部分這類開銷;某個生產路由端點量測到的端到端開銷中位數約為 55 毫秒——不到正常回應時間的 1%。但如果你的流量是即時性的——例如語音代理、必須在 300 毫秒內回應的 UI——數百毫秒的路由跳躍,就可能決定系統可用與否。這個單一限制,正是擁有合理路由使用案例的團隊最常決定不採用路由的原因。

準確度。路由器的好壞取決於其路由判斷的品質。一個在通用基準上訓練的分類器,可能會對你的領域產生自信的錯誤判斷:你所謂「簡單」的摘要任務,對前沿模型而言可能很簡單,但對廉價模型卻是不可能的任務。這種失敗模式是無聲的——使用者只會得到較差的輸出,而且沒有人會將它記錄下來——這正是每個可信賴的路由器都配備品質底線或平衡模式的原因。

快取失效。OpenAI 和 Anthropic 都會對重複的提示詞前綴提供折扣,通常快取讀取的輸入 token 可享約 90% 的折扣。如果你的路由層改寫、重新排序或在提示詞中注入不斷變動的時間戳記,就會使前綴失效,白白浪費那個折扣。良好的路由器應逐位元組傳遞提示詞,讓供應商自身的快取機制發揮作用。

建議:採用具備品質下限的受管路由器

如果你在生產環境中運行多個模型,流量混合了簡單與困難的請求,且流量規模大到一定比例都代表實際收益,那麼建議使用託管路由器——它能維持品質底線,且不對 token 加價收費。我們自家的產品是 OrcaRouter,也是我們能詳細說明的一款;後續的檢查清單適用於你評估的任何路由器。

OrcaRouter 的自動模式 — 請求模型名稱 orcarouter/auto(於標準的 OpenAI 相容端點上)— 會對每個提示進行評分,並將其路由到 200 多個模型。它提供四種路由策略,預設為 Balanced:Cheapest 會將請求傳送給能回答問題且成本最低的模型;Balanced 會傳送給通過品質門檻且成本最低的模型;Quality 會不考慮價格地傳送給得分最高的模型;Adaptive 則會從您的即時流量中學習,並隨之調整路由。評分測量在不到一毫秒內完成,總增加延遲保持在 50ms 以下;若所選的供應商出現速率限制或錯誤,路由器會在串流進行中於 50ms 內故障轉移到健康的模型。任何一層都沒有加價:您支付給每個供應商的是其確切公布的價格 — 上述 $0.09 或 $5.00 就是您實際支付的金額 — 而路由本身是免費的。

在準確度方面,2026 年 6 月的 RouterArena 排行榜將 OrcaRouter 評為 75.5%,而追蹤到的最接近替代方案則為 74.0%(根據 orcarouter.ai)。單一排行榜證明不了什麼——請將其視為單一數據點,並在信任任何路由器處理生產流量(包括我們的)之前,用你自己的提示詞執行你自己的評測。此外,如果你正在思考到底是否需要路由器功能或閘道器功能,路由器與閘道器之間的區別已在我們的指南《AI API Gateway in 2026》中說明。

當此建議有誤時

誠實的跳躍列表,直白地說:

簡短版本

LLM 路由器是一個中介層,負責挑選由哪個模型來回答每個請求——對大多數簡單請求使用便宜且快速的模型,對少數困難請求使用前沿模型,並在供應商故障時提供故障轉移。當你的模型之間價格差異很大(DeepSeek V4 Flash 每 100 萬輸入 token 為 $0.09,而 Claude Opus 5 為 $5.00,相差 55 倍),且你的流量混合了簡單與困難請求時,這種做法就值得。研究指出,在品質下限的保護下,節省上限約為 85%,而下限則取決於你的評估計告訴你的數值。它會增加延遲並削弱部分準確性控制;對於單一模型團隊、延遲預算低於 300 毫秒、支出極小,以及無法衡量輸出品質的團隊來說,這不是正確的選擇。當它確實適用時,請在品質下限之後運行,不加收 token 加成費用,先路由一小部分流量,並在相信節省數字之前先查看路由日誌。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube