
LLMルーターとは何か?モデル選択レイヤー、実際の計算、そしてスキップすべき時
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
LLMルーターとは、アプリケーションとモデルプロバイダーの間に位置するソフトウェア層であり、すべてのリクエストに対してどのモデルが応答すべきかを決定します。つまり、安価で高速なモデル、例えばDeepSeek V4 Flashはタスクが簡単な場合に、最先端のモデル、例えばClaude Opus 5は実際に難しい場合に使います。重要なのはコストです。DeepSeek V4 Flashは100万入力トークンあたり$0.09、Claude Opus 5は$5.00です(2026-08-10時点のOrcaRouterモデルカタログのプロバイダー直販価格)。同じ呼び出しで55倍の差があります。トラフィックの簡単な80%を低価格モデルに送り、難しい20%を高価格モデルに維持すること——これが、ほとんどのチームが触れたことのない最大のコスト削減レバーです。
LLMルーターの実態
マーケティングをはがせば、モデルルーターの仕事は3つだけだ。どれも退屈だが、どれも価値がある。それは単一のエンドポイントである。コードはプロバイダごとにSDKを用意する代わりに、OpenAI互換のURLを1つ呼び出すだけでよい。また、リクエストを採点して難易度を見積もり、ルーティングする。簡単なタスクは安価なモデルへ、本当に難しい推論は最先端モデルへ送る。さらに、フェイルオーバーも行う。選択したプロバイダがレート制限をかけてきたり5xxを返したりした場合、ルーターは正常なモデルに対して再試行するので、アプリケーションがエラーを目にすることはない。
ルーターが異なるのは決定ステップであり、そのスペクトラムはおなじみのものです。ルールベースのルーターはキーワードやプロンプトの長さをモデルにマッチングします。1ミリ秒未満で、予測可能ですが、価格やモデルが変わると脆くなります。セマンティックルーターはプロンプトを埋め込み、意味によってルーティングするため、「残高はいくら?」と「いくらお金を持っている?」は同じ経路に着地します。学習型ルーターは実際のトラフィックを監視し、1ドルあたりの品質で勝っているモデルへとシフトします。それぞれのメカニズム(さまざまな分類子タイプの精度帯域や、すべてのプロンプトを評価する自動モードを含む)の詳細は、ガイド『Auto Router for LLMs』で詳しく説明しています。ここでのポイントは、ルーティングインテリジェンスがスペクトラム上に存在し、どのポイントが必要かは製品上の決定であり、機能チェックリストではないということです。

「AIルーター」という言葉がNPU搭載のWi-Fiハードウェアにも使われているのを見たことがあるかもしれませんが、それは偶然同じ名前を持つ別の製品であり、その混同についてはAIルーターガイドで解消しています。この記事の内容はすべてソフトウェアカテゴリに関するものです。
価格差こそが収益をもたらすのです。
ルーターは、モデルの価格に大きな差がある場合にのみその存在価値を発揮しますが、現在その差は非常に大きくなっています。以下の料金はすべて、OrcaRouterモデルカタログから取得した、2026-08-10時点のプロバイダー直接の1Mトークンあたりの価格です。

この価格差を見れば、論点は自ずと明らかになる。DeepSeek V4 Flash が $0.09 であるのに対し、Claude Opus 5 は $5.00 で、入力トークンだけでも約55倍の差がある。そして、低価格帯とフロンティア層のギャップは、もはや一回限りの割引ではなく、市場の恒常的な特徴となっている。あなたのトラフィックが典型的な構成——大半が短く要件の明確なリクエストで、ごく一部が本当に難しい推論——であるなら、すべてをフロンティア層で処理するのは、簡単な80%に最高価格を払うことを意味する。
これが、「llm router」の現在のページワン結果が期待を裏切る点です。例えば、Decagonの用語集エントリは「GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro」を「入力トークン100万件あたり5〜15ドル」として引用していますが、これらのモデルは2年前に最新だったもので、価格は現在の約2倍でした。市場は動いたのに、定義は変わっていません。それが、日付のないLLMルーター解説記事を信用できない最大の理由です。
貯蓄に関する研究が実際に示していること
上記の計算は現実のものであり、研究もまた現実のものです。しかし、正直な全体像は単一の数値ではなく、範囲として示されるものです。

以下は計算結果です。前提を明示しているので調整可能です。{{1}}月間10万件の会話{{/1}}を処理し、各会話が{{2}}1,000入力トークンと200出力トークン{{/2}}を送信・生成するサポートボットを想定します。すべてをClaude Sonnet 5で実行すると、{{3}}月額約400ドル{{/3}}かかります。{{4}}簡単な80%をDeepSeek V4 Flashに振り分け、難しい20%をClaude Sonnet 5に残すと{{/4}}、同じトラフィックで{{5}}約90ドル{{/5}}になり、{{6}}プロンプトキャッシュを考慮する前で{{/6}}約78%安くなります。キャッシュを考慮すれば、その差はさらに広がります。
ここから得られる教訓:トラフィックのほとんどが易しい場合、アグレッシブなルーティングでは60〜85%削減でき、バランス型ルーティングでは35〜45%削減でき、保守的なルーティングでも10〜15%削減できます。あなたにとっての正確な数値は、あなた自身のプロンプトで測定されるあなたのトラフィックに依存する性質のものであり、ブログ記事からコピーできる定数ではありません。
ルーティングが隠す3つのコスト
誰もグロッサリー項目に挙げない2つのコストは、レイテンシーと正確性であり、さらに3つ目の、より微妙なコストがあります。
レイテンシー。ルーティングされるすべてのリクエストは、モデルが処理を開始する前に分類コストを支払います。ルールベースの分類器なら1ミリ秒未満、小さな埋め込みモデルや分類モデルなら約50〜200ミリ秒、訓練済みのドメイン分類器ならそれ以上かかります。優れたルーターは、上流のリクエストを準備しながら分類を行うことで、この大部分を隠します。実際、ある本番ルーティングエンドポイントでは、エンドツーエンドのオーバーヘッドが中央値で約55ミリ秒と測定されており、通常の応答時間の1%未満です。しかし、トラフィックがリアルタイムの場合、たとえば音声エージェントや300ミリ秒以内に応答しなければならないUIでは、数百ミリ秒のルーティングホップが、実用に耐えるかどうかの分かれ目になります。この単一の制約こそが、正当なルーティングのユースケースを持つチームがルーティングを導入しないことを決定する最も一般的な理由です。
精度。ルーターの性能は、そのルーティング判断の質次第です。一般的なベンチマークで訓練された分類器は、あなたのドメインに関して自信満々に誤った判断を下すことがあります。あなたの「簡単な」要約タスクは、フロンティアモデルには簡単でも、安価なモデルには不可能かもしれません。この失敗は静かに起こります。ユーザーはより悪い出力を受け取るだけで、誰もそれを記録しません。だからこそ、信頼できるルーターには必ず品質下限またはバランスモードが搭載されています。
キャッシュ無効化。OpenAI と Anthropic はどちらも、繰り返されるプロンプトプレフィックスに対して割引を提供しており、通常はキャッシュ読み取り時の入力トークンが約90%オフになります。ルーティング層がプロンプトを書き換えたり、並べ替えたり、回転するタイムスタンプを挿入したりすると、プレフィックスが無効化され、その割引が失われます。優れたルーターはプロンプトをバイト単位でそのまま渡し、プロバイダ自身のキャッシュ機構に任せます。
推奨事項:品質の下限を備えたマネージドルーター
本番環境で複数のモデルを運用している場合、トラフィックは簡単なものと難しいものが混在し、その量が十分に大きければわずかな割合でも実際の金額になるため、推奨されるのは品質の下限を維持しつつトークンにマークアップを課さないマネージドルーターです。当社の製品であるOrcaRouterは、その一例であり、詳細にお話しできるものです。以下のチェックリストは、評価するどのルーターにも適用されます。
OrcaRouterのオートモードでは、リクエストするモデル名 orcarouter/autoを標準のOpenAI互換エンドポイントで指定すると、各プロンプトを評価し、200以上のモデルにルーティングします。Balancedをデフォルトとする4つのルーティングポリシーが付属しています。Cheapestは、回答できる最も低コストなモデルに送信します。Balancedは、品質基準を満たす最も安価なモデルに送信します。Qualityは、価格に関係なく最もスコアの高いモデルに送信します。Adaptiveは、ライブトラフィックから学習し、ルーティングを動的に変更します。評価は1ミリ秒未満で測定され、追加レイテンシの合計は50ms未満に保たれます。選択したプロバイダーがレート制限やエラーを返した場合、ルーターは50ms未満でストリーム途中の正常なモデルにフェイルオーバーします。どのレイヤーにもマークアップはありません。各プロバイダーには公開された正確な価格を支払います。上記の$0.09や$5.00の数字がそのまま支払額であり、ルーティング自体は無料です。
精度について言えば、2026年6月のRouterArenaリーダーボードでは、OrcaRouterは75.5%とスコアリングされ、最も近い追跡対象の代替製品は74.0%でした(orcarouter.ai調べ)。1つのリーダーボードは何の証明にもなりません。単一のデータポイントとして扱い、本番トラフィックを任せるルーターを信頼する前に(当社の製品を含む)、ご自身のプロンプトで独自に評価を行ってください。また、ルーター機能とゲートウェイ機能のどちらが必要かを検討している場合は、ルーターとゲートウェイの違いについて、当社のガイド『AI API Gateway in 2026』で解説しています。
この推奨が誤っている場合
正直なスキップリストを平易に述べると:
短いバージョン
{{1}}LLMルーターは、各リクエストにどのモデルが応答するかを選択するレイヤーです。簡単なタスクの大多数には安価で高速なモデルを、難しい少数派には最先端モデルを割り当て、プロバイダーが停止した場合にはフェイルオーバーを備えます。{{/1}}{{2}}これは、モデル間の価格差が大きい場合(DeepSeek V4 Flashが$0.09、Claude Opus 5が入力トークン100万あたり$5.00で55倍の開き)に効果を発揮し、トラフィックが簡単なタスクと難しいタスクの混合であることが条件です。{{/2}}{{3}}研究によると、品質フロアを維持した場合の節約上限は約85%で、下限は評価指標が示す値になります。{{/3}}{{4}}代わりにレイテンシと精度管理の一部を犠牲にすることになり、単一モデルで運用している環境、300ms未満のレイテンシ予算、支出がわずかな環境、出力品質を測定できないチームには不適切です。{{/4}}{{5}}適切な状況では、トークンマークアップなしで品質フロアの背後に配置し、まずトラフィックの一部をルーティングし、節約額を信じる前にルーティングログを確認してください。{{/5}}
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
