
LiteLLMの代替手段:問題はプロキシではなく、運用だった
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
LiteLLMは最も人気のあるオープンソースAIプロキシです — MITライセンスのPython SDKおよびゲートウェイで、100以上のLLMプロバイダーを1つのOpenAI互換APIの背後にまとめます。2026年にLiteLLMの代替を探しているなら、おそらく価格が理由ではないでしょう。LiteLLMは手数料を取らず、APIキーがネットワークの外に出ることもありません。チームを離れさせるのは運用です — デプロイ、パッチ適用、フェイルオーバー、モデルカタログの維持をすべて自分で行わなければなりません。その検索に最もよく応える代替はOrcaRouter:200以上のモデルを1つのエンドポイントでプロバイダーの定価で利用でき、トークンあたりのマークアップは$0、プロンプト評価は1ミリ秒未満、ミッドストリームのフェイルオーバーは50ミリ秒未満、そしてRouterArenaの2026年6月リーダーボードでは75.5のルーティング精度スコアを記録 — GPT-5の74.0やAzureの72.8を上回ります。
人々がLiteLLMを去る本当の理由
率直な出発点として、LiteLLMが正しくやっていることを述べたい。LiteLLMは何も間違ったことをしていないわけではない。むしろ、多くのことを正しくやっている。MITライセンスであり、エコシステムの中でも最も広範なプロバイダカタログの1つを備え、単一のOpenAI互換インターフェースの背後に100以上のプロバイダをまとめている。また、自社ネットワーク内で動作するため、データが境界の外に出ることはない。これらはすべて不満の対象ではない。不満なのは、セルフホスト型プロキシが、あなたが今や所有することになる本番サービスだという点だ。アップグレードもあなたの責任だ。プロバイダがスキーマを変更したり、モデルの価格を変更したりすれば、モデルカタログを更新するのもあなたの仕事だ。プロキシがアプリケーション内のすべてのモデル呼び出しにとって単一障害点となるなら、フェイルオーバーと可用性の構築もあなたの責任だ。これは現実の運用予算であり、トラフィックとともに増大する。月間1,000万〜2,000万リクエストにもなれば、プロキシと並行してPostgres、Redis、OpenTelemetry、Grafana、そしてCIパイプラインを運用することになる。
運用リスクは仮説上のものではありません。2026年3月24日、資格情報を収集するペイロードを搭載した2つの悪意のあるLiteLLMリリース(バージョン1.82.7および1.82.8)がPyPIに公開され、削除されるまで約2〜3時間公開されたままでした。このインシデントはPYSEC-2026-2として追跡されています。1.82.8のペイロードは、.pthというファイルに置かれており、Pythonインタープリタが起動するたびに実行されるため、パッケージをアンインストールしても停止しませんでした。そして、このペイロードは毎日数百万回のダウンロードに紛れ込む可能性がありました。ここから得られる教訓は「LiteLLMが危険にさらされた」ということではありません。セルフホスト型プロキシは、その隣にインストールされているすべてのもののサプライチェーン面を受け継ぐため、その面を守るのはあなた自身です。これは一般的な事柄の具体的な一例です。セルフホスト型ゲートウェイでは、運用こそがあなたが構築している製品であり、それはあなたの予定に組み込まれるべきものです。
ランク付けされた選択肢
• OrcaRouter — 多くのチームに最適な選択肢。マネージドルーター:Anthropic、OpenAI、Google、Grok、Alibaba Cloud、DeepSeek、Meta、Qwen、MiniMaxの200以上のモデルと、Orca独自のモデルを束ねる、OpenAI互換の単一エンドポイント。運用に関する議論が崩れる理由は価格設定モデルにあります。OrcaRouterが上乗せするのは、トークンあたり$0、永遠に — 各プロバイダーには正確な定価を支払い、価格は60秒ごとに更新されるため、プロバイダーが日中に価格を変更した場合も、その変更は同じ分に反映され、次に設定ファイルを編集するときまで待つ必要はありません。ルーティング自体は無料で、収益はオプションのチーム機能から得られます。無料のHackerプランでは0%マークアップで3つのAPIキーを利用でき、Teamは月額49ドルで10席・キー無制限、Enterpriseは99.99%アップタイムSLA付きのプライベートまたはオンプレミス展開を追加します。また、公開済みで日付入りのルーティング精度数値を備えているのは、このリストの中で唯一の選択肢です:RouterArenaの2026年6月のリーダーボードで75.5%、プロンプト評価は1ミリ秒未満、ミッドストリームフェイルオーバーは50ミリ秒未満。
• Portkey — オープンコアのガバナンスオプション。 MITライセンスのゲートウェイコアとホステッドコントロールプレーンを備え、45以上のプロバイダーで1,600以上のモデルをカバーしています。無料ティアと月額99ドルのScaleでは、セルフホストしたトラフィックに加えて、ホステッド予算、ロール、可観測性を利用できます。考慮すべきトレードオフ: RBAC、SSO/SCIM、VPCデプロイは有料ティアに含まれます。
• Kong AI Gateway — すでにKongを利用しているチーム向け。 KongのAPI管理プラットフォームの中核となるオープンソースで、LLMゲートウェイにSSOとPIIの秘匿化を追加します。エンタープライズプランは月額約1,500ドルからです。運用はやや重めですが、Kongがすでにエッジなら、自然な選択肢です。
• Bifrost または Envoy AI Gateway — セルフホスト型の高速選択肢。 Bifrost は Apache-2.0 の Go 製ゲートウェイで、サブミリ秒のルーティングオーバーヘッドを謳っています。Envoy AI Gateway は Kubernetes を利用する組織向けに Envoy 上で構築された Apache-2.0 プロジェクトです。どちらもセルフホスティングの利点を維持しているため、運用面での議論はほぼ成立します。ただし、Bifrost の目玉となる数値は独立に再現検証されておらず、本番環境に適用する前に、自社のトラフィックでテストしてください。
• Helicone — 必要なのは、ルーティングではなく可観測性です。 リクエストごとのコストテレメトリーと強力なダッシュボードを備えた、そのまま使えるプロキシです。無料プランは月10,000リクエスト、Proは月$25から。ルーティング機能は基本的で、ラウンドロビンとフェイルオーバーのみです。そのため、LiteLLMの代替というよりは、そのコンパニオンとして捉えるのがよいでしょう。
• TrueFoundry — エンタープライズ管理ゲートウェイ。 プロプライエタリ製品で、SaaS、VPC内、またはエアギャップ環境として提供され、SSO/SCIM、セマンティックキャッシュ、1,600以上のモデルを対象としたガードレールを備えています。調達部門がGitHubリポジトリではなくベンダー契約とSLAを必要とする場合に、最適な選択肢です。

スコアボードの自己ホスティングでは、絶対に得るものはない
セルフホスト型プロキシは、そのルーティングの精度数値をどこも公開していません。測定するものがないからです。品質でルーティングするのではなく、設定で転送しているのです。RouterArenaの2026年6月のリーダーボードは、ルーティング層を直接対決で評価する数少ない場であり、そこではOrcaRouterが75.5%で首位、GPT-5の74.0、Azureの72.8をリードしています。この差こそが要点です。リクエストごとに適切なモデルを選ぶ精度が数ポイント高いルーターは、1ミリ秒未満のプロンプト評価パスを、単なる便宜ではなく、測定可能な品質向上に変えます。セルフホスト型プロキシでは、その軸全体が未測定のままであり、毎週価格が変わるモデル市場について、設定ファイルが正しいと信頼していることになります。また、手書きのフォールバックルールは、事前に予測した障害モードにしか対応できません。

LiteLLMが依然として適切な選択である場合
上記のいずれも、LiteLLMが悪いという議論ではありません——それは、誰が運用すべきかという議論です。LiteLLMが依然としてより良い答えとなる具体的な状況は存在し、それらは公正な比較のために重要です:
• トラフィックは1つか2つのプロバイダーだけです。アプリケーション全体がOpenAIとAnthropicだけを呼び出すのであれば、プロキシは設定ファイルであり、メンテナンスは簡単です。
• キーがネットワークの外部に出ることは絶対にありません。ホステッドサービス(マネージドルーターを含む)が一切許可されない、エアギャップ環境または厳格なオンプレミス環境こそが、LiteLLMの本領です。
• あなた自身がリセラーまたはゲートウェイ製品を構築している場合です。 LiteLLMはプロバイダー価格にマークアップを設定できるため、「マージンを追加する」機能セットはすでに組み込まれています。
• すでにプラットフォームを運用しています。Postgres、Redis、オンコールローテーションを備え、データプレーンを完全に制御したいチームにとって、ホスト型オプションは解放的というよりむしろ冗長に感じられるかもしれません。
• コンプライアンスチームはベンダー契約に署名しません。 MITライブラリのセルフホスティングは、どのSaaSにもない形で調達が不要です。

このテストは、オープンソースかマネージドかという問題ではない。問題は、自社で引き受ける運用が、自分で所有したいコストなのか、それとも購入したいサービスなのか、ということだ。 運用が実際に負担となるスケールの下限——プロキシ1つ、プロバイダー2社、設定ファイル1つ——では、LiteLLMが正解であり、選択肢の中で最も安価である。 そのラインを超えると、マネージドオプションは便利な選択肢ではなくなり、それ自体が目的となる。
切り替えはBASE_URLの変更です
上記のすべてのオプションはOpenAI互換のコントラクトを維持するため、切り替えは通常、決断そのものよりも小規模です。クライアントSDKはそのまま動作し続けます。ベースURLを3箇所(SDK初期化、ランタイム構成、デプロイマニフェスト)変更し、LiteLLM固有の仮想キーを再マッピングするだけです。計画すべき実際の非互換性は2つあります。LiteLLMのx-litellm-*リクエストヘッダーと、その名前空間化されたエラーエンベロープです。どちらも小さなアダプターで1日あれば対応できます。ルーティング層の変更はコードの変更よりも大きいものです。つまり、フォールバックルールを手動で記述するのをやめ、ルーターに選択させるのです。これはまさに、そもそもLiteLLMの代替を探したときにあなたが担っていた責任です。
正直な読み
LiteLLMの選択は、オープンソース対クラウドという議論ではなく、誰がプロキシを運用するかという決定です。LiteLLMは、運用が単純な場合や境界が絶対的な場合には正しい答えであり、この記事がそう述べないのは読者に対して不誠実でしょう。その線を超えるすべての人にとって、トークンごとの課金がなく、プロバイダー価格を60秒ごとに更新し、ストリームの途中で50ミリ秒未満のフェイルオーバーを実現し、ルーティング精度(RouterArenaの2026年6月のリーダーボードで75.5%)を公開しているマネージドルーターは、打ち負かすのが難しい論拠となります。
上記のすべてのルーターとプロバイダーは、1つのOpenAI互換エンドポイントからアクセスできます。OrcaRouterは、プロバイダーの表示価格で200以上のモデルを提供し、トークン当たりのマークアップは$0、60秒ごとに更新されます。APIキーを取得 — クレジットカード不要、60秒で利用開始できます。
