1つの融合スコア、固定の公開ウェイト
各モデルは4つの独立した証拠ファミリーから複合スコアを得ます:ブラインド人間評価 40%、独立ベンチマーク 30%、OrcaRouter 本番環境データ 20%、エコシステム採用度 10%。ウェイトは固定かつ公開 — 編集による調整も、有料掲載も、ベンダーからの提出も一切ありません。
OrcaRouter の実運用トラフィックとコミュニティの Battle Mode 投票に基づくランキング — ベンダー公称のベンチマークではありません。
モデルごとに1つの統合ランキング——LMArena の投票、独立ベンチマーク、エコシステム採用度、OrcaRouter の本番環境データを固定の公開ウェイトで融合。新モデルは公開初日から外部データに基づいて掲載されます。
| 順位 | モデル | 総合スコア | 信頼性 | $/1M混合 | 利用量 | モメンタム | 根拠 |
|---|---|---|---|---|---|---|---|
| #1 | OpenAI: gpt-oss-120b | 65.7 | 99.47% · 910ms | $0.10$0.03 → $0.17 per 1M tokens | <1% | — | AA Math 93.4Artificial Analysisの数学スコア。OR 0.6%OpenRouterトークンシェア——実世界での採用度。 |
| #2 | openai/gpt-5.2-2025-12-11 | 65.1 | 99.11% · 2545ms | $7.88$1.75 → $14 per 1M tokens | <1%▼ | — | AA Math 99.0Artificial Analysisの数学スコア。OR 0.0%OpenRouterトークンシェア——実世界での採用度。 |
| #3 | DeepSeek: DeepSeek V4 Flash | 64.7 | 99.04% · 623ms | $0.22$0.147 → $0.295 per 1M tokens | 20%▼ | — | AA Math 50.0Artificial Analysisの数学スコア。OR 18.2%OpenRouterトークンシェア——実世界での採用度。 |
| #4 | Z.ai: GLM 4.7 | 63.4 | 99.80% · 4066ms | $1.40$0.6 → $2.2 per 1M tokens | <1%▲ | — | AA Math 95.0Artificial Analysisの数学スコア。OR 0.1%OpenRouterトークンシェア——実世界での採用度。 |
| #5 | OpenAI: GPT-5.1-Codex | 63.3 | 99.05% · 1938ms | $5.63$1.25 → $10 per 1M tokens | <1%▲ | — | AA Math 95.7Artificial Analysisの数学スコア。OR 0.0%OpenRouterトークンシェア——実世界での採用度。 |
| #6 | openai/gpt-5-2025-08-07 | 62.7 | 99.25% · 2428ms | $5.63$1.25 → $10 per 1M tokens | <1%▼ | — | AA Math 94.3Artificial Analysisの数学スコア。OR 0.0%OpenRouterトークンシェア——実世界での採用度。 |
| #7 | openai/gpt-5.1-2025-11-13 | 62.7 | 99.10% · 2692ms | $5.63$1.25 → $10 per 1M tokens | <1%▼ | — | AA Math 94.0Artificial Analysisの数学スコア。OR 0.0%OpenRouterトークンシェア——実世界での採用度。 |
| #8 | openai/gpt-5-mini-2025-08-07 | 62.4 | 99.00% · 1450ms | $1.13$0.25 → $2 per 1M tokens | <1%▲ | — | AA Math 90.7Artificial Analysisの数学スコア。OR 0.2%OpenRouterトークンシェア——実世界での採用度。 |
| #9 | OpenAI: GPT-5.1-Codex-Mini | 61.4 | 99.18% · 1125ms | $1.13$0.25 → $2 per 1M tokens | <1%▲ | — | AA Math 91.7Artificial Analysisの数学スコア。OR 0.0%OpenRouterトークンシェア——実世界での採用度。 |
| #10 | Google: Gemini 2.5 Pro | 59.9 | 99.50% · 5666ms | $8.75$2.5 → $15 per 1M tokens | <1%▼ | — | AA Math 87.7Artificial Analysisの数学スコア。OR 0.1%OpenRouterトークンシェア——実世界での採用度。 |
LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai
Battle Mode の総当たり勝率——各モデルが直接対決で各ライバルに勝つ頻度です。
独立した知能スコアを入力価格に対してプロットしています。破線は価格と知能のパレートフロンティアです。
匿名の2つの回答にワンボート。あなたのバトルが統合ランクの20%(本番実績)に反映されます。
2つの匿名モデルが同じプロンプトに回答します。両方を読んで勝者に投票し、どちらがどのモデルかを確認しましょう。あなたの投票は上のランキングに反映されます。
このページのすべての数値は実測値であり、ベンダーの自己申告は一切ありません。以下は統合ランキングの完全な算出方法です — すべてのモデルに、毎日、同じルールを適用します。
各モデルは4つの独立した証拠ファミリーから複合スコアを得ます:ブラインド人間評価 40%、独立ベンチマーク 30%、OrcaRouter 本番環境データ 20%、エコシステム採用度 10%。ウェイトは固定かつ公開 — 編集による調整も、有料掲載も、ベンダーからの提出も一切ありません。
人間の選好は LMArena のコミュニティ Elo — テキストとビジョンのアリーナでのブラインド一対比較投票(CC-BY-4.0)。独立ベンチマークは Artificial Analysis(Intelligence Index に加えコーディング、数学、GPQA Diamond、τ²-Bench)と SWE-bench Verified(実際の GitHub Issue の解決率)を組み合わせます。本番環境データは OrcaRouter 自身のもの:Blind Battle の勝率とゲートウェイのライブテレメトリ — 成功率、レイテンシ、ルーティングされたトークン量。採用度は OpenRouter が公表するトークンシェアを使います。
各ソースの尺度は異なる(Elo、0–100 指数、解決率%)ため、各シグナルを現在のボードに対して標準化し 0–100 に写像します:50 がボード平均、15 ポイントごとに標準偏差 1 つ分で、両端はクランプします。ランク入りには最低 2 つの独立した証拠ファミリーが必要で、ボードは複合スコア上位 25 モデルを掲載します。
テキスト、コーディング、ビジョン、数学、推論、エージェントの各ボードは、セグメントに適したシグナルで同じ融合を再計算します — コーディングはコーディング系ベンチマークと SWE-bench Verified に、ビジョンは LMArena のビジョンアリーナに置き換え — そして Blind Battle は常に同一セグメント内のモデル同士のみを対戦させます。
外部フィードは毎日更新され、自社テレメトリはライブです。新モデルはリリースから 48 時間以内に外部データに基づいて掲載されます。ベンダーの自己申告値はどこにも使わず、コミュニティの話題度は文脈としてのみ表示してランクには一切影響させず、すべての外部ソースはボードの下に出典を明記します。
各モデルは4つの証拠ファミリー——ブラインド人間評価(LMArena)、独立ベンチマーク(Artificial Analysis、SWE-bench)、OrcaRouterの本番信頼性、エコシステム採用度(OpenRouter)——を固定公開ウェイト40/30/20/10で統合したスコアを持ちます。
新モデルはリリースから48時間以内に外部データに基づいて掲載されます。コミュニティバトルと本番トラフィックの蓄積とともにランクは安定していきます。
外部フィードは毎日更新、OrcaRouterのテレメトリーはライブ。最終更新日はヘッダーに表示されます。
ランク入りには少なくとも2つの独立した評価ソースが必要で、ボードには総合スコア上位25モデルを表示します。エビデンスが不足するモデルは、新たなソースがカバーするまで掲載されません。
はい——統合テーブル上部のボタンでテキスト、コーディング、ビジョン、数学、推論、エージェントの各ボードを切り替えられ、バトルは同種のモデル同士のみで行われます。
OrcaRouter 自身のバトル・トラフィックデータを含む3つの証拠ファミリーが揃うと、ランクは外部データのみではなく完全な融合スコアに基づくようになります。
LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouterランキング、OrcaRouterの本番テレメトリー。出典はボード下に明記しています。
困難です。ウェイトは公開、自己申告値は不使用、ブラインドバトルと実トラフィックが各スコアを裏付けます。
はい——JSON/CSVエクスポート、埋め込み可能なランクバッジ、ランク変動RSSを出典明記のうえ無料で利用できます。リンクはページ下部にあります。