1つの融合スコア、固定の公開ウェイト
各モデルは4つの独立した証拠ファミリーから複合スコアを得ます:ブラインド人間評価 40%、独立ベンチマーク 30%、OrcaRouter 本番環境データ 20%、エコシステム採用度 10%。ウェイトは固定かつ公開 — 編集による調整も、有料掲載も、ベンダーからの提出も一切ありません。
OrcaRouter の実運用トラフィックとコミュニティの Battle Mode 投票に基づくランキング — ベンダー公称のベンチマークではありません。
モデルごとに1つの統合ランキング——LMArena の投票、独立ベンチマーク、エコシステム採用度、OrcaRouter の本番環境データを固定の公開ウェイトで融合。新モデルは公開初日から外部データに基づいて掲載されます。
| 順位このセグメントの総合スコア順位。 | モデルクリックでモデル詳細ページへ:価格・仕様・プロバイダー経路。 | 総合スコア0–100の統合スコア:人間の選好40%、独立ベンチマーク30%、OrcaRouter本番実績20%、採用度10%。 | 信頼性OrcaRouterゲートウェイで測定した7日間成功率と中央値(p50)レイテンシ。 | $/1M混合入力/出力の100万トークン単価の平均。ホバーで入力→出力の内訳。 | 速度出力スループット(1 秒あたりのトークン数)。OrcaRouter ゲートウェイのトラフィック(7 日間ウィンドウ)で、生成トークン総数を生成時間の合計で割った値です。バーは最速のモデルを基準とした相対値です。 | モメンタムコミュニティの話題度とレーティング変化——参考情報であり、ランクには一切影響しません。 | 根拠統合の背後にある生シグナル——各チップにホバーで意味を表示。 |
|---|---|---|---|---|---|---|---|
| #1 | OpenAI: GPT-5.4 Pro | 81.2 | 99.46% · 10000ms | $165.00$60 → $270 per 1M tokens | 毎秒 132 トークン | — | AA 66.0Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。Win 58.7%OrcaRouterブラインドバトル勝率——自コミュニティのブラインド投票。 |
| #2 | DeepSeek: DeepSeek V4.1 Flash | 78.9 | 99.92% · 2523ms | $0.38$0.15 → $0.6 per 1M tokens | 毎秒 182 トークン | — | AA 39.5Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 13.7%OpenRouterトークンシェア——実世界での採用度。 |
| #3 | OpenAI: GPT-6 Astra | 75.7 | 99.14% · 10000ms | $30.00$10 → $50 per 1M tokens | 毎秒 75 トークン | — | AA 52.7Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 1.3%OpenRouterトークンシェア——実世界での採用度。 |
| #4 | Anthropic: Claude Opus 5.5 | 74.4 | 99.04% · 8660ms | $12.00$4 → $20 per 1M tokens | 毎秒 165 トークン | — | AA 57.6Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 0.2%OpenRouterトークンシェア——実世界での採用度。 |
| #5 | Anthropic: Claude Opus 5 | 72.4 | 99.24% · 6250ms | $15.00$5 → $25 per 1M tokens | 毎秒 85 トークン | — | AA 50.8Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 0.9%OpenRouterトークンシェア——実世界での採用度。 |
| #6 | Anthropic: Claude Fable 5.1 | 72.2 | 99.25% · 8112ms | $30.00$10 → $50 per 1M tokens | 毎秒 77 トークン | — | AA 53.4Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 0.4%OpenRouterトークンシェア——実世界での採用度。 |
| #7 | gpt-5.6-luna | 72.1 | 99.08% · 1027ms | $0.90$0.2 → $1.6 per 1M tokens | 毎秒 72 トークン | — | AA 37.3Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 6.5%OpenRouterトークンシェア——実世界での採用度。 |
| #8 | Z.ai: GLM 5.3 | 71.9 | 99.88% · 4015ms | $2.61$1.26 → $3.96 per 1M tokens | 毎秒 73 トークン | — | AA 44.8Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 2.3%OpenRouterトークンシェア——実世界での採用度。 |
| #9 | Z.ai: GLM 5.3 Flash | 71.6 | 99.48% · 6978ms | $0.16$0.075 → $0.25 per 1M tokens | 毎秒 85 トークン | — | Arena 1472LMArenaコミュニティElo——テキストアリーナのブラインド投票(CC-BY-4.0)。AA 41.8Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 14.2%OpenRouterトークンシェア——実世界での採用度。 |
| #10 | OpenAI: GPT-5.6 Sol | 71.4 | 99.10% · 10000ms | $12.00$4 → $20 per 1M tokens | 毎秒 2617 トークン | — | AA 47.0Artificial Analysis知能指数——独立系複合ベンチマーク(0–100)。OR 1.4%OpenRouterトークンシェア——実世界での採用度。 |
LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai
Battle Mode の総当たり勝率——各モデルが直接対決で各ライバルに勝つ頻度です。
独立した知能スコアを入力価格に対してプロットしています。破線は価格と知能のパレートフロンティアです。
匿名の2つの回答にワンボート。あなたのバトルが統合ランクの20%(本番実績)に反映されます。
2つの匿名モデルが同じプロンプトに回答します。両方を読んで勝者に投票し、どちらがどのモデルかを確認しましょう。あなたの投票は上のランキングに反映されます。
このページのすべての数値は実測値であり、ベンダーの自己申告は一切ありません。以下は統合ランキングの完全な算出方法です — すべてのモデルに、毎日、同じルールを適用します。
各モデルは4つの独立した証拠ファミリーから複合スコアを得ます:ブラインド人間評価 40%、独立ベンチマーク 30%、OrcaRouter 本番環境データ 20%、エコシステム採用度 10%。ウェイトは固定かつ公開 — 編集による調整も、有料掲載も、ベンダーからの提出も一切ありません。
人間の選好は LMArena のコミュニティ Elo — テキストとビジョンのアリーナでのブラインド一対比較投票(CC-BY-4.0)。独立ベンチマークは Artificial Analysis(Intelligence Index に加えコーディング、数学、GPQA Diamond、τ²-Bench)と SWE-bench Verified(実際の GitHub Issue の解決率)を組み合わせます。本番環境データは OrcaRouter 自身の Blind Battle 勝率です。採用度は OpenRouter が公表するトークンシェアを使います。成功率、レイテンシ、スループットは各モデルの横に参考情報として表示され、ランキングには一切影響しません。
各ソースの尺度は異なる(Elo、0–100 指数、解決率%)ため、各シグナルを現在のボードに対して標準化し 0–100 に写像します:50 がボード平均、15 ポイントごとに標準偏差 1 つ分で、両端はクランプします。ランク入りには最低 2 つの独立した証拠ファミリーが必要で、ボードは複合スコア上位 25 モデルを掲載します。
テキスト、コーディング、ビジョン、数学、推論、エージェントの各ボードは、セグメントに適したシグナルで同じ融合を再計算します — コーディングはコーディング系ベンチマークと SWE-bench Verified に、ビジョンは LMArena のビジョンアリーナに置き換え — そして Blind Battle は常に同一セグメント内のモデル同士のみを対戦させます。
外部フィードは毎日更新され、自社テレメトリはライブです。新モデルはリリースから 48 時間以内に外部データに基づいて掲載されます。ベンダーの自己申告値はどこにも使わず、コミュニティの話題度は文脈としてのみ表示してランクには一切影響させず、すべての外部ソースはボードの下に出典を明記します。
各モデルは4つの証拠ファミリー——ブラインド人間評価(LMArena)、独立ベンチマーク(Artificial Analysis、SWE-bench)、OrcaRouterの本番信頼性、エコシステム採用度(OpenRouter)——を固定公開ウェイト40/30/20/10で統合したスコアを持ちます。
新モデルはリリースから48時間以内に外部データに基づいて掲載されます。コミュニティバトルと本番トラフィックの蓄積とともにランクは安定していきます。
外部フィードは毎日更新、OrcaRouterのテレメトリーはライブ。最終更新日はヘッダーに表示されます。
ランク入りには少なくとも2つの独立した評価ソースが必要で、ボードには総合スコア上位25モデルを表示します。エビデンスが不足するモデルは、新たなソースがカバーするまで掲載されません。
はい——統合テーブル上部のボタンでテキスト、コーディング、ビジョン、数学、推論、エージェントの各ボードを切り替えられ、バトルは同種のモデル同士のみで行われます。
OrcaRouter 自身のバトル・トラフィックデータを含む3つの証拠ファミリーが揃うと、ランクは外部データのみではなく完全な融合スコアに基づくようになります。
LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouterランキング、OrcaRouterの本番テレメトリー。出典はボード下に明記しています。
困難です。ウェイトは公開、自己申告値は不使用、ブラインドバトルと実トラフィックが各スコアを裏付けます。
はい——JSON/CSVエクスポート、埋め込み可能なランクバッジ、ランク変動RSSを出典明記のうえ無料で利用できます。リンクはページ下部にあります。