AI モデルリーダーボード

OrcaRouter の実運用トラフィックとコミュニティの Battle Mode 投票に基づくランキング — ベンダー公称のベンチマークではありません。

2026-08-22 更新5つの評価ソース新モデルは48時間以内に掲載
実トラフィックで計測
100.0%
最高成功率(7日間)
Qwen: Qwen3 Max
416 ms
最速 p50 レイテンシ
DeepSeek: DeepSeek V3
80.1%
最高のコミュニティ勝率
Qwen3.7 Max (2026-05-20)

統合ランキング

モデルごとに1つの統合ランキング——LMArena の投票、独立ベンチマーク、エコシステム採用度、OrcaRouter の本番環境データを固定の公開ウェイトで融合。新モデルは公開初日から外部データに基づいて掲載されます。

順位モデル総合スコア信頼性$/1M混合利用量モメンタム根拠
#1DeepSeek: DeepSeek V4 Flash80.899.46% · 620ms$0.22$0.147 → $0.295 per 1M tokens19%τ² 95.0τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 19.1%OpenRouterトークンシェア——実世界での採用度。
#2Z.ai: GLM 5.272.399.24% · 4178ms$2.90$1.4 → $4.4 per 1M tokens1%τ² 99.1τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 4.1%OpenRouterトークンシェア——実世界での採用度。
#3DeepSeek: DeepSeek V4 Pro69.799.88% · 929ms$0.66$0.442 → $0.884 per 1M tokens5%τ² 96.2τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 3.3%OpenRouterトークンシェア——実世界での採用度。
#4MiniMax: MiniMax M363.699.95% · 10000ms$0.75$0.3 → $1.2 per 1M tokens<1%τ² 88.9τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 2.0%OpenRouterトークンシェア——実世界での採用度。
#5Anthropic: Claude Fable 561.899.30% · 6919ms$30.00$10 → $50 per 1M tokens<1%τ² 98.5τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 0.3%OpenRouterトークンシェア——実世界での採用度。
#6Anthropic: Claude Opus 4.860.799.47% · 8132ms$15.00$5 → $25 per 1M tokens<1%τ² 94.4τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 0.4%OpenRouterトークンシェア——実世界での採用度。
#7Google: Gemini 3.1 Pro Preview60.499.23% · 10000ms$7.00$2 → $12 per 1M tokens<1%τ² 95.6τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 0.3%OpenRouterトークンシェア——実世界での採用度。
#8openai/gpt-5.5-2026-04-2360.399.07% · 3363ms$27.50$10 → $45 per 1M tokens<1%τ² 93.9τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 0.4%OpenRouterトークンシェア——実世界での採用度。
#9OpenAI: GPT-5.6 Sol60.399.14% · 6288ms$17.50$5 → $30 per 1M tokens<1%τ² 85.1τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 1.4%OpenRouterトークンシェア——実世界での採用度。
#10Z.ai: GLM 560.099.83% · 3142ms$2.10$1 → $3.2 per 1M tokens<1%τ² 98.2τ²-Bench——エージェントのツール使用ベンチマーク(Artificial Analysis経由)。OR 0.1%OpenRouterトークンシェア——実世界での採用度。

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

ラボ別ルーティングトークン比率
deepseek 54.2%openai 23.5%tencent 7.7%obsidian 6.2%その他 8.4%
40%
人間の選好
LMArena · Bradley–Terry
30%
独立ベンチマーク
Artificial Analysis · SWE-bench
20%
本番環境の実績
OrcaRouter battles & traffic
10%
エコシステム採用度
OpenRouter token share

直接対決

Battle Mode の総当たり勝率——各モデルが直接対決で各ライバルに勝つ頻度です。

ベンチマーク——知能と価格

独立した知能スコアを入力価格に対してプロットしています。破線は価格と知能のパレートフロンティアです。

ブラインドバトル

匿名の2つの回答にワンボート。あなたのバトルが統合ランクの20%(本番実績)に反映されます。

⚔️ ブラインドバトル

2つの匿名モデルが同じプロンプトに回答します。両方を読んで勝者に投票し、どちらがどのモデルかを確認しましょう。あなたの投票は上のランキングに反映されます。

評価方法 — このランキングの仕組み

このページのすべての数値は実測値であり、ベンダーの自己申告は一切ありません。以下は統合ランキングの完全な算出方法です — すべてのモデルに、毎日、同じルールを適用します。

1つの融合スコア、固定の公開ウェイト

各モデルは4つの独立した証拠ファミリーから複合スコアを得ます:ブラインド人間評価 40%、独立ベンチマーク 30%、OrcaRouter 本番環境データ 20%、エコシステム採用度 10%。ウェイトは固定かつ公開 — 編集による調整も、有料掲載も、ベンダーからの提出も一切ありません。

各ファミリーのデータ源

人間の選好は LMArena のコミュニティ Elo — テキストとビジョンのアリーナでのブラインド一対比較投票(CC-BY-4.0)。独立ベンチマークは Artificial Analysis(Intelligence Index に加えコーディング、数学、GPQA Diamond、τ²-Bench)と SWE-bench Verified(実際の GitHub Issue の解決率)を組み合わせます。本番環境データは OrcaRouter 自身のもの:Blind Battle の勝率とゲートウェイのライブテレメトリ — 成功率、レイテンシ、ルーティングされたトークン量。採用度は OpenRouter が公表するトークンシェアを使います。

スコアを比較可能にする方法

各ソースの尺度は異なる(Elo、0–100 指数、解決率%)ため、各シグナルを現在のボードに対して標準化し 0–100 に写像します:50 がボード平均、15 ポイントごとに標準偏差 1 つ分で、両端はクランプします。ランク入りには最低 2 つの独立した証拠ファミリーが必要で、ボードは複合スコア上位 25 モデルを掲載します。

ユースケース別ボード

テキスト、コーディング、ビジョン、数学、推論、エージェントの各ボードは、セグメントに適したシグナルで同じ融合を再計算します — コーディングはコーディング系ベンチマークと SWE-bench Verified に、ビジョンは LMArena のビジョンアリーナに置き換え — そして Blind Battle は常に同一セグメント内のモデル同士のみを対戦させます。

鮮度とフェアプレー

外部フィードは毎日更新され、自社テレメトリはライブです。新モデルはリリースから 48 時間以内に外部データに基づいて掲載されます。ベンダーの自己申告値はどこにも使わず、コミュニティの話題度は文脈としてのみ表示してランクには一切影響させず、すべての外部ソースはボードの下に出典を明記します。

よくある質問

AIモデルランキングはどのように算出されますか?

各モデルは4つの証拠ファミリー——ブラインド人間評価(LMArena)、独立ベンチマーク(Artificial Analysis、SWE-bench)、OrcaRouterの本番信頼性、エコシステム採用度(OpenRouter)——を固定公開ウェイト40/30/20/10で統合したスコアを持ちます。

なぜ新モデルにすでにランクがあるのですか?

新モデルはリリースから48時間以内に外部データに基づいて掲載されます。コミュニティバトルと本番トラフィックの蓄積とともにランクは安定していきます。

ランキングの更新頻度は?

外部フィードは毎日更新、OrcaRouterのテレメトリーはライブ。最終更新日はヘッダーに表示されます。

モデルが載っていないのはなぜ?

ランク入りには少なくとも2つの独立した評価ソースが必要で、ボードには総合スコア上位25モデルを表示します。エビデンスが不足するモデルは、新たなソースがカバーするまで掲載されません。

用途別のランキングはありますか?

はい——統合テーブル上部のボタンでテキスト、コーディング、ビジョン、数学、推論、エージェントの各ボードを切り替えられ、バトルは同種のモデル同士のみで行われます。

新モデルのランクはいつ安定しますか?

OrcaRouter 自身のバトル・トラフィックデータを含む3つの証拠ファミリーが揃うと、ランクは外部データのみではなく完全な融合スコアに基づくようになります。

データの出所は?

LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouterランキング、OrcaRouterの本番テレメトリー。出典はボード下に明記しています。

ベンダーはランキングを操作できますか?

困難です。ウェイトは公開、自己申告値は不使用、ブラインドバトルと実トラフィックが各スコアを裏付けます。

データのエクスポートや埋め込みはできますか?

はい——JSON/CSVエクスポート、埋め込み可能なランクバッジ、ランク変動RSSを出典明記のうえ無料で利用できます。リンクはページ下部にあります。

新モデル・順位変動・リリース情報はこちらで:X · @OrcaRouterDiscord