AI 模型排行榜

基於 OrcaRouter 真實生產流量與社群 Battle Mode 投票排名 —— 而非廠商自報的基準測試。

更新於 2026-08-235 個證據來源新模型 48 小時內上榜
基於真實流量測量
100.0%
最高成功率(7 天)
Google: Gemini 3.1 Flash Lite Preview
403 ms
最快 p50 延遲
DeepSeek: DeepSeek V3
80.1%
最高社群勝率
Qwen3.7 Max (2026-05-20)

綜合排名

每個模型一個綜合排名——LMArena 投票、獨立基準測試、生態採用度與 OrcaRouter 生產環境證據,按固定公開權重融合。新模型上線首日即基於外部證據入榜。

排名模型綜合分可靠性$/1M 混合用量動量證據
#1OpenAI: gpt-oss-120b65.799.47% · 910ms$0.10$0.03 → $0.17 per 1M tokens<1%AA Math 93.4Artificial Analysis 數學基準分。OR 0.6%OpenRouter 令牌份額——真實生態採用度。
#2openai/gpt-5.2-2025-12-1165.199.11% · 2545ms$7.88$1.75 → $14 per 1M tokens<1%AA Math 99.0Artificial Analysis 數學基準分。OR 0.0%OpenRouter 令牌份額——真實生態採用度。
#3DeepSeek: DeepSeek V4 Flash64.799.04% · 623ms$0.22$0.147 → $0.295 per 1M tokens20%AA Math 50.0Artificial Analysis 數學基準分。OR 18.2%OpenRouter 令牌份額——真實生態採用度。
#4Z.ai: GLM 4.763.499.80% · 4066ms$1.40$0.6 → $2.2 per 1M tokens<1%AA Math 95.0Artificial Analysis 數學基準分。OR 0.1%OpenRouter 令牌份額——真實生態採用度。
#5OpenAI: GPT-5.1-Codex63.399.05% · 1938ms$5.63$1.25 → $10 per 1M tokens<1%AA Math 95.7Artificial Analysis 數學基準分。OR 0.0%OpenRouter 令牌份額——真實生態採用度。
#6openai/gpt-5-2025-08-0762.799.25% · 2428ms$5.63$1.25 → $10 per 1M tokens<1%AA Math 94.3Artificial Analysis 數學基準分。OR 0.0%OpenRouter 令牌份額——真實生態採用度。
#7openai/gpt-5.1-2025-11-1362.799.10% · 2692ms$5.63$1.25 → $10 per 1M tokens<1%AA Math 94.0Artificial Analysis 數學基準分。OR 0.0%OpenRouter 令牌份額——真實生態採用度。
#8openai/gpt-5-mini-2025-08-0762.499.00% · 1450ms$1.13$0.25 → $2 per 1M tokens<1%AA Math 90.7Artificial Analysis 數學基準分。OR 0.2%OpenRouter 令牌份額——真實生態採用度。
#9OpenAI: GPT-5.1-Codex-Mini61.499.18% · 1125ms$1.13$0.25 → $2 per 1M tokens<1%AA Math 91.7Artificial Analysis 數學基準分。OR 0.0%OpenRouter 令牌份額——真實生態採用度。
#10Google: Gemini 2.5 Pro59.999.50% · 5666ms$8.75$2.5 → $15 per 1M tokens<1%AA Math 87.7Artificial Analysis 數學基準分。OR 0.1%OpenRouter 令牌份額——真實生態採用度。

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

各廠商路由令牌份額
deepseek 51.0%openai 25.3%tencent 7.9%obsidian 7.0%其他 8.8%
40%
人類偏好
LMArena · Bradley–Terry
30%
獨立基準測試
Artificial Analysis · SWE-bench
20%
生產環境證據
OrcaRouter battles & traffic
10%
生態採用度
OpenRouter token share

正面對戰

Battle Mode 兩兩對戰勝率——每個模型與各個對手正面交鋒的獲勝頻率。

基準評測——智慧水準與價格

將獨立的智慧評分與輸入價格作圖。虛線為價格/智慧的帕累托前緣。

盲測對戰

兩個匿名回答,一次投票。你的對戰計入綜合排名中 20% 的生產證據權重。

⚔️ 盲測對戰

兩個匿名模型回答同一個提示詞。讀完兩邊再投票,接著揭曉各自是誰——你的投票會計入上方排行榜。

方法論——這個排行榜如何運作

本頁每個數字都來自實測,絕無廠商自報。以下是綜合排名背後的完整方法——對每個模型、每一天都執行同樣的規則。

一個融合得分,固定公開權重

每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。

各類證據的來源

人類偏好來自 LMArena 社群 Elo——文字與視覺競技場的盲測兩兩投票(CC-BY-4.0)。獨立基準結合 Artificial Analysis(智能指數以及程式、數學、GPQA Diamond 與 τ²-Bench)和 SWE-bench Verified(模型解決真實 GitHub issue 的比例)。生產環境證據來自 OrcaRouter 自身:盲測對戰勝率加即時閘道遙測——成功率、延遲與路由 Token 用量。採用度使用 OpenRouter 公布的 Token 份額。

如何讓得分可比

各來源的量綱不同(Elo、0–100 指數、解決率百分比),因此每個訊號都會針對當前榜單標準化並映射到 0–100:50 為榜單平均值,每 15 分代表一個標準差,兩端截斷。模型至少需要兩類獨立證據才能入榜,榜單按綜合得分列出前 25 名。

按用例分區的榜單

文字、程式、視覺、數學、推理與智能體榜單在各自適配的訊號上重跑同一套融合——程式分區換用程式基準與 SWE-bench Verified,視覺分區使用 LMArena 視覺競技場——且盲測對戰只在同一分區內配對。

新鮮度與公平性

外部資料來源每日刷新,第一方遙測即時更新;新模型在發布後 48 小時內基於外部證據入榜。全程不使用任何廠商自報數據,社群熱度僅作參考、絕不參與排名,且所有外部來源都在榜單下方註明出處。

常見問題

AI 模型排行榜如何排名?

每個模型的融合得分來自四類證據——盲測人類偏好(LMArena)、獨立基準(Artificial Analysis、SWE-bench)、OrcaRouter 生產可靠性、生態採用度(OpenRouter),按固定公開權重 40 / 30 / 20 / 10 加權。

為什麼新發布的模型已經有排名?

新模型在發布後 48 小時內即基於外部證據入榜。隨著社群對戰和生產流量的累積,排名會逐步穩固。

排行榜多久更新一次?

外部資料來源每日刷新,OrcaRouter 遙測即時更新;榜單頂部顯示最近更新日期。

為什麼某個模型不在榜上?

模型需要至少兩個獨立證據來源才能上榜,榜單展示綜合得分前 25 名——證據不足的模型將保持未上榜,直到有新的來源覆蓋它。

不同使用情境會分開排名嗎?

是的——綜合表格上方的分區按鈕可切換文字、程式、視覺、數學、推理與智能體榜單,且對戰只在同類模型間配對。

新模型的排名何時穩固?

當模型累積了包括 OrcaRouter 自有對戰與流量數據在內的三類證據後,其排名將基於完整融合得分,而不再只依賴外部證據。

資料來自哪裡?

LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouter 排名,以及 OrcaRouter 生產遙測——均在榜單下方註明。

廠商能刷榜嗎?

很難:權重公開,不採用廠商自報數據,盲測對戰與真實流量為每個分數提供錨點。

可以匯出或嵌入這些資料嗎?

可以——JSON/CSV 匯出、可嵌入的模型排名徽章、排名變動 RSS 均可免費使用(需註明來源),連結見頁面底部。

新模型、排名變動與首發——歡迎關注:X · @OrcaRouterDiscord