AI 模型排行榜

基於 OrcaRouter 真實生產流量與社群 Battle Mode 投票排名 —— 而非廠商自報的基準測試。

更新於 2026-08-095 個證據來源新模型 48 小時內上榜
基於真實流量測量
100.0%
最高成功率(7 天)
openai/gpt-4-turbo-2024-04-09
450 ms
最快 p50 延遲
OpenAI: GPT-4o (2024-08-06)
80.1%
最高社群勝率
Qwen3.7 Max (2026-05-20)

綜合排名

每個模型一個綜合排名——LMArena 投票、獨立基準測試、生態採用度與 OrcaRouter 生產環境證據,按固定公開權重融合。新模型上線首日即基於外部證據入榜。

排名模型綜合分可靠性$/1M 混合用量動量證據
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 1.9%OpenRouter 令牌份額——真實生態採用度。
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 6.7%OpenRouter 令牌份額——真實生態採用度。
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Artificial Analysis 智能指數——獨立綜合基準(0–100)。Win 58.7%OrcaRouter 盲測對戰勝率——我們自己社群的盲測兩兩投票。
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 2.0%OpenRouter 令牌份額——真實生態採用度。
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 4.9%OpenRouter 令牌份額——真實生態採用度。Win 63.6%OrcaRouter 盲測對戰勝率——我們自己社群的盲測兩兩投票。
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.9%OpenRouter 令牌份額——真實生態採用度。
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.1%OpenRouter 令牌份額——真實生態採用度。Win 80.1%OrcaRouter 盲測對戰勝率——我們自己社群的盲測兩兩投票。
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 1.2%OpenRouter 令牌份額——真實生態採用度。
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494LMArena 社群 Elo——文字競技場盲測人類投票(CC-BY-4.0)。AA 62.1Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.3%OpenRouter 令牌份額——真實生態採用度。
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480LMArena 社群 Elo——文字競技場盲測人類投票(CC-BY-4.0)。AA 51.6Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 3.5%OpenRouter 令牌份額——真實生態採用度。

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

各廠商路由令牌份額
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%其他 6.8%
40%
人類偏好
LMArena · Bradley–Terry
30%
獨立基準測試
Artificial Analysis · SWE-bench
20%
生產環境證據
OrcaRouter battles & traffic
10%
生態採用度
OpenRouter token share

正面對戰

Battle Mode 兩兩對戰勝率——每個模型與各個對手正面交鋒的獲勝頻率。

基準評測——智慧水準與價格

將獨立的智慧評分與輸入價格作圖。虛線為價格/智慧的帕累托前緣。

盲測對戰

兩個匿名回答,一次投票。你的對戰計入綜合排名中 20% 的生產證據權重。

⚔️ 盲測對戰

兩個匿名模型回答同一個提示詞。讀完兩邊再投票,接著揭曉各自是誰——你的投票會計入上方排行榜。

方法論——這個排行榜如何運作

本頁每個數字都來自實測,絕無廠商自報。以下是綜合排名背後的完整方法——對每個模型、每一天都執行同樣的規則。

一個融合得分,固定公開權重

每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。

各類證據的來源

人類偏好來自 LMArena 社群 Elo——文字與視覺競技場的盲測兩兩投票(CC-BY-4.0)。獨立基準結合 Artificial Analysis(智能指數以及程式、數學、GPQA Diamond 與 τ²-Bench)和 SWE-bench Verified(模型解決真實 GitHub issue 的比例)。生產環境證據來自 OrcaRouter 自身:盲測對戰勝率加即時閘道遙測——成功率、延遲與路由 Token 用量。採用度使用 OpenRouter 公布的 Token 份額。

如何讓得分可比

各來源的量綱不同(Elo、0–100 指數、解決率百分比),因此每個訊號都會針對當前榜單標準化並映射到 0–100:50 為榜單平均值,每 15 分代表一個標準差,兩端截斷。模型至少需要兩類獨立證據才能入榜,榜單按綜合得分列出前 25 名。

按用例分區的榜單

文字、程式、視覺、數學、推理與智能體榜單在各自適配的訊號上重跑同一套融合——程式分區換用程式基準與 SWE-bench Verified,視覺分區使用 LMArena 視覺競技場——且盲測對戰只在同一分區內配對。

新鮮度與公平性

外部資料來源每日刷新,第一方遙測即時更新;新模型在發布後 48 小時內基於外部證據入榜。全程不使用任何廠商自報數據,社群熱度僅作參考、絕不參與排名,且所有外部來源都在榜單下方註明出處。

常見問題

AI 模型排行榜如何排名?

每個模型的融合得分來自四類證據——盲測人類偏好(LMArena)、獨立基準(Artificial Analysis、SWE-bench)、OrcaRouter 生產可靠性、生態採用度(OpenRouter),按固定公開權重 40 / 30 / 20 / 10 加權。

為什麼新發布的模型已經有排名?

新模型在發布後 48 小時內即基於外部證據入榜。隨著社群對戰和生產流量的累積,排名會逐步穩固。

排行榜多久更新一次?

外部資料來源每日刷新,OrcaRouter 遙測即時更新;榜單頂部顯示最近更新日期。

為什麼某個模型不在榜上?

模型需要至少兩個獨立證據來源才能上榜,榜單展示綜合得分前 25 名——證據不足的模型將保持未上榜,直到有新的來源覆蓋它。

不同使用情境會分開排名嗎?

是的——綜合表格上方的分區按鈕可切換文字、程式、視覺、數學、推理與智能體榜單,且對戰只在同類模型間配對。

新模型的排名何時穩固?

當模型累積了包括 OrcaRouter 自有對戰與流量數據在內的三類證據後,其排名將基於完整融合得分,而不再只依賴外部證據。

資料來自哪裡?

LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouter 排名,以及 OrcaRouter 生產遙測——均在榜單下方註明。

廠商能刷榜嗎?

很難:權重公開,不採用廠商自報數據,盲測對戰與真實流量為每個分數提供錨點。

可以匯出或嵌入這些資料嗎?

可以——JSON/CSV 匯出、可嵌入的模型排名徽章、排名變動 RSS 均可免費使用(需註明來源),連結見頁面底部。

新模型、排名變動與首發——歡迎關注:X · @OrcaRouterDiscord