一個融合得分,固定公開權重
每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。
基於 OrcaRouter 真實生產流量與社群 Battle Mode 投票排名 —— 而非廠商自報的基準測試。
每個模型一個綜合排名——LMArena 投票、獨立基準測試、生態採用度與 OrcaRouter 生產環境證據,按固定公開權重融合。新模型上線首日即基於外部證據入榜。
| 排名按本分類綜合分排序的位置。 | 模型點擊進入完整模型頁:價格、規格、供應商路由。 | 綜合分0–100 融合分:人類偏好 40%、獨立基準 30%、OrcaRouter 生產證據 20%、生態採用 10%。 | 可靠性OrcaRouter 閘道流量測得的 7 天成功率與中位(p50)延遲。 | $/1M 混合每百萬令牌輸入/輸出價格的平均值;懸停查看精確的輸入→輸出拆分。 | 速度輸出吞吐量(每秒 token 數),基於 OrcaRouter 閘道流量(7 天視窗)——總輸出 token 數除以總生成時間。長條長度相對於最快的模型。 | 動量社群熱度與評分變化——僅供參考,絕不計入排名。 | 證據融合背後的原始信號——懸停任一標籤查看其含義。 |
|---|---|---|---|---|---|---|---|
| #1 | OpenAI: GPT-5.4 Pro | 81.2 | 99.46% · 10000ms | $165.00$60 → $270 per 1M tokens | 每秒 132 個 token | — | AA 66.0Artificial Analysis 智能指數——獨立綜合基準(0–100)。Win 58.7%OrcaRouter 盲測對戰勝率——我們自己社群的盲測兩兩投票。 |
| #2 | DeepSeek: DeepSeek V4.1 Flash | 78.9 | 99.92% · 2672ms | $0.38$0.15 → $0.6 per 1M tokens | 每秒 182 個 token | — | AA 39.5Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 13.7%OpenRouter 令牌份額——真實生態採用度。 |
| #3 | OpenAI: GPT-6 Astra | 75.7 | 99.12% · 10000ms | $30.00$10 → $50 per 1M tokens | 每秒 75 個 token | — | AA 52.7Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 1.3%OpenRouter 令牌份額——真實生態採用度。 |
| #4 | Anthropic: Claude Opus 5.5 | 74.4 | 99.36% · 10000ms | $12.00$4 → $20 per 1M tokens | 每秒 306 個 token | — | AA 57.6Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.2%OpenRouter 令牌份額——真實生態採用度。 |
| #5 | Anthropic: Claude Opus 5 | 72.4 | 99.29% · 6221ms | $15.00$5 → $25 per 1M tokens | 每秒 85 個 token | — | AA 50.8Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.9%OpenRouter 令牌份額——真實生態採用度。 |
| #6 | Anthropic: Claude Fable 5.1 | 72.2 | 99.21% · 8010ms | $30.00$10 → $50 per 1M tokens | 每秒 80 個 token | — | AA 53.4Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.4%OpenRouter 令牌份額——真實生態採用度。 |
| #7 | gpt-5.6-luna | 72.1 | 99.38% · 1104ms | $0.90$0.2 → $1.6 per 1M tokens | 每秒 78 個 token | — | AA 37.3Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 6.5%OpenRouter 令牌份額——真實生態採用度。 |
| #8 | Z.ai: GLM 5.3 | 71.9 | 99.86% · 3874ms | $2.61$1.26 → $3.96 per 1M tokens | 每秒 73 個 token | — | AA 44.8Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 2.3%OpenRouter 令牌份額——真實生態採用度。 |
| #9 | Z.ai: GLM 5.3 Flash | 71.6 | 99.50% · 6897ms | $0.16$0.075 → $0.25 per 1M tokens | 每秒 86 個 token | — | Arena 1472LMArena 社群 Elo——文字競技場盲測人類投票(CC-BY-4.0)。AA 41.8Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 14.2%OpenRouter 令牌份額——真實生態採用度。 |
| #10 | OpenAI: GPT-5.6 Sol | 71.4 | 99.26% · 10000ms | $12.00$4 → $20 per 1M tokens | 每秒 3362 個 token | — | AA 47.0Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 1.4%OpenRouter 令牌份額——真實生態採用度。 |
LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai
Battle Mode 兩兩對戰勝率——每個模型與各個對手正面交鋒的獲勝頻率。
將獨立的智慧評分與輸入價格作圖。虛線為價格/智慧的帕累托前緣。
兩個匿名回答,一次投票。你的對戰計入綜合排名中 20% 的生產證據權重。
兩個匿名模型回答同一個提示詞。讀完兩邊再投票,接著揭曉各自是誰——你的投票會計入上方排行榜。
本頁每個數字都來自實測,絕無廠商自報。以下是綜合排名背後的完整方法——對每個模型、每一天都執行同樣的規則。
每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。
人類偏好來自 LMArena 社群 Elo——文字與視覺競技場的盲測兩兩投票(CC-BY-4.0)。獨立基準結合 Artificial Analysis(智能指數以及程式、數學、GPQA Diamond 與 τ²-Bench)和 SWE-bench Verified(模型解決真實 GitHub issue 的比例)。生產環境證據來自 OrcaRouter 自身的盲測對戰勝率。採用度使用 OpenRouter 公布的 Token 份額。成功率、延遲與吞吐量僅作為參考顯示在每個模型旁,從不參與排名。
各來源的量綱不同(Elo、0–100 指數、解決率百分比),因此每個訊號都會針對當前榜單標準化並映射到 0–100:50 為榜單平均值,每 15 分代表一個標準差,兩端截斷。模型至少需要兩類獨立證據才能入榜,榜單按綜合得分列出前 25 名。
文字、程式、視覺、數學、推理與智能體榜單在各自適配的訊號上重跑同一套融合——程式分區換用程式基準與 SWE-bench Verified,視覺分區使用 LMArena 視覺競技場——且盲測對戰只在同一分區內配對。
外部資料來源每日刷新,第一方遙測即時更新;新模型在發布後 48 小時內基於外部證據入榜。全程不使用任何廠商自報數據,社群熱度僅作參考、絕不參與排名,且所有外部來源都在榜單下方註明出處。
每個模型的融合得分來自四類證據——盲測人類偏好(LMArena)、獨立基準(Artificial Analysis、SWE-bench)、OrcaRouter 生產可靠性、生態採用度(OpenRouter),按固定公開權重 40 / 30 / 20 / 10 加權。
新模型在發布後 48 小時內即基於外部證據入榜。隨著社群對戰和生產流量的累積,排名會逐步穩固。
外部資料來源每日刷新,OrcaRouter 遙測即時更新;榜單頂部顯示最近更新日期。
模型需要至少兩個獨立證據來源才能上榜,榜單展示綜合得分前 25 名——證據不足的模型將保持未上榜,直到有新的來源覆蓋它。
是的——綜合表格上方的分區按鈕可切換文字、程式、視覺、數學、推理與智能體榜單,且對戰只在同類模型間配對。
當模型累積了包括 OrcaRouter 自有對戰與流量數據在內的三類證據後,其排名將基於完整融合得分,而不再只依賴外部證據。
LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouter 排名,以及 OrcaRouter 生產遙測——均在榜單下方註明。
很難:權重公開,不採用廠商自報數據,盲測對戰與真實流量為每個分數提供錨點。
可以——JSON/CSV 匯出、可嵌入的模型排名徽章、排名變動 RSS 均可免費使用(需註明來源),連結見頁面底部。