一個融合得分,固定公開權重
每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。
基於 OrcaRouter 真實生產流量與社群 Battle Mode 投票排名 —— 而非廠商自報的基準測試。
每個模型一個綜合排名——LMArena 投票、獨立基準測試、生態採用度與 OrcaRouter 生產環境證據,按固定公開權重融合。新模型上線首日即基於外部證據入榜。
| 排名 | 模型 | 綜合分 | 可靠性 | $/1M 混合 | 用量 | 動量 | 證據 |
|---|---|---|---|---|---|---|---|
| #1 | Anthropic: Claude Opus 5 | 74.2 | 99.77% · 3883ms | $15.00$5 → $25 per 1M tokens | <1% | — | AA 63.1Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 1.9%OpenRouter 令牌份額——真實生態採用度。 |
| #2 | OpenAI: GPT-5.6 Luna | 73.8 | 99.44% · 3256ms | $0.70$0.2 → $1.2 per 1M tokens | 12% | — | AA 52.3Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 6.7%OpenRouter 令牌份額——真實生態採用度。 |
| #3 | OpenAI: GPT-5.4 Pro | 72.2 | 99.25% · 9000ms | $165.00$60 → $270 per 1M tokens | <1%▼ | — | AA 66.0Artificial Analysis 智能指數——獨立綜合基準(0–100)。Win 58.7%OrcaRouter 盲測對戰勝率——我們自己社群的盲測兩兩投票。 |
| #4 | MoonshotAI: Kimi K3 | 72.2 | 99.40% · 7738ms | $9.00$3 → $15 per 1M tokens | 8% | — | AA 59.7Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 2.0%OpenRouter 令牌份額——真實生態採用度。 |
| #5 | Z.ai: GLM 5.2 | 71.6 | 99.62% · 5211ms | $2.90$1.4 → $4.4 per 1M tokens | 3%▼ | — | AA 52.6Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 4.9%OpenRouter 令牌份額——真實生態採用度。Win 63.6%OrcaRouter 盲測對戰勝率——我們自己社群的盲測兩兩投票。 |
| #6 | OpenAI: GPT-5.6 Sol | 69.8 | 99.34% · 6136ms | $17.50$5 → $30 per 1M tokens | <1% | — | AA 60.9Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.9%OpenRouter 令牌份額——真實生態採用度。 |
| #7 | Qwen3.7 Max (2026-05-20) | 69.2 | 99.14% · 10000ms | $2.50$1.25 → $3.75 per 1M tokens | <1%▲ | — | AA 46.7Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.1%OpenRouter 令牌份額——真實生態採用度。Win 80.1%OrcaRouter 盲測對戰勝率——我們自己社群的盲測兩兩投票。 |
| #8 | OpenAI: GPT-5.6 Terra | 68.0 | 99.94% · 2586ms | $7.00$2 → $12 per 1M tokens | 16% | — | AA 56.6Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 1.2%OpenRouter 令牌份額——真實生態採用度。 |
| #9 | Anthropic: Claude Fable 5 | 67.3 | 99.41% · 4144ms | $30.00$10 → $50 per 1M tokens | <1%▲ | — | Arena 1494LMArena 社群 Elo——文字競技場盲測人類投票(CC-BY-4.0)。AA 62.1Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 0.3%OpenRouter 令牌份額——真實生態採用度。 |
| #10 | Google: Gemini 3.6 Flash | 66.6 | 99.35% · 3928ms | $4.50$1.5 → $7.5 per 1M tokens | <1% | — | Arena 1480LMArena 社群 Elo——文字競技場盲測人類投票(CC-BY-4.0)。AA 51.6Artificial Analysis 智能指數——獨立綜合基準(0–100)。OR 3.5%OpenRouter 令牌份額——真實生態採用度。 |
LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai
Battle Mode 兩兩對戰勝率——每個模型與各個對手正面交鋒的獲勝頻率。
將獨立的智慧評分與輸入價格作圖。虛線為價格/智慧的帕累托前緣。
兩個匿名回答,一次投票。你的對戰計入綜合排名中 20% 的生產證據權重。
兩個匿名模型回答同一個提示詞。讀完兩邊再投票,接著揭曉各自是誰——你的投票會計入上方排行榜。
本頁每個數字都來自實測,絕無廠商自報。以下是綜合排名背後的完整方法——對每個模型、每一天都執行同樣的規則。
每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。
人類偏好來自 LMArena 社群 Elo——文字與視覺競技場的盲測兩兩投票(CC-BY-4.0)。獨立基準結合 Artificial Analysis(智能指數以及程式、數學、GPQA Diamond 與 τ²-Bench)和 SWE-bench Verified(模型解決真實 GitHub issue 的比例)。生產環境證據來自 OrcaRouter 自身:盲測對戰勝率加即時閘道遙測——成功率、延遲與路由 Token 用量。採用度使用 OpenRouter 公布的 Token 份額。
各來源的量綱不同(Elo、0–100 指數、解決率百分比),因此每個訊號都會針對當前榜單標準化並映射到 0–100:50 為榜單平均值,每 15 分代表一個標準差,兩端截斷。模型至少需要兩類獨立證據才能入榜,榜單按綜合得分列出前 25 名。
文字、程式、視覺、數學、推理與智能體榜單在各自適配的訊號上重跑同一套融合——程式分區換用程式基準與 SWE-bench Verified,視覺分區使用 LMArena 視覺競技場——且盲測對戰只在同一分區內配對。
外部資料來源每日刷新,第一方遙測即時更新;新模型在發布後 48 小時內基於外部證據入榜。全程不使用任何廠商自報數據,社群熱度僅作參考、絕不參與排名,且所有外部來源都在榜單下方註明出處。
每個模型的融合得分來自四類證據——盲測人類偏好(LMArena)、獨立基準(Artificial Analysis、SWE-bench)、OrcaRouter 生產可靠性、生態採用度(OpenRouter),按固定公開權重 40 / 30 / 20 / 10 加權。
新模型在發布後 48 小時內即基於外部證據入榜。隨著社群對戰和生產流量的累積,排名會逐步穩固。
外部資料來源每日刷新,OrcaRouter 遙測即時更新;榜單頂部顯示最近更新日期。
模型需要至少兩個獨立證據來源才能上榜,榜單展示綜合得分前 25 名——證據不足的模型將保持未上榜,直到有新的來源覆蓋它。
是的——綜合表格上方的分區按鈕可切換文字、程式、視覺、數學、推理與智能體榜單,且對戰只在同類模型間配對。
當模型累積了包括 OrcaRouter 自有對戰與流量數據在內的三類證據後,其排名將基於完整融合得分,而不再只依賴外部證據。
LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouter 排名,以及 OrcaRouter 生產遙測——均在榜單下方註明。
很難:權重公開,不採用廠商自報數據,盲測對戰與真實流量為每個分數提供錨點。
可以——JSON/CSV 匯出、可嵌入的模型排名徽章、排名變動 RSS 均可免費使用(需註明來源),連結見頁面底部。