一個融合得分,固定公開權重
每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。
基於 OrcaRouter 真實生產流量與社群 Battle Mode 投票排名 —— 而非廠商自報的基準測試。
每個模型一個綜合排名——LMArena 投票、獨立基準測試、生態採用度與 OrcaRouter 生產環境證據,按固定公開權重融合。新模型上線首日即基於外部證據入榜。
| 排名 | 模型 | 綜合分 | 可靠性 | $/1M 混合 | 用量 | 動量 | 證據 |
|---|---|---|---|---|---|---|---|
| #1 | Google: Gemini 3.6 Flash | 65.9 | 99.19% · 4146ms | $4.50$1.5 → $7.5 per 1M tokens | <1%▲ | — | Vision 1311LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 1.7%OpenRouter 令牌份額——真實生態採用度。 |
| #2 | Anthropic: Claude Fable 5 | 64.9 | 99.26% · 6787ms | $30.00$10 → $50 per 1M tokens | <1%▲ | — | Vision 1331LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.3%OpenRouter 令牌份額——真實生態採用度。 |
| #3 | Anthropic: Claude Opus 4.7 | 63.3 | 99.09% · 4345ms | $15.00$5 → $25 per 1M tokens | <1%▼ | — | Vision 1316LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.5%OpenRouter 令牌份額——真實生態採用度。 |
| #4 | Qwen: Qwen3.8 Max | 62.5 | 99.49% · 5607ms | $4.00$2 → $6 per 1M tokens | <1% | — | Vision 1315LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.4%OpenRouter 令牌份額——真實生態採用度。 |
| #5 | Anthropic: Claude Opus 4.6 | 61.1 | 99.15% · 4592ms | $15.00$5 → $25 per 1M tokens | <1%▲ | — | Vision 1311LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.2%OpenRouter 令牌份額——真實生態採用度。 |
| #6 | Google: Gemini 3.1 Pro Preview | 58.8 | 99.37% · 10000ms | $7.00$2 → $12 per 1M tokens | <1%▼ | — | Vision 1294LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.3%OpenRouter 令牌份額——真實生態採用度。 |
| #7 | Anthropic: Claude Opus 4.8 | 58.7 | 99.32% · 8070ms | $15.00$5 → $25 per 1M tokens | <1%▼ | — | Vision 1290LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.4%OpenRouter 令牌份額——真實生態採用度。 |
| #8 | Anthropic: Claude Sonnet 4.6 | 58.7 | 99.16% · 2675ms | $9.00$3 → $15 per 1M tokens | <1%▼ | — | Vision 1282LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.8%OpenRouter 令牌份額——真實生態採用度。 |
| #9 | xAI: Grok 4.5 | 58.4 | 99.20% · 10000ms | $4.00$2 → $6 per 1M tokens | <1%▼ | — | Vision 1295LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 0.2%OpenRouter 令牌份額——真實生態採用度。 |
| #10 | MiniMax: MiniMax M3 | 57.7 | 99.95% · 10000ms | $0.75$0.3 → $1.2 per 1M tokens | <1%▼ | — | Vision 1258LMArena 視覺競技場 Elo——多模態回答的盲測投票。OR 2.0%OpenRouter 令牌份額——真實生態採用度。 |
LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai
Battle Mode 兩兩對戰勝率——每個模型與各個對手正面交鋒的獲勝頻率。
將獨立的智慧評分與輸入價格作圖。虛線為價格/智慧的帕累托前緣。
兩個匿名回答,一次投票。你的對戰計入綜合排名中 20% 的生產證據權重。
兩個匿名模型回答同一個提示詞。讀完兩邊再投票,接著揭曉各自是誰——你的投票會計入上方排行榜。
本頁每個數字都來自實測,絕無廠商自報。以下是綜合排名背後的完整方法——對每個模型、每一天都執行同樣的規則。
每個模型的綜合得分來自四類獨立證據:盲測人類偏好 40%、獨立基準測試 30%、OrcaRouter 生產環境證據 20%、生態採用度 10%。權重固定且公開——沒有人為調整、沒有付費排位、不接受廠商提交。
人類偏好來自 LMArena 社群 Elo——文字與視覺競技場的盲測兩兩投票(CC-BY-4.0)。獨立基準結合 Artificial Analysis(智能指數以及程式、數學、GPQA Diamond 與 τ²-Bench)和 SWE-bench Verified(模型解決真實 GitHub issue 的比例)。生產環境證據來自 OrcaRouter 自身:盲測對戰勝率加即時閘道遙測——成功率、延遲與路由 Token 用量。採用度使用 OpenRouter 公布的 Token 份額。
各來源的量綱不同(Elo、0–100 指數、解決率百分比),因此每個訊號都會針對當前榜單標準化並映射到 0–100:50 為榜單平均值,每 15 分代表一個標準差,兩端截斷。模型至少需要兩類獨立證據才能入榜,榜單按綜合得分列出前 25 名。
文字、程式、視覺、數學、推理與智能體榜單在各自適配的訊號上重跑同一套融合——程式分區換用程式基準與 SWE-bench Verified,視覺分區使用 LMArena 視覺競技場——且盲測對戰只在同一分區內配對。
外部資料來源每日刷新,第一方遙測即時更新;新模型在發布後 48 小時內基於外部證據入榜。全程不使用任何廠商自報數據,社群熱度僅作參考、絕不參與排名,且所有外部來源都在榜單下方註明出處。
每個模型的融合得分來自四類證據——盲測人類偏好(LMArena)、獨立基準(Artificial Analysis、SWE-bench)、OrcaRouter 生產可靠性、生態採用度(OpenRouter),按固定公開權重 40 / 30 / 20 / 10 加權。
新模型在發布後 48 小時內即基於外部證據入榜。隨著社群對戰和生產流量的累積,排名會逐步穩固。
外部資料來源每日刷新,OrcaRouter 遙測即時更新;榜單頂部顯示最近更新日期。
模型需要至少兩個獨立證據來源才能上榜,榜單展示綜合得分前 25 名——證據不足的模型將保持未上榜,直到有新的來源覆蓋它。
是的——綜合表格上方的分區按鈕可切換文字、程式、視覺、數學、推理與智能體榜單,且對戰只在同類模型間配對。
當模型累積了包括 OrcaRouter 自有對戰與流量數據在內的三類證據後,其排名將基於完整融合得分,而不再只依賴外部證據。
LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouter 排名,以及 OrcaRouter 生產遙測——均在榜單下方註明。
很難:權重公開,不採用廠商自報數據,盲測對戰與真實流量為每個分數提供錨點。
可以——JSON/CSV 匯出、可嵌入的模型排名徽章、排名變動 RSS 均可免費使用(需註明來源),連結見頁面底部。