基於 OrcaRouter 真實生產流量與社群 Battle Mode 投票排名 —— 而非廠商自報的基準測試。
盲測 Battle Mode 投票,採用 Bradley–Terry(Elo)模型排名。圓點表示評分,橫條表示 95% 信賴區間。同一區間內的模型在統計上持平。
兩個匿名模型回答同一個提示詞。讀完兩邊再投票,接著揭曉各自是誰——你的投票會計入上方排行榜。
Battle Mode 兩兩對戰勝率——每個模型與各個對手正面交鋒的獲勝頻率。
各項能力——程式設計、數學、推理等——上最強的模型,並附上相對全場中位數的逐項能力剖面。
將獨立的智慧評分與輸入價格作圖。虛線為價格/智慧的帕累托前緣。
基於過去 7 天 OrcaRouter 生產流量測量。
| 模型 | 成功率(7 天) | p50 | p99 | 錯誤率 | $/百萬(輸入→輸出) | tok/s |
|---|---|---|---|---|---|---|
| openai/gpt-4.1-2025-04-14 | 100.0% | 3.67 s | 7.44 s | 0.0% | $2.00 → $8.00 | 87 |
| openai/gpt-5-2025-08-07 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 363 |
| TEtencent/Hunyuan-A13B-Instruct | 100.0% | 1.24 s | 1.24 s | 0.0% | $0.14 → $0.57 | — |
| KIkimi/kimi-k2.5 | 100.0% | 5.53 s | 10.00 s | 0.0% | $0.60 → $3.00 | 54 |
| MIMiniMax: MiniMax M2.7 | 100.0% | 1.28 s | 10.00 s | 0.0% | $0.30 → $1.20 | 82 |
| openai/gpt-4.1-nano-2025-04-14 | 100.0% | 1.57 s | 10.00 s | 0.0% | $0.10 → $0.40 | 131 |
| Anthropic: Claude Fable 5 | 100.0% | 7.36 s | 10.00 s | 0.0% | $10.00 → $50.00 | 73 |
| openai/gpt-4-turbo-2024-04-09 | 100.0% | 7.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 27 |
| OpenAI: GPT-5.1 | 100.0% | 2.43 s | 4.63 s | 0.0% | $1.25 → $10.00 | 109 |
| Qwen3.7 Max | 100.0% | 3.90 s | 10.00 s | 0.0% | $1.25 → $3.75 | 55 |
| ZAZ.ai: GLM 5 | 100.0% | 7.50 s | 10.00 s | 0.0% | $1.00 → $3.20 | 51 |
| GRgrok/grok-imagine-image | 100.0% | 4.76 s | 4.76 s | 0.0% | — → — | — |
| openai/gpt-5.1-2025-11-13 | 100.0% | 2.75 s | 4.19 s | 0.0% | $1.25 → $10.00 | 90 |
| ZAZ.ai: GLM 4.5 | 100.0% | 4.25 s | 10.00 s | 0.0% | $0.60 → $2.20 | 58 |
| MIMiniMax: MiniMax M2.5 | 100.0% | 3.50 s | 4.63 s | 0.0% | $0.30 → $1.20 | 100 |
| OpenAI: GPT-3.5 Turbo 16k | 100.0% | 5.00 s | 7.07 s | 0.0% | $3.00 → $4.00 | 70 |
| Qwen3.7 Max (2026-05-20) | 100.0% | 28.13 s | 28.13 s | 0.0% | $1.25 → $3.75 | 12765 |
| GRgrok/grok-4.3 | 100.0% | 2.00 s | 3.33 s | 0.0% | $1.25 → $2.50 | 115 |
| OpenAI: GPT-4o | 100.0% | 902 ms | 10.00 s | 0.0% | $2.50 → $10.00 | 98 |
| openai/gpt-5.5-2026-04-23 | 100.0% | 4.25 s | 10.00 s | 0.0% | $10.00 → $45.00 | 124 |
| qwen/qwen3-max-preview | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.86 → $3.44 | 86 |
| MIMiniMax M2.7 highspeed | 100.0% | 3.67 s | 3.67 s | 0.0% | $0.60 → $2.40 | 83 |
| openai/gpt-5-chat-latest | 100.0% | 2.00 s | 3.40 s | 0.0% | $1.25 → $10.00 | 135 |
| Qwen: Qwen3 VL 235B A22B Thinking | 100.0% | 8.00 s | 10.00 s | 0.0% | $0.40 → $4.00 | 35 |
| Qwen: Qwen3 VL 8B Thinking | 100.0% | 7.50 s | 10.00 s | 0.0% | $0.18 → $2.10 | 67 |
哪些模型真正承載著 OrcaRouter 的生產流量,依所選時間窗口內的 token 吞吐量排名。
| 排名 | 模型 | 佔比 | 趨勢 |
|---|---|---|---|
| #1 | DEdeepseek-v4-flash | — | |
| #2 | DEdeepseek-v4-pro | — | |
| #3 | ZAglm-5.2 | — | |
| #4 | claude-opus-4.8 | ||
| #5 | DEdeepseek-chat | ||
| #6 | DEdeepseek-reasoner | ||
| #7 | MIminimax-m3 | ||
| #8 | claude-sonnet-5 | — | |
| #9 | claude-opus-4.7 | ||
| #10 | gpt-image-2-medium | — | |
| #11 | qwen3.7-max | ||
| #12 | qwen3.7-plus | ||
| #13 | gemini-3.5-flash | ||
| #14 | qwen3.5-35b-a3b | ||
| #15 | gpt-5.4-nano | ||
| #16 | gemini-2.5-flash-lite | ||
| #17 | gemini-3-flash-preview | ||
| #18 | KIkimi-k2.7-code | — | |
| #19 | gemini-embedding-2-preview | ||
| #20 | ZAglm-5.1 | ||
| #21 | claude-haiku-4.5 | ||
| #22 | qwen3.6-plus | ||
| #23 | OBqwen3.6-35b-a3b | ||
| #24 | claude-sonnet-4.6 | ||
| #25 | gemini-2.5-flash |
另有 17 個模型低於此窗口的排名門檻。
社群排名與獨立外部排名的吻合程度,以 Spearman ρ 和 Kendall τ 秩相關係數衡量。
基於每日快照,呈現各模型過去 90 天的競技場評分。出現回落標記表示持續下滑。
社群正在討論的話題 — 提及量、14 天熱度走勢與口碑情緒。僅供參考,絕不作為排名依據。