基于 OrcaRouter 真实生产流量与社区 Battle Mode 投票排名 —— 而非厂商自报的基准测试。
盲测 Battle Mode 投票,使用 Bradley–Terry(Elo)模型排名。圆点表示评分,横条表示 95% 置信区间。同一区间内的模型在统计上持平。
两个匿名模型回答同一个提示词。读完两边再投票,然后揭晓各自是谁——你的投票会计入上方榜单。
Battle Mode 两两对战胜率——每个模型与各个对手正面交锋的获胜频率。
各项能力——编程、数学、推理等——上最强的模型,并附上相对全场中位数的逐项能力剖面。
将独立的智能评分与输入价格作图。虚线为价格/智能的帕累托前沿。
基于过去 7 天 OrcaRouter 生产流量测量。
| 模型 | 成功率(7 天) | p50 | p99 | 错误率 | $/百万(输入→输出) | tok/s |
|---|---|---|---|---|---|---|
| OpenAI: GPT-5 Mini | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.25 → $2.00 | 189 |
| Qwen: Qwen3 Max | 100.0% | 3.91 s | 10.00 s | 0.0% | $0.36 → $1.43 | 64 |
| OpenAI: GPT-5.2 | 100.0% | 1.51 s | 8.31 s | 0.0% | $1.75 → $14.00 | 171 |
| OpenAI: GPT-4.1 Nano | 100.0% | 1.36 s | 5.00 s | 0.0% | $0.10 → $0.40 | 99 |
| qwen/qwen3.5-flash | 100.0% | 5.83 s | 10.00 s | 0.0% | $0.10 → $0.40 | 140 |
| MIMiniMax M2.7 highspeed | 100.0% | 3.67 s | 3.67 s | 0.0% | $0.60 → $2.40 | 83 |
| openai/gpt-5.2-2025-12-11 | 100.0% | 2.50 s | 10.00 s | 0.0% | $1.75 → $14.00 | 74 |
| Google: Nano Banana Pro (Gemini 3 Pro Image Preview) | 100.0% | 5.00 s | 5.53 s | 0.0% | — → — | — |
| OpenAI: GPT-4o (2024-05-13) | 100.0% | 3.13 s | 6.12 s | 0.0% | $5.00 → $15.00 | 122 |
| Qwen3.7 Max (2026-05-20) | 100.0% | 28.13 s | 28.13 s | 0.0% | $1.25 → $3.75 | 12765 |
| ZAZ.ai: GLM 4.6 | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.60 → $2.20 | 42 |
| openai/gpt-3.5-turbo-1106 | 100.0% | 1.83 s | 4.15 s | 0.0% | $1.00 → $2.00 | 145 |
| openai/gpt-4-turbo-2024-04-09 | 100.0% | 7.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 28 |
| OpenAI: GPT-4o-mini (2024-07-18) | 100.0% | 5.00 s | 10.00 s | 0.0% | $0.15 → $0.60 | 32 |
| openai/gpt-5.1-2025-11-13 | 100.0% | 2.75 s | 4.19 s | 0.0% | $1.25 → $10.00 | 90 |
| openai/gpt-3.5-turbo-0125 | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.50 → $1.50 | 1512 |
| openai/gpt-4.1-nano-2025-04-14 | 100.0% | 1.57 s | 10.00 s | 0.0% | $0.10 → $0.40 | 131 |
| openai/gpt-5-nano-2025-08-07 | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.05 → $0.40 | 650 |
| Qwen3.7 Max | 100.0% | 3.89 s | 10.00 s | 0.0% | $1.25 → $3.75 | 56 |
| DEDeepSeek: DeepSeek V3 | 100.0% | 399 ms | 4.67 s | 0.0% | $0.15 → $0.29 | 58 |
| openai/gpt-5.5-2026-04-23 | 100.0% | 4.25 s | 10.00 s | 0.0% | $10.00 → $45.00 | 124 |
| Qwen: Qwen3 VL 235B A22B Instruct | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.40 → $1.60 | 74 |
| GRgrok/grok-4.3 | 100.0% | 2.00 s | 3.33 s | 0.0% | $1.25 → $2.50 | 115 |
| KIkimi/kimi-k2.5 | 100.0% | 5.53 s | 10.00 s | 0.0% | $0.60 → $3.00 | 54 |
| KIkimi/kimi-k2.6 | 100.0% | 3.92 s | 10.00 s | 0.0% | $0.95 → $4.00 | 36 |
哪些模型真正承载着 OrcaRouter 的生产流量,按所选时间窗口内的 token 吞吐量排名。
本期到目前为止,我们已统计到 — 个模型。当积累足够流量、能够公平地为模型排名时,流量排行榜便会解锁。
在此期间,上方的总榜和可靠性榜已经上线。
社区排名与独立外部排名的吻合程度,以 Spearman ρ 和 Kendall τ 秩相关系数衡量。
基于每日快照,展示各模型过去 90 天的竞技场评分。出现回落徽标表示持续下滑。
社区正在讨论的话题 — 提及量、14 天热度走势与口碑情绪。仅作参考,绝不作为排名依据。