مُرتَّبة وفق حركة الإنتاج الحقيقية في OrcaRouter وأصوات المجتمع في Battle Mode — وليس وفق معايير يعلنها المزوّدون.
أصوات Battle Mode المُعمّاة، مُرتَّبة بنموذج Bradley–Terry (Elo). تُظهر النقاط التقييم، وتُظهر الأشرطة فترة الثقة 95٪. النماذج ضمن النطاق نفسه متعادلة إحصائيًا.
يجيب نموذجان مجهولان عن المطالبة نفسها. اقرأ الإجابتين وصوّت للفائز ثم اكتشف من كتب ماذا — صوتك يُحتسب في الترتيب أعلاه.
| المرتبة | النموذج | تقييم الساحة | الطريقة | الأصوات | فوز·خسارة·تعادل |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | تعمية · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | تعمية · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | تعمية · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | تعمية · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | تعمية · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | تعمية · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | تعمية · BT | 247 | 117·117·13 | ||
| OBQwen3.6 35B A3B Uncensored (Aggressive) | تعمية · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | تعمية · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | تعمية · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | تعمية · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | تعمية · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | تعمية · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | تعمية · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | تعمية · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | تعمية · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | تعمية · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | تعمية · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | تعمية · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | تعمية · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | تعمية · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | تعمية · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | تعمية · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | تعمية · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | تعمية · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | تعمية · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | تعمية · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | تعمية · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | تعمية · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | تعمية · BT | 128 | 61·61·6 |
معدلات الفوز الثنائية في Battle Mode — كم مرة يتفوق كل نموذج على كل منافس في المواجهة المباشرة.
أقوى نموذج في كل قدرة — البرمجة والرياضيات والاستدلال وغيرها — مع ملف لكل محور مقارنةً بالوسيط العام.
درجات ذكاء مستقلة مرسومة مقابل سعر الإدخال. الخط المتقطع هو حدّ باريتو للسعر/الذكاء.
مقيس على حركة إنتاج OrcaRouter خلال الأيام الـ7 الماضية.
| النموذج | النجاح ٪ (7 أيام) | p50 | p99 | الأخطاء ٪ | $/مليون (إدخال→إخراج) | tok/s |
|---|---|---|---|---|---|---|
| ZAZ.ai: GLM 5 | 100.0% | 7.50 s | 10.00 s | 0.0% | $1.00 → $3.20 | 51 |
| OpenAI: GPT-4o | 100.0% | 902 ms | 10.00 s | 0.0% | $2.50 → $10.00 | 98 |
| Qwen: Qwen3.5-122B-A10B | 100.0% | 5.00 s | 10.00 s | 0.0% | $0.12 → $0.92 | 89 |
| MIMiniMax M2.7 highspeed | 100.0% | 3.67 s | 3.67 s | 0.0% | $0.60 → $2.40 | 83 |
| Anthropic: Claude Opus 4.6 | 100.0% | 7.32 s | 10.00 s | 0.0% | $5.00 → $25.00 | 63 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| OpenAI: GPT-5 Codex | 100.0% | 875 ms | 7.35 s | 0.0% | $1.25 → $10.00 | 129 |
| openai/gpt-5.4-nano-2026-03-17 | 100.0% | 1.55 s | 3.30 s | 0.0% | $0.20 → $1.25 | 157 |
| OpenAI: GPT-4.1 Nano | 100.0% | 1.37 s | 5.00 s | 0.0% | $0.10 → $0.40 | 82 |
| OpenAI: GPT-5 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 1504 |
| ZAZ.ai: GLM 4.5 Air | 100.0% | 7.50 s | 10.00 s | 0.0% | $0.20 → $1.10 | 65 |
| ZAZ.ai: GLM 5.1 | 100.0% | 4.59 s | 10.00 s | 0.0% | $1.40 → $4.40 | 67 |
| openai/gpt-4.1-nano-2025-04-14 | 100.0% | 1.57 s | 10.00 s | 0.0% | $0.10 → $0.40 | 131 |
| OpenAI: GPT-5.1-Codex | 100.0% | 1.00 s | 1.83 s | 0.0% | $1.25 → $10.00 | 87 |
| openai/gpt-4-turbo-2024-04-09 | 100.0% | 7.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 27 |
| openai/gpt-5.2-chat-latest | 100.0% | 1.57 s | 10.00 s | 0.0% | $1.75 → $14.00 | 112 |
| qwen/qwen3.5-plus | 100.0% | 3.96 s | 10.00 s | 0.0% | $0.12 → $0.69 | 52 |
| qwen/qwen3.6-plus-2026-04-02 | 100.0% | 4.18 s | 7.86 s | 0.0% | $0.28 → $1.65 | 56 |
| Anthropic: Claude Fable 5 | 100.0% | 7.36 s | 10.00 s | 0.0% | $10.00 → $50.00 | 73 |
| openai/gpt-4.1-2025-04-14 | 100.0% | 3.67 s | 7.44 s | 0.0% | $2.00 → $8.00 | 87 |
| openai/gpt-5-chat-latest | 100.0% | 2.00 s | 3.40 s | 0.0% | $1.25 → $10.00 | 135 |
| OpenAI: GPT-5 Nano | 100.0% | 4.31 s | 10.00 s | 0.0% | $0.05 → $0.40 | 835 |
| Qwen3.7 Max (2026-05-20) | 100.0% | 28.13 s | 28.13 s | 0.0% | $1.25 → $3.75 | 12765 |
| OpenAI: GPT-4 Turbo | 100.0% | 5.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 24 |
| openai/gpt-5-2025-08-07 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 363 |
أي النماذج تتحمل فعليًا حركة مرور الإنتاج في OrcaRouter، مرتبة حسب إنتاجية الرموز خلال النافذة المحددة.
رأينا حتى الآن — نموذجًا في هذه الفترة. يُفتح تصنيف الحجم بمجرد تجمّع حركة مرور كافية لترتيب النماذج بإنصاف.
في غضون ذلك، لوحتا الترتيب العام والموثوقية أعلاه نشطتان بالفعل.
مدى تتبُّع تصنيف المجتمع للتصنيفات الخارجية المستقلة، مقيسًا بارتباط الرتب لـ Spearman ρ و Kendall τ.
تقييم Arena Rating لكل نموذج خلال آخر 90 يومًا، من لقطات يومية. تشير شارة التراجع إلى انخفاض مستمر.
ما يتحدث عنه المجتمع — حجم الإشارات، والزخم خلال 14 يومًا، والمشاعر. سياق فقط، وليس إشارة ترتيب أبدًا.