لوحة صدارة نماذج الذكاء الاصطناعي

مُرتَّبة وفق حركة الإنتاج الحقيقية في OrcaRouter وأصوات المجتمع في Battle Mode — وليس وفق معايير يعلنها المزوّدون.

مقيس على حركة حقيقية
100.0%
أعلى معدل نجاح (7 أيام)
Z.ai: GLM 5
399 ms
أسرع زمن استجابة p50
DeepSeek: DeepSeek V3
80.1%
أعلى معدل فوز مجتمعي
Qwen3.7 Max (2026-05-20)

العام — معدل الفوز المجتمعي

أصوات Battle Mode المُعمّاة، مُرتَّبة بنموذج Bradley–Terry (Elo). تُظهر النقاط التقييم، وتُظهر الأشرطة فترة الثقة 95٪. النماذج ضمن النطاق نفسه متعادلة إحصائيًا.

ضبط الأسلوب
قريبًا — يتطلب مزيدًا من بيانات المبارزات

⚔️ مبارزة عمياء

يجيب نموذجان مجهولان عن المطالبة نفسها. اقرأ الإجابتين وصوّت للفائز ثم اكتشف من كتب ماذا — صوتك يُحتسب في الترتيب أعلاه.

المرتبةالنموذجتقييم الساحةالطريقةالأصواتفوز·خسارة·تعادل
#1Qwen3.7 Max (2026-05-20)1746±140
تعمية · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
تعمية · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
تعمية · BT
281158·111·12
OpenAI: GPT-5.51521±81
تعمية · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
تعمية · BT
310149·149·12
Qwen3.7 Max1519±125
تعمية · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
تعمية · BT
247117·117·13
Qwen3.6 35B A3B Uncensored (Aggressive)1518±91
تعمية · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
تعمية · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
تعمية · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
تعمية · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
تعمية · BT
224119·93·12
MiniMax: MiniMax M31300±59
تعمية · BT
265127·126·12
Google: Gemma 4 31B1300±58
تعمية · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
تعمية · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
تعمية · BT
213100·101·12
Z.ai: GLM 5.21298±67
تعمية · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
تعمية · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
تعمية · BT
281151·118·12
OpenAI: GPT-5.41078±73
تعمية · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
تعمية · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
تعمية · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
تعمية · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
تعمية · BT
248118·118·12
Z.ai: GLM 5.11076±78
تعمية · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
تعمية · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
تعمية · BT
18871·105·12
#28Gemini 3.5 Flash852±123
تعمية · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
تعمية · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
تعمية · BT
12861·61·6

المواجهات المباشرة

معدلات الفوز الثنائية في Battle Mode — كم مرة يتفوق كل نموذج على كل منافس في المواجهة المباشرة.

متصدرو الفئات

أقوى نموذج في كل قدرة — البرمجة والرياضيات والاستدلال وغيرها — مع ملف لكل محور مقارنةً بالوسيط العام.

المعايير — الذكاء مقابل السعر

درجات ذكاء مستقلة مرسومة مقابل سعر الإدخال. الخط المتقطع هو حدّ باريتو للسعر/الذكاء.

الموثوقية والتكلفة

مقيس على حركة إنتاج OrcaRouter خلال الأيام الـ7 الماضية.

النموذج
النجاح ٪ (7 أيام)
p50
p99
الأخطاء ٪
$/مليون (إدخال→إخراج)
tok/s
Z.ai: GLM 5100.0%7.50 s10.00 s
0.0%
$1.00 → $3.2051
OpenAI: GPT-4o100.0%902 ms10.00 s
0.0%
$2.50 → $10.0098
Qwen: Qwen3.5-122B-A10B100.0%5.00 s10.00 s
0.0%
$0.12 → $0.9289
MiniMax M2.7 highspeed100.0%3.67 s3.67 s
0.0%
$0.60 → $2.4083
Anthropic: Claude Opus 4.6100.0%7.32 s10.00 s
0.0%
$5.00 → $25.0063
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
OpenAI: GPT-5 Codex100.0%875 ms7.35 s
0.0%
$1.25 → $10.00129
openai/gpt-5.4-nano-2026-03-17100.0%1.55 s3.30 s
0.0%
$0.20 → $1.25157
OpenAI: GPT-4.1 Nano100.0%1.37 s5.00 s
0.0%
$0.10 → $0.4082
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
Z.ai: GLM 4.5 Air100.0%7.50 s10.00 s
0.0%
$0.20 → $1.1065
Z.ai: GLM 5.1100.0%4.59 s10.00 s
0.0%
$1.40 → $4.4067
openai/gpt-4.1-nano-2025-04-14100.0%1.57 s10.00 s
0.0%
$0.10 → $0.40131
OpenAI: GPT-5.1-Codex100.0%1.00 s1.83 s
0.0%
$1.25 → $10.0087
openai/gpt-4-turbo-2024-04-09100.0%7.00 s10.00 s
0.0%
$10.00 → $30.0027
openai/gpt-5.2-chat-latest100.0%1.57 s10.00 s
0.0%
$1.75 → $14.00112
qwen/qwen3.5-plus100.0%3.96 s10.00 s
0.0%
$0.12 → $0.6952
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
Anthropic: Claude Fable 5100.0%7.36 s10.00 s
0.0%
$10.00 → $50.0073
openai/gpt-4.1-2025-04-14100.0%3.67 s7.44 s
0.0%
$2.00 → $8.0087
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
Qwen3.7 Max (2026-05-20)100.0%28.13 s28.13 s
0.0%
$1.25 → $3.7512765
OpenAI: GPT-4 Turbo100.0%5.00 s10.00 s
0.0%
$10.00 → $30.0024
openai/gpt-5-2025-08-07100.0%10.00 s10.00 s
0.0%
$1.25 → $10.00363
عرض 1 إلى 25 من 133

الحجم — حركة مرور الإنتاج

أي النماذج تتحمل فعليًا حركة مرور الإنتاج في OrcaRouter، مرتبة حسب إنتاجية الرموز خلال النافذة المحددة.

تصنيف الحجم قيد التهيئة

رأينا حتى الآن — نموذجًا في هذه الفترة. يُفتح تصنيف الحجم بمجرد تجمّع حركة مرور كافية لترتيب النماذج بإنصاف.

النماذج المرصودة

في غضون ذلك، لوحتا الترتيب العام والموثوقية أعلاه نشطتان بالفعل.

التحقق — التوافق مع التصنيفات الخارجية

مدى تتبُّع تصنيف المجتمع للتصنيفات الخارجية المستقلة، مقيسًا بارتباط الرتب لـ Spearman ρ و Kendall τ.

الرواج — الشعبية والمشاعر

ما يتحدث عنه المجتمع — حجم الإشارات، والزخم خلال 14 يومًا، والمشاعر. سياق فقط، وليس إشارة ترتيب أبدًا.