لوحة صدارة نماذج الذكاء الاصطناعي

مُرتَّبة وفق حركة الإنتاج الحقيقية في OrcaRouter وأصوات المجتمع في Battle Mode — وليس وفق معايير يعلنها المزوّدون.

آخر تحديث 2026-08-095 مصادر أدلةالنماذج الجديدة تُدرج خلال 48 ساعة
مقيس على حركة حقيقية
100.0%
أعلى معدل نجاح (7 أيام)
openai/gpt-4-turbo-2024-04-09
450 ms
أسرع زمن استجابة p50
OpenAI: GPT-4o (2024-08-06)
80.1%
أعلى معدل فوز مجتمعي
Qwen3.7 Max (2026-05-20)

التصنيف الموحّد

ترتيب مدمج واحد لكل نموذج — أصوات LMArena، ومعايير مستقلة، وتبنّي المنظومة، وأدلة الإنتاج من OrcaRouter، بأوزان علنية ثابتة. تدخل النماذج الجديدة من اليوم الأول استنادًا إلى أدلة خارجية.

المرتبةالنموذجالدرجة المركّبةالموثوقية$/1M مدمجالاستخدامالزخمالأدلة
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 1.9%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 6.7%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).Win 58.7%نسبة فوز المعركة العمياء في OrcaRouter — تصويت أعمى من مجتمعنا.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 2.0%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 4.9%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.Win 63.6%نسبة فوز المعركة العمياء في OrcaRouter — تصويت أعمى من مجتمعنا.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 0.9%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 0.1%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.Win 80.1%نسبة فوز المعركة العمياء في OrcaRouter — تصويت أعمى من مجتمعنا.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 1.2%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494إيلو مجتمع LMArena — تصويت أعمى في ساحة النص (CC-BY-4.0).AA 62.1مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 0.3%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480إيلو مجتمع LMArena — تصويت أعمى في ساحة النص (CC-BY-4.0).AA 51.6مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 3.5%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

حصة الرموز الموجهة حسب المختبر
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%أخرى 6.8%
40%
تفضيل البشر
LMArena · Bradley–Terry
30%
معايير مستقلة
Artificial Analysis · SWE-bench
20%
أدلة الإنتاج
OrcaRouter battles & traffic
10%
تبنّي المنظومة
OpenRouter token share

المواجهات المباشرة

معدلات الفوز الثنائية في Battle Mode — كم مرة يتفوق كل نموذج على كل منافس في المواجهة المباشرة.

المعايير — الذكاء مقابل السعر

درجات ذكاء مستقلة مرسومة مقابل سعر الإدخال. الخط المتقطع هو حدّ باريتو للسعر/الذكاء.

مبارزة عمياء

إجابتان مجهولتان وصوت واحد. تغذي معاركك 20% من وزن أدلة الإنتاج في الترتيب الموحّد.

⚔️ مبارزة عمياء

يجيب نموذجان مجهولان عن المطالبة نفسها. اقرأ الإجابتين وصوّت للفائز ثم اكتشف من كتب ماذا — صوتك يُحتسب في الترتيب أعلاه.

المنهجية — كيف تعمل لوحة الترتيب هذه

كل رقم في هذه الصفحة مقاس فعليًا، ولا شيء منه مُبلّغ ذاتيًا. هذه هي الطريقة الكاملة وراء الترتيب المدمج — القواعد نفسها لكل نموذج، كل يوم.

درجة مدمجة واحدة بأوزان علنية ثابتة

يحصل كل نموذج على درجة مركّبة من أربع عائلات أدلة مستقلة: التفضيل البشري الأعمى 40%، والمعايير المستقلة 30%، وأدلة الإنتاج من OrcaRouter 20%، وتبنّي المنظومة 10%. الأوزان ثابتة وعلنية — لا تعديلات تحريرية، ولا مواضع مدفوعة، ولا طلبات من المورّدين.

ما الذي يغذي كل عائلة

يأتي التفضيل البشري من تصنيف Elo المجتمعي في LMArena — تصويتات ثنائية عمياء في ساحتي النص والرؤية (CC-BY-4.0). وتجمع المعايير المستقلة بين Artificial Analysis (مؤشر الذكاء إضافة إلى البرمجة والرياضيات وGPQA Diamond وτ²-Bench) وSWE-bench Verified، أي نسبة قضايا GitHub الحقيقية المحلولة. أدلة الإنتاج خاصة بـ OrcaRouter: معدلات الفوز في Blind Battle مع قياسات البوابة الحية — معدل النجاح والكمون وحجم الرموز الموجّهة. ويعتمد التبنّي على حصة الرموز التي تنشرها OpenRouter.

كيف تصبح الدرجات قابلة للمقارنة

تُقيّم المصادر بمقاييس مختلفة (Elo، ومؤشرات 0–100، ونسب الحل)، لذا يُوحَّد كل مؤشر قياسيًا مقابل اللوحة الحالية ويُسقَط على 0–100: فالدرجة 50 هي متوسط اللوحة، وكل 15 نقطة تعادل انحرافًا معياريًا واحدًا مع تقييد عند الطرفين. يحتاج النموذج إلى عائلتي أدلة مستقلتين على الأقل ليُرتَّب أصلًا، وتعرض اللوحة أفضل 25 نموذجًا بحسب الدرجة المركّبة.

لوحات بحسب حالة الاستخدام

تعيد لوحات النص والبرمجة والرؤية والرياضيات والاستدلال والوكلاء حساب المزيج نفسه على مؤشرات مناسبة لكل فئة — فالبرمجة تستبدل بمعايير البرمجة وSWE-bench Verified، والرؤية تستخدم ساحة الرؤية في LMArena — ولا تجمع Blind Battle إلا بين نماذج الفئة نفسها.

الحداثة والنزاهة

تُحدَّث المصادر الخارجية يوميًا والقياسات الذاتية حية؛ وتدخل النماذج الجديدة استنادًا إلى أدلة خارجية خلال 48 ساعة من الإصدار. لا تُستخدم أرقام المورّدين المُبلّغة ذاتيًا في أي موضع، ويُعرض صدى المجتمع كسياق فقط ولا يدخل في الترتيب أبدًا، وتُنسب كل المصادر الخارجية أسفل اللوحة.

الأسئلة الشائعة

كيف يُحتسب ترتيب نماذج الذكاء الاصطناعي؟

يحصل كل نموذج على درجة مدمجة من أربع عائلات من الأدلة — تفضيل بشري أعمى (LMArena)، ومعايير مستقلة (Artificial Analysis وSWE-bench)، وموثوقية الإنتاج في OrcaRouter، وتبنّي المنظومة (OpenRouter) — بأوزان عامة ثابتة 40 / 30 / 20 / 10.

لماذا يملك نموذج جديد ترتيبًا بالفعل؟

تدخل النماذج الجديدة إلى اللوحة استنادًا إلى أدلة خارجية خلال 48 ساعة من الإصدار، ويترسّخ الترتيب مع تراكم معارك المجتمع وحركة الإنتاج.

كم مرة يُحدَّث التصنيف؟

تتحدث المصادر الخارجية يوميًا وقياسات OrcaRouter مباشرة؛ ويظهر تاريخ آخر تحديث أعلى الصفحة.

لماذا يغيب نموذج عن القائمة؟

يحتاج النموذج إلى مصدرين مستقلين على الأقل من الأدلة ليُصنَّف، وتعرض اللوحة أفضل 25 نموذجًا حسب الدرجة المركّبة — وتبقى النماذج ذات الأدلة الأقل خارج القائمة حتى يغطيها مصدر جديد.

هل تُصنَّف حالات الاستخدام على حدة؟

نعم — تبدّل الأزرار أعلى الجدول المدمج بين لوحات النص والبرمجة والرؤية والرياضيات والاستدلال والوكلاء، ولا تجمع المعارك إلا بين نماذج متكافئة.

متى يترسّخ ترتيب النموذج الجديد؟

عندما يجمع النموذج ثلاث عائلات من الأدلة، بما فيها بيانات المعارك والحركة الخاصة بـ OrcaRouter، يستند ترتيبه إلى المزيج الكامل لا إلى الأدلة الخارجية وحدها.

من أين تأتي البيانات؟

LMArena (CC-BY-4.0) وArtificial Analysis وSWE-bench وتصنيفات OpenRouter، إضافة إلى قياسات إنتاج OrcaRouter — وكلها منسوبة أسفل اللوحة.

هل يستطيع المزوّدون التلاعب بالتصنيف؟

صعب: الأوزان علنية، ولا نستخدم أرقامًا ذاتية، والمعارك العمياء مع الحركة الحقيقية ترسّخ كل درجة.

هل يمكنني تصدير هذه البيانات أو تضمينها؟

نعم — تصدير JSON/CSV وشارة ترتيب قابلة للتضمين وخلاصة RSS لتغيرات الترتيب، مجانًا مع ذكر المصدر. الروابط في أسفل الصفحة.

نماذج جديدة وتغيرات الترتيب والإصدارات — تابعنا:X · @OrcaRouterDiscord