لوحة صدارة نماذج الذكاء الاصطناعي

مُرتَّبة وفق حركة الإنتاج الحقيقية في OrcaRouter وأصوات المجتمع في Battle Mode — وليس وفق معايير يعلنها المزوّدون.

آخر تحديث 2026-09-235 مصادر أدلةالنماذج الجديدة تُدرج خلال 48 ساعة
مقيس على حركة حقيقية
100.0%
أعلى معدل نجاح (7 أيام)
MiniMax: MiniMax M2.5
156 ms
أسرع زمن استجابة p50
Orca: OrcaVerify Text 1.0 (Free)
80.1%
أعلى معدل فوز مجتمعي
Qwen3.7 Max (2026-05-20)

التصنيف الموحّد

ترتيب مدمج واحد لكل نموذج — أصوات LMArena، ومعايير مستقلة، وتبنّي المنظومة، وأدلة الإنتاج من OrcaRouter، بأوزان علنية ثابتة. تدخل النماذج الجديدة من اليوم الأول استنادًا إلى أدلة خارجية.

المرتبةالنموذجالدرجة المركّبةالموثوقية$/1M مدمجالسرعةالزخمالأدلة
#1OpenAI: GPT-5.4 Pro81.199.46% · 10000ms$165.00$60 → $270 per 1M tokens132 توكن في الثانيةAA 66.0مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).Win 58.7%نسبة فوز المعركة العمياء في OrcaRouter — تصويت أعمى من مجتمعنا.
#2DeepSeek: DeepSeek V4.1 Flash78.699.90% · 2532ms$0.38$0.15 → $0.6 per 1M tokens184 توكن في الثانيةAA 39.5مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 13.5%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#3OpenAI: GPT-6 Astra75.899.16% · 10000ms$30.00$10 → $50 per 1M tokens56 توكن في الثانيةAA 52.7مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 1.4%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#4Anthropic: Claude Opus 5.573.4100.00% · 10000ms$12.00$4 → $20 per 1M tokens1784 توكن في الثانيةAA 57.6مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 0.0%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#5Anthropic: Claude Opus 572.699.17% · 6222ms$15.00$5 → $25 per 1M tokens84 توكن في الثانيةAA 50.8مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 0.9%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#6Anthropic: Claude Fable 5.172.399.26% · 8014ms$30.00$10 → $50 per 1M tokens61 توكن في الثانيةAA 53.4مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 0.4%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#7Z.ai: GLM 5.372.199.86% · 3910ms$2.61$1.26 → $3.96 per 1M tokens74 توكن في الثانيةAA 44.8مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 2.4%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#8gpt-5.6-luna72.199.08% · 1200ms$0.90$0.2 → $1.6 per 1M tokens82 توكن في الثانيةAA 37.3مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 6.6%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#9Z.ai: GLM 5.3 Flash71.599.55% · 6861ms$0.16$0.075 → $0.25 per 1M tokens93 توكن في الثانيةArena 1472إيلو مجتمع LMArena — تصويت أعمى في ساحة النص (CC-BY-4.0).AA 41.8مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 13.9%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.
#10OpenAI: GPT-5.6 Sol71.499.14% · 10000ms$12.00$4 → $20 per 1M tokens1625 توكن في الثانيةAA 47.0مؤشر ذكاء Artificial Analysis — معيار مركّب مستقل (0–100).OR 1.4%حصة رموز OpenRouter — تبنٍّ فعلي للمنظومة.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

حصة أفضل 20 حسب المختبر
openai 20.0%anthropic 20.0%z-ai 15.0%google 10.0%أخرى 35.0%
40%
تفضيل البشر
LMArena · Bradley–Terry
30%
معايير مستقلة
Artificial Analysis · SWE-bench
20%
أدلة الإنتاج
OrcaRouter Blind Battle win rate
10%
تبنّي المنظومة
OpenRouter token share

المواجهات المباشرة

معدلات الفوز الثنائية في Battle Mode — كم مرة يتفوق كل نموذج على كل منافس في المواجهة المباشرة.

المعايير — الذكاء مقابل السعر

درجات ذكاء مستقلة مرسومة مقابل سعر الإدخال. الخط المتقطع هو حدّ باريتو للسعر/الذكاء.

مبارزة عمياء

إجابتان مجهولتان وصوت واحد. تغذي معاركك 20% من وزن أدلة الإنتاج في الترتيب الموحّد.

⚔️ مبارزة عمياء

يجيب نموذجان مجهولان عن المطالبة نفسها. اقرأ الإجابتين وصوّت للفائز ثم اكتشف من كتب ماذا — صوتك يُحتسب في الترتيب أعلاه.

المنهجية — كيف تعمل لوحة الترتيب هذه

كل رقم في هذه الصفحة مقاس فعليًا، ولا شيء منه مُبلّغ ذاتيًا. هذه هي الطريقة الكاملة وراء الترتيب المدمج — القواعد نفسها لكل نموذج، كل يوم.

درجة مدمجة واحدة بأوزان علنية ثابتة

يحصل كل نموذج على درجة مركّبة من أربع عائلات أدلة مستقلة: التفضيل البشري الأعمى 40%، والمعايير المستقلة 30%، وأدلة الإنتاج من OrcaRouter 20%، وتبنّي المنظومة 10%. الأوزان ثابتة وعلنية — لا تعديلات تحريرية، ولا مواضع مدفوعة، ولا طلبات من المورّدين.

ما الذي يغذي كل عائلة

يأتي التفضيل البشري من تصنيف Elo المجتمعي في LMArena — تصويتات ثنائية عمياء في ساحتي النص والرؤية (CC-BY-4.0). وتجمع المعايير المستقلة بين Artificial Analysis (مؤشر الذكاء إضافة إلى البرمجة والرياضيات وGPQA Diamond وτ²-Bench) وSWE-bench Verified، أي نسبة قضايا GitHub الحقيقية المحلولة. أدلة الإنتاج هي معدلات الفوز الخاصة بـ OrcaRouter في Blind Battle. ويعتمد التبنّي على حصة الرموز التي تنشرها OpenRouter. أما معدل النجاح والكمون والإنتاجية فتُعرض بجانب كل نموذج كسياق ولا تدخل في الترتيب أبدًا.

كيف تصبح الدرجات قابلة للمقارنة

تُقيّم المصادر بمقاييس مختلفة (Elo، ومؤشرات 0–100، ونسب الحل)، لذا يُوحَّد كل مؤشر قياسيًا مقابل اللوحة الحالية ويُسقَط على 0–100: فالدرجة 50 هي متوسط اللوحة، وكل 15 نقطة تعادل انحرافًا معياريًا واحدًا مع تقييد عند الطرفين. يحتاج النموذج إلى عائلتي أدلة مستقلتين على الأقل ليُرتَّب أصلًا، وتعرض اللوحة أفضل 25 نموذجًا بحسب الدرجة المركّبة.

لوحات بحسب حالة الاستخدام

تعيد لوحات النص والبرمجة والرؤية والرياضيات والاستدلال والوكلاء حساب المزيج نفسه على مؤشرات مناسبة لكل فئة — فالبرمجة تستبدل بمعايير البرمجة وSWE-bench Verified، والرؤية تستخدم ساحة الرؤية في LMArena — ولا تجمع Blind Battle إلا بين نماذج الفئة نفسها.

الحداثة والنزاهة

تُحدَّث المصادر الخارجية يوميًا والقياسات الذاتية حية؛ وتدخل النماذج الجديدة استنادًا إلى أدلة خارجية خلال 48 ساعة من الإصدار. لا تُستخدم أرقام المورّدين المُبلّغة ذاتيًا في أي موضع، ويُعرض صدى المجتمع كسياق فقط ولا يدخل في الترتيب أبدًا، وتُنسب كل المصادر الخارجية أسفل اللوحة.

الأسئلة الشائعة

كيف يُحتسب ترتيب نماذج الذكاء الاصطناعي؟

يحصل كل نموذج على درجة مدمجة من أربع عائلات من الأدلة — تفضيل بشري أعمى (LMArena)، ومعايير مستقلة (Artificial Analysis وSWE-bench)، وموثوقية الإنتاج في OrcaRouter، وتبنّي المنظومة (OpenRouter) — بأوزان عامة ثابتة 40 / 30 / 20 / 10.

لماذا يملك نموذج جديد ترتيبًا بالفعل؟

تدخل النماذج الجديدة إلى اللوحة استنادًا إلى أدلة خارجية خلال 48 ساعة من الإصدار، ويترسّخ الترتيب مع تراكم معارك المجتمع وحركة الإنتاج.

كم مرة يُحدَّث التصنيف؟

تتحدث المصادر الخارجية يوميًا وقياسات OrcaRouter مباشرة؛ ويظهر تاريخ آخر تحديث أعلى الصفحة.

لماذا يغيب نموذج عن القائمة؟

يحتاج النموذج إلى مصدرين مستقلين على الأقل من الأدلة ليُصنَّف، وتعرض اللوحة أفضل 25 نموذجًا حسب الدرجة المركّبة — وتبقى النماذج ذات الأدلة الأقل خارج القائمة حتى يغطيها مصدر جديد.

هل تُصنَّف حالات الاستخدام على حدة؟

نعم — تبدّل الأزرار أعلى الجدول المدمج بين لوحات النص والبرمجة والرؤية والرياضيات والاستدلال والوكلاء، ولا تجمع المعارك إلا بين نماذج متكافئة.

متى يترسّخ ترتيب النموذج الجديد؟

عندما يجمع النموذج ثلاث عائلات من الأدلة، بما فيها بيانات المعارك والحركة الخاصة بـ OrcaRouter، يستند ترتيبه إلى المزيج الكامل لا إلى الأدلة الخارجية وحدها.

من أين تأتي البيانات؟

LMArena (CC-BY-4.0) وArtificial Analysis وSWE-bench وتصنيفات OpenRouter، إضافة إلى قياسات إنتاج OrcaRouter — وكلها منسوبة أسفل اللوحة.

هل يستطيع المزوّدون التلاعب بالتصنيف؟

صعب: الأوزان علنية، ولا نستخدم أرقامًا ذاتية، والمعارك العمياء مع الحركة الحقيقية ترسّخ كل درجة.

هل يمكنني تصدير هذه البيانات أو تضمينها؟

نعم — تصدير JSON/CSV وشارة ترتيب قابلة للتضمين وخلاصة RSS لتغيرات الترتيب، مجانًا مع ذكر المصدر. الروابط في أسفل الصفحة.

نماذج جديدة وتغيرات الترتيب والإصدارات — تابعنا:X · @OrcaRouterDiscord