مُرتَّبة وفق حركة الإنتاج الحقيقية في OrcaRouter وأصوات المجتمع في Battle Mode — وليس وفق معايير يعلنها المزوّدون.
آخر تحديث 2026-08-095 مصادر أدلةالنماذج الجديدة تُدرج خلال 48 ساعة
مقيس على حركة حقيقية
100.0%
أعلى معدل نجاح (7 أيام)
openai/gpt-4-turbo-2024-04-09
450 ms
أسرع زمن استجابة p50
OpenAI: GPT-4o (2024-08-06)
80.1%
أعلى معدل فوز مجتمعي
Qwen3.7 Max (2026-05-20)
التصنيف الموحّد
ترتيب مدمج واحد لكل نموذج — أصوات LMArena، ومعايير مستقلة، وتبنّي المنظومة، وأدلة الإنتاج من OrcaRouter، بأوزان علنية ثابتة. تدخل النماذج الجديدة من اليوم الأول استنادًا إلى أدلة خارجية.
معدلات الفوز الثنائية في Battle Mode — كم مرة يتفوق كل نموذج على كل منافس في المواجهة المباشرة.
المعايير — الذكاء مقابل السعر
درجات ذكاء مستقلة مرسومة مقابل سعر الإدخال. الخط المتقطع هو حدّ باريتو للسعر/الذكاء.
مبارزة عمياء
إجابتان مجهولتان وصوت واحد. تغذي معاركك 20% من وزن أدلة الإنتاج في الترتيب الموحّد.
⚔️ مبارزة عمياء
يجيب نموذجان مجهولان عن المطالبة نفسها. اقرأ الإجابتين وصوّت للفائز ثم اكتشف من كتب ماذا — صوتك يُحتسب في الترتيب أعلاه.
المنهجية — كيف تعمل لوحة الترتيب هذه
كل رقم في هذه الصفحة مقاس فعليًا، ولا شيء منه مُبلّغ ذاتيًا. هذه هي الطريقة الكاملة وراء الترتيب المدمج — القواعد نفسها لكل نموذج، كل يوم.
درجة مدمجة واحدة بأوزان علنية ثابتة
يحصل كل نموذج على درجة مركّبة من أربع عائلات أدلة مستقلة: التفضيل البشري الأعمى 40%، والمعايير المستقلة 30%، وأدلة الإنتاج من OrcaRouter 20%، وتبنّي المنظومة 10%. الأوزان ثابتة وعلنية — لا تعديلات تحريرية، ولا مواضع مدفوعة، ولا طلبات من المورّدين.
ما الذي يغذي كل عائلة
يأتي التفضيل البشري من تصنيف Elo المجتمعي في LMArena — تصويتات ثنائية عمياء في ساحتي النص والرؤية (CC-BY-4.0). وتجمع المعايير المستقلة بين Artificial Analysis (مؤشر الذكاء إضافة إلى البرمجة والرياضيات وGPQA Diamond وτ²-Bench) وSWE-bench Verified، أي نسبة قضايا GitHub الحقيقية المحلولة. أدلة الإنتاج خاصة بـ OrcaRouter: معدلات الفوز في Blind Battle مع قياسات البوابة الحية — معدل النجاح والكمون وحجم الرموز الموجّهة. ويعتمد التبنّي على حصة الرموز التي تنشرها OpenRouter.
كيف تصبح الدرجات قابلة للمقارنة
تُقيّم المصادر بمقاييس مختلفة (Elo، ومؤشرات 0–100، ونسب الحل)، لذا يُوحَّد كل مؤشر قياسيًا مقابل اللوحة الحالية ويُسقَط على 0–100: فالدرجة 50 هي متوسط اللوحة، وكل 15 نقطة تعادل انحرافًا معياريًا واحدًا مع تقييد عند الطرفين. يحتاج النموذج إلى عائلتي أدلة مستقلتين على الأقل ليُرتَّب أصلًا، وتعرض اللوحة أفضل 25 نموذجًا بحسب الدرجة المركّبة.
لوحات بحسب حالة الاستخدام
تعيد لوحات النص والبرمجة والرؤية والرياضيات والاستدلال والوكلاء حساب المزيج نفسه على مؤشرات مناسبة لكل فئة — فالبرمجة تستبدل بمعايير البرمجة وSWE-bench Verified، والرؤية تستخدم ساحة الرؤية في LMArena — ولا تجمع Blind Battle إلا بين نماذج الفئة نفسها.
الحداثة والنزاهة
تُحدَّث المصادر الخارجية يوميًا والقياسات الذاتية حية؛ وتدخل النماذج الجديدة استنادًا إلى أدلة خارجية خلال 48 ساعة من الإصدار. لا تُستخدم أرقام المورّدين المُبلّغة ذاتيًا في أي موضع، ويُعرض صدى المجتمع كسياق فقط ولا يدخل في الترتيب أبدًا، وتُنسب كل المصادر الخارجية أسفل اللوحة.
الأسئلة الشائعة
كيف يُحتسب ترتيب نماذج الذكاء الاصطناعي؟
يحصل كل نموذج على درجة مدمجة من أربع عائلات من الأدلة — تفضيل بشري أعمى (LMArena)، ومعايير مستقلة (Artificial Analysis وSWE-bench)، وموثوقية الإنتاج في OrcaRouter، وتبنّي المنظومة (OpenRouter) — بأوزان عامة ثابتة 40 / 30 / 20 / 10.
لماذا يملك نموذج جديد ترتيبًا بالفعل؟
تدخل النماذج الجديدة إلى اللوحة استنادًا إلى أدلة خارجية خلال 48 ساعة من الإصدار، ويترسّخ الترتيب مع تراكم معارك المجتمع وحركة الإنتاج.
كم مرة يُحدَّث التصنيف؟
تتحدث المصادر الخارجية يوميًا وقياسات OrcaRouter مباشرة؛ ويظهر تاريخ آخر تحديث أعلى الصفحة.
لماذا يغيب نموذج عن القائمة؟
يحتاج النموذج إلى مصدرين مستقلين على الأقل من الأدلة ليُصنَّف، وتعرض اللوحة أفضل 25 نموذجًا حسب الدرجة المركّبة — وتبقى النماذج ذات الأدلة الأقل خارج القائمة حتى يغطيها مصدر جديد.
هل تُصنَّف حالات الاستخدام على حدة؟
نعم — تبدّل الأزرار أعلى الجدول المدمج بين لوحات النص والبرمجة والرؤية والرياضيات والاستدلال والوكلاء، ولا تجمع المعارك إلا بين نماذج متكافئة.
متى يترسّخ ترتيب النموذج الجديد؟
عندما يجمع النموذج ثلاث عائلات من الأدلة، بما فيها بيانات المعارك والحركة الخاصة بـ OrcaRouter، يستند ترتيبه إلى المزيج الكامل لا إلى الأدلة الخارجية وحدها.
من أين تأتي البيانات؟
LMArena (CC-BY-4.0) وArtificial Analysis وSWE-bench وتصنيفات OpenRouter، إضافة إلى قياسات إنتاج OrcaRouter — وكلها منسوبة أسفل اللوحة.
هل يستطيع المزوّدون التلاعب بالتصنيف؟
صعب: الأوزان علنية، ولا نستخدم أرقامًا ذاتية، والمعارك العمياء مع الحركة الحقيقية ترسّخ كل درجة.
هل يمكنني تصدير هذه البيانات أو تضمينها؟
نعم — تصدير JSON/CSV وشارة ترتيب قابلة للتضمين وخلاصة RSS لتغيرات الترتيب، مجانًا مع ذكر المصدر. الروابط في أسفل الصفحة.