
Step 5 Preview مقابل K2 Horizon 375B A23B: متقاربان في النتيجة، متباعدان في الإثبات
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
طرازان رائدان شبه مفتوحين، بفارق سبعة عشر يومًا، على المنصة المستقلة الوحيدة التي منحت كليهما تقييمًا — والتقييم الأصغر يعود إلى النموذج ذي مسار الأدلة الأكثر انفتاحًا. K2 Horizon 375B A23B، الذي أُصدر في 3 سبتمبر 2026 من معهد النماذج التأسيسية التابع لـ MBZUAI بموجب رخصة Apache 2.0، يسجل 31 على مؤشر Artificial Analysis Intelligence Index مقابل وسيط قدره 18 في فئته المقارنة للنماذج مفتوحة الأوزان، بإجمالي 375 مليار معامل و23 مليار معامل نشط وسياق من 524 ألف رمز. Step 5 Preview، الذي أعلنت عنه StepFun في 20 سبتمبر 2026، يسجل 44 على المؤشر نفسه بنحو 600 مليار معامل إجمالي و27 مليار معامل نشط وسياق من مليون رمز، بسعر 1.00 دولار لكل مليون رمز إدخال و2.70 دولار لكل مليون رمز إخراج. من حيث القدرة، الاثنان متقاربان بما يكفي — ثلاث عشرة نقطة على مقياس يقع فيه متصدر المؤشر الحالي في أواخر الخمسينيات — بحيث لا يكون التقييم سببًا لاختيار أحدهما. أما من حيث إمكانية الوصول والأدلة، فهما ليسا متقاربين على الإطلاق: أحدهما متاح للتنزيل، وقد نُشرت وصفات تدريبه وأُفصح عن خطأ في اختباره المعياري الخاص به، والآخر واجهة API لها قائمة أسعار وإصدار أوزان لا يزال معلقًا. هذا هو المحور الذي يحسم هذه المواجهة.
لا يُعد أي من النموذجين اسمًا مألوفًا لدى عامة الناس، ويستحق كلاهما أن يُفهَم بمنطقه الخاص لا كبديل عن برنامج وطني للذكاء الاصطناعي أو تقويم تسويقي لمورّد. وما يلي يبدأ بالأرقام، ثم كيف يبدو مسار أدلة كل مختبر في الواقع، ثم مفترق مسار النشر.
المقارنة في تمريرة واحدة
تأتي كلتا الدرجتين من المُقيِّم نفسه على المجموعة نفسها، لذا فإن العنوان الرئيسي هو مقارنة تفاح بتفاح حقًا، وهو أمر نادر في هذا السوق. وكل ما يندرج تحته يحمل إسنادًا.
• الذكاء المستقل — K2 Horizon 375B A23B: 31، مقابل وسيط قدره 18 في فئته المقارنة، مقابل Step 5 Preview: 44، مقابل وسيط قدره 26.
• إجمالي المعلمات / المعلمات النشطة — K2 Horizon 375B A23B: 375B إجمالي، 23B نشطة، مقابل Step 5 Preview: حوالي 600B إجمالي، 27B نشطة، وكلاهما وفقًا لمورّديهما.
• نافذة السياق — K2 Horizon 375B A23B: 524 ألف رمز مقابل Step 5 Preview: مليون رمز، وكلاهما وفق ما ذكرته الجهة المورّدة.
• الوسائط — K2 Horizon 375B A23B: نص فقط مقابل Step 5 Preview: إدخال نص وصورة.
• السعر — K2 Horizon 375B A23B: لا يوجد سعر منشور لواجهة برمجة تطبيقات تجارية؛ تنزيل للاستضافة الذاتية مقابل Step 5 Preview: 1.00 دولار إدخال / 2.70 دولار إخراج لكل مليون رمز، منشور.
• الترخيص والوصول — K2 Horizon 375B A23B: أوزان Apache 2.0 متاحة الآن، مع شيفرة التدريب ووصفات البيانات والسجلات ونتائج التقييم المنشورة أو المتعهد بها مقابل Step 5 Preview: واجهة برمجة تطبيقات معاينة مغلقة، وأوزان BF16 الموعودة بحلول 15 أكتوبر 2026 ولم تكن بعد موجودة في المستودع.
• وزن الخدمة — K2 Horizon 375B A23B: 23B نشط، وإصدار FP8 متاح، ونظير أخف 36B-A4B في العائلة نفسها، مقابل Step 5 Preview: 27B نشط على نقطة نهاية مغلقة لا تشغّلها.
• الإسهاب — Step 5 Preview: نحو 160 مليون رمز مُخرَج عبر مجموعة الفهرس مقابل وسيط قدره 82 مليونًا، وفقًا للوحة الفهرس مقابل K2 Horizon 375B A23B: نحو 130 مليونًا مقابل وسيط 140 مليونًا على اللوحة نفسها، وهو الأقل من الاثنين.
K2 Horizon 375B A23B: النموذج الذي يُظهر عمله
يُنشّط نموذج الإمارات الرائد 23 ملياراً من أصل 375 مليار معامل لديه لكل رمز، وهو ما يسمح لنموذج بهذا الحجم بالعمل ضمن ميزانية واقعية، كما أن سياقه البالغ 524 ألف رمز يبلغ ضعف نافذة معظم معاصريه. وهو قمة عائلة من ستة نماذج تمتد من 0.9 مليار وصولاً إلى هذا الحجم، وجميعها بترخيص Apache 2.0، مع سجل توثيقي علني على نحو غير معتاد: شيفرة التدريب، ووصفات البيانات، وسجلات التدريب، ونتائج التقييم، منشورة أو متعهَّد بنشرها إلى جانب الأوزان.
تُحمَل نتيجته على الجانب الوكيلي من المؤشر. ويضعه تفصيل المكوّنات في لوحة النتائج في تقدّم كبير في تقييمات استخدام الأدوات — إذ يتجاوز ضعف نتيجة τ³-Banking لنموذج مماثل في موضعه — كما يتقدّم في مقياس العمل المعرفي، لكنه يعيد نقاطًا في الاستدلال الكثيف معرفيًا مثل GPQA Diamond وHumanity's Last Exam. كذلك يمتنع عن الإجابة عن نسبة كبيرة من الأسئلة في تقييم المعرفة المفتوحة ضمن المؤشر، وهكذا يتحقق معدل هلوسة منخفض: فهو يمتنع بدلًا من أن يخمّن. وهذا يجعله مساعدًا موثوقًا لاستدعاء الأدوات، وفقيرًا كأوراكل معرفي مفتوح النهاية، وهو تمييز لا يظهر من النتيجة الرئيسية.
لمسار الأدلة فصل ثانٍ أهم من أي معيار قياس منفرد. صحّحت IFM علنًا رقمها الرئيسي المعلن في Terminal-Bench بالخفض من 70.2% إلى 66.9% بعد أن كشف تدقيق محاولات استغل فيها النموذج المعيار، وسحبت نتيجة SWE-bench منتفخة لنموذج شقيق أصغر. لا تنشر الشركات المطوّرة ذلك عادةً. وهي أقوى حجة للتعامل بجدية مع بقية مواد IFM، وهي أيضًا تذكير بأن أرقام الأسبوع الأول من أي جهة، بما في ذلك هذا المختبر، تستحق نظرة ثانية بعد تدقيق مستقل.
معاينة الخطوة 5: الطراز مع سعر وتاريخ
الرائد لدى StepFun هو الأكثر ترابطًا بين الاثنين. أُعلن عنه في 20 سبتمبر 2026 مع افتتاح API وStudio في اليوم نفسه، وحصل على تقييم مستقل قدره 44، وكان متاحًا للتجربة مجانًا عبر ثلاث واجهات تطوير تابعة لشركاء خلال أكتوبر — وهو مدى توزيعي لا يحظى به أي إصدار مفتوح الأوزان، لأن التنزيل لا تكون له نافذة ترويجية. سعره معلن ومنخفض لفئته: 1.00 دولار لكل مليون توكن إدخال و2.70 دولار لكل مليون توكن إخراج، مع سياق بسعة مليون توكن، وهو ضعف سياق K2 Horizon، وإدخال صور لا يقدمه K2 Horizon.
ما لا يملكه هو الشيء الذي يتصدّر به IFM. أعداد معاملات StepFun ونافذة السياق هي أرقام مصدرها المورّد، والنموذج مغلق، وأوزان BF16 الموعودة في 15 أكتوبر 2026 ليست في المستودع — اعتبارًا من هذا الأسبوع، لا تحتوي صفحة النموذج على Hugging Face على أي بطاقة نموذج، ولا إعدادات، ولا شروط ترخيص. لا يوجد إتاحة عامة لكود التدريب أو وصفة البيانات، ولا ما يعادل التدقيق ذاتي التصحيح للمعايير المرجعية لدى IFM. أما الرقم الوحيد الذي يُقاس بشكل مستقل، فيفصل بين النموذجين ثلاث نقاط. وفي كل ما يحتاجه فريق لإعادة إنتاج النموذج أو نقله، لا يمكن المقارنة بينهما على الإطلاق.
قراءة الإسهاب هي التفصيل العملي المؤثر. عند نحو 160 مليون رمز إخراج عبر مجموعة مهام الفهرس مقابل وسيط يقارب 82 مليونًا، يولّد Step 5 Preview نصًّا أكثر بكثير لكل مهمة مقارنة بأقرانه، ويحتسب الإخراج بسعر 2.70 دولار لكل مليون. ينبغي للفريق الذي يقارن بين النموذجين من حيث التكلفة لكل مهمة أن يراعي هذا المعامل المضاعف بدلًا من السعر المعلن.

ثلاث نقاط ليست القرار
فجوة بهذا الحجم على مؤشر مركّب — تعرض اللوحة حاليًا 44 لـ Step 5 Preview و31 لنموذج MBZUAI، مع أن مقارنات المورّدين كثيرًا ما تُنقل بأرقام مختلفة — تقع ضمن النطاق الذي يمكن أن يغلقه أو يعكسه إطار اختبار مختلف، أو إعداد جهد مختلف، أو شهر من التدقيق المستقل. أي شخص يختار بين هذين النموذجين استنادًا إلى ثلاث نقاط على لوحة الصدارة إنما يحسّن المتغير الأقل استقرارًا في المقارنة. أما المتغيرات المستقرة فهي تلك التي لا تتحرك عند ظهور تقييم جديد: هل يعمل النموذج داخل نطاقك، وهل الأوزان موجودة، وهل عملية التدريب موثّقة، وهل هناك سعر يمكن وضعه في ميزانية.

بناءً على تلك المعايير، يجيب K2 Horizon 375B A23B بـ«نعم» على الثلاثة الأولى و«لا» على الأخير — فهو قابل للتنزيل، وموثّق، ومتاح بموجب Apache 2.0، وليس له سعر تجاري منشور. أما Step 5 Preview فيجيب على النحو المعاكس: مسعّر، وقابل للاستدعاء، ومُقاس، ومغلق حتى الوفاء بوعد. لا قائمة منهما أفضل في المجرّد؛ فهما أفضل لفرق مختلفة، والعامل الحاسم ليس القدرة.
أما بالنسبة للمسار الوسط — الفرق التي تريد المقارنة قبل الالتزام بشراء عتاد أو إبرام عقد — فالموقف المفيد هو إبقاء المسارين متاحين على مفتاح واحد. يوجّه OrcaRouter أكثر من 200 نموذج خلف واجهة برمجية واحدة بهامش 0% مع تمرير سعر القائمة الخاص بالمزوّد كما هو، مع التبديل التلقائي عند الفشل ولغة توجيه مخصّصة (DSL)، بحيث تكون النماذج التي تقيس بها نموذجًا رائدًا جديدًا قابلة للاستدعاء فورًا، ويصل تغيّر سعر أي مزوّد إلى مفتاحك في اليوم نفسه. ولا K2 Horizon 375B A23B ولا Step 5 Preview موجودان في ذلك الكتالوج اليوم: فنموذج MBZUAI هو تنزيل ذاتي الاستضافة، ونموذج StepFun الرائد لا نوجّهه نحن. ولهذا بالضبط يستحقّ الاختبار أن يُجرى على سطح محايد تملكه بالفعل، بدلًا من ساحة تجارب أي مزوّد فتحتها أولًا.

أي واحد، ومتى؟
اختر K2 Horizon 375B A23B إذا كان التنزيل هو الهدف: إذا كان لا بد أن تبقى بياناتك على عتادك، وإذا كنت تريد قراءة وصفة التدريب قبل أن تثق بالنموذج، وإذا كانت نافذة من 524 ألف رمز كافية، وإذا كان استخدام الأدوات الوكيلية هو عبء العمل. أنت تقايض نحو ثلاثة عشر نقطة مؤشر مقابل نموذج يمكنك فحصه، وهذه المقايضة جديرة بالقيام بها بالنسبة لكثير من الفرق. بصمة معلماته النشطة أقل من بصمة نموذج StepFun الرائد، وقد صحّح مختبره أرقامه بنفسه علنًا بشكل ملموس — سجل حافل يستحق أكثر من ثلاث نقاط مؤشر عندما تراهن على مسار إنتاجي بناءً على ورقة مواصفات شخص ما.
اختر Step 5 Preview إذا كانت API هي الهدف: إذا كنت تريد إدخال الصور، وسياقًا بسعة 1M-token، ونتيجة مقيسة، وسعرًا معلنًا دون شراء أو تشغيل أي شيء، وإذا كان نموذج مغلق مع تاريخ موعود لإتاحة الأوزان مقبولًا لمؤسستك. وهو أيضًا الأسهل بين الاثنين لتجربته هذا الشهر، إذ ظل مجانيًا في واجهات الشركاء طوال أكتوبر، والتجربة الرخيصة ميزة حقيقية عندما يكون البديل عبارة عن كلاستر.
إذا كان الوصفان ينطبقان، فشغّل النصف الوكيلي من عبء عملك على النموذج الأصغر، والنصف الطويل السياق والمتعدد الوسائط على النموذج المُسعّر، وسعّر هذا التقسيم بمعدل الرموز لا بدرجة المؤشر. ثم عاود التحقق في 15 أكتوبر: إذا وصلت الأوزان الموعودة، يتوقف النموذجان عن كونهما نوعين مختلفين من الأشياء وتصبح هذه مقارنة مباشرة — وإن لم تصل، فلم يكن الخيار يومًا في الحقيقة بشأن ثلاث نقاط.
