تم إنشاء بطاقة مقارنة من عمودين بعنوان «Step 5 Preview مقابل Intern-S2 Mobius» مع عنوان فرعي: «نموذج رائد بحجم 600B تستأجره، أم نموذج استدلال بحجم 35B تشغّله بنفسك». تقول البطاقة اليسرى «Step 5 Preview»: AA Index 44 (مقيس)؛ نحو 600B إجمالي / 27B نشط؛ سياق 1M رمز؛ $1.00 إدخال / $2.70 إخراج لكل 1M؛ واجهة برمجة تطبيقات معاينة مغلقة؛ الأوزان موعودة في 15 أكتوبر 2026. تقول البطاقة اليمنى «Intern-S2 Mobius»: لا توجد نتيجة مستقلة؛ 35B معامل؛ السياق غير منشور؛ لا سعر لواجهة API، استضافة ذاتية؛ Apache 2.0 متاح الآن؛ ادعاء تسريع بنحو 4x، غير مُعاد إنتاجه. ويقرأ تذييل: «أرقام Step 5 Preview وفق StepFun وArtificial Analysis؛ أرقام Intern-S2 Mobius هي ادعاءات InternLM، غير مُعاد إنتاجها.»
Engineering & Research

Step 5 Preview مقابل Intern-S2 Mobius: هل تحتاج إلى نموذج رائد بسعة 600B، أم إلى نموذج استدلال سريع بسعة 35B؟

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

السبب الصادق لمقارنة Step 5 Preview مع Intern-S2 Mobius ليس أنهما متشابهان. بل أنهما إجابتان لسؤالين مختلفين من نفس المشتري — الفريق الذي لديه عبء عمل استدلالي ليديره وليس لديه رغبة في شراء عنقود. الخاص بـ StepFun Step 5 Preview، أُعلن في 20 سبتمبر 2026، هو الإجابة الكبيرة: ما يقرب من 600 مليار معلمة إجمالية مع 27 مليار نشطة، وسياق 1M رمز، ودرجة 44 في مؤشر Artificial Analysis Intelligence Index المقاسة بشكل مستقل، وسعر منشور قدره 1.00 دولار لكل مليون رمز إدخال و2.70 دولار لكل مليون رمز إخراج. الخاص بـ InternLM Intern-S2 Mobius، صدر في 29 يوليو 2026، هو الإجابة الصغيرة: نموذج مفتوح الأوزان بـ 35 مليار معلمة مبني على معمارية Mobius-v0، تم تدريبه مسبقًا بشكل مستمر من Qwen3.5-35B، وادعاؤه المركزي ليس القدرة بل السرعة — تسريع شامل بمقدار 4x على معايير الاستدلال مقابل الأساس الذي تم التدريب منه، دون أي درجة معيارية مستقلة من أي نوع. أحدهما رائد تستأجره؛ والآخر نموذج صغير تشغله. المقارنة في الحقيقة تدور حول ما إذا كان عبء العمل الذي أمامك يبرر الرائد على الإطلاق.

أمر تنظيمي واحد قبل الأرقام، لأنه يكلّف الناس وقتًا حقيقيًا: أطلقت InternLM عدة نماذج تحت لافتة Intern-S2، وهي ليست الشيء نفسه. إن Intern-S2-397B هو النموذج العلمي متعدد الوسائط الرائد؛ وIntern-S2 Mobius هو المفكّر الفعّال بحجم 35B الذي نناقشه هنا؛ وإصدار سابق من Intern-S2 هو نموذج منفصل آخر أيضًا. إذا كنت تبحث عن "Intern-S2" وتصل إلى جداول تقييم خاصة بنموذج 397B، فأنت تقرأ عن نقطة حفظ مختلفة.

ما يدّعيه كل نموذج فعليًا

ادعاءات Step 5 Preview هي الادعاءات المعتادة لطراز رائد في 2026، ويجري التحقق من أحدها بشكل مستقل. تذكر StepFun نحو 600 مليار معامل إجمالي مع 27 مليار معامل نشط، وإدخال نصي وصوري، ونافذة سياق تبلغ مليون رمز، وسعر 1.00 دولار/2.70 دولار لكل مليون رمز إدخال وإخراج. وتقيس Artificial Analysis أداءه عند 44 على مؤشر Intelligence Index الخاص بها، فوق وسيط النماذج المماثلة البالغ 26، مع إخراج بسرعة 87 رمزًا في الثانية مقابل متوسط 78، ونحو 160 مليون رمز إخراج مولّد عبر مجموعة مهام المؤشر مقابل وسيط 82 مليونًا — أي نحو ضعف حجم الإسهاب المعتاد تقريبًا، وهو أمر مهم في نموذج تُحتسب تكلفته على الإخراج.

إن ادعاء Intern-S2 Mobius معماري وأضيق نطاقًا. يفصل تصميمه المعرفة عن الحوسبة: فذاكرة مشتركة عالميًا تحمل متجهات المعرفة، وتستعلم عدة وحدات استدلال منها وتُنقّح حالات مخفية بالتكرار مقابلها، بدلًا من ربط التخزين والحوسبة طبقةً بطبقة كما يفعل المحوّل التقليدي. المردود المعلن لـ InternLM هو تسريع شامل من الطرف إلى الطرف بنحو 4x في اختبارات الاستدلال مقارنةً بـ Qwen3.5-35B الذي ينحدر منه، مع درجات استدلال مماثلة أو أقوى، إضافةً إلى سلاسل تفكير مرئية أقصر. النموذج برخصة Apache 2.0، ومدخلات نصية وصورية، وهو متاح للتنزيل.

• الحجم — Step 5 Preview: حوالي 600 مليار إجمالاً، 27 مليار نشط وفقًا لـ StepFun مقابل Intern-S2 Mobius: 35 مليار إجمالاً.

• درجة مستقلة — Step 5 Preview: 44 على Artificial Analysis Intelligence Index مقابل Intern-S2 Mobius: لم ينشر أي طرف ثالث أي نتيجة.

• السرعة — Step 5 Preview: 87 توكن إخراج في الثانية مقابل متوسط 78، وفق قياس لوحة المؤشر مقابل Intern-S2 Mobius: «نحو 4 أضعاف» مقابل خط الأساس الخاص به Qwen3.5-35B، وهو رقم مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه.

• نافذة السياق — Step 5 Preview: مليون رمز وفقًا لـ StepFun مقابل Intern-S2 Mobius: لم يُنشر أي رقم مستقل لنافذة السياق.

• السعر — Step 5 Preview: $1.00 للإدخال / $2.70 للإخراج لكل مليون توكن مقابل Intern-S2 Mobius: لا يوجد سعر API؛ أنت تدفع مقابل العتاد.

• الترخيص والوصول — Step 5 Preview: معاينة مغلقة عبر API الخاص بالمورّد، وأوزان BF16 موعودة بحلول 15 أكتوبر 2026 مقابل Intern-S2 Mobius: أوزان Apache 2.0 متاحة الآن.

• الإسهاب — معاينة Step 5 Preview: نحو 160 مليون رمز إخراج عبر مجموعة المؤشر مقابل وسيط قدره 82 مليون، وفق لوحة المؤشر مقابل Intern-S2 Mobius: مسارات استدلال مرئية أقصر تدّعيها InternLM، لم يقسها أحد آخر.

ادعاء 4x، ولماذا هو الرقم المثير للاهتمام هنا

اقرأ أرقام المورّدين جنبًا إلى جنب وسيتضح عدم التطابق فورًا: العنوان الرئيسي لدى StepFun هو درجة قدرات، بينما العنوان الرئيسي لدى InternLM هو مضاعِف إنتاجية. هذا ليس مصادفة، وهو أكثر ما يفيد في هذه المقارنة. إن تسريعًا شاملًا بمقدار 4x في مهام الاستدلال، إن صمد عند الاحتكاك بمنظومة تقييم طرف آخر، يساوي أكثر لنشر واسع النطاق من بضع نقاط على مؤشر — فهو يغيّر حساب تشغيل عبء العمل أصلاً. يستهدف Intern-S2 Mobius الفرق التي تكون عنق الزجاجة لديها هو الرموز في الثانية لكل دولار، لا القدرات القصوى.

التحفّظ هو أن المضاعف يُقاس مقابل Qwen3.5-35B، النموذج الذي جرى التدريب المسبق المستمر لـ Intern-S2 Mobius انطلاقًا منه، والذي لم يخضع قط لتدريب Mobius. هذه مقارنة مع نقطة انطلاقه هو لا مع منافس. لا توجد إعادة إنتاج مستقلة لادعاء الإنتاجية، ولا نتيجة مؤشر من طرف ثالث، ولا نافذة سياق منشورة من أي جهة غير المورّد. تعامل مع "نحو 4x" كإشارة معمارية مثيرة للاهتمام وفرضية تختبرها على منصة الاختبار الخاصة بك، لا كمواصفة.

يمتلك Step 5 Preview ملفًا إثباتيًا معاكسًا. رقم قدرته مُقاس بشكل مستقل؛ أما حكايته في الكفاءة فهي الجزء الضعيف. قراءة الإسهاب في لوحة المؤشر — نحو 160 مليون رمز إخراجي حيث يصدر النموذج الوسيط نحو 82 مليونًا — هي الثقل المقابل الصادق لسعر إخراج قدره 2.70 دولار، وهي تعني أن عبء عمل يعتمد على توليدات منظمة طويلة سينفق أكثر بشكل جوهري مما يوحي به السعر المعلن. ما يمتلكه ولا يمتلكه Intern-S2 Mobius هو سعر API منشور من الأساس، وهو ما يجعله قابلًا للمقارنة في المقام الأول.

مستودع Hugging Face الخاص ببناء المورّد الموعود يروي النصف الآخر من القصة: هكذا يبدو إصدار مفتوح الأوزان عندما يُعلَن عنه لكن لم يُشحَن بعد.

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

حيث تصبح مسألة البصمة مؤثرة فعليًا

الميزة الحقيقية لدى Intern-S2 Mobius ليست في نتيجته، التي لم يقسها أحد، بل في تكلفة أن تكون مخطئًا في شأنه. خمسة وثلاثون مليار معلمة هو حجم يمكن لفريق أن يشغّله على عتاد يملكه بالفعل، وأن يقيّمه دون أمر شراء، وأن يتخلى عنه دون شطب أي شيء. تلك ميزة بنيوية لا يستطيع الطراز الرائد مجاراتها مهما حقق من نقاط، وهي السبب في أن هذه المقارنة تستحق أن تُجرى بدلًا من رفضها باعتبارها غير متكافئة.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

تتمثل ميزة الطراز الرائد في الصورة المعكوسة. إن سياق Step 5 Preview البالغ مليون رمز، وإدخال الصور، وقدرة الاستدلال العام المقيسة، تغطي عملاً من غير المرجح أن يغطيه نموذج 35B على نحو جيد، ولا يكلّف تجربته شيئاً طوال مدة نافذة مجانية — فقد ظل النموذج مجانياً في ثلاث واجهات مطوّرين منفصلة خلال أكتوبر. لا يتوفر أي من هاتين الحقيقتين لنموذج مستضاف ذاتياً: فلا يوجد أسبوع مجاني لتشغيل وحدات معالجة الرسومات الخاصة بك، ولا توجد قائمة أسعار تحوّل القرار إلى بند تكلفة.

إذا أردت أن تصمد المقارنة بعد انتهاء النافذة الترويجية، فالشيء الجدير بالبناء هو إطار اختبار لا مجرد تفضيل. يوجّه OrcaRouter أكثر من 200 نموذج خلف مفتاح API واحد وفاتورة واحدة بهامش 0% مع تمرير سعر القائمة الخاص بالمزوّد، مع التحويل التلقائي عند الفشل ولغة توجيه (DSL) لتوجيه حركة المرور حسب التكلفة أو زمن الاستجابة أو القدرات. لا Step 5 Preview ولا Intern-S2 Mobius ضمن ذلك الكتالوج — فنموذج StepFun الرائد لا نوجّهه نحن، وIntern-S2 Mobius تنزيل ذاتي الاستضافة — لذا فالقيمة هنا ليست في الوصول إلى أيٍّ منهما، بل في أن النماذج التي ستقيسهما مقابلها تبعد مفتاحًا واحدًا، وأن قرارًا يُتخذ بالقياس يتحرك مع الأدلة لا مع منشور مدونة إطلاق.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

كيف تقرر

إذا كان عبء العمل لديك وكيليًا أو متعدد الوسائط أو طويل السياق أو مفتوح النهاية — من النوع الذي لا يمكنك فيه حصر المهام مسبقًا — فإن الطراز الرائد هو الجواب، وStep 5 Preview مثال معقول عليه: مدروس، ومسعّر، ورخيص للتجربة الأولية، وقابل للعكس حسب الرمز (token). فقط ضع في ميزانيتك الإسهاب بدلًا من السعر المعلن.

إذا كان عبء العمل لديك ضيقًا ومتكررًا وكثيف الحجم في الاستدلال على بيانات يجب أن تبقى داخل نطاقك، فإن النموذج الصغير هو الجواب، وIntern-S2 Mobius مرشح حقيقي تحديدًا لأنه صغير: فهو يعمل على العتاد الذي تملكه، وهو Apache 2.0، وادعاء السرعة، إن صح، هو من النوع الذي يحسم مسألة اقتصاديات الوحدة. ادخل وأنت تعلم أن الأمر ادعاء المورّد لا حكمًا ترثه عن شخص آخر.

الخطأ هو التعامل مع الخيار وكأنه دائم. اشترِ تقييم النموذج الصغير أولاً، لأنه التجربة الرخيصة؛ واستأجر الطراز الرائد للمهام التي يفشل فيها النموذج الصغير، لأن ذلك هو الإصلاح الرخيص. الفرق التي تُبقي كلا الخيارين متاحين على المفتاح نفسه ومنصة الاختبار نفسها تنتهي إلى اتخاذ هذا القرار ببياناتها الخاصة، وهذا هو الإصدار الوحيد منه الذي يصمد عندما يطرح أي من المورّدين خليفة له.