بطاقة عنوان لمقال مقارنة بعنوان Intern-Decision-4B مقابل Qwen 3.8، وعنوان فرعي: تمريرة أمامية خلال 44 مللي ثانية في مقابل 2.4 تريليون معامل، مع ثلاث أيقونات خطية مسطحة توحي بمقيّم صغير سريع، ونموذج استدلال كبير، ومقارنة تكاليف.
Engineering & Research

Intern-Decision-4B مقابل Qwen 3.8: تمريرة أمامية بـ44 مللي ثانية مقابل 2.4 تريليون معامل

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نشرت InternLM نموذج Intern-Decision-4B على Hugging Face في صباح 26 سبتمبر 2026 — بلا منشور إطلاق، ولا تدوينة، ورابط GitHub على بطاقة النموذج الخاصة به يعيد 404، ومساحة عرض توضيحي تعيد 401. الأوزان حقيقية وقابلة للتنزيل؛ أما الإعلان فغير موجود. والنموذج الكامن تحتها هو نسخة مضبوطة بدقة من Qwen3.5-4B، وهو ما يجعل المقارنة مع النموذج الرائد المستضاف تستحق أكثر من ورقة مواصفات. هذان ليسا متنافسين. بل هما طرفا خط أنابيب واحد، والسؤال كله هو أين يقع الخط الفاصل بينهما. النواة الأساسية هي النموذج ذو 2.4 تريليون معامل الذي نشرته الشركة في أغسطس ويُقدَّم الآن باسم Qwen3.8-Max، بسعر 2.00 دولار و6.00 دولار لكل مليون رمز؛ وIntern-Decision-4B إعادة بناء بـ4.54 مليار معامل لذلك النموذج الأساسي الذي مضى على إصداره سبعة أشهر، وهو لا يصدر أي رموز على الإطلاق، ويجيب عن ما يصل إلى ستة عشر سؤالًا محدَّد النوع في تمريرة أمامية واحدة، ولا يكلف شيئًا لكل استدعاء لأنه لا يوجد ناتج لتحصيل فاتورة مقابله.

الجواب في سطر واحد: إذا كانت مهمتك قرارًا له مجموعة مغلقة من الإجابات، فإن Intern-Decision-4B أسرع بنحو خمسين مرة لكل قرار وأرخص بنيويًا، ولن يتفوق عليه أي نموذج حدودي في ذلك المحور الضيق. أما إذا كانت مهمتك أي شيء آخر — استدلال، أو سياق طويل، أو استخدام أدوات، أو أي شيء لا تكون الإجابة فيه مُعدَّدة سلفًا في الموجّه الخاص بك — فإن Qwen 3.8 ليس أفضل فحسب، بل هو الوحيد بين الاثنين القادر على أداء المهمة أصلاً. وكل ما يلي يتعلق بتحديد ذلك الخط بدقة.

ما الذي تم تأكيده فعليًا، وما الذي لم يتم تأكيده

ابدأ بالأدلة، لأن التأطير يهم. لا يوجد إعلان من البائع لـ Intern-Decision-4B. لا بيان صحفي، ولا ورقة بحثية، ولا وصف للمستودع لقراءته. ما هو موجود اليوم هو مستودع Hugging Face نُشر هذا الصباح تحت internlm، وهي منظمة — Intern Large Models، مجموعة Shanghai AI Laboratory — تحمل رخصة Apache 2.0 مع رخصة Qwen الأصلية محفوظة بجانبها باسم LICENSE-QWEN. ظهرت نقطتا تفتيش شقيقتان خلال أربعين ثانية من بعضهما البعض: Intern-Decision-0.8B بـ 853 مليون معلمة و Intern-Decision-2B بـ 2.21 مليار. الثلاثة جميعها تحمل نفس الوسوم — اتخاذ القرار، متعدد الوسائط، التنبؤ المهيكل — وتقع الثلاثة جميعها تحت مجموعة نماذج واحدة لا تزال غير متاحة للعامة بعد.

ما لم يُتأكد منه: هل هذا هو الإصدار النهائي أم دفعة مبكرة. أُنشئ المستودع في الساعة 05:36 بالتوقيت العالمي المنسق، وعُدّل مرة أخرى قبل الساعة 08:00 بالتوقيت العالمي المنسق في اليوم نفسه، واستمر نشاط عام إضافي على نقاط التحقق الشقيقة بعد الساعة 09:00. لم تقل InternLM ما هي قصة النشر المقصودة، ولم تنشر المستودع الذي تشير إليه، ولم تقل ما إذا كانت نقطة نهاية مستضافة قادمة. تعامل مع كل رقم من أرقام القياس في هذا المقال على أنه مُبلَّغ من المورّد وغير مُعاد إنتاجه — لأنه حتى لحظة كتابة هذه السطور، لم يُكتب حرفيًا أي شيء آخر عن هذا النموذج في أي مكان. ثلاثة مسارات بحث منفصلة لا تُرجع شيئًا عن الاسم.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

الرهان المعماري: مُقيِّم، وليس مُولِّدًا

أهم جملة في التوثيق الخاص بـ Intern-Decision-4B هي جملة نافية: مسار الاستدلال "لا يستدعي generate() أو يأخذ عينات من نص حر". هذا ليس تفصيلًا تنفيذيًا، بل هو التصميم بأكمله، وهو ما يميز هذا عن استدعاء Qwen3.8-Max بمخطط JSON والأمل في أن يُغلق القوس.

إليك الآلية كما تصفها البطاقة. تُسلِّم النموذج حالة مشتركة، ومخططًا لأسئلة مُسمّاة، واختياريًا ما يصل إلى ثماني صور. كل سؤال يكون واحدًا من ثلاثة أنواع: choice (اختر واحدًا من مجموعة مرتّبة من الخيارات)، score (قيّم على مقياس ترتيبي، ويُعاد كقيمة متوقعة مرجّحة بالاحتمال)، أو noul (ثنائي لا/نعم). يُصاغ موجّه النظام والحالة والمخطط وهيكل JSON مساعد كامل باستخدام عنصر نائب واحد لكل حقل. ثم — وهذه هي الحيلة — يشغّل النموذج تمريرة أمامية سببية واحدة، وتُقرأ اللوجيتات عند الموضع الذي يسبق كل عنصر نائب مباشرةً. يُؤخذ softmax فقط على رموز المرشّحين المسموح بها لذلك الحقل، ويُطبّق معايرة نقطة التفتيش، وتُربط الرموز عائدةً إلى قيم الخيارات الأصلية لديك.

النتائج ملموسة. لأن مساحة إجابات كل حقل تُجمَّع عند كل طلب بدلًا من أن تكون مضمَّنة في رأس مفردات، فإن مخططًا تبتكره هذا المساء لا يحتاج إلى إعادة تدريب — أضف سؤالًا، فتصبح الخيارات رموزًا مرشحة لذلك الحقل. ولأنه لا توجد حلقة فك ترميز، فلا يوجد رمز إخراج، ولا قوس يمكن نسيانه، ولا منطق إعادة محاولة حول JSON مشوّه. ولأن جميع الأسئلة تُقيَّم انطلاقًا من القراءة نفسها للحالة، فإن ستة عشر سؤالًا تكلّف تمريرة أمامية واحدة، لا ست عشرة.

الحدود ملموسة بالقدر نفسه، والبطاقة تنص عليها دون مواربة. من سؤال واحد إلى ستة عشر سؤالاً، وبما يصل إلى 62 خياراً لكل سؤال، وبما يصل إلى ثماني صور. حد أقصى افتراضي قدره 8,192 رمزاً — والمُدخلات التي تتجاوزه تُرفض دون اقتطاع. هذه الجملة الأخيرة قرار تصميمي يستحق التوقف عنده: الاقتطاع الصامت هو الطريقة التي يبدأ بها المصنّف بهدوء في الإجابة عن سؤال مختلف عن الذي طرحته، وقد اختارت InternLM الفشل بصوت مرتفع بدلاً من ذلك. إنه القرار الصحيح، وهو أيضاً فخ تشغيلي، لأن سلسلة تذاكر طويلة زائد مخطط زائد صور سوف تتجاوز 8,192 أسرع مما تتوقع، ولا يوجد مسار سلس — بل تحصل على خطأ.

حيث يفوز Intern-Decision-4B، وليس الأمر متقاربًا

محوران، وكلاهما بنيوي وليس تدريجيًا.

• زمن الاستجابة لكل قرار — 44.16 ms متوسطًا، و44.03 ms وسيطًا، و44.60 ms عند p95، مقيسة على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي. في مقابل Qwen3.8-Max، التي تُظهر نافذتها الحية لمدة سبعة أيام على منصتنا التجريبية الخاصة p50 قدره 2,474 ms وp95 قدره 9,789 ms عند 55.4 توكن مخرج في الثانية. أي ما يقارب 56× عند الوسيط، والمقارنة ليست غير عادلة بقدر ما هي بين عمليتين مختلفتين: أحد النموذجين يصنّف، والآخر يستنتج ثم يكتب. الفجوة حقيقية وكذلك السبب وراءها.

• التكلفة لكل قرار — وهذه مسألة حسابية، لا رأي. خذ استدعاءً واقعيًا لفرز الدعم: 800 رمز إدخال من الحالة والمخطط، و150 رمز إخراج من JSON منظم. على Qwen3.8-Max، هذا يعني 800 × $2.00/M زائد 150 × $6.00/M، أو نحو $0.0025 لكل قرار، قبل أي رمز استدلال واحد — وQwen3.8-Max نموذج استدلال، لذا فإن جانب الإخراج صغير على نحو متفائل. مليون قرار تكلف نحو $2,500. والمليون قرار نفسها على Intern-Decision-4B تكلف صفرًا من الرموز ونحو 12.3 ساعة من زمن RTX 4090. ليس لدى Intern-Decision-4B سعر إخراج لأنه لا يملك أي إخراج.

المقايضة صادقة وواضحة: نموذج 4B يحتاج إلى وحدة معالجة رسومية (GPU) تملكها أو تستأجرها، ويشغل تلك الوحدة، ولا يمكنه أبدًا أن يفعل سوى شيء واحد. لكن إذا كان الشيء الواحد هو ما يفعله منتجك ملايين المرات يوميًا، فإن الحساب أعلاه هو الجدوى التجارية بأكملها، ولا تغيّرها أي قدرة من قدرات النماذج الرائدة.

الرقم الذي لا ينشره Qwen 3.8: المعايرة

هذا هو العامل المميّز الهادئ، وهو الذي ستفوته معظم المقارنات لأنه لا يبدو كمعيار قياس.

يُرجع Intern-Decision-4B توزيعًا على قيم خياراتك، لا مجرد تصنيف — بالإضافة إلى ثقة، ولأسئلة noul، الاحتمال المعاير لـ«نعم». يُبلغ InternLM عن درجة Brier مقدارها 0.347 وخطأ معايرة متوقع مقداره 0.065 عبر مجموعته الخاصة، ويُضمّن درجة الحرارة المُلاءَمَة في نقطة التفتيش: 1.99241824، وتمت ملاءمتها بشكل منفصل لهذا الحجم عبر تصغير سالب اللوغاريتم الإمكاني على 1,728 حالة معايرة مخصصة مع 1,693 حالة تحقق محجوزة. لم تُستخدم تسميات مجموعة الاختبار لاختيارها. هناك تشخيص ثانٍ مستقل من 96 حالة في البطاقة يستخدم توزيعات مرجعية دقيقة بدلاً من تسميات مُعيّنة بالعيّنة، ويُظهر أن Brier/ECE الإجمالي ينتقل من 0.628 / 0.213 قبل المعايرة إلى 0.550 / 0.089 بعدها — حيث تقلّص خطوة المعايرة الخطأ المتوقع بما يزيد كثيرًا على النصف.

الآن ابحث عن الرقم نفسه في جانب Qwen 3.8. إنه غير موجود. تنشر Alibaba درجات Artificial Analysis Index، وGPQA Diamond، وterminal-bench، وSciCode، وtau-banking، وlong-context recall — وكلها مقاييس قدرات. وهي لا تنشر أي مقياس معايرة لأي عضو من عائلة Qwen 3.8، لأن ثقة النموذج التوليدي ليست كمية يقدّمها المورّد. إذا كان نظامك يحتاج إلى احتمال يمكنه وضع عتبة عليه أو التوجيه بناءً عليه بدلًا من إجابة يلزم أن يثق بها، فإن هذا الاختلاف ليس مسألة درجة. أحد النموذجين يعطيك رقمًا بمعدل خطأ موثّق؛ والآخر يعطيك نصًا، فتبني تقديرك الخاص للثقة حوله.

حيث يفوز Qwen 3.8، وليس بفارق ضئيل أيضًا

ضع الاثنين جنبًا إلى جنب فيما يتعلق بما يمكن أن يُطلَب منهما فعله، وعندها تتوقف الحدود عن كونها خفية.

• السياق — يحمل Qwen3.8-Max نافذة سعة 1,000,000 توكن. يرفض Intern-Decision-4B أي شيء يتجاوز 8,192. هذا عامل قدره 122، ولا يوجد حل بديل، لأن سقف الإدخال يُفرض ولا يُقتطع.

• نمط الإدخال — يقبل Qwen3.8-Max النص والصورة والفيديو. ويقبل Intern-Decision-4B النص والصور، حتى ثماني صور، وتُحسب رموز الصور ضمن الميزانية نفسها البالغة 8,192.

• الاستدلال والأدوات — يضم Qwen3.8-Max استخدام الأدوات ووضع JSON والاستدلال ضمن قدراته المعلنة، ويسجّل مؤشر الذكاء الصادر عن Artificial Analysis بقيمة 45.4، في المرتبة الخامسة عشرة من بين 145 نموذجًا مُفهرسًا، مع درجة AA Coding البالغة 76.2 في المرتبة التاسعة من 138. تلك أرقام مستقلة نشرتها Artificial Analysis، وليست ادعاءات من المورّد. لا يملك Intern-Decision-4B أي سجل في Artificial Analysis، ولا أي درجة مستقلة من أي نوع، ولا أي قدرة على الاستدلال أو التخطيط أو استدعاء أي شيء.

• مخرجات مفتوحة — يكتب Qwen3.8-Max. لا يستطيع Intern-Decision-4B إنتاج فقرة، أو تبرير، أو خطة. يمكنه فقط تقييم الخيارات التي فكرت مسبقًا في إدراجها.

من الجدير بالملاحظة أيضًا على صعيد الأوزان المفتوحة: إذا أردت نواة Qwen 3.8 نفسها وليس المسار المستضاف، فإن Qwen3.8-27B هو الشقيق الكثيف — 27.8 مليار معلمة، وApache 2.0، وسياق من 262,144 رمزًا، ونحو 0.33 دولار / 2.40 دولار لكل مليون رمز حيث يُقدَّم. ويسجل 33.7 على AA Intelligence Index. لا يزال أكبر بمرتبة مقدار من Intern-Decision-4B، ولا يزال توليديًا، ولا يزال الأداة غير المناسبة لاتخاذ قرار ضمن مجموعة مغلقة على نطاق واسع — لكنه الخيار الأوسط الصادق، والوحيد من بين الثلاثة الذي يكون رخيصًا حقًا وقادرًا حقًا في الوقت نفسه.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

قراءة جدول المعايير الخاص بـ InternLM بصدق

تحتوي بطاقة Intern-Decision-4B على جدول مقارنة، وما هو غائب عنه أكثر إفادة مما فيه. الصفوف هي Jev، Laya، SemIf، Kev، JevK5، و0.8B و2B الخاصة بـ InternLM. كل واحد من هؤلاء هو إدخال آخر من System One أو نموذج قرار — Jev من TypeSafe AI، وLaya من Convai Innovations، وثلاثة آخرين. كل رقم تم الإبلاغ عنه من قبل البائع على أدوات InternLM الخاصة. لا يوجد أي نموذج رائد في الجدول على الإطلاق.

هذا ليس سهوًا. إنه النطاق الصادق للادعاء. متوسط Intern-Decision-4B الرئيسي البالغ 90.02 عبر سبع مجموعات — Jevbench-Easy 100.00، Jevbench-Original 98.61، Jevbench-Hard 73.87، Typed Decision 80.55، ToolACE 96.45، AG News 90.82، WildJailBreak 89.86 — هو ادعاء بقيادة فئة نماذج القرار، وهو ما يفعله في هذا الجدول، متجاوزًا 88.74 لـ Jev و57.77 لـ Laya. إنه ليس ادعاءً بالتنافس مع Qwen 3.8، ولا تزعم InternLM ذلك في أي مكان. بطاقة النموذج محدودة النطاق بفئتها الخاصة، وقراءة فوز في فئة على أنه فوز في القدرات هو الخطأ الذي وُجد هذا القسم لمنعه.

تحذيران إضافيان. أرقام زمن الاستجابة — بمتوسط 44 مللي ثانية على 4090 — مقيسة من قبل المورّد، وتعتمد على عبء العمل والعتاد، كما أن تنفيذ تمريرة أمامية على وحدة معالجة رسومات واحدة ليس القياس نفسه الذي يمثله نداء واجهة برمجة تطبيقات مستضافة يشمل زمن الذهاب والإياب عبر الشبكة والانتظار في الطوابير. والبرنامج التجريبي للمعايرة يضم 96 حالة: إنه أداة تشخيصية لا معيار قياس، وهذا ما تنص عليه البطاقة.

مسألة النشر، وهي نقطة التفرّع الحقيقية

تجاهل المقاييس المرجعية للحظة، واسأل عمّا يتطلّبه كل واحد منها منك تشغيليًا.

Intern-Decision-4B يبلغ حجمه على القرص حوالي 9.1 جيجابايت بصيغة bf16 — قطعتان لغويتان بحجم 4.26 جيجابايت و4.15 جيجابايت، وبرج رؤية بحجم 612 ميجابايت، وجهاز عرض بحجم 54 ميجابايت. يتم تحميله عبر ملف بحجم 16 كيلوبايت inference.py المُشحون في المستودع نفسه، مع DecisionEngine فئة تقوم بإنشائها مرة واحدة وتعيد استخدامها. إدخال قاموس Python واحد، وإخراج قاموس استجابة واحد، مع متطلبات Python 3.12+. يعمل عند 44 مللي ثانية على 4090، والشقيق 0.8B صغير بما يكفي للتفكير فيه بأقل بكثير. لكن الوحدة هي الواجهة — لا يوجد خادم، ولا نقطة نهاية متوافقة مع OpenAI، ولا واجهة برمجة تطبيقات مستضافة. أنت تبني الخدمة حولها، وإذا كنت بحاجة إلى اثنين منها للتبديل عند الفشل فأنت تبني ذلك أيضًا.

الجانب التوليدي من المسار نفسه قرار مختلف تمامًا، وهو القرار الذي وُجد الموجّه من أجله فعلًا. يمكن استدعاء Qwen3.8-Max وQwen3.8-27B كلاهما على OrcaRouter خلف المفتاح نفسه المتوافق مع OpenAI، بسعر قائمة المزوّد مع تمرير هامش ربح 0% — لذا عندما تغيّر Alibaba سعر Qwen، يصبح ساريًا على جانبنا في اليوم نفسه بدلًا من دورة الفوترة التالية. Intern-Decision-4B ليس أحد مساراتنا ولن يكون حتى تستضيفه InternLM في مكان ما؛ ولن نتظاهر بغير ذلك. ما نغطيه هو النصف من هذا المسار الذي يمثل استدعاءً شبكيًا: مفتاح واحد لأكثر من 200 نموذج، وتحويل تلقائي عند الفشل إذا تدهور Qwen3.8-Max — ومعدل الخطأ المباشر لديه خلال سبعة أيام هو 1.78% — والقدرة على إجراء اختبار A/B بين طبقتي Qwen 3.8 إحداهما مقابل الأخرى في مسار الطلب نفسه قبل أن تلتزم بأي منهما.

وهذا هو النمط الجدير بالاستخلاص. شغّل المُقيّم محليًا لأنه رخيص وسريع ويؤدي مهمة واحدة ضيقة على نحو جيد. وجّه خطوة الاستدلال، لأن هناك حيث تحدث فعليًا تقلبات الموردين وتخفيضات الأسعار والانقطاعات.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

أيّ واحد يجب أن تختاره فعلاً؟

اختر Intern-Decision-4B إذا كان قرارك مغلق المجموعة، وإجاباتك قابلة للتعداد في موجّه، وتشغّل القرار نفسه على نطاق واسع، وتهتم بالاحتمال بقدر اهتمامك بالتصنيف. توجيه التذاكر، والإشراف على المحتوى مقابل تصنيف ثابت، والاستخراج المنظم إلى مخطط تتحكم به، ومعايير التقييم، والبوابات الثنائية — أي شيء كان بإمكان إنسان أن يكتب قائمة خياراته مسبقًا. المعلمات البالغ عددها 4.54 مليار صريحة بشأن السقف: تُظهر البطاقة نفسها أن 4B عند 73.87 على Jevbench-Hard مقابل 100.00 على Easy، لذا كلما كان شكل القرار أصعب، تنازل النموذج الصغير أكثر.

اختر Qwen 3.8 — أي Qwen3.8-Max إذا كنت تريد النواة المستضافة، وQwen3.8-27B إذا كنت تريد أوزانًا يمكنك الاحتفاظ بها — إذا لم تكن الإجابة قابلة للتعداد مسبقًا، أو إذا كانت الإجابة أطول من 8,192 رمزًا، أو إذا كنت بحاجة إلى مبرر يمكنك إظهاره لإنسان، أو إذا كنت بحاجة إلى استدعاءات أدوات، أو إذا كنت بحاجة إلى فيديو. اختره أيضًا إذا كنت ببساطة لا تريد تشغيل GPU: 12.3 ساعة من زمن 4090 لكل مليون قرار رخيصة فقط إذا كان لديك بالفعل 4090 ولديك شيء آخر تفعله به في الأيام الـ363 الأخرى.

اختر كليهما إذا كان خط المعالجة لديك على الشكل الذي تكون عليه معظم خطوط المعالجة فعليًا — مصنّف رخيص لمجموعة مغلقة في المقدمة، ونموذج رائد خلفه للحالات التي لا يكون المصنّف واثقًا بشأنها. تلك هي التهيئة التي بُنيت من أجلها الثقة المعايرة في Intern-Decision-4B، وهي السبب في أن رقم ECE أعلاه يهم أكثر من المتوسط الرئيسي.

ماذا تشاهد

ثلاثة أسئلة مفتوحة، يمكن الإجابة عنها جميعًا في غضون أيام. هل ينشر InternLM مستودع GitHub الذي تشير إليه بطاقته الخاصة — وهو حاليًا 404 — ومعه وصف للتدريب؟ وهل يتبع الإعلان الأوزان، محوّلًا دفعة هادئة إلى إصدار موثّق؟ وهل يعيد أي شيء مستقل إنتاج المتوسط 90.02، أو قيمة Brier البالغة 0.347، على عتاد ليس تابعًا لـ InternLM؟

هناك تناقض صغير واحد يجب ملاحظته أثناء الانتظار، لأنه من النوع الذي يهم عند تحديد حجم النشر. النموذج يُسمى 4B. عدد المعاملات هو 4,539,265,536 — 4.54 مليار. النموذج الشقيق 0.8B يبلغ 853 مليونًا والنموذج الشقيق 2B يبلغ 2.21 مليار، وكلاهما يُقرَّب صعودًا أو هبوطًا بفارق ضئيل. فقط 4B يُقرَّب لأسفل بأكثر من نصف مليار. إنها ليست مشكلة. إنها تذكير بأنه في إصدار غير معلن، تكون الوثيقة هي المواصفة الوحيدة المتاحة لك، وحتى الوثيقة لا تزال قيد التحرير.