بطاقة عنوان مُولّدة لـ Intern-Decision-4B، بعنوان فرعي «نموذج قرار مُهيكل يجيب دون كتابة أي token»، وتحمل ثلاث شارات نصها «لا إعلان»، و«ثلاث نقاط تحقق خلال 40 ثانية»، و«لا تقييمات مستقلة»، مع تذييل نصه «الأرقام وفقًا لبطاقة نموذج InternLM؛ لا شيء هنا مُعاد إنتاجه بشكل مستقل.» شعار OrcaRouter مُركَّب في الزاوية اليمنى السفلى.
Guides & Insights

Intern-Decision-4B: أطلقت InternLM نموذج قرار يجيب دون كتابة رمز واحد

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ظهرت ثلاثة مستودعات نماذج على صفحة InternLM على Hugging Face خلال أربعين ثانية في 26 سبتمبر 2026: Intern-Decision-0.8B عند 05:35:57 UTC، Intern-Decision-2B عند 05:36:19، وinternlm/Intern-Decision-4B عند 05:36:37. النموذج 4B هو المثير للاهتمام. إنه ضبط دقيق لـ Qwen3.5-4B يقبل حالة مشتركة، ومخططًا لأسئلة مسمّاة، وصورًا اختيارية، ويعيد توزيع إجابات معايرًا لكل سؤال في تمريرة أمامية واحدة. لا يولّد نصًا أبدًا. تقول ملاحظات إصداره الخاصة ذلك صراحةً: "تؤدي واجهة API هذه تقييمًا منظمًا للمرشحين. وهي لا تستدعي generate() أو تأخذ عينات من نص حر." أربعون ثانية من عمليات الرفع ولا سطر واحد من الإعلان في أي مكان — لا منشور مدونة، ولا تغريدة، ولا سجل تغييرات، ولا صفحة إطلاق. ما الموجود سوى بطاقة نموذج، وملف inference.py، وأربع شرائح safetensors.

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

ما الذي تم إطلاقه، وما الذي لم يتم إطلاقه

العائلة هي أول ما يجب إتقانه، لأن بطاقة 4B تحملها بهدوء. يعرض جدول القياس المرجعي الخاص بها صفوفًا لـ Intern-Decision-0.8B و Intern-Decision-2B إلى جانب صفوفه الخاصة، وقد وصلت نقاط التحقق الثلاث كلها إلى الـ hub خلال الدقيقة نفسها. لا يوجد رابط أبدًا إلى مستودع 2B من بطاقة 4B — عليك العثور عليه عبر موجز الرفع الخاص بالمؤسسة.

ما لم يُشحَن هو تقريبًا كل ما يجلبه الإصدار عادةً:

• لا إعلان — لا تغطية على الويب على الإطلاق، ولا بيان من المورّد بأي لغة تمكّنا من العثور عليها.

• لا يوجد عرض توضيحي — تشير البطاقة إلى Space على huggingface.co/spaces/internlm/intern-decision؛ تستجيب نقطة النهاية هذه بـ HTTP 401، أي أنها ليست عامة، وليس أنها معطلة.

• لا توجد مجموعة — مجموعة النماذج المُعلَن عنها على huggingface.co/collections/internlm/intern-decision تُرجع أيضًا 401.

• لا يوجد مستودع برمجي — رابط GitHub الخاص بالبطاقة، github.com/internlm/Intern-Decision، يعطي خطأ 404، ولا تتضمن قائمة مستودعات مؤسسة InternLM أي مشروع كهذا.

• لا تبنٍّ — حتى كتابة هذه السطور، لا يُظهر الـ4B سوى إعجاب واحد وصفر عمليات تنزيل.

هذا هو كامل السطح القابل للمعرفة. تعامل مع كل رقم أدناه على أنه رقم المورّد نفسه، لأن لا أحد آخر قد شغّل هذا الشيء بعد.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

عقد الاستدلال هو المنتج

يُخصَّص معظم البطاقة لإجراء من خمس خطوات، وهو يخبرك أين ذهب الجهد الهندسي. تحتفظ الأسئلة والخيارات بترتيبها. تُربَط خيارات كل سؤال برموز من رمز واحد — A إلى Z، ثم a إلى z، ثم 0 إلى 9. أي 62 رمزًا، وهذا بالضبط سبب تحديد البطاقة لسقف السؤال عند 62 خيارًا. يُصاغ الطلب من موجه النظام الأصلي، والحالة، ومخطط القرار، وهيكل JSON مساعد كامل مع عنصر نائب واحد <decision> لكل حقل، مع الحفاظ على قالب الدردشة الخاص بنقطة التحقق وكتلة تفكير فارغة. ثم تمريرة أمامية سببية واحدة. تُقرأ اللوجيتات عند الموضع الذي يسبق كل عنصر نائب مباشرةً، ويُشغَّل softmax على لوجيتات رموز المرشحين المسموح بها لذلك الحقل فقط، وتُطبَّق المعايرة، ثم تُعاد الرموز إلى قيم خياراتك.

النتيجة هي شكل ثابت: لا حلقة فك ترميز، ولا أخذ عينات، ولا محلل، ولا سطح هلوسة، وسقف صارم قدره قرار واحد لكل سؤال في كل تمريرة. تُدعم ثلاثة أنواع من الأسئلة — اختيار مع خريطة معايير مرتبة، درجة مع قائمة أو خريطة بمفاتيح رقمية، و noul، ثنائي لا/نعم.

التفصيل الأهم في ورقة المواصفات

توضح البطاقة صراحةً أن المدخلات "تُرفض دون اقتطاع" إذا تجاوزت DecisionEngine(max_length=8192). اقرأ ذلك إلى جانب الإعدادات فيبرز شيء غريب: برج النصوص الأساسي يعلن max_position_embeddings بقيمة 262,144. يمكن للعمود الفقري معالجة ربع مليون رمز؛ بينما يرفض الغلاف الصادر أي شيء يتجاوز 8,192. هذا ليس نموذجاً ذا سياق طويل بإعداد افتراضي متحفظ — بل هو نموذج لتقييم القرارات يحدّ إطاره الخاص من الأدلة التي يمكنك تمريرها إليه. إذا كان سؤال التوجيه لديك يعتمد على أكثر من نحو ثمانية آلاف رمز من الحالة، فإن نقطة التحقق هذه كما شُحنت لن تجيب عليه، وسترفض بدلاً من أن تقتطع مدخلاتك.

يُسمح بما يصل إلى ثماني صور، وتُشير البطاقة إلى أن رموز الصور تُحتسب ضمن الحدّ نفسه البالغ 8,192.

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

داخل الأوزان

أربع شظايا، و4.54 مليار معامل BF16، وتهيئة تشرح اسم الحجم: يوجد برج نصي، وبرج رؤية من نحو أربع وعشرين طبقة بحجم رقعة 16 بكسل، ومُسقِط بينهما. الجانب النصي 32 طبقة بحجم مخفي 2,560، مع 16 رأس انتباه مقابل 4 رؤوس مفتاح/قيمة، ومفردات من 248,320 رمزًا وتضمينات مرتبطة. تتناوب أنواع الطبقات على فاصل ثابت — ثلاث طبقات انتباه خطي، ثم طبقة انتباه كامل، وتتكرر. فقط طبقات الانتباه الكامل تحمل انتباهًا عالميًا، والتضمين الدوراني جزئي بمعامل 0.25. يتطلب تحميله Python 3.12 أو أحدث، وPyTorch 2.9.1 وTransformers 5.14.1، ولا تزال قائمة الملفات تتضمن ملفات المُرمِّز وmerges والمفردات بدلًا من الاعتماد على مُرمِّز من جانب الـ hub.

الأرقام، ومن أنتجها

كل ما ورد في هذا القسم قاسه InternLM ونُشر على بطاقة النموذج. لم يُعِد أي طرف ثالث إنتاج أي منه، ولا يوجد مُدخل لـ Artificial Analysis ولا تقييم arena ولا صف في لوحة الصدارة لهذا النموذج في أي مكان.

عبر سبع مجموعات تقييم، يحقق 4B متوسطًا قدره 90.02، بدرجة Brier مقدارها 0.347 وخطأ معايرة متوقع قدره 0.065. ويسرد الجدول نفسه Intern-Decision-0.8B عند 79.38 وIntern-Decision-2B عند 84.68، لذا تتجه العائلة صعودًا مع زيادة الحجم — 4.7 نقاط من 0.8B إلى 2B، ثم 5.3 نقاط إضافية إلى 4B. ويحمل الجدول أيضًا خمسة صفوف لم يدرّبها المورّد: Jev عند 88.74، وJevK5 عند 85.16، وSemIf عند 84.23، وKev عند 79.56، وLaya عند 57.77. وقد شُغّلت تلك الصفوف بواسطة InternLM على أداة التقييم الخاصة بـ InternLM مقابل نقطة تفتيش InternLM. وهي ليست أرقام تلك المشاريع نفسها، وقراءتها على هذا النحو هي أسهل خطأ متاح هنا.

يُقاس زمن الاستجابة على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، وتشير البطاقة إلى أن القيم تعتمد على عبء العمل والعتاد. يسجل 4B متوسطًا قدره 44.16 مللي ثانية، ووسيطًا قدره 44.03 مللي ثانية، و44.60 مللي ثانية عند P95 — وهو انتشار أقل بكثير من مللي ثانية واحدة بين الوسيط والذيل، وهذا ما يبدو عليه التمرير الأمامي ثابت الشكل. تقع كلتا نقطتي التحقق الأصغر حجماً عند حوالي 33 مللي ثانية، مع تقدم 2B بشكل طفيف على 0.8B في المتوسط والوسيط، وهو أمر يستحق الملاحظة بدلاً من التغاضي عنه: فهذان قريبان بما يكفي ليكون كل منهما ضمن ضوضاء قياس الآخر.

المعايرة، والتحفظات الصادقة بشأنها

تأتي نقطة التحقق بدرجة حرارة افتراضية مقدارها 1.99241824، مُلاءَمَة بشكل منفصل لهذا النموذج عبر تصغير سالب الإمكان اللوغاريتمي على 1,728 حالة معايرة مُعيَّنة، مع استبعاد 1,693 حالة منها للتحقق. تنص البطاقة على أن تسميات مجموعة الاختبار لم تُستخدم لاختيارها. التنفيذ هو معايرة احتمال المرشح، وليس درجة حرارة لأخذ العينات: فهو يحرّك الثقة، والاحتمال الثنائي، والدرجة المتوقعة، مع إبقاء قرار argmax دون مساس.

ثم يقدّم تشخيص منفصل من 96 حالة تقريرًا عن الأثر. في أعمدة «قبل» و«بعد» الخاصة بـ InternLM، ينتقل مؤشرا Brier وECE الإجماليان لدى 4B من 0.628 / 0.213 إلى 0.550 / 0.089، مقابل 0.595 / 0.130 لدى Jev. وثمة قراءتان أمينتان لهذا الجدول: فالمعايرة تعمل بوضوح، وعمود «قبل» ليس ما قد يراه أي مستخدم على الإطلاق، لأن الإعداد الافتراضي المضمّن هو درجة الحرارة الناتجة عن الملاءمة. ومن الجدير بالتنبيه أيضًا أن فئتين من فئات التشخيص الست أسوأ لدى 4B منها لدى Jev، وأن أسوأ تلك الفئات، الأدلة اليومية وتحيز الملاحظة، يتحسن إلى 0.575 / 0.210 بينما لا يزال متخلفًا عن 0.603 / 0.114 لدى Jev. وفي هذه الشريحة، تضيّق المعايرة الفجوة دون أن تغلقها.

أين يتلاءم الموجّه، وأين لا يتلاءم بعد

العقبة العملية أمام استخدام هذا النموذج ليست الدقة، بل التغليف. فالإصدار يأتي على شكل صنف Python تستورده بعد تنزيل أربع شرائح، وليس نقطة نهاية HTTP يمكنك استدعاؤها. وهذه بالتحديد هي الفجوة التي وُجدت طبقة توجيه لسدّها — مفتاح واحد عبر أكثر من 200 نموذج، ويُمرَّر سعر قائمة المزوّد بهامش ربح 0%، وتحويل تلقائي عند تعثّر مزوّد — لكن يجب أن نكون صريحين: إن OrcaRouter لا يحمل حالياً Intern-Decision-4B أو أي نموذج من نوعه. كتالوجنا لا يدرجه، ولا ينبغي أن يُقرأ أي شيء هنا على أنه ادعاء توفر. ما يمكننا تقديمه هو القرار الأقل تكلفة: إذا أردت تجربة مُقيِّم قرارات بـ 4.5 مليار معامل أمام مسار إنتاجي، يمكنك دمجه في موجّه مع تراجع إلى نموذج عام بحيث يكلفك يوم معايرة سيئ إعادة محاولة بدلاً من انقطاع.

ما الذي قد يغيّر الصورة؟

ثلاثة أشياء، مرتبة حسب الأهمية. يحتاج شخص من خارج InternLM إلى إعادة إنتاج متوسط 90.02 وخطأ المعايرة المتوقع 0.065 — فادعاءات المعايرة التي لم تصادف قط مجموعة اختبار خارجية هي أقل الأرقام قابلية للنقل في تعلّم الآلة. ويجب أن تظهر بصمة البطاقة نفسها: الـ Space، والمجموعة، ومستودع GitHub. وعلى المورّد أن يوضّح ما إذا كان هذا منتجًا أم ناتجًا ورقيًا، لأن ترخيصًا للبحث فقط وترخيص Apache-2.0 ليسا الالتزام نفسه، وقد اختار نموذج 4B ترخيص Apache-2.0 مع الحفاظ على ترخيص Qwen إلى جانبه. وحتى ذلك الحين، فالتأطير الصحيح هو ما يوحي به الرفع نفسه: هذه نقطة تفتيش حقيقية بعقد استدلال حقيقي وبطاقة أداء غير موثّقة بالكامل، نُشرت دون إخبار أي أحد.

في الوقت الحالي، الخلاصة الصادقة ضيقة ومفيدة. إذا كانت مشكلتك هي «اختر واحدًا من خمسة تصنيفات توجيه وأخبرني بمدى يقينك»، فإن نموذجًا بحجم 4.5 مليار يُصدر 62 من اللوغيتات ولا يُصدر نثرًا هو شكل يمكن الدفاع عنه للتقييم. وإذا كانت مشكلتك تتضمن مستندًا طويلًا، أو أكثر من ثماني صور، أو أي حاجة إلى شرح الإجابة بالكلمات، فإن نقطة التحقق هذه كما تم شحنها هي الأداة الخاطئة، ولا يغيّر ذلك أيُّ قدرٍ من تلميع المورّد لمقاييسه المرجعية.