بطاقة عنوان مُولّدة لـ Intern-Decision-2B تحمل النص 'شُحن بهدوء، دون إعلان' مع الشارتين 'أصبح رابط GitHub متاحًا اليوم' و'2,213,241,664 معامل'، مع شعار OrcaRouter مُركّبًا في الزاوية.
Engineering & Research

أُطلق Intern-Decision-2B بهدوء على Hugging Face. توقف رابط GitHub على بطاقته للتو عن إرجاع خطأ 404

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في وقت سابق من اليوم، بطاقة نموذج internlm/Intern-Decision-2B أشارت إلى ثلاثة أماكن للحصول على مزيد من المعلومات، وكان اثنان منها معطلين: مساحة العرض أجابت بـ HTTP 401، و github.com/internlm/Intern-Decision أعاد 404 لأي شخص نقر عليه. اعتبارًا من الساعة 08:58 بالتوقيت العالمي المنسق، المستودع الكائن خلف ذلك الرابط الثاني موجود — عام، بعمق ثلاث التزامات، يحمل كود التدريب، وواجهتي استدلال خلفيتين، وحزمة تقييم تحتوي على 10,751 صف اختبار، ومعيار معايرة من 96 حالة، ودليل إعادة الإنتاج. هذا هو الشيء الوحيد الذي تغير في هذا النموذج منذ ظهوره على Hugging Face في الساعة 05:36 بالتوقيت العالمي المنسق يوم 26 سبتمبر 2026، وهو كافٍ لنقل Intern-Decision-2B من "نقطة تفتيش ذات README غير قابل للوصول" إلى "نقطة تفتيش يمكنك فعلاً فحصها، وإعادة الإنتاج عليها، والجدال معها."

الأوزان نفسها لم تتغير ولا لبس فيها. إن Intern-Decision-2B هو نموذج قرار مُهيكل متعدد الوسائط بـ 2,213,241,664 معامل، تم ضبطه بدقة من Qwen/Qwen3.5-2B — قاعدة Alibaba من 28 فبراير 2026 — صدر بموجب Apache-2.0 مع الحفاظ على ترخيص Qwen الأصلي بجانبه باسم LICENSE-QWEN. إنه الحجم الأوسط من ثلاثة أحجام أطلقتها InternLM في أربعين ثانية: Intern-Decision-0.8B عند 05:35:57، وهذا عند 05:36:19، وIntern-Decision-4B عند 05:36:37. لا يزال لا يوجد أي إعلان من أي نوع وراء أي منها.

ما يجعل الحجم الأوسط يستحق مقالًا خاصًا به هو أنه الموضع الذي تكفّ فيه العائلة عن التصرف بطريقة يمكن توقعها. وفقًا لأرقام InternLM الخاصة، فهو الأسرع بين الثلاثة والأسوأ من حيث المعايرة بين الثلاثة، وكلا الحقيقتين تستحقان الفهم قبل أن تنزّل أربعة غيغابايت ونصف من أي شيء.

ما هو المؤكَّد، وما هو مجرد كلام المورّد؟

فئتان، ويجب إبقاؤهما منفصلتين.

مؤكد، لأنه قائمة ملفات أو استجابة HTTP: عدد المعاملات (2,592 F32 بالإضافة إلى 2,213,239,072 من أوزان BF16)؛ خريطة الشظايا (شظية لغة بحجم 3.76 GB، برج رؤية بحجم 612.5 MB، جهاز عرض بحجم 50.3 MB، حوالي 4.43 GB من الموترات ونحو 4.46 GB من المستودع)؛ زوج الترخيص؛ النموذج الأساسي؛ البنية التحتية (نموذج Qwen3_5ForConditionalGeneration مع 24 طبقة، حجم مخفي 2,048، 8 رؤوس استعلام مقابل رأسان مفتاح-قيمة، بُعد الرأس 256، نمط متكرر من ثلاث طبقات انتباه خطي إلى طبقة انتباه كامل واحدة، طبقة واحدة محتفظ بها للتنبؤ متعدد الرموز، وسقف تضمين بـ 262,144 موضعًا)؛ وجود المستودع؛ وحقيقة أن مجموعة النماذج في huggingface.co/collections/internlm/intern-decision تعمل الآن وتسرد جميع نقاط التفتيش الثلاث.

مُبلَّغ عنه من المورّد وغير مُعاد إنتاجه: كل رقم دقة، وكل رقم زمن وصول، ودرجة حرارة المعايرة. لا توجد ورقة بحثية، ولا مدخل على arXiv، ولا منشور إطلاق، ولا سجل تغييرات، ولا تقييم مستقل — البحث عن السلسلة "Intern-Decision" لا يُرجع أي شيء يخص هذا النموذج. لا يزال Space التجريبي يستجيب بـ 401، ما يعني أنه ليس عامًّا، لا أنه معطوب. نقطة التحقق 2B لديها إعجاب واحد وصفر تنزيلات. لم يقم أحد خارج InternLM بتشغيله.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal, the Demo, Model Weights and GitHub links, and the card text stating the model is 'a multimodal structured decision model fine-tuned from Qwen3.5-2B' that 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by the five-step 'How inference works' list.

عقد الاستدلال، بترتيب حدوثه

الملف الأكثر إفادة في المستودع ليس البطاقة. بل هو src/inference/engine.py والنسخة المرفقة من inference.py على Hub، لأنهما معًا يوثّقان عقدًا وليس موجّهًا.

• أنت تقدّم الحالة — المادة الخاضعة للتقييم — أسئلة مخطط، واختياريًا حتى ثماني صور. من سؤال واحد إلى ستة عشر سؤالًا، بما يصل إلى 62 خيارًا لكل سؤال.

• تُسند خيارات كل سؤال إلى رموز ذات وحدة رمزية واحدة: A–Z، ثم a–z، ثم 0–9. إن سقف الخيارات البالغ 62 ليس تفضيلًا تصميميًا، بل هو بالضبط عدد الرموز ذات الوحدة الرمزية الواحدة التي يمكن للعقد التعامل معها.

• تُعرض موجّه النظام والحالة والمخطط وهيكل JSON كامل للمساعد باستخدام <decision> كعنصر نائب واحد لكل حقل. ويُحافظ على قالب الدردشة الخاص بنقطة التحقق وكتلة التفكير الفارغة كما هي.

• يتم تشغيل تمريرة أمامية سببية واحدة. تُقرأ الـ logits عند الموضع الذي يسبق كل عنصر نائب مباشرةً — وليس بعده، وليس عند رمز مُولَّد.

• يُحسب سوفتماكس على الرموز المرشّحة المسموح بها لذلك الحقل فقط، وتُطبّق معايرة نقطة التحقق، ثم تُعاد الرموز لتُطابق قيم الخيارات الأصلية لديك.

البطاقة صريحة بشأن ما هذا: "هذا الـ API يقوم بتقييم مُهيكل للمرشحين. إنه لا يستدعي generate() أو يأخذ عينات من نص حر الشكل." DecisionEngine(max_length=8192) يرفض المدخلات المفرطة الحجم بدلًا من اقتطاعها، لذا فإن الطلب الذي لا يتناسب معها يفشل بصوت عالٍ بدلًا من أن يفقد فقرته الأخيرة بصمت. قائمة الواجهات الخلفية صادقة أيضًا — backend="hf" هو الافتراضي والوحيد المُنفَّذ في مستودع Hugging Face، وهو أمر يستحق المعرفة لأن إصدار GitHub يتضمن واجهة خلفية XTuner أيضًا، والاثنان ليسا متطابقين عدديًا. يقول دليل التقييم الخاص بـ InternLM ذلك: "يمكن أن تغير اختلافات Kernel و BF16 الاحتمالات وأحيانًا التصنيفات."

الشذوذ في المنتصف

ضع نقاط التحقق الثلاث جنبًا إلى جنب على جدول InternLM الخاص، وسيكون الشكل غريبًا بما يكفي ليكون هو القصة.

• المتوسط عبر سبع مجموعات — Intern-Decision-0.8B ‏79.38، وIntern-Decision-2B ‏84.68، وIntern-Decision-4B ‏90.02. مرتّبة، كما تتوقع من نمو الأوزان.

• الكمون على بطاقة RTX 4090 واحدة — 33.98 ms في المتوسط للنموذج 0.8B، و33.28 ms للنموذج 2B، و44.16 ms للنموذج 4B. الحجم الأوسط هو الأسرع بين الثلاثة، بفارق صغير بما يكفي ليكون مجرد ضجيج على وحدة معالجة رسومات واحدة، لكنه ثابت عبر المتوسط، والوسيط (33.15 ms)، وP95 (33.55 ms).

• درجة براير، الأقل أفضل — 0.530، 0.437، 0.347. رتيبة مع الحجم، كما هو معتاد في قاعدة تسجيل صحيحة.

• خطأ المعايرة المتوقع، الأقل أفضل — 0.066 لـ 0.8B، و0.100 لهذا 2B، و0.065 لـ 4B. الحجم الأوسط هو الأسوأ، وهو أسوأ من النموذج الذي يبلغ نصف حجمه.

ذلك السطر الأخير هو المثير للاهتمام، ودرجات الحرارة المُلاءَمَة تدعمه بدلًا من أن تفسّره. تحمل كل نقطة تفتيش درجة حرارة خاصة بها مُلاءَمَة باستخدام NLL: 2.747760550703 للنموذج 0.8B، و2.100509348278 للنموذج 2B، و1.992418 للنموذج 4B. جرى ملاءمة كل واحدة على 1,728 حالة معايرة مُخصَّصة مع استبعاد 1,693 حالة، عبر تصغير سالب لوغاريتم الإمكان (negative log-likelihood) ضمن بحث في مقلوب درجة الحرارة على المجال [0.01, 100]، مع إبقاء تسميات مجموعة الاختبار خارج الملاءمة عمدًا. تقع درجة حرارة النموذج 2B بين نظيريها، وهو ما قد تتوقعه لو كان الشذوذ أثرًا من آثار الملاءمة. لكنه ليس كذلك: القيمة المُلاءَمَة رتيبة مع الحجم بينما خطأ ما بعد المعايرة ليس رتيبًا. وفق قياس InternLM نفسه، تُعد نقطة التفتيش ذات 2.2 مليار معامل الأقل موثوقية بين الثلاث عندما تخبرك بمدى ثقتها.

هناك تحفّظان قبل أن يصبح ذلك استنتاجًا. إن ECE مع عشر حاويات متساوية العرض وثقة الاحتمال الأقصى إحصاءةٌ مُشوِّشة على المجموعة الصغيرة التي يستخدمها هذا الجدول — Jevbench-Hard، 111 عنصرًا، لذا يرتكز عمود ECE بأكمله على نحو مئة سؤال وعلى اختيار تقسيم الحاويات. وinternlm/Intern-Decision-2B هو البطاقة الوحيدة من الثلاث التي لا تحمل قسم المعايرة الإضافي الذي تحمله بطاقة 4B، لذا التوثيق هنا أقل، لا أكثر. اقرأ قيمة 0.100 كسبب لملاءمة درجة الحرارة الخاصة بك بنفسك، لا كحكم نهائي على الأوزان.

A rendered comparison card titled 'Three checkpoints, forty seconds' listing the Intern-Decision 0.8B, 2B and 4B columns against seven rows: upload timestamps 05:35:57 / 05:36:19 / 05:36:37 UTC; parameters 852,985,920 / 2,213,241,664 / 4,539,265,536; seven-suite average 79.38 / 84.68 / 90.02; Brier 0.530 / 0.437 / 0.347; ECE 0.066 / 0.100 / 0.065; fitted temperature 2.747761 / 2.100509 / 1.992418; and RTX 4090 mean latency 33.98 ms / 33.28 ms / 44.16 ms, with a footer noting every figure is vendor-reported and unreproduced.

ما الذي يضيفه المستودع، وما الذي لا يزال يحجبه

إن إصدار GitHub أكثر اكتمالاً من بطاقة النموذج، التي هي بحد ذاتها غنية بالمعلومات — فالمختبر الذي كان يقصد إنتاج نتاج ورقي لا يُرفِق عادةً مولِّد معايرة حتميًا وحزمة تقييم تتحقق من التجزئة إلى جانب مشغّل التدريب.

ما هو الآن عام: شفرة التدريب وهدف الرمز التالي المقنّع (تظهر رموز الإجابة المرجعية في التسميات فقط، ولا تظهر أبدًا في المدخل؛ ويُتنبأ بإجابة كل حقل بواسطة اللوجيت الذي يسبق علامته مباشرة، وتشترك جميع الحقول في تمريرة أمامية واحدة)؛ وحزم الدقة السبع ذات التجزئات المُتحقق منها بـ SHA-256 وأعداد الصفوف؛ وشفرة التقييم؛ وسكربتات ملاءمة درجة الحرارة وإعادة التشغيل، حيث يُؤكَّد أن إعادة التشغيل تُغيّر صفر قرارات؛ ومعيار معايرة التوزيع المكوَّن من 96 حالة مع مُولِّده ومُقيِّمه دون اتصال؛ وعرض توضيحي في المتصفح يُقدَّم على loopback عبر POST /v1/decisions (المعروف أيضًا باسم /v1/jev).

ما الذي يُستبعد صراحةً، بكلمات المستودع نفسه: "لا تُشمَل بيانات التدريب، وسجلات المعايرة/التحقق الخاصة، والصور، وخطوط أنابيب الإعداد، وأوزان النموذج." لا يحمل المستودع أي ملف ترخيص على الإطلاق، لذا فإن شروط الكود غير مذكورة رغم أن الأوزان بموجب Apache-2.0. وتبقى تركيبة تقسيم المعايرة — أي 1,728 حالة، ومن أين — غير معلنة، وهو الإغفال الوحيد الذي يحدّ من مدى إمكانية التحقق من أرقام ECE.

المقاسات التي نوجّهها فعلاً، والمقاس الذي لا نوجّهه

Intern-Decision-2B ليس على OrcaRouter. صفحة نموذجنا الخاصة به تُرجع 404، ولا توجد أي نقطة نهاية مستضافة له في أي مكان تمكّنا من العثور عليه، ولا ينبغي قراءة أي شيء هنا على أنه ادعاء بالتوافر. السبيل الوحيد لاستدعائه اليوم هو تنزيل نقطة التحقق وتشغيل inference.py بجوار الأوزان.

هذا مهم بالنسبة للقرار الذي تدور حوله هذه المقالة فعلاً، لأن مُقيّمًا لا يخدمه أحد هو مُقيّم يجب عليك تشغيله. إذا كان القرار ذو المجموعة المغلقة الذي تحاول اتخاذه قريبًا في الشكل مما تفعله هذه العائلة — حالة، أسئلة مصنّفة، احتمالات معايرة — فإن المقارنة المستضافة هي Jev 1.13 من TypeSafe، وهو النموذج الذي قارنت InternLM به عن قصد، وهو على OrcaRouter بتكلفة 0.042 دولار لكل مليون رمز إدخال مع سياق 65K وزمن P50 حتى أول رمز يبلغ 178 مللي ثانية.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

تشغيل نقطة تحقّق (checkpoint) بـ2.2 مليار معامل محليًا واستدعاء مصنّف مستضاف ليسا عملية الشراء نفسها، لكنهما المشكلة ذاتها، وإتاحة كليهما على مفتاح واحد مع سعر قائمة المزوّد مُمرَّرًا بهامش ربح 0% هو السبب في إبقاء المقارنة مفتوحة بدلًا من المراهنة بالمعمارية على أحدهما.

ما الذي قد يغيّر هذه الصورة؟

ثلاثة أمور، بالترتيب.

يحتاج شخص من خارج InternLM إلى إعادة إنتاج المتوسط البالغ 84.68 وقيمة ECE البالغة 0.100، وأصبح المستودع الآن هو ما يجعل ذلك ممكنًا — وهذا هو الخبر الفعلي هنا. الاختبار علني ومُتحقَّق منه عبر الهاش؛ لا ينقص سوى ورقة الإجابات، وورقة الإجابات هي نقطة الحفظ التي يمكن لأي شخص تنزيلها الآن.

يحتاج المورّد إلى أن يوضّح الغرض من هذا. إن نموذجًا يضم حزمة تدريب عاملة، وحزمة تقييم منشورة، ودون أي إعلان، ودون ترخيص لكوده، ودون نقطة نهاية مستضافة، يُقرأ على أنه إصدار بحثي لم يُبتّ بعد في تحويله إلى منتج. الأوزان المرخّصة بموجب Apache-2.0 ترجّح ناحية؛ أما غياب ترخيص الكود وSpace الذي يعيد 401 فيرجّحان الناحية الأخرى.

والحجم الأوسط يحتاج إلى سبب للوجود. إذا كانت ميزة سرعة 2B على 0.8B حقيقية لكن هامشية، وكانت معايرته الأضعف بين الثلاثة في كل مقياس نشرته InternLM، فإن التوصية الأمينة لمعظم القراء هي أن يدفعوا 2.6× من مساحة القرص مقابل 4B أو أن يقبلوا بدقة النموذج الأصغر الأضعف. الحجة لصالح 2B هي أنه يصادف كونه الأسرع بين النماذج السريعة — وهذه حجة أضعف مما يوحي به التأطير التسويقي للعائلة.