
أُطلق Intern-Decision-2B بهدوء على Hugging Face. توقف رابط GitHub على بطاقته للتو عن إرجاع خطأ 404
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 584 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 187 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
في وقت سابق من اليوم، بطاقة نموذج internlm/Intern-Decision-2B أشارت إلى ثلاثة أماكن للحصول على مزيد من المعلومات، وكان اثنان منها معطلين: مساحة العرض أجابت بـ HTTP 401، و github.com/internlm/Intern-Decision أعاد 404 لأي شخص نقر عليه. اعتبارًا من الساعة 08:58 بالتوقيت العالمي المنسق، المستودع الكائن خلف ذلك الرابط الثاني موجود — عام، بعمق ثلاث التزامات، يحمل كود التدريب، وواجهتي استدلال خلفيتين، وحزمة تقييم تحتوي على 10,751 صف اختبار، ومعيار معايرة من 96 حالة، ودليل إعادة الإنتاج. هذا هو الشيء الوحيد الذي تغير في هذا النموذج منذ ظهوره على Hugging Face في الساعة 05:36 بالتوقيت العالمي المنسق يوم 26 سبتمبر 2026، وهو كافٍ لنقل Intern-Decision-2B من "نقطة تفتيش ذات README غير قابل للوصول" إلى "نقطة تفتيش يمكنك فعلاً فحصها، وإعادة الإنتاج عليها، والجدال معها."
الأوزان نفسها لم تتغير ولا لبس فيها. إن Intern-Decision-2B هو نموذج قرار مُهيكل متعدد الوسائط بـ 2,213,241,664 معامل، تم ضبطه بدقة من Qwen/Qwen3.5-2B — قاعدة Alibaba من 28 فبراير 2026 — صدر بموجب Apache-2.0 مع الحفاظ على ترخيص Qwen الأصلي بجانبه باسم LICENSE-QWEN. إنه الحجم الأوسط من ثلاثة أحجام أطلقتها InternLM في أربعين ثانية: Intern-Decision-0.8B عند 05:35:57، وهذا عند 05:36:19، وIntern-Decision-4B عند 05:36:37. لا يزال لا يوجد أي إعلان من أي نوع وراء أي منها.
ما يجعل الحجم الأوسط يستحق مقالًا خاصًا به هو أنه الموضع الذي تكفّ فيه العائلة عن التصرف بطريقة يمكن توقعها. وفقًا لأرقام InternLM الخاصة، فهو الأسرع بين الثلاثة والأسوأ من حيث المعايرة بين الثلاثة، وكلا الحقيقتين تستحقان الفهم قبل أن تنزّل أربعة غيغابايت ونصف من أي شيء.
ما هو المؤكَّد، وما هو مجرد كلام المورّد؟
فئتان، ويجب إبقاؤهما منفصلتين.
مؤكد، لأنه قائمة ملفات أو استجابة HTTP: عدد المعاملات (2,592 F32 بالإضافة إلى 2,213,239,072 من أوزان BF16)؛ خريطة الشظايا (شظية لغة بحجم 3.76 GB، برج رؤية بحجم 612.5 MB، جهاز عرض بحجم 50.3 MB، حوالي 4.43 GB من الموترات ونحو 4.46 GB من المستودع)؛ زوج الترخيص؛ النموذج الأساسي؛ البنية التحتية (نموذج Qwen3_5ForConditionalGeneration مع 24 طبقة، حجم مخفي 2,048، 8 رؤوس استعلام مقابل رأسان مفتاح-قيمة، بُعد الرأس 256، نمط متكرر من ثلاث طبقات انتباه خطي إلى طبقة انتباه كامل واحدة، طبقة واحدة محتفظ بها للتنبؤ متعدد الرموز، وسقف تضمين بـ 262,144 موضعًا)؛ وجود المستودع؛ وحقيقة أن مجموعة النماذج في huggingface.co/collections/internlm/intern-decision تعمل الآن وتسرد جميع نقاط التفتيش الثلاث.
مُبلَّغ عنه من المورّد وغير مُعاد إنتاجه: كل رقم دقة، وكل رقم زمن وصول، ودرجة حرارة المعايرة. لا توجد ورقة بحثية، ولا مدخل على arXiv، ولا منشور إطلاق، ولا سجل تغييرات، ولا تقييم مستقل — البحث عن السلسلة "Intern-Decision" لا يُرجع أي شيء يخص هذا النموذج. لا يزال Space التجريبي يستجيب بـ 401، ما يعني أنه ليس عامًّا، لا أنه معطوب. نقطة التحقق 2B لديها إعجاب واحد وصفر تنزيلات. لم يقم أحد خارج InternLM بتشغيله.

عقد الاستدلال، بترتيب حدوثه
الملف الأكثر إفادة في المستودع ليس البطاقة. بل هو src/inference/engine.py والنسخة المرفقة من inference.py على Hub، لأنهما معًا يوثّقان عقدًا وليس موجّهًا.
• أنت تقدّم الحالة — المادة الخاضعة للتقييم — أسئلة مخطط، واختياريًا حتى ثماني صور. من سؤال واحد إلى ستة عشر سؤالًا، بما يصل إلى 62 خيارًا لكل سؤال.
• تُسند خيارات كل سؤال إلى رموز ذات وحدة رمزية واحدة: A–Z، ثم a–z، ثم 0–9. إن سقف الخيارات البالغ 62 ليس تفضيلًا تصميميًا، بل هو بالضبط عدد الرموز ذات الوحدة الرمزية الواحدة التي يمكن للعقد التعامل معها.
• تُعرض موجّه النظام والحالة والمخطط وهيكل JSON كامل للمساعد باستخدام <decision> كعنصر نائب واحد لكل حقل. ويُحافظ على قالب الدردشة الخاص بنقطة التحقق وكتلة التفكير الفارغة كما هي.
• يتم تشغيل تمريرة أمامية سببية واحدة. تُقرأ الـ logits عند الموضع الذي يسبق كل عنصر نائب مباشرةً — وليس بعده، وليس عند رمز مُولَّد.
• يُحسب سوفتماكس على الرموز المرشّحة المسموح بها لذلك الحقل فقط، وتُطبّق معايرة نقطة التحقق، ثم تُعاد الرموز لتُطابق قيم الخيارات الأصلية لديك.
البطاقة صريحة بشأن ما هذا: "هذا الـ API يقوم بتقييم مُهيكل للمرشحين. إنه لا يستدعي generate() أو يأخذ عينات من نص حر الشكل." DecisionEngine(max_length=8192) يرفض المدخلات المفرطة الحجم بدلًا من اقتطاعها، لذا فإن الطلب الذي لا يتناسب معها يفشل بصوت عالٍ بدلًا من أن يفقد فقرته الأخيرة بصمت. قائمة الواجهات الخلفية صادقة أيضًا — backend="hf" هو الافتراضي والوحيد المُنفَّذ في مستودع Hugging Face، وهو أمر يستحق المعرفة لأن إصدار GitHub يتضمن واجهة خلفية XTuner أيضًا، والاثنان ليسا متطابقين عدديًا. يقول دليل التقييم الخاص بـ InternLM ذلك: "يمكن أن تغير اختلافات Kernel و BF16 الاحتمالات وأحيانًا التصنيفات."
الشذوذ في المنتصف
ضع نقاط التحقق الثلاث جنبًا إلى جنب على جدول InternLM الخاص، وسيكون الشكل غريبًا بما يكفي ليكون هو القصة.
• المتوسط عبر سبع مجموعات — Intern-Decision-0.8B 79.38، وIntern-Decision-2B 84.68، وIntern-Decision-4B 90.02. مرتّبة، كما تتوقع من نمو الأوزان.
• الكمون على بطاقة RTX 4090 واحدة — 33.98 ms في المتوسط للنموذج 0.8B، و33.28 ms للنموذج 2B، و44.16 ms للنموذج 4B. الحجم الأوسط هو الأسرع بين الثلاثة، بفارق صغير بما يكفي ليكون مجرد ضجيج على وحدة معالجة رسومات واحدة، لكنه ثابت عبر المتوسط، والوسيط (33.15 ms)، وP95 (33.55 ms).
• درجة براير، الأقل أفضل — 0.530، 0.437، 0.347. رتيبة مع الحجم، كما هو معتاد في قاعدة تسجيل صحيحة.
• خطأ المعايرة المتوقع، الأقل أفضل — 0.066 لـ 0.8B، و0.100 لهذا 2B، و0.065 لـ 4B. الحجم الأوسط هو الأسوأ، وهو أسوأ من النموذج الذي يبلغ نصف حجمه.
ذلك السطر الأخير هو المثير للاهتمام، ودرجات الحرارة المُلاءَمَة تدعمه بدلًا من أن تفسّره. تحمل كل نقطة تفتيش درجة حرارة خاصة بها مُلاءَمَة باستخدام NLL: 2.747760550703 للنموذج 0.8B، و2.100509348278 للنموذج 2B، و1.992418 للنموذج 4B. جرى ملاءمة كل واحدة على 1,728 حالة معايرة مُخصَّصة مع استبعاد 1,693 حالة، عبر تصغير سالب لوغاريتم الإمكان (negative log-likelihood) ضمن بحث في مقلوب درجة الحرارة على المجال [0.01, 100]، مع إبقاء تسميات مجموعة الاختبار خارج الملاءمة عمدًا. تقع درجة حرارة النموذج 2B بين نظيريها، وهو ما قد تتوقعه لو كان الشذوذ أثرًا من آثار الملاءمة. لكنه ليس كذلك: القيمة المُلاءَمَة رتيبة مع الحجم بينما خطأ ما بعد المعايرة ليس رتيبًا. وفق قياس InternLM نفسه، تُعد نقطة التفتيش ذات 2.2 مليار معامل الأقل موثوقية بين الثلاث عندما تخبرك بمدى ثقتها.
هناك تحفّظان قبل أن يصبح ذلك استنتاجًا. إن ECE مع عشر حاويات متساوية العرض وثقة الاحتمال الأقصى إحصاءةٌ مُشوِّشة على المجموعة الصغيرة التي يستخدمها هذا الجدول — Jevbench-Hard، 111 عنصرًا، لذا يرتكز عمود ECE بأكمله على نحو مئة سؤال وعلى اختيار تقسيم الحاويات. وinternlm/Intern-Decision-2B هو البطاقة الوحيدة من الثلاث التي لا تحمل قسم المعايرة الإضافي الذي تحمله بطاقة 4B، لذا التوثيق هنا أقل، لا أكثر. اقرأ قيمة 0.100 كسبب لملاءمة درجة الحرارة الخاصة بك بنفسك، لا كحكم نهائي على الأوزان.

ما الذي يضيفه المستودع، وما الذي لا يزال يحجبه
إن إصدار GitHub أكثر اكتمالاً من بطاقة النموذج، التي هي بحد ذاتها غنية بالمعلومات — فالمختبر الذي كان يقصد إنتاج نتاج ورقي لا يُرفِق عادةً مولِّد معايرة حتميًا وحزمة تقييم تتحقق من التجزئة إلى جانب مشغّل التدريب.
ما هو الآن عام: شفرة التدريب وهدف الرمز التالي المقنّع (تظهر رموز الإجابة المرجعية في التسميات فقط، ولا تظهر أبدًا في المدخل؛ ويُتنبأ بإجابة كل حقل بواسطة اللوجيت الذي يسبق علامته مباشرة، وتشترك جميع الحقول في تمريرة أمامية واحدة)؛ وحزم الدقة السبع ذات التجزئات المُتحقق منها بـ SHA-256 وأعداد الصفوف؛ وشفرة التقييم؛ وسكربتات ملاءمة درجة الحرارة وإعادة التشغيل، حيث يُؤكَّد أن إعادة التشغيل تُغيّر صفر قرارات؛ ومعيار معايرة التوزيع المكوَّن من 96 حالة مع مُولِّده ومُقيِّمه دون اتصال؛ وعرض توضيحي في المتصفح يُقدَّم على loopback عبر POST /v1/decisions (المعروف أيضًا باسم /v1/jev).
ما الذي يُستبعد صراحةً، بكلمات المستودع نفسه: "لا تُشمَل بيانات التدريب، وسجلات المعايرة/التحقق الخاصة، والصور، وخطوط أنابيب الإعداد، وأوزان النموذج." لا يحمل المستودع أي ملف ترخيص على الإطلاق، لذا فإن شروط الكود غير مذكورة رغم أن الأوزان بموجب Apache-2.0. وتبقى تركيبة تقسيم المعايرة — أي 1,728 حالة، ومن أين — غير معلنة، وهو الإغفال الوحيد الذي يحدّ من مدى إمكانية التحقق من أرقام ECE.
المقاسات التي نوجّهها فعلاً، والمقاس الذي لا نوجّهه
Intern-Decision-2B ليس على OrcaRouter. صفحة نموذجنا الخاصة به تُرجع 404، ولا توجد أي نقطة نهاية مستضافة له في أي مكان تمكّنا من العثور عليه، ولا ينبغي قراءة أي شيء هنا على أنه ادعاء بالتوافر. السبيل الوحيد لاستدعائه اليوم هو تنزيل نقطة التحقق وتشغيل inference.py بجوار الأوزان.
هذا مهم بالنسبة للقرار الذي تدور حوله هذه المقالة فعلاً، لأن مُقيّمًا لا يخدمه أحد هو مُقيّم يجب عليك تشغيله. إذا كان القرار ذو المجموعة المغلقة الذي تحاول اتخاذه قريبًا في الشكل مما تفعله هذه العائلة — حالة، أسئلة مصنّفة، احتمالات معايرة — فإن المقارنة المستضافة هي Jev 1.13 من TypeSafe، وهو النموذج الذي قارنت InternLM به عن قصد، وهو على OrcaRouter بتكلفة 0.042 دولار لكل مليون رمز إدخال مع سياق 65K وزمن P50 حتى أول رمز يبلغ 178 مللي ثانية.

تشغيل نقطة تحقّق (checkpoint) بـ2.2 مليار معامل محليًا واستدعاء مصنّف مستضاف ليسا عملية الشراء نفسها، لكنهما المشكلة ذاتها، وإتاحة كليهما على مفتاح واحد مع سعر قائمة المزوّد مُمرَّرًا بهامش ربح 0% هو السبب في إبقاء المقارنة مفتوحة بدلًا من المراهنة بالمعمارية على أحدهما.
ما الذي قد يغيّر هذه الصورة؟
ثلاثة أمور، بالترتيب.
يحتاج شخص من خارج InternLM إلى إعادة إنتاج المتوسط البالغ 84.68 وقيمة ECE البالغة 0.100، وأصبح المستودع الآن هو ما يجعل ذلك ممكنًا — وهذا هو الخبر الفعلي هنا. الاختبار علني ومُتحقَّق منه عبر الهاش؛ لا ينقص سوى ورقة الإجابات، وورقة الإجابات هي نقطة الحفظ التي يمكن لأي شخص تنزيلها الآن.
يحتاج المورّد إلى أن يوضّح الغرض من هذا. إن نموذجًا يضم حزمة تدريب عاملة، وحزمة تقييم منشورة، ودون أي إعلان، ودون ترخيص لكوده، ودون نقطة نهاية مستضافة، يُقرأ على أنه إصدار بحثي لم يُبتّ بعد في تحويله إلى منتج. الأوزان المرخّصة بموجب Apache-2.0 ترجّح ناحية؛ أما غياب ترخيص الكود وSpace الذي يعيد 401 فيرجّحان الناحية الأخرى.
والحجم الأوسط يحتاج إلى سبب للوجود. إذا كانت ميزة سرعة 2B على 0.8B حقيقية لكن هامشية، وكانت معايرته الأضعف بين الثلاثة في كل مقياس نشرته InternLM، فإن التوصية الأمينة لمعظم القراء هي أن يدفعوا 2.6× من مساحة القرص مقابل 4B أو أن يقبلوا بدقة النموذج الأصغر الأضعف. الحجة لصالح 2B هي أنه يصادف كونه الأسرع بين النماذج السريعة — وهذه حجة أضعف مما يوحي به التأطير التسويقي للعائلة.
