بطاقة عنوان رئيسية تحمل النص 'Intern-Decision-0.8B' مع عنوان فرعي 'شُحن بهدوء، دون إعلان'، وتحمل شارات 'لا ورقة بحثية، لا مستودع، لا منشور إطلاق' و'852,985,920 معاملًا، 1.73 جيجابايت على القرص'، مع شعار OrcaRouter مركّبًا في الزاوية.
Guides & Insights

وصل Intern-Decision-0.8B دون أي إعلان: ما الذي وضعته InternLM بهدوء على Hugging Face

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

رابط GitHub الموجود على بطاقة النموذج يُرجع 404. ومساحة العرض التجريبي تُرجع 401. لا توجد أي مجموعة، ولا منشور مدوّنة، ولا تقرير تقني، ولا أي نتيجة بحث في أي مكان عن السلسلة النصية "Intern-Decision" لا تكون إعلانًا وظيفيًا لتدريب — ومع ذلك، فإن Intern-Decision-0.8B موجود الآن على Hugging Face كنقطة حفظ كاملة، قابلة للتنزيل، بترخيص Apache-2.0، ومضبوط بدقة انطلاقًا من Qwen3.5-0.8B، ورُفع في الساعات الأولى من 26 سبتمبر 2026 مع نظيرين أكبر ظهرا في الدقائق الثلاث نفسها: Intern-Decision-2B وIntern-Decision-4B. سبق أن أطلقت InternLM بهذه الطريقة، ولهذا فإن كل ما يلي مُجمّع من المستودع نفسه بدلًا من منشور إطلاق. وهذا التمييز يهم هنا أكثر من المعتاد: فالمستودع يخبرك بما هو موجود، ولا يستطيع سوى المورّد أن يخبرك بالغرض منه.

ما يقوله المستودع بالفعل، بالتفصيل، غريب بما يكفي ليستحق القراءة. هذه ليست نماذج محادثة وليست نماذج لغوية صغيرة بالمعنى المعتاد. يأخذ Intern-Decision-0.8B قطعة من الحالة، ومخططًا لأسئلة مسمّاة تكتبها مسبقًا، واختياريًا ما يصل إلى ثماني صور، ويعيد توزيعًا للإجابات لكل سؤال في تمريرة أمامية واحدة. إنه لا يستدعي generate() أبدًا. ولا يأخذ عينات أبدًا. لا يوجد ناتج نصي لتحليله، ولا JSON لإصلاحه، ولا حلقة إعادة محاولة حول قوس لم يُغلق قط. إن ضيق النطاق هو البنية بأكملها، وهو يضع هذا النموذج في الفئة الصغيرة نفسها التي تضم Jev 1.13 من TypeSafe وLaya من Convai — وهي فئة يبدو أن InternLM قاس أداءه مقابلها عن قصد، لأن Jevbench هو معيار TypeSafe الخاص، وهو العمود الأول في الجدول.

إليك ما يمكن معرفته من نقطة التحقق، وما تدّعيه نقطة التحقق فقط، وما لا يستطيع أي شخص خارج InternLM قوله على الإطلاق في الوقت الحالي.

ما هو موجود فعليًا في المستودع

البطاقة قصيرة وصريحة بشأن النسب. يُوصف Intern-Decision-0.8B بأنه "نموذج قرار مُهيكل متعدد الوسائط جرى ضبطه الدقيق انطلاقًا من Qwen3.5-0.8B" — قاعدة Qwen التي صدرت في 28 فبراير 2026 — ويحمل المستودع ملف ترخيص ثانيًا، LICENSE-QWEN، إلى جانب شروط Apache-2.0، وهو ما يُفترض أن يفعله النموذج المشتق، ويُعد بحد ذاته إشارة صدق صغيرة. يُفيد فهرس Hugging Face بوجود 852,985,920 معاملًا موزعة على ثلاث شظايا: شظية لغوية بحجم 1.50 GB، وشظية رؤية بحجم 176 MB، ومُسقِط بحجم 25 MB. ويبلغ إجمالي تخزين المستودع نحو 1.73 GB بما في ذلك ملفات المُرمِّز، ما يضع الأمر كله بأريحية على وحدة معالجة رسومات استهلاكية واحدة أو حاسوب محمول جيد التجهيز.

يكشف الإعداد عن بنية ظلّت Qwen تطرحها عبر الجيل 3.5 بدلًا من شبكة قرار مصممة خصيصًا. إنه Qwen3_5ForConditionalGeneration يتألف من 24 طبقة مرتبة في نمط متكرر من ثلاث طبقات انتباه خطي مقابل طبقة انتباه كامل واحدة، وحجم مخفي 1,024، و8 رؤوس انتباه مقابل رأسَي مفاتيح وقيم، وبُعد رأس 256، وتضمين موضع أقصى قدره 262,144 رمزًا. ويُحتفظ بطبقة واحدة للتنبؤ متعدد الرموز. مسار الرؤية حقيقي: يصف نص البطاقة معالجة الصور، ويستقبل المعالج الصور، وتضم نقطة التحقق برج رؤية ووحدة إسقاط لخدمته — لذا فإن وسم متعدد الوسائط على المستودع مدعوم بأوزان، وليس بالوسوم فقط.

تجدر ملاحظة صورة العائلة لأنها تشكّل طريقة قراءة كل شيء آخر. رفع InternLM ثلاثة أحجام في 40 ثانية: ‏0.8B، ثم 2B، ثم 4B. أعداد المعاملات هي 852,985,920 و2,213,241,664 و4,539,265,536. تحمل بطاقة نموذج 4B قسمًا إضافيًا — تجربة معايرة توزيع معروف من 96 حالة مع درجات قبل وبعد — لا تحمله بطاقة 0.8B. هذا التفاوت ليس دليلًا على عيب في النموذج الصغير؛ بل هو دليل على أن توثيق النموذج الصغير كُتب بميزانية أقصر، وهو النوع من الأمور التي يبدو عليها الإصدار الهادئ.

كيف يعمل مسار الاستدلال فعليًا

الملف المضمّن inference.py هو الملف الأكثر إفادة في المستودع، لأنه يوثّق عقدًا لا مطالبة. يجري التسلسل على النحو التالي:

• أنت تقدّم طلبًا يتضمّن الحالة (الشيء الذي يتم الحكم عليه)، وأسئلة (مخطط)، وصورًا اختياريًا.

• تُعيَّن خيارات كل سؤال إلى رموز تمثل توكنًا واحدًا — من A إلى Z، ثم الحروف الصغيرة، ثم الأرقام، بحد أقصى 62 خيارًا لكل سؤال.

• يتم عرض موجه النظام والحالة والمخطط وهيكل JSON كامل للمساعد مع عنصر نائب <decision> واحد لكل حقل.

• تُنفَّذ تمريرة أمامية سببية واحدة. تُقرأ اللوجيتات عند الموضع الذي يسبق كل عنصر نائب مباشرة.

• يُجرى softmax فقط على رموز المرشحين المسموح بها لذلك الحقل، وتُطبَّق معايرة نقطة التحقق، ثم تُعاد تعيين الرموز إلى قيم الخيارات الأصلية لديك.

يكشف المحرك عن ثلاثة أنواع من الأسئلة. النوع choice يأخذ كائنًا مرتبًا يربط قيم الخيارات بالأوصاف. النوع score يأخذ قائمة — تصبح القيم النصية "0" و"1" و"2" وهكذا — أو كائنًا مرتبًا بمفاتيح نصية رقمية محدودة، مما يسمح للنموذج بإرجاع قيمة متوقعة مرجحة باحتمال وليس فقط فئة. النوع noul هو قرار ثنائي مع "لا" قبل "نعم". تُرجع الاستجابة، لكل حقل، التوزيع الاحتمالي المعاير، وثقة تساوي أقصى احتمال مرشح، وقرار argmax مع كسر التعادل المعجمي، وبالنسبة لأسئلة score القيمة الرقمية المتوقعة ومفتاحًا. الحدود صريحة: من سؤال واحد إلى ستة عشر سؤالًا لكل طلب، وحتى 62 خيارًا لكل منها، وسقف إدخال افتراضي قدره 8,192 رمزًا يتم رفضه وليس اقتطاعه، وبحد أقصى ثماني صور تُحتسب رموزها ضمن ذلك السقف.

تفصيلان في تلك القائمة يستحقان الانتباه لأنهما يحددان ما إذا كان يمكنك الوثوق بالمخرجات. الأول هو أنه لا تُدرَج أي إجابات ذهبية في المطالبة — فالنموذج يقيّم مرشحين لم تُعرض عليه الإجابة الصحيحة الخاصة بهم. والثاني هو أن usage.output_tokens ليس عددًا لرموز النص؛ بل يَعُدُّ الحقول المُقيَّمة. أي شخص يدمج هذا في حساب ميزانية الرموز الموجود سيتفاجأ بذلك، وتذكر البطاقة ذلك بدلًا من تركه ليكتشف.

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

جدول القياس المعياري، وإلى أي حد يمكن تصديقه

تحذير للقارئ بشأن هذا القسم: كل رقم أدناه مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه. اختارت InternLM معايير التقييم، واختارت النماذج المقارنة، ونفّذت التقييمات، ونشرت الجدول. لا يوجد أي تشغيل مستقل لـ Intern-Decision-0.8B على أي لوحة متصدرين عامة، ولا يُرجع البحث في Artificial Analysis أي شيء عن النموذج على الإطلاق. هذا لا يجعل الجدول زائفًا. بل يجعله غير مُدقَّق، ويعني أن الأعمدة أكثر فائدة لقراءة شكل النتيجة لا مستواها.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench، ثلاثة تقسيمات — يسجل Intern-Decision-0.8B 97.92 على Easy، و80.56 على Original، و52.25 على Hard. ويأتي Jev التابع لـ TypeSafe عند 100.00 و98.61 و72.07 في التقسيمات نفسها.

• قرار مُصنَّف — يسجّل نموذج 0.8B نتيجة 77.35 مقابل 73.35 لـ Jev. هذا هو العمود الوحيد الذي يتفوّق فيه أصغر نموذج في المجال على النموذج الذي يحمل المعيار اسمه.

• ToolACE — 94.52 لـ 0.8B مقابل 91.29 لـ Jev. ToolACE هو معيار لاستدعاء الدوال، ورأس قرار يتفوق على Jev في اختيار الأدوات هو الادعاء الأكثر جوهرية في الجدول.

• AG News — 88.61 مقابل 89.57 لدى Jev. متكافئ فعليًا مع طليعة هذه الفئة في التصنيف الرباعي للموضوعات.

• WildJailBreak — 64.48 مقابل 96.29 التي سجلها Jev. هذا هو الانهيار. ويمكن القول إنه العمود الأكثر أهمية بالنسبة لنموذج ستوجّهه إلى مدخلات غير موثوقة، وهو العمود الذي يكون فيه 0.8B الأبعد عن المرجع.

• المتوسط — 79.38 للطراز 0.8B، و84.68 لنظيره 2B من العائلة نفسها، و90.02 للطراز 4B. تتصاعد العائلة بشكل حاد، وهو بالضبط ما تتوقعه، ويشكّل في حد ذاته حجة معتدلة على أن الجدول لم يُهندَس عكسيًا لتملق الطراز الرائد.

• المعايرة — Brier 0.530 وخطأ المعايرة المتوقع 0.066 للنموذج 0.8B. ويُبلّغ Jev عن 0.358 و0.095. اقرأ هذين الرقمين معًا فتنشأ صورة أوضح مما يوفره أيٌّ منهما وحده: النموذج 0.8B أفضل معايرةً من Jev بمعنى ECE — فدرجات الثقة المعلنة لديه تواكب دقته على نحو أقرب — بينما هو أقل دقة بشكل معتبر إجمالًا. وهذا وصف معقول لنموذج صغير بدرجة حرارة مُلاءَمَة عمدًا، وليس مزيجًا مُطرِيًا يمكن نشره بالخطأ.

مجموعة المقارنة لها خاصية لافتة واحدة: تهيمن عليها نماذج القرار. يظهر كل من Jev وLaya وSemIf وKev وJevK5؛ ومعيار الجدول نفسه هو معيار TypeSafe. اختارت InternLM أن تُقاس على أرض منافس، باستخدام أدوات اختبار منافس، ثم نشرت الأعمدة التي يخسر فيها أصغر نموذج لديها. إنه نوع القرار الذي يتخذه فريق عندما لا يخطط لحملة تسويقية حول الإصدار — وهو ما يتسق مع كل ما عدا ذلك في طريقة طرح هذا المنتج.

درجة حرارة المعايرة هي الرقم الأكثر إثارة للاهتمام

يعتمد Decision-0.8B درجة حرارة افتراضية مقدارها 2.747760550703، عبر تصغير NLL على 1,693 حالة تحقق. البطاقة صريحة في أن تسميات مجموعة الاختبار لم تُستخدم لاختياره. التحويل المطبق هو p = softmax(candidate_logits()) متبوعًا بـ calibrated_p = softmax(log(p) / T).

تلك معايرة لاحتمالات المرشحين، وليست درجة حرارة أخذ العينات، والتمييز بينهما ليس ترفًا لفظيًا. ولأن التحويل يُطبَّق بعد softmax ويحافظ على الترتيب، فإنه لا يستطيع تغيير قرار argmax إطلاقًا. إنه يغيّر الثقة، واحتمال نعم الخاص بـ noul، والقيمة المتوقعة لسؤال الدرجة — ويترك القرار الرئيسي كما هو تمامًا. إذا كان سير عملك يقرأ التسمية، فإن درجة الحرارة لا تُحدث أي تأثير. وإذا كان سير عملك يقرأ الاحتمال — بوضعه عند عتبات، أو الترتيب حسبه، أو تغذيته في حساب القيمة المتوقعة اللاحق — فإن درجة الحرارة هي الفرق بين رقم له معنى ورقم لا معنى له. تمرير temperature=1 يعيد التوزيع غير المُعاير، وهو مخرج مفيد لأي شخص يريد تطبيق معايرته الخاصة فوق ذلك.

يتم ضبط درجة الحرارة لكل نقطة تفتيش على حدة بدلًا من مشاركتها بينها. ويستخدم نموذج 4B قيمة مختلفة، هي 1.99241824، وتوجّهك البطاقة إلى استخدام وحدة الاستدلال المرفقة مع الحجم الذي حمّلته حتى تتوافق معايرتها الافتراضية. ومن ينسخ غلاف استدلال من نموذج شقيق إلى آخر فسيطبّق درجة حرارة خاطئة من دون أن يلاحظ.

أربع وثلاثون مللي ثانية، ونتيجة لا ينبغي أن تكون ممكنة

قام InternLM بقياس زمن الاستجابة من الطرف إلى الطرف لكل استعلام على بطاقة RTX 4090 واحدة باستخدام مسار Hugging Face المحلي — وهو قياس حقيقي، لكنه أيضًا أبطأ إعداد لتقديم الخدمة ممكن، إذ إن النشر الإنتاجي سيستخدم وقت تشغيل مُترجَمًا أو وقت تشغيل يعتمد على التجميع. يُدرَج Jev بمتوسط 109.70 ms ووسيط 106.30 ms مع p95 البالغ 146.70 ms. ويأتي Intern-Decision-0.8B عند 33.98 / 33.44 / 37.50 ms.

الرقم الجدير بالتوقف عنده هو النظير 2B: 33.28 ms متوسطًا، و33.15 ms وسيطًا. إن 2B أسرع من 0.8B، بفارق صغير بما يكفي ليكون مجرد ضجيج، لكنه ليس في الاتجاه الذي تتوقعه أعداد المعاملات. هذا ليس خطأً في الجدول، وهو ليس حقًا عن النماذج. يقوم نموذج القرار بتمريرة أمامية واحدة بالضبط على مطالبة يحدد طولها الحالة والمخطط وأوصاف الخيارات — وليس بما يكتبه النموذج، لأنه لا يكتب شيئًا. بالنسبة للمطالبات في هذا النمط، تهيمن معالجة المطالبة، ويُعد عدد المعاملات تكلفة من الدرجة الثانية. والنتيجة العملية هي أن السبب المعتاد للجوء إلى أصغر نقطة حفظ — وهو أنك تدفع لكل رمز — لا ينطبق هنا. السبب الحقيقي لاختيار 0.8B بدلًا من 2B هو بصمة الذاكرة وأن مستودعه كله يتسع في 1.73 GB، وليس الإنتاجية.

ما لا يمكن إثباته بعد

هذا هو الجزء الذي كان منشور إطلاق سيجيب عنه ولا يستطيع مستودع الإجابة عنه.

لا يوجد تاريخ إصدار معلن، ولا إعلان، ولا شيء على قنوات InternLM العامة يصف هذه العائلة. رابط GitHub المطبوع على بطاقة الطراز لا يعمل. مساحة العرض التجريبي المشار إليها في البطاقة ليست قابلة للقراءة العامة. لا توجد مجموعة تجمع نقاط التحقق الثلاث، ما يعني أن السبيل الوحيد للعثور على 2B أو 4B هو النظر إلى قائمة طرازات المؤسسة. لا توجد ورقة بحثية، لذا فإن بيانات التدريب، ووصفة الضبط، وعدد خطوات التدريب، وما الذي عدّلته "decision tuning" في الأوزان، كلها غير مذكورة. لا يوجد تقييم مستقل، ولا تكرار لزمن الاستجابة من طرف ثالث، ولا دليل حتى الآن على أن أي شخص خارج InternLM قد شغّل نقطة التحقق.

وهناك أيضاً سؤالان تطرحهما البطاقة دون الإجابة عنهما. الأول هو ما يعنيه فجوة WildJailBreak عملياً: فالعجز في متانة الرفض بهذا الحجم هو خاصية من خصائص الضبط الدقيق، وما إذا كان يعكس النموذج الأساسي، أو هدف ضبط القرار، أو العدد القليل من المعاملات، ليس شيئاً يخبرك به المستودع. والثاني هو ما يحدث عند سقف الإدخال. فالطلبات التي تتجاوز 8,192 رمزاً تُرفض بدلاً من أن تُقطع، وهو السلوك الصحيح لنموذج تقييم، لكنه يعني أن نافذة السياق العملية ليست الـ 262,144 التي يعلن عنها ملف الإعداد — بل هي ما يتسع في 8,192 رمزاً من الحالة والمخطط والخيارات ورقع الصور. وبالنسبة إلى المستندات الطويلة ذات المخططات الغنية، يصل هذا السقف أسرع مما يوحي به مخطط البنية.

أين يقع هذا، وكيف تجربه دون المراهنة عليه

التأطير الصادق هو أن Intern-Decision-0.8B نقطة تفتيش مُصدَرة بادعاءات غير مُدقَّقة ولا يوجد توثيق داعم لها. هذا المزيج ليس سببًا لتجاهله — فإصدار أوزان تحت Apache-2.0 يمكنك تنزيله وقياسه في فترة بعد الظهر أفضل حالًا من API بقائمة انتظار — لكنه يعني أن عبء التحقق يقع عليك. يُحمَّل المحرك من دليل محلي، ويعمل على GPU من فئة 4090 أو أصغر، وتوفّر البطاقة طلبًا جاهزًا يمكنك لصقه. سيقول لك يومٌ من التقييم مقابل حالاتك الموسومة عن عمود WildJailBreak أكثر مما يمكن أن يقوله جدول المورّد.

إذا كانت طبقة القرار هي الجزء الذي تقيّمه، فإن هدف المقارنة المفيد هو حل مستضاف. Jev 1.13 من TypeSafe هو النموذج الذي اتخذ InternLM منه معيارًا للمقارنة، ويمكن استدعاؤه اليوم عبر نقطة نهاية واحدة متوافقة مع OpenAI بتكلفة 0.042 دولار لكل مليون رمز إدخال، مع احتساب الإخراج بصفر — وهو السعر نفسه الذي ينشره المورّد، لأن OrcaRouter يمرر سعر قائمة المزوّد كما هو دون أي هامش ربح بدلًا من إضافة هامش فوق ذلك. إن وضع رأس قرار مستضاف ذاتيًا بحجم 0.8B وواجهة API مستضافة للقرار على المفتاح نفسه، في فترة ما بعد الظهر نفسها، تجربة أرخص بكثير من ربط عقدين منفصلين للإجابة عن السؤال نفسه.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

ما قد يغيّر هذه الصورة ليس معيارًا. بل هو ظهور مستودع GitHub، أو أن تنشر InternLM وصفة الضبط، أو أن تصل أول عملية تشغيل مستقلة لنقطة الحفظ إلى لوحة صدارة. وإلى أن يحدث أحد هذه الأمور، فإن الوصف الدقيق لـ Intern-Decision-0.8B ضيّق وغير مادح، وهو في مصلحته تمامًا: الأوزان حقيقية، وعقد الاستدلال موثّق على نحو أفضل مما تنجح فيه معظم النماذج التي أُطلقت، والتسويق لم يبدأ بعد.