بطاقة عنوان رئيسية تحمل النص 'Intern-Decision-0.8B مقابل Gemma 4 12B' مع عنوان فرعي 'أحدهما يكتب إجابة، والآخر يقيّمها'، وتحمل شارات 'رأس تقييم 0.8B، بلا رموز إخراج' و'نموذج عام متعدد الوسائط 11.95B'، مع شعار OrcaRouter مركّبًا في الزاوية.
Guides & Insights

Intern-Decision-0.8B مقابل Gemma 4 12B: رأس تقييم في مواجهة نموذج متعدد الوسائط عام

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أرخص طريقة لرؤية ما يمثله Intern-Decision-0.8B — وما لا يمثله — هي أن تضعه بجانب Gemma 4 12B، ثم تلاحظ أن المقارنة تدور بالكامل تقريبًا حول ما يفعله كل نموذج بطبقة مخرجاته. إن Gemma 4 12B، وهو نموذج DeepMind متعدد الوسائط خالٍ من المُرمِّز بعدد معاملات يبلغ 11.95 مليارًا، صدر في 3 يونيو 2026 بموجب Apache 2.0، هو نموذج توليدي عامّ الأغراض: تعطيه نصًا أو صورًا أو صوتًا أو فيديو، فيكتب إجابة. أما Intern-Decision-0.8B، الذي رفعته InternLM بهدوء إلى Hugging Face في 26 سبتمبر 2026 دون أي إعلان، فهو نموذج مضبوط ضبطًا دقيقًا من Qwen3.5-0.8B الأصغر كثيرًا، ولا ينتج أي نص على الإطلاق — بل يستقبل حالة، ومخططًا لأسئلة مُسمّاة، وما يصل إلى ثماني صور، ويعيد توزيعًا احتماليًا معايرًا لكل سؤال بعد تمريرة أمامية واحدة. أحدهما يكتب. والآخر يُقيّم. وكل ما يلي ينتج عن ذلك.

يجعل هذا من هذه المواجهة أمرًا غريبًا إذا صيغت كمنافسة، ويستحق قوله بوضوح قبل صفوف المواصفات: هذان ليسا بديلين، وأي شخص يختار بينهما فقد أخطأ أصلاً في طرح المشكلة. يجيب Gemma 4 12B عن سؤال "ما الذي ينبغي أن تكون عليه الاستجابة؟". ويجيب Intern-Decision-0.8B عن سؤال "أي من هذه الخيارات الستة عشر هو، وما مدى ثقتك؟" — ويجيب عنه دون حلقة فك ترميز، ومن هنا تأتي فروق زمن الاستجابة والتكلفة. لذا فإن المقارنة المفيدة تدور حول كيفية ربط كل منهما في سير عمل واحد، لا حول أيهما يفوز.

الفرق الأكبر الوحيد هو الجانب الخاص بإخراج الفاتورة

يُحتسب Gemma 4 12B مثل أي نموذج توليدي: رموز الإدخال ورموز الإخراج، كليهما. عندما تطلب منه JSON منظمًا، يُولَّد كل واحد من تلك الرموز، وتُؤخذ منه عينات، ويُحتسب، وكلما طالت مخططاتك وزاد تعشيشها، زاد عددها. هذا ليس انتقادًا للنموذج — بل هو ما يفعله مفكك الترميز — لكنه البند الذي وُجدت رؤوس القرار لإزالته. لا يملك Intern-Decision-0.8B رموز إخراج. بطاقته توضح السبب صراحةً: مسار الاستدلال لا يستدعي أبدًا generate()/، ويقرأ logits عند المواضع التي تسبق مباشرةً كل <decision>/ عنصر نائب في هيكل مُصيَّر مسبقًا، ويأخذ softmax على الرموز المرشحة المسموح بها فقط لذلك الحقل. عداد الاستخدام المسمى output_tokens/ يحصي الحقول المُقيَّمة، وليس النص.

تتفاقم النتيجة مع التوسع. فخط أنابيب يوسم عشرة آلاف سجل باستخدام Gemma 4 12B يدفع مقابل عشرة آلاف مستند JSON؛ أما الخط نفسه على Intern-Decision-0.8B فيدفع مقابل المُطالبات ولا شيء غيرها. وما إذا كان الرقم المطلق كبيرًا يعتمد كليًا على حجمك ومخططك، وأي شخص لديه ميزانية لكل رمز يمكنه حسابه في جدول بيانات خلال عشر دقائق. لكن الاتجاه لا خلاف عليه، وهو السبب في ظهور فئة من نماذج القرار الصغيرة أصلًا.

زمن الاستجابة، ولماذا تكون فجوة المعاملات مضللة

• نموذج الإنتاجية — Intern-Decision-0.8B: تمريرة أمامية واحدة، دون حلقة فك ترميز. Gemma 4 12B: توليد انحداري تلقائي، رمز واحد في كل مرة.

• زمن الاستجابة المقيس — Intern-Decision-0.8B: 33.98 مللي ثانية كمتوسط / 37.50 مللي ثانية عند المئين 95 على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، وفقًا لقياس InternLM نفسه. Gemma 4 12B: لا يوجد رقم مكافئ لمرور واحد، لأنه لا توجد تمريرة واحدة يمكن قياسها.

• البصمة — Intern-Decision-0.8B: حوالي 1.73 GB من مساحة تخزين المستودع، و852,985,920 معاملًا موزعة على جزء لغوي بحجم 1.50 GB، وجزء رؤية بحجم 176 MB، ومُسقِط بحجم 25 MB. Gemma 4 12B: تضع مواد إطلاق Google هذا النموذج عند 16 GB من ذاكرة VRAM أو الذاكرة الموحدة.

• حتمية المخرجات — Intern-Decision-0.8B: argmax على اللوغيتات المرشحة، لذا يُنتج المدخل نفسه التسمية نفسها في كل مرة. Gemma 4 12B: أخذ العينات ما لم تثبّت درجة الحرارة عند الصفر، وحتى عندئذٍ تصل التسمية كنص يجب عليك تحليله.

الفجوة البالغة 14 ضعفًا في عدد المعاملات بين هذين النموذجين لا تُترجم إلى أي شيء يشبه فجوة قدرها 14 ضعفًا في زمن التشغيل عند مهمة اتخاذ قرار، لأن طبيعة العمل مختلفة. يقضي Intern-Decision-0.8B تمريرته الواحدة في قراءة المطالبة — الحالة، والمخطط، وأوصاف الخيارات — ثم يتوقف. أما Gemma 4 12B فيقضي تلك القراءة نفسها للمطالبة ثم يضيف فوقها كل توكن من الإجابة. بالنسبة لمخطط من ستة عشر حقلًا مع تسميات خيارات وصفية، فإن مرحلة التوليد ليست خطأً هامشيًا؛ إنها معظم الزمن الفعلي. وجدول InternLM نفسه يوضح هذه النقطة عن غير قصد: فشقيقه 2B يسجل متوسطًا قدره 33.28 مللي ثانية، أسرع بشكل طفيف من 33.98 مللي ثانية لدى 0.8B. وعندما تهيمن معالجة المطالبة، يتوقف عدد المعاملات عن كونه الرافعة.img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

حيث يكون Gemma 4 12B ببساطة في فئة مختلفة

سيكون من غير الأمانة أن نترك ورقة المواصفات عند تأطير مهمة القرار، لأنه خارج ذلك التأطير، ليس Gemma 4 12B متقدّمًا فحسب — بل يلعب رياضة مختلفة.

يستقبل Intern-Decision-0.8B نصًّا بالإضافة إلى ما يصل إلى ثماني صور، وهذا هو كامل سطح الإدخال لديه. سقفه الافتراضي للإدخال هو 8,192 رمزًا، ويُرفض ما يتجاوزه بدلًا من اقتطاعه، وهو سقف أدنى بكثير من الحد الأقصى البالغ 262,144 لتضمين المواضع الذي يعلنه إعدادُه — فالسقف، لا البنية المعمارية، هو النافذة العملية. أما Gemma 4 12B فيستقبل النص والصورة والصوت والفيديو أصالةً عبر تصميم بلا مُرمِّز يِسقط الرقع الخام والموجات الصوتية مباشرةً في فضاء التضمين، ويمتلك نافذة سياق تبلغ 256 ألفًا، ويعيد نصًّا. وتمنحه بطاقةُ Google المنشورة نسبة 77.2% في MMLU Pro، و77.5% في AIME 2026 دون أدوات، و72.0% في LiveCodeBench v6، و78.8% في GPQA Diamond، و69.1% في MMMU Pro، و79.7% في MATH-Vision. هذه أرقام المورّد من بطاقة تقييم Google نفسها، وخلافًا لجدول Intern-Decision-0.8B فإن خلفها عامًا من الاستخدام من أطراف ثالثة، لأن Gemma 4 طُرح في منظومة قائمة — LM Studio وOllama وllama.cpp وMLX وvLLM وSGLang وUnsloth — منذ اليوم الأول.

كما أن الإصدارين لا يتشابهان إطلاقًا، والتباين ذو مغزى. كان لدى Gemma 4 12B مدونة إطلاق، وتقرير تقني على arXiv، وصفحة عائلة من خمسة نماذج، وبطاقة تقييم، ورابط تنزيل في يوم ظهوره. أما Intern-Decision-0.8B فكان لديه بطاقة نموذج تتضمن رابط GitHub يعيد 404 ومساحة تجريبية Space تعيد 401، وقد ظهر في غضون أربعين ثانية من ظهور شقيقين أكبر منه غير موثقين بالقدر نفسه. أحد هذين منتج. والآخر نقطة حفظ قرر شخص ما وضعها على الإنترنت.

كلاهما Apache 2.0، وهذا ليس صفًا مشتركًا تافهًا.

البعد الوحيد الذي يلتقي فيه الاثنان حقًا هو الترخيص، وهو يستحق فقرة لأنه حيث يتغير القرار بالنسبة للمستخدمين التجاريين. كلاهما Apache 2.0. يُشحن Gemma 4 12B بموجب شروط ترخيص Gemma 4 المستضافة على Google، والتي تحدد بطاقة النموذج أنها Apache 2.0؛ يحمل Intern-Decision-0.8B ترخيص Apache-2.0 إلى جانب ملف ثانٍ باسم LICENSE-QWEN/ الذي يُعد التعامل الصحيح مع نموذج مشتق من أوزان Qwen وإشارة إلى أن InternLM قام بالأعمال الورقية حتى لإصدار لم يعلن عنه.

وهذا ما يميّز كليهما عن عائلة LFM2.5 من Liquid AI، التي تجعل رخصتها LFM Open License v1.0 الحقوق التجارية مشروطة ببقاء كيانك القانوني تحت عتبة إيرادات سنوية تبلغ 10 ملايين دولار — قيد حقيقي ينبغي للمشتري الذي يقارن بين الخيارات في نماذج القرار أن يقرأه قبل أن يفترض أن «الأوزان المفتوحة» تعني الشيء نفسه في كل مكان. وإذا كانت حالة استخدامك تجارية وتجاوزت إيراداتك ذلك الحد، فإن Apache 2.0 ورخصة LFM ليستا قابلتين للتبادل، ولا يحمل أيٌّ من Gemma 4 12B أو Intern-Decision-0.8B هذا القيد.

السجل الصادق عن أرقام Intern-Decision-0.8B

كل رقم من أرقام أداء Intern-Decision-0.8B هو مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه. هذا ليس إجراءً شكليًا — بل هو الوضع الراهن للأدلة، وينبغي أن يحدد مقدار الوزن الذي يحمله الجدول. اختارت InternLM المعايير، واختارت المنافسين، وأجرت التقييمات ونشرت النتائج، ولا يوجد أي تشغيل مستقل على أي لوحة صدارة عامة. البحث عن النموذج في Artificial Analysis لا يُرجع أي نتيجة على الإطلاق. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

مع وجود هذا التصنيف ملصقًا، يظل شكل النتيجة مفيدًا. يسجّل 0.8B نتيجة 77.35 على معيار Typed Decision من TypeSafe مقابل 73.35 لـ Jev 1.13 — النموذج الذي سُمّي المعيار باسمه — و94.52 على ToolACE مقابل 91.29. ويحقق في المتوسط 79.38 عبر المجموعة، مع شقيقيه 2B و4B عند 84.68 و90.02. العمود الذي ينبغي أن يوقف المشتري هو WildJailBreak، حيث يسجّل 64.48 مقابل 96.29 لـ Jev: فجوة متانة الرفض بهذا الحجم هي خاصية من خصائص الضبط الدقيق، وما إذا كانت تأتي من قاعدة Qwen3.5-0.8B أو هدف ضبط القرار أو عدد المعاملات غير موثّق في أي مكان. ملف المعايرة الخاص به هو القراءة الأكثر إثارة للاهتمام — Brier قدره 0.530 وخطأ معايرة متوقع قدره 0.066، مقابل 0.358 و0.095 لـ Jev — أي أنه أقل دقة إجمالًا لكن ثقاته المعلنة تتبع دقته بشكل أقرب. بالنسبة إلى سير عمل قائم على العتبات، تهم هذه التفرقة أكثر من الدقة الخام، وهي من النوع الذي لم يكن لدى InternLM أي حافز لنشره.

في مقابل ذلك، فإن بطاقة تقييم Gemma 4 12B هي أيضًا صادرة عن المورّد — فقد أجرت Google تلك الاختبارات المعيارية بنفسها — لكن النموذج موجود في العالم منذ يونيو، وجرى تشغيله عبر كل بيئة تشغيل محلية رئيسية، وكان أي تباين سيظهر. الفجوة الإثباتية بين «لم يُعَد إنتاجه لمدة أسبوع» و«لم يُعَد إنتاجه لمدة أربعة أشهر ولم يعارضه أحد» هي الفرق الحقيقي بين هذين العمودين.

كيف يمكنك دمجها فعليًا

النمط المنطقي ليس اختيارًا. يتولّى رأس القرار الاستدعاءات المهيكلة — التوجيه، والفرز، والتصنيف، والتقييم وفق معيار — حيث تكون مجموعة الإجابات مغلقة، ويكون زمن الاستجابة مهمًا، وتكون رموز الإخراج مجرّد عبء صافٍ. ويتولّى النموذج العام كل ما يحتاج إلى نثر أو شيفرة أو تركيب أو سياق طويل: ملخّص التصعيد، وشرح سبب إحالة التذكرة إلى الفوترة، والمسودة التي يحرّرها إنسان.

إذا كنت تحاول تحديد أين تقع الحدود، فإن أرخص تجربة هي وضع كلا النصفين خلف نقطة نهاية واحدة. يوجّه OrcaRouter أكثر من 200 نموذج عبر واجهة برمجة تطبيقات واحدة متوافقة مع OpenAI مع تجاوز تلقائي للفشل وسعر قائمة المزوّد يُمرَّر كما هو دون أي هامش ربح، ما يعني أن اختبار نموذج قرار مستضاف ونموذج عام مستضاف في السكربت نفسه يكلّف مفتاحًا واحدًا وعصر يوم واحد. يجدر بنا أن نكون دقيقين بشأن حدّ واحد هنا: إن Intern-Decision-0.8B ليس أحد نماذجنا — إنه نقطة تحقق Apache-2.0 تقوم بتنزيلها وتشغيلها بنفسك، والسبب الكامل وراء اختيار نموذج بحجم 1.73 GB هو أنه يعيش حيث توجد بياناتك بالفعل. النصف التوليدي من النمط هو الجزء الذي لا يفصله سوى سطر واحد. أما بخصوص Gemma 4 12B تحديدًا، فهو ليس في كتالوجنا كذلك؛ إن أحجام Gemma 4 التي نوجّهها هي 31B و26B A4B، و12B هو تنزيل محلي. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

الحكم، إذن، ليس فائزًا. إن Intern-Decision-0.8B رأس تسجيل رخيص وسريع وحتمي من مختبر لم يشرحه بعد، مع جدول معياري لم يكرره أحد وعمود لمتانة الرفض ينبغي اختباره قبل أن يقترب من مدخلات غير موثوقة. أما Gemma 4 12B فهو نموذج عام متعدد الوسائط ناضج مفتوح الأوزان، له بطاقة منشورة وتقرير تقني وأربعة عشر ضعف عدد المعاملات، وهو الأداة الخاطئة لاستدعاء تصنيف من ستة عشر حقلًا — لا لأنه أسوأ، بل لأن توليد إجابة لسؤال كتبت مجموعة إجاباته مسبقًا هو طريقة مكلفة للحصول على وسم.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا