
Intern-Decision-0.8B مقابل Gemma 4 12B: رأس تقييم في مواجهة نموذج متعدد الوسائط عام
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 592 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 187 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
أرخص طريقة لرؤية ما يمثله Intern-Decision-0.8B — وما لا يمثله — هي أن تضعه بجانب Gemma 4 12B، ثم تلاحظ أن المقارنة تدور بالكامل تقريبًا حول ما يفعله كل نموذج بطبقة مخرجاته. إن Gemma 4 12B، وهو نموذج DeepMind متعدد الوسائط خالٍ من المُرمِّز بعدد معاملات يبلغ 11.95 مليارًا، صدر في 3 يونيو 2026 بموجب Apache 2.0، هو نموذج توليدي عامّ الأغراض: تعطيه نصًا أو صورًا أو صوتًا أو فيديو، فيكتب إجابة. أما Intern-Decision-0.8B، الذي رفعته InternLM بهدوء إلى Hugging Face في 26 سبتمبر 2026 دون أي إعلان، فهو نموذج مضبوط ضبطًا دقيقًا من Qwen3.5-0.8B الأصغر كثيرًا، ولا ينتج أي نص على الإطلاق — بل يستقبل حالة، ومخططًا لأسئلة مُسمّاة، وما يصل إلى ثماني صور، ويعيد توزيعًا احتماليًا معايرًا لكل سؤال بعد تمريرة أمامية واحدة. أحدهما يكتب. والآخر يُقيّم. وكل ما يلي ينتج عن ذلك.
يجعل هذا من هذه المواجهة أمرًا غريبًا إذا صيغت كمنافسة، ويستحق قوله بوضوح قبل صفوف المواصفات: هذان ليسا بديلين، وأي شخص يختار بينهما فقد أخطأ أصلاً في طرح المشكلة. يجيب Gemma 4 12B عن سؤال "ما الذي ينبغي أن تكون عليه الاستجابة؟". ويجيب Intern-Decision-0.8B عن سؤال "أي من هذه الخيارات الستة عشر هو، وما مدى ثقتك؟" — ويجيب عنه دون حلقة فك ترميز، ومن هنا تأتي فروق زمن الاستجابة والتكلفة. لذا فإن المقارنة المفيدة تدور حول كيفية ربط كل منهما في سير عمل واحد، لا حول أيهما يفوز.
الفرق الأكبر الوحيد هو الجانب الخاص بإخراج الفاتورة
يُحتسب Gemma 4 12B مثل أي نموذج توليدي: رموز الإدخال ورموز الإخراج، كليهما. عندما تطلب منه JSON منظمًا، يُولَّد كل واحد من تلك الرموز، وتُؤخذ منه عينات، ويُحتسب، وكلما طالت مخططاتك وزاد تعشيشها، زاد عددها. هذا ليس انتقادًا للنموذج — بل هو ما يفعله مفكك الترميز — لكنه البند الذي وُجدت رؤوس القرار لإزالته. لا يملك Intern-Decision-0.8B رموز إخراج. بطاقته توضح السبب صراحةً: مسار الاستدلال لا يستدعي أبدًا generate()/، ويقرأ logits عند المواضع التي تسبق مباشرةً كل <decision>/ عنصر نائب في هيكل مُصيَّر مسبقًا، ويأخذ softmax على الرموز المرشحة المسموح بها فقط لذلك الحقل. عداد الاستخدام المسمى output_tokens/ يحصي الحقول المُقيَّمة، وليس النص.
تتفاقم النتيجة مع التوسع. فخط أنابيب يوسم عشرة آلاف سجل باستخدام Gemma 4 12B يدفع مقابل عشرة آلاف مستند JSON؛ أما الخط نفسه على Intern-Decision-0.8B فيدفع مقابل المُطالبات ولا شيء غيرها. وما إذا كان الرقم المطلق كبيرًا يعتمد كليًا على حجمك ومخططك، وأي شخص لديه ميزانية لكل رمز يمكنه حسابه في جدول بيانات خلال عشر دقائق. لكن الاتجاه لا خلاف عليه، وهو السبب في ظهور فئة من نماذج القرار الصغيرة أصلًا.
زمن الاستجابة، ولماذا تكون فجوة المعاملات مضللة
• نموذج الإنتاجية — Intern-Decision-0.8B: تمريرة أمامية واحدة، دون حلقة فك ترميز. Gemma 4 12B: توليد انحداري تلقائي، رمز واحد في كل مرة.
• زمن الاستجابة المقيس — Intern-Decision-0.8B: 33.98 مللي ثانية كمتوسط / 37.50 مللي ثانية عند المئين 95 على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، وفقًا لقياس InternLM نفسه. Gemma 4 12B: لا يوجد رقم مكافئ لمرور واحد، لأنه لا توجد تمريرة واحدة يمكن قياسها.
• البصمة — Intern-Decision-0.8B: حوالي 1.73 GB من مساحة تخزين المستودع، و852,985,920 معاملًا موزعة على جزء لغوي بحجم 1.50 GB، وجزء رؤية بحجم 176 MB، ومُسقِط بحجم 25 MB. Gemma 4 12B: تضع مواد إطلاق Google هذا النموذج عند 16 GB من ذاكرة VRAM أو الذاكرة الموحدة.
• حتمية المخرجات — Intern-Decision-0.8B: argmax على اللوغيتات المرشحة، لذا يُنتج المدخل نفسه التسمية نفسها في كل مرة. Gemma 4 12B: أخذ العينات ما لم تثبّت درجة الحرارة عند الصفر، وحتى عندئذٍ تصل التسمية كنص يجب عليك تحليله.
الفجوة البالغة 14 ضعفًا في عدد المعاملات بين هذين النموذجين لا تُترجم إلى أي شيء يشبه فجوة قدرها 14 ضعفًا في زمن التشغيل عند مهمة اتخاذ قرار، لأن طبيعة العمل مختلفة. يقضي Intern-Decision-0.8B تمريرته الواحدة في قراءة المطالبة — الحالة، والمخطط، وأوصاف الخيارات — ثم يتوقف. أما Gemma 4 12B فيقضي تلك القراءة نفسها للمطالبة ثم يضيف فوقها كل توكن من الإجابة. بالنسبة لمخطط من ستة عشر حقلًا مع تسميات خيارات وصفية، فإن مرحلة التوليد ليست خطأً هامشيًا؛ إنها معظم الزمن الفعلي. وجدول InternLM نفسه يوضح هذه النقطة عن غير قصد: فشقيقه 2B يسجل متوسطًا قدره 33.28 مللي ثانية، أسرع بشكل طفيف من 33.98 مللي ثانية لدى 0.8B. وعندما تهيمن معالجة المطالبة، يتوقف عدد المعاملات عن كونه الرافعة.img src="2.png">

حيث يكون Gemma 4 12B ببساطة في فئة مختلفة
سيكون من غير الأمانة أن نترك ورقة المواصفات عند تأطير مهمة القرار، لأنه خارج ذلك التأطير، ليس Gemma 4 12B متقدّمًا فحسب — بل يلعب رياضة مختلفة.
يستقبل Intern-Decision-0.8B نصًّا بالإضافة إلى ما يصل إلى ثماني صور، وهذا هو كامل سطح الإدخال لديه. سقفه الافتراضي للإدخال هو 8,192 رمزًا، ويُرفض ما يتجاوزه بدلًا من اقتطاعه، وهو سقف أدنى بكثير من الحد الأقصى البالغ 262,144 لتضمين المواضع الذي يعلنه إعدادُه — فالسقف، لا البنية المعمارية، هو النافذة العملية. أما Gemma 4 12B فيستقبل النص والصورة والصوت والفيديو أصالةً عبر تصميم بلا مُرمِّز يِسقط الرقع الخام والموجات الصوتية مباشرةً في فضاء التضمين، ويمتلك نافذة سياق تبلغ 256 ألفًا، ويعيد نصًّا. وتمنحه بطاقةُ Google المنشورة نسبة 77.2% في MMLU Pro، و77.5% في AIME 2026 دون أدوات، و72.0% في LiveCodeBench v6، و78.8% في GPQA Diamond، و69.1% في MMMU Pro، و79.7% في MATH-Vision. هذه أرقام المورّد من بطاقة تقييم Google نفسها، وخلافًا لجدول Intern-Decision-0.8B فإن خلفها عامًا من الاستخدام من أطراف ثالثة، لأن Gemma 4 طُرح في منظومة قائمة — LM Studio وOllama وllama.cpp وMLX وvLLM وSGLang وUnsloth — منذ اليوم الأول.
كما أن الإصدارين لا يتشابهان إطلاقًا، والتباين ذو مغزى. كان لدى Gemma 4 12B مدونة إطلاق، وتقرير تقني على arXiv، وصفحة عائلة من خمسة نماذج، وبطاقة تقييم، ورابط تنزيل في يوم ظهوره. أما Intern-Decision-0.8B فكان لديه بطاقة نموذج تتضمن رابط GitHub يعيد 404 ومساحة تجريبية Space تعيد 401، وقد ظهر في غضون أربعين ثانية من ظهور شقيقين أكبر منه غير موثقين بالقدر نفسه. أحد هذين منتج. والآخر نقطة حفظ قرر شخص ما وضعها على الإنترنت.
كلاهما Apache 2.0، وهذا ليس صفًا مشتركًا تافهًا.
البعد الوحيد الذي يلتقي فيه الاثنان حقًا هو الترخيص، وهو يستحق فقرة لأنه حيث يتغير القرار بالنسبة للمستخدمين التجاريين. كلاهما Apache 2.0. يُشحن Gemma 4 12B بموجب شروط ترخيص Gemma 4 المستضافة على Google، والتي تحدد بطاقة النموذج أنها Apache 2.0؛ يحمل Intern-Decision-0.8B ترخيص Apache-2.0 إلى جانب ملف ثانٍ باسم LICENSE-QWEN/ الذي يُعد التعامل الصحيح مع نموذج مشتق من أوزان Qwen وإشارة إلى أن InternLM قام بالأعمال الورقية حتى لإصدار لم يعلن عنه.
وهذا ما يميّز كليهما عن عائلة LFM2.5 من Liquid AI، التي تجعل رخصتها LFM Open License v1.0 الحقوق التجارية مشروطة ببقاء كيانك القانوني تحت عتبة إيرادات سنوية تبلغ 10 ملايين دولار — قيد حقيقي ينبغي للمشتري الذي يقارن بين الخيارات في نماذج القرار أن يقرأه قبل أن يفترض أن «الأوزان المفتوحة» تعني الشيء نفسه في كل مكان. وإذا كانت حالة استخدامك تجارية وتجاوزت إيراداتك ذلك الحد، فإن Apache 2.0 ورخصة LFM ليستا قابلتين للتبادل، ولا يحمل أيٌّ من Gemma 4 12B أو Intern-Decision-0.8B هذا القيد.
السجل الصادق عن أرقام Intern-Decision-0.8B
كل رقم من أرقام أداء Intern-Decision-0.8B هو مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه. هذا ليس إجراءً شكليًا — بل هو الوضع الراهن للأدلة، وينبغي أن يحدد مقدار الوزن الذي يحمله الجدول. اختارت InternLM المعايير، واختارت المنافسين، وأجرت التقييمات ونشرت النتائج، ولا يوجد أي تشغيل مستقل على أي لوحة صدارة عامة. البحث عن النموذج في Artificial Analysis لا يُرجع أي نتيجة على الإطلاق. img src="3.png">

مع وجود هذا التصنيف ملصقًا، يظل شكل النتيجة مفيدًا. يسجّل 0.8B نتيجة 77.35 على معيار Typed Decision من TypeSafe مقابل 73.35 لـ Jev 1.13 — النموذج الذي سُمّي المعيار باسمه — و94.52 على ToolACE مقابل 91.29. ويحقق في المتوسط 79.38 عبر المجموعة، مع شقيقيه 2B و4B عند 84.68 و90.02. العمود الذي ينبغي أن يوقف المشتري هو WildJailBreak، حيث يسجّل 64.48 مقابل 96.29 لـ Jev: فجوة متانة الرفض بهذا الحجم هي خاصية من خصائص الضبط الدقيق، وما إذا كانت تأتي من قاعدة Qwen3.5-0.8B أو هدف ضبط القرار أو عدد المعاملات غير موثّق في أي مكان. ملف المعايرة الخاص به هو القراءة الأكثر إثارة للاهتمام — Brier قدره 0.530 وخطأ معايرة متوقع قدره 0.066، مقابل 0.358 و0.095 لـ Jev — أي أنه أقل دقة إجمالًا لكن ثقاته المعلنة تتبع دقته بشكل أقرب. بالنسبة إلى سير عمل قائم على العتبات، تهم هذه التفرقة أكثر من الدقة الخام، وهي من النوع الذي لم يكن لدى InternLM أي حافز لنشره.
في مقابل ذلك، فإن بطاقة تقييم Gemma 4 12B هي أيضًا صادرة عن المورّد — فقد أجرت Google تلك الاختبارات المعيارية بنفسها — لكن النموذج موجود في العالم منذ يونيو، وجرى تشغيله عبر كل بيئة تشغيل محلية رئيسية، وكان أي تباين سيظهر. الفجوة الإثباتية بين «لم يُعَد إنتاجه لمدة أسبوع» و«لم يُعَد إنتاجه لمدة أربعة أشهر ولم يعارضه أحد» هي الفرق الحقيقي بين هذين العمودين.
كيف يمكنك دمجها فعليًا
النمط المنطقي ليس اختيارًا. يتولّى رأس القرار الاستدعاءات المهيكلة — التوجيه، والفرز، والتصنيف، والتقييم وفق معيار — حيث تكون مجموعة الإجابات مغلقة، ويكون زمن الاستجابة مهمًا، وتكون رموز الإخراج مجرّد عبء صافٍ. ويتولّى النموذج العام كل ما يحتاج إلى نثر أو شيفرة أو تركيب أو سياق طويل: ملخّص التصعيد، وشرح سبب إحالة التذكرة إلى الفوترة، والمسودة التي يحرّرها إنسان.
إذا كنت تحاول تحديد أين تقع الحدود، فإن أرخص تجربة هي وضع كلا النصفين خلف نقطة نهاية واحدة. يوجّه OrcaRouter أكثر من 200 نموذج عبر واجهة برمجة تطبيقات واحدة متوافقة مع OpenAI مع تجاوز تلقائي للفشل وسعر قائمة المزوّد يُمرَّر كما هو دون أي هامش ربح، ما يعني أن اختبار نموذج قرار مستضاف ونموذج عام مستضاف في السكربت نفسه يكلّف مفتاحًا واحدًا وعصر يوم واحد. يجدر بنا أن نكون دقيقين بشأن حدّ واحد هنا: إن Intern-Decision-0.8B ليس أحد نماذجنا — إنه نقطة تحقق Apache-2.0 تقوم بتنزيلها وتشغيلها بنفسك، والسبب الكامل وراء اختيار نموذج بحجم 1.73 GB هو أنه يعيش حيث توجد بياناتك بالفعل. النصف التوليدي من النمط هو الجزء الذي لا يفصله سوى سطر واحد. أما بخصوص Gemma 4 12B تحديدًا، فهو ليس في كتالوجنا كذلك؛ إن أحجام Gemma 4 التي نوجّهها هي 31B و26B A4B، و12B هو تنزيل محلي. img src="4.png">

الحكم، إذن، ليس فائزًا. إن Intern-Decision-0.8B رأس تسجيل رخيص وسريع وحتمي من مختبر لم يشرحه بعد، مع جدول معياري لم يكرره أحد وعمود لمتانة الرفض ينبغي اختباره قبل أن يقترب من مدخلات غير موثوقة. أما Gemma 4 12B فهو نموذج عام متعدد الوسائط ناضج مفتوح الأوزان، له بطاقة منشورة وتقرير تقني وأربعة عشر ضعف عدد المعاملات، وهو الأداة الخاطئة لاستدعاء تصنيف من ستة عشر حقلًا — لا لأنه أسوأ، بل لأن توليد إجابة لسؤال كتبت مجموعة إجاباته مسبقًا هو طريقة مكلفة للحصول على وسم.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
