بطاقة عنوان مُولَّدة تحمل نص «Intern-Decision-2B مقابل Gemma 4 12B»، وعنوانها الفرعي «8,192 رمزًا مقابل 256,000»، مع شارتي «مُقيِّم يرفض» و«عامّيّ يكتب»، وشعار OrcaRouter مُركَّبًا في الزاوية.
Guides & Insights

Intern-Decision-2B مقابل Gemma 4 12B: سقف 8,192 رمزًا في مواجهة نافذة 256K

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لنفترض أن ما تحتاج إلى الحكم عليه هو ملف مطالبة تأمين من أربعين صفحة. internlm/Intern-Decision-2B سيرفضه. لن يقتطعه ولن يلخّصه — بل سيرفضه، لأن محرّك الاستدلال المضمّن يعلن DecisionEngine(max_length=8192) وبطاقة النموذج تقول بلغة واضحة إن المدخلات المفرطة الحجم "تُرفض دون اقتطاع". google/gemma-4-12B-it — Gemma 4 12B Unified — سيأخذ المستند نفسه، إضافة إلى الصور الممسوحة ضوئيًا المدبّسة إليه، وإلى المكالمة الهاتفية المسجّلة، ويكتب لك إجابة. هذا التباين هو المقارنة كلها، ولا علاقة له تقريبًا بأعداد المعاملات — 2,213,241,664 مقابل 11,959,730,224 — التي كانت ستتصدّر المشهد عند قراءة ورقة المواصفات.

Intern-Decision-2B هو الأوسط من بين ثلاث نقاط تحقق قرارية رفعتها InternLM إلى Hugging Face في 26 سبتمبر 2026 دون إعلان، ومضبوط ضبطًا دقيقًا انطلاقًا من Qwen/Qwen3.5-2B، ومرخّص بموجب Apache-2.0 مع الإبقاء على شروط Qwen إلى جانبه. Gemma 4 12B Unified هو نموذج Google DeepMind متعدد الوسائط الخالي من مُشفِّر من مايو 2026، وهو نظام من أيّ إلى أيّ يستقبل النص والصورة والصوت والفيديو ويولّد نصًا عبر نافذة من 256,000 رمز في أكثر من 140 لغة. أحد هذين مُقيِّم. والآخر نموذج عامّ يمكنه أن يقيّم بشكل سيئ إذا صغت الموجّه بعناية. الاختيار بينهما ليس مسألة اختبار معياري بقدر ما هو سؤال عن الشكل الذي عليه إجابتك بالفعل.

حيث لا يكون الاثنان قابلين للمقارنة فعليًا

يجدر أن نكون صريحين بشأن هذا قبل الأرقام، لأن المواجهة تُغري بتماثل زائف.

لا يُنتج Intern-Decision-2B أي رموز. يستقبل حالة، ومن سؤال واحد إلى ستة عشر سؤالًا مُسمّى، مع ما يصل إلى 62 خيارًا لكل سؤال، واختياريًا ما يصل إلى ثماني صور؛ ويُنشئ هيكل JSON للمساعد يحتوي على عنصر نائب <decision> واحد لكل حقل؛ ويُجري تمريرة أمامية سببية واحدة؛ ويقرأ اللوجيتات في الموضع الذي يسبق كل عنصر نائب مباشرة؛ ويطبّق softmax على الرموز القانونية لذلك الحقل فقط؛ ويطبّق درجة حرارة مُلائمة مقدارها 2.100509348278. الناتج هو توزيع معاير وقيمة argmax لكل حقل. تنص البطاقة على النفي صراحةً: "تُجري واجهة API هذه تقييمًا مُهيكلًا للمرشّحين. وهي لا تستدعي generate() ولا تأخذ عينات من نص حر."

يولّد Gemma 4 12B. كل ما يفعله — الاستدلال مع تفكير قابل للضبط، واستدعاء الدوال، وOCR، وفهم المخططات، والتعرّف على الكلام، وتغطية 140 لغة — يمر عبر حلقة فك ترميز على مفردات من 262,144 مدخلًا. اطلب منه قرار توجيه مع احتمالات وستحصل على نص نثري يحتوي على رقم، وسيكون الرقم أياً كان ما أنتجه المُعيّن، وليس softmax على مجموعة خياراتك.

إذن فالسؤال العملي ليس "أيّهما أكثر دقة". بل "هل إجابتي بالفعل مجموعة مغلقة؟" إذا كانت كذلك، فإن 12B وسيلة مُسرِفة للاختيار من قائمة. وإذا لم تكن كذلك، فلا يمكن لـ Intern-Decision-2B مساعدتك بأي قدر من الدقة على الإطلاق.

سقف المُدخلات هو الخط الأكثر حِدّة بينهما

إليك البُعد الذي ينبغي أن تُرجّحه فوق كل الأبعاد الأخرى، لأنه يُفضي إلى إخفاقات تامّة لا إلى إخفاقات جزئية.

• طول المدخل — يقبل Intern-Decision-2B ‏8,192 رمزًا ويرفض أي شيء أطول منه، وبصوت عالٍ؛ ويقبل Gemma 4 12B ‏256,000 رمز، وعلى بطاقة Google الخاصة، يحقق 43.4% في MRCR v2 eight-needle عند 128k.

• الصور — حتى ثمانٍ لـ Intern-Decision-2B، وتُحتسب ضمن الميزانية نفسها البالغة 8,192 رمزًا؛ نسبة العرض إلى الارتفاع والدقة متغيّرتان لـ Gemma 4 12B، مع إدخال متشابك للنص والصورة بأي ترتيب.

• الأنماط المُدخَلة — النص والصورة لأحدهما؛ النص والصورة والصوت والفيديو للآخر.

• اللغة — لا يُقدَّم أي ادعاء بتعدد اللغات في أي مكان في وثائق Intern-Decision؛ تُغطي Gemma 4 أكثر من 140 لغة مُدرَّبة مسبقًا بدرجة تقييم متعددة اللغات تبلغ 83.4 على MMMLU للـ 12B.

• الإخراج — توزيع إجابات JSON مُنمَّط لأحدهما؛ ونص مُولَّد للآخر.

حدّ الـ8,192 ليس اعتباطيًّا، وهذا ما يجعله صعب الالتفاف عليه. يقرأ هدف القرار logit عند موضع ثابت لكل حقل، لذا يجب أن تحتوي المطالبة على الحالة والمخطط والهيكل الكامل في تمريرة واحدة؛ ولا توجد استراتيجية تقطيع تحافظ على العقد. تذكرة، أو بريد إلكتروني، أو حالة JSON قصيرة، أو لقطة شاشة أو اثنتان — ذلك هو مركز التصميم. أما مستند يحتاج إلى استرجاع فهو مستند ليس هذا النموذج مخصّصًا له.

تكلفة كل واحد منها بالنسبة لك، محسوبة بصدق

ليس لدى Intern-Decision-2B نقطة نهاية مستضافة ولا مزوّد. وصفحة نموذج OrcaRouter الخاصة به تُرجع 404، ولا شيء في هذه المقالة يُعدّ ادعاءً بإتاحته. واستدعاؤه يعني تنزيل ما يقرب من 4.46 GB من المستودع — شريحة لغوية بحجم 3.76 GB، وبرج رؤية بحجم 612.5 MB، ومُسقِط بحجم 50.3 MB — وتشغيل inference.py بجانب الأوزان في بيئة Python 3.12 مع torch 2.9.1 وtransformers 5.14.1، على وحدة معالجة رسومات تدفع ثمنها سواء كانت تقيّم القرارات أم لا.

هذا ليس عيبًا في كل الحالات، ويستحق الحساب أن يُجرى بدلًا من الافتراض. عند متوسط 33.28 مللي ثانية لكل طلب على بطاقة RTX 4090 واحدة، وفق قياس InternLM نفسه، فإنّ Intern-Decision-2B المستضاف محليًا لا يكلّف شيئًا عن كل قرار. أما النموذج العام المستضاف فيحاسب على كل رمز، بما في ذلك الرموز التي يستهلكها في التفكير قبل أن يجيب. وعند الحجم الكبير، يكون المقيّم الذي تملكه بالفعل هو الأداة الأرخص — فالتكلفة هي GPU والهندسة، وليس الاستدعاء.

كذلك لا يتوفّر Gemma 4 12B Unified في فهرسنا؛ فإن أردته فعليك تنزيل 11.96 مليار معامل بصيغة BF16 وتشغيله بنفسك. أما المواضع التي يضم فيها فهرسنا مسارات حقيقية لـ Gemma 4 فهي الحجمين الآخرين، وهما رخيصان: Gemma 4 26B A4B بسعر 0.06 دولار لكل مليون رمز إدخال و0.33 دولار لكل مليون رمز إخراج، وGemma 4 31B بسعر 0.13 و0.38، وكلاهما مُدرَج بسياقات تبلغ 262,144 رمزًا ووقت الوصول إلى أول رمز الذي يُظهره الفهرس عند 1.73 ثانية. وإذا تبيّن أن مشكلتك تتعلق بالاستدلال العام لا بقرار من مجموعة مغلقة، فهذا هو ما ينبغي مقارنته بمُقيِّم يعمل محليًا — نموذجان إضافيان على مفتاح واحد، وقائمة المزوّدين تُمرَّر دون أي هامش، والتحويل التلقائي عند الفشل بحيث لا يصبح نموذج لا تزال تقيّمه نقطة فشل وحيدة في مسار الإنتاج.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

لوحة النتائج، مع التحفظات المرفقة

• المعاملات — Intern-Decision-2B ‏2,213,241,664 في BF16 بالإضافة إلى برج رؤية ومُسقط؛ Gemma 4 12B Unified ‏11,959,730,224 في BF16.

• السياق — 8,192 رمزًا، مرفوضة فوق ذلك، مقابل 256,000 رمز.

• الإخراج — احتمالات معايرة وقيمة argmax، بدون نص؛ نص مُولَّد، رمز واحد في كل مرة.

• الوسائط — نص مع ما يصل إلى ثماني صور مقابل نص وصورة وصوت وفيديو كمدخل، ونص كمخرج.

• أدلة منشورة — جدول صادر عن المورّد يضم سبع مجموعات، بمتوسط 84.68، ودرجة براير 0.437، وECE 0.100، لم يُعِد إنتاجه أحد خارج المختبر؛ وبطاقة تقييم من Google تتضمن MMLU Pro 77.2%، وGPQA Diamond 78.8%، وAIME 2026 بدون أدوات 77.5%، وLiveCodeBench v6 72.0، بالإضافة إلى إدراج مستقل عند 14.2 على Artificial Analysis Intelligence Index.

• الاعتماد — إعجاب واحد وصفر تنزيلات على نقطة التحقق 2B مقابل عائلة متداولة منذ مايو، مع تكميمات ونسخ مُضبّطة بدقة ومشتقات يبلغ عددها المئات.

اقرأ صفوف الأدلة بشكل غير متماثل، لأن هذا ما هي عليه. أرقام Google تم فهرستها وإعادة إنتاجها بشكل مستقل من قبل أطراف ثالثة؛ أما أرقام InternLM فلم يتم تشغيلها من قبل أي شخص خارج المختبر، ويجب التعامل مع رقم المعايرة على وجه الخصوص كنية موثقة جيدًا حتى يخضع لمجموعة اختبار أجنبية. الملخص الصادق ليس أن جدول المورد خاطئ. بل إن العمودين لا يحملان نفس الوزن الإثباتي، والمقارنة التي تطبع 84.68 بجانب 77.2 دون قول ذلك تضلل قارئها.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

ماذا نفعل بهذا؟

اختر Intern-Decision-2B عندما يكون القرار مغلقًا فعليًا، وتتسع الحالة بأريحية داخل ثمانية آلاف توكن، وتريد احتمالًا يمكنك تطبيق عتبة عليه بدلًا من فقرة عليك تحليلها، وتملك العتاد والرغبة لتشغيل نقطة حفظ لا يدعمها أحد بعد. الحجم الأوسط تحديدًا يحمل أضعف معايرة منشورة بين الثلاثة التي أصدرتها InternLM — ECE 0.100 مقابل 0.066 للنموذج الذي بنصف حجمه و0.065 للذي يقارب ضعف حجمه — لذا إذا كنت تختار ضمن هذه العائلة، فإن 2B هو الذي تضبط عليه درجة حرارتك الخاصة، وليس الذي تثق به جاهزًا دون تعديل.

اختر Gemma 4 12B — أو عمليًا أكثر، أحد مقاسي Gemma 4 اللذين نوجّه إليهما فعليًا — عندما يكون الإدخال أطول من صفحة، أو عندما يتعلق الأمر بالصوت أو الفيديو أو بلغة غير الإنجليزية، أو عندما يجب شرح الإجابة بدل مجرد اختيارها، أو عندما لا ترغب في امتلاك حزمة الاستدلال. يُعد 12B أصغر نماذج Gemma 4 ذات الصوت الأصلي؛ أما 26B A4B فينشّط نحو أربعة مليارات معامل لكل رمز، وهو أرخص طريقة للدخول إلى العائلة.

وإذا كان ما لديك فعليًا هو مشكلة تقييم مصحوبة بمستند طويل، فلا أيٌّ من هذين هو الأداة الصحيحة: تلك مشكلة استرجاع ترتدي ثياب مقال مقارنة.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.