
Intern-Decision-2B مقابل Gemma 4 12B: سقف 8,192 رمزًا في مواجهة نافذة 256K
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 584 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 187 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
لنفترض أن ما تحتاج إلى الحكم عليه هو ملف مطالبة تأمين من أربعين صفحة. internlm/Intern-Decision-2B سيرفضه. لن يقتطعه ولن يلخّصه — بل سيرفضه، لأن محرّك الاستدلال المضمّن يعلن DecisionEngine(max_length=8192) وبطاقة النموذج تقول بلغة واضحة إن المدخلات المفرطة الحجم "تُرفض دون اقتطاع". google/gemma-4-12B-it — Gemma 4 12B Unified — سيأخذ المستند نفسه، إضافة إلى الصور الممسوحة ضوئيًا المدبّسة إليه، وإلى المكالمة الهاتفية المسجّلة، ويكتب لك إجابة. هذا التباين هو المقارنة كلها، ولا علاقة له تقريبًا بأعداد المعاملات — 2,213,241,664 مقابل 11,959,730,224 — التي كانت ستتصدّر المشهد عند قراءة ورقة المواصفات.
Intern-Decision-2B هو الأوسط من بين ثلاث نقاط تحقق قرارية رفعتها InternLM إلى Hugging Face في 26 سبتمبر 2026 دون إعلان، ومضبوط ضبطًا دقيقًا انطلاقًا من Qwen/Qwen3.5-2B، ومرخّص بموجب Apache-2.0 مع الإبقاء على شروط Qwen إلى جانبه. Gemma 4 12B Unified هو نموذج Google DeepMind متعدد الوسائط الخالي من مُشفِّر من مايو 2026، وهو نظام من أيّ إلى أيّ يستقبل النص والصورة والصوت والفيديو ويولّد نصًا عبر نافذة من 256,000 رمز في أكثر من 140 لغة. أحد هذين مُقيِّم. والآخر نموذج عامّ يمكنه أن يقيّم بشكل سيئ إذا صغت الموجّه بعناية. الاختيار بينهما ليس مسألة اختبار معياري بقدر ما هو سؤال عن الشكل الذي عليه إجابتك بالفعل.
حيث لا يكون الاثنان قابلين للمقارنة فعليًا
يجدر أن نكون صريحين بشأن هذا قبل الأرقام، لأن المواجهة تُغري بتماثل زائف.
لا يُنتج Intern-Decision-2B أي رموز. يستقبل حالة، ومن سؤال واحد إلى ستة عشر سؤالًا مُسمّى، مع ما يصل إلى 62 خيارًا لكل سؤال، واختياريًا ما يصل إلى ثماني صور؛ ويُنشئ هيكل JSON للمساعد يحتوي على عنصر نائب <decision> واحد لكل حقل؛ ويُجري تمريرة أمامية سببية واحدة؛ ويقرأ اللوجيتات في الموضع الذي يسبق كل عنصر نائب مباشرة؛ ويطبّق softmax على الرموز القانونية لذلك الحقل فقط؛ ويطبّق درجة حرارة مُلائمة مقدارها 2.100509348278. الناتج هو توزيع معاير وقيمة argmax لكل حقل. تنص البطاقة على النفي صراحةً: "تُجري واجهة API هذه تقييمًا مُهيكلًا للمرشّحين. وهي لا تستدعي generate() ولا تأخذ عينات من نص حر."
يولّد Gemma 4 12B. كل ما يفعله — الاستدلال مع تفكير قابل للضبط، واستدعاء الدوال، وOCR، وفهم المخططات، والتعرّف على الكلام، وتغطية 140 لغة — يمر عبر حلقة فك ترميز على مفردات من 262,144 مدخلًا. اطلب منه قرار توجيه مع احتمالات وستحصل على نص نثري يحتوي على رقم، وسيكون الرقم أياً كان ما أنتجه المُعيّن، وليس softmax على مجموعة خياراتك.
إذن فالسؤال العملي ليس "أيّهما أكثر دقة". بل "هل إجابتي بالفعل مجموعة مغلقة؟" إذا كانت كذلك، فإن 12B وسيلة مُسرِفة للاختيار من قائمة. وإذا لم تكن كذلك، فلا يمكن لـ Intern-Decision-2B مساعدتك بأي قدر من الدقة على الإطلاق.
سقف المُدخلات هو الخط الأكثر حِدّة بينهما
إليك البُعد الذي ينبغي أن تُرجّحه فوق كل الأبعاد الأخرى، لأنه يُفضي إلى إخفاقات تامّة لا إلى إخفاقات جزئية.
• طول المدخل — يقبل Intern-Decision-2B 8,192 رمزًا ويرفض أي شيء أطول منه، وبصوت عالٍ؛ ويقبل Gemma 4 12B 256,000 رمز، وعلى بطاقة Google الخاصة، يحقق 43.4% في MRCR v2 eight-needle عند 128k.
• الصور — حتى ثمانٍ لـ Intern-Decision-2B، وتُحتسب ضمن الميزانية نفسها البالغة 8,192 رمزًا؛ نسبة العرض إلى الارتفاع والدقة متغيّرتان لـ Gemma 4 12B، مع إدخال متشابك للنص والصورة بأي ترتيب.
• الأنماط المُدخَلة — النص والصورة لأحدهما؛ النص والصورة والصوت والفيديو للآخر.
• اللغة — لا يُقدَّم أي ادعاء بتعدد اللغات في أي مكان في وثائق Intern-Decision؛ تُغطي Gemma 4 أكثر من 140 لغة مُدرَّبة مسبقًا بدرجة تقييم متعددة اللغات تبلغ 83.4 على MMMLU للـ 12B.
• الإخراج — توزيع إجابات JSON مُنمَّط لأحدهما؛ ونص مُولَّد للآخر.
حدّ الـ8,192 ليس اعتباطيًّا، وهذا ما يجعله صعب الالتفاف عليه. يقرأ هدف القرار logit عند موضع ثابت لكل حقل، لذا يجب أن تحتوي المطالبة على الحالة والمخطط والهيكل الكامل في تمريرة واحدة؛ ولا توجد استراتيجية تقطيع تحافظ على العقد. تذكرة، أو بريد إلكتروني، أو حالة JSON قصيرة، أو لقطة شاشة أو اثنتان — ذلك هو مركز التصميم. أما مستند يحتاج إلى استرجاع فهو مستند ليس هذا النموذج مخصّصًا له.
تكلفة كل واحد منها بالنسبة لك، محسوبة بصدق
ليس لدى Intern-Decision-2B نقطة نهاية مستضافة ولا مزوّد. وصفحة نموذج OrcaRouter الخاصة به تُرجع 404، ولا شيء في هذه المقالة يُعدّ ادعاءً بإتاحته. واستدعاؤه يعني تنزيل ما يقرب من 4.46 GB من المستودع — شريحة لغوية بحجم 3.76 GB، وبرج رؤية بحجم 612.5 MB، ومُسقِط بحجم 50.3 MB — وتشغيل inference.py بجانب الأوزان في بيئة Python 3.12 مع torch 2.9.1 وtransformers 5.14.1، على وحدة معالجة رسومات تدفع ثمنها سواء كانت تقيّم القرارات أم لا.
هذا ليس عيبًا في كل الحالات، ويستحق الحساب أن يُجرى بدلًا من الافتراض. عند متوسط 33.28 مللي ثانية لكل طلب على بطاقة RTX 4090 واحدة، وفق قياس InternLM نفسه، فإنّ Intern-Decision-2B المستضاف محليًا لا يكلّف شيئًا عن كل قرار. أما النموذج العام المستضاف فيحاسب على كل رمز، بما في ذلك الرموز التي يستهلكها في التفكير قبل أن يجيب. وعند الحجم الكبير، يكون المقيّم الذي تملكه بالفعل هو الأداة الأرخص — فالتكلفة هي GPU والهندسة، وليس الاستدعاء.
كذلك لا يتوفّر Gemma 4 12B Unified في فهرسنا؛ فإن أردته فعليك تنزيل 11.96 مليار معامل بصيغة BF16 وتشغيله بنفسك. أما المواضع التي يضم فيها فهرسنا مسارات حقيقية لـ Gemma 4 فهي الحجمين الآخرين، وهما رخيصان: Gemma 4 26B A4B بسعر 0.06 دولار لكل مليون رمز إدخال و0.33 دولار لكل مليون رمز إخراج، وGemma 4 31B بسعر 0.13 و0.38، وكلاهما مُدرَج بسياقات تبلغ 262,144 رمزًا ووقت الوصول إلى أول رمز الذي يُظهره الفهرس عند 1.73 ثانية. وإذا تبيّن أن مشكلتك تتعلق بالاستدلال العام لا بقرار من مجموعة مغلقة، فهذا هو ما ينبغي مقارنته بمُقيِّم يعمل محليًا — نموذجان إضافيان على مفتاح واحد، وقائمة المزوّدين تُمرَّر دون أي هامش، والتحويل التلقائي عند الفشل بحيث لا يصبح نموذج لا تزال تقيّمه نقطة فشل وحيدة في مسار الإنتاج.

لوحة النتائج، مع التحفظات المرفقة
• المعاملات — Intern-Decision-2B 2,213,241,664 في BF16 بالإضافة إلى برج رؤية ومُسقط؛ Gemma 4 12B Unified 11,959,730,224 في BF16.
• السياق — 8,192 رمزًا، مرفوضة فوق ذلك، مقابل 256,000 رمز.
• الإخراج — احتمالات معايرة وقيمة argmax، بدون نص؛ نص مُولَّد، رمز واحد في كل مرة.
• الوسائط — نص مع ما يصل إلى ثماني صور مقابل نص وصورة وصوت وفيديو كمدخل، ونص كمخرج.
• أدلة منشورة — جدول صادر عن المورّد يضم سبع مجموعات، بمتوسط 84.68، ودرجة براير 0.437، وECE 0.100، لم يُعِد إنتاجه أحد خارج المختبر؛ وبطاقة تقييم من Google تتضمن MMLU Pro 77.2%، وGPQA Diamond 78.8%، وAIME 2026 بدون أدوات 77.5%، وLiveCodeBench v6 72.0، بالإضافة إلى إدراج مستقل عند 14.2 على Artificial Analysis Intelligence Index.
• الاعتماد — إعجاب واحد وصفر تنزيلات على نقطة التحقق 2B مقابل عائلة متداولة منذ مايو، مع تكميمات ونسخ مُضبّطة بدقة ومشتقات يبلغ عددها المئات.
اقرأ صفوف الأدلة بشكل غير متماثل، لأن هذا ما هي عليه. أرقام Google تم فهرستها وإعادة إنتاجها بشكل مستقل من قبل أطراف ثالثة؛ أما أرقام InternLM فلم يتم تشغيلها من قبل أي شخص خارج المختبر، ويجب التعامل مع رقم المعايرة على وجه الخصوص كنية موثقة جيدًا حتى يخضع لمجموعة اختبار أجنبية. الملخص الصادق ليس أن جدول المورد خاطئ. بل إن العمودين لا يحملان نفس الوزن الإثباتي، والمقارنة التي تطبع 84.68 بجانب 77.2 دون قول ذلك تضلل قارئها.

ماذا نفعل بهذا؟
اختر Intern-Decision-2B عندما يكون القرار مغلقًا فعليًا، وتتسع الحالة بأريحية داخل ثمانية آلاف توكن، وتريد احتمالًا يمكنك تطبيق عتبة عليه بدلًا من فقرة عليك تحليلها، وتملك العتاد والرغبة لتشغيل نقطة حفظ لا يدعمها أحد بعد. الحجم الأوسط تحديدًا يحمل أضعف معايرة منشورة بين الثلاثة التي أصدرتها InternLM — ECE 0.100 مقابل 0.066 للنموذج الذي بنصف حجمه و0.065 للذي يقارب ضعف حجمه — لذا إذا كنت تختار ضمن هذه العائلة، فإن 2B هو الذي تضبط عليه درجة حرارتك الخاصة، وليس الذي تثق به جاهزًا دون تعديل.
اختر Gemma 4 12B — أو عمليًا أكثر، أحد مقاسي Gemma 4 اللذين نوجّه إليهما فعليًا — عندما يكون الإدخال أطول من صفحة، أو عندما يتعلق الأمر بالصوت أو الفيديو أو بلغة غير الإنجليزية، أو عندما يجب شرح الإجابة بدل مجرد اختيارها، أو عندما لا ترغب في امتلاك حزمة الاستدلال. يُعد 12B أصغر نماذج Gemma 4 ذات الصوت الأصلي؛ أما 26B A4B فينشّط نحو أربعة مليارات معامل لكل رمز، وهو أرخص طريقة للدخول إلى العائلة.
وإذا كان ما لديك فعليًا هو مشكلة تقييم مصحوبة بمستند طويل، فلا أيٌّ من هذين هو الأداة الصحيحة: تلك مشكلة استرجاع ترتدي ثياب مقال مقارنة.

