بطاقة عنوان مُولَّدة لـ Microsoft-Decision-1 مقابل Gemma 4 12B، بعنوان فرعي: "مُسجِّل نقاط بلا رموز إخراج مقابل كاتب بلا مجموعة مغلقة"، مع شرائح تقرأ الاحتمالات مقابل النثر، وسياق من 32,768 رمزًا مقابل 256,000، ونص فقط مقابل نص وصورة وصوت وفيديو، وواجهة برمجية مستضافة مقابل أوزان مفتوحة.
Guides & Insights

Microsoft-Decision-1 مقابل Gemma 4 12B: أحدهما يختار من قائمتك، والآخر يكتب لك واحدة جديدة

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع Microsoft-Decision-1 و Gemma 4 12B جنبًا إلى جنب، والفرق الذي يحسم كل شيء ليس الحجم أو الدقة أو الترخيص — بل ما يحدث بعد أن يقرأ النموذج مدخلاتك. Gemma 4 12B، النموذج متعدد الوسائط الخالي من المشفر الذي طورته DeepMind بـ 11.96 مليار معلمة، والذي صدر في 3 يونيو 2026 بموجب Apache 2.0، يقرأ النصوص والصور والصوت أو الفيديو ثم يكتب لك إجابة، رمزًا تلو الآخر، عبر نافذة من 256,000 رمز وأكثر من 140 لغة. أصبح Microsoft-Decision-1 متاحًا بشكل عام على Microsoft Foundry في 8 أكتوبر 2026 كمُقيِّم نصي فقط تم تدريبه لاحقًا على Qwen3.5-9B: أنت تسلمه حالة وسؤالًا سبق أن حصرت إجاباته، فيعيد لك احتمالًا معايرًا لكل خيار في تمريرة واحدة على ما يصل إلى 32,768 رمزًا، دون أن يولّد شيئًا. أحد النموذجين يخبرك أي خياراتك صحيحة. والآخر يخبرك ماذا كان ينبغي أن تكون الخيارات — ويحاسبك على كل كلمة من ذلك.

وضع هذا في إطار منافسة سيكون خطأً في التصنيف، ويجدر قول ذلك قبل سطور المواصفات لا بعدها. هذان ليسا بديلين؛ إنهما يقعان عند طرفين متقابلين من سير العمل. والسؤال المفيد هو أي طرف تبني في الواقع، لأن الإجابة تحدد ما إذا كنت تشتري قاضياً أم كاتباً.

الفاتورة هي النقطة التي يتوقف عندها الاختلاف عن كونه فلسفيًا.

يُحتسب سعر Gemma 4 12B بالطريقة نفسها التي يُحتسب بها سعر أي نموذج توليدي: رموز الإدخال ورموز الإخراج، معًا. وعندما تطلب منه JSON منظّمًا، يُولَّد كل حرف من حروف ذلك JSON ويُنتقى بالمعاينة ويُدفع ثمنه — وكلما زاد تداخل المخطط الخاص بك، طال الرد وكبر ذلك البند. وهذا ليس عيبًا في النموذج. بل هو ما يفعله مفكّك الترميز، وهو بالتحديد البند الذي وُجدت رؤوس القرار لحذفه.

ليس لدى Microsoft-Decision-1 جانب إخراج يمكن فوترته. فهو ينفذ تمريرة أمامية واحدة على حالتك وسؤالك ومجموعة خياراتك، ويقرأ درجة لكل مرشح، ثم يعود. تتضاعف التبعات مع الحجم لا مع حجم المطالبة: خط معالجة يوسم عشرة آلاف سجل باستخدام Gemma 4 12B ينتج عشرة آلاف مستند JSON، في حين ينتج الخط نفسه عند تشغيله على مُقيّم قرار عشرة آلاف مطالبة ولا شيء آخر. وما إذا كان التوفير المطلق كبيرًا يتوقف بالكامل على حجمك وضخامة مخططك، وأي شخص لديه ميزانية لكل رمز يمكنه حسم الأمر في جدول بيانات. أما الاتجاه فليس محل نزاع.

هناك اختلاف ثانٍ أصغر: لا تنشر Microsoft سعرًا على صفحة طراز Microsoft-Decision-1. تُحيل روابط التسعير إلى واجهة التسعير الخاصة بـ Microsoft، لذا فإن التكلفة لكل قرار هي شيء تقرأه من Azure وليس من البطاقة. ما توضحه الصفحة هو أن 0% من الاستدعاء عبارة عن رموز إخراج، وأن الاستدلال بالدفعات معطّل — لا يمكنك توزيع تكلفة عملية تقييم جماعية عبر قناة دفعية كما قد تفعل مع نموذج توليدي.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

نفس المدخل، إجابتان مختلفتان

أعطِ كلا النموذجين تذكرة دعم عملاء وسؤالًا. يُرجع Microsoft-Decision-1 شيئًا مثل 0.83 لـ "الفوترة"، و0.11 لـ "التقني"، و0.04 لـ "الإلغاء"، و0.02 لـ "لا يمكن الجزم". لديك تصنيف قابل للتسمية، ورقم يمكنك مقارنته بعتبة، ومسار امتناع — وتوثّق Microsoft أن خيارًا على نمط "لا يمكن الجزم" مدعوم عندما تكون الأدلة المقدمة غير كافية، وهذا ما يجعل منطق التصعيد يعمل. ما لا تحصل عليه هو السبب.

أعطِ التذكرة إلى Gemma 4 12B وستحصل على فقرة. يمكنه التفكير في الطلب بتفكير قابل للتهيئة، واستدعاء الدوال، وقراءة فاتورة ممسوحة ضوئيًا مرفقة بالتذكرة، ونسخ البريد الصوتي المدبّس بها، والرد بلغة العميل نفسها. كل واحد من هذه الأمور هو شيء لا يستطيع Decision-1 فعله بأي دقة: سطح إدخاله نص لا غير، وهو غير مصمم صراحةً للإجابة على أسئلة مفتوحة أو المحادثة أو الترجمة أو التلخيص.

لا يُعد أيٌّ من مخرجات Gemma 4 12B احتمالًا. اطلب منه قرار توجيه مصحوبًا بثقة، وستحصل على نص نثري يحوي رقمًا، وهذا الرقم هو ما أنتجه المُعيِّن وليس softmax على مجموعة الخيارات التي زوّدته بها. إذا كانت عتبة لاحقة تعتمد على أن يعني ذلك الرقم شيئًا، فأنت أمام مشروع معايرة، لا أمام مُقيِّم.

ما إذا كان لسؤالك مجموعة مغلقة هو القرار كله

هذا هو الاختبار الذي ينبغي تطبيقه قبل أي شيء آخر، ويستغرق نحو عشر دقائق باستخدام سبورة بيضاء.

• إذا كانت إجابتك مستخرجة من قائمة يمكنك تعدادها مسبقًا — تصنيف، أو تقييم، أو نعم/لا، أو درجة وفق معايير، أو مسار — فإن Microsoft-Decision-1 هو الأداة الصحيحة، وGemma 4 12B طريقة مسرفة وأقل موثوقية للاختيار من تلك القائمة. ستكون تدفع لمُفكِّك ترميز مقابل تخمين رقم كنت قد حدّدت حدوده بالفعل.

• إذا لم تكن إجابتك مجموعة مغلقة — لخّص هذا، واشرح ذاك، واكتب الرد، وصِف المخطط — فلا يمكن لـ Microsoft-Decision-1 أن يساعد بأي ثمن. ليس لديه مسار إلى النثر، ولا حقل تعليل، ولا آلية لإنتاج أي شيء لم تدرجه كخيار.

• إذا كان الأمر مزيجًا من الاثنين، فلديك خط أنابيب من نموذجين بدلًا من خيار واحد، ويصبح سؤال التصميم المثير للاهتمام هو أيّهما يملك عتبة التصعيد. يحددها المُقيِّم؛ ويملأ الكاتب ما يحدث فوقها وتحتها.

حيث تُعدّ Gemma 4 12B ببساطة لعبة مختلفة

خارج إطار القرار، لا يتقدّم Gemma 4 12B على أي خط — بل يلعب لعبة مختلفة، والتظاهر بغير ذلك سيكون مخادعاً.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• الوسائط — Microsoft-Decision-1 نصي فقط كمدخل ورقمي كمخرج. أما Gemma 4 12B فيستقبل النص والصورة والصوت والفيديو أصلاً عبر تصميم بلا مُرمِّز يُسقط الرقع الخام والموجات مباشرة في فضاء التضمين، مع إدخال متشابك بأي ترتيب.

• السياق — 32,768 رمزًا لـ Microsoft-Decision-1 مقابل 256,000 لـ Gemma 4 12B، الذي يسجل 43.4% في MRCR v2 eight-needle عند 128k على بطاقة Google الخاصة.

• اللغة — 25 لغة مدعومة لـ Microsoft-Decision-1، مع تحذير Microsoft من أن التغطية والجودة والمعايرة "قد تتفاوت حسب اللغة" وتسمية اللغات غير الإنجليزية ذات الموارد المحدودة كنقطة ضعف؛ أكثر من 140 لـ Gemma 4 12B، مع قيمة MMMLU مُقيَّمة تبلغ 83.4 لهذا الحجم.

• الأداء المنشور — يحمل تبويب Benchmarks الخاص بـ Microsoft-Decision-1 منهجيةً دون أي أرقام؛ بينما تنشر Google نسبًا لـ Gemma 4 12B تبلغ 77.2% في MMLU Pro، و77.5% في AIME 2026 بدون أدوات، و72.0% في LiveCodeBench v6، و78.8% في GPQA Diamond، و69.1% في MMMU Pro، و79.7% في MATH-Vision.

• التوزيع — Microsoft-Decision-1 واجهة برمجة تطبيقات مستضافة ضمن Foundry فقط، بلا أوزان، ولا تنزيل، ولا مسار للضبط الدقيق. Gemma 4 12B أوزان بترخيص Apache 2.0 أُتيحت ضمن منظومة يوم الإطلاق من LM Studio وOllama وllama.cpp وMLX وvLLM وSGLang وUnsloth.

• وقت التشغيل — تقييم القرار هو تمريرة واحدة بدون حلقة فك ترميز، لذا يتناسب زمن الاستجابة مع الطلب بدلاً من طول الإجابة؛ Gemma 4 12B يُولّد رمزاً تلو الآخر، وتضعه مواد إطلاق Google عند 16 جيجابايت من الذاكرة الموحدة.

صف المعايير القياسية هو الجدير بالتوقف عنده، في الاتجاه الذي يمنح مايكروسوفت أقل قدر من الإطراء. أرقام Gemma 4 12B مُعلَنة من المورّد هي الأخرى — لكن خلفها شهور من الاستخدام من طرف ثالث، في أدوات تقييم عامة، وعلى أجهزة يملكها آخرون. أما مشاركة مايكروسوفت في هذه الفئة فهي الأحدث والأقل قابلية للتحقق من بين الاثنتين، رغم أنها تأتي من الشركة الأكبر.

كم يكلفك الاتصال بكل منها فعليًا

Gemma 4 12B بنسخته 12B ليس مدرجًا في كتالوجنا — إذا كان هذا هو الحجم الذي تريده، فعليك جلب 11.96 مليار معامل بصيغة BF16 وتشغيله بنفسك. ما يتضمنه كتالوجنا فعلًا هو بقية سلسلة Gemma 4، وهي غير مكلفة: Gemma 4 26B A4B بسعر 0.06 دولار لكل مليون رمز إدخال و0.33 دولار لكل مليون رمز إخراج، وGemma 4 31B بسعر 0.13 و0.38، وكلاهما مدرج بنوافذ سياق تبلغ 262,144 رمزًا. هذه هي أسعار القوائم من المورّد تُمرَّر كما هي دون إضافة أي هامش من جانبنا، خلف مفتاح واحد متوافق مع OpenAI إلى جانب أكثر من 200 طراز آخر. إذا تبيّن أن مشكلتك تتعلق بالاستدلال العام بدلًا من قرار محدّد المجموعة، فأحد هذين الحجمين هو الخيار الرخيص للقياس مقابل مُقيِّم تشغّله بنفسك — وإذا كنت تفضّل ألّا تلتزم بكاتب واحد، فإن التحويل التلقائي عند الفشل يُبقي مرحلة التوليد في حلقة التقييم حيّة عندما يتدهور أحد المزوّدين.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 هو نشر Foundry تقوم بتوفيره بنفسك، وهو غير متاح من خلالنا. لا شيء في هذه المقالة يُعد ادعاءً بتوفره، على أيٍّ من طرفي الاستدعاء.

الخلاصة

أصبح Microsoft-Decision-1 متاحًا بشكل عام على Microsoft Foundry في 8 أكتوبر 2026: مُقيِّم نصي فقط بـ32,768 رمزًا، على أساس Qwen3.5-9B، يعيد احتمالات معايَرة على الخيارات التي تُعدِّدها، مع صفر رموز إخراج، ودون أوزان ودون أرقام معيارية منشورة. Gemma 4 12B هو نموذج عام متعدد الوسائط خالٍ من المُشفِّر بحجم 11.96B صدر في 2026 بموجب Apache 2.0، ويفكّر ويقرأ الصور والصوت ويكتب عبر 256,000 رمز. اختر بحسب شكل إجابتك، لا بحسب أعداد المعلمات: المجموعة المغلقة تنتمي إلى المُقيِّم، والمفتوحة تنتمي إلى الكاتب، ودفع تكلفة نموذج مُفكِّك لاختيار عنصر من قائمة كتبتها بالفعل هو الطريقة الأكثر شيوعًا التي تنفق بها الفرق عشرة أضعاف ما يكلفه قرار.

ما يحمله كتالوجنا بالفعل هو بقية سلسلة Gemma 4، وهي غير مكلفة: Gemma 4 26B A4B بسعر $0.06 لكل مليون توكن إدخال و$0.33 لكل مليون توكن إخراج، وGemma 4 31B بسعر $0.13 و$0.38.