بطاقة عنوان رئيسية بعنوان «Liquid AI d1-3B مقابل Gemma 4 12B» وعنوان فرعي «نموذج قرار مقابل نموذج عام»، تعرض بطاقة قائمة تحقق صغيرة بسعة 3.12B مع شريحة احتمالية إلى جانب بطاقة أكبر بسعة 11.96B تحمل أيقونات مستند وموجة صوتية وإطار فيلم وشريحة إجابة مكتوبة.
Guides & Insights

Liquid AI d1-3B مقابل Gemma 4 12B: نموذج قرار في مواجهة نموذج عام

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أسرع طريقة لإفساد هذه المقارنة هي وضع Liquid AI d1-3B وGe​mma 4 12B على الاختبار المعياري نفسه وانتظار فائز. فهما لا يجيبان عن السؤال نفسه. إن Liquid AI d1-3B نموذج قرار بحجم 3.12 مليار معلمة نُشر بأوزان مفتوحة في 7 أكتوبر 2026: تعطيه حالة ومجموعة أسئلة مسمّاة فيعيد احتمالات وتسمية مختارة ودرجة ثقة، بصفر توكنات مخرجة وبدون خطوة توليد. أما Ge​mma 4 12B فهو نموذج Goo​gle العام الخالي من مُشفّر والقادر على التعامل من أي مدخل إلى أي مخرج، نقطة حفظ بحجم 11.96 مليار معلمة تستقبل النص والصورة والصوت والفيديو وتكتب إجابة عبر نافذة سياقية من 256,000 توكن وبأكثر من 140 لغة. أحدهما يخبرك أيًّا من أربعة أشياء تكون لوحة الدوائر. والآخر يخبرك لماذا. قارنهما على الجودة وحدها فلن تتعلم شيئًا، لأن المخرجات غير قابلة للمقارنة — ولم يجرِ المورّدان أي اختبار معياري يقارن أحدهما بالآخر قط. قارنهما من حيث ما يعيده الاستدعاء فعليًا، وما يكلّفه، وأين ينفد الطريق أمام كل منهما، فيصبح الاقتران اختبارًا حدوديًا مفيدًا حقًا.

عقدان مختلفان للمخرجات

الفرق الذي يقوم بكل العمل هنا هو ما يعود على السلك.

Liquid AI d1-3B يعيد كائن إجابة مُهيكل. كل سؤال في الطلب يُعلن نوعًا — noul لنعم/لا مع P(yes)، choice لخيار واحد من مجموعة خيارات مُسمّاة مع ثقة واحتمال لكل خيار، أو score لموضع على مقياس مرتّب من مستويين إلى عشرة مستويات مع المستوى المتوقع وتوزيعه. يُبلغ النموذج عن output_tokens: 0 لأنه لا يُكتب شيء. تُقرأ عدة أسئلة حول حالة واحدة من تمريرة أمامية واحدة، وتُرمّز الحالة وصورها مرة واحدة لجميعها.

Gemma 4 12Bيُعيد نصًا نثريًا. أحيانًا يُعيد JSON الذي طلبته، وأحيانًا يُعيد JSON لم تطلبه بالضبط، ويمكنه أن يستنتج قبل أن يجيب. إنه نموذج لغوي أولًا: أي شيء يعرف كيف يصنّفه، يعبّر عنه كنص. وهذا مصدر قوة عندما يجب شرح الإجابة لإنسان أو تغذيتها إلى خطوة لاحقة تتوقع لغة، وتكلفة عندما يكون الشيء الوحيد الذي تحتاجه هو احتمال.

كل ما يأتي لاحقًا يترتب على ذلك. لا يمكن أن يفشل تحليل استجابة d1-3B. كما أنها لا تستطيع أن تشرح نفسها، وتقول بطاقة النموذج ذلك صراحةً: فهو ليس نموذج محادثة ولا يكتب نصًا.

أين تقف مسارات الأدلة

إن مصدر مجموعتي الأرقام ليس متكافئًا، وهذا أمر يهم هنا أكثر مما تهم الأرقام نفسها.

• Decision Index 0.2.1 — يسجّل Liquid AI d1-3B نتيجة 48.57، وقد قيّمه المورّد باستخدام المُقيّم الرسمي، ليكون الأول بين النماذج التي تقل عن 10B ومتقدّمًا على Decider 35B-A3B بنتيجة 47.11. لم يُقيَّم Ge​mma 4 12B على Decision Index على الإطلاق، لذا لا يوجد نظير لهذا الصف.

• اختبارات الاستدلال — يسجّل Gemma 4 12B نتيجة 77.5 في AIME 2026، و78.8 في GPQA Diamond، و1,659 نقطة في تصنيف Codeforces ELO، ويحمل مؤشر Artificial Analysis Intelligence Index بقيمة 22 في وضع الاستدلال و13 مع إيقاف الاستدلال. لا يملك Liquid AI d1-3B أي اختبار استدلال، لأن نموذج القرار لا ينتج أثر استدلال يمكن تقييمه.

• سياق طويل — يستوعب Gemma 4 12B عدد 256,000 رمز ويحقق 43.4% في MRCR v2 eight-needle عند 128k على بطاقة Google الخاصة. يستوعب Liquid AI d1-3B عدد 32,768 رمز. إذا كانت "حالتك" عبارة عن مستند من أربعين صفحة بالإضافة إلى مسحات ضوئية، فإن هذه الفجوة هي القرار بأكمله وهي ليست متقاربة.

• الرؤية — يبلغ متوسط Liquid AI d1-3B نحو 74.1 عبر أحد عشر اختبارًا معياريًا عامًا للصور، تُقرأ كقرارات على مجموعة خيارات كل اختبار، مقابل 73.9 للنموذج الأساسي LFM2.5-VL-3B الذي بُني منه، وتفيد الجهة المورّدة بأن إزالة الصور تُخفض الأسئلة نفسها إلى 45.1. ورؤية Ge​mma 4 12B أقوى وأوسع، لكنها يُبلَّغ عنها كجودة توليد، لا كدقة قرار على خيارات مسمّاة.

• اللغات — ست عشرة لغة موثقة لـ Liquid AI d1-3B؛ وأكثر من 140 لـ Gemma 4 12B.

• السرعة — يجيب Liquid AI d1-3B عن سؤال واحد خلال 8 ms على RTX 4090، و16 ms على Jetson AGX Thor، و26 ms على Jetson AGX Orin 64 GB، و50 ms على Jetson Orin Nano، ويحزم 64 حالة في تمريرة واحدة بمعدل 475 في الثانية على 4090. أما Ge​mma 4 12B فيولّد، لذا فإن زمن استجابته دالة لعدد الرموز التي يكتبها.

• جودة الأدلة — نتائج Gemma 4 12B هي نتائج Google، نُشرت في يونيو 2026، ومنذ ذلك الحين خضعت للفحص والتدقيق والتكميم وإعادة التشغيل من قِبَل مجتمع كبير. أما نتائج Liquid AI d1-3B فهي نتائج Liquid، نُشرت قبل يومين، ولم يكرّرها أحد خارج المختبر. اقرأ العمود الثاني على هذا الأساس.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

المكان الوحيد الذي يتنافسون فيه حقًا

هناك تداخل حقيقي، وهو ليس على لوحة الصدارة. إنه استدعاء LLM-as-a-judge.

تستخدم كثير من خطوط الإنتاج بالفعل نموذجًا عامًا متوسط الحجم كطبقة تقييم: أن يسجّل درجة إلحاح هذه التذكرة، وأن يقرر ما إذا كان هذا المخرَج يستوفي معيار تقييم، وأن يختار الأداة التي ينبغي أن يستدعيها الوكيل تاليًا، وأن يتحقق مما إذا كانت فقرة مسترجَعة تجيب عن السؤال. اليوم يذهب معظم ذلك إلى نموذج توليدي يُطلب منه إخراج رقم أو تصنيف كنص، والرقم الذي يُخرجه هو ما أنتجه المُعاين لا softmax على مجموعة خياراتك. هذا هو سير العمل الذي دُرِّب Liquid AI d1-3B تدريبًا لاحقًا ليحل محله، والعروض التوضيحية المنشورة كلها نسخ منه — شرط SQL يُجيب بنعم أو لا عن 150 تذكرة دعم، وحلقة ضغط سياق الوكيل التي تُبقي كل مخرَج أداة أو تقلّمه أو تُسقطه وتزيل 52% من الرموز، وتطبيق فحص بصري فرز الأجزاء السليمة والمعيبة من خطوط الإنتاج بدقة تتراوح بين 85 و97% في مهمة لم يُدرَّب عليها قط.

يؤدي Gemma 4 12B كل هذه المهام، بل ويفعل أكثر منها. يمكنه أيضًا كتابة الملخص، والإبقاء على مستند بحجم 256K في العرض، وتلقّي مكالمة هاتفية مسجّلة كمدخل، والإجابة بأكثر من 140 لغة. إذا كان خط أنابيبك بحاجة إلى تقييم وسرد، فإن 12B يؤدي مهمتين بنداء واحد، ونموذج القرار 3B يؤدي إحداهما.

الحد الفاصل هو طول السياق وشكل المخرجات. حالة طويلة، مدخلات منطوقة، لغات كثيرة، أو شرح يتوقعه القارئ — Ge​mma 4 12B، بلا منافس. حالة قصيرة، مجموعة خيارات ثابتة، ميزانية زمن استجابة لكل طلب بالمللي ثانية ذات الرقم الواحد، أو ضمان صارم بأن الإجابة ستُحلَّل — هذا هو عمود d1-3B، والنموذج العام يدفع مقابل قدرة لن تستخدمها.

كم يكلف الاتصال بكل واحد

لا يوجد أي من النموذجين في كتالوجنا، لذا لا يوجد سعر توجيه نقدّمه لأيّ منهما — فـ Ge​mma 4 12B ليس ضمن أحجام Ge​mma التي نوفّرها، وLiquid AI d1-3B أوزان مفتوحة يمكنك استضافتها بنفسك أو الوصول إليها عبر واجهة API الخاصة بالمورّد نفسه ومنصات طرف ثالث. وللسياق على الجانب المجاور لـ Gemini من تلك العائلة، فإن حجمَي Ge​mma 4 اللذين نوجّههما فعلاً مدرجان بسعر $0.06 لكل مليون رمز إدخال و$0.33 لكل مليون رمز إخراج لـ Ge​mma 4 26B A4B، و$0.13 و$0.38 لـ Ge​mma 4 31B، وكلاهما بسياقات تبلغ 262,144 رمزًا، وبإدخال نص وصورة وفيديو. ويقارب متوسط تسعير المزوّدين المذكور لـ Ge​mma 4 12B في أماكن أخرى $0.10 و$0.30.

نسخة Liquid المستضافة d1 لا تحاسب إلا على رموز الإدخال، بسعر 0.04 دولار لكل مليون، مع احتساب الصور كإدخال بواقع 1.5 رمز لكل رقعة بحجم 32×32 بكسل. ولذلك لا يحتوي طلب القرار على أي بند لرموز الإخراج إطلاقًا، وهذا هو السبب البنيوي وراء وصول مقارنة التكلفة التي يجريها المورّد بنفسه مقابل نماذج أكبر بكثير إلى النتيجة التي وصلت إليها. لا يوجد للأوزان المفتوحة سعر لكل استدعاء؛ بل تدفع الثمن في العتاد. ويجب أن يقع كلاهما في خط الأنابيب نفسه الذي يمر به كل شيء آخر تستدعيه، وهي الطبقة التي وُجد الموجّه من أجلها — واجهة API واحدة عبر 200+، قائمة المزوّدين تُمرَّر بهامش ربح 0%، والتبديل التلقائي عند الفشل حتى لا يتحول خلل عابر واحد في المنبع إلى انقطاع الخدمة لديك. تلك هي التوصيلات المحيطة بالمقارنة، وليست المقارنة نفسها.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

كيف تقرر، بصراحة

ابدأ من تنسيق الإجابة بدلاً من النموذج. إذا كان بإمكان النظام اللاحق استهلاك احتمال، وتسمية، وثقة، وكانت مجموعة الإجابات صغيرة ومعروفة، فإن Liquid AI d1-3B ليس تخفيضًا من 12B — بل هو أداة مختلفة، وأرقام الكمون تجعله نشرًا مختلفًا فئويًا: 50 مللي ثانية على Jetson Orin Nano هو جهاز لا ينبغي له تشغيل 12B على الإطلاق.

إذا كان يجب أن تكون الإجابة جملة، أو كانت الحالة أطول من اثنين وثلاثين ألف رمز، أو كان شخص ما سينطقه، أو كانت لغة الإخراج هي البنغالية، فإن Ge​mma 4 12B هو الوحيد من بين الاثنين القادر على أداء المهمة، وتنتهي المقارنة قبل أن تبدأ.

الموضع المفيد حقًا لمعظم الفرق هو كليهما، في موضعين مختلفين. نموذج قرار أمام الاستدعاء المكلف، يقوم بالفرز والتوجيه وفحوصات الضوابط التي لا تحتاج إلى لغة؛ ونموذج عام خلفه للعمل الذي يحتاج إليها. هذان هما خط الأنابيب نفسه، أحدهما مرشّح والآخر الحمولة — والفرق التي ستستفيد أكثر ما يمكن من إصدار d1 هي تلك التي تدفع بالفعل مقابل 12B للإجابة بنعم أو لا.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.