
Liquid AI d1-3B مقابل Gemma 4 12B: نموذج قرار في مواجهة نموذج عام
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
أسرع طريقة لإفساد هذه المقارنة هي وضع Liquid AI d1-3B وGemma 4 12B على الاختبار المعياري نفسه وانتظار فائز. فهما لا يجيبان عن السؤال نفسه. إن Liquid AI d1-3B نموذج قرار بحجم 3.12 مليار معلمة نُشر بأوزان مفتوحة في 7 أكتوبر 2026: تعطيه حالة ومجموعة أسئلة مسمّاة فيعيد احتمالات وتسمية مختارة ودرجة ثقة، بصفر توكنات مخرجة وبدون خطوة توليد. أما Gemma 4 12B فهو نموذج Google العام الخالي من مُشفّر والقادر على التعامل من أي مدخل إلى أي مخرج، نقطة حفظ بحجم 11.96 مليار معلمة تستقبل النص والصورة والصوت والفيديو وتكتب إجابة عبر نافذة سياقية من 256,000 توكن وبأكثر من 140 لغة. أحدهما يخبرك أيًّا من أربعة أشياء تكون لوحة الدوائر. والآخر يخبرك لماذا. قارنهما على الجودة وحدها فلن تتعلم شيئًا، لأن المخرجات غير قابلة للمقارنة — ولم يجرِ المورّدان أي اختبار معياري يقارن أحدهما بالآخر قط. قارنهما من حيث ما يعيده الاستدعاء فعليًا، وما يكلّفه، وأين ينفد الطريق أمام كل منهما، فيصبح الاقتران اختبارًا حدوديًا مفيدًا حقًا.
عقدان مختلفان للمخرجات
الفرق الذي يقوم بكل العمل هنا هو ما يعود على السلك.
Liquid AI d1-3B يعيد كائن إجابة مُهيكل. كل سؤال في الطلب يُعلن نوعًا — noul لنعم/لا مع P(yes)، choice لخيار واحد من مجموعة خيارات مُسمّاة مع ثقة واحتمال لكل خيار، أو score لموضع على مقياس مرتّب من مستويين إلى عشرة مستويات مع المستوى المتوقع وتوزيعه. يُبلغ النموذج عن output_tokens: 0 لأنه لا يُكتب شيء. تُقرأ عدة أسئلة حول حالة واحدة من تمريرة أمامية واحدة، وتُرمّز الحالة وصورها مرة واحدة لجميعها.
Gemma 4 12Bيُعيد نصًا نثريًا. أحيانًا يُعيد JSON الذي طلبته، وأحيانًا يُعيد JSON لم تطلبه بالضبط، ويمكنه أن يستنتج قبل أن يجيب. إنه نموذج لغوي أولًا: أي شيء يعرف كيف يصنّفه، يعبّر عنه كنص. وهذا مصدر قوة عندما يجب شرح الإجابة لإنسان أو تغذيتها إلى خطوة لاحقة تتوقع لغة، وتكلفة عندما يكون الشيء الوحيد الذي تحتاجه هو احتمال.
كل ما يأتي لاحقًا يترتب على ذلك. لا يمكن أن يفشل تحليل استجابة d1-3B. كما أنها لا تستطيع أن تشرح نفسها، وتقول بطاقة النموذج ذلك صراحةً: فهو ليس نموذج محادثة ولا يكتب نصًا.
أين تقف مسارات الأدلة
إن مصدر مجموعتي الأرقام ليس متكافئًا، وهذا أمر يهم هنا أكثر مما تهم الأرقام نفسها.
• Decision Index 0.2.1 — يسجّل Liquid AI d1-3B نتيجة 48.57، وقد قيّمه المورّد باستخدام المُقيّم الرسمي، ليكون الأول بين النماذج التي تقل عن 10B ومتقدّمًا على Decider 35B-A3B بنتيجة 47.11. لم يُقيَّم Gemma 4 12B على Decision Index على الإطلاق، لذا لا يوجد نظير لهذا الصف.
• اختبارات الاستدلال — يسجّل Gemma 4 12B نتيجة 77.5 في AIME 2026، و78.8 في GPQA Diamond، و1,659 نقطة في تصنيف Codeforces ELO، ويحمل مؤشر Artificial Analysis Intelligence Index بقيمة 22 في وضع الاستدلال و13 مع إيقاف الاستدلال. لا يملك Liquid AI d1-3B أي اختبار استدلال، لأن نموذج القرار لا ينتج أثر استدلال يمكن تقييمه.
• سياق طويل — يستوعب Gemma 4 12B عدد 256,000 رمز ويحقق 43.4% في MRCR v2 eight-needle عند 128k على بطاقة Google الخاصة. يستوعب Liquid AI d1-3B عدد 32,768 رمز. إذا كانت "حالتك" عبارة عن مستند من أربعين صفحة بالإضافة إلى مسحات ضوئية، فإن هذه الفجوة هي القرار بأكمله وهي ليست متقاربة.
• الرؤية — يبلغ متوسط Liquid AI d1-3B نحو 74.1 عبر أحد عشر اختبارًا معياريًا عامًا للصور، تُقرأ كقرارات على مجموعة خيارات كل اختبار، مقابل 73.9 للنموذج الأساسي LFM2.5-VL-3B الذي بُني منه، وتفيد الجهة المورّدة بأن إزالة الصور تُخفض الأسئلة نفسها إلى 45.1. ورؤية Gemma 4 12B أقوى وأوسع، لكنها يُبلَّغ عنها كجودة توليد، لا كدقة قرار على خيارات مسمّاة.
• اللغات — ست عشرة لغة موثقة لـ Liquid AI d1-3B؛ وأكثر من 140 لـ Gemma 4 12B.
• السرعة — يجيب Liquid AI d1-3B عن سؤال واحد خلال 8 ms على RTX 4090، و16 ms على Jetson AGX Thor، و26 ms على Jetson AGX Orin 64 GB، و50 ms على Jetson Orin Nano، ويحزم 64 حالة في تمريرة واحدة بمعدل 475 في الثانية على 4090. أما Gemma 4 12B فيولّد، لذا فإن زمن استجابته دالة لعدد الرموز التي يكتبها.
• جودة الأدلة — نتائج Gemma 4 12B هي نتائج Google، نُشرت في يونيو 2026، ومنذ ذلك الحين خضعت للفحص والتدقيق والتكميم وإعادة التشغيل من قِبَل مجتمع كبير. أما نتائج Liquid AI d1-3B فهي نتائج Liquid، نُشرت قبل يومين، ولم يكرّرها أحد خارج المختبر. اقرأ العمود الثاني على هذا الأساس.

المكان الوحيد الذي يتنافسون فيه حقًا
هناك تداخل حقيقي، وهو ليس على لوحة الصدارة. إنه استدعاء LLM-as-a-judge.
تستخدم كثير من خطوط الإنتاج بالفعل نموذجًا عامًا متوسط الحجم كطبقة تقييم: أن يسجّل درجة إلحاح هذه التذكرة، وأن يقرر ما إذا كان هذا المخرَج يستوفي معيار تقييم، وأن يختار الأداة التي ينبغي أن يستدعيها الوكيل تاليًا، وأن يتحقق مما إذا كانت فقرة مسترجَعة تجيب عن السؤال. اليوم يذهب معظم ذلك إلى نموذج توليدي يُطلب منه إخراج رقم أو تصنيف كنص، والرقم الذي يُخرجه هو ما أنتجه المُعاين لا softmax على مجموعة خياراتك. هذا هو سير العمل الذي دُرِّب Liquid AI d1-3B تدريبًا لاحقًا ليحل محله، والعروض التوضيحية المنشورة كلها نسخ منه — شرط SQL يُجيب بنعم أو لا عن 150 تذكرة دعم، وحلقة ضغط سياق الوكيل التي تُبقي كل مخرَج أداة أو تقلّمه أو تُسقطه وتزيل 52% من الرموز، وتطبيق فحص بصري فرز الأجزاء السليمة والمعيبة من خطوط الإنتاج بدقة تتراوح بين 85 و97% في مهمة لم يُدرَّب عليها قط.
يؤدي Gemma 4 12B كل هذه المهام، بل ويفعل أكثر منها. يمكنه أيضًا كتابة الملخص، والإبقاء على مستند بحجم 256K في العرض، وتلقّي مكالمة هاتفية مسجّلة كمدخل، والإجابة بأكثر من 140 لغة. إذا كان خط أنابيبك بحاجة إلى تقييم وسرد، فإن 12B يؤدي مهمتين بنداء واحد، ونموذج القرار 3B يؤدي إحداهما.
الحد الفاصل هو طول السياق وشكل المخرجات. حالة طويلة، مدخلات منطوقة، لغات كثيرة، أو شرح يتوقعه القارئ — Gemma 4 12B، بلا منافس. حالة قصيرة، مجموعة خيارات ثابتة، ميزانية زمن استجابة لكل طلب بالمللي ثانية ذات الرقم الواحد، أو ضمان صارم بأن الإجابة ستُحلَّل — هذا هو عمود d1-3B، والنموذج العام يدفع مقابل قدرة لن تستخدمها.
كم يكلف الاتصال بكل واحد
لا يوجد أي من النموذجين في كتالوجنا، لذا لا يوجد سعر توجيه نقدّمه لأيّ منهما — فـ Gemma 4 12B ليس ضمن أحجام Gemma التي نوفّرها، وLiquid AI d1-3B أوزان مفتوحة يمكنك استضافتها بنفسك أو الوصول إليها عبر واجهة API الخاصة بالمورّد نفسه ومنصات طرف ثالث. وللسياق على الجانب المجاور لـ Gemini من تلك العائلة، فإن حجمَي Gemma 4 اللذين نوجّههما فعلاً مدرجان بسعر $0.06 لكل مليون رمز إدخال و$0.33 لكل مليون رمز إخراج لـ Gemma 4 26B A4B، و$0.13 و$0.38 لـ Gemma 4 31B، وكلاهما بسياقات تبلغ 262,144 رمزًا، وبإدخال نص وصورة وفيديو. ويقارب متوسط تسعير المزوّدين المذكور لـ Gemma 4 12B في أماكن أخرى $0.10 و$0.30.
نسخة Liquid المستضافة d1 لا تحاسب إلا على رموز الإدخال، بسعر 0.04 دولار لكل مليون، مع احتساب الصور كإدخال بواقع 1.5 رمز لكل رقعة بحجم 32×32 بكسل. ولذلك لا يحتوي طلب القرار على أي بند لرموز الإخراج إطلاقًا، وهذا هو السبب البنيوي وراء وصول مقارنة التكلفة التي يجريها المورّد بنفسه مقابل نماذج أكبر بكثير إلى النتيجة التي وصلت إليها. لا يوجد للأوزان المفتوحة سعر لكل استدعاء؛ بل تدفع الثمن في العتاد. ويجب أن يقع كلاهما في خط الأنابيب نفسه الذي يمر به كل شيء آخر تستدعيه، وهي الطبقة التي وُجد الموجّه من أجلها — واجهة API واحدة عبر 200+، قائمة المزوّدين تُمرَّر بهامش ربح 0%، والتبديل التلقائي عند الفشل حتى لا يتحول خلل عابر واحد في المنبع إلى انقطاع الخدمة لديك. تلك هي التوصيلات المحيطة بالمقارنة، وليست المقارنة نفسها.

كيف تقرر، بصراحة
ابدأ من تنسيق الإجابة بدلاً من النموذج. إذا كان بإمكان النظام اللاحق استهلاك احتمال، وتسمية، وثقة، وكانت مجموعة الإجابات صغيرة ومعروفة، فإن Liquid AI d1-3B ليس تخفيضًا من 12B — بل هو أداة مختلفة، وأرقام الكمون تجعله نشرًا مختلفًا فئويًا: 50 مللي ثانية على Jetson Orin Nano هو جهاز لا ينبغي له تشغيل 12B على الإطلاق.
إذا كان يجب أن تكون الإجابة جملة، أو كانت الحالة أطول من اثنين وثلاثين ألف رمز، أو كان شخص ما سينطقه، أو كانت لغة الإخراج هي البنغالية، فإن Gemma 4 12B هو الوحيد من بين الاثنين القادر على أداء المهمة، وتنتهي المقارنة قبل أن تبدأ.
الموضع المفيد حقًا لمعظم الفرق هو كليهما، في موضعين مختلفين. نموذج قرار أمام الاستدعاء المكلف، يقوم بالفرز والتوجيه وفحوصات الضوابط التي لا تحتاج إلى لغة؛ ونموذج عام خلفه للعمل الذي يحتاج إليها. هذان هما خط الأنابيب نفسه، أحدهما مرشّح والآخر الحمولة — والفرق التي ستستفيد أكثر ما يمكن من إصدار d1 هي تلك التي تدفع بالفعل مقابل 12B للإجابة بنعم أو لا.

