
Liquid AI d1-3B مقابل Granite 4.2 3B: نموذجان بحجم 3B لا يؤديان المهمة نفسها أبدًا
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
ضع Liquid AI d1-3B و Granite 4.2 3B على نفس وحدة معالجة الرسوميات الواحدة وسيتسعان معًا بارتياح — 3.12B معلمة من جهة، و3B من الجهة الأخرى. وسيتصرفان أيضًا كما لو أنهما أتيا من تخصصين مختلفين. Granite 4.2 3B، الذي تؤرخه بطاقة النموذج الخاصة بـ IBM في 25 أغسطس 2026، هو نموذج استدلال: ثلاثة أنماط تفكير، و<think> كتلة، وإجابة تقرؤها. Liquid AI d1-3B، الذي رُفع إلى Hugging Face في 5 أكتوبر 2026 وأعلنت عنه Liquid بعد يومين، هو نموذج قرار: يأخذ حالة بالإضافة إلى مجموعة صريحة من أسئلة ذات أنواع ويعيد احتمالًا أو تصنيفًا أو موضعًا على مقياس في تمريرة أمامية واحدة، مُبلِغًا عن output_tokens: 0 لأنه لا يكتب أي شيء. السؤال المفيد ليس أيهما أفضل. بل أي من استدعاءاتك هو في الواقع قرار، لأن المستودعين مبنيان لنصفين متعاكسين من ذلك الانقسام.
ما الذي يوجد فعليًا في كل مستودع؟
كل ما يلي مستمد من بطاقتي النموذج ومن منشور الإعلان الخاص بـ Liquid. لم يُعَد إنتاج أي من هذا بشكل مستقل، ولم يُقيّم أي طرف ثالث أيًا من النموذجين على مجموعة الاختبار نفسها، والأرقام الواردة في البطاقتين هي أرقام البائعين أنفسهم.
• الحجم — Liquid AI d1-3B بإجمالي 3.12 مليار، مبني على LFM2.5-VL-3B من Liquid؛ Granite 4.2 3B هو محوّل كثيف أحادي المفكك بحجم 3 مليارات مبني على granite-4.1-3b-base
• الإخراج — يُعيد d1-3B الاحتمالات والتسميات ودرجات الثقة ولا يكتب أي نص على الإطلاق؛ يُولِّد Granite 4.2 3B رموزًا، بما في ذلك سلسلة تفكير اختيارية داخل <think>وسوم
• السياق — d1-3B 32,768 رمزًا؛ Granite 4.2 3B 128K أصلاً، مع امتداد للسياق الطويل إلى 512K على البطاقة
• المُدخل — نص d1-3B، أو JSON، أو صور، أو مزيج منها، عبر مُرمِّز الرؤية SigLIP2 NaFlex 400M؛ وللنص فقط Granite 4.2 3B
• الترخيص — d1-3B بموجب Liquid's LFM Open License v1.0؛ Granite 4.2 3B بموجب Apache 2.0
• اللغات — يُدرج d1-3B عدد 16؛ ويُدرج Granite 4.2 3B اثنتي عشرة لغة مختبرة، مع الإشارة في البطاقة إلى أن اللغات الأخرى غير مختبرة
• التقديم — يوفّر d1-3B تعليمات برمجية مخصصة (trust_remote_code=True، transformers>=5.14)، مع مستودعات GGUF وw8a8 في العائلة نفسها وبطاقات موثّقة لـ llama.cpp وOllama وLM Studio؛ يعمل Granite 4.2 3B تحت vLLM 0.20+ أو SGLang 0.5.18+ مع محلّل تفكير مخصص
سطران من تلك السطور يقومان بعمل أكثر من البقية. صف المخرجات هو حجة هذا المقال بأكملها، وصف الترخيص هو ذاك الذي لا يضعه أحد في جدول المقارنة.

أحدهما يكتب سلسلة من الأفكار، والآخر يرفض الكتابة
Granite 4.2 3B يبرّر وجوده بالتفكير بصوت عالٍ. توثّق بطاقته ثلاثة أوضاع: التفكير مفعّل افتراضيًا، وعدم التفكير، ووضع بجهد منخفض يحتفظ بأثر الاستدلال لكنه يختصره. تفصل حزم الخدمة أثر التفكير عن الإجابة النهائية بحيث يتلقى تطبيقك محتوى نظيفًا بالإضافة إلى حقل استدلال منفصل. هذا تصميم جيد لسؤال يحتاج إلى حلّ — مسألة رياضية، أو فرع من المنطق، أو قطعة كود يجب كتابتها قبل الحكم عليها.
لا يمتلك d1-3B هذا النمط، وتقول بطاقته ذلك بصراحة: "إنه ليس نموذج محادثة ولا يكتب نصًا." يُعلن الاستدعاء أسئلة ذات نوع. noul هو نعم/لا ويُرجع P(yes) بين 0 و1. choice يختار تسمية واحدة من مجموعة خيارات مُسمّاة ويُرجع التسمية، وثقة، واحتمالًا لكل خيار. score يضع الحالة على مقياس مرتّب من اثنين إلى عشرة ويُرجع المستوى المتوقع مع توزيعه ومفتاحه. تُقرأ الإشارة من الـ logits عند موضع عنصر نائب في تمريرة واحدة، لا بأخذ عينات رمزًا برمز، ولهذا يمكن لكتلة الاستخدام أن تُبلّغ عن صفر من رموز الإخراج من دون كذب.
هذا الفرق يغيّر فاتورتك قبل أن يغيّر دقتك. فاستدعاء تصنيف من Granite يفكّر في 400 رمز هو استدعاء تدفع مقابله 400 رمز إخراج، والوسم الذي أردته مدفون في نص نثري يتعيّن على محلّل أن يستخرجه بعد ذلك. أما استدعاء d1-3B فلا تُحتسب تكلفته إلا على الإدخال. وإذا كان معظم حركة المرور لديك مجرد وسم مرتبط بقاعدة، فأنت تدفع مقابل الاستدلال سواء غيّر الوسم أو لم يغيّره.
حيث يكون Granite 4.2 3B بوضوح هو الخيار الأفضل
خذ معايير الاستدلال على ظاهرها — فهي خاصة بـ IBM، وتُشغَّل عبر خط أنابيب داخلي لـ NeMo Evaluator، ولم يقم أي طرف خارجي بإعادة إنتاجها — ونموذج 3B قوي بشكل غير عادي بالنسبة لحجمه: AIME25 78.33، HMMT فبراير 2025 66.67، GPQA 54.80، LiveCodeBench v6 69.71، MMLU-Pro 67.84، IFBench 74.33، BFCL v4 52.41، tau3-bench 45.78، و RULER 64K 67.52 تنخفض إلى 55.30 عند 128K.
ينتج عن تلك القائمة أربع وظائف، وd1-3B ليس ضمن أي منها.
• سياق أصلي بسعة 128K، قابل للتوسعة إلى 512K، مقابل 32,768 رمزًا على d1-3B — إذا كانت حالتك مستندًا طويلًا، فالخيار محسوم لك
• استدعاء الأدوات الوكيلي مع مُحلِّل موثَّق وتكاملات أُطُر العمل لـ OpenCode وPi وOpenHands، وهو ما لا يملك نموذج القرار ما يعادله
• أي مهمة تكون إجابتها فقرة: التلخيص، والصياغة، والاستخراج إلى بنية حرة الشكل، وتوليد التعليمات البرمجية
• الضبط الدقيق وإعادة التوزيع دون حد أقصى للإيرادات، لأن Apache 2.0 لا يتضمن بندًا للحد الأدنى
لاحظ ما لايوجد على بطاقة Granite: صفّا SWE-Bench وTerminal-Bench مُعلَّمان بـ NA لنموذج 3B. طُبِّقت مرحلة التعلّم المعزّز الوكيلي من IBM على عضوي العائلة 8B و30B فقط، لذا لا يحمل أصغر نموذج الدرجات الوكيلية التي تحملها نظيراته الأكبر. أي فريق يقرأ "Granite 4.2" ويفترض أن نموذج 3B يرث الملف الوكيلي للعائلة سيُفاجأ.

حيث يفوز d1-3B قبل أن يُكمل Granite تفكيره
يُعد جدول الكمون الخاص بـ Liquid، المقيس وهو دافئ، طلبًا واحدًا في كل مرة، أقوى جزء في حجته: سؤال واحد خلال 8 مللي ثانية على RTX 4090 و9 مللي ثانية على AMD MI325X، و16 مللي ثانية على Jetson AGX Thor و26 مللي ثانية على Jetson AGX Orin 64GB، مع حزم 64 حالة في تمريرة واحدة بمعدل 475/ثانية على 4090 و1,106/ثانية على MI325X. وللمقارنة، هذا تقريبًا الوقت الذي يحتاجه Granite 4.2 3B لإصدار بضعة رموز من أثر استدلاله.
ثلاثة أنواع من الأسئلة على حالة واحدة تكلّف d1-3B 21 مللي ثانية على 4090 بدلًا من ثلاث استدعاءات منفصلة، لأن الحالة وصورها تُقرأ مرة واحدة لجميع الأسئلة. في منظومة إشراف أو توجيه كانت تُطلق طلب HTTP واحدًا لكل قاعدة، هذا هو الفرق بين قائمة انتظار من الاستدعاءات واستدعاء واحد.
إنه يرى أيضًا. يسجل d1-3B متوسطًا قدره 74.1 عبر أحد عشر معيارًا عامًا للصور، مقابل 73.9 لنموذجه الأساسي، وتشير بطاقة النموذج إلى أنه عند إزالة الصور تحصل الأسئلة نفسها على 45.1 — فالإجابات تأتي من الصورة، لا من التوجيه النصي. الصفوف الفردية تحمل وجهين (CV-Bench 82.1 مقابل 87.6 للنموذج الأساسي، وPOPE 88.5 مقابل 90.1)، لذا فإن ادعاء الرؤية هو «على مستوى النموذج الأساسي»، لا «أفضل منه».
الثقل الموازن الصادق: إن نتيجة d1-3B البالغة 48.57 على Decision Index 0.2.1 قد أنتجتها Liquid التي شغّلت المُقيّم الرسمي بنفسها بدلاً من تقديمها عبر لوحة المتصدرين، والصفوف المنافسة تأتي من لوحة المتصدرين العامة. كما أن متوسطها 77.1 عبر ثماني مهام معيارية كقرارات و71.8 على DecisionBench هما أيضًا من الطرف الأول. كل شيء في جانب d1 من هذه المقارنة غير مُتحقق منه.

لماذا لا يُعدّ نموذج استدلال بحجم 3B نموذج قرار بحجم 3B
الخطوة المغرية هي اعتبار Granite 4.2 3B بديلًا أرخص لـ d1-3B، أو العكس. كلاهما يفشل، والفشل بنيوي وليس مسألة جودة.
اطلب من Granite أن يقرر، فتحصل على توليد يجب عليك تحليله، وفاتورة تتدرج حسب صعوبة السؤال كما رآها النموذج، وزمن استجابة يعتمد على وضع التفكير الذي اخترته. اطلب من d1-3B أن يستدل، فلا تحصل على شيء على الإطلاق — فليس لديه تدفق رموز يستدل فيه. النموذجان على طرفين متقابلين من خط تعبره معظم خطوط المعالجة عدة مرات لكل طلب: هناك شيء ما يجب أن يقرر، وشيء ما يجب أن يتحدث. ينتمي d1-3B إلى المقدمة، حيث تختار قاعدة فرز مسارًا وتُعيد ثقة معايَرة. أما Granite 4.2 3B فينتمي خلفه، على الفرع الذي يحتاج إلى إجابة مكتوبة.
ثمة فخ ثانٍ أكثر هدوءًا. قيمة نموذج القرار تكمن في المعايرة — ثقة مقدارها 0.9 تكون صحيحة في تسع مرات من أصل عشر. لا تنشر بطاقة Granite 4.2 3B أي مقاييس للمعايرة ولا أي احتمالات؛ بل تنشر درجات الدقة والاستدلال. ومقارنتهما في لوحة صدارة أحد المعايير لا تخبرك بشيء عن أيهما ينبغي أن تثق به عند استخدام عتبة.
سطر الترخيص الذي لا يضعه أحد في الجدول
يُطرح Granite 4.2 3B بموجب Apache 2.0. ويُطرح d1-3B بموجب LFM Open License v1.0، الذي يبدو متسامحًا حتى القسم 5: حيث يُمنح الاستخدام التجاري بشرط أن تبقى أنت أو كيانك القانوني تحت حدٍّ محدَّد في الوثيقة نفسها بأنه إيرادات سنوية تبلغ عشرة ملايين دولار أمريكي أو أكثر، وأي استخدام تجاري يتجاوز ذلك الحد ليس مرخّصًا به ببساطة. وتُستثنى الجهات غير الربحية ومستخدمو الأبحاث.
بالنسبة لهاوي أو شركة ناشئة، هذه ليست مشكلة. بالنسبة لشركة تتجاوز هذا الحد في منتصف العام — أو قد تستحوذ عليها شركة أخرى — فإن المستودعين ليسا قطعتين متكافئتين مهما بدت أعداد معاملاتهما متشابهة، ومراجعة الترخيص تحدث بعد وقت طويل من قيام شخص ما بالفعل بشحن النموذج الأولي. إنه أرخص شيء في هذه الصفحة يمكن التحقق منه مبكرًا.
تشغيل الزوج كخط أنابيب واحد
لا يوجد أيٌّ من النموذجين في كتالوجنا اليوم، لذا هذا ليس ادّعاءً بالتوافر: فكلاهما من الأصول المُستضافة ذاتيًا، وبشكل خاص Granite 4.2 3B لا توجد لديه أي مزوّدي استدلال مُدرجين في بطاقته على الإطلاق. لكن النمط الذي ينتهي إليه الفريق فعليًا هو استدعاءٌ واحد يقرّر وآخر يتحدّث، وهذا النمط هو حيث تستحق طبقة التوجيه مكانها. يضع OrcaRouter أكثر من 200 نموذج خلف مفتاح API واحد مع تمرير أسعار المزوّدين المدرجة بهامش ربح 0%، لذا يصل خفض سعر البائع إلى فاتورتك في اليوم نفسه بدلًا من تجديد العقد التالي، والتحويل التلقائي عند الفشل بين المزوّدين يعني أن المكوّن المشترك في منتصف المسار لا يصبح نقطة فشل وحيدة بينما لا تزال تقيّمه. إذا أردت إجراء اختبار A/B بين d1-3B ونموذج عام مُستضاف على حركة مرورك الخاصة قبل الالتزام بنشر مُستضاف ذاتيًا، فأقرب جار موجّه إلى سلالة Granite هو Gemma 4 31B بسعر 0.13 دولار لكل مليون رمز إدخال و0.38 دولار لكل مليون رمز إخراج — وهو نموذج أكبر بكثير، لكنه يؤدي الدور نفسه "العام الذي يكتب" في المسار.
الحكم، مصوغًا كقاعدة
إذا كان ما تحتاجه هو حكم — بريد مزعج أم لا، أي قائمة انتظار، ما مدى الإلحاح، هل تطابق هذه الصورة ذلك الوصف — فإن d1-3B هو الوحيد من بين الاثنين الذي ينجز المهمة في تمريرة واحدة، ويفعل ذلك خلال ملّي ثوانٍ لا تتعدى خانة واحدة. وإذا كان ما تحتاجه هو إجابة مكتوبة، أو قراءة مستند طويل، أو استدعاء أداة، أو قطعة من التعليمات البرمجية، فإن Granite 4.2 3B هو الوحيد الذي يملك تدفق رموز أصلاً، ودرجات الاستدلال لدى 3B مبهرة حقًا بالنسبة لحجمه — وفقًا لتقييمات IBM الخاصة، دون أن يتحقق منها أحد بعد.
ما سيغيّر الصورة ليس صفًا جديدًا في المقاييس. بل طرفٌ ثالث يمنح كلا النموذجين درجات على نفس أداة المعايرة، لأن الخاصية التي تحدّد ما إذا كان يمكنك وضع عتبة على نموذج هي تلك التي لا تتيح لك أيٌّ من البطاقتين مقارنتها اليوم.
