
Liquid AI d1-3B مقابل Intern-Decision-4B: أيّ مُقرِّر مُعايَر تحتاج فعلاً؟
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
هناك الآن نموذجان مفتوحا الأوزان يجيبان عن الأسئلة بعدم كتابة أي شيء، وإلى أن تضع مخططات الإدخال/الإخراج الخاصة بهما جنبًا إلى جنب، يبدوان كالفكرة نفسها مكررة. Liquid AI d1-3B، الذي رُفع إلى Hugging Face في 5 أكتوبر 2026 وأعلنت عنه Liquid بعد يومين، هو نموذج قرار متعدد الوسائط بحجم 3.12B تقول بطاقته بصراحة إنه «ليس نموذج محادثة ولا يكتب نصًا». أما Intern-Decision-4B من InternLM، الذي رُفع بهدوء إلى مؤسسة InternLM في 26 سبتمبر 2026 دون أي تدوينة أو تغريدة أو صفحة إطلاق تدعمه، فهو نموذج قرار بحجم 4B مُضبوط ضبطًا دقيقًا من Qwen3.5-4B، ويُعيد هو أيضًا توزيع إجابات لكل سؤال في تمريرة أمامية واحدة. العقد نفسه على السطح. لكن الفروق الكامنة تحته — ترخيص سيُعقّدك، وعقد يمكن أن يكتب نصًا عن غير قصد، وآلات لم يقارنها أحد — هي ما يحدد أيّهما ينتمي إلى منظومتك.
ما مدى قربهما فعليًا
أول ما ينبغي توضيحه هو مقدار ما في هذه المقارنة من تعادل. كلا النموذجين يأخذ حالةً ومخططًا لأسئلة مسمّاة، وكلاهما يقرأ الإشارة من قيم logits عند موضع عنصر نائب بدلًا من أخذ العينات، وكلاهما متعدد الوسائط، وكلاهما يذكر أنه لم يكتب شيئًا. ومن حيث شكل الاستدعاء، هما متطابقان تقريبًا، والاختلافات المثيرة للاهتمام تكمن في التفاصيل المحيطة بالأطراف.
• الحجم — Liquid AI d1-3B بإجمالي 3.12B، مبني على LFM2.5-VL-3B من Liquid؛ Intern-Decision-4B بحجم 4B (نحو 4.54B وفق عدد الموترات الذي تطبعه البطاقة)، مضبوط ضبطًا دقيقًا من Qwen3.5-4B
• أنواع الأسئلة — يستخدم كل من d1-3B وIntern-Decision-4B الأنواع الثلاثة نفسها: منطقي للإجابة بنعم/لا، اختيار لواحد من مجموعة محددة، درجة لنقطة على مقياس مرتب
• حقول الإجابة — يُرجع d1-3B الإجابة بالإضافة إلى الثقة والاحتمالات؛ يُرجع مخطط InternLM توزيعات بالإضافة إلى قيمة ثقة يحذر بطاقة النموذج من أنها ليست احتمالاً معايراً
• حد الإدخال الأقصى — d1-3B: 32,768 توكنًا من السياق؛ أما Intern-Decision-4B فسقفٌ يبلغ 8 توكنات يرفض الطلبات الأطول مباشرةً بدلًا من اقتطاعها، مع احتساب الصور ضمنه
• الترخيص — d1-3B بموجب Liquid's LFM Open License v1.0، وApache 2.0 من جانب InternLM
• اللغات — يسرد d1-3B 16؛ بطاقة Intern-Decision-4B لا تذكر أي لغة.
• الواجهة — يُشحن d-3B كطراز تقوم بتحميله واستدعائه باستخدام trust_remote_code=True؛ يُشحن Intern-Decision-4B كمكتبة Python تقوم بتثبيتها عبر pip install، مع خلفية واحدة منفذة وحقل model الخاص بالطلب غير قادر صراحةً على تبديل نقاط التحقق
• نتيجة المورّدين الخاصة — d1-3B عند 48.57 على التقسيم العام لـ Decision Index 0.2.1؛ Intern-Decision-4B عند 90.02 كمتوسط عبر جدوله الخاص ذي المجموعات السبع، مع درجة برير 0.347 وخطأ معايرة متوقع 0.065
هذان الرقمان الأخيران غير قابلين للمقارنة، واعتبارهما لوحة نتائج سيكون أسهل خطأ يمكن ارتكابه في هذه الصفحة. فهما يأتيان من أدوات اختبار مختلفة، ومجموعات أسئلة مختلفة، ومقيّمين مختلفين.

المعايرة هي المنتج بأكمله، وواحد فقط منهم يضمنها كتابةً.
لا يستحق نموذج القرار زمن الاستجابة الذي يستهلكه إلا إذا كان الرقم الذي يعيده بجانب الإجابة ذا معنى. وهذا هو معنى المعايرة: فالثقة المعلنة البالغة 0.9 ينبغي أن تكون صحيحة نحو تسع مرات من كل عشر، والنموذج الواثق والمخطئ أسوأ من نموذج يقول إنه لا يعرف.
إن InternLM هو الذي يتعامل مع هذا. توثّق بطاقته درجة حرارة مُلاءَمة مقدارها 1.99241824، مشتقة عبر تصغير سالب لوغاريتم الإمكان على 1,728 حالة معايرة محددة، مع الاحتفاظ بـ 1,693 حالة للتحقق، ومطبوعة إلى ثماني منازل عشرية بحيث يمكن إعادة إنتاجها. كما ينشر دراسة تجريبية قبلية وبعدية على 96 حالة تُظهر أن الآلية تعمل بدلًا من مجرد الادعاء بذلك: Brier 0.628 وECE 0.213 قبل المعايرة مقابل 0.550 و0.089 بعدها. وBrier وECE هما المقياسان المعياريان لما إذا كانت الاحتمالات المعلنة صادقة، واتجاه التحرك كبير.
لا تنشر Liquid أي ما يعادلها. وتحمل بطاقة d1-3B الخاصة به معايير من نمط الدقة — SQuAD 2.0 85.3، وCivil Comments 93.0، وMASSIVE intent 87.3، وPubMedQA 66.0، وBoolQ 86.7، وXNLI 85.0، وPAWS-X 76.9، بمتوسط 77.1 — إلى جانب 48.57 له على مؤشر القرار، ونقطة البيع المعلنة للنموذج هي إجابات مُعايَرة محددة النوع. لكن لا يوجد صف ECE، ولا صف Brier، ولا درجة حرارة مُلاءَمة منشورة.
لا يعني هذا التفاوت أن سليل Qwen3.5-4B مُعاير بشكل أفضل من نموذج 3B مبني على LFM2.5-VL-3B؛ بل يعني أنه بين هاتين البطاقتين، إحداهما تمنحك الحساب اللازم لإعادة إنتاج الادعاء، والأخرى تمنحك الادعاء. إذا كان خط أنابيبك يضع عتبة على ثقة ما — التوجيه فوق 0.8، والتصعيد دون 0.4 — فيمكنك التحقق من جانب InternLM هذه الليلة، بينما لا يمكنك سوى إجراء فحص عيّني لجانب Liquid.
ينطبق هذا التحذير في الاتجاهين. مجموعتا الأرقام كلتاهما من طرف أول. لم يُقيَّم أي من النموذجين من طرف مستقل، كما تستند ادعاءات المعايرة الخاصة بـ InternLM إلى دراسة تجريبية من 96 حالة أجرتها InternLM بنفسها مقابل الملاءمة الخاصة بـ InternLM.
الترخيص الذي يطلب منك رقمًا
Intern-Decision-4B هو Apache 2.0، موروث من Qwen3.5-4B، مع الاحتفاظ بإشعارات المصدر الأصلي — الاستخدام التجاري، وإعادة التوزيع، والضبط الدقيق، ولا توجد أي مسألة تتعلق بالإيرادات في أي موضع فيه.
d1-3B يخضع لترخيص Liquid's LFM Open License v1.0، والقسم 5 هو الجزء الذي لا يقرأه أحد حتى يقرأه قسم المشتريات. لا يُمنح الاستخدام التجاري إلا بشرط أن تبقى أنت أو كيانك القانوني دون عتبة، معرّفة في الوثيقة نفسها بأنها إيرادات سنوية تبلغ عشرة ملايين دولار أمريكي أو أكثر؛ أما الاستخدام فوقها فغير مرخّص ببساطة. وتُستثنى المؤسسات غير الربحية والمستخدمون من الباحثين.
للفرد أو لفريق صغير، كلاهما مجاني. أما أي جهة لديها قسم مالي، فالمستودعان منتجان مختلفان، والفرق رقم إما أن تكون فوقه أو لا.
ذيل جدول المعايير الخاص بـ d1-3B هو ادعاؤه الحقيقي.
الرقم الرئيسي على بطاقة Liquid هو 48.57 على Decision Index 0.2.1، متقدمًا على بقية الصفوف التي تقل عن 10B في جدول يمتد من Winnow-12B عند 50.02 نزولًا إلى Decider 2B عند 28.97. وما يجعل هذا الرقم جديرًا بالاقتباس هو مؤشر التمييز الكامن تحته. في الدرجات الفرعية الخاصة بـ Decision Index نفسها، يسجل d1-3B 74.5 في الأدوات و36.3 في الفنون بينما لا يحقق سوى 23.8 في المعرفة — مقابل Decider 35B-A3B، وهو نموذج خليط خبراء بحجم 36B أي 12 ضعف حجمه، ويسجل 56.5 في الأدوات و32.6 في الفنون و31.8 في المعرفة.

بعبارة أخرى، ليس 3B نموذجًا صغيرًا أسوأ قليلًا على نحو متساوٍ. إنه نموذج صغير قوي بشكل غير معتاد في القرارات المنظمة على نمط الأدوات، وضعيف بشكل غير معتاد في الأسئلة التي تحتاج إلى معرفة بالعالم، وهو يتفوق على 36B في الفئتين الأكثر شبهًا بالمهمة التي بُني من أجلها. إذا كانت قراراتك من نوع «أي من هذه الإجراءات الخمسة المسمّاة؟» و«هل هذا مستند إلى المقطع المُسترجَع؟»، فإن فجوة الحجم تؤدي دورًا أقل مما تتوقع. وإذا كانت قراراتك تعتمد على حقائق يجب أن يمتلكها النموذج مسبقًا، فتوقّع أن يظهر 23.8.
هناك نسخة ثانية من تلك الحجة على الجانب البصري. يبلغ متوسط d1-3B 74.1 عبر أحد عشر معيارًا عامًا للصور، مقابل 73.9 لنموذجه الأساسي الخاص به، وعند إزالة الصور تسجل الأسئلة نفسها 45.1 — لذا في أسئلة الصور تأتي الإجابات حقًا من الصورة. إنه على مستوى نموذجه الأساسي وليس أفضل منه، وصفوف كل معيار تقطع في الاتجاهين: CV-Bench 82.1 مقابل 87.6، وPOPE 88.5 مقابل 90.1، وBLINK 59.2 مقابل 58.7.
من الجدير بالملاحظة أيضًا الوقفة في بطاقة InternLM: إذ يأتي إجماليها المرتفع من مهام مدفوعة بالأسئلة مثل Typed Decision 80.55 وToolACE 96.45، بينما يبلغ Jevbench-Hard 73.87. وحيث يصبح المخطط صعبًا، تنخفض النتيجة.
السرعة: الفجوة ليست حيث تتوقعها
تعلن d1-3B عن 8 مللي ثانية لسؤال واحد على RTX 4090 و9 مللي ثانية على MI325X، و21 مللي ثانية لثلاثة أسئلة تتشارك حالة واحدة، و16 مللي ثانية على Jetson AGX Thor، وبإنتاجية معبأة تبلغ 475 قرارًا في الثانية على 4090 و1,106 على MI325X.
تقيس بطاقة Intern-Decision-4B متوسط زمن من البداية إلى النهاية يبلغ 44.16 مللي ثانية على نفس RTX 4090، مع وسيط يبلغ 44.03 مللي ثانية و44.60 مللي ثانية عند P95.
يبدو أن هذا فوز بمقدار 5x، لكنه ليس كذلك، لأن الرقمين يقيسان شيئين مختلفين. أرقام Liquid هي استدعاءات نموذج مُسخّنة مسبقًا، طلب واحد في كل مرة، مع تحمّل تكاليف اختيار النواة والتجميع مقدمًا — وتقول البطاقة صراحةً إن سؤالًا واحدًا يكلّف 16 مللي ثانية على 4090 دون تجميع مخطط CUDA، وإن أول استدعاء بشكل جديد يتحمل تكلفة التجميع. أما 44 مللي ثانية الخاصة بـ InternLM فهي زمن من البداية إلى النهاية لكل استعلام عبر مكتبة Python لا يوجد في خلفياتها المنفّذة سوى الاستدلال المحلي عبر Hugging Face، لذا فهي تحمل معها الآلية المحيطة. لا يوجد خطأ في أي من الرقمين. ضع كليهما تحت منصة اختبار واحدة، على جهاز واحد، وبنفس شكل الطلب، وستتقلص الفجوة إلى شيء تود قياسه بدلًا من افتراضه.
ما لا خلاف عليه هو السقف. 8,192 رمزًا هو رفض قاطع من جانب InternLM، ورموز الصور تُستهلك من الميزانية نفسها، لذا فإن مستندًا طويلًا مع لقطة شاشة هو طلب يعود مرفوضًا بدل أن يُقتطع. يمنحك d1-3B 32,768 رمزًا للعمل بها. إذا كانت حالاتك تذاكر ومبادلات قصيرة، فلن يمثل هذا الفارق مشكلة أبدًا. أما إذا كانت بحجم صفحة، فإنه يحسم المسألة قبل أي معيار تقييم.
شغّلها كلوحة، لا كتبديل
الإجابة على سؤال محدد بنعم/لا والإجابة على سؤال "أي من الأشياء الستة المذكورة هذا، وما مدى تأكدك" هما مطلبان مختلفان، والبطاقتان مصممتان بشكل مختلف بما يكفي — إحداهما بحد أقصى صارم للمدخلات ومعايرة منشورة، والأخرى بـ 32K وذيل تسجيل أفضل — لدرجة أن النشر المفيد لفريق يقيّم كليهما غالبًا ليس بديلاً بل لوحة: نفس الحالة تُطرح على كلا النموذجين، مع توجيه حالات عدم التوافق إلى إنسان أو إلى نموذج أكبر.
لا يوجد أي من النموذجين في كتالوجنا، وهذا ليس ادعاءً بالتوفر؛ فكلاهما من الأصول المستضافة ذاتيًا. لكن اللوحة هي بالضبط الشكل الذي تقوم فيه طبقة التوجيه بالعمل بدلاً من الأعمال الورقية. يتيح OrcaRouter أكثر من 200 نموذج خلف مفتاح API واحد مع أسعار القائمة لدى المزوّدين تُمرَّر بهامش ربح 0% — لذا عندما يخفّض أحد المورّدين الذين توجّههم خلفنا سعره، تتحرّك فاتورتك في اليوم نفسه — و التجاوز التلقائي عند الفشل عبر المزوّدين يمنع لوحة من نموذجين من أن تصبح نقطتي فشل منفردتين. النماذج التي توجّهها اليوم ليست هذين النموذجين، بل هي النماذج العامة المستضافة التي كنت ستستبدلها، مثل Qwen3.5-27B بسعر $0.086 لكل مليون رمز إدخال و$0.688 لكل مليون، وهو الرقم الذي يجب على نموذج 3B مستضاف ذاتيًا أن يتغلّب عليه بمجرد احتساب تكلفة GPU.
ماذا تفعل هذا الأسبوع
إذا كانت قراراتك حالات قصيرة، وكان لا بد للرخصة أن تصمد أمام مراجعة شركتك، وأردت أوسع نطاق ممكن من أهداف البناء — llama.cpp، وOllama، وLM Studio، ومسار دفعات مضغوط يشغّل 64 حالة في تمريرة واحدة — فإن d1-3B هو الأكثر تحوّلًا إلى منتج بين الاثنين، وتمييزه بين الأدوات والفنون هو أقوى ما تُظهره أي من البطاقتين. وإذا كانت قراراتك تمتد عبر حالات طويلة، أو كنت بحاجة إلى رخصة بلا بند إيرادات، أو أردت ملاءمة معايرة يمكنك إعادة إنتاجها ومنظومة اختبار تكون فيها التكلفة المحيطة محسوبة بالفعل، فإن Intern-Decision-4B هو الذي يمكنك فعلًا التحقق من أوراقه.

الجزء غير المريح هو نفسه لكليهما: لم يُشغِّل أي طرف مستقل أيًّا من النموذجين، ولا توجد أي مقارنة معايرة لم يطلبها البائع الذي كتب البطاقة. وبالنسبة لفئة نماذج تكمن قيمتها كلها في معنى رقم بجانب إجابة، تلك هي الفجوة الجديرة بالإغلاق قبل أن تضع عتبة على أي شيء.
