بطاقة عنوان رئيسية بعنوان "Kolibri vs Granite 4.2 3B" مع عنوان فرعي "نموذج خبراء مختلط متناثر بحجم 78B مقابل نموذج استدلال كثيف بحجم 3B"، وشارات كبسولية تقرأ "إجمالي 78.1B | نشط 3.46B"، و"~3B كثيف"، و"Apache 2.0 لكليهما"، وسطر تذييل يقرأ "أرقام معلنة من المورّد من كلا الجانبين"، مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

Kolibri مقابل Granite 4.2 3B: رهان على التناثر بحجم 78B، والنموذج 3B الذي يرفض أن يلعب اللعبة نفسها

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع Kolibri وGranite 4.2 3Bجنبًا إلى جنب، وأول ملاحظة صادقة هي أن هذه ليست مواجهة عادلة، وليست في الاتجاه الذي قد تفترضه. Kolibri هو نموذج مزيج خبراء من Aleph Alpha يضم 78.1 مليار معامل، صدر في 3 أكتوبر 2026، ويُفعِّل 3.46 مليار معامل لكل رمز. أما Granite 4.2 3B فهو نموذج استدلال كثيف من IBM بنحو ثلاثة مليارات معامل، وصلت أوزانه إلى Hugging Face في 7 أغسطس 2026، مع بطاقة النموذج والمدونة التقنية التي تبعتها في 25 أغسطس. أحدهما يبلغ ستة وعشرين ضعف الآخر من حيث إجمالي المعاملات. السبب في أنهما ينتميان إلى القرار نفسه هو أن كليهما بترخيص Apache 2.0، وكليهما نصي فقط، وكليهما مُصمَّم للاستضافة الذاتية، وكليهما استهدفا المشتري نفسه: فريق يريد ذكاءً للمستندات على عتاد يتحكم به، مع مصدر موثوق يصمد في مراجعة المشتريات. السؤال المثير ليس أيهما أفضل. بل ماذا يشتريه فعلًا هذا القدر من المعاملات الذي يبلغ ستة وعشرين ضعفًا، وما كلفة حمله.

عدم التطابق، بصراحة.

Granite 4.2 3B هو نموذج كثيف قائم بذاته دُرّب تدريبًا لاحقًا من Granite-4.1-3B-Base، وهو جزء من عائلة Granite 4.2 التي طرحتها IBM حتى أغسطس. يضم 40 طبقة مع انتباه الاستعلامات المجمّعة، وسياقًا أصليًا بحجم 128K توسّعه IBM إلى 512K في مرحلة خامسة من التدريب المسبق، وثلاثة أنماط تفكير لكل استعلام: التفكير الكامل افتراضيًا، ومسار منخفض الجهد، ومسار بلا تفكير. بطاقة IBM صريحة بشكل غير معتاد بشأن ما ليس عليه نموذج 3B. وخلافًا لشقيقيه 8B و30B، تخطّى عمدًا كتلة التعلم المعزز الوكيلي المتخصصة التي دُرّبت في SWE-agent وبيئات الطرفية والبحث، ولهذا لا تدرج IBM أي رقم لـ SWE-bench له على الإطلاق، وتقدّم النموذج بوصفه متخصصًا في الاستدلال لا وكيلًا.

Kolibri تسير في الاتجاه المعاكس على كل محور. خمسون طبقة، كلها مزيج الخبراء، 384 خبيرًا لكل طبقة مع واحد مشترك وستة موجهين، ونسبة تناثر تبلغ حوالي 22.6 إلى 1. سياقها أصليًا 262,144 رمزًا، ومُتحقق منه حتى 1,048,576، مع توصية البطاقة بالبقاء عند 262,144 أو أقل للأعمال الحساسة لزمن الاستجابة. أربعة مستويات لجهد الاستدلال. استدعاء الأدوات بنمط Hermes مع محلل vLLM مضمّن في نفس مستودع الأوزان. وبصمة تبلغ حوالي 78 جيجابايت في FP8، مع كون الحد الأدنى لتكوين البطاقة هو إما بطاقتا A100 80 جيجابايت، أو بطاقتا H100 SXM5، أو H200 واحدة، أو B200 واحدة، أو B300 واحدة.

• المعاملات — Kolibri: 78,103,074,560 إجمالاً، 3,457,573,120 نشطة لكل رمز. Granite 4.2 3B: كثيف بحوالي 3 مليارات، جميع المعاملات نشطة عند كل رمز.

• السياق — Kolibri: 16,384 مُدرَّب، 65,536 مُدرَّب متوسط، 262,144 أصلي، 1,048,576 تم التحقق منه. Granite 4.2 3B: 128K أصلي، موسّع إلى 512K.

• أنماط التفكير — Kolibri: لا شيء، منخفض، متوسط، مرتفع، تُضبط عبر قالب الدردشة. Granite 4.2 3B: كامل، منخفض الجهد، وبدون تفكير، لكل استعلام.

استدعاء الأدوات — Kolibri: بأسلوب Hermes، مع محلِّل مرفق. Granite 4.2 3B: نعم، ولكن ليس عبر المسار المُدرَّب على الوكلاء بالتعلم المعزز الذي حصل عليه أشقاؤه الأكبر.

• اللغات — Kolibri: الألمانية والإنجليزية، بحكم التصميم ولا شيء آخر. Granite 4.2 3B: الإنجليزية أولاً، مع تدريب IBM الأوسع متعدد اللغات الذي يقف خلفه.

• البصمة — Kolibri: حوالي 78 GB في FP8، وبحد أدنى وحدتا معالجة رسوميات. Granite 4.2 3B: نحو 6–8 GB في bfloat16، وأقل من 2 GB عند التكميم، من فئة الحواسيب المحمولة.

• رخصة — كلاهما Apache 2.0، وكلاهما بدون بند للاستخدام المقبول أو حد أدنى للمستخدمين النشطين شهريًا.

• التقديم — Kolibri: إضافة aleph-alpha-inference الخاصة بـ vLLM أو صورة الحاوية المنشورة. Granite 4.2 3B: vLLM وSGLang وTransformers وGGUF وOllama تحت granite4.2:3b.

A two-column comparison scoreboard titled 'Kolibri vs Granite 4.2 3B'. Left column Kolibri: Parameters 78.1B total / 3.46B active, Context 262,144 native / 1,048,576 validated, Thinking none / low / medium / high, Languages German and English, Licence Apache 2.0, Footprint about 78 GB FP8, two GPUs minimum. Right column Granite 4.2 3B: Parameters ~3B dense, Context 128K native / 512K extended, Thinking full / low / none, Languages English-first with IBM multilingual training, Licence Apache 2.0, Footprint 6-8 GB bfloat16 / under 2 GB quantized, laptop-class. Footer: 'Kolibri figures are Aleph Alpha's own; Granite 4.2 3B figures are IBM's own; nothing here is independently reproduced.' with the OrcaRouter logo in the bottom-right corner.

ما الذي تحققه الـ 75 مليار معامل إضافي

ثلاثة أمور، ومن الجدير أن نكون دقيقين في تحديد أي منها ثابت وأي منها مُدّعى.

الأول هو الألمانية. هذا هو الفرق الحقيقي الأكثر حدة بين النموذجين، وهو ليس صفًا في لوحة ترتيب. بنت Aleph Alpha نموذج Kolibri حول مدونة ثنائية اللغة ألمانية-إنجليزية، مستهدفةً نحو 20 في المئة من الألمانية في عملية تدريب مسبق بحجم 20 تريليون توكن، وانتهت إلى مجموعة ألمانية من 2.4 تريليون توكن، نسّق المختبر 80 في المئة منها أو ولّدها بنفسه. وتشرح البطاقة لماذا تطلّب ذلك جهدًا: فمجموعات البيانات الألمانية المفتوحة منزوعة التكرار لم توفّر سوى 390 مليار توكن، أي أقل بمرتبة قدر تقريبًا، لذا أعاد المختبر ضبط مرشّح Common Crawl خصيصًا للألمانية، وأعاد صياغة الوثائق الألمانية الموجودة إلى مدخلات موسوعية وحوارات ومقاطع. تفصيل المرشّح هو ما ينبغي تذكّره. فخط بيانات لغوية قياسي يحذف الوثائق التي تحتوي على كلمات طويلة كثيرة، والنثر الإداري الألماني يتجاوز بانتظام الحد الإنجليزي لمتوسط طول الكلمة — لذا تحذف الإعدادات الافتراضية بهدوء السجل الذي تكتب به الإدارة العامة. لم تبنِ IBM نموذج Granite لتلك المدونة. سيتعامل Granite 4.2 3B مع الألمانية؛ لكنه لم يُصمَّم حول السجل القانوني والإداري الألماني، ولن تخبرك أي لوحة ترتيب بالفرق.

الثاني هو السياق الطويل الذي يصمد أمام المستندات الحقيقية. سقف Granite البالغ 512K كبير حقًا، لكن النموذجين وصلا إلى ذلك بطريقتين مختلفتين، وتصميم Kolibri الموضعي هو حجة السياق الطويل الأكثر تقليدية. تعامل مع أرقام RULER الخاصة بـ IBM — 67.52 عند 64K و55.30 عند 128K في المواد المنشورة لعائلة 4.2 — على أنها الإفصاح الصادق عن مقدار تدهور جودة الاسترجاع بحلول 128K، وتذكّر أنه ليس لدى Kolibri أي منحنى تدهور منشور مكافئ على الإطلاق.

الثالث هو هامش الاستدلال الخام، وهنا تكون الإجابة الصادقة «ليس بالقدر الذي توحي به نسبة المعلمات». لقد وفّر خط أنابيب التدريب الخاص بـ Kolibri له عملية تدريب مسبق بـ20 تريليون رمز على 768 من NVIDIA B200s خلال 21 يومًا، كما يضعه جدول المقارنة الخاص بـ Aleph Alpha نفسه، مع Kolibri عند جهد استدلال مرتفع، عند 75.5 في المتوسط الإنجليزي و70.8 في المتوسط الألماني لمقارنة تضم أربعة عشر نموذجًا — حيث يخسر أمام نموذج كثيف بـ27 مليار معلمة من Alibaba في معظم الصفوف. أما أبرز ادعاءات Granite 4.2 3B فهي ادعاءاته الخاصة: AIME 2025 عند 78.33، وGPQA عند 54.80، وLiveCodeBench v6 عند 69.71، وMMLU-Pro عند 67.84، وكلها مُبلَّغ عنها من IBM ولم يُعَد إنتاجها. مجموعات اختبار مختلفة، وأدوات تقييم مختلفة، ومورّدون مختلفون. لا يوجد في أي مكان رقم بنفس أداة التقييم لهذه المقارنة الثنائية، ولن نختلق واحدًا.

أين يفوز كل واحد منهما فعليًا

شغّل Granite 4.2 3B إذا كان جهازك هو القيد. فبحجم 6–8 غيغابايت بصيغة bfloat16، أو أقل من 2 غيغابايت بعد التكميم، يتّسع لحاسوب محمول، أو لبطاقة رسوميات واحدة في محطة عمل، أو لصندوق طرفي معزول تمامًا لن يرى يوماً اثنتين من H100s. ويعمل عبر خمس بيئات تشغيل مختلفة، من بينها Ollama وGGUF، وهذا مهم عندما يكون هدف النشر حاسوب محمول يخصّ شخصًا آخر لا رفّ الخوادم الذي تملكه أنت. وبطاقته التقنية جديرة بالثقة بصفة غير معتادة، والسبب تحديدًا أن IBM دوّنت ما استبعدته. فالجهة التي ترفض الإدعاء بنتائج SWE-bench لنموذج بحجم 3B إنما تخبرك أين يتوقف النموذج.

شغّل Kolibri إذا كانت المدونة النصية هي الهدف والعتاد موجود. فريق لديه عقود باللغة الألمانية، أو توثيق تقني، أو ملفات إدارية، وعقدة GPU مزدوجة موجودة، ومتطلّب ألا تغادر الأوزان المبنى أبدًا هو بالضبط من صُمّم هذا الإصدار من أجلهم. النافذة الأصلية البالغة 262,144 رمزًا، وذاكرة FP8 KV المؤقتة، ومستويات الجهد الأربعة، ومسار استدعاء أدوات Hermes، كلها تشير إلى سير عمل المستندات لا إلى الدردشة. المُرمِّز ثنائي اللغة جزء من الحجة نفسها: يذكر Aleph Alpha متوسط 4.90 بايت لكل رمز على نص الويب الألماني مقابل 4.35 لـ GPT-5 و3.28 لـ Kimi K3، وكلها قياسات أجراها المورّد على مدونة المورّد، وكون الأحرف لكل رمز أكثر هو أثر مباشر في كلفة الاستدلال لا نتيجة تقييم. وإذا صحّ ذلك، فإنه يتراكم عبر كل صفحة تعالجها.

عدم التماثل الذي لا يُعلن عنه أحد هو البيانات. نشرت IBM أوزان Granite 4.2 3B وشرحًا تقنيًا مفصّلًا لكيفية بناء النموذج، لكن ليس بيانات التدريب. ونشرت Aleph Alpha خط الأنابيب، ومصدر البيانات، ورقم الطاقة إلى جانب أوزان Kolibri — 20 تريليون رمز تدريب مسبق، و9.5×10² ميغاواط/ساعة بما يشمل الأعباء الإضافية لمراكز البيانات ولا يشمل الضبط الدقيق الخاضع للإشراف والتعلّم المعزّز. وبالنسبة لفريق يجب أن يجيب عن سؤال «من أين جاء نص هذا النموذج؟»، فإن هذا الفرق ليس شكليًا.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the card header, the Apache 2.0 licence tag, the twelve tested languages, and the links to the Granite 4.2 Collection, the technical blog and the GitHub repository.

واقع التوجيه لكليهما

لا يوجد أيٌّ من النموذجين في كتالوج مستضاف اليوم. لا يمتلك Kolibri أي SKU لواجهة برمجة تطبيقات من المورّد على الإطلاق — فالإصدار عبارة عن أوزان بالإضافة إلى تقرير تقني — بينما يُطرح Granite 4.2 3B كأوزان لخمس حزم تشغيل دون نقطة نهاية مستضافة من IBM. كلا العرضين قائمان على الاستضافة الذاتية، والسؤال العملي بالنسبة لمعظم الفرق ليس أيّهما يتبنّى، بل ما إذا كان عبء العمل يبرّر امتلاك أيٍّ منهما.

هنا تستحق طبقة التوجيه مكانها حتى بالنسبة إلى النماذج التي لا تحملها. فحصنا كتالوج OrcaRouter تحت كل تهجئة لاسمَي النموذجين، ولا Kolibri ولا Granite 4.2 3B موجودان هناك، لذا لن نتظاهر بغير ذلك. ما يمنحك إياه OrcaRouter هو الطريقة الرخيصة لمعرفة ما إذا كان قرار العتاد مبررًا قبل أن تتخذه: وجّه مسار اختبار نحو طبقة صغيرة من خليط الخبراء (mixture-of-experts) موجّهة بالفعل — نسخة Gemma 4 26B-A4B بسعر $0.06 لكل مليون رمز إدخال و$0.33 لكل مليون رمز إخراج، مع نافذة 262,144 رمزًا — وانظر ما إذا كان عبء مستنداتك الألمانية يحتاج فعلاً إلى ما يوفره Kolibri، على مفتاح واحد متوافق مع OpenAI، بسعر القائمة لدى المزود دون أي إضافة. إذا كان يحتاج ذلك، فأنت تشتري وحدات GPU بالدليل لا بالحدس. وإذا لم يكن يحتاج، فقد وفّرت للتو طلب عتاد.

الحكم، وما الذي قد يغيّره

هذه ليست مواجهة لها فائز. فـ Kolibri وGranite 4.2 3B يجيبان عن أسئلة مختلفة عند نقاط سعرية مختلفة، والتصنيف الصادق الوحيد هو حسب القيد: إذا كان القيد هو العتاد، فإن Granite 4.2 3B هو الوحيد من بين الاثنين الذي يستوفي الشرط. وإذا كان القيد هو العمل على مستندات السجل التنظيمي الألماني في الموقع، فإن Granite 4.2 3B لم يكن في السباق قط، وKolibri هو الأثر الأكثر إثارة للاهتمام — إصدار شرعي مفتوح الأوزان بحجم 78B، بترخيص Apache 2.0، مع نشر خط أنابيب البيانات والمُرمِّز الرمزي إلى جانب الأوزان.

هناك أمران سيحسمان المقارنة. تشغيل مستقل لـ Kolibri على مهمة إجابة أسئلة المستندات باللغة الألمانية سيختبر الادعاء الذي بُني هذا الإصدار فعلاً لتقديمه، بما أنه لا توجد حالياً أي لوحة صدارة تقيسه. وإعادة إنتاج مستقلة لأرقام الاستدلال الخاصة بـ Granite 4.2 3B ستخبرك ما إذا كان جهاز من فئة الحواسيب المحمولة قادراً على الصمود في المجموعة الفرعية من عبء عملك التي لم تكن تحتاج أصلاً إلى 78 مليار معامل. وإلى أن يتحقق أحد هذين الأمرين، اشترِ وفق القيود، لا وفق عدد المعاملات.

A screenshot of IBM's technical blog announcing the Granite 4.2 family, showing the post header and the discussion of the family's dense and mixture-of-experts tiers and their reasoning and thinking modes.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا