بطاقة رئيسية مُولَّدة للشرح التوضيحي Kolibri، بعنوان «Kolibri: نموذج مفتوح الأوزان بحجم 78B من ألمانيا» وعنوان فرعي «78B إجمالاً / 3.46B نشطة / سياق 1M رمز / Apache 2.0»، إلى جانب ثلاثة أيقونات خطية مسطحة: طائر الطنّان، ومجموعة من الطبقات، وقفل فوق مستند. ويظهر شعار OrcaRouter في الشريط الواقع أسفل الرسم.
Guides & Insights

Kolibri، موضّح: Aleph Alpha تطرح نموذجاً ألمانياً-إنجليزياً بحجم 78 مليار معلمة بموجب Apache 2.0

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصدرت Aleph Alpha Kolibri في 3 أكتوبر 2026، وهو نموذج خليط خبراء بـ 78.1 مليار معامل، يُنشّط 3.46 مليار معامل لكل رمز، ويمتلك نافذة سياق مُتحقَّق منها تبلغ 1,048,576 رمزًا، ويُتاح بأوزان كاملة على Hugging Face بموجب رخصة Apache 2.0. نشر مختبر هايدلبرغ هذا النموذج في يوم الوحدة الألمانية، إلى جانب تقرير فني، وبطاقة نموذج بالألمانية والإنجليزية، وسرد مفصل على نحو غير معتاد لكيفية تدريب هذا الشيء. النموذج الذي يُقاس عليه في كامل وثائق Aleph Alpha الخاصة هو Kolibri Origin — السلف ذو 30.6 مليار معامل و3.27 مليار معامل نشط، الذي أنهى التدريب المسبق في 11 يونيو 2026 ولم يُطرح علنًا قط. نموذجان، يفصل بينهما ثلاثة أشهر، والمسافة بينهما هي أكثر ما يثير الاهتمام في هذا الإصدار.

ما يجعل Kolibri يستحق قراءة متأنية ليس أنه أقوى نموذج متاح. فعلى جداول المقارنة الخاصة بـ Aleph Alpha ليس كذلك، وسنصل إلى ذلك. ما يستحق الملاحظة هو أن مختبرًا أوروبيًا أطلق نموذجًا مفتوح الأوزان بهذا الحجم أصلًا، مع نشر خط أنابيب التدريب ومنشأ البيانات ورقم الطاقة إلى جانبه، وحدّد الترخيص بـ Apache 2.0 بدلًا من ترخيص بحثي مُخصّص. وبالنسبة للفرق التي تبدأ قواعد الشراء لديها بعبارة «إلى أين تذهب البيانات»، فإن هذا المزيج هو المنتج.

ورقة المواصفات، والرقمان اللذان يهمان

كل ما يلي مأخوذ من بطاقة النموذج التي نشرتها Aleph Alpha مع الأوزان؛ لم يُعَد إنتاج أي منه بشكل مستقل حتى الآن، ولا يوجد صف لـ Kolibri في Artificial Analysis وقت كتابة هذا النص.

• إجمالي المعلمات — 78,103,074,560، مع 3,457,573,120 نشطة لكل رمز، بنسبة تقارب 22.6 إلى 1.

• البنية المعمارية — محوّل من 50 طبقة، جميع الطبقات مزيج من الخبراء، 384 خبيراً لكل طبقة مع خبير مشترك واحد و6 خبراء موجّهين، ومزيج بنسبة 4:1 من الانتباه بالنافذة المنزلقة إلى الانتباه بالاستعلام المُجمّع عبر المكدس.

• السياق — دُرِّب على 16,384 رمزًا، وتلقى تدريبًا متوسطًا على 65,536، ووُسِّع إلى سياق أصلي يبلغ 262,144. ولأن ترميز المواضع لا يُطبَّق إلا في طبقات النافذة المنزلقة، تفيد Aleph Alpha بأن النافذة يمكن توسيعها دون تحجيم للمواضع، وقد تحققت من الجودة وكفاءة الخدمة حتى 1,048,576 رمزًا. وتوصي البطاقة بالبقاء عند 262,144 أو أقل للأعمال الحساسة لزمن الاستجابة وللمهام المعقدة.

• الدقة — أوزان FP8 في كتل 128×128 مع تنشيطات مُكمّاة ديناميكيًا، تُقيَّم باستخدام ذاكرة KV مؤقتة بتنسيق FP8؛ تبقى التضمينات ورأس LM والمعايير وموجّه MoE بتنسيق bfloat16.

• الاستدلال — أربعة مستويات للجهد: لا شيء، منخفض، متوسط، ومرتفع، يتم ضبطها عبر قالب المحادثة.

• استدعاء الأدوات — نعم، بأسلوب Hermes، مع محلل vLLM {{1}}مضمّن في المستودع نفسه{{/1}} {{2}}الذي يحتوي على الأوزان{{/2}}.

• اللغات — الألمانية والإنجليزية، ولا شيء غير ذلك. ويُذكر ذلك كخيار تصميمي لا كإغفال.

• التدريب — 20 تريليون رمز لمرحلة ما قبل التدريب على مجموعة نصوص ثنائية اللغة مُرشّحة، بنحو 62.5 في المائة من الإنجليزية، و23.9 في المائة من الألمانية، و13.6 في المائة من الشيفرة، إضافة إلى 3.44 تريليون رمز لمرحلة التدريب الوسيط و201 مليار لتوسيع السياق الطويل.

• الحوسبة — 768 من وحدات NVIDIA B200 عبر 96 عقدة HGX، و21 يومًا من التدريب المُسبق لمدة 511 ساعة و392,000 ساعة GPU، بمعدل مُبلَّغ عنه 6.4×10²³ عملية FLOPs. أضاف التدريب الأوسط خمسة أيام و90,000 ساعة GPU؛ وأضاف تمديد السياق الطويل 13 ساعة و10,000 ساعة GPU.

• الطاقة — 9.5×10² ميجاواط/ساعة تقديريًا، شاملًا التكاليف الإضافية لمراكز البيانات، ويغطي التدريب المسبق والتدريب الوسيط والتدريب على السياق الطويل، لكنه لا يشمل الضبط الدقيق المُوجَّه بالبيانات والتعلم المعزز.

• الترخيص — Apache 2.0. لا ملحق للاستخدام المقبول، ولا حد للمستخدمين النشطين شهريًا، ولا شروط تجارية منفصلة.

سطران من تلك الأسطر هما اللذان ينبغي للمشتري أن يقرأهما مرتين. عدد المعاملات النشطة هو ما تدفع ثمنه عند الاستدلال، و3.46 مليار نشطة من أصل 78 مليارًا إجمالًا نسبة تناثر عدوانية — وهي السبب الكامل في أن نموذجًا بهذا الحجم يمكن تقديمه أصلًا على وحدتي معالجة رسومية. أما رقم السياق فيُذكر بأنه 262,144 أصليًا مع 1,048,576 مُتحقَّقًا منه، وهو ادعاء أكثر حرصًا من "سياق 1M" المسطّح الذي ستراه في معظم التغطية لهذا الإصدار.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

نموذجان يفصل بينهما ثلاثة أشهر

Kolibri هو النموذج الثاني ضمن ما تُسمّيه Aleph Alpha مصنعها Model Factory، والجدول الزمني الذي نشرته هو الجزء من الإصدار الذي تغفله معظم التغطيات.

بدأ العمل على خط أنابيب التدريب في يناير 2026. أنهى Kolibri Origin التدريب المسبق بالمقياس المستهدف في 11 يونيو 2026 — 30.6 مليار معامل إجمالي، و3.27 مليار معامل نشط، ونافذة سياق من 65,536 رمزًا، و7.51 تريليون رمز تدريب، و50 طبقة كانت اثنتان منها كثيفة و48 منها MoE، ونمط استدلال واحد. جرى التحقق منه داخليًا ولم يُطرح علنًا قط. أنهى Kolibri التدريب المسبق في 11 سبتمبر 2026.

• المعاملات — 30.6 مليار إجمالاً و3.27 مليار نشطة، مقابل 78.1 مليار إجمالاً و3.46 مليار نشطة.

• السياق — 8,192 توكن من سياق التدريب المسبق على Origin، مقابل 16,384 على Kolibri، لتصل في النهاية إلى 262,144 أصليًا.

• البيانات — 7.51 تريليون توكن تدريب مسبق على Origin، مقابل 20 تريليون، مستمدة من مخزون خام يتجاوز 200 تريليون، قام خط المعالجة بترشيحه وإزالة التكرارات منه وتنقيحه.

• البنية المعمارية — طبقتان كثيفتان بالإضافة إلى 48 طبقة MoE على Origin، مقابل 50 طبقة MoE، مع تصميم انتباه مُغيّر، وثلاثة أضعاف عدد الخبراء، وتخلخل أعلى، وخوارزمية توجيه مُستبدلة.

• الاستدلال — وضع واحد على Origin، مقابل لا شيء، منخفض، متوسط، وعالٍ على Kolibri.

• الإصدار — لا يوجد إصدار عام لـ Origin، و3 أكتوبر 2026 لـ Kolibri.

الأرقام التي تتغيّر أكثر هي أرقام مجموعة المهام، حيث قيّم إطار التقييم نفسه كلا النموذجين. في المتوسط الألماني لمجموعة ما بعد التدريب، سجّل Origin ‏46.4 وسجّل Kolibri ‏70.8؛ وفي المتوسط الإنجليزي، 54.1 مقابل 75.5. في AIME 2025 بالألمانية، 73.5 مقابل 87.5. وفي معايير التقييم الداخلية البديلة للعملاء التي ينشرها المورّد كمجموعة قطاعية، انتقلت مجموعة مزوّدي السيارات من 0.72 إلى 0.99، وأشباه الموصلات من 0.35 إلى 0.80، والقطاع العام الألماني من 0.54 إلى 0.75، وتقنية الدفع الصناعي من 0.31 إلى 0.60، والفضاء الجوي من 0.14 إلى 0.59.

تلك الأرقام الداخلية الخاصة بالقطاعات يديرها المورّد على مجموعات تقييم من بنائه ومصمَّمة حول عملائه، لذا تعامل معها بوصفها وصفًا للنيّة لا درجةً. والغرض من نشرها أنها تشرح ما حُسِّن النموذج من أجله: ليس لوحة صدارة، بل مجموعة من وثائق القطاعات الخاضعة للتنظيم.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

الألمانية هنا قرار تصميمي، وليست وسمًا لغويًا

معظم بطاقات النماذج «متعددة اللغات» تعني مزيج تدريب صادف أنه تضمّن بعض الألمانية. أما هذه فقد بُنيت على النقيض من ذلك، والبطاقة دقيقة بشأن الآليات.

اكتشفت Aleph Alpha من تجارب صغيرة بنماذج وكيلة أن نحو 20 في المائة من البيانات الألمانية في المزيج أنتجت أفضل النتائج، وهو ما عنى، بالنسبة لتشغيل بحجم 20 تريليون رمز، إيجاد 4 تريليونات رمز ألماني. منحتها مجموعات البيانات الألمانية المفتوحة منزوعة التكرار والمرشّحة 390 مليارًا — أي أقل من الهدف بمرتبة قدر. وسدّت الفجوة بثلاث طرق: إعادة ضبط مرشّح Common Crawl خصيصًا للألمانية، ما أنتج 1.3 تريليون رمز عضوي فريد؛ وإعادة صياغة الوثائق الألمانية الموجودة إلى مدخلات على غرار الموسوعات، وحوارات أسئلة وأجوبة، ومقاطع نصية، ما أنتج نحو تريليون إضافي وأصبح أكبر مصدر ألماني منفرد؛ والترجمة، التي استُخدمت فقط في Kolibri Origin وأُسقطت في Kolibri. انتهى الألماني كمجموعة فريدة من 2.4 تريليون رمز، 80 في المائة منها منسّق أو مولّد داخليًا، وظهرت بنسبة 21.3 في المائة من رموز التدريب المسبق بعد إعادة أخذ العينات بالزيادة.

تفصيل المرشِّح يستحق الاقتباس لأنه من النوع الذي لا يظهر إلا في مختبر دُرِّب فعلاً على الألمانية. خط أنابيب البيانات اللغوية القياسي يُسقط المستندات التي تحتوي على عدد كبير جدًا من الكلمات الطويلة — لكن النثر الإداري الألماني يتجاوز بانتظام الحد الإنجليزي لمتوسط طول الكلمة، لذا تحذف الإعدادات الافتراضية بهدوء السجل اللغوي الذي تكتب به الإدارة العامة. النتيجة التجارية الواضحة هي أن نموذجًا دُرِّب على مرشِّح إنجليزي جاهز لا يمتلك أي مفردات قانونية-إدارية ألمانية تذكر، ولن يخبرك أي مقياس أداء بذلك.

يحظى المُرمِّز بالمعاملة نفسها. درّبت Aleph Alpha مُرمِّزًا ثنائي اللغة ألمانيًا-إنجليزيًا بمفردات تضم 128,000 رمز باستخدام طريقة جديدة تسميها UniBPE، تحافظ على الدمج من الأسفل إلى الأعلى في ترميز أزواج البايت لكنها تختار عمليات الدمج وفق هدف unigram. وعلى نصوص الويب الألمانية، يُبلَّغ عن متوسط 4.90 بايت لكل رمز، متقدمًا على GPT-5 عند 4.35، وGemini عند 4.13، وQwen3.5–3.8 عند 4.17، وGLM 5.3 عند 3.93، وDeepSeek V4 عند 3.72، وKimi K3 عند 3.28 — وكلها أرقام أبلغ عنها المورّد في مقارنته الخاصة. ويعني نص أكثر لكل رمز رموزًا أقل لكل مهمة، وهو أثر مباشر على تكلفة الاستدلال لا ادعاء بالجودة، وهو من نوع مكاسب الكفاءة التي تتراكم عبر عبء عمل معالجة المستندات.

ما لا يحسمه جدول المورّد

نشرت Aleph Alpha مقارنةً لما بعد التدريب شملت أربعة عشر نموذجًا، وهي أكثر فائدة من معظم جداول الإطلاق لأنها لا تجامل موضوعها.

على نفس منصة الاختبار، مع ضبط Kolibri عند جهد الاستدلال العالي، يحصل Qwen3.8 27B على 80.2 في المتوسط الإنجليزي مقابل 75.5 لـ Kolibri، و79.9 في المتوسط الألماني مقابل 70.8. كما يتقدم في GPQA Diamond وLiveCodeBench v6 وSWE-Bench Verified وفي اختباري السياق الطويل. يحصل Nemotron 3 Super 120B-A12B على 73.0 في الإنجليزية مقابل 75.5 لـ Kolibri — وهو أقرب، ومتقدم في AIME 2025. ويحصل Gemma 4 26B-A4B IT على 71.9 و66.3 في المتوسطين.

لذا فإن الخلاصة الصادقة للإصدار ليست «أحدث ما توصلت إليه التقنية». بل هي أن Kolibri يقع في منتصف مجال من النماذج التي تفعّل ما بين ثلاثة واثني عشر مليار معامل لكل رمز، وأنه يتفوق بوضوح على النماذج الأصغر منه بكثير، وأنه يخسر أمام نموذج كثيف بـ27 مليار معامل من Alibaba في معظم صفوف جدوله الخاص، بينما يفعّل نحو ثُمن المعاملات. إن تأطير Aleph Alpha لذلك هو جبهة باريتو للجودة مقابل الرموز المفككة في الثانية لكل وحدة معالجة رسومات — فلا يقدم أي من النماذج المقارنة جودة أعلى عند تكلفة الخدمة نفسها، ولا الجودة نفسها بتكلفة أقل. هذا هو الادعاء الذي ينبغي مساءلته، وهو ادعاء يخص اقتصاديات الخدمة، لا ادعاء قدرات.

لا يوجد أي من هذه الأرقام تم التحقق منه بشكل مستقل. لا يوجد مدخل لـ Kolibri في Artificial Analysis، ولا تكرار من طرف ثالث لإطار التقييم، والمعايير الرأسية من بناء المورّد. المقارنة أيضًا كريمة هيكليًا مع Kolibri في اتجاه واحد وغير كريمة في اتجاه آخر: جميع النماذج الأربعة عشر شُغّلت عبر أداة الاختبار الخاصة بـ Aleph Alpha مع مطالبات وإعدادات few-shot متطابقة، وهذه هي الطريقة الصحيحة لفعل ذلك، لكنها تظل أداة اختبار مختبر واحد. تعامل مع كل رقم في هذا القسم على أنه مُبلَّغ عنه من المورّد حتى يشغّله شخص آخر.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

ما تحتاجه لتشغيله

كوليبري ليس نموذجًا تجربه على حاسوب محمول. تمثل أوزان FP8 بصمة ذاكرة للنموذج تبلغ نحو 78 GB، والحد الأدنى من البطاقات هو بطاقتا A100 80 GB، أو بطاقتا H100 SXM5، أو H200 واحدة، أو B200 واحدة أو B300 واحدة؛ والتكوين الموصى به هو بطاقتا H100 SXM5، أو بطاقتا H200، أو B200 واحدة أو B300 واحدة.

يعني تقديمه كخدمة تثبيت حزمة aleph-alpha-inference، التي توفر إضافة Kolibri vLLM وتثبّت إصدار vLLM الذي تدعمه، أو سحب صورة الحاوية ghcr.io/aleph-alpha/aleph-alpha-inference. ومن هناك، يصبح الأمر استدعاءً قياسيًا لـ vLLM مع ذاكرة KV المؤقتة FP8، ومُحلّل استدلال Kolibri ومُحلّل استدعاء أدوات Kolibri. تحتاج السياقات التي تتجاوز 262,144 رمزًا إلى علامة صريحة للحد الأقصى لطول النموذج وتجاوز تضمين الموضع. معاملات أخذ العينات الموصى بها هي temperature 1.0 و top-p 0.97 و top-k 128.

واجهة الـAPI متوافقة مع OpenAI، وهذا الأمر أهم مما يبدو للوهلة الأولى: إذ يُمرَّر جهد الاستدلال عبر قالب المحادثة كقيمة reasoning_effort، وتُصدَر نداءات الأدوات في الحقل المعياري tools. والفريق الذي يتحدث بصيغة chat-completions أصلًا يستطيع توجيه كوده الحالي إلى نقطة نهاية Kolibri على جهاز في مبناه دون طبقة وسيطة.

ما لا يتوفر لدى Kolibri بعد

أربعة غيابات يجدر ذكرها بوضوح، لأن تغطية الإطلاق تميل إلى تجاهلها.

• لا يوجد تقييم مستقل. لا تمتلك Artificial Analysis صفحة نموذج لـ Kolibri، ولم ينشر أي طرف ثالث إعادة إنتاج لجدول المعايير الخاص بالبائع.

• لا توجد نقطة نهاية مُستضافة من المورّد. الإصدار عبارة عن أوزان بالإضافة إلى تقرير فني؛ لا توجد وحدة تعريف (SKU) لواجهة برمجة تطبيقات Aleph Alpha الخاصة بـ Kolibri في المواد المنشورة مع النموذج.

• لا يوجد مسار على OrcaRouter، ولا على أي مجمّع نذكر اسمه. لقد فحصنا الكتالوج تحت كل تهجئة لبادئة المورّد واسم الطراز، وKolibri غير موجود هناك — لذا إن أردت استدعاءه، فأنت تنزّل 78 غيغابايت وتشغّل نقطة نهاية vLLM بنفسك. نفضّل قول ذلك على الإيحاء بأننا نوفّره.

• لا إدخال متعدد الوسائط. نصٌ يدخل، نصٌ يخرج، لغتان. تلك هي المقايضة التي أجراها المختبر لصالح العمق على حساب الاتساع، وهي بالنسبة لنشرٍ لمعالجة المستندات على الأرجح الخيار الصحيح، لكنها حدّ حقيقي.

إذا كان ما تحتاجه فعلاً اليوم هو نموذج صغير من نوع مزيج الخبراء يمكنك استدعاؤه دون شراء وحدتي معالجة رسوميات، فإن فئة Gemma 4 MoE هي أقرب شيء متاح بالفعل على نقطة نهاية موجّهة، بسعر 0.06 دولار لكل مليون رمز إدخال و0.33 دولار لكل مليون رمز إخراج في نسخة 26B-A4B، مع نافذة من 262,144 رمزاً. وبالنسبة لأي شخص يوازن بين نشر سيادي مُستضاف ذاتياً بحجم 78B وهذا، فإن المقارنة المفيدة ليست صفوف المعايير — بل هي 78 غيغابايت من ذاكرة VRAM ومحادثة شراء مقابل بند تكلفة لكل رمز. يوجّه OrcaRouter تلك الفئة عبر مفتاح واحد متوافق مع OpenAI مع تمرير سعر القائمة الخاص بالمزوّد دون أي إضافة، وهذه هي الطريقة الرخيصة لمعرفة ما إذا كان عبء العمل يبرر امتلاك العتاد.

كوليبري نفسه هو الأثر الأكثر إثارة للاهتمام. نموذج ألماني-إنجليزي بـ78 مليار معامل تحت Apache 2.0، مع خط أنابيب البيانات، وطريقة المُرمِّز، ورقم الطاقة، وقصة تكرار على مدى ثلاثة أشهر تُنشر إلى جانب الأوزان، هو نوع مختلف من الإصدار عن إطلاق الأوزان المعتاد — فالإفصاح جزء من المنتج، وليس منشور مدونة عنه. أما ما إذا كان ادعاء باريتو يصمد، فهو الآن سؤال لمن لديهم اثنتان من H100 وساعة إيقاف، والجواب لن يأتي من أي شخص كتب بطاقة النموذج.