
اليوم الأول لـ Kolibri: أتاحت Aleph Alpha 78 مليارًا من الأوزان الألمانية-الإنجليزية، ورد الفعل يسبق الأدلة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 217 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
بعد أربع وعشرين ساعة على نشر Aleph Alpha Kolibri، تصلّب رد الفعل في سطر واحد، ويستحق تفكيك هذا السطر. فقد وضع مختبر هايدلبرغ نموذج خليط خبراء بـ78.1 مليار معامل على Hugging Face بموجب Apache 2.0 في 3 أكتوبر 2026، وأعلن عنه في الصباح نفسه في غرفة أخباره الخاصة ومن حسابه الخاص، وبحلول اليوم التالي صار الملخص المتداول في خلاصات الذكاء الاصطناعي يقول: 78 مليار معامل إجمالاً، و3.46 مليار معامل نشطة لكل رمز، وأوزان مفتوحة بموجب Apache 2.0، ومصمم للألمانية والإنجليزية. كل بند في تلك الجملة قابل للتحقق من المستودع. وما لم يُقَل إلى حد كبير هو أي أجزاء من الإصدار هي حقائق مقيسة وأيها مزاعم قدّمها المؤلفون عن نموذجهم الخاص لم يشغّله أحد خارج هايدلبرغ. تلك الفجوة هي قصة اليوم الأول، وهي تهم أكثر من الرقم الرئيسي.
ابدأ بالجدول الزمني، لأن قدرًا مفاجئًا من ردود الفعل تعامل مع هذا على أنه إصدار صامت غامض، ولم يكن كذلك. مستودع Hugging Face Aleph-Alpha/Kolibri-1 أُنشئ في 2 أكتوبر 2026 الساعة 05:54:02 بتوقيت UTC، وتحمل بطاقة النموذج تاريخ إصدار معلن هو 3 أكتوبر، وصدر منشور غرفة أخبار المورّد في الصباح نفسه عند الساعة 08:43:53 بتوقيت غرينتش — في يوم الوحدة الألمانية، وهو تاريخ اختاره المختبر بوضوح. نشر حساب Aleph Alpha نفسه عنه في غضون دقائق. لم يكن هناك حظر نشر صحفي ولا حدث إطلاق، ومن المرجح أن هذا هو مصدر صيغة «الإصدار الهادئ»، لكن منشور غرفة أخبار المورّد وتقرير تقني وإعلان رسمي لا تشكّل إصدارًا هادئًا. إنه إصدار عادي ببساطة لم تغطّه الصحافة العامة للذكاء الاصطناعي في ذلك اليوم.
الرقم الذي يكرره التفاعل
السبب في أن رقم 3.46 مليار نشط هو الرقم الذي يستشهد به الجميع هو أنه الرقم الوحيد في الإصدار الذي يغيّر ما يتعيّن على المشتري أن يمتلكه. Kolibri هو محوّل من 50 طبقة، كل طبقة فيه عبارة عن مزيج من الخبراء، بواقع 384 خبيرًا في كل طبقة، واحد مشترك وستة موجّهة، بإجمالي 78,103,074,560 معاملًا. ولكل رمز ينشّط 3,457,573,120 منها — أي نسبة تناثر تبلغ نحو 22.6 إلى 1. وهذا ما يجعل نموذجًا بـ78 مليار معامل قابلًا للتشغيل على زوج من H100s بدلًا من رفّ كامل، وهو الادعاء الأكثر أثرًا في الإصدار.
حوله تقع الأرقام الرئيسية الأخرى، وكلها من بطاقة النموذج وليس من تشغيل مستقل:
• السياق — دُرّب على 16,384 رمزًا، ودُرّب تدريبًا متوسطًا على 65,536، ونافذته الأصلية 262,144، وتم التحقق منه حتى 1,048,576. توصي البطاقة بالبقاء عند 262,144 أو أقل للأعمال الحساسة لزمن الاستجابة. لاحظ بعناية أن عبارة «سياق 1M» المجردة التي ستراها في الملخصات هي السقف الذي تم التحقق منه، وليست النافذة الأصلية.
• الدقة — أوزان FP8 في كتل 128x128 مع تنشيطات مُكمَّاة ديناميكيًا، ويُقيَّم ذلك باستخدام ذاكرة تخزين مؤقت KV بصيغة FP8؛ أما التضمينات ورأس LM وطبقات التطبيع وموجّه MoE فتبقى بصيغة bfloat16.
• الاستدلال — أربعة مستويات جهد — لا شيء، منخفض، متوسط، مرتفع — يتم ضبطها عبر قالب المحادثة، مع استدعاء أدوات بأسلوب Hermes ومحلّل vLLM مرفق في المستودع نفسه الذي توجد فيه الأوزان.
• اللغات — الألمانية والإنجليزية، ولا شيء غير ذلك.
• التدريب — 20 تريليون رمز تدريب مسبق على مجموعة نصوص ثنائية اللغة مُفلترة تتكوّن تقريبًا من 62.5 في المائة من الإنجليزية، و23.9 في المائة من الألمانية، و13.6 في المائة من الشيفرة، بالإضافة إلى 3.44 تريليون رمز للتدريب المتوسط و201 مليار لتوسيع السياق الطويل.
• الحوسبة والطاقة — 768 من وحدات NVIDIA B200 عبر 96 عقدة HGX، و21 يومًا من التدريب المسبق لمدة 511 ساعة و392,000 ساعة GPU، عند 6.4x10^23 من عمليات FLOPs كما أُبلغ عنها، و9.5x10^2 ميجاواط-ساعة تقديريًا بما في ذلك التكاليف العامة لمركز البيانات، باستثناء الضبط الدقيق الخاضع للإشراف والتعلم المعزز.
• الترخيص — Apache 2.0. لا ملحق للاستخدام المقبول، ولا حد للمستخدمين النشطين شهريًا، ولا شروط تجارية منفصلة.
الادّعاءان اللذان لم يتحقّق منهما أحد
هذا هو الجزء من اليوم الأول الذي تخطّاه ردّ الفعل، وهو الجزء الذي يحدّد ما إذا كان Kolibri مهمًّا أم مجرد مثير للاهتمام.
الأول هو ادعاء اقتصاديات الخدمة. لا تتمثل صياغة Aleph Alpha في أن Kolibri هو أقوى نموذج متاح — فهو ليس كذلك في جدول المقارنة الخاص بالمختبر نفسه، والمختبر يقول ذلك. بل تتمثل صياغتها في أنه لا يوجد نموذج مُقارَن يقدّم جودة أعلى بالتكلفة نفسها للخدمة، أو الجودة نفسها بتكلفة أقل، على امتداد حدود باريتو للجودة مقابل الرموز المُفكَّكة في الثانية لكل GPU. وهذا ادعاء بشأن معدل الإنتاجية على عتاد بعينه، وهو بالضبط نوع الادعاء الذي لا يمكن أن يحسمه إلا طرف ثالث لديه ساعة إيقاف ووحدتا H100. ولم يحسمه أحد. لا يوجد مدخل لـ Kolibri في Artificial Analysis حتى 4 أكتوبر 2026، ولا إعادة إنتاج من طرف ثالث لمنظومة التقييم.
الثاني هو ادعاء المُرمِّز. درّبت Aleph Alpha مُرمِّزًا ثنائي اللغة ألمانيًا-إنجليزيًا بمفردات من 128,000 رمز باستخدام طريقة تسميها UniBPE، وتُبلِغ عن 4.90 بايت في المتوسط لكل رمز على نص ويب ألماني مقابل GPT-5 عند 4.35، وGemini عند 4.13، وQwen 3.5-3.8 عند 4.17، وGLM 5.3 عند 3.93، وDeepSeek V4 عند 3.72، وKimi K3 عند 3.28. كل واحد من تلك الأرقام مصدره المورّد نفسه، مقيسًا على مجموعة نصوص المورّد نفسه، مقابل منافسين اختارهم المورّد. زيادة النص لكل رمز أثر حقيقي في تكلفة الاستدلال وليست ادعاءً بالجودة، وإذا ثبت ذلك فإنه يتراكم عبر أي عبء عمل لمعالجة المستندات — لكنه قياس مختبر واحد، وليس نتيجة اختبار معياري.
الألمانية هي المقصد، وهي الهندسة الأكثر إثارةً للاهتمام في الإصدار.
معظم بطاقات النماذج «متعددة اللغات» تصف مزيجًا تدريبيًا صادف أنه ضمّ الألمانية. أما هذا النموذج فقد بُني بالطريقة المعاكسة، والبطاقة محددة على نحو غير معتاد بشأن الآليات.
قادت تجارب صغيرة على نموذج وكيل إلى وصول Aleph Alpha إلى هدف يتمثل في نحو 20 بالمائة من البيانات الألمانية في المزيج، وهو ما يعني بالنسبة لعملية تدريب بحجم 20 تريليون توكن إيجاد 4 تريليونات توكن ألماني. وقد وفرت مجموعات البيانات الألمانية المفتوحة، بعد إزالة التكرارات وتصفيتها، 390 مليارًا — أي أقل بمرتبة عشرية. سدّ المختبر الفجوة بثلاث طرق: إعادة ضبط مرشّح Common Crawl خصيصًا للألمانية، مما أنتج 1.3 تريليون توكن عضوي فريد؛ وإعادة صياغة الوثائق الألمانية إلى مدخلات موسوعية وحوارات سؤال وجواب ومقاطع نصية، مما أنتج نحو تريليون آخر وأصبح أكبر مصدر ألماني منفرد؛ والترجمة، التي استُخدمت للنموذج السابق وتم التخلي عنها عمدًا في Kolibri. وفي النهاية، أصبحت الألمانية مجمعًا فريدًا يضم 2.4 تريليون توكن، 80 بالمائة منه مُنتقى أو مُولَّد داخليًا، وظهرت بنسبة 21.3 بالمائة من توكنات التدريب المسبق بعد رفع العينات.
تفصيل المرشّح هو من النوع الذي لا يظهر إلا في مختبر دُرِّب فعلاً على الألمانية. فمرشّح بيانات اللغة القياسي يستبعد المستندات ذات الكلمات الطويلة أكثر من اللازم — لكن النثر الإداري الألماني يتجاوز بانتظام الحد الإنجليزي لطول الكلمة، لذا تُخفي الإعدادات الافتراضية بهدوء السجل اللغوي الذي تكتب به الإدارة العامة. والنموذج المدرَّب على مرشّح إنجليزي جاهز لا يملك مفردات قانونية إدارية ألمانية تُذكر، ولن يخبرك أي معيار تقييم بذلك.
ما يوضحه جدول المقارنة في الواقع
نشرت Aleph Alpha مقارنة لما بعد التدريب تغطي أربعة عشر نموذجًا، وهي أكثر فائدة من معظم جداول الإطلاق لأنها لا تجامل الموضوع. على نفس منصة الاختبار مع Kolibri عند جهد الاستدلال المرتفع، يسجل Qwen3.8 27B نتيجة 80.2 في المتوسط الإنجليزي مقابل 75.5 لـ Kolibri، و79.9 في المتوسط الألماني مقابل 70.8، ويتقدم في GPQA Diamond وLiveCodeBench v6 وSWE-Bench Verified وكلا معياري السياق الطويل. يسجل Nemotron 3 Super 120B-A12B نتيجة 73.0 في الإنجليزية مقابل 75.5 لـ Kolibri. يسجل Gemma 4 26B-A4B IT نتيجة 71.9 و66.3 في المتوسطين.
لذا، فالخلاصة الصادقة لهذا الإصدار ليست «الأحدث في المجال». بل إن Kolibri يقع في منتصف مجال من النماذج التي تفعّل ما بين ثلاثة واثني عشر مليار معامل لكل توكن، وأنه يتفوق بوضوح على النماذج الأصغر منه بكثير، وأنه يخسر أمام نموذج كثيف بـ27 مليار معامل من Alibaba في معظم صفوف جدوله الخاص بينما يفعّل نحو ثُمن المعاملات. وما إذا كانت الاقتصاديات تنقذ تلك الفجوة هو ادعاء Pareto، وادعاء Pareto غير مُختبَر.

كيف ستسميه فعليًا، اليوم
لا توجد نقطة نهاية مستضافة من المورّد — فالإصدار عبارة عن أوزان بالإضافة إلى تقرير فني، مع عدم وجود SKU لواجهة Aleph Alpha API الخاصة بـ Kolibri في المواد المنشورة. كذلك لا يوجد مسار له على OrcaRouter: لقد فحصنا الكتالوج تحت كل تهجئة لبادئة المورّد واسم النموذج، وKolibri غير موجود هناك، لذا فإن استدعاءه اليوم يعني تنزيل نحو 78 GB من أوزان FP8 وتشغيل نقطة نهاية vLLM بنفسك من aleph-alpha-inference، الحزمة أو صورة الحاوية المنشورة.
هذا قرار شراء حقيقي، وليس حاشية، وهو المجال الذي تثبت فيه طبقة التوجيه مكانتها حتى مع نموذج لا تحمله. المقارنة الصادقة لأي شخص يزن نشرًا سياديًا مستضافًا ذاتيًا بحجم 78B ليست صفوف المقارنات المعيارية — بل هي 78 غيغابايت من ذاكرة VRAM ومحادثة شراء مقابل بند تكلفة لكل رمز على أجهزة يملكها شخص آخر. إذا كان ما تحتاجه فعليًا هذا الشهر هو نموذج صغير بخليط من الخبراء يمكنك استدعاؤه دون شراء وحدتي GPU، فإن فئة Gemma 4 26B-A4B هي أقرب شيء متاح بالفعل على نقطة نهاية موجّهة، بسعر 0.06 دولار لكل مليون رمز إدخال و0.33 دولار لكل مليون رمز إخراج مع نافذة 262,144 رمزًا، وتقوم OrcaRouter بتوجيه تلك الفئة عبر مفتاح واحد متوافق مع OpenAI بسعر القائمة الخاص بالمزوّد دون أي إضافة. تلك هي الطريقة الرخيصة لمعرفة ما إذا كان عبء العمل يبرر امتلاك الأجهزة قبل وصول الأجهزة.

ما يجب مراقبته، وما قد يغيّر الحكم
ثلاثة أمور، مرتّبة حسب مقدار ما قد تغيّر به الصورة.
إن قياسًا مستقلًا للإنتاجية عند التكوين الموصى به من البطاقة، وهو تكوين بطاقتَي H100، سيؤكد ادّعاء باريتو، وهو الادّعاء الوحيد في البيان الجديد فعلًا وليس مجرد إعادة صياغة لورقة المواصفات. وإعادة إنتاج مستقلة لمتوسطات مجموعة مهام الألمانية والإنجليزية ستخبرك ما إذا كانت الفجوة إلى Qwen3.8 27B ضيقة كما يوحي مزوّد البطاقة نفسه أو أضيق. وتقييم باللغة الألمانية على نص إداري حقيقي — لا اختبار قياسي عام مترجم — سيختبر الشيء الذي بُني البيان من أجله فعليًا، وهو ما لا تقيسه أي لوحة صدارة حاليًا.
حتى يتحقق أحد تلك الأمور، فإن التأطير الصحيح هو الذي يدعمه المستودع نفسه. كوليبري إصدار حقيقي مفتوح الأوزان من مختبر أوروبي، وعلى نطاق لم تطرحه مختبرات أوروبية من قبل، وبشروط Apache 2.0 لم تضاهها أي شركة قائمة، وخط أنابيب بيانات منشور إلى جانب الأوزان، وقصة تكرار من نموذجين أكثر إثارة من الرقم الرئيسي. وهو أيضًا، في الوقت الحالي، نموذج تأتي أكثر أرقامه اقتباسًا من مؤلفيه أنفسهم. كلتا الجملتين صحيحتان في اليوم الأول، والثانية هي التي أغفلها رد الفعل.

