
Kolibri مقابل Intern-Decision 4B: أحدهما يكتب المستندات، والآخر يرفض كتابة أي شيء على الإطلاق
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 217 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
أكثر ما يستحق الملاحظة بشأن Kolibri وIntern-Decision-4B هو أنهما ليسا من النوع نفسه من الكائنات، وأن التعامل معهما على أنهما مقارنة بين نموذج ونموذج سيكون خطأً فئويًا. Kolibri هو النموذج اللغوي من نوع مزيج الخبراء (mixture-of-experts) التابع لـ Aleph Alpha، البالغ عدد معاملاته 78.1 مليارًا، وصدر في 3 أكتوبر 2026، ويُنشّط 3.46 مليار معامل لكل توكن، ويكتب نصوصًا بالألمانية والإنجليزية. أما Intern-Decision-4B فهو نموذج قرار مُهيكل متعدد الوسائط بعدد 4.54 مليار معامل من فريق InternLM، رُفع إلى Hugging Face في 26 سبتمبر 2026، وتنص بطاقته بصراحة على أنه "لا يستدعي generate() ولا يأخذ عينات من نص حر" على الإطلاق. أحدها ينتج نثرًا. والآخر ينتج توزيعًا احتماليًا على الخيارات التي تقدمها، في تمريرة أمامية واحدة، ولا قدرة لديه على كتابة جملة. ولا يصبحان متنافسين إلا في حالة ضيقة واحدة، ومعرفة أي حالة بالتحديد هي ما يتبيّن أنه أكثر ما يفيد في أيٍّ من الإصدارين.
إصداران، وادعاءان موجزان مختلفان تمامًا
بطاقة Kolibri هي مواصفات نموذج لغوي كبير متناثر: 50 طبقة، كلها مزيج خبراء، و384 خبيرًا في كل طبقة بواقع خبير مشترك وستة خبراء موجّهين، وسياق أصلي من 262,144 توكنًا تم التحقق منه حتى 1,048,576، وأربعة مستويات لجهد الاستدلال، واستدعاء أدوات بأسلوب Hermes مع محلل vLLM مرفق، وأوزان FP8 في كتل 128×128، وشروط Apache 2.0. جرى تدريبه على 20 تريليون توكن باستخدام 768 من NVIDIA B200 على مدى 21 يومًا — 392,000 ساعة GPU عند 6.4×10²³ عملية FLOPs كما أُبلغ عنها و9.5×10² ميجاواط ساعة مقدّرة، بما يشمل التكاليف العامة لمركز البيانات، باستثناء الضبط الدقيق الخاضع للإشراف والتعلم المعزّز. الحد الأدنى لتكوين الخدمة في البطاقة هو بطاقتا A100 بسعة 80 GB، واثنتان من H100 SXM5، وواحدة H200، وواحدة B200 أو واحدة B300، وبصمة FP8 نحو 78 GB. إنه قطعة جادة من البنية التحتية، ويجيب عن الأسئلة عبر توليد النص.
Intern-Decision-4B هو نوع معاكس من الكائنات، والبطاقة صريحة بشكل منعش حيال ذلك. إنه ضبط دقيق لـ Qwen3.5-4B حيث يكون برج الرؤية والمُسقِط مجمّدين ولا يُدرَّب سوى العمود الفقري اللغوي. تعطيه حالة، ومخططًا لأسئلة مسمّاة، واختياريًا ما يصل إلى ثماني صور، فيعيد توزيعًا على الإجابات المرشحة لكل سؤال دفعة واحدة. الآلية غير معتادة وتستحق أن تُذكر بدقة: تُقابَل الخيارات برموز من توكن واحد تمتد من A إلى Z، ومن a إلى z، ومن 0 إلى 9 — أي 62 مرشحًا، وبالتالي حد أقصى 62 خيارًا لكل سؤال — ثم يُصاغ الموجّه بعنصر نائب واحد لكل حقل، ويقرأ النموذج اللوجيتات عند الموضع الذي يسبق كل عنصر نائب مباشرةً. تُشغَّل Softmax على لوجيتات الرموز المسموح بها لذلك الحقل فقط، وتُعاير درجة حرارة خاصة بنقطة التحقق النتيجة، ثم تُعاد الرموز إلى قيم خياراتك الأصلية بصيغة JSON ذات أنواع. لا توجد حلقة فك ترميز، ولا أخذ عينات، ولا نثر.
• الإخراج — Kolibri: نص ألماني أو إنجليزي مُولَّد بحرية، واستدعاءات أدوات، وآثار استدلال. Intern-Decision-4B: إجابات JSON مُنمّطة مع احتمال لكل خيار.
• المعاملات — Kolibri: 78,103,074,560 إجمالاً، 3,457,573,120 نشطة. Intern-Decision-4B: 4.54 مليار موزّعة على أربع شظايا safetensors بصيغة bfloat16، مع برج رؤية مجمّد.
• الإدخال — Kolibri: نص فقط. Intern-Decision-4B: نص بالإضافة إلى ما يصل إلى ثماني صور.
• سعة الأسئلة — Intern-Decision-4B: حتى 62 خيارًا لكل حقل، في تمريرة أمامية واحدة، مع أنواع الأسئلة 'choice' و'score' و'noul' (نعم/لا). Kolibri: غير محدود من حيث المبدأ، لكنه عمليًا رمز واحد في كل مرة.
• اللغة — Kolibri: الألمانية والإنجليزية بحكم التصميم. Intern-Decision-4B: أيًّا كان ما يحمله Qwen3.5-4B، مع جميع حزم التقييم المنشورة بالإنجليزية.
• زمن الاستجابة — Intern-Decision-4B: 44.16 ms متوسط، و44.03 ms وسيط، و44.60 ms عند P95 لكل استعلام على بطاقة RTX 4090 واحدة، وفقًا لقياسه الخاص. Kolibri: لا يوجد أي رقم منشور لكل استعلام على الإطلاق.
• الترخيص — كلاهما Apache 2.0؛ يُشحن Intern-Decision-4B مع الاحتفاظ بملف ترخيص Qwen إلى جانبه.

لماذا يوجد مُقيِّم بحجم 4B من الأساس
الحجة لصالح Intern-Decision-4B ليست أنه صغير. بل إن طلب احتمال من نموذج توليدي كبير ليس مماثلاً لقياسه، والفرق قابل للقياس.
جدول القياسات المرجعي الخاص بالبطاقة نفسه يقدّم الحجة بقدر غير معتاد من الإفصاح عن الذات. عبر سبع مجموعات اختبار للدقة، يحقق Intern-Decision-4B في المتوسط 90.02 — مقابل 88.74 لأقوى خط أساس يقارن نفسه به، وهو نموذج يُدعى Jev. لكن الدقة هي النصف غير المثير للاهتمام. يعرض الجدول أيضًا درجة Brier وخطأ المعايرة المتوقع، وهناك تكون الصورة أكثر صرامة. يسجّل 4B درجة Brier قدرها 0.347 وECE قدره 0.065، مقابل 0.358 و0.095 لدى Jev. النماذج الشقيقة الأصغر هي حيث تصبح قصة المعايرة مفيدة حقًا. يسجّل Intern-Decision-2B متوسط 84.68، متقدمًا كثيرًا على 0.8B عند 79.38 — ومع ذلك فإن ECE لديه 0.100 أسوأ من 0.066 لدى 0.8B وأسوأ من 0.065 لدى 4B، مع درجة Brier قدرها 0.437 مقابل 0.530 لدى 0.8B. الأكثر دقة بين النموذجين الصغيرين هو الأقل صدقًا بشأن ثقته بنفسه. إذا كنت قد افترضت أن المعايرة تتحسن مع الدقة، أو مع عدد المعاملات، فإن ذلك الجدول هو المثال المضاد في الحالتين.
تشخيص ثانٍ منفصل يغطي 96 حالة مبنية على توزيعات مرجعية دقيقة بدلاً من تسميات صلبة مُعيّنة — سحوبات عشوائية، وأحداث مركّبة، وتاريخ شرطي، وأحاجي احتمالية. انخفض خطأ نموذج 4B في تلك التجربة الاستطلاعية من 0.628 إلى 0.550 على المقياس المُبلّغ عنه، بينما استقر النموذج المقارن عند 0.595. وتوضّح البطاقة صراحةً أن هذه التجربة الاستطلاعية لم تُستخدم لملاءمة أو اختيار درجة الحرارة المنشورة؛ فقد لُوّمت درجة حرارة 4B البالغة 1.992418 بشكل منفصل على مجموعة معايرة. كما أدرج فريق InternLM المعيار نفسه في مستودع GitHub — المولّد الحتمي، والمراجع، والمقيّم دون اتصال — ما يعني أن ادعاء المعايرة من النوع النادر الذي يمكن لطرف ثالث أن يعيد تشغيله فعليًا بدلاً من قبوله على الثقة.
لا شيء في إصدار Kolibri يقدّم ما يعادله. فجدول المقارنة الخاص به يسرد دقة المهام عبر أربعة عشر نموذجًا على أداة تقييم واحدة تابعة لمورّد واحد، والدقة هي المقياس الذي يمكن قياس نموذج توليدي به. لا يوجد أي رقم معايرة، ولا Brier أو ECE في أي مكان من المواد، ولا توجد طريقة لسؤاله عن «احتمال أن يكون بند العقد هذا قابلًا للتنفيذ» لا تتضمن أخذ عيّنة من جملة وقراءتها.
الدرز الوحيد حيث يلتقيان
ضع الاثنين جنبًا إلى جنب في مسار عمل حقيقي وستتضح المعالم على الفور. يحتاج سير عمل المستندات الألماني إلى كلا النصفين، ولا تغطي أي من الأداتين نصف الأخرى.
كوليبري هو النصف الذي يقرأ ويكتب. الفريق الذي لديه عقود ألمانية أو وثائق تقنية يحصل على نافذة أصلية بسعة 262,144 توكن، وذاكرة KV مؤقتة بتنسيق FP8، ومُرمِّز ثنائي اللغة تُفيد Aleph Alpha بأنه يبلغ 4.90 بايت في المتوسط لكل توكن على النصوص الألمانية على الويب، واستدعاء أدوات Hermes — أي نموذج يستطيع تلخيص مستند رسمي، وصياغة رد، وتشغيل حلقة أدوات. ما لا يستطيع فعله هو أن يخبرك بثقته الخاصة بطريقة يمكنك تدقيقها، لأن كل ما يصدره هو سلسلة مُولَّدة بالمعاينة.
Intern-Decision-4B هو النصف الذي يقرّر. عند إعطائه صفحة من نص ألماني ومجموعة ثابتة من الخيارات، يُعيد توزيعًا معايرًا في 44 مللي ثانية على وحدة معالجة رسومات استهلاكية واحدة، دون خطوة توليد، وبالتالي دون أي تباين في العينات على الإطلاق. ما لا يستطيع فعله هو إنتاج النص الألماني في المقام الأول، كما أن مجموعات التقييم المنشورة الخاصة به إنجليزية — فسلوكه بالألمانية موروث من قاعدة Qwen3.5-4B وليس مدرَّبًا عليه، وهو قيد حقيقي لعملية نشر بالألمانية ولم يقيّمه أحد.
إذن، الإجابة الهندسية الصادقة لسير عمل منظّم باللغة الألمانية هي أن هاتين مرحلتان من خط أنابيب واحد، وليستا مرشحين لخانة واحدة. والسؤال العملي هو أين تعمل كل واحدة منهما. يحتاج Kolibri إلى اثنتين من H100s أو B200 وحوالي 78 GB. ويحتاج Intern-Decision-4B إلى واحدة RTX 4090 وينفّذ استعلامًا في أقل من 45 مللي ثانية. وعدم التماثل في التكلفة يبلغ نحو مرتبتين من حيث الحجم على صعيد العتاد، وهو يشير إلى تصميم يعمل فيه مُقيِّم صغير باستمرار على كل حالة، ولا يُستدعى المُولِّد الكبير إلا عندما تحتاج الحالة فعلاً إلى نص نثري. وهذا شكل أرخص وأكثر ملاءمة للتدقيق من تمرير كل حالة عبر نموذج 78B للحصول على إجابة يتعين عليك بعد ذلك تفسيرها.

واقع الاستضافة لكليهما، وما الغرض من الطبقة
لا يتوفر أي من النموذجين كـ API مستضاف، وقد تحققنا بدلاً من الافتراض. لا يملك Intern-Decision-4B نقطة نهاية من البائع؛ فالإصدار عبارة عن أوزان، ومستودع GitHub، وHugging Face Space. لقد تحركت أعداد التنزيل والعد منذ منتصف الأسبوع، وهو ما يخبرك أن الناس يتبنونه، ولكن لا يزال لا يوجد مسار مدفوع قابل للاستدعاء في أي مكان نسميه.
كذلك لا يملك Kolibri أي SKU لواجهة برمجة تطبيقات Aleph Alpha — فالإصدار عبارة عن أوزان وتقرير تقني وصورة حاوية على ghcr.io/aleph-alpha/aleph-alpha-inference. وهو غير موجود على OrcaRouter: فقد فحصنا الكتالوج بكل تهجئة ممكنة لبادئة المورّد واسم الطراز، ولا يُعيد سوى «لم يُعثر عليه»، وهو ما نفضّل قوله بدلًا من الإيحاء بغير ذلك.
ما تغيّره طبقة التوجيه هنا ليس الوصول إلى هذين النموذجين، بل اقتصاديات تقرير ما إذا كان ينبغي شراء العتاد لأيّ منهما. والاختبار النزيه قبل الشراء للنصف التوليدي هو تشغيل عبء العمل مقابل طبقة صغيرة من خليط الخبراء تكون موجّهة بالفعل — نسخة Gemma 4 26B-A4B بسعر $0.06 لكل مليون رمز إدخال و$0.33 لكل مليون رمز إخراج مع نافذة 262,144 رمزاً وإدخال نص وصورة وفيديو — على مفتاح واحد متوافق مع OpenAI بسعر قائمة المزوّد دون أي إضافات، وانظر ما إذا كان عبء عمل المستندات الألمانية يحتاج فعلاً إلى 78 مليار معامل قبل طلب وحدات GPU. ليس للنصف الخاص بالقرار مثل هذا الاختصار، لأن سلوك التوزيع المعاير هو جوهر النموذج ولا تقوم به أي طبقة موجّهة. لكن هذا في حد ذاته هو الاكتشاف: يخبرك أن مقيّم 4B هو الجزء الذي ستستضيفه ذاتياً فعلاً، وأن المولّد هو الجزء الذي يستحق إعادة اختباره مقابل شيء يمكنك استئجاره بعد ظهر هذا اليوم.
ما الذي سيحسم الأمر؟
قياسان، ولم يوجد أيٌّ منهما بعد.
الأول هو Intern-Decision-4B على مُدخل ألماني. كل حزمة اختبارات منشورة هي بالإنجليزية، والنموذج ضبط دقيق لقاعدة متعددة اللغات، لذا فإن معايرته الألمانية غير معروفة — والمعايرة هي بالتحديد الخاصية التي لا تنتقل مجانًا عبر اللغات. وستُعد نسخة ألمانية من البرنامج التجريبي لتوزيع الحالات الـ96 المخرج الأكثر إفادة على الإطلاق الذي يمكن لأي شخص نشره عن هذا النموذج.
والثاني هو تكلفة كوليبري لكل قرار. فادّعاؤها في اقتصاديات الخدمة هو حدود باريتو بين الجودة وعدد الرموز المفكوكة ترميزها في الثانية لكل وحدة معالجة رسومية، ولا توجد صفحة لـ Arti
حتى ذلك الحين، الطريقة الصحيحة لقراءة هذه الاقتران ليست باعتباره تنافسًا. إن Intern-Decision-4B هو الإصدار الأكثر إثارة للاهتمام تقنيًا بين الاثنين، لأن المخرجات المهيكلة الواعية بالمعايرة قدرة لا تكاد أي نموذج توليدي يقدمها، كما أن بطاقته تتيح لك التحقق من الادعاء. أما Kolibri فهو الإصدار الأكثر أثرًا، لأن مختبرًا أوروبيًا يطلق نموذجًا برخصة Apache 2.0 بحجم 78 مليار معامل مع نشر خط أنابيب البيانات إلى جانبه يُعد حدثًا في سلسلة التوريد لا مجرد حدث يتعلق بنموذج. لا يحل أحدهما محل الآخر. وعلى الفرق التي تحتاج إلى كليهما أن تخطط لكليهما وأن تحدد حجم العتاد بناءً على ذلك، وحينها يكون الإطار المحيط بهما هو الموضع الذي يذهب إليه الجهد الهندسي فعليًا.

