
Intern-Decision-0.8B مقابل Qwen 3.8: 853 مليون معامل ومجموعة مغلقة من الإجابات
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 592 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 187 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
إن Intern-Decision-0.8B هو الأصغر بين ثلاثة نماذج قرار دفعتها InternLM إلى Hugging Face في صباح 26 سبتمبر 2026، وهو ليس الأسرع بينها. هذا أول ما يجدر معرفته. وفقًا لقياسات المختبر نفسه، فإن الشقيق 2B يعمل بشكل أسرع بشكل طفيف — 33.28 مللي ثانية مقابل 33.98 مللي ثانية — ويسجل أعلى بست نقاط في نفس المتوسط المكون من سبع مجموعات، لذا فإن السبب المعتاد للجوء إلى نقطة تفتيش دون المليار، ألا وهو السرعة الخام، لا ينطبق هنا. ما ينطبق هو الحجم: 852,985,920 معاملًا، 1.71 جيجابايت من أوزان bf16، صغير بما يكفي ليبقى بشكل دائم في هامش آلة لديها شيء آخر تفعله. ضع ذلك مقابل Qwen3.8-Max — التسليم المستضاف لنواة خليط الخبراء المتناثرة ذات 2.4 تريليون معامل التي نشرها المورد في أغسطس، بسعر 2.00 دولار و6.00 دولار لكل مليون رمز — والاثنان لا يتنافسان على نفس الوظيفة. أحدهما يعيد توزيعًا احتماليًا على الخيارات التي قدمتها مسبقًا. والآخر يكتب.
الجواب القصير: يستحق Intern-Decision-0.8B أن تقتنيه إذا كنت بحاجة إلى قرار ضمن مجموعة مغلقة يُقيَّم على عتاد تملكه بالفعل، وإذا كان 1.71 GB بدلاً من 4.43 GB هو الفرق بين الإطلاق وعدمه. ولا يستحق أن تقتنيه إذا كنت تريد أدق مُقيِّم صغير أطلقته InternLM هذا الأسبوع — وهو 4B — أو إذا لم تكن إجابتك مُعدَّدة بالفعل في التوجيه الخاص بك، وفي هذه الحالة لا تكون أي من هاتين الأداتين هي الأداة الصحيحة، وQwen 3.8 هو الوحيد من بينهما القادر على أداء المهمة أصلاً.
ما يقوله المستودع، وما لا يقوله أي شيء آخر
ابدأ بالأدلة، لأنه لا يوجد إلا القليل منها. لم تصدر InternLM أي إعلان عن هذا النموذج. لا منشور إطلاق، ولا ورقة بحثية، ولا وصف مستودع. تربط بطاقة Hugging Face مساحة Space تجريبية ومستودع GitHub، وحتى كتابة هذه السطور، يعيد Space الرمز 401 ويعيد رابط GitHub الرمز 404 — المكانان اللذان تشير إليهما البطاقة لمزيد من المعلومات مغلقان. ظهرت ثلاث نقاط تفتيش بفارق أربعين ثانية إحداها عن الأخرى في حوالي الساعة 05:36 UTC يوم 26 سبتمبر: Intern-Decision-0.8B وIntern-Decision-2B وIntern-Decision-4B، وكلها تحمل الوسوم نفسها — صنع القرار، متعدد الوسائط، التنبؤ المهيكل — وجميعها نسخ مضبوطة بدقة من نقاط تفتيش Qwen، في هذه الحالة Qwen3.5-0.8B.
ما يمكن معرفته من المستودع دقيق على نحو غير معتاد لإصدار لم يُعلَن عنه، لأن المختبر شحن وحدة الاستدلال الخاصة به إلى جانب الأوزان. يُحمَّل 0.8B عبر 16 كيلوبايت inference.py في دليل النموذج، ويتطلب Python 3.12 أو أحدث وtorch 2.9.1 مع transformers 5.14.1، ويكشف عن فئة DecisionEngine تُنشئها مرة واحدة وتعيد استخدامها. إدخال قاموس Python واحد، وإخراج قاموس استجابة واحد. ما لا يمكن معرفته: هل هذا إصدار مكتمل أم دفعة مبكرة، وهل ستأتي نقطة نهاية مستضافة، وهل المقصود بنقطتي التفتيش اللتين يقع بينهما هو المنتج نفسه بأحجام مختلفة أم ثلاثة منتجات مختلفة تشترك في اسم واحد. لم يشغّل أحد خارج InternLM أيًّا منها.

مشكلة الشقيق: 2B أسرع وأفضل
إليك الجزء من جدول InternLM المنشور الذي يجعل من الصعب تحديد مكانة 0.8B. بقراءة الأحجام الثلاثة عبر المجموعات السبع نفسها:
• السرعة — 0.8B: 33.98 مللي ثانية متوسطًا، 33.44 مللي ثانية وسيطًا، 37.50 مللي ثانية عند p95. 2B: 33.28 مللي ثانية، 33.15 مللي ثانية، 33.55 مللي ثانية. 4B: 44.16 مللي ثانية، 44.03 مللي ثانية، 44.60 مللي ثانية. جرى قياس كل ذلك لكل استعلام على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي.
• متوسط المجموعات السبع — 0.8B: 79.38. 2B: 84.68. 4B: 90.02.
• المعايرة — 0.8B: Brier 0.530، ECE 0.066. 2B: Brier 0.437، ECE 0.100. 4B: Brier 0.347، ECE 0.065.
• الحجم على القرص بصيغة bf16 — 0.8B: 1.71 GB. 2B: 4.43 GB. 4B: 9.08 GB.
إنّ 2B أسرع في المتوسط، وأكثر إحكامًا بشكل كبير عند الذيل، وأكثر دقة، كل ذلك في آنٍ واحد. لذا فإن «الأصغر يعني أسرع» غير صحيح عبر هذه العائلة — بل ومرتين، لأن 4B أبطأ من كليهما. المحور الوحيد الذي يفوز فيه 0.8B فوزًا مطلقًا هو ذاك الذي لا يقيسه أحد في المعايير: 1.71 GB مقابل 4.43 GB لـ 2B و9.08 GB لـ 4B. إذا كنت تضع مقيّمًا ضمن ميزانية ذاكرة ثابتة — جهاز صغير يعمل دائمًا، أو GPU مشترك، أو عقدة حافة يشغل فيها نموذج لغوي بالفعل معظم البطاقة — فتلك هي الحجة بأكملها، وهي حجة حقيقية.
باقي الجدول دراسة في المواضع التي تنكسر فيها النماذج الصغيرة بشكل غير متساوٍ. درجة Typed Decision لدى نموذج 0.8B هي 77.35 مقابل 80.55 لدى 4B — بفارق ثلاث نقاط مع خُمس عدد المعاملات. لكن Jevbench-Original يهبط من 98.61 إلى 80.56 وWildJailBreak ينهار من 89.86 إلى 64.48. وأيًّا كان ما تقيسه هاتان المجموعتان — لا تذكر البطاقة ذلك، ولا تقدّم البطاقة أي تعريفات للمجموعات على الإطلاق — فهما الأكثر قسوة على نقطة الحفظ الصغيرة. النموذج الذي يصمد على محور واحد ويتهاوى على محورين آخرين ليس نموذجًا أضعف بشكل موحّد. إنه نموذج له حدّ كفاءة محدد، وستريد أن تعرف أين يقع عبء عملك قبل تخصيص الأسطول له.
تحذير آخر بشأن صف المعايرة. قيمة ECE لنموذج 0.8B البالغة 0.066 هي أفضل رقم له — أفضل من 0.095 لدى Jev على المجموعة نفسها — بينما درجة Brier لديه البالغة 0.530 أسوأ من 0.358 لدى Jev. الخطأ المُعاير ومتوسط خطأ الاحتمال التربيعي ليسا المقياس نفسه، والجدول الذي يُظهر أحدهما بمظهر قوي والآخر بمظهر ضعيف يخبرك بأن التوزيع جيد التشكّل قرب قمم ثقته، وأكثر تضخمًا مما ينبغي في ما بينها. إذا كان نظامك يحدد العتبات بناءً على الثقة، فإن هذا التمييز يهم أكثر من المتوسط.
ما الذي تحصل عليه فعليًا من 1.71 GB
مسار الاستدلال في هذا النموذج هو مُقيِّم، وليس مُولِّدًا، والفرق في التكلفة بنيوي وليس تدريجيًا. تُسلِّم له حالةً مشتركة، ومخططًا لأسئلة مُسمّاة، واختياريًا حتى ثماني صور. كل سؤال هو أحد ثلاثة أنواع: choice (واحد من مجموعة خيارات مرتبة)، score (مقياس ترتيبي، يُعاد كقيمة متوقعة مرجّحة بالاحتمال)، أو noul (ثنائي لا/نعم). تُصاغ الحالة والمخطط وهيكل JSON كامل للمساعد مع عنصر نائب واحد لكل حقل، ويُشغِّل النموذج تمريرة أمامية سببية واحدة، وتُقرأ اللوجيتات عند الموضع الذي يسبق كل عنصر نائب مباشرة. لا يُؤخذ softmax إلا على رموز المرشحين المسموح بها لذلك الحقل، وتُطبَّق المعايرة المُدربة لنقطة التحقق، ثم تُربط الرموز مرة أخرى بقيم خياراتك.
تترتب على ذلك ثلاث نتائج. لا يوجد توكن إخراج، وبالتالي لا يوجد سعر إخراج — فمليون قرار لا يكلّف شيئًا من التوكنات. ولا توجد حلقة فك ترميز ولا قوس معقوف يمكن نسيانه، لذا فإن JSON المشوّه ليس نمط فشل. ولأن فضاء إجابة كل حقل يُجمَّع لكل طلب، فإن مخططًا تبتكره بعد ظهر هذا اليوم لا يحتاج إلى إعادة تدريب: أضف سؤالًا فتصبح خياراته رموزًا مرشحة لذلك الحقل.
الحدود مذكورة بصراحة مماثلة. من سؤال واحد إلى ستة عشر سؤالًا، بما يصل إلى 62 خيارًا لكل منها، وبما يصل إلى ثماني صور، وحد أقصى افتراضي يبلغ 8,192 رمزًا — والمدخلات التي تتجاوزه تُرفض بدلًا من أن تُقتطع. هذه الجملة الأخيرة قرار تصميمي يستحق التوقف عنده، لأن الاقتطاع الصامت هو كيف يبدأ المصنّف بهدوء في الإجابة عن سؤال مختلف عن الذي طرحته. أما InternLM فيفشل بصوت عالٍ بدلًا من ذلك، وهو صحيح وأيضًا فخ تشغيلي: سلسلة تذاكر طويلة بالإضافة إلى مخطط بالإضافة إلى صور ستتجاوز 8,192 أسرع مما تتوقع، ولا يوجد مسار سلس عندما يحدث ذلك.
وتمنحك 1.71 GB اقتصاديات وقت تشغيل يمكنك حسابها بالضرب. عند 33.98 مللي ثانية لكل قرار، يستغرق مليون قرار 9.44 ساعات على بطاقة RTX 4090 واحدة. ويحتاج 4B إلى 12.3 ساعة للمليون نفسه، ويتنازل عن عشر نقاط ونصف من الدقة مقابل 7.37 GB لم تكن تملكها. ولا يشمل أي من الرقمين تكلفة الجهاز، ولا يشمل أي منهما الجزء الذي ينساه الناس: أنت تشغّل خدمة، ولا يوجد خادم في المستودع.

Qwen 3.8 ليس نموذجًا واحدًا، والطرف الرخيص هو الجدير بالانتباه
Qwen 3.8، إذا أُخذ كاسم قائم بذاته، هو Qwen3.8-2.4T-A95B: نواة مزيج الخبراء المتناثر ذات 2.4 تريليون معامل التي نشرتها Alibaba كأوزان مفتوحة في 12 أغسطس 2026، مع نحو 95 مليار معامل نشط لكل توكن، وترخيص مخصص بدلًا من Apache 2.0. أما التقديم المستضاف لتلك النواة نفسها فهو Qwen3.8-Max، المتاح عمومًا عبر واجهة برمجة تطبيقات مدفوعة منذ 3 أغسطس، وتم تحديثه كلقطة مؤرخة في 2 سبتمبر. إنهما عقل واحد يُباع بطريقتين، والتقديم الثاني هو الذي سيستدعيه معظم الناس فعليًا.
بناءً على أرقام مستقلة، يقيس Artificial Analysis لقطة سبتمبر من Qwen3.8-Max عند مؤشر ذكاء 45.4 — الخامس عشر من 145 نموذجًا مفهرسًا — مع درجة AA Coding تبلغ 76.2 في المركز التاسع من 138، وGPQA Diamond عند 92.8، وHumanity's Last Exam عند 43.1، ودرجة استدعاء السياق الطويل 80.3. تتخلف نقطة التفتيش المفتوحة عن واجهة API التي قُطّرت منها عند 39.9. في نافذة الساحة الخاصة بنا على مدى سبعة أيام، يستقر Qwen3.8-Max عند p50 البالغ 2,578 مللي ثانية وp95 البالغ 9,539 مللي ثانية عند 55.5 رمزًا للإخراج في الثانية، مع معدل خطأ 1.57%. يمكن استدعاء Qwen3.8-Max على OrcaRouter على أساس سعر قائمة المزود مع إضافة هامش ربح 0%، لذا فإن تغيير سعر Alibaba يكون مباشرًا على جانبنا في نفس اليوم بدلاً من دورة الفوترة التالية.
النظير الكثيف، مع ذلك، هو ما ينبغي موازنته مقابل نقطة تفتيش محلية بحجم 1.71 غيغابايت، لأنه أرخص وسيلة لشراء قدرة عامة في هذه العائلة. Qwen3.8-27B مرخّص بموجب Apache 2.0، ويحمل سياقًا أصليًا بطول 262,144 رمزًا، ويأتي Qwen3.8-27B بسعر 0.33 دولار و2.40 دولار لكل مليون رمز في كتالوجنا. مؤشر Artificial Analysis للذكاء الخاص به هو 33.7. وهو يعادل تقريبًا اثنين وثلاثين ضعفًا لعدد معلمات Intern-Decision-0.8B، وما يزال توليديًا، وما يزال الأداة الخاطئة لاتخاذ قرار ضمن مجموعة مغلقة على نطاق واسع — لكنه الخيار الأوسط الصادق، والعضو الوحيد في هذه المقارنة الذي يجمع بين الرخص الحقيقي والعمومية الحقيقية في آن واحد.
المُقيِّم مقابل المُولِّد، بصياغة واضحة.
• السياق — Qwen3.8-Max يحمل نافذة من 1,000,000 توكن. Intern-Decision-0.8B يرفض أي شيء يتجاوز 8,192. بمعامل 122، مفروض بدلًا من مقتطع.
• الإدخال — يستقبل Qwen3.8-Max النص والصورة والفيديو. ويستقبل Intern-Decision-0.8B النص وما يصل إلى ثماني صور، وتُحتسب رموز الصور ضمن الميزانية نفسها البالغة 8,192.
• الإخراج — Qwen3.8-Max يكتب، ويفكّر، ويستدعي الأدوات، ويُصدر JSON عند الطلب. لا يستطيع Intern-Decision-0.8B إنتاج فقرة أو تعليل أو خطة. يمكنه فقط تقييم الخيارات التي فكّرت مسبقًا في إدراجها.
• تكلفة كل استدعاء — استدعاء فرز واقعي يضم 800 رمز إدخال و150 رمز إخراج يكلّف نحو 0.0025 دولار على Qwen3.8-Max، قبل أي رموز استدلال، وجانب الإخراج فيه صغير على نحو متفائل لأنه نموذج استدلال. مليون استدعاء من هذا النوع يكلّف نحو 2,500 دولار. لا سعر رمز لـ Intern-Decision-0.8B على الإطلاق: مليون قرار يعادل 9.44 ساعة من بطاقة 4090 تملكها أو تستأجرها.
• زمن الاستجابة — 2,578 مللي ثانية عند الوسيط على Qwen3.8-Max خلال الأيام السبعة الماضية، بما يشمل الشبكة والانتظار في الطابور. إن 33.98 مللي ثانية الخاصة بـ Intern-Decision-0.8B هي مجرد تمريرة أمامية على بطاقة محلية وليست القياس نفسه؛ والمقارنة النزيهة هي فارق بمقدار مرتبة واحدة من حيث الحجم، لا ثمانين ضعفًا.
• الأدلة — كل رقم من أرقام Intern-Decision-0.8B هنا مُبلَّغ عنه من المورّد على أدوات InternLM الخاصة، ولم يُعِد أحد إنتاجه، بما في ذلك زمن الاستجابة. وكل رقم من أرقام Qwen 3.8 إما من Alibaba نفسها أو قياس من Artificial Analysis، وهي مُوسَّمة بشكل منفصل أعلاه.
• درجة مستقلة — Qwen3.8-Max لديه واحدة. أما Intern-Decision-0.8B فليس لديه أي منها من أي نوع، ولا ينشره أي مزوّد استدلال.

طريقتان لتشغيل خط الأنابيب هذا
الانقسام التشغيلي أحدّ من الانقسام على مستوى المعايير القياسية. إن Intern-Decision-0.8B وحدة، وليس خدمة. لا توجد نقطة نهاية متوافقة مع OpenAI، ولا خادم معالجة بالدفعات، ولا فحص سلامة، ولا سياسة إعادة محاولة، ولا نسخة ثانية إلا إذا بنيت واحدة. يُحمَّل في عملية واحدة ويستجيب لقاموس واحد في المرة، وإذا احتجت إلى تجاوز الفشل فأنت تجاوز الفشل. هذا وصف منصف لنقطة تحقق بحثية بـ 853 مليون معامل نُشرت دون مذكرة إطلاق، وينبغي أن يؤخذ ذلك في الحسبان عند اتخاذ القرار وفقًا لذلك.
النصف التوليدي من خط المعالجة نفسه هو استدعاء شبكي، والاستدعاء الشبكي هو ما وُجد الموجّه من أجله. يمكن الوصول إلى Qwen3.8-Max وQwen3.8-27B معًا عبر مفتاح واحد متوافق مع OpenAI، كما أن التحويل التلقائي عند الفشل يعني ألا تتحول خدمة upstream متدهورة إلى حادثتك — ويجدر ذكر ذلك هنا لأن معدل الخطأ المباشر لدى Qwen3.8-Max على مدى سبعة أيام من جانبنا هو 1.57%، وهو منخفض إلى أن يصبح طلبك. النمط المنطقي هو ذاك الذي كان هذا الاقتران يصفه بهدوء: شغّل المُقيّم منخفض التكلفة ذا المجموعة المغلقة محليًا لأنه سريع ولا يكلف شيئًا لكل استدعاء، ووجّه خطوة الاستدلال لأن هناك حيث تحدث تخفيضات الأسعار، وتقلّبات النماذج، والانقطاعات فعليًا.
أمران لن ندّعيهما. إن Intern-Decision-0.8B ليس أحد مساراتنا، ولن يكون كذلك حتى تستضيفه InternLM في مكان ما — ولن نلمّح إلى خلاف ذلك. ونحن لا نستضيف أي نموذج من InternLM على الإطلاق اليوم، لذا لا شيء في هذه المقالة يُعدّ عرضًا ترويجيًا لتشغيل الموضوع عبرنا.
ما الذي سيغيّر الإجابة؟
ثلاثة أسئلة مفتوحة، يمكن الإجابة عنها جميعًا في غضون أيام. هل تنشر InternLM مستودع GitHub الذي تشير إليه بطاقتها الخاصة، ومعه وصف لكيف جرى ضبط هذه الأوزان؟ وهل يأتي منشور إطلاق بعد نقاط الحفظ، فيحوّل دفعة صامتة إلى إصدار موثّق له قصة نشر معلنة؟ وهل تستطيع أي جهة مستقلة إعادة إنتاج المتوسط 79.38 أو خطأ المعايرة 0.066 على عتاد ليس ملكًا لـ InternLM؟
إلى أن يتحقق أحد تلك الأمور، فإن القراءة الصادقة لـ Intern-Decision-0.8B ضيقة ومحددة: فهو أرخص مقيّم لمجموعة مغلقة ضمن عائلة من ثلاثة، على بصمة حجم تتسع حيث لا يتسع شقيقه الأسرع والأكثر دقة، ونُشر دون إعلان ودون الأثر الوحيد الذي كان سيبين لك ما ضُبط من أجله. إذا كان قرارك ضمن مجموعة مغلقة، وكانت إجاباتك قابلة للتعداد في تعليمة نصية، وكان الرقم 1.71 GB هو ما يتوقف عليه نشرك فعلاً، فهو الخيار الصحيح ولا يوجد شيء آخر مثله عند هذا الحجم. وإذا لم تكن إجابتك قابلة للتعداد مسبقاً، أو تجاوزت حالتك 8,192 رمزاً، أو كنت بحاجة إلى مبرر يمكنك أن تعرضه على إنسان، فلم تكن المقارنة قريبة قط — والنموذج الذي تريده لم يكن يوماً النموذج ذا الـ853 مليون معامل.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
