
Intern-Decision-4B مقابل Laya: نموذجان يرفضان كتابة إجابة، يفصل بينهما فارق عشرة أضعاف في الحجم
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 592 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 187 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
هناك صف في بطاقة نموذج Intern-Decision-4B يقول "Laya — 57.77". أي شخص قرأ توثيق Laya الخاص سيتعرف على معنى الرقم: convaiinnovations/laya هو نموذج قرار غير تلقائي الانحدار بـ 421 مليون معامل، و57.77 هو المتوسط الذي يحصل عليه عند استخدامه بدون تدريب (zero-shot) على معيار شخص آخر. بطاقته الخاصة تقول الشيء نفسه بشكل أكثر صراحة — نقاط التفتيش الأساسية تقع دون خط الأساس للأغلبية على معيار القرارات المصنفة، عند 0.362 مقابل 0.461. وفي المقابل، internlm/Intern-Decision-4B هو نموذج بـ 4.54 مليار معامل بُني لنفس المهمة بالضبط: خذ حالة ومجموعة من الأسئلة المصنفة، شغّل تمريرة أمامية واحدة، أعد احتمالات معايرة، ولا تولّد رمزًا أبدًا. نفس الرهان المعماري، نفس شكل المخرجات، نفس ترخيص Apache-2.0، عشرة أضعاف المعاملات — وأحدهما قاعدة للضبط الدقيق بينما يدّعي الآخر أنه محرك zero-shot جاهز.
يتفقون على الفرضية، وهذا هو الجزء النادر
تطرح كلتا البطاقتين الحجة نفسها، ويجدر ذكر ذلك لأن معظم القطاع يطرح العكس. إذا كانت مشكلتك هي الاختيار من بين مجموعة معروفة من الإجابات، فإن توليد النثر هو العملية الخاطئة: فأنت تدفع مقابل رموز تتخلص منها، وتحتاج إلى محلل، وتحصل على شرح لم تطلبه بدلًا من احتمال يمكنك تطبيق عتبة عليه. وتصوغ بطاقة Laya ذلك بقولها: "إنها لا تولّد نصًا أبدًا، لذا لا يوجد شيء لتحليله ولا شيء لاختلاقه." وتقول بطاقة Intern-Decision-4B إن واجهتها البرمجية "تنفذ تقييمًا منظمًا للمرشحين. وهي لا تستدعي generate() أو تأخذ عينات من نص حر."
تختلف الآليتان على نحو مفيد. تُغذّي Laya أسئلة محدّدة النوع إلى رأس تصنيف، وتُعيد إجابات محدّدة النوع باحتمالات معايَرة في تمريرة أمامية واحدة، مع طبقة توجيه تكتشف نظام الكتابة واللغة في أقل من نصف ميلي ثانية قبل التمريرة. أما Intern-Decision-4B فيُسقط خيارات كل سؤال على رموز من رمز واحد، ويُنشئ هيكل JSON للمساعد فيه عنصر نائب واحد لكل حقل، ويقرأ اللوغيتات مباشرة قبل كل عنصر نائب، ويجري softmax على الرموز المسموح بها لذلك الحقل فقط. مسألة Laya هي مسألة تصنيف؛ أما مسألة InternLM فهي مسألة الرمز التالي التي تأبى أن تصبح مسألة توليد.

فجوة الحجم، وما تجلبه
إن مطالبة نموذجين بأداء المهمة نفسها عند 421M و4.54B من المعاملات تنتج النتيجة التي تتوقعها، ثم مفاجأة.
الجزء المتنبأ به هو القدرة على الأسئلة الصعبة. يحقق Intern-Decision-4B متوسط 90.02 عبر سبع مجموعات تقييم، مع درجة Brier قدرها 0.347 وخطأ معايرة متوقع قدره 0.065 في قياس InternLM الخاص، ويعمل بمتوسط 44.16 ms لكل استعلام على بطاقة RTX 4090 واحدة. نقطة التحقق الإنجليزية الأساسية لدى Laya دقتها 0.362 على معيار typed-decisions المؤلف من 2,000 قرار، وهو ما تشير بطاقتها الخاصة إلى أنه أقل من خط الأغلبية 0.461 وبالكاد أعلى من خط الأساس العشوائي 0.318. وعند ضبط نقطة التحقق نفسها ضبطًا دقيقًا على تقسيم التدريب الخاص بذلك المعيار، يقفز الرقم إلى 0.766. وتستنتج بطاقة Laya الاستنتاج بنفسها: "Laya قاعدة سريعة للتخصص، وليست محرك قرارات بدون تدريب مسبق."
المفاجأة هي أن النموذج الأصغر يفوز في بُعدين بشكل قاطع. السرعة: يجيب Laya على 103 إلى 332 سؤالًا في الثانية عند العمل بدفعات على وحدة T4 واحدة، وتشير بطاقته إلى أنه أسرع بنحو ست إلى ثماني مرات من TypeSafe Jev بناءً على رقم p50 المقاس بشكل مستقل والبالغ 236–276 مللي ثانية الذي يستشهد به. عشرة أضعاف المعاملات لا تشتري عشرة أضعاف الإنتاجية في الاتجاه المعاكس — 44.16 مللي ثانية الخاصة بـ Intern-Decision-4B هي لكل استعلام على 4090 دون نشر أي تفاصيل عن المعالجة الدفعية. واللغة: يذكر Laya أن 45 من 51 لغة مُختبَرة قابلة للاستخدام بأكثر من ثلاثة أضعاف العشوائي، مع 0.451 الموجّه على نية MASSIVE في ثلاث عشرة لغة غير إنجليزية مقابل 0.306 لنقطة تحققه الإنجليزية فقط. ولا يقدم Intern-Decision-4B أي ادعاء متعدد اللغات على الإطلاق.
لوحة النتائج
• المعاملات — 4.54B BF16 لـ Intern-Decision-4B، برج النص بالإضافة إلى برج الرؤية بالإضافة إلى المُسقِط؛ 421M لـ Laya، مكدس واحد مضغوط من فئة المُشفِّر.
• الحد الأقصى للإدخال — 8,192 رمزًا لكليهما، وكلاهما يرفضان بدلاً من الاقتطاع؛ لاحظ أن 8,192 الخاصة بـ Laya تنطبق على نقطة التحقق متعددة اللغات، التي يكون الافتراضي المُشحون بها هو 1,024.
• التعددية — يستقبل Intern-Decision-4B من 1 إلى 16 سؤالًا وما يصل إلى 62 خيارًا لكل سؤال، و62 ليس رقمًا اعتباطيًا: فهو بالضبط عدد الرموز أحادية التوكن التي يمكن لعقد الاستدلال الخاص به معالجتها. وتستقبل Laya أيضًا أسئلة متعددة الأنواع، لكن بطاقتها توثّق انهيارًا حادًا بعد نحو 50 خيارًا، حيث لا يحصل سؤال بـ77 تسمية إلا على ثلاثة أو أربعة توكنات من الميزانية لكل تسمية، وتهبط الدقة إلى 0.425.
• الصور — حتى ثماني صور لـ Intern-Decision-4B، وتُحتسب ضمن ميزانية الـ 8,192 رمزًا؛ لا يوجد مسار متعدد الوسائط لـ Laya.
• المعايرة — يأتي Intern-Decision-4B بدرجة حرارة مُلاءَمَة مقدارها 1.99241824 اختيرت بتصغير NLL على مدى 1,728 حالة، ويُبلّغ عن ECE قدره 0.065 على مجموعته الخاصة؛ بينما تأتي Laya مفرطة الثقة، وتقول بطاقتها إن إعادة ملاءمة درجة حرارة واحدة لكل نوع سؤال وعدد خيارات تنقل متوسط ECE من 0.466 إلى 0.081.
• وضعية الاستدلال بدون أمثلة — نقطة حفظ مكتملة تدّعي تحقيق متوسط 90.02 مقابل أساس موثّق يسجّل أقل من خط فئة الأغلبية.
• زمن الاستجابة — 44.16 مللي ثانية في المتوسط، و44.03 مللي ثانية في الوسيط على بطاقة RTX 4090 واحدة، مقابل 103 إلى 332 سؤالًا في الثانية عند تجميعها على دفعات على بطاقة T4 واحدة.
• اللغات — لا يوجد ادعاء منشور ضد أن 45 من أصل 51 لغة قابلة للاستخدام عند توجيهها.
• الترخيص — Apache-2.0 مع الإبقاء على ترخيص Qwen الأصلي إلى جانب Apache-2.0 المُوسَّم صراحةً للاستخدام التجاري.

بطاقتان، وفكرتان مختلفتان تمامًا حول الإفصاح
هنا تتوقف المقارنة عن كونها ورقة مواصفات وتصبح قرارًا تقديريًا، لأن المورّدَين يوثّقان طرازاتهما بأسلوبين متعاكسين.
تنشر بطاقة Laya إخفاقاتها الخاصة بالتفصيل. وتُفيد بأن نقطة التحقق الإنجليزية تسجل دقة 0.000 على الخميرية عند ثقة 0.952 — واثقة وهي مخطئة، مما يجعل الاعتماد على بوابة الثقة عديم الفائدة هناك. وتُفيد بأن action.act_probability لا يحمل أي إشارة قابلة للاستخدام، إذ يقرأ 1.0 لكل مدخل تقريبًا مع AUROC قدره 0.30 على 396 قرارًا موسومًا، وتنصحك بالاعتماد على الثقة بدلًا من ذلك، والتي تبلغ 0.77 على العناصر نفسها. وتسمّي أسئلة الدرجات الترتيبية "أضعف عنصر أولي"، مستشهدة بـ 0.372 على SST-5. بطاقة تخبرك أيّ من مخرجاتها الخاصة ينبغي تجاهله تفعل شيئًا لا تحاوله معظم الشركات الموردة.
تنشر بطاقة Intern-Decision-4B جدولًا نظيفًا ولا حالات فشل. تحذيراته حقيقية وذات وزن — فقسم المعايرة صريح على نحو غير معتاد في أن عمود "before" في تجربته التجريبية ليس ما قد يراه أي مستخدم، وأن تسميات مجموعة الاختبار لم تُستخدم لاختيار درجة الحرارة — لكن قسم التقييم سبعة انتصارات ولا إقرارات. كما يحمل صفوفًا لخمسة أنظمة منافسة شغّلها InternLM على منصة الاختبار الخاصة بـ InternLM، بما في ذلك صف Laya الذي تفتتح به هذه المقالة. تلك ليست أرقام تلك المشاريع نفسها، وقراءتها على هذا النحو سيكون خطأً.
إذن، خط المصادر في هذه المواجهة غير متماثل على نحوٍ يخدم النموذج الأصغر: فأدلة Laya تتضمن عيوبًا وثّقتها بنفسها، أما أدلة Intern-Decision-4B فلم تواجه قط مجموعة اختبار لم يخترها مؤلفوها.
أي شكل من أشكال المشكلات يناسب كل واحد منها؟
بالنظر إلى حالة قصيرة ومنظمة بالإنجليزية، ومجموعة مغلقة من الإجابات، والحاجة إلى احتمال موثوق، فإن Intern-Decision-4B هو الكائن الأكثر قدرة على الورق والأكثر تكلفة عمليًا — أربع شظايا safetensors، وPyTorch 2.9.1 وTransformers 5.14.1 تحت Python 3.12، ومحرك مقيم، وغلاف تكتبه بنفسك إذا أردت نقطة نهاية HTTP. وبالنظر إلى قرار توجيه أو حماية عالي الحجم عبر عشرات اللغات حيث تكون الإنتاجية هي القيد الملزم، فإن Laya هي الشكل الأفضل: pip install laya، ونموذج بحجم 421M، وبطاقة أخبرتك بالفعل أن تُجري ضبطًا دقيقًا قبل الوثوق بالاحتمالات.
الشيء الوحيد الذي تتفق عليه البطاقتان هو أنه لا ينبغي الوثوق بأي من النموذجين في وضع zero-shot دون التحقق من المعايرة على بياناتك الخاصة — لايا لأن نقاط التفتيش الأساسية لديها تقترب من مستوى الصدفة في أنواع القرارات غير المألوفة، وإنترن-ديسيجن-4B لأن قيمة ECE البالغة 0.065 لديه تأتي من مجموعة اختبارات جمّعها مؤلفوه أنفسهم.
ما الذي يغيّره جهاز التوجيه وما لا يغيّره هنا
لا يوجد أي من هذين النموذجين في كتالوج OrcaRouter، ويجدر القول بوضوح بدلاً من التلميح بخلاف ذلك: صفحات نماذجنا تُرجع خطأ 404 لكل من Intern-Decision-4B وLaya، ولا يُعد أي منهما مسارًا يمكنك استدعاؤه اليوم. وما يعنيه ذلك بالنسبة للمشروعين ليس واحدًا. رخصة Laya من نوع Apache-2.0 مع وسم الاستخدام التجاري تعني أن العقبة هي التغليف فحسب — فهي حزمة Python محلية صغيرة الحجم، وهي من النوع الذي يمكن تقديمه بشكل معقول. عقبة Intern-Decision-4B هي أيضًا التغليف، لكن أوزانها من نوع BF16 بحجم 4.54B وسقف الرفض البالغ 8,192 رمزًا يجعلانه مكوّنًا وليس خدمة.
ما يساعد فيه OrcaRouter فعلًا يقع في الجانب البعيد من القرار. إذا تبيّن أن مشكلة القرار المهيكل لديك تحتاج في النهاية إلى خطوة استدلال، فإن النماذج العامة القادرة على ذلك متاحة عبر مفتاح واحد عبر أكثر من 200 نموذج، مع تمرير سعر القائمة لدى المزوّد بهامش ربح 0% وتحويل تلقائي عند الفشل بين المزوّدين — لذا فإن النموذج الذي تقرنه بمقيّم يقع على بعد نقطة نهاية واحدة، وليس عقدًا ثانيًا.
النسخة المختصرة
توصل هذان المشروعان إلى الاستنتاج نفسه بشأن كيفية اتخاذ القرارات، ثم اختلفا في كل شيء آخر تقريبًا. تراهن Laya على أن 421 مليون معامل، والتوجيه اللغوي المحكم، والصدق القاسي بشأن عيوبه، تصنع قاعدة سريعة يمكنك تخصيصها. وتراهن Intern-Decision-4B على أن عشرة أضعاف المعاملات، وعقد تقييم أحادي الرمز مصممًا بعناية، يصنعان محركًا مكتملًا يعمل دون أمثلة. التجربة الفاصلة هي تجربة لم يُجرِها أيٌّ منهما علنًا: خُذ مجموعة من القرارات ذات إجابات قابلة للحساب، وشغِّل كليهما، وتحقّق مما إذا كانت الاحتمالات تعني شيئًا. نشرت Laya تلك التجربة نشرًا جزئيًا، وأوضحت لك أين تفشل. أما Intern-Decision-4B فلم ينشره على الإطلاق.

