بطاقة عنوان مُولَّدة نصُّها "Intern-Decision-2B مقابل Qwen 3.8"، وعنوانها الفرعي "عمود فقري واحد، ومهمتان مختلفتان تمامًا"، مع شارتين: "مُقيِّم 2.2B، 33 ms" و"الطراز الرائد 2.4T، سياق 1M"، مع شعار OrcaRouter مُركَّبًا في الزاوية.
Guides & Insights

Intern-Decision-2B مقابل Qwen 3.8: بنية أساسية واحدة، ومهمتان مختلفتان تمامًا

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

افتح التكوين الخاص بـ internlm/Intern-Decision-2B والتكوين الخاص بـ Qwen/Qwen3.5-2B جنبًا إلى جنب، ولا يكاد يختلف أي شيء. نفس 24 طبقة، ونفس الحجم المخفي 2,048، ونفس 8 رؤوس استعلام مقابل رأسَي مفتاح-قيمة، ونفس بُعد الرأس 256، ونفس سقف تضمين المواضع البالغ 262,144، ونفس المفردات البالغة 248,320 رمزًا، ونفس النمط المتكرر من ثلاث طبقات انتباه خطي إلى طبقة انتباه كامل واحدة. إن Intern-Decision-2B ليس معمارية جديدة. إنه ذلك العمود الفقري مع إزالة قدرته على توليد النص ومعايرة ثقته — وهذا الطرح الواحد هو ما يجعل المقارنة مع Qwen3.8-Max، وهو النموذج الرائد ذو الـ2.4 تريليون معامل الذي يشير إليه اسم عائلة "Qwen 3.8" كله عند الطرف الأعلى، أكثر قيمة من عدّ تنازلي للمعاملات.

الاثنان ليسا متنافسين، والمواجهة ليست مسابقة. إن Intern-Decision-2B هو ضبط دقيق بحجم 2,213,241,664 معاملًا لـ Qwen3.5-2B، رُفع إلى Hugging Face في 05:36 UTC يوم 26 سبتمبر 2026 بين ثلاثة نماذج شقيقة لم يُعلن عنها، وهو لا يُصدر أي توكنات: بل يستقبل حالة وأسئلة محددة النوع، ويُجري تمريرة أمامية سببية واحدة، ويقرأ اللوغيتات عند مواضع عناصر نائبة ثابتة، ويُعيد توزيعًا معايرًا لكل حقل. أما Qwen3.8-Max فهو الرائد المستضاف لدى Alibaba، وهو نموذج خليط خبراء متناثر بنحو 95 مليار معامل نشط لكل توكن، ونافذة سياق متعددة الوسائط بسعة مليون توكن، وسعر قائمة قدره $2.00 لكل مليون توكن إدخال و$6.00 لكل مليون توكن إخراج. أحدهما مكوّن، والآخر خدمة. السؤال المفيد هو: أين ينبغي أن يقع الخط الفاصل بينهما في خط أنابيب تدفع مقابله بالفعل؟

الطرح، على وجه الدقة

ما غيّره ضبط القرار يستحق أن يُذكر بدقة، لأنه يوضح ما كان النموذج الأساسي يحمله بالفعل.

تسمى المهمة في المستودع باسم النمذجة اللغوية المقنّعة الانحدارية الذاتية. يحتوي إدخال المساعد على هيكل JSON كامل يتضمن رمز <decision> واحد لكل حقل؛ ولا تظهر رموز الإجابة المرجعية إلا في التسميات، ولا تظهر أبدًا في الإدخال. يستخدم التدريب محاذاة سببية عادية للرمز التالي، حيث تتنبأ القيمة اللوجيتية التي تسبق العلامة مباشرةً بإجابة ذلك الحقل، وتتشارك جميع الحقول في تمرير أمامي واحد. عند الاستدلال، تُقيَّد القيم اللوجيتية برموز الإجابة القانونية أحادية الرمز — A–Z، a–z، 0–9، ومن هنا يأتي سقف الخيارات البالغ 62 — ثم تُمرَّر عبر softmax وتُعاد ربطها بتسمياتك.

إذن، فإن آلية الرمز التالي في النموذج الأساسي سليمة وغير معدلة. ما تم تدريبه هو تفضيل لشغل أحد عدد قليل من مواضع الإجابة بدلاً من متابعة جملة، بالإضافة إلى درجة حرارة خاصة بنقطة تفتيش تبلغ 2.100509348278، تم ملاءمتها بواسطة اللوغاريتم السالب للإمكانية على 1,728 حالة معايرة مخصصة مع 1,693 حالة محتجزة. البطاقة واضحة تمامًا في أن التوليد مستبعد: واجهة برمجة التطبيقات "تقوم بتقييم منظم للمرشحين. لا تستدعي generate() أو تأخذ عينات من نص حر."

يوثّق المستودع أيضًا ما لم يمسّه الضبط: فهو «يضبط بدقة العمود الفقري اللغوي لـ Qwen3.5 مع تجميد برج الرؤية والمُسقِط». وتبلغ شظية الرؤية البالغة 612,517,440 بايت في طراز 2B العدد نفسه من البايتات الموجود في نقطة تحقق القرار 4B، وهو ما يتوافق مع مكوّنات موروثة لا مُدرَّبة. مسار الصور يعمل؛ لكنه ببساطة لم يكن ما أنفقت عليه مرحلة القرار ميزانيتها.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

ما لا تستطيع 2.2 مليار معامل فعله، وما تفعله 2.4 تريليون معامل بدلاً من ذلك

كل شيء ينقسم على محور واحد: ما إذا كانت إجابتك موجودة بالفعل كقائمة.

Intern-Decision-2B يجيب عن مجموعة مغلقة. من سؤال واحد إلى ستة عشر سؤالًا، وبما يصل إلى 62 خيارًا لكل سؤال، وما يصل إلى ثماني صور، كل ذلك ضمن ميزانية قدرها 8,192 رمزًا يرفضها المحرك بدلًا من أن يقتطعها. وتُعاد كاحتمالات. بمتوسط 33.28 مللي ثانية لكل طلب على بطاقة RTX 4090 واحدة، مع P95 يبلغ 33.55 مللي ثانية، ولا تُحصَّل أي رسوم لكل استدعاء لأنه لا يوجد ناتج تُحصَّل رسوم مقابله.

يكتب Qwen3.8-Max. سياق من مليون توكن، وإدخال نص وصورة وفيديو، واستدلال بوضع تفكير، واستدعاء أدوات أصلي، ومخرجات منظمة، وحتى 131,000 توكن إخراج في البنية المؤرخة 0902. ويمكنه أيضًا، من حيث المبدأ، اتخاذ قرار التوجيه نفسه الذي يتخذه Intern-Decision-2B — يمكنك أن تطلب منه الاختيار من بين خيارات وإرجاع JSON. ثلاثة أمور تسوء عندما تفعل ذلك. تدفع ثمن التوكنات التي يستهلكها في اتخاذ القرار. وتحصل على سلسلة قد ينجح تحليلها أو لا. والرقم داخل تلك السلسلة هو ما أنتجته أداة أخذ العينات، وليس قيمة softmax يمكنك تعيين عتبة لها عند 0.8 والتصرف بناءً عليها.

كلا الروايتين صحيحتان ولا تُلغي إحداهما الأخرى. النموذج الرائد ذو 2.4 تريليون معامل موجود لأن معظم المشكلات ليست مجموعات مغلقة. المقيّم ذو 2.2 مليار معامل موجود لأن المجموعة الفرعية التي تكون كذلك تستحق أداة أرخص.

لوحة النتائج

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• المعاملات — Intern-Decision-2B ‏2,213,241,664 بصيغة BF16، بالإضافة إلى برج رؤية ومُسقِط، بنحو 4.46 GB على القرص؛ Qwen3.8-Max بنحو 2.4 تريليون إجمالاً مع نحو 95 مليارًا نشِطة لكل رمز، تُقدَّم ولا تُنزَّل.

• السياق — 8,192 رمزًا، مرفوض أعلاه؛ 1,000,000 رمز مع 131,000 كحد أقصى للإخراج في إصدار 0902.

• المخرجات — احتمالات معايَرة وقيمة argmax، دون نص مُولَّد؛ نص مُولَّد يتضمن مسار استدلال.

• الوسائط المُدخلة — نص بالإضافة إلى ما يصل إلى ثماني صور؛ نص وصورة وفيديو.

• التكلفة — لا توجد رسوم لكل استدعاء، وأنت تمتلك وحدة معالجة الرسومات؛ 2.00 دولار لكل مليون رمز إدخال، و6.00 دولار لكل مليون رمز إخراج، مع قراءات الذاكرة المؤقتة بسعر 0.25 دولار وكتابات الذاكرة المؤقتة بسعر 2.50 دولار.

• أدلة منشورة — جدول مورّد من سبع مجموعات بمتوسط 84.68، وBrier 0.437 وECE 0.100 عبر 10,751 صف اختبار، لم يُعِد إنتاجه أي شخص خارج InternLM، على نقطة تحقق (checkpoint) لها إعجاب واحد وصفر تنزيلات؛ ومؤشر الذكاء Artificial Analysis Intelligence Index بقيمة 45.4 في المرتبة 15 من 145، ومؤشر AA Coding بقيمة 76.2 في المرتبة 9 من 138، وكلاهما مقيس بشكل مستقل.

• زمن الاستجابة — 33.28 مللي ثانية متوسط لكل طلب على بطاقة RTX 4090 واحدة، وينخفض مع إضافة التجميع على دفعات؛ 2.655 ثانية P50 للوصول إلى أول رمز كما يورده الكتالوج، ويرتفع مع الحمل.

صفوف الأدلة ليست متكافئة، ولا ينبغي طبعها كما لو كانت كذلك. فنموذج Alibaba الرائد تسنده درجة مؤشر مستقلة. أما نقطة تفتيش InternLM فلديها جدول أنتجه مؤلفوها أنفسهم، وينبغي على وجه الخصوص قراءة رقم المعايرة باعتباره نية موثقة جيدًا إلى أن يلتقي ببيانات جهة أخرى — ويتأكد ذلك هنا أكثر، لأن هذا الحجم بالذات يسجل أسوأ خطأ معايرة متوقع بين الثلاثة التي شحنتها InternLM: 0.100 مقابل 0.066 للنموذج الذي يساوي نصف حجمه، و0.065 للنموذج الذي يقارب ضعف حجمه.

الدرز، وكيفية تشغيله

خط المعالجة المنطقي ليس اختيارًا بين هذين الاثنين، بل تقسيم: يتولى المُقيِّم القرارات المعدودة، ويتولى نموذج رائد كل ما لا تكون إجابته قائمة. فرز الدعم الذي يوجّه إلى أحد ستة فرق ويقيّم الإلحاح على مقياس من ثلاث نقاط لا يحتاج إلى 95 مليار معلمة نشطة؛ بل يحتاج إلى احتمال وعتبة. أما مسار التصعيد الذي يكتب في النهاية ردًا للعميل فيحتاج إلى ذلك.

هذا التقسيم له شكل تشغيلي. Intern-Decision-2B ليس على OrcaRouter — فصفحة طرازنا الخاصة به تُرجع 404 ولا يوجد مسار مُستضاف في أي مكان تمكّنا من العثور عليه — لذا يعمل على عتادك الخاص، ما يعني أنه مكوّن تديره وتراقبه. Qwen3.8-Max هو مسار: مفتاح واحد عبر أكثر من 200 طراز، وسعر قائمة المزوّد يُمرَّر دون أي هامش ربح، ما يعني أن تغيّر سعر البائع على الطراز الرائد يصل إلى فاتورتك في اليوم نفسه الذي يحدث فيه. إن وضع الجزء المستضاف من خط الأنابيب خلف تلك الواجهة الواحدة هو ما يُبقي الجزء الأرخص رخيصًا: فيُبقي المُقيِّم حجم الاستدعاءات منخفضًا، ولا يُوصَل إلى الطراز المتقدم إلا في الحالات التي تحتاجه فعلاً.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

إذا كنت لا تزال تقيّم أي مُقيِّم يستحق أن يكون في تلك الخانة — فهذا المُقيِّم ليس لديه تقييم مستقل، ومعايرته هي الأضعف في عائلته نفسها — التحويل التلقائي عند الفشل عبر مزوّدي الخدمة هو السبيل لتجربته في مسار لديه بالفعل بديل عامل خلفه، بدلًا من استبدال ذلك البديل استبدالًا كاملًا.

الحكم الصادق

إذا كانت مشكلتك قرارًا يتعلق بمجموعة من الإجابات يمكنك تعدادها، وتتسع الحالة داخل ثمانية آلاف توكن، فإن Intern-Decision-2B سيؤديها في ثلاث وثلاثين ميلي ثانية دون أي تكلفة في كل استدعاء، ولن يتفوق عليه أي نموذج طليعي في ذلك المحور مهما استأجرت من معاملات. طبّق معايرتك الخاصة عليه قبل أن تعتمد على الثقة التي يبلّغ عنها.

إذا كانت مشكلتك أي شيء آخر — الاستدلال، أو السياق الطويل، أو استخدام الأدوات، أو الفيديو، أو مستند بمليون رمز، أو ببساطة إجابة لم تُكتب بعد — فإن Qwen3.8-Max ليس أفضل فحسب. بل هو الوحيد من بين الاثنين القادر على أداء المهمة أصلاً.

وإذا لم تستطع بعد أن تقول أيهما لديك من هذين، فالجواب على الأرجح أنك تملك كليهما، في خط الأنابيب نفسه، وهو البنية التي كانت أعداد المعاملات تخبرك بها بهدوء طوال الوقت.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا