بطاقة عنوان مُولّدة بعنوان "TwIL-LM3-Pro مقابل Qwen 3.8"، وبعنوان فرعي "المقارنة التي أجرتها البطاقة فعليًا"، مع بطاقتين مستديرتي الزوايا مكتوب عليهما "TwIL-LM3-Pro - 3.66B، محلي، غير تجاري" و"Qwen3.8-Max - مستضاف، سياق 1M، $2 / $6". ويقول سطر التذييل "تم قياس webAI مقابل Qwen3-8B، وليس Qwen3.8-Max." وشعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

TwIL-LM3-Pro مقابل Qwen 3.8: عدم تكافؤ، والمقارنة التي تهم فعلًا

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

TwIL-LM3-Pro وQwen3.8-Max لا ينتميان إلى الصفحة نفسها، والسبب ليس أن أحدهما أفضل. بل لأن الحجة المنشورة لنموذج webAI للمنطق الصوري بحجم 3.66 مليار معامل مبنية على مقارنة مع نموذج Qwen — والنموذج المعني ليس النموذج الذي يذكره العنوان. تقيس جداول المسار A والمسار B من webAI نموذج TwIL-LM3-Pro مقابل Qwen3-8B، وهو نموذج كثيف مفتوح الأوزان بحجم 8 مليار من جيل سابق، ولا تولي Qwen3.8-Max أي اهتمام على الإطلاق: لا لأن TwIL-LM3-Pro سيفوز، بل لأن Qwen3.8-Max هو النظام المستضاف الرائد لـ Alibaba، وهو نموذج خليط خبراء متناثر يُذكر أنه بـ 2.4 تريليون معامل مع حوالي 95 مليار معامل نشط لكل رمز، ونافذة سياق متعددة الوسائط بمليون رمز، وبطاقة أسعار تبلغ 2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج. وضع ملف GGUF بحجم 2.09 جيجابايت على حاسوب محمول بجانب ذلك هو خطأ فئوي مُتخفٍّ في هيئة صفحة مقارنة.

إذن، يفعل هذا المقال شيئين. فهو يصحح المقارنة التي تخطئ فيها نتائج البحث، ثم يجيب عن الصيغة التي يُرجّح أن يكون القارئ يطرحها فعلاً من السؤال: بالنظر إلى أن نموذجًا حدوديًا لا يبعد سوى استدعاء API واحد، وأن متخصصًا في المنطق الصوري يعمل على جهازك الخاص، فمتى يستحق كل منهما مكانه؟

النموذج الذي قاسته البطاقة فعليًا

المقارنة ذات الصلة هي مع Qwen3-8B، وملخّص webAI نفسه لها أكثر تواضعًا مما توحي به الكتابات المنقولة. بوابة TwIL-LM3-Pro الماكرو داخل النطاق هي 0.5539 مقابل 0.5336 لـ Qwen3-8B، وتحتوي بطاقة النموذج على الجملة التي كانت صفحة تسويقية لتحذفها: فارق البوابة هو 0.020، «أصغر من ضجيج المعاينة عند n = 200 لكل مسار — لذا اقرأ ذلك على أنه تعادل، لا فوز».

حيث لا تكون المقارنة مجرد رمي عملة معدنية: strict-7، 0.2879 مقابل 0.2093، صف لا يستخدم أي نقاط مطابقة متسامحة على الإطلاق، وبالتالي لا يمكن تصنيعه عبر التنسيق. الاختيار من متعدد الصارم، 0.4100 مقابل 0.0000. استقراء القواعد، 0.4195 مقابل 0.3680. ونسبة المعاملات — 3.66B مقابل 8B تقريبًا — وهي الادعاء بأكمله القائل بـ«أقل من نصف الحجم».

في مجموعة الاختبار المحجوزة، يزداد webAI صراحةً: «TwIL-LM3-Pro لا يتقدم عليه». المتوسط الكلي للمجموعات العشر هو 0.7901، أي على مستوى قاعدته Granite الخاصة به، وخلف 0.8493 الخاص بـ Qwen3-8B. إن متخصصًا صغيرًا يعادل نموذجًا عامًا يبلغ ضعف حجمه في المنطق الصوري ويخسر أمامه في القدرة العامة هو الشكل المتوقع، وذكر ذلك بهذه الطريقة هو ما يمنح رقم strict-7 مصداقيته.

ما هو Qwen3.8-Max في الواقع

Qwen3.8-Max ليس تكرارًا لـ Qwen3-8B. إنه الفئة المميزة من Alibaba، ويظهر على صفحة كتالوج OrcaRouter باسم `qwen/qwen3.8-max` مع تاريخ إصدار هو 3 أغسطس 2026، ونافذة سياق تبلغ مليون رمز، وإدخال نصي وصوري وفيديو، وإخراج نصي، ودعم كامل لوضع التفكير، واستدعاء الدوال، والأدوات المدمجة، والمخرجات المهيكلة. يتم تقديمه عبر لوحات معلومات متوافقة مع OpenAI وAnthropic ولوحات أصلية في خمس مناطق، ويُتحكَّم في وضع التفكير عبر المعامل `enable_thinking`. السعر هو 2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج.

نُشرت لقطة مؤرخة، `qwen/qwen3.8-max-0902`، في 2 سبتمبر 2026 بالقدرات نفسها والتسعير نفسه، ونُشرت خصيصًا لكي يمكن تثبيت السلوك من أجل عمليات تشغيل قابلة لإعادة الإنتاج. إذا كنت تبني على Qwen3.8-Max لأي شيء طويل الأمد، فإن معرّف اللقطة هذا هو ما ينبغي وضعه في الإعدادات بدلًا من الاسم المستعار المتحرك.

لاحظ ما هو غائب عن ذلك الوصف: عدد معلمات يمكنك تنزيله، وملف ترخيص، وأي مسار لتشغيله بنفسك. Qwen3.8-Max منتج مستضاف. ذكرت التغطية الصحفية عند الإطلاق أوزانًا مفتوحة وُعد بها في الأسبوع التالي، وصياغة techsy — "2.4 تريليون معلمة، سياق 1M، لا أوزان بعد" — هي الحالة التي ينبغي للقارئ أن يتحقق منها بدلًا من افتراضها، لأن وعدًا أُبلغ به عند الإطلاق ليس نقطة تحقق منشورة.

أربعة أبعاد، ولا أيّ منها قريب

• المعلمات — TwIL-LM3-Pro 3.66B كثيف، كلها نشطة مقابل Qwen3.8-Max المُبلغ عنه بـ 2.4T إجمالي في تصميم خليط خبراء متناثر مع حوالي 95B نشطة لكل رمز. ثلاث مراتب على الإجمالي، ومرتبتان على النشط.

• أين يعمل — يتم تنزيل TwIL-LM3-Pro بصيغة bf16 بحجم 6.82 GiB أو بصيغة Q4_K_M GGUF بحجم 2.09 GiB لـCPU أو 4 GB من VRAM، مقابل Qwen3.8-Max الذي لا يوجد إلا كنقطة نهاية مستضافة.

• السياق — TwIL-LM3-Pro ‏131,072 توكن، موروثة من قاعدة Granite الخاصة به ولم يُتحقق منها قط بما يتجاوز 8,192 في تقييمه الخاص مقابل Qwen3.8-Max عند 1,000,000 توكن.

• الأنماط — نص مُدخَل، نص مُخرَج مقابل نص وصورة وفيديو مُدخَل، نص مُخرَج.

• الترخيص — webAI Non-Commercial License ver. 1.0، مع اشتراط اتفاقية منفصلة للاستخدام المولِّد للإيرادات مقابل واجهة برمجة تطبيقات تجارية مستضافة دون وجود أوزان تستلزم ترخيصًا.

• التكلفة — TwIL-LM3-Pro: لا رسوم لكل رمز ولا نقطة نهاية مستضافة، مقابل 2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج لدى Qwen3.8-Max، مع معدل للإدخال المخزّن مؤقتاً يبلغ نحو 0.25 دولار لكل مليون.

نموذج ‏3.66B‏ رخيص لأنه صغير، وهو صغير لأنه يؤدي مهمة واحدة. Qwen3.8-Max غالٍ لأنه عام الأغراض ومُستضاف. لا يُعد أي من السعرين حكمًا نهائيًا.

السؤال الكامن وراء السؤال

إذا أزلنا الالتباس في التسمية، يبقى سؤال هندسي، وهو سؤال جيد: إذا كان بإمكان نموذج حدودي مستضاف أن يستدل بشأن المنطق الصوري، فلماذا تشغيل متخصص ضيّق النطاق أصلاً؟

ثمة ثلاثة أسباب تصمد. الأول هو الترخيص والشبكة: مجموعة بحثية غير تجارية، أو بيئة معزولة شبكيًا، أو تمريرة وسم دفعية يجب أن تعمل على حاسوب محمول بلا اتصال، لا يمكنها استدعاء نقطة نهاية مستضافة، ويجيب ملف GGUF بحجم 2.09 GiB على هذا القيد مباشرة. والثاني هو بنية التكلفة بحسب الحجم — مهمة وسم بالمنطق الصوري على مليون مدخل قصير تدفع لكل رمز على نموذج حدودي مستضاف، ولا تدفع سوى الوقت الفعلي على نموذج محلي. والثالث هو شكل المخرجات: ضُبط TwIL-LM3-Pro لِيُخرج بنى قابلة للتحقق آليًا بدلًا من النثر، وبالنسبة لتسميات الاستلزام والتحليلات الدلالية، فإن ذلك خط أنابيب أصغر من توجيه نموذج عام وتحليل إجابته.

في مقابل ذلك، حجة Qwen3.8-Max بسيطة. فهو يرى الصور والفيديو، ويستوعب مليون توكن، ويتعامل مع الأدوات والمخرجات المهيكلة عبر API موثّق، ولديه معايير أداء منشورة وتقييم مستقل يسنده. لا شيء يخص متخصصًا ضيّق المجال يهدد ذلك؛ فالاثنان يستجيبان لمجموعتين مختلفتين من القيود.

المكدس الذي يستخدم كليهما

النمط الذي ينجو من التلامس مع خط أنابيب حقيقي هو نمط ثنائي الطبقات، وهو ليس غريبًا. يقرأ نموذج حدودي مستضاف المدخلات الفوضوية — صفحة كتاب مدرسي ممسوحة ضوئيًا، أو مصدرًا مختلط الوسائط، أو مواصفة طويلة — ويحوّلها إلى نص منظم نظيف. يذهب ذلك النص إلى نموذج منطق صوري محلي مهمته كلها أن يصدر وسمًا أو تحليلًا أو نقدًا بصيغة Lean على عتاد تملكه. والحكم على ما إذا كانت الطبقة الثانية تستحق كلفة صيانتها هو مقارنة على طريقة strict-7، لا البوابة، لأن المتخصص يكسب مكانه في المسارات التي لا يترك فيها المقياس مجالًا لتقييم متسامح.

هناك أيضًا إشارة جديرة بالأخذ من بطاقة webAI الخاصة: فقد شُغّل خط المعالجة على خمسة نماذج أساسية مختلفة، مع تغيّر معامل الدمج فقط من نموذج لآخر، ويقدّم webAI النتيجة لكل منها، بما في ذلك النماذج التي تحرّكت أقل ما يمكن. وهذا ادعاء أقوى بشأن وصفة ما من أي سطر نتائج مرجعية منفرد، وهو نوع الدليل الذي يخبرك بأن طريقة ما قابلة للتعميم، لا أن نقطة تحقق واحدة كانت محظوظة.

ما القابل للتوجيه هنا، وما غير القابل للتوجيه؟

هذا هو المكان الوحيد الذي يجتمع فيه النموذجان في الجملة نفسها بصدق. Qwen3.8-Max هو مسار: يُقدَّم عبر OrcaRouter باسم `qwen/qwen3.8-max`، ولأن المنصة تمرّر سعر قائمة المزوّد مع إضافة هامش ربح بنسبة 0%، فإن سعر $2.00/$6.00 هو سعر المورّد نفسه، وأي خفض سعر من المورّد يسري في اليوم نفسه بدلًا من بعد دورة تعاقدية. اللقطة المؤرخة `qwen/qwen3.8-max-0902` قابلة للتوجيه إلى جانبها، لذا فإن تثبيت معرّف نموذج قابل لإعادة الإنتاج هو خيار إعدادات وليس علاقة مورّد منفصلة.

إن TwIL-LM3-Pro ليس مسارًا، وسيكون من قبيل عدم الأمانة الإيحاء بخلاف ذلك. فهو مرخّص بترخيص غير تجاري، ولا توجد له نقطة نهاية مستضافة منشورة، والطريقة الحالية لاستخدامه هي تنزيل نقطة التحقق وتشغيله بنفسك. ما يفعله الموجّه لخط أنابيب مبني حوله هو العمل النصي المحيط — توسيع المطالبات، وتوليد المجموعة النصية، ومرحلة التصفية — والذي يعمل على نفس نقطة النهاية المتوافقة مع OpenAI مع أكثر من 200 نموذج، لذا فإن تبديل النموذج الذي يولّد بيانات التقييم بالنموذج الذي يقيّمها لا يكلّف شيئًا سوى تعديل في الإعدادات، مع التحويل التلقائي عند الفشل للإبقاء على دفعة طويلة نشطة عندما يتعثّر مزوّد.

أكثر استخدام يمكن الدفاع عنه للاثنين معًا هو بالضبط هذا: طبقة حدودية قابلة للتوجيه تقوم بالاستدلال العام والاستخلاص المنظم، ومتخصص مُنزَّل يقوم بالحكم المنطقي الصوري، ومفتاح واحد لكل شيء بينهما.

أي نموذج يجب مقارنته، ومتى؟

إذا كنت تقيّم نماذج منطق صوري صغيرة، فإن Qwen الجدير بوضعه إلى جانب TwIL-LM3-Pro هو Qwen3-8B، وقد نشرت webAI بالفعل تلك المقارنة مرفقةً بالتحفظات. وإذا كنت تختار أين تشغّل عبء عمل إنتاجي، فإن Qwen3.8-Max قرار مختلف تمامًا — نظام حدودي مستضاف له بطاقة أسعار ولا يتوفر للتنزيل — والسؤال الصحيح ليس أيهما أفضل بل أي قيد هو المُلزِم: الاتصال والترخيص في جانب، والسياق والوسائط والنطاق في الجانب الآخر. ينتهي الأمر بمعظم الأنظمة الحقيقية إلى أنها تحتاج إلى كلا الجوابين.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا