
مراجعة Qwen3.8-Max: رائد علي بابا بمعاملات 2.4 تريليون بسعر 2/6 دولارات — إصدار 0902 يتصدر Code Arena WebDev
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
استعرضت Alibaba QwenQwen3.8-Max في المؤتمر العالمي للذكاء الاصطناعي في شنغهاي في 19 يوليو 2026، ولمدة أسبوعين كان النموذج الأكثر تداولاً الذي لم يستطع أحد تحديد سعره فعلياً. لم تكن هناك بطاقة أسعار، ولا جدول معايير، ولا بطاقة نموذج، ولا ترخيص، ولا عدد معاملات نشطة — فقط عنوان ضخم يذكر 2.4 تريليون معامل، وادعاء أن النموذج يحتل "المرتبة الثانية بعد Claude Fable 5."
في 3 أغسطس 2026، تغيّر ذلك. أصبح Qwen3.8-Max متاحًا بشكل عام: بطاقة أسعار منشورة بقيمة 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، ووجهة متوافقة مع OpenAI وDashScope، وجدول معايير كامل، وأوزان مفتوحة وصلت في 12 أغسطس. بعد أسبوع، في 14 أغسطس، أصبح متاحًا على DigitalOcean Serverless Inference كشريك الإطلاق "اليوم صفر" لشركة علي بابا — أول سحابة غربية كبرى تقدمه. في 2 سبتمبر، أصدرت علي بابا تحديثًا مسمى، Qwen3.8-Max-0902، خضع لمزيد من التدريب اللاحق على Coding وCowork، والذي تقول Qwen إنه يعزز الأداء في الأعمال المعقدة والعمل العلمي. هذه المراجعة مكتوبة استنادًا إلى حقائق الإتاحة العامة، مع دمج ذلك الإطلاق في اليوم صفر وبناء 0902، وتجيب على السؤال الذي تطرحه الفرق فعليًا الآن بعد أن أصبح النموذج قابلًا للشراء: هل Qwen3.8-Max جاهز لتحمل حركة مرور الإنتاج، أم لا يزال نموذجًا على قائمة المراقبة؟
الإجابة المختصرة هي أنه تقدّم أبعد مما توقّع معظم الناس — التسعير تحديدًا عدواني على نحو يعيد تسعير حدود الإمكانات، وتحديث 2 سبتمبر يضاعف الرهان على الأمرين اللذين كان النموذج بارعًا فيهما أصلًا، وهما البرمجة والعمل التعاوني. أما بطاقة الأداء المستقلة التي صدرت لاحقًا فهي جيّدة حقًا، لكنها تنطوي على تحفّظ يستحقّ القراءة قبل أن توجّه إليه أي حركة زوار.
الخلاصة. أصبح نموذج Qwen3.8-Max الآن متاحًا للعموم (GA) بسعر $2 / $6 لكل مليون توكن، بسعر ثابت عبر كامل سياق مليون التوكن دون أي رسوم إضافية على المطالبات الطويلة — متفوقًا بذلك على Kimi K3 ($3/$15) وClaude Opus 5 ($5/$25) في سعر المخرجات، وهي العنصر الأكثر تحديدًا للتكلفة في أعمال الاستدلال. وقد نشرت Alibaba جدول معايير قويًا (Terminal-Bench 2.1: 86.6، وGPQA Diamond: 92.6، وOSWorld-Verified: 86.1)، والقفزة في البرمجة مقارنةً بالنموذج السابق مذهلة: إذ بلغ الأداء 73.5 في FrontierSWE مقابل 40.7. غير أن جدول الجودة هذا من إعداد Alibaba نفسها، وقد أدلى أول حَكَمٍ مستقل بدلوه الآن — مؤشر Artificial Analysis Intelligence Index — إذ حصل Qwen3.8-Max على 56 نقطة بتكلفة 1.14 دولار للمهمة، على قدم المساواة مع Claude Opus 4.8 (56 نقطة)، ومتخلفًا بنقطة واحدة عن رائد الأوزان المفتوحة Kimi K3 (57 نقطة) مع تكلفة أعلى بنسبة 25% لكل مهمة. ولم يعد عدد البارامترات النشطة موضع شك: 95 مليار بارامتر نشط من أصل 2.4 تريليون بارامتر إجمالًا، على ما تؤكده بطاقة تعريف النموذج الرسمية، الأمر الذي يتيح أخيرًا للأطراف الخارجية تحليل اقتصاديات تشغيل النموذج. ومنذ ظهر هذا التقييم لأول مرة، انفتح أيضًا مسارٌ مُدارٌ ثانٍ: أُطلق Qwen3.8-Max على منصة DigitalOcean Serverless Inference في 14 أغسطس، وكانت DigitalOcean شريك اليوم صفر (Day 0) لدى Alibaba، مع أرقام تشغيل نشرتها DigitalOcean — إذ تتوسع المعالجة التمهيدية (prefill) لتبلغ نحو 16,000 توكن/ثانية ونحو 1,937 توكن مخرجات/ثانية عند 256 طلبًا متزامنًا دون أي خطأ — وهي أول بيانات مؤكدة لزمن الاستجابة يصدرها مزوّد آخر غير Alibaba. وفي 2 سبتمبر، جدّدت Alibaba نموذجها الرائد بإصدار Qwen3.8-Max-0902، بعد مزيدٍ من التدريب اللاحق على البرمجة والعمل التعاوني (Coding وCowork)؛ وتقول Qwen إن النسخة الجديدة أقوى في أعباء العمل المؤسسية والعلمية المعقدة — وهو ادعاءٌ من الشركة المورّدة لا تدعمه بعد أي أرقام مستقلة في المجالين المؤسسي والعلمي. أما الجانب البرمجي من إصدار 0902، فقد أصبح له الآن نتيجة ساحةٍ مستقلة خاصة به: إذ ظهر Qwen3.8-Max-0902 لأول مرة في المركز الأول على لوحة Code Arena: WebDev برصيد 1,691 نقطة — بزيادة 22 نقطة عن الإصدار السابق وتقدمًا على Claude Opus 5 وKimi K3 — بحسب ما ذكرته Alibaba بالاستناد إلى لوحة المنافسات الحية التابعة لطرف ثالث. وفي الأسبوع نفسه، حصلت قصة التجارة القائمة على الوكلاء (agentic commerce) على سجل نتائج: ففي CommerceAgentBench — معيار جديد من فريق Accio في Alibaba، مبني على نسخٍ طبق الأصل حافظةٍ للحالة من برمجيات تجارية حقيقية — أظهر Qwen3.8-Max أقوى نتيجة بين نماذج الأوزان المفتوحة، وهي 156 اجتيازًا إجماليًا عبر ثلاث منصات اختبار، متقدمًا بنتيجتين على DeepSeek V4 Pro — لكنه جدولٌ تديره الشركة المورّدة، لا حَكَمٌ مستقل. الحكم: أصبح النموذج قابلًا للاقتناء فعلًا الآن، وسعره منخفض بما يكفي لتبرير تقييمٍ حقيقي له — لكن اعتمده بقرارٍ متعمد ومدروس، لا تبنّه بشكلٍ شامل.
النقاط الرئيسية
• GA منذ 3 أغسطس 2026. لقد انتهى عصر حملات المعاينة والائتمانات؛ هناك بطاقة أسعار حقيقية ونقطة نهاية حقيقية.
• $2 / $6 لكل مليون توكن، سعر موحد واحد عبر سياق مليون. معظم المنافسين يفرضون رسومًا إضافية على المطالبات الطويلة. Alibaba لا يفعل ذلك، وهو أمر بالغ الأهمية للعمل على المستندات الطويلة والمستودعات الكبيرة.
• جدول معايير Alibaba قوي لكنه غير مدقَّق: Terminal-Bench 2.1 86.6، GPQA Diamond 92.6، PaperBench 93.0، IFBench 82.8، OSWorld-Verified 86.1، OmniDocBench 1.5 92.1.
• القفزة الجيلية في البرمجة هي القصة الحقيقية: FrontierSWE 73.5 (من 40.7) وDeepSWE 1.1 56.6 (من 21.6) — أي ما يقارب المضاعفة في كليهما.
• وصلت أول نتيجة مستقلة: سجّل Qwen3.8-Max 56 على مؤشر AA للذكاء بتكلفة 1.14 دولار لكل مهمة — أي أعلى بـ10 نقاط من Qwen3.7-Max (46)، ومعادل لـ Claude Opus 4.8 (56)، وأقل بنقطة واحدة من Kimi K3 (57). لم يُنشر بعد أي نتيجة عامة على لوحة صدارة LMArena.
• {{1}}تأكيد المعلمات النشطة عند 95 مليارًا{{/1}} — {{2}}تشير بطاقة النموذج الرسمية إلى إجمالي 2.4 تريليون و95 مليارًا منشطًا{{/2}}، مما يغلق أكبر سؤال مفتوح في حسابات تكلفة التشغيل.
الأوزان المفتوحة صدرت — Qwen3.8-2.4T-A95B (BF16) وQwen3.8-2.4T-A95B-FP8 ظهرا على Hugging Face في 12 أغسطس بموجب ترخيص Qwen3.8-Max المخصص، وليس Apache 2.0. مسار التشغيل المحلي Qwen3.8-27B صدر في 14 أغسطس بموجب Apache 2.0.
• مسار مُدار ثانٍ افتُتح في 14 أغسطس. أصبح Qwen3.8-Max متاحًا على منصة DigitalOcean Serverless Inference، بوصفها شريك الإطلاق في اليوم الأول لشركة Alibaba — بتقنية NVFP4 على NVIDIA HGX B300، وبسعر $2/$6 مع $0.20 للإدخال المخزّن مؤقتًا، ويُقدَّم بسياق 262K الأصلي للنموذج المفتوح. الأرقام التي قاستها DigitalOcean (prefill ~16K رمز/ثانية، صفر أخطاء عند 256 عملية متزامنة) هي أول بيانات أداء خدمة على منصة مُدارة خارج Alibaba.
• تحديث 2 سبتمبر: Qwen3.8-Max-0902. واصلت Alibaba تدريب النموذج الرائد على Coding وCowork وتقدمه على QwenCloud بنفس السعر $2/$6 وسياق 1M. تقول Qwen إن الأداء المؤسسي والعلمي أصبح أقوى — لا تزال ادعاءات من الشركة — بينما حقق الجانب البرمجي نتيجة مستقلة في الساحة في نفس اليوم: ظهر الإصدار لأول مرة في المركز الأول على Code Arena: WebDev برصيد 1,691 (راجع نقطة Code Arena أدناه).
• CommerceAgentBench: الرائد بين النماذج مفتوحة الأوزان، يديره البائع. أطلق فريق Accio من Alibaba هذا الأسبوع منصة CommerceAgentBench، وهي تتضمن 107 مهام بعيدة المدى داخل نسخ محاكاة ذات حالة لبرمجيات التجارة والأعمال الحقيقية، وتُقيَّم بناءً على الحالة عبر بيئات Accio وOpenClaw وPi. يتصدر Qwen3.8-Max النماذج مفتوحة الأوزان بإجمالي 156 اجتيازًا، بفارق اثنين عن DeepSeek V4 Pro؛ بينما يتصدر النموذج المغلق Claude Opus 5 الترتيب الكلي برصيد 191، والجدول من إعداد Alibaba ذاتها، وليس من جهة تحكيم مستقلة.
• Code Arena: WebDev #1 — نتيجة الساحة المستقلة للإصدار 0902. حلّ Qwen3.8-Max-0902 لأول مرة في صدارة لوحة Code Arena: WebDev برصيد 1,691 نقطة، بزيادة 22 نقطة عن الإصدار السابق، ومتقدّمًا على Claude Opus 5 وKimi K3؛ كما يتصدّر حدود باريتو للكفاءة مقابل التكلفة في تلك اللوحة بمتوسط ~5 دولارات/MToken، أي نحو ربع متوسط سعر Claude Opus 5. وقد أكّد الحساب الرسمي QwenCloud التابع لـ Qwen هذا الترتيب. وعلى عكس CommerceAgentBench، فإن هذه اللوحة تابعة لجهة خارجية؛ فهي ساحة تصويت بشري أعمى وليست جدولًا من إعداد Alibaba، غير أن «الظهور الأول في #1» هو إعلان من Alibaba عن قائمة تعكس لحظةً زمنيةً محددة.
ملاحظة بشأن الدقة: جدول معايير Qwen3.8-Max في هذه المراجعة مقدَّم من Alibaba ولم تتم إعادة تكرار نتائجه بشكل مستقل. درجة Artificial Analysis Intelligence Index (56 بتكلفة 1.14 دولار لكل مهمة) قاستها AA بشكل مستقل على واجهة برمجة التطبيقات الرسمية لشركة Alibaba، لتكون بذلك أول جهة تحكيم مستقلة للنموذج. التسعير مأخوذ من بطاقة أسعار الإتاحة العامة في Alibaba Model Studio. مستودعات الأوزان المفتوحة (Qwen3.8-2.4T-A95B وQwen3.8-2.4T-A95B-FP8)، ورقم المعاملات النشطة البالغ 95 مليارًا، ونص الترخيص، كلها مصادر أولية: فهي منشورة ضمن منظمة Qwen نفسها على Hugging Face، وقد جرى التحقق منها في 13 أغسطس 2026. توافر النموذج على DigitalOcean، وبطاقة أسعارها، وقياسات أداء الخدمة، ونتيجة الفحص السريع عبر GPQA التي بلغت 88 على النسخة المكمَّمة، كلها مستقاة من وثائق DigitalOcean الرسمية ودليلها التعليمي المجتمعي، وقد نُشرت بالتزامن مع إعلان 14 أغسطس؛ أما عبارة «شريك إطلاق من اليوم الأول» فهي من صياغة إعلان Alibaba. وحينما نستشهد بأرقام المنافسين فإن مصدرها Artificial Analysis أو المورّد المذكور في السياق عينه. أما تحديث Qwen3.8-Max-0902 الذي أُعلن في 2 سبتمبر، فكل ما يتصل به من معلومات هو إفادة من المورّد: فمواصفاته، ووصف ما بعد التدريب المسمى Coding-and-Cowork، والمكاسب المؤسسية والعلمية المزعومة، كلها من إعلان Qwen الخاص وصفحة النموذج على QwenCloud، ولم تتم إعادة إنتاج أيٍّ من أرقامه بشكل مستقل. ويُعد المركز في Code Arena: WebDev الذي تناولناه في قسم المعايير الاستثناء الوحيد: فهذه اللوحة ساحة تصويتٍ أعمى لطرف ثالث وليست جدولًا من Alibaba، وإن كانت عبارة «الظهور الأول في المركز الأول برصيد 1,691» مجرد إعلان من Alibaba عن ترتيبٍ في لحظة زمنية محددة؛ إذ تظل نتائج الساحة متغيرة مع تراكم الأصوات. ونتيجة CommerceAgentBench التي نغطيها أدناه تقع في الفئة نفسها: فهذا المعيار من تصميم ونشر فريق Accio التابع لـ Alibaba International، لذا فإن جداوله من تقديم Alibaba؛ وهو معيار مفتوح المصدر، لكنه ليس جهة تحكيم مستقلة كما هي Artificial Analysis. وجداول معايير المورّدين تميل إلى التفاؤل كقاعدة عامة؛ فتعاملوا معها بوصفها فرضية لتجربتها على أعباء عملكم بأنفسكم، لا بوصفها ترتيبًا نهائيًا محسومًا.

ما هو Qwen3.8-Max؟
Qwen3.8-Max هو الرائد في عائلة Qwen التابعة لشركة Alibaba: نموذج خليط خبراء متناثر (Mixture-of-Experts) بإجمالي 2.4 تريليون معلمة، ونافذة سياقية تبلغ مليون رمز (1M-token)، ومدخلات متعددة الوسائط أصلية. يقبل النصوص والصور والفيديو، ويُرجع نصوصًا. يدعم وضع التفكير، واستدعاء الدوال، والأدوات المدمجة، والمخرجات المنظمة، ويُقدَّم عبر نقطة نهاية /v1/chat/completions المتوافقة مع OpenAI، مما يعني أن معظم التكاملات الحالية تحتاج إلى تغيير عنوان URL الأساسي بدلاً من إعادة الكتابة. الإصدار الحالي قيد الإنتاج، الذي صدر في 2 سبتمبر، هو Qwen3.8-Max-0902، المدرَّب لاحقًا بشكل إضافي على Coding وCowork.
أرقام السياق العملي أكثر تحديدًا قليلاً من تسويق "1M". بيانات وصف السحابة من Alibaba تسرد نافذة 983,616 رمزًا مع تمكين التفكير، وحد أقصى للإدخال يبلغ نحو 991K رمزًا، وحد أقصى للإخراج يبلغ 131,072 رمزًا. هذا السقف للإخراج سخي بشكل غير معتاد ومهم لمهام مثل توليد ملفات كاملة من التعليمات البرمجية أو صياغة تقارير طويلة، حيث الأسقف الأقل تجبرك على التقسيم والدمج. نقطة التفتيش المفتوحة التي يقدمها DigitalOcean الآن هي تكوين مختلف: بطاقة النموذج الخاصة بها تسرد 262,144 رمزًا بشكل أصلي، قابلة للتوسيع حتى نحو 1,010,000، لذا فإن الخدمة من طرف ثالث التي تشغّل القاعدة المفتوحة ستستقر عادةً عند الرقم الأصلي الأصغر.
أصبح عدد المعاملات النشطة متاحًا للعموم الآن، ويحمله اسم المستودع: A95B يعني 95 مليار معامل مُفعَّل. تنص بطاقة النموذج الرسمية لـ Qwen3.8-2.4T-A95B على "2.4 تريليون إجمالاً و95 مليار مُفعَّل"، وهو نموذج مختلط الخبراء (Mixture-of-Experts) دقيق التحبب يضم 512 خبيرًا، منها 10 خبراء موجَّهين بالإضافة إلى خبير مشترك واحد نشطون لكل رمز (token). هذا الرقم أهم من الرقم الرئيسي 2.4T. بالنسبة للنموذج الكثيف (dense model)، تخبرك المعاملات الإجمالية تقريبًا بتكلفة الاستدلال؛ أما بالنسبة لنموذج MoE، فهي لا تخبرك بشيء تقريبًا — فقط العدد النشط هو ما يهم، لأنه ما يعمل فعليًا لكل رمز. نموذج بسعة 2.4T يُفعِّل 30B يتصرف بشكل مختلف تمامًا، من حيث زمن الاستجابة واقتصاديات التشغيل، عن نموذج يُفعِّل 200B. عند 95B نشطًا، تقع القدرة الحاسوبية لكل رمز في نفس مرتبة النموذج الكثيف الذي يقع حول علامة 90B — أي جزء ضئيل مما كان سيتطلبه نموذج كثيف بسعة 2.4T — وهذا هو الرقم الذي يجعل أخيرًا سؤال الاستضافة الذاتية أدناه قابلًا للإجابة.
تحديث 2 سبتمبر: Qwen3.8-Max-0902
في 2 سبتمبر 2026، أصدرت Qwen أول إصدار إنتاج محدث باسمه. يحتفظ Qwen3.8-Max-0902 بنفس بنية MoE المتفرقة البالغة 2.4 تريليون معامل، ونفس المعاملات النشطة البالغة 95 مليارًا، ونفس نافذة السياق البالغة مليون رمز، لكنه خضع لمزيد من التدريب اللاحق على قدرتين — البرمجة والتعاون المشترك — وهو متاح الآن على واجهة QwenCloud البرمجية باسم qwen3.8-max-0902 (مُدرج أيضًا باسم qwen3.8-max-2026-09-02). وهو الإصدار الموصى به حاليًا وليس فرعًا جانبيًا: نقطة نهاية qwen3.8-max غير المؤرخة من Alibaba تخدم الآن لقطة 0902، لذا فإن أي استدعاء لاسم النموذج القياسي يصل إلى الإصدار المحدث، بينما المعرف المؤرخ موجود للفرق التي تريد تثبيت البنية الدقيقة. اعتبارًا من 3 سبتمبر، أصبحت اللقطة مدرجة أيضًا كمعرف نموذج مستقل قابل للتوجيه على واجهات برمجية مُدارة تابعة لجهات خارجية. لم تتغير بطاقة الأسعار: 2 دولار لكل مليون رمز إدخال، و6 دولار لكل مليون رمز إخراج، مع نفس أسعار التخزين المؤقت.
ادعاءات الأداء صادرة عن Qwen. يصف الإعلان وصفحة نموذج QwenCloud قدرةً برمجيةً «تحقق اختراقًا جديدًا» في المشاريع على نطاق هندسة البرمجيات والتطوير المستقل بعيد المدى، وتجربةً تعاونيةً «محسَّنةً بشكل ملحوظ» للوكلاء عبر تنسيق أدوات متعددة وتسليم المهام من بدايتها إلى نهايتها، و— كما تقول الشركة — أداءً أقوى في المهام المؤسسية المعقدة والبحث العلمي وسير العمل ذات الدورات الطويلة. وفي اليوم نفسه ظهر أول تقييم مستقل. فقد تصدّر Qwen3.8-Max-0902 لوحة Code Arena: WebDev عند أول ظهور له — وهي ساحة تصويتٍ أعمى من جهة خارجية لتطوير الويب القائم على الوكلاء، وكانت تُعرف سابقًا باسم WebDev Arena — برصيد 1,691 نقطة، بزيادة 22 عن الإصدار السابق، ومتفوقًا على Claude Opus 5 وKimi K3، وفقًا لما ذكرته Alibaba نقلاً عن اللوحة المباشرة؛ وهو ترتيب أكده الحساب الرسمي لـ Qwen في اليوم نفسه، مشيرًا إلى QwenCloud API. أما ما يثبته ذلك وما لا يثبته فيفصَّل في قسم المعايير أدناه. أما ادعاءات هذا التحديث المتبقية — الاستدلال المؤسسي، والعمل العلمي، والاستقلالية العامة بعيدة المدى — فما تزال مجرد تصريحات من البائع؛ لذا حافظ على الانضباط نفسه الذي طُبِّق على جدول أغسطس: تعامل معها بوصفها فرضيةً إلى أن يؤكدها تقييم Artificial Analysis أو عبء عمل حقيقي.
ما المقصود بـ "Cowork" في الممارسة العملية هو النقطة التي يصبح فيها التحديث مثيرًا للاهتمام. لقد اعتمد Qwen3.8-Max في حقبة GA بالفعل على الاستقلالية طويلة الأمد — بناء oh-my-cli الذي استغرق 16 يومًا، والأعمال الافتراضية التي تجاوزت 2,000 جولة — كما أن إصدار 0902 يمثل تركيزًا مضاعفًا من Alibaba على هذا المحور: وكلاء ينسقون أدوات متعددة وينجزون المهمة من البداية إلى النهاية بدلاً من تقديم إجابات أحادية. في الأسبوع نفسه، نشر فريق Accio التابع لـ Alibaba أداة CommerceAgentBench، وهي معيار مصمم لقياس هذا المحور مباشرة: 107 مهام طويلة الأمد داخل نسخ متماثلة ذات حالة من برامج التجارة والأعمال الحقيقية، حيث يتصدر Qwen3.8-Max قائمة النماذج مفتوحة الأوزان — وتفاصيل ذلك في قسم المعايير أدناه. أما بالنسبة للفرق التي تقيّم النموذج للعمل المؤسسي، فهذا هو الادعاء الذي يجب اختباره أولاً، لأنه أيضًا الأصعب في التحقق من جدول المعايير.
التسعير: أكثر شيء عدواني في هذا الإطلاق
يُدرج Alibaba Model Studio نموذج Qwen3.8-Max بسعر $2.00 لكل مليون رمز إدخال و$6.00 لكل مليون رمز إخراج. يتضمن الإخراج رموز التفكير، وهذا مهم لأن التكوينات كثيفة الاستدلال تحسب تفكيرها الداخلي بسعر الإخراج. اقتصاديات التخزين المؤقت: مرات الوصول إلى المدخلات المخزنة تبلغ $0.25 لكل مليون، إنشاء التخزين المؤقت الصريح $2.50، وقراءات التخزين المؤقت الصريح $0.17.
الجزء المثير للاهتمام من الناحية الهيكلية ليس الرقم الرئيسي، بل هي الطبقة المسطحة. تفرض علي بابا نفس السعر $2/$6 سواء كان طلبك 5,000 رمز أو 900,000 رمز. يطبق معظم المنافسين رسومًا إضافية على السياق الطويل تحديدًا لأن خدمة طلب يقترب من مليون رمز مكلفة. امتصاص علي بابا لهذا الأمر هو استحواذ متعمد على السوق يستهدف بالضبط أعباء العمل التي يكون فيها السياق الطويل هو النقطة الأساسية: مراجعة الكود على مستوى المستودع بأكمله، وتحليل العقود والملفات، وتوليف الأبحاث متعددة المستندات.
مثال توضيحي. لنفترض أنك تشغّل وكيلًا لتحليل المستودعات: 200,000 توكن إدخال من سياق الكود و8,000 توكن مخرجات لكل استدعاء.
• لكل استدعاء: 0.2M × $2 = $0.40 إدخال، بالإضافة إلى 0.008M × $6 = $0.048 إخراج. ≈ $0.45 لكل استدعاء.
• عند 1,000 مكالمة/يوم: ≈ $448/يوم، أو حوالي $13,400/شهر.
• نفس الاستدعاء ضد Claude Opus 5 بسعر $5/$25: $1.00 + $0.20 = $1.20 — أي ما يقارب 2.7× أكثر.
• مع التخزين المؤقت للسياق في سياق برمجي ثابت، يخفض الإدخال المخزن بسعر $0.25 جانب الإدخال من $0.40 إلى $0.05، مما يجعل الاستدعاء يصل إلى ≈ $0.10 — أي انخفاض بنحو 4.5 أضعاف في حركة المرور المتكررة.
هذا الفرق في التخزين المؤقت هو موطن الميزانية الحقيقية. إذا كان وكيلك يعيد قراءة سياق لم يتغير في معظمه في كل دورة — وهو ما يصف معظم وكلاء البرمجة والدعم — فإن السعر الفعلي أقرب بكثير إلى $0.25/$6 منه إلى $2/$6. الفرق التي تتجاهل إعداد التخزين المؤقت تدفع عادةً أكثر بمقدار 3–4 أضعاف على هذا النموذج.
للمقارنة بالأسعار المدرجة: Qwen3.8-Max بسعر $2/$6؛ وسابقه Qwen3.7-Max بسعر $2.50/$7.50؛ وKimi K3 بسعر $3/$15؛ وGPT-5.6 Terra بسعر $2/$12؛ وClaude Opus 5 بسعر $5/$25. في الإدخال، Qwen منافس فقط. أما في الإخراج — وهو الجانب الذي يهيمن على الإنفاق في الاستدلال وعمل الوكلاء — فهو أرخص نموذج يُدّعى أنه في الطليعة على تلك القائمة.
يكشف القياس المستقل الذي أجرته Artificial Analysis الوجه الآخر لهذه الرموز الرخيصة. على Intelligence Index الخاص بها، تبلغ تكلفة Qwen3.8-Max 1.14 دولارًا للمهمة — أي أكثر من ضعف تكلفة سابقه البالغة 0.53 دولار، وأعلى بنسبة 25% من تكلفة Kimi K3 البالغة 0.86 دولار رغم أن Kimi K3 يُدرج بسعر 3/15 دولارًا لكل رمز. الفجوة سلوكية وليست زيادة في الأسعار: إذ بلغ متوسط النموذج 64 خطوة لكل مهمة GDPval-AA مقابل 14 بالنسبة لـ Qwen3.7-Max، وبسبب أن منصة الاختبار تعيد إرسال المحادثة كاملةً في كل خطوة، نمت رموز الإدخال بنحو 15 ضعفًا بينما نمت المخرجات بنحو 45%. الرموز الرخيصة لا تعني وكلاء رخيصين — فالإسهاب الذي أشار إليه مختبرو النسخة التجريبية أصبح له ثمنٌ مقيس. ولأن OrcaRouter يمرر الأسعار المعلنة بهامش ربح 0% عبر نقطة نهاية متوافقة مع OpenAI، فإن السؤال بين 1.14 دولار مقابل 0.86 دولار يمكنك قياسه على استفسارات متطابقة دون عقدٍ إضافي.

جدول المعايير، وما الذي يقيسه كل رقم فعليًا
في GA، نشرت Alibaba الجدول الذي احتجزته في المعاينة. النتائج المبلغ عنها:
• Terminal-Bench 2.1 — 86.6. يقيس ما إذا كان النموذج قادرًا على استخدام شل حقيقية حتى الاكتمال: تنفيذ الأوامر، وقراءة المخرجات، والتعافي من الأخطاء. وهذا هو أقرب مؤشر على "هل يمكنه العمل كعامل برمجة وليس مجرد مقترح أكواد."
• GPQA Diamond — 92.6.أسئلة على مستوى الدراسات العليا في الفيزياء والكيمياء والأحياء، صُممت لتكون مقاومة للاسترجاع. تشير الدرجة المرتفعة إلى استدلال علمي حقيقي وليس تذكّرًا. 92.6 هي الأعلى في المجال الحالي.
• PaperBench — 93.0.إعادة إنتاج النتائج من الأوراق البحثية — قراءة المنهجية وإعادة تنفيذها. يُكافئ الفهم المستمر متعدد الخطوات.
• IFBench — 82.8. اتّباع التعليمات في ظل قيود: التنسيق، والطول، والتعليمات السلبية. ومن الجدير بالملاحظة أنه أدنى درجة في جدول Alibaba الخاص، وهو ما يتوافق مع شكوى فترة المعاينة من أن النموذج مُفصّل إلى درجة تجاهل حدود النطاق.
• OSWorld-Verified — 86.1.استخدام الحاسوب: قيادة واجهة مستخدم رسومية حقيقية لسطح المكتب لإنجاز المهام. الأداء القوي هنا يدعم التموضع الوكيل.
• OmniDocBench 1.5 — 92.1. تحليل المستندات — الجداول والتخطيط ومزيج النصوص والصور. يتكامل مع سياق 1M بسعر ثابت لتقديم حالة حقيقية لخطوط معالجة المستندات.
• FrontierSWE — 73.5، بزيادة عن 40.7 للنسخة السابقة. DeepSWE 1.1 — 56.6، بزيادة عن 21.6.
هاتان الأخيرتان تستحقان التركيز. فمضاعفة الأداء تقريبًا على معايير هندسة البرمجيات الصعبة في جيل واحد ليست مكاسب تدريجية طبيعية، وهي متسقة مع قرار علي بابا بتسويق هذا النموذج للمطورين بدلاً من مستخدمي الدردشة. إذا ثبت رقم FrontierSWE بعد إعادة التكرار المستقلة، فإن Qwen3.8-Max نموذج برمجة جاد وليس مجرد نموذج ضخم.
لقد تقلّص التحذير الوارد في المعاينة لكنه لم يختفِ.الجدول أعلاه أنتجته Alibaba على منصّة تقييم خاصة بها، في ظل ظروف لا يمكن لأي طرف آخر الاطّلاع عليها. جداول البائعين تُنتقى ولا تُؤخذ كعيّنة عشوائية — فالمختبرات تنشر المعايير التي تحقق فيها نتائج جيدة. لكن اعتبارًا من 6 أغسطس، أصبح هناك حَكَم مستقل حقيقي: منصة Artificial Analysis منحت نموذج Qwen3.8-Max نتيجة 56 على Intelligence Index بتكلفة 1.14 دولار لكل مهمة، وذلك في قياسٍ تمّ عبر واجهة Alibaba الرسمية — أي أنها قفزة بعشر نقاط عن النسخة السابقة (46)، وتعادل نتيجة Claude Opus 4.8 (56)، وتتأخر بنقطة واحدة عن Kimi K3 (57). وعلى لوحة صدارة GDPval-AA الوكيلية لدى Artificial Analysis، يصل النموذج إلى 1,739 نقطة Elo، متجاوزًا Kimi K3 (1,685) وGPT-5.6 Sol (1,730)، ولا يتقدم عليه سوى Claude Opus 5 (1,852). وتستحق تحفظات Artificial Analysis نفسها وزنًا مماثلًا: تشغيل سابق سجّل 53 قبل حلّ مشاكل نقطة النهاية، وأسفرت إعادة الاختبار عبر الواجهة الرسمية عن 56؛ وهبطت نتيجة AA-Omniscience عشر نقاط بسبب معدل هلوسة ارتفع من 23% إلى 40%؛ كما أن التكلفة المرتفعة لكل مهمة تعود تحديدًا إلى أن النموذج يمرّ عبر خطوات أكثر بكثير. أما لوحة صدارة LMArena العامة فما تزال بلا نتيجة معلنة.
أضاف إطلاق DigitalOcean نقطة بيانات ثالثة، هذه النقطة على الإصدار المكمم بدلاً من النسخة الرئيسية. الفحص الداخلي الخاص بـ DigitalOcean لأوزان NVFP4 التي يقدمها سجّل 88 على GPQA Diamond، مقابل 92.6 المنشورة من Alibaba للنسخة الرئيسية غير المكممة. يشير DigitalOcean نفسه إلى أن المقارنة هي "نقطة بيانات إرشادية وليست مقارنة مضبوطة" — الفروقات تتعلق بثلاثة محاور (قاعدة الأوزان المفتوحة بدلاً من النسخة الرئيسية المستضافة، وNVFP4 بدلاً من BF16، وحزمة تقييم مختلفة) — لكنها أول تحقق مستقل من نشر فعلي لهذه الأوزان، وتذكير بأن نسخة الأوزان المفتوحة ليست مطابقة حرفيًا للرقم الموجود في جدول Alibaba.
CommerceAgentBench: لوحة نتائج التجارة القائمة على الوكلاء
إلى جانب هذا التحديث، أصدر فريق Accio التابع لشركة Alibaba International منصة CommerceAgentBench، وهي معيار مصمم لتقييم العمل طويل المدى الذي لا تزال Qwen تروّج له بدقة. يبدأ الوكيل كل مهمة داخل حاوية جديدة في واحدة من 14 نسخة طبق الأصل غير متصلة بالإنترنت من برامج التجارة والأعمال الحقيقية — نشر المنتجات، حجز الشحن، إدارة المتاجر، عمليات الدفع، وتحليل الموردين — ويعتمد التقييم على الحالة: لا تُنجز المهمة إلا عندما تتغيّر الخدمات الوهمية الأساسية والملفات المُنتجة فعليًا، لذا فإن الوكيل الذي يصف سير عمل معقولًا دون تغيير الحالة لا يحصل على أي نقاط. تشمل الحزمة 107 مهام عبر أسطح CLI والمتصفح والملفات/المستندات وAPI/MCP، وتُنفَّذ عبر ثلاث منصات تشغيل — Accio وOpenClaw وPi — كما أن كود المنصات (Apache 2.0) وبيانات المهام (CC BY 4.0) متاحة للمراجعة أو إعادة التشغيل.
على الجداول المنشورة، يسجّل Qwen3.8-Max أقوى نتيجة بين نماذج الأوزان المفتوحة: 56 من 107 مهام على منصة Accio، و47 على OpenClaw، و53 على Pi — بإجمالي 156 اجتيازًا، متقدمًا بفارق اثنين عن DeepSeek V4 Pro البالغ 154. تأتي الميزة الكاملة للأوزان المفتوحة من منصة Accio؛ إذ يتعادل النموذجان على منصتي OpenClaw وPi. صدارة الأوزان المفتوحة ليست الصدارة الإجمالية: النموذج المغلق Claude Opus 5 يتصدر الميدان برصيد 191 اجتيازًا إجماليًا، متقدمًا بفارق 35. والجدول من إعداد Alibaba نفسها — ففريق Accio تابع لـAlibaba، والمستودع نفسه يوضح حدود التدقيق: منصة Accio مرجعية فقط وغير قابلة لإعادة الإنتاج من سحب (checkout) للمستودع (بينما OpenClaw هي المسار القابل لإعادة التنفيذ)، والنتائج على مستوى المهام تفتقر إلى مجاميع تحقق عامة ثابتة، واعتمدت صفوف Qwen على بروتوكول إعادة تشغيل محتوى الاستدلال للحفاظ على قابلية المقارنة. تعامل معها كنقطة بيانات معلنة من البائع على المحور الوكيلي نفسه الذي تقيسه OSWorld-Verified ومنهج GDPval-AA الخاص بـAA من زوايا مختلفة — يجدر اختبارها مقابل مسارات عملك الخاصة، وهي ليست ترتيبًا نهائيًا.
Code Arena WebDev: الحكم المستقل لبناء 0902.
كود أرينا هي قطعة الدليل المستقل التي كان ينقصها التحديث. وهي لوحة متصدرين تابعة لجهة خارجية لتطوير الويب العاملي (agentic web development) — المشروع المعروف سابقًا باسم WebDev Arena — حيث تُحتسب الأصوات البشرية العمياء والزوجية حول أيِّ ناتج نموذجٍ يفضّل المستخدم شحنه، وتُحوَّل إلى تقييم بأسلوب Elo. على لوحة WebDev الخاصة بها، ظهر Qwen3.8-Max-0902 في الصدارة لأول مرة بـ1,691 نقطة، بزيادة 22 عن الإصدار السابق، ومتقدمًا على Claude Opus 5 وKimi K3. وللترتيب ميزة كفاءة في التكلفة أيضًا: بمتوسط مزيج يبلغ حوالي 5 دولارات لكل مليون رمز (token) — وهو سعر القائمة البالغ 2/6 دولارات مرجَّحًا نحو المزيج الثقيل في المخرجات الذي يولّده توليد تطبيقات الويب فعلًا — فإن إصدار 0902 هو النموذج الأعلى تسجيلًا على حدود باريتو للوحة، إذ تبلغ تكلفته ربع سعر مزيج Claude Opus 5 البالغ ~20 دولارًا/مليون تقريبًا وأقل بكثير من ~12 دولارًا/مليون لدى Kimi K3؛ ولهذا يقع هذان الاثنان خارج حدود باريتو رغم احتلالهما المركزين #2 و#3 في النقاط. أعلنت علي بابا عن الترتيب في 2 سبتمبر، وأكّده الحساب الرسمي لـQwen موجّهًا المستخدمين إلى QwenCloud؛ وهذا القياس ليس قياس علي بابا: فعلى عكس جدول المعايير أعلاه أو تشغيل CommerceAgentBench الذي يليه مباشرة، تُنتَج هذه النتيجة من ساحة تابعة لجهة خارجية بناءً على أصوات تفضيلات بشرية.
تحفظان يبقيان الأمر نزيهًا. أولًا، تقييمات الحلبة لحظية: 1,691 هو الموضع الذي استقرت عليه اللوحة عندما أعلنت Alibaba عن الإطلاق الأول، وسيتبدل مع تراكم الأصوات، لذا فاقرأها كإشارة قوية على البرمجة في تطوير الويب وليس تاجًا دائمًا. ثانيًا، إنه يغطي محورًا واحدًا فقط. فادعاءات التحديث المتعلقة بالمؤسسات والعلوم والآفاق العامة طويلة الأمد لا تزال بلا حَكَم مستقل، ولهذا يظل جدول البائعين ومؤشر AA Index 56 على النموذج الأساسي هما النقطتان المرجعيتان لكل ما يقع خارج أعمال الواجهة الأمامية الوكيلة. ثالثًا، السعر الحدّي هو خيار نمذجة وليس بطاقة تسعير جديدة: رقم ~$5/MToken يمزج القائمة غير المتغيرة $2/$6 مع افتراض استخدام عالٍ للمخرجات، فتعامل معه كترتيب لكفاءة التكلفة وفق شروط الحلبة نفسها، لا كإعادة تسعير من Alibaba.

أوزان مفتوحة، Qwen3.8-27B، وسؤال النشر المحلي
لقد تم الآن الوفاء بوعد Alibaba بشأن الأوزان المفتوحة. في 12 أغسطس 2026، نشرت Qwen مستودعين على Hugging Face — Qwen3.8-2.4T-A95B بصيغة BF16 و Qwen3.8-2.4T-A95B-FP8 — كل منهما يضم 213 ملفًا للأوزان. الترخيص هو ترخيص Qwen3.8-Max مخصص، وليس Apache 2.0؛ ويقرأ حقل الترخيص في Hugging Face "أخرى". تسمح الشروط بالاستخدام والتعديل والتوزيع والضبط الدقيق، بما في ذلك الاستخدام التجاري، مع الإسناد، بالإضافة إلى بوابتين تستندان إلى الحجم: المنتجات التي تتجاوز 100 مليون مستخدم نشط شهريًا أو 20 مليون دولار من الإيرادات الشهرية يجب أن تعرض اسم النموذج بشكل بارز، وأعمال Model-as-a-Service أو AI-Work-Assistant التي تتجاوز 50 مليون دولار من إجمالي الإيرادات التراكمية للاثني عشر شهرًا الماضية تحتاج إلى ترخيص منفصل من Qwen. معظم الفرق ضمن تلك البوابات؛ إذا تجاوز عملك هذه الحدود، فاقرأ نص الترخيص قبل البناء عليه. عدادات التنزيل تدعم حداثة الإصدار — 978 على مستودع BF16 و 3,851 على مستودع FP8 وقت كتابة هذا التقرير، وهي أرقام منخفضة لإصدار رائد، وتتفق مع مستودع أُنشئ في 8 أغسطس وأُعلن عنه علنًا فقط في 12 أغسطس، وليس مستودعًا ظل ظاهرًا لمدة أسبوع. ملاحظة إضافية للصراحة: نقطة التحقق المفتوحة هي النموذج الأساسي، نصي فقط مع تفكير يعمل دائمًا، بينما تضيف واجهة برمجة تطبيقات Qwen3.8-Max المستضافة إدخال الرؤية، ووضع عدم التفكير الاختياري، والسياق الكامل البالغ 1M — تنزيل الأوزان يمنحك النموذج، وليس كل ميزات الواجهة.
استضافة النموذج الرئيسي ذاتيًا لا تزال بعيدة عن متناول معظم الفرق، لكنها الآن بعيدة عن المتناول برياضيات معروفة. مجموعة الأوزان الكاملة البالغة 2.4 تريليون معامل تبلغ تقريبًا 4.9 تيرابايت بصيغة BF16 وحوالي 2.4 تيرابايت بصيغة FP8، لأن كل خبير يجب أن يكون مقيماً في الذاكرة حتى لو تم تنشيط 95 مليار معامل فقط لكل رمز. مع التكميم بأربع بتات، يكون الحجم في حدود 1.2 تيرابايت مقابل حوالي 141 جيجابايت لكل وحدة H200، لذا فأنت بحاجة إلى ثمانية مسرّعات فائقة أو أكثر قبل أن تخدم رمزًا واحدًا. ما يضيفه العدد النشط المعلن الآن هو جانب الإنتاجية: مع تنشيط 95 مليار معامل لكل رمز، تكون الحسابات لكل رمز مماثلة لنموذج كثيف في فئة ~90 مليار معامل — وهو جزء صغير من التكلفة التي سيفرضها نموذج كثيف بحجم 2.4 تريليون — لذا بمجرد أن تكون الأوزان مقيّمة في الذاكرة، فإن تكلفة كل رمز ليست بالكابوس الذي يوحي به العدد الإجمالي للمعاملات. هذا المزيج من بصمة ذاكرة كبيرة وحسابات متواضعة لكل رمز هو بالضبط السبب الذي يجعل علي بابا قادرة على تسعير المخرجات بمبلغ 6 دولارات لكل مليون رمز، وهو ما يوجّه الفرق التي تستضيف النموذج بنفسها نحو عقد متعددة وحدات المعالجة الرسومية تشغّل نقاط تفتيش FP8 بدلاً من أي شيء يعمل على وحدة واحدة.
خيار DigitalOcean لخدمة النموذج هو مثال عملي على تلك الحسابات في بيئة الإنتاج. فهو يشغّل النموذج المكمّم بصيغة NVFP4 على معالجات NVIDIA HGX B300 الرسومية تحديدًا حتى تتسع أوزانه البالغة 2.4 تريليون على عقدة واحدة، متجنبًا توجيه الخبراء عبر العقد — وهو نشر حي لاقتصاديات 4-بت التي كان هذا القسم يتناولها على الورق. والمقايضة هي بالضبط ما يحدده الفحص الموضعي GPQA أعلاه كميًا: بصمة أصغر، مع تكلفة ملموسة في الجودة مقابل النموذج الرائد غير المكمّم.
وهذا ما يجعل Qwen3.8-27B إصدارًا أكثر أهمية بالنسبة لمعظم القرّاء — وعلى عكس الطراز الرئيسي، صدرت أوزانه في الموعد المحدد. في 14 أغسطس 2026، نشرت Qwen نموذج Qwen/Qwen3.8-27B على Hugging Face وModelScope بموجب Apache 2.0: نموذج كثيف بحجم 27B، متعدد الوسائط أصليًا، بسياق أصلي يبلغ 262K رمزًا قابلًا للتمديد إلى 1M ووضع reasoning_effort قابل للتهيئة. كان Daniel Han من Unsloth قد قدّر أنه سيعمل بحوالي 17GB من VRAM — بطاقة واحدة من فئة prosumer — وهذا أصبح قابلًا للاختبار الآن: المستودع الرسمي يوفر ملفات BF16 safetensors (حوالي 55.6GB عبر 18 جزءًا)، تليها كميات GGUF المضغوطة في مستودعات المجتمع. وهكذا اكتمل نمط إصدار هذا الجيل: جاءت أوزان الطراز الرئيسي 2.4T أولًا في 12 أغسطس، وصدر النموذج الصغير للمسار المحلي بعد يومين. لقد تتبعنا إصداره في منشورنا حول تاريخ إصدار Qwen3.8-27B.
أين يتناسب Qwen3.8-Max: أربعة سيناريوهات
1. تحليل المستندات الطويلة والعقود. هذا هو الأنسب بقوة. السعر الثابت عبر مليون رمز بالإضافة إلى OmniDocBench 92.1 يعني أنه يمكنك تمرير ملف من 400 صفحة في استدعاء واحد دون رسوم إضافية ودون تقسيم. المنافسون الذين يفرضون أقساطًا على السياقات الطويلة يجعلون نفس المهمة أكثر تكلفة بشكل ملحوظ. على مسار DigitalOcean، تذكر أن هذا المسار يخدم القاعدة المفتوحة بسياق 262K — لا يزال ملفًا كبيرًا، لكن ليس المليون الكامل.
2. وكلاء الترميز على نطاق المستودعات. يدعم ذلك كل من Terminal-Bench 86.6 وFrontierSWE 73.5، كما أن تسعير التخزين المؤقت يجعل العمل التكراري على قاعدة أكواد مستقرة منخفض التكلفة. أول ما يجب اختباره هو زمن الاستجابة تحت مستوى التزامن الخاص بك، لأن المراجعين في فترة المعاينة وجدوا النموذج دقيقًا لكنه بطيء في عمليات الوكيل الطويلة، وخدمة GA مختلفة عن خدمة المعاينة. نتيجة AA في GDPval-AA — وهي 1,739 Elo الرائدة بتكلفة 64 خطوة لكل مهمة — هي التأكيد المستقل لشقي هذه المفاضلة. قياسات DigitalOcean في 12 أغسطس — الإنتاجية الإجمالية التي تتدرج بشكل شبه خطي إلى ~1,937 رمز إخراج في الثانية عند 256 طلبًا متزامنًا مع صفر أخطاء وعدم الوصول إلى التشبع — هي أول نقطة بيانات من منصة مُدارة حول هذه المسألة، وإن كانت أرقام DigitalOcean الخاصة على خوادمها، وليست مقارنة وجهاً لوجه مع خوادم Alibaba.
3. خطوط معالجة المستندات ولقطات الشاشة. إدخال الفيديو والصور إلى جانب نتيجة OSWorld-Verified 86.1 يجعلها موثوقة لسير العمل التي تعتمد على قراءة الشاشات — أتمتة ضمان الجودة، وفرز طلبات الدعم من لقطات الشاشة، والمهام القريبة من RPA. ومرة أخرى، الإدخال متعدد الوسائط هو ميزة API مستضافة؛ أما مسار القاعدة المفتوحة في DigitalOcean فهو نصي فقط.
4. حيث لن نضعه بعد. تجربة المستخدم التفاعلية الحساسة لزمن الاستجابة وأي عبء عمل خاضع للتنظيم يتطلب تقييمًا قابلًا للتكرار. بالنسبة للأول، تريد إنتاجية مقاسة تتحكم بها. بالنسبة للثاني، قابلية التكرار الآن لديها بطاقة نموذج ورخصة للاستشهاد، لكن جدول معايير Alibaba ما زال غير مُعاد إنتاجه — وتراجع Omniscience الخاص بـ AA (معدل الهلوسة حتى 40%) هو تذكير بأن النتيجة المستقلة سلاح ذو حدين.

كيفية الوصول إلى Qwen3.8-Max
هناك عدة مسارات عملية. فالمسار المباشر عبر Alibaba Model Studio أو DashScope — أو عبر واجهة QwenCloud API الخاصة بـ Qwen — يمنحك بطاقة الأسعار المذكورة أعلاه وأسرع وصول إلى الإصدارات الجديدة المحدّثة بتواريخها — فقد ظهر إصدار Qwen3.8-Max-0902 بتاريخ 2 سبتمبر هناك أولاً قبل أن يُطرح عبر نقاط الوصول الأخرى — مقابل تكلفة إضافة مورّد جديد وإدارة مفتاح آخر. أما Qwen Chat وتطبيق Qwen فهما أسرع طريقة لمعاينة السلوك قبل كتابة الكود. ويُعد تنزيل الأوزان المفتوحة من Hugging Face مسارًا رابعًا للفرق التي تريد تشغيل بنيتها التحتية الخاصة — مع ما سبق ذكره من تحفظات بشأن الحجم والترخيص. أما عبر الموجّه فهو الخيار الذي ينبغي لمعظم فرق الإنتاج أن تضعه في الاعتبار، لأنه يفصل قرار الترحيل عن قرار التقييم.
منذ 14 أغسطس 2026، أصبح هناك خيار جديد بالفعل: Qwen3.8-Max متاح الآن على DigitalOcean Serverless Inference، وهو ما أعلنته Alibaba بوصفها «شريك الإطلاق في اليوم صفر» — وهذا تأطير من Alibaba نفسها، رغم أن قائمة العرض تابعة لـ DigitalOcean وتقف بمفردها. تقدم DigitalOcean نقطة الفحص مفتوحة الأوزان (معرّف نموذج المنصة qwen3.8-max)، مكمَّمة بتقنية NVFP4 على معالجات NVIDIA HGX B300 GPU بالتعاون التقني مع Inferact، كواجهة برمجة تطبيقات خادمية مُدارة بالكامل: نقطة نهاية واحدة، وتسعير حسب الاستخدام، ولا بنية تحتية تحتاج إلى إدارتها. وبطاقة أسعارها مطابقة لقائمة Alibaba — $2.00 للإدخال / $6.00 للإخراج لكل مليون، مع إدخال مخزّن مؤقتًا بسعر $0.20 — كما أنها توفر السياق الأصلي للقاعدة المفتوحة البالغ 262 ألف رمز مع تفعيل التفكير دائمًا، بدلاً من الوضع متعدد الوسائط بنحو مليون رمز الخاص بالنسخة الرئيسية المستضافة. هذا الحد الأقصى للسياق مهم إذا كان عبء عملك يعتمد على الطرف الطويل: وضع المليون رمز الكامل يظل متاحًا عبر Alibaba API فقط.
ما يضيفه مسار DigitalOcean إلى جانب الجغرافيا هو أول بيانات خدمة فعلية من مزود آخر غير Alibaba. قياسات DigitalOcean الخاصة على نقطة الإنتاج الخاصة بها، التي أُجريت في 12 أغسطس، تُظهر أن التعبئة المسبقة تتوسع خطيًا بمعدل تقريبي يبلغ 16,000 رمز/ثانية — وهي قاعدة تقريبية: TTFT ≈ (الإدخال ÷ 16,000) + 0.7 ثانية، أي حوالي 1.1 ثانية عند ~1,080 رمزًا وحوالي 15.8 ثانية عند ~254 ألف رمز — وإجمالي الإنتاجية يصل إلى ~1,937 رمز إخراج/ثانية عند 256 طلبًا متزامنًا مع عدم وجود أخطاء وعدم العثور على نقطة تشبع. هذه أرقام DigitalOcean على نشرها الخاص، وليست اختبارًا مضبوطًا للمقارنة، لكنها أول بيانات حول زمن الاستجابة والتزامن لهذا النموذج خارج سحابة Alibaba، وهي تعالج مباشرة القلق بشأن "دقيق لكن بطيء" من عصر المعاينة.
Qwen3.8-Max متاح الآن على OrcaRouter بمعرّف qwen/qwen3.8-max، وتحديث 2 سبتمبر قابل للتوجيه تحت معرّفه المؤرّخ الخاص — qwen/qwen3.8-max-0902 — وكلاهما بنفس السعر الرسمي البالغ 2.00$ / 6.00$. يطبّق OrcaRouter هامش ربح بنسبة 0% ويمرّر تسعيرة المزوّد مباشرة، لذا فإن أيًّا من المسارين يكلف نفس تكلفة الاتصال المباشر. تُظهر بيانات القياس الخاصة بخدمتنا حاليًا زمنًا وسطيًا (p50) للوصول إلى أول رمز (TTFT) يبلغ 1.64 ثانية خلال نافذة 7 أيام. هذا قياس كمون من طرفنا مباشرة وليس ادعاءً من المورّد، ويستحق أن يُوزن مقابل تقارير فترة المعاينة التي وصفت النموذج بأنه "أبطأ نموذج استخدمته": تلك التقارير صدرت عن مراجع واحد كان يشغّل مهام بناء وكيلية تستغرق ساعات على بنية معاينة، وينبغي إعادة اختبارها ضد خدمة GA بدلًا من تداولها كحقيقة حالية.
القيمة العملية لمسار الموجّه هي أن Qwen3.8-Max يعمل خلف نفس نقطة النهاية المتوافقة مع OpenAI التي تستخدمها النماذج التي تشغّلها بالفعل، لذا فإن التقييم مجرد تغيير في سلسلة النموذج. يمكنك توجيه 5% من حركة المرور الإنتاجية إليه، ومقارنته بنموذجك الحالي على نفس الاستعلامات، مع الإبقاء على نظام احتياطي — وهذا بالضبط هو الوضع الذي يستحقه نموذج يعتمد على جدول مورّد غير منسوخ. وينبغي اعتماد نفس النهج لاختبار نشر DigitalOcean: تشغيل جزء من الحركة عليه مع وجود نظام احتياطي، بدلاً من المراهنة على مسار إنتاجي بمنظومة خدمة عمرها أسبوعان فقط.

القيود والمخاطر الصادقة
• جدول الموردين لا يزال غير مدقق. النتيجة المستقلة وصلت (AA Index 56)، لكن جدول المعايير الخاص بأليابابا يظل غير مُكرَّر، ويشير قياس AA إلى تراجع في Omniscience مع معدل هلوسة يصل إلى 40%. النتيجة المستقلة تساعد؛ لكنها لا تجعل جدول الموردين قابلاً للتدقيق.
• مسار DigitalOcean هو القاعدة المفتوحة، وليس الرائد. يقدم نقطة التحقق بسياق 262K، نص فقط، تفكير دائم التشغيل، ومكمّم بـ NVFP4 — ونتائج الفحص العشوائي الخاصة بـ DigitalOcean التي تحقق 88 على GPQA Diamond مقابل 92.6 المنشورة من Alibaba، وهي فجوة تصفها DigitalOcean بأنها دلالية وليست مضبوطة. إذا كنت بحاجة إلى واجهة برمجة التطبيقات الكاملة متعددة الوسائط بسعة مليون رمز، فإنها لا تزال مستضافة من Alibaba.
• صدر Qwen3.8-27B، لكن رقم إصداره من البائع. أُتيحت أوزان الإصدار 27B في 14 أغسطس بموجب ترخيص Apache 2.0، مما يسدّ ثغرة النشر المحلي — لكن ادعاءات أدائه في المعايير مصدرها Alibaba ولم تُكرَّر من أطراف مستقلة، كما أن نسخ التكميم المجتمعية كانت لا تزال تُطرح تدريجياً حتى هذا التحديث.
• رخصة مخصصة، وليست Apache 2.0. تسمح رخصة Qwen3.8-Max بالاستخدام التجاري مع الإسناد، لكنها تتضمن حدّين للتوسع — عرضًا بارزًا لاسم النموذج عند تجاوز 100 مليون مستخدم نشط شهريًا (MAU) أو إيرادات شهرية تبلغ 20 مليون دولار، ورخصة منفصلة للشركات العاملة في MaaS/مساعد العمل بالذكاء الاصطناعي التي تتجاوز إيراداتها 50 مليون دولار خلال الاثني عشر شهرًا الماضية. اقرأها قبل أن تتوسع وتتجاوز هذه الحدود.
• الإسهاب والانحراف عن التعليمات. IFBench 82.8 هو أضعف رقم في جدول Alibaba الخاص، وقد شاهد مختبرو المعاينة مرارًا النموذج يتجاوز النطاق المطلوب — مضيفًا ميزات غير مطلوبة. أرقام AA الخاصة تضع الآن رقمًا لذلك: إن 64 خطوة لكل مهمة GDPval-AA هي ما يرفع التكلفة إلى 1.14 دولار، أي أعلى بنسبة 25% من Kimi K3. جذاب في العرض التجريبي، لكنه مكلف عندما يُحتسب الإخراج بمعدل 6 دولارات لكل 1M، ومزعزع للاستقرار عندما تحتاج إلى صيغ دقيقة.
• ضوابط المحتوى. وكغيرها من النماذج المتطورة المستضافة في الصين، تخضع الردود على المواضيع الحساسة سياسياً لقيود. وهذا الأمر ذو صلة إذا كان منتجك يتعامل مع استفسارات مفتوحة.
• تُحتسب رموز التفكير ضمن المخرجات.مع تفعيل الاستدلال، تكون التكاليف الفعلية أعلى من التقديرات المبدئية. قِس التكاليف مع ضبط الاستدلال بالطريقة التي ستُطلق بها المنتج فعليًا.

الأسئلة الشائعة
هل Qwen3.8-Max متاح الآن؟
نعم. لقد أصبح متاحًا بشكل عام في 3 أغسطس 2026، مع جدول أسعار منشور وواجهة برمجة تطبيقات متوافقة مع OpenAI وDashScope. الإصدار الإنتاجي الحالي — Qwen3.8-Max-0902، الذي صدر في 2 سبتمبر — يعمل الآن عبر واجهة برمجة تطبيقات QwenCloud، وهو ما تقدمه نقطة النهاية القياسية qwen3.8-max حاليًا. وهذا تغيير عن وضعه التجريبي في 19 يوليو، عندما كان الوصول مقتصرًا على Qwen Chat وتطبيق Qwen وحملة الاعتمادات في Qoder.
ما هو Qwen3.8-Max-0902؟
Qwen3.8-Max-0902 هو الإصدار الإنتاجي المحدَّث بتاريخ 2 سبتمبر 2026 من Qwen3.8-Max: نفس النموذج الرئيسي الهجين المتناثر (sparse-MoE) الذي يضم 2.4 تريليون معامل وسياقًا من مليون رمز، مع تدريب لاحق إضافي على Coding وCowork، وهو متاح على واجهة QwenCloud البرمجية بنفس السعر $2/$6. وتقول Qwen إن اللقطة الجديدة أقوى في المهام المؤسسية والعلمية المعقدة — وهو ادعاء من الشركة الموردة لم يُختبر بعد بشكل مستقل — بينما على صعيد البرمجة فقد حققت بالفعل نتيجة مستقلة: المركز الأول على لوحة Code Arena: WebDev برصيد 1,691 نقطة، وأعلى نقطة في حدّ كفاءتها مقابل التكلفة (Pareto frontier) بمتوسط ~$5 لكل مليون رمز، وفقًا لإعلان Alibaba عن إدراجها في الساحة المباشرة، وهو ما أكده حساب QwenCloud الرسمي.
كم تكلفة Qwen3.8-Max؟
{{1}}2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج، بسعر ثابت عبر سياق كامل يبلغ مليون رمز دون أي رسوم إضافية على المطالبات الطويلة.{{/1}} {{2}}تبلغ تكلفة الوصول إلى الإدخال المخزّن مؤقتًا 0.25 دولار لكل مليون، وإنشاء ذاكرة التخزين المؤقت بشكل صريح 2.50 دولار، وقراءات ذاكرة التخزين المؤقت 0.17 دولار.{{/2}} {{3}}تُفوتر رموز التفكير بسعر الإخراج.{{/3}} {{4}}على مؤشر الذكاء الخاص بـ Artificial Analysis، تبلغ التكلفة المقاسة للنموذج 1.14 دولار لكل مهمة — راجع قسم التسعير لمعرفة سبب تجاوز ذلك لحساب الرموز.{{/4}} {{5}}يعرض مسار DigitalOcean دون خادم السعرين أنفسهما 2/6 دولار مع إدخال مخزّن مؤقتًا بسعر 0.20 دولار.{{/5}}
كم عدد المعلمات التي يمتلكها Qwen3.8-Max؟
2.4 تريليون إجمالاً، في تكوين خليط خبراء متناثر (sparse Mixture-of-Experts). عدد المعاملات النشطة — {{1}}الرقم الذي يحدد فعليًا تكلفة التقديم وزمن الاستجابة{{/1}} — تم تأكيده الآن عند 95 مليار معامل مُفعَّل، وفقًا لبطاقة النموذج الرسمية لـ Qwen3.8-2.4T-A95B (512 خبيرًا؛ 10 موجَّهين بالإضافة إلى خبير مشترك واحد نشط لكل رمز).
هل أوزان Qwen3.8-Max مفتوحة؟
نعم — منذ 12 أغسطس 2026. نشرت Qwen نموذج Qwen3.8-2.4T-A95B (BF16) وQwen3.8-2.4T-A95B-FP8 على Hugging Face، كل منهما يحتوي على 213 ملف وزن. الترخيص هو ترخيص Qwen3.8-Max مخصص (يصنفه Hugging Face على أنه "أخرى")، وليس Apache 2.0: فهو يسمح بالاستخدام التجاري مع الإسناد ويتضمن بوابتين قائمتين على الحجم. نقطة التحقق المفتوحة نصية فقط مع تفكير دائم التفعيل؛ واجهة برمجة التطبيقات المستضافة تضيف الرؤية، ووضعًا اختياريًا بدون تفكير، وسياق 1M الكامل.
هل تم اختبار Qwen3.8-Max بشكل مستقل؟
نعم — اعتبارًا من 6 أغسطس 2026. تمنحها Artificial Analysis درجة 56 على مؤشر الذكاء لديها مقابل 1.14 دولارًا لكل مهمة، وفقًا للقياس على واجهة Alibaba الرسمية: قفزة بمقدار 10 نقاط عن Qwen3.7-Max (46)، وتعادل مع Claude Opus 4.8 (56)، وتتخلف بنقطة واحدة عن Kimi K3 (57). غير أن جدول المعايير أعلاه ما زال من إصدار Alibaba ولم يُستقلّ بالتجربة، ولا يزال لويدر بورد LMArena العام بدون نتيجة منشورة. تغيّرت صورة الساحة المستقلة في 2 سبتمبر: إصدار 0902 المحدَّث ظهر أولًا على نفس المنصة في لوحة Code Arena: WebDev برصيد 1,691 نقطة — نتيجة غيبية من جهة خارجية، وليست جدولًا من Alibaba — كما يدرجها Code Arena في حدود الأداء مقابل التكلفة كأعلى قيمة تسجيلًا على اللوحة بمتوسط تقريبي يبلغ 5 دولارات/MToken. الفحص المفاجئ من DigitalOcean لبنيتها المكمَّمة (88 على GPQA Diamond) هو أول فحص من جهة خارجية على نشر تشغيلي، وهو صريح في كونه استرشاديًا وليس تجربة مضبوطة. تحذير واحد لعمود «مستقل»: CommerceAgentBench، حيث يتصدّر Qwen3.8-Max نماذج الوزن المفتوح، ليس حكمًا مستقلًا ثانيًا — فشركة Accio التي بنته ونشرته هي فريق Alibaba نفسه.
هل Qwen3.8-Max أفضل من Qwen3.7-Max؟
وفقًا لأرقام Alibaba الخاصة، وبشكل جوهري — فإن FrontierSWE 73.5 مقابل 40.7 وDeepSWE 1.1 56.6 مقابل 21.6 تمثلان زيادة تقترب من المضاعفة في مهام هندسة البرمجيات الصعبة. كما أنها أرخص من سابقتها التي كانت بسعر 2.50 دولار/7.50 دولار. وبشكل مستقل، تقدّر AA القفزة الجيلية بعشر نقاط على مؤشر الذكاء الخاص بها (56 مقابل 46). ومع ذلك، لا يزال يتعين التحقق من كلا ادعاءَي البائع على عبء العمل الخاص بك.
هل يمكنني استضافة Qwen3.8-Max بنفسي؟
ليس عمليًا. مجموعة الأوزان الكاملة البالغة 2.4 تريليون معلمة تبلغ تقريبًا 4.9 تيرابايت بصيغة BF16 وحوالي 2.4 تيرابايت بصيغة FP8، ونحو 1.2 تيرابايت بدقة 4 بت — وبالمقارنة مع حوالي 141 جيجابايت لكل معالج H200، فهذا يعني ثمانية أو أكثر من وحدات معالجة الرسوم فائقة الأداء. مع 95 مليار معلمة نشطة لكل رمز، تكون الحوسبة لكل رمز متواضعة نسبيًا، لكن استهلاك الذاكرة هو القيد الحاسم. خدمة NVFP4 من DigitalOcean على معالجات B300 هي الدليل العملي على أن دقة 4 بت يمكن أن تُلائم النموذج على عقدة واحدة. نموذج Qwen3.8-27B — الذي يُقال إنه يستهلك حوالي 17 جيجابايت من ذاكرة الفيديو — هو الخيار الواقعي للتشغيل المحلي، وقد صدرت أوزانه في 14 أغسطس 2026 بموجب رخصة Apache 2.0 — أصبح قابلاً للتنزيل الآن بدلاً من أن يكون وعدًا.
ما هو Qwen3.8-27B؟
نموذج أصغر بكثير أُعلن عنه إلى جانب الطراز الرئيسي، وُضع كمسار عملي للنشر المحلي. إنه نموذج كثيف بمعاملات 27 مليارًا، متعدد الوسائط أصليًا، بسياق أصلي يبلغ 262 ألف رمز قابل للتوسيع إلى مليون، ويُطرح بموجب ترخيص Apache 2.0. ظهرت أوزانه على Hugging Face وModelScope في 14 أغسطس 2026؛ ويشير Daniel Han من Unsloth إلى أنه يعمل في حوالي 17 غيغابايت من ذاكرة الفيديو (VRAM) — أي بطاقة استهلاكية عالية الأداء واحدة. ادعاءات أدائه المذكورة هي من تقارير Alibaba ولم تتم إعادة إنتاجها بشكل مستقل.
هل Qwen3.8-Max متعدد الوسائط؟
نعم — يقبل إدخال النصوص والصور والفيديو ويعيد نصًا. كما يدعم وضع التفكير، واستدعاء الدوال، والأدوات المدمجة، والمخرجات المنظمة. نقطة التحقق ذات الأوزان المفتوحة مخصصة للنصوص فقط؛ أما الإدخال متعدد الوسائط فهو ميزة من ميزات واجهة برمجة التطبيقات المستضافة، وهو ما لا يتوفر في مسار DigitalOcean.
هل يتوفر Qwen3.8-Max على DigitalOcean؟
نعم — منذ 14 أغسطس 2026. توفّر DigitalOcean Serverless Inference نقطة التحقق مفتوحة الأوزان (NVFP4 على NVIDIA HGX B300) بسعر 2.00$/6.00$ لكل مليون مع 0.20$ للإدخال المخزَّن مؤقتًا، وسياق يبلغ 262K رمزًا، ونصوص فقط، مع تفكير يعمل دائمًا. تصف Alibaba شركة DigitalOcean بأنها "شريك الإطلاق يوم 0"؛ والقائمة نفسها ملك DigitalOcean ومستقلة عن تلك الصياغة. الأرقام المقيسة من DigitalOcean: prefill يبلغ ~16K رمزًا/ثانية و~1,937 رمزًا/ثانية للإخراج عند 256 طلبًا متزامنًا مع صفر أخطاء.
هل يمكنني استخدام Qwen3.8-Max عبر OrcaRouter؟
نعم. إنه متاح الآن باسم qwen/qwen3.8-max، ولقطة 2 سبتمبر بمعرّف تاريخي مستقل — qwen/qwen3.8-max-0902 — بنفس التسعير العام $2.00/$6.00، مع هامش ربح 0%. تكلِفة التوجيه هي نفسها التوجيه المباشر، عبر نقطة النهاية المتوافقة مع OpenAI التي تستخدمها بالفعل. تُظهر بيانات القياس عن 7 أيام أن الوقت حتى أول رمز (p50) يبلغ 1.64 ثانية.
هل يجب أن أنقل حركة المرور الإنتاجية إليه اليوم؟
ليس بشكل شامل. إن التسعير وأول تقييم مستقل يجعلان إجراء تقييم جاد أمرًا رخيصًا وجديرًا بالاهتمام الآن، لكن مع تكلفة أعلى بنسبة 25% لكل مهمة مقارنةً بـ Kimi K3، فإن الخطوة المنضبطة هي تقسيم حركة المرور بين نظامك الحالي والنظام الجديد على نفس الاستفسارات، مع توفير خطة احتياطية — وليس ترحيلًا. أما مسار DigitalOcean فيضيف نشرًا مُدارًا ثانيًا للاختبار ضده، مما يجعل التقييم أرخص أيضًا.
خلاصة القول
أمضى Qwen3.8-Max أسبوعين وهو النموذج الأكثر تشويقًا الذي لم يستطع أحد شراءه. لكنه عند الإطلاق العام (GA) أصبح عرضًا مختلفًا حقًا: تسعير ثابت بـ $2/$6 عبر مليون توكن هو تسعير عدواني، وأسعار التخزين المؤقت تجعل عمل الوكيل التكراري رخيصًا، والقفزة الجيلية في FrontierSWE وDeepSWE — إذا تكررت — تجعل منه نموذج برمجة حقيقيًا وليس مجرد استعراضٍ للحجم. وقد حوّل وصول الأوزان المفتوحة بموجب ترخيص حقيقي في 12 أغسطس عبارة «الأوزان المفتوحة قادمة» من وعدٍ إلى حقيقة، كما أن مسار DigitalOcean للتوفّر من اليوم الأول، الذي أُعلن في 14 أغسطس — مع أرقام خدمة مُقاسة وقراءة تخزين مؤقت بسعر $0.20 — يقوّي حجة «جرّبه بتكلفة زهيدة» ويمنح الفرق بيئة نشر مُدارة من طرف ثالث للمقارنة مع واجهة Alibaba البرمجية الخاصة بها. ويُبقي تحديث 2 سبتمبر Qwen3.8-Max-0902 هذه الفرضية سليمة: نفس التسعير $2/$6 وسياق المليون توكن، مع مزيد من التدريب اللاحق على البرمجة والعمل التعاوني الذي كان النموذج مُهيأً له أصلًا. كما أضاف التحديث لوحة نتائج مستقلة لتفضيلات البشر لهذا الطرح البرمجي: فقد ظهر Qwen3.8-Max-0902 لأول مرة في المركز الأول على لوحة WebDev في Code Arena برصيد 1,691 نقطة، متقدمًا على Claude Opus 5 وKimi K3، وبتكلفة إجمالية تبلغ نحو $5/MToken، فهو النموذج الأعلى تسجيلًا على حدود باريتو للتكلفة مقابل الأداء في تلك اللوحة. أما نتيجة CommerceAgentBench التي نشرها فريق Accio التابع لشركة Alibaba في الأسبوع نفسه — حيث يتصدر Qwen3.8-Max مجال الأوزان المفتوحة في معيار مبني على سير عمل تجارية حقيقية — فتمنح فرضية العمل التعاوني تلك لوحة نتائج ملموسة خاصة بها، وإن كانت مُدارة من جهة البائع.
ما الذي تغيّر هو أن الحَكَم والأوزان كلاهما استقرّا — والنتيجة جيدة في معظمها مع علامات نجمية حقيقية. تضع AA نموذج Qwen3.8-Max عند 56 على مؤشر الذكاء، وهي قفزة جيلية حقيقية تجعله في مستوى Claude Opus 4.8، رغم أن بطاقة الأداء نفسها تُظهر Kimi K3 متقدمًا بنقطة واحدة مع تكلفة أقل بنسبة 25% لكل مهمة، وتشير إلى انخفاض بمقدار 10 نقاط في مؤشر Omniscience مع ارتفاع معدل الهلوسة. مسألة المعاملات النشطة حُسمت — 95B مُفعّل، مؤكد في بطاقة النموذج — والترخيص منشور، مخصص وليس Apache 2.0. ما لم يتغيّر: جدول معايير Alibaba الخاص ما زال غير قابل للتكرار، والتكلفة لكل مهمة ما زالت مرتفعة لأن النموذج يعمل عبر خطوات كثيرة جدًا، والقاعدة المفتوحة المستضافة على DigitalOcean هي نموذج مختلف قليلاً عن الأرقام الرئيسية للنموذج الرائد (سياق 262K، NVFP4، فحص GPQA 88 مقابل 92.6)، وادعاءات معايير Qwen3.8-27B مقدمة من البائع حتى وإن كانت أوزانه قد صدرت. هذا المزيج لا يجعل Qwen3.8-Max رهانًا سيئًا — عند هذا السعر هو قريب من كونه تجربة إلزامية — لكنه يعني أن الموقف الصحيح هو التقييم بعدوانية، والتوجيه بعناية، والإبقاء على خطة بديلة. الحدث الذي يجب مراقبته الآن هو ما إذا كان عدد الخطوات العاملة خلف تكلفة 1.14 دولار لكل مهمة شيئًا يمكن لعبء عملك استيعابه، وما إذا كانت ميزة Build 0902 في Code Arena: WebDev ستستمر مع تراكم الأصوات، وما إذا كانت مكاسبها في Coding وCowork ستتكرر على أعباء عمل حقيقية، وما إذا كانت ميزة الأوزان المفتوحة في CommerceAgentBench — وهما تمريران إجماليان على منصة Alibaba الخاصة — ستصمد أمام تشغيل مستقل، وما إذا كانت ادعاءات معايير 27B ستصمد، وما إذا كانت الإنتاجية المقاسة لاستضافة DigitalOcean ستصمد تحت حركة مرور حقيقية — هذا هو ما سيقرر ما إذا كان "الثاني فقط بعد Fable 5" كان تحديدًا للموضع أم نبوءة.

مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
