بطاقة عنوان رئيسية لـ Qwen3.8 Max Prime، طبقة خدمة الإنتاجية لدى علي بابا بسرعة 1.5-2x لطراز Qwen3.8-Max الرائد، مع شرائح مواصفات تعرض نفس الإجمالي 2.4T و ~95B نشط، Prime بسعر $3.301/$9.902، والقياسي بسعر $1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba تضع بطاقة أسعار ثانية بجانب طرازها الرائد

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 22 سبتمبر 2026، في مؤتمر يونتشي في هانغتشو، أعلن خط أعمال MaaS لدى علي بابا عن مستوى خدمة يسميه وضع Prime — 优速模式 — وطرح معرّف نموذج جديد على قائمة الأسعار الخاصة به: qwen3.8-max-prime. هذا المعرّف ليس نموذجًا جديدًا. إنه Qwen3.8-Max، النموذج الرائد القائم على مزيج خبراء متناثر ببارامترات تبلغ 2.4 تريليون، والذي وصل إلى التوفر العام في 3 أغسطس 2026، ويُقدَّم عبر مسار أسرع. Qwen3.8 Max Prime يحمل الأوزان نفسها، ونافذة السياق نفسها، والأدوات نفسها، وحدود الاستخدام نفسها التي يحملها النموذج الأساسي. ما يختلف هو الإنتاجية والسعر، والسعر يتضاعف تقريبًا.

هذه هي المرة الثانية خلال سبعة أسابيع التي تغيّر فيها Alibaba طريقة بيع Qwen3.8-Max دون تغيير ماهيته.Qwen3.8-Max-0902في 2 سبتمبر، أصدرت الشركة تحديثًا مُدرَّبًا لاحقًا مثبَّتًا باسمه، يركّز على البرمجة والعمل الوكيلي، عبر API فقط. وفي 22 سبتمبر أُضيفت فئة السرعة. لم يكن أيٌّ منهما عملية إطلاق، واعتبار أيٍّ منهما كذلك سيكلّفك المال.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

ما هو وضع Prime في الحقيقة

تصف وثائق Alibaba الخاصة وضع Prime كقناة لـ "السيناريوهات الحساسة لسرعة الإخراج" — مساعدي البرمجة بالذكاء الاصطناعي، واستدلال الوكلاء متعدد الخطوات، والمحادثات في الوقت الفعلي — وتذكر الفائدة بوضوح: يتم رفع TPS إلى 1.5 إلى 2 ضعف واجهة برمجة التطبيقات القياسية. لا توجد معلمة جديدة لتعيينها. تقوم بتبديل النموذج قيمته إلى معرف Prime وتكون على المسار السريع.

الوثائق صريحة بالقدر نفسه بشأن ما لا يتغيّر: «القدرات المدعومة من النموذج وقيود الاستخدام هي نفسها كما في النموذج الأصلي». لذا لا يوجد سياق أكبر، ولا وضع استدلال أفضل، ولا سطح أدوات إضافي. إنها مجموعة التقديم نفسها مع هامش أكبر خلفها.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

بطاقة الأسعار، اقرأها بعناية

تعرض صفحة الأسعار الدولية الخاصة بـ Alibaba هذين المعرّفين جنبًا إلى جنب، وهو ما يجعل المقارنة واضحة على نحو غير معتاد. لكل مليون رمز:

• الإدخال — qwen3.8-max-prime ‏$3.301 مقابل qwen3.8-max ‏$1.65

• الإخراج — qwen3.8-max-prime ‏9.902 دولار مقابل qwen3.8-max ‏4.951 دولار

• إصابة في الذاكرة المؤقتة — qwen3.8-max-prime $0.413 مقابل سعر قراءة من الذاكرة المؤقتة على المعرّف القياسي الذي تعرضه الصفحة نفسها كسطر خصم

• النسبة — 2.0× لكلٍّ من الإدخال والإخراج، وليس تقديرًا مُدوَّرًا، بل الحساب الحرفي للأرقام المنشورة

في قائمة أسعار الصين، ينطبق مضاعف 2× نفسه باليوان: 24 ¥ للمدخلات و72 ¥ للمخرجات لكل مليون لـ Prime ID، مقابل 12 ¥ و36 ¥ للفئة القياسية، مع إصابات الذاكرة المخبئية عند 3 ¥.

الرقم المذكور على نطاق واسع لإطلاق Qwen3.8-Max هو 2 دولار للإدخال و6 دولار للإخراج لكل مليون. هذا هو العنوان الرئيسي الذي اعتمدته تغطية أغسطس، وهو ليس الرقم الموجود في بطاقة الأسعار الدولية اليوم. إذا كنت تضع نموذجًا للإنفاق، فاستخدم بطاقة الأسعار الخاصة بمنطقتك بدلاً من عنوان الإطلاق، وتحقق منها مرة أخرى قبل أن تلتزم — لقد قامت Aliba​ba بمراجعة هذه الصفحة مرتين منذ 2 سبتمبر.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

قاعدة تحديد المعدل هي الميزة الحقيقية

السطر الذي يتجاهله معظم الناس هو الأكثر أهمية للإنتاج. توضح وثائق Aliba​ba Prime أنه عندما يصل استخدامك إلى حد المعدل، إذا كانت المنصة لا تزال لديها موارد احتياطية، فلن يتم تقييدك، لذا فإن الإنتاجية المتاحة لك فعليًا لن تنخفض عن الحد المذكور.

هذا سقف مرن مع أرضية صلبة، وهو شكل مختلف عن حد الطبقة القياسي. وهو يعني أن رقم 1.5–2× وعدٌ بشأن الأرضية، وليس حدًا أقصى للسقف: عند التنازع تحصل على الحد، وعند السعة الخاملة يمكنك الحصول على أكثر. وبالنسبة لحلقة وكيل تطلق عشرات الاستدعاءات المتتابعة، فإن عدم التماثل هذا يساوي أكثر من مضاعف TPS الخام، لأن زمن الاستجابة الطرفي في أبطأ استدعاء هو ما يحدد ما إذا كان سير عملك ينتهي.

حدود TPM الديناميكية للنماذج القياسية موزَّعة على مستويات حسب الإنفاق الشهري على Model Studio — وتُظهر المجموعة الوثائقية نفسها معرّف qwen3.8-max الأساسي عند 5,000,000 و10,000,000 و20,000,000 TPM عبر المستويات، ويُحدَّث شهريًا. ولا يُلغي Prime هذا الهيكل؛ بل يغيّر طريقة تأثيره.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

ما لم يقيسه أحد بعد

إليك الفجوة الصريحة. رقم 1.5–2× هو مُعلَن من المورّد. لا يوجد أي قياس مستقل لإنتاجية Prime-mode يمكننا العثور عليه، وهذا مهم لأن أرقام الإصدار القياسي المستقلة نفسها لا تُظهر السرعة بصورة جيدة.

يمنح "Artificial Analysis"، الذي يقيس النماذج على منصّته الخاصة، حاليًا Qwen3.8-Max على إصدار 0902 مؤشر ذكاء قدره 45، مع تسجيل GPQA Diamond عند 92.8%، وTerminal-Bench Hard عند 38.9%، وHumanity's Last Exam عند 43.1% — ويقدّر تكلفته المقيسة لكل مهمة بـ 5.41 دولار. وهذه أرقام مستقلة على وحدة SKU القياسية، جُمِعت بتاريخ 2026-09-24. وهي أيضًا تذكير بأن المؤشر قد روجِع منذ تغطية الإطلاق في أغسطس، لذا لا تضع قيمة مؤشر قديمة بجانب قيمة حالية وتسمّي ذلك اتجاهًا.

ما لا تمتلكه AA هو صف Prime. وإلى أن يقيسه أحد، فإن ادعاء السرعة يخص Alibaba وحدها، والموقف الصحيح هو اختباره على حمل العمل الخاص بك بدلاً من افتراض أنه في أعلى الفئة.

ما يعنيه هذا بالنسبة لقرار التوجيه

Prime هي فئة تبيعها Alibaba على واجهة API الخاصة بها، وهي المكان الوحيد للحصول عليها. نحن لا نستضيف qwen3.8-max-prime هنا. ما يوجّهه OrcaRouter فعلاً هو الإصدار القياسي Qwen3.8-Max وإصداره المثبّت بتاريخ Qwen3.8-Max-0902، وكلاهما على نفس المفتاح المستخدم لبقية عائلة Qwen3.8 — Qwen3.8، Qwen3.8-Flash، Qwen3.8-27B — إلى جانب أكثر من 200 نموذج آخر، مع تمرير سعر القائمة لدى المزوّد كما هو وبهامش ربح 0%وهذا الجزء الأخير هو السبب في أن تحديث 2 سبتمبر وأي تغيير مستقبلي في سعر Max يظهران لدينا في اليوم نفسه الذي يظهران فيه لدى Alibaba.

التقسيم العملي يبدو هكذا. شغِّل حركة المرور الافتراضية لديك على المعرِّف القياسي عبر موجِّه، حيث يحميك التحويل التلقائي عند الفشل إذا تدهور مسار مزوِّد واحد. وانقل الاستدعاءات المحددة التي يكون فيها زمن الاستجابة الفعلي هو المنتج نفسه — الإكمال التفاعلي، وخطوة الوكيل الضيقة زمنيًا — إلى Prime، واحسب تكلفة ذلك القرار مقابل 2× لا مقابل 1.5×.

من الذي يجب أن يتحول، ومن الذي يجب أن ينتظر؟

بدّل إذا كان مستخدموك ينتظرون الرموز: إكمال تلقائي، أو دور محادثة، أو حلقة تحرير شيفرة يراقبها إنسان. عند الطرف الأعلى من نطاق السرعة، يكون Prime متعادل التكلفة لكل ثانية يُزال فيها زمن الاستجابة — فتدفع ضعف المبلغ بالضبط مقابل نصف الوقت بالضبط. وعند الطرف الأدنى من النطاق، تدفع 2× مقابل 1.5×، أي علاوة بنسبة 33% لكل ثانية يتم توفيرها. وإذا كان عبء العمل لديك مهمة دفعية تعمل طوال الليل، فإن هذه العلاوة لا تشتري لك شيئًا كنت بحاجة إليه.

انتظر إذا كان نموذج التكلفة لديك مبنيًا على الرقم المعلن عند الإطلاق، 2$/6$، أو إذا كانت طلباتك كثيفة المدخلات. ادّعاء المورّد بشأن السرعة يتعلق بـ TPS — أي رموز المخرجات في الثانية — بينما التعبئة المسبقة (prefill) مرحلة مختلفة في خط المعالجة. الطلب ذو السياق الطويل يدفع ضعف الثمن على رموز المدخلات، سواء وصلت المخرجات أسرع أم لا. قِس هذه الحالة قبل أن تنقلها.

وتحقّق من التاريخ على بطاقة أسعارك. Qwen3.8-Max موجود في السوق منذ 3 أغسطس، وقد حُدِّث مرة واحدة، وأُعيد تغليفه مرة واحدة، وما زال عمره سبعة أسابيع. الفئة هي الخبر؛ أما النموذج فليس كذلك.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا