
Qwen3.8 Max Prime: Alibaba تضع بطاقة أسعار ثانية بجانب طرازها الرائد
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 584 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 187 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
في 22 سبتمبر 2026، في مؤتمر يونتشي في هانغتشو، أعلن خط أعمال MaaS لدى علي بابا عن مستوى خدمة يسميه وضع Prime — 优速模式 — وطرح معرّف نموذج جديد على قائمة الأسعار الخاصة به: qwen3.8-max-prime. هذا المعرّف ليس نموذجًا جديدًا. إنه Qwen3.8-Max، النموذج الرائد القائم على مزيج خبراء متناثر ببارامترات تبلغ 2.4 تريليون، والذي وصل إلى التوفر العام في 3 أغسطس 2026، ويُقدَّم عبر مسار أسرع. Qwen3.8 Max Prime يحمل الأوزان نفسها، ونافذة السياق نفسها، والأدوات نفسها، وحدود الاستخدام نفسها التي يحملها النموذج الأساسي. ما يختلف هو الإنتاجية والسعر، والسعر يتضاعف تقريبًا.
هذه هي المرة الثانية خلال سبعة أسابيع التي تغيّر فيها Alibaba طريقة بيع Qwen3.8-Max دون تغيير ماهيته.Qwen3.8-Max-0902في 2 سبتمبر، أصدرت الشركة تحديثًا مُدرَّبًا لاحقًا مثبَّتًا باسمه، يركّز على البرمجة والعمل الوكيلي، عبر API فقط. وفي 22 سبتمبر أُضيفت فئة السرعة. لم يكن أيٌّ منهما عملية إطلاق، واعتبار أيٍّ منهما كذلك سيكلّفك المال.

ما هو وضع Prime في الحقيقة
تصف وثائق Alibaba الخاصة وضع Prime كقناة لـ "السيناريوهات الحساسة لسرعة الإخراج" — مساعدي البرمجة بالذكاء الاصطناعي، واستدلال الوكلاء متعدد الخطوات، والمحادثات في الوقت الفعلي — وتذكر الفائدة بوضوح: يتم رفع TPS إلى 1.5 إلى 2 ضعف واجهة برمجة التطبيقات القياسية. لا توجد معلمة جديدة لتعيينها. تقوم بتبديل النموذج قيمته إلى معرف Prime وتكون على المسار السريع.
الوثائق صريحة بالقدر نفسه بشأن ما لا يتغيّر: «القدرات المدعومة من النموذج وقيود الاستخدام هي نفسها كما في النموذج الأصلي». لذا لا يوجد سياق أكبر، ولا وضع استدلال أفضل، ولا سطح أدوات إضافي. إنها مجموعة التقديم نفسها مع هامش أكبر خلفها.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
بطاقة الأسعار، اقرأها بعناية
تعرض صفحة الأسعار الدولية الخاصة بـ Alibaba هذين المعرّفين جنبًا إلى جنب، وهو ما يجعل المقارنة واضحة على نحو غير معتاد. لكل مليون رمز:
• الإدخال — qwen3.8-max-prime $3.301 مقابل qwen3.8-max $1.65
• الإخراج — qwen3.8-max-prime 9.902 دولار مقابل qwen3.8-max 4.951 دولار
• إصابة في الذاكرة المؤقتة — qwen3.8-max-prime $0.413 مقابل سعر قراءة من الذاكرة المؤقتة على المعرّف القياسي الذي تعرضه الصفحة نفسها كسطر خصم
• النسبة — 2.0× لكلٍّ من الإدخال والإخراج، وليس تقديرًا مُدوَّرًا، بل الحساب الحرفي للأرقام المنشورة
في قائمة أسعار الصين، ينطبق مضاعف 2× نفسه باليوان: 24 ¥ للمدخلات و72 ¥ للمخرجات لكل مليون لـ Prime ID، مقابل 12 ¥ و36 ¥ للفئة القياسية، مع إصابات الذاكرة المخبئية عند 3 ¥.
الرقم المذكور على نطاق واسع لإطلاق Qwen3.8-Max هو 2 دولار للإدخال و6 دولار للإخراج لكل مليون. هذا هو العنوان الرئيسي الذي اعتمدته تغطية أغسطس، وهو ليس الرقم الموجود في بطاقة الأسعار الدولية اليوم. إذا كنت تضع نموذجًا للإنفاق، فاستخدم بطاقة الأسعار الخاصة بمنطقتك بدلاً من عنوان الإطلاق، وتحقق منها مرة أخرى قبل أن تلتزم — لقد قامت Alibaba بمراجعة هذه الصفحة مرتين منذ 2 سبتمبر.

قاعدة تحديد المعدل هي الميزة الحقيقية
السطر الذي يتجاهله معظم الناس هو الأكثر أهمية للإنتاج. توضح وثائق Alibaba Prime أنه عندما يصل استخدامك إلى حد المعدل، إذا كانت المنصة لا تزال لديها موارد احتياطية، فلن يتم تقييدك، لذا فإن الإنتاجية المتاحة لك فعليًا لن تنخفض عن الحد المذكور.
هذا سقف مرن مع أرضية صلبة، وهو شكل مختلف عن حد الطبقة القياسي. وهو يعني أن رقم 1.5–2× وعدٌ بشأن الأرضية، وليس حدًا أقصى للسقف: عند التنازع تحصل على الحد، وعند السعة الخاملة يمكنك الحصول على أكثر. وبالنسبة لحلقة وكيل تطلق عشرات الاستدعاءات المتتابعة، فإن عدم التماثل هذا يساوي أكثر من مضاعف TPS الخام، لأن زمن الاستجابة الطرفي في أبطأ استدعاء هو ما يحدد ما إذا كان سير عملك ينتهي.
حدود TPM الديناميكية للنماذج القياسية موزَّعة على مستويات حسب الإنفاق الشهري على Model Studio — وتُظهر المجموعة الوثائقية نفسها معرّف qwen3.8-max الأساسي عند 5,000,000 و10,000,000 و20,000,000 TPM عبر المستويات، ويُحدَّث شهريًا. ولا يُلغي Prime هذا الهيكل؛ بل يغيّر طريقة تأثيره.

ما لم يقيسه أحد بعد
إليك الفجوة الصريحة. رقم 1.5–2× هو مُعلَن من المورّد. لا يوجد أي قياس مستقل لإنتاجية Prime-mode يمكننا العثور عليه، وهذا مهم لأن أرقام الإصدار القياسي المستقلة نفسها لا تُظهر السرعة بصورة جيدة.
يمنح "Artificial Analysis"، الذي يقيس النماذج على منصّته الخاصة، حاليًا Qwen3.8-Max على إصدار 0902 مؤشر ذكاء قدره 45، مع تسجيل GPQA Diamond عند 92.8%، وTerminal-Bench Hard عند 38.9%، وHumanity's Last Exam عند 43.1% — ويقدّر تكلفته المقيسة لكل مهمة بـ 5.41 دولار. وهذه أرقام مستقلة على وحدة SKU القياسية، جُمِعت بتاريخ 2026-09-24. وهي أيضًا تذكير بأن المؤشر قد روجِع منذ تغطية الإطلاق في أغسطس، لذا لا تضع قيمة مؤشر قديمة بجانب قيمة حالية وتسمّي ذلك اتجاهًا.
ما لا تمتلكه AA هو صف Prime. وإلى أن يقيسه أحد، فإن ادعاء السرعة يخص Alibaba وحدها، والموقف الصحيح هو اختباره على حمل العمل الخاص بك بدلاً من افتراض أنه في أعلى الفئة.
ما يعنيه هذا بالنسبة لقرار التوجيه
Prime هي فئة تبيعها Alibaba على واجهة API الخاصة بها، وهي المكان الوحيد للحصول عليها. نحن لا نستضيف qwen3.8-max-prime هنا. ما يوجّهه OrcaRouter فعلاً هو الإصدار القياسي Qwen3.8-Max وإصداره المثبّت بتاريخ Qwen3.8-Max-0902، وكلاهما على نفس المفتاح المستخدم لبقية عائلة Qwen3.8 — Qwen3.8، Qwen3.8-Flash، Qwen3.8-27B — إلى جانب أكثر من 200 نموذج آخر، مع تمرير سعر القائمة لدى المزوّد كما هو وبهامش ربح 0%وهذا الجزء الأخير هو السبب في أن تحديث 2 سبتمبر وأي تغيير مستقبلي في سعر Max يظهران لدينا في اليوم نفسه الذي يظهران فيه لدى Alibaba.
التقسيم العملي يبدو هكذا. شغِّل حركة المرور الافتراضية لديك على المعرِّف القياسي عبر موجِّه، حيث يحميك التحويل التلقائي عند الفشل إذا تدهور مسار مزوِّد واحد. وانقل الاستدعاءات المحددة التي يكون فيها زمن الاستجابة الفعلي هو المنتج نفسه — الإكمال التفاعلي، وخطوة الوكيل الضيقة زمنيًا — إلى Prime، واحسب تكلفة ذلك القرار مقابل 2× لا مقابل 1.5×.
من الذي يجب أن يتحول، ومن الذي يجب أن ينتظر؟
بدّل إذا كان مستخدموك ينتظرون الرموز: إكمال تلقائي، أو دور محادثة، أو حلقة تحرير شيفرة يراقبها إنسان. عند الطرف الأعلى من نطاق السرعة، يكون Prime متعادل التكلفة لكل ثانية يُزال فيها زمن الاستجابة — فتدفع ضعف المبلغ بالضبط مقابل نصف الوقت بالضبط. وعند الطرف الأدنى من النطاق، تدفع 2× مقابل 1.5×، أي علاوة بنسبة 33% لكل ثانية يتم توفيرها. وإذا كان عبء العمل لديك مهمة دفعية تعمل طوال الليل، فإن هذه العلاوة لا تشتري لك شيئًا كنت بحاجة إليه.
انتظر إذا كان نموذج التكلفة لديك مبنيًا على الرقم المعلن عند الإطلاق، 2$/6$، أو إذا كانت طلباتك كثيفة المدخلات. ادّعاء المورّد بشأن السرعة يتعلق بـ TPS — أي رموز المخرجات في الثانية — بينما التعبئة المسبقة (prefill) مرحلة مختلفة في خط المعالجة. الطلب ذو السياق الطويل يدفع ضعف الثمن على رموز المدخلات، سواء وصلت المخرجات أسرع أم لا. قِس هذه الحالة قبل أن تنقلها.
وتحقّق من التاريخ على بطاقة أسعارك. Qwen3.8-Max موجود في السوق منذ 3 أغسطس، وقد حُدِّث مرة واحدة، وأُعيد تغليفه مرة واحدة، وما زال عمره سبعة أسابيع. الفئة هي الخبر؛ أما النموذج فليس كذلك.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
