بطاقة عنوان رئيسية لمقارنة GPT-6 Astra مع Qwen3.8-Max، مع عنوان فرعي: 'رائدان وكيلان والتفاصيل الدقيقة تحت كلٍّ منهما'، وشرائح إحصائية تعرض 'AA Intelligence: 61 مقابل 58' و'سعر القائمة: 10$/50$ مقابل 2$/6$' و'ARC-AGI-3: 99.9% من جهة البائع مقابل 62.7% عبر بيئة اختبار محايدة'، وتذييل بتاريخ الإطلاق، وشعار OrcaRouter في الركن السفلي الأيمن.
Guides & Insights

GPT-6 Astra مقابل Qwen3.8-Max: نموذجان رائدان للوكلاء والتفاصيل الدقيقة خلف كل منهما

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في سبتمبر 2026 هناك قصتان عن «النموذج الوكيل الرائد»، وGPT-6 Astra وQwen3.8-Max هما بطلا القصتين. أطلقت OpenAI نموذج GPT-6 Astra في 3 سبتمبر بوصفه النموذج الذي تقول إنه الأفضل في العالم لاستخدام الحاسوب وهندسة البرمجيات والعلوم والأمن السيبراني؛ أما Qwen3.8-Max من Alibaba، المتاح منذ 3 أغسطس، فهو النموذج الوكيل الرائد لأقوى مختبر صيني — وهو النموذج الذي يضعُه Artificial Analysis في صدارة المجال على مؤشره الوكيل، وهو أقرب منافس من النظام البيئي المفتوح لادعاءات النماذج الحدودية حول العمل المستقل. كلاهما قوي فعلًا، وكلاهما يُسوَّق بأرقام بارزة تتقلص عند التدقيق: نتيجة OpenAI البالغة 99.9% في ARC-AGI-3 تنخفض إلى 62.7% عندما يُجري ARC Prize اختباره المحايد الخاص؛ كما أن تألّق Qwen3.8-Max الوكيل يقترن بتراجع في الهلوسة جرى قياسه بشكل مستقل، وبعادة إنفاق 64 دورة وأكثر من دولار على مهام كان سلفه يُنجزها في 14 دورة. هذه مقارنة بين نموذجين — وبين طريقتين لقراءة المؤشرات المعيارية.

العنوانان الرئيسيان

ترويج OpenAI لنموذج GPT-6 Astra يقوم على الاتساع بالإضافة إلى الاستقلالية: نموذج واحد يقود متصفحًا، ويكتب ويصحح الأكواد البرمجية، ويُجري التحليلات العلمية، وبشكل فريد — يكتشف ثغرات أمنية جديدة بكفاءة عالية لدرجة أن OpenAI صنّفت النموذج بأكمله على أنه "حرج" وفقًا لإطار الاستعداد الخاص بها، وقيّدت الإعدادات الأكثر قدرة على شركاء معتمدين. تدّعي مواد الإطلاق تحقيق نسبة 100% مثالية على معيار ExploitBench، و97.6% على FrontierMath Tier 4، و96.0% على GPQA Diamond، ودرجة تشبّع كاملة على ARC-AGI-3. أما ترويج Alibaba لنموذج Qwen3.8-Max فهو أضيق نطاقًا لكنه موجّه بدقة: حصان عمل وكيلٍ بسعر 2/6 دولار، يحقق نتائج في القمة أو قريبًا منها في التقييمات الوكيلة المستقلة، مع نشر الأوزان الأساسية (بموجب ترخيص مخصص) بدلًا من حبسها في صندوق أسود.

ماذا تقول لوحة النتائج المستقلة

تُقيّم Artificial Analysis حاليًا GPT-6 Astra (الأقصى) بدرجة 61 في Intelligence — محتلًا المرتبة 8 من بين 202 نموذج تتتبّعه — وQwen3.8-Max بدرجة 58 في Intelligence، في المرتبة 24. هذه الفجوة البالغة ثلاث نقاط أصغر من فجوة السعر وأصغر من تسويق أيٍّ من البائعَين؛ وفي مؤشر AA المنفصل للوكلاء، يسجّل Qwen3.8-Max 58 وضعه في مستوى أفضل النماذج الاحتكارية الرائدة، بينما لا تنشر AA أي مؤشر للوكلاء لـGPT-6 Astra على الإطلاق. القراءة الصادقة: من حيث الذكاء المقاس الخالص، هذان النموذجان متجاوران، وإنّ تأطير «النموذج الأكثر ذكاءً في العالم» في مواد إطلاق OpenAI ليس ما يُظهره تقييم AA المستقل.

الذكاء — GPT-6 Astra (max): AA Intelligence 61، المرتبة #8/202. Qwen3.8-Max: AA Intelligence 58، المرتبة #24/202؛ AA Agentic 58.

سعر القائمة — GPT-6 Astra: $10.00 / $50.00 لكل مليون، $1.00 لقراءة الكاش، و2× للإدخال بعد 272 ألف رمزًا. Qwen3.8-Max: $2.00 / $6.00 لكل مليون، $0.25 لقراءة الكاش.

السياق / المخرجات — GPT-6 Astra: 1.05M إدخال / 128K إخراج. Qwen3.8-Max: 1M إدخال / ~128K إخراج.

الأدلة الوكيلية — GPT-6 Astra: 99.9% في ARC-AGI-3 (ببيئة OpenAI) مقابل 62.7% (ببيئة ARC Prize القياسية)؛ WANDR 0.682 بتكلفة 11.98 دولارًا للمهمة (وفقًا لتقرير Perplexity). Qwen3.8-Max: 1,739 Elo في AA GDPval عند 64 دورة لكل مهمة (بنحو 1.14 دولار للمهمة)؛ Code Arena WebDev: الأول بـ1,691 Elo.

علامات خطر مستقلة — GPT-6 Astra: لم يُدرج بعد في منتقي ChatGPT، وAPI على مراحل، وتنازل عن قابلية المراقبة. Qwen3.8-Max: تراجع الهلوسة على معيار AA-Omniscience من 23% إلى 40% مقارنة بالجيل السابق.

الأوزان — GPT-6 Astra: ملكية خاصة. Qwen3.8-Max: نقطة تفتيش من فئة Max (Qwen3.8-2.4T-A95B) متاحة للعموم بموجب ترخيص مخصص منذ 12 أغسطس؛ لا تزال AA تدرج الرائد المستضاف كملكية خاصة.

Two-column comparison scoreboard for GPT-6 Astra vs Qwen3.8-Max. GPT-6 Astra column: AA Intelligence 61 (#8 of 202), AA Agentic not yet published, list price $10.00/$50.00, context/output 1.05M/128K, headline score ARC-AGI-3 99.9% on OpenAI's provider-adapter harness, independent caveat 62.7% on ARC Prize's standard harness. Qwen3.8-Max column: AA Intelligence 58 (#24 of 202), AA Agentic 58, list price $2.00/$6.00, context/output 1M/~128K, headline score GDPval 1,739 Elo on Artificial Analysis runs, independent caveat hallucination regression from 23% to 40% per AA-Omniscience.

الخط الدقيق، مشروحًا

تناول رقم ARC-AGI-3 أولاً، لأنه أنقى مثال على كيف يمكن لرقمٍ أن يكون صحيحًا ومضللاً معًا. تذكر OpenAI أن GPT-6 Astra يحقق 99.9% على منصة تقييمها الخاصة المزوّدة بمحوّل لمقدّم الخدمة — وهي بيئة مصممة خصيصًا للنموذج. أما ARC Prize، المنظمة التي تشرف على هذا المعيار، فقد شغّلت GPT-6 Astra على منصة التقييم المعيارية المحايدة تجاه مقدّم الخدمة، وسجّلت 62.7%. كلتا النتيجتين في قمة النتائج الرائدة؛ لكن أياً منهما لا يبلغ 99.9% على منصة لا يسيطر عليها صانع النموذج. ينطبق التحذير نفسه على درجة Perplexity في WANDR البالغة 0.682 — وهي أعلى درجة سجّلتها Perplexity، لكنّ من قاسها شركة تدمج في الوقت نفسه GPT-6 Astra في منتجاتها، لذلك تحمل مصلحة تجارية. هذا النمط يستحق أن يُسمّى: جميع أرقام OpenAI الأكثر إبهارًا تأتي من منصات تقييم تتحكم فيها OpenAI أو شركاؤها، والرقم المستقل تمامًا الوحيد — Intelligence 61 من AA — هو ممتاز فحسب.

تقرير Qwen3.8-Max الدقيق يسير في الاتجاه المعاكس: نقاط قوته تُقاس بشكل مستقل، وضعفه يُقاس أيضًا بشكل مستقل. درجة GDPval البالغة 1,739 إيلو حقيقية — لكن تشغيلات Artificial Analysis تُظهر أن Qwen3.8-Max يصل إليها عبر إنفاق 64 دورة وما يقارب 1.14 دولار لكل مهمة، مقابل 14 دورة و0.53 دولار للجيل السابق. تلك ضريبة جهد: النموذج يشتري سقفه الوكيل برموز الاستدلال، وهو ما يهم أي شخص يدفع لكل رمز. وقد قيّم تقييم Omniscience من AA تراجعًا في الهلوسة من 23% إلى 40% مقارنة بجيل Qwen السابق — علامة مستقلة حقيقية لأعباء العمل المستقلة متعددة الخطوات تحديدًا، حيث تكون الإجابة الخاطئة الواثقة أغلى ما يكون. النموذج الذي يقنع نفسه بالأخطاء على مدى 64 دورة ليس أوضح أمانًا لإطلاقه من نموذج يعترف صانعه بأن قابلية مراقبته تراجعت.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) showing an Intelligence Index of 61 ranked #8 of 202, Cost ranked #86 of 202 with $10.00 input and $50.00 output per million tokens and a 90% cache discount, a $1.67 cost per Intelligence Index task, and a summary describing the model as among the leaders in intelligence but expensive for its class.

السعر، والنشر، والطريقة الصادقة للاختيار

على صعيد السعر، لا مجال للمنافسة: نموذج Qwen3.8-Max، بسعر 2.00 دولار / 6.00 دولار لكل مليون، يعادل خمس سعر الإدخال في GPT-6 Astra وثمن سعر الإخراج فيه، مع سياق من مليون توكن لا يتحمل رسوم Astra الإضافية على المطالبات الطويلة. أمّا من حيث قابلية النشر، فيتمتع Qwen3.8-Max بميزة إضافية هذا الأسبوع — يمكن استدعاؤه اليوم، وهو متاح على OrcaRouter بسعر القائمة لدى Alibaba، ويُمرَّر السعر دون أي هامش ربح، مع تجاوز تلقائي عند الفشل. GPT-6 Astra، الذي لا يزال في طور الطرح ولم يصبح بعد قابلاً للاختيار في ChatGPT لدى معظم المستخدمين بحلول 4 سبتمبر، يمكن الوصول إليه عبر واجهة برمجة التطبيقات الخاصة بـ OpenAI والأسواق السحابية الرئيسية بينما يتسع نطاق الوصول. النمط العملي لفريق يبني خطوط أنابيب تعتمد على الوكلاء هو وضع عبء العمل على النموذج الذي يمكنك استدعاؤه اليوم، ومعاملة الآخر كمعيار للمراقبة. إذا أردت تقييم ادعاءات "agentic" بدلاً من تصديقها، فإن طبقة التوجيه هي الأداة: نماذج Qwen3.8-Max وKimi K3 وGrok 4.6 و200+ نموذج آخر تجتمع خلف مفتاح واحد على OrcaRouter، ويمكن للغة التوجيه المخصصة (DSL) أن تدمج عدة نماذج منها في استدعاء واحد — لذا يمكنك تشغيل مجموعة مهامك الخاصة على النماذج المتنافسة وقراءة النتائج بنفسك بدلاً من الاختيار بين التفاصيل الدقيقة لمورّدَين.

سؤالان يطرحهما هذا اللقاء باستمرار

لماذا تعلن OpenAI عن نتيجة 99.9% على اختبار ARC-AGI-3 بينما تقيس ARC Prize 62.7%؟ لأن الاختبارين ليسا متطابقين. إن بيئة التشغيل المُكيَّفة للمزوّد لدى OpenAI هي نسخة من المعيار مُهيأة وفق طريقة استدعاء GPT-6 Astra في الإنتاج؛ أما بيئة التشغيل القياسية لدى ARC Prize فهي تهيئة محايدة مصممة للمقارنة العادلة بين أي نموذج. نتيجة 62.7% هي التي تعمّم على "ماذا يحدث إذا استدعيت هذا النموذج بنفسي"، وهي لا تزال أفضل نتيجة سجّلتها ARC Prize على تلك البيئة.

هل أوزان Qwen3.8-Max مفتوحة؟ جزئيًا، مع تحفّظ على الترخيص. نشرت Alibaba نسخة فئة Max من النموذج باسم Qwen3.8-2.4T-A95B في 12 أغسطس بموجب ترخيص مخصص — الأوزان قابلة للتنزيل، لكنها ليست انفتاحًا بأسلوب Apache-2.0 كما في النموذج الأصغر Qwen3.8-27B، وما زال Artificial Analysis يُدرج النموذج الرائد المستضاف على أنه مملوك. إذا كان مطلبك هو "أستطيع تشغيل النموذج نفسه الذي أدفع مقابله"، فهذا التمييز مهم؛ وإذا كان مطلبك هو "أستطيع فحص البنية واستضافة نسخة قريبة ذاتيًا"، فإن Qwen3.8-Max يفي بذلك بينما لا يفي به GPT-6 Astra.

الخلاصة

اختر GPT-6 Astra إذا كنت بحاجة إلى الأشياء المحددة التي يقوم بها وحده حاليًا — أعمال الأمن الهجومي، والاستدلال العلمي المتطور، وأصعب مهام استخدام الحاسوب المستقل — وكانت مؤسستك قادرة على اجتياز بوابات الوصول إليه وتحمل تكلفته. اختر Qwen3.8-Max إذا كنت تريد نموذجًا وكيلًا من الطراز الأول يمكنك نشره فعليًا هذا الأسبوع بسعر {{1}}$2/$6{{/1}}، مع توفر الأوزان {{2}}كباب نجاة احتياطي{{/2}} وتراجعٍ في الهلوسة {{3}}أصبحت تعرف الآن أنه يجب اختباره{{/3}}. الدرس الأوسع يكمن في التفاصيل الدقيقة نفسها: في سبتمبر 2026، يُباع النموذجان الرائدان "الوكيلان" بأرقام بارزة لا يتحكم أيٌّ من صانعيهما فيها بشكل كامل، والمشتري العقلاني يقرأ بيئة الاختبار، ويحصي الجولات، {{4}}ويشغّل مهامه الخاصة{{/4}} قبل اختيار الجانب.

Screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing the $2.00 per 1M input and $6.00 per 1M output prices, and Alibaba listed as the provider with the model's flagship reasoning and agentic positioning.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا