Qwen 3.8 مقابل Claude Opus 4.8: التوسع منخفض التكلفة يلتقي بمتخصص الاستدلال
Guides & Insights

Qwen 3.8 مقابل Claude Opus 4.8: التوسع منخفض التكلفة يلتقي بمتخصص الاستدلال

الكاتب

Jim Song

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

استعرضت Alibaba Qwen3.8-Max في شنغهاي يوم 19 يوليو 2026 كنموذج يضم 2.4 تريليون معامل، صُمم لتحقيق التوسع والشمول. أما نموذج Anthropic Claude Opus 4.8 فهو مختلف تمامًا: نموذج رائد متميز في الاستدلال العميق، تلجأ إليه الفرق عندما تتطلب المهمة خطوات متعددة ويكون الخطأ مكلفًا.

لمدة أسبوعين، كان من الصعب إجراء تلك المقارنة بصدق، لأن Qwen لم ينشر سعرًا ولا معايير.تغيّر ذلك في 3 أغسطس 2026، عندما وصل Qwen3.8-Max إلى مرحلة التوفر العام مع بطاقة أسعار بلغت $2 / $6 لكل مليون توكن وجدول معايير كامل. تظل المسألة الفلسفية كما هي — الحجم الخام والانفتاح مقابل موثوقية الاستدلال — لكن الآن أصبحت هناك أرقام على جانبي المعادلة.

ملاحظة للمطورين — أسرع طريقة لحسم سؤال كهذا هي تشغيل كليهما على سير العمل الخاصة بك. يوفّر OrcaRouter أكثر من 200 نموذج خلف نقطة نهاية واحدة متوافقة مع OpenAI، بحيث يمكنك وضع Qwen 3.8 Max في مواجهة Opus 4.8 على المهمة نفسها دون ربط مجموعتي SDK.

خلاصة الحكم. ما زال Opus 4.8 هو المتخصص في الاستدلال: فقد خضع للتدقيق ودخل ضمن المجموعة العليا في مؤشر Artificial Analysis Intelligence Index، وهو موثوق به في سلاسل العوامل الطويلة التي تكون فيها الإجابة الخاطئة بثقة أعلى تكلفةً من فاتورة الرموز. وتتمثل نقاط ضعفه في التكلفة والإسهاب — إذ تضع AA معدّلها المختلط حول $3.85/1M عند أقصى جهد، وهو كثيف الاستهلاك للرموز، إذ يُذكر أن Grok 4.5 يُكمل مهام مماثلة باستخدام عدد أقل من رموز الإخراج بنحو 4×. وتَرُدّ Qwen3.8-Max الآن بشيء كانت تفتقر إليه في يوليو: سعر حقيقي ومنخفض يبلغ $2 / $6 ثابت لكل مليون رمز، مع إدخال مُخبأ بسعر $0.25، وجدول معايير من البائع يتصدره Terminal-Bench 2.1 86.6 وOSWorld-Verified 86.1. كما أظهرت اجتهادًا حقيقيًا في سياق المهام الوكيلة في اختبار الطرف الثالث الوحيد المتاح. لكنها لا تزال غير مُقيَّمة من أي مُقيّم مستقل. اختر Opus للاستدلال الذي يجب أن تثق به؛ وQwen للأعمال الحساسة للتكلفة والتي تضع الإتقان أولًا.

النقاط الرئيسية

Qwen3.8-Max متاح بشكل عام منذ 3 أغسطس 2026 بسعر $2 / $6 لكل مليون توكن، بتسعيرة موحدة عبر سياق المليون توكن بالكامل — بطاقة أسعار حقيقية، تحل محل خصم المعاينة المؤقت لشهر يوليو.

Opus 4.8 أغلى بشكل ملموس: تُقدّر Artificial Analysis تكلفته المختلطة بحوالي $3.85/1M عند أقصى جهد، وهو كثيف الرموز — ووفقًا للتقارير، ينتج حوالي 4 أضعاف رموز الإخراج لكل مهمة مقارنة بـ Grok 4.5، لذا فإن التشغيلات الوكيلة الطويلة تزيد الفجوة.

تتعارض المصادر حول رقم AA الدقيق لـ Opus 4.8. على AA v4.1، يُذكر أن Kimi K3 (57.1) يأتي مباشرة فوقه، لذا فإن العبارة الموثوقة هي "مجموعة القمة، أسفل قادة Fable 5 / GPT-5.6 Sol" وليس رقمًا واحدًا ثابتًا.

لدى Qwen الآن أرقام أداء وكيل، مُعلنة ذاتيًا: Terminal-Bench 2.1 86.6، OSWorld-Verified 86.1، FrontierSWE 73.5 (مقارنة بـ 40.7 لسابقتها). لم يتم التحقق من أيٍّ منها بشكل مستقل.

نقطة بيانات وكيلية واحدة من طرف ثالث لـ Qwen مواتية:مقابل Kimi K3 أنتجت 354 استشهادًا بمستودعات مقابل 274، واستخدمت 22 طلب بوابة مقابل 53، وسجّلت 0 استدعاءات أدوات فاشلة مقابل 2 — بينما سجّلت 80/100 مقابل 83 لـ Kimi.

الانفتاح يتباين بشكل دائم: تعد Qwen بتوفير أوزان مفتوحة خلال الأسبوع، بالإضافة إلى Qwen3.8-27B بحوالي 17 جيجابايت VRAM؛ بينما Opus 4.8 مغلقة ومتاحة عبر API فقط.

ملاحظة دقة: جميع أرقام جودة Qwen3.8-Max مبلّغ عنها من قِبل Alibaba وغير مُتحقق منها من أطراف ثالثة. أرقام Opus 4.8 تُنسب إلى Artificial Analysis ومصادر مُسمّاة وقد تختلف عن تقارير Anthropic الخاصة؛ وبسبب تعارض المتتبعات حول المؤشر الدقيق لـ Opus، فإننا نذكر موقعه النسبي بدلاً من رقم واحد. تسعير Qwen هو بطاقة أسعار الإتاحة العامة (GA) ويحل محل خصم المعاينة لشهر يوليو.

المواصفات والسعر، جنبًا إلى جنب

هذه هي البيانات الدقيقة، كل رقم منسوب إلى مصدره.

• الصانع / الحالة — Qwen3.8-Max: Alibaba؛ GA (3 أغسطس 2026)؛ Claude Opus 4.8: Anthropic؛ رائد التفكير العميق GA

• البنية — Qwen3.8-Max: ~2.4T إجمالي، MoE متفرق (لا تزال المعلمات النشطة غير معلنة); Opus 4.8: مغلق؛ البنية غير معلنة

• نافذة السياق — Qwen3.8-Max: 1M توكن (983,616 مع التفكير؛ الحد الأقصى للمخرجات 131,072)؛ Opus 4.8: الرائد في السياقات الطويلة

• AA Intelligence Index — Qwen3.8-Max: غير مُقيَّم بعد؛ Opus 4.8: المجموعة العليا، دون المتصدرين (Artificial Analysis؛ أُبلغ أن Kimi K3 عند 57.1 أعلى بقليل)

• القوة الأساسية — Qwen3.8-Max: التوسع، الشمولية، اقتصاديات السياقات الطويلة؛ Opus 4.8: استدلال عميق متعدد الخطوات + موثوقية وكيلية

• نتائج العوامل المبلَّغة من البائع — Qwen3.8-Max: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (مبلَّغ عنه من Alibaba)؛ Opus 4.8: غير متاح — السمعة تُكتسب من الإنتاج

• التسعير (الإدخال / الإخراج) — Qwen3.8-Max: $2.00 / $6.00 لكل 1M، سعر ثابت؛ الإدخال المخزّن مؤقتًا $0.25; Opus 4.8: بريميوم — متوسط AA ~$3.85/1M عند أقصى جهد

• كفاءة الرموز — Qwen3.8-Max: مطوّل؛ IFBench 82.8 هو أضعف نتيجة أبلغ عنها ذاتيًا؛ Opus 4.8: كثيف الرموز — إخراج أكثر بنحو 4 أضعاف من Grok 4.5 (كما ذُكر)

• أوزان مفتوحة — Qwen3.8-Max: مُوعَدٌ بها خلال هذا الأسبوع (لا ترخيص بعد)؛ Opus 4.8: لا — مغلق / API فقط

أمران يؤطران المقارنة، وكلاهما تحرك في 3 أغسطس.

أولاً، أصبحت فجوة التكلفة الآن قابلة للقياس بدلاً من كونها نظرية. في يوليو، كانت ميزة Qwen عبارة عن خصم لا يمكنك تخصيص ميزانية له. الآن أصبحت معدلًا، وشكل الفجوة غير معتاد: Opus مكلفة و كثيفة الرموز، مما يعني أن الاثنين يتضاعفان. إذا كان Opus يُنتج أربعة أضعاف رموز الإخراج لنفس المهمة ويفرض رسومًا إضافية على كل رمز، فإن التشغيل الطويل للوكيل يمكن أن يكلف أضعاف ما توحي به الأسعار الرئيسية. معدل إخراج Qwen البالغ 6 دولارات، وسياق ثابت 1M، وإدخال مخزن مؤقت بقيمة 0.25 دولار تهاجم هذا التضاعف تمامًا.

ثانيًا، لم يعد عمود معايير Qwen فارغًا — وللمرة الأولى، جزء منه ذو صلة مباشرة. ادعاء Opus 4.8 بأكمله هو الموثوقية الوكيلة، وقد نشرت Alibaba الآن أرقامًا وكيلة: 86.6 في Terminal-Bench 2.1 لتشغيل الصدفة، و86.1 في OSWorld-Verified لقيادة واجهة مستخدم رسومية حقيقية. تلك تقيس الأشياء الصحيحة. التحفظ هو على المصدر، لا على الصلة: أنتجتها Alibaba على منصتها الخاصة، ولم يكررها أي طرف ثالث. في الوقت نفسه، تستند سمعة Opus إلى شيء أصعب في النشر لكنه ربما أكثر قيمة — الاستخدام الإنتاجي المستدام عبر العديد من الفرق، وهو نوع من الأدلة لا يمكن لجدول مورد أن يصنعه.

موثوقية الاستدلال مقابل الشمولية الخام

الفارق المثير للاهتمام بين هذين الاثنين ليس جودة المحاولة الواحدة — بل هو كيفية تصرفهما عندما تتضمن المهمة خطوات عديدة وأدوات حقيقية مرفقة.

سمعة Opus 4.8 مبنية علىالموثوقية الفاعلة: سلاسل طويلة من الاستدلال حيث يتتبع السياق، ويتعافى من الطرق المسدودة، ويعيد إجابات يمكنك الاعتماد عليها دون إعادة التحقق من كل خطوة. هذه هي الخاصية التي تدفع الفرق ثمنًا إضافيًا مقابلها، لأنه في الإنتاج تكون تكلفة إجابة خاطئة واثقة متعددة الخطوات أكبر بكثير من فاتورة الرموز. المفاضلة هي أن Opus يستهلك الكثير من الرموز — يُقال إن Grok 4.5 يكمل المهام المماثلة باستخدام رموز إخراج أقل بنحو 4 مرات — لذا فإن موثوقيته تأتي بتكلفة حقيقية مستمرة.

يجيب Qwen 3.8 بنوع مختلف من القوة: الشمولية المطلقة، وهناك الآن نقطة بيانات واحدة من طرف ثالث عنه. في اختبار فهم البنية الذي أجرته Trilogy AI (Qwen3.8-Max مقابل Kimi K3)، حصل Qwen على 80/100مقابل 83 لكيمي — خاسرًا في العنوان الرئيسي — لكنه كان الوكيل الأكثر اجتهادًا، حيث أنتج 354 استشهادًا بالمستودعات مقابل 274 لكيمي، واستخدم 22 طلب بوابة مقابل 53، وسجّل 0 استدعاءات أدوات فاشلة مقابل 2. توصّل النموذجان إلى نفس الاستنتاج البنيوي الأساسي؛ إلا أن Qwen بذل مزيدًا من عمل التحقق للوصول إلى ذلك، مع استخدام أنظف للأدوات.

نتيجة انعدام استدعاءات الأدوات الفاشلة هي الإشارة الوكيلية الأكثر تشجيعًا لدى Qwen على الإطلاق، لأن استدعاءات الأدوات الفاشلة هي ما يكسر الوكلاء في الإنتاج فعلًا. وهي أيضًا اختبار واحد، على مهمة واحدة، من مُقيِّم واحد — لا تقترب إطلاقًا من قاعدة الأدلة التي تقف خلف سمعة Opus.

كان ثمن شمولية Qwen هو الكمون والرموز. وجد مراجعو فترة المعاينة أنه «جيد جدًا وبطيء جدًا» — أكثر من 30 دقيقة لبناء موقع ويب، وأكثر من ساعة لمحاكاة البوكر، وهو أبطأ نموذج استخدمه ذلك المراجع. وهناك تحفظان ينطبقان الآن. كان ذلك البنية التحتية للمعاينة، وخدمة الإتاحة العامة (GA) نظام مختلف؛ وتُظهر بيانات OrcaRouter على مدار 7 أيام حاليًا زمن الوصول إلى أول رمز عند مستوى p50 يبلغ 1.64 ثانية، على الرغم من أن TTFT والإنتاجية الشاملة في البناءات التي تستغرق ساعةً هما مقياسان مختلفان. تستحق هذه النتيجة إعادة اختبار بدلاً من التكرار.

هناك أيضًا مصدر قلق هيكلي يستحق الذكر: أضعف نتيجة معلنة لدى Alibaba هي IFBench 82.8، وهو اتباع التعليمات في ظل القيود. بالنسبة لخطوط العمل الوكيلة التي تحلل مخرجات النموذج في كل خطوة، فإن النموذج الذي يتجاوز النطاق ويضيف عملًا غير مطلوب يشكل عبئًا بغض النظر عن مدى دقته. وهنا بالتحديد يبرز انضباط Opus ويكسب قيمته الممتازة.

التكلفة في الممارسة العملية: حيث تظهر أثر فجوة الرموز بمقدار 4 أضعاف

خذ تشغيل وكيل متعدد الخطوات: 80,000 رمز إدخال للسياق و— هذا هو المتغير الرئيسي — أحجام مخرجات مختلفة، لأن Opus يُذكر أنه يُصدر حوالي 4 أضعاف أكثر.

Qwen3.8-Max عند 8,000 توكن إخراج: 0.08M × $2 = $0.16، بالإضافة إلى 0.008M × $6 = $0.048. ≈ $0.21 لكل تشغيل.

Opus 4.8 بسعر مختلط يبلغ حوالي 3.85 دولار لكل مليون رمز على 80,000 رمز إدخال + حوالي 32,000 رمز إخراج (4× الرموز): تقريبًا 0.43 دولار لكل تشغيلة على التسعير المختلط — وأكثر بشكل ملموس إذا قمت بتسعير الإدخال والإخراج بشكل منفصل بمعدلات الطبقة المميزة.

• عند 3,000 عملية في اليوم: Qwen ≈ 630 دولارًا يوميًا؛ Opus ≈ 1,290 دولارًا يوميًا أو أكثر.

• مع الإدخال المخزن مؤقتًا من Qwen بسعر $0.25/1M على سياق مستقر، ينخفض تشغيله إلى ≈ $0.07 — أرخص بحوالي 6 مرات من Opus.

الثقل المضاد الصادق هو الذي ينطبق دائمًا على مقارنات Opus: إذا حلّ Opus مهمةً من محاولة واحدة بينما يحتاج نموذج أرخص إلى محاولتين بالإضافة إلى مراجعة بشرية، فإن النموذج الأرخص ليس أرخص فعليًا. إسهاب Opus هو جزئيًا آلية موثوقيته — فهو يفكّر بصوتٍ عالٍ، وهذا يكلّف توكنات. السؤال بالنسبة لعبء عملك هو ما إذا كنت تدفع مقابل تفكيرٍ متأنٍّ تحتاجه. في الاستدلال عالي المخاطر ومنخفض الحجم، فالأغلب أنك تفعل. في التحليل عالي الحجم حيث تتحقق من النتائج لاحقًا على أي حال، فالأغلب أنك لا تفعل.

الانفتاح ومسألة الاستضافة المحلية

Opus 4.8 مغلق ولا يتوفر إلا عبر API بشكل دائم. قد لا يكون Qwen3.8-Max كذلك — فالأوزان موعودة خلال الأسبوع — لكن النموذج الرائد ليس هدفًا واقعيًا للاستضافة الذاتية: فحوالي 1.2 تيرابايت بدقة 4 بت مقابل حوالي 141 جيجابايت لكل H200 يعني ثمانية مسرعات أو أكثر من الطراز الأعلى، ومع أن عدد المعاملات النشطة لا يزال غير معلن، لا يمكنك نمذجة الإنتاجية التي سيوفرها هذا الإنفاق. كما لا يوجد حتى الآن نص ترخيص، لذا فإن الاستخدام التجاري غير محدد رسميًا.

المُعلَن عنه بالتزامن Qwen3.8-27B هو الإصدار العملي للفرق التي يهمها التحكم أكثر من القدرة الخام. وبكونه مفتوح الأوزان أيضًا، يُقال إنه يعمل بحوالي 17GB من VRAM — أي بطاقة واحدة فائقة الأداء. إذا كنت تقارن مع Opus لأنك تحتاج إلى التفكير المنطقي داخل شبكتك الخاصة، فإن نموذج 27B هو النموذج الذي يجب تقييمه؛ أما انفتاح النموذج الرائد 2.4T فهو نظري في معظمه.

الأسئلة الشائعة

هل Qwen 3.8 أفضل من Claude Opus 4.8؟

ليس على الأدلة الموجودة. يقع Opus 4.8 في المجموعة العليا من مؤشر Artificial Analysis Intelligence Index المُدقَّق، وقد أثبت جدارته في الاستدلال الوكيل العميق في بيئات الإنتاج. تمتلك Qwen3.8-Max نتائج قوية مُعلنة ذاتيًا (Terminal-Bench 2.1: 86.6، OSWorld-Verified: 86.1) واختبارًا وكيلًا واحدًا إيجابيًا من طرف ثالث، لكن دون أي درجة مستقلة. تتفوق Qwen في السعر؛ بينما يتفوق Opus في الإثبات وموثوقية الاستدلال.

لماذا يتم وصف رقم اختبار الأداء لـ Opus 4.8 بشكل غامض؟

لأن أدوات التتبع تتعارض حقًا. في AA v4.1، يُذكر أن Kimi K3 (57.1) يأتي مباشرة فوق Opus 4.8، مما يضع Opus في المجموعة العليا لكن أسفل المتصدرين Fable 5 / GPT-5.6 Sol — إلا أن المصادر المختلفة تبلغ عنه بشكل مختلف، لذا فإن الاستشهاد برقم واحد حاسم سيكون مضللًا. إن موقعه النسبي هو البيان الموثوق.

كم هو أرخص Qwen 3.8 من Claude Opus 4.8؟

بشكل ملحوظ، وتتسع الفجوة في عمليات التشغيل الطويلة. سعر Qwen3.8-Max هو $2 / $6 لكل 1M بشكل ثابت، مع إدخال مخزّن مؤقتًا بسعر $0.25. تقدّر Artificial Analysis التكلفة المجمعة لـ Opus بحوالي $3.85/1M عند أقصى جهد، ويُقال إن Opus يستهلك رموزًا أكثر بنحو 4× من Grok 4.5 — لذا تتضاعف الفجوة السعرية مع حجم المخرجات. في تشغيل نموذجي متعدد الخطوات، تكون Qwen أرخص بنحو 2–6× اعتمادًا على التخزين المؤقت.

هل خرج Qwen 3.8 Max من مرحلة المعاينة؟

نعم، في 3 أغسطس 2026. لديها بطاقة أسعار منشورة ونقطة نهاية متوافقة مع OpenAI وDashScope، لذا فإن حملة اعتمادات Qoder في يوليو وإطار الخصم 90% لم يعودا يصفان كيفية بيعها.

هل Qwen 3.8 موثوق للعمل الوكيل؟

الإشارات المبكرة مشجعة لكنها ضعيفة. تعلن Alibaba عن نتائج 86.6 في Terminal-Bench 2.1 و86.1 في OSWorld-Verified، وفي اختبار مستقل واحد سجلت صفر فشل في استدعاءات الأدوات مقابل اثنين لمنافس. في المقابل، أدنى درجة تعلنها عن نفسها هي 82.8 في IFBench على اتباع التعليمات، وشاهد المختبرون الأوليون بشكل متكرر تجاوزها للنطاق المحدد — وهو خطر حقيقي على خطوط المعالجة التي تحلل مخرجات كل خطوة.

هل يمكنني استضافة Qwen 3.8 ذاتيًا لتجنب أسعار Opus المميزة؟

ليس النموذج الرائد، بواقعية. تم الوعد بالأوزان خلال الأسبوع لكن لم يُنشر أي ترخيص، وبحجم ~1.2 تيرابايت في 4-بت ستحتاج إلى ثمانية أو أكثر من وحدات معالجة رسومية من فئة H200. النموذج المُعلن بالتزامن Qwen3.8-27B، الذي يُقال إنه يستهلك ~17 جيجابايت من ذاكرة الفيديو، هو الخيار العملي. أما Opus 4.8 فهو مغلق، فلا يوجد مسار للاستضافة الذاتية على الإطلاق.

أي واحد يجب أن أستخدمه اليوم؟

Opus 4.8 للأعمال الإنتاجية الحرجة من ناحية الاستدلال أو الأعمال الوكيلة التي يجب أن تثق بها، حيث يكون الخطأ في إجابة متعددة الخطوات مكلفًا. أما Qwen3.8-Max فللأعمال الحساسة للتكلفة والتي تعطي الأولوية للشمولية — خاصة تحليل السياقات الطويلة، حيث أن سعره الثابت للمليون رمز ومدخلاته المخزنة مؤقتًا بسعر 0.25 دولار تجعل الجدوى الاقتصادية صعبة المجادلة.

خلاصة القول

Qwen 3.8 مقابل Claude Opus 4.8 ما تزال المقارنة تباينًا في الفلسفات، لكن الجوانب الاقتصادية لم تعد افتراضية. وصل Qwen3.8-Max إلى مرحلة التوفر العام (GA) بتسعير حقيقي يقلّص سعر Opus بهامش واسع، وتتفاقم الفجوة لأن Opus مرتفع السعر وكثيف الاستهلاك للرموز. كما نشرت Qwen أرقامًا عن الأداء الوكيل تخاطب مباشرةً مجال Opus الأساسي، وأظهر اختبارها الوحيد من طرف ثالث للأداء الوكيل استخدامًا أنظف للأدوات من منافس قوي.

يحافظ Opus على ميزته حيث كانت دائمًا: مكانة مُدقَّقة ضمن المجموعة العليا، وسجل إنتاجي موثوق في الاستدلال متعدد الخطوات لا يعوّضه أي جدول من جداول البائعين. أما الفجوات المتبقية لدى Qwen فهي المألوفة — لا نتيجة مستقلة، ولا إفصاح عن عدد المعلَمات النشطة، ولا ترخيص بعد، وضعف مُعلَن ذاتيًا في اتباع التعليمات، وهو ما يهمّ تحديدًا في خطوط الأنابيب القائمة على الوكلاء التي يُختار Opus من أجلها. ترقّب حدثين: أول نتيجة مستقلة في مؤشر Intelligence Index، ووصول الأوزان مصحوبة بترخيص. وإلى ذلك الحين، يبقى Opus هو النموذج الذي تأتمنه على القرارات المكلفة، وQwen 3.8 هو النموذج الذي توجّه إليه الكمّ الأكبر — بعد اختباره على سير عملك الخاصة.

مقارنات في هذه المقالة4

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube