
Tencent HY4 Preview مقابل Qwen3.8-Max: منافسة الأوزان المفتوحة في أغسطس
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
إن التصادم الذي كان هذا الشهر يتجه نحوه هو المواجهة بين Tencent HY4 Preview وQwen3.8-Max. أطلق Alibaba إصدار Qwen3.8-Max للتوفر العام في 3 أغسطس، ليصبح أول Qwen من فئة Max بأوزان مفتوحة في 12 أغسطس؛ أما Tencent HY4 Preview فوصل هذا الصباح، بعد 25 يومًا، ببطاقة إطلاق تسمّي Qwen3.8-Max مباشرة — إذ تُبلغ Tencent عن 74.1 لـ HY4 Preview في معيار Toolathlon-Verified، متقدمًا على Qwen3.8-Max في ذلك المعيار. كلاهما نموذجان صينيان رائدان بأوزان مفتوحة، وكلاهما مُسعَّر للانتشار، وواحد منهما فقط حصل على نتائج مستقلة.
النموذجان تفصل بينهما أكثر من مجرد الحجم — Qwen3.8-Max يبلغ 2.4 تريليون معلمة مقابل 770 مليارًا في HY4 Preview — ولكن في المعايير المتعلقة بالوكلاء التي تهم المشتري، يستهدفان الهدف نفسه: العمل طويل الأمد حيث يقرأ النموذج ويستدعي الأدوات ويكرر دون وجود إنسان في الحلقة. هذا هو بالضبط المجال الذي يحاول فيه جيل أغسطس مفتوح الأوزان إثبات قدرته على استبدال النماذج الحدودية المغلقة، وكانت الخطوة الأولى لـ Tencent هي توجيه ضربة إلى أكبر إصدار مفتوح هذا الشهر.
لوحة النتائج

• النطاق — HY4 Preview 770B إجمالي / 49B نشط مقابل Qwen3.8-Max 2.4T إجمالي / ~95B نشط
• السياق — HY4 Preview أكثر من مليون توكن مقابل Qwen3.8-Max مليون توكن على API (262 ألف توكن أصلي في الأوزان المفتوحة، قابل للتوسيع إلى ~1.01 مليون)
• السعر لكل مليون — HY4 Preview ¥6 دخول / ¥18 خروج (≈$0.85 / $2.50) مقابل Qwen3.8-Max $2.00 دخول / $6.00 خروج، قراءات الكاش $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (وفقًا لما أبلغ البائع) مقابل Qwen3.8-Max 86.6
• النمطية — كلاهما نصي فقط في صيغهما مفتوحة الأوزان؛ واجهة برمجة تطبيقات Qwen3.8-Max تضيف إدخال الصور والفيديو، بينما HY4 Preview لا يفعل ذلك.
• النتيجة المستقلة — HY4 Preview لا شيء مقابل Qwen3.8-Max AA مؤشر الذكاء 58، مؤشر الوكيل 58
البطاقتان تحكيان القصة نفسها من جانبين متعاكسين. في Terminal-Bench 2.1، تفصل نتيجة Qwen3.8-Max البالغة 86.6 ونتيجة HY4 Preview البالغة 85.4 نقطة ونصف — نقطة لصالح Qwen، ورقم HY4 غير مدقق. على مستوى السعر، HY4 Preview أرخص في كل من الإدخال والإخراج لكل توكن. فيما يخص التحقق، تمتلك Qwen3.8-Max مؤشر ذكاء مستقل قيمته 58 ومؤشر فاعلية قيمته 58؛ بينما لا تمتلك HY4 Preview سوى بياناتها الصحفية الخاصة. الفارق هو النمط الكلاسيكي لمنافس قادم بأسعار أفضل وادعاءات غير مثبتة في مواجهة منافس راسخ تم التحقق منه.
قراءة ادعاء Toolathlon
Toolathlon-Verified يقيس موثوقية استخدام الأدوات الوكيلة — أي مدى اتساق قدرة النموذج على قيادة أداة عبر مهمة كاملة مع الأخطاء والتعافي والاستدعاءات متعددة الخطوات. نتيجة تينسنت 74.1 تستهدف مباشرة الجزء الأقوى في ملف Qwen3.8-Max، لأن مؤشر الوكلاء الخاص بـ Qwen البالغ 58 ونتيجة OSWorld-Verified البالغة 86.1 هما الرقمان اللذان جعلا عرض Alibaba الوكيل موثوقًا. كما يسجل Qwen3.8-Max 82.8 على IFBench (اتباع التعليمات) و93.0 على PaperBench (عمل وكيل بمستوى بحثي)، وكلاهما يتفوق على نماذج مثل GPT-5.6 Sol في جداول البائع الخاصة. لذا اختارت تينسنت المعيار الوحيد الذي تدعي فيه فوزًا مباشرًا على أكبر نموذج مفتوح في الشهر — وهذا الادعاء حاليًا قابل للتحقق تمامًا مثل أي صف بائع منفرد آخر: ليس إطلاقًا.
مُتحقَّق مقابل مُبلَّغ من المورّد
هذا هو المحور الذي تكون فيه المواجهة أقل إنصافًا، والتفاوت يستحق أن نوضحه صراحةً. مؤشر الذكاء الخاص بـ Qwen3.8-Max البالغ 58 يأتي من Artificial Analysis، ومؤشر الوكيل الخاص به البالغ 58 يأتي من Artificial Analysis أيضًا، ونفس أطر التقييم المستقلة التي منحته هذه الدرجات هي التي قاست نقاط ضعفه: معدل هلوسة يبلغ 40% على AA-Omniscience، مرتفعًا من 23% في الجيل السابق، وعدد هائل يبلغ 64 دورة وكيل لكل مهمة — النموذج يعمل بجد، وتدفع ثمن كل دورة. أما Tencent HY4 Preview فلا يمتلك أيًا من هذه الأدوات القياسية. فنقاط قوته مجرد ادعاءات، وأنماط فشله — التي تشير Tencent نفسها إلى التفكير الطويل والإفراط في التحقق الذاتي — هي اعترافات لا قياسات.
بالنسبة لفريق يختار بين الاثنين، فإن فجوة التحقق ليست أمرًا مجردًا. سلوك Qwen3.8-Max المتمثل في 64 دورة لكل مهمة هو محرك تكلفة حقيقي ومُقاس: بسعر 2/6 دولار، لا يزال الوكيل الأكثر تكلفة لكل مهمة مكتملة في بعض المقارنات الخارجية، وقد أبلغت الفرق أن عدد الدورات يؤدي إلى تآكل ميزة السعر التي يتمتع بها. سلوك HY4 Preview المكافئ غير معروف — فقد يكون أرخص لكل مهمة مما يوحي به سعره المنخفض بالفعل لكل رمز، أو قد تلتهم عادة التحقق الذاتي الفرق. لا يمكن لأحد أن يخبرك أيهما بعد، لأنه لا أحد خارج تينسنت قام بتشغيله.
السعر والجوانب العملية للأوزان المفتوحة
لكل رمز (token)، يكون HY4 Preview أرخص على جانبي القائمة: {{1}}¥6/¥18{{/1}} مقابل {{2}}$2.00/$6.00 من Qwen3.8-Max{{/2}}، وضربات الكاش بمقدار {{3}}¥0.3{{/3}} مقابل {{4}}$0.25{{/4}}. وهذا يجعل HY4 Preview أرخص نموذج رائد مفتوح الأوزان في الإدخال أو الإخراج، قطعيًا. لكن "الأوزان المفتوحة" تأتي مع مجموعتين مختلفتين من الشروط الدقيقة. {{5}}إصدار الأوزان المفتوحة من Qwen3.8-Max — وهو Qwen3.8-2.4T-A95B{{/5}} — نصي فقط مع تفعيل التفكير إجباريًا، وسياق أصلي يبلغ 262K بدلاً من 1M في الواجهة البرمجية، وترخيص مخصص بشروط متدرجة حسب الحجم: متطلبات عرض اسم النموذج عند تجاوز 100 مليون مستخدم شهريًا، وترخيص منفصل لأعمال نموذج كخدمة (Model-as-a-Service) الكبيرة. {{6}}أوزان Tencent HY4 Preview{{/6}} موجودة على HuggingFace وModelScope وGitHub منذ صباح اليوم، لكن شروط ترخيصها الدقيقة وما إذا كانت الأوزان مطابقة للواجهة البرمجية المُقدَّمة لم يُعلن عنها بتلك الدرجة من الوضوح. كلا النموذجين قابلان للتنزيل؛ لكن لا يتميز أي منهما بسهولة التركيب المباشر.
الخلاصة
Qwen3.8-Max هو الخيار الأكثر أمانًا في كل جانب يشتري فيه التحققُ الأمان: تقييم مستقل في الذكاء وعمل الوكلاء، وأنماط فشل معروفة، وترخيص مستقر، وثلاثة أسابيع من التغذية الراجعة الإنتاجية. وهو أيضًا الخيار الأكثر تكلفة لكل توكن، وسلوكه المقاس الذي يتسم بكثرة الأدوار يُعد مخاطرة تكلفة معروفة. أما Tencent HY4 Preview فهو الرهان الأفضل قيمة: أرخص في الإدخال والإخراج معًا، وادعاء مماثل في Terminal-Bench، وادعاء Toolathlon-Verified مباشر ضد Qwen — وكل ذلك غير مُتحقق منه في اليوم الأول. إذا كنت ستضع نموذجًا مفتوح الوزن في الإنتاج هذا الأسبوع، فإن Qwen3.8-Max هو الخيار القابل للدفاع عنه، وهو متاح على OrcaRouter بسعر Alibaba الرسمي — $2.00/$6.00، يُمرَّر دون أي هامش ربح. أما HY4 Preview فهو مشروع التقييم: شغّله عبر API الخاص بـ Tencent ضد مهامك الخاصة بأسلوب Toolathlon، وأبقِ مسار الإنتاج على النموذج المُتحقق منه، وعندما تصدر النتائج المستقلة — أو عندما يصل HY4 Preview إلى موجه ويصبح معدل ¥6/¥18 تمريرًا في نفس اليوم — يكون التبديل قاعدة توجيه، لا إعادة كتابة.


ماذا تشاهد
• أول تشغيل مستقل لـ HY4 Preview على منصة اختبار للوكلاء. الرقم 74.1 المُوثَّق من Toolathlon هو الرقم الذي تريد Tencent الفوز به؛ ومؤشر Agentic Index من طرف ثالث سيكون بمثابة التأكيد.
• عدد الجولات المُقاس لـ HY4 Preview. إن 64 جولة لكل مهمة في Qwen3.8-Max هي المثال التحذيري؛ وما إذا كان HY4 Preview أرخص لكل مهمة مكتملة هو الحجة الاقتصادية بأكملها.
• شروط الترخيص على الأوزان. ستحدد ما إذا كان «مفتوح» يعني «قابلًا للاستخدام على نطاقك» بالنسبة لـ HY4 Preview، كما فعلت شروط ترخيص Qwen3.8-Max مع نموذج عليبابا.
• ما إذا كان أي من البائعين سيخفض السعر مرة أخرى. في شهر شُحن فيه نموذجان رائدان مفتوحا الأوزان بتسعير عدواني، فإن تمرير التكلفة عبر الموجّه يجعل أي خفض إضافي مرئيًا في اليوم نفسه.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
