
Tencent HY4 Preview مقابل GPT-5.6 Sol: ادعاء استدعاء الأدوات الذي يضع الأوزان المفتوحة في مواجهة الحدود
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
Tencent HY4 Preview هو أول نموذج مفتوح الأوزان منذ شهور تُعلن بطاقة إطلاقه صراحةً التفوق على GPT-5.6 Sol. الرقم المعني هو Toolathlon-Verified، وهو معيار لاستدعاء الأدوات الوَكيلي، حيث تُبلّغ Tencent عن HY4 Preview نتيجة 74.1 — متقدمًا على Qwen3.8-Max، ووفقًا لمقارنة Tencent الخاصة، متقدمًا أيضًا على GPT-5.6 Sol. في كل الصعد الأخرى، ليس النموذجان ندّين حقًا: GPT-5.6 Sol هو النموذج الحدودي المغلق والرائد من OpenAI وتُقاس نتائجه بشكل مستقل، بينما Tencent HY4 Preview هو نموذج أولي مفتوح الأوزان يضم 770 مليار معامل، أُطلق هذا الصباح مع بطاقة أداء أعدّها البائع ودون أي تحقق من طرف ثالث.
إذن السؤال المثير للاهتمام ليس "أي نموذج أذكى" — بل ما إذا كان منافسٌ مفتوح الأوزان بسعر إدخالٍ يبلغ نحو سُدس سعر Sol يستطيع أن يدّعي بشكلٍ موثوقٍ شريحةً من الطليعة، وما الذي ينبغي لفريقٍ فعله تجاه ادّعاءٍ لا يمكن التحقق منه حاليًا.
الادعاء الذي يجعل من هذه مواجهة حقيقية
يقيس Toolathlon-Verified مدى موثوقية النموذج في قيادة أداة عبر مهمة وكيلية كاملة — قراءة النتائج، واتخاذ قرار الاستدعاء التالي، والتعافي من الأخطاء — وليس مدى جودة كتابته لدالة واحدة. وهذا مهم لأن الحصة الأكبر من الإنفاق الفعلي على واجهات برمجة التطبيقات للنماذج الحدودية تذهب إلى حلقات الوكلاء، وليس إلى الإكمالات لمرة واحدة. إن نتيجة تينسنت البالغة 74.1 على هذا المعيار هي الادعاء المحدد الذي وضع HY4 Preview في محادثة GPT-5.6 Sol، ويستحق التوقف عنده لحظة: فهو النوع من الأرقام الذي، إذا صمد أمام التكرار المستقل، يجعل محادثة التكلفة بين النماذج مفتوحة الأوزان والنماذج الحدودية المغلقة حقيقية. وإذا لم يصمد، يتحول إلى بطاقة أداء أخرى من بائع تتبخر تحت اختبار طرف ثالث.
طريقتان لشراء الذكاء

• المعلمات — HY4 Preview بإجمالي 770B / 49B نشطة، أوزان مفتوحة مقابل GPT-5.6 Sol، عدد المعلمات غير معلن، واجهة برمجة تطبيقات مغلقة
السياق — HY4 Preview أكثر من مليون توكن مقابل GPT-5.6 Sol بـ 1.05 مليون توكن، حد أقصى للإخراج 128 ألف توكن
• السعر لكل 1M — HY4 Preview ¥6 للداخل / ¥18 للخارج (≈$0.85 / $2.50) مقابل GPT-5.6 Sol $4.00 / $20.00 في المستوى الأساسي، يرتفع إلى $8.00 / $30.00 للطلبات ذات السياق الكبير، قراءات الكاش $0.40
• طرق الإدخال — HY4 Preview نص فقط في هذه المعاينة مقابل GPT-5.6 Sol إدخال نص وصورة
• أوضاع الاستدلال — HY4 Preview ليس له ما يعادله منشور مقابل وضع Ultra الخاص بـ GPT-5.6 Sol (حتى 16 وكيلًا فرعيًا متوازيًا) وأقصى جهد استدلالي
التحقق المستقل — لا يوجد أي شيء بعد لـ HY4 Preview مقابل GPT-5.6 Sol المتواجد في كل لوحات الصدارة الرئيسية، مع تصنيف سياق 1.05M ضمن المستوى الأعلى في اختبارات السياق الطويل المركبة
عمود السعر هو مكان المقارنة الكاملة. في الطبقة الأساسية، تبلغ تكلفة GPT-5.6 Sol 4.00 دولارًا لكل مليون رمز إدخال و20.00 دولارًا لكل مليون رمز إخراج. تبلغ تكلفة Tencent HY4 Preview حوالي 0.85 دولار و2.50 دولار بأسعار الصرف الحالية. بالنسبة لعبء عمل ينقل الكثير من رموز الإخراج — وهو ما تفعله البرمجة الوكيلية — فإن النموذج مفتوح الأوزان مُسعّر بحوالي ثُمن النموذج المغلق، وتستمر هذه الفجوة حتى مع التحفظ القائل بأن أرقام Sol مدعومة بقدر أكبر بكثير من التحقق.
حيث لا تزال GPT-5.6 Sol تتفوق
التحقق هو الميزة الأولى. أصبح GPT-5.6 Sol متاحًا للعموم منذ 9 يوليو، وقد خضع لقياسات مستقلة منذ ذلك الحين: 88.8 على Terminal-Bench 2.1 في الاستدلال الأساسي، و91.9 في وضع Ultra، و53.6 على Agents' Last Exam (رقم قياسي عند الإصدار)، و94.6 على GPQA Diamond، و64.6 على SWE-bench Pro. كما تذكر OpenAI تحقيق تحسّن بنسبة 54% في كفاءة الرموز (tokens) في مهام البرمجة الوكيلة مقارنةً بنموذجها الرئيسي السابق. هذه أرقام يمكنك أن تجدها منشورة خارج توثيق OpenAI الخاص، وهي الخاصية التي تفتقر إليها Tencent HY4 Preview اليوم بالضبط.
القدرة هي الميزة الثانية، وهي هيكلية وليست هامشية. يقبل GPT-5.6 Sol إدخال الصور؛ أما HY4 Preview فهو نصي فقط في هذه النسخة التجريبية، مع إقرار Tencent بأن دعم الرؤية سينتظر الإصدار الكامل. يشتمل GPT-5.6 Sol على وضع Ultra mode — وهو تكوين متعدد الوكلاء ينسق وكلاء فرعيين متوازيين بتكلفة ثلاثة إلى أربعة أضعاف تكلفة الرموز، وهو مفيد تحديدًا للمهام الهندسية طويلة المدى التي قد تتنافس فيها النموذجان فعلًا. كما أن مسارات استخدام الكمبيوتر والاستدعاء البرمجي للأدوات في Sol موثقة، ومُجرَّبة على نطاق الإنتاج، ومُختبرة تحت الحمل. ادعاء Tencent الحاصل على Toolathlon-Verified، إذا أمكن تكراره، يضيق فجوة استخدام الأدوات؛ لكنه لا يغلق فجوات الوسائط المتعددة أو الوكلاء المتعددين، وهي فجوات لا تحاول HY4 Preview معالجتها.
حيث يكون HY4 Preview مثيرًا للاهتمام حقًا
دعنا نضع مسرحية المعايير جانبًا، وتبقى ثلاثة أشياء حقيقية. أولاً، السعر: بسعر ¥6/¥18 — أي ما يعادل تقريبًا 0.85 دولار / 2.50 دولار — تخفض Tencent أسعارها عن جميع نماذج الحدود الغربية في رموز الإخراج بعامل يتراوح بين أربعة وثمانية، وتخفضها أيضًا عن نظرائها الصينيين مفتوحي الأوزان في الإدخال. ثانيًا، الأوزان المفتوحة: نموذج MoE نشط بـ49B قابل للنشر على عقدة واحدة على نحو لن يكون ممكنًا أبدًا لبنية Sol غير المعلنة، والأوزان متاحة بالفعل على HuggingFace وModelScope وGitHub. ثالثًا، السياق والمسار الهندسي: DeepSWE 64.3 ونافذة سياق تزيد عن مليون موجهان إلى نفس أعباء العمل الوكيلية طويلة الأمد التي يستهدفها وضع Ultra في Sol، وبجزء صغير من التكلفة.
التحذير الصادق هو أنه لم يصمد أيٌّ من هذا أمام معيار مستقل. قصة التحسين الذاتي التي ترويها Tencent — وهي زيادة بنسبة 31.8% في الإنتاجية من البداية إلى النهاية من خلال تكرار النموذج على حزمة الاستدلال الخاصة به — تم قياسها داخليًا. الفوز في الاختبار الأعمى على GLM 5.3 وKimi K3 تم إجراؤه داخليًا. كل شيء مثير للاهتمام حول HY4 Preview هو، اليوم، مجرد ادعاء.
القرار
إذا كنت تبني نظام إنتاج اليوم، فإن GPT-5.6 Sol هو الخيار القابل للدفاع عنه، وهو متاح عبر OrcaRouter بسعر القائمة المتدرج الخاص بـ OpenAI — 4.00$ / 20.00$ في الطبقة الأساسية، و8.00$ / 30.00$ في الطبقة التي تعلوها، مع تمرير السعر دون أي زيادة، بحيث ينعكس أي تغيير في أسعار المورد على جانبنا في اليوم نفسه. إذا كانت سير عملِك قائمةً على الوكلاء وكثيفة الأدوات، فإن البنية المتدرجة تعني وجوب مقارنة أحجام الإدخال الفعلية لديك بعتبة الـ272 ألف توكن بدلاً من افتراض سعر موحد.
إذا كنت مستعدًا لإجراء تقييم موازٍ، فإن HY4 Preview رخيص بما يكفي ليستحق تقييمًا حقيقيًا: وجّه حمل عمل استدعاء الأدوات عبر Sol اليوم، وشغّل الاستفسارات نفسها على HY4 Preview عبر واجهة Tencent البرمجية الخاصة، وقارن النتائج على مهامك الخاصة بأسلوب Toolathlon. وإذا جاءت النتائج المستقلة كما تقول Tencent إنها ستأتي، فإن مسار التبديل قصير — يندرج النموذج مفتوح الأوزان في الموجّه، وتقوم قاعدة التبديل الاحتياطي بتبديل نقاط النهاية، مع تمرير سعر البائع ¥6/¥18 دون تغيير. هذا هو الهيكل الصادق لهذه المواجهة: نموذج متقدّم موثوق يمكنك البناء عليه اليوم، في مواجهة منافس مفتوح غير موثّق، رخيص بما يكفي لاختباره ومهيأ ليجعل نقاش الأسعار يدور حول فئة الأوزان المفتوحة بأكملها.


ماذا تشاهد
• أول تكرار مستقل لـ Toolathlon-Verified. إذا أكدت منصة تقييم من طرف ثالث أن HY4 Preview يحقق في السبعينات، فإن حجة "الأوزان المفتوحة لا يمكنها استخدام الأدوات الوكيلة" تنهار.
• ما إذا كانت Tencent ستطلق ميزة الرؤية قبل الإصدار الكامل لـ Hy4. الوضع النصي فقط يقيّد معاينة HY4 إلى مجموعة فرعية صارمة من أعباء العمل التي يعالجها GPT-5.6 Sol.
• فواتير التوكنات الفعلية من ميل HY4 Preview إلى التفكير الطويل. عند ¥18 لكل مليون من المخرجات، التحقق الذاتي المطوّل يلتهم الميزة السعرية أسرع مما هو عليه على نموذج بسعر $20.
• ما إذا كانت تسعيرة Sol المتدرجة ستشهد خفضًا إضافيًا قبل الإطلاق الكامل لـ Hy4. إن تمرير الانخفاض عبر جهاز التوجيه يعني أن الخفض يظهر في اليوم نفسه.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
