
Claude Sonnet 5.5 مقابل Tencent HY4 Preview: كلا المختبرين يبيعان فاتورة الرموز
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 931 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 192 tok/s
- OrcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- xAISpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
إطلاقان يفصل بينهما ستة أسابيع، ويقدّمان الوعد نفسه بكلمات مختلفة. ادعاء المورّد هو أن Claude Sonnet 5.5، الذي أُطلق في 28 سبتمبر 2026، يكلّف "حتى 30% أقل لكل مهمة" من Claude Sonnet 5 عند معدلات ثابتة لكل توكن. الادعاء الثاني هو أن تحسين 7 سبتمبر على النسخة المستضافة من Tencent HY4 Preview، الذي صدر لأول مرة وأُتيح مصدره مفتوحًا في 28 أغسطس 2026، يقلّل جولات الاستدلال واستهلاك التوكنات لكل مهمة عند الجودة نفسها للمهمة. لم يرفع أي من المورّدين سعرًا أو يخفضه لتقديم ذلك الادعاء. كلاهما يخبرك أن التوكنات هي المنتج الآن، والجزء المثير في هذه المواجهة هو أن واحدًا فقط من الادعاءين يمكن التحقق منه مقابل رقم منشور لكل مهمة — لأن واحدًا فقط من هذين النموذجين لديه قياس مستقل يمكن التحقق منه مقابله.
هذا التفاوت ليس انتقاصًا من Tencent. لا يملك HY4 Preview صفحة نموذج في Artificial Analysis، ولا درجة مستقلة في Intelligence Index، ولا رقم تكلفة لكل مهمة من أي طرف ثالث. ما يملكه هو جدول قياسات أداء من المورّد — Terminal-Bench 2.1 عند 85.4، وDeepSWE 64.3، وتقييم داخلي أعمى شمل 203 مهام هندسية حيث حقق في المتوسط 2.99 مقابل GLM-5.3 عند 2.92 وKimi K3 عند 2.94 — وظهور أولي في لوحة صدارة WebDev Arena بتصويت الجمهور، حيث تُبلّغ Tencent أنه حلّ نحو المرتبة الخامسة إجمالًا والثالثة بين النماذج مفتوحة الأوزان. كل هذه إشارات حقيقية. لكن أيا منها ليس تكلفة لكل مهمة، ما يعني أن الرقم الدقيق الذي يتنافس عليه المورّدان غير متاح بالنسبة إلى HY4 Preview.
ما الذي شحنته كل جهة فعليًا
{{T}}encent HY4 Preview هو مزيج من الخبراء بمعاملات تبلغ 770 مليارًا، مع 49 مليارًا نشطة لكل توكن، و78 طبقة، و256 خبيرًا موجّهًا بالإضافة إلى خبير مشترك واحد، وطبقة MTP أصلية لفك التشفير التخميني، ونافذة سياق تتجاوز مليون توكن. وهو نصّي فقط بحكم التصميم — فقد بنته {{T}}encent لوكلاء البرمجة، واستخدام الأدوات المعقّد، وأعمال الإنتاجية، وليس للصور — وهو يعتمد افتراضيًا على الاستدلال المكثّف، مع ثلاثة مستويات قابلة للتهيئة (عالٍ، منخفض، بلا) وإعداد أخذ عينات موصى به من المورّد بدرجة حرارة 0.9 وtop_p 1.0. الأوزان بترخيص Apache 2.0 وقابلة للتنزيل من Hugging Face وGitHub وModelScope وGitCode. أشارت {{T}}encent في الأصل إلى عيبين في المعاينة: قضاء وقت أطول من اللازم في التفكير، والإفراط في التحقق من عملها، ويستهدف تحديث 7 سبتمبر هذين العيبين تحديدًا.
Claude Sonnet 5.5 هو النموذج الثاني من الجيل 5.5 لدى Anthropic، والذي تُقدّمه بوصفه أفضل مزيج من السرعة والذكاء في التشكيلة. مليون توكن من السياق، و128,000 توكن إخراج بشكل متزامن و300,000 عبر Message Batches API، وإدخال نص وصورة وملف، وتفكير تكيّفي بجهد قابل للاختيار، وحد معرفة في يونيو 2026، واحتفاظ صفري بالبيانات متاح منذ الإطلاق، وحد أدنى للتقاعد في 28 سبتمبر 2027. لم تتغيّر بطاقة الأسعار عن Claude Sonnet 5: 2.00 دولار لكل مليون إدخال، و10.00 دولارات لكل مليون إخراج، و0.20 دولار لقراءات الذاكرة المؤقتة و2.50 دولار لكتابات الذاكرة المؤقتة. أوزان مغلقة، Anthropic API بالإضافة إلى Bedrock وGoogle Cloud وMicrosoft Foundry.
ضع الاثنين مقابل بعضهما وستكون المواضع شبه متناظرة:
• السعر — Claude Sonnet 5.5: $2.00 إدخال / $10.00 إخراج لكل مليون مقابل Tencent HY4 Preview: $0.83 إدخال / $2.50 إخراج في كتالوجنا، من قائمة مورّد عند ¥6 / ¥18
• قراءات الذاكرة المؤقتة — Claude Sonnet 5.5 بسعر 0.20 دولار لكل مليون مقابل Tencent HY4 Preview بسعر 0.042 دولار لكل مليون في كتالوجنا
• الأوزان — Claude Sonnet 5.5 مغلق مقابل Tencent HY4 Preview Apache 2.0، قابل للتنزيل
• السياق — Claude Sonnet 5.5 بعدد 1,000,000 رمز مقابل Tencent HY4 Preview بعدد 1,048,576 رمزًا، متطابقان فعليًا
• الحد الأقصى للإخراج — Claude Sonnet 5.5 بسعة 128,000 في الوضع المتزامن، و300,000 عبر Batches، مقابل Tencent HY4 Preview بسعة 64,000 في كتالوجنا
• طريقة الإدخال — Claude Sonnet 5.5 نص وصورة وملف مقابل Tencent HY4 Preview نص فقط
• نتائج مستقلة — Claude Sonnet 5.5، مؤشر الذكاء 56 بتكلفة 7.90 دولار لكل مهمة، المراجعة v4.3.2 مقابل Tencent HY4 Preview: لا توجد نتائج منشورة
• سرعة الإخراج المقيسة — Claude Sonnet 5.5 بمعدل 138.7 رمز/ثانية مقابل Tencent HY4 Preview بمعدل 22.3 رمز/ثانية على حركة الاستخدام الخاصة بنا

الادعاء الذي يقدّمه كلا المختبرين، ولماذا يمكن التحقق من أحدهما
تصرّح Anthropic بأن "خفضًا بنسبة 30% لكل مهمة" وتصرّح Tencent بأن "جولات استدلال أقل، واستهلاك أقل للرموز" هما المشروع الهندسي نفسه موصوفًا من اتجاهين: جعل النموذج ينفق رموزًا أقل للوصول إلى الإجابة نفسها. وتؤكد Anthropic صراحةً أن الأسعار لم تتغير، ما يعني أن أي توفير لكل مهمة لا بد أن يأتي من أعداد الرموز — وتتيح لك اللوحة المستقلة رؤية شكل المشكلة لا حجم الإصلاح. يولّد Claude Sonnet 5.5 نحو 410 ملايين رمز إخراج في تقييم Intelligence Index، مقابل 117 مليونًا لـ MiniMax M3 و77 مليونًا لـ Grok 4.5. إنه نموذج مسهب، وفق ما هو مقيس على لوحة تنشر الرقم. وأيًا كان مقدار التحسين بنسبة 30% مقارنةً بـ Claude Sonnet 5، فهو يُطبَّق على قاعدة ضخمة جدًا.
بالنسبة إلى HY4 Preview، لا يتوفر علنًا رقم مكافئ. ملاحظة التحسين الخاصة بـ Tencent هي البيان الوحيد عنه، وهي تذكر النتيجة دون رقم: دورات أقل، ورموز إدخال وإخراج أقل، والجودة نفسها، مع التحقق منها عبر مقاييس الأداء المعيارية والتقييم البشري في تمرير مزدوج. هذا ادعاء مورّد بالمعنى الدقيق — مُصرّح به، ومعقول، وغير معاد إنتاجه — ويوصف بذلك هنا. وإن اعتماد نموذج معاينة استنادًا إلى ادعاء مورّد بشأن اقتصاد الرموز، بينما اقتصاد الرموز هو الشيء الذي لا يمكنك قياسه من الخارج، هو بالتحديد الرهان الذي يطلب منك إصدار المعاينة القيام به.
ثمة تفصيل إضافي جدير بالانتباه قبل أن يخطّط أيّ أحد لنشر مستضاف ذاتيًا حول ذلك التحسين. إن تغيير Tencent في 7 سبتمبر ينطبق على البناء الذي تقدّمه Tencent عبر نقاط النهاية المستضافة لديها. أما النسخة المفتوحة فلم يُحدَّثها أحد — فلا يزال آخر تعديل على مستودع Hugging Face يعود إلى 28 أغسطس — لذا فإن أي نسخة مستضافة ذاتيًا من الأوزان تعمل بالسلوك الأصلي الأطول في الاستدلال الذي نبّهت إليه ملاحظات المعاينة. النسخة المحسَّنة والنسخة القابلة للتنزيل ليستا الملف نفسه.
حيث تُؤتي الأوزان المفتوحة ثمارها فعلاً هو المكان نفسه الذي تفعل فيه ذلك دائماً: عملية نشر لا يمكنها استدعاء API. نموذج بـ770 مليار معامل مع 49 مليار معامل نشط هو قرار يخص مركز بيانات لا محطة عمل، لذا ليست هذه قصة فئة الحواسيب المحمولة التي يرويها نموذج 30B — لكن بالنسبة لمشترٍ يحتاج إلى النموذج داخل محيطه الخاص، فإن Apache 2.0 بهذا الحجم خيار لا يقدمه Claude Sonnet 5.5 بأي ثمن.
تجربة معاينة دون المجازفة بمسار الإنتاج عليها
نماذج المعاينة هي الحالة التي يتوقف فيها التوجيه عن كونه تحسينًا للتكلفة ويصبح ضبطًا للمخاطر. السبب في وضع إصدار معاينة خلف موجّه بدلًا من استدعائه مباشرةً هو أن المعاينة تُعرَّف بإمكانية تغيّرها تحت قدميك، والشيئان اللذان تريدهما من الطبقة التي أمامه هما تقسيم بنسبة مئوية وشيء يلتقط حالات الفشل.
هذا هو الشكل الذي يوفره OrcaRouter: نقطة نهاية واحدة متوافقة مع OpenAI تغطي أكثر من 200 نموذج، وسعر قائمة المزوّد يُمرَّر دون إضافة أي هامش، والتحويل التلقائي عند الفشل بين مزوّدي الخدمة upstream، ولغة DSL للتوجيه لتكوين استدعاءات من عدة نماذج. يمكن توجيه Tencent HY4 Preview هنا اليوم باسم tencent/hy4-preview بسعر 0.83 دولار للمدخلات و2.50 دولار للمخرجات لكل مليون توكن، مع قراءات ذاكرة مؤقتة بسعر 0.042 دولار عبر نافذته البالغة 1,048,576 توكن — البناء نفسه، بسعر المزوّد، ويمكن الوصول إليه عبر المفتاح الذي تستخدمه بالفعل لكل شيء آخر في الكتالوج. Claude Sonnet 5 قابل للتوجيه هنا أيضًا، بسعرَي Anthropic البالغين 2.00 و10.00 دولارًا، وهو كذلك منذ 30 يونيو؛ ويشكّل شريكًا واضحًا للتحويل عند الفشل بينما يراكم نموذج عمره يوم واحد أدلة الإنتاج.

Claude Sonnet 5.5 نفسه ليس مُدرجًا في كتالوجنا. طُرح أمس، والسبيل إليه هو واجهة API الخاصة بـ Anthropic، ولن تلمّح هذه الصفحة إلى غير ذلك — فالمغزى من نصيحة التوجيه هو أن الطريقة الآمنة لتشغيل طبقة جديدة كليًا في الإنتاج هي منحها شريحة من حركة المرور مع شيء مُجرَّب خلفها، وهذا لا ينجح إلا عندما يوجد طرفا الترتيب في مكان يمكن الوصول إليه من نقطة واحدة. يحمل HY4 Preview هنا 372 ألف توكن من حركة المرور أسبوعيًا، وهذا ما تبدو عليه معاينة عمرها يومان قبل أن يلتزم بها أي أحد؛ أما Claude Sonnet 5 فيحمل 7.9 مليون أسبوعيًا منذ 30 يونيو، وهذا هو الفرق بين مرشّح وحدٍّ أدنى.

إلى أين يذهب المال فعلاً
من حيث الأسعار وحدها، يُعدّ HY4 Preview أرخص بأربع مرات في الإخراج من Claude Sonnet 5.5، وأرخص بنحو خمس مرات في قراءات الذاكرة المؤقتة، ويضاهي النافذة. أما من ناحية القياسات الفعلية، فإن Claude Sonnet 5.5 يولّد الإخراج أسرع بست مرات على حركة المرور الخاصة بنا — 138.7 رمزًا في الثانية مقابل 22.3 — وهو نوع الفجوة الذي يحوّل ميزة سعرية بأربعة أضعاف إلى ميزة زمنية فعلية أصغر بكثير، وأحيانًا إلى خسارة، عند أخذ الانتظار في الطابور في الحسبان.
بين هاتين الحقيقتين، يتوقف القرار على أربعة أسئلة لا يستطيع الإجابة عليها إلا القارئ. هل يحتاج العمل إلى صورة أو ملف في المطالبة؟ HY4 Preview نصي فقط وهذا ينهي النقاش. هل يحتاج إلى إكمال مهمة برمجية متعددة الخطوات، حيث إن نتيجة HY4 Preview في Terminal-Bench 2.1 البالغة 85.4 هي رقم Tencent الخاص وغير مُعاد إنتاجه؟ إذن، فإن حالة المعاينة هي المخاطرة التي تقبلها، وتحسين 7 سبتمبر يستحق إعادة الاختبار بدلاً من الثقة به. هل يجب أن يعمل عبء العمل داخل نطاقك الخاص؟ إذن، فإن أوزان Apache 2.0 هي الحقيقة الفاصلة. وهل يهم مستوى القدرة المركّب أكثر من المعدل؟ إذن، فإن الرقم 56 المقاس بشكل مستقل لـ Claude Sonnet 5.5 هو الرقم الذي يجب وزنه، بتكلفة 7.60 دولار لكل مهمة Index، مع التحفظ بأنه لا يوجد رقم مكافئ على جانب Tencent للمقارنة به.
ما يكشفه كلا الإطلاقين حقًا هو أن طليعة المجال قد تجاوزت بطاقات الأسعار. فقد أطلق مختبران، بينهما ستة أسابيع، نماذج وقدّما استهلاك الرموز لكل مهمة بدلًا من السعر لكل مليون، والنتيجة العملية للمشتري هي أن الرقم المفيد لم يعد موجودًا على صفحة أسعار أي من المورّدين. إنه عدد الرموز الذي ينتجه عبء عملك أنت، مقيسًا على كلا النموذجين، وهو الرقم الوحيد في هذه المقالة الذي لا يستطيع أي من المورّدين تقديمه لك.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
