
Tencent HY4 Preview مقابل Kimi K3: الاختبار الأعمى الذي اختارت Tencent نشره
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
Tencent HY4 Preview مقابل Kimi K3 هو المواجهة الوحيدة في إطلاق هذا النموذج التي اختارت Tencent نفسها إجراءها. في اختبارها الداخلي الأعمى — 163 مهندسًا، و203 مهام هندسية، تم تقييمها على مقياس من أربع نقاط — سجلت HY4 Preview 2.99/4.00 مقابل 2.94 لـ Kimi K3، وعنوان Tencent الرئيسي وصفها بالفوز. التفاصيل الدقيقة لهذا الفوز تستحق القراءة بتمعن: تفوقت HY4 Preview على Kimi K3 في 51.2% من المهام، وتعادلت في 7.9%، وخسرت في 40.9%. صافي نسبة الفوز البالغ 10 نقاط حقيقي، لكنها ميزة ضئيلة أمام نموذج يبلغ إجمالي عدد معلماته الثلث وأقل من نصف المعلمات النشطة — والاختبار بأكمله أجرته Tencent.
كيمي K3 هو النموذج الرئيسي مفتوح الأوزان من موونشوت بمعاملات تبلغ 2.8 تريليون، وهو أكبر نموذج مفتوح أُطلق على الإطلاق، والنقطة المرجعية التي تقيس عليها كل مختبرات الصين أداءها منذ 16 يوليو. اختارته تينسنت كخصم لأنه المعيار القياسي للنماذج مفتوحة الأوزان — وهو ما يجعل مهمة هذا المقال محددة بشكل غير معتاد: اقرأ المقارنة المباشرة الوحيدة التي تطوع بها المنافس، واحكم بنفسك على قيمتها.
المعيار الذي اختارت Tencent نشره
تم تقييم الاختبار الأعمى بواسطة مهندسي تينسنت أنفسهم على مهام هندسية خاصة بتينسنت، وهذا أول ما يجب التقليل من شأنه. إن مجموعة المهام التي تنتقيها الشركة هي بالضبط البيئة التي يحقق فيها النموذج الجديد أفضل ظهورٍ ممكن. وحتى مع التسليم بذلك، فإن شكل النتيجة مُفيد: 51.2% انتصارات مقابل 40.9% خسائر هو هامش متواضع، ونسبة التعادل 7.9% تعني أن النموذجين متقاربان في معظم المهام. وفي المهام الصعبة، تلك التي ينفرد فيها النموذج الرائد، تظل الفجوة كما هي دائمًا — والعنوان الرئيسي لشركة تينسنت، "متقدم قليلاً على Kimi K3"، صيغ بأمانة، وهذا ليس ما تنشره كل المختبرات.
الحجم ليس قدرًا
مقارنة المعلمات تجعل النتيجة إما مبهرة أو مريبة، اعتمادًا على افتراضاتك المسبقة. كيمي K3 يبلغ إجمالي معلماته 2.8 تريليون مع 104 مليارات نشطة — 896 خبيرًا، 16 نشطًا لكل رمز — وقد تم تدريبه على التفكير بشكل دائم مع سلسلة تفكير مكشوفة. إصدار HY4 التجريبي يبلغ إجماليه 770 مليارًا مع 49 مليارًا نشطة، أي ثلث الحجم الإجمالي وأقل من نصف القدرة الحاسوبية النشطة. تحقيق نموذج أصغر فوزًا ضيقًا في اختبار أعمى على نموذج أكبر هو الاتجاه الذي يسير فيه مجال الأوزان المفتوحة بالكامل — حيث تبادل كل من Qwen3.8-Max بحجم 2.4 تريليون وGLM-5.2 بحجم 753 مليارًا الضربات على معايير الوكلاء لعدة أشهر — لذا فالنتيجة معقولة وليست غريبة. كما أنها، بشكل حاسم، لم يتم التحقق منها من قبل أي جهة خارج تينسنت.
لوحة النتائج

• الحجم — HY4 Preview 770B إجمالي / 49B نشط مقابل Kimi K3 2.8T إجمالي / 104B نشط
سياق — HY4 Preview >1M توكن مقابل 1M توكن لـ Kimi K3
• السعر لكل 1M — HY4 Preview ¥6 للإدخال / ¥18 للإخراج (≈$0.85 / $2.50) مقابل Kimi K3 $3.00 للإدخال / $15.00 للإخراج، ضربات الكاش $0.30
• الطريقة — HY4 Preview نص فقط مقابل Kimi K3 إدخال أصلي للصور والفيديو
• الاستدلال — لا يوجد وضع منشور لـ HY4 Preview مقابل تفكير Kimi K3 الدائم مع سلسلة أفكار متدفقة
• درجة مستقلة — HY4 Preview: لا يوجد مقابل Kimi K3: مؤشر الذكاء AA 57، ضمن أفضل ثلاثة عالميًا عند الإصدار
في الصفوف التي يذكر فيها الطرفان رقمًا، تتجمّع النماذج. تُبلغ Tencent عن HY4 Preview بنتيجة 37.1 على APEX-Agents، وهو مستوى تقريبًا مع 37.2 لـ Kimi K3 — تعادل شبه كامل قد تتنبأ به لوحة نتائج الاختبار الأعمى. نتيجة HY4 Preview في Toolathlon-Verified البالغة 74.1 و DeepSWE البالغة 64.3 ليس لهما ما يعادلهما من Kimi K3 في ما لديّ، ونتائج Kimi K3 في FrontierSWE 81.2 و ProgramBench 77.8 و BrowseComp 91.2 ليس لها ما يعادلها من HY4 Preview. لوحة النتائج صادقة في أن البطاقتين تتقاطعان بشكل ضئيل، وهو في حد ذاته تحذير من التعامل مع صفوف أي من البائعين كوصف كامل للنموذج.
الرؤية هي الفرق الحقيقي الأكبر
بالنسبة للمطوّر الذي يختار بين الاثنين اليوم، فإن الفجوة الهيكلية ليست الذكاء — بل هي طريقة الإدخال. Kimi K3 متعدد الوسائط بطبيعته: فهو يقبل إدخال الصور والفيديو عبر مشفّره MoonViT-V2، ويُعدّ من أفضل النماذج مفتوحة المصدر في مهام الرؤية، حيث يحتل المرتبة الثانية عالمياً في ساحة الرؤية. أما Tencent HY4 Preview فهو نصي فقط في هذه النسخة التجريبية، وقد صرّحت Tencent بأن الرؤية يجب أن تنتظر الإصدار الكامل. أي عبء عمل يتطلب لقطات شاشة أو فهم واجهة المستخدم أو الإسناد البصري يكون من نصيب Kimi K3 افتراضياً، بغض النظر عمّا يقوله الاختبار الأعمى عن النصوص الهندسية. إذا كان عملك يتعلق حصرياً بالكود والوثائق ومخرجات الطرفية، فإن الفجوة لا تهم؛ لكن بمجرد أن تتضمن المهمة النظر إلى شيء ما، فإنها تحسم المواجهة.
مسألة التكلفة
لكل توكن، HY4 Preview أرخص بشكل كبير: تقريبًا 0.85 دولار/2.50 دولار مقابل 3.00 دولار/15.00 دولار لـ Kimi K3، مع إصابات التخزين المؤقت عند ¥0.3 (حوالي أربعة سنتات) مقابل 0.30 دولار. لكن النموذجين يظهران سلوكين متعاكسين في استهلاك التوكنز يقللان الفجوة. يقوم Kimi K3 بالاستدلال بشكل دائم ويبث سلسلة أفكاره، مما يضخم توكنز الإخراج في كل طلب؛ وقد لاحظ المراجعون أن النموذج أبطأ — حوالي 62 توكنًا في الثانية — ومكثف في التوكنز لحلقات الوكلاء. HY4 Preview، وفقًا لملاحظات الإصدار الخاصة بشركة Tencent نفسها، "يميل إلى التفكير الطويل المفرط والإفراط في التحقق الذاتي" في المهام المعقدة. كلاهما يستهلك توكنز إخراج إضافية؛ لكن HY4 Preview يفرض سعرًا أقل عليها فقط. المقارنة العادلة هي التكلفة لكل مهمة مكتملة، ولا أحد خارج Tencent قد قام بقياسها لـ HY4 Preview بعد.
الحكم
تنسنت HY4 Preview هو المنافس الأرخص والأصغر وغير المُثبَت الذي يدّعي تفوقًا طفيفًا في الاختبار الأعمى على المعيار مفتوح الأوزان؛ أما Kimi K3 فهو النموذج الراسخ الأكبر والمُثبَت والقادر على معالجة الصور، وتبلغ تكلفته أربعة إلى خمسة أضعاف لكل توكن، ويملك مؤشر ذكاء مستقلًا بقيمة 57. لا تُعد بطاقة المعايير لأي من النموذجين مستقلة تمامًا — فدرجات Kimi K3 الرئيسية هي أيضًا من إبلاغ Moonshot، وإن كان مؤشر 57 الخاص بها ليس كذلك. إذا كان عبء عملك متعدد الوسائط، فإن Kimi K3 هو الخيار الوحيد في هذه المواجهة. أما إذا كانت المهام نصية وهندسية، فإن HY4 Preview هو الخيار الأفضل قيمةً، مع مواجهة مباشرة حقيقية في سجله وإن كانت مُدارة من البائع، والمسار الأرخص هو توجيه Kimi K3 عبر المفتاح الإنتاجي — فهو متاح على OrcaRouter بسعر Moonshot المعلن البالغ 3.00 دولار / 15.00 دولار، مع تمريره دون أي زيادة — بينما تشغّل HY4 Preview عبر واجهة تنسنت البرمجية الخاصة على أعباء العمل الظلّية. عندما يصبح HY4 Preview متاحًا على أحد الموجّهات، سيتولى المفتاح نفسه وقواعد التبديل الاحتياطي نفسها أمر كليهما، وسيُمرَّر سعر تنسنت البالغ 6/18 يوانًا دون تغيير.


ماذا تشاهد
• إعادة تشغيل مستقلة لمهام الاختبار الأعمى. نسبة الفوز 51.2% هي الادعاء الأكثر قابلية للاختبار في هذا الإطلاق، ومنصة اختبار من طرف ثالث ستحسم الأمر في غضون أسبوع.
• ما إذا كانت نسخة HY4 Preview ستصدر ميزة الرؤية قبل الإصدار الكامل من Hy4. هذا هو ما سيحوّل هذه المواجهة من منافسة قائمة على القيمة النصية فقط إلى معركة حقيقية بين الهواتف الرائدة.
• التكلفة لكل مهمة مكتملة على الأطر الوكيلة القياسية. كلا النموذجين كثيفا الاستهلاك للرموز؛ أيهما أرخص لكل مهمة منجزة يكسب الحجة الإنتاجية.
• استجابة Kimi K3 لضغط الأسعار. إذا خفضت Moonshot معدل الإخراج البالغ 15 دولارًا، فإن إطار "التحدي الرخيص مقابل المعيار الباهظ" ينقلب.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
