بطاقة عنوان تقرأ "GPT-6 Astra مقابل Tencent HY4 Preview"، مع النص التقديمي "أرقام أحد النموذجين دققها شخص آخر. أما الآخر فلم يحدث ذلك - و64,000 رمز إخراج هو حيث يتوقف الجانب الرخيص"، فوق رسم توضيحي مولّد لمكعب مختوم معتمد بجانب مكعب مفتوح بطبقات ظاهرة.
Guides & Insights

GPT-6 Astra مقابل Tencent HY4 Preview: أحد النموذجين لديه سجل تدقيق والآخر لديه جدول قياس مرجعي

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Tencent HY4 Preview وGPT-6 Astra هما أرخص مسارين متاحين اليوم للوصول إلى البرمجة الوكيلية القريبة من الطليعة إذا قرأت أرقام المزوّدين أنفسهم، وهما النموذجان الأقل قابلية للمقارنة في تلك الفئة إذا قرأت أرقام أي جهة أخرى. صدر Tencent HY4 Preview وفتح مصدره في 28 أغسطس 2026 بموجب Apache 2.0، بسعر 0.834 دولار لكل مليون توكن إدخال و2.501 دولار لكل مليون توكن إخراج، مع بنية خليط الخبراء بمعاملات تبلغ 770 ملياراً، ونافذة سياق تتجاوز مليون توكن، وحد أقصى للإخراج يبلغ 64,000 توكن. أصبح GPT-6 Astra متاحاً عموماً منذ 3 سبتمبر 2026 بسعر 10.00 دولار و50.00 دولار، مع نافذة 1,050,000 توكن وحد أقصى للإخراج 128,000. نقاط قوة Astra مدعومة بثماني تقييمات منشورة من أطراف ثالثة؛ أما نقاط قوة HY4 Preview فمدعومة بعمليات تشغيل Tencent الخاصة على الطرفية واستدعاء الأدوات والتقييم الأعمى، ولا شيء غير ذلك. هذا التفاوت لا يعني أن النموذج الأرخص أضعف. بل يعني أن إحدى هاتين المقارنتين يمكن التحقق منها والأخرى يجب تصديقها، وتختلف القرارات العملية تبعاً لذلك.

ما الذي يمنحك إياه إصدار Apache 2.0 فعلياً

الترخيص هو الجزء من هذه المواجهة الذي لا يستطيع جدول الأسعار التعبير عنه. إن Tencent HY4 Preview ليس إعلانًا تشويقيًا مستضافًا بعلامة تجارية مفتوحة الأوزان — فالأوزان قابلة للتنزيل من Hugging Face وGitHub وModelScope وGitCode، مما يعني أن النموذج يظل متاحًا بغض النظر عن أي قرار يتخذه Tencent بشأن التسعير الخاص به، أو نقطة النهاية الخاصة به، أو استمرار اهتمامه بتقديمه.

• البنية — 770B إجمالي المعاملات، و49B نشطة لكل رمز، و78 طبقة، و256 خبيرًا موجّهًا بالإضافة إلى خبير مشترك واحد، وطبقة أصلية للتنبؤ متعدد الرموز لفك التشفير التخمينيbr /> • خصائص الخدمة — 54.6 رمز إخراج في الثانية و6.26 ثانية وسيط الزمن حتى أول رمز، مقاسة عبر مسارات OrcaRouter خلال نافذة متدحرجة مدتها سبعة أيامbr /> • السياق والحد الأقصى — نافذة من 1,048,576 رمزًا مقابل حد أقصى للإخراج يبلغ 64,000 رمزbr /> • واجهة الإدخال — نص فقط؛ لا صور، ولا ملفات، ولا صوتbr /> • التحكم في الاستدلال — ثلاثة مستويات: مرتفع، ومنخفض، ولا شيء، مع كون مرتفع هو الافتراضي، بالإضافة إلى توصية موثّقة بأخذ العينات بدرجة حرارة 0.9 وtop_p 1.0br /> • الموثوقية — معدل خطأ 2.8% خلال نافذة السبعة أيام نفسها، مقابل 10.3% على مسار Astra

ذلك الزوج الأخير من الأرقام هو أكثر ما يمكن التصرف بناءً عليه في هذه الصفحة، وهو نوع الرقم الذي لا ينشره أي مورّد عن نموذجه الخاص. درجات Astra في المعايير المستقلة أعلى، وقد كان مساره يفشل في نحو طلب واحد من كل عشرة خلال الأسبوع الماضي، في حين أن نموذجًا لا يملك أي درجات مستقلة على الإطلاق كان يفشل في طلب واحد من كل خمسة وثلاثين. لا يُعد أي من الرقمين حكمًا على النموذجين أنفسهما — فمعدلات الأخطاء تقيس المسار وحدود المعدل والمصدر الأعلى، وليس الأوزان — لكنها الأرقام التي يواجهها نظام إنتاجي فعليًا.

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

حيث يمكن التحقق من أرقام تينسنت مقابل أرقام شخص آخر

تُعد هذه، بحسب الأدلة المنشورة، فرصة غير معتادة حقًا: لدى كل من Astra وHY4 Preview رقم في Terminal-Bench 2.1، وواحد فقط منهما مُبلَّغ عنه من جهة المورّد.

• Terminal-Bench 2.1، في تشغيل طرفية حقيقية — GPT-6 Astra 88.4، بتقييم مستقل؛ Tencent HY4 Preview 85.4، وفق ما أعلنته الشركةbr /> • استدعاء الأدوات — Astra 41.4 في τ²-Banking، بتقييم مستقل؛ HY4 Preview 74.1 في Toolathlon-Verified، وفق ما أعلنته الشركة، في اختبار مختلفbr /> • هندسة البرمجيات — HY4 Preview 64.3 في DeepSWE، مرتفعًا من 28.0 على سابقه Hy3، وفق ما أعلنته الشركةbr /> • مهام الوكلاء — HY4 Preview 37.1 pass@1 في APEX-Agents، وفق ما أعلنته الشركةbr /> • التفضيل البشري — متوسط 2.99 من 4.00 عبر 203 مهام هندسية قيّمها 163 خبيرًا، وأجرته الشركة، مقابل GLM-5.3 عند 2.92 وKimi K3 عند 2.94br /> • مؤشر مستقل — GPT-6 Astra عند 54.7 في مؤشر الذكاء و96.1 في GPQA Diamond، من طرف ثالث؛ لا يوجد مؤشر مكافئ لـ HY4 Preview

صف Terminal-Bench هو الجدير بالتوقف عنده. الفارق البالغ 3 نقاط بين نتيجة مستقلة قدرها 88.4 ونتيجة مبلّغ عنها من مورّد قدرها 85.4 يقع تمامًا ضمن النطاق الذي يمكن أن تنتجه أداة اختبار مختلفة، أو بنية دعم مختلفة، أو درجة حرارة أخذ عينات مختلفة، ما يعني أن القراءة الأمينة ليست "Astra أفضل بثلاث نقاط" بل "أرخص نموذج مفتوح الأوزان في هذه الفئة يدّعي التكافؤ، والادعاء معقول على الأقل". وصياغة Tencent نفسها حذرة في هذه النقطة: فهي تصف DeepSWE بأنه "يضيّق الفجوة تدريجيًا" بدلًا من إغلاقها، وادعاؤها الوحيد النظيف بشأن التكافؤ — التعادل في Terminal-Bench مع نموذج مغلق رائد من مورّد مختلف — هو بالضبط الادعاء الأكثر حاجة إلى قياس ثانٍ.

هناك أيضًا تغيير يجدر معرفته، لأنه يغيّر الاقتصاديات وليس النتائج. في 7 سبتمبر 2026، أدرجت Tencent تحسينًا في نسخة المعاينة المباشرة قالت إنه يقلل جولات الاستدلال واستهلاك الرموز لكل مهمة في الأعمال المعقدة. ولأن النموذج يفرض رسومًا حسب الرمز، فإن رموزًا أقل لكل مهمة منجزة تخفض تكلفة المهمة حتى لو لم يتغير سعر الرمز. حجم هذا التوفير هو قياس Tencent نفسها، ولم يكرره أحد خارج Tencent — لكن الآلية حقيقية، وهي السبب في أن معاينة صدرت في أغسطس قد تكون أرخص بشكل ملموس في التشغيل في أكتوبر مما أوحى به منشور إطلاقها.

سقف 64,000 رمز هو المواصفة التي تحدد عمليات النشر.

في منتصف ورقة المواصفات تقع القيد الذي يلدغ أولًا، وهو ليس الجودة. فالحد الأقصى لمخرجات HY4 Preview هو 64,000 رمز مقابل 128,000 لدى Astra، وذلك في نموذجٍ غرضه المعلن هو وكلاء البرمجة وسلاسل استخدام الأدوات الطويلة. ملفٌ مولَّد، أو رقعة متعددة الملفات، أو تقرير طويل منظَّم — هذه هي المخرجات التي تصطدم بسقف، وفي تشغيل وكيلٍ ما لا تكون النتيجة إجابةً أسوأ قليلًا، بل إجابةً مقتطعة يتعيّن على خط المعالجة المحيط اكتشافها والتعامل معها.

كلا النموذجين يستهلكان نحو مليون رمز من الإدخال، لذا فإن حالة قراءة المستندات تعادل حقيقي. أما الفرق فيقع بالكامل في جانب التوليد، وهو ضعف كامل لا مجرد خطأ تقريب. أضف إلى ذلك الفرق في سطح الإدخال — إذ يقبل Astra الصور والملفات، بينما HY4 Preview نصي فقط — لتبرز صورة تدل على تقسيم عمل واضح: النموذج مفتوح الأوزان لحلقات نص-إلى-نص يكون مخرجها استدعاء أداة أو نصًا برمجيًا، والنموذج المغلق لأي مهمة تقتضي النظر إلى شيء ما أو كتابة نص طويل.

ما الذي يمنحه معدل إنتاج أعلى بـ20×، سطرًا بسطر

• سعر الإدخال — Tencent HY4 Preview $0.834 لكل مليون مقابل GPT-6 Astra $10.00، بنحو 12×br /> • سعر الإخراج — HY4 Preview $2.501 لكل مليون مقابل Astra $50.00، بنحو 20×br /> • الإدخال المخزّن مؤقتًا — HY4 Preview $0.042 لكل مليون مقابل Astra $1.00، بنحو 24×br /> • شريحة الطلب الطويل — تعيد Astra تسعير الطلب بالكامل عند تجاوز 272,000 رمز إدخال إلى $20.00 و$75.00؛ ولا تحتوي بطاقة HY4 Preview على شريحة مكافئةbr /> • سعر الإدخال الفعّال على مُوجّه من 400,000 رمز — HY4 Preview دون تغيير عند $0.834 مقابل Astra $20.00، بنحو 24×br /> • تكلفة كل مليون رمز في حلقة وكيل عادية، بنسبة 4:1 إدخال إلى إخراج — HY4 Preview نحو $1.17 مقابل Astra نحو $18.00br /> • تكلفة شهر يبلغ 100 مليون رمز بالنسبة نفسها — HY4 Preview نحو $117 مقابل Astra نحو $1,800

بند الإدخال المخزَّن مؤقتًا هو البند الذي يسوء توسّعه أكثر من غيره في الجانب المكلف، لأن حلقات الوكيل تعيد إرسال النص النظامي نفسه وبادئة المحادثة ذاتها في كل دور. عند 0.042$ مقابل 1.00$، تكون أرخص التوكنات في حلقة طويلة أرخص بـ24 مرة على نموذج Tencent، وهو تحديدًا نوع عبء العمل الذي تتراكم فيه أسرعَ الفروق الصغيرة لكل توكن. أما التكلفة لكل مهمة، وهي المقياس الذي كان سيحسم هذا بوضوح، فلا تنشرها Tencent على الإطلاق — لذا السبيل الوحيد للحصول على الرقم المهم هو تشغيل كلا النموذجين على مجموعة المهام الخاصة بك وقراءة كائن الاستخدام.

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

ما الذي يضيفه جهاز التوجيه هنا، مع وجود معدلات الخطأ في متناول اليد

كلا الطرازين موجودان في كتالوج OrcaRouter — tencent/hy4-preview و openai/gpt-6-astra — خلف نقطة نهاية واحدة متوافقة مع OpenAI، كل منهما بسعر القائمة الخاص بمزوّده، مُمرَّرًا كما هو دون هامش ربح بنسبة 0%. هذه التفصيلة الأخيرة تكتسب أهمية أكبر في هذين الطرازين مما في معظم الحالات، لأن سعر القائمة الخاص بطراز Tencent منشور باليوان: الأرقام الدولارية أعلاه هي السعر المحوَّل الذي تراه فعليًا، وليست هامشًا من موزّع، وإذا غيّرت Tencent السعر، يصبح التغيير ساريًا هنا في اليوم نفسه بدلًا من تجديد العقد التالي.

إن لغة التوجيه (Routing DSL) هي النقطة التي يتوقف فيها النموذجان عن كونهما بديلين. القاعدة الطبيعية لهذا الزوج هي التصعيد عند المخرجات: أرسل الحلقة إلى النموذج الرخيص، وعندما تعود استجابة مبتورة عند سقف الـ64,000 رمز أو تفشل في اجتياز فحص المخطط (schema)، أعد محاولة تلك الخطوة عبر openai/gpt-6-astra، الذي يمتلك ضعف مساحة المخرجات. أما التحويل التلقائي عند الفشل فهو النصف الآخر من الحجة، وهو ليس نظريًا عندما يكون أحد المسارين قد أعاد أخطاءً في طلب واحد من كل عشرة على مدى الأسبوع الماضي — فجولة وكيل طويلة مثبتة على نموذج واحد تموت بسياقها المتراكم، ولا أي من هذين النموذجين رخيص بما يكفي لإعادة تشغيله من البداية عن طريق الخطأ.

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

ما الذي قد يغيّر هذه المقارنة؟

ثلاثة أشياء، مرتبة حسب مقدار ما قد تغيّره. تقييم مستقل لـ HY4 Preview — النموذج متاح للعموم منذ ستة أسابيع، وليس لديه فهرس من طرف ثالث، ولا رقم Terminal-Bench معاد إنتاجه، ولا رقم تكلفة لكل مهمة، والتقييم الأعمى الوحيد الذي أجراه المورّد هو بيانات تفضيل البشر الوحيدة الموجودة. تكلفة منشورة لكل مهمة مكتملة لكلا النموذجين، مما سيستبدل كل نسبة في هذا المقال برقم واحد. وقرار Tencent بشأن الاستدلال من طرف ثالث، لأن أوزان Apache 2.0 يمكن أن يقدمها أي شخص، وفي اللحظة التي يقدم فيها مضيفون منافسون HY4 Preview، يصبح السعر في الجانب الرخيص من هذه المقارنة سوقًا وليس قائمة.

حتى ذلك الحين، تكون الخلاصة القابلة للاستخدام أضيق نطاقًا من منشور الإطلاق لأي من المورّدين، وأكثر صدقًا من لوحة نتائج: GPT-6 Astra هو النموذج الذي جرى التحقق من ادعاءات قدراته، مع سقف إخراج مضاعف ومسار كان يفشل في طلب واحد من كل عشرة. Tencent HY4 Preview هو النموذج الذي لم تُفحص ادعاءات قدراته، مع بنية منشورة، وترخيص مفتوح، وثلث السعر، ومعدل خطأ أقل بكثير خلال النافذة نفسها. إذا كان عملك نصًا يدخل ونصًا يخرج ويندرج داخل 64,000 رمز مُولَّد، فإن النموذج الأرخص ليس حلًا وسطًا — بل هو الجواب الصحيح، وسجل التدقيق هو الشيء الوحيد الذي تتخلى عنه.

القاعدة الطبيعية لهذا الزوج هي التصعيد عند الإخراج: أرسل الحلقة إلى النموذج الرخيص، وعندما تعود استجابة مقتطعة عند سقف 64,000 رمز أو تفشل في اجتياز فحص المخطط الخاص بك، أعد محاولة تلك الخطوة مقابل openai/gpt-6-astra، الذي يملك ضعف مساحة الإخراج.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا