
صوت HeyGen يظهر لأول مرة في المركز الأول على Controlled Voice TTS Arena — متجاوزًا Qwen وElevenLabs في الأصوات المستنسخة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
في 9 أكتوبر 2026، أضافت Artificial Analysis نموذج HeyGen Voice إلى ساحة Controlled Voice التابعة لها، وتصدّر النموذج هذه الساحة مباشرة. حصل HeyGen Voice — أول نموذج تحويل النص إلى كلام من HeyGen يُقيَّم على اللوحة — على 1,202 نقطة Elo، متقدّمًا على Qwen-Audio-3.1-TTS-Plus عند 1,186 وعلى Eleven v4 Turbo من ElevenLabs عند 1,167. ويحلّ Cartesia Sonic 3.6، الذي يتصدّر لوحة Provider Voices المفتوحة على الموقع، في المركز الخامس هنا عند 1,143. وهي نتيجة حقيقية على لوحة صدارة بُنيت لإزالة أكبر عامل تشويش منفرد في تقييم الأصوات، وهي أيضًا نتيجة ذات معنى محدد للغاية يسهل المبالغة في تأويله: HeyGen Voice هو أفضل صوت في هذه الساحة استنادًا إلى ثمانية أصوات مرجعية مستنسخة، وليس بعد بطلًا مثبتًا بالقياس على اللوحة التي تضم ستة وتسعين نموذجًا.
ما الذي تقيسه لوحة Controlled Voice، ولماذا يهم ذلك
تدير Artificial Analysis لوحتَي تصنيف للصوت، وهما تجيبان عن سؤالين مختلفين. تتيح ساحة Provider Voices لكل مورّد أن يقدّم أصواته الأصلية الخاصة — الأصوات التجريبية المصقولة التي تختارها الشركة لتمثيل نفسها — وترتّب النماذج وفق مدى جودة تلك الأصوات. لوحة صدارتها واسعة وناضجة: ستة وتسعون مُدخلًا، مع Eleven v4 Turbo في الصدارة عند 1,328 Elo وCartesia Sonic 3.6 في المركز الرابع عند 1,280.
تفعل ساحة Controlled Voice شيئًا أضيق نطاقًا، وأكثر فائدة لأي شخص يطرح منتجًا. كل نموذج عليها يولّد الكلام من الأصوات الثمانية المستنسخة نفسها — أربعة أمريكية وأربعة بريطانية — لذا فالمقارنة ليست «أي صوت تسويقي أجمل» بل «كيف يتعامل كل محرك مع الصوت نفسه والنص نفسه وظروف التسجيل نفسها». إنها أقرب ما لدى الصناعة إلى اختبار متماثل للمحرك بدلًا من شريط العرض التوضيحي، وهي اللوحة التي تهم إذا كنت تخطط لاستنساخ صوت وتسليمه إلى نموذج TTS.
يتصدرها الآن HeyGen Voice. الفارق 16 إيلو عن Qwen-Audio-3.1-TTS-Plus و35 عن Eleven v4 Turbo، مع فاصل ثقة مُبلَّغ عنه بنسبة 95% يبلغ نحو 1,185 إلى 1,219 على رقم HeyGen. ستة عشر إيلو فجوة حقيقية لكنها ليست هوة سحيقة — على لوحة بهذه الكثافة، إنها الفرق بين الأول والثاني، لا بين القابل للاستخدام وغير القابل للاستخدام.

حيث لم يتم تصنيف HeyGen Voice بعد
الجانب الصادق في هذه النتيجة هو أن HeyGen Voice لا يظهر إطلاقًا على لوحة Provider Voices، وغيابه ليس مؤشرًا على الجودة. وتشير Artificial Analysis إلى أن النماذج قد تُستبعد لأنها لم تحصل بعد على عدد كافٍ من الأصوات. أما نموذج عمره بضعة أيام، وله ساحة واحدة فقط بدرجات مختلفة خلفه، فببساطة لم يجمع بعد حجم الاستماع الأعمى الذي تتطلبه اللوحة الأكبر.
إذن، القراءة الصحيحة في 10 أكتوبر 2026 هي: إن HeyGen Voice هو الصوت الأعلى تصنيفًا في المقارنة المضبوطة للأصوات المستنسخة، وكمٌّ مجهول مقابل الميدان الأوسع. وأي شخص يستشهد بـ«أفضل نموذج TTS في العالم» استنادًا إلى هذا الرقم فإنه يستشهد بلوحة نتائج أصغر مما توحي به الجملة.

الرقمان الكامنان خلف Elo
• إيلو الصوت المتحكَّم فيه — HeyGen Voice: 1,202 (95% CI تقريبًا 1,185–1,219). Qwen-Audio-3.1-TTS-Plus: 1,186. Eleven v4 Turbo: 1,167.
• تصنيف Elo لأصوات المزوّدين — HeyGen Voice: غير مُدرَج (أصوات غير كافية). Eleven v4 Turbo: 1,328 في المرتبة #1. Sonic 3.6: 1,280 في المرتبة #4.
• الترتيب في المجال الخاضع للتحكم — HeyGen Voice: المركز الأول من 42 مدخلًا مصنفًا (المركز 42 هو OpenVoice v2 عند 812).
• السعر على أساس الأرينا — HeyGen Voice: 30.00 دولار لكل مليون حرف، وهو التحويل الخاص بالأرينا لتسعير ائتمانات HeyGen. Qwen-Audio-3.1-TTS-Plus: 19.30 دولار لكل مليون حرف. Eleven v4 Turbo: 40.00 دولار لكل مليون حرف.
• مرساة إيلو — OpenAudio S1 هو النقطة المرجعية الثابتة عند 1,000، لذا فإن HeyGen Voice أعلى بـ 202 نقطة من المرساة.
• من أيضًا في المراكز الخمسة الأولى — يكمل كل من Eleven v4 برصيد 1,160 وSonic 3.6 برصيد 1,143 المراكز الخمسة الأولى خلف المتصدرين.

ما الذي أصدرته HeyGen فعلاً
محرك HeyGen لتحويل النص إلى كلام متاح في واجهة برمجة التطبيقات v3 الخاصة بالشركة. GET /v3/voices هو استدعاء يأخذ engine، معامل الذي تتضمن قيمه orca — محرك HeyGen الخاص — إلى جانب starfish وتمرير إلى أصوات ElevenLabs. يتم تشغيل تخليق الكلام عبر POST /v3/voices/speech؛ ويكشف الضبط لكل طلب عن speed من 0.5 إلى 1.5 و pitch من −50 إلى +50 نصف نغمة، مع تلميح BCP-47 locale.
يُدرج الكتالوج على أنه أكثر من 300 صوت مُعدّ مسبقًا عبر عشرات اللغات. تأتي الأصوات المخصّصة بثلاثة أنواع: تصميم من النص إلى الصوت يولّد ما يصل إلى ثلاثة خيارات مرتّبة انطلاقًا من وصف لا يتجاوز 1000 حرف، واستنساخ فوري من تسجيل واحد، واستنساخ احترافي مدرّب على عشرين دقيقة أو أكثر من الصوت. هذا الأخير هو الجزء الذي تخضع له لوحة صدارة Controlled Voice لاختبار إجهاد فعلي — فتلك الأصوات المرجعية الثمانية هي أصوات مستنسخة، وجودة الاستنساخ هي ما تتفاضل فيه محركات TTS.
تُذكر المحركات أيضًا في الوثائق بوصفها قابلة للاختيار لكل صوت، ما يعني أن HeyGen لا تفرض عليك استخدام نموذجها: يمكنك التوجيه إلى محرك صوت من طرف ثالث عبر واجهة برمجة التطبيقات (API) الخاصة بها عندما تفضّل ذلك. هذا تحوّط من المورّد بشأن نموذجه الخاص، ويجدر معرفته عندما تقرأ ادعاءً بأنه «الصوت رقم 1» بشأن HeyGen.
ما الذي يغيّره هذا لأي شخص يختار صوتًا
تترتب على تحقّق نتيجة صوتية مُتحكَّم فيها ثلاث تبعات عملية، وليس أيٌّ منها «تبديل كل شيء».
أولًا، إذا كانت حالة الاستخدام لديك هي صوت علامة تجارية مستنسخ — متحدث واحد، أسطر كثيرة — فهذه هي لوحة الصدارة التي يجب قراءتها الآن، وHeyGen Voice هو النموذج الذي يجب اختباره أولًا. لوحة الصدارة التي تُبقي الصوت ثابتًا تقيس الشيء الذي ستفعله فعليًا.
ثانيًا، إذا كانت حالة الاستخدام لديك تتطلب طاقمًا واسعًا من الشخصيات ذات النطق الأصلي بلغات لا يغطيها استنساخك، فإن لوحة Provider Voices ومدخلاتها الستة والتسعين لا تزال المرجع ذا الصلة، ولم يحصل HeyGen Voice على ترتيب هناك بعد. لا شيء في نتيجة الصوت المستنسخ يخبرك كيف يتعامل المحرك مع مئة صوت مختلف.
ثالثًا، أصبح للسعر الآن رقم، لكنه ليس الرقم الذي نشرته الجهة الموردة. تُدرج الساحة HeyGen Voice بسعر 30.00 دولارًا لكل مليون حرف، وهو تحويل من Artificial Analysis لنظام أرصدة لا تترجمه صفحة HeyGen نفسها أبدًا إلى سعر للصوت. وهذا يضع المتصدر الجديد تحت سعر Eleven v4 Turbo البالغ 40.00 دولارًا وفوق سعر فئة Qwen البالغ 19.30 دولارًا — سعر في منتصف الميدان مرتبط بدرجة المركز الأول، وهو سعر مستنتج لا مُقتبس.
مسألة التوجيه
لاختيار الصوت بُعد لا تملكه معظم خيارات النماذج: فالفشل مسموع للمستخدم النهائي خلال مقطع لفظي واحد. وهذا ما يجعل الترحيل رخيصًا في الاختبار ومكلفًا في الخطأ عند التشغيل الفعلي. تشغيل محرك جديد خلف الواجهة نفسها التي يعمل بها المحرك الحالي — واجهة API واحدة، ومفتاح واحد، وسعر قائمة المزوّد يُمرَّر كما هو بدلًا من رفعه، مع تحويل تلقائي عند الفشل إلى مزوّد صوت ثانٍ عندما يفشل الطلب — هو الطريقة التي تحصل بها على إجابة حقيقية عن صوتك أنت، لا إجابة مخطط Elo عن ثمانية أصوات مرجعية. وُجدت طبقة التوجيه في OrcaRouter لهذا النوع من القرار بالتحديد: ضع المنافس الجديد على نسبة من الزيارات، وأبقِ المحرك الحالي جاهزًا، ودع التحويل عند الفشل يغطي النافذة التي يظل فيها النموذج الجديد غير مُثبت. تُخبرك لوحة الصدارة إلى أين تنظر، لكنها لا تستطيع أن تُخبرك كيف يبدو السكربت الخاص بك عند تشغيله.
ماذا تشاهد بعد ذلك
رقمان سيحسمان هذه القصة. الأول هو ما إذا كان HeyGen Voice سيجمع أصواتًا كافية لدخول لوحة Provider Voices، وأين سيستقر مقابل 1,328 الخاصة بـ Eleven v4 Turbo — وهو نموذج يتصدر تلك اللوحة لكنه متأخر في الساحة المضبوطة، وهذه بالتحديد هي الفجوة التي وُجدت اللوحتان لكشفها. الثاني هو ما إذا كانت HeyGen تنشر سعرًا صوتيًا خاصًا بها، بحيث يمكن التحقق من مبلغ $30.00 الذي استنتجته الساحة مقابل رقم من المورّد بدلًا من استنتاجه من الاعتمادات. وحتى يتوفر كلا الرقمين، فإن الظهور الأول في المرتبة #1 على اللوحة المضبوطة يمثل ادعاءً قويًا بشأن جودة الصوت المستنسخ، ومسألة مفتوحة بشأن كل ما عدا ذلك.
