بطاقة رئيسية مُولّدة بعنوان «HeyGen Voice مقابل Cartesia Sonic 3.6 — لوحة النتائج» تُقارن بين المحرّكين، مع ملاحظة أن مقارنة Elo تُبقي ثمانية أصوات مرجعية مستنسخة ثابتة وفقًا لـ Artificial Analysis، 9 أكتوبر 2026. يظهر شعار OrcaRouter في الزاوية اليمنى السفلية.
Engineering & Research

HeyGen Voice مقابل Cartesia Sonic 3.6: بطل الصوت المستنسخ في مواجهة المتصدر بزمن استجابة أقل من 90 مللي ثانية

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يحمل HeyGen Voice وCartesia Sonic 3.6 ادعاءين مختلفين بالمركز الأول على Artificial Analysis، والمقارنة بأكملها تكمن في الفجوة بينهما. يتصدر HeyGen Voice ساحة Controlled Voice بـ1,202 Elo — اللوحة التي يتحدث فيها كل نموذج بالأصوات الثمانية المستنسخة نفسها، أربعة أميركية وأربعة بريطانية. ويحتل Cartesia Sonic 3.6 المركز الرابع في ساحة Provider Voices بـ1,280 Elo، حيث يقدّم كل مزوّد أصواته الأصلية الخاصة، ويحمل موقع Cartesia نفسه شارة تدّعي احتلال المرتبة الأولى عبر كل من Speech Arena ولوحة متصدري Speech to Text، وهو ادعاء يعرضه المزوّد ولا يدعمه جدول Artificial Analysis المباشر حالياً في المركز الأول. محرّك واحد يفوز في الاختبار حيث يكون الصوت ثابتاً، والآخر يتقدم في الاختبار حيث تكون ميزانية الإنتاج حقيقية.

ابدأ بما تم تحسين كل نموذج من أجله فعليًا

صُمِّم Sonic 3.6 ليُستهلك ضمن بثّ متدفّق. تتصدّر صفحة منتج Cartesia بعبارة «أول مقطع صوتي في أقل من 90 مللي ثانية» — وفق ما أوردته الجهة الموردة، دون إعادة إنتاج — كما تصف الصفحة نفسها واجهة برمجة تطبيقات لتحويل النص إلى كلام في الزمن الحقيقي مع بثّ من الطراز الأول. ويغطي 44 لغة من نموذج واحد، ويفسّر المضامين العاطفية الضمنية افتراضيًا، ويقبل إشارات غير لفظية مثل الضحك المكتوب في النص، ويستنسخ صوتًا من نحو عشر ثوانٍ من التسجيل الصوتي، ويوطّن الصوت الموجود إلى لغات أخرى، ويتقبل قواميس نطق مخصصة للمصطلحات المتخصصة وأسماء الأعلام. وكل واحدة من هذه الميزات موجَّهة إلى العميل نفسه: شيء يردّ بسرعة، وبلغة يفهمها المتصل.

صُمم HeyGen Voice ليُستهلك كأداء. إنه محرك HeyGen الداخلي، يُتاح عبر واجهة v3 API الخاصة بالشركة، مع أكثر من 300 صوت جاهز عبر عشرات اللغات وثلاثة مسارات نحو صوت مخصص — تصميم صوت قائم على الوصف يعيد حتى ثلاثة خيارات مرتبة من نص توجيهي لا يتجاوز 1,000 حرف، واستنساخ فوري من تسجيل واحد، واستنساخ احترافي مدرَّب على عشرين دقيقة أو أكثر. يغطي الضبط لكل طلب السرعة من 0.5 إلى 1.5 والنغمة على مدى ±50 نصف نغمة. لا شيء في مواد HeyGen المنشورة يَعِد بأي رقم لزمن الاستجابة على الإطلاق.

هذا التفاوت هو المقال بأكمله. أحد النموذجين ينشر رقمًا بالمللي ثانية ولا ينشر سعرًا لكل حرف؛ بينما ينشر الآخر سعرًا ولا ينشر رقمًا لزمن الاستجابة.

لوحة النتائج

A generated two-column scoreboard titled 'HeyGen Voice vs Cartesia Sonic 3.6 — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', "Price: $30.00 per 1M characters, arena conversion of credit pricing", 'Latency: no figure published', 'Languages: dozens, count unpublished' and 'Custom voice: design, instant clone, professional clone'. The Cartesia Sonic 3.6 column reads 'Controlled Voice Elo: 1,143, #5 of 42', 'Provider Voices Elo: 1,280, #4 of 96', 'Price: $49.00 per 1M characters, vendor rate card', 'Latency: under 90ms to first audio, vendor-reported', 'Languages: 44 from one model' and 'Custom voice: roughly 10-second clone'. A footer distinguishes vendor-published rates from the arena's derived conversion.

• إيلو الصوت المُتحكَّم فيه (نفس الأصوات الثمانية المستنسخة) — HeyGen Voice: 1,202، الأول من 42. Sonic 3.6: 1,143، الخامس.

• إيلو أصوات المزوّدين (أصوات أصلية) — HeyGen Voice: غير مصنّف، أصوات غير كافية. Sonic 3.6: 1,280، المركز الرابع من 96.

• السعر المنشور — Sonic 3.6: $49.00 لكل مليون حرف، وفق بطاقة أسعار المورّد. HeyGen Voice: $30.00 لكل مليون حرف بناءً على تحويل الساحة نفسه لتسعير اعتمادات HeyGen؛ ولا تنشر HeyGen أي سعر للصوت بنفسها.

• زمن الاستجابة — Sonic 3.6: أقل من 90 مللي ثانية للصوت الأول (مُبلَّغ عنه من المورد، لم يتم إعادة إنتاجه). HeyGen Voice: لم ينشر المورد أي رقم ولم تقم Artificial Analysis بقياسه.

• اللغات — Sonic 3.6: 44 من نموذج واحد. HeyGen Voice: أكثر من 300 صوت عبر "عشرات اللغات"، غير مُعدَّدة كعدد.

• مسار الصوت المخصص — Sonic 3.6: استنساخ خلال ~10 ثوانٍ. HeyGen Voice: تصميم صوت من وصف نصي، أو استنساخ فوري، أو استنساخ احترافي مدرَّب على أكثر من 20 دقيقة.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked model list with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186, Eleven v4 Turbo third at 1,167, Eleven v4 fourth at 1,160 and Sonic 3.6 fifth at 1,143, with samples, release dates and per-1M-character API pricing columns.

فجوة Elo، عند قراءتها بشكل صحيح

تفوق بـ59 نقطة في الساحة المضبوطة ينقلب إلى عجز بـ137 نقطة على لوحة المزوّد، وهذا الانقلاب ليس تناقضًا. تُزيل اللوحة المضبوطة قدرة البائع على اختيار صوت مُتملّق وتسأل كيف يتعامل المحرك مع صوت لم يختره. ويفوز HeyGen Voice بذلك. أما لوحة المزوّد فتسأل عن مدى جودة أفضل أصوات البائع نفسه، وهو أقرب إلى ما يسمعه العميل في عرض تجريبي للبيع — ويُبلي Sonic 3.6 بلاءً حسنًا هناك، في المرتبة الرابعة من ستة وتسعين، وبفارق 38 نقطة عن Eleven v4 Turbo المصنّف في الصدارة.

لا يمثّل أيٌّ من الرقمين الحقيقة العامة. إذا كنت تستنسخ شخصًا بعينه وتحتاج إلى أن يعرض المحرّك ذلك الشخص بشكل مقنع، فإن النتيجة المضبوطة هي المؤشر الأفضل، وHeyGen Voice يتقدّمها حاليًا. وإذا كنت تختار صوتًا من مكتبة لوكيل يجب أن يبدو مميزًا على نطاق واسع، فإن نتيجة المزوّد هي المؤشر الأفضل، ولدى Sonic 3.6 تصنيف لا يملكه HeyGen Voice.

من الجدير بالملاحظة لأي شخص يحتفظ بأرقام قديمة: كلتا هاتين اللوحتين تتغيران مع تراكم الأصوات. في وقت سابق من عام 2026، أُفيد بأن Sonic 3.6 تتصدّر لوحة الصوت المتحكَّم به بلا منازع؛ أما الجدول الحالي فيضعها في المرتبة الخامسة هناك برصيد 1,143، مع وجود HeyGen Voice وQwen-Audio-3.1-TTS-Plus وفئتين من Eleven v4 فوقها. الاستشهاد بجدول الترتيب هو طابع زمني، وليس خاصية دائمة للنموذج.

أين تتعطل مقارنة الأسعار

سعر Sonic 3.6 البالغ 49.00 دولارًا لكل مليون حرف هو سعر المعيار الخاص بالساحة نفسها، مستمد من سعر API المنشور من المورّد عند الإعدادات الافتراضية. وهذا يجعل فاتورة صوتية شهرية من خمسة أرقام قابلة للحساب قبل أن تكتب سطرًا واحدًا من كود التكامل.

رقم HeyGen أقل صلابة، لكنه موجود. يُدرج مخطط أسعار الساحة HeyGen Voice عند 30.00 دولارًا لكل مليون حرف — أي أقل بتسعة عشر دولارًا من Sonic 3.6 — وهذا الرقم هو تحويل Artificial Analysis لتسعير أرصدة HeyGen، وليس سعرًا تنشره HeyGen. تعرض صفحة HeyGen نفسها أرصدة للبيع (Creator بسعر 29 دولارًا شهريًا مقابل 600 رصيد، وPro بسعر 49 دولارًا مقابل 1,000، وBusiness بسعر 149 دولارًا مقابل 1,500) وتذكر بوضوح أن الاستهلاك يختلف حسب النموذج والمدة وتعقيد التوليد، دون أن تترجم تلك الأرصدة إلى أحرف مطلقًا. لذا فإن النموذج الذي يفوز بلوحة الصوت المتحكَّم فيه مُسعَّر بأقل بكثير من النموذج الذي يحتل المرتبة الخامسة، والفارق رقم مشتق سترغب في تأكيده مقابل نصك الخاص بدلًا من بطاقة أسعار يمكنك تدقيقها.

هذا ليس حجة ضد HeyGen Voice. بل هو حجة لاختباره على حركة المرور التي يمكنك تحمّل تكلفة قياسها، لأن الطريقة الوحيدة لمعرفة تكلفته الحقيقية في خط الأنابيب الخاص بك هي تمرير نصك الخاص عبره.

الاختيار بينهما

اختر Sonic 3.6 عندما يتعيّن على الصوت أن يجيب. ادّعاء زمن أول صوت أقل من 90 مللي ثانية، وواجهة API أصلية للبث، و44 لغة من نموذج واحد، والأهم: بطاقة أسعار منشورة، تجعله الخيار الإنتاجي الأقل مخاطرة لوكلاء المحادثة، وأنظمة IVR، وأي شيء يكون فيه التوقف خللًا. ترتيبه الخامس في فئة الصوت المتحكَّم به ترتيب محترم، وليس ضعفًا، واحتلاله المركز الرابع على اللوحة الأوسع هو أقوى إشارة مستقلة يحملها أيٌّ من النموذجين.

اختبر HeyGen Voice أولًا عندما يتعين على الصوت أن يؤدي. السرد، والمحتوى المقروء للعلامات التجارية، وأداء الشخصيات، وأي مشروع تستنسخ فيه متحدثًا واحدًا وتحتاج إلى أن يكون استنساخ ذلك المتحدث أفضل شيء مسموع على الخط — تلك هي المهمة التي صُممت الساحة المضبوطة لقياسها، وهي المهمة التي فازت بها HeyGen Voice للتو. إن مسار الاستنساخ الاحترافي المدرَّب على أكثر من عشرين دقيقة منتج مختلف جوهريًا عن الاستنساخ الفوري في عشر ثوانٍ، وهو المسار الذي يتوافق مع الأصوات المرجعية المستنسخة الثمانية في الساحة.

لا تختر أيًا منهما بناءً على رقم Elo واحد. اللوحتان تختلفان بشأن هذه النماذج، ما يعني أن اللوحتين تخبرانك شيئًا حقيقيًا: الجودة تعتمد على الصوت وعبء العمل، لا على المحرك وحده.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, with samples, release dates, 8-voice arena badges and API pricing columns.

تشغيل كليهما دون الالتزام

الطريق العملي للخروج من خلاف كهذا هو التوقف عن التعامل معه كقرار شراء. ضَع المحرّكين خلف واجهة واحدة، ووزّع حركة المرور، واحكم بناءً على صوتك أنت — فبضع أسطر من التعليق الصوتي وحلقة وكيل حيّة ستخبرك بأكثر مما ستخبرك به خمسون نقطة Elo. يوجّه OrcaRouter كليهما عبر مفتاح API واحد بسعر قائمة المزوّد دون هامش، لذا فبطاقة الأسعار الخاصة بالمورّد نفسه هي ما تدفعه، ويظهر تغيّر سعر Sonic 3.6 في اليوم نفسه بدلًا من موعد التجديد. التبديل التلقائي عند الفشل يهم هنا أكثر مما يهم في معظم عمليات تبديل النماذج، لأن مزوّد الصوت الذي يتعطل في منتصف الجملة يكون مسموعًا للمتصل، وتتيح لك لغة توجيه DSL تثبيت محرّك واحد للأدوار الحساسة لزمن الاستجابة ومحرّك آخر للتعليق الصوتي المُعدّ مسبقًا دون الحفاظ على تكاملين اثنين.

ما الذي سيحسم الأمر؟

أمران. صدور سعر صوتي منشور لكل حرف أو لكل رصيد من HeyGen سيجعل نصف التكلفة في هذه المقارنة ملموسًا بقدر ما هو نصف الجودة، كما أن جمع HeyGen Voice أصواتًا كافية لدخول ساحة Provider Voices سيخبرنا ما إذا كانت ريادته في الأصوات المتحكَّم بها تصمد عند الاحتكاك بالأصوات الأصلية — الاختبار الذي اجتازه Sonic 3.6 بالفعل في المركز الرابع من أصل ستة وتسعين. حتى ذلك الحين، يظل Sonic 3.6 هو الشاغل الحالي للمنصب بسعر ورقم زمن استجابة، ويظل HeyGen Voice هو المتحدي الذي يملك أدلة أفضل على الأصوات المستنسخة ولا سعر يمكن وضعه إلى جانبه.