بطاقة رئيسية مُولَّدة بعنوان "HeyGen Voice vs Qwen-Audio-3.0-TTS" تُظهر فجوة Elo البالغة 79 نقطة في الصوت المُتحكَّم فيه مقابل سعري المليون حرف، مع ملاحظة أن أحد السعرين منشور من المورّد والآخر هو تحويل مشتق من الساحة لتسعير الاعتمادات، وفقًا لـ Artificial Analysis، 9 أكتوبر 2026. ويظهر شعار OrcaRouter في الزاوية اليمنى السفلى.
Engineering & Research

HeyGen Voice مقابل Qwen-Audio-3.0-TTS: ما الذي تدفعه مقابل Elo، وأي فئة من Qwen قمت بقياس أدائها فعليًا

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أجرِ الحساب أولًا، لأنه أقل تفاوتًا مما توحي به لوحة النتائج. يكلّف Qwen-Audio-3.0-TTS-Plus مبلغ 19.30 دولارًا لكل مليون حرف على منصة Model Studio — وهو سعر معلن من المورّد. أما HeyGen Voice فيستقر عند 30.00 دولارًا لكل مليون حرف على مخطط الأسعار الخاص بـ Artificial Analysis نفسه، وهو رقم يستخلصه الموقع من تسعير أرصدة HeyGen، لأن صفحة الأسعار العامة الخاصة بـ HeyGen تبيع أرصدة من دون أن تبيّن ما تستهلكه عملية توليد صوت واحد. وفي الوقت نفسه، تبلغ فجوة الصوت المضبوط بينهما 79 Elo: فقد سجّل HeyGen Voice 1,202 في الساحة التي تُبقي الأصوات المرجعية الثمانية كلها ثابتة، بينما سجّل Qwen-Audio-3.0-TTS-Plus 1,123. لذا فإن النموذج الأرخص يحتل مرتبة متأخرة كثيرًا عن النموذج الأفضل، والنسبة بينهما نحو 1.55×، وواحد فقط من هذين السعرين هو رقم تبنّاه المورّد الذي يبيعه ووضع اسمه عليه.

الفخ في الاسم

قبل أي من ذلك، اضبط الفئة الصحيحة، لأن هذه عائلة ستدعك بكل سرور تختبر النموذج الخطأ. هناك مُدخلان من Alibaba يهمان هنا، وهما ليسا قابلين للتبادل.

Qwen-Audio-3.0-TTS-Plus هو النموذج الذي تقارن به هذه المقالة. يسجّل 1,123 على اللوحة المضبوطة — السابع من أصل اثنين وأربعين — و1,264 على لوحة Provider Voices، حيث يحتل المرتبة السادسة من أصل ستة وتسعين. وهو منتج TTS حقيقي وحالي قائم على البث بسعر معلن قدره 19.30 دولارًا لكل مليون حرف.

Qwen-Audio-3.1-TTS-Plus هو فئته اللاحقة، وهو النموذج الذي يحتل المركز الثاني على اللوحة المضبوطة عند 1,186 — النموذج الذي كان الأقرب إلى التغلب على HeyGen Voice عند أول ظهور له. سعره مُدرج عند 19.30 دولارًا نفسها، مع أن وثائق Alibaba تحذر من أن إصدارات النماذج المختلفة تتطلب أصواتًا مطابقة، لذا فإن "السعر نفسه، فئة أحدث" لا تعني "بديلًا جاهزًا للاستبدال المباشر".

أي شخص يقرأ «#1 متقدّم على Qwen» ثم يقيس أداء Qwen-Audio-3.0-TTS فسيختبر نموذجًا أضعف بـ63 إيلو من النموذج الذي كان العنوان عنه. الخلاف حول الفئة يساوي 63 نقطة، وهو أكثر من الفجوة بين HeyGen Voice والمركز الثالث.

لوحة النتائج

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• تقييم Elo للأصوات المتنافسة (نفس الأصوات الثمانية المستنسخة) — HeyGen Voice: 1,202، المرتبة 1 من 42. Qwen-Audio-3.0-TTS-Plus: 1,123، المرتبة 7.

• أصوات المزود Elo (أصوات أصلية) — Qwen-Audio-3.0-TTS-Plus: 1,264، #6 من 96. HeyGen Voice: غير مصنف.

• السعر لكل مليون حرف — Qwen-Audio-3.0-TTS-Plus: 19.30 دولارًا، منشور من الجهة المورّدة على Alibaba Cloud. HeyGen Voice: 30.00 دولارًا وفق التحويل الذي أجرته الساحة نفسها لتسعير الرصيد؛ ولا تنشر HeyGen أي سعر للصوت.

• تكلفة 100 ساعة من التعليق الصوتي — Qwen-Audio-3.0-TTS-Plus: حوالي 926 دولارًا بمعدل ~480,000 حرف لكل ساعة منطوقة. HeyGen Voice: حوالي 1,440 دولارًا وفق تحويل الساحة البالغ 30.00 دولارًا — مستخلص، وليس مقتبسًا.

• التحكم الصوتي — Qwen-Audio-3.0-TTS-Plus: تعليمات المعامل، ووسوم المشاعر واللغة، واستنساخ الصوت وتصميم الصوت. HeyGen Voice: تصميم من النص إلى الصوت من وصف لا يزيد عن 1,000 حرف، واستنساخ فوري، واستنساخ احترافي مدرَّب على أكثر من 20 دقيقة.

• الإخراج — Qwen-Audio-3.0-TTS-Plus: PCM وWAV وMP3 وOpus بتردد يصل إلى 48kHz، مع إمكانية ضبط المعدل وطبقة الصوت ومستوى الصوت ومعدل البت. HeyGen Voice: السرعة 0.5–1.5 وطبقة الصوت ±50 نصف نغمة لكل طلب.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

ما الذي تقدّمه لك هندسة Alibaba فعليًا

عائلة Qwen-Audio-3.0-TTS هي منتج بثّي والوثائق مكتوبة على هذا الأساس. تمرّ الطلبات عبر بروتوكول WebSocket مشترك مع CosyVoice، مع run-task، continue-task وfinish-task وتدفّق الأحداث وtask-started، result-generated، task-finished وtask-failed والاستجابات إلى جانبها. يتوفّر الإلغاء في كل نموذج Qwen-Audio-TTS في منطقتي بكين وسنغافورة عبر streaming_cancel(). يبلغ الخرج 48kHz، وتشمل الصيغ Opus، وهو أمر مهم إذا كنت تنقل الصوت إلى متصفح أو مكالمة هاتفية بدلاً من ملف WAV.

هناك تفصيلان في تلك الوثائق يسهل تفويتهما ويكون اكتشافهما متأخرًا مكلفًا. تنطبق وسوم Emotion و rich language فقط على فئتي Plus و Flash — وليس على العائلة بأكملها — وهي تعمل فقط في وضع البث أحادي الاتجاه. وتختلف مفاتيح API بين منطقتي سنغافورة وبكين، حيث تتم عنونة مساحات العمل عبر عناوين URL بالشكل wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. المفاتيح الإقليمية هي تفصيل من تفاصيل التزويد حتى اليوم الذي تصبح فيه انقطاعًا.

جانب HeyGen هو شكل مختلف من المنتج: واجهة برمجة تطبيقات v3 بنمط REST حيث POST /v3/voices/speech تُولّد الكلام، GET /v3/voices تسرد الكتالوج خلف engine مرشّح، ويعيد تصميم الصوت ما يصل إلى ثلاثة خيارات مرتّبة من موجز نصي مع بذرة لضمان قابلية التكرار. تكشف الوثائق أيضًا أن engine مرشّح يقبل قيمًا تتجاوز قيم HeyGen الخاصة — لذا سيقوم HeyGen بكل سرور بتوجيهك إلى محرك صوتي تابع لجهة خارجية عبر واجهته البرمجية. إن المورّد الذي يطرح نموذج منافس كخيار قابل للاختيار يخبرك بشيء عن موضع قوته التي يراها.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

إلى أين يذهب الـ 79 {{1}}Elo{{/1}} {{2}}goes{{/2}}

إن فجوة مقدارها 79 نقطة على لوحة مُحكمة لهي فجوة كبيرة — أكبر من هامش الـ16 نقطة الذي يفصل HeyGen Voice عن المركز الثاني، وتقارب المسافة بين المركزين الثالث والثامن في ذلك المجال. كما أنها مقيسة على محور واحد فقط.

تستنسخ الساحة المُتحكَّم بها ثمانية أصوات وتُبقيها ثابتة. لا تقول شيئًا عن سطح التحكم القائم على التعليمات الذي يعرضه Qwen، ولا شيئًا عن إخراج Opus بتردد 48kHz عبر WebSocket قابل للإلغاء، ولا شيئًا عن النشر الإقليمي. هذه خصائص هندسية، وهي السبب في أن فريقًا يبني مركز اتصال باللغة الصينية الماندرين لن ينتقل إلى نموذج يحقق نتيجة أعلى بـ79 نقطة على ثمانية أصوات مرجعية باللغة الإنجليزية.

ما تقوله النتيجة المنضبطة هو أضيق نطاقًا ومع ذلك ما يزال مفيدًا: عندما يُزوَّد المحرّكان بالصوت المستنسخ نفسه، فضّل المستمعون مخرجات HeyGen Voice. إذا كان منتجك يستنسخ الأصوات، فهذا هو محورك. أما إذا كان منتجك يختار صوتًا من كتالوج ويبثّه في مكالمة، فإن لوحة المزوّدين أقرب إلى واقعك — وهناك لا يحتل HeyGen Voice أي مرتبة على الإطلاق بينما يحلّ Qwen-Audio-3.0-TTS-Plus في المرتبة السادسة من أصل ستة وتسعين.

حجة السعر، إذا أُخذت على محمل الجد

بسعر 19.30 دولارًا لكل مليون حرف، يُعد Qwen-Audio-3.0-TTS-Plus نحو نصف تكلفة فئة ElevenLabs البالغة 40 دولارًا وحوالي 40% من سعر Cartesia Sonic 3.6 البالغ 49 دولارًا. بالنسبة لعبء عمل يبلغ 100 ساعة من السرد — حوالي 48 مليون حرف بمعدل كلام نموذجي — فإن ذلك في حدود 926 دولارًا. الحجم نفسه على Eleven v4 Turbo سيكون حوالي 1,920 دولارًا، وعلى Sonic 3.6 حوالي 2,352 دولارًا. أما HeyGen Voice، بسعر الساحة البالغ 30.00 دولارًا، فيقع قرب 1,440 دولارًا: بين الفئة الرخيصة واللاعبين الحاليين، أقرب إلى الوسط منه إلى القمة.

يحمل هذا الحساب تحفظًا لا تحتاجه الحسابات الأخرى. إن 19.30 دولارًا هو السعر الذي نشرته Alibaba نفسها. أما 30.00 دولارًا فهو تحويل أجرته Artificial Analysis لنظام أرصدة لم تترجمه HeyGen قط إلى أحرف، لذا فهو تقدير بحسن نية وليس عرض سعر. إذا كانت نسبة الأحرف لكل رصيد الفعلية أسوأ مما يفترضه المخطط، فإن ميزة 79-Elo تكلف أكثر مما يوحيه معامل 1.55×؛ وإذا كانت أفضل، فتكلف أقل. النموذج الذي يتعين عليك استنتاج سعره هو نموذج تجرّبه على شريحة مُقاسة من حركة الاستخدام بدلًا من أن توحّد معاييرك عليه. هذا ليس انتقادًا للمحرك — بل وصف للمعلومات المتاحة في 10 أكتوبر 2026.

البت

اختر Qwen-Audio-3.0-TTS-Plus عندما تكون التكلفة والبنية التحتية للبث هي ما يوجه القرار. أقل من 20 دولارًا لكل مليون حرف، وWebSocket قابل للإلغاء مع إخراج Opus بتردد 48 كيلوهرتز، ومعامل تعليمات ووسوم مشاعر، ومرتبة سادسة في لوحة المزودين، تجعله الصوت الأكثر اقتصادية وجيد التقييم في هذه المقارنة. اختر فئة 3.1 بدلاً من ذلك إذا كنت تريد النموذج الذي جاء فعليًا في المرتبة الثانية على اللوحة المضبوطة، وتحقق من قائمة الأصوات قبل افتراض أن التبديل مجاني.

اختبر HeyGen Voice عندما تكون دقة الاستنساخ هي المنتج. متحدث واحد، أسطر كثيرة، صوت يجب أن يكون *ذلك* الصوت في كل مرة — هذا هو المحور الذي تقيسه اللوحة المضبوطة، والمحور الذي يتصدر به المجال بأكمله. ضع ميزانية لفترة قياس، لأن نموذج الاعتمادات يعني أنك ستتعلم تكلفتك الحقيقية بتشغيل نصك الخاص بدلًا من قراءة بطاقة أسعار.

وتجاهل المقارنة كليًا إذا كان عبء العمل باللغة الصينية وفي الوقت الفعلي. لم يُقَس أيّ من رقمَي Elo على أصواتكم، ولا بلغتكم، ولا ضمن ميزانية الكمون الخاصة بكم.

الحفاظ على إمكانية الوصول إلى كليهما

هذه إحدى الثنائيات التي تستحق فيها طبقة التوجيه وجودها بدلًا من أن تكون إضافة ملحقة. مفتاح API واحد يغطي كلا المزوّدين — يُمرَّر سعر القائمة من المزوّد دون أي هامش ربح، لذا فإن سعر Alibaba المعلن البالغ $19.30 هو ما تدفعه، وأي تغيير في سعر Qwen يصبح ساريًا في اليوم نفسه — يزيل الحاجة إلى اختيار فائز قبل أن تتوفر لديك أدلة. يغطي التحويل التلقائي عند الفشل المخاطر الواضحة في مسار الصوت، حيث يكون توقف البث مسموعًا للمستمع، كما تتيح لك لغة التوجيه DSL إرسال السرد الضخم إلى المحرك الرخيص والأسطر الحاسمة للاستنساخ إلى المحرك الذي يتقدّم بـ79 نقطة، دون مكتبتَي عميل وعلاقتَي فوترة. قيمة OrcaRouter هنا ليست في أنه يستضيف نموذجًا صوتيًا؛ بل في أنه يجعل تكلفة معرفة أيّهما تريد شبه معدومة.

الأسئلة المفتوحة

ثلاثة أمور كفيلة بحسم هذا. وجود معدل/سعر للصوت على صفحة أسعار HeyGen نفسها سيحوّل الـ30.00 دولارًا التي يستنتجها arena إلى رقم يمكنك تدقيقه. ووجود مدخل لـHeyGen في لوحة Provider Voices سيخبرنا ما إذا كان تفوق الصوت المستنسخ يصمد أمام الأصوات الأصلية — وهو الاختبار الذي يجتازه Qwen-Audio-3.0-TTS-Plus في المركز السادس من ستة وتسعين. كما أن نتيجة صوت مضبوط لـQwen-Audio-3.1-TTS-Plus مقابل HeyGen Voice بعد مزيد من الأصوات ستخبرنا ما إذا كان 16 Elo ترتيبًا مستقرًا. وحتى ذلك الحين: Qwen هو الخيار المُسعّر، القابل للبث، الجيد الترتيب؛ وHeyGen Voice هو الخيار الأعلى تقييمًا، غير القابل للتسعير؛ والفئة التي تقيس عليها تهم أكثر من العنوان الذي تقرؤه.