
Eleven v4 مقابل Qwen Audio 3.1: الصوت الأرخص على لوحة الصدارة فاز بها
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 982 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 197 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
في اللوحة التي يُمنح فيها كل مشارك الأصوات الثمانية المستنسخة نفسها، Alibaba Qwen-Audio-3.1-TTS-Plus حلّ في المركز الأول عند إيلو 1,178 و ElevenLabs Eleven v4 حلّ في المركز الثاني عند 1,157. ويكلّف النموذج الذي فاز 19.30 دولارًا لكل مليون حرف على تلك اللوحة. أما النموذج الذي جاء ثانيًا فيكلّف 80.00 دولارًا. وهذه فجوة جودة مقدارها 21 نقطة وفجوة سعرية بأربعة أضعاف تشيران في اتجاهين متعاكسين، وهي النتيجة الأكثر إثارة للاهتمام في أسبوع الإطلاق بأكمله — بل أكثر إثارة من المركز الأول الذي حققته ElevenLabs في الساحة الأخرى، لأن الترتيب في تلك الساحة تقليدي والفائز هو أغلى صوت ضمن العشرة الأوائل.
اللوحتان غير قابلتين للتبادل، وسبب ظهور هذه المواجهة بهذه الصورة يعود بالكامل إلى أيّ اللوحتين تنظر إليها. في Provider Voice، يقيّم المستمعون الأصوات الخاصة بكل مزوّد. أما Controlled Voice فيستنسخ الأصوات الثمانية نفسها — أربعة أمريكية وأربعة بريطانية — لكل نموذج، بحيث لا يفوز أحد اعتمادًا على تشكيلته الصوتية الافتراضية. تفوز ElevenLabs باللوحة الأولى بفارق 61 نقطة. وتفوز Alibaba باللوحة الثانية بفارق 21 نقطة. لا تخطئ أيّ من اللوحتين، واللوحة الثانية هي التي تتنبأ بمنتج يطرح صوت علامة تجارية مستنسخًا.

لوحة النتائج ذات الصوت المتحكَّم فيه، بالكامل
• تفضيل أعمى، نسخ مطابقة — Qwen-Audio-3.1-TTS-Plus المرتبة 1، إيلو 1,178، 19.30 دولارًا لكل مليون حرف مقابل Eleven v4 المرتبة 2، إيلو 1,157، 80.00 دولارًا.
• التفضيل الأعمى، أصوات كل مورّد الخاصة به — Eleven v4 في المرتبة 1، بتصنيف Elo 1,319 مقابل Qwen-Audio-3.0-TTS-Plus في المرتبة 4، بتصنيف Elo 1,258. فجوة قدرها 61 نقطة في الاتجاه المعاكس.
• السعر، التسوية حسب الساحة — Qwen بسعر 19.30 دولارًا مقابل Eleven v4 بسعر 80.00 دولارًا. Qwen أرخص بنسبة 76%.
• السعر، بطاقة أسعار المورّد — Eleven v4 $0.022 لكل ألف حرف كسعر ترويجي و$0.08 بعد 12 أكتوبر. بطاقة أسعار Qwen Audio 3.1 الخاصة ليست شيئًا تمكنا من قراءته، لذا فإن تطبيع الساحة هو السعر الوحيد الذي يمكننا المقارنة به.
• الإصدار الموجود على كل لوحة — 3.1 على Controlled Voice، و3.0 على Provider Voice. إنهما طرازان مختلفان ولا يمكن تبادل اللوحتين.
• إدخال 3.0 على Controlled Voice — المرتبة 5، Elo 1,124، بالسعر نفسه 19.30 $. إصدار 3.1 يتفوق بـ54 Elo على سابقه بسعر مطابق.
• إصدارات Qwen السابقة على Provider Voice — Qwen3 TTS Flash في المرتبة 79، بتقييم Elo 944؛ Qwen3 TTS في المرتبة 82، بتقييم Elo 930.
• الطراز الرائد السابق الخاص بـ ElevenLabs على Controlled Voice — Eleven v3 في المرتبة 7، بتصنيف Elo 1,073.
• فحص سلامة الأعمدة المجمّعة — الانتشار الثماني الاتجاهات من المرتبة 1 إلى المرتبة 10 على Controlled Voice هو 121 Elo. تفوّق Qwen بـ 21 نقطة على Eleven v4 يقل عن خُمس نطاق المجال بأكمله، وهو المقياس الصحيح لإبقائه عليه.

الصفّان الموجودان هناك يقومان بمعظم العمل. الأول هو المقارنة بين 3.0 و3.1: فقد تحركت Alibaba بمقدار 54 نقطة Elo خلال ترقية إصدار واحدة من دون تغيير السعر إطلاقًا. وهذه وتيرة أسرع من نقلة ElevenLabs البالغة 84 نقطة من v3 إلى v4، وهي تعني أن ترتيب المراتب المحدد في هذه المقالة هو لقطة لحظية يعمل كلا المزوّدين بنشاط على تغييرها.
الثاني هو الفارق الإجمالي البالغ 121 نقطة. فرق قدره 21 نقطة في لوحة يبلغ نطاقها المفيد نحو 120 نقطة هو فرق حقيقي وإن كان متواضعًا — يقارب في الحجم الفارق بين إصدار Qwen 3.1 وإصداره 3.0. وإذا كانت حالة استخدامك تقع في لغة لم يُضبط أيّ من النموذجين عليها، فإن هذا الهامش يقع بسهولة ضمن النطاق الذي يمكن أن تقلبه بضعة سكربتات اختبارية صعبة.
مشكلة الإصدار التي لا يلفت إليها أحد
النتيجة المتداولة بعنوان «Eleven v4 في المرتبة الثانية على Controlled Voice» دقيقة وغير كاملة، والإغفال مهم لأي شخص يخطط بناءً عليها. النموذج الذي يعلو Eleven v4 على تلك اللوحة هو إصدار 3.1 من Alibaba. أما مدخل Qwen على لوحة Provider Voice فهو إصدار 3.0 — ولا يظهر نموذج 3.1 في الصفوف العليا من تلك اللوحة كما نقرؤها. لذا فإن العنوانين الرئيسيين — «Eleven v4 في المرتبة الأولى» و«Eleven v4 في المرتبة الثانية» — هما عبارتان عن نموذجَي Qwen مختلفين في مهمتين مختلفتين، وإصدار Qwen الذي تفوّق على Eleven v4 في إحدى اللوحتين ليس هو إصدار Qwen الذي تفوّق عليه Eleven v4 في اللوحة الأخرى.
هذا ليس فخًّا يستهدف أيًّا من المورّدين؛ بل هو سبب لعدم الثقة في أي ملخّص من جملة واحدة لأسبوع كهذا. إذا كنت تختار بين هذين النظامين، فالمقارنة التي تريدها هي 3.1 مقابل v4 باستخدام صوتك المستنسخ، وبلغتك أنت، ولم ينشر أي من المورّدين ذلك.
ما يمكننا وما لا يمكننا قوله عن Qwen Audio 3.1
الصدق بشأن الأدلة أثمن هنا من جدول مواصفات كامل، لذا إليك حدود ما يستند إليه هذا المقال. من لوحات الساحة المتاحة لدينا، بخصوص Qwen-Audio-3.1-TTS-Plus: تصنيف إيلو للصوت المضبوط يبلغ 1,178، وتطبيع سعري قدره 19.30 دولارًا لكل مليون حرف، وحقيقة أنه الإصدار الحالي في سلسلة سجّل إصدارها السابق نتيجة أقل بـ54 نقطة عند السعر نفسه.
ليس لدينا، ولن نخمّن: تغطيته اللغوية، أو زمن استجابته، أو حدّ الإدخال لكل طلب، أو ما إذا كان يدعم توجيهات التسليم المضمّنة، أو ما إذا كان يقدّم استنساخًا صوتيًا يتجاوز أصوات الساحة الثمانية، أو ما يتقاضاه وفق بطاقة أسعاره الخاصة. كل هذه أمور موثّقة لـ Eleven v4 — أكثر من 90 لغة، وحدّ أقصى 10,000 حرف، ووسوم صوتية، واستنساخات فورية في عشر ثوانٍ، ودعم الصوتيات IPA — وغيابها في جانب Qwen فجوة في ما هو متاح للقراءة العلنية، وليس مأخذًا على النموذج. قرار شراء يُتخذ بناءً على هذا المقال وحده سيكون قرارًا مبنيًا على رقمين.

ثمة تباين واحد ينجو من ذلك القيد، لأن كلا الجانبين إما مُعلَن من المورّد أو مُعلَن من اللوحة. وفي السعر، يكون تطبيع اللوحة هو القاسم المشترك، وهو يفضّل Qwen بنسبة 76%. وفي الجودة ضمن متحدثين متطابقين، تفضّل اللوحة نفسها Qwen بمقدار 21 Elo. هذان الصفان قابلان للمقارنة. أما كل ما عدا ذلك هنا فليس كذلك، ولن تتظاهر المقالة بغير ذلك.
لماذا ينبغي أن يكون للمجلس الخاضع للسيطرة وزن أكبر من المعتاد
معظم مقارنات الأصوات تعتمد افتراضيًا على أي لوحة صدارة تضع النموذج الذي تحبّه أصلًا في المرتبة الأولى. في هذه المواجهة، هناك سبب من حيث المبدأ لتفضيل Controlled Voice، وهو سبب محدّد لا عام.
تتنافس Alibaba وElevenLabs بمزايا مختلفة تمامًا. {{1}}ميزة ElevenLabs هي مكتبة أصوات بُنيت على مدار سنوات من الانتقاء{{/1}}؛ {{2}}وميزة Alibaba هي منظمة بحثية بإيقاع إصدار نماذج يصعب مجاراته{{/2}}. اللوحة التي تتيح لكل متنافس أن يجلب أصواته الخاصة تقيس المكتبة بقدر ما تقيس محرّك التوليف، وعلى تلك اللوحة تفوز ElevenLabs بفارق 61 نقطة. استبعد المكتبات — نفس الأصوات الثمانية المستنسخة للجميع — فتنتقل الميزة من طرف إلى آخر. إذا كان الصوت الذي يسمعه مستخدموك مستنسخًا من شخص معيّن، فأنت لا تشتري مكتبة ElevenLabs، لذا فاللوحة المضبوطة هي التي تصف اختيارك. وإذا كنت تختار من قائمة أصوات جاهزة، فالعكس هو الصحيح، وتقدّم Eleven v4 بفارق 61 نقطة هو الرقم الذي يستحق التعويل عليه.
هناك سبب ثانٍ، أقل ارتياحًا، لترجيح النتيجة المضبوطة. لوحة أصوات المورّد تكافئ تشكيلة افتراضية مميزة، والتشكيلة المميزة قد تكون استقطابية بطرق يخفيها متوسط Elo — فما يعتبره أحد المستمعين ذا شخصية يعتبره آخر متكلفًا. أما لوحة الأصوات المستنسخة مع متحدثين متطابقين فتزيل هذا المتغير تمامًا، مما يجعلها القياس الأكثر قابلية للتكرار بين الاثنين.
تشغيل أيٍّ منهما، وما نوجّهه فعليًا
لا تستضيف OrcaRouter نماذج الكلام الخاصة بـ ElevenLabs ولا نماذج الكلام الخاصة بـ Alibaba. لا يوجد أي من المورّدين في كتالوجنا، لذا لا توجد طريقة لاستدعاء أي منهما من خلالنا، ولن توحي هذه المقالة بخلاف ذلك — بل تتجه إلى واجهة برمجة التطبيقات (API) الخاصة بالمورّد وإلى العديد من منصات الطرف الثالث لكليهما.
ما نغطيه فعلًا هو الطبقة الأعلى. إذا كانت منظومة الكلام لديك عقدة واحدة في خط معالجة أكبر، فإننا نوفّر أكثر من 200 نموذج خلف مفتاح API واحد، مع تمرير أسعار المزوّدين المدرجة بهامش ربح 0%، لذا فإن أي إعادة تسعير لدى أي طرف أعلى في السلسلة — بما في ذلك النافذة الترويجية لـ ElevenLabs والسعر المدرج الأكبر بكثير الذي يليها في 12 أكتوبر — تنعكس على جانبنا في اليوم الذي تحدث فيه بدلًا من دورة الفوترة التالية. وبالنسبة لقرار يتوقف على نسبة سعرية تبلغ 4x، فإن هذا التوقيت هو الفرق بين مقارنة تبقى صالحة مع مرور الوقت ومقارنة تبدو خاطئة بعد ثلاثة أسابيع.
وحين يتعذّر أن يهبط مسار الصوت، ينقل تجاوز الفشل التلقائي حركة المرور إلى نظام upstream سليم بدلًا من إفشال الطلب. في مواجهة بهذا التقارب في الجودة وبهذا الاختلال الهائل في السعر، فإن المعمارية الحكيمة هي وضع كلا النموذجين خلف نقطة نهاية واحدة مع تولّي التوجيه قرار التقسيم — لا اختيار دائم مبني على لقطة من لوحة الصدارة سيُبطلها كلا المورّدين خلال ربع سنة.
الحكم، وتاريخ انتهاء صلاحيته
اختر Qwen-Audio-3.1-TTS-Plus إذا كنت تستنسخ صوتًا وتراقب التكلفة. فهو الأول على لوحة الصدارة التي تُبقي المتحدثين ثابتين، وسعره نحو ربع السعر، وخطه يتقدم بوتيرة أسرع — 54 إيلو في خطوة إصدار واحدة وبمعدل غير متغيّر يوحي بأن الإصدار التالي رهان أفضل مما يبدو عليه الإصدار الحالي على الورق.
اختر Eleven v4 إذا كان مستخدموك يسمعون أصواتًا جاهزة، أو إذا كنت بحاجة إلى تغطية بلغات يمكنك التحقق منها قبل الإطلاق، أو إذا كانت مجموعة الميزات الموثّقة — وسوم الصوت، والتحكم في الفونيمات، وطلبات من 10,000 حرف، واستنساخ في عشر ثوانٍ — تؤدي في منتجك عملاً لا تقيسه لوحات الساحة. تقدمه بمقدار 61 نقطة على لوحة أصوات المورّدين ليس بالأمر الهيّن، والميزتان اللتان يمكنك كتابتهما في سكربت هما قدرات، وليستا درجات.
حدِّد تاريخ مراجعة. تحرّكت علي بابا 54 نقطة إيلو في ترقية إصدار خلال هذه الدورة، وتحرّكت ElevenLabs 84 نقطة عبر جيل كامل، كما ينتهي السعر الترويجي لـ Eleven v4 في 12 أكتوبر. ومهما كانت نتيجة هذه المقارنة اليوم، فإن العاملين الأرجح لقلبها — إصدار 3.2 وعودة السعر إلى ما كان عليه — سيقعان كلاهما قبل نهاية الربع.
