بطاقة hero مُولّدة لـ ElevenLabs Eleven v4 مقابل VoxCPM2 مع لوحتين: ElevenLabs Eleven v4 كنقطة نهاية مستضافة عند Elo 1,319، والمرتبة 1، و80.00 دولار لكل مليون حرف؛ وVoxCPM2 كنقطة حفظ (checkpoint) بترخيص Apache-2.0 بمعاملات 2B، ومخرجات 48 kHz، وبلا صف في الساحة. التذييل: «مرتبة Eleven v4 وسعره وفق Artificial Analysis، سبتمبر 2026؛ ومواصفات VoxCPM2 وفق بطاقة نموذج OpenBMB.» ويقع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

Eleven v4 مقابل VoxCPM2: نموذج مُصنَّف مقابل نقطة تحقق لا يمكنك استئجارها

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الحقيقة الأكثر فائدة في هذه المواجهة هي صف غير موجود. ElevenLabs Eleven v4 يحتل المرتبة 1 في Provider Voice Arena التابع لـ Artificial Analysis بتصنيف Elo يبلغ 1,319 عبر 1,674 ظهورًا، بسعر 80.00 دولارًا لكل مليون حرف. VoxCPM2، نقطة تفتيش OpenBMB التي صدرت في أبريل 2026، لا تظهر في أي مكان على أي من لوحتي الكلام — ليست مصنفة، ولا غير مصنفة، ولا كمدخل معاينة. هذا ليس حكمًا على الجودة. هذا يعني أن أيًا كان الرقم الذي كنت تأمل في مقارنته بـ 1,319، فلم ينتجه أحد، ويجب أن تُجرى المقارنة على أساس شيء آخر غير التفضيل. ما يتبقى هو الملكية، والضبط الدقيق، ومسألة ترخيص لا تتيح لك نقطة نهاية مستضافة طرحها.

ما الذي يسلّمه لك كل طرف فعليًا

هذه فئات مختلفة من المنتجات، والاختلاف ليس شكليًا.

• الوصول — Eleven v4 هو نقطة نهاية مستضافة يُوصَل إليها عبر واجهة برمجة تطبيقات ElevenLabs الخاصة، وتُحتسب تكلفتها لكل حرف. أما VoxCPM2 فهو نقطة تحقق (checkpoint) على Hugging Face تحت openbmb/VoxCPM2؛ فأنت تنزّله وتشغّله، ولا توجد نقطة نهاية تابعة للجهة الأولى لاستدعائها.

• الترخيص — يُوزَّع VoxCPM2 بموجب Apache 2.0، وهو مجاني صراحةً للاستخدام التجاري. أما Eleven v4 فهو واجهة برمجة تطبيقات تجارية تخضع لشروط ElevenLabs. ويُهم هذا الفارق إذا طلب مراجعتك القانونية معرفة ما إذا كان يجوز لك الضبط الدقيق أو إعادة التوزيع أو شحن الأوزان؛ فمع نقطة التحقق تكون الإجابة مكتوبة وثابتة.

• الحجم والعتاد — يبلغ VoxCPM2 ملياري معامل على بنية MiniCPM-4 الأساسية، وتشير البطاقة إلى نحو 8 غيغابايت من VRAM بدقة bfloat16، مع حد أقصى لطول التسلسل يبلغ 8,192 رمزًا. لا تنشر ElevenLabs أي عدد للمعاملات الخاص بـ Eleven v4، كما أن البصمة العتادية لنموذج مستضاف ليست شيئًا تديره أنت.

• سلسلة الإخراج — يقبل VoxCPM2 صوتًا مرجعيًا بتردد 16 كيلوهرتز ويُخرج 48 كيلوهرتز عبر تقنية الدقة الفائقة المدمجة في AudioVAE V2، دون أي مُضاعِف معدل عينات خارجي في المسار. أما خدمة TTS المستضافة فتمنحك بثًا بأي معدل اختاره المورّد.

• التقييم المستقل — لدى Eleven v4 تقييم، وهو المركز الأول. لا يملك VoxCPM2 أي تقييم. الغياب ليس تقييمًا منخفضًا؛ فهو نموذج غير مُقيَّم، وينبغي ألا يُذكر الاثنان في الجملة نفسها كما لو كان الثاني رقمًا.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

الرقم الذي يحل محل Elo المفقود

إذا لم يكن بوسعك مقارنة التفضيل، فقارن ما يمكنك حسابه، وبالنسبة إلى نموذج مستضاف ذاتيًا فإن هذا هو معدل الإنتاجية. تذكر بطاقة VoxCPM2 عامل زمن حقيقي يبلغ نحو 0.30 في PyTorch القياسي على RTX 4090، وينخفض إلى نحو 0.13 تحت Nano-VLLM. عامل الزمن الحقيقي هو ثوانٍ من الحوسبة لكل ثانية من الصوت، لذا يعني هذان الرقمان أن ساعة GPU واحدة تنتج نحو 3.3 ساعات من الكلام النهائي في الحالة الأولى، ونحو 7.7 ساعات في الحالة الثانية.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

ثمّة نتيجتان تتبعان فورًا. مكدّس التقديم يهم أكثر من النموذج: نقطة التحقق نفسها على البطاقة نفسها تضاعف مخرجاتها أكثر من الضعف عند تبديل محرك الاستدلال، لذا فأي نموذج تكلفة يستخدم رقم 0.30 يبالغ في تقدير تكلفتك المستضافة ذاتيًا بمعامل يقارب 2.3. والاستغلال هو كل اللعبة: البطاقة التي تظل خاملة لا تتغلب على واجهة برمجة تطبيقات تُحاسب لكل حرف بأي سعر، لأن فاتورة الـAPI تتناسب مع ما تقوله بينما فاتورة البطاقة تتناسب مع متى اشتريتها.

وهذا هو سبب أن النسخة الصادقة من هذا القرار ليست «أيها يبدو أفضل». بل «كم ساعة صوتية تنتج شهريًا، وهل العتاد مشغول». دون الحجم الذي تبقى فيه البطاقة محمّلة، تفوز واجهة API بفارق كبير. وفوقه، على عتاد تملكه بالفعل، تكون التكلفة الحدية لنقطة التحقق في الساعة الألف هي نفسها تكلفتها في الساعة الأولى — وهذه ميزة بنيوية لا يمكن لأي قائمة أسعار أن تضاهيها.

القدرة التي لن تبيعها لك نقطة نهاية مستضافة

هنا يتوقف التشابه عن كونه صورة طبق الأصل، لأن هناك شيئًا واحدًا يفعله VoxCPM2 لا يستطيع Eleven v4 فعله إطلاقًا: يمكنك إعادة تدريبه. توثّق بطاقة النموذج كلاً من الضبط الدقيق الكامل SFT وLoRA على ما لا يقل عن خمس إلى عشر دقائق من الصوت، مع نص برمجي للإعداد والتكوين مرفق لكل منهما.

هذا يغيّر شكل برنامج صوتي. تمنحك واجهة برمجة تطبيقات مستضافة نموذجًا ثابتًا إضافة إلى أي استنساخ يوفره المورّد — عشر ثوانٍ من الصوت المرجعي في حالة Eleven v4 من أجل النسخ الفورية، مع فئة احترافية فوقها. وتمنحك نقطة تفتيش قابلة للضبط بـ LoRA نموذجًا لم يطّلع قط على بيانات أي طرف آخر ويمكنك تثبيت سلوكه حسب الإصدار. وبالنسبة إلى صوت علامة تجارية، أو مجال خاضع للتنظيم، أو لغة يتعامل معها طاقم الأصوات لدى المورّد بشكل ضعيف، فإن ذلك يمثل فئة مختلفة من الحلول، لا حلًّا أرخص.

المقايضة واضحة وتستحق الذكر: مع VoxCPM2، أنت تقبل أنه لم يقم أي طرف ثالث بتقييم النموذج قط، وأن ضمانات الجودة هي ضمانات تبنيها وتقيسها بنفسك، وأن حد التسلسل البالغ 8,192 رمزًا وتحذير البطاقة نفسه — بأن تصميم الصوت والتحكم في النمط يختلفان بين التشغيلات وأنه يُوصى بتوليد واحد إلى ثلاثة — أصبحا الآن مشكلتك في ضمان الجودة.

ما الذي يمنحك إياه Eleven v4 ولا تستطيع نقطة التحقق تقديمه

وعلى الجانب الآخر، فإن مزايا النموذج المستضاف هي تلك التي تظهر على تقويم الإصدارات بدلاً من ورقة المواصفات.

• تصنيف مبنيّ على القياس — الأول في لوحة تصنيف تستند تقديراتها إلى 1,674 عيّنة، وبهامش يبلغ نحو ±19 نقطة حوله. وأيًّا كان ما تقيسه تلك اللوحة، فهي مستقلة عن كلا المورّدين، وهي إشارة الجودة الوحيدة الصادرة عن طرف ثالث في هذه المقارنة.

• التوجيه الأدائي في النص — وسوم صوتية مضمّنة مثل [يضحك]، [يهمس] و[قال بغضب بلكنة فرنسية]، إضافة إلى مطالبات الإلقاء باللغة الطبيعية ودعم محسّن للأبجدية الصوتية الدولية. إن الحصول على تغيير في المزاج من نموذج مستضاف ذاتيًا يعني إعادة توليد أو ضبطًا دقيقًا؛ وهنا يكون الأمر رمزًا في النص.

• تغطية لا يتعين عليك التحقق منها — أكثر من 90 لغة مقابل 30 لدى VoxCPM2، مع التحفظ بأن قائمة نقطة التحقق صريحة ومُسمّاة (بما في ذلك اللهجات الصينية)، في حين أن «أكثر من 90» لدى المورّد مجرد عدد دون قائمة.

• لا يوجد سطح تشغيلي — لا GPU، ولا حزمة تقديم، ولا انحراف في الإصدارات، مع سعر ترويجي قدره 0.022 دولار لكل 1000 حرف حتى 12 أكتوبر مقابل سعر قائمة يبلغ 0.08 دولار بعد ذلك.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

لا يخصّنا أيٌّ من هذين، وهذا هو بيت القصيد في هذا القسم

لا يستضيف OrcaRouter أيًّا من النموذجين. لا توجد نقطة نهاية لـ ElevenLabs ولا نقطة نهاية لـ VoxCPM2 في كتالوجنا، والجواب الصادق بشأن التوجيه هو أن Eleven v4 يتم الوصول إليه عبر واجهة برمجة التطبيقات الخاصة بـ ElevenLabs نفسها، بينما VoxCPM2 شيء تنشره على عتادك الخاص. لن نلمّح إلى خلاف ذلك لجعل المقارنة أكثر ترتيبًا.

حيث يساعد مفتاح واحد فعلًا هو القرار الذي يسبق القرار. سبب تعثّر محادثات الاستضافة الذاتية هو أن البديل لا يُقيَّم أبدًا: الواجهة البرمجية نداء واحد، ونقطة التحقق حزمة تقديم كاملة، لذا تفوز الواجهة البرمجية تلقائيًا بدلًا من أن تفوز بالحساب. إسهام OrcaRouter هو أن الجانب المستضاف من تلك المقارنة رخيص الاختبار — أكثر من 200 نموذج خلف مفتاح API واحد مع أسعار قوائم المزوّدين تمرَّر عند هامش ربح 0%، لذا يُقيَّم الخيار المستضاف بسعره الحقيقي لا بسعر مُقدَّر، مع تحويل تلقائي عند الفشل إذا وضعت مرشحًا خلف مسار مباشر قبل أن تنتهي من القرار.

كيف تقرر في مرور واحد

اختر Eleven v4 إذا كان لا بد أن يكون الصوت جيدًا من أول تسجيل وتريد إنجاز الأمر هذا الأسبوع. تحصل على المرتبة الأولى في لوحة تقييم مستقلة، وصيغة توجيه موثّقة، وأوسع عدد لغات موثّق في هذه المقارنة، ومن دون أي بنية تحتية. تدفع 0.08 دولار لكل 1000 حرف اعتبارًا من 13 أكتوبر فصاعدًا، وتقبل أنك لا تستطيع إعادة تدريبه، أو تثبيت إصداره، أو الاحتفاظ بالصوت على عتادك الخاص.

اختر VoxCPM2 إذا كان لا بد أن يكون النموذج ملكك. رخصة Apache 2.0، و2B معامل على نحو 8 غيغابايت من VRAM، وإخراج بتردد 48 كيلوهرتز دون مُضاعِف معدل العينات في السلسلة، ومسار ضبط دقيق يعمل على خمس إلى عشر دقائق من الصوت — هذه قدرات لا تقدمها نقطة نهاية مستضافة بأي ثمن، وغياب صف في الساحة هو ثمنها. شغّل أرقام معدل الإنتاجية على بطاقتك الخاصة قبل أن تلتزم، لأن عاملي الزمن الحقيقي 0.30 و0.13 هما قياسات بطاقة النموذج نفسها، ولن تعيد منظومة الخدمة لديك إنتاجهما بالضبط.

وإذا كانت الإجابة الصادقة هي أنك لا تعرف حجم الصوت الشهري لديك، فهذا هو الرقم الذي عليك البحث عنه. إنه يحدد هذه المقارنة. لن تخبرك أيٌّ من اللوحتين.