
Eleven v4 مقابل VoxCPM2: نموذج مُصنَّف مقابل نقطة تحقق لا يمكنك استئجارها
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 982 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 197 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
الحقيقة الأكثر فائدة في هذه المواجهة هي صف غير موجود. ElevenLabs Eleven v4 يحتل المرتبة 1 في Provider Voice Arena التابع لـ Artificial Analysis بتصنيف Elo يبلغ 1,319 عبر 1,674 ظهورًا، بسعر 80.00 دولارًا لكل مليون حرف. VoxCPM2، نقطة تفتيش OpenBMB التي صدرت في أبريل 2026، لا تظهر في أي مكان على أي من لوحتي الكلام — ليست مصنفة، ولا غير مصنفة، ولا كمدخل معاينة. هذا ليس حكمًا على الجودة. هذا يعني أن أيًا كان الرقم الذي كنت تأمل في مقارنته بـ 1,319، فلم ينتجه أحد، ويجب أن تُجرى المقارنة على أساس شيء آخر غير التفضيل. ما يتبقى هو الملكية، والضبط الدقيق، ومسألة ترخيص لا تتيح لك نقطة نهاية مستضافة طرحها.
ما الذي يسلّمه لك كل طرف فعليًا
هذه فئات مختلفة من المنتجات، والاختلاف ليس شكليًا.
• الوصول — Eleven v4 هو نقطة نهاية مستضافة يُوصَل إليها عبر واجهة برمجة تطبيقات ElevenLabs الخاصة، وتُحتسب تكلفتها لكل حرف. أما VoxCPM2 فهو نقطة تحقق (checkpoint) على Hugging Face تحت openbmb/VoxCPM2؛ فأنت تنزّله وتشغّله، ولا توجد نقطة نهاية تابعة للجهة الأولى لاستدعائها.
• الترخيص — يُوزَّع VoxCPM2 بموجب Apache 2.0، وهو مجاني صراحةً للاستخدام التجاري. أما Eleven v4 فهو واجهة برمجة تطبيقات تجارية تخضع لشروط ElevenLabs. ويُهم هذا الفارق إذا طلب مراجعتك القانونية معرفة ما إذا كان يجوز لك الضبط الدقيق أو إعادة التوزيع أو شحن الأوزان؛ فمع نقطة التحقق تكون الإجابة مكتوبة وثابتة.
• الحجم والعتاد — يبلغ VoxCPM2 ملياري معامل على بنية MiniCPM-4 الأساسية، وتشير البطاقة إلى نحو 8 غيغابايت من VRAM بدقة bfloat16، مع حد أقصى لطول التسلسل يبلغ 8,192 رمزًا. لا تنشر ElevenLabs أي عدد للمعاملات الخاص بـ Eleven v4، كما أن البصمة العتادية لنموذج مستضاف ليست شيئًا تديره أنت.
• سلسلة الإخراج — يقبل VoxCPM2 صوتًا مرجعيًا بتردد 16 كيلوهرتز ويُخرج 48 كيلوهرتز عبر تقنية الدقة الفائقة المدمجة في AudioVAE V2، دون أي مُضاعِف معدل عينات خارجي في المسار. أما خدمة TTS المستضافة فتمنحك بثًا بأي معدل اختاره المورّد.
• التقييم المستقل — لدى Eleven v4 تقييم، وهو المركز الأول. لا يملك VoxCPM2 أي تقييم. الغياب ليس تقييمًا منخفضًا؛ فهو نموذج غير مُقيَّم، وينبغي ألا يُذكر الاثنان في الجملة نفسها كما لو كان الثاني رقمًا.

الرقم الذي يحل محل Elo المفقود
إذا لم يكن بوسعك مقارنة التفضيل، فقارن ما يمكنك حسابه، وبالنسبة إلى نموذج مستضاف ذاتيًا فإن هذا هو معدل الإنتاجية. تذكر بطاقة VoxCPM2 عامل زمن حقيقي يبلغ نحو 0.30 في PyTorch القياسي على RTX 4090، وينخفض إلى نحو 0.13 تحت Nano-VLLM. عامل الزمن الحقيقي هو ثوانٍ من الحوسبة لكل ثانية من الصوت، لذا يعني هذان الرقمان أن ساعة GPU واحدة تنتج نحو 3.3 ساعات من الكلام النهائي في الحالة الأولى، ونحو 7.7 ساعات في الحالة الثانية.

ثمّة نتيجتان تتبعان فورًا. مكدّس التقديم يهم أكثر من النموذج: نقطة التحقق نفسها على البطاقة نفسها تضاعف مخرجاتها أكثر من الضعف عند تبديل محرك الاستدلال، لذا فأي نموذج تكلفة يستخدم رقم 0.30 يبالغ في تقدير تكلفتك المستضافة ذاتيًا بمعامل يقارب 2.3. والاستغلال هو كل اللعبة: البطاقة التي تظل خاملة لا تتغلب على واجهة برمجة تطبيقات تُحاسب لكل حرف بأي سعر، لأن فاتورة الـAPI تتناسب مع ما تقوله بينما فاتورة البطاقة تتناسب مع متى اشتريتها.
وهذا هو سبب أن النسخة الصادقة من هذا القرار ليست «أيها يبدو أفضل». بل «كم ساعة صوتية تنتج شهريًا، وهل العتاد مشغول». دون الحجم الذي تبقى فيه البطاقة محمّلة، تفوز واجهة API بفارق كبير. وفوقه، على عتاد تملكه بالفعل، تكون التكلفة الحدية لنقطة التحقق في الساعة الألف هي نفسها تكلفتها في الساعة الأولى — وهذه ميزة بنيوية لا يمكن لأي قائمة أسعار أن تضاهيها.
القدرة التي لن تبيعها لك نقطة نهاية مستضافة
هنا يتوقف التشابه عن كونه صورة طبق الأصل، لأن هناك شيئًا واحدًا يفعله VoxCPM2 لا يستطيع Eleven v4 فعله إطلاقًا: يمكنك إعادة تدريبه. توثّق بطاقة النموذج كلاً من الضبط الدقيق الكامل SFT وLoRA على ما لا يقل عن خمس إلى عشر دقائق من الصوت، مع نص برمجي للإعداد والتكوين مرفق لكل منهما.
هذا يغيّر شكل برنامج صوتي. تمنحك واجهة برمجة تطبيقات مستضافة نموذجًا ثابتًا إضافة إلى أي استنساخ يوفره المورّد — عشر ثوانٍ من الصوت المرجعي في حالة Eleven v4 من أجل النسخ الفورية، مع فئة احترافية فوقها. وتمنحك نقطة تفتيش قابلة للضبط بـ LoRA نموذجًا لم يطّلع قط على بيانات أي طرف آخر ويمكنك تثبيت سلوكه حسب الإصدار. وبالنسبة إلى صوت علامة تجارية، أو مجال خاضع للتنظيم، أو لغة يتعامل معها طاقم الأصوات لدى المورّد بشكل ضعيف، فإن ذلك يمثل فئة مختلفة من الحلول، لا حلًّا أرخص.
المقايضة واضحة وتستحق الذكر: مع VoxCPM2، أنت تقبل أنه لم يقم أي طرف ثالث بتقييم النموذج قط، وأن ضمانات الجودة هي ضمانات تبنيها وتقيسها بنفسك، وأن حد التسلسل البالغ 8,192 رمزًا وتحذير البطاقة نفسه — بأن تصميم الصوت والتحكم في النمط يختلفان بين التشغيلات وأنه يُوصى بتوليد واحد إلى ثلاثة — أصبحا الآن مشكلتك في ضمان الجودة.
ما الذي يمنحك إياه Eleven v4 ولا تستطيع نقطة التحقق تقديمه
وعلى الجانب الآخر، فإن مزايا النموذج المستضاف هي تلك التي تظهر على تقويم الإصدارات بدلاً من ورقة المواصفات.
• تصنيف مبنيّ على القياس — الأول في لوحة تصنيف تستند تقديراتها إلى 1,674 عيّنة، وبهامش يبلغ نحو ±19 نقطة حوله. وأيًّا كان ما تقيسه تلك اللوحة، فهي مستقلة عن كلا المورّدين، وهي إشارة الجودة الوحيدة الصادرة عن طرف ثالث في هذه المقارنة.
• التوجيه الأدائي في النص — وسوم صوتية مضمّنة مثل [يضحك]، [يهمس] و[قال بغضب بلكنة فرنسية]، إضافة إلى مطالبات الإلقاء باللغة الطبيعية ودعم محسّن للأبجدية الصوتية الدولية. إن الحصول على تغيير في المزاج من نموذج مستضاف ذاتيًا يعني إعادة توليد أو ضبطًا دقيقًا؛ وهنا يكون الأمر رمزًا في النص.
• تغطية لا يتعين عليك التحقق منها — أكثر من 90 لغة مقابل 30 لدى VoxCPM2، مع التحفظ بأن قائمة نقطة التحقق صريحة ومُسمّاة (بما في ذلك اللهجات الصينية)، في حين أن «أكثر من 90» لدى المورّد مجرد عدد دون قائمة.
• لا يوجد سطح تشغيلي — لا GPU، ولا حزمة تقديم، ولا انحراف في الإصدارات، مع سعر ترويجي قدره 0.022 دولار لكل 1000 حرف حتى 12 أكتوبر مقابل سعر قائمة يبلغ 0.08 دولار بعد ذلك.

لا يخصّنا أيٌّ من هذين، وهذا هو بيت القصيد في هذا القسم
لا يستضيف OrcaRouter أيًّا من النموذجين. لا توجد نقطة نهاية لـ ElevenLabs ولا نقطة نهاية لـ VoxCPM2 في كتالوجنا، والجواب الصادق بشأن التوجيه هو أن Eleven v4 يتم الوصول إليه عبر واجهة برمجة التطبيقات الخاصة بـ ElevenLabs نفسها، بينما VoxCPM2 شيء تنشره على عتادك الخاص. لن نلمّح إلى خلاف ذلك لجعل المقارنة أكثر ترتيبًا.
حيث يساعد مفتاح واحد فعلًا هو القرار الذي يسبق القرار. سبب تعثّر محادثات الاستضافة الذاتية هو أن البديل لا يُقيَّم أبدًا: الواجهة البرمجية نداء واحد، ونقطة التحقق حزمة تقديم كاملة، لذا تفوز الواجهة البرمجية تلقائيًا بدلًا من أن تفوز بالحساب. إسهام OrcaRouter هو أن الجانب المستضاف من تلك المقارنة رخيص الاختبار — أكثر من 200 نموذج خلف مفتاح API واحد مع أسعار قوائم المزوّدين تمرَّر عند هامش ربح 0%، لذا يُقيَّم الخيار المستضاف بسعره الحقيقي لا بسعر مُقدَّر، مع تحويل تلقائي عند الفشل إذا وضعت مرشحًا خلف مسار مباشر قبل أن تنتهي من القرار.
كيف تقرر في مرور واحد
اختر Eleven v4 إذا كان لا بد أن يكون الصوت جيدًا من أول تسجيل وتريد إنجاز الأمر هذا الأسبوع. تحصل على المرتبة الأولى في لوحة تقييم مستقلة، وصيغة توجيه موثّقة، وأوسع عدد لغات موثّق في هذه المقارنة، ومن دون أي بنية تحتية. تدفع 0.08 دولار لكل 1000 حرف اعتبارًا من 13 أكتوبر فصاعدًا، وتقبل أنك لا تستطيع إعادة تدريبه، أو تثبيت إصداره، أو الاحتفاظ بالصوت على عتادك الخاص.
اختر VoxCPM2 إذا كان لا بد أن يكون النموذج ملكك. رخصة Apache 2.0، و2B معامل على نحو 8 غيغابايت من VRAM، وإخراج بتردد 48 كيلوهرتز دون مُضاعِف معدل العينات في السلسلة، ومسار ضبط دقيق يعمل على خمس إلى عشر دقائق من الصوت — هذه قدرات لا تقدمها نقطة نهاية مستضافة بأي ثمن، وغياب صف في الساحة هو ثمنها. شغّل أرقام معدل الإنتاجية على بطاقتك الخاصة قبل أن تلتزم، لأن عاملي الزمن الحقيقي 0.30 و0.13 هما قياسات بطاقة النموذج نفسها، ولن تعيد منظومة الخدمة لديك إنتاجهما بالضبط.
وإذا كانت الإجابة الصادقة هي أنك لا تعرف حجم الصوت الشهري لديك، فهذا هو الرقم الذي عليك البحث عنه. إنه يحدد هذه المقارنة. لن تخبرك أيٌّ من اللوحتين.
