
Gemini 3.8 TTS مقابل VoxCPM2: استئجار صوت أم تشغيله، بالأرقام الحقيقية
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
لا يوجد صف في لوحة المتصدرين يضع Gemini 3.8 Flash TTS وVoxCPM2 جنبًا إلى جنب، وهذا الغياب هو أكثر حقيقة مفيدة في هذه المقارنة. Gemini 3.8 Flash TTS هو نقطة نهاية مستضافة بتصنيف إيلو 1,260 في المرتبة 2 على Artificial Analysis Provider Voice Arena وبطاقة أسعار منشورة بالوحدات الرمزية. VoxCPM2 هو نقطة تفتيش OpenBMB — مليارا معلمة، Apache 2.0، صدر في أبريل 2026 — لا يستضيفه أي مزوّد استدلال. لا يمكنك استئجاره. أنت تشغّله.
إذن فالسؤال ليس أي نموذج يبدو أفضل. بل ما إذا كان عبء العمل لديك يُخدم بشكل أفضل عبر الدفع لكل حرف مقابل وحدات معالجة رسومات شخص آخر، أو عبر امتلاك وحدات معالجة الرسومات والدفع مقابلها سواء كانت تعمل أم لا. هذا سؤال حسابي، وعلى خلاف معظم مقارنات النماذج، له إجابة يمكنك حسابها قبل أن تلتزم.

أحدهما تستأجره، والآخر تشغّله
ابدأ بما يقدّمه لك كل واحد منهم فعليًا.
• الوصول — Gemini 3.8 Flash TTS متاح عبر API فقط، ويُستدعى من خلال Gemini API وواجهات Google المذكورة في إعلانه الصادر في 23 سبتمبر 2026. أما VoxCPM2 فلا يملك أي نقطة نهاية تابعة للجهة الأولى قيد الاستخدام الإنتاجي، ولا يوجد مزوّد استدلال يقدّمه؛ فنقطة التحقق (checkpoint) هي المنتج.
• الترخيص — يُصدَر {{1}}VoxCPM2{{/1}} تحت رخصة {{2}}Apache 2.0{{/2}}، التي تسمح بالاستخدام التجاري دون الحاجة إلى اتفاق منفصل. وهذا ترخيص متسامح حقًّا، وهو ليس الوضع الافتراضي للأوزان الصوتية المفتوحة، إذ يُصدَر العديد منها بموجب شروط تقتصر على الأبحاث وتُعيد توجيه الاستخدام التجاري عبر واجهة برمجة تطبيقات مستضافة.
• الحجم — يبلغ VoxCPM2 ملياري معامل، ويتّسع في نحو 8 جيجابايت من VRAM بدقة مخفّضة لأغراض التطوير، مع ذروة استدلال تبلغ حوالي 22 جيجابايت على بطاقة بسعة 24 جيجابايت. ولم تنشر Google أي عدد للمعاملات لأيٍّ من طرازَي Gemini 3.8 TTS.
• إنشاء الأصوات — يقوم Gemini 3.8 Flash TTS بتصميم الصوت انطلاقًا من وصف مكتوب، واستنساخ الصوت من عيّنة مدتها 30 ثانية، وإجراء حوار بين متحدّثين في نداء واحد. أما VoxCPM2 فهو نموذج تحويل نص إلى كلام بصوت واحد؛ والمحادثة فيه عبارة عن تشغيلَين مدمجَين.
• درجة مستقلة — يمتلك Flash TTS واحدة. أما VoxCPM2 فلا يظهر ضمن الصفوف المصنَّفة في Provider Voice Arena كما جرى رصدها في 24 سبتمبر 2026. وغياب النموذج عن أي لوحة ليس حكمًا على جودته — فهو عادةً يعني أن أحدًا لم يُدرج النموذج — لكنه يعني بالفعل أنه لا يوجد رقم تفضيل من طرف ثالث يمكن أخذه في الحسبان.

تلك النقطة الأخيرة تنطبق في الاتجاهين، ويجدر قولها بصراحة لا التمرير عليها: إذا كنت بحاجة إلى إشارة جودة مستقلة قبل أن تلتزم، فإن واحدًا فقط من هذين يوفّرها.
الرقم الذي يحسم الأمر: عامل الزمن الحقيقي
الاستضافة الذاتية لنموذج الكلام تحوّل فاتورة لكل حرف إلى فاتورة لكل ساعة GPU، وسعر الصرف بين هاتين الوحدتين هو عامل الوقت الحقيقي للنموذج — كم ثانية من الحوسبة يستغرق لإنتاج ثانية واحدة من الصوت.
الأرقام المنشورة لـ VoxCPM2 هي 0.30 في PyTorch العادي و0.13 تحت Nano-VLLM. اقرأ تلك على أنها إنتاجية وليس زمن استجابة: عند 0.13، تنتج ساعة GPU واحدة من الوقت الفعلي ما يقرب من 7.7 ساعات من الصوت النهائي. عند 0.30، تنتج ساعة GPU نفسها ما يقرب من 3.3 ساعات. تلك هي أرقام بطاقة النموذج نفسها، التي قاستها OpenBMB، وهي المدخل الأكثر أهمية لأي قرار بين البناء أو الشراء هنا.
يترتب على ذلك ثلاثة أمور.
• تتفوق بنية تقديم الخدمة على النموذج نفسه في الأهمية. فالانتقال من PyTorch العادي إلى Nano-VLLM يضاعف الإنتاجية أكثر من مرتين على العتاد نفسه. وأي نموذج تكلفة مبني على الرقم 0.30 يبالغ في تقدير تكلفة الاستضافة الذاتية بمعامل نحو 2.3.
• الاستخدام هو كل شيء. وحدة معالجة رسومات مستأجرة تظل خاملة 90% من الوقت ليست أرخص من واجهة برمجة تطبيقات مهما كان الثمن. لا تظهر نقطة التعادل إلا عندما تُبقي البطاقة مشغولة.
• التجميع الدفعي يغيّر المعادلة الحسابية مرة أخرى. يُقاس عامل الزمن الحقيقي لكل تدفق؛ والخادم الذي يعالج طلبات متزامنة يوزّع التكلفة الثابتة فيما بينها، وهذا تحديدًا هو النمط الذي تبدأ فيه الاستضافة الذاتية بالتفوق.
كم تكلف ساعة من الصوت، في كلا الاتجاهين
ضع نموذجي الفوترة على المحور نفسه. ساعة واحدة من الصوت النهائي تساوي 3,600 ثانية من الإخراج.
على جانب الاستئجار، تحسب Google الرسوم بالرموز (tokens) لا بالأحرف: $0.50 لكل مليون رمز نصي مُدخل و$9.00 لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم $18.00؛ أما Flash-Lite TTS فتبلغ $0.50 و$6.00، ثم $12.00. تُسعّر Batch وFlex بـ$0.25 و$4.50 لـ Flash TTS مقابل $0.25 و$3.00 لـ Flash-Lite TTS، وتُسعّر Priority بـ$0.90 و$16.00. وتُوحّد Artificial Analysis الأسعار القياسية عند $16.50 و$11.00 لكل مليون حرف، وهو تحويل خاص باللوحة لا عرض سعر من Google، وهو الرقم الذي ينبغي استخدامه عند المقارنة بنموذج يحسب الرسوم بالأحرف.
على الجانب المملوك، لا يوجد سعر لكل حرف على الإطلاق. التكلفة هي ساعة GPU، مضروبة في عدد الساعات التي تحتاجها عند معدل الإنتاجية أعلاه، بالإضافة إلى مكدس تقديم الخدمة، بالإضافة إلى الأشخاص الذين يبقونها قيد التشغيل. ميزة VoxCPM2 هي أن التكلفة الحدّية للساعة الألف هي نفس تكلفة الساعة الأولى — وعيبه أن التكلفة الحدّية للساعة الأولى هي GPU.
وهذا هو السبب في أن القرار واضح بشكل غير معتاد:
• دون حجم معيّن، تفوز واجهة API بفارق كبير. أنت تدفع دولارات بأرقام أحادية لكل ساعة صوت مقابل تكلفة رأسمالية، ويجعل سعر Google الترويجي تلك الفجوة أوسع حتى 1 يناير 2027.
• فوق هذا الحجم، وعلى عتاد تملكه بالفعل ويمكنك إبقاؤه مشغولًا، تتفوّق نسخة Apache 2.0 بحسم — وخلافًا لنسخة مرخّصة للأبحاث، لا شيء في الترخيص يمنعك من طرحها.
• فيما بينهما، الإجابة الصادقة هي أنك تشتري الخيارات وليس التوفير. الاستضافة الذاتية تمنحك القدرة على تثبيت إصدار معين، والاحتفاظ بالصوت على بنيتك التحتية الخاصة، والتوقف عن الاهتمام بتغير أسعار المورّد.
حيث تكون كل واحدة هي الإجابة الصحيحة
اختر Gemini 3.8 Flash TTS عندما تريد المنتج الأفضل توثيقًا. فهو يمتلك تقييمًا مستقلًا، وسعرًا معلنًا، وحوارًا بين متحدثين في استدعاء واحد، وتصميم أصوات واستنساخها، ولا سطح تشغيلي يتجاوز مفتاح API. أما شقيقه Flash-Lite TTS فيمنحك نقطة سعرية ثانية داخل الواجهة نفسها بسعر موحّد قدره 11.00 دولارًا لكل مليون حرف. وما تقبله في المقابل هو سعر يتضاعف في 1 يناير 2027 وعدم القدرة على تشغيل النموذج في أي مكان.
اختر VoxCPM2 عندما يكون العمل التشغيلي هو المقصود. فـ Apache 2.0 تعني أن الاستخدام التجاري مسموح به صراحةً، وحجم 2B يعني أن مسرّعًا واحدًا يكفي، ومعامل الزمن الحقيقي البالغ 0.13 تحت Nano-VLLM يعني أن بطاقة متواضعة تنتج عدة ساعات من الصوت لكل ساعة من الزمن الفعلي. وما تقبله هو أنه لن يقوم أحد آخر بتشغيله نيابة عنك: لا نقطة نهاية مستضافة، ولا صف في الساحة، ولا قائمة أسعار من مورّد، وكل ضمان جودة تحصل عليه هو ضمان تبنيه وتقيسه بنفسك.

لا يستضيف OrcaRouter أيًّا من هذين النموذجين، ويجدر قول ذلك صراحةً بدلًا من الإيحاء بخلاف ذلك. المكان الذي يُستدعى منه Gemini 3.8 Flash TTS هو واجهة Google البرمجية الخاصة بها والأسطح التي حدّدتها Google؛ أما VoxCPM2 فهو نقطة تحقق (checkpoint) تنشرها بنفسك. وما يغطيه OrcaRouter هو الطبقة الأعلى من ذلك القرار — أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح، بحيث يصبح أي تغيير في سعر البائع ساريًا لدينا في اليوم نفسه بدلًا من دورة الفوترة التالية، وتجاوز تلقائي للأعطال بحيث لا يضطر نموذج قيد التقييم أبدًا إلى أن يكون اعتمادًا في بيئة الإنتاج، ولغة توجيه (routing DSL) تجمع عدة نماذج في استدعاء واحد عندما لا يؤدي صوت واحد المهمة كاملة.
ماذا تشاهد بعد ذلك
هناك أمران من شأنهما تغيير هذه المقارنة ماديًا، ولم يحدث أي منهما حتى الآن.
الأول هو أن يستضيف أحدهم VoxCPM2. غيابه عن سوق الاستدلال هو السبب الرئيسي في أن النموذجين يُقارنان على أساس الاقتصاد لا الجودة — وإذا تبنّاه مزوّد، يتوقف حساب الإيجار مقابل التملك عن كونه العامل الحاسم، ويصبح صف الساحة المفقود هو الشيء الذي تريد ملأه.
الثاني هو تغيير الأسعار في يناير من جانب Google. عند السعر الترويجي، تكون API رخيصة بما يكفي بحيث لا ينبغي لمعظم أعباء العمل أن تستضيف أي شيء بنفسها؛ أما عند السعر بعد الترويجي، فتضيق الفجوة إلى حد ينبغي فيه لفريق يمتلك سعة GPU قائمة وحجمًا ثابتًا أن يعيد إجراء الحسابات بدلاً من افتراض أن API لا تزال متفوقة.
إلى أن يتغيّر أحد هذين الأمرين، فإن المُدخل الحاسم ليس لوحة الصدارة. بل عدد ساعات الصوت التي تنتجها شهريًا، وما إذا كانت البطاقة مشغولة.
