بطاقة رئيسية مُولّدة لـ 'Gemini 3.8 TTS vs VoxCPM2' على خلفية بيضاء مع لمسات متدرجة ناعمة بالأزرق والسماوي. تسرد البطاقة اليسرى 'Gemini 3.8 Flash TTS' نقطة نهاية API، وElo 1,260 في المرتبة 2، و16.50 دولارًا لكل مليون حرف بعد التطبيع؛ بينما تسرد البطاقة اليمنى 'VoxCPM2' رخصة Apache 2.0، و2 مليار معامل، ونحو 8 غيغابايت من VRAM للتشغيل، ومعامل زمن حقيقي 0.30 في PyTorch العادي ولا نقطة نهاية مستضافة. ويظهر في سطر التذييل 'Elo وفقًا لـ Artificial Analysis Provider Voice Arena، سبتمبر 2026؛ وأرقام VoxCPM2 وفقًا لبطاقة نموذجه.' ويُركّب شعار OrcaRouter في الزاوية اليمنى السفلية.
Guides & Insights

Gemini 3.8 TTS مقابل VoxCPM2: استئجار صوت أم تشغيله، بالأرقام الحقيقية

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لا يوجد صف في لوحة المتصدرين يضع Gemini 3.8 Flash TTS وVoxCPM2 جنبًا إلى جنب، وهذا الغياب هو أكثر حقيقة مفيدة في هذه المقارنة. Gemini 3.8 Flash TTS هو نقطة نهاية مستضافة بتصنيف إيلو 1,260 في المرتبة 2 على Artificial Analysis Provider Voice Arena وبطاقة أسعار منشورة بالوحدات الرمزية. VoxCPM2 هو نقطة تفتيش OpenBMB — مليارا معلمة، Apache 2.0، صدر في أبريل 2026 — لا يستضيفه أي مزوّد استدلال. لا يمكنك استئجاره. أنت تشغّله.

إذن فالسؤال ليس أي نموذج يبدو أفضل. بل ما إذا كان عبء العمل لديك يُخدم بشكل أفضل عبر الدفع لكل حرف مقابل وحدات معالجة رسومات شخص آخر، أو عبر امتلاك وحدات معالجة الرسومات والدفع مقابلها سواء كانت تعمل أم لا. هذا سؤال حسابي، وعلى خلاف معظم مقارنات النماذج، له إجابة يمكنك حسابها قبل أن تلتزم.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

أحدهما تستأجره، والآخر تشغّله

ابدأ بما يقدّمه لك كل واحد منهم فعليًا.

• الوصول — Gemini 3.8 Flash TTS متاح عبر API فقط، ويُستدعى من خلال Gemini API وواجهات Google المذكورة في إعلانه الصادر في 23 سبتمبر 2026. أما VoxCPM2 فلا يملك أي نقطة نهاية تابعة للجهة الأولى قيد الاستخدام الإنتاجي، ولا يوجد مزوّد استدلال يقدّمه؛ فنقطة التحقق (checkpoint) هي المنتج.

• الترخيص — يُصدَر {{1}}VoxCPM2{{/1}} تحت رخصة {{2}}Apache 2.0{{/2}}، التي تسمح بالاستخدام التجاري دون الحاجة إلى اتفاق منفصل. وهذا ترخيص متسامح حقًّا، وهو ليس الوضع الافتراضي للأوزان الصوتية المفتوحة، إذ يُصدَر العديد منها بموجب شروط تقتصر على الأبحاث وتُعيد توجيه الاستخدام التجاري عبر واجهة برمجة تطبيقات مستضافة.

• الحجم — يبلغ VoxCPM2 ملياري معامل، ويتّسع في نحو 8 جيجابايت من VRAM بدقة مخفّضة لأغراض التطوير، مع ذروة استدلال تبلغ حوالي 22 جيجابايت على بطاقة بسعة 24 جيجابايت. ولم تنشر Google أي عدد للمعاملات لأيٍّ من طرازَي Gemini 3.8 TTS.

• إنشاء الأصوات — يقوم Gemini 3.8 Flash TTS بتصميم الصوت انطلاقًا من وصف مكتوب، واستنساخ الصوت من عيّنة مدتها 30 ثانية، وإجراء حوار بين متحدّثين في نداء واحد. أما VoxCPM2 فهو نموذج تحويل نص إلى كلام بصوت واحد؛ والمحادثة فيه عبارة عن تشغيلَين مدمجَين.

• درجة مستقلة — يمتلك Flash TTS واحدة. أما VoxCPM2 فلا يظهر ضمن الصفوف المصنَّفة في Provider Voice Arena كما جرى رصدها في 24 سبتمبر 2026. وغياب النموذج عن أي لوحة ليس حكمًا على جودته — فهو عادةً يعني أن أحدًا لم يُدرج النموذج — لكنه يعني بالفعل أنه لا يوجد رقم تفضيل من طرف ثالث يمكن أخذه في الحسبان.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

تلك النقطة الأخيرة تنطبق في الاتجاهين، ويجدر قولها بصراحة لا التمرير عليها: إذا كنت بحاجة إلى إشارة جودة مستقلة قبل أن تلتزم، فإن واحدًا فقط من هذين يوفّرها.

الرقم الذي يحسم الأمر: عامل الزمن الحقيقي

الاستضافة الذاتية لنموذج الكلام تحوّل فاتورة لكل حرف إلى فاتورة لكل ساعة GPU، وسعر الصرف بين هاتين الوحدتين هو عامل الوقت الحقيقي للنموذج — كم ثانية من الحوسبة يستغرق لإنتاج ثانية واحدة من الصوت.

الأرقام المنشورة لـ VoxCPM2 هي 0.30 في PyTorch العادي و0.13 تحت Nano-VLLM. اقرأ تلك على أنها إنتاجية وليس زمن استجابة: عند 0.13، تنتج ساعة GPU واحدة من الوقت الفعلي ما يقرب من 7.7 ساعات من الصوت النهائي. عند 0.30، تنتج ساعة GPU نفسها ما يقرب من 3.3 ساعات. تلك هي أرقام بطاقة النموذج نفسها، التي قاستها OpenBMB، وهي المدخل الأكثر أهمية لأي قرار بين البناء أو الشراء هنا.

يترتب على ذلك ثلاثة أمور.

• تتفوق بنية تقديم الخدمة على النموذج نفسه في الأهمية. فالانتقال من PyTorch العادي إلى Nano-VLLM يضاعف الإنتاجية أكثر من مرتين على العتاد نفسه. وأي نموذج تكلفة مبني على الرقم 0.30 يبالغ في تقدير تكلفة الاستضافة الذاتية بمعامل نحو 2.3.

• الاستخدام هو كل شيء. وحدة معالجة رسومات مستأجرة تظل خاملة 90% من الوقت ليست أرخص من واجهة برمجة تطبيقات مهما كان الثمن. لا تظهر نقطة التعادل إلا عندما تُبقي البطاقة مشغولة.

• التجميع الدفعي يغيّر المعادلة الحسابية مرة أخرى. يُقاس عامل الزمن الحقيقي لكل تدفق؛ والخادم الذي يعالج طلبات متزامنة يوزّع التكلفة الثابتة فيما بينها، وهذا تحديدًا هو النمط الذي تبدأ فيه الاستضافة الذاتية بالتفوق.

كم تكلف ساعة من الصوت، في كلا الاتجاهين

ضع نموذجي الفوترة على المحور نفسه. ساعة واحدة من الصوت النهائي تساوي 3,600 ثانية من الإخراج.

على جانب الاستئجار، تحسب Google الرسوم بالرموز (tokens) لا بالأحرف: $0.50 لكل مليون رمز نصي مُدخل و$9.00 لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم $18.00؛ أما Flash-Lite TTS فتبلغ $0.50 و$6.00، ثم $12.00. تُسعّر Batch وFlex بـ$0.25 و$4.50 لـ Flash TTS مقابل $0.25 و$3.00 لـ Flash-Lite TTS، وتُسعّر Priority بـ$0.90 و$16.00. وتُوحّد Artificial Analysis الأسعار القياسية عند $16.50 و$11.00 لكل مليون حرف، وهو تحويل خاص باللوحة لا عرض سعر من Google، وهو الرقم الذي ينبغي استخدامه عند المقارنة بنموذج يحسب الرسوم بالأحرف.

على الجانب المملوك، لا يوجد سعر لكل حرف على الإطلاق. التكلفة هي ساعة GPU، مضروبة في عدد الساعات التي تحتاجها عند معدل الإنتاجية أعلاه، بالإضافة إلى مكدس تقديم الخدمة، بالإضافة إلى الأشخاص الذين يبقونها قيد التشغيل. ميزة VoxCPM2 هي أن التكلفة الحدّية للساعة الألف هي نفس تكلفة الساعة الأولى — وعيبه أن التكلفة الحدّية للساعة الأولى هي GPU.

وهذا هو السبب في أن القرار واضح بشكل غير معتاد:

• دون حجم معيّن، تفوز واجهة API بفارق كبير. أنت تدفع دولارات بأرقام أحادية لكل ساعة صوت مقابل تكلفة رأسمالية، ويجعل سعر Google الترويجي تلك الفجوة أوسع حتى 1 يناير 2027.

• فوق هذا الحجم، وعلى عتاد تملكه بالفعل ويمكنك إبقاؤه مشغولًا، تتفوّق نسخة Apache 2.0 بحسم — وخلافًا لنسخة مرخّصة للأبحاث، لا شيء في الترخيص يمنعك من طرحها.

• فيما بينهما، الإجابة الصادقة هي أنك تشتري الخيارات وليس التوفير. الاستضافة الذاتية تمنحك القدرة على تثبيت إصدار معين، والاحتفاظ بالصوت على بنيتك التحتية الخاصة، والتوقف عن الاهتمام بتغير أسعار المورّد.

حيث تكون كل واحدة هي الإجابة الصحيحة

اختر Gemini 3.8 Flash TTS عندما تريد المنتج الأفضل توثيقًا. فهو يمتلك تقييمًا مستقلًا، وسعرًا معلنًا، وحوارًا بين متحدثين في استدعاء واحد، وتصميم أصوات واستنساخها، ولا سطح تشغيلي يتجاوز مفتاح API. أما شقيقه Flash-Lite TTS فيمنحك نقطة سعرية ثانية داخل الواجهة نفسها بسعر موحّد قدره 11.00 دولارًا لكل مليون حرف. وما تقبله في المقابل هو سعر يتضاعف في 1 يناير 2027 وعدم القدرة على تشغيل النموذج في أي مكان.

اختر VoxCPM2 عندما يكون العمل التشغيلي هو المقصود. فـ Apache 2.0 تعني أن الاستخدام التجاري مسموح به صراحةً، وحجم 2B يعني أن مسرّعًا واحدًا يكفي، ومعامل الزمن الحقيقي البالغ 0.13 تحت Nano-VLLM يعني أن بطاقة متواضعة تنتج عدة ساعات من الصوت لكل ساعة من الزمن الفعلي. وما تقبله هو أنه لن يقوم أحد آخر بتشغيله نيابة عنك: لا نقطة نهاية مستضافة، ولا صف في الساحة، ولا قائمة أسعار من مورّد، وكل ضمان جودة تحصل عليه هو ضمان تبنيه وتقيسه بنفسك.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

لا يستضيف OrcaRouter أيًّا من هذين النموذجين، ويجدر قول ذلك صراحةً بدلًا من الإيحاء بخلاف ذلك. المكان الذي يُستدعى منه Gemini 3.8 Flash TTS هو واجهة Google البرمجية الخاصة بها والأسطح التي حدّدتها Google؛ أما VoxCPM2 فهو نقطة تحقق (checkpoint) تنشرها بنفسك. وما يغطيه OrcaRouter هو الطبقة الأعلى من ذلك القرار — أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح، بحيث يصبح أي تغيير في سعر البائع ساريًا لدينا في اليوم نفسه بدلًا من دورة الفوترة التالية، وتجاوز تلقائي للأعطال بحيث لا يضطر نموذج قيد التقييم أبدًا إلى أن يكون اعتمادًا في بيئة الإنتاج، ولغة توجيه (routing DSL) تجمع عدة نماذج في استدعاء واحد عندما لا يؤدي صوت واحد المهمة كاملة.

ماذا تشاهد بعد ذلك

هناك أمران من شأنهما تغيير هذه المقارنة ماديًا، ولم يحدث أي منهما حتى الآن.

الأول هو أن يستضيف أحدهم VoxCPM2. غيابه عن سوق الاستدلال هو السبب الرئيسي في أن النموذجين يُقارنان على أساس الاقتصاد لا الجودة — وإذا تبنّاه مزوّد، يتوقف حساب الإيجار مقابل التملك عن كونه العامل الحاسم، ويصبح صف الساحة المفقود هو الشيء الذي تريد ملأه.

الثاني هو تغيير الأسعار في يناير من جانب Google. عند السعر الترويجي، تكون API رخيصة بما يكفي بحيث لا ينبغي لمعظم أعباء العمل أن تستضيف أي شيء بنفسها؛ أما عند السعر بعد الترويجي، فتضيق الفجوة إلى حد ينبغي فيه لفريق يمتلك سعة GPU قائمة وحجمًا ثابتًا أن يعيد إجراء الحسابات بدلاً من افتراض أن API لا تزال متفوقة.

إلى أن يتغيّر أحد هذين الأمرين، فإن المُدخل الحاسم ليس لوحة الصدارة. بل عدد ساعات الصوت التي تنتجها شهريًا، وما إذا كانت البطاقة مشغولة.