بطاقة رئيسية مُولَّدة لـ "Gemini 3.8 TTS مقابل ElevenLabs" على خلفية بيضاء مع لمسات متدرجة ناعمة بالأزرق والسماوي. تسرد البطاقة اليسرى "ElevenLabs Eleven v3" 100 دولار لكل مليون حرف، وأكثر من 70 لغة، وتصنيف Elo 1,167، والمرتبة 17؛ بينما تسرد البطاقة اليمنى "Gemini 3.8 Flash TTS" 33 دولارًا لكل مليون حرف، و130 لغة، وتصنيف Elo 1,260، والمرتبة 2. ويظهر في سطر التذييل: "تصنيف Elo وفقًا لـ Artificial Analysis Provider Voice Arena، سبتمبر 2026." كما يظهر شعار OrcaRouter مُدمجًا في الزاوية اليمنى السفلى.
Guides & Insights

Gemini 3.8 TTS مقابل ElevenLabs: ماذا يمنحك ثلاثة أضعاف السعر؟

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

بالحجم نفسه، يكلّف نموذج التوليد الرائد من ElevenLabs نحو ثلاثة أضعاف ما يكلّفه النموذج الجديد للشركة. ElevenLabs Eleven v3 تحتسب $0.10 لكل ألف حرف — $100 لكل مليون — وGemini 3.8 Flash TTS تحتسب $9.00 لكل مليون رمز صوتي، وهو ما تعيد Artificial Analysis معايرته إلى $33.00 لكل مليون حرف. وهذا فارق بمقدار 3.0x على العدّاد، وهو أكبر حقيقة منفردة في هذه المقارنة. والسؤال المثير للاهتمام ليس ما إذا كان الفارق حقيقيًا؛ بل ما الذي تشتريه فعلاً السبعة والستون دولارًا الإضافية لكل مليون حرف، لأن الجواب ليس «كلامًا أفضل».

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

ثلاثة أمتار، وليس مترًا واحدًا

أول ما يجب توضيحه هو أن هذين المنتجين لا يقيسان الشيء نفسه، وأن بطاقات الأسعار المنشورة تخفي ذلك.

• تفرض ElevenLabs رسومًا حسب عدد الأحرف. تبلغ تكلفة Eleven v3 ‏0.10 دولار لكل 1000 حرف، بحد أقصى 5000 حرف لكل طلب. تبلغ تكلفة Eleven v3 Conversational ‏0.05 دولار لكل 1000 حرف، كما أن نموذجي Flash وTurbo بسعر 0.05 دولار لكل 1000 حرف أيضًا، لكن بحد أقصى 40000 حرف لكل طلب، وبزمن استجابة مُعلَن يبلغ نحو 75 مللي ثانية مقابل زمن استجابة v3 Conversational البالغ نحو 280 مللي ثانية.

• تفرض Google رسومها حسب الرموز (tokens)، ورموز الصوت ليست رموز نص. يتقاضى Gemini 3.8 Flash TTS مبلغ $0.50 لكل مليون رمز نصي مُدخل و$9.00 لكل مليون رمز صوتي مُخرج، ويُحتسب ذلك بمعدل 25 رمزًا صوتيًا لكل ثانية من الكلام المُولَّد. ولا يوجد حد أقصى منشور لعدد الأحرف لكل طلب.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• لا تُصدر Artificial Analysis فواتير بأيٍّ منهما؛ بل تُطبّع. إنّ مبلغي $100.00 و$33.00 لكل مليون حرف على لوحة صدارتها Provider Voice Arena هما قاسم مشترك مشتق كي تتمكن اللوحة من الترتيب حسب السعر أصلًا. مفيدان لاحتساب نسبة، لا لعرض سعر.

إذن، النسخة الصادقة من رقم 3.0x هي: على أساس المقارنة الوحيد المتاح، فإن Google تبلغ حوالي ثلث السعر. ما يعنيه ذلك في جدول البيانات الخاص بك يعتمد على ما إذا كانت السلاسل القصيرة أو الطويلة تهيمن على عبء العمل الخاص بك — يتباعدان بشكل حاد مقياس الصوت لكل ثانية ومقياس النص لكل حرف مع زيادة طول المنطوقات، لأن الصمت والوقفات والحشو العروضي كلها تستهلك رموز الصوت ولا تستهلك أحرفًا.

شهر مُنجَز

خذ مليون حرف من النص، بطول رواية متوسطة الحجم تقريبًا، وحوّلها إلى كلام مرة واحدة.

• ElevenLabs Eleven v3 — 100.00 دولار مقابل التوليف، بالإضافة إلى أي فئة خطة تحتاجها لتشغيله وفق مستوى التزامن لديك. تتراوح الخطط المنشورة بين Starter بسعر 6 دولارات، وCreator بسعر 22 دولارًا، وPro بسعر 99 دولارًا، وScale بسعر 299 دولارًا، وBusiness بسعر 990 دولارًا، كما أن حصص الأحرف مضمّنة في هذه الخطط بدلًا من أن تُفوتَر بشكل منفصل.

• Gemini 3.8 Flash TTS — ما يعادل 33.00 دولارًا، أو نحو 16.50 دولارًا إذا كان يمكن تنفيذ المهمة على دفعات، لأن فئة Batch وFlex تخفض تعريفة الصوت إلى النصف لتصل إلى 4.50 دولارات لكل مليون توكن. وترفع خدمة الأولوية السعر إلى 16.20 دولارًا لكل مليون، أو ما يعادل نحو 59.40 دولارًا، وهو لا يزال أقل بكثير من ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — 6.00 دولارات لكل مليون توكن صوتي، أي ما يعادل نحو 22.10 دولارًا وفق التسوية نفسها، مقابل 101 لغة بدلًا من 130.

شغّل المليون حرف نفسها عبر التسعير الترويجي من Google، فتتسع الفجوة أكثر، لأن كلا نموذجي Gemini TTS الجديدين بنصف السعر حتى 31 ديسمبر 2026 ثم يتضاعف السعر. وأي شخص يبني دراسة جدوى على أرقام سبتمبر فإنه يبنيها على خصم له تاريخ انتهاء معلن.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

المكان الوحيد الذي تنقلب فيه المقارنة هو العبارات القصيرة جدًا. العداد القائم على الأحرف لا يتقاضى شيئًا تقريبًا مقابل تأكيد من ثلاث كلمات؛ أما عداد الصوت لكل ثانية فيتقاضى عن الثانية التي يستغرقها نطق التأكيد، بما في ذلك الصمت المحيط به. إذا كان منتجك واجهة صوتية مبنية من ردود من جملة واحدة، فإن الحساب يميل نحو ElevenLabs. وإذا كان سردًا أو كتبًا صوتية أو توطينًا طويلاً أو أي شيء يكون فيه النص طويلاً والصوت أطول، فإنه يميل بقوة نحو Google.

سؤال الجودة، بصراحة

في Artificial Analysis Provider Voice Arena — تصويتات ثنائية عمياء على الأصوات الأصلية لكل مزوّد على حدة — فإن النموذجين ليسا متقاربين، وGoogle في المقدمة.

• Gemini 3.8 Flash TTS — المرتبة 2، إيلو 1,260، فاصل 17 نقطة، 1,999 عينة، 8 أصوات في الساحة، صدر في سبتمبر 2026.

• ElevenLabs Eleven v3 — المرتبة 17، إيلو 1,167، فاصل 11 نقطة، 4,345 عيّنة، 8 أصوات في الساحة، مُدرَج في فبراير 2026 على اللوحة.

يفصل بينهما ثلاثة وتسعون نقطة من نقاط إيلو، وخلافًا للفارق بين الثلاثة الأوائل على تلك اللوحة، فإن هذا الفارق حقيقي: نطاق Eleven v3 هو 1,156 إلى 1,178 ونطاق Gemini هو 1,243 إلى 1,277، دون أي تداخل. كما أن عدد العينات لدى Eleven v3 يزيد على ضعف عدد عينات Gemini، لذا فالتقدير ليس ضعيفًا أيضًا.

هذه نتيجة محرجة حقًا لحجة السعر، وتتعارض مع الاستنتاج الواضح. تتقاضى ElevenLabs ثلاثة أضعاف المبلغ، وتحتل مرتبة أدنى بسبعة عشر مركزًا في التفضيل الأعمى. ومهما كان ما تشتريه الـ67 دولارًا الإضافية، فهو ليس صوتًا أفضل في مواجهة مباشرة.

ما الذي تبيعه ElevenLabs في الواقع

لا تبيع ElevenLabs أساسًا نقطة نهاية للتوليف، وإنّ تسعيرها كما لو كانت كذلك هو موضع خطأ معظم المقارنات. ما الذي يشتريه المال:

مكتبة أصوات. تضم مكتبة الأصوات المشتركة من ElevenLabs مئات الأصوات، وهي واجهة منتج حقيقية — فالذي يأتي الناس إلى ElevenLabs من أجله غالبًا هو صوت بعينه سمعوه في مكان ما، لا النموذج الذي يقف خلفه. ويأتي Gemini 3.8 Flash TTS مزوّدًا بـ30 صوتًا استوديو جاهزًا، ومسار تصميم صوت يولّد صوتًا من وصف باللغة الطبيعية، ومسار استنساخ يستنسخ صوتًا من عيّنة مدتها 30 ثانية مع التحقق من الموافقة، وعلامة SynthID المائية، وبيانات اعتماد C2PA مرفقة. الكتالوج الافتراضي أصغر؛ أما القدرة على إنشاء صوت بعينه فهي مماثلة.

• مستويات زمن الاستجابة كمنتجات منفصلة. Flash وTurbo عند ~75 مللي ثانية وحد 40,000 حرف هما منتج مختلف عن v3 عند ~280 مللي ثانية و5,000 حرف، وكلاهما أرخص من v3. إذا كان تطبيقك يحتاج إلى أقل من 100 مللي ثانية، فإن ElevenLabs تبيعه صراحةً، ولا تقدم مواد إطلاق Google ادعاءً مماثلاً بزمن الاستجابة لأي من نموذجي TTS الجديدين.

• منظومة بيئية. الدبلجة، وكلاء الصوت، نقاط النهاية الحوارية، هيكل خطة مرتبط بالتزامن — للسبب نفسه الذي تبيع به Cartesia الاتصالات الهاتفية: إنها حزمة تقنية، لا نموذج.

إذا كنت تشتري مجموعة متكاملة، فإن 3.0x هو ثمن عدم تجميعها بنفسك. وإذا كنت تشتري استدعاء تخليق صوتي، فأنت تدفعه مقابل مكتبة أصوات وفئة زمن استجابة.

ما الذي تبيعه Google فعليًا

الحجة المضادة أضيق وأقوى من "أرخص".

• التغطية اللغوية — 130 لغة على Flash TTS و101 على Flash-Lite TTS، تُكتشف تلقائيًا من النص، مقابل أكثر من 70 لغة توثّقها ElevenLabs لـ Eleven v3. بالنسبة لعملية تعريب، هذا الفرق ليس مقارنة ميزات، بل فجوة في التغطية.

• التوجيه — التحكم في الإلقاء سطرًا بسطر، وإعداد مشهد بمتحدثين داخل استدعاء واحد، وإشارات غير لفظية مكتوبة في النص على شكل <laughs>، <sigh>، <gasp>، |mhm| و|yeah|. تدّعي Google أن الجيل 3.8 حسّن الاتساق في النصوص الطويلة والتحكم بمتحدثين اثنين مقارنةً بـ Gemini 3.1 Flash TTS، وهو بالضبط الغرض من وجود هذه الميزات. ادعاء من المورّد، غير مُعاد إنتاجه.

• نموذج حالة الصوت — 200 صوت مخصص ذي حالة لكل مشروع بصلاحية سنة واحدة (TTL)، أو أصوات بلا حالة يُشار إليها بواسطة voicekey_... معرّف تنتهي صلاحيته خلال سبعة أيام. هذا قرار بنية تحتية يمكنك التخطيط حوله.

• التحكم في الإخراج — WAV 24 kHz أحادي 16-bit PCM موقّع على نقطة النهاية الأحادية، وPCM بلا ترويسة (audio/l16) على نقطة نهاية البث، وaudio/mulaw وaudio/alaw بمعدل عينات قابل للتكوين.

معايير الإطلاق الخاصة بـ Google مُبلَّغ عنها من الجهة البائعة وينبغي قراءتها على هذا الأساس: المركز الأول في Hume AI Voice Design Benchmark عند 71.4، والمركز الأول في نمذجة اللهجات عند 60.8، والمركزان الأول والثاني في Hume Overall Quality Index لـ Flash وFlash-Lite على الترتيب، ومواقع متقدمة في التفضيل الأعمى مُدَّعاة في اليابانية والبرتغالية البرازيلية والفيتنامية والعربية الفصحى الحديثة والإسبانية المكسيكية والهندية. لا شيء من تلك الاختبارات متاح للعموم. أما إيلو الساحة أعلاه فهو الرقم الوحيد المُجمَّع بشكل مستقل في هذا المقال، ويصادف أنه يتفق مع اتجاه ادعاءات الجهة البائعة.

حساب التبديل

قم بالتبديل إذا كان حجم العمل لديك طويلاً أو متعدد اللغات أو ضخمًا بما يكفي بحيث يظهر 3.0x كبند مستقل، وإذا كان بإمكانك التعايش مع كتالوج أصوات افتراضي أصغر وعدم وجود فئة منشورة بأقل من 100 مللي ثانية. يغطي ذلك السرد والدبلجة وإمكانية الوصول ومعظم الكلام المضمّن في المنتجات.

ابقَ إذا كنت تشتري المنظومة — مكتبة الأصوات، ومستويات زمن الاستجابة، ومنتجات الدبلجة والوكلاء — أو إذا كان عبء عملك يغلب عليه مقاطع كلامية قصيرة جدًا حيث يعاقبك عدّاد الصوت لكل ثانية. ابقَ أيضًا إذا كنت قد ضبطت بدقة هوية صوتية على ElevenLabs يتعرّف عليها مستخدموك، لأن استمرارية الصوت ميزة من ميزات المنتج، وإعادة إنشائها على نموذج جديد تُعدّ مشروعًا بحد ذاته.

في كلتا الحالتين، الخطوة العاقلة هي تشغيل كليهما لمدة شهر على حركة مرور حقيقية قبل الالتزام، وهذا هو السبب وراء عدم ربط أي منهما مباشرة بقاعدة التعليمات البرمجية الخاصة بك. يضع OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش، لذا فإن أي تغيير في السعر من أي من المختبرين يصل إلى فاتورتك في اليوم نفسه بدلًا من وقت التجديد، والتبديل التلقائي عند الفشل يُبقي مسار الكلام الإنتاجي حيًّا عندما يسوء سلوك نقطة نهاية جديدة تمامًا. نحن لا نستضيف ElevenLabs — فطبقا التركيب والوكيل لديها هما منتجها الخاص — ولا نستضيف نقاط نهاية Gemini 3.8 TTS، التي تأتي من واجهة برمجة تطبيقات Google. ما نقدمه هو طبقة النص الأساسية والتوجيه الذي يعلوها.

الرقم الجدير بالمتابعة هو تقييم Elo الخاص بـ Eleven v3 في التحديث القادم للوحة الصدارة. ثلاث وتسعون نقطة عجز كبير بالنسبة إلى نموذج يتقاضى ثلاثة أضعاف السعر، وإذا ضاق مجال الثقة دون أن تُغلق الفجوة، فإن حجة السعر تكفّ عن كونها مقايضة وتصبح حكمًا.