بطاقة رئيسية مُولّدة لـ 'Gemini 3.8 TTS: بجعتان، نموذجان' على خلفية بيضاء مع لمسات متدرجة ناعمة بالأزرق والسماوي. ثلاث بطاقات تحمل النص 'Gemini 3.8 Flash TTS — Elo 1,260، المرتبة 2، 8 أصوات في الساحة، 9.00 دولار لكل مليون رمز صوتي'، و'Gemini 3.8 Flash-Lite TTS — Elo 1,235، المرتبة 6، 6.00 دولار لكل مليون رمز صوتي'، و'حوار بمتحدثين — مدعوم، تصميم الصوت، محاكاة خلال 30 ثانية'. ويقرأ سطر التذييل 'Elo وفقًا لـ Artificial Analysis Provider Voice Arena، سبتمبر 2026؛ الأسعار المدرجة وفقًا لـ Google.' وشعار OrcaRouter مُركّب في الزاوية السفلية اليمنى.
Guides & Insights

Gemini 3.8 TTS: بجعتان، ونموذجان، وسعر يتضاعف في يناير

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أسرع طريقة لفهم ما طرحته الشركة في 23 سبتمبر 2026 هي النظر إلى العرض التوضيحي الذي انتشر معه: بجعان يتجادلان حول ما إذا كان ينبغي لهما الانتقال إلى Pacifica Pier، صوت لكل طائر، بأدوار مكتوبة واحدة تلو الأخرى. Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTSهما النموذجان اللذان يقوم عليهما ذلك العرض التوضيحي، وكلاهما متاحان عمومًا على Gemini API، والبجع ليس حيلة تسويقية. إنهما أول شيء في هذا الجيل لم تستطع نماذج Gemini الصوتية السابقة فعله إطلاقًا: متحدثان، توليد واحد، ونص يتحكم في من يقول ماذا.

السعر هو النصف الآخر من القصة، وهو النقطة التي يفترق عندها النموذجان. يفرض Flash TTS رسومًا قدرها 0.50 دولار لكل مليون رمز نصي مُدخل و9.00 دولارات لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم 18.00 دولارًا؛ ويفرض Flash-Lite TTS رسومًا قدرها 0.50 دولار و6.00 دولارات وفق الجدول نفسه، ثم 12.00 دولارًا. هذه هي أسعار Google نفسها. وبعد تحويلها بواسطة Artificial Analysis إلى أساس لكل مليون حرف كي تجلس على اللوحة نفسها مع الجميع، تبلغ 16.50 دولارًا و11.00 دولارًا — أي أرخص بنحو الثلث لنموذج Lite، وكلاهما أقل بكثير مما يتقاضاه المتصدر في تلك اللوحة.

إذن فالسؤال المثير للاهتمام ليس ما إذا كانت النماذج جيدة. بل أيهما ينبغي أن تبني عليه، لأن الفارق بينهما ليس الفارق الذي قد تخمّنه من الأسماء.

ما يحتويه إعلان 23 سبتمبر فعليًا

نموذجان، لا نموذج واحد، وGoogle صريحة في أنهما انقسام وليس نسخة صغيرة ونسخة كبيرة من الشيء نفسه. يذكر الإعلان خمسة أماكن يستقران فيها — Google AI Studio وGemini API وGemini Enterprise وGemini Notebook وGoogle Vids — ومعرّفات API واضحة ومباشرة: gemini-3.8-flash-tts وgemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

قائمة الإمكانات أطول مما يوحي به العنوان الرئيسي. من إعلان Google ووثائق توليد الكلام في Gemini API:

• تصميم الصوت — تصف صوتًا بالكلمات وتحصل مقابل ذلك على معرّف صوت مخصص، بدلًا من الاختيار من قائمة ثابتة.

• استنساخ الصوت — تُنتج عيّنة مدتها 30 ثانية معرّفًا صوتيًا، وهو المسار الذي ستستخدمه معظم الفرق فعليًا لصوت علامة تجارية أو لراوٍ.

• حوار بين متحدثين — حالة البجع. يحمل النص أدوار المتحدثين بدلًا من كتلة نثرية واحدة.

• تنسيق على مستوى الدور — تصف المستندات وسم speech_metadata الذي يُلحق التوجيه بدور معيّن بدلًا من الطلب بأكمله.

• أصوات مُعدّة مسبقًا، بالإضافة إلى مكتبة أصوات موسّعة يمكن الوصول إليها عبر GET /v1beta/voices.

• ثلاثة ترميزات صوتية — WAV افتراضيًا، مع إتاحة mulaw وalaw لمسارات المعالجة المهيأة للاتصالات الهاتفية.

• إدخال نصي فقط، وإخراج صوتي فقط. تذكر الوثائق ذلك بصراحة: لا تأخذ نماذج TTS أي وسائط إدخال أخرى ولا تنتج أي مخرجات أخرى، وهناك قسم منفصل باسم «القيود» يسرد التقييدات.

ما لا يرد في الإعلان هو أي من الأرقام التي يحتاجها مخطط السعة. حدود المعدل، والحصص، ومدة تخزين الصوت المصمَّم، كلها موجودة في الوثائق وصفحة الأسعار، وليس في منشور الإطلاق، وهو السبب المعتاد وراء مرور أسبوع الإطلاق بسلاسة في العروض التوضيحية وبشكل سيئ في الإنتاج.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

البجع هو الخبر الحقيقي

لقد كانت تقنية تحويل النص إلى كلام أحادي المتحدث مشكلة محلولة بما يكفي منذ عامين. ما كان ناقصًا هو نموذج يُبقي هويتين منفصلتين عبر نص طويل دون انحراف، وهذا ما يختبره العرض التجريبي حقًا — لا ما إذا كان الصوت يبدو بشريًا، بل ما إذا كان المتحدث «أ» لا يزال المتحدث «أ» بعد أربع دقائق.

يترتب على ذلك أمران، وهما السبب في أن لهذا أهمية تتجاوز ألعاب البودكاست.

الأول هو أن وحدة العمل تتغير. فمع نموذج أحادي المتحدث، يكون الحوار الذي تبلغ مدته عشرين دقيقة عبارة عن عشرين دقيقة من الصوت تخيطها من تشغيلين مستقلين، وكل وصلة هي موضع يُعاد فيه ضبط التنغيم. أما مع نموذج ثنائي المتحدثين، فهو استدعاء واحد وسياق واحد، ويستطيع النموذج أن يتفاعل مع الجملة التي تسبقه. هذا فرق في الجودة لا يمكنك تعويضه بالمعالجة اللاحقة.

الثاني هو أن تنسيق السكربت يصبح الواجهة. إذا كان خط معالجتك يُخرج بالفعل شيئًا على شكل SSML — تعليق توضيحي لكل عبارة — فإن هذا التوليد يكاد يكون جاهزًا للاستبدال المباشر. وإذا كان خط معالجتك يسلّم نموذجًا جدارًا من النص ويأمل، فلديك الآن سبب لإعادة هيكلته، لأن التنسيق الذي كان ضمنيًا أصبح الآن شيئًا عليك قوله بصوت عالٍ. هذه هي المقايضة نفسها التي تجريها بقية الميدان بطرق مختلفة، وهي المحور الذي يتنافس عليه هذان النموذجان من Google مع كل ما عداها على الساحة.

كم تبلغ تكلفة ساعة من تسجيل صوتي لبجعتيْن؟

من المفيد إجراء حسابات الرموز مرة واحدة، لأن رقم الرموز الصوتية لكل مليون ليس رقمًا لكل ساعة، وقد فاجأ هذا الفرق الناس.

تُنتَج الرموز الصوتية بمعدل ثابت لكل ثانية من الإخراج، لذا تتناسب التكلفة مع طول الصوت النهائي، لا مع طول النص المكتوب. خذ سعر Google نفسه لـ Flash TTS — 9.00 دولارات لكل مليون رمز صوتي مُخرَج — لتجد أن حسابات مقطع نهائي مدته ساعة واحدة تستقر في نطاق الدولارات ذات الرقم الواحد على الفئة القياسية، مع نموذج Lite بثلثي ذلك. أما تسعير Batch وFlex، عند 0.25 دولار للإدخال و4.50 دولارات للإخراج لـ Flash TTS مقابل 0.25 دولار و3.00 دولارات لـ Flash-Lite TTS، فيخفض التكلفة أكثر لأي شيء لا يحتاج إلى التوليد عند الطلب. أما Priority، عند 0.90 دولار و16.00 دولارًا، فهو للأعمال التي تحتاج إلى ذلك.

ثلاث نتائج عملية:

• إعادة توليد فقرة أمر رخيص؛ أما إعادة توليد سلسلة فهو قرار. وبهذه المعدلات، لم يعد الجزء المكلف في مسار معالجة الكلام هو الاستدلال، بل عاد ليكون الإنسان الذي يعتمد التسجيل.

• معدل إدخال النص لا يُذكر. فـ 0.50 دولار لكل مليون رمز نصي مقابل سكربت من بضعة آلاف من الكلمات ليس سوى خطأ تقريب لا يكاد يُذكر بالقياس إلى الجانب الصوتي. لا تُحسّن السكربت من أجل الطول.

• إن الموعد النهائي في 31 ديسمبر حقيقي وهو يضاعف سعر الصوت. وإذا كنت تخطط لإطلاق في 2027، فضع في الميزانية الرقم بعد انتهاء العرض الترويجي، لا رقم الإطلاق، وإلا ستضطر إلى إعادة التخطيط في يناير.

العدد المستقل، والأعداد غير المستقلة.

يأتي أحد الأرقام في هذا الإطلاق من مصدر غير Google. في Artificial Analysis Provider Voice Arena، بحسب لقطة بتاريخ 24 سبتمبر 2026، يحتل Gemini 3.8 Flash TTS المرتبة الثانية بتصنيف Elo قدره 1,260 عبر 1,999 عيّنة و8 أصوات في الساحة، ويحتل Gemini 3.8 Flash-Lite TTS المرتبة السادسة بتصنيف 1,235 عبر 2,000 عيّنة. يقع كلاهما داخل فترتي الثقة الخاصة بالآخر عند ±16 و±17، لذا تخبرك اللوحة أنهما غير قابلين للتمييز إحصائيًا من حيث التفضيل — وهذا نتيجة مفيدة حقًا، لأنها تعني أن الخيار الأرخص ليس أسوأ بشكل قابل للقياس بالنسبة للمستمعين.

كل ما عدا ذلك هو ادعاء Google نفسه وينبغي قراءته على هذا النحو: لغة التعبير، وأعداد اللغات، وجودة الاستنساخ. لا تمنحك الساحة سوى ترتيب تفضيلات، ولا شيء غير ذلك. وهي لا تخبرك كيف يتعامل أي من النموذجين مع نص مدته 40 دقيقة دون انحراف، ولا كيف يتصرف مع اسم علم لم يره من قبل، ولا ما يحدث لصوت مُصمَّم بعد أسبوع.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

يُعدّ طراز Lite أيضًا الحجة الأفضل على أن هذا الثنائي يمثّل انقسامًا حقيقيًا لا مجرد فئة تسويقية. فارق Elo مقداره 25 نقطة يقع داخل هوامش الخطأ، مقابل فارق سعري بنسبة 33%، هو شكل القرار الذي ينبغي لخطوط المعالجة الحساسة للسعر أن تتخذه لصالح Lite في كل مرة تقريبًا — وشكل القرار الذي ينبغي لخطوط المعالجة الحساسة لزمن الاستجابة أن تتخذه في الاتجاه المعاكس، لأن الاثنين يختلفان في التوقيت كما يختلفان في الفاتورة.

أين تشغّله، والنسخة الصادقة من تلك الإجابة

لا تستضيف OrcaRouter نقاط نهاية Gemini 3.8 TTS. ويجدر بنا أن نقول ذلك بوضوح بدلًا من الإيحاء بخلاف ذلك، لأن الأمر المفيد الذي يمكننا قوله عن هذين النموذجين ليس أننا نقدمهما — فنحن لا نفعل ذلك — بل إن خفضًا لسعر من المورّد مثل تغيير الحادي والثلاثين من ديسمبر هو بالضبط نوع الحدث الذي يجعل التوجيه جديرًا بالاقتناء.

يضع OrcaRouter أكثر من 200 نموذج خلف مفتاح API واحد عند سعر قائمة المزوّد دون أي هامش ربح، فما تدفعه هو بطاقة أسعار المزوّد، وأي تغيير عليها يصبح ساريًا لدينا في اليوم نفسه بدلًا من دورة الفوترة التالية. بالنسبة إلى خط معالجة صوتي في منتصف الترحيل، فإن طبقة تجاوز الفشل تهم أكثر من الكتالوج: يمكنك وضع مسار طلب على نموذج لا يزال قيد التقييم دون المخاطرة بمسار إنتاجي عليه، لأن الاستدعاء الفاشل يمكن أن ينتقل إلى شيء ثبت بالفعل. تؤلّف لغة التوجيه DSL عدة نماذج في استدعاء واحد للحالات التي لا يكون فيها صوت واحد جيدًا بما يكفي، ويجيب دمج النماذج على موجّه باستخدام مجموعة من النماذج عندما تكون الإجابة أهم من زمن الاستجابة.

بالنسبة إلى نماذج Gemini 3.8 TTS نفسها، فالمكان الذي تُستدعى منه هو واجهة برمجة التطبيقات API الخاصة بـ Google، والواجهات التي سمّتها Google في 23 سبتمبر. ما يفعله هذا الثنائي بمعماريتك — استدعاء واحد لمتحدثين اثنين، والتنسيق كتعليق، وصوت يمكن وصفه بدلًا من اختياره — هو الجزء الذي يبقى بعد انتهاء خصم الإطلاق.

ماذا تشاهد بعد ذلك

ثلاثة أمور ستحدد ما إذا كان هذا الجيل قفزة نوعية أم مجرد ميزة.

الأول هو الانحراف. لم ينشر أحد تقييمًا مطوّلًا لما إذا كان مسار المتحدثين يحافظ على الهوية على مدار ساعة كاملة، وحتى يفعل أحدهم ذلك، فإن عرض pelican يظل مجرد عرض. الثاني هو عمر الصوت. الصوت المصمم الذي تنتهي صلاحيته خلال أسبوع هو نموذج أولي؛ أما الصوت الذي يمكن إعادة اشتقاقه من إعدادات مخزنة فهو منتج، وتعتمد الإجابة على أي من المعرفين تحتفظ به. الثالث هو ما يحدث بعد 31 ديسمبر، عندما ينتهي السعر الترويجي وتتضاعف تكلفة خط أنابيب الكلام لكل ساعة بين عشية وضحاها.

لا شيء من تلك مرئي من منشور الإطلاق. الثلاثة كلها مرئية من الوثائق، وهو الموضع الذي تتوقف فيه تغطية الإطلاق عن القراءة.