بطاقة رئيسية مُنشأة بعنوان «Gemini 3.8 Flash TTS يقول مرحبًا» على خلفية بيضاء بلمسات متدرجة ناعمة من الأزرق والسماوي. تحتوي بطاقة مستديرة عريضة على أيقونة موجة صوتية بجانب «30 صوتًا من الاستوديو» و«130 لغة» و«لكل رمز صوتي»، مع بطاقة ثانية على اليمين مكتوب عليها «Flash-Lite TTS - 101 لغة». ويقول سطر التذييل «Gemini API، 23 سبتمبر 2026. أرقام المورّد.» وشعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

Gemini 3.8 Flash TTS يقول مرحبًا: Google تقسم خطها الصوتي إلى قسمين وتخفض السعر

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أطلق المورّد نموذجَي صوت في 23 سبتمبر 2026، وقد صيغ الإعلان وكأن العنوان الرئيسي هو جودة الصوت. لكن الأمر ليس كذلك. Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS هما أول نموذجَي تحويل النص إلى كلام يضعهما المورّد على Gemini Developer API بسعر أقل من نموذج المعاينة الذي يحلّان محله — وبالنسبة لأي شخص كان يدفع لكل حرف في مكان آخر، فهذا هو الجزء الذي يغيّر بند الميزانية. سعر إخراج الصوت في Gemini 3.8 Flash TTS هو 9.00 دولارات لكل مليون توكن حتى نهاية 2026. تُحتسب فاتورة الصوت بواقع 25 توكنًا في الثانية، ما يعادل نحو 0.02 سنت لكل ثانية من الكلام المولَّد. النموذج الذي يخلِفه، Gemini 3.1 Flash TTS Preview، كان سعره 20.00 دولارًا لكل مليون توكن صوتي.

النصف الثاني من القصة هو أن هناك الآن نموذجان، وليس نموذجًا واحدًا. قسّمت Google الخط: يحمل Flash TTS مجموعة اللغات الكاملة ومعدل الصوت الأعلى، بينما يأتي Flash-Lite TTS بقائمة لغات أقصر وسعر أرخص. هذا شكل مختلف عن ترتيب نموذج المعاينة الواحد الموجود على API منذ أبريل، وهو يخبرك كيف ترى Google شكل السوق — عدد صغير من التطبيقات التي تحتاج إلى 130 لغة واستنساخ الصوت، وعدد أكبر بكثير يحتاج إلى صوت إنجليزي كفؤ لروبوت دعم ولا شيء آخر.

ما الذي تم شحنه فعليًا في 23 سبتمبر

كلا الطرازين متاحان عمومًا على Gemini API وفي AI Studio اعتبارًا من وقت الإعلان، وليسا محجوبين خلف قائمة انتظار. الأسماء على واجهة API هي gemini-3.8-flash-tts وgemini-3.8-flash-lite-tts.

• Flash TTS — 130 لغة، مع اكتشاف تلقائي للغة من النص، و30 صوتًا استوديو مُعدًّا مسبقًا من بينها Kore وPuck.

• Flash-Lite TTS — 101 لغة، نفس واجهة تصميم الأصوات، مصنّف ضمن الفئة عالية الحجم.

• كلاهما — تصميم الصوت من وصف باللغة الطبيعية، وتوجيه الأداء سطرًا بسطر، وترتيب مشهد بمتحدثين اثنين، وإشارات غير لفظية مكتوبة مباشرة في النص.

• الإخراج — WAV 24 كيلوهرتز أحادي القناة 16-بت PCM موقّع على نقطة النهاية الأحادية؛ PCM بدون ترويسة (audio/l16) على نقطة نهاية البث؛ يُقبل أيضًا audio/mulaw وaudio/alaw، مع معدل عينات قابل للتهيئة.

قائمة الأسعار، لكل مليون رمز، تستحق القراءة كاملة لأن الفئات تختلف بأكثر من الرقم الرئيسي:

• Flash TTS Standard — 0.50 دولار للنص المُدخل / 9.00 دولار للصوت المُخرج، وترتفع إلى 1.00 / 18.00 دولار بعد 31 ديسمبر 2026.

• Flash TTS Batch وFlex — ‏0.25$ / 4.50$.

• أولوية Flash TTS — 0.90 دولار / 16.20 دولار.

• Flash-Lite TTS القياسي — 0.50 / 6.00 دولار، ليرتفع إلى 1.00 / 12.00 دولار بعد 31 ديسمبر 2026.

• Flash-Lite TTS Batch و Flex — ‏$0.25 / $3.00.

• أولوية Flash-Lite TTS — 0.90 $ / 10.80 $.

Gemini 3.1 Flash TTS Preview، للمقارنة — $1.00 / $20.00، الدفعات $0.50 / $10.00.

النافذة الترويجية هي الأمر الجدير بالملاحظة. قامت Google بتسعير كلا الطرازين الجديدين بنصف السعر حتى نهاية العام ونشرت أرقام ما بعد الترويج في نفس الجدول. أي شخص يقوم بنمذجة التكلفة لكل ألف دقيقة يجب أن يستخدم رقم يناير، وليس رقم سبتمبر.

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

تصميم الصوت هو القدرة الجديدة الحقيقية

الأصوات الجاهزة مسبقًا أصبحت الحد الأدنى. ما أضافه Google في 3.8 هو طريقة لوصف صوت بالكلمات والحصول عليه، وطريقة لاستنساخ صوت من عيّنة قصيرة مصحوبة بفحص للموافقة.

يأخذ تصميم الصوت مطالبة بلغة طبيعية — السرعة، والجرس، واللكنة، وهو النوع الذي قد تقضي بعد الظهر في تجربته — ويعيد صوتًا قابلًا للاستخدام دون تسجيل مرجعي. أما استنساخ الصوت فيسير في الاتجاه المعاكس: تقدّم عينة مدتها 30 ثانية، فيتحقق النظام من الموافقة، ويُوسم الصوت الناتج بعلامة SynthID المائية وبيانات اعتماد C2PA على الصوت المُنشأ. وتُدرج إعادة مزج الصوت، التي تتيح لك دمج صوت مخصص موجود أو تعديله، على أنها ستتوفر قريبًا لا أنها متاحة بالفعل.

تأتي الأصوات المخصصة بنوعين، وتختلف طريقة عملها اختلافًا كافيًا بحيث يكون هذا التمييز مهمًا في بيئة الإنتاج. تُخزَّن الأصوات المخصصة ذات الحالة على مستوى المشروع، بحد أقصى 200 لكل مشروع، مع مدة صلاحية سنة واحدة. ويُشار إلى الأصوات عديمة الحالة بواسطة voicekey_... معرّف، وتنتهي صلاحيتها بعد سبعة أيام. إذا كان تطبيقك يوفّر صوتًا لكل عميل، فإن الحد الأقصى ومدة الصلاحية (TTL) هما الرقمان اللذان يحددان ما إذا كنت بحاجة إلى طبقة تخزين خاصة بك.

أدوات التحكم في الإلقاء هي النصف الآخر من "الجديد". يمكنك توجيه السطر كما توجّه ممثلًا — الوتيرة، التشديد، النبرة العاطفية — بدلًا من مجرد اختيار صوت والأمل. يمكن إخراج مشاهد ثنائية المتحدثين داخل مكالمة واحدة. والأصوات غير اللفظية عناصر نصية من الدرجة الأولى: <laughs>، <sigh> و <gasp> كإشارات مضمّنة، إضافة إلى |mhm| و |yeah| لأصوات التفاعل الخلفي الصغيرة التي تجعل المحادثة الاصطناعية تبدو كمحادثة. يُزعم أن القراءة الطويلة تحافظ على هوية المتحدث مع انحراف ضئيل، وهو نمط الفشل الذي يظهر أولًا عند توليد فصل من كتاب صوتي مدته 40 دقيقة.

الاختبارات المعيارية، ومن قام بتشغيلها

تستند المواد الترويجية لإطلاق Google إلى تقييمين خارجيين ومجموعة من المراكز في الساحة. وكلها مُبلَّغ عنها من المورّد — أي أن Google تنقلها عن غيره، والتشغيلات الأساسية وراءها ليست علنية — لذا تعامل معها بوصفها ادعاءات لا قياسات.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• معيار Hume AI لتصميم الأصوات — حلّ Gemini 3.8 Flash TTS في المرتبة الأولى بنتيجة 71.4، وجاء في المرتبة الأولى في نمذجة اللكنة بنتيجة 60.8.

• مؤشر Hume للجودة الإجمالية — Flash TTS أولاً، وFlash-Lite TTS ثانياً.

• التفضيل الأعمى في Speech Arena — المراكز الأولى التي حققتها اليابانية والبرتغالية البرازيلية والفيتنامية والعربية الفصحى والإسبانية المكسيكية والهندية.

• مقابل Gemini 3.1 Flash TTS — تدّعي Google تحقيق مكاسب في الاتساق مع النصوص الطويلة والتحكم في سيناريوهات الحوار الثنائي بين المتحدثين، وهما بالضبط الأمران اللذان صُمِّمت من أجلهما ميزات توجيه الإلقاء.

يستحق التناقض الموثق الإشارة إليه لأنه سيربك أي شخص يقارن المصادر. تصف تدوينة المدونة مكتبة تضم أكثر من 2000 صوت جاهز للإنتاج. أما وثائق المطورين فتصف "مئات" من الأصوات في Extended Voice Library إلى جانب 30 صوت استوديو مُعدًّا مسبقًا. وقد نقلت تغطية الطرف الثالث أرقامًا أعلى بمرتبة قدر أخرى. لا يمكن التوفيق بين هذه الأرقام من الخارج — القراءة الأمينة هي أن المجموعة المُعدّة مسبقًا والتي تحصل عليها افتراضيًا هي 30، وأن Extended Voice Library أكبر وموصوفة بشكل غامض، وأن الأرقام الكبيرة تشير إلى كتالوج يتضمن أصواتًا أنشأها المستخدمون. إذا كان عدد الأصوات يشكل عاملًا حاسمًا في قرارك، فاختبر الصوت المحدد الذي تحتاجه بدلًا من الوثوق بأي من الأرقام الثلاثة.

ماذا يعني إذا كنت تبني عليه

التغيير العملي هو أن تحويل النص إلى كلام انتقل من بند متخصص إلى شيء يمكنك وضعه في نموذج التكلفة نفسه الذي تستخدمه لرموز لغتك. عند 25 رمزًا في الثانية، تكون ساعة من الصوت المُولَّد 90,000 رمز صوتي، وهو ما يعادل نحو 54 سنتًا بسعر Flash-Lite الترويجي. هذا رخيص بما يكفي لتصبح المسألة المثيرة للاهتمام ليست "هل نستطيع تحمل تكلفة صوت اصطناعي" بل "أي من الفئتين تحتاج إليها هذه الواجهة".

التغيير العملي الثاني هو أن نموذج TTS الجديد تمامًا هو بالضبط النوع الذي تريد تجربته دون المراهنة بمسار إنتاجي عليه. وهذا هو المبرر لوضع نموذج جديد خلف موجّه بدل توصيله مباشرةً: إذ يوفّر OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح، كما أن تجاوز الفشل التلقائي لديه يعني أن نقطة نهاية صوتية جديدة تتذبذب تحت الحمل تتدهور إلى نموذج تثق به بالفعل بدل إسقاط المكالمة. نحن لا نستضيف نقاط نهاية TTS الخاصة بـ Gemini 3.8 — فهي تأتي من واجهة برمجة التطبيقات الخاصة بـ Google — لكن طبقة النص الكامنة تحت الصوت، ومسار الاحتياط عند فشل استدعاء التوليف، هما الجزءان اللذان وُجد الموجّه من أجلهما فعليًا.

ما الذي لا يزال مفقودًا؟

هناك ثلاثة أمور غائبة عن الإطلاق، وكل واحد منها يمثل قيدًا حقيقيًا، لا مجرد ملاحظة تافهة.

لا يوجد تقييم مستقل منشور. أرقام Hume من Google هي استشهاد المورّد بمعيار طرف ثالث، وهذا أفضل من لا شيء وأسوأ من تدقيق. حتى تنشر Artificial Analysis أو ما يعادلها تشغيلها الخاص على النماذج نفسها، يجب قراءة كل ادعاء بشأن الجودة في هذا المقال على أنه ادعاء.

لا يوجد خيار أوزان مفتوحة. كلا النموذجين مغلقان ويعملان عبر واجهة برمجة التطبيقات فقط، مما يضعهما في فئة مختلفة عن نماذج الكلام المفتوحة التي ظهرت في نفس الساحة. إذا كان نشرك يتطلب تشغيل النموذج بنفسك، فإن هذا الإطلاق لا يخدمك.

وتنتهي الأسعار الترويجية. سعر يناير 2027 لـ Flash TTS هو ضعف سعر سبتمبر، وأي دراسة جدوى مبنية على أرقام الإطلاق ستحتاج إلى إعادتها في الربع الأول. هذا ليس انتقادًا — فالإعلان عن الرقمين مقدمًا أكثر صدقًا مما يفعله معظمهم — لكنه الرقم الذي يجب أن يكون في جدول البيانات.

لم تُصرّح Google بما إذا كان Gemini 3.1 Flash TTS Preview سيتوقف العمل به، بل قالت فقط إن Flash-Lite TTS مُوجَّه ليكون بديله الأساسي المعتمد. وعلى أي شخص لا يزال يستخدم النموذج التجريبي أن يخطّط للانتقال بدلًا من انتظار إشعار بالتوقف.

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.