
أنشئ وانشر صوتًا مخصّصًا باستخدام Gemini 3.8 Flash TTS: تصميم الصوت، والاستنساخ، والساعتان اللتان تقرران
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 506 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 184 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
يتيح لك Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS معًا ابتكار صوت من وصف مكتوب بدلًا من اختيار صوت من قائمة، وقد أصبح كلاهما متاحًا عمومًا على Gemini API في 23 سبتمبر 2026. والعنوان الأبرز الذي يكرره الناس هو تصميم الصوت. أما الجزء الذي يستحق التخطيط له فهو ما يحدث للصوت المُصمَّم بعد ذلك، لأن المورّد يمنحك طريقتين للاحتفاظ به ويربط بكلٍّ منهما مدة صلاحية مختلفة. اختر الطريقة الخاطئة، وسينتهي الصوت الذي يعتمد عليه منتجك خلال أسبوع.
تلك هي الفجوة في تغطية الإطلاق حتى الآن. تشرح منشورات الإعلان أنه يمكنك استدعاء صوت إلى الوجود عبر المطالبة النصية، ويشير بعضها إلى الاستنساخ من عيّنة مدتها 30 ثانية. لكن أياً منها لا يستعرض نموذج التخزين، وهو ما يحدد ما إذا كان خط أنابيب الكلام قابلاً لإعادة إنتاجه من ملف إعدادات أم يجب إعادة تزويده وفق جدول زمني. تتناول هذه المقالة المسار كاملاً — التصميم، والتخزين، والاستدعاء، والدفع — بالأسعار والحصص كما تنشرها Google.
ما الذي صدر في 23 سبتمبر
نموذجان، ومخطط API واحد. المعرّفات هي gemini-3.8-flash-tts وgemini-3.8-flash-lite-tts، وتوضح وثائق Google صراحةً أن كليهما يستخدمان "نفس مخطط API وتنسيق التلقين نفسه تمامًا" — فالانتقال بينهما تغيير لمعامل واحد، وليس إعادة كتابة.
• المدخل — نص فقط. يقبل كلا النموذجين النص ويعيدان صوتًا؛ فهما ليسا متعددي الوسائط ولا يولّدان نصًا في المقابل.
• الإخراج — WAV، PCM أحادي 24 كيلوهرتز، 16 بت موقّع على نقطة النهاية الأحادية؛ PCM بدون ترويسة (audio/l16) على نقطة النهاية المتدفقة؛ audio/mulaw وaudio/alaw مقبولان بمعدل عينات قابل للتكوين.
• اللغات — 130 على Flash TTS، و101 على Flash-Lite TTS، تُكتشف تلقائيًا من النص بدلًا من الإعلان عنها في الطلب.
• الأصوات — 30 صوتًا استوديو منسّقًا مُدرجة في الوثائق (من بينها Kore وPuck)، ومكتبة أصوات موسّعة تضم "مئات" إضافية قابلة للاستعلام عبر نقطة نهاية voices، بالإضافة إلى مساري الإنشاء أدناه.
• التوجيه — تحكّم في الإلقاء سطرًا بسطر، ومشاهد ثنائية المتحدثين مُخرجة من نص واحد، وإشارات غير لفظية مثل <laughs> و<sigh> و|mhm| مكتوبة مباشرةً في النص.
الطبقتان موجودتان لأن أحمال العمل تباعدت. تم وضع Flash TTS لتحقيق أقصى دقة صوتية وتمثيل معقد؛ يوصف Flash-Lite TTS في كلمات Google نفسها بأنه "البديل الأساسي" لـ gemini-3.1-flash-tts-preview، الذي يهدف إلى الدبلجة بالجملة وميزات القراءة بصوت عالٍ وتتابعات وكلاء الصوت. كلاهما يحل محل نموذج معاينة واحد كان على واجهة API منذ أبريل 2026، لذا إذا كنت على المعاينة، فإن الترحيل هو قرار طبقة وليس ترقية إصدار.

تصميم صوت هو برومبت، وهذا يغيّر خطوة المراجعة.
سطح الإنشاء هو الشيء الجديد حقًا في هذا الجيل. مُوجَّه صوت يُبنى من وصف باللغة الطبيعية — الدور، اللكنة، الطابع الصوتي — ويُرجع مُعرّفًا تعيد استخدامه. في واجهة API، هذا استدعاء إنشاء صوت مع store: true ومدخل مُوجَّه؛ في أمثلة Google نفسها، تتراوح الأوصاف من دي جي ملبورن عالي الطاقة إلى تنين ياباني. بمجرد إنشائه، يُشار إلى الصوت في طلب كلام بواسطة مُعرّفه، ويمكن بعد ذلك أن تكون تعليمات النمط لكل طلب ضئيلة أو فارغة، لأن الشخصية أصبحت مدمجة بالفعل في الصوت.
النتيجة العملية هي تغيير في سير العمل، لا مجرد ميزة. كان اختيار الأصوات فيما مضى تفاوضًا على ترخيص أو حجزًا في استوديو، ما يعني أن اختيار الصوت كان يحدث مرة واحدة، مبكرًا، ويصمد أمام المراجعة لأن تغييره كان مكلفًا. عندما يكون الصوت فقرة نصية، يصبح اختياره رمزًا تصميميًا — شيئًا يمكن لمدير منتج أن يطلب إعادة توليده يوم الثلاثاء. الفرق التي تضع سلسلة الوصف في التحكم في المصدر وتتعامل مع معرّف الصوت المولّد باعتباره مخرَج بناء ستحصل على ناتج متسق عبر البيئات. أما الفرق التي تنشئ الأصوات يدويًا في AI Studio فلن تفعل ذلك، وسيبدو الفشل كاختلاف غير قابل للتفسير بين صوت بيئة الاختبار وصوت الإنتاج.
الساعتان
هذا هو الجزء الذي تتجاهله منشورات الإطلاق. تتيح لك Google الإبقاء على صوت مُصمَّم أو مُستنسخ في إحدى حالتين، وتنتهي صلاحية كلتيهما بمعدلات مختلفة اختلافًا هائلًا.
• الأصوات المخزّنة — التي أُنشئت مع تمكين التخزين، توجد في مشروعك وتخضع لحصة قدرها 200 صوت لكل مشروع مع مدة بقاء تبلغ سنة واحدة.
• مفاتيح بلا حالة — يمكن أن يُرجع تكرار الصوت مفتاحاً يديره العميل (بصيغة voicekey_…) بدلاً من معرّف مخزّن، ولهذا المفتاح عمر سبعة أيام.
عند قراءتهما معًا، يُعدّ هذان الخياران تعليمة تصميمية. الصوت المخزَّن هو التزام يمتد لسنة وسقف صارم قدره 200 لكل مشروع، وهو سخيّ لمنتج له طاقم ثابت وعديم الجدوى مع أي شيء يولّد صوتًا جديدًا لكل عميل. المفتاح عديم الحالة هو العكس: لا ضغط حصص، لكنه مفتاح عليك إعادة إصداره أسبوعيًا، ما يعني أن تطبيقك يحتاج إلى مسار تحديث، وأن بنيتك التحتية تحتاج إلى تخزين بيانات اعتماد تتبدّل. لا أحد الخيارين خطأ. أن تختار من دون أن تلاحظ أيّهما اخترت هو ما يجعل وكيلًا صوتيًا يصمت في اليوم الثامن.
تأتي خاصيتان إضافيتان مرتبطتان بالاستنساخ، ويستحقّان المعرفة قبل أن تَعِد فريقًا قانونيًا بأي شيء. يتطلّب إنشاء صوت مستنسخ تسجيل موافقة شفهية من صاحب الصوت يجب أن يطابق المتحدث المرجعي — تحقّق منطوق، لا مربع اختيار. ويحمل الناتج بيانات المنشأ: كل مقطع صوتي يحمل علامة مائية SynthID، كما تحمل الأصوات المستنسخة إضافةً إلى ذلك بيانات اعتماد محتوى C2PA. ومسار التصميم هو عمدًا الأصعب من حيث إساءة الاستخدام، وكلا الحاجزين بنيويان وليسا مجرد تصريحات سياسات.
ثمة تناقض جدير بالإشارة إليه بدلًا من حلّه. يسرد جدول النماذج المدعومة من Google كلاً من تصميم الصوت واستنساخ الصوت كمتاحين على كلا نموذجي 3.8 TTS. وتصف معظم تغطية الإطلاق الاستنساخ بأنه جزء من قصة Flash TTS تحديدًا. إذا كان الاستنساخ مهمًا في قرارك بين الطبقتين، فتحقّق منه في وثائق الطبقة التي تنوي إطلاقها بدلًا من الوثوق بأيٍّ من الملخّصين.
كم تكلفة ساعة من الصوت
تتقاضى Google مقابل الكلام بالوحدات الرمزية (tokens)، لا بالأحرف أو الثواني، ومعادلة التحويل منشورة: تُحتسب الصوت بمعدل 25 وحدة رمزية لكل ثانية من الإخراج، أي 90,000 وحدة رمزية في الساعة. وهذا يجعل الحساب بسيطًا بشكل غير معتاد، وهو الرقم الذي ينبغي إدراجه في الميزانية بدلًا من السعر لكل مليون.
• Flash TTS standard — 0.50 دولار لكل مليون رمز نصي عند الإدخال، و9.00 دولارات لكل مليون رمز صوتي عند الإخراج حتى 31 ديسمبر 2026، ثم 1.00 دولار و18.00 دولارًا. Batch وFlex بسعر 0.25 دولار و4.50 دولارات؛ أما Priority فبسعر 0.90 دولار و16.20 دولارًا.
• Flash-Lite TTS القياسي — 0.50 دولار و6.00 دولارات حتى نفس التاريخ، ثم 1.00 دولار و12.00 دولارًا. Batch وFlex: 0.25 دولار و3.00 دولارات؛ Priority: 0.90 دولار و10.80 دولارًا.
• على أساس الثواني — يبلغ Flash TTS نحو 0.81 دولار لكل ساعة من الصوت المُولَّد خلال النافذة الترويجية، ونحو 1.62 دولار بعدها؛ أما Flash-Lite TTS فيبلغ نحو 0.54 دولار ثم 1.08 دولار.
• مقارنةً بالطراز الذي يحل محلّه — gemini-3.1-flash-tts-preview يُسعَّر عند 1.00 دولار و20.00 دولار لكل مليون، لذا انخفض بند إخراج الصوت بنسبة 55 بالمئة في Flash TTS و70 بالمئة في Flash-Lite TTS.
لا تخطط على أساس الرقم الترويجي. تنشر Google العمودين في الجدول نفسه، ما يعني أن سعر يناير ليس شائعة يُكتشف لاحقًا — بل هو على البطاقة اليوم، وأي تقدير لكل ألف دقيقة مبني على $0.81 يجب أن يصمد أمام مضاعفته.
عدد واحد مستقل، وعدة أعداد ليست كذلك.
يبدأ إعلان Google بنتائج المعايير، وينبغي قراءتها على ما هي عليه تمامًا. وتقول الشركة إن Flash TTS حصد المركز الأول في Voice Design Benchmark من Hume AI بدرجة 71.4، وتصدّر نمذجة اللكنات بدرجة 60.8، وإن Flash TTS وFlash-Lite TTS احتلا المركزين الأول والثاني في Overall Quality Index من Hume، مع مراتب قوية في التفضيل الأعمى على Voice Arena لليابانية، والبرتغالية البرازيلية، والفيتنامية، والعربية الفصحى، والإسبانية المكسيكية، والهندية. وكلها مبلّغ عنها من المورّد، ولا يوجد أي من عمليات التشغيل هذه علنًا.
ثمة تفصيل في تلك القائمة يستحق الانتباه. Alan Cowen، المذكور بوصفه أحد مؤلفي إعلان Google، هو مؤسس Hume AI — المختبر الذي يقدّم معيار Voice Design Benchmark الرقم الرئيسي الوارد. وهذا لا يجعل الرقم خاطئًا، ومعيار Hume معيار حقيقي، لكن الاثنين ليسا مستقلين أحدهما عن الآخر، والقارئ الذي يزن الرقم 71.4 ينبغي أن يعرف ذلك قبل أن يكرره بوصفه تحققًا من طرف ثالث.
الرقم الذي جُمع بشكل مستقل موجود على Provider Voice Arena التابعة لـ Artificial Analysis، وقد جُمع لهذا المقال في 24 سبتمبر 2026: يحتل Gemini 3.8 Flash TTS المرتبة الثانية عند Elo قدره 1,260 مع فاصل 17 نقطة عبر 1,999 عيّنة، خلف Cartesia Sonic 3.6 عند 1,273. يحتل Gemini 3.8 Flash-Lite TTS المرتبة السادسة عند 1,235. الطراز الذي يتم استبداله، Gemini 3.1 Flash TTS، في المرتبة العاشرة عند 1,199 عبر 3,430 عيّنة. تفضيل المستمع الأعمى، وليس تقييم المختبر نفسه — والرقم الوحيد للجودة هنا الذي لم تكلّف Google به.

أين يتم تشغيله، وأين ليس بعد
كلا الطرازين متاحان اليوم في {{Gemini API}} و{{Google AI Studio}}، دون قائمة انتظار. أما واجهات المستهلك والمؤسسات فهي مُجدولة على مراحل لا مُطلقة: إذ سيصل {{Flash TTS}} إلى {{Gemini Notebook}} و{{Flash-Lite TTS}} إلى {{Google Vids}}، ويوصَف الوصول إلى {{Gemini Enterprise}} بأنه «قريبًا»، كما أن إعادة مزج الصوت — أي تعديل الجرس والنغمة والوتيرة واللكنة على صوت موجود — مُدرَجة كميزة مستقبلية لا حاضرة. وإذا كانت خطتك تعتمد على إعادة المزج، فهي غير موجودة بعد.
من جانبنا، الصدق أولًا: نقاط نهاية Gemini 3.8 TTS ليست على جدول التوجيه الخاص بـ OrcaRouter. الجيل الذي تحلّ هذه النقاط محلّه هو — google/gemini-3.1-flash-tts-preview موجود في الكتالوج بالسعرين نفسهما، 1.00 دولار و20.00 دولار لكل مليون رمز، اللذين تنشرهما Google، لأن سعر القائمة لدى المزوّد يُمرَّر من دون أي هامش ربح، وهو يستجيب على نفس نقطة النهاية /v1/audio/speech التي يستهدفها SDK المتوافق مع OpenAI لديك بالفعل. وهذا يهم أكثر مما يبدو لعبء عمل صوتي، لأن ما تشتريه فعليًا هو نقطة نهاية مستقرة يمكن لتطبيقك استدعاؤها بينما تتغير النماذج خلفها. يحتفظ كودك بسلسلة اسم النموذج؛ ويحتفظ الكتالوج بالتوجيه. وعندما تُغلق نافذة Google الترويجية في 31 ديسمبر وتتضاعف Flash TTS، يتغير سعر النموذج الموجّه في اليوم نفسه بدلًا من تجديد العقد التالي — والنموذج الذي يتعطل ينتقل إلى بديل بدلًا من أن يأخذ معه طابور السرد الصوتي لديك.

إذا كنت تقيّم هذا الجيل قبل الالتزام به، فإن التجربة الرخيصة هي تجربة من مستويين. شغّل النص نفسه عبر Flash TTS وFlash-Lite TTS، لأن المخطط متطابق والفرق هو معامل — ثم قرّر باستخدام الصوت الخاص بك بدلًا من مخطط قياس مرجعي، وتحقّق على Artificial Analysis مما إذا كانت فجوة الجودة تصمد أمام هوامش الخطأ الخاصة به قبل أن تدفع العلاوة. في مشروع سرد واسع النطاق، تمثّل العلاوة مالًا حقيقيًا؛ أما في روبوت دعم يقرأ رقم هاتف بصوت مسموع، فليس من الواضح أنها تمنحك شيئًا يمكن للمستمع سماعه.
