כרטיס Hero שנוצר עבור 'Gemini 3.8 Flash TTS says hello' על רקע לבן עם הדגשות גרדיאנט רכות בכחול וציאן. כרטיס מעוגל ורחב מכיל סמל צורת גל לצד '30 קולות אולפן', '130 שפות' ו'לכל אסימון אודיו', עם כרטיס שני מימין שעליו כתוב 'Flash-Lite TTS - 101 שפות'. שורת פוטר מציינת 'Gemini API, 23 בספטמבר 2026. נתוני ספק.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.8 Flash TTS אומר שלום: גוגל מפצלת את קו הדיבור שלה לשניים ומורידה את המחיר

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הספק השיק שני מודלי דיבור ב-23 בספטמבר 2026, וההודעה כתובה כאילו הכותרת הייתה איכות הקול. היא לא. Gemini 3.8 Flash TTS וGemini 3.8 Flash-Lite TTS הם המודלים הראשונים לטקסט לדיבור שהספק העלה ל-Gemini Developer API במחיר נמוך מזה של מודל התצוגה המקדימה שהם מחליפים — ולכל מי שמשלם לפי תו במקום אחר, זה החלק שמשנה שורת תקציב. תעריף פלט האודיו ב-Gemini 3.8 Flash TTS הוא 9.00 דולר למיליון טוקנים עד סוף 2026. חיוב האודיו הוא 25 טוקנים לשנייה, מה שמסתכם בבערך 0.02 סנט לשנייה של דיבור מיוצר. המודל שהוא מחליף, Gemini 3.1 Flash TTS Preview, תומחר ב-20.00 דולר למיליון טוקני אודיו.

החצי השני של הסיפור הוא שכעת יש שני מודלים, ולא אחד. גוגל פיצלה את הקו: Flash TTS נושאת את מערך השפות המלא ואת קצב האודיו הגבוה יותר, ואילו Flash-Lite TTS נושאת רשימת שפות קצרה יותר ומחיר זול יותר. זהו מבנה שונה מההסדר של מודל תצוגה מקדימה יחיד שנמצא ב-API מאז אפריל, והוא מספר לך כיצד גוגל תופסת את השוק — מספר קטן של אפליקציות שזקוקות ל-130 שפות ולשכפול קול, ומספר גדול בהרבה שזקוקות לקול אנגלי ראוי עבור בוט תמיכה ולא לשום דבר אחר.

מה בעצם הושק ב-23 בספטמבר

שני המודלים זמינים באופן כללי ב-Gemini API וב-AI Studio החל מרגע ההכרזה, ולא חסומים מאחורי רשימת המתנה. השמות ב-API הם gemini-3.8-flash-tts וgemini-3.8-flash-lite-tts.

• Flash TTS — 130 שפות, זיהוי שפה אוטומטי מתוך הטקסט, 30 קולות אולפן מובנים מראש כולל Kore ו-Puck.

• Flash-Lite TTS — 101 שפות, אותו ממשק עיצוב קולי, ממוצב כדרג הנפח הגבוה.

• שניהם — עיצוב קולי מתוך תיאור בשפה טבעית, הכוונת הגשה שורה-אחר-שורה, בימוי סצנה עם שני דוברים, ורמזים לא-מילוליים הכתובים ישירות לתוך התסריט.

• פלט — WAV 24 kHz מונו PCM מסומן 16 סיביות בנקודת הקצה האונארית; PCM ללא כותרת (audio/l16) בנקודת הקצה הזורמת; audio/mulaw ו-audio/alaw מתקבלים גם כן, עם קצב דגימה הניתן להגדרה.

לוח התעריפים, לכל מיליון טוקנים, שווה קריאה במלואו, מפני שהדרגות נבדלות זו מזו ביותר מאשר המספר הכותרתי:

• Flash TTS Standard — ‏$0.50 לקלט טקסט / ‏$9.00 לפלט אודיו, עולה ל-‏$1.00 / ‏$18.00 לאחר 31 בדצמבר 2026.

• Flash TTS Batch ו-Flex — $0.25 / $4.50.

• Flash TTS Priority — $0.90 / $16.20.

• Flash-Lite TTS Standard — $0.50 / $6.00, ולאחר 31 בדצמבר 2026 יעלה ל-$1.00 / $12.00.

• Flash-Lite TTS Batch ו-Flex — $0.25 / $3.00.

• Flash-Lite TTS Priority — $0.90 / $10.80.

Gemini 3.1 Flash TTS Preview, לשם השוואה — $1.00 / $20.00, אצווה $0.50 / $10.00.

חלון המבצע הוא הדבר שצריך לשים לב אליו. גוגל תימחרה את שני הדגמים החדשים בחצי תעריף עד סוף השנה ופרסמה את המספרים שלאחר המבצע באותה טבלה. כל מי שבונה מודל לעלות לאלף דקות צריך להשתמש בנתון של ינואר, ולא בזה של ספטמבר.

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

עיצוב קול הוא היכולת החדשה באמת

קולות מוכנים מראש הם תנאי סף. מה שגוגל הוסיפה ב-3.8 הוא דרך לתאר קול במילים ולקבל אותו, ודרך לשכפל קול מדגימה קצרה עם בדיקת הסכמה מצורפת.

עיצוב קול מקבל הנחיה בשפה טבעית — קצב, גוון, מבטא, מהסוג שאחרת היית מבלה עבורו אחר צהריים שלם באודישנים — ומחזיר קול שמיש בלי הקלטת ייחוס. שכפול קול עובד בכיוון ההפוך: אתה מספק דגימה של 30 שניות, המערכת מאמתת הסכמה, והקול המתקבל מסומן בסימן מים של SynthID ובאישורי C2PA על האודיו שנוצר. רמיקס קול, שמאפשר למזג או לשנות קול מותאם אישית קיים, מוצג כ"בקרוב" ולא כמשוחרר.

קולות מותאמים אישית מגיעים בשני סוגים והם מתנהגים באופן שונה מספיק כדי שההבחנה ביניהם תהיה חשובה בסביבת ייצור. קולות מותאמים אישית עם מצב (stateful) נשמרים עבור הפרויקט, עם תקרה של 200 לפרויקט, וזמן חיים (TTL) של שנה. קולות ללא מצב (stateless) נגישים באמצעות voicekey_... שהוא מזהה, ופג תוקפם לאחר שבעה ימים. אם האפליקציה שלך מקצה קול לכל לקוח, המגבלה וה-TTL הם שני המספרים שמכריעים אם אתה צריך שכבת אחסון משלך.

בקרות ההגשה הן החצי השני של "החדש". אפשר לביים שורה כמו שהייתם מביימים שחקן — קצב, הדגשה, רגיסטר רגשי — במקום רק לבחור קול ולקוות. אפשר לביים סצנות של שני דוברים בתוך קריאה אחת. וווקליזציות לא-מילוליות הן רכיבי תסריט ממדרגה ראשונה: <laughs>, <sigh> ו-<gasp> כרמזים מוטמעים, ובנוסף |mhm| ו-|yeah| עבור קולות התגובה הקטנים שהופכים שיחה סינתטית לשיחה שנשמעת כמו שיחה. נטען כי קריאה ארוכה שומרת על זהות הדובר עם סחיפה מינימלית, וזהו מצב הכשל שמופיע ראשון כשמייצרים פרק של 40 דקות בספר שמע.

הבנצ'מרקים, ומי הריץ אותם

חומר ההשקה של Google נשען על שתי הערכות חיצוניות ועל מקבץ של מיקומים בזירה. כל אלה מדווחים על ידי הספק — Google מצטטת אותם, וההרצות שעומדות בבסיסם אינן פומביות — לכן התייחסו אליהם כאל טענות ולא כאל מדידות.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• מדד עיצוב הקול של Hume AI — Gemini 3.8 Flash TTS הגיע למקום הראשון עם 71.4, וראשון במידול מבטא עם 60.8.

• מדד האיכות הכולל של Hume — Flash TTS ראשון, Flash-Lite TTS שני.

• העדפה עיוורת ב-Speech Arena — מקומות מובילים הושגו ביפנית, בפורטוגזית ברזילאית, בווייטנאמית, בערבית ספרותית מודרנית, בספרדית מקסיקנית ובהינדי.

• לעומת Gemini 3.1 Flash TTS — גוגל טוענת לשיפורים בעקביות לאורך טקסטים ארוכים ובשליטה בתסריט עם שני דוברים, ואלה בדיוק שני הדברים שתכונות הכוונת ההגשה נועדו להם.

פער מתועד אחד ראוי לציון, משום שהוא יבלבל כל מי שמשווה בין מקורות. בפוסט הבלוג מתוארת ספרייה של יותר מ-2,000 קולות מוכנים להפקה. בתיעוד למפתחים מתוארים "מאות" קולות ב-Extended Voice Library לצד 30 קולות אולפן מובנים מראש. סיקור מצד שלישי ציטט נתונים גבוהים בסדר גודל נוסף. אי אפשר ליישב את אלה מבחוץ — הקריאה ההגונה היא שהסט המובנה מראש שמקבלים כברירת מחדל הוא 30, ש-Extended Voice Library גדול יותר ומתואר באופן מעורפל, ושהמספרים הגדולים מתייחסים לקטלוג שכולל קולות שנוצרו על ידי משתמשים. אם ספירת קולות היא גורם מכריע בהחלטה שלך, בדוק את הקול הספציפי שאתה צריך במקום לסמוך על אף אחד משלושת הנתונים.

מה זה אומר אם אתה בונה על זה

השינוי המעשי הוא שהמרת טקסט לדיבור עברה מסעיף נפרד למומחים למשהו שאפשר להכניס לאותו מודל עלויות כמו טוקני השפה שלך. בקצב של 25 טוקנים לשנייה, שעה של אודיו מיוצר היא 90,000 טוקני אודיו, שבתעריף המבצעי של Flash-Lite הם בערך 54 סנט. זה זול מספיק עד כדי כך שהשאלה המעניינת מפסיקה להיות "האם אנחנו יכולים להרשות לעצמנו קול סינתטי" והופכת ל"איזו משתי השכבות המשטח הזה צריך".

השינוי המעשי השני הוא שמודל TTS חדש לגמרי הוא בדיוק מסוג הדברים שרוצים לנסות בלי להמר עליהם כמסלול פרודקשן. זה הטיעון להציב מודל חדש מאחורי ראוטר במקום לחבר אותו ישירות: OrcaRouter חושף יותר מ-200 מודלים מאחורי מפתח אחד במחיר המחירון של הספק, בלי תוספת, וה-failover האוטומטי שלו מבטיח שנקודת קצה חדשה לדיבור שמתקשה תחת עומס תידרדר למודל שאתם כבר סומכים עליו במקום להפיל את השיחה. אנחנו לא מארחים את נקודות הקצה של Gemini 3.8 TTS — אלו מגיעות מה-API של גוגל עצמה — אבל שכבת הטקסט שמתחת לקול, ומסלול הגיבוי כשקריאת סינתזה נכשלת, הם בדיוק החלקים שראוטר נועד עבורם.

מה עדיין חסר

שלושה דברים חסרים בהשקה, וכל אחד מהם הוא אילוץ אמיתי, לא דקדוקי עניות.

אין הערכה עצמאית שפורסמה. המספרים של Hume מבית Google הם הספק שמצטט בנצ'מרק של צד שלישי, וזה טוב מכלום וגרוע מביקורת. עד ש-Artificial Analysis או גוף מקביל יפרסם הרצה משלו על אותם מודלים, כל טענת איכות במאמר הזה צריכה להיקרא כטענה.

אין אפשרות של משקלים פתוחים. שני המודלים סגורים ומיועדים ל-API בלבד, מה שמציב אותם בקטגוריה שונה ממודלי הדיבור הפתוחים שנחתו לאחרונה באותה זירה. אם הפריסה שלך מחייבת הרצה של המודל בעצמך, ההשקה הזו אינה מיועדת לך.

והתמחור הפרומוציוני מסתיים. התעריף של ינואר 2027 עבור Flash TTS הוא כפול מהתעריף של ספטמבר, וכל תוכנית עסקית שנבנתה על מספרי ההשקה תצטרך להיעשות מחדש ברבעון הראשון. זו אינה ביקורת — לפרסם את שני המספרים מראש הוא ישר יותר מרוב — אבל זה המספר ששייך לגיליון האלקטרוני.

גוגל לא הודיעה אם Gemini 3.1 Flash TTS Preview יוצא משימוש, אלא רק ש-Flash-Lite TTS ממוצב כמחליף העיקרי שלה. כל מי שעדיין משתמש במודל ה-Preview צריך לתכנן הגירה במקום להמתין להודעת השבתה.

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.