כרטיס הירו שנוצר עבור 'יצירה ופריסה של אודיו מותאם אישית' עם כתובית המשנה 'Gemini 3.8 Flash TTS' על רקע לבן עם הדגשי גרדיאנט עדינים בכחול וציאן. שלושה כרטיסים ממוספרים מציגים '1 עצבו קול מתוך פרומפט', '2 אחסנו אותו לשנה, או החזיקו מפתח לשבעה ימים' ו-'3 קראו ל-/v1/audio/speech', מעל שורת פוטר שאומרת 'Gemini API, 23 בספטמבר 2026. נתוני ספקים.' הלוגו של OrcaRouter מוטמע בפינה הימנית התחתונה.
Guides & Insights

יצירה ופריסה של אודיו מותאם אישית עם Gemini 3.8 Flash TTS: עיצוב קול, שיבוט, ושתי השעונים שמכריעים

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS מאפשרים לשניהם להמציא קול מתוך תיאור כתוב במקום לבחור אחד מרשימה, ושניהם הפכו לזמינים באופן כללי ב-Gemini API ב-23 בספטמבר 2026. הכותרת שכולם חוזרים עליה היא עיצוב הקול. החלק שכדאי לתכנן סביבו הוא מה קורה לקול מעוצב afterwards — כי הספק נותן לך שתי דרכים לשמור אחד, ומצמיד אורך חיים שונה לכל אחת. בחר באחת הלא נכונה, והקול שהמוצר שלך תלוי בו יפוג בתוך שבוע.

זהו הפער בסיקור ההשקה עד כה. פוסטי ההכרזה מסבירים שאפשר ליצור קול באמצעות פרומפט, וכמה מהם מזכירים שיבוט מדגימה של 30 שניות. אף אחד מהם לא מפרט את מודל האחסון, שהוא הדבר שקובע אם צינור דיבור ניתן לשחזור מקובץ תצורה או שיש לספק אותו מחדש לפי לוח זמנים. מאמר זה מכסה את כל המסלול — עיצוב, אחסון, קריאה ותשלום — עם המחירים והמכסות כפי ש-Google מפרסמת אותם.

מה שוחרר ב-23 בספטמבר

שני מודלים, סכימת API אחת. המזהים הם gemini-3.8-flash-tts וgemini-3.8-flash-lite-tts, והתיעוד של Google מציין במפורש ששניהם מקבלים "בדיוק את אותה סכימת API ואותו פורמט פרומפט" — מעבר ביניהם הוא שינוי בפרמטר אחד, לא שכתוב.

• קלט — טקסט בלבד. שני המודלים מקבלים טקסט ומחזירים אודיו; הם אינם מולטימודליים ואינם מפיקים טקסט חזרה.

• פלט — WAV, 24 kHz מונו 16-bit PCM עם סימן בנקודת הקצה unary; PCM ללא כותרת (audio/l16) בנקודת הקצה הזורמת; audio/mulaw ו־audio/alaw מתקבלים עם קצב דגימה שניתן להגדרה.

• שפות — 130 ב-Flash TTS, 101 ב-Flash-Lite TTS, מזוהות אוטומטית מהטקסט ולא מוצהרות בבקשה.

• קולות — 30 קולות אולפן נבחרים המפורטים בתיעוד (Kore ו-Puck ביניהם), Extended Voice Library של "מאות" נוספים הניתנים לשאילתה דרך נקודת הקצה voices, ובנוסף שני מסלולי היצירה שלהלן.

• בימוי — שליטה במסירה שורה־אחר־שורה, סצנות של שני דוברים המבוימות מתוך תסריט בודד, ורמזים לא־מילוליים כגון <laughs>, <sigh> ו־|mhm| הכתובים ישירות בתמלול.

שתי השכבות קיימות משום שעומסי העבודה התפצלו. Flash TTS ממוצב למקסימום נאמנות אקוסטית ומשחק קולי מורכב; Flash-Lite TTS מתואר במילותיה של גוגל עצמה כ"תחליף סוס העבודה" עבור gemini-3.1-flash-tts-preview, המיועד לדיבוב בכמויות גדולות, תכונות הקראה ומפלי סוכני קול. שניהם מחליפים מודל תצוגה מקדימה יחיד שהיה ב-API מאז אפריל 2026, כך שאם הייתם על התצוגה המקדימה, ההעברה היא החלטת שכבה ולא שדרוג גרסה.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English on 24 September 2026, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) and Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), and Python sample code that passes a speaker_config with the Kore voice to the interactions endpoint.

עיצוב קול הוא פרומפט, וזה משנה את שלב הסקירה.

משטח היצירה הוא הדבר החדש באמת בדור הזה. מבוסס הנחיה נבנה מתיאור בשפה טבעית — תפקיד, מבטא, אופי קולי — ומחזיר מזהה שאתם עושים בו שימוש חוזר. ב-API זו קריאה ליצירת קול עם store: true וקלט מבוסס הנחיה; בדוגמאות של Google עצמה התיאורים נעים מדיג'יי מלבורן עתיר אנרגיה ועד דרקון יפני. לאחר יצירתו, הקול מאוזכר בבקשת דיבור לפי המזהה שלו, והנחיות הסגנון לכל בקשה יכולות להיות מינימליות או ריקות, מפני שהאופי כבר טבוע בקול.

ההשלכה המעשית היא שינוי בתהליך העבודה, לא רק תכונה. ליהוק קולי היה פעם משא ומתן על רישיון או הזמנת אולפן, מה שאומר שבחירת הקול התרחשה פעם אחת, מוקדם, ושרדה את הסקירה כי שינוייה היו יקרים. כשקול הוא פסקת טקסט, הליהוק הופך לטוקן עיצוב — משהו שמנהל מוצר יכול לבקש לגלגל מחדש ביום שלישי. צוותים ששמים את מחרוזת התיאור בבקרת מקור ומתייחסים למזהה הקול שנוצר כתוצר בנייה יקבלו פלט עקבי בין סביבות. צוותים שיוצרים קולות ידנית ב-AI Studio לא יקבלו זאת, והכשל ייראה כהבדל בלתי מוסבר בין אודיו ב-staging לזה שב-production.

שני השעונים

זה הקטע שפוסטים של השקה מדלגים עליו. Google מאפשרת לך לשמור קול מעוצב או משוכפל באחד משני מצבים, והם פגים בקצבים שונים לחלוטין.

• קולות מאוחסנים — נוצרים כאשר האחסון מופעל, הם נמצאים בפרויקט שלך וכפופים למכסה של 200 קולות לפרויקט עם זמן חיים של שנה.

• מפתחות חסרי מצב — שכפול קול יכול להחזיר מפתח בניהול הלקוח (הצורה voicekey_…) במקום מזהה מאוחסן, ולמפתח הזה יש תוקף של שבעה ימים.

כשקוראים אותם יחד, הצמד הזה הוא הנחיית עיצוב. קול מאוחסן הוא התחייבות לשנה שלמה ותקרה קשיחה של 200 לפרויקט, שזה נדיב עבור מוצר עם קאסט קבוע וחסר תועלת לכל דבר שמייצר קול חדש לכל לקוח. המפתח חסר המצב הוא ההפך: אין לחץ של מכסה, אבל מפתח שצריך להנפיק מחדש מדי שבוע, מה שאומר שהאפליקציה שלך צריכה נתיב רענון והתשתית שלך צריכה לאחסן אישורים שמתחלפים. אף אחת מהאפשרויות אינה שגויה. בחירה בלי לשים לב מה בחרת היא הדרך שבה סוכן קולי משתתק ביום השמיני.

שתי תכונות נוספות מצורפות לשכפול וכדאי להכיר אותן לפני שאתם מבטיחים משהו לצוות משפטי. יצירת קול משוכפל דורשת הקלטת הסכמה מילולית מבעל הקול שחייבת להתאים לדובר הייחוס — בדיקה מדוברת, לא תיבת סימון. והפלט נושא מידע על מקור: כל קטע מסומן בסימן מים של SynthID, וקולות משוכפלים נושאים בנוסף אישורי תוכן C2PA. מסלול העיצוב הוא בכוונה הקשה יותר לניצול לרעה, ושתי המחסומים הם מבניים ולא הצהרות מדיניות.

אי-התאמה אחת שראוי לציין ולא ליישב. טבלת המודלים הנתמכים של Google מפרטת עיצוב קול ושכפול קול כזמינים בשני מודלי 3.8 TTS. רוב סיקורי ההשקה מתארים את שכפול הקול כחלק מסיפור Flash TTS בפרט. אם שכפול קול חשוב להחלטה שלך בין השכבות, אמת אותו מול התיעוד של השכבה שברצונך לשחרר, במקום להסתמך על סיכום כזה או אחר.

כמה עולה שעת אודיו

גוגל מחייבת על דיבור בטוקנים, לא בתווים או בשניות, וההמרה מפורסמת: אודיו נמדד ב-25 טוקנים לשנייה של פלט, שהם 90,000 טוקנים לשעה. זה הופך את החשבון לנקי במיוחד, וזה המספר שצריך לשים בתקציב ולא התעריף למיליון.

• Flash TTS standard — 0.50$ למיליון טוקנים של טקסט בקלט, 9.00$ למיליון טוקנים של אודיו בפלט עד 31 בדצמבר 2026, ולאחר מכן 1.00$ ו-18.00$. ‏Batch ו-Flex הם 0.25$ ו-4.50$; ‏Priority הוא 0.90$ ו-16.20$.

• Flash-Lite TTS standard — $0.50 ו־$6.00 עד אותו תאריך, ואז $1.00 ו־$12.00. Batch ו־Flex $0.25 ו־$3.00; Priority $0.90 ו־$10.80.

• בשניות — Flash TTS יוצא בערך $0.81 לשעה של אודיו שנוצר במהלך חלון המבצע וכ-$1.62 לאחריו; Flash-Lite TTS הוא בערך $0.54 ואז $1.08.

• לעומת המודל שהוא מחליף — gemini-3.1-flash-tts-preview מתומחר ב-1.00$ ו-20.00$ למיליון, כך ששורת פלט האודיו ירדה ב-55 אחוז ב-Flash TTS וב-70 אחוז ב-Flash-Lite TTS.

אל תתכנן לפי המחיר המבצעי. גוגל מפרסמת את שתי העמודות באותה טבלה, מה שאומר שתעריף ינואר אינו שמועה שתתגלה מאוחר יותר — הוא כבר נמצא בכרטיס היום, וכל אומדן לאלף דקות שנבנה על 0.81 דולר חייב לשרוד הכפלה.

מספר אחד עצמאי, וכמה שאינם.

ההכרזה של Google פותחת עם תוצאות בנצ'מרק, ויש לקרוא אותן בדיוק כפי שהן. החברה אומרת ש-Flash TTS הגיע למקום הראשון בבנצ'מרק Voice Design של Hume AI עם 71.4, הוביל במידול מבטאים עם 60.8, ושה-Flash TTS ו-Flash-Lite TTS דורגו ראשון ושני במדד האיכות הכולל של Hume, עם מיקומים חזקים בהעדפה עיוורת ב-Voice Arena עבור יפנית, פורטוגזית ברזילאית, וייטנאמית, ערבית סטנדרטית מודרנית, ספרדית מקסיקנית והינדי. הכול מדווח על ידי הספק, ואף אחת מההרצות אינה פומבית.

יש פרט ברשימה ההיא שראוי לשים לב אליו. אלן קאואן, המיוחס כאחד ממחברי ההכרזה של גוגל, הוא המייסד של Hume AI — המעבדה שה-Voice Design Benchmark שלה מספק את המספר הכותרתי. זה לא הופך את הנתון לשגוי, והבנצ'מרק של Hume הוא אמיתי, אך השניים אינם בלתי־תלויים זה בזה, וקורא ששוקל את 71.4 צריך לדעת זאת לפני שהוא חוזר עליו כוולידציה מצד שלישי.

הנתון שנאסף באופן עצמאי נמצא ב-Provider Voice Arena של Artificial Analysis, שנלכד עבור מאמר זה ב-24 בספטמבר 2026: Gemini 3.8 Flash TTS ממוקם שני עם Elo של 1,260 ומרווח של 17 נקודות על פני 1,999 דגימות, מאחורי Cartesia Sonic 3.6 עם 1,273. Gemini 3.8 Flash-Lite TTS הוא שישי עם 1,235. המודל שמוחלף, Gemini 3.1 Flash TTS, הוא עשירי עם 1,199 על פני 3,430 דגימות. העדפת מאזינים בעיוורון, לא הערכה עצמית של המעבדה — והמספר היחיד לאיכות כאן שגוגל לא הזמינה.

A generated scoreboard card titled 'Gemini 3.8 Flash TTS — the scoreboard' with six rows: Arena Elo 1,260 at rank 2 over 1,999 samples; audio out $9.00 per 1M tokens to 31 December 2026; 130 languages on Flash TTS against 101 on Flash-Lite TTS; 30 studio voices plus prompt-based design; stored voices capped at 200 per project with a one-year lifetime; and a stateless voicekey with a seven-day lifetime. The footer reads 'Elo per Artificial Analysis, 24 Sept 2026; price and quotas per Google. Google's Hume AI results are vendor-reported.'

היכן להריץ את זה, והיכן זה עדיין לא

שני המודלים זמינים היום ב-Gemini API וב-Google AI Studio, ללא רשימת המתנה. המשטחים לצרכנים ולארגוניים מוצגים בשלבים ולא הושקו: Flash TTS מגיע ל-Gemini Notebook ו-Flash-Lite TTS ל-Google Vids, הגישה ל-Gemini Enterprise מתוארת כבקרוב, ומיקסום קולי — התאמת גוון, גובה צליל, קצב ומבטא לקול קיים — מופיע כתכונה עתידית ולא ככזו שקיימת כיום. אם התוכנית שלך תלויה במיקסום, הוא עדיין לא קיים.

מצדנו, קודם כול כנות: נקודות הקצה של Gemini 3.8 TTS אינן נמצאות בטבלת הניתוב של OrcaRouter. הדור שהם מחליפים כן נמצא — google/gemini-3.1-flash-tts-preview נמצא בקטלוג באותם $1.00 ו-$20.00 למיליון טוקנים שגוגל מפרסמת, משום שמחיר המחירון של הספק מועבר הלאה ללא תוספת רווח, והוא עונה על אותה /v1/audio/speech נקודת קצה שה-SDK התואם ל-OpenAI שלך כבר מכוון אליה. זה חשוב יותר ממה שזה נשמע לעומס עבודה של דיבור, משום שמה שאתה בעצם קונה הוא נקודת קצה יציבה שהאפליקציה שלך יכולה לקרוא לה בזמן שהמודלים שמאחוריה משתנים. הקוד שלך מחזיק מחרוזת מודל; הקטלוג מחזיק את הניתוב. כשחלון המבצעים של גוגל נסגר ב-31 בדצמבר ו-Flash TTS מכפיל את מחירו, המחיר של מודל מנותב משתנה באותו יום ולא בחידוש החוזה הבא — ומודל שנופל עובר ל-failover במקום לגרור איתו את תור ההקראה שלך.

A screenshot of the OrcaRouter model page for google/gemini-3.1-flash-tts-preview, captured in English on 24 September 2026, showing the model described as Google's text-to-speech model accessed via OrcaRouter, an input price of $1.00 and output price of $20.00 per 1M tokens, a p50 time-to-first-token of 6.61 seconds and p95 of 10.00 seconds over seven days, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, and a /v1/audio/speech endpoint.

אם אתם בוחנים את הדור הזה לפני שאתם מתחייבים, הניסוי הזול הוא דו-שלבי. הריצו את אותו סקריפט דרך Flash TTS ו-Flash-Lite TTS, מפני שהסכימה זהה וההבדל הוא פרמטר — ואז החליטו לפי האודיו שלכם ולא לפי תרשים בנצ'מרק, ובדקו ב-Artificial Analysis אם פער האיכות שורד את פסי השגיאה שלו לפני שאתם משלמים את הפרמיה. עבור פרויקט קריינות בקנה מידה גדול, הפרמיה היא כסף אמיתי; עבור בוט תמיכה שקורא מספר טלפון בקול, היא לא בהכרח קונה לכם שום דבר שמאזין יכול לשמוע.