
יצירה ופריסה של אודיו מותאם אישית עם Gemini 3.8 Flash TTS: עיצוב קול, שיבוט, ושתי השעונים שמכריעים
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 506 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 184 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS מאפשרים לשניהם להמציא קול מתוך תיאור כתוב במקום לבחור אחד מרשימה, ושניהם הפכו לזמינים באופן כללי ב-Gemini API ב-23 בספטמבר 2026. הכותרת שכולם חוזרים עליה היא עיצוב הקול. החלק שכדאי לתכנן סביבו הוא מה קורה לקול מעוצב afterwards — כי הספק נותן לך שתי דרכים לשמור אחד, ומצמיד אורך חיים שונה לכל אחת. בחר באחת הלא נכונה, והקול שהמוצר שלך תלוי בו יפוג בתוך שבוע.
זהו הפער בסיקור ההשקה עד כה. פוסטי ההכרזה מסבירים שאפשר ליצור קול באמצעות פרומפט, וכמה מהם מזכירים שיבוט מדגימה של 30 שניות. אף אחד מהם לא מפרט את מודל האחסון, שהוא הדבר שקובע אם צינור דיבור ניתן לשחזור מקובץ תצורה או שיש לספק אותו מחדש לפי לוח זמנים. מאמר זה מכסה את כל המסלול — עיצוב, אחסון, קריאה ותשלום — עם המחירים והמכסות כפי ש-Google מפרסמת אותם.
מה שוחרר ב-23 בספטמבר
שני מודלים, סכימת API אחת. המזהים הם gemini-3.8-flash-tts וgemini-3.8-flash-lite-tts, והתיעוד של Google מציין במפורש ששניהם מקבלים "בדיוק את אותה סכימת API ואותו פורמט פרומפט" — מעבר ביניהם הוא שינוי בפרמטר אחד, לא שכתוב.
• קלט — טקסט בלבד. שני המודלים מקבלים טקסט ומחזירים אודיו; הם אינם מולטימודליים ואינם מפיקים טקסט חזרה.
• פלט — WAV, 24 kHz מונו 16-bit PCM עם סימן בנקודת הקצה unary; PCM ללא כותרת (audio/l16) בנקודת הקצה הזורמת; audio/mulaw ו־audio/alaw מתקבלים עם קצב דגימה שניתן להגדרה.
• שפות — 130 ב-Flash TTS, 101 ב-Flash-Lite TTS, מזוהות אוטומטית מהטקסט ולא מוצהרות בבקשה.
• קולות — 30 קולות אולפן נבחרים המפורטים בתיעוד (Kore ו-Puck ביניהם), Extended Voice Library של "מאות" נוספים הניתנים לשאילתה דרך נקודת הקצה voices, ובנוסף שני מסלולי היצירה שלהלן.
• בימוי — שליטה במסירה שורה־אחר־שורה, סצנות של שני דוברים המבוימות מתוך תסריט בודד, ורמזים לא־מילוליים כגון <laughs>, <sigh> ו־|mhm| הכתובים ישירות בתמלול.
שתי השכבות קיימות משום שעומסי העבודה התפצלו. Flash TTS ממוצב למקסימום נאמנות אקוסטית ומשחק קולי מורכב; Flash-Lite TTS מתואר במילותיה של גוגל עצמה כ"תחליף סוס העבודה" עבור gemini-3.1-flash-tts-preview, המיועד לדיבוב בכמויות גדולות, תכונות הקראה ומפלי סוכני קול. שניהם מחליפים מודל תצוגה מקדימה יחיד שהיה ב-API מאז אפריל 2026, כך שאם הייתם על התצוגה המקדימה, ההעברה היא החלטת שכבה ולא שדרוג גרסה.

עיצוב קול הוא פרומפט, וזה משנה את שלב הסקירה.
משטח היצירה הוא הדבר החדש באמת בדור הזה. מבוסס הנחיה נבנה מתיאור בשפה טבעית — תפקיד, מבטא, אופי קולי — ומחזיר מזהה שאתם עושים בו שימוש חוזר. ב-API זו קריאה ליצירת קול עם store: true וקלט מבוסס הנחיה; בדוגמאות של Google עצמה התיאורים נעים מדיג'יי מלבורן עתיר אנרגיה ועד דרקון יפני. לאחר יצירתו, הקול מאוזכר בבקשת דיבור לפי המזהה שלו, והנחיות הסגנון לכל בקשה יכולות להיות מינימליות או ריקות, מפני שהאופי כבר טבוע בקול.
ההשלכה המעשית היא שינוי בתהליך העבודה, לא רק תכונה. ליהוק קולי היה פעם משא ומתן על רישיון או הזמנת אולפן, מה שאומר שבחירת הקול התרחשה פעם אחת, מוקדם, ושרדה את הסקירה כי שינוייה היו יקרים. כשקול הוא פסקת טקסט, הליהוק הופך לטוקן עיצוב — משהו שמנהל מוצר יכול לבקש לגלגל מחדש ביום שלישי. צוותים ששמים את מחרוזת התיאור בבקרת מקור ומתייחסים למזהה הקול שנוצר כתוצר בנייה יקבלו פלט עקבי בין סביבות. צוותים שיוצרים קולות ידנית ב-AI Studio לא יקבלו זאת, והכשל ייראה כהבדל בלתי מוסבר בין אודיו ב-staging לזה שב-production.
שני השעונים
זה הקטע שפוסטים של השקה מדלגים עליו. Google מאפשרת לך לשמור קול מעוצב או משוכפל באחד משני מצבים, והם פגים בקצבים שונים לחלוטין.
• קולות מאוחסנים — נוצרים כאשר האחסון מופעל, הם נמצאים בפרויקט שלך וכפופים למכסה של 200 קולות לפרויקט עם זמן חיים של שנה.
• מפתחות חסרי מצב — שכפול קול יכול להחזיר מפתח בניהול הלקוח (הצורה voicekey_…) במקום מזהה מאוחסן, ולמפתח הזה יש תוקף של שבעה ימים.
כשקוראים אותם יחד, הצמד הזה הוא הנחיית עיצוב. קול מאוחסן הוא התחייבות לשנה שלמה ותקרה קשיחה של 200 לפרויקט, שזה נדיב עבור מוצר עם קאסט קבוע וחסר תועלת לכל דבר שמייצר קול חדש לכל לקוח. המפתח חסר המצב הוא ההפך: אין לחץ של מכסה, אבל מפתח שצריך להנפיק מחדש מדי שבוע, מה שאומר שהאפליקציה שלך צריכה נתיב רענון והתשתית שלך צריכה לאחסן אישורים שמתחלפים. אף אחת מהאפשרויות אינה שגויה. בחירה בלי לשים לב מה בחרת היא הדרך שבה סוכן קולי משתתק ביום השמיני.
שתי תכונות נוספות מצורפות לשכפול וכדאי להכיר אותן לפני שאתם מבטיחים משהו לצוות משפטי. יצירת קול משוכפל דורשת הקלטת הסכמה מילולית מבעל הקול שחייבת להתאים לדובר הייחוס — בדיקה מדוברת, לא תיבת סימון. והפלט נושא מידע על מקור: כל קטע מסומן בסימן מים של SynthID, וקולות משוכפלים נושאים בנוסף אישורי תוכן C2PA. מסלול העיצוב הוא בכוונה הקשה יותר לניצול לרעה, ושתי המחסומים הם מבניים ולא הצהרות מדיניות.
אי-התאמה אחת שראוי לציין ולא ליישב. טבלת המודלים הנתמכים של Google מפרטת עיצוב קול ושכפול קול כזמינים בשני מודלי 3.8 TTS. רוב סיקורי ההשקה מתארים את שכפול הקול כחלק מסיפור Flash TTS בפרט. אם שכפול קול חשוב להחלטה שלך בין השכבות, אמת אותו מול התיעוד של השכבה שברצונך לשחרר, במקום להסתמך על סיכום כזה או אחר.
כמה עולה שעת אודיו
גוגל מחייבת על דיבור בטוקנים, לא בתווים או בשניות, וההמרה מפורסמת: אודיו נמדד ב-25 טוקנים לשנייה של פלט, שהם 90,000 טוקנים לשעה. זה הופך את החשבון לנקי במיוחד, וזה המספר שצריך לשים בתקציב ולא התעריף למיליון.
• Flash TTS standard — 0.50$ למיליון טוקנים של טקסט בקלט, 9.00$ למיליון טוקנים של אודיו בפלט עד 31 בדצמבר 2026, ולאחר מכן 1.00$ ו-18.00$. Batch ו-Flex הם 0.25$ ו-4.50$; Priority הוא 0.90$ ו-16.20$.
• Flash-Lite TTS standard — $0.50 ו־$6.00 עד אותו תאריך, ואז $1.00 ו־$12.00. Batch ו־Flex $0.25 ו־$3.00; Priority $0.90 ו־$10.80.
• בשניות — Flash TTS יוצא בערך $0.81 לשעה של אודיו שנוצר במהלך חלון המבצע וכ-$1.62 לאחריו; Flash-Lite TTS הוא בערך $0.54 ואז $1.08.
• לעומת המודל שהוא מחליף — gemini-3.1-flash-tts-preview מתומחר ב-1.00$ ו-20.00$ למיליון, כך ששורת פלט האודיו ירדה ב-55 אחוז ב-Flash TTS וב-70 אחוז ב-Flash-Lite TTS.
אל תתכנן לפי המחיר המבצעי. גוגל מפרסמת את שתי העמודות באותה טבלה, מה שאומר שתעריף ינואר אינו שמועה שתתגלה מאוחר יותר — הוא כבר נמצא בכרטיס היום, וכל אומדן לאלף דקות שנבנה על 0.81 דולר חייב לשרוד הכפלה.
מספר אחד עצמאי, וכמה שאינם.
ההכרזה של Google פותחת עם תוצאות בנצ'מרק, ויש לקרוא אותן בדיוק כפי שהן. החברה אומרת ש-Flash TTS הגיע למקום הראשון בבנצ'מרק Voice Design של Hume AI עם 71.4, הוביל במידול מבטאים עם 60.8, ושה-Flash TTS ו-Flash-Lite TTS דורגו ראשון ושני במדד האיכות הכולל של Hume, עם מיקומים חזקים בהעדפה עיוורת ב-Voice Arena עבור יפנית, פורטוגזית ברזילאית, וייטנאמית, ערבית סטנדרטית מודרנית, ספרדית מקסיקנית והינדי. הכול מדווח על ידי הספק, ואף אחת מההרצות אינה פומבית.
יש פרט ברשימה ההיא שראוי לשים לב אליו. אלן קאואן, המיוחס כאחד ממחברי ההכרזה של גוגל, הוא המייסד של Hume AI — המעבדה שה-Voice Design Benchmark שלה מספק את המספר הכותרתי. זה לא הופך את הנתון לשגוי, והבנצ'מרק של Hume הוא אמיתי, אך השניים אינם בלתי־תלויים זה בזה, וקורא ששוקל את 71.4 צריך לדעת זאת לפני שהוא חוזר עליו כוולידציה מצד שלישי.
הנתון שנאסף באופן עצמאי נמצא ב-Provider Voice Arena של Artificial Analysis, שנלכד עבור מאמר זה ב-24 בספטמבר 2026: Gemini 3.8 Flash TTS ממוקם שני עם Elo של 1,260 ומרווח של 17 נקודות על פני 1,999 דגימות, מאחורי Cartesia Sonic 3.6 עם 1,273. Gemini 3.8 Flash-Lite TTS הוא שישי עם 1,235. המודל שמוחלף, Gemini 3.1 Flash TTS, הוא עשירי עם 1,199 על פני 3,430 דגימות. העדפת מאזינים בעיוורון, לא הערכה עצמית של המעבדה — והמספר היחיד לאיכות כאן שגוגל לא הזמינה.

היכן להריץ את זה, והיכן זה עדיין לא
שני המודלים זמינים היום ב-Gemini API וב-Google AI Studio, ללא רשימת המתנה. המשטחים לצרכנים ולארגוניים מוצגים בשלבים ולא הושקו: Flash TTS מגיע ל-Gemini Notebook ו-Flash-Lite TTS ל-Google Vids, הגישה ל-Gemini Enterprise מתוארת כבקרוב, ומיקסום קולי — התאמת גוון, גובה צליל, קצב ומבטא לקול קיים — מופיע כתכונה עתידית ולא ככזו שקיימת כיום. אם התוכנית שלך תלויה במיקסום, הוא עדיין לא קיים.
מצדנו, קודם כול כנות: נקודות הקצה של Gemini 3.8 TTS אינן נמצאות בטבלת הניתוב של OrcaRouter. הדור שהם מחליפים כן נמצא — google/gemini-3.1-flash-tts-preview נמצא בקטלוג באותם $1.00 ו-$20.00 למיליון טוקנים שגוגל מפרסמת, משום שמחיר המחירון של הספק מועבר הלאה ללא תוספת רווח, והוא עונה על אותה /v1/audio/speech נקודת קצה שה-SDK התואם ל-OpenAI שלך כבר מכוון אליה. זה חשוב יותר ממה שזה נשמע לעומס עבודה של דיבור, משום שמה שאתה בעצם קונה הוא נקודת קצה יציבה שהאפליקציה שלך יכולה לקרוא לה בזמן שהמודלים שמאחוריה משתנים. הקוד שלך מחזיק מחרוזת מודל; הקטלוג מחזיק את הניתוב. כשחלון המבצעים של גוגל נסגר ב-31 בדצמבר ו-Flash TTS מכפיל את מחירו, המחיר של מודל מנותב משתנה באותו יום ולא בחידוש החוזה הבא — ומודל שנופל עובר ל-failover במקום לגרור איתו את תור ההקראה שלך.

אם אתם בוחנים את הדור הזה לפני שאתם מתחייבים, הניסוי הזול הוא דו-שלבי. הריצו את אותו סקריפט דרך Flash TTS ו-Flash-Lite TTS, מפני שהסכימה זהה וההבדל הוא פרמטר — ואז החליטו לפי האודיו שלכם ולא לפי תרשים בנצ'מרק, ובדקו ב-Artificial Analysis אם פער האיכות שורד את פסי השגיאה שלו לפני שאתם משלמים את הפרמיה. עבור פרויקט קריינות בקנה מידה גדול, הפרמיה היא כסף אמיתי; עבור בוט תמיכה שקורא מספר טלפון בקול, היא לא בהכרח קונה לכם שום דבר שמאזין יכול לשמוע.
