כרטיס הירו שנוצר עבור 'Gemini 3.8 TTS: שני שקנאים, שני מודלים' על רקע לבן עם נגיעות גרדיאנט רכות בכחול ותכלת. שלושה כרטיסים מציגים 'Gemini 3.8 Flash TTS — Elo 1,260, דירוג 2, 8 קולות ארנה, $9.00 לכל 1M טוקני אודיו', 'Gemini 3.8 Flash-Lite TTS — Elo 1,235, דירוג 6, $6.00 לכל 1M טוקני אודיו' ו'דיאלוג בין שני דוברים — נתמך, עיצוב קול, שיכפול של 30 שניות'. שורת כותרת תחתונה מציינת 'Elo לפי Artificial Analysis Provider Voice Arena, ספט׳ 2026; מחירי מחירון לפי Google.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.8 TTS: שני שקנאים, שני מודלים, ומחיר שמכפיל את עצמו בינואר

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדרך המהירה ביותר להבין מה הספק שחרר ב-23 בספטמבר 2026 היא להסתכל על ההדגמה שהסתובבה יחד עם זה: שני שקנאים מתווכחים אם לעבור ל-Pacifica Pier, קול אחד לכל ציפור, מתוסרט תור אחר תור. Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS הם שני המודלים שמאחורי ההדגמה הזו, שניהם זמינים באופן כללי ב-Gemini API, והשקנאים אינם גימיק. הם הדבר הראשון בדור הזה שמודלי הדיבור הקודמים של Gemini לא יכלו לעשות בכלל: שני דוברים, יצירה אחת, תסריט שקובע מי אומר מה.

המחיר הוא החצי השני של הסיפור, והוא המקום שבו שני המודלים נפרדים. Flash TTS מחייב 0.50 דולר למיליון טוקני טקסט בקלט ו-9.00 דולר למיליון טוקני אודיו בפלט עד 31 בדצמבר 2026, ואז 18.00 דולר; Flash-Lite TTS מחייב 0.50 ו-6.00 דולר לפי אותו לוח זמנים, ואז 12.00 דולר. אלה התעריפים של Google עצמה. בהמרה של Artificial Analysis לבסיס של למיליון תווים כדי שיוכלו להופיע באותה טבלה כמו כולם, הם מסתכמים ב-16.50 דולר וב-11.00 דולר — זול יותר בכשליש עבור מודל ה-Lite, ושניהם הרבה מתחת למה שגובה החלק העליון של אותה טבלה.

אז השאלה המעניינת היא לא אם המודלים טובים. היא איזה מהשניים כדאי לך לבנות עליו, כי הפער ביניהם אינו הפער שהיית מנחש מהשמות.

מה שההכרזה מ־23 בספטמבר מכילה למעשה

שני מודלים, לא אחד, וגוגל אומרת במפורש שמדובר בפיצול ולא בגרסה קטנה וגדולה של אותו דבר. ההכרזה מונה חמישה מקומות שבהם הם מושקים — Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook ו-Google Vids — ומזהי ה-API פשוטים: gemini-3.8-flash-tts ו-gemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

רשימת היכולות ארוכה יותר ממה שמשתמע מהכותרת. מתוך ההכרזה של Google ומתיעוד יצירת הדיבור של Gemini API:

• עיצוב קול — אתה מתאר קול במילים ומקבל בחזרה מזהה קול מותאם אישית, במקום לבחור מתוך רשימה קבועה.

• שכפול קול — דגימה של 30 שניות מפיקה מזהה קול, והוא המסלול שרוב הצוותים ישתמשו בו בפועל לקול מיתוגי או לקריין.

• דיאלוג דו-דוברי — מקרה הפליקן. התסריט מכיל חילופי דוברים במקום גוש פרוזה אחד.

• עיצוב ברמת תור — התיעוד מתאר אנוטציית speech_metadata שמשייכת הנחיה לתור ספציפי ולא לכל הבקשה כולה.

• קולות מוכנים מראש, בתוספת Extended Voice Library הנגישה באמצעות GET /v1beta/voices.

• שלושה קידודי אודיו — WAV כברירת מחדל, כאשר mulaw ו-alaw זמינים עבור פייפליינים בעלי אופי טלפוני.

• קלט טקסט בלבד, פלט אודיו בלבד. התיעוד חד-משמעי בעניין זה: מודלי TTS אינם מקבלים שום מודאליות קלט אחרת ואינם מפיקים שום פלט אחר, וישנו סעיף מגבלות נפרד שמפרט את המגבלות.

מה שאין בהכרזה הוא אף אחד מהמספרים שמתכנן קיבולת זקוק להם. מגבלות קצב, מכסות ומשך חיי האחסון של קול מעוצב נמצאים כולם במסמכים ובעמוד התמחור, ולא בפוסט ההשקה — וזו הסיבה הרגילה לכך ששבוע השקה עובר חלק בהדגמות ורע בייצור.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

השקנאים הם החדשות האמיתיות

TTS של דובר יחיד נחשב לבעיה פתורה למדי כבר שנתיים. מה שהיה חסר היה מודל שישמור על הפרדה בין שתי זהויות לאורך תסריט ארוך בלי לסטות, וזה מה שהדמו באמת בודק — לא אם הקול נשמע אנושי, אלא אם דובר A הוא עדיין דובר A אחרי ארבע דקות.

שני דברים נובעים מכך, והם הסיבה שזה חשוב מעבר לצעצועי פודקאסט.

הראשון הוא שיחידת העבודה משתנה. עם מודל של דובר יחיד, דיאלוג של עשרים דקות הוא עשרים דקות של אודיו שאתה מחבר משתי הרצות בלתי תלויות, וכל תפר הוא מקום שבו הפרוזודיה מתאפסת. עם מודל של שני דוברים, זו קריאה אחת, הקשר אחד, והמודל יכול להגיב לשורה שלפניו. זהו הבדל באיכות שאי אפשר להשיב בעיבוד לאחר מעשה.

השני הוא שפורמט התסריט הופך לממשק. אם הפייפליין שלכם כבר מפיק משהו בצורת SSML — הערה לכל ביטוי — הדור הזה קרוב להיות תחליף ישיר. אם הפייפליין שלכם מוסר למודל קיר של טקסט ומקווה, יש לכם כעת סיבה לבנות אותו מחדש, כי העיצוב שהיה מרומז בעבר הוא כעת משהו שעליכם לומר בקול רם. זהו אותו ויתור ששאר התחום עושה בדרכים שונות, וזהו הציר שעליו שני המודלים האלה של Google מתחרים עם כל השאר על הלוח.

כמה עולה שעת אודיו של שני שקנאים

החישוב של הטוקנים שווה לעשות פעם אחת, כי הנתון של מיליון טוקני אודיו אינו נתון פר שעה, וההבדל הזה הפתיע אנשים.

אסימוני אודיו נוצרים בקצב קבוע לשנייה של פלט, כך שהעלות משתנה בהתאם לאורך האודיו המוגמר, ולא לאורך התסריט. קחו את התעריף של גוגל עצמה עבור Flash TTS — $9.00 למיליון אסימוני אודיו בפלט — והחישוב עבור יצירה מוגמרת של שעה מגיע לספרות בודדות של דולרים במסלול הסטנדרטי, כשמודל Lite עומד על שני שלישים מזה. תמחור Batch ו-Flex, ב-$0.25 בקלט ו-$4.50 בפלט עבור Flash TTS לעומת $0.25 ו-$3.00 עבור Flash-Lite TTS, מקטין זאת עוד יותר עבור כל דבר שאינו צריך להיות מיוצר לפי דרישה. Priority, ב-$0.90 ו-$16.00, מיועד לעבודה שכן צריכה.

שלוש השלכות מעשיות:

• יצירה מחדש של פסקה היא זולה; יצירה מחדש של סדרה היא החלטה. במחירים האלה, החלק היקר בצינור עיבוד דיבור מפסיק להיות הסקה וחוזר להיות האדם שמאשר את הטייק.

• תעריף קלט הטקסט הוא בגדר רעש. $0.50 למיליון טוקני טקסט בתסריט של כמה אלפי מילים הוא שגיאת עיגול בהשוואה לצד האודיו. אל תבצע אופטימיזציה של התסריט לפי אורכו.

• המצוק של 31 בדצמבר הוא אמיתי והוא מכפיל את תעריף האודיו. אם אתם מתכננים פריסה ב-2027, תקצבו את המספר שאחרי המבצע, לא את מספר ההשקה, אחרת תתכננו מחדש בינואר.

המספר שהוא עצמאי, ואלה שאינם.

נתון אחד בהשקה הזו מגיע ממקום אחר מלבד Google. בנתוני Artificial Analysis Provider Voice Arena, שנאספו ב-24 בספטמבר 2026, Gemini 3.8 Flash TTS ממוקם במקום 2 עם Elo של 1,260 על פני 1,999 דגימות ו-8 קולות בזירה, ו-Gemini 3.8 Flash-Lite TTS ממוקם במקום 6 עם 1,235 על פני 2,000 דגימות. שניהם נמצאים בתוך מרווחי הסמך זה של זה ב-±16 ו-±17, כך שלוח הדירוג אומר לך שהם בלתי ניתנים להבחנה סטטיסטית מבחינת העדפה — וזו תוצאה שימושית באמת, כי היא אומרת שהזול יותר אינו גרוע באופן מדיד למאזינים.

כל השאר הוא טענה של גוגל עצמה, ויש לקרוא אותה ככזו: שפת ההבעה, מספרי השפות, איכות השכפול. הארינה נותנת לך דירוג העדפות בלבד. היא לא מספרת לך כיצד כל אחד מהמודלים מתמודד עם תסריט בן 40 דקות בלי סחיפה, כיצד הוא מתנהג עם שם עצם פרטי שהוא לא ראה מעולם, או מה קורה לקול מעוצב אחרי שבוע.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

מודל Lite הוא גם הטיעון הטוב יותר לכך ששני הדגמים האלה מייצגים פיצול אמיתי ולא דרג שיווקי. פער Elo של 25 נקודות שנמצא בתוך פסי השגיאה, מול פער מחירים של 33%, הוא הצורה שבה נראית החלטה שפייפליינים רגישים למחיר צריכים לקבל כמעט בכל פעם לטובת Lite — והצורה שבה נראית החלטה שפייפליינים רגישים להשהיה צריכים לקבל בכיוון ההפוך, מכיוון שהשניים נבדלים גם בזמן וגם בחשבון.

איפה להריץ את זה, והגרסה הכנה של התשובה הזו

OrcaRouter אינו מארח את נקודות הקצה של Gemini 3.8 TTS. כדאי לומר זאת במפורש ולא לרמוז אחרת, משום שהדבר המועיל שאנו יכולים לומר על שני המודלים הללו אינו שאנו מספקים אותם — איננו מספקים — אלא שקיצוץ מחיר מצד ספק, כמו השינוי של 31 בדצמבר, הוא בדיוק סוג האירוע שהופך את הניתוב לדבר שכדאי להחזיק בו.

OrcaRouter מעמידה יותר מ-200 מודלים מאחורי מפתח API יחיד במחיר המחירון של הספקללא תוספת רווח, כך שכרטיס התעריפים של הספק הוא מה שאתם משלמים, ושינוי בו נכנס לתוקף אצלנו באותו יום ולא במחזור החיוב הבא. עבור צינור דיבור שנמצא באמצע תהליך הגירה, שכבת המעבר לגיבוי חשובה יותר מהקטלוג: אפשר להפנות נתיב בקשה למודל שעדיין נמצא בהערכה בלי להמר עליו נתיב ייצור, כי קריאה שנכשלת יכולה ליפול הלאה למשהו שכבר הוכח. ה-DSL של הניתוב מרכיב כמה מודלים לקריאה אחת במקרים שבהם שום קול בודד אינו טוב מספיק, ומיזוג מודלים עונה לפרומפט עם פאנל כשהתשובה חשובה יותר מהשהיה.

עבור מודלי Gemini 3.8 TTS עצמם, המקום שבו קוראים להם הוא ה-API של Google עצמה, והמשטחים ש-Google ציינה ב-23 בספטמבר. מה שהצמד עושה לארכיטקטורה שלך — קריאה אחת לשני דוברים, עיצוב סגנון כאנוטציה, קול שאפשר לתאר ולא רק לבחור — הוא החלק שישרוד מעבר להנחת ההשקה.

מה לצפות בהמשך

שלושה דברים יכריעו אם הדור הזה הוא קפיצת מדרגה או סתם תכונה.

הראשונה היא סחיפה. איש לא פרסם הערכה מפורטת בשאלה אם המסלול הדו-דוברי שומר על זהות לאורך שעה שלמה, ועד שמישהו יעשה זאת, הדגמת pelican היא רק הדגמה. השנייה היא תוחלת החיים של הקול. קול מעוצב שפג תוקפו בעוד שבוע הוא אב-טיפוס; קול שניתן לגזור מחדש מקונפיגורציה שמורה הוא מוצר, והתשובה תלויה באיזה משני המזהים אתה שומר. השלישית היא מה קורה אחרי 31 בדצמבר, כשתעריף המבצע מסתיים והעלות לשעה של צינור עיבוד דיבור מוכפלת בין לילה.

אף אחד מאלה לא נראה מתוך פוסט ההשקה. כל השלושה נראים מתוך התיעוד, וזה המקום שבו סיקור ההשקה מפסיק לקרוא.