כרטיס הירו שנוצר עבור 'Gemini 3.8 Live vs Gemini 3.8 TTS' על רקע לבן עם נגיעות גרדיאנט עדינות בכחול ותכלת. עמודה שמאלית שכותרתה 'זמין ב-Live API' מפרטת את 'gemini-3.8-live', 'שומע ומדבר', 'אודיו נכנס, אודיו יוצא'; עמודה ימנית שכותרתה 'זמין בנקודות הקצה של TTS' מפרטת את 'gemini-3.8-flash-tts', 'קורא טקסט כתוב', 'טקסט נכנס, אודיו יוצא'. בשורת פוטר כתוב 'אף אחד מהם לא נקרא Gemini 3.8 TTS.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.8 Live מול Gemini 3.8 TTS: לולאת שיחה וקול הקראה חולקים שם של דור

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Gemini 3.8 Live הוא מודל דיבור-לדיבור שיצא ב-15 בספטמבר 2026 בתור gemini-3.8-live וgemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" אינו מודל כלל — זהו המונח המטרייה שסיקור ההשקה, כולל כותרת הפוסט של גוגל עצמה, משתמש בו כדי לתאר את צמד נקודות הקצה לטקסט-לדיבור שהגיעו ב-23 בספטמבר 2026 בתור gemini-3.8-flash-tts וgemini-3.8-flash-lite-tts. אז זה אינו דף ה"מול" הרגיל, שבו שני מוצרים נאבקים על תפקיד אחד. זהו דף על שני תפקידים שחולקים מספר דור, ועל הטעות הספציפית שאנשים עושים כשהם מתייחסים למילים "Live" ו-"TTS" כשני טעמים של אותו דבר.

הפיצול שמספר הדור המשותף מסתיר

התיעוד של Google להפקת דיבור משרטט את הגבול בעצמו, וקל לפסוח על המשפט הזה: "יכולת ה-TTS שונה מהפקת דיבור המסופקת דרך Live API." אותו קטע מסביר מדוע, והסיבה מבנית ולא עניין של איכות. Live API בנוי עבור "אודיו אינטראקטיבי, לא מובנה, וקלטים ופלטים מולטימודליים." TTS דרך Gemini API "מותאם לתרחישים הדורשים הקראה מדויקת של טקסט עם שליטה עדינה." הערה מאוחרת יותר מבהירה במפורש את צורת הקלט: מודלי ה-TTS מקבלים טקסט בלבד ומחזירים אודיו בלבד.

האילוץ היחיד הזה — טקסט נכנס, אודיו יוצא, ללא קלט — הוא כל ההשוואה. מודל Gemini 3.8 Live שומע את מי שמדבר אליו. מודל Gemini 3.8 Flash TTS או Flash-Lite TTS לעולם אינו שומע אף אחד; הוא קורא מחרוזת ומבצע אותה. כל השאר נובע מכך: מדדי הביצועים שקיימים עבור האחד חסרי משמעות עבור האחר, התמחור נמדד ביחידות שונות, ואופני הכשל אינם ברי השוואה כלל.

זה חשוב מפני ששני תרחישי השימוש נראים זהים מבחוץ. גם סוכן קולי וגם צינור קריינות בסופו של דבר מפיקים דיבור שנשמע אנושי. רק אחד מהם ניתן לקטוע.

לאן "Gemini 3.8 TTS" בעצם מתפענח

פתחו את טבלת המודלים הנתמכים עבור יצירת הדיבור של Gemini API ותמצאו ארבע רשומות TTS ואף לא רשומה בשם Gemini 3.8 TTS. שתיים מהן הן מהדור הזה: Gemini 3.8 Flash TTS, מזהה מודל gemini-3.8-flash-tts, עם 130 שפות, ו-Gemini 3.8 Flash-Lite TTS, מזהה מודל gemini-3.8-flash-lite-tts, עם 101 שפות. שתי האחרות — Gemini 3.1 Flash TTS Preview ו-Gemini 2.5 Pro Preview TTS — הן דור התצוגה המקדימה שאותו Flash-Lite מחליף.

אז כשמישהו אומר "Gemini 3.8 TTS", הוא בדרך כלל מתכוון לרמת Flash, כי זו הרמה שפוסט ההשקה פותח בה וזו שהלוח של Arena מדרג במקום הגבוה ביותר. כשהם אומרים את זה על סוכן קולי חי, הם לא מצביעים על כלום, כי הדבר שהם רוצים נמצא בנקודת קצה אחרת עם שם אחר וחוזה קלט אחר.

ישנה התנגשות שלישית שראויה לציון, משום שהיא מייצרת את העצה הגרועה ביותר. Gemini 3.8 Live אינו מודל טקסט-לדיבור עם תכונות נוספות. הוא מודל דיבור-לדיבור, והסיבה שהוא עולה יותר ליחידה היא שהוא מבצע יותר עבודה ליחידה: מקשיב, מנמק תוך כדי אמירה, מתמודד עם הפרעות, ובגרסת ה-Extended Thinking, מתלבט לפני שהוא עונה.

המספר היחיד שבאמת משתווה

ציוני איכות לא עוברים בין שתי המשפחות האלה; אין לוח אחד שמנקד קריין ומנהל שיחה על אותו ציר. כסף כן עובר, ברגע שבוחרים את היחידה בכנות, והיחידה הכנה לכל דבר הקשור לקול היא שעת אודיו.

• חיוב לפי שימוש בקלט — Gemini 3.8 Live מחייב לפי דקת אודיו, $0.005 לדקה בקלט ו-$0.018 לדקה בפלט לעומת Gemini 3.8 Flash TTS שמחייב לפי מיליון טוקני אודיו, $9.00 עד 31 בדצמבר 2026 ו-$18.00 לאחר מכן
• חיוב לפי שימוש בפלט — Gemini 3.8 Live אודיו דו-כיווני עולה בערך $1.38 עבור שעה של קלט ופלט בו-זמניים במחיר מחירון, לפני כל מטמון פרומפטים לעומת Gemini 3.8 Flash TTS שהוא זרם חד-כיווני, ומיליון תווים של קריינות מוגמרת מסתכם ב-$16.5 לפי הנרמול של Artificial Analysis
• קלט טקסט — Gemini 3.8 Live מחייב טקסט ואודיו בשורות נפרדות, $0.75 למיליון טוקני טקסט בקלט ו-$4.50 בפלט לעומת נקודות הקצה של TTS שמחייבות קלט טקסט ב-$0.50 למיליון טוקנים
• שכבת Flash-Lite — ל-Gemini 3.8 Live אין דגם זול יותר; הברירה היא Live או Extended Thinking לעומת Gemini 3.8 Flash-Lite TTS שמתומחר ב-$6.00 ואז $12.00 למיליון טוקני אודיו, כאשר Artificial Analysis עומד על $11.0 למיליון תווים
• מבנה קלט — Gemini 3.8 Live אודיו, וידאו וטקסט נכנסים, אודיו יוצא לעומת נקודות הקצה של TTS טקסט נכנס, אודיו יוצא

נתון ה‑Live הוא החישוב שלנו על בסיס התעריפים לדקה שמפרסמת Google, ולא מספר שעתי שמפרסמת Google. נתוני התווים הם הנרמול של Artificial Analysis, ואותם יש לצטט כשמשווים בין דרגות סינתזה. שימו לב שללוח Speech to Speech של Artificial Analysis עצמו יש עמודה נפרדת של עלות לשעת אודיו קלט עבור מודלי ה‑Live — כ‑3.50 דולר עבור Gemini 3.8 Live וכ‑0.84 דולר עבור גרסת ה‑Extended Thinking — וזהו נרמול שונה again ואסור להשוות אותו למחירון לפי דקה כאילו היו אותה מדידה.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

מה נשבר כשאתה בוחר באפשרות הלא נכונה?

אופני הכשל מאלפים משום שהם כה שונים זה מזה.

קוראים לנקודת קצה של TTS כשנזקקת ללולאת שיחה ושום דבר לא נכשל. הבקשה מחזירה אודיו תקין. אתה מקבל תגובה שוטפת וקריאה היטב למחרוזת קבועה, ואז שקט — כי מעולם לא היה שם מאזין. צוותים מגלים זאת כשהם בונים את מבחן ה-barge-in הראשון שלהם ומגלים שה"משתמש" צריך לחכות שכל הקליפ יסתיים לפני שהתור הבא יכול להתחיל. התאמת שיחה לנקודת קצה של סינתזה משמעה הוספת זיהוי דיבור, מדיניות חלוקת תורים ומנגנון הפרעה סביבה, ובשלב זה בנית מחדש מפל ואתה משלם עבור שני מודלים במקום אחד.

קרא לנקודת קצה של Live כשנזקקת לקריינות, ואתה משלם על יכולת שאינך משתמש בה. מודל Live נמדד בשני הכיוונים, כי הוא מצפה לשני הכיוונים. עבור ספר אודיו או קריינות לסרטון הדרכה, צד הקלט הוא תסריט שלעולם אינו משתנה והמודל לעולם אינו צריך לשמוע דבר. אתה קונה לולאת שיחה כדי להקריא מסמך בקול רם.

המקרה היחיד שבו הבחירה באמת קשה הוא הקסקדה: זיהוי, אחר כך הסקה, ואז סינתזה. הארכיטקטורה הזו לא מיושנת, ובהרבה מערכות ייצור היא עדיין הנכונה, כי היא מאפשרת להחליף כל שלב בנפרד ולבחור ספק אחר לכל אחד. היא עולה לך בזמן השהיה והיא עולה לך בפרוזודיה שמודל מקצה לקצה יחיד שומר עליה על פני גבול תור. הפשרה אמיתית בשני הכיוונים.

היכן שהמסלול כבר קיים

OrcaRouter אינו כולל את נקודות הקצה של Gemini 3.8 Live או את נקודות הקצה של 3.8 TTS, וכדאי לומר זאת לפני כל דבר אחר על ניתוב, מפני שקל להניח את ההפך מקטלוג כה רחב. מה שכן נמצא בקטלוג הוא שאר המשפחה — google/gemini-3.8-flash מבין 28 מודלים של גוגל ו-יותר מ-200 מודלים בסך הכול, ממפתח אחד במחיר המחירון של הספק וללא תוספת.

זה חשוב במיוחד עבור הקסקייד. אם הארכיטקטורה שלך היא זיהוי, לאחר מכן הסקה, ולאחר מכן סינתזה, שלב ההסקה הוא זה שבו מפתח יחיד שמכסה ספקים רבים משתלם, כי זה השלב שמחליפים בו בתדירות הגבוהה ביותר והשלב שבו הורדת מחיר מצד ספק אמורה להגיע לחשבון שלך באותו יום ולא בחידוש החוזה הבא. זה גם השלב שבו מעבר אוטומטי לגיבוי מצדיק את עצמו: לקסקייד יש שלושה מקומות שבהם הוא יכול להישבר, והאמצעי הוא הזול ביותר להעניק לו יתירות.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

כלל החלטה קצר

אם המודל צריך להגיב למשהו שלא היה קיים אצלו כטקסט, אתם רוצים את Gemini 3.8 Live, וכדאי לתקצב לפי תעריפי האודיו של Google ולצפות לחשוב על איזו משתי הווריאציות תזדקקו. אם הטקסט כבר כתוב והמשימה היא לבצע אותו, אתם רוצים את Gemini 3.8 Flash TTS או Flash-Lite TTS, וכדאי לתקצב לפי מיליון תווים ולבחור את הדרגה לפי כיסוי השפות ולפי השאלה אם פער האיכות שווה את פער המחיר.

ואם מבקשים ממך להשוות בין "Gemini 3.8 Live ו-Gemini 3.8 TTS" כאילו היו שני מוצרים, הדבר השימושי הראשון שתוכל לעשות הוא לשאול לאיזו נקודת קצה. השם בתדריך לא מתמפה לאחת מהן, והתשובה משנה את הארכיטקטורה, לא רק את החשבונית.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.