
Gemini 3.8 Live מול Gemini 3.8 TTS: לולאת שיחה וקול הקראה חולקים שם של דור
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 181 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
Gemini 3.8 Live הוא מודל דיבור-לדיבור שיצא ב-15 בספטמבר 2026 בתור gemini-3.8-live וgemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" אינו מודל כלל — זהו המונח המטרייה שסיקור ההשקה, כולל כותרת הפוסט של גוגל עצמה, משתמש בו כדי לתאר את צמד נקודות הקצה לטקסט-לדיבור שהגיעו ב-23 בספטמבר 2026 בתור gemini-3.8-flash-tts וgemini-3.8-flash-lite-tts. אז זה אינו דף ה"מול" הרגיל, שבו שני מוצרים נאבקים על תפקיד אחד. זהו דף על שני תפקידים שחולקים מספר דור, ועל הטעות הספציפית שאנשים עושים כשהם מתייחסים למילים "Live" ו-"TTS" כשני טעמים של אותו דבר.
הפיצול שמספר הדור המשותף מסתיר
התיעוד של Google להפקת דיבור משרטט את הגבול בעצמו, וקל לפסוח על המשפט הזה: "יכולת ה-TTS שונה מהפקת דיבור המסופקת דרך Live API." אותו קטע מסביר מדוע, והסיבה מבנית ולא עניין של איכות. Live API בנוי עבור "אודיו אינטראקטיבי, לא מובנה, וקלטים ופלטים מולטימודליים." TTS דרך Gemini API "מותאם לתרחישים הדורשים הקראה מדויקת של טקסט עם שליטה עדינה." הערה מאוחרת יותר מבהירה במפורש את צורת הקלט: מודלי ה-TTS מקבלים טקסט בלבד ומחזירים אודיו בלבד.
האילוץ היחיד הזה — טקסט נכנס, אודיו יוצא, ללא קלט — הוא כל ההשוואה. מודל Gemini 3.8 Live שומע את מי שמדבר אליו. מודל Gemini 3.8 Flash TTS או Flash-Lite TTS לעולם אינו שומע אף אחד; הוא קורא מחרוזת ומבצע אותה. כל השאר נובע מכך: מדדי הביצועים שקיימים עבור האחד חסרי משמעות עבור האחר, התמחור נמדד ביחידות שונות, ואופני הכשל אינם ברי השוואה כלל.
זה חשוב מפני ששני תרחישי השימוש נראים זהים מבחוץ. גם סוכן קולי וגם צינור קריינות בסופו של דבר מפיקים דיבור שנשמע אנושי. רק אחד מהם ניתן לקטוע.
לאן "Gemini 3.8 TTS" בעצם מתפענח
פתחו את טבלת המודלים הנתמכים עבור יצירת הדיבור של Gemini API ותמצאו ארבע רשומות TTS ואף לא רשומה בשם Gemini 3.8 TTS. שתיים מהן הן מהדור הזה: Gemini 3.8 Flash TTS, מזהה מודל gemini-3.8-flash-tts, עם 130 שפות, ו-Gemini 3.8 Flash-Lite TTS, מזהה מודל gemini-3.8-flash-lite-tts, עם 101 שפות. שתי האחרות — Gemini 3.1 Flash TTS Preview ו-Gemini 2.5 Pro Preview TTS — הן דור התצוגה המקדימה שאותו Flash-Lite מחליף.
אז כשמישהו אומר "Gemini 3.8 TTS", הוא בדרך כלל מתכוון לרמת Flash, כי זו הרמה שפוסט ההשקה פותח בה וזו שהלוח של Arena מדרג במקום הגבוה ביותר. כשהם אומרים את זה על סוכן קולי חי, הם לא מצביעים על כלום, כי הדבר שהם רוצים נמצא בנקודת קצה אחרת עם שם אחר וחוזה קלט אחר.
ישנה התנגשות שלישית שראויה לציון, משום שהיא מייצרת את העצה הגרועה ביותר. Gemini 3.8 Live אינו מודל טקסט-לדיבור עם תכונות נוספות. הוא מודל דיבור-לדיבור, והסיבה שהוא עולה יותר ליחידה היא שהוא מבצע יותר עבודה ליחידה: מקשיב, מנמק תוך כדי אמירה, מתמודד עם הפרעות, ובגרסת ה-Extended Thinking, מתלבט לפני שהוא עונה.
המספר היחיד שבאמת משתווה
ציוני איכות לא עוברים בין שתי המשפחות האלה; אין לוח אחד שמנקד קריין ומנהל שיחה על אותו ציר. כסף כן עובר, ברגע שבוחרים את היחידה בכנות, והיחידה הכנה לכל דבר הקשור לקול היא שעת אודיו.
• חיוב לפי שימוש בקלט — Gemini 3.8 Live מחייב לפי דקת אודיו, $0.005 לדקה בקלט ו-$0.018 לדקה בפלט לעומת Gemini 3.8 Flash TTS שמחייב לפי מיליון טוקני אודיו, $9.00 עד 31 בדצמבר 2026 ו-$18.00 לאחר מכן
• חיוב לפי שימוש בפלט — Gemini 3.8 Live אודיו דו-כיווני עולה בערך $1.38 עבור שעה של קלט ופלט בו-זמניים במחיר מחירון, לפני כל מטמון פרומפטים לעומת Gemini 3.8 Flash TTS שהוא זרם חד-כיווני, ומיליון תווים של קריינות מוגמרת מסתכם ב-$16.5 לפי הנרמול של Artificial Analysis
• קלט טקסט — Gemini 3.8 Live מחייב טקסט ואודיו בשורות נפרדות, $0.75 למיליון טוקני טקסט בקלט ו-$4.50 בפלט לעומת נקודות הקצה של TTS שמחייבות קלט טקסט ב-$0.50 למיליון טוקנים
• שכבת Flash-Lite — ל-Gemini 3.8 Live אין דגם זול יותר; הברירה היא Live או Extended Thinking לעומת Gemini 3.8 Flash-Lite TTS שמתומחר ב-$6.00 ואז $12.00 למיליון טוקני אודיו, כאשר Artificial Analysis עומד על $11.0 למיליון תווים
• מבנה קלט — Gemini 3.8 Live אודיו, וידאו וטקסט נכנסים, אודיו יוצא לעומת נקודות הקצה של TTS טקסט נכנס, אודיו יוצא
נתון ה‑Live הוא החישוב שלנו על בסיס התעריפים לדקה שמפרסמת Google, ולא מספר שעתי שמפרסמת Google. נתוני התווים הם הנרמול של Artificial Analysis, ואותם יש לצטט כשמשווים בין דרגות סינתזה. שימו לב שללוח Speech to Speech של Artificial Analysis עצמו יש עמודה נפרדת של עלות לשעת אודיו קלט עבור מודלי ה‑Live — כ‑3.50 דולר עבור Gemini 3.8 Live וכ‑0.84 דולר עבור גרסת ה‑Extended Thinking — וזהו נרמול שונה again ואסור להשוות אותו למחירון לפי דקה כאילו היו אותה מדידה.

מה נשבר כשאתה בוחר באפשרות הלא נכונה?
אופני הכשל מאלפים משום שהם כה שונים זה מזה.
קוראים לנקודת קצה של TTS כשנזקקת ללולאת שיחה ושום דבר לא נכשל. הבקשה מחזירה אודיו תקין. אתה מקבל תגובה שוטפת וקריאה היטב למחרוזת קבועה, ואז שקט — כי מעולם לא היה שם מאזין. צוותים מגלים זאת כשהם בונים את מבחן ה-barge-in הראשון שלהם ומגלים שה"משתמש" צריך לחכות שכל הקליפ יסתיים לפני שהתור הבא יכול להתחיל. התאמת שיחה לנקודת קצה של סינתזה משמעה הוספת זיהוי דיבור, מדיניות חלוקת תורים ומנגנון הפרעה סביבה, ובשלב זה בנית מחדש מפל ואתה משלם עבור שני מודלים במקום אחד.
קרא לנקודת קצה של Live כשנזקקת לקריינות, ואתה משלם על יכולת שאינך משתמש בה. מודל Live נמדד בשני הכיוונים, כי הוא מצפה לשני הכיוונים. עבור ספר אודיו או קריינות לסרטון הדרכה, צד הקלט הוא תסריט שלעולם אינו משתנה והמודל לעולם אינו צריך לשמוע דבר. אתה קונה לולאת שיחה כדי להקריא מסמך בקול רם.
המקרה היחיד שבו הבחירה באמת קשה הוא הקסקדה: זיהוי, אחר כך הסקה, ואז סינתזה. הארכיטקטורה הזו לא מיושנת, ובהרבה מערכות ייצור היא עדיין הנכונה, כי היא מאפשרת להחליף כל שלב בנפרד ולבחור ספק אחר לכל אחד. היא עולה לך בזמן השהיה והיא עולה לך בפרוזודיה שמודל מקצה לקצה יחיד שומר עליה על פני גבול תור. הפשרה אמיתית בשני הכיוונים.
היכן שהמסלול כבר קיים
OrcaRouter אינו כולל את נקודות הקצה של Gemini 3.8 Live או את נקודות הקצה של 3.8 TTS, וכדאי לומר זאת לפני כל דבר אחר על ניתוב, מפני שקל להניח את ההפך מקטלוג כה רחב. מה שכן נמצא בקטלוג הוא שאר המשפחה — google/gemini-3.8-flash מבין 28 מודלים של גוגל ו-יותר מ-200 מודלים בסך הכול, ממפתח אחד במחיר המחירון של הספק וללא תוספת.
זה חשוב במיוחד עבור הקסקייד. אם הארכיטקטורה שלך היא זיהוי, לאחר מכן הסקה, ולאחר מכן סינתזה, שלב ההסקה הוא זה שבו מפתח יחיד שמכסה ספקים רבים משתלם, כי זה השלב שמחליפים בו בתדירות הגבוהה ביותר והשלב שבו הורדת מחיר מצד ספק אמורה להגיע לחשבון שלך באותו יום ולא בחידוש החוזה הבא. זה גם השלב שבו מעבר אוטומטי לגיבוי מצדיק את עצמו: לקסקייד יש שלושה מקומות שבהם הוא יכול להישבר, והאמצעי הוא הזול ביותר להעניק לו יתירות.

כלל החלטה קצר
אם המודל צריך להגיב למשהו שלא היה קיים אצלו כטקסט, אתם רוצים את Gemini 3.8 Live, וכדאי לתקצב לפי תעריפי האודיו של Google ולצפות לחשוב על איזו משתי הווריאציות תזדקקו. אם הטקסט כבר כתוב והמשימה היא לבצע אותו, אתם רוצים את Gemini 3.8 Flash TTS או Flash-Lite TTS, וכדאי לתקצב לפי מיליון תווים ולבחור את הדרגה לפי כיסוי השפות ולפי השאלה אם פער האיכות שווה את פער המחיר.
ואם מבקשים ממך להשוות בין "Gemini 3.8 Live ו-Gemini 3.8 TTS" כאילו היו שני מוצרים, הדבר השימושי הראשון שתוכל לעשות הוא לשאול לאיזו נקודת קצה. השם בתדריך לא מתמפה לאחת מהן, והתשובה משנה את הארכיטקטורה, לא רק את החשבונית.

