כרטיס hero מחולל עבור 'Gemini 3.8 Live with Live Avatar' על רקע לבן עם הדגשות גרדיאנט עדינות בכחול ותכלת. שלושה כרטיסים מוערמים מציגים '15 בספטמבר 2026 — Gemini 3.8 Live ו-3.8 Live Extended Thinking יוצאים ב-Live API', '24 בספטמבר 2026 — Live Avatar מוכרז, Gemini Enterprise', ו'היום — ה-Avatar הוא יכולת ארגונית, לא מזהה מודל'. שורת כותרת תחתונה מציינת 'תאריכים לפי Google DeepMind.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.8 Live עם Live Avatar: Google מעניקה פנים למודל הקולי שלה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Gemini 3.8 Live ו-Gemini 3.8 Live Extended Thinking הושקו ב-15 בספטמבר 2026 — שתי נקודות הקצה הנייטיביות לדיאלוג חי ש-Google פתחה ב-API של הספק, האחת ממוטבת לשהיה והשנייה לשיקול דעת. ב-24 בספטמבר הכריזה החברה על Gemini 3.8 Live with Live Avatar, שמזווג יצירת וידאו כמעט בזמן אמת עם אותה לולאת דיבור, כך שלדגם יש פנים בזמן שהוא מדבר. שום דבר בשני מזהי הדגמים לא השתנה. מה שהשתנה הוא איך מותר לשיחה להיראות, ו——באופן משמעותי יותר——מה שמותר לדגם לעשות לשיחה בעודה עדיין מתנהלת.

מה בעצם שוחרר ב-24 בספטמבר

הפוסט של DeepMind קצר וספציפי, וכדאי להפריד בין הטענות שלו לבין המשמעות שלו. Live Avatar, במילותיה של Google עצמה, "מביא נוכחות חזותית כמעט בזמן אמת ל-AI השיחתי של Gemini" על ידי שילוב של יצירת וידאו בזמן אמת עם סטאק הדיבור הקיים. החברה מתארת סנכרון שפתיים מדויק, הבעות פנים טבעיות וחילופי תורות זורמים, ונותנת שתי דוגמאות לפריסה: שירות לקוחות והדרכות אינטראקטיביות. ואז היא אומרת את המשפט שהכי חשוב לכל מי שמתכנן בנייה — "החל מהיום, Gemini 3.8 Live with Live Avatar זמין ב-Gemini Enterprise."

זה כל סיפור הזמינות. Live Avatar אינו מזהה מודל של Gemini API. רשימת מודלי האודיו של ה-API עדיין מכילה gemini-3.8-live וגם gemini-3.8-live-extended-thinking ואין שורת אווטאר, ולכרטיס התעריפים אין סעיף אווטאר. התכונה נמצאת בתוך Gemini Enterprise, כלומר הקהל של ההכרזה הוא קונים ארגוניים והמפתחים שמשלבים עבורם, ולא המפתח הבודד שקורא ל-Live API עם מפתח היום.

שתיים מהטענות בפוסט ראויות לציטוט מדויק, משום ששתיהן חזקות יותר מהשפה השגרתית של השקות. הראשונה: Live Avatar "מציע סנכרון דיבור-אל-דיבור רב-לשוני מקורי" ו"יכול לעבור בצורה חלקה בין 97 שפות בלי לפגוע בנאמנות הווידאו או ליצור סטייה חזותית". המספר 97 הוא אותו מספר שפות שנטען בהשקה של 15 בספטמבר עבור מודלי הדיאלוג החי שבבסיס המערכת, כך שזו הטענה הרב-לשונית הקיימת בניסוח מחדש, עם אילוץ חדש שמצורף אליה — סנכרון השפתיים והאנימציה של הפנים צריכים לעמוד בקצב כשהשפה מתחלפת באמצע המשפט. השנייה: כל הפלט מסומן במים של SynthID, "שזור ישירות בפלט האודיו והווידאו". בשני הערוצים, לא רק בקול.

היכולת החדשה באמת היא זו שבאמצע

אם ממשיכים מעבר לוויזואליה, הפסקה המעניינת ביותר היא זו שעוסקת בקריאות לכלים. Google אומרת ש-Live Avatar מבוסס על "קריאה לכלים אסינכרונית" שיכולה "להפעיל קריאות לכלים ולשלוף נתונים ברקע תוך המשך דו־שיח פעיל, ולטפל במשימות מורכבות תוך הבטחת זרימת שיחה בלתי מופרעת." הדוגמה המעשית היא צ'ק־אין של אורח במלון, שבו המודל קורא לכלים ברקע וממשיך לדבר.

זהו הבדל ארכיטקטוני אמיתי מצורת הבקשה-תגובה שרוב אינטגרציות הקול בנויות סביבה, וזה החלק שיש לו עלות נלווית. ביצוע א-סינכרוני אומר שהמודל עושה עבודה שהתמלול לא מראה. בצינור טקסט היית רואה את קריאת הכלי בתור תור. כאן זה קורה מתחת לשיחה שעדיין מתנהלת, מה שמעלה את אותן שאלות שכל ביצוע מקבילי מעלה: מה קורה אם קריאת הכלי נכשלת בשקט באמצע משפט, ואיך המתקשר יודע? הפוסט של Goog​le לא אומר, וכרטיס המודל הוא המקום לחפש בו. התייחס לטענת "זרימה שיחתית בלתי מופרעת" ככזו שדווחה על ידי הספק ולא נבדקה על ידי שום צד שלישי שמצאנו.

אווטארים מוגדרים מראש, ורשימת ההיתרים שמגבילה את החצי המעניין

לסיפור ההתאמה האישית יש שתי רמות, ורק אחת מהן זמינה באופן כללי. כל פריסה ארגונית מקבלת "ספרייה של אווטארים מגוונים ומוגדרים מראש". אווטארים מותאמים אישית — שנוצרים "מתמונת ייחוס באיכות גבוהה" תוך "שימור הדמיון לייחוס, הסגנון המיתוגי או זהות הדמות" — נמצאים מאחורי מחסום, ו-Goog​le מציינת זאת במפורש: "יצירת אווטאר מותאם אישית זמינה כיום רק באמצעות רשימת היתרים ארגונית."

אז היכולת שרוב הצוותים ירצו בפועל, זו שמאפשרת לאווטאר להתאים למותג או לדמות בעלת שם, היא זו שאי אפשר להשיג בשירות עצמי. אם התוכנית שלכם תלויה במציג סינתטי שנראה כמו הקמע שלכם, אתם ממתינים להחלטה על רשימת היתר ולא לשחרור של מודל. זו עובדת רכש, לא עובדה טכנית, וזה מסוג הדברים שנדחים בשקט ברבעון.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

היכן הוא ממוקם ביחס לשאר השורה

Live Avatar לא הגיע אל תוך משפחת מוצרים ריקה, ואת המקום שהוא תופס קל ביותר לראות לעומת האחים שיצאו לאור באותם שבועיים.

• מסופק כ- — Gemini 3.8 Live עם Live Avatar הוא יכולת ארגונית בתוך Gemini Enterprise לעומת Gemini 3.8 Live ו-Gemini 3.8 Live Extended Thinking שהם נקודות קצה של Gemini API עם מזהי מודלים ותעריפים מפורסמים לפי דקה
• ניתן לקריאה על ידי מפתחים — Live Avatar לא, אין מזהה מודל ואין שורה במחירון לעומת שתי נקודות הקצה של Live כן, gemini-3.8-live ו-gemini-3.8-live-extended-thinking
• פלט — Live Avatar אודיו בתוספת וידאו מסונכרן לעומת נקודות הקצה של Live אודיו בלבד
• הצהרת שפות — Live Avatar 97 שפות עם סינכרון שפתיים והמשכיות הבעות לעומת נקודות הקצה של Live 97 שפות עם החלפה אוטומטית באמצע השיחה
• סימן מים — Live Avatar SynthID גם ברצועת האודיו וגם ברצועת הווידאו לעומת נקודות הקצה של Live SynthID על האודיו שנוצר

שתי נקודות הקצה של Live עצמן הן הזוג המתועד היטב. מדידה בלתי תלויה מציבה אותן הרחק זו מזו בצירים מסוימים וקרוב זו לזו באחרים: במדד Artificial Analysis Speech to Speech Index, ‏Gemini 3.8 Live Extended Thinking (High) עומד על 82.6 לעומת 76.0 של Gemini 3.8 Live, פער שנבנה בעיקר על איכות החשיבה ולא על דינמיקה שיחתית, שבה הסדר מתהפך. הנתונים של Google עצמה מציבים אותן על 68.6% ו-30.1% בהשלמת משימות ב-τ-Voice ועל 98% ו-92% ב-Big Bench Audio. Live Avatar יורש את מי מהשניים שתקראו מתחתיו, וגם יורש את התמחור שלהם, מכיוון שהאווטאר הוא שכבת תצוגה מעל אותה לולאת שיחה.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

מה שזה לא משנה

זה לא משפר את המודלים. Live Avatar הוא שכבת הצגה ותזמור: נתוני האיכות של Gemini 3.8 Live הם כפי שהיו ב-15 בספטמבר, ומי שזקוק לחזק מבין שתי הווריאציות עדיין צריך לבחור ב-Extended Thinking ולהשלים עם השיהוי שלה. זה לא מכניס וידאו ל-API. וזה לא משנה את המחיר של שיחה עם המודל, שעדיין מחויב לפי תעריפי האודיו לפי דקה של Live API — $0.005 לדקת אודיו נכנס ו-$0.018 לדקת אודיו יוצא — כאשר יצירת הווידאו של האווטאר אינה מתומחרת בפומבי מכיוון שהיא אינה נמכרת בנפרד.

מה שזה כן משנה הוא מכלול המוצרים שאפשר לבנות בלי שכבת רינדור נפרדת. סוכן תמיכה שקודם לכן דיבר והשאיר פאנל ריק על המסך יכול כעת להחזיק פנים בזמן שהוא עובד, והעבודה שהוא עושה ברקע כבר אינה נראית כזמן מת. זהו שינוי משמעותי בצורתו של ממשק ושינוי מתון במודל הבסיסי. שני הדברים האלה יכולים להיות נכונים בו-זמנית.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

מה לצפות, והערת ניתוב אחת

שלושה דברים יהפכו את זה מהכרזה להחלטת בנייה. ה-allowlisting של אווטארים מותאמים אישית יצטרך להיפתח, כי אווטארים מוגדרים מראש הם דמו ואווטארים מותאמים אישית הם מוצר. מסלול הווידאו יצטרך לקבל מחיר, כי אף אחד לא יכול לבנות מודל של כלכלת יחידה על פלט בלי תמחור. ונקודת קצה של אווטאר תצטרך להופיע ברשימת המודלים של ה-API, כי זה ההבדל בין תכונה ארגונית למשהו שמפתח יכול לקרוא לו כבר הלילה.

מצדנו, דבר אחד ראוי להצהרה מדויקת, שכן קל להניח אחרת: OrcaRouter אינו מנתב את נקודות הקצה של Gemini 3.8 Live או את Live Avatar, ואין לקרוא דבר כאן כטענה שהוא כן עושה זאת. מה שכן אנחנו מספקים הוא שאר קו 3.8 של Google — google/gemini-3.8-flash ביניהם — לצד קטלוג של יותר מ-200 מודלים ממפתח אחד במחיר המחירון של הספק ללא תוספת. אם Live Avatar מפנה את הארכיטקטורה שלכם לעבר סוכן שצריך להסיק לגבי מה שהלקוח אמר, חצי ההיסק של המחסנית הזו הוא החצי שאתם יכולים לאחד כבר היום.