כרטיס כותרת ראשי עבור Gemini 3.8 Live Extended Thinking לעומת Gemini 3.8 Live, המציג את שני המודלים מופרדים לפי עלות אודיו שעתית של פי 4, 3.50 $ לעומת 0.84 $.
Guides & Insights

Gemini 3.8 Live Extended Thinking לעומת Gemini 3.8 Live: לשלם פי 4 עבור 38 הנקודות שחשובות

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלים, השקה אחת, מחירון אחד, והחלטה שרוב הכתבות טועות בה באותו כיוון. Gemini 3.8 Live Extended Thinking וGemini 3.8 Live הושקו יחד ב-15 בספטמבר 2026, שניהם מבוססים על Gemini 3 Pro, שניהם מטפלים ב-97 שפות עם החלפה אוטומטית באמצע השיחה, שניהם קולטים קלט חזותי כמעט בזמן אמת, ושניהם מטביעים סימן מים באודיו שנוצר עם SynthID. במדד ה-Speech to Speech Index המשולב שמפרסם Artificial Analysis, הם נמצאים במרחק 6.6 נקודות זה מזה — 82.6 לעומת 76.0. בעלות האודיו השעתית שאותו לוח מודד, המרחק ביניהם הוא קצת יותר מפי ארבעה.

אף אחד מאלה אינו המספר שאמור להכריע את הארכיטקטורה שלך. המספר שכן אמור להכריע הוא 38: הפער בין השניים ב-τ-Voice, רכיב השלמת המשימות הסוכני, שבו וריאנט החשיבה פותר 68.6% מתרחישי שירות לקוחות משוכפלים והווריאנט הסטנדרטי פותר 30.1%. אתה לא בוחר בין מודל טוב למודל טוב יותר. אתה בוחר בין ממשק שיחה לבין מערכת חשיבה שבמקרה מדברת, וההבדל במחיר הוא הדבר הפחות מעניין בבחירה הזאת.

מזלג המחירים, ביחידות שבהן מחייבים אותך בפועל

התחילו מהחשבון, כי זה החלק שאנשים מבינים נכון ואז נותנים לו משקל יתר. שני המודלים חולקים את אותו תעריף מפורסם דרך Live API: $0.005 לדקת קלט אודיו ו-$0.018 לדקת פלט אודיו, ובצד של Extended Thinking אסימוני הפלט האלה כוללים את החשיבה. אותו כרטיס, אותם תעריפים, אין דרגת פרימיום נפרדת עבור הסקה.

הפער מתגלה ברגע שמודדים עבודה ולא דקות. עמודת העלות לשעת אודיו קלט של Artificial Analysis — העלות של השלמת תת-קבוצה קבועה בת 40 שאלות של Big Bench Audio, מנורמלת לנתון שעתי — ממקמת את שני המודלים בטווחים שונים לחלוטין:

Gemini 3.8 Live Extended Thinking (High) — 3.50 $ לשעת אודיו קלט, לפי המדידה של Artificial Analysis עצמה

Gemini 3.8 Live — $0.84 לשעה, התעריף הנמוך ביותר שמשולם בלוח הזה

• GPT-Live-1 (מנוע Astra, מאמץ בינוני) — 5.83 דולר לשעה, כך שגרסת ה-reasoning עדיין זולה בכ-40% מהמודל שהיא מנצחת

Grok Voice Think Fast 2.0 High — $4.80 לשעה

• GPT-Realtime-2.1 High — $10.75 לשעה

זו ההסתעפות: פי ארבעה מעלות השמע לשעה, על אותו תעריף מפורסם לדקה, מפני שווריאנט ההסקה מוציא יותר טוקנים על אותה כמות האזנה. ה-$0.84 של המודל הסטנדרטי אינו הנחה, הוא רצפת הלוח כולו.

מה קונות 38 הנקודות

פרק את הקומפוזיט, ושני המודלים מפסיקים להיראות כמו זוג:

מדד דיבור לדיבור — Gemini 3.8 Live Extended Thinking (High) 82.6 לעומת Gemini 3.8 Live 76.0

ביצועים סוכניים (השלמת משימות ב-τ-Voice) — 68.6% לעומת 30.1%

הסקת דיבור (Big Bench Audio) — 98% לעומת 92%

דינמיקה שיחתית — 91.9% לעומת 96.1%

העדפת ארנה (Elo) — 990 מול 1083

שיעור הצלחת המשימות — 89.1% לעומת 93.2%

זמן עד לאודיו הראשון — 1.35s לעומת 1.18s

עלות לשעת אודיו קלט — $3.50 לעומת $0.84

קרא את זה בכנות והמודל הזול מנצח בארבע מתוך שמונה השורות. הוא מהיר יותר לאודיו ראשון, מועדף על ידי הארנה, סביר יותר להשלים משימה שטחית, ומדורג טוב יותר בדינמיקה שיחתית — האחרונה שבהם אינה פרס ניחומים, כי דינמיקה שיחתית היא מה שמתקשר שם לב אליו. מה שהוא לא יכול לעשות זה לסיים עבודה שיש בה שלבים. שלושים נקודה אחת אחוז מול 68.6% הוא הפער הבודד הגדול ביותר בכל מקום במהדורה הזו, והוא נופל על הציר היחיד שמפריד בין סוכן לממשק.

שתי הסתייגויות לגבי השורות האלה. נתון העדפת הארנה בתוך האינדקס מוקפא בנקודה שבה מודל נעשה זכאי לפרסום, כך שזהו תמונת מצב ולא Elo רץ — יש לקרוא אותו כדירוג נקודתי בזמן ולא בתור התרשים החי של Speech Agent Arena. ובראש לוח τ-Voice צמוד: גרסת החשיבה עם 68.6% מובילה את GPT-Live-1 עם 67.9% (Astra backend, מאמץ בינוני) ב-0.7 נקודות, כאשר GPT-Live-1 (Sol, מאמץ נמוך) עם 59.3% ו-Grok Voice Think Fast 2.0 High עם 56.5% מאחור. יתרון 0.7 הנקודות על GPT-Live-1 נמצא בתוך הרעש. הפער של 38 נקודות בתוך הזוג הזה אינו בתוך הרעש.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

ה-4x האחר: מה עולה לך שכבת החשיבה בקוד

יש פורק שני בגרסה הזו, והוא אינו מופיע באף לוח דירוג. שני המודלים אינם ניתנים להחלפה ישירה זה בזה, מכיוון שגרסת החשיבה משנה את החוזה שהלקוח שלך חייב לכבד.

במודל הסטנדרטי, Gemini 3.8 Live מתנהג בדיוק כפי שלקוח Live API מצפה: קריאות כלים ו-API ברקע פועלות בזמן שהמודל ממשיך לדבר, ו-turnComplete: true עדיין מסמן את סוף התור. אין הגדרת רמת חשיבה לבחירה, מפני שאין שום דבר נפרד להגדיר — המודל עונה, וכשהוא סיים לענות, התור תם.

ב-Gemini 3.8 Live Extended Thinking, שלושה דברים משתנים בבת אחת:

קריאות פונקציה הן תמיד אסינכרוניות. הצהרת כלי חוסם אינה נכנסת לתור בנימוס — היא מחזירה שגיאה קשה. כל סכימת כלי שכתבת עבור המודל הסטנדרטי חייבת להיות מוצהרת מחדש כבלתי־חוסמת.

שדה סטטוס חדש נושא את המצב האמיתי. לקוחות צריכים לקרוא interaction_status במקום לסמוך על turnComplete: השדה מציג IN_PROGRESS בזמן שהמודל עדיין מהרהר או שכלי עדיין פועל, ורק מתייצב ל-IDLE כאשר המשימה כולה הסתיימה. תור יכול להסתיים בעוד שהמשימה טרם הסתיימה.

עומק החשיבה הוא פרמטר מתכוונן. המודל חושף רמות חשיבה ניתנות להגדרה — נמוכה, בינונית וגבוהה — והמספרים 82.6 ו-68.6 בלוח הם בתצורת (High). מעבר לרמה נמוכה משנה הן את האיכות והן את חשבון הטוקנים, ושום דבר במדד לא אומר לך מה רמה נמוכה עולה לך בהשלמת משימות.

הנקודה השלישית היא מלכודת ההגירה. מכיוון ש-Extended Thinking מגיב באותה צורה ברשת כמו המודל הסטנדרטי עד שמעורבת קריאת כלי, צוות יכול להחליף את מזהה המודל, לראות דמו עובד, ולגלות את החוזה האסינכרוני רק בפרודקשן כשכלי הזמנות מחזיר שגיאה במקום תוצאה. תקצבו את ריפקטור הלקוח לצד תעריף האודיו פי 4; באינטגרציה בשלה זה הגדול מבין שני העלויות.

איזה מהם עומס העבודה שלך בעצם דורש

הדרך הנקייה להחליט היא לשאול לשם מה נועד הסשן, ולא עד כמה חכם תרצה שהוא יהיה.

בחר Gemini 3.8 Liveכשהשיחה היא התוצר. מענה, שמירה על רצף השיחה, קבלת הודעה, מיון מתקשר, להיות נעים ומהיר וזול. במחיר של 0.84 דולר לשעת אודיו קלט זהו מודל הקול המוכשר הזול ביותר שמפורסם כיום, הוא מועדף בזירה, הוא אמין יותר במשימות שטחיות, והוא מהיר ב-170 מילישניות עד לאודיו הראשון — הבדל שמתקשר מרגיש. הדבר האחד שצריך לקבל הוא התקרה: 30.1% בהשלמת משימות מרובות-שלבים פירושו שהוא לא יסיים עבודה שיש בה שלבים, ושום כמות של הנדסת פרומפטים לא תזיז את המספר הזה.

קחו את Gemini 3.8 Live Extended Thinking כשהמפגש כולל משימה. לקבוע תור, לשנות, לבטל, לפתור בעיה בחשבון, להוביל מתקשר בתהליך רב-שלבי בזמן שהוא ממתין. זה קו 38 הנקודות, והוא שווה $3.50 לשעה — שזה, שימו לב, עדיין זול יותר משני המודלים שהוא עוקף בציון המשולב. אתם גם מקבלים את התנהגות הקריינות שהופכת את ההמתנה לנסבלת: המודל הזה מנמק ומדבר בו-זמנית, כך שבמקום שקט בזמן שהוא מחפש משהו, המתקשר שומע "תן לי לבדוק את זה…" ואת ההתקדמות תוך כדי. זו אותה בעיה שארכיטקטורות דופלקס מלא פותרות בכך שהאודיו לעולם לא נפסק; התשובה של Google היא להמשיך לדבר במקביל לעבודה.

שתי שורות נוספות ששווה לשקול. גוגל גם מדווחת על 35.1% עבור מודל ה-Extended Thinking בלוח המובילים τ³-Banking של Sierra, לעומת 32.0% עבור GPT-Live-1 Astra — נתון שמדווח על ידי הספק בלי מדידה עצמאית מאחוריו, וזה נתון שמצנן את ההתלהבות במונחים מוחלטים, שכן 35.1% פירושם שהמודל הטוב ביותר בלוח הזה נכשל בבערך שניים מכל שלושה ניסיונות של משימת בנקאות ריאלית. והמקום השני של המודל הסטנדרטי ב-Speech Agent Arena, שאותו גוגל מצטטת בחומרים שלה עצמה, הוא תוצאה אמיתית בלוח אחר שמודד העדפה ולא השלמת משימות. שתי הקביעות מחזיקות. יחד הן אומרות שהמודל הזול טוב מאוד בזה שמדברים איתו, והמודל היקר הוא היחיד מבין השניים שאפשר לתת לו עבודה.

מריץ את שניהם, בלי שתי אינטגרציות

ההתנגדות המעשית לכל זה היא שבחירה לפי עומס עבודה משמעה תחזוקה של שני נתיבים. זה לא חייב להיות כך. שתי הווריאציות יושבות מול אותו סוג של בקאנד — הרצת כלים ברקע ותכנון רב-שלבי מתורגמים לקריאות רגילות של מודל טקסט — והשכבה הזו היא המקום שבו שונות העלויות שלך נמצאת ושבו ההחלפה זולה.

OrcaRouter מציע 190 מודלים ממפתח יחיד במחיר המחירון של הספק וללא תוספת, כך ששינוי מחיר של ספק מתעדכן אצלנו באותו יום ולא בחידוש החוזה הבא. עבור סטאק שמנתב בין שכבה שיחתית זולה לשכבת הסקה יקרה, שתי התכונות שחשובות הן שניתן להחליף את יעד ההאצלה בתעבורה חיה בלי לגעת באינטגרציית הקול, ושמעבר אוטומטי לגיבוי שומר על סשן פעיל כשקצה אחורי נכשל או מגיע לפסק זמן. כדי לדייק לגבי מה שאנחנו מארחים ומה לא: נקודות הקצה Gemini 3.8 Live ו-Gemini 3.8 Live Extended Thinking אינן בנתב שלנו — הן מגיעות מה-API של Google עצמו, ב-Gemini API, ב-Live API וב-Google AI Studio. מודלי הטקסט שסוכנים אלה מעבירים אליהם את עבודתם לעתים קרובות מאוד הם, וביניהם Gemini 3.8 Flash.

איפה כל דגם יושב על הלוח

הצילום שלהלן צולם ב-16 בספטמבר 2026, ובראש ה-Speech to Speech Index כתוב כך:

Gemini 3.8 Live Extended Thinking (High) — 82.6, מקום ראשון

• GPT-Live-1 (צד שרת Astra, מאמץ בינוני) — 81.5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (בקאנד Sol, מאמץ נמוך) — 80.1

Gemini 3.8 Live — 76.0, מקום חמישי

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

הערת שם אחת בזמן שאתם קוראים את הרשימה הזו: הסיומת (High) המצורפת למודל הזה בסיקור היא תווית של תצורת מאמץ חשיבה, ולא מהדורה נפרדת. זו אותה מוסכמה שהלוח משתמש בה עבור Grok Voice Think Fast 2.0 High ו-GPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

מה עדיין לא נכלל ב-commit?

דבר אחד בנוגע לצמד הזה קל לפרש שלא כהלכה, ולכן כדאי לומר זאת בפשטות: אף אחד מהדגמים אינו זמין באופן כללי במובן החוזי, למרות ששניהם מתומחרים ומתועדים.

מפתחים מקבלים Gemini 3.8 Live ב-Gemini API, ב-Live API וב-Google AI Studio תחת המזהה gemini-3.8-live; ארגוניים מקבלים תצוגה מקדימה פרטית ב-Gemini Enterprise, כאשר Gemini Enterprise for Customer Experience מופיע כ"בקרוב"; צרכנים מקבלים אותו ב-Search Live. Gemini 3.8 Live Extended Thinking מציע את אותו משטח מפתחים תחת gemini-3.8-live-extended-thinking, ובנוסף מסלול צרכני רחב יותר — Gemini Live, ‏Docs Live למנויי Google AI Pro ו-Ultra, ו-Gmail Live ו-Keep Live לכל מנויי Google AI. לקוחות עסקיים של Workspace מופיעים כ"בקרוב".

מה שחסר הוא מה שארגון צריך לפני שהוא מוסיף לכך שורת הכנסה: התחייבות לזמינות כללית, נתון זמינות מפורסם, ותעריף שגוגל הבטיחה לשמור עליו. המחירים מפורסמים, ולתמחור של תצוגה מקדימה יש נטייה להשתנות. בנה אב־טיפוס עכשיו, תכנן את ההגירה, ואל תחתום על יעד זמינות שלא סופק לך.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

ההחלטה שהצמד הזה מציג בפועל צרה יותר מכפי שהאינדקס גורם לה להיראות, והיא אינה סולם איכות. אם תפקיד הסוכן שלך הוא לדבר, המודל הזול אינו פשרה — הוא המוצר הטוב יותר במחיר הנמוך, והתעריף הזול פי ארבעה הוא בונוס ולא הטיעון. אם תפקיד הסוכן שלך הוא לסיים משהו, גרסת החשיבה היא היחידה מבין השניים שאפשר בכלל להטיל עליה את המשימה, ו-3.50 דולר לשעה הוא שגיאת עיגול לעומת הזמנה שאחרת נכשלת. הטעות שיש להימנע ממנה היא לפצל את ההבדל: לשלם עבור עומק חשיבה על עומס עבודה שמעולם לא היה זקוק אלא לשיחה טובה, וזה מה שקורה כשצוות קורא את פער הציון המשולב של 6.6 נקודות ולעולם אינו גולל למטה אל ה-38.