כרטיס כותרת הירו עבור Gemini 3.8 Live Extended Thinking לעומת GPT-Live-1, המציג את שני מודלי הקול בפער של 1.1 נקודות מדד זה מזה, עם מודלי חיוב שונים.
Guides & Insights

Gemini 3.8 Live Extended Thinking מול GPT-Live-1: תיקו של 1.1 נקודות ושני חשבונות שונים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בציון המשולב, זהו תיקו. Gemini 3.8 Live Extended Thinkingעומד על 82.6 במדד הדיבור-אל-דיבור של Artificial Analysis; GPT-Live-1, עם מנוע ה-Astra שלו במאמץ הסקה בינוני, עומד על 81.5. ברכיב הסוכני שמתחת — השלמת משימות ב-τ-Voice — הפער הוא 0.7 נקודות, 68.6% מול 67.9%. ברכיב ההסקה הוא רחב יותר ופונה לכיוון ההפוך: 97.7% ב-Big Bench Audio עבור מודל Gemini, 90.1% עבור GPT-Live-1. שום דבר בפער הזה לא שורד הרצת בנצ'מרק שנייה, ואף אחד מאלה אינו מה שעליכם להחליט על פיו.

מה שמבדיל בין השניים אינו איכות. זה שהם חלוקים בשאלה מהו סוכן קולי, מי עושה את החשיבה, ומה שמשפיע ראשון על שורת התקציב — כיצד מחויבים על הסשן. Gemini 3.8 Live Extended Thinking מחייב לפי טוקן אודיו ומבצע את החשיבה באותו מודל שמדבר. GPT-Live-1 מחייב בתעריף אחיד לפי שעון הסשן, בין אם מישהו מדבר ובין אם לאו, ומעביר את החשיבה בפועל למודל טקסט נפרד שאתם בוחרים ומשלמים עליו בנפרד. אלה שני מוצרים שונים העוטים את אותו ציון בנצ'מרק, והמוצר שמתאים תלוי בשאלה שטבלת הדירוג לעולם לא שואלת: איך נראית שיחה ממוצעת בקו שלכם?

השוויון של 1.1 נקודות, והיכן הוא למעשה נשבר

התחילו עם המספרים, כי הדקיקות של הכותרת היא הנקודה:

מדד דיבור לדיבור — Gemini 3.8 Live Extended Thinking (High) 82.6 לעומת GPT-Live-1 (בקאנד של Astra, מאמץ בינוני) 81.5

ביצועים אג'נטיים (השלמת משימות ב-τ-Voice) — 68.6% לעומת 67.9%, כאשר GPT-Live-1 מגיע ל-59.3% כשהוא מריץ את ה-backend של Sol במאמץ נמוך

חשיבה דיבורית (Big Bench Audio) — 97.7% לעומת 90.1%, הרכיב היחיד שבו הפער אינו רעש

תהליכי עבודה בנקאיים מורכבים (Sierra τ³-Banking, לפי דיווח הספק) — 35.1% לעומת 32.0%

זמן עד לאודיו הראשון — 1.35s לעומת 1.24–1.34s דרך ה-API

עלות מדודה לשעה — $3.50 לעומת $5.83 עבור תצורת Astra, שניהם לפי מדידת קלט האודיו של Artificial Analysis

הקריאה הכנה היא שאין הבדל בין שני המודלים במדד המשולב, שיש הבדל ביניהם בחשיבה בדיבור, שבה מודל Gemini מוביל בכמעט שמונה נקודות, ושיש הבדל ביניהם בעלות, שבה הוא מוביל בכ-40%. המקום שבו GPT-Live-1 יוצא קדימה הוא בחלקים של החוויה שמודד ביצועים מתקשה לתת להם ציון: הוא דופלקס מלא באמת, מקשיב תוך כדי דיבור, משמיע תגובות משוב, ומחליט כמה פעמים בשנייה אם לדבר או לוותר על התור. Gemini 3.8 Live Extended Thinking מבוסס תורות. הוא פותר את אותה בעיה בסיסית — מתקשר שנשאר בדממה בזמן שהסוכן עובד — באמצעות קריינות במקום, כשהוא חושב ומדבר בו-זמנית עם רמזים כמו "תן לי לבדוק את זה…" בזמן שהמשימה מתבצעת.

שתי הגישות משאירות את הקו בחיים. הן מרגישות שונות. רק אחת מהן מופיעה באינדקס.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

שני מודלים לחיוב, ולמה כרטיס התעריפים מטעה

זהו הקטע שמכריע את מרבית הפריסות, והוא זה שהסיקור מדלג עליו.

Gemini 3.8 Live Extended Thinking מחויב באותו אופן שבו מחויב מודל טוקנים. דרך Live API, התעריפים המפורסמים הם $3.00 למיליון טוקני קלט אודיו — בערך $0.005 לדקת קלט אודיו — ו-$12.00 למיליון טוקני פלט אודיו, בערך $0.018 לדקה, כאשר טוקני החשיבה נספרים בתוך הפלט הזה. אתם משלמים על אודיו שזז. מתקשר שעוצר, חושב או מועבר להמתנה לא עולה לכם דבר כל עוד הוא שותק.

GPT-Live-1 מחויב באותו אופן שבו מחויב קו טלפון. זה 0.05 דולר קבוע לכל דקה של זמן סשן, בחיוב לפי שנייה, בלי קשר למי שמדבר או אם בכלל מישהו מדבר. ה-backend של החשיבה אינו כלול: מודל הטקסט שעושה את החשיבה, וכל כלי שהוא קורא לו, מחויבים בנפרד על גבי זה. כך מחיר כותרת של 0.05 דולר הופך לסכום כולל של כ-4.47 דולר לשעה ב-backend של Sol ו-5.83 דולר לשעה ב-Astra medium, כפי שנמדד על ידי Artificial Analysis.

הצב את אלה זה לצד זה וההשוואה הנאיבית — 0.018 דולר מול 0.05 דולר לדקה, פער של פי 2.8 — שגויה בשני הכיוונים. הנתונים הנמדדים לשעה מעמידים את הפער האמיתי על 3.50 דולר מול 5.83 דולר, קרוב יותר לפי 1.7. אבל מודל שעון הסשן גם משנה את צורת החשבון שלך ולא רק את גובהו: ב-GPT-Live-1 העלות שלך עוקבת אחרי משך השיחה, כך שקו עם שיחות ארוכות, שקטות ובעלות תוכן מועט — תור תמיכה, שלב אימות, העברה ל-IVR — משלם אותו דבר כמו קו צפוף. בצד של Gemini, העלות עוקבת אחרי אודיו, כך ששקט הוא בחינם ופירוט יתר אינו. הרץ את החישוב על אורך השיחה הממוצע שלך לפני שאתה מריץ אותו על תעריף לדקה, כי זה המספר שקובע איזה מהם זול יותר עבורך, וזה לא אותה תשובה עבור קו הזמנות וקו מיון.

איפה שהחשיבה מתרחשת

ההבדל המבני השני הוא האצלה, והוא זה שקובע כמה מהסטאק הזה תוכלו למעשה להחליף.

GPT-Live-1 הוא ממשק קדמי. הוא מטפל באודיו דו-כיווני, וכאשר שאילתה דורשת חשיבה אמיתית הוא מעביר את העבודה למודל אחורי נפרד — GPT-5.5 ו-GPT-6 Astra מתועדים שניהם כמודלים אחוריים — עם בוררי מאמץ חשיבה שמאפשרים לך לבחור כמה מהמודל האחורי הזה אתה רוצה לקנות. זו הסיבה שהלוח מציג את GPT-Live-1 פעמיים בציונים שונים: 81.5 על Astra במאמץ בינוני, 80.1 על Sol במאמץ נמוך. פער 1.4 הנקודות בין שתי התצורות של עצמו גדול יותר מפער 1.1 הנקודות בין שני המודלים במפגש הזה, מה שמלמד שבצד של OpenAI, התצורה שאתה בוחר חשובה יותר מהספק שאתה בוחר.

Gemini 3.8 Live Extended Thinking חושב באותו מודל שמדבר. אין backend נפרד לבחור ואין חשבון נפרד עבורו; הפשרה היא שאתה מכוון עומק עם רמות חשיבה — נמוכה, בינונית וגבוהה — על אותו מודל, והמספרים 82.6 ו-68.6 הם ה-(גבוהה) תצורה. כלי רקע וביצוע API פועלים באופן אסינכרוני בשני הצדדים, כך שאף מודל לא נתקע בזמן שהוא עובד.

השלכה מעשית אחת: מכיוון שהאינטליגנציה של GPT-Live-1 היא מודל טקסט קנוי מאחורי חזית קולית, תקרת האיכות שלה זזה כאשר OpenAI משיקה מודל טקסט, ולא כאשר היא משיקה מודל קולי. התקרה של Gemini 3.8 Live Extended Thinking זזה כאשר Google מאמנת מחדש את מודל האודיו. אם אתם מהמרים לשנתיים על פלטפורמת קול, הפער הזה בקצב השדרוגים שווה יותר מחשבה מ-1.1 נקודות אינדקס.

מה עלויות המעבר, בכל דרך שתבחר

אף אחד מאלה אינו החלפה של מזהה מודל, וצוותים שמתייחסים לכך ככזה מגלים זאת בפרודקשן. המעבר אל Gemini 3.8 Live Extended Thinking משמעו לקבל חוזה תור שונה: קריאות פונקציה הן תמיד אסינכרוניות, כך שהצהרת כלי חוסמת מחזירה שגיאה קשה במקום להיכנס לתור, והלקוחות צריכים לקרוא את השדה interaction_statusIN_PROGRESS בזמן שהמודל עדיין מנמק או שכלי עדיין פועל, IDLE רק כשהמשימה כולה מסתיימת — במקום לסמוך על turnComplete כמעיד שהעבודה הושלמה. המעבר אל GPT-Live-1 משמעו לאמץ את תשתית בחירת ה-backend שלו ומשטח חיוב שני, ולהסתגל ל-API שהפך לזמין באופן כללי למפתחים רק ב-10 בספטמבר 2026, לאחר שהושק לראשונה ב-ChatGPT ב-8 ביולי — כך שכלים של צד שלישי, ערכות SDK וכלי ניטור סביבו בני חודשים, לא שנים. בכל כיוון שתבחרו, תקצבו את עבודת האינטגרציה לצד חשבון הטוקנים. בערימת קול בוגרת, הרפקטור הוא בדרך כלל הגדול מבין השניים.

איך לבצע השוואה כזו בלי להמר על זה

הדרך ההגיונית להכריע בשאלה של 1.1 נקודות היא להריץ את שניהם על התעבורה שלך, והחלק המסובך הוא שבדרך כלל הדבר מחייב שתי אינטגרציות, שני חוזים ושתי קבוצות של אישורי גישה. זה לא חייב להיות שתי ארכיטקטורות. בשתי המערכות האלה החזית הקולית היא שכבה דקה מעל קריאות רגילות למודל טקסט — עבור GPT-Live-1 זה מפורש, ובצד של Gemini הרצת כלים ברקע נפתרת באותו אופן — ושכבת הטקסט הזו היא המקום שבו נמצאת שונות העלויות שלך ושבו ההחלפה היא באמת זולה.

OrcaRouter מציע 190 מודלים ממפתח אחד במחיר המחירון של הספק, ללא תוספת רווח, כך ששינוי מחיר במעלה הזרם מתעדכן אצלנו באותו יום ולא רק בחידוש החוזה הבא. במערך קולי, שתי התכונות שקובעות הן שהיעד שאליו מואצלת הקריאה ניתן להחלפה על תעבורה חיה בלי לגעת באינטגרציית הקול, ושמעבר אוטומטי לגיבוי משאיר את השיחה פעילה כאשר ה-backend מחזיר שגיאה או חורג מזמן ההמתנה — וזה בדיוק מה שמאפשר לך לנסות תצורה לא מוכחת על תעבורה אמיתית בלי להעמיד מאחוריה קו ייצור. כדי לדייק לגבי מה שאנחנו מארחים ומה לא: לא נקודת הקצה Gemini 3.8 Live Extended Thinking ולא נקודת הקצה GPT-Live-1 נמצאת בראוטר שלנו — אלה מגיעות מה-API של גוגל ושל OpenAI עצמן. מודלי הטקסט שאליהם הן מאצילות נמצאים אצלנו לעתים קרובות מאוד, ובהם Gemini 3.8 Flash.

החלק העליון של הלוח, וכמה מעט הוא מתייצב

הצילום שלהלן צולם ב-16 בספטמבר 2026:

Gemini 3.8 Live Extended Thinking (High) — 82.6, מקום ראשון

GPT-Live-1 (בקאנד Astra, מאמץ בינוני) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (בקאנד Sol, מאמץ נמוך) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

שלושה דברים שכדאי לשים לב אליהם. ראשית, המקומות הראשון והשלישי מופרדים ב-1.3 נקודות, והראשון והחמישי ב-6.6, כך שצמרת הלוח הזה היא ערבוביה, לא דירוג. שנית, הדגם שבכותרת ההשוואה הזו אינו הרשומה של Gemini במקום החמישי — זהו Gemini 3.8 Live הסטנדרטי, מוצר שונה וזול בהרבה, שאין לבלבל בינו לבין וריאנט החשיבה המושווה כאן. שלישית, יש תקדים להתייחס לכל נתון אינדקס בודד כאל זמני: xAI דיווחה על 82.9 עבור Grok Voice Think Fast 2.0 ביולי, והדגם הזה מציג 81.3 בלוח הזה. ציוני אינדקס שדווחו על ידי ספקים לא תמיד שורדים מפגש עם לוח דירוג חי. מספרי τ-Voice של 68.6% ו-67.9% יושבים כעת על לוח ציבורי המופעל תחת ההרנס של Artificial Analysis עצמה, כך שהם מאומתים ולא רק נטענים — אבל הבדל של 0.7 נקודות בין שני דגמים על אותו הרנס אינו הבדל. אמתו זאת על התנועה שלכם או התעלמו מזה.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

עוד נתון שכדאי לתמחר בהחלטה, כי זה המספר הכי פחות נוח בהשוואה הזו: Google מדווחת על 35.1% עבור Gemini 3.8 Live Extended Thinking בלוח המובילים τ³-Banking של Sierra, לעומת 32.0% עבור GPT-Live-1 Astra. אלה נתונים שמדווחים על ידי הספק ואינם משוחזרים, והם מתארים עולם שבו סוכן הקול המוביל בלוח הזה נכשל בבערך שניים מכל שלושה ניסיונות לביצוע משימת בנקאות מציאותית. אם הסוכן שלך צריך להשלים עבודה מוסדרת, רבת-שלבים, אף אחד מהמודלים האלה אינו מוגמר — ויתרון של 3.1 נקודות בבנצ'מרק הזה אינו סיבה לבחור בספק, אלא סיבה להשאיר אדם בלופ.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

אז: אם טבעיות השיחה היא המוצר והשיחות שלך קצרות וצפופות, ההתנהגות בדופלקס מלא של GPT-Live-1 היא יתרון אמיתי שהמדד לא יכול לראות, וחיוב לפי שעון סשן הוא סביר באורך שיחה כזה. אם השיחות ארוכות, שקטות או משתנות, או אם הסקה מדיבור ועלות לפי שעה הם השיקול המכריע, Gemini 3.8 Live Extended Thinking מקדים במרכיבים החשובים וזול בכ-40% לשעה בזמן שהוא עושה זאת — עם ההסתייגות שהוא מבוסס תורות, עדיין בתצוגה מוקדמת לשוק הארגוני, ודורש ריפקטור בצד הלקוח לפני שהוא יריץ את הכלים שלך. מה ששום דבר מזה לא מצדיק הוא לבחור באחד מהם על סמך 1.1 נקודות מדד. על סמך הראיות הקיימות, הסיבה הכנה לבחור בין השניים היא מודל החיוב והארכיטקטורה שמתחתיו, ושניהם דברים שאתה יכול למדוד על התעבורה שלך השבוע.

ב-OrcaRouter, מעבר אוטומטי לגיבוי שומר על השיחה פעילה כאשר ה-backend נתקל בשגיאה או בפסק זמן.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית