כרטיס כותרת עבור המאמר GPT-Live-1 Speech to Speech Index המציג את שלושת הציונים הגבוהים ביותר: GPT-Live-1 עם GPT-6 Astra במאמץ בינוני ב-81.5, Grok Voice Think Fast 2.0 High ב-81.3, ו-GPT-Live-1 עם GPT-5.6 Sol במאמץ נמוך ב-80.1
Guides & Insights

GPT-Live-1 בראש מדד Speech to Speech עם ציון 81.5 — אבל הדירוג שייך לבקאנד שלו

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

GPT-Live-1, המודל הקולי הדו-כיווני המלא שנשלח לראשונה בתוך ChatGPT ב-8 ביולי 2026, נמצא כעת במקום הראשון במדד ה-Speech to Speech של Artificial Analysis עם 81.5 — שורה שקיימת רק משום שהמודל הופנה אל GPT-6 Astra כדי לבצע את החשיבה שלו. אם מריצים את אותה חזית קולית עם GPT-5.6 Sol בתור ה-backend המואצל במאמץ חשיבה נמוך, הוא מקבל ציון 80.1, שהוא המקום השלישי. המקום השני, עם 81.3, שייך ל-Grok Voice Think Fast 2.0 High.

שתי הערות כנות לפני המספרים. המודל אינו חדש: GPT-Live-1 הגיע ל-API של המפתחים ב-10 בספטמבר 2026, לאחר חודשיים שבהם שימש כקול ברירת המחדל של ChatGPT. מה שחדש, נכון למדידה ב-15 בספטמבר, הוא שמעריך חיצוני נתן לו ציון — הדבר היחיד שהיה חסר בכל כתיבה על המודל הזה עד כה, כולל שלנו, שבה המספרים היחידים שעמדו לרשותנו היו אלה ש-OpenAI פרסמה על עצמה. והפער של 0.2 נקודות מעל המקום השני קטן מהפער של 1.4 נקודות בין שתי התצורות של GPT-Live-1 עצמו, וזהו המספר השימושי ביותר בלוח.

אז הכותרת "GPT-Live-1 הוא מודל הקול הטוב ביותר" היא לא בדיוק מה שהמדד אומר. הוא אומר ש-GPT-Live-1 עם GPT-6 Astra במאמץ בינוני הוא, בפער של חמישית נקודה, ושהבחירה ב-backend מזיזה את התוצאה יותר מכל מודל מתחרה.

מה שהמדד בעצם מודד

Artificial Analysis בונה את Speech to Speech Index כמורכב משוקלל-שווה של ארבעה חלקים: Speech Reasoning, הנמדד באמצעות Big Bench Audio; Agentic Performance, הנמדד באמצעות τ-Voice; Arena Preference, דירוג Elo של העדפת אדם בזוגות; ו-Task Success Rate. רק מודלים שכל ארבעת הרכיבים זמינים עבורם מקבלים ערך אינדקס — כל השאר מוצגים עם מקף, וזו הסיבה שלטבלה יש הרבה יותר שורות מאשר ציונים. האינדקס עצמו הושק ב-23 ביוני 2026 ותוקן פעמיים מאז, לאחרונה כדי להחליף את Conversational Dynamics ב-Task Success, כך שציון מגרסה אחת אינו בהכרח בר-השוואה לציון מגרסה אחרת.

שני פרטים מתודולוגיים נוספים חשובים כשאתם קוראים את הדירוג. ה-Arena Elo קפוא במצב שבו היה כשמודל נעשה לראשונה ראוי לפרסום, כך שמרכיב ההעדפה מתגמל הגעה מוקדמת ולא היות הטוב ביותר כיום. והאינדקס מדרג מערכת שלמה ולא מודל בודד: עבור GPT-Live-1, המספר מכסה את חזית הקול בתוספת מודל הבקאנד שאליו היא מעבירה עבודה. זו בחירה עיצובית מכוונת, וזו הסיבה שאותו מודל מופיע פעמיים עם ציונים שונים.

הצמרת של התחום, כפי שפורסם:

• GPT-Live-1 (Astra, בינוני) — מדד 81.5, ראשון

• Grok Voice Think Fast 2.0 High — מדד 81.3, שני

• GPT-Live-1 (Sol, נמוך) — מדד 80.1, שלישי

• GPT-Realtime-2.1 High — מדד 73.9, רביעי

• GPT-Realtime-2 High — מדד 73.6, חמישי

• Grok Voice Think Fast 1.0 — אינדקס 72.3, שישי

• Gemini 3.1 Flash Live High — מדד 71.5, שביעי

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

לשם השוואה, המודל ש-GPT-Live-1 מחליף נמצא 7.6 נקודות מתחתיו. זהו פער דורי אמיתי, ואין על כך מחלוקת.

הניצחון ב-0.2 נקודות נובע בדיוק ממרכיב אחד

פרקו את המדד המשולב, ושני המובילים מפסיקים להיראות כמו אותו סוג של מודל. ברכיבים, לפי Artificial Analysis:

• ביצועים סוכניים (τ-Voice) — GPT-Live-1 67.9% לעומת Grok Voice Think Fast 2.0 High 56.5%

• הסקה קולית (Big Bench Audio) — 90% לעומת 97%

• שיעור הצלחת המשימות — 87.4% לעומת 94.6%

• Arena Elo — 1048 לעומת 1011

• זמן עד לאודיו הראשון — 1.34s לעומת 0.70s

• עלות לשעה, כולל צד שרת — $5.83 לעומת $4.80

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 מנצח בשתיים מתוך שש שורות ומפסיד בארבע, ובכל זאת זוכה במדד. האריתמטיקה אינה תעלומה: הפער ב-τ-Voice הוא 11.4 נקודות, גדול בהרבה מכל פער אחר בטבלה, ותחת שקלול שווה הוא גורר את הציון המשולב מעבר לקו. במילים פשוטות, GPT-Live-1 הוא הסוכן הטוב יותר ו-Grok Voice Think Fast 2.0 High הוא המאזין הטוב יותר והמהיר יותר — והמדד במקרה נותן משקל כבד מספיק לדבר שבו GPT-Live-1 טוב, עד כדי להפוך אותו לראשון.

אם המוצר שלך הוא סוכן קולי שמבצע הזמנות, פותר בעיות או מבצע עסקאות, היתרון של 11.4 נקודות ב-τ-Voice הוא המספר שמנבא את החוויה שלך. אם המוצר שלך הוא שיחה שצריכה להרגיש מיידית ולעולם לא לדבר מעל המשתמש, זמן של 0.70 שניות עד לאודיו הראשון הוא המספר שמנבא את החוויה שלך, ו-Grok מנצח בכך בערך בפער של פי שניים. בביצוע משימות בפיקוח רגולטורי יש אזהרה שנייה: שיעור ההצלחה של Grok במשימות, 94.6%, הוא הגבוה ביותר בטבלה הגלויה, והנתון של GPT-Live-1, 87.4%, אומר שבערך אחת מכל שמונה משימות אינה מושלמת. שניהם שיפורים לעומת הדור הקודם. אף אחד מהם אינו בעיה שנפתרה.

השורה מספר 1 היא תצורת ניתוב, לא מודל

הנה החלק שראוי ליותר תשומת לב מאשר המיקום בטבלת המובילים. GPT-Live-1 הוא שכבת קול בדופלקס מלא שמטפלת בעצמה בהאזנה, בדיבור, בקטיעה ובנטילת תורות, ומאצילה את החשיבה, הקריאות לכלים והחיפוש למודל backend נפרד בזמן שהשיחה נמשכת. Artificial Analysis דירגה שניים מהזיווגים הללו כרשומות נפרדות. Astra במאמץ בינוני הניבה 81.5. Sol במאמץ נמוך הניבה 80.1.

הפער הזה של 1.4 נקודות הוא הסיפור. הפער בין המקום הראשון לשני הוא 0.2 נקודות. הפער בין שתי התצורות המדורגות של GPT-Live-1 גדול פי שבעה. שום דבר במודל הקולי לא השתנה בין השורות האלה — רק איזה מודל ביצע את החשיבה, ובאיזו רמת מאמץ. טבלת דירוג שמדרגת מערכות אומרת לך, במדויק, שהתצורה היא המוצר.

הוא גם מתקן את הדיווח של עצמנו. ב-11 בספטמבר 2026 רשמנו את GPT-Live-1 ב-69.8% במדד הזה, מאחורי גם GPT-Realtime-2.1 וגם Grok. זו הייתה הקריאה הזמינה באותה עת, והיא תמכה במסקנה סבירה — ש-OpenAI בנתה את מנגנוני השיחה הטובים ביותר ולא את סוכן הקול הטוב ביותר. המדד כולל כעת שתי תצורות GPT-Live-1 מסוג delegated, ב-81.5 וב-80.1. Artificial Analysis לא מפרסמת יומן שינויים, והיא עדכנה את מרכיבי המדד באוגוסט, כך שאיננו יכולים לומר בוודאות אם הנתון המוקדם יותר היה תצורה שלא דורגה או שדורגה חלקית, או הרצה תחת השקלול הישן יותר; מה שניתן לראות הוא שהצימודים מסוג delegated מופיעים כעת כשורות שלמות משל עצמם, ושהתשובה השתנתה כאשר הם הופיעו.

המשמעות המעשית היא ש"איזה מודל קולי" היא השאלה הלא נכונה, ו"איזה מודל קולי פלוס איזה backend, באיזו רמת מאמץ" היא השאלה הנכונה. זו שאלת ניתוב, והיא בדיוק זו שהמוצר שלנו קיים כדי לענות עליה. OrcaRouter חושף את ה-backend של ההאצלה של GPT-Live-1,‏ GPT-6 Astra, דרך אותה נקודת קצה תואמת OpenAI כמו יותר מ-200 מודלים אחרים, כך שהחלפת שכבת החשיבה היא שינוי של מזהה מודל ולא אינטגרציה. ה-DSL לניתוב מרכיב כמה מודלים לקריאה אחת, ו-failover אוטומטי פירושו שצימוד לא מוכח אינו הימור על פרודקשן — אם ה-backend נחלש, הבקשה נוחתת במקום אחר במקום להיכשל. ליתר דיוק לגבי מה שאנחנו לא עושים: GPT-Live-1 עצמו אינו בקטלוג שלנו ואנחנו לא מגישים אותו. ה-backend שאליו הוא מאציל הוא עניין אחר.

כמה עולה שעה של זה

הקצה הקדמי של GPT-Live-1 מחויב ב-$0.05 לדקת קול, בחיוב לפי שנייה, שהם $3.00 לשעה של קו פתוח. זה לא כל החשבון: הסקה מואצלת, קריאות לכלים וחיפוש באינטרנט נמדדים בנפרד לפי מה שמודל ה-backend גובה. Artificial Analysis מדדה את הנתון הכולל, ולכן טור העלויות שלה הוא זה שיש להשתמש בו:

• GPT-Live-1 (Sol, low) — 4.47$ לשעה

• Grok Voice Think Fast 2.0 High — $4.80 לשעה

• GPT-Live-1 (Astra, בינוני) — $5.83 לשעה

• GPT-Realtime-2.1 High — $10.75 לשעה

המנצח בדירוג הוא היקר ביותר מבין שלוש האפשרויות הנוכחיות, והתצורה שניצחה יקרה ב-30% לשעה מהתצורה שדורגה במקום השלישי. בקריאה מהכיוון השני, החלוקה מלמדת: $3.00 מכל שעה הם שכבת הקול, והיתר — $1.47 ב-Sol, $2.83 ב-Astra — טוקנים של הבקאנד. שכבת החשיבה היא בין שליש לחצי מהחשבון שלך, וזה נתח גדול עבור רכיב שלוח הדירוג מתייחס אליו כאל הערת שוליים.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

אולם לעומת המודל שהוא מחליף, כל המשפחה היא בערך חצי מחיר — הקצה הקדמי של 0.05 דולר לדקה הוא קיצוץ אמיתי, לא אריזה מחדש. מכיוון שטוקנים של ה-backend מחויבים בתעריפי ה-backend, העלות של פריסת GPT-Live-1 היא בעיקר פונקציה של מודל החשיבה שאליו תנתבו, וה-backends יכולים להיות של OpenAI עצמה או מודלים של צד שלישי. ב-OrcaRouter, ה-backends האלה מועברים במחיר המחירון של הספק עם 0% תוספת, כך ששינוי מחיר של ספק בשכבת החשיבה נכנס לתוקף באותו יום ולא במחזור החיוב הבא.

מה שהמדד אינו מכריע

שלוש הסתייגויות, שנאמרו על ידי המקור ולא הוסקו. גם שני הערכים של GPT-Live-1 וגם Grok Voice Think Fast 2.0 High מסומנים כמי שמבוססים על ניסוי בודד, שזה דליל מדי להחלטה של 0.2 נקודות — הרצה חוזרת יכולה לשנות את הסדר בין הראשון לשני בלי ששום דבר ישתנה באף אחד מהמודלים. Arena Elo, כפי שצוין, הוקפא במדידה הראשונה הניתנת לפרסום של כל מודל. ולמדד אין רשומה עבור האופן שבו המערכות הללו מתנהגות בשיחה ארוכה: הרכיבים הם קצרי טווח מעצם בנייתם, בעוד שאופן הכשל שבאמת הורג סוכני קול בסביבת ייצור הוא סחיפה לאורך שיחה של עשרים דקות.

לחוד, ומהספק ולא מהאינדקס: ה-API של GPT-Live-1 שוחרר בלי קלט של תמונות או וידאו, בלי פלטים מובנים ובלי מסלול חינמי, ומגבלות הקצב שלו נספרות לפי סשנים במקביל ולא לפי בקשות בדקה. אלה אילוצים מיום ההשקה שאולי כבר השתנו; בדקו אותם לפני שאתם מתכננים סביבם.

מה לעשות עם זה

אם אתם בוחרים השבוע ארכיטקטורה ולא מודל, האינדקס מתגמל את תבנית ההאצלה בעבודה סוכנית ואת תבנית המפל בהשהיה. GPT-Live-1 עם 81.5 הוא הראיה החזקה ביותר עד כה לכך שהפרדת השיחה מהחשיבה היא הצורה הנכונה לסוכני קול שמשלימים משימות. Grok Voice Think Fast 2.0 High עם 81.3, עם 0.70 שניות לשמע הראשון ושיעור הצלחה של 94.6% במשימות, הוא הראיה החזקה ביותר לכך שהצורה המואצלת אינה היחידה שעובדת — ושהיא עדיין לא המהירה ביותר.

ההחלטה הנובעת מהמספרים זולה ממה שהיא נראית. שתי התצורות של GPT-Live-1, והמודל שהביס אותו בארבעה מתוך שישה רכיבים, נמצאים במרחק של $1.36 לשעה זה מזה. בפער כזה, המהלך הנכון הוא להפסיק לקרוא לוחות דירוג ולהריץ את התמלילים שלך דרך שניהם. המדד מספר לך את צורת הפשרה; הוא לא יכול לומר לך באיזה צד שלה המשתמשים שלך נמצאים.

שאלות שהמספר מזמין

האם GPT-Live-1 הוא כעת המודל הקולי הטוב ביותר?

לפי הציון המורכב, כן — ב-0.2 נקודות ועם ניסוי בודד מאחוריו. לפי המרכיבים זה תלוי לחלוטין במה שאתם בונים: הוא מוביל בביצועים סוכניים ובהעדפת ארנה, ומפגר בהסקת דיבור, בשיעור הצלחה במשימות ובזמן עד לאודיו הראשון. יתרון של 0.2 נקודות בציון המורכב, הנשען על יתרון של 11.4 נקודות במרכיב אחד, הוא מקום ראשון שניתן להצדיק, לא מקום ראשון מכריע.

האם חייבים להשתמש ב-GPT-6 Astra כדי לקבל את ה-81.5?

עבור השורה המדויקת הזו, כן — ה-81.5 שייך ל-GPT-Live-1 המוגדר עם Astra במאמץ הסקה בינוני. Sol במאמץ נמוך הוא חלופה מתועדת עם 80.1 וזול יותר ב-1.36 דולר לשעה, ו-OpenAI תומכת בהבאת מודלים של צד שלישי בתור ה-backend, כך שהרשומות בלוח הדירוג הן שתי נקודות על עקומה ולא האפשרויות היחידות. איזה זיווג הוא הטוב ביותר לעומס העבודה שלך הוא לא משהו שאינדקס ציבורי יכול לענות לך עליו.

מדוע אותו מודל קיבל ציון 69.8 בסיקור הקודם שלנו ו-81.5 כעת?

שני הנתונים נוגעים לדברים שונים. הקריאה המוקדמת מיקמה את GPT-Live-1 במדד כרשומה אחת; הטבלה הנוכחית מציגה את שתי התצורות המואצלות שלו כשורות נפרדות עם ניקוד מלא, כשהצימוד עם Astra עומד על 81.5 והצימוד עם Sol על 80.1. Artificial Analysis עדכנה את מרכיבי המדד באוגוסט ואינה מפרסמת יומן שינויים, לכן התייחסו לפער כאל שינוי במה שנמדד ולא כראיה לכך שהמודל השתפר — והתייחסו לכל ציון מורכב בודד עבור מודל מאציל כאל אמירה על תצורה.