כרטיס כותרת הירואי שעליו הכיתוב 'GPT-Live-1 מגיע ל-API' עם כתובית המשנה '$0.05 לדקה לקול דופלקס מלא' והשורה 'המודל הוא מ-8 ביולי 2026; ה-API למפתחים שוחרר ב-10 בספטמבר 2026', לצד שתי צורות גל אודיו חופפות עם חצים המתעקלים בשני הכיוונים, כשהלוגו של OrcaRouter מורכב בפינה.
Guides & Insights

GPT-Live-1 מגיע ל-API: קול בדופלקס מלא ב-0.05 דולר לדקה, ללא נתיב החלפה ישירה מ-GPT-Realtime-2.1

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

GPT-Live-1 נמצא ב-API החל מ-10 בספטמבר, והמספר שבאמת יעצב מחדש תקציבים אינו בנצ'מרק — הוא יחידת החיוב. המודל הקולי בדופלקס מלא של OpenAIOpe​nAI מחייב כעת בתעריף קבוע של $0.05 לדקת קול, בחיוב לפי שנייה, בעוד שהמודל שאליו משווים אותו, GPT-Realtime-2.1, נמדד בטוקני אודיו במחיר של $32 למיליון בקלט ו-$64 למיליון בפלט. המודל עצמו אינו חדש: GPT-Live-1 הושק בתוך ChatGPT ב-8 ביולי 2026, כתחליף ל-Advanced Voice Mode. מה שחדש הוא שמפתחים יכולים סוף סוף לפנות אליו — ושפנייה אליו כמעט ואינה דומה לאינטגרציית ה-Realtime שכבר יש לרוב הצוותים. התיעוד של OpenAIOpe​nAI עצמה משייך את שכבת הקול ל-backend הסקה נפרד, ובדוגמת ה-WebRTC שפורסמה ה-backend הזה הוא GPT-5.6 Terra.

מה שוחרר ב-10 בספטמבר, ומה לא

משטח ה-API מצומצם במכוון. יש בדיוק מזהה מודל אחד, gpt-live-1, שהוא גם תמונת ברירת המחדל של עצמו — אין גרסאות מתוארכות לנעיצה. יש בדיוק נקודת קצה אחת, נקודת הקצה Live Sessions בכתובת v1/live/sessions. כל השאר בפלטפורמה של OpenAI מכובה עבור המודל הזה: אין Chat Completions, אין Responses, אין Realtime (כולל וריאנטים של תרגום ותמלול), אין Assistants, אין Batch, אין כוונון עדין, אין הטמעות, אין יצירת תמונות או וידאו, אין נקודות קצה של דיבור או תמלול אודיו, אין מודרציה.

קלטים ופלטים הם אודיו וטקסט. סטרימינג וקריאה לפונקציות נתמכים; פלטים מובנים, כוונון עדין ופלטים חזויים אינם נתמכים. קלט תמונה ווידאו אינו נתמך במפורש — כך שמשטח ה"קול עם וידאו" ש-OpenAIOpe​nAI רמז עליו אינו חלק מהמהדורה הזו. השכבה החינמית אינה יכולה לקרוא לו כלל, ומגבלות הקצב נמדדות בסשנים במקביל ולא בבקשות לדקה: 25 בשכבה 1, ועולה ל-50, 200, 300 ו-500 בשכבות 2 עד 5.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

מסגור המקביליות הזה הוא הרמז הראשון לכך שזה לא תחליף plug-in. מגבלות קצב הנקובות בשיחות חיות בו-זמניות אומרות לך מה OpenAIOpe​nAI מצפה שתהיה יחידת הסקייל: קו טלפון, לא בקשה.

שינוי התמחור הוא הסיפור השקט יותר והגדול יותר.

חיוב אחיד לפי דקה הוא סטייה של ממש. במדידת טוקנים היה עליך למדל את צריכת האודיו — כמה טוקנים עולה שנייה של שקט, כיצד מתקשר שממשיך לדבר מעל הסוכן משנה את אורך הפלט — לפני שיכולת לחזות שיחה אחת. בתעריף של $0.05 לדקה, החשבון מצטמצם לכפל:

• שיחת תמיכה של 5 דקות — $0.25 של זמן דיבור

• שיחת 10 דקות — $0.50

• ממוצע של 4 דקות על פני 1,000 שיחות ביום — $200 ליום, בערך $6,000 בחודש

• שעה אחת של קו פתוח רציף — $3.00

שלושה פרטים מחדדים את זה. ראשית, משך הזמן אינו מעוגל כלפי מעלה לדקה שלמה הבאה, כך ששיחה של 40 שניות עולה כ-3.3 סנטים במקום חמישה סנטים מלאים. שנית, אתחול הסשן מחייב 15 שניות של משך דיבור מראש — אבל זה מזוכה כנגד חיובי משך מאוחרים יותר, ולא נערם עליהם, כך ששיחה קצרה מ-15 שניות עדיין יוצאת במחיר של 15 שניות. שלישית, הקול הוא רק חצי מהחשבון. מודל ההסקה שבצד השרת, קריאות הכלים שלו, וכל חיפוש באינטרנט מחויבים בנפרד לפי התעריפים הרגילים של אותו מודל, מה שאומר שמודל קולי "זול" עדיין יכול לייצר שיחה יקרה אם מפנים את ההאצלה למודל הסקה בחזית היכולות ומאפשרים לו לחפש בכל תור.

המבנה הדו-מטרי הזה הוא הנקודה שבה ניתוב מפסיק להיות מותרות. ב-OrcaRouter החצי האחורי של סשן GPT-Live-1 הוא סתם עוד קריאה למודל — בערך 190 מודלים מאחד-עשר ספקים במעלה הזרם מאחורי מפתח אחד, במחיר המחירון של הספק כפי שהוא וללא כל תוספת רווח, ועם מעבר אוטומטי לגיבוי אם הקצה האחורי שבחרתם מחזיר שגיאה או מגיע לפסק זמן. את שכבת הקול עצמה אי אפשר לנתב; נקודת הקצה Live Sessions שייכת ל-OpenAIOpe​nAI בלבד. אבל את כל מה ששכבת הקול מעבירה הלאה אתם בהחלט יכולים לנתב — וזה החצי שמתכייל לפי מידת המאמץ המחשבתי שהמתקשרים שלכם משקיעים.

WebRTC בלבד — מדוע קוד ה-Realtime שלך לא יעבור הסבה

זו העלות המעשית של המעבר, ורוב הסיקור על ההשקה מדלג עליה. הפעלות של GPT-Live-1 פועלות דרך WebRTC, ולא דרך תעבורת WebSocket שעליה מבוססות רבים מאינטגרציות ה-Realtime הקיימות. בדיקה של הנתיב הישן עם מזהה מודל GPT-Live מחזירה שגיאה שאומרת לך בפירוש שהפעלות דורשות WebRTC.

לחיצת היד, לפי המדריך של OpenAI ל-WebRTC: הדפדפן שלך פותח RTCPeerConnection, מצרף רצועות מיקרופון, פותח ערוץ נתונים ורושם מאזינים לפני ההצעה, מגדיר את התיאור המקומי, ממתין לאיסוף ICE, ומפרסם את ההצעה לשרת שלך. השרת שלך קורא אז ל-POST /v1/live/sessions עם תצורת הסשן בתוספת transport: { type: "webrtc", sdp: ... }. תגובת הצלחה מחזירה HTTP 201 הנושאת את session.id ואת transport.sdp, שאותם הדפדפן מחיל כתיאור המרוחק. המדיה עוברת ברצועות שעליהן סוכם; ערוץ הנתונים — ששמו oai-events — נושא תמלולים, עדכוני סשן ועבודה שהואצלה. כדי לנתק, אתה שולח session.close וממשיך לקרוא עד ש-session.closed מגיע.

שתי מלכודות ששווה להדביק על המסך. קריאת ה-HTTP עצמה מתחילה את הסשן, לכן אסור לך לשלוח גם session.start בערוץ הנתונים. ואתה לא אמור להוסיף אודיו קלט או להמתין לדלתאות אודיו פלט דרך הערוץ הזה — השאר audio.format מחוץ לקונפיגורציה ותן ל-SDP לטפל בזה. דוגמאות השרת מגבילות את גוף הבקשה ל-64 KB, מגבילות בזמן את איסוף ICE לאחר 10 שניות ואת סיום הסשן לאחר 15.

שום דבר מזה לא קשה. כל זה קוד חדש. אם המוצר שלך הוא סוכן זמן־אמת מבוסס תורות, המעבר ל-GPT-Live-1 הוא שכתוב של שכבת התעבורה בתוספת שכתוב של מנגנון ההאצלה, ולא החלפה של מזהה מודל — כדאי לתקצב אותו כספרינט ולא כמשימה של אחר צהריים אחד.

הבנצ'מרקים, ומי הריץ כל אחד ואחד מהם

כל נתון שלהלן הוא של OpenAI עצמה, פורסם עם השקת ה-API ולא שוחזר באופן עצמאי על ידי איש בזמן כתיבת הדברים. ההסתייגות הזו חשובה כאן יותר מהרגיל, מפני שהפערים גדולים דיים עד שהם מזמינים שיצטטו אותם כעובדה מוגמרת.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• אינטראקטיביות דופלקס מלא — GPT-Live-1 ‎80.1% לעומת 45.4% עבור GPT-Realtime-2.1

• השהיית חילופי תורות — 0.8 שנ׳ מול 1.4 שנ׳

• דיוק בהפעלת כלים — 87% לעומת 60%

• בנצ'מרק לתמיכה קולית בבנקאות, שיעור מעבר — 32% לעומת 12.4%

קראו את השורה האחרונה פעמיים. שיעור הצלחה של 32% הוא שיפור גדול לעומת 12.4%, אך עדיין משמעו שהמערכת נכשלה בכשני שלישים מהמשימות באותה הערכה. הזינוקים ביכולות האינטראקטיביות ובקריאה לכלים הם אלה שמתארים מוצר שונה באמת; הנתון הבנקאי הוא הישר מכולם, בכל הנוגע למרחק שנותר לסוכני קול מלהתמודד עם תהליך עבודה מפוקח ללא השגחה.

העדויות מהלקוחות דלילות יותר מטבלת הבנצ׳מרק ומצביעות באותו כיוון. Yelp משתמשת ב-GPT-Live-1 להזמנות טלפוניות, כאשר סמנכ״ל הטכנולוגיה אלכס לוי מצוטט בנוגע לשיפור בטיפול בשיחות. פלטפורמת לימוד השפות Speak דיווחה על כמעט 80% פחות קטיעות מאשר המערכת הקודמת שלה מבוססת התורות — נתון מדיווח עצמי מחברה שיש לה אינטרס בתוצאה, ואף על פי כן מספר הפריסה הקונקרטי ביותר שזמין.

שכבת הקול היא קצה קדמי; אתה בוחר את המוח.

ההימור הארכיטקטוני הוא האצלה, וזה החלק בגרסה הזו ששכבת ניתוב משתלבת בו באופן טבעי. GPT-Live-1 לא עושה את החשיבה המעמיקה. כאשר קורא שואל משהו שדורש הסקה, אחזור או כלי, המודל מעביר את המשימה מעבר לגבול אסינכרוני ל-backend נפרד שממשיך לעבוד בזמן שהשיחה המדוברת נמשכת, ואז מחזיר את התשובה חזרה פנימה כשהיא מוכנה.

ההגדרה מפורשת, וכדאי לקרוא את הדוגמה בתיעוד בעיון. לצד model: "gpt-live-1" וההנחיות, הסשן נושא אובייקט delegation מסוג responses, שבו הבלוק הפנימי responses מפרט את מודל ה-backend, את ההנחיות שלו, את הכלים שלו — הדוגמה משתמשת בweb_search — ואת tool_choice. בדוגמת ה-WebRTC שפורסמה של OpenAI‌AI, מודל ה-backend הזה הוא GPT-5.6 Terra.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

זו הטענה האמיתית של העיצוב: החלף את ה-backend וחוויית הקול נעשית חכמה יותר בלי לאמן מחדש את מודל הדיבור. זה גם אומר ש-backend ההאצלה הוא נייד באופן ששכבת הקול אינה. OrcaRouter לא כולל את gpt-live-1 — נקודת הקצה Live Sessions היא של OpenAI בלבד, ואנחנו לא מנתבים ממנה דבר. אבל חצי ההאצלה מדבר Responses API, והחצי הזה הוא לגמרי לבחירתך. GPT-5.6 Terra פעיל ב-OrcaRouter במחיר המחירון של OpenAIOpe​nAI — $2.00 למיליון טוקני קלט ו-$12.00 למיליון פלט, כאשר נקודת הקצה Responses חשופה — כך שהמודל המדויק בדוגמה של OpenAIOpe​nAI עצמו נמצא במרחק קריאה אחת בלי חוזה או SDK נוספים.

מבחינה מעשית, זה הופך את בחירת ה-backend לקונפיגורציה. אפשר להריץ A/B בין מודל הסקה זול למודל פרונטירי על תעבורת שיחות חיה על ידי עריכת שורה אחת וצפייה בחשבון לפי שיחה, או להחזיק את מודל ההאצלה מאחורי failover אוטומטי כך שאחר צהריים רע במעלה הזרם לא יפיל לך את קו הטלפון. שכבת הקול שאתה משלם עליה $0.05 לדקה נשארת במקומה; כל מה שהיא מאצילה עובר דרך מפתח אחד בין כ-190 מודלים מאחד-עשר ספקי upstream, במחיר המחירון של הספק עם אפס מרווח.

מה עדיין חסר

• אין קלט תמונה או וידאו — תמונות סטילס ושיתוף מסך אינם בגרסה זו, כך שהמשטח הקולי הרב-מודלי שמצבי ChatGPT ישנים עדיין מחזיקים בו נותר ללא מענה

• אין פלטים מובנים — אם הסוכן שלך צריך ארגומנטים של כלים שעברו אימות סכימה, האימות הזה חייב להיות במודל הבקאנד שלך, לא בשכבת הקול

• אין גישה למסלול החינמי ואין כיוונון עדין — גם העלות וגם ההתאמה האישית מתחילות במסלולים בתשלום

• אין הערכה בלתי תלויה של אף מספר כותרת — כל נתון לעיל מופק על ידי הספק

• תקרת מקביליות של 25 סשנים בו-זמנית ברמה 1 — נדיבה לפיילוט, צרה למוקד שירות ביום הראשון

מי צריך לזוז, ומי צריך לחכות

עברו עכשיו אם אתם בונים טלפוניה — קווי הזמנות, קביעת תורים, תמיכת קו ראשון — והסטאק הנוכחי שלכם הוא מפל ה-ASR-to-LLM-to-TTS הקלאסי. השיהוי וטיפול בהפרעות הם בדיוק מה שהצינור הזה מאבד, המחיר לדקה צפוי מספיק כדי לשים אותו בגיליון אלקטרוני, והמסמכים של OpenAIOpe​nAI עצמם כוללים כעת דוגמת שרת בסגנון Twilio שאפשר להעתיק ממנה. עברו עכשיו גם אם אתם כבר על מודל Realtime והמוצר שלכם הוא באמת שיחתי ולא מבוסס תורות, כי טיפול בהפרעות הוא החלק שבו GPT-Realtime-2.1 היה הגרוע ביותר.

המתן אם האינטגרציה שלך מבוססת תורות ועובדת. שכתוב התעבורה הוא עבודה אמיתית, נקודת הקצה לא תומכת בשום דבר אחר, ואין נתיב הגירה שמשמר את קוד ה-WebSocket הקיים שלך. המתן גם אם מקרה השימוש שלך תלוי בפלטי כלים מובנים או בקלט וידאו, ששניהם חסרים כאן.

על מה לשים לב בשבועות הקרובים: השחזור הבלתי תלוי הראשון של נתון האינטראקטיביות של 80.1%, האם תעריף 0.05$ הוא תעריף היכרות, האם GPT-Live-1 mini קטן יותר מגיע ל-API כפי שהגיע בצד הצרכני, והאם קלט תמונה ומסך סוגר את הפער. עד שמעבדה חיצונית תריץ את ההערכה הזו, הסיכום הכנה הוא שזהו מודל הקול המסוגל ביותר שמישהו הוציא למפתחים, כשהקבלה לטענה הזו נכתבה בידי האנשים שמוכרים אותו.