
GPT-Live-1 מגיע ל-API: קול בדופלקס מלא ב-0.05 דולר לדקה, ללא נתיב החלפה ישירה מ-GPT-Realtime-2.1
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
GPT-Live-1 נמצא ב-API החל מ-10 בספטמבר, והמספר שבאמת יעצב מחדש תקציבים אינו בנצ'מרק — הוא יחידת החיוב. המודל הקולי בדופלקס מלא של OpenAIOpenAI מחייב כעת בתעריף קבוע של $0.05 לדקת קול, בחיוב לפי שנייה, בעוד שהמודל שאליו משווים אותו, GPT-Realtime-2.1, נמדד בטוקני אודיו במחיר של $32 למיליון בקלט ו-$64 למיליון בפלט. המודל עצמו אינו חדש: GPT-Live-1 הושק בתוך ChatGPT ב-8 ביולי 2026, כתחליף ל-Advanced Voice Mode. מה שחדש הוא שמפתחים יכולים סוף סוף לפנות אליו — ושפנייה אליו כמעט ואינה דומה לאינטגרציית ה-Realtime שכבר יש לרוב הצוותים. התיעוד של OpenAIOpenAI עצמה משייך את שכבת הקול ל-backend הסקה נפרד, ובדוגמת ה-WebRTC שפורסמה ה-backend הזה הוא GPT-5.6 Terra.
מה שוחרר ב-10 בספטמבר, ומה לא
משטח ה-API מצומצם במכוון. יש בדיוק מזהה מודל אחד, gpt-live-1, שהוא גם תמונת ברירת המחדל של עצמו — אין גרסאות מתוארכות לנעיצה. יש בדיוק נקודת קצה אחת, נקודת הקצה Live Sessions בכתובת v1/live/sessions. כל השאר בפלטפורמה של OpenAI מכובה עבור המודל הזה: אין Chat Completions, אין Responses, אין Realtime (כולל וריאנטים של תרגום ותמלול), אין Assistants, אין Batch, אין כוונון עדין, אין הטמעות, אין יצירת תמונות או וידאו, אין נקודות קצה של דיבור או תמלול אודיו, אין מודרציה.
קלטים ופלטים הם אודיו וטקסט. סטרימינג וקריאה לפונקציות נתמכים; פלטים מובנים, כוונון עדין ופלטים חזויים אינם נתמכים. קלט תמונה ווידאו אינו נתמך במפורש — כך שמשטח ה"קול עם וידאו" ש-OpenAIOpenAI רמז עליו אינו חלק מהמהדורה הזו. השכבה החינמית אינה יכולה לקרוא לו כלל, ומגבלות הקצב נמדדות בסשנים במקביל ולא בבקשות לדקה: 25 בשכבה 1, ועולה ל-50, 200, 300 ו-500 בשכבות 2 עד 5.

מסגור המקביליות הזה הוא הרמז הראשון לכך שזה לא תחליף plug-in. מגבלות קצב הנקובות בשיחות חיות בו-זמניות אומרות לך מה OpenAIOpenAI מצפה שתהיה יחידת הסקייל: קו טלפון, לא בקשה.
שינוי התמחור הוא הסיפור השקט יותר והגדול יותר.
חיוב אחיד לפי דקה הוא סטייה של ממש. במדידת טוקנים היה עליך למדל את צריכת האודיו — כמה טוקנים עולה שנייה של שקט, כיצד מתקשר שממשיך לדבר מעל הסוכן משנה את אורך הפלט — לפני שיכולת לחזות שיחה אחת. בתעריף של $0.05 לדקה, החשבון מצטמצם לכפל:
• שיחת תמיכה של 5 דקות — $0.25 של זמן דיבור
• שיחת 10 דקות — $0.50
• ממוצע של 4 דקות על פני 1,000 שיחות ביום — $200 ליום, בערך $6,000 בחודש
• שעה אחת של קו פתוח רציף — $3.00
שלושה פרטים מחדדים את זה. ראשית, משך הזמן אינו מעוגל כלפי מעלה לדקה שלמה הבאה, כך ששיחה של 40 שניות עולה כ-3.3 סנטים במקום חמישה סנטים מלאים. שנית, אתחול הסשן מחייב 15 שניות של משך דיבור מראש — אבל זה מזוכה כנגד חיובי משך מאוחרים יותר, ולא נערם עליהם, כך ששיחה קצרה מ-15 שניות עדיין יוצאת במחיר של 15 שניות. שלישית, הקול הוא רק חצי מהחשבון. מודל ההסקה שבצד השרת, קריאות הכלים שלו, וכל חיפוש באינטרנט מחויבים בנפרד לפי התעריפים הרגילים של אותו מודל, מה שאומר שמודל קולי "זול" עדיין יכול לייצר שיחה יקרה אם מפנים את ההאצלה למודל הסקה בחזית היכולות ומאפשרים לו לחפש בכל תור.
המבנה הדו-מטרי הזה הוא הנקודה שבה ניתוב מפסיק להיות מותרות. ב-OrcaRouter החצי האחורי של סשן GPT-Live-1 הוא סתם עוד קריאה למודל — בערך 190 מודלים מאחד-עשר ספקים במעלה הזרם מאחורי מפתח אחד, במחיר המחירון של הספק כפי שהוא וללא כל תוספת רווח, ועם מעבר אוטומטי לגיבוי אם הקצה האחורי שבחרתם מחזיר שגיאה או מגיע לפסק זמן. את שכבת הקול עצמה אי אפשר לנתב; נקודת הקצה Live Sessions שייכת ל-OpenAIOpenAI בלבד. אבל את כל מה ששכבת הקול מעבירה הלאה אתם בהחלט יכולים לנתב — וזה החצי שמתכייל לפי מידת המאמץ המחשבתי שהמתקשרים שלכם משקיעים.
WebRTC בלבד — מדוע קוד ה-Realtime שלך לא יעבור הסבה
זו העלות המעשית של המעבר, ורוב הסיקור על ההשקה מדלג עליה. הפעלות של GPT-Live-1 פועלות דרך WebRTC, ולא דרך תעבורת WebSocket שעליה מבוססות רבים מאינטגרציות ה-Realtime הקיימות. בדיקה של הנתיב הישן עם מזהה מודל GPT-Live מחזירה שגיאה שאומרת לך בפירוש שהפעלות דורשות WebRTC.
לחיצת היד, לפי המדריך של OpenAI ל-WebRTC: הדפדפן שלך פותח RTCPeerConnection, מצרף רצועות מיקרופון, פותח ערוץ נתונים ורושם מאזינים לפני ההצעה, מגדיר את התיאור המקומי, ממתין לאיסוף ICE, ומפרסם את ההצעה לשרת שלך. השרת שלך קורא אז ל-POST /v1/live/sessions עם תצורת הסשן בתוספת transport: { type: "webrtc", sdp: ... }. תגובת הצלחה מחזירה HTTP 201 הנושאת את session.id ואת transport.sdp, שאותם הדפדפן מחיל כתיאור המרוחק. המדיה עוברת ברצועות שעליהן סוכם; ערוץ הנתונים — ששמו oai-events — נושא תמלולים, עדכוני סשן ועבודה שהואצלה. כדי לנתק, אתה שולח session.close וממשיך לקרוא עד ש-session.closed מגיע.
שתי מלכודות ששווה להדביק על המסך. קריאת ה-HTTP עצמה מתחילה את הסשן, לכן אסור לך לשלוח גם session.start בערוץ הנתונים. ואתה לא אמור להוסיף אודיו קלט או להמתין לדלתאות אודיו פלט דרך הערוץ הזה — השאר audio.format מחוץ לקונפיגורציה ותן ל-SDP לטפל בזה. דוגמאות השרת מגבילות את גוף הבקשה ל-64 KB, מגבילות בזמן את איסוף ICE לאחר 10 שניות ואת סיום הסשן לאחר 15.
שום דבר מזה לא קשה. כל זה קוד חדש. אם המוצר שלך הוא סוכן זמן־אמת מבוסס תורות, המעבר ל-GPT-Live-1 הוא שכתוב של שכבת התעבורה בתוספת שכתוב של מנגנון ההאצלה, ולא החלפה של מזהה מודל — כדאי לתקצב אותו כספרינט ולא כמשימה של אחר צהריים אחד.
הבנצ'מרקים, ומי הריץ כל אחד ואחד מהם
כל נתון שלהלן הוא של OpenAI עצמה, פורסם עם השקת ה-API ולא שוחזר באופן עצמאי על ידי איש בזמן כתיבת הדברים. ההסתייגות הזו חשובה כאן יותר מהרגיל, מפני שהפערים גדולים דיים עד שהם מזמינים שיצטטו אותם כעובדה מוגמרת.

• אינטראקטיביות דופלקס מלא — GPT-Live-1 80.1% לעומת 45.4% עבור GPT-Realtime-2.1
• השהיית חילופי תורות — 0.8 שנ׳ מול 1.4 שנ׳
• דיוק בהפעלת כלים — 87% לעומת 60%
• בנצ'מרק לתמיכה קולית בבנקאות, שיעור מעבר — 32% לעומת 12.4%
קראו את השורה האחרונה פעמיים. שיעור הצלחה של 32% הוא שיפור גדול לעומת 12.4%, אך עדיין משמעו שהמערכת נכשלה בכשני שלישים מהמשימות באותה הערכה. הזינוקים ביכולות האינטראקטיביות ובקריאה לכלים הם אלה שמתארים מוצר שונה באמת; הנתון הבנקאי הוא הישר מכולם, בכל הנוגע למרחק שנותר לסוכני קול מלהתמודד עם תהליך עבודה מפוקח ללא השגחה.
העדויות מהלקוחות דלילות יותר מטבלת הבנצ׳מרק ומצביעות באותו כיוון. Yelp משתמשת ב-GPT-Live-1 להזמנות טלפוניות, כאשר סמנכ״ל הטכנולוגיה אלכס לוי מצוטט בנוגע לשיפור בטיפול בשיחות. פלטפורמת לימוד השפות Speak דיווחה על כמעט 80% פחות קטיעות מאשר המערכת הקודמת שלה מבוססת התורות — נתון מדיווח עצמי מחברה שיש לה אינטרס בתוצאה, ואף על פי כן מספר הפריסה הקונקרטי ביותר שזמין.
שכבת הקול היא קצה קדמי; אתה בוחר את המוח.
ההימור הארכיטקטוני הוא האצלה, וזה החלק בגרסה הזו ששכבת ניתוב משתלבת בו באופן טבעי. GPT-Live-1 לא עושה את החשיבה המעמיקה. כאשר קורא שואל משהו שדורש הסקה, אחזור או כלי, המודל מעביר את המשימה מעבר לגבול אסינכרוני ל-backend נפרד שממשיך לעבוד בזמן שהשיחה המדוברת נמשכת, ואז מחזיר את התשובה חזרה פנימה כשהיא מוכנה.
ההגדרה מפורשת, וכדאי לקרוא את הדוגמה בתיעוד בעיון. לצד model: "gpt-live-1" וההנחיות, הסשן נושא אובייקט delegation מסוג responses, שבו הבלוק הפנימי responses מפרט את מודל ה-backend, את ההנחיות שלו, את הכלים שלו — הדוגמה משתמשת בweb_search — ואת tool_choice. בדוגמת ה-WebRTC שפורסמה של OpenAIAI, מודל ה-backend הזה הוא GPT-5.6 Terra.

זו הטענה האמיתית של העיצוב: החלף את ה-backend וחוויית הקול נעשית חכמה יותר בלי לאמן מחדש את מודל הדיבור. זה גם אומר ש-backend ההאצלה הוא נייד באופן ששכבת הקול אינה. OrcaRouter לא כולל את gpt-live-1 — נקודת הקצה Live Sessions היא של OpenAI בלבד, ואנחנו לא מנתבים ממנה דבר. אבל חצי ההאצלה מדבר Responses API, והחצי הזה הוא לגמרי לבחירתך. GPT-5.6 Terra פעיל ב-OrcaRouter במחיר המחירון של OpenAIOpenAI — $2.00 למיליון טוקני קלט ו-$12.00 למיליון פלט, כאשר נקודת הקצה Responses חשופה — כך שהמודל המדויק בדוגמה של OpenAIOpenAI עצמו נמצא במרחק קריאה אחת בלי חוזה או SDK נוספים.
מבחינה מעשית, זה הופך את בחירת ה-backend לקונפיגורציה. אפשר להריץ A/B בין מודל הסקה זול למודל פרונטירי על תעבורת שיחות חיה על ידי עריכת שורה אחת וצפייה בחשבון לפי שיחה, או להחזיק את מודל ההאצלה מאחורי failover אוטומטי כך שאחר צהריים רע במעלה הזרם לא יפיל לך את קו הטלפון. שכבת הקול שאתה משלם עליה $0.05 לדקה נשארת במקומה; כל מה שהיא מאצילה עובר דרך מפתח אחד בין כ-190 מודלים מאחד-עשר ספקי upstream, במחיר המחירון של הספק עם אפס מרווח.
מה עדיין חסר
• אין קלט תמונה או וידאו — תמונות סטילס ושיתוף מסך אינם בגרסה זו, כך שהמשטח הקולי הרב-מודלי שמצבי ChatGPT ישנים עדיין מחזיקים בו נותר ללא מענה
• אין פלטים מובנים — אם הסוכן שלך צריך ארגומנטים של כלים שעברו אימות סכימה, האימות הזה חייב להיות במודל הבקאנד שלך, לא בשכבת הקול
• אין גישה למסלול החינמי ואין כיוונון עדין — גם העלות וגם ההתאמה האישית מתחילות במסלולים בתשלום
• אין הערכה בלתי תלויה של אף מספר כותרת — כל נתון לעיל מופק על ידי הספק
• תקרת מקביליות של 25 סשנים בו-זמנית ברמה 1 — נדיבה לפיילוט, צרה למוקד שירות ביום הראשון
מי צריך לזוז, ומי צריך לחכות
עברו עכשיו אם אתם בונים טלפוניה — קווי הזמנות, קביעת תורים, תמיכת קו ראשון — והסטאק הנוכחי שלכם הוא מפל ה-ASR-to-LLM-to-TTS הקלאסי. השיהוי וטיפול בהפרעות הם בדיוק מה שהצינור הזה מאבד, המחיר לדקה צפוי מספיק כדי לשים אותו בגיליון אלקטרוני, והמסמכים של OpenAIOpenAI עצמם כוללים כעת דוגמת שרת בסגנון Twilio שאפשר להעתיק ממנה. עברו עכשיו גם אם אתם כבר על מודל Realtime והמוצר שלכם הוא באמת שיחתי ולא מבוסס תורות, כי טיפול בהפרעות הוא החלק שבו GPT-Realtime-2.1 היה הגרוע ביותר.
המתן אם האינטגרציה שלך מבוססת תורות ועובדת. שכתוב התעבורה הוא עבודה אמיתית, נקודת הקצה לא תומכת בשום דבר אחר, ואין נתיב הגירה שמשמר את קוד ה-WebSocket הקיים שלך. המתן גם אם מקרה השימוש שלך תלוי בפלטי כלים מובנים או בקלט וידאו, ששניהם חסרים כאן.
על מה לשים לב בשבועות הקרובים: השחזור הבלתי תלוי הראשון של נתון האינטראקטיביות של 80.1%, האם תעריף 0.05$ הוא תעריף היכרות, האם GPT-Live-1 mini קטן יותר מגיע ל-API כפי שהגיע בצד הצרכני, והאם קלט תמונה ומסך סוגר את הפער. עד שמעבדה חיצונית תריץ את ההערכה הזו, הסיכום הכנה הוא שזהו מודל הקול המסוגל ביותר שמישהו הוציא למפתחים, כשהקבלה לטענה הזו נכתבה בידי האנשים שמוכרים אותו.
