
אירוע הפלטפורמה של OpenAI בספטמבר: GPT-Live-1 מגיע ל-API כשה-Agents API נפתח בבטא
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
שני דברים יצאו מהפלטפורמה של OpenAI ב-10 בספטמבר 2026, ולשקט מבין השניים יש רדיוס השפעה גדול יותר. GPT-Live-1 — מודל הקול בדופלקס מלא שפועל בתוך ChatGPT מאז 8 ביולי — ניתן כעת לקריאה על ידי מפתחים בעלות של $0.05 לדקת קול. לצדו, ובהרבה פחות אזכורים בסיקור, נכנס ה-Agents API לבטא ציבורית: אותה תשתית שמריצה את Codex, שנחשפה כמוצר מתארח עם סנדבוקסים מנוהלים. האחד הוא קול טוב יותר. האחר הוא OpenAI שמוכרת את הדבר שהיה פעם החלק הקשה בבניית סוכן.
שניהם נלקחו מהמקורות הראשוניים עבור הכתבה הזו: ההכרזה של OpenAI על Agents API, הפוסט בקהילת המפתחים שלה שהציג את GPT-Live-1 ב-API, והתיעוד למפתחים של שניהם. כאשר מספר מגיע מ-OpenAI ולא ממעריך חיצוני, הוא מסומן ככזה להלן — ונתון אחד אכן מגיע מבחוץ, מה שמשנה את הסיפור במעט.

Artificial Analysis החלה השנה לפרסם מדד דיבור-לדיבור (Speech to Speech Index), ול-GPT-Live-1 יש בו שורה משלו: 69.8%, ממוצע משוקלל של הסקה בדיבור, ביצועים סוכניים, העדפה בזירה והצלחת משימות. זה מציב אותו במקום השביעי מבין אחד-עשר המודלים שנמדדו — אחרי GPT-Realtime-2.1 עם 73.9%, שהוא המודל שהוא מחליף, ואחרי Grok Voice Think Fast 2.0 עם 79.0%. לוח התוצאות העצמאי וטבלת הבנצ'מרקים של OpenAI עצמה לא מספרים את אותו סיפור, ושניהם נכונים.
מה שיצא, לפי הסדר שבו זה ישנה את הארכיטקטורה שלך
• קול — GPT-Live-1 זמין ב-API בתור gpt-live-1, בתעריף של $0.05 לדקת קול, בחיוב לפי שנייה, כאשר מודל החשיבה ב-backend מחויב בנפרד לפי התעריפים שלו.
• Agents — ה-API של סוכנים נמצא בבטא ציבורית. OpenAI אומרת שאין תשלום נוסף עבור ה-API עצמו; אתה משלם עבור טוקנים של מודלים, כלים וזמן קונטיינר sandbox מתארח.
• ארגזי חול — OpenAI מארחת כעת את סביבת ההרצה, תוך שימוש חוזר באותה תשתית ארגזי חול כמו זו של Codex ו-ChatGPT, הניתנת להגדרה עם קבצים, חבילות, כישורים ותוספים.
• סביבות — מלבד ה-sandbox של OpenAI עצמה, צוותים יכולים לכוון סוכנים לתשתית שלהם או לספקי sandbox חיצוניים ברשימת שותפי הבטא.
השחרור הקולי הוא סיפור של מודל. ה-Agents API הוא סיפור של פלטפורמה, וסיפורי פלטפורמה הם אלה שמכוונים מחדש בשקט בסיס קוד.
Agents API: סוכן ב-POST אחד
הקריאה המרכזית היא POST /v1/agents/sessions, שנשלחת עם כותרת OpenAI-Beta: agents=v1, וההבטחה היא שמשימה, מודל, כלים וסביבה מספיקים כדי לקבל בחזרה סוכן פעיל. ערכות ה-SDK מכסות את Python, TypeScript/JavaScript, Go, Java ו-Ruby.
מה שהופך אותו ליותר מסתם עטיפה הוא ש-OpenAI מפעילה את הארנ�ס במקום לשלוח אותו. הארנ�ס של AgentKit הוא קוד פתוח וניתן לבחינה, אבל העותק הפעיל הוא של OpenAI — דחיסת הקשר לאורך סשנים ארוכים, חיפוש כלים, קריאה פרוגרמטית לכלים, תמיכה ב-MCP, פונקציות מותאמות אישית, חיפוש אינטרנט מובנה, ותזמור תתי-סוכנים עם מקביליות ניתנת להגדרה. יכולות הארנ�ס המגורסאות משוחררות לצד השקות מודלים, וזו המחויבות המעניינת: הפיגום נע באותו קצב כמו המודלים.
לכל מי שבילה רבעון בתחזוקה של לולאה — לוגיקת ניסיונות חוזרים, גיזום הקשר, ניתוב כלים, פיזור תתי-סוכנים שתמיד מדליף מצב — זה המוצר האמיתי. לא קריאת המודל. הצנרת סביבו שאתם כבר לא כותבים.
ארגזי חול מתארחים הם החלק שמגיע עם חשבון
סוכנים שמריצים קוד צריכים מקום שבו להריץ אותו, והבטא מביאה את התשובה של OpenAI עצמה: סנדבוקס מנוהל שמריץ קוד, עובד עם קבצים ומפיק ארטיפקטים, וניתן להגדרה עם חבילות, מיומנויות ותוספים. מפתחים שכבר יש להם סביבת הרצה מוקשחת לא נאלצים להשתמש בו — הן האפשרות להביא תשתית משלך והן קבוצה של שותפי סנדבוקס מזוהים בשמם נמצאות בבטא.
שתי הסתייגויות תפעוליות כדאי לתעד לפני שאתה בונה על זה. מיקום נתונים בבטא הוא בארה"ב בלבד, ו-Zero Data Retention אינו נתמך. עבור עומס עבודה רגולטורי, שתי שורות אלו קובעות אם זה פיילוט או מסלול ייצור, והן הפרטים שנוטים להתגלות מאוחר.
GPT-Live-1 ב-API: חיוב אחיד לפי דקה הוא השינוי האמיתי
מודל הקול עצמו אינו חדש — הוא החליף את Advanced Voice Mode בתוך ChatGPT ב-8 ביולי — אבל הצורה המסחרית כן. תחת קו ה-Realtime, אודיו נמדד בטוקנים, מה שאומר שתחזית של שיחה חייבה מידול של צריכת אודיו: כמה טוקנים עולה שנייה של שקט, וכיצד מתקשר שמדבר מעל הסוכן משנה את אורך הפלט. תעריף אחיד של $0.05 לדקת קול ממצמצם זאת לכפל. שעה של קו פתוח רצוף היא $3.00. ממוצע של ארבע דקות על פני אלף שיחות ביום הוא בערך $200 ביום.
סשנים פועלים מנקודת קצה של Live Sessions עם מזהה מודל יחיד וללא תמונות מצב מתוארכות להצמדה. התיעוד מכסה WebRTC, WebSockets וטלפוניה/SIP כנתיבי חיבור, ומדריך ההתחלה המהירה שפורסם בונה את נתיב ה-WebRTC. לחיוב יש שני מונים, ורק אחד מהם הוא הקולי: כל קריאת הסקה מואצלת, הפעלת כלי וחיפוש באינטרנט מחויבים בתעריפים הרגילים של מודל ה-backend.
הארכיטקטורה היא האצלה. GPT-Live-1 מנהל את השיחה — כשהוא מחליט כמה פעמים בשנייה אם להמשיך להקשיב, לעצור, להפריע או להעביר את העבודה הלאה — ומעביר כל דבר שדורש חשיבה אמיתית דרך גבול אסינכרוני לבקאנד נפרד, שממשיך לעבוד בזמן שהשיחה המדוברת נמשכת. התיעוד מגדיר שני מצבים: האצלת Responses, שבה OpenAI קוראת עבורך למודל Responses נתמך ומספקת הקשר שיחה, והאצלת לקוח, שבה האפליקציה שלך מספקת את הבקאנד ושומרת על השליטה בביצוע, בהקשר ובאילו תוצאות מגיעות לשכבת הקול. בדוגמת ה-Responses שפורסמה, הבקאנד הזה הוא GPT-5.6 Terra, הנקרא באובייקט האצלה שלצדו ההוראות והכלים שלו. בהשקה לצרכנים ביולי הוא היה GPT-5.5; כתיבות בקהילה מאז הצביעו על GPT-6 Astra.

כל מספר עיקרי עבור שכבת הקול הוא של OpenAI עצמה, ובזמן כתיבת שורות אלה, לא שוחזר באופן עצמאי על ידי איש: 80.1% ב-Full Duplex Bench v1.5 באינטראקטיביות לעומת 45.4% עבור GPT-Realtime-2.1, השהיית חילופי תורות של 0.798 שניות לעומת 1.41 שניות, 87% הצלחה בקריאות לכלים, ושיעור מעבר של 32% בהערכת תמיכה קולית בבנקאות לעומת 12.4% עבור המודל שאותו הוא מחליף. הזוג האחרון הוא הישר — שיפור גדול, ועדיין מערכת שנכשלת בכשני שלישים מתהליך עבודה מוסדר. קיימות ראיות לקוח מצד שלישי, אך הן דלות ואינטרסנטיות: Yelp עבור הזמנות טלפוניות, EliseAI, ופלטפורמת הלמידה Speak מדווחות על כמעט 80% פחות הפרעות מאשר במערכת הקודמת מבוססת התורות שלה.
התוצאה הבלתי תלויה פחות מחמיאה, וכדאי להציב אותה לצד הרשימה שלמעלה ולא מתחתיה. במדד Artificial Analysis Speech to Speech — ציון משולב אחד על חשיבה בדיבור, ביצועים סוכניים, העדפה בזירה והצלחת משימות — GPT-Live-1 ניצב על 69.8%, מתחת ל-73.9% של GPT-Realtime-2.1 והרבה מתחת ל-79.0% של Grok Voice Think Fast 2.0. קראו את השניים יחד וצורת המוצר מתבהרת: OpenAI בנתה את המכניקה השיחתית הטובה ביותר הזמינה ולא בנתה את סוכן הקול הטוב ביותר, משום שהחשיבה מואצלת למודל שהמדד מדרג בנפרד.

שתי ההכרזות הן הכרזה אחת
בקריאה אחת, המהדורות מתארות את אותו ארגון מחדש משני כיוונים. ה-Agents API מעביר את הלולאה, את הסנדבוקס ואת ניהול ההקשר אל מוצר מתארח. GPT-Live-1 מעביר את משטח השיחה אל ממשק קדמי דק שמאציל את החשיבה שלו למקום אחר. בשני המקרים, המודל מפסיק להיות הדבר שבונים סביבו והופך לרכיב שבוחרים בו — ובשני המקרים, הבחירה היא שורת קונפיגורציה ולא התחייבות ארכיטקטונית.
זה בדיוק התפר ששכבת ניתוב יושבת בו. OrcaRouter לא מעבירה gpt-live-1: נקודת הקצה של Live Sessions היא של OpenAI בלבד, ואנחנו לא מנתבים ממנה דבר. חצי הדליגציה הוא סיפור אחר. הקצה האחורי ששכבת הקול מוסרת אליו עבודה מדבר ב-Responses API, וזו קריאת מודל רגילה — המודל שהדוגמה של OpenAI עצמה נוקבת בשמו, GPT-5.6 Terra, זמין דרך OrcaRouter במחיר המחירון של OpenAI של 2.00 דולר למיליון טוקני קלט ו-12.00 דולר למיליון טוקני פלט, כשנקודת הקצה Responses חשופה. דליגציה מצד הלקוח מרחיקה לכת: היא מאפשרת לאפליקציה שלך לספק את הקצה האחורי בעצמה, מה שאומר שהמודל שמאחורי הקול יכול להיות כל נקודת קצה שאתה שולט בה. הדבר נכון גם למשבצת המודל של Agents API: ה-harness הוא של OpenAI, אבל המודל שבתוכו הוא בחירה שנשארת בידיך, ובערך 190 מודלים מאחד־עשר ספקים במעלה הזרם יושבים מאחורי מפתח אחד במחיר המחירון של הספק בלי תוספת מעל.
באופן קונקרטי, שלושה דברים נובעים מכך. ניתן להריץ A/B בין בקאנדים על תעבורה חיה על ידי עריכת שורה אחת, וכך מגלים אם מנוע הסקה זול טוב מספיק לפני שמקדישים לו קו טלפון. Failover יכול לשבת תחת מודל ההאצלה, כך שאחר צהריים גרוע במעלה הזרם לא מפיל איתו את השיחה. ואפשר להריץ משימה מול כמה בקאנדים בקריאה אחת דרך ה-DSL לניתוב, או לקבל עליה תשובה מפאנל של מודלים בבת אחת עם מיזוג מודלים — שימושי ברגע שצריך לתת אמון בפלט של סוכן ולא רק לייצר אותו.
מה נמצא באף אחת מהמהדורות?
• אין קלט תמונה או וידאו ב-GPT-Live-1 — הממשק הקולי הרב-מודלי שמציעים מצבי ChatGPT הישנים יותר עדיין לא זוכה למענה.
• אין פלטים מובנים בשכבת הקול, לכן יש לאכוף ארגומנטים של כלים שעברו ולידציה של סכימה במודל הבקאנד.
• אין גישה במסלול החינמי ל-GPT-Live-1, ומגבלות הקצב נקובות בסשנים במקביל — 25 ברמה 1, ועולות ל-500 עד רמה 5.
• אין Zero Data Retention ואין מיקום נתונים מחוץ לארה״ב ב-Agents API beta.
• אין שחזור בלתי־תלוי של אף נתון בנצ׳מרק של GPT-Live-1.
ההימור ש-OpenAI עשתה ב-10 בספטמבר הוא שמפתחים רוצים לקנות את הרתמה ולבחור את המוח בנפרד. החצי הראשון של זה הוא כעת סעיף בשורה. החצי השני הוא המקום שבו ינחת הלחץ התחרותי של שנים-עשר החודשים הבאים — כי רתמה מתארחת עם משבצת מודל להחלפה אינה טובה יותר מהמודלים שאפשר להכניס לתוכה, וכרגע זה החלק היחיד בסטאק ש-OpenAI לא שולטת בו לבדה.
חצי ההאצלה הוא סיפור אחר — הבקאנד ששכבת הקול מוסרת אליו עבודה הוא קריאת מודל רגילה, ו-GPT-5.6 Terra זמין דרך OrcaRouter במחיר המחירון של OpenAI, עם נקודת הקצה Responses חשופה.
