כרטיס כותרת ראשי עבור המאמר 'יום הפלטפורמה של OpenAI בספטמבר', עם כותרת משנה 'GPT-Live-1 מגיע ל-API, ה-Agents API נפתח בבטא', נושא תג שעליו כתוב 'שתי ההכרזות מתוארכות ל-10 בספטמבר 2026' ושלושה כרטיסים שעליהם כתוב 'GPT-Live-1 ב-API: $0.05 לדקת קול, נקודת קצה Live Sessions, מזהה מודל אחד', 'Agents API: בטא ציבורית, Codex harness, ארגזי חול מתארחים או להביא משלך' ו'למה זה חשוב: המודל הופך לרכיב שאתה בוחר, ה-harness הופך למוצר שאתה שוכר', מעל פס תחתון שעליו כתוב 'נתוני הקול דווחו על ידי OpenAI ולא שוחזרו; התמחור של Agents API הוא העברת עלויות.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

אירוע הפלטפורמה של Ope​nAI בספטמבר: GPT-Live-1 מגיע ל-API כשה-Agents API נפתח בבטא

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני דברים יצאו מהפלטפורמה של Ope​nAI ב-10 בספטמבר 2026, ולשקט מבין השניים יש רדיוס השפעה גדול יותר. GPT-Live-1 — מודל הקול בדופלקס מלא שפועל בתוך ChatGPT מאז 8 ביולי — ניתן כעת לקריאה על ידי מפתחים בעלות של $0.05 לדקת קול. לצדו, ובהרבה פחות אזכורים בסיקור, נכנס ה-Agents API לבטא ציבורית: אותה תשתית שמריצה את Codex, שנחשפה כמוצר מתארח עם סנדבוקסים מנוהלים. האחד הוא קול טוב יותר. האחר הוא Ope​nAI שמוכרת את הדבר שהיה פעם החלק הקשה בבניית סוכן.

שניהם נלקחו מהמקורות הראשוניים עבור הכתבה הזו: ההכרזה של OpenAI על Agents API, הפוסט בקהילת המפתחים שלה שהציג את GPT-Live-1 ב-API, והתיעוד למפתחים של שניהם. כאשר מספר מגיע מ-OpenAI ולא ממעריך חיצוני, הוא מסומן ככזה להלן — ונתון אחד אכן מגיע מבחוץ, מה שמשנה את הסיפור במעט.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis החלה השנה לפרסם מדד דיבור-לדיבור (Speech to Speech Index), ול-GPT-Live-1 יש בו שורה משלו: 69.8%, ממוצע משוקלל של הסקה בדיבור, ביצועים סוכניים, העדפה בזירה והצלחת משימות. זה מציב אותו במקום השביעי מבין אחד-עשר המודלים שנמדדו — אחרי GPT-Realtime-2.1 עם 73.9%, שהוא המודל שהוא מחליף, ואחרי Gr​ok Voice Think Fast 2.0 עם 79.0%. לוח התוצאות העצמאי וטבלת הבנצ'מרקים של Ope​nAI עצמה לא מספרים את אותו סיפור, ושניהם נכונים.

מה שיצא, לפי הסדר שבו זה ישנה את הארכיטקטורה שלך

• קול — GPT-Live-1 זמין ב-API בתור gpt-live-1, בתעריף של $0.05 לדקת קול, בחיוב לפי שנייה, כאשר מודל החשיבה ב-backend מחויב בנפרד לפי התעריפים שלו.

• Agents — ה-API של סוכנים נמצא בבטא ציבורית. Ope​nAI אומרת שאין תשלום נוסף עבור ה-API עצמו; אתה משלם עבור טוקנים של מודלים, כלים וזמן קונטיינר sandbox מתארח.

• ארגזי חול — Ope​nAI מארחת כעת את סביבת ההרצה, תוך שימוש חוזר באותה תשתית ארגזי חול כמו זו של Codex ו-ChatGPT, הניתנת להגדרה עם קבצים, חבילות, כישורים ותוספים.

• סביבות — מלבד ה-sandbox של Ope​nAI עצמה, צוותים יכולים לכוון סוכנים לתשתית שלהם או לספקי sandbox חיצוניים ברשימת שותפי הבטא.

השחרור הקולי הוא סיפור של מודל. ה-Agents API הוא סיפור של פלטפורמה, וסיפורי פלטפורמה הם אלה שמכוונים מחדש בשקט בסיס קוד.

Agents API: סוכן ב-POST אחד

הקריאה המרכזית היא POST /v1/agents/sessions, שנשלחת עם כותרת Ope​nAI-Beta: agents=v1, וההבטחה היא שמשימה, מודל, כלים וסביבה מספיקים כדי לקבל בחזרה סוכן פעיל. ערכות ה-SDK מכסות את Python, TypeScript/JavaScript, Go, Java ו-Ruby.

מה שהופך אותו ליותר מסתם עטיפה הוא ש-Ope​nAI מפעילה את הארנ�ס במקום לשלוח אותו. הארנ�ס של AgentKit הוא קוד פתוח וניתן לבחינה, אבל העותק הפעיל הוא של Ope​nAI — דחיסת הקשר לאורך סשנים ארוכים, חיפוש כלים, קריאה פרוגרמטית לכלים, תמיכה ב-MCP, פונקציות מותאמות אישית, חיפוש אינטרנט מובנה, ותזמור תתי-סוכנים עם מקביליות ניתנת להגדרה. יכולות הארנ�ס המגורסאות משוחררות לצד השקות מודלים, וזו המחויבות המעניינת: הפיגום נע באותו קצב כמו המודלים.

לכל מי שבילה רבעון בתחזוקה של לולאה — לוגיקת ניסיונות חוזרים, גיזום הקשר, ניתוב כלים, פיזור תתי-סוכנים שתמיד מדליף מצב — זה המוצר האמיתי. לא קריאת המודל. הצנרת סביבו שאתם כבר לא כותבים.

ארגזי חול מתארחים הם החלק שמגיע עם חשבון

סוכנים שמריצים קוד צריכים מקום שבו להריץ אותו, והבטא מביאה את התשובה של OpenAI עצמה: סנדבוקס מנוהל שמריץ קוד, עובד עם קבצים ומפיק ארטיפקטים, וניתן להגדרה עם חבילות, מיומנויות ותוספים. מפתחים שכבר יש להם סביבת הרצה מוקשחת לא נאלצים להשתמש בו — הן האפשרות להביא תשתית משלך והן קבוצה של שותפי סנדבוקס מזוהים בשמם נמצאות בבטא.

שתי הסתייגויות תפעוליות כדאי לתעד לפני שאתה בונה על זה. מיקום נתונים בבטא הוא בארה"ב בלבד, ו-Zero Data Retention אינו נתמך. עבור עומס עבודה רגולטורי, שתי שורות אלו קובעות אם זה פיילוט או מסלול ייצור, והן הפרטים שנוטים להתגלות מאוחר.

GPT-Live-1 ב-API: חיוב אחיד לפי דקה הוא השינוי האמיתי

מודל הקול עצמו אינו חדש — הוא החליף את Advanced Voice Mode בתוך ChatGPT ב-8 ביולי — אבל הצורה המסחרית כן. תחת קו ה-Realtime, אודיו נמדד בטוקנים, מה שאומר שתחזית של שיחה חייבה מידול של צריכת אודיו: כמה טוקנים עולה שנייה של שקט, וכיצד מתקשר שמדבר מעל הסוכן משנה את אורך הפלט. תעריף אחיד של $0.05 לדקת קול ממצמצם זאת לכפל. שעה של קו פתוח רצוף היא $3.00. ממוצע של ארבע דקות על פני אלף שיחות ביום הוא בערך $200 ביום.

סשנים פועלים מנקודת קצה של Live Sessions עם מזהה מודל יחיד וללא תמונות מצב מתוארכות להצמדה. התיעוד מכסה WebRTC, WebSockets וטלפוניה/SIP כנתיבי חיבור, ומדריך ההתחלה המהירה שפורסם בונה את נתיב ה-WebRTC. לחיוב יש שני מונים, ורק אחד מהם הוא הקולי: כל קריאת הסקה מואצלת, הפעלת כלי וחיפוש באינטרנט מחויבים בתעריפים הרגילים של מודל ה-backend.

הארכיטקטורה היא האצלה. ‏GPT-Live-1 מנהל את השיחה — כשהוא מחליט כמה פעמים בשנייה אם להמשיך להקשיב, לעצור, להפריע או להעביר את העבודה הלאה — ומעביר כל דבר שדורש חשיבה אמיתית דרך גבול אסינכרוני לבקאנד נפרד, שממשיך לעבוד בזמן שהשיחה המדוברת נמשכת. התיעוד מגדיר שני מצבים: האצלת Responses, שבה Ope​nAI קוראת עבורך למודל Responses נתמך ומספקת הקשר שיחה, והאצלת לקוח, שבה האפליקציה שלך מספקת את הבקאנד ושומרת על השליטה בביצוע, בהקשר ובאילו תוצאות מגיעות לשכבת הקול. בדוגמת ה-Responses שפורסמה, הבקאנד הזה הוא GPT-5.6 Terra, הנקרא באובייקט האצלה שלצדו ההוראות והכלים שלו. בהשקה לצרכנים ביולי הוא היה GPT-5.5; כתיבות בקהילה מאז הצביעו על GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

כל מספר עיקרי עבור שכבת הקול הוא של OpenAI עצמה, ובזמן כתיבת שורות אלה, לא שוחזר באופן עצמאי על ידי איש: 80.1% ב-Full Duplex Bench v1.5 באינטראקטיביות לעומת 45.4% עבור GPT-Realtime-2.1, השהיית חילופי תורות של 0.798 שניות לעומת 1.41 שניות, 87% הצלחה בקריאות לכלים, ושיעור מעבר של 32% בהערכת תמיכה קולית בבנקאות לעומת 12.4% עבור המודל שאותו הוא מחליף. הזוג האחרון הוא הישר — שיפור גדול, ועדיין מערכת שנכשלת בכשני שלישים מתהליך עבודה מוסדר. קיימות ראיות לקוח מצד שלישי, אך הן דלות ואינטרסנטיות: Yelp עבור הזמנות טלפוניות, EliseAI, ופלטפורמת הלמידה Speak מדווחות על כמעט 80% פחות הפרעות מאשר במערכת הקודמת מבוססת התורות שלה.

התוצאה הבלתי תלויה פחות מחמיאה, וכדאי להציב אותה לצד הרשימה שלמעלה ולא מתחתיה. במדד Artificial Analysis Speech to Speech — ציון משולב אחד על חשיבה בדיבור, ביצועים סוכניים, העדפה בזירה והצלחת משימות — GPT-Live-1 ניצב על 69.8%, מתחת ל-73.9% של GPT-Realtime-2.1 והרבה מתחת ל-79.0% של Gr​ok Voice Think Fast 2.0. קראו את השניים יחד וצורת המוצר מתבהרת: Ope​nAI בנתה את המכניקה השיחתית הטובה ביותר הזמינה ולא בנתה את סוכן הקול הטוב ביותר, משום שהחשיבה מואצלת למודל שהמדד מדרג בנפרד.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

שתי ההכרזות הן הכרזה אחת

בקריאה אחת, המהדורות מתארות את אותו ארגון מחדש משני כיוונים. ה-Agents API מעביר את הלולאה, את הסנדבוקס ואת ניהול ההקשר אל מוצר מתארח. GPT-Live-1 מעביר את משטח השיחה אל ממשק קדמי דק שמאציל את החשיבה שלו למקום אחר. בשני המקרים, המודל מפסיק להיות הדבר שבונים סביבו והופך לרכיב שבוחרים בו — ובשני המקרים, הבחירה היא שורת קונפיגורציה ולא התחייבות ארכיטקטונית.

זה בדיוק התפר ששכבת ניתוב יושבת בו. OrcaRouter לא מעבירה gpt-live-1: נקודת הקצה של Live Sessions היא של OpenAI בלבד, ואנחנו לא מנתבים ממנה דבר. חצי הדליגציה הוא סיפור אחר. הקצה האחורי ששכבת הקול מוסרת אליו עבודה מדבר ב-Responses API, וזו קריאת מודל רגילה — המודל שהדוגמה של OpenAI עצמה נוקבת בשמו, GPT-5.6 Terra, זמין דרך OrcaRouter במחיר המחירון של OpenAI של 2.00 דולר למיליון טוקני קלט ו-12.00 דולר למיליון טוקני פלט, כשנקודת הקצה Responses חשופה. דליגציה מצד הלקוח מרחיקה לכת: היא מאפשרת לאפליקציה שלך לספק את הקצה האחורי בעצמה, מה שאומר שהמודל שמאחורי הקול יכול להיות כל נקודת קצה שאתה שולט בה. הדבר נכון גם למשבצת המודל של Agents API: ה-harness הוא של OpenAI, אבל המודל שבתוכו הוא בחירה שנשארת בידיך, ובערך 190 מודלים מאחד־עשר ספקים במעלה הזרם יושבים מאחורי מפתח אחד במחיר המחירון של הספק בלי תוספת מעל.

באופן קונקרטי, שלושה דברים נובעים מכך. ניתן להריץ A/B בין בקאנדים על תעבורה חיה על ידי עריכת שורה אחת, וכך מגלים אם מנוע הסקה זול טוב מספיק לפני שמקדישים לו קו טלפון. Failover יכול לשבת תחת מודל ההאצלה, כך שאחר צהריים גרוע במעלה הזרם לא מפיל איתו את השיחה. ואפשר להריץ משימה מול כמה בקאנדים בקריאה אחת דרך ה-DSL לניתוב, או לקבל עליה תשובה מפאנל של מודלים בבת אחת עם מיזוג מודלים — שימושי ברגע שצריך לתת אמון בפלט של סוכן ולא רק לייצר אותו.

מה נמצא באף אחת מהמהדורות?

• אין קלט תמונה או וידאו ב-GPT-Live-1 — הממשק הקולי הרב-מודלי שמציעים מצבי ChatGPT הישנים יותר עדיין לא זוכה למענה.

• אין פלטים מובנים בשכבת הקול, לכן יש לאכוף ארגומנטים של כלים שעברו ולידציה של סכימה במודל הבקאנד.

• אין גישה במסלול החינמי ל-GPT-Live-1, ומגבלות הקצב נקובות בסשנים במקביל — 25 ברמה 1, ועולות ל-500 עד רמה 5.

• אין Zero Data Retention ואין מיקום נתונים מחוץ לארה״ב ב-Agents API beta.

• אין שחזור בלתי־תלוי של אף נתון בנצ׳מרק של GPT-Live-1.

ההימור ש-OpenAI עשתה ב-10 בספטמבר הוא שמפתחים רוצים לקנות את הרתמה ולבחור את המוח בנפרד. החצי הראשון של זה הוא כעת סעיף בשורה. החצי השני הוא המקום שבו ינחת הלחץ התחרותי של שנים-עשר החודשים הבאים — כי רתמה מתארחת עם משבצת מודל להחלפה אינה טובה יותר מהמודלים שאפשר להכניס לתוכה, וכרגע זה החלק היחיד בסטאק ש-OpenAI לא שולטת בו לבדה.

חצי ההאצלה הוא סיפור אחר — הבקאנד ששכבת הקול מוסרת אליו עבודה הוא קריאת מודל רגילה, ו-GPT-5.6 Terra זמין דרך OrcaRouter במחיר המחירון של Ope​nAI, עם נקודת הקצה Responses חשופה.