بطاقة عنوان رئيسية لمقال «يوم المنصة لـ OpenAI في سبتمبر»، بعنوان فرعي «GPT-Live-1 يصل إلى API، وAgents API تُفتح في النسخة التجريبية»، تحمل شارة تقول «كلا الإعلانين بتاريخ 10 سبتمبر 2026» وثلاث بطاقات تقول «GPT-Live-1 في API: 0.05 دولار لكل دقيقة صوتية، نقطة نهاية Live Sessions، معرّف نموذج واحد»، و«Agents API: نسخة تجريبية عامة، أداة تشغيل Codex، بيئات اختبار مُستضافة أو أحضر بيئتك الخاصة»، و«لماذا يهم: يصبح النموذج مكوّنًا تختاره، وتصبح أداة التشغيل منتجًا تستأجره»، فوق شريط تذييل يقول «أرقام الصوت مُبلَّغ عنها من OpenAI وغير مُعاد إنتاجها؛ تسعير Agents API يُمرَّر كما هو.» شعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Guides & Insights

يوم المنصة لشهر سبتمبر من Ope​nAI: يصل GPT-Live-1 إلى API بينما تُفتح Agents API في النسخة التجريبية

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

غادر شيئان منصة Ope​nAI في 10 سبتمبر 2026، وللأكثر هدوءًا منهما نطاق تأثير أكبر. GPT-Live-1 — نموذج الصوت كامل الازدواجية الذي يعمل داخل ChatGPT منذ 8 يوليو — أصبح الآن قابلًا للاستدعاء من المطورين مقابل 0.05 دولار لكل دقيقة صوت. وإلى جانبه، وبإشارة أقل بكثير في التغطية، دخل Agents API مرحلة بيتا العامة: نفس إطار التشغيل الذي يشغّل Codex، مكشوفًا كمنتج مستضاف مع بيئات اختبار معزولة مُدارة. أحدهما صوت أفضل. والآخر هو أن Ope​nAI تبيع الشيء الذي كان يُعد الجزء الصعب في بناء وكيل.

استُخرج كلا الرقمين من المصادر الأولية لهذا المقال: إعلان OpenAI عن Agents API، ومنشورها في مجتمع المطوّرين الذي يقدّم GPT-Live-1 في API، والوثائق التطويرية لكليهما. وعندما يأتي رقم من OpenAI بدلاً من مُقيّم خارجي، فإنه يُوسَم بذلك أدناه — وثمة رقم واحد يأتي بالفعل من جهة خارجية، مما يغيّر القصة قليلاً.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

بدأت Artificial Analysis بنشر مؤشر Speech to Speech Index هذا العام، ولـ GPT-Live-1 صف فيه: 69.8%، وهو متوسط مرجّح عبر الاستدلال الكلامي، والأداء الوكيلي، وتفضيل الساحة، ونجاح المهام. وهذا يضعه في المرتبة السابعة من بين أحد عشر نموذجًا جرى تقييمها — خلف GPT-Realtime-2.1 عند 73.9%، وهو النموذج الذي يحلّ محلّه، وخلف Grok Voice Think Fast 2.0 عند 79.0%. لا تروي لوحة النتائج المستقلة وجدول المعايير الخاص بـ OpenAI القصة نفسها، وكلاهما صحيح.

ما الذي صدر، بالترتيب الذي سيغيّر به بنيتك المعمارية

• الصوت — أصبح GPT-Live-1 متاحًا في API باسم gpt-live-1، بتكلفة 0.05 دولار لكل دقيقة من الصوت، تُحسب بالثانية، مع محاسبة نموذج الاستدلال الخلفي بشكل منفصل وفقًا لأسعاره الخاصة.

• الوكلاء — إن Agents API في نسخة تجريبية عامة. تقول OpenAI إنه لا توجد رسوم إضافية على الـ API نفسها؛ أنت تدفع مقابل رموز النماذج والأدوات ووقت حاوية الاختبار المعزولة المستضافة.

• بيئات معزولة — تستضيف OpenAI الآن بيئة التنفيذ، مع إعادة استخدام البنية التحتية ذاتها للعزل التي تعتمدها Codex وChatGPT، ويمكن تهيئتها بالملفات والحزم والمهارات والإضافات.

• البيئات — إلى جانب بيئة OpenAI الرملية الخاصة، يمكن للفرق توجيه الوكلاء نحو بنيتهم التحتية الخاصة أو نحو بائعي البيئات الرملية من الأطراف الثالثة في قائمة شركاء النسخة التجريبية.

إصدار الصوت هو قصة نموذج. أما Agents API فهي قصة منصة، وقصص المنصات هي التي تعيد توجيه قاعدة الكود بهدوء.

The Agents API: وكيل واحد في POST واحد

النداء الأساسي هو POST /v1/agents/sessions، ويُرسَل مع Ope​nAI-Beta: agents=v1 كترويسة، وتكمن الفكرة في أن المهمة والنموذج والأدوات والبيئة كافية لاستعادة وكيل قيد التشغيل. وتغطي حزم SDK اللغات Python، TypeScript/JavaScript، Go، Java وRuby.

ما يجعلها أكثر من مجرد غلاف هو أن Ope​nAI تشغّل الharness بدلاً من طرحه للاستخدام. إن harness الخاص بـ AgentKit مفتوح المصدر وقابل للفحص، لكن النسخة قيد التشغيل هي نسخة Ope​nAI — ضغط السياق عبر الجلسات الطويلة، والبحث في الأدوات، والاستدعاء البرمجي للأدوات، ودعم MCP، والدوال المخصصة، والبحث المدمج في الويب، وتنسيق الوكلاء الفرعيين مع تزامن قابل للتكوين. تُطرح قدرات الharness المُصدَّرة بنسخ متزامنة مع إطلاق النماذج، وهذا هو الالتزام المثير للاهتمام: إذ تتحرك البنية التحتية بوتيرة النماذج نفسها.

بالنسبة لأي شخص أمضى ربع سنة في صيانة حلقة — منطق إعادة المحاولة، تقليم السياق، توجيه الأدوات، تفريع الوكلاء الفرعيين الذي يسرب الحالة دائمًا — هذا هو المنتج الفعلي. ليس استدعاء النموذج. البنية التحتية المحيطة به التي لم تعد تكتبها.

بيئات الاختبار المستضافة هي الجزء الذي تأتي معه فاتورة

تحتاج الوكلاء التي تنفّذ الشيفرة إلى مكان لتنفيذها فيه، وتقدّم النسخة التجريبية إجابة OpenAI الخاصة: بيئة معزولة مُدارة تشغّل الشيفرة، وتتعامل مع الملفات وتنتج مخرجات، وقابلة للتكوين بالحزم والمهارات والإضافات. أما المطورون الذين يملكون بالفعل بيئة تنفيذ محصّنة فليسوا مضطرين إليها — إذ تتضمن النسخة التجريبية خيار جلب البنية التحتية الخاصة بك، إلى جانب مجموعة من شركاء البيئات المعزولة المحدّدين بالاسم.

هناك تحفظان تشغيليان يجدر تدوينهما قبل أن تبني عليه. إقامة البيانات في النسخة التجريبية مقصورة على الولايات المتحدة فقط، كما أن الاحتفاظ الصفري بالبيانات (Zero Data Retention) غير مدعوم. وبالنسبة لعبء عمل خاضع للتنظيم، يحدد هذان السطران ما إذا كان هذا مساراً تجريبياً أم مساراً إنتاجياً، وهما التفصيلان اللذان غالباً ما يُكتشفان متأخراً.

GPT-Live-1 في API: الفوترة الثابتة لكل دقيقة هي التغيير الحقيقي

نموذج الصوت نفسه ليس جديدًا — فقد حلّ محل Advanced Voice Mode داخل ChatGPT في 8 يوليو — لكن الشكل التجاري هو الجديد. في إطار خط Realtime، كان الصوت يُحتسب بالتوكنات، ما يعني أن توقّع تكلفة مكالمة تطلّب نمذجة استهلاك الصوت: كم توكنًا تستهلكه ثانية صمت، وكيف يغيّر تحدّث متصل فوق صوت الوكيل طول المخرجات. أما السعر الثابت 0.05 دولار لكل دقيقة صوتية فيختزل ذلك إلى عملية ضرب. ساعة من خط مفتوح متواصل تكلف 3.00 دولارات. ومتوسط أربع دقائق على مدى ألف مكالمة يوميًا يبلغ نحو 200 دولار يوميًا.

تعمل الجلسات من نقطة نهاية Live Sessions بمعرّف نموذج واحد ودون لقطات مؤرخة لتثبيتها. توثّق الوثائق WebRTC وWebSockets والاتصال الهاتفي/SIP كمسارات اتصال، بينما يبني الدليل السريع المنشور مسار WebRTC. تحتوي الفوترة على عدّادين، وواحد فقط منهما هو الصوت: كل استدعاء استدلال مُفوَّض واستدعاء أداة وبحث على الويب يُحتسب بأسعار النموذج الخلفي العادية.

البنية هي التفويض. يتولى GPT-Live-1 إدارة المحادثة — حيث يقرر عدة مرات في الثانية ما إذا كان سيستمر في الاستماع أو يتوقف مؤقتًا أو يقاطع أو يسلم العمل — ويمرر أي شيء يحتاج إلى تفكير حقيقي عبر حد غير متزامن إلى نظام خلفي منفصل، يواصل العمل بينما تستمر المحادثة المنطوقة. تحدد الوثائق وضعين: تفويض Responses، حيث يستدعي Ope​nAI نموذج Responses مدعومًا نيابة عنك ويوفر سياق المحادثة، وتفويض العميل، حيث يوفر تطبيقك الخاص الواجهة الخلفية ويحتفظ بالتحكم في التنفيذ والسياق وأي النتائج تصل إلى طبقة الصوت. في مثال Responses المنشور، تلك الواجهة الخلفية هي GPT-5.6 Terra، المسمى في تفويض، كائن إلى جانب تعليماته وأدواته الخاصة. في إطلاق يوليو للمستهلكين كان GPT-5.5؛ وقد أشارت كتابات المجتمع منذ ذلك الحين إلى GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

كل رقم رئيسي في الطبقة الصوتية هو رقم OpenAI نفسها، وفي وقت كتابة هذا النص لم يُعَد إنتاجه بشكل مستقل من قبل أي جهة: 80.1% في التفاعلية على Full Duplex Bench v1.5 مقابل 45.4% لـ GPT-Realtime-2.1، وزمن استجابة لتبادل الأدوار يبلغ 0.798 ثانية مقابل 1.41 ثانية، ونجاح في استدعاء الأدوات بنسبة 87%، ومعدل اجتياز 32% في تقييم دعم صوتي مصرفي مقابل 12.4% للنموذج الذي يحل محله. هذا الزوج الأخير هو الأصدق — تحسّن كبير، ومع ذلك لا يزال نظامًا يفشل في نحو ثلثي سير عمل خاضع للتنظيم. توجد أدلة من عملاء أطراف ثالثة لكنها ضئيلة وذات مصلحة: Yelp للحجوزات الهاتفية، وEliseAI، ومنصة التعلم Speak التي أبلغت عن انخفاض يقارب 80% في المقاطعات مقارنة بمنظومتها السابقة القائمة على تبادل الأدوار.

النتيجة المستقلة أقل إطراءً، وتستحق أن توضع بجانب القائمة أعلاه بدلًا من تحتها. على مؤشر Artificial Analysis Speech to Speech Index — درجة مركبة واحدة تشمل الاستدلال الكلامي، والأداء الوكيلي، وتفضيل الساحة، ونجاح المهام — يحتل GPT-Live-1 نسبة 69.8%، دون نسبة GPT-Realtime-2.1 البالغة 73.9%، وأدنى بكثير من نسبة Gr​ok Voice Think Fast 2.0 البالغة 79.0%. اقرأ الاثنين معًا، فيتضح شكل المنتج: بنت Ope​nAI أفضل آليات الحوار المتاحة ولم تبنِ أفضل وكيل صوتي، لأن الاستدلال مُفوَّض إلى نموذج يقيّمه المؤشر بشكل منفصل.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

الإعلانان هما إعلان واحد

عند قراءتهما معًا، يصف الإصداران إعادة التنظيم نفسها من اتجاهين. تنقل واجهة برمجة التطبيقات Agents API الحلقة وبيئة العزل وإدارة السياق إلى منتج مستضاف. ينقل GPT-Live-1 السطح المحادثي إلى واجهة أمامية رقيقة تُفوّض تفكيرها إلى مكان آخر. في كليهما، يتوقف النموذج عن كونه الشيء الذي تبني حوله ويصبح مكونًا تختاره — وفي كليهما، يكون الاختيار سطر تهيئة بدلًا من التزام معماري.

هذا بالضبط هو الشقّ الذي تستقرّ فيه طبقة التوجيه. ولا يوفّر OrcaRouter gpt-live-1: نقطة نهاية Live Sessions حكرٌ على Ope​nAI وحدها، ولا نوجّه أيًّا منها. أما شقّ التفويض فحكايته مختلفة. الخادم الخلفي الذي تُسند إليه طبقة الصوت العمل يتحدّث Responses API، وذلك استدعاء نموذج عادي — والنموذج الذي يسمّيه مثال Ope​nAI نفسه، GPT-5.6 Terra، متاح عبر OrcaRouter بسعر Ope​nAI المعلن البالغ $2.00 لكل مليون رمز إدخال و$12.00 لكل مليون رمز إخراج، مع كشف نقطة نهاية Responses. ويتقدّم تفويض العميل خطوةً أبعد: فهو يتيح لتطبيقك تزويد الخادم الخلفي بنفسه مباشرةً، ما يعني أن النموذج الكامن خلف الصوت يمكن أن يكون أيّ نقطة نهاية تتحكّم بها. وينطبق الأمر ذاته على خانة النموذج في Agents API: فالهيكل ملك Ope​nAI، لكن النموذج بداخله خيار يبقى بيدك، ونحو 190 نموذجًا من أحد عشر مزوّدًا أعلى السلسلة تقف خلف مفتاح واحد بسعر القائمة لدى المزوّد دون أي هامش إضافي.

عمليًا، يترتب على ذلك ثلاثة أمور. يمكن إجراء اختبار A/B للواجهات الخلفية على حركة مرور حية عبر تحرير سطر واحد، وهكذا تكتشف ما إذا كان محرك استدلال رخيص جيدًا بما يكفي قبل تخصيص خط هاتف له. ويمكن أن يقع التبديل الاحتياطي (Failover) ضمن نموذج التفويض، بحيث لا تؤدي فترة سيئة في المنبع إلى إسقاط المحادثة معها. ويمكن تشغيل مهمة مقابل عدة واجهات خلفية في نداء واحد عبر لغة التوجيه DSL، أو أن تجيب عنها لجنة من النماذج دفعة واحدة عبر دمج النماذج — وهذا مفيد لحظة وجوب الوثوق بمخرجات وكيل ما لا مجرد توليدها.

ما الذي لا يوجد في أي من الإصدارين؟

• لا يوجد إدخال للصور أو الفيديو على GPT-Live-1 — لا تزال الواجهة الصوتية متعددة الوسائط التي تمتلكها أوضاع ChatGPT الأقدم دون معالجة.

• لا توجد مُخرجات مُهيكلة على طبقة الصوت، لذا يجب فرض وسائط الأدوات المُتحقَّق من مطابقتها للمخطط في نموذج الواجهة الخلفية.

• لا يوجد وصول من الطبقة المجانية إلى GPT-Live-1، وتُحتسب حدود المعدل بالجلسات المتزامنة — 25 في الطبقة 1، وترتفع إلى 500 بحلول الطبقة 5.

• لا يوجد الاحتفاظ الصفري بالبيانات ولا إقامة بيانات خارج الولايات المتحدة في Agents API beta.

• لا يوجد أي إعادة إنتاج مستقلة لأي رقم من أرقام معايير GPT-Live-1.

الرهان الذي قامت به OpenAI في 10 سبتمبر هو أن المطورين يريدون شراء منصة التشغيل واختيار العقل بشكل منفصل. أصبح النصف الأول من ذلك الآن بندًا مستقلًا. أما النصف الثاني فهو حيث سينصب الضغط التنافسي خلال الاثني عشر شهرًا المقبلة — لأن منصة تشغيل مستضافة بفتحة نموذج قابلة للتبديل لا تكون جودتها إلا بجودة النماذج التي يمكنك وضعها فيها، والآن هذا هو الجزء الوحيد من المنظومة التقنية الذي لا تتحكم فيه OpenAI وحدها.

أما شق التفويض فحكاية مختلفة — فالواجهة الخلفية التي تُسلّم طبقة الصوت العمل إليها هي استدعاء نموذج عادي، وGPT-5.6 Terra متاح عبر OrcaRouter بسعر Ope​nAI المعلن مع إتاحة نقطة نهاية Responses.