
يوم المنصة لشهر سبتمبر من OpenAI: يصل GPT-Live-1 إلى API بينما تُفتح Agents API في النسخة التجريبية
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
غادر شيئان منصة OpenAI في 10 سبتمبر 2026، وللأكثر هدوءًا منهما نطاق تأثير أكبر. GPT-Live-1 — نموذج الصوت كامل الازدواجية الذي يعمل داخل ChatGPT منذ 8 يوليو — أصبح الآن قابلًا للاستدعاء من المطورين مقابل 0.05 دولار لكل دقيقة صوت. وإلى جانبه، وبإشارة أقل بكثير في التغطية، دخل Agents API مرحلة بيتا العامة: نفس إطار التشغيل الذي يشغّل Codex، مكشوفًا كمنتج مستضاف مع بيئات اختبار معزولة مُدارة. أحدهما صوت أفضل. والآخر هو أن OpenAI تبيع الشيء الذي كان يُعد الجزء الصعب في بناء وكيل.
استُخرج كلا الرقمين من المصادر الأولية لهذا المقال: إعلان OpenAI عن Agents API، ومنشورها في مجتمع المطوّرين الذي يقدّم GPT-Live-1 في API، والوثائق التطويرية لكليهما. وعندما يأتي رقم من OpenAI بدلاً من مُقيّم خارجي، فإنه يُوسَم بذلك أدناه — وثمة رقم واحد يأتي بالفعل من جهة خارجية، مما يغيّر القصة قليلاً.

بدأت Artificial Analysis بنشر مؤشر Speech to Speech Index هذا العام، ولـ GPT-Live-1 صف فيه: 69.8%، وهو متوسط مرجّح عبر الاستدلال الكلامي، والأداء الوكيلي، وتفضيل الساحة، ونجاح المهام. وهذا يضعه في المرتبة السابعة من بين أحد عشر نموذجًا جرى تقييمها — خلف GPT-Realtime-2.1 عند 73.9%، وهو النموذج الذي يحلّ محلّه، وخلف Grok Voice Think Fast 2.0 عند 79.0%. لا تروي لوحة النتائج المستقلة وجدول المعايير الخاص بـ OpenAI القصة نفسها، وكلاهما صحيح.
ما الذي صدر، بالترتيب الذي سيغيّر به بنيتك المعمارية
• الصوت — أصبح GPT-Live-1 متاحًا في API باسم gpt-live-1، بتكلفة 0.05 دولار لكل دقيقة من الصوت، تُحسب بالثانية، مع محاسبة نموذج الاستدلال الخلفي بشكل منفصل وفقًا لأسعاره الخاصة.
• الوكلاء — إن Agents API في نسخة تجريبية عامة. تقول OpenAI إنه لا توجد رسوم إضافية على الـ API نفسها؛ أنت تدفع مقابل رموز النماذج والأدوات ووقت حاوية الاختبار المعزولة المستضافة.
• بيئات معزولة — تستضيف OpenAI الآن بيئة التنفيذ، مع إعادة استخدام البنية التحتية ذاتها للعزل التي تعتمدها Codex وChatGPT، ويمكن تهيئتها بالملفات والحزم والمهارات والإضافات.
• البيئات — إلى جانب بيئة OpenAI الرملية الخاصة، يمكن للفرق توجيه الوكلاء نحو بنيتهم التحتية الخاصة أو نحو بائعي البيئات الرملية من الأطراف الثالثة في قائمة شركاء النسخة التجريبية.
إصدار الصوت هو قصة نموذج. أما Agents API فهي قصة منصة، وقصص المنصات هي التي تعيد توجيه قاعدة الكود بهدوء.
The Agents API: وكيل واحد في POST واحد
النداء الأساسي هو POST /v1/agents/sessions، ويُرسَل مع OpenAI-Beta: agents=v1 كترويسة، وتكمن الفكرة في أن المهمة والنموذج والأدوات والبيئة كافية لاستعادة وكيل قيد التشغيل. وتغطي حزم SDK اللغات Python، TypeScript/JavaScript، Go، Java وRuby.
ما يجعلها أكثر من مجرد غلاف هو أن OpenAI تشغّل الharness بدلاً من طرحه للاستخدام. إن harness الخاص بـ AgentKit مفتوح المصدر وقابل للفحص، لكن النسخة قيد التشغيل هي نسخة OpenAI — ضغط السياق عبر الجلسات الطويلة، والبحث في الأدوات، والاستدعاء البرمجي للأدوات، ودعم MCP، والدوال المخصصة، والبحث المدمج في الويب، وتنسيق الوكلاء الفرعيين مع تزامن قابل للتكوين. تُطرح قدرات الharness المُصدَّرة بنسخ متزامنة مع إطلاق النماذج، وهذا هو الالتزام المثير للاهتمام: إذ تتحرك البنية التحتية بوتيرة النماذج نفسها.
بالنسبة لأي شخص أمضى ربع سنة في صيانة حلقة — منطق إعادة المحاولة، تقليم السياق، توجيه الأدوات، تفريع الوكلاء الفرعيين الذي يسرب الحالة دائمًا — هذا هو المنتج الفعلي. ليس استدعاء النموذج. البنية التحتية المحيطة به التي لم تعد تكتبها.
بيئات الاختبار المستضافة هي الجزء الذي تأتي معه فاتورة
تحتاج الوكلاء التي تنفّذ الشيفرة إلى مكان لتنفيذها فيه، وتقدّم النسخة التجريبية إجابة OpenAI الخاصة: بيئة معزولة مُدارة تشغّل الشيفرة، وتتعامل مع الملفات وتنتج مخرجات، وقابلة للتكوين بالحزم والمهارات والإضافات. أما المطورون الذين يملكون بالفعل بيئة تنفيذ محصّنة فليسوا مضطرين إليها — إذ تتضمن النسخة التجريبية خيار جلب البنية التحتية الخاصة بك، إلى جانب مجموعة من شركاء البيئات المعزولة المحدّدين بالاسم.
هناك تحفظان تشغيليان يجدر تدوينهما قبل أن تبني عليه. إقامة البيانات في النسخة التجريبية مقصورة على الولايات المتحدة فقط، كما أن الاحتفاظ الصفري بالبيانات (Zero Data Retention) غير مدعوم. وبالنسبة لعبء عمل خاضع للتنظيم، يحدد هذان السطران ما إذا كان هذا مساراً تجريبياً أم مساراً إنتاجياً، وهما التفصيلان اللذان غالباً ما يُكتشفان متأخراً.
GPT-Live-1 في API: الفوترة الثابتة لكل دقيقة هي التغيير الحقيقي
نموذج الصوت نفسه ليس جديدًا — فقد حلّ محل Advanced Voice Mode داخل ChatGPT في 8 يوليو — لكن الشكل التجاري هو الجديد. في إطار خط Realtime، كان الصوت يُحتسب بالتوكنات، ما يعني أن توقّع تكلفة مكالمة تطلّب نمذجة استهلاك الصوت: كم توكنًا تستهلكه ثانية صمت، وكيف يغيّر تحدّث متصل فوق صوت الوكيل طول المخرجات. أما السعر الثابت 0.05 دولار لكل دقيقة صوتية فيختزل ذلك إلى عملية ضرب. ساعة من خط مفتوح متواصل تكلف 3.00 دولارات. ومتوسط أربع دقائق على مدى ألف مكالمة يوميًا يبلغ نحو 200 دولار يوميًا.
تعمل الجلسات من نقطة نهاية Live Sessions بمعرّف نموذج واحد ودون لقطات مؤرخة لتثبيتها. توثّق الوثائق WebRTC وWebSockets والاتصال الهاتفي/SIP كمسارات اتصال، بينما يبني الدليل السريع المنشور مسار WebRTC. تحتوي الفوترة على عدّادين، وواحد فقط منهما هو الصوت: كل استدعاء استدلال مُفوَّض واستدعاء أداة وبحث على الويب يُحتسب بأسعار النموذج الخلفي العادية.
البنية هي التفويض. يتولى GPT-Live-1 إدارة المحادثة — حيث يقرر عدة مرات في الثانية ما إذا كان سيستمر في الاستماع أو يتوقف مؤقتًا أو يقاطع أو يسلم العمل — ويمرر أي شيء يحتاج إلى تفكير حقيقي عبر حد غير متزامن إلى نظام خلفي منفصل، يواصل العمل بينما تستمر المحادثة المنطوقة. تحدد الوثائق وضعين: تفويض Responses، حيث يستدعي OpenAI نموذج Responses مدعومًا نيابة عنك ويوفر سياق المحادثة، وتفويض العميل، حيث يوفر تطبيقك الخاص الواجهة الخلفية ويحتفظ بالتحكم في التنفيذ والسياق وأي النتائج تصل إلى طبقة الصوت. في مثال Responses المنشور، تلك الواجهة الخلفية هي GPT-5.6 Terra، المسمى في تفويض، كائن إلى جانب تعليماته وأدواته الخاصة. في إطلاق يوليو للمستهلكين كان GPT-5.5؛ وقد أشارت كتابات المجتمع منذ ذلك الحين إلى GPT-6 Astra.

كل رقم رئيسي في الطبقة الصوتية هو رقم OpenAI نفسها، وفي وقت كتابة هذا النص لم يُعَد إنتاجه بشكل مستقل من قبل أي جهة: 80.1% في التفاعلية على Full Duplex Bench v1.5 مقابل 45.4% لـ GPT-Realtime-2.1، وزمن استجابة لتبادل الأدوار يبلغ 0.798 ثانية مقابل 1.41 ثانية، ونجاح في استدعاء الأدوات بنسبة 87%، ومعدل اجتياز 32% في تقييم دعم صوتي مصرفي مقابل 12.4% للنموذج الذي يحل محله. هذا الزوج الأخير هو الأصدق — تحسّن كبير، ومع ذلك لا يزال نظامًا يفشل في نحو ثلثي سير عمل خاضع للتنظيم. توجد أدلة من عملاء أطراف ثالثة لكنها ضئيلة وذات مصلحة: Yelp للحجوزات الهاتفية، وEliseAI، ومنصة التعلم Speak التي أبلغت عن انخفاض يقارب 80% في المقاطعات مقارنة بمنظومتها السابقة القائمة على تبادل الأدوار.
النتيجة المستقلة أقل إطراءً، وتستحق أن توضع بجانب القائمة أعلاه بدلًا من تحتها. على مؤشر Artificial Analysis Speech to Speech Index — درجة مركبة واحدة تشمل الاستدلال الكلامي، والأداء الوكيلي، وتفضيل الساحة، ونجاح المهام — يحتل GPT-Live-1 نسبة 69.8%، دون نسبة GPT-Realtime-2.1 البالغة 73.9%، وأدنى بكثير من نسبة Grok Voice Think Fast 2.0 البالغة 79.0%. اقرأ الاثنين معًا، فيتضح شكل المنتج: بنت OpenAI أفضل آليات الحوار المتاحة ولم تبنِ أفضل وكيل صوتي، لأن الاستدلال مُفوَّض إلى نموذج يقيّمه المؤشر بشكل منفصل.

الإعلانان هما إعلان واحد
عند قراءتهما معًا، يصف الإصداران إعادة التنظيم نفسها من اتجاهين. تنقل واجهة برمجة التطبيقات Agents API الحلقة وبيئة العزل وإدارة السياق إلى منتج مستضاف. ينقل GPT-Live-1 السطح المحادثي إلى واجهة أمامية رقيقة تُفوّض تفكيرها إلى مكان آخر. في كليهما، يتوقف النموذج عن كونه الشيء الذي تبني حوله ويصبح مكونًا تختاره — وفي كليهما، يكون الاختيار سطر تهيئة بدلًا من التزام معماري.
هذا بالضبط هو الشقّ الذي تستقرّ فيه طبقة التوجيه. ولا يوفّر OrcaRouter gpt-live-1: نقطة نهاية Live Sessions حكرٌ على OpenAI وحدها، ولا نوجّه أيًّا منها. أما شقّ التفويض فحكايته مختلفة. الخادم الخلفي الذي تُسند إليه طبقة الصوت العمل يتحدّث Responses API، وذلك استدعاء نموذج عادي — والنموذج الذي يسمّيه مثال OpenAI نفسه، GPT-5.6 Terra، متاح عبر OrcaRouter بسعر OpenAI المعلن البالغ $2.00 لكل مليون رمز إدخال و$12.00 لكل مليون رمز إخراج، مع كشف نقطة نهاية Responses. ويتقدّم تفويض العميل خطوةً أبعد: فهو يتيح لتطبيقك تزويد الخادم الخلفي بنفسه مباشرةً، ما يعني أن النموذج الكامن خلف الصوت يمكن أن يكون أيّ نقطة نهاية تتحكّم بها. وينطبق الأمر ذاته على خانة النموذج في Agents API: فالهيكل ملك OpenAI، لكن النموذج بداخله خيار يبقى بيدك، ونحو 190 نموذجًا من أحد عشر مزوّدًا أعلى السلسلة تقف خلف مفتاح واحد بسعر القائمة لدى المزوّد دون أي هامش إضافي.
عمليًا، يترتب على ذلك ثلاثة أمور. يمكن إجراء اختبار A/B للواجهات الخلفية على حركة مرور حية عبر تحرير سطر واحد، وهكذا تكتشف ما إذا كان محرك استدلال رخيص جيدًا بما يكفي قبل تخصيص خط هاتف له. ويمكن أن يقع التبديل الاحتياطي (Failover) ضمن نموذج التفويض، بحيث لا تؤدي فترة سيئة في المنبع إلى إسقاط المحادثة معها. ويمكن تشغيل مهمة مقابل عدة واجهات خلفية في نداء واحد عبر لغة التوجيه DSL، أو أن تجيب عنها لجنة من النماذج دفعة واحدة عبر دمج النماذج — وهذا مفيد لحظة وجوب الوثوق بمخرجات وكيل ما لا مجرد توليدها.
ما الذي لا يوجد في أي من الإصدارين؟
• لا يوجد إدخال للصور أو الفيديو على GPT-Live-1 — لا تزال الواجهة الصوتية متعددة الوسائط التي تمتلكها أوضاع ChatGPT الأقدم دون معالجة.
• لا توجد مُخرجات مُهيكلة على طبقة الصوت، لذا يجب فرض وسائط الأدوات المُتحقَّق من مطابقتها للمخطط في نموذج الواجهة الخلفية.
• لا يوجد وصول من الطبقة المجانية إلى GPT-Live-1، وتُحتسب حدود المعدل بالجلسات المتزامنة — 25 في الطبقة 1، وترتفع إلى 500 بحلول الطبقة 5.
• لا يوجد الاحتفاظ الصفري بالبيانات ولا إقامة بيانات خارج الولايات المتحدة في Agents API beta.
• لا يوجد أي إعادة إنتاج مستقلة لأي رقم من أرقام معايير GPT-Live-1.
الرهان الذي قامت به OpenAI في 10 سبتمبر هو أن المطورين يريدون شراء منصة التشغيل واختيار العقل بشكل منفصل. أصبح النصف الأول من ذلك الآن بندًا مستقلًا. أما النصف الثاني فهو حيث سينصب الضغط التنافسي خلال الاثني عشر شهرًا المقبلة — لأن منصة تشغيل مستضافة بفتحة نموذج قابلة للتبديل لا تكون جودتها إلا بجودة النماذج التي يمكنك وضعها فيها، والآن هذا هو الجزء الوحيد من المنظومة التقنية الذي لا تتحكم فيه OpenAI وحدها.
أما شق التفويض فحكاية مختلفة — فالواجهة الخلفية التي تُسلّم طبقة الصوت العمل إليها هي استدعاء نموذج عادي، وGPT-5.6 Terra متاح عبر OrcaRouter بسعر OpenAI المعلن مع إتاحة نقطة نهاية Responses.
