
GPT-Live-1 يصل إلى واجهة API: صوت ثنائي الاتجاه بالكامل مقابل 0.05 دولار للدقيقة، دون مسار استبدال مباشر من GPT-Realtime-2.1
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
أصبح GPT-Live-1 متاحًا في API اعتبارًا من 10 سبتمبر، والرقم الذي سيعيد فعليًا تشكيل الميزانيات ليس معيار أداء — بل وحدة الفوترة. نموذج الصوت مزدوج الاتجاه بالكامل من OpenAIOpenAI تتم فوترته الآن بسعر ثابت قدره 0.05 دولار لكل دقيقة صوت، ويُحتسب بالثانية، بينما النموذج الذي يُقارَن به، GPT-Realtime-2.1، كان يُقاس برموز صوتية بسعر 32 دولارًا لكل مليون للإدخال و64 دولارًا لكل مليون للإخراج. النموذج نفسه ليس جديدًا: فقد أُطلق GPT-Live-1 داخل ChatGPT في 8 يوليو 2026، كبديل لـ Advanced Voice Mode. الجديد هو أن المطورين يمكنهم أخيرًا استدعاؤه — وأن استدعاءه لا يشبه تقريبًا تكامل Realtime الذي تملكه معظم الفرق بالفعل. توثيق OpenAIOpenAI نفسه يقرن طبقة الصوت بنظام خلفي منفصل للاستدلال، وفي مثال WebRTC المنشور يكون ذلك النظام الخلفي هو GPT-5.6 Terra.
ما الذي صدر في 10 سبتمبر، وما الذي لم يصدر
سطح واجهة برمجة التطبيقات ضيّق بحكم التصميم. يوجد معرّف نموذج واحد فقط، gpt-live-1، وهو أيضًا اللقطة الافتراضية الخاصة به — لا توجد متغيّرات مؤرَّخة لتثبيتها. توجد نقطة نهاية واحدة فقط، وهي نقطة نهاية الجلسات المباشرة (Live Sessions) عند v1/live/sessions. كل شيء آخر على منصة OpenAIOpenAI معطّل لهذا النموذج: لا Chat Completions، ولا Responses، ولا Realtime (بما في ذلك متغيّرا الترجمة والنسخ)، ولا Assistants، ولا Batch، ولا الضبط الدقيق، ولا التضمينات، ولا توليد الصور أو الفيديو، ولا نقاط نهاية الكلام الصوتي أو النسخ، ولا الإشراف.
المدخلات والمخرجات هي الصوت والنص. البث واستدعاء الدوال مدعومان؛ أما المخرجات المهيكلة والضبط الدقيق والمخرجات المتوقعة فليست مدعومة. إدخال الصور والفيديو غير مدعوم صراحةً — لذا فإن واجهة «الصوت مع الفيديو» التي لمّح إليها OpenAI ليست جزءًا من هذا الإصدار. ولا يمكن للمستوى المجاني استدعاؤه على الإطلاق، وتُقاس حدود المعدل بجلسات متزامنة بدلًا من الطلبات في الدقيقة: 25 على المستوى 1، لترتفع إلى 50 و200 و300 و500 عبر المستويات من 2 إلى 5.

هذا التأطير القائم على التزامن هو أول مؤشر على أن هذا ليس بديلاً جاهزًا للتركيب. إن حدود المعدل المعبَّر عنها بالمحادثات الحية المتزامنة تخبرك بما يتوقع OpenAIOpenAI أن يكون وحدة القياس: خط هاتف، وليس طلبًا.
تغيير التسعير هو القصة الأكثر هدوءًا والأكبر
الفوترة الثابتة لكل دقيقة تغيير جوهري. في ظل القياس بالتوكنات، كان عليك نمذجة استهلاك الصوت — كم من التوكنات تكلّفها ثانية واحدة من الصمت، وكيف يغيّر متصل يواصل الكلام فوق الوكيل طول المخرجات — قبل أن تتمكن من توقع مكالمة واحدة. عند 0.05 دولار للدقيقة، تنهار الحسابات إلى عملية ضرب:
• مكالمة دعم مدتها 5 دقائق — 0.25 دولار من وقت الصوت
• مكالمة مدتها 10 دقائق — 0.50 دولار
• بمتوسط 4 دقائق عبر 1,000 مكالمة يوميًا — 200 دولار يوميًا، أي نحو 6,000 دولار شهريًا
• ساعة واحدة من الخط المفتوح المتواصل — 3.00 دولار
ثلاثة تفاصيل تزيد ذلك وضوحًا. أولًا، لا تُقرَّب المدة إلى أعلى نحو الدقيقة الكاملة التالية، لذا تكلّف مكالمة مدتها 40 ثانية نحو 3.3 سنتات بدلًا من خمسة سنتات كاملة. ثانيًا، تُحتسب تهيئة الجلسة 15 ثانية من مدة الصوت مقدَّمًا — لكنها تُخصم من رسوم المدة اللاحقة، ولا تُضاف فوقها، لذا فإن مكالمة أقصر من 15 ثانية تظل عند سعر 15 ثانية. ثالثًا، الصوت ليس سوى نصف الفاتورة. إذ يُفوتر نموذج الاستدلال الخلفي، واستدعاءات أدواته، وأي بحث على الويب بشكل منفصل وفق الأسعار المعتادة لذلك النموذج، ما يعني أن "نموذج صوت رخيص" قد ينتج مع ذلك مكالمة باهظة إذا وجّهت التفويض إلى نموذج استدلالي متطور وتركته يبحث في كل دور.
هذا الهيكل ذو المترين هو حيث يتوقف التوجيه عن كونه رفاهية. على OrcaRouter، الجزء الخلفي من جلسة GPT-Live-1 ليس سوى استدعاء نموذج آخر — نحو 190 نموذجًا من أحد عشر مزوّدًا في المنبع خلف مفتاح واحد، بسعر قائمة المزوّد الممرَّر كما هو دون أي هامش ربح، ومع تجاوز فشل تلقائي إذا وقع خطأ في الخلف الذي اخترته أو انتهت مهلته. لا يمكنك توجيه طبقة الصوت نفسها؛ فنقطة نهاية Live Sessions مقتصرة على OpenAIOpenAI وحدها. يمكنك بالتأكيد توجيه كل ما تحيل إليه طبقة الصوت، وهو النصف الذي يتوسّع بحسب مدى عمق تفكير المتصلين لديك.
WebRTC فقط — لماذا لن يُنقل كود Realtime الخاص بك
هذه هي التكلفة العملية للانتقال، ومعظم تغطية الإطلاق تتجاهلها. تعمل جلسات GPT-Live-1 عبر WebRTC، وليس عبر نقل WebSocket الذي بُنيت عليه الكثير من تكاملات Realtime الحالية. إن اختبار المسار الأقدم باستخدام معرّف نموذج GPT-Live يعيد خطأً يقول لك بكلمات صريحة إن الجلسات تتطلب WebRTC.
المصافحة، وفقًا لدليل WebRTC الخاص بـ OpenAIOpenAI: يفتح متصفحك RTCPeerConnection، ويُرفق مسارات الميكروفون، ويفتح قناة بيانات ويسجّل المستمعين قبل تقديم العرض، ويضبط الوصف المحلي، وينتظر جمع ICE، ويرسل العرض إلى خادمك الخاص. ثم يستدعي خادمك POST /v1/live/sessions مع إعدادات الجلسة بالإضافة إلى transport: { type: "webrtc", sdp: ... }. عند النجاح، تُعيد استجابة HTTP 201 تحمل session.id وtransport.sdp، الذي يطبقه المتصفح كوصف بعيد. تنتقل الوسائط عبر المسارات المتفاوض عليها؛ وقناة البيانات — التسمية oai-events — تحمل النصوص المنسوخة وتحديثات الجلسة والمهام المفوّضة. لإنهاء المكالمة ترسل session.close وتستمر في القراءة حتى session.closed يصل.
فخّان تقنيان يستحقان أن يُلصقا على الشاشة. استدعاء HTTP نفسه يبدأ الجلسة، لذا يجب ألا ترسل أيضاً session.start على قناة البيانات. ويجب ألا تضيف صوت الإدخال أو تنتظر دلتات صوت الإخراج عبر تلك القناة — اترك audio.format خارج الإعدادات ودع SDP يتولى ذلك. تحدّ أمثلة الخادم جسم الطلب عند 64 كيلوبايت، وتضع مهلة 10 ثوانٍ لتجميع ICE و15 ثانية لإنهاء الجلسة.
لا شيء من ذلك صعب. كلّه كود جديد. إذا كان منتجك وكيلاً زمنياً قائماً على الأدوار، فإن الانتقال إلى GPT-Live-1 يُعدّ إعادة كتابة كاملة لطبقة النقل وإعادة كتابة كاملة لطبقة التفويض، وليس مجرد تبديل معرّف النموذج — وهو ما يستحق أن يُدرَج في الميزانية كسبرنت بدل أن يُخصَّص له أصيل يوم واحد.
اختبارات الأداء، ومن أجرى كل واحد منها
كل رقم أدناه هو من OpenAIOpenAI نفسها، نُشِر مع إصدار API ولم يُعِد إنتاجه بشكل مستقل أي شخص وقت كتابة هذه السطور. هذا التحذير مهم هنا أكثر من المعتاد، لأن الفروق كبيرة بما يكفي لتُغري باقتباسها كحقيقة مسلّم بها.

• تفاعلية الازدواج الكامل — GPT-Live-1 بنسبة 80.1% مقابل 45.4% لـ GPT-Realtime-2.1
• زمن استجابة تناوب الأدوار — 0.8 ثانية مقابل 1.4 ثانية
• دقة استدعاء الأدوات — 87% مقابل 60%
• المعيار المرجعي للدعم الصوتي في القطاع المصرفي، معدل النجاح — 32% مقابل 12.4%
اقرأ السطر الأخير مرتين. معدل نجاح 32% تحسن كبير مقارنة بـ12.4%، ولا يزال يعني أن النظام فشل في نحو ثلثي المهام في ذلك التقييم. أما قفزتا التفاعلية واستدعاء الأدوات فهما اللتان تصفان منتجًا مختلفًا حقًا؛ ورقم الخدمات المصرفية هو الرقم الصادق بشأن المسافة التي لا تزال تفصل وكلاء الصوت عن التعامل مع سير عمل خاضع للتنظيم دون إشراف.
الأدلة المستمدة من العملاء أضعف من جدول المعايير وتشير في الاتجاه نفسه. تستخدم Yelp نموذج GPT-Live-1 لإجراء الحجوزات الهاتفية، مع الاستشهاد بالرئيس التنفيذي للتقنية أليكس ليفي بشأن تحسّن التعامل مع المكالمات. وأبلغت منصة تعلّم اللغات Speak عن انخفاض يقارب 80% في المقاطعات مقارنةً بنظامها السابق القائم على الأدوار — وهو رقم مُبلَّغ عنه ذاتياً من شركة لها مصلحة في النتيجة، ولا يزال أكثر أرقام النشر ملموسية المتاحة.
طبقة الصوت هي واجهة أمامية؛ وأنت تختار العقل.
الرهان المعماري هو التفويض، وهو الجزء من هذا الإصدار الذي تنسجم فيه طبقة التوجيه بشكل طبيعي. لا يقوم GPT-Live-1 بالتفكير العميق. عندما يسأل المتصل عن شيء يتطلب استدلالًا أو استرجاعًا أو أداة، يسلّم النموذج المهمة عبر حدود غير متزامنة إلى خادم خلفي منفصل يواصل العمل بينما تستمر المحادثة المنطوقة، ثم يعيد إدماج الإجابة عند جهوزيتها.
الإعداد صريح، ويستحق أن يُقرأ مثال الوثائق بعناية. إلى جانب model: "gpt-live-1" والتعليمات، تحمل الجلسة كائن delegation من النوع responses، الذي تُسمّي كتلة responses الداخلية فيه نموذج الواجهة الخلفية، وتعليماته الخاصة، وأدواته — ويستخدم المثال web_search — وtool_choice. وفي مثال WebRTC المنشور من OpenAI، يكون نموذج الواجهة الخلفية هذا هو GPT-5.6 Terra.

هذا هو الادعاء الحقيقي للتصميم: استبدل الواجهة الخلفية، فتصبح تجربة الصوت أذكى دون إعادة تدريب نموذج الكلام. يعني ذلك أيضًا أن الواجهة الخلفية للتفويض قابلة للنقل بطريقة لا تكون عليها طبقة الصوت. لا يحمل OrcaRouter النموذج gpt-live-1 — فنقطة نهاية Live Sessions مخصّصة لـ OpenAI وحدها، ونحن لا نوجّه أيًا منها. لكن نصف التفويض يتحدث واجهة Responses API، وهذا النصف متروك لك بالكامل لتختاره. GPT-5.6 Terra متاح مباشرة على OrcaRouter بسعر OpenAIOpenAI المعلن — 2.00 دولار لكل مليون توكن إدخال و12.00 دولارًا لكل مليون توكن إخراج، مع إتاحة نقطة نهاية Responses — بحيث يكون النموذج نفسه في مثال OpenAIOpenAI نفسه على بعد استدعاء واحد دون عقد ثانٍ أو SDK.
عمليًا، يحوّل ذلك اختيار الواجهة الخلفية إلى تهيئة. يمكنك إجراء مقارنة A/B بين محرّك استدلال رخيص وآخر متقدم على حركة مكالمات حية بتعديل سطر واحد ومراقبة فاتورة كل مكالمة، أو تضع نموذج التفويض خلف تجاوز فشل تلقائي بحيث لا تؤدي أمسية سيئة عند المزوّد الأعلى إلى إسقاط خط هاتفك معها. تبقى طبقة الصوت التي تدفع مقابلها 0.05 دولار في الدقيقة في مكانها؛ وكل ما تفوّضه يمرّ عبر مفتاح واحد إلى نحو 190 نموذجًا من أحد عشر مزوّدًا في الطبقة الأعلى، بسعر قائمة المزوّد وبدون أي هامش ربح.
ما الذي لا يزال مفقودًا؟
• لا يوجد إدخال للصور أو الفيديو — الصور الثابتة ومشاركة الشاشة غير موجودة في هذا الإصدار، لذا تظل واجهة الصوت متعددة الوسائط التي ما زالت أوضاع ChatGPT الأقدم تحتفظ بها دون معالجة
• لا مخرجات مهيكلة — إذا كان وكيلك يحتاج إلى معطيات أدوات مُتحقَّق منها وفق مخطط، فيجب أن يقع هذا التحقق في النموذج الخلفي لديك، لا في طبقة الصوت
• لا يتوفر وصول إلى الطبقة المجانية ولا ضبط دقيق — تبدأ التكلفة والتخصيص معًا من الطبقات المدفوعة
• لا يوجد تقييم مستقل لأي رقم رئيسي — كل رقم أعلاه مصدره المورّد
• حدّ أقصى للتزامن يبلغ 25 جلسة متزامنة على المستوى الأول — سخيّ بالنسبة لمشروع تجريبي، وضيّق بالنسبة لمركز اتصال في يومه الأول
من الذي يجب أن يتحرك، ومن الذي يجب أن ينتظر؟
تحرّك الآن إذا كنت تبني أنظمة اتصالات هاتفية — خطوط حجز، وحجز مواعيد، ودعم من الخط الأول — ومكدّسك الحالي هو سلسلة ASR-to-LLM-to-TTS الكلاسيكية. فزمن الاستجابة والتعامل مع المقاطعات هما بالضبط ما يفقده ذلك المسار، وسعر الدقيقة قابل للتنبؤ بما يكفي لوضعه في جدول بيانات، كما أن وثائق OpenAIOpenAI الخاصة تتضمن الآن مثال خادم على شكل Twilio يمكن النسخ منه. تحرّك الآن أيضًا إذا كنت تعتمد بالفعل على نموذج Realtime وكان منتجك حواريًا حقًا وليس قائمًا على الأدوار، لأن التعامل مع المقاطعات هو الجزء الذي كان GPT-Realtime-2.1 الأسوأ فيه.
انتظر إذا كان تكاملك قائمًا على الأدوار ويعمل. إعادة كتابة طبقة النقل عمل حقيقي، ونقطة النهاية لا تدعم أي شيء آخر، ولا يوجد مسار ترحيل يحافظ على كود WebSocket الحالي لديك. انتظر أيضًا إذا كانت حالة الاستخدام لديك تعتمد على مخرجات أدوات مهيكلة أو إدخال فيديو، وكلاهما غائب هنا.
ما يجب مراقبته خلال الأسابيع القليلة المقبلة: أول إعادة إنتاج مستقلة لرقم التفاعلية البالغ 80.1%، وما إذا كان سعر $0.05 تمهيديًا، وما إذا كان إصدار أصغر من GPT-Live-1 mini يصل إلى API بالطريقة التي وصل بها إلى جانب المستهلك، وما إذا كان إدخال الصور والشاشة يسدّ الفجوة. وإلى أن يُجري مختبر خارجي ذلك التقييم، فإن الملخص الصادق هو أنّ هذا هو أكثر نموذج صوتي قدرةً أطلقه أي أحد للمطوّرين، مع أنّ إثبات هذا الادعاء كتبه الأشخاص الذين يبيعونه.
