بطاقة العنوان الرئيسية لـ"GPT-Live-1 مقابل Inworld Realtime TTS-2"، بعنوان فرعي "التوليف أصبح رخيصًا؛ أما الاستماع فلا يزال مكلفًا"، وتحمل ثلاث بطاقات نصها: "Inworld Realtime TTS-2: 25 دولارًا لكل مليون حرف، مع تسعير متدرج يصل إلى 12.50 دولارًا"، و"Inworld Realtime TTS-2 Flash: 15 دولارًا لكل مليون حرف، مع تسعير متدرج يصل إلى 7 دولارات"، و"GPT-Live-1: 0.05 دولار لكل دقيقة صوتية، إضافةً إلى المنطق الكامن وراء ذلك"، فوق شريط تذييل نصه: "أسعار Inworld منشورة من المورّد، سبتمبر 2026؛ أسعار GPT-Live-1 وفقًا لوثائق OpenAI." وشعار OrcaRouter مُدمج في الزاوية السفلية اليمنى.
Guides & Insights

GPT-Live-1 مقابل Inworld Realtime TTS-2: حرب أسعار على الأصوات، وعلاوة سعرية على الاستماع

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

حقّق Inworld Realtime TTS-2 التوفر العام مصحوبًا بشيء كان سوق الأصوات يفتقده: بطاقة أسعار منشورة. يبلغ سعر الطراز الرائد 25 دولارًا لكل مليون حرف عند الطلب، بينما يبلغ سعر نظيره الأسرع Inworld Realtime TTS-2 Flash مبلغ 15 دولارًا، وكلاهما ينخفض عبر فئات الحجم إلى 12.50 دولارًا و7 دولارات. وباحتلّته Elo 1,244 والمركز الثاني في ساحة الكلام لدى Artificial Analysis، فإن ذلك يجعل الطراز الرائد بنحو نصف سعر المتصدر الحالي في الساحة، وواحدًا من أرخص الطرق لشراء صوت ضمن أفضل خمسة. أما GPT-Live-1 فهو الطراز الآخر في هذه المقارنة والعرض المعاكس — 0.05 دولار لكل دقيقة صوت، من دون أي حروف، ومن دون أي سبيل لشرائه إلا بشراء الاستماع وتناوب الأدوار ومعالجة المقاطعات المصاحبة له.

الشيء المثير للاهتمام عند مقارنتهما هو أن فجوة السعر تبدو هائلة ثم تتلاشى في معظمها. Synthesis في حرب أسعار. Conversation ليست كذلك.

ما الذي أطلقته Inworld فعلاً

بدأت سلسلة TTS-2 كمعاينة بحثية في مايو 2026 بادعاء محدد: أن هذا نموذج لا يولّد الكلام بمعزل عن السياق. فهو يتلقى الأدوار السابقة في المحادثة كمدخل صوتي، ويفكر في النبرة والإيقاع، ويعدّل كيفية استجابته. هذا التموضع — الوعي الحواري بدلًا من صوت أنقى — هو ما ميّزه عن محركات السرد التي هيمنت على تحويل النص إلى كلام حتى عام 2025.

أدّت الإتاحة العامة إلى تحويل المعاينة إلى عائلة، وأرفقت بها قائمة أسعار. يمثّل Flash خيار الإنتاجية، إذ تذكر Inworld نحو 20 مللي ثانية لزمن الوصول إلى أول بايت من جهة الخادم عند المئين 90، مقابل 100 مللي ثانية للطراز الرائد، وزمن وسيط دون 200 مللي ثانية حتى أول صوت. هذه أرقام المورّد من وثائق Inworld نفسها؛ أما القياس الوحيد من طرف ثالث المتداول، من Coval، فيضع Flash عند نحو 25 مللي ثانية والطراز الرائد في المئات الدنيا. ولم يخضع أي منهما لتدقيق مستقل من طرف إلى طرف.

الميزة الأكثر استحقاقًا للملاحظة لا علاقة لها بزمن الاستجابة. أضافت Inworld وضعًا حرفيًا بحيث تُقرأ أرقام الطلبات ورموز التأكيد والعناوين والأرقام التسلسلية حرفًا بحرف بدلًا من تطبيعها إلى شيء يبدو طبيعيًا لكنه خاطئ. بالنسبة لوكيل صوتي أجرى للتو حجزًا، هذا الوسم الواحد هو الفرق بين منتج يعمل وعرض تجريبي يُحوَّل إلى موظف بشري.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

بُعدًا بُعدًا

• النوع — GPT-Live-1: تحويل الكلام إلى كلام كامل الازدواجية في نموذج واحد مقابل Inworld Realtime TTS-2: نموذج تحويل النص إلى كلام، مع توفّر الازدواجية بشكل منفصل عبر Inworld Realtime API

• سعر الوحدة — GPT-Live-1: 0.05 دولار لكل دقيقة صوتية، تُحسب لكل ثانية، وتُحتسب الواجهة الخلفية للاستدلال بشكل منفصل مقابل Inworld Realtime TTS-2: 25 دولارًا لكل مليون حرف عند الطلب، و20 دولارًا في باقة Creator و12.50 دولارًا في الفئة الأعلى، مع Flash بسعر 15 و10 و7 دولارات

• الجودة المستقلة — GPT-Live-1: 70.3% على مؤشر Speech to Speech، بالمركز السادس مناصفةً من بين أربعة عشر مقابل Inworld Realtime TTS-2: إيلو 1,244 من 1,091 عيّنة والثاني في ساحة Artificial Analysis Provider Voice، مع Flash عند إيلو 1,211 من 1,626 عيّنة والسادس

• الانقطاع — GPT-Live-1: أصلي، يُحدَّد داخل النموذج عدة مرات في الثانية، مقابل Inworld Realtime TTS-2: ليس خاصية من خصائص نموذج TTS؛ إذ تدعم Inworld Realtime API ميزة barge-in بزمن استجابة للانقطاع يبلغ نحو 100 مللي ثانية، عبر مقبس واحد يتحدث بروتوكول Open​AI Realtime

• الكمون — GPT-Live-1: كمون تبادل الأدوار 0.798 ثانية في اختبارات OpenAI الخاصة، ولم يُنشر أي زمن للوصول إلى الصوت الأول، مقابل Inworld Realtime TTS-2: 100 ميلي ثانية من جانب الخادم عند المئين التسعين، وFlash عند 20، مع وسيط أقل من ثانية واحدة حتى أول مقطع صوتي عبر خط أنابيب Realtime API الكامل

• اللغات — GPT-Live-1: اللغات الرئيسية مخدومة جيدًا، لكن الأداء غير متساوٍ خارجها، مقابل Inworld Realtime TTS-2: أكثر من 200 لغة ومنطقة محلية، مع 15 عند جودة المستوى الأول و79 أخرى عند المستوى الثاني، وهوية صوتية واحدة محفوظة عبر جميعها

• الأصوات والاستنساخ — GPT-Live-1: اثنا عشر إعدادًا مسبقًا، بلا استنساخ مقابل Inworld Realtime TTS-2: 282 صوتًا مدمجًا، استنساخ فوري بنمط صفري من 5 إلى 15 ثانية من صوت مُصرَّح به، واستنساخ احترافي وتحكم كامل في الأداء على الطراز الرائد فقط

• النشر — GPT-Live-1: مستضاف فقط، نقطة نهاية واحدة، لا طبقة مجانية، التزامن محدود من 25 إلى 500 جلسة، مقابل Inworld Realtime TTS-2: واجهة برمجة تطبيقات مستضافة بالإضافة إلى حاوية محلية مقيّدة الوصول تتطلب H100، وطبقة مجانية عند الطلب تتضمن ما يصل إلى نحو 70 دقيقة من التخليق الصوتي

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

سؤال الدوبلكس، مُجاب عنه بدقة

سيكون من السهل كتابة هذه المقارنة على أنها «أحدهما يستمع، والآخر يتحدث فقط»، لكنها ستكون خاطئة على نحو مهم. نماذج تحويل النص إلى كلام من Inworld هي نصّ يدخل وصوت يخرج. لكن Inworld تبيع أيضاً Realtime API يعمل عبر اتصال WebSocket أو WebRTC أو SIP واحد، وهو مزدوج الاتجاه بالمعنى الذي يهم المُنشئ: فهو يعتمد كشف النشاط الصوتي الدلالي مع إعداد قابل للتعديل لمدى التهيّؤ، ويدعم التحكم اليدوي في تبديل الأدوار، ويقاطع عند التدخل خلال نحو 100 مللي ثانية. وهو متوافق بروتوكولياً مع واجهة Open​AI Realtime، ما يجعل الترحيل تمريناً في الإعداد بدلاً من إعادة كتابة.

إن ما ليست عليه واجهة Inworld's Realtime API هو نموذج أصلي للتحويل المباشر من الكلام إلى الكلام. إنها سلسلة متتالية — نموذج للتعرف على الكلام قابل للتبديل، ونموذج لغوي من اختيارك، ومُركِّب صوتي — تُنسَّق داخل اتصال واحد. هذا خيار معماري مشروع، وهو الخيار نفسه الذي تتخذه معظم وكلاء الصوت في بيئات الإنتاج. إنه ببساطة خيار مختلف عن GPT-Live-1، حيث يقرر نموذج واحد متى يتنازل عن الدور.

يظهر الفرق العملي عندما يقاطع المتصل في منتصف الجملة. في نموذج التتابع، تُكتشف المقاطعة، ويُلغى التوليد، ويبدأ دور جديد — تسلسل يعمل جيدًا ويكلفك رحلة ذهاب وعودة. في النموذج من طرف إلى طرف، كان القرار يُتخذ باستمرار بالفعل. الأول نظام يستجيب بسرعة. والثاني نظام لم يتوقف عن الاستماع أبدًا.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

إجراء الحسابات، لأن الوحدات تخفي الإجابة

يُقال الكلام بمعدل 150 كلمة في الدقيقة تقريبًا، ويبلغ متوسط اللغة الإنجليزية نحو خمسة أحرف ونصف لكل كلمة، لذا فإن دقيقة من الناتج المنطوق تعادل حوالي 800 إلى 900 حرف. عند 25 دولارًا لكل مليون، ينتج Inworld Realtime TTS-2 دقيقة من الكلام مقابل نحو سنتين. وعند سعر Flash البالغ 15 دولارًا، تكون التكلفة أقل من سنت ونصف.

مقابل 0.05 دولار لكل دقيقة صوتية من GPT-Live-1، يبدو ذلك هزيمة ساحقة — حتى تحتسب تكلفة بقية ما يفعله GPT-Live-1. لا تزال واجهة Inworld Realtime API بحاجة إلى التعرّف على الكلام ونموذج لغوي، وكلاهما يُفوتَر بشكل منفصل، وكلاهما يحمل زمن استجابة خاصًا به. أضف ذلك، وستتجاوز التكلفة لكل دقيقة للنظام المتسلسل خمسة سنتات لأي مكالمة تتضمن سؤالًا حقيقيًا. العلاوة السعرية للنموذج من طرف إلى طرف ليست مقابل الصوت. بل هي مقابل تبادل الأدوار، وهي تقريبًا تكلفة مرحلة التعرّف على الكلام التي لم تعد تشتريها.

حيث يتفوق النظام المتتابع بشكل حاسم هو الحجم الكبير دون محادثة. مكالمات الإشعارات، وتأكيدات التسليم، وتذكيرات المواعيد، والرد الصوتي التفاعلي المُعدّ مسبقًا — أي حالة يكون فيها النص معروفًا قبل بدء المكالمة ولن يقاطعها أحد. هناك، يكون التسعير حسب الأحرف بمعدل 7 إلى 15 دولارًا لكل مليون أرخص ببساطة من التسعير حسب الدقيقة للاتصال المزدوج، ودفع مقابل تناوب أدوار لا تستخدمه أبدًا يعد هدرًا.

هناك أيضًا مسار وسط تُخفيه صيغة النموذجين. إذا كنت تُجمّع تتابعًا على أي حال، فلا يلزم أن تأتي طبقة الكلام من مورّد صوتي متخصص: فنماذج ‌TTS الخاصة بـ Open​AI ونماذج المعاينة Gem​ini TTS من Goog​le هي نقاط نهاية API عادية، وهي مُوجَّهة عبر التوجيه. ونحو 190 نموذجًا من أحد عشر مزوّدًا من المنبع تقف خلف مفتاح OrcaRouter واحد بسعر المزوّد المعلن دون أي هامش — لذا يمكن لنموذج تخليق أن يحل في الكتالوج نفسه، وعلى المفتاح نفسه والفاتورة نفسها، إلى جانب نموذج الاستدلال الذي يغذّيه، مع تحويل تلقائي عند الفشل إذا تدهورت إحدى نقاط النهاية أثناء النشر. وهي المرحلة الأقل بريقًا في حزمة الصوت والأسهل في التوحيد. ولا يتاح لا Realtime TTS-2 من Inworld ولا نقطة نهاية Live Sessions في GPT-Live-1 بهذه الطريقة؛ فهذان يخصّان مورّديهما.

أي واحدة تختار؟

اختر Inworld Realtime TTS-2 إذا كان الحجم هو الهدف وكانت المحادثة مكتوبة مسبقًا. وكلاء ذوو إنتاجية عالية، وإشعارات، ومنتجات متعددة اللغات حيث تهم 200 لغة/منطقة وهوية صوتية واحدة محفوظة، أو أي نشر يحتاج إلى حاوية محلية. تحصل على صوت ضمن أفضل صوتين في الساحة بسعر يقارب نصف سعر المتصدر، وطبقة مجانية للنماذج الأولية، واستنساخ صوت لا يقدمه GPT-Live-1 إطلاقًا، وواجهة Realtime API تتعامل مع المقاطعة بكفاءة في نمط التتالي الذي تشغله على الأرجح بالفعل.

اختر GPT-Live-1 إذا كانت المقاطعة هي المنتج نفسه. المكالمات التي تخرج عن السيناريو، والمتصلون الذين يقاطعون الوكيل، وسير العمل حيث يكون تناوب الأدوار هو الفرق بين محادثة وقائمة. تدفع سعرًا بالدقيقة لا ينخفض عندما يصبح الكلام رخيصًا، وتتخلى عن الاستنساخ و200 لغة، وتستعيد الوصلات.

حرب الأسعار في تخليق الصوت حقيقية، وهي خبر سار لأي شخص يبني وكيلًا صوتيًا — فالصوت ضمن أفضل خمسة أصوات يكلّف الآن خُمس ما كان يكلّفه قبل ثمانية عشر شهرًا. لكنها لا تحسم هذه المقارنة، لأن ما يتقاضى GPT-Live-1 ثمنًا مقابله ليس ما تخفّض Inworld سعره.