
GPT-Live-1 مقابل Inworld Realtime TTS-2: حرب أسعار على الأصوات، وعلاوة سعرية على الاستماع
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
حقّق Inworld Realtime TTS-2 التوفر العام مصحوبًا بشيء كان سوق الأصوات يفتقده: بطاقة أسعار منشورة. يبلغ سعر الطراز الرائد 25 دولارًا لكل مليون حرف عند الطلب، بينما يبلغ سعر نظيره الأسرع Inworld Realtime TTS-2 Flash مبلغ 15 دولارًا، وكلاهما ينخفض عبر فئات الحجم إلى 12.50 دولارًا و7 دولارات. وباحتلّته Elo 1,244 والمركز الثاني في ساحة الكلام لدى Artificial Analysis، فإن ذلك يجعل الطراز الرائد بنحو نصف سعر المتصدر الحالي في الساحة، وواحدًا من أرخص الطرق لشراء صوت ضمن أفضل خمسة. أما GPT-Live-1 فهو الطراز الآخر في هذه المقارنة والعرض المعاكس — 0.05 دولار لكل دقيقة صوت، من دون أي حروف، ومن دون أي سبيل لشرائه إلا بشراء الاستماع وتناوب الأدوار ومعالجة المقاطعات المصاحبة له.
الشيء المثير للاهتمام عند مقارنتهما هو أن فجوة السعر تبدو هائلة ثم تتلاشى في معظمها. Synthesis في حرب أسعار. Conversation ليست كذلك.
ما الذي أطلقته Inworld فعلاً
بدأت سلسلة TTS-2 كمعاينة بحثية في مايو 2026 بادعاء محدد: أن هذا نموذج لا يولّد الكلام بمعزل عن السياق. فهو يتلقى الأدوار السابقة في المحادثة كمدخل صوتي، ويفكر في النبرة والإيقاع، ويعدّل كيفية استجابته. هذا التموضع — الوعي الحواري بدلًا من صوت أنقى — هو ما ميّزه عن محركات السرد التي هيمنت على تحويل النص إلى كلام حتى عام 2025.
أدّت الإتاحة العامة إلى تحويل المعاينة إلى عائلة، وأرفقت بها قائمة أسعار. يمثّل Flash خيار الإنتاجية، إذ تذكر Inworld نحو 20 مللي ثانية لزمن الوصول إلى أول بايت من جهة الخادم عند المئين 90، مقابل 100 مللي ثانية للطراز الرائد، وزمن وسيط دون 200 مللي ثانية حتى أول صوت. هذه أرقام المورّد من وثائق Inworld نفسها؛ أما القياس الوحيد من طرف ثالث المتداول، من Coval، فيضع Flash عند نحو 25 مللي ثانية والطراز الرائد في المئات الدنيا. ولم يخضع أي منهما لتدقيق مستقل من طرف إلى طرف.
الميزة الأكثر استحقاقًا للملاحظة لا علاقة لها بزمن الاستجابة. أضافت Inworld وضعًا حرفيًا بحيث تُقرأ أرقام الطلبات ورموز التأكيد والعناوين والأرقام التسلسلية حرفًا بحرف بدلًا من تطبيعها إلى شيء يبدو طبيعيًا لكنه خاطئ. بالنسبة لوكيل صوتي أجرى للتو حجزًا، هذا الوسم الواحد هو الفرق بين منتج يعمل وعرض تجريبي يُحوَّل إلى موظف بشري.

بُعدًا بُعدًا
• النوع — GPT-Live-1: تحويل الكلام إلى كلام كامل الازدواجية في نموذج واحد مقابل Inworld Realtime TTS-2: نموذج تحويل النص إلى كلام، مع توفّر الازدواجية بشكل منفصل عبر Inworld Realtime API
• سعر الوحدة — GPT-Live-1: 0.05 دولار لكل دقيقة صوتية، تُحسب لكل ثانية، وتُحتسب الواجهة الخلفية للاستدلال بشكل منفصل مقابل Inworld Realtime TTS-2: 25 دولارًا لكل مليون حرف عند الطلب، و20 دولارًا في باقة Creator و12.50 دولارًا في الفئة الأعلى، مع Flash بسعر 15 و10 و7 دولارات
• الجودة المستقلة — GPT-Live-1: 70.3% على مؤشر Speech to Speech، بالمركز السادس مناصفةً من بين أربعة عشر مقابل Inworld Realtime TTS-2: إيلو 1,244 من 1,091 عيّنة والثاني في ساحة Artificial Analysis Provider Voice، مع Flash عند إيلو 1,211 من 1,626 عيّنة والسادس
• الانقطاع — GPT-Live-1: أصلي، يُحدَّد داخل النموذج عدة مرات في الثانية، مقابل Inworld Realtime TTS-2: ليس خاصية من خصائص نموذج TTS؛ إذ تدعم Inworld Realtime API ميزة barge-in بزمن استجابة للانقطاع يبلغ نحو 100 مللي ثانية، عبر مقبس واحد يتحدث بروتوكول OpenAI Realtime
• الكمون — GPT-Live-1: كمون تبادل الأدوار 0.798 ثانية في اختبارات OpenAI الخاصة، ولم يُنشر أي زمن للوصول إلى الصوت الأول، مقابل Inworld Realtime TTS-2: 100 ميلي ثانية من جانب الخادم عند المئين التسعين، وFlash عند 20، مع وسيط أقل من ثانية واحدة حتى أول مقطع صوتي عبر خط أنابيب Realtime API الكامل
• اللغات — GPT-Live-1: اللغات الرئيسية مخدومة جيدًا، لكن الأداء غير متساوٍ خارجها، مقابل Inworld Realtime TTS-2: أكثر من 200 لغة ومنطقة محلية، مع 15 عند جودة المستوى الأول و79 أخرى عند المستوى الثاني، وهوية صوتية واحدة محفوظة عبر جميعها
• الأصوات والاستنساخ — GPT-Live-1: اثنا عشر إعدادًا مسبقًا، بلا استنساخ مقابل Inworld Realtime TTS-2: 282 صوتًا مدمجًا، استنساخ فوري بنمط صفري من 5 إلى 15 ثانية من صوت مُصرَّح به، واستنساخ احترافي وتحكم كامل في الأداء على الطراز الرائد فقط
• النشر — GPT-Live-1: مستضاف فقط، نقطة نهاية واحدة، لا طبقة مجانية، التزامن محدود من 25 إلى 500 جلسة، مقابل Inworld Realtime TTS-2: واجهة برمجة تطبيقات مستضافة بالإضافة إلى حاوية محلية مقيّدة الوصول تتطلب H100، وطبقة مجانية عند الطلب تتضمن ما يصل إلى نحو 70 دقيقة من التخليق الصوتي

سؤال الدوبلكس، مُجاب عنه بدقة
سيكون من السهل كتابة هذه المقارنة على أنها «أحدهما يستمع، والآخر يتحدث فقط»، لكنها ستكون خاطئة على نحو مهم. نماذج تحويل النص إلى كلام من Inworld هي نصّ يدخل وصوت يخرج. لكن Inworld تبيع أيضاً Realtime API يعمل عبر اتصال WebSocket أو WebRTC أو SIP واحد، وهو مزدوج الاتجاه بالمعنى الذي يهم المُنشئ: فهو يعتمد كشف النشاط الصوتي الدلالي مع إعداد قابل للتعديل لمدى التهيّؤ، ويدعم التحكم اليدوي في تبديل الأدوار، ويقاطع عند التدخل خلال نحو 100 مللي ثانية. وهو متوافق بروتوكولياً مع واجهة OpenAI Realtime، ما يجعل الترحيل تمريناً في الإعداد بدلاً من إعادة كتابة.
إن ما ليست عليه واجهة Inworld's Realtime API هو نموذج أصلي للتحويل المباشر من الكلام إلى الكلام. إنها سلسلة متتالية — نموذج للتعرف على الكلام قابل للتبديل، ونموذج لغوي من اختيارك، ومُركِّب صوتي — تُنسَّق داخل اتصال واحد. هذا خيار معماري مشروع، وهو الخيار نفسه الذي تتخذه معظم وكلاء الصوت في بيئات الإنتاج. إنه ببساطة خيار مختلف عن GPT-Live-1، حيث يقرر نموذج واحد متى يتنازل عن الدور.
يظهر الفرق العملي عندما يقاطع المتصل في منتصف الجملة. في نموذج التتابع، تُكتشف المقاطعة، ويُلغى التوليد، ويبدأ دور جديد — تسلسل يعمل جيدًا ويكلفك رحلة ذهاب وعودة. في النموذج من طرف إلى طرف، كان القرار يُتخذ باستمرار بالفعل. الأول نظام يستجيب بسرعة. والثاني نظام لم يتوقف عن الاستماع أبدًا.

إجراء الحسابات، لأن الوحدات تخفي الإجابة
يُقال الكلام بمعدل 150 كلمة في الدقيقة تقريبًا، ويبلغ متوسط اللغة الإنجليزية نحو خمسة أحرف ونصف لكل كلمة، لذا فإن دقيقة من الناتج المنطوق تعادل حوالي 800 إلى 900 حرف. عند 25 دولارًا لكل مليون، ينتج Inworld Realtime TTS-2 دقيقة من الكلام مقابل نحو سنتين. وعند سعر Flash البالغ 15 دولارًا، تكون التكلفة أقل من سنت ونصف.
مقابل 0.05 دولار لكل دقيقة صوتية من GPT-Live-1، يبدو ذلك هزيمة ساحقة — حتى تحتسب تكلفة بقية ما يفعله GPT-Live-1. لا تزال واجهة Inworld Realtime API بحاجة إلى التعرّف على الكلام ونموذج لغوي، وكلاهما يُفوتَر بشكل منفصل، وكلاهما يحمل زمن استجابة خاصًا به. أضف ذلك، وستتجاوز التكلفة لكل دقيقة للنظام المتسلسل خمسة سنتات لأي مكالمة تتضمن سؤالًا حقيقيًا. العلاوة السعرية للنموذج من طرف إلى طرف ليست مقابل الصوت. بل هي مقابل تبادل الأدوار، وهي تقريبًا تكلفة مرحلة التعرّف على الكلام التي لم تعد تشتريها.
حيث يتفوق النظام المتتابع بشكل حاسم هو الحجم الكبير دون محادثة. مكالمات الإشعارات، وتأكيدات التسليم، وتذكيرات المواعيد، والرد الصوتي التفاعلي المُعدّ مسبقًا — أي حالة يكون فيها النص معروفًا قبل بدء المكالمة ولن يقاطعها أحد. هناك، يكون التسعير حسب الأحرف بمعدل 7 إلى 15 دولارًا لكل مليون أرخص ببساطة من التسعير حسب الدقيقة للاتصال المزدوج، ودفع مقابل تناوب أدوار لا تستخدمه أبدًا يعد هدرًا.
هناك أيضًا مسار وسط تُخفيه صيغة النموذجين. إذا كنت تُجمّع تتابعًا على أي حال، فلا يلزم أن تأتي طبقة الكلام من مورّد صوتي متخصص: فنماذج TTS الخاصة بـ OpenAI ونماذج المعاينة Gemini TTS من Google هي نقاط نهاية API عادية، وهي مُوجَّهة عبر التوجيه. ونحو 190 نموذجًا من أحد عشر مزوّدًا من المنبع تقف خلف مفتاح OrcaRouter واحد بسعر المزوّد المعلن دون أي هامش — لذا يمكن لنموذج تخليق أن يحل في الكتالوج نفسه، وعلى المفتاح نفسه والفاتورة نفسها، إلى جانب نموذج الاستدلال الذي يغذّيه، مع تحويل تلقائي عند الفشل إذا تدهورت إحدى نقاط النهاية أثناء النشر. وهي المرحلة الأقل بريقًا في حزمة الصوت والأسهل في التوحيد. ولا يتاح لا Realtime TTS-2 من Inworld ولا نقطة نهاية Live Sessions في GPT-Live-1 بهذه الطريقة؛ فهذان يخصّان مورّديهما.
أي واحدة تختار؟
اختر Inworld Realtime TTS-2 إذا كان الحجم هو الهدف وكانت المحادثة مكتوبة مسبقًا. وكلاء ذوو إنتاجية عالية، وإشعارات، ومنتجات متعددة اللغات حيث تهم 200 لغة/منطقة وهوية صوتية واحدة محفوظة، أو أي نشر يحتاج إلى حاوية محلية. تحصل على صوت ضمن أفضل صوتين في الساحة بسعر يقارب نصف سعر المتصدر، وطبقة مجانية للنماذج الأولية، واستنساخ صوت لا يقدمه GPT-Live-1 إطلاقًا، وواجهة Realtime API تتعامل مع المقاطعة بكفاءة في نمط التتالي الذي تشغله على الأرجح بالفعل.
اختر GPT-Live-1 إذا كانت المقاطعة هي المنتج نفسه. المكالمات التي تخرج عن السيناريو، والمتصلون الذين يقاطعون الوكيل، وسير العمل حيث يكون تناوب الأدوار هو الفرق بين محادثة وقائمة. تدفع سعرًا بالدقيقة لا ينخفض عندما يصبح الكلام رخيصًا، وتتخلى عن الاستنساخ و200 لغة، وتستعيد الوصلات.
حرب الأسعار في تخليق الصوت حقيقية، وهي خبر سار لأي شخص يبني وكيلًا صوتيًا — فالصوت ضمن أفضل خمسة أصوات يكلّف الآن خُمس ما كان يكلّفه قبل ثمانية عشر شهرًا. لكنها لا تحسم هذه المقارنة، لأن ما يتقاضى GPT-Live-1 ثمنًا مقابله ليس ما تخفّض Inworld سعره.
