
GPT-Live-1 مقابل Breeze TTS 2: الرائد الصوتي مفتوح الأوزان الذي لا يمكنك إطلاقه
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
Breeze TTS 2 هو أعلى نماذج تحويل النص إلى كلام مفتوحة الأوزان تقييمًا في ساحة Provider Voices Speech Arena التابعة لـ Artificial Analysis، إذ يحمل 1,205 نقطة Elo ويحتل المرتبة السابعة إجمالًا بين أكثر من مئة نظام مُقيَّم — متقدمًا على كل محرك مرخّص تجاريًا ينشر أوزانًا. وأوزانه قابلة للتنزيل منذ 25 أغسطس 2026. وهو أيضًا، بموجب الترخيص الذي تُشحن به تلك الأوزان، غير قابل للاستخدام في أي منتج. أما GPT-Live-1 فهو المقايضة المعاكسة في كل بُعد: مغلق، ومستضاف، ويُفوتر بسعر 0.05 دولار عن كل دقيقة صوتية منذ وصوله إلى واجهة برمجة التطبيقات للمطورين الخاصة بـ OpenAI في 10 سبتمبر 2026، وهو الوحيد من بين الاثنين القادر على سماع المتصل يقاطعه.
ضع تلك الجملتين جنبًا إلى جنب، وستُحسم المقارنة أسرع مما تُحسم معظم مقارنات النماذج. هذه ليست معركة حول أيّهما يُولّف كلامًا أفضل. إنها معركة حول ما إذا كنت تشتري صوتًا أم محادثة، وما إذا كانت كلمة «مفتوح» تعني ما افترضت أنها تعنيه.
إنهما ليسا من النوع نفسه، وهذا هو المقصود.
Breeze TTS 2، من شركة ناشئة تُدعى BreezeBlue يعمل بها نحو خمسة عشر شخصًا، هو نموذج تحويل النص إلى كلام بثلاثة مليارات معامل. يدخل النص، ويخرج الصوت. إنه لا يسمع شيئًا. وليست لديه أيّة وجهة نظر حول متى ينبغي أن ينتهي الدور، لأنه لا يملك مفهوم الدور أصلًا. عند بثّه عبر WebSocket، سيبدأ بإنتاج الصوت قبل أن ينتهي توليد نصّك، وهذا مفيد حقًا للحفاظ على إيقاع وكيل صوتي محكم — لكن قرار متى يتحدّث كان قد اتُّخذ من قبل الجهة التي كتبت النص.
GPT-Live-1 هو نموذج كلام إلى كلام كامل الازدواجية. يدخل الصوت والنص؛ ويخرج الصوت والنص؛ ويقرر النموذج عدة مرات في الثانية ما إذا كان يواصل الاستماع، أو يتوقف مؤقتاً، أو يأخذ الدور، أو يتنازل عنه. وتضع أرقام Full Duplex Bench v1.5 الخاصة بـ OpenAI، التي نُشرت مع الإصدار ولم تُعَد إنتاجها خارج الشركة، تفاعليته عند 80.1% مقابل 45.4% لـ GPT-Realtime-2.1، مع زمن استجابة لأخذ الدور يبلغ 0.798 ثانية مقابل 1.41.
هذا التفاوت ليس انتقاصًا من Breeze TTS 2. إنه تحذير بشأن المكان الذي ينتمي إليه كل منهما في المنظومة. إذا كنت تبني سلسلة متعاقبة — تعرّف على الكلام يغذّي نموذجًا لغويًا يغذّي مُركّبًا صوتيًا — فإن Breeze TTS 2 مرشح للثلث الأخير منها. وإذا كنت تشتري GPT-Live-1، فأنت تشتري الحلقة كاملة وتسلّم منطق تناوب الأدوار معها.
بُعدًا بُعدًا
• نموذج التفاعل — {{1}}GPT-Live-1{{/1}}: ازدواج كامل، مقاطعة أصلية، يستمع أثناء التحدث مقابل {{2}}Breeze TTS 2{{/2}}: تحويل النص إلى كلام متدفق، بلا إدخال صوتي على الإطلاق
• الأوزان — GPT-Live-1: مغلق، مستضاف فقط، معرّف نموذج واحد وبدون لقطات مؤرخة مقابل Breeze TTS 2: 3 مليارات معامل على Hugging Face منذ 25 أغسطس 2026، شيفرة استدلال PyTorch بترخيص Apache-2.0
• الترخيص — GPT-Live-1: شروط تجارية عبر واجهة برمجة تطبيقات OpenAI، ولا شيء يستدعي المراجعة، مقابل Breeze TTS 2: ترخيص بحثي وغير تجاري يغطي الأوزان وعمليات الضبط الدقيق وLoRAs وعمليات الدمج والتكميم والمخرجات المستضافة ذاتيًا
• وحدة السعر — GPT-Live-1: 0.05 دولار لكل دقيقة صوتية، تُحتسب بالثانية، وتُقاس الواجهة الخلفية للاستدلال بشكل منفصل مقابل Breeze TTS 2: 34 دولارًا لكل مليون حرف على نقطة النهاية المستضافة، مع تخفيض تدريجي إلى 28 دولارًا عند أعلى خطة معلنة
• دليل الجودة — GPT-Live-1: 70.3% في مؤشر Speech to Speech Index من Artificial Analysis، بالمناصفة في المركز السادس من أصل أربعة عشر نموذجًا مُقيَّمًا، مقابل Breeze TTS 2: 1,205 Elo في ساحة Provider Voices، والسابع إجمالًا والأول بين النماذج مفتوحة الأوزان، وفقًا لـ Artificial Analysis
• اللغات — GPT-Live-1: تشير تغطية الإطلاق باستمرار إلى طلاقة غير متساوية خارج اللغات الرئيسية مقابل Breeze TTS 2: 50 لغة تدّعيها الجهة الموردة، مع بطاقة نموذج موسومة باللغتين الإنجليزية والصينية
• التحكم الصوتي — GPT-Live-1: اثنا عشر صوتًا خاصًا بـ API، وتُوجَّه النبرة والوتيرة عبر المطالبة النصية، دون أي استنساخ على الإطلاق، مقابل Breeze TTS 2: استنساخ من صوت مرجعي، وتصميم صوتي بلا مرجع، وتوجيه صوتي، وأحداث صوتية مضمّنة
• الإنتاجية — GPT-Live-1: تُقاس بعدد الجلسات المتزامنة، بحد أقصى 25 في الفئة 1 و500 في الفئة 5، مع عدم وجود فئة مجانية، مقابل Breeze TTS 2: نحو 45 حرفًا في الثانية وفق قياس Artificial Analysis، وهو أبطأ من عدة منافسين تجاريين ويهم في الأعمال الطويلة

الرخصة تقوم بعمل أكثر مما تقوم به لوحة المتصدرين.
بطاقة النموذج الخاصة بـ BreezeBlue صريحة بشكل غير معتاد بشأن هذا، وهو ما يُحسب للشركة. شفرة الاستدلال مرخّصة بموجب Apache-2.0. أما الأوزان وأي مخرجات تولّدها باستضافتها ذاتيًا فهي لأغراض البحث، ويتطلب النشر التجاري إما اشتراكًا مدفوعًا في خدمة استضافة أو إذنًا كتابيًا. ويمتد هذا القيد صراحةً ليشمل النماذج المشتقة، وLoRAs، وعمليات الدمج والتكميم — ما يسد الثغرة التي عادةً ما يلجأ إليها الناس.
إذاً، صيغة "رائد الأوزان المفتوحة" تحتاج إلى قيدٍ قلّما تحمله العناوين الرئيسية. إن Breeze TTS 2 مفتوح بمعنى أنك تستطيع تنزيله وفحصه وقياس أدائه وتشغيله على عتادك الخاص لأغراض التقييم. لكنه ليس مفتوحاً بالمعنى الذي يسمح لشركة ناشئة ببناء منتج عليه دون إما الدفع لـ BreezeBlue أو شراء مراجعة قانونية. اثنان من الأمور الثلاثة التي يقصدها الناس بالأوزان المفتوحة — القابلية للتحقق والتكلفة — تحصل عليهما. والثالث — حرية الإطلاق — لا تحصل عليه.
هذا فرق حقيقي عن نموذج مثل GPT-Live-1، حيث لا يكون سؤال الترخيص «هل يُسمح لي؟» بل «كم؟». كلاهما ينتهي بفاتورة. واحد فقط منهما ينتهي أولًا برأي محامٍ.

لا يمكن مقارنة وحدتي السعر، لذا إليك الحساب
يبدو أن 0.05 دولار في الدقيقة و34 دولارًا لكل مليون حرف وكأنهما يعيشان في كونين مختلفين، لأنهما بالفعل كذلك. ولمقارنتهما عليك التحويل. يجري الكلام بمعدل نحو 150 كلمة في الدقيقة، ويبلغ متوسط الإنجليزية نحو خمسة أحرف ونصف لكل كلمة عند احتساب المسافات، لذا فإن دقيقة من الإخراج المنطوق تعادل نحو 800 إلى 900 حرف. وعند سعر Breeze TTS 2 البالغ 34 دولارًا لكل مليون، فإن ذلك يمثل نحو ثلاثة سنتات من التوليف في الدقيقة — أرخص من خمسة سنتات لدى GPT-Live-1، على مستوى الكلام الخام.
تنهار المقارنة فورًا بعد ذلك، لأن الخمسة سنتات الخاصة بـ GPT-Live-1 تشمل الاستماع. فهو أيضًا يحوّل كلام المتصل إلى نص، ويقرر متى ينتهي الدور، ويدير المقاطعة — عملًا يتعيّن على نظام التتابع شراؤه من مكان آخر: نموذج التعرف على الكلام، ونموذج كشف الدور، ونموذج لغوي لإنتاج النص الذي سيقرؤه Breeze TTS 2. أضف تلك العناصر، وستقع سنتات التخليق الثلاثة في نظام التتابع تحت فاتورة أكبر عادةً من فاتورة النموذج من طرف إلى طرف.
الخلاصة الصادقة هي أن الصوت الأرخص هو Breeze TTS 2، والمحادثة الأرخص هي GPT-Live-1، والفرق بين هذين الادعاءين يمثل كل ما تبلغه تكلفة وكيل صوتي فعليًا.

حيث سيلتقون فعليًا
فريق يبني وكيلًا هاتفيًا اليوم ولا يرغب في الالتزام بحزمة شاملة من طرف إلى طرف لمورّد واحد، سيجمع بالضبط هذا التتالي: Breeze TTS 2 أو محرك مكافئ للفم، وشيء آخر للأذنين، ونموذج لغوي موجَّه للتفكير. والأخير من هذه الثلاثة هو العنصر الأكثر تغيّرًا — فهو حيث تتحسّن الجودة بأسرع وتيرة، وحيث تتباين التكلفة أكثر من أي مكان آخر، وحيث نادرًا ما يكون النموذج الذي يفوز هذا الربع هو النموذج الذي يفوز في الربع التالي.
تلك الطبقة هي استدعاء API عادي، وهي الجزء الوحيد في هذه المنظومة الذي يستحق أن يبقى قابلًا للنقل. قرابة 190 نموذجًا من أحد عشر مزوّدًا upstream تقع خلف مفتاح OrcaRouter واحد بسعر القائمة لدى المزوّد دون أي هامش ربح، لذا فإن تبديل نموذج الاستدلال خلف وكيل صوتي هو تغيير في الإعدادات لا مشروع تكامل، كما أن التحويل التلقائي عند الفشل يمنع خلفية تتجاوز المهلة من إسقاط المكالمة. لا يمكن الوصول بهذه الطريقة إلى نقطة نهاية Live Sessions الخاصة بـ GPT-Live-1 ولا إلى واجهة API المستضافة الخاصة بـ Breeze TTS 2 — فطبقات الصوت في هذه المقارنة تقع خارج متناول طبقة التوجيه، ويجدر بنا أن نكون واضحين في ذلك بدلًا من الإيحاء بغير ذلك.
أي واحدة تختار؟
اختر GPT-Live-1 إذا كانت المحادثة هي المنتج ويمكنك قبول واجهة أمامية مستضافة ومغلقة. خطوط الحجوزات، ودعم الخط الأول، وأي حالة يكون فيها مقاطعة المتصل للوكيل حدثًا طبيعيًا لا استثناءً. أنت تشتري معالجة المقاطعات، وتشتريها بسعر لكل دقيقة يظل متوقعًا، في حين أن الاستدلال الكامن وراءه هو الجزء الذي تضبطه.
اختر Breeze TTS 2 إذا كنت تحتاج إلى صوت يمكنك فحصه، أو إذا كنت تبني منتجًا يكون فيه التوليف الصوتي مكوّنًا واحدًا بين مكوّنات كثيرة، أو إذا كنت تحتاج إلى الاستنساخ وتصميم الصوت اللذين لا يوفرهما GPT-Live-1 إطلاقًا. أقدِم على ذلك وأنت تعلم أن الأوزان مخصّصة للبحث، وأن ادعاء الـ 50 لغة هو ادعاء من المورّد مقابل بطاقة موسومة بلغتين، وأن أرقام زمن الاستجابة هي قياسات BreezeBlue الخاصة على مسار سريع مُسخّن وليست تدقيقًا مستقلًا.
إن الغريزة التي تدفع إلى اعتبار هذا مسابقة جودة هي الغريزة الخاطئة. Breeze TTS 2 قريب من قمة اللوحة التي ينافس عليها، بينما ينافس GPT-Live-1 على لوحة مختلفة تمامًا. القرار الذي يكلف المال فعليًا هو القرار الكامن تحت كليهما: أي نموذج يقوم بالتفكير، وما إذا كان بإمكانك تغيير رأيك في ذلك خلال ظهيرة واحدة.
