
GPT-Live-1 مقابل Qwen-Audio-3.0-TTS: المحادثة والراوي ليسا بندًا واحدًا
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة

ضع GPT-Live-1 وQwen-Audio-3.0-TTS جنبًا إلى جنب من حيث السعر لكل ساعة من الصوت، وستبدو الفجوة حاسمة: فـQwen-Audio-3.0-TTS-Plus من Alibaba ينتج الكلام بتكلفة 27.6 دولارًا لكل مليون حرف، أي نحو 1.66 دولار من الصوت في الساعة، بينما يفوتر GPT-Live-1 من OpenAI مبلغ 3.00 دولارات مقابل ساعة من خط مفتوح متواصل. الراوي أرخص، لذا يفوز الراوي — إلا أن هذه هي المقارنة الخاطئة، وسبب خطئها هو أكثر ما يمكن لأي شخص أن يستفيده من هذه المواجهة. Qwen-Audio-3.0-TTS هو نموذج تحويل النص إلى كلام. GPT-Live-1 هو نموذج محادثة كامل الازدواجية. أحدهما يقرأ ما كتبته. أما الآخر فعليه أن يقرر، عدة مرات في الثانية، ما إذا كنت قد انتهيت من الكلام.
أحدهما يُصيّر، والآخر يتحادث.
تأخذ تقنية تحويل النص إلى كلام نصًا وتُعيد صوتًا. لا يوجد صوت مُدخَل، ولا دور لتأخذه، ولا مفهوم للتعرض للمقاطعة، ولا نص مفرّغ لإرجاعه، لأن النموذج لم يسمع شيئًا قط. نموذج تكلفتها أشبه بمطبعة: صفحات تدخل، وصوت يخرج، والجودة والإنتاجية هما الرقمان الوحيدان المهمان، ويمكنك قياس كليهما قبل الإطلاق.
يعالج نموذج محادثة ثنائي الاتجاه بالكامل الصوت الوارد أثناء إنتاجه للصوت الصادر. وتشمل مهمته الأجزاء من المحادثة التي لا علاقة لها بالكلمات — التوقف عندما يتوقف المستخدم، والاستمرار عبر إشارة خلفية مثل «أجل» بدلًا من اعتبارها مقاطعة، والتنازل عن الدور في منتصف الجملة، وإطلاق استدعاء أداة دون إسقاط خيط الحديث. يفعل GPT-Live-1 كل ذلك ويعيد نصوص التعرف على الكلام إلى جانب الجلسة، وهو ما لا يمكنه فعله إلا لأنه كان يستمع طوال الوقت.
إذا كان منتجك يقرأ المقالات بصوت عالٍ، أو يحوّل الوثائق إلى صوت، أو يعلّق صوتيًا على فيديو، فإن GPT-Live-1 هو الأداة الخاطئة، بسعر يبلغ أربعة أضعاف سعر كل ساعة. وإذا كان منتجك يستقبل مكالمة هاتفية، فإن Qwen-Audio-3.0-TTS ليس سوى ثلث خط معالجة لا يزال بحاجة إلى نموذج ASR ونموذج لغوي ليصبح محادثة.
حيث تكون Qwen-Audio-3.0-TTS هي الإجابة الأفضل حقًا
الحجة الداعمة لنموذج Alibaba ليست تسويقًا. صدر في 20 يوليو 2026 عن Tongyi Lab التابع لـ Alibaba وأُتيح كـ API مستضاف ومغلق عبر Alibaba Cloud Model Studio، وقد احتل مستوى Plus المرتبة الأولى في ساحة تحويل النص إلى كلام لدى Artificial Analysis عند إطلاقه. غير أن لوحة الصدارة هدف متحرك، وقد تحركت هذه اللوحة: اعتبارًا من سبتمبر 2026، يحتل Qwen-Audio-3.0-TTS-Plus المرتبة الرابعة في Provider Voice Arena بتصنيف Elo قدره 1,232 على 2,306 عينات، خلف Cartesia Sonic 3.6 عند 1,275، وInworld Realtime TTS-2 عند 1,244، وSimba 3.2 من Speechify عند 1,233 — ثلاثة نماذج من أغسطس ويوليو صدرت بعده. أن تكون في المرتبة الرابعة من بين أكثر من عشرين، مع فقدان الصدارة وبقاء ميزة السعر، يظل موقعًا قويًا. لكنه ليس الموقع الذي وصفته تغطية الإطلاق.

يتصدّر في 10 من أصل 16 لغة يغطيها، ويضيف 20 منطقة لهجات صينية، ويدعم استنساخ الصوت من عينات قصيرة بما في ذلك الاستنساخ عبر اللغات، ويحمل 86 وسمًا مضمّنًا للمشاعر والأداء.
المحاذير محددة بما يكفي للتخطيط على أساسها.
• الإنتاجية — يولّد Plus نحو 16 حرفًا في الثانية، مقابل 30.2 لـ Simba 3.2، و27 لـ Gemini 3.1 Flash TTS، ونحو 120 لـ Sonic 3.5. في التصيير بالدفعات يكون هذا غير ملحوظ؛ أما في منتج مباشر فهو الرقم الذي يحدد المخزن المؤقت لديك.
• توثيق الأسعار — المبلغ 27.6 دولارًا لكل مليون حرف، الذي يُستشهد به على نطاق واسع، لا يطابق صفحة التسعير الخاصة بـ Alibaba نفسها في كل لقطة، وقد أدرجت في بعض النقاط أرقامًا أقل لكل من الفئتين. تحقق من الرقم الحالي على مستوى الحساب قبل أن تضع توقعاتك، وليس من رقم لوحة الصدارة.
• مكتبة الأصوات — على الرغم من دعم 16 لغة، فإن الأصوات المُعدّة مسبقًا العامة تكاد تكون كلها بالصينية والإنجليزية. أما اللغات الأربع عشرة الأخرى فهي متاحة عبر سير عمل الاستنساخ بدلًا من أن تكون جاهزة للاستخدام الفوري.
• تقييد الميزات — لا تعمل وسوم المشاعر المضمّنة البالغ عددها 86 إلا في وضع البث أحادي الاتجاه، لذا لا يصمد التحكم التعبيري في كل مسارات التكامل.
• الطبقات — تستهدف Flash زمن انتقال أول حزمة يقارب 300 مللي ثانية للاستخدام في الوقت الفعلي؛ أما Plus فهي طبقة الجودة. إنهما منتجان مختلفان يحملان الاسم نفسه، واختيار المنتج الخاطئ خطأ أول شائع.
النسخة الصادقة من فاتورة التتالي
إليك ما تغفله المقارنة بالساعة. المنتج الحواري المبني على نموذج TTS هو سلسلة متتالية: يحوّل نموذج ASR كلام المتصل إلى نص، ويقرر نموذج لغوي ما ينبغي قوله، ثم ينطقه نموذج TTS. ثلاثة موردين، وثلاث فواتير، وثلاث ميزانيات زمن استجابة تتراكم، وعملية تسليم عند كل حدّ يموت عنده التنغيم. قد تبلغ تكلفة مرحلة TTS 1.66 دولار لكل ساعة من الصوت. أما المرحلتان الأخريان فهما حيث تكمن الأموال والأخطاء فعلاً — ولا يستطيع نموذج السلسلة المتتالية سماع وقفة في منتصف جملة يلفظها بالفعل.
يدمج GPT-Live-1 الأجزاء الثلاثة في جلسة واحدة وعدّاد واحد، بسعر 0.05 دولار للدقيقة من الصوت مع محاسبة الواجهة الخلفية للاستدلال بشكل منفصل. وهناك تفصيلان يحافظان على دقة تلك الفاتورة. تُحتسب تهيئة الجلسة 15 ثانية من الصوت مقدمًا، وتُقيَّد كرصيد مقابل المدة اللاحقة بدلًا من أن تُضاف إليها. والواجهة الخلفية عدّاد ثانٍ: فكل استدعاء استدلال مُفوَّض، واستدعاء أداة، وبحث ويب يُحاسَب بأسعار ذلك النموذج المعتادة، لذا فإن توجيه التفويض إلى نموذج استدلال رائد يبحث في كل دور ينتج استدعاءً مكلفًا خلف طبقة صوت رخيصة.
ما تقوله اللوحات المستقلة عن الاثنين مفيد تحديدًا لأنهما يقيسان أشياء مختلفة، ولا أحدهما يجامل موضوعه. يحتل Qwen-Audio-3.0-TTS-Plus المرتبة الرابعة في الجودة، وهو قريب من القاع في معدل الإنتاجية. ويحتل GPT-Live-1 المرتبة السابعة من إحدى عشرة في مؤشر تحويل الكلام إلى كلام لدى Artificial Analysis بنسبة 69.8% — متخلفًا عن GPT-Realtime-2.1 الذي يحل محله، عند 73.9% — بينما يُحتسب بسعر يقع في أدنى نطاق تكلفة الساعة من الصوت المُدخَل في المؤشر، 4.42 دولار مقابل 10.75 دولار لـ GPT-Realtime-2.1. لا يحقق أي من النموذجين صدارة فئته. وكلاهما أرخص من الشيء الذي صُنع ليتفوق عليه.

ذلك المقياس الثاني هو حيث تتحول طبقة التوجيه إلى قرار تصميمي بدلاً من مجرد تحسين. لا يحمل OrcaRouter كلاً من GPT-Live-1 ولا Qwen-Audio-3.0-TTS — طبقة الصوت في كلتا الحالتين خارج نطاق وصولنا، ولا نوجه أيًا منها. أما مرحلة الاستدلال فليست كذلك. ما يقرب من 190 نموذجًا من أحد عشر مزودًا للمصدر تقع خلف مفتاح واحد بسعر قائمة المزود وبدون أي هامش ربح، ويصل تخفيض سعر المزود في نفس اليوم بدلاً من تجديد العقد التالي. بالنسبة لسلسلة متتالية، فإن ذلك يغطي المرحلة الوسطى بشكل مباشر: احتفظ بخياري ASR وثلاثة محركات استدلال خلف نقطة نهاية واحدة، وقارن بينها (A/B) على حركة مرور حقيقية، ودع التحويل التلقائي عند الفشل يستوعب مساءً سيئًا لدى المزود دون إسقاط مكالمة.
مسألة الموافقة تسير في الاتجاه المعاكس.
استنساخ الصوت هو أكثر قدرات Qwen-Audio-3.0-TTS فائدةً تجارياً وأكبر سطح امتثال لها. عشر ثوانٍ من الصوت المرجعي تكفي لإعادة إنتاج صوت متحدث، عبر اللغات، وهو أمر تحويلي بالنسبة إلى التوطين ومسؤولية في أي مكان تكون فيه الهوية مهمة. أطلقت OpenAI نموذج GPT-Live-1 دون أي استنساخ ودون أصوات مخصصة على الإطلاق — 12 صوتاً عبر API للاختيار من بينها، وهذه هي القائمة.
هذا اللاتماثل يسهل تخطيه في مقارنة الميزات ويصعب تخطيه في مراجعة المخاطر. المنتج الذي لا يتحدث أبدًا إلا بأحد اثني عشر صوتًا من أصوات المورّدين لديه إجابة أقصر بكثير عن «لمن هذا الصوت، ومن وافق عليه» من منتج يمكنه إعادة إنتاج أي صوت من عيّنة. إذا كنت بحاجة إلى الاستنساخ، فإن قرار خط الأنابيب قد اتُّخذ نيابة عنك، ويصبح السؤال: ما الذي يحكمه؟ وإذا لم تكن بحاجة إليه، فإن قيد GPT-Live-1 يستحق القراءة كضابط لم يكن عليك بناؤه.
أيّ واحد يجب شراؤه؟
اشترِ Qwen-Audio-3.0-TTS إذا كان الناتج محتوى: سرد، أو توطين، أو صوت خاص بإمكانية الوصول، أو دبلجة، أو أي سير عمل يكون فيه النص موجودًا قبل الصوت، وتكون الجودة لكل ساعة مُنتَجة هي المقياس. ابدأ باستخدام Flash إذا كنت بحاجة إلى تشغيل في الوقت الفعلي، وانتقل إلى Plus عندما يكون الصوت نفسه هو المُخرَج النهائي، وسعّر سير عمل الاستنساخ بشكل منفصل عن الأصوات المُعدّة مسبقًا.
اشترِ GPT-Live-1 إذا كان الإدخال شخصًا. يدعم خطوط الدعم، وتدفقات الحجز، ومقابلات الاستقبال، وأي شيء يصل فيه المقطع الأول من كلام المستخدم بينما لا يزال النموذج في منتصف الجملة، ويجب أن يتصرف النظام كمستمع لا كمتحدث. تبلغ تكلفته أكثر لكل ساعة من الصوت، وهو الوحيد بين الاثنين الذي يمكن مقاطعته.
الاثنان مكمّلان لبعضهما أكثر بكثير مما هما متنافسان: فالعديد من المنتجات تريد Qwen-Audio-3.0-TTS يقرأ مستندًا، ونموذجًا ثنائي الاتجاه يتولى المكالمة التي تلي ذلك. وما لا ينبغي أن يتشاركاه هو نموذج التكلفة. فالتكلفة لكل ساعة من الصوت هي المقياس الصحيح لواحد منهما فقط.
