
Qwen-Audio-3.1 مقابل ElevenLabs: خفض سعر بنسبة 70% يواجه الشركة المهيمنة
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 177 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1323 tok/s
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
خفّض المورّد سعر واجهة برمجة التطبيقات Qwen-Audio-3.1-TTS بنحو 70% في 23 سبتمبر 2026، وأعلن ذلك على المسرح في مؤتمر Apsara في هانغتشو إلى جانب أربعة نماذج صوتية أخرى. هذا الرقم وحده هو سبب استحقاق هذه المقارنة للكتابة: فقد كان ElevenLabs Eleven v3 الصوت الإنتاجي الافتراضي لمعظم الفرق الغربية بمعدل فعلي يقارب 100 دولار لكل مليون حرف، وقد أعاد منافس موثوق للتو تسعير المهمة نفسها بجزء يسير من ذلك مع توسيع التغطية اللغوية في الوقت نفسه. النظامان ليسا متكافئين — فـ Qwen-Audio-3.1-TTS واجهة برمجة تطبيقات مستضافة حصرًا من Tongyi Lab التابع للمورّد، مع منظومة أصوات أصغر، بينما ElevenLabs منصة محتوى متكاملة تملك أعمق مكتبة أصوات في القطاع. لكن إذا كان قرارك يومًا ما محسومًا بالفاتورة، فقد تغيّرت الحسابات هذا الأسبوع.
ما الذي تم شحنه فعليًا في 23 سبتمبر
Qwen-Audio-3.1 ليس نموذجًا واحدًا. بل هو تحديث من خمسة نماذج لمنظومة الصوت الكاملة لدى Alibaba، والفئات مهمة لأن لها أسعارًا مختلفة ومهامًا مختلفة:
• Qwen-Audio-3.1-TTS — الخلف المباشر لنموذج التخليق الذي تستخدمه معظم الفرق. يضيف سبع لغات ليصبح المجموع 16، ويحافظ على مناطق اللهجات الصينية العشرين، ويضيف نقلاً طبيعياً للجرس الصوتي عبر اللغات (صوت واحد يمتد عبر الماندرين والكانتونية والإنجليزية واليابانية)، وتحكماً مبنياً على التعليمات في العاطفة والوتيرة وأسلوب الإلقاء، ويتعامل مع الصوت المرجعي المشوّش أو الذي به صدى أو الرديء لأي سبب آخر دون وضع منفصل لإزالة الضوضاء.
• Qwen-Audio-3.1-TTS-Next — فئة جديدة، ومنتج مختلف. تسميه Alibaba نموذج "Audiogen": فهو يولّد الصوت والمؤثرات الصوتية والأجواء الخلفية في تمريرة واحدة من النص والطوابع الزمنية والصوت المرجعي. حوار متعدد المتحدثين، بودكاست، مشاهد صوتية للأفلام والتلفزيون، ومخرجات بدقة 48 كيلوهرتز. وفقًا لوثائق Model Studio من Alibaba Cloud، يستقبل حتى 3,000 حرف من المدخلات، ويحدّ الصوت المولَّد بحد أقصى 240 ثانية للبودكاست و120 ثانية فيما عدا ذلك، ويعمل بمعدل 3 طلبات في الثانية، ويعيد WAV أو MP3 أو PCM.
• Qwen-Audio-3.1-ASR، Qwen-Audio-3.1-ASR-Next وQwen-Audio-3.1-Realtime — التعرف على الكلام، وفهم الصوت (المشاعر، والموسيقى، والأصوات البيئية، وتحديد موقع الأحداث) والمحادثة كاملة الازدواجية على التوالي. أما Realtime فهو النموذج الذي تدفع به علي بابا إلى الأجهزة: Qwen Office، وQoder، وQwenNote A2، وروبوت سطح المكتب QwenNote Eva، ونظارات Qwen AI.
شملت تخفيضات الأسعار خط المنتجات بالكامل، وليس TTS فقط: انخفض التركيب بنحو 70%، والوقت الفعلي بنحو 85%، والتعرف بما يصل إلى 95%. كما أتاحت علي بابا Qwen-Audio-Agent كمصدر مفتوح، وهو إطار عمل لبناء وكلاء صوتيين يعملون في الوقت الفعلي، وأطلقت Qwen3.8-LiveTranslate مع خفض زمن الاستجابة إلى أقل من 2.5 ثانية.

لوحة النتائج

• السعر — Qwen-Audio-3.1-TTS: أقل بنحو 70% من الجيل السابق Qwen-Audio، الذي كان يضع فئة 3.0 Plus عند نحو 27.60 دولار لكل مليون حرف وفئة Flash عند نحو 15 دولارًا. ElevenLabs Eleven v3: نحو 100 دولار لكل مليون حرف وفقًا لما ترصده Artificial Analysis، مع Flash عند نحو 50 دولارًا.
• اللغات — Qwen-Audio-3.1-TTS: 16 لغة بالإضافة إلى 20 منطقة لهجة صينية. ElevenLabs Eleven v3: 74 لغة.
• الأوزان — Qwen-Audio-3.1-TTS: مغلقة، مستضافة فقط على Alibaba Cloud Model Studio. ElevenLabs Eleven v3: مغلقة، مستضافة فقط.
• مكتبة الأصوات — Qwen-Audio-3.1-TTS: استنساخ أصلي بالإضافة إلى نقل الجرس عبر اللغات؛ لا توجد سوق عامة مماثلة. ElevenLabs: أكبر مكتبة أصوات مشتركة في القطاع، بالإضافة إلى الاستنساخ الفوري من حوالي 30 ثانية من الصوت.
• التحكم في الأداء — Qwen-Audio-3.1-TTS: انفعالات وسرعة وأسلوب قائمة على التعليمات، مع وراثة 86 وسمًا مضمَّنًا للأداء طُوِّرت مع الإصدار 3.0. ElevenLabs Eleven v3: وسوم صوتية إضافةً إلى المنصة المحيطة (الدبلجة، الوكلاء، الاستوديو).
• معيار مستقل — Qwen-Audio-3.1-TTS: لا يوجد بعد. ElevenLabs Eleven v3: 1,168 إيلو في لوحة صدارة Provider Voice Arena التابعة لـ Artificial Analysis اعتبارًا من أغسطس 2026.
حيث يفوز المتحدي حقًا
ثلاثة أشياء، وواحد منها فقط هو السعر.
السعر، بوضوح. خفض بنسبة 70% مقابل منافس حالي بسعر 100 دولار لكل مليون حرف ليس فرقًا هامشيًا. إنه الفرق بين منتج تجري عليه النماذج الأولية ومنتج تشحنه إلى كل مستخدم. إذا كنت تولّد سردًا صوتيًا بكميات كبيرة، فإن التوفير السنوي ليس بندًا عليك أن تجادل من أجله داخليًا — بل يجادل عن نفسه.
الصينية، بلا أي لبس. عشرون منطقة لهجات صينية تمثل خندقًا لا يقترب منه أي شيء تقدمه ElevenLabs. إذا كان منتجك يخدم مستخدمي البر الرئيسي الصيني، أو الناطقين بالكانتونية، أو جمهورًا من المغتربين يبدّلون اللغات في منتصف الجملة، فالمقارنة محسومة قبل أن تبدأ.
نقل جرس الصوت عبر اللغات.يأخذ Qwen-Audio-3.1-TTS صوتًا واحدًا وينقله بطبيعية عبر الماندرين والكانتونية والإنجليزية واليابانية. هذه قدرة محددة لها حالة استخدام محددة — صوت واحد يحمل هوية تجارية واحدة يظل ثابتًا عند تبديل اللغة — وهي ميزة تمييز حقيقية لكل من يوطّن مذيعًا واحدًا بدلًا من اختيار مذيع جديد لكل سوق.
حيث لا تزال ElevenLabs تتفوق، والمنافسة ليست متقاربة
الاتساع اللغوي هو الأمر الأول، وهو الأكبر. أربعٌ وسبعون لغة مقابل ست عشرة ليست فجوة تُسدّ بإعلان تسعير. إذا أطلقتَ خدماتك بالبولندية والتركية والفيتنامية والبرتغالية، فإن ElevenLabs يغطي احتياجاتك اليوم، أما Qwen-Audio-3.1-TTS فلا.
الثاني هو النظام البيئي. ElevenLabs ليس نقطة نهاية تخليق؛ بل هو منصة محتوى. مكتبة أصوات مشتركة يمكنك ترخيصها بدلاً من استنساخها، سير عمل الدبلجة، بنية تحتية للوكلاء، منتج استوديو، واجهة API موثقة تقف خلفها سنوات من مكتبات العملاء. الترحيل بعيداً عن ذلك مشروع، وليس تغييراً في الإعدادات، والفرق التي بنت عليه تعرف تماماً ما الذي ستتخلى عنه.
الثالث هو شيء يصعب تسميته ويستحق التسمية على أي حال: إدراك مدى طبيعية صوت إنجليزي واحد. لطالما كان تخليق Qwen ممتازًا في الصينية ومجرد جيد جدًا في الإنجليزية، وبينما يدّعي الإصدار 3.1 تحسين الأداء متعدد اللغات، لا يوجد اختبار استماع مستقل على النموذج الجديد بعد. أي شخص يخبرك أنه يعرف كيف يبدو صوت Qwen الجديد في الإنجليزية إنما يخمن.
الرقم الذي لا ينبغي لأحد أن يقتبسه بعد
هذا هو الجزء من القصة الذي سيتشوَّه في التغطية، لذا ها هو بوضوح. Qwen-Audio-3.1-TTS ليس لديه نتيجة اختبار معياري مستقلة. سلفه، Qwen-Audio-3.0-TTS-Plus، كان عند 1,234 Elo على لوحة صدارة Provider Voice Arena التابعة لـ Artificial Analysis اعتبارًا من منتصف أغسطس 2026، محتلًا مرتبة تتراوح بين الثاني والخامس على تلك اللوحة. لم يُضَف Qwen-Audio-3.1-TTS إلى أي ساحة بعد. كل ادعاءات الجودة في مواد إطلاق Alibaba مُبلَّغ عنها من المورّد وغير مُعاد إنتاجها.
هذا لا يجعل الادعاءات زائفة. بل يجعلها غير مُتحقَّق منها، ويعني أن الطرح الأمين لهذه المواجهة الآن هو: نموذج له سعر ولا نتيجة، في مقابل نموذج له نتيجة وسعر أعلى بكثير. أي شيء أقوى من ذلك هو تخمين يتراءى بثوب معيار قياس.

ينطبق نفس الانضباط على زمن الاستجابة. رقم Alibaba الرئيسي لأول رمز لجانب ASR من هذه العائلة — 92 مللي ثانية — يأتي من اختبار الشركة الخاص عالي التزامن على مواصفات 0.6B، وليس من اختبار طرف ثالث، والتحليلات المنشورة منذ الإطلاق تشير إلى أن ASR و TTS منتجان منفصلان في خط أنابيب وليسا نموذجًا واحدًا من طرف إلى طرف، وأن تقارير المجتمع تصف تراكم زمن الاستجابة في الحوارات الطويلة تحت نمط البث الشبهي. تعامل مع أرقام زمن الاستجابة من البائعين عبر هذه العائلة بأكملها كحدود قصوى، وليس كتجربة مقاسة.
ما قيمة خفض السعر في الممارسة العملية
لنأخذ عبء عمل واقعيًا: منتج يولّد 20 مليون حرف من السرد الصوتي شهريًا بالإنجليزية والماندرين. بسعر ElevenLabs Eleven v3 البالغ نحو 100 دولار لكل مليون حرف، يبلغ ذلك نحو 2000 دولار شهريًا، أو 24000 دولار سنويًا. وبسعر Qwen-Audio-3.0-TTS-Plus البالغ نحو 27.60 دولارًا لكل مليون، كان الحجم نفسه يكلّف بالفعل نحو 552 دولارًا شهريًا. طبّق خفضًا بنسبة ~70% أعلنته Alibaba في 23 سبتمبر، وسيستقر عبء العمل نفسه عند مئات قليلة من الدولارات شهريًا.
لا يمثل أي من هذه الأرقام أسعار قائمة يمكنك التعاقد بناءً عليها — إذ تصدر ElevenLabs فواتيرها بوحدات ائتمانية عبر مستويات الاشتراك، بينما تخفيضات Alibaba هي تخفيضات بنسبة مئوية مقابل أسعار تختلف حسب المنطقة وحسب المستوى. لكن شكل المقارنة لا لبس فيه، وهذا الشكل هو ما تبني عليه ميزانيتك.
ملاحظة تحذيرية واحدة تستحق الإشارة لأي شخص يقوم بنمذجة هذا بعناية: نقلت Alibaba Cloud فوترة النسخ في الوقت الفعلي على عقدة سنغافورة من القياس على أساس المدة إلى القياس على أساس الرموز، بسعر 0.93 دولار لكل مليون رمز إدخال و0.70 دولار لكل مليون رمز إخراج. الفوترة بالرموز أقل قابلية للتنبؤ من الفوترة بالمدة عندما لا تتحكم في عدد الرموز التي يتحول إليها مقطع صوتي معين، كما أن الضوضاء والصمت والسياق متعدد الجولات كلها تزيد من استهلاك الرموز. ولا يعني خفض معلن بنسبة 70% تلقائيًا تحقيق وفر بنسبة 70% على حركة المرور الخاصة بك.
كيفية تشغيل المفتاح فعليًا
إذا كنت تقيّم هذا، فالشيء المفيد معرفته هو ما تكلّفك إياه عملية الانتقال من وقت هندسي. كلا النموذجين عبارة عن واجهات برمجية مُستضافة مغلقة، لذا فأنت تدمج مع نقطة نهاية HTTP في كلتا الحالتين، والعمل عبارة عن عميل وسياسة لإعادة المحاولة وقائمة أصوات — وليس إعادة هيكلة معمارية.
هنا تأتي فائدة بنية OrcaRouter، مع تحفّظ صادق واحد أولًا: نحن لا نوجّه Qwen-Audio-3.1-TTS أو أي نموذج Qwen-Audio. نقاط نهاية الكلام لدى Alibaba خارج نطاقنا، وينطبق الأمر نفسه على ElevenLabs. ما نغطيه هو طبقة الاستدلال المحيطة بها — مفتاح API واحد عبر أكثر من 200 نموذج نصي بهامش ربح 0%، أي أن سعر القائمة من المزوّد يمر مباشرة، لذا يصبح تخفيض سعر المورّد ساريًا لدينا في اليوم نفسه بدلًا من بعد دورة إعادة تسعير. بالنسبة للفرق التي تبني التطبيق الذي يشغّل خط أنابيب كلام — أداة التلخيص، ومولّد النصوص، ومخطّط المحتوى — يعني ذلك عقدًا واحدًا بدلًا من عدة عقود، والتبديل التلقائي عند تدهور خدمة المنبع، ولغة توجيه DSL لتجميع النماذج في استدعاء واحد. هذا لا يعني أنك تستدعي صوت Qwen عبرنا. أي شخص يقول لك خلاف ذلك لم يقرأ الكتالوج.
من الذي يجب أن يتحرك، ومن الذي يجب أن ينتظر؟
تحرّك الآن إذا كان عبء عملك يركّز على الصينية أولًا، أو إذا كانت تغطية اللهجات ضمن قائمة متطلباتك، أو إذا كانت تكلفة الحجم هي القيد الذي أبقاك على صوت أرخص لكنه أسوأ، أو إذا كنت بحاجة إلى صوت واحد يحمل هوية علامتك التجارية يصمد عند تبديل اللغة. فمع تسعير الثالث والعشرين من سبتمبر، يصبح المنطق الاقتصادي صعب الجدال، وقد كانت الجودة في اللغة الصينية تنافسية بالفعل قبل ذلك.
انتظر إذا كنت تطلق منتجك بأكثر من نحو ستة عشر لغة، أو إذا كان منتجك يعتمد على مكتبة أصوات قابلة للترخيص بدلًا من الاستنساخ، أو إذا كنت متعمقًا في أدوات الدبلجة أو أدوات الوكلاء الخاصة بمنصة ما، أو إذا كانت عملية الشراء لديك تتطلب تقييم جودة مستقل قبل الاعتماد النهائي. لا شيء من ذلك يمثل عوائق دائمة، لكن تخفيض السعر لم يعالج أيًا منها.
وراقب شيئًا واحدًا تحديدًا: ما إذا كان Qwen-Audio-3.1-TTS يظهر في ساحة استماع عمياء. في اللحظة التي يفعل فيها ذلك، تتوقف هذه المقارنة عن كونها حول السعر وعدد اللغات وتبدأ في كونها حول ما إذا كان الصوت الأرخص جيدًا بالقدر نفسه فعلاً. هذا هو السؤال الذي لم تجب عنه عملية الإطلاق.
