
Qwen-Audio-3.1-TTS مقابل Qwen-Audio-3.0-TTS: ماذا حقّق شهران؟
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 495 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 186 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
صدر Qwen-Audio-3.0-TTS في 20 يوليو 2026 ووصل مباشرةً إلى قمة لوحات الصدارة المستقلة للكلام — فقد بلغت فئة Plus 1,238 نقطة Elo على لوحة صدارة Provider Voice Arena التابعة لـ Artificial Analysis، محتلّةً المرتبة الثانية على اللوحة. وبعد تسعة أسابيع، في 23 سبتمبر 2026، أعلنت الشركة المورّدة عن Qwen-Audio-3.1-TTS في مؤتمر Apsara Conference في هانغتشو، مع تخفيض سعري بنحو 70%. هذا التوقيت يجعل المقارنة غير معتادة: فالنموذج الذي يتم استبداله ليس متقادمًا، بل خضع للاختبارات القياسية، وأثبت جدارته، ولا يزال قريبًا من القمة. لذا فالسؤال الحقيقي ليس أيّهما أفضل. بل ما الذي تغيّر تحديدًا، وهل يهم أيٌّ من ذلك عبء عملك، وماذا يحدث للنتيجة التي تثق بها بالفعل عندما لا يكون النموذج اللاحق قد حصل على تقييم على الإطلاق.
شهران، خمس نقاط نهاية، عائلة واحدة
لم تكتفِ علي بابا بإطلاق نموذج واحد. يشمل إصدار 3.1 خمسة نماذج: Qwen-Audio-3.1-ASR، وQwen-Audio-3.1-ASR-Next، وQwen-Audio-3.1-TTS، وQwen-Audio-3.1-TTS-Next، وQwen-Audio-3.1-Realtime. بالنسبة لأي شخص يستدعي حاليًا Qwen-Audio-3.0-TTS، فإن واحدًا فقط من هذه النماذج يُعد بديلًا مباشرًا — طبقة TTS العادية — وواحدًا منها منتج جديد حقيقي وليس ترقية.
ذلك الثاني يستحق الفهم حتى إن لم تستدعِه قط. إن Qwen-Audio-3.1-TTS-Next هو ما تسميه Alibaba نموذج «Audiogen»: تمريرة واحدة تنتج الصوت والمؤثرات الصوتية والأجواء الخلفية معًا انطلاقًا من النص والطوابع الزمنية والصوت المرجعي. حوار متعدد المتحدثين، وتجميع بودكاست، ومشاهد صوتية، وإخراج بتردد 48 kHz. يدرج توثيق Model Studio من Alibaba Cloud حدوده بوضوح — 3,000 حرف من المدخلات، و240 ثانية من الصوت المولّد للبودكاست و120 ثانية فيما عدا ذلك، و3 طلبات في الثانية، وإخراج بصيغة WAV أو MP3 أو PCM، ويقبل ما يصل إلى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية بصيغ WAV أو MP3 أو OGG Opus. لا يُدعم إدخال مرجعي بصيغة PCM الخام. ويُسعّر بـ0.848 دولار لكل مليون رمز إدخال و1.696 دولار لكل مليون رمز إخراج على عقدة بكين، باستثناء الأسعار الترويجية، وهو يتعامل مع الصينية والإنجليزية فقط.
إذا كنت تستخدم 3.0-TTS ومهمتك هي "تحويل هذا السكربت إلى صوت"، فلا شيء من ذلك يغيّر التكامل لديك. أما إذا كانت مهمتك هي "تجميع بودكاست بمذيعين اثنين مع خلفيات موسيقية"، فإن 3.1-TTS-Next فئة منتج مختلفة، وربما السبب الذي يدفعك للنظر في هذا الإصدار من الأساس.
الترقية، سطرًا بسطر

• اللغات — Qwen-Audio-3.1-TTS: 16 لغة وفقًا لما أعلنته الشركة المطوّرة، مع إضافة سبع لغات مقارنةً بالجيل السابق. Qwen-Audio-3.0-TTS: 16 لغة كما ورد في التغطية المنشورة لإصدار يوليو.
• اللهجات الصينية — Qwen-Audio-3.1-TTS: 20 منطقة لهجية، منقول. Qwen-Audio-3.0-TTS: 20 منطقة لهجية.
• نقل الطابع الصوتي عبر اللغات — Qwen-Audio-3.1-TTS: نعم، صوت واحد ينتقل عبر الماندرين والكانتونية والإنجليزية واليابانية. Qwen-Audio-3.0-TTS: غير مُتاح.
• التحكّم في الإلقاء — Qwen-Audio-3.1-TTS: تحكّم قائم على التعليمات في العاطفة والوتيرة والأسلوب. Qwen-Audio-3.0-TTS: 86 وسم إلقاء مضمَّن.
• مدخل مرجعي مشوّش — Qwen-Audio-3.1-TTS: يتعامل مع الصوت المرجعي المشوّش أو ذي الصدى مباشرةً، دون وضع منفصل لإزالة التشويش. Qwen-Audio-3.0-TTS: يتطلب صوتًا مرجعيًا نظيفًا.
• درجة مستقلة — Qwen-Audio-3.1-TTS: لا يوجد بعد. Qwen-Audio-3.0-TTS-Plus: 1,238 Elo في لوحة صدارة Provider Voice Arena التابعة لـ Artificial Analysis اعتبارًا من أغسطس 2026.
عدد اللغات لا يتوافق، وهذا أمر مهم
هذا أمر بسيط سيتم التغاضي عنه في كل مكان آخر، لذا يجدر ذكره. تقول مواد إطلاق Alibaba أن طبقة 3.1 TTS تضيف سبع لغات. التغطية المنشورة لجيل 3.0 في يوليو — بما في ذلك مقالات المقارنة الخاصة بنا من ذلك الشهر — أدرجت 16 لغة لطبقة 3.0. سبعة مضافًا إلى ستة عشر يساوي ثلاثة وعشرين، وليس ستة عشر، ولم تنشر Alibaba أي تسوية بين الرقمين.
التفسيرات المحتملة غير مبهرة: قد يحصي رقم 3.1 مجموعة مختلفة، وقد يكون رقم 3.0 قد بولغ فيه عند الإطلاق، أو قد تصف عبارة "يضيف سبعة" طبقة ASR بدلًا من TTS. لا نعرف أيّها الصحيح. ما نعرفه هو أن عدد اللغات على طرفي هذه المقارنة رقم تبلّغت به الجهة الموردة ولم يخضع أبدًا لتدقيق مستقل، وأن أي شخص يقتبس "16 لغة" كحقيقة قاطعة عن أي من النموذجين إنما يقتبس شريحة تسويقية. تحقق من اللغات المحددة التي تحتاجها مقابل وثائق Model Studio قبل أن تخطط بناءً على أي عدد.

التحكم في التعليمات هو التغيير الذي يظهر فعليًا في الكود
من بين كل ما في إصدار 3.1 TTS، هذا هو ما يغيّر طريقة كتابتك لمطالباتك. كان جيل 3.0 يتحكم في الإلقاء عبر 86 وسمًا مضمّنًا — مفردات ثابتة كان عليك تعلّمها، وإدراجها في المواضع الصحيحة، وكانت تفعل بالضبط ما تقوله ولا شيء أكثر. وتستبدل فئة 3.1 ذلك بتعليمات باللغة الطبيعية: تصف العاطفة، والوتيرة، والأسلوب الذي تريده، ويقوم النموذج بتفسيره.
الفرق العملي هو التعبيرية مقابل القابلية للتنبؤ. إن مفردات الوسوم عقد — فالوسم نفسه ينتج نفس الأداء في كل مرة، وهذا ما تريده في خط إنتاج يجب أن يكون فيه الصوت متسقًا عبر عشرة آلاف مقطع. التعليمات الحرة أوسع لكنها أقل إحكامًا، وترث مشكلة حساسية المطالبة المعتادة: صياغتان لـ"دافئ ولكن ليس عاطفيًا" لن يكون لهما الوقع نفسه، وكذلك لن يكون لاستدعاءين لنفس الصياغة في أيام مختلفة.
إذا كان خط أنابيبك الحالي مبنيًا على تلك الوسوم الـ86، فإن الترقية ليست مجانية. أنت تستبدل سطح تحكم حتميًا بآخر احتمالي، وعمل الترحيل ليس هو استدعاء API — بل إعادة التحقق من كل قالب توجيه تملكه مقابل تفسير النموذج الجديد. خصّص ميزانية لذلك قبل أن تخصّص ميزانية للوفورات.
تحويل جرس الصوت عبر اللغات، وما الغرض الفعلي منه
صوت مرجعي واحد، يُنقل عبر الماندرين والكانتونية والإنجليزية واليابانية، محافظًا على هويته مع تغيُّر اللغة. على الورق، يبدو هذا كبند من بنود الميزات. أما عمليًا، فهو يحل مشكلة محددة ومكلفة: متحدث واحد عليه أن يتواجد بأكثر من لغة دون أن يبدو شخصًا مختلفًا في كل منها.
الحل البديل التقليدي هو تعيين ممثل صوتي منفصل لكل لغة والقبول بأن صوت علامتك التجارية أصبح الآن أربعة أصوات تتشارك النص نفسه. أما البديل الآخر فقد كان استنساخ متحدث واحد إلى كل لغة، وهو بالضبط سير العمل الذي تنزلق فيه الأصوات المستنسخة عادةً — تنتقل اللكنة، ويضعف جرس الصوت، ويلاحظ المستمعون ذلك خلال جملة واحدة. نقل الجرس عبر اللغات هو الادعاء بأنه لا حاجة إلى أي من هذين التنازلين.
وهو أيضًا، في الوقت الحالي، غير موثّق بالكامل. لا يوجد أي اختبار استماع من طرف ثالث على Qwen-Audio-3.1-TTS بأي لغة، ولا تُعدّ عروض Alibaba التوضيحية الخاصة سوى الدليل الوحيد على أن النقل يظل قائمًا. إذا كانت هذه القدرة هي السبب في أنك تفكر في الترقية، فاختبرها على صوتك المرجعي الخاص قبل أن تلتزم — فهذه تجربة تستغرق خمس دقائق وهي الوحيدة التي تجيب عن السؤال.
ماذا يفعل خفض السعر بفاتورة 3.0
خفضت علي بابا أسعار خدمات الكلام على طول الخط: التركيب بنحو 70%، والزمن الحقيقي بنحو 85%، والتعرف بما يصل إلى 95%. دخل التعديل حيز التنفيذ على Alibaba Cloud Model Studio في 22 سبتمبر 2026 عند الساعة 00:00 بتوقيت بكين، ويغطي منطقتي بكين وسنغافورة، وينطبق على نقاط نهاية 3.1 TTS و3.0 realtime. بعد التعديل، تسعّر فئة TTS Flash عند 1.5 يوان لكل مليون رمز إدخال و12 يوانًا لكل مليون رمز إخراج؛ وتسعّر فئة realtime Flash عند 1.5 لإدخال النص، و6 لإدخال الصوت، و4.5 لإخراج النص، و12 لإخراج النص والصوت معًا، لكل مليون رمز.
هذا هو الجزء المهم إذا كنت تشغّل بالفعل 3.0-TTS. كانت فئة 3.0 Plus تسجّل نحو 27.60 دولار لكل مليون حرف على Artificial Analysis حتى أغسطس، مع فئة Flash عند نحو 15 دولارًا. وإذا كان التخفيض البالغ نحو 70% ينطبق على الفئة التي تستخدمها، فإن فاتورتك على نفس عبء العمل تنخفض إلى نحو ثلث ما كانت عليه — دون أن تغيّر سطرًا واحدًا من الكود. هذا هو الأمر غير المعتاد في هذا الإصدار: بالنسبة لعميل 3.0، قيمة خفض السعر أكبر من ترقية النموذج، وهو يصلك سواء رحّلت أم لم ترحّل.
هناك تحذيران يستحقان التمسك بهما. تُقتبس التخفيضات المئوية مقابل أسعار تختلف حسب المنطقة وحسب الطبقة، لذا فإن نسبة 70% الواردة في العنوان ليست وعدًا بشأن حركة المرور الخاصة بك تحديدًا. وقد نقلت Alibaba Cloud فوترة النسخ الفوري على عقدة سنغافورة من القياس على أساس المدة إلى القياس على أساس التوكنات — $0.93 لكل مليون توكن إدخال و$0.70 لكل مليون توكن إخراج — وهو أساس أقل قابلية للتنبؤ عندما تضخّم كل من فترات الصمت والضوضاء والسياق متعدد الأدوار استهلاك التوكنات. اقرأ بطاقة الأسعار الجديدة مقارنةً بتسجيلاتك الصوتية الخاصة، لا بالبيان الصحفي.
حيث لا يزال Qwen-Audio-3.0-TTS هو الخيار الصحيح
ثلاث حالات، وهي ليست حالات هامشية.
عندما تحتاج إلى رقم يمكنك الدفاع عنه. يمتلك Qwen-Audio-3.0-TTS-Plus تصنيف Elo مستقلًا قدره 1,238 — وتقرأ اللوحة نفسها 1,259 لذلك الطراز في سبتمبر، ولا يزال الثاني، لذا فقد انحرف التصنيف صعودًا بدلًا من أن يتدهور — من ساحة استماع عمياء تقف خلفها آلاف الأصوات. لا يملك Qwen-Audio-3.1-TTS أي تصنيف في الساحة على الإطلاق. إذا كانت عملية الاعتماد النهائي لديك تتطلب دليلًا من طرف ثالث، فالطراز الأقدم هو الذي يملكه، وخفض السعر لا يغيّر ذلك.

عندما تتغلب الحتمية على التعبيرية. إذا كان خط أنابيب الإنتاج لديك مبنيًا على سطح التحكم المكوّن من 86 وسمًا، فأنت تملك نظامًا يمكنك التفكير في مخرجاته. التحكم القائم على التعليمات أكثر قدرة وأقل قابلية للتنبؤ، وتكلفة الترحيل حقيقية.
حين لا يمسّ أي شيء في الترقية عبء عملك. إذا كنت تُولّد الصوت بالماندرين والإنجليزية بحجم معتدل، وبصوت مرجعي نقي، ومجموعة ثابتة من وسوم الإلقاء، فإن نقل الجرس عبر اللغات، ومتانة المدخلات المزعجة، وسبع لغات إضافية كلها تحلّ مشكلات لا تواجهها. اغتنم تخفيض السعر، واحتفظ بالنموذج.
تشغيل كليهما دون تشغيل تكاملين
الجزء المحرج في التبديل من جيل إلى جيل هو أنك غالبًا ما تريد أن يعمل كلا النموذجين في الوقت نفسه — الإصدار 3.0 لمسار الإنتاج مع النتيجة التي تسنده، والإصدار 3.1 للغات الجديدة وميزة النقل، وطريقة لنقل حركة المرور بينهما دون إعادة نشر. كلاهما واجهتا برمجة تطبيقات مستضافتان ومغلقتان على Alibaba Cloud Model Studio، لذا فذلك نقطتا نهاية، وحدّا معدل، ونمطا فشل خلف ميزة واحدة.
ملاحظة صادقة حول موقعنا: لا يوجّه OrcaRouter نموذج Qwen-Audio-3.1-TTS أو أي نموذج Qwen-Audio، ولا نوجّه نقاط نهاية الكلام لدى Alibaba إطلاقًا. ما نقدّمه هو طبقة استدلال نصي حول مسار معالجة كهذا — مفتاح API واحد لأكثر من 200 نموذج بهامش 0%، وسعر المزوّد المدرج يُمرَّر مباشرةً، لذا يصل تخفيض سعر البائع إلينا في اليوم نفسه بدلًا من بعد دورة إعادة تسعير. إذا كانت الخدمة التي تشغّل خط معالجة الكلام لديك هي مولّد سكربت أو أداة تلخيص أو مخطط محتوى، فهذا يعني عقدًا واحدًا بدلًا من عدة عقود، وتجاوز فشل تلقائي عند تدهور مزوّد المنبع، ولغة DSL للتوجيه لتجميع النماذج في نداء واحد. ولا يعني ذلك أنك تستدعي صوت Qwen عبرنا، وأي صفحة توحي بخلاف ذلك مخطئة بشأن كتالوجنا الخاص.
الملخص الصادق
يُعد Qwen-Audio-3.1-TTS ترقية حقيقية تتضمن ثلاث إضافات مهمة — التحكم في الأداء المبني على التعليمات، ونقل الجرس عبر اللغات، والمتانة تجاه الصوت المرجعي السيئ — إضافة إلى تخفيض السعر الذي يفوق قيمة أي منها. لم يُستبدل Qwen-Audio-3.0-TTS بالطريقة التي يُستبدل بها عادةً نموذج عمره شهران: فهو لا يزال يحتفظ بدرجة تقييم معياري مستقلة لم يحققها خلفه، ولا يزال يغطي نطاق اللهجات الصينية الذي يقوم عليه معظم ما يميّز هذه العائلة.
إذن القرار أضيق مما يوحي به التسويق. إذا كنت تولّد بكميات كبيرة، فالتغيير في التسعير واقع عليك بالفعل. وإذا كنت تحتاج اللغات الجديدة أو نقل الجرس الصوتي، فقم بالترحيل وتحقق من الميزة على صوتك أنت أولاً. وإذا كنت تحتاج رقم جودة قابلاً للدفاع عنه، فانتظر حتى يظهر Qwen-Audio-3.1-TTS في ساحة استماع عمياء — فهذا هو الحدث الوحيد الذي سيحسم الأمر، وإلى أن يحدث، فإن الموقف الصادق هو أن النموذج الأحدث هو الأرخص والنموذج الأقدم هو المُثبَت.
