
Gemini 3.8 TTS مقابل Qwen Audio 3.0 TTS: إجابتان مختلفتان عن "اجعلها تبدو صحيحة"
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
نقطة إيلو واحدة تفصل بين هذين الطرازين في ساحة الأصوات لمزودي Artificial Analysis، وهما يصلان إلى هناك عبر حل مشكلتين مختلفتين تمامًا. Qwen-Audio-3.0-TTS-Plus في المرتبة 3 بتقييم إيلو قدره 1,259 عبر 1,447 عيّنة و15 صوتًا في الساحة، وصدر في سبتمبر 2026 وبسعر مدرج قدره 27.60 دولارًا لكل مليون حرف. Gemini 3.8 Flash TTS في المرتبة 2 بتقييم 1,260 عبر 1,999 عيّنة و8 أصوات في الساحة، وصدر في 23 سبتمبر 2026 وبسعر مدرج قدره 33.00 دولارًا لكل مليون حرف. لا يمكن تمييزهما إحصائيًا، ويختلفان بنسبة عشرين بالمئة في السعر، ويستندان إلى نظريتين متعارضتين حول ما يجعل الكلام الاصطناعي جيدًا.
النظرية هي الجزء المثير. إجابة Qwen هي تحكم مضمّن: 86 وسم أداء تنثرها عبر النص كي يعرف النموذج أين يتنفس، وأين يشدّد، وأين يغيّر طبقة الصوت. أما إجابة Google فهي طبقة توجيه: تعليمات سطراً بسطر، وإخراج بمتحدثين اثنين، ومجموعة صغيرة من الإشارات غير اللفظية. إذا كنت قد بنيت بالفعل خط أنابيب يُصدر تعليقات شبيهة بـ SSML، فسيُناسبك أحد هذين ولن يُناسبك الآخر، وهذه التوافقية تهم أكثر من نقطة Elo واحدة.
أين يقع الاثنان فعليًا على اللوحة
تتطلب قراءة Provider Voice Arena بصدق النظر إلى الفواصل، وليس الرتب.
• كوين-أوديو-3.0-تي تي إس-بلس — المرتبة 3، إيلو 1,259، 1,447 عينة، 15 صوت ساحة، سبتمبر 2026، 27.6 دولار لكل مليون حرف.
• {{1}}Gemini 3.8 Flash TTS{{/1}} — المرتبة 2، إيلو 1,260، 1,999 عيّنة، 8 أصوات في الساحة، سبتمبر 2026، 33.0$ لكل مليون حرف.
• Cartesia Sonic 3.6 — المرتبة 1، إيلو 1,273، 1,757 عينة، 8 أصوات في الساحة، أغسطس 2026، 49.0 دولار لكل مليون حرف.
الثلاثة الأوائل في نطاق واحد. الفواصل المنشورة للاثنين الأوائل تمتد سبع عشرة نقطة على كلا الجانبين، وهو أوسع من الفارق الكامل بين الأول والثالث، لذا فإن الترتيب فيما بينها ليس دليلًا مستقرًا. ما تُثبته لوحة الصدارة هو أن الثلاثة جميعًا في المجموعة المتصدرة وأن لا شيء أدنى منها قريب — المرتبة 10، Gemini 3.1 Flash TTS، عند 1,199.
التباين الوحيد الجدير بالملاحظة هو عدد الأصوات في الساحة. يطرح Qwen 15 صوتًا مقابل 8 لـ Gemini، لذا فإن نتيجة Qwen هي متوسط على عيّنة أوسع من منتج المورّد نفسه. وهذا له وجهان: فهو تقدير أكثر إنصافًا لما يبدو عليه كتالوج Qwen عمومًا، ويمنح Qwen فرصًا أكثر لطرح صوت ضعيف يجرّ المتوسط نحو الأسفل. ولا يغيّر أيّ من التفسيرين الاستنتاج القائل إن الاثنين متعادلان.

86 وسم تسليم مقابل طبقة اتجاه
هذا هو الفرق الجوهري وهو الذي يحسم معظم عمليات التكامل.
تأتي Qwen-Audio-3.0-TTS مع 86 وسم إلقاء مضمّنًا — تعليقات توضيحية مدمجة في النص تتحكم في كيفية نطق جزء ما. إنه نهج قائم على الترميز: نصّك هو الذي يحمل الأداء. وهذا مألوف لأي شخص سبق له العمل مع SSML، ويتكامل جيدًا مع الأدوات التي تولّد النصوص برمجيًا، لأن سطح التحكم عبارة عن تحويل سلسلة نصية وليس استدعاءً لواجهة API.
Gemini 3.8 Flash TTS يسلك المسار الآخر. أنت توجّه إلقاء سطر كما توجّه ممثلًا — الوتيرة، والتشديد، والنبرة العاطفية — كتعليمة منفصلة بدلًا من ترميز مضمّن. يمكن إخراج مشاهد بمتحدثين ضمن استدعاء واحد. وتُكتب مجموعة صغيرة من الإشارات غير اللفظية في النص: <laughs>، <sigh>، <gasp> كإشارات مضمّنة، إضافة إلى |mhm| و|yeah| لأصوات التفاعل الخلفية.
إذن، كلا النموذجين يقبلان التعليق التوضيحي داخل النص؛ الفرق هو حجم المفردات والمكان الذي يوجد فيه باقي التحكم. نموذج Qwen أوسع وأكثر تسطحًا — 86 وسمًا، كلها في النص. نموذج Google أضيق في النص وأوسع خارجه، مع اتجاه الإلقاء وترتيب المتحدث كمعاملات على مستوى الاستدعاء. إذا كنت تنقل نظامًا يصدر بالفعل ترميزًا مضمّنًا غنيًا، فإن Qwen هو النقل الأقصر. إذا كنت تبني منطق الاتجاه في كود التطبيق على أي حال، فإن تقسيم Google أنظف.

تغطية اللغات مقابل تغطية اللهجات
أرقام التغطية ليست قابلة للمقارنة، والمقارنة بينها بشكل ساذج خطأ.
يغطي Gemini 3.8 Flash TTS 130 لغة، تُكتشف تلقائيًا من النص؛ ويغطي Flash-Lite TTS 101 لغة. هذا اتساع عبر العائلات اللغوية، وهو ما تريده لعملية توطين يجب أن تصل إلى ذيل طويل من الأسواق.
يغطي Qwen-Audio-3.0-TTS ست عشرة لغة بالإضافة إلى 20 منطقة لهجات صينية. هذا عمق داخل عائلة لغوية واحدة. إن عشرين منطقة لهجات ليست رقمًا أصغر من 130 لغة كما تبدو في الظاهر — بل هي نوع مختلف من الادعاء، وبالنسبة لمنتج يخدم مستخدمين ناطقين بالصينية عبر مناطق البر الرئيسي، فهي الأكثر فائدة. النموذج الذي يضم 130 لغة وصوتًا واحدًا للغة الماندرين لا يخدم مستخدمًا في سيتشوان بالطريقة التي يخدمه بها نموذج يضم 20 منطقة لهجات.
ما يهم يعتمد كليًا على جمهورك. إذا كان متطلبك هو «مقبول على الأقل في عشرين سوقًا»، فـ Gemini. وإذا كان هو «الصواب فعلًا في السوق الصيني»، فـ Qwen.
السعر، وما يخفيه الرقم لكل حرف
• Qwen-Audio-3.0-TTS-Plus — 27.60 دولارًا لكل مليون حرف على الأساس المُوحَّد الخاص بلوحة الصدارة؛ أما نسخة Flash فيبلغ سعرها نحو 15 دولارًا لكل مليون حرف مع زمن استجابة مُعلَن لأول حزمة يبلغ نحو 300 مللي ثانية.
• Gemini 3.8 Flash TTS — 33.00 دولارًا لكل مليون حرف بعد التطبيع؛ وتُفوتر من Google بمعدل 0.50 دولار لكل مليون رمز نصي مُدخل و9.00 دولارات لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم 1.00 دولار و18.00 دولارًا.
• Gemini 3.8 Flash-Lite TTS — 22.10 دولارًا لكل مليون حرف مُطبّع في المرتبة 6 بتصنيف إيلو 1,235؛ وتُحتسب بتكلفة 6.00 دولارات لكل مليون رمز صوتي حتى 31 ديسمبر 2026.
كلا الرقمين لكل حرف هما عمليات تطبيع من Artificial Analysis، وليسا أسعار قائمة المورّدين — إذ تقدّم Qwen الفوترة عبر Alibaba Cloud Model Studio وتقدّم Google الفوترة بالوحدات الرمزية (tokens)، ولا ينشر أي منهما سعرًا لكل حرف لهذين النموذجين. استخدمهما للنسبة، وهي نحو 1.2 مرة لصالح Qwen، وليس كعروض أسعار.
تتباين الطبقات في الشكل. ينقسم Qwen إلى Plus وFlash، حيث تضحي طبقة Flash بالجودة مقابل ادعاء زمن أول حزمة يبلغ ~300 مللي ثانية. ينقسم Google إلى Flash وFlash-Lite، ثم يتفرع أكثر إلى Standard، وBatch، وFlex، وPriority — 4.50 دولار، و9.00 دولار، و16.20 دولار لكل مليون رمز صوتي على Flash TTS. يكافئ نموذج Google تصنيف عبء العمل الخاص بك؛ بينما يكافئ Qwen اختيار طبقة جودة من البداية.
التوافر هو الفرق الحقيقي الآخر. يتوفر Gemini 3.8 Flash TTS بشكل عام على Gemini Developer API. أما Qwen-Audio-3.0-TTS فهو مغلق ومستضاف فقط، ويُقدَّم عبر Alibaba Cloud Model Studio من دون أوزان مفتوحة. إذا كنت بحاجة إلى تشغيل النموذج بنفسك، فلا هذا ولا ذاك مناسب لك — لكن إذا كانت بنيتك التحتية موجودة بالفعل على Alibaba Cloud، فإن نموذج Qwen هو الذي لا توجد بشأنه مسألة خروج بيانات تحتاج إلى حل.
ادعاءات الموردين من كلا الجانبين
لا يملك أيٌّ من النموذجين معيار قياس مستقلًا خارج الساحة، وقد نشر كلا البائعين مزاعم ينبغي تصنيفها على هذا النحو.
نتائج Google الخاصة بـ Gemini 3.8 Flash TTS: المركز الأول في Hume AI Voice Design Benchmark عند 71.4، والمركز الأول في نمذجة اللكنات عند 60.8، والمركزان الأول والثاني في Hume Overall Quality Index لـ Flash وFlash-Lite، وأعلى مراكز التفضيل الأعمى المُدّعاة باللغة اليابانية والبرتغالية البرازيلية والفيتنامية والعربية الفصحى الحديثة والإسبانية المكسيكية والهندية. التشغيلات ليست علنية.
ما يخص Alibaba، بخصوص Qwen-Audio-3.0-TTS: نظام الإلقاء ذو 86 وسمًا، و20 منطقة لهجية، وقيمة الحزمة الأولى البالغة ~300 مللي ثانية في نسخة Flash. وأيضًا غير مُعاد إنتاجه.
تصنيف Elo للساحة هو الرقم الوحيد المتعلق بالجودة الذي جُمع بشكل مستقل في هذه المقالة، وهو يقول إن الاثنين متعادلان في قمة لوحة الصدارة.

ما الذي يضيفه Gemini ولا يضيفه Qwen
إنشاء الأصوات هو الفجوة الأوضح. يدعم Gemini 3.8 Flash TTS تصميم الأصوات انطلاقًا من وصف باللغة الطبيعية، واستنساخ الصوت من عيّنة مدتها 30 ثانية، مع التحقق من الموافقة وعلامة SynthID المائية بالإضافة إلى بيانات اعتماد C2PA على المخرجات. تأتي الأصوات المخصصة في شكلين: 200 صوت ذي حالة لكل مشروع بمدة صلاحية سنة واحدة، أو أصوات بلا حالة يتم الوصول إليها عبر voicekey_...، وهو مقبض تنتهي صلاحيته بعد سبعة أيام. إعادة مزج الأصوات مدرجة كقادم قريبًا.
التحكم في صيغة الإخراج هو الثاني. WAV 24 kHz أحادي 16-بت PCM موقّع على نقطة النهاية الأحادية، وPCM بلا رأس (audio/l16) على نقطة النهاية المتدفقة، إضافة إلى audio/mulaw وaudio/alaw ومعدل عينات قابل للتهيئة. في الأعمال المتصلة بالاتصالات الهاتفية، يزيل دعم mulaw خطوة إعادة الترميز.
أي واحد يجب الاتصال به؟
اختر Qwen-Audio-3.0-TTS إذا كان مستخدموك ناطقين بالصينية وكانت تغطية اللهجات هي المطلوب، أو إذا كنت تريد مفردات ترميز مضمنة غنية يمكن لمولّدك إخراجها مباشرة، أو إذا كنت بالفعل على Alibaba Cloud وتريد أقصر طريق إلى نقطة نهاية عاملة. وهو أيضًا الأرخص بين الاثنين على الأساس المعياري، وتكون نسخة Flash أرخص مرة أخرى إذا كان وصول أول حزمة خلال ~300 ms مقبولًا.
اختر Gemini 3.8 Flash TTS إذا كنت بحاجة إلى اتساع في العديد من اللغات بدلًا من العمق في لغة واحدة، أو إذا كنت بحاجة إلى إنشاء صوت معيّن أو نسخه، أو إذا كنت بحاجة إلى إخراج بصيغة mulaw أو alaw، أو إذا كان "التوفر العام بدلًا من الاستضافة الحصرية" متطلبًا من متطلبات الشراء.
لا يُعد أيٌّ من الخيارين اختيارًا سيئًا، ولا يتفوق أحدهما بوضوح — وهذا هو المغزى من فارق نقطة إيلو واحدة. القرار يتعلق بالتوافق، لا بالجودة.
وهذا أيضًا هو سبب عدم الالتزام الجازم بأيٍّ منهما في الوقت الحالي. يمنحك OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش إضافي، لذا يصل أي تغيير في الأسعار من أي من المختبرين إلى فاتورتك في اليوم نفسه بدلًا من موعد التجديد، كما أن التبديل التلقائي عند الفشل يعني أن نقطة نهاية تركيب صوتي تتعثر تحت الحمل تنتقل إلى أخرى بدلًا من إسقاط الطلب. نحن لا نستضيف Qwen-Audio-3.0-TTS — فهي تُقدَّم عبر Alibaba Cloud Model Studio — ولا نستضيف نقاط نهاية Gemini 3.8 TTS، التي تأتي من واجهة Google البرمجية. ما نوفّره هو طبقة النص والتوجيه الذي يعلوها، وهو ما يتيح لك تشغيل كليهما على حركة مرور حقيقية لمدة شهر قبل أن تختار.
الرقم الذي يجب مراقبته هو المراجعة القادمة لـ Arena. مع 1,447 عينة على Qwen و1,999 على Gemini، لا تزال الفترتان واسعتين بما يكفي لأن شهرًا واحدًا من الأصوات قد يفصل بينهما — أو يؤكد أن التعادل هو الإجابة.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
