بطاقة رئيسية مُولّدة لـ 'Gemini 3.8 Live مقابل Qwen-Audio-3.1-TTS' على خلفية بيضاء مع لمسات متدرجة زرقاء وسماوية ناعمة. تقع لوحتان تحت عنوان نصّه 'نصفان، تم تحديثهما بفارق ثمانية أيام'. تغطي اللوحة اليسرى '15 سبتمبر 2026 — Gemini 3.8 Live وExtended Thinking على Live API'. تغطي اللوحة اليمنى '23 سبتمبر 2026 — Qwen-Audio-3.1-TTS في Apsara، مع خفض التوليف بنسبة ~70%'. يقول سطر التذييل 'يلتقيان في منتصف خط الأنابيب، لا في المهمة نفسها.' تم تركيب شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

Gemini 3.8 Live مقابل Qwen-Audio-3.1-TTS: نصفا حزمة صوتية واحدة، أُعيد تسعيرهما بفارق ثمانية أيام

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Gemini 3.8 Live هو نموذج تحويل الكلام إلى كلام لدى Google، طُرح في 15 سبتمبر 2026 باسم gemini-3.8-live و gemini-3.8-live-extended-thinking على Live API. Qwen-Audio-3.1-TTS هو نموذج تحويل النص إلى كلام لدى Alibaba، أُعلن عنه في مؤتمر Apsara في هانغتشو في 23 سبتمبر 2026، أي بعد ثمانية أيام، مصحوبًا بخفض سعر يقارب 70% على تركيب الكلام. فجوة الثمانية أيام هذه هي السبب في أن هذه المقارنة تستحق القراءة الآن بدلًا من يوليو. لم يتغير شيء في دور المنتجين — أحدهما يستمع ويتحدث، والآخر يقرأ النص بصوت عالٍ — لكن نصفَي خط أنابيب صوتي جاهز للإنتاج أُعيد بناؤهما أو أُعيد تسعيرهما خلال أسبوعين فقط، والحسابات التي كانت تحسم هذه المواجهة تحركت بهدوء.

نصفان، يُحدَّثان بفارق ثمانية أيام بينهما.

ابدأ بالأمر الذي يجعل هذا الاقتران غير معتاد: النموذجان لا يتنافسان. فالمنتج الصوتي له فم وله أذن، وهذان النموذجان يمثلان واحدًا من كل منهما. يُغلق Gemini 3.8 Live الحلقة — إدخال صوت وفيديو، وإخراج صوت، مع التعامل مع المقاطعات، وتشغيل استدعاءات الأدوات تحت المحادثة. يأخذ Qwen-Audio-3.1-TTS سلسلة نصية وصوتًا مرجعيًا ويعيد أداءً. إنه فم أفضل مما هو في أي شيء آخر، وهو لا يحاول أن يكون أذنًا.

ما يجعل توقيت سبتمبر مثيرًا للاهتمام هو أن الإعلانين يستهدفان طرفين متقابلين من بند الميزانية نفسه. كان إطلاق Goog​le في 15 سبتمبر قصة قدرات دون أي تحرك سعري مرتبط بها؛ أما إعلان Aliba​ba في 23 سبتمبر فكان في معظمه قصة هامش ربح، مع قدرات جديدة ترافقه. الفريق الذي بنى خطًا هجينًا في أغسطس أُعطي، خلال ثمانية أيام، سببًا لإعادة فحص كلا الجانبين — وقد أصبح أحد هذين الجانبين فقط أرخص.

ما الذي غيّره إصدار 3.1 فعليًا من جانب Qwen

لم تُطلق علي بابا نموذجًا واحدًا في 23 سبتمبر. يغطي جيل 3.1 خمس نقاط نهاية — Qwen-Audio-3.1-ASR وQwen-Audio-3.1-ASR-Next وQwen-Audio-3.1-TTS وQwen-Audio-3.1-TTS-Next وQwen-Audio-3.1-Realtime — وواحد فقط منها، وهو الطبقة العادية من TTS، يُعد بديلًا مباشرًا لأي شخص يستدعي بالفعل نموذج TTS 3.0.

في تلك الطبقة، تغيّرت ثلاثة أشياء، وواحد منها يمثل تكلفة ترحيل حقيقية. انتقل التحكم في الإلقاء من مفردات ثابتة من 86 وسمًا مضمّنًا إلى تعليمات باللغة الطبيعية: تصف المشاعر والوتيرة والأسلوب الذي تريده بدلًا من إدراج القوس الصحيح في الموضع الصحيح. وصل نقل الجرس الصوتي عبر اللغات، مما يتيح لصوت مرجعي واحد أن يحمل هويته عبر الماندرين والكانتونية والإنجليزية واليابانية. كما أصبح النموذج الآن يتحمّل الصوت المرجعي المشوّش أو ذا الصدى مباشرةً، دون خطوة منفصلة لإزالة الضوضاء. تغطية اللغات لم تتغيّر عند 16 لغة حسب ما أعلنه المورّد، بالإضافة إلى 20 منطقة لهجات صينية، و—هذا جدير بالتنبيه لأنه يُتغاضى عنه في مواضع أخرى—تقول مواد Alibaba نفسها إن طبقة 3.1 تضيف سبع لغات، وهو ما لا يتوافق مع الـ16 لغة التي أدرجتها التغطية المنشورة لجيل يوليو. اعتبر كلا العددين معلنًا من المورّد حتى تتحقق من اللغات المحددة التي تحتاجها بالرجوع إلى Model Studio.

المنتج الجديد حقًا في هذا الإصدار هو Qwen-Audio-3.1-TTS-Next، الذي يسميه Alibaba نموذج "Audiogen": تمريرة واحدة تنتج الصوت والمؤثرات الصوتية والأجواء الخلفية معًا، من أجل حوار متعدد المتحدثين، وتجميع البودكاست، والعمل على المشاهد. وهو مُدرج بسعر 0.848 دولار لكل مليون رمز إدخال و1.696 دولار لكل مليون رمز إخراج على عقدة بكين، بحد أقصى 3,000 حرف من الإدخال، و240 ثانية من الصوت المُولَّد للبودكاست و120 ثانية فيما عدا ذلك، وبمعدل ثلاثة طلبات في الثانية، ويقبل حتى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية. يتعامل مع الصينية والإنجليزية فقط. إذا كان خط معالجتك راويًا واحدًا يقرأ نصًا، فهذا المنتج غير ذي صلة بك؛ أما إذا كان يتكوّن من مذيعين اثنين وخلفية موسيقية، فهو سبب الاطلاع على هذا الإصدار من الأساس.

الدرزة هي ما تختاره في الواقع

لأن النموذجين لا يؤديان المهمة نفسها، فالقرار ليس منافسةً. إنه سؤال عن أين تضع نقطة التسليم، وكم أنت مستعد أن تدفع لجعل خط التماس غير مرئي.

ثمة معماريتان صادقتان. الأولى شبكة واحدة: يتولى Gemini 3.8 Live الدور كاملاً، فيسمع المتصل، ويقرر ما يقوله وينطق به، وأنت تقبل الصوت الذي يمنحك إياه — وهو صوت لا يمكنك استنساخه ولا وسمه بعلامتك التجارية. والثانية سلسلة متتالية: التعرّف، ثم الاستدلال، ثم Qwen-Audio-3.1-TTS كفم، يمنحك ألف صوت، بما في ذلك صوت سجّله موهوبك الخاص، على حساب زمن الاستجابة عبر حدود مورّدين اثنين أو ثلاثة، والتنغيم الذي يضيع عندما تُقسَّم الجملة عبر استدعاء API.

ينتهي الأمر بمعظم الفرق إلى امتلاك كليهما، وهذا ليس فشلًا في الجرأة. استخدم النموذج اللحظي حيث يكون زمن الاستجابة محسوسًا — المقاطعة، الإقرار، و"مم-هم" التي تخبر المتصل أنك ما زلت هناك — واستخدم نموذج التوليف حيث تُسمع الجودة: إعادة القراءة المطولة لسياسة، ورقم التأكيد الذي يُقرأ بوتيرة متأنية، وصوت العلامة التجارية الذي يجب أن يكون متطابقًا في كل مكالمة على حدة. النموذج الهجين هو الإجابة الصحيحة لفئة كبيرة من المنتجات. وهو أيضًا حيث يصبح نموذج التكلفة صعبًا، لأنك الآن تقيس وحدتين مختلفتين.

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

يُسعَّر لكل ساعة صوتية، وهي الوحدة الوحيدة التي تناسبهما معًا.

تتقاضى Google رسومًا على Live API بالدقيقة؛ وتتقاضى Alibaba رسومًا على مستويات Qwen TTS حسب الحرف وحسب الرمز المميز. ولمقارنتهما، عليك اختيار معيار توحيد، والمعيار الوحيد القابل للدفاع عنه للصوت هو ساعة الصوت المكتمل.

• القياس عند الإدخال — Gemini 3.8 Live لكل دقيقة من الصوت، 0.005 دولار إدخالًا و0.018 دولار إخراجًا مقابل Qwen-Audio-3.1-TTS لكل مليون حرف، مع فئة 3.0 Plus عند نحو 27.60 دولارًا وفئة Flash عند نحو 15 دولارًا قبل التخفيض، وفئة TTS Flash مسعّرة عند 1.5 يوان لكل مليون رمز إدخال و12 يوانًا لكل مليون رمز إخراج بعده
• القياس عند الإخراج — Gemini 3.8 Live محادثة ثنائية الاتجاه تكلّف نحو 1.38 دولار مقابل ساعة من الكلام بالوقت الفعلي بالسعر المعلن، قبل أي تخزين مؤقت، مقابل Qwen-Audio-3.1-TTS بث أحادي الاتجاه، مع فئة 3.1-Next عند 0.848 دولار لكل مليون رمز إدخال و1.696 دولار لكل مليون رمز إخراج على عقدة بكين
• يسمع المتصل — Gemini 3.8 Live نعم، إدخال صوتي ومرئي أصلي مقابل Qwen-Audio-3.1-TTS لا، نص داخل وصوت خارج
• الأصوات — Gemini 3.8 Live صوت واحد، غير قابل للاستنساخ، وغير قابل للربط بعلامة تجارية مقابل Qwen-Audio-3.1-TTS أكثر من ألف صوت مع استنساخ فوري (zero-shot) من صوت مرجعي مشوّش
• اللغات — Gemini 3.8 Live: 97 لغة وفق ما تعلنه الجهة المورّدة، مع التبديل في منتصف المحادثة مقابل Qwen-Audio-3.1-TTS: 16 لغة معلنة بالإضافة إلى 20 منطقة لهجات صينية، مع نقل الجرس الصوتي عبر الماندرين والكانتونية والإنجليزية واليابانية
• التحكم في الأداء — Gemini 3.8 Live: التوجيه وسياق المحادثة مقابل Qwen-Audio-3.1-TTS: تعليمات باللغة الطبيعية، لتحل محل 86 وسمًا مضمّنًا في الجيل 3.0
• تقييم مستقل — Gemini 3.8 Live: 82.6 على مؤشر Artificial Analysis Speech to Speech Index لنسخة Extended Thinking و76.0 للنسخة القياسية مقابل Qwen-Audio-3.1-TTS: لا شيء؛ أقرب رقم لـ Qwen هو 1,259 إيلو لفئة 3.0 Plus من الجيل السابق على Provider Voice Arena، وهو تقييم للسلف وليس لهذا الطراز

نسبة التخفيض المذكورة محسوبة مقابل أسعار تختلف حسب المنطقة والفئة، لذا فإن نسبة 70% المعلنة ليست وعدًا بشأن حجم استخدامك، كما نقلت Aliba​ba Cloud أيضًا النسخ الفوري على عقدة سنغافورة من القياس على أساس المدة إلى القياس على أساس الرموز — وهو أساس أقل قابلية للتنبؤ، لأن كلاً من الصمت والسياق متعدد الأدوار يضخم استهلاك الرموز. راجع بطاقة الأسعار الجديدة مقارنةً بتسجيلاتك الصوتية.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

ما الذي لا تحسمه ترقية 3.1

إليك الجزء الذي يسهل الخطأ فيه في كلا الاتجاهين. تحسينات 3.1 لا تجعل Qwen-Audio-3.1-TTS مرشحًا للمهمة التي يؤديها Gemini 3.8 Live — فالتحكم القائم على التعليمات، وتحويل طابع الصوت، وتحمّل المدخلات الصاخبة كلها تجعله فمًا أفضل، ولا يمنحه أي منها أذنًا. وبالمثل، فإن موقع Gemini 3.8 Live في الاختبارات المرجعية لا يخبرك بأي شيء عمّا إذا كان صوت علامتك التجارية يصمد في جملة بالكانتونية.

هناك أيضًا ثغرة في الأدلة يجعل تخفيض السعر تجاهلها أكثر إغراءً. لا يمتلك Qwen-Audio-3.1-TTS أي تقييم مستقل. إن 1,259 Elo التي تظهر بجانب اسم Qwen في Provider Voice Arena تعود إلى Qwen-Audio-3.0-TTS-Plus، النموذج الذي يتم استبداله، وقد قيست على 1,447 عينة. ولا يوجد بعد صف النموذج اللاحق نفسه في Arena. إذا كانت عملية الاعتماد لديك تتطلب رقمًا من طرف ثالث — وبالنسبة لصوت علامة تجارية، يُفترض أن تفعل ذلك على الأرجح — فإن النموذج الأحدث هو الذي يخلو منه، والفئة الأرخص هي التي لا يمكنك الدفاع عنها بعد. الحدث الوحيد الذي قد يحسم هذا الأمر هو ظهور Qwen-Audio-3.1-TTS على لوحة استماع عمياء.

حيث يفيد مفتاح واحد وحيث لا يفيد

من السهل أن يفوت المرء أحد آثار الإصدار 3.1 لأنه يبدو كتفصيل من هندسة الأوامر لا كتفصيل من البنية التحتية. إن استبدال 86 وسمًا مثبتًا في الكود بتعليمات حرة الصياغة يحوّل توجيهات التسليم لديك إلى مخرجات نصية. أنت الآن تولّدها، وتضع لها إصدارات، وتعيد التحقق من كل واحد منها في ضوء تفسير النموذج الجديد — ونمط الفشل هو الانحراف، لا الخطأ، لأن صياغتين لعبارة «دافئ لكن غير عاطفي» لن يكون لهما الوقع نفسه.

تلك مشكلة استدلال نصي ملفوفة حول مسار معالجة الكلام، وهي المجال الذي نكون فيه مفيدين. لا يوجّه OrcaRouter النموذج Qwen-Audio-3.1-TTS ولا أي نموذج Qwen-Audio، كما لا نوجّه نقاط نهاية Gemini 3.8 Live أيضًا — لا يمكن استدعاء أي من شقّي هذه المنظومة عبرنا، ولا ينبغي قراءة أي شيء هنا كادعاء بأن ذلك ممكن. ما نوفره فعلًا هو الطبقة التي تكتب النص التوجيهي وتتحقق منه: qwen/qwen3.8-flash وgoogle/gemini-3.8-flash ضمن أكثر من 200 نموذج من مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح، مع لغة DSL للتوجيه تجمع عدة نماذج في استدعاء واحد وتحويل تلقائي عند الفشل عندما يتدهور أحد المصادر الأعلى. عندما تكون على وشك إعادة التحقق من عشرة آلاف مطالبة تسليم مقابل نموذج غيّر للتو طريقة قراءته لها، فإن توليد المتغيّرات وتقييمها من حيث الاتساق هو الجزء الذي ينبغي أن يكون عقدًا واحدًا، لا أربعة.

ما الذي يجب قياسه عندما تختار

ثلاث تجارب تُجيب أكثر من أي مجلس إدارة. مرّر صوتًا مرجعيًا واحدًا وفقرة واحدة من النص الخاص بك عبر Qwen-Audio-3.1-TTS، واستمع لترى ما إذا كان التحكم القائم على التعليمات يمنحك نفس الإلقاء مرتين — فهذا هو خطر الترحيل، وقياسه أرخص من التخطيط حوله. مرّر تسجيل مكالمة حقيقيًا مع ضجيج خلفيتك الخاص عبر Gemini 3.8 Live، وتحقق مما إذا كان تبادل الأدوار يصمد عندما يقاطع المتصل في منتصف كلمة — فهذا ما يحاول مؤشر الكلام-إلى-الكلام قياسه كميًا، وهو لا يصمد عند ملامسة خط هاتف حقيقي بموثوقية كافية ليُؤخذ على الثقة. وأجرِ الحساب على حجمك الخاص بالساعات الصوتية بدلًا من الوحدات التي يفوتر بها المورّدان، لأنه في هذا الاقتران تحديدًا لم يكن فرق السعر المتوقع بين "TTS الصيني الرخيص" و"Goog​le flagship" يومًا بحجم ما يبدو، وبعد 23 سبتمبر أصبح أصغر مما كان.

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا