
Gemini 3.8 Live مقابل Qwen-Audio-3.1-TTS: نصفا حزمة صوتية واحدة، أُعيد تسعيرهما بفارق ثمانية أيام
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 36 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 181 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
Gemini 3.8 Live هو نموذج تحويل الكلام إلى كلام لدى Google، طُرح في 15 سبتمبر 2026 باسم gemini-3.8-live و gemini-3.8-live-extended-thinking على Live API. Qwen-Audio-3.1-TTS هو نموذج تحويل النص إلى كلام لدى Alibaba، أُعلن عنه في مؤتمر Apsara في هانغتشو في 23 سبتمبر 2026، أي بعد ثمانية أيام، مصحوبًا بخفض سعر يقارب 70% على تركيب الكلام. فجوة الثمانية أيام هذه هي السبب في أن هذه المقارنة تستحق القراءة الآن بدلًا من يوليو. لم يتغير شيء في دور المنتجين — أحدهما يستمع ويتحدث، والآخر يقرأ النص بصوت عالٍ — لكن نصفَي خط أنابيب صوتي جاهز للإنتاج أُعيد بناؤهما أو أُعيد تسعيرهما خلال أسبوعين فقط، والحسابات التي كانت تحسم هذه المواجهة تحركت بهدوء.
نصفان، يُحدَّثان بفارق ثمانية أيام بينهما.
ابدأ بالأمر الذي يجعل هذا الاقتران غير معتاد: النموذجان لا يتنافسان. فالمنتج الصوتي له فم وله أذن، وهذان النموذجان يمثلان واحدًا من كل منهما. يُغلق Gemini 3.8 Live الحلقة — إدخال صوت وفيديو، وإخراج صوت، مع التعامل مع المقاطعات، وتشغيل استدعاءات الأدوات تحت المحادثة. يأخذ Qwen-Audio-3.1-TTS سلسلة نصية وصوتًا مرجعيًا ويعيد أداءً. إنه فم أفضل مما هو في أي شيء آخر، وهو لا يحاول أن يكون أذنًا.
ما يجعل توقيت سبتمبر مثيرًا للاهتمام هو أن الإعلانين يستهدفان طرفين متقابلين من بند الميزانية نفسه. كان إطلاق Google في 15 سبتمبر قصة قدرات دون أي تحرك سعري مرتبط بها؛ أما إعلان Alibaba في 23 سبتمبر فكان في معظمه قصة هامش ربح، مع قدرات جديدة ترافقه. الفريق الذي بنى خطًا هجينًا في أغسطس أُعطي، خلال ثمانية أيام، سببًا لإعادة فحص كلا الجانبين — وقد أصبح أحد هذين الجانبين فقط أرخص.
ما الذي غيّره إصدار 3.1 فعليًا من جانب Qwen
لم تُطلق علي بابا نموذجًا واحدًا في 23 سبتمبر. يغطي جيل 3.1 خمس نقاط نهاية — Qwen-Audio-3.1-ASR وQwen-Audio-3.1-ASR-Next وQwen-Audio-3.1-TTS وQwen-Audio-3.1-TTS-Next وQwen-Audio-3.1-Realtime — وواحد فقط منها، وهو الطبقة العادية من TTS، يُعد بديلًا مباشرًا لأي شخص يستدعي بالفعل نموذج TTS 3.0.
في تلك الطبقة، تغيّرت ثلاثة أشياء، وواحد منها يمثل تكلفة ترحيل حقيقية. انتقل التحكم في الإلقاء من مفردات ثابتة من 86 وسمًا مضمّنًا إلى تعليمات باللغة الطبيعية: تصف المشاعر والوتيرة والأسلوب الذي تريده بدلًا من إدراج القوس الصحيح في الموضع الصحيح. وصل نقل الجرس الصوتي عبر اللغات، مما يتيح لصوت مرجعي واحد أن يحمل هويته عبر الماندرين والكانتونية والإنجليزية واليابانية. كما أصبح النموذج الآن يتحمّل الصوت المرجعي المشوّش أو ذا الصدى مباشرةً، دون خطوة منفصلة لإزالة الضوضاء. تغطية اللغات لم تتغيّر عند 16 لغة حسب ما أعلنه المورّد، بالإضافة إلى 20 منطقة لهجات صينية، و—هذا جدير بالتنبيه لأنه يُتغاضى عنه في مواضع أخرى—تقول مواد Alibaba نفسها إن طبقة 3.1 تضيف سبع لغات، وهو ما لا يتوافق مع الـ16 لغة التي أدرجتها التغطية المنشورة لجيل يوليو. اعتبر كلا العددين معلنًا من المورّد حتى تتحقق من اللغات المحددة التي تحتاجها بالرجوع إلى Model Studio.
المنتج الجديد حقًا في هذا الإصدار هو Qwen-Audio-3.1-TTS-Next، الذي يسميه Alibaba نموذج "Audiogen": تمريرة واحدة تنتج الصوت والمؤثرات الصوتية والأجواء الخلفية معًا، من أجل حوار متعدد المتحدثين، وتجميع البودكاست، والعمل على المشاهد. وهو مُدرج بسعر 0.848 دولار لكل مليون رمز إدخال و1.696 دولار لكل مليون رمز إخراج على عقدة بكين، بحد أقصى 3,000 حرف من الإدخال، و240 ثانية من الصوت المُولَّد للبودكاست و120 ثانية فيما عدا ذلك، وبمعدل ثلاثة طلبات في الثانية، ويقبل حتى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية. يتعامل مع الصينية والإنجليزية فقط. إذا كان خط معالجتك راويًا واحدًا يقرأ نصًا، فهذا المنتج غير ذي صلة بك؛ أما إذا كان يتكوّن من مذيعين اثنين وخلفية موسيقية، فهو سبب الاطلاع على هذا الإصدار من الأساس.
الدرزة هي ما تختاره في الواقع
لأن النموذجين لا يؤديان المهمة نفسها، فالقرار ليس منافسةً. إنه سؤال عن أين تضع نقطة التسليم، وكم أنت مستعد أن تدفع لجعل خط التماس غير مرئي.
ثمة معماريتان صادقتان. الأولى شبكة واحدة: يتولى Gemini 3.8 Live الدور كاملاً، فيسمع المتصل، ويقرر ما يقوله وينطق به، وأنت تقبل الصوت الذي يمنحك إياه — وهو صوت لا يمكنك استنساخه ولا وسمه بعلامتك التجارية. والثانية سلسلة متتالية: التعرّف، ثم الاستدلال، ثم Qwen-Audio-3.1-TTS كفم، يمنحك ألف صوت، بما في ذلك صوت سجّله موهوبك الخاص، على حساب زمن الاستجابة عبر حدود مورّدين اثنين أو ثلاثة، والتنغيم الذي يضيع عندما تُقسَّم الجملة عبر استدعاء API.
ينتهي الأمر بمعظم الفرق إلى امتلاك كليهما، وهذا ليس فشلًا في الجرأة. استخدم النموذج اللحظي حيث يكون زمن الاستجابة محسوسًا — المقاطعة، الإقرار، و"مم-هم" التي تخبر المتصل أنك ما زلت هناك — واستخدم نموذج التوليف حيث تُسمع الجودة: إعادة القراءة المطولة لسياسة، ورقم التأكيد الذي يُقرأ بوتيرة متأنية، وصوت العلامة التجارية الذي يجب أن يكون متطابقًا في كل مكالمة على حدة. النموذج الهجين هو الإجابة الصحيحة لفئة كبيرة من المنتجات. وهو أيضًا حيث يصبح نموذج التكلفة صعبًا، لأنك الآن تقيس وحدتين مختلفتين.

يُسعَّر لكل ساعة صوتية، وهي الوحدة الوحيدة التي تناسبهما معًا.
تتقاضى Google رسومًا على Live API بالدقيقة؛ وتتقاضى Alibaba رسومًا على مستويات Qwen TTS حسب الحرف وحسب الرمز المميز. ولمقارنتهما، عليك اختيار معيار توحيد، والمعيار الوحيد القابل للدفاع عنه للصوت هو ساعة الصوت المكتمل.
• القياس عند الإدخال — Gemini 3.8 Live لكل دقيقة من الصوت، 0.005 دولار إدخالًا و0.018 دولار إخراجًا مقابل Qwen-Audio-3.1-TTS لكل مليون حرف، مع فئة 3.0 Plus عند نحو 27.60 دولارًا وفئة Flash عند نحو 15 دولارًا قبل التخفيض، وفئة TTS Flash مسعّرة عند 1.5 يوان لكل مليون رمز إدخال و12 يوانًا لكل مليون رمز إخراج بعده
• القياس عند الإخراج — Gemini 3.8 Live محادثة ثنائية الاتجاه تكلّف نحو 1.38 دولار مقابل ساعة من الكلام بالوقت الفعلي بالسعر المعلن، قبل أي تخزين مؤقت، مقابل Qwen-Audio-3.1-TTS بث أحادي الاتجاه، مع فئة 3.1-Next عند 0.848 دولار لكل مليون رمز إدخال و1.696 دولار لكل مليون رمز إخراج على عقدة بكين
• يسمع المتصل — Gemini 3.8 Live نعم، إدخال صوتي ومرئي أصلي مقابل Qwen-Audio-3.1-TTS لا، نص داخل وصوت خارج
• الأصوات — Gemini 3.8 Live صوت واحد، غير قابل للاستنساخ، وغير قابل للربط بعلامة تجارية مقابل Qwen-Audio-3.1-TTS أكثر من ألف صوت مع استنساخ فوري (zero-shot) من صوت مرجعي مشوّش
• اللغات — Gemini 3.8 Live: 97 لغة وفق ما تعلنه الجهة المورّدة، مع التبديل في منتصف المحادثة مقابل Qwen-Audio-3.1-TTS: 16 لغة معلنة بالإضافة إلى 20 منطقة لهجات صينية، مع نقل الجرس الصوتي عبر الماندرين والكانتونية والإنجليزية واليابانية
• التحكم في الأداء — Gemini 3.8 Live: التوجيه وسياق المحادثة مقابل Qwen-Audio-3.1-TTS: تعليمات باللغة الطبيعية، لتحل محل 86 وسمًا مضمّنًا في الجيل 3.0
• تقييم مستقل — Gemini 3.8 Live: 82.6 على مؤشر Artificial Analysis Speech to Speech Index لنسخة Extended Thinking و76.0 للنسخة القياسية مقابل Qwen-Audio-3.1-TTS: لا شيء؛ أقرب رقم لـ Qwen هو 1,259 إيلو لفئة 3.0 Plus من الجيل السابق على Provider Voice Arena، وهو تقييم للسلف وليس لهذا الطراز
نسبة التخفيض المذكورة محسوبة مقابل أسعار تختلف حسب المنطقة والفئة، لذا فإن نسبة 70% المعلنة ليست وعدًا بشأن حجم استخدامك، كما نقلت Alibaba Cloud أيضًا النسخ الفوري على عقدة سنغافورة من القياس على أساس المدة إلى القياس على أساس الرموز — وهو أساس أقل قابلية للتنبؤ، لأن كلاً من الصمت والسياق متعدد الأدوار يضخم استهلاك الرموز. راجع بطاقة الأسعار الجديدة مقارنةً بتسجيلاتك الصوتية.

ما الذي لا تحسمه ترقية 3.1
إليك الجزء الذي يسهل الخطأ فيه في كلا الاتجاهين. تحسينات 3.1 لا تجعل Qwen-Audio-3.1-TTS مرشحًا للمهمة التي يؤديها Gemini 3.8 Live — فالتحكم القائم على التعليمات، وتحويل طابع الصوت، وتحمّل المدخلات الصاخبة كلها تجعله فمًا أفضل، ولا يمنحه أي منها أذنًا. وبالمثل، فإن موقع Gemini 3.8 Live في الاختبارات المرجعية لا يخبرك بأي شيء عمّا إذا كان صوت علامتك التجارية يصمد في جملة بالكانتونية.
هناك أيضًا ثغرة في الأدلة يجعل تخفيض السعر تجاهلها أكثر إغراءً. لا يمتلك Qwen-Audio-3.1-TTS أي تقييم مستقل. إن 1,259 Elo التي تظهر بجانب اسم Qwen في Provider Voice Arena تعود إلى Qwen-Audio-3.0-TTS-Plus، النموذج الذي يتم استبداله، وقد قيست على 1,447 عينة. ولا يوجد بعد صف النموذج اللاحق نفسه في Arena. إذا كانت عملية الاعتماد لديك تتطلب رقمًا من طرف ثالث — وبالنسبة لصوت علامة تجارية، يُفترض أن تفعل ذلك على الأرجح — فإن النموذج الأحدث هو الذي يخلو منه، والفئة الأرخص هي التي لا يمكنك الدفاع عنها بعد. الحدث الوحيد الذي قد يحسم هذا الأمر هو ظهور Qwen-Audio-3.1-TTS على لوحة استماع عمياء.
حيث يفيد مفتاح واحد وحيث لا يفيد
من السهل أن يفوت المرء أحد آثار الإصدار 3.1 لأنه يبدو كتفصيل من هندسة الأوامر لا كتفصيل من البنية التحتية. إن استبدال 86 وسمًا مثبتًا في الكود بتعليمات حرة الصياغة يحوّل توجيهات التسليم لديك إلى مخرجات نصية. أنت الآن تولّدها، وتضع لها إصدارات، وتعيد التحقق من كل واحد منها في ضوء تفسير النموذج الجديد — ونمط الفشل هو الانحراف، لا الخطأ، لأن صياغتين لعبارة «دافئ لكن غير عاطفي» لن يكون لهما الوقع نفسه.
تلك مشكلة استدلال نصي ملفوفة حول مسار معالجة الكلام، وهي المجال الذي نكون فيه مفيدين. لا يوجّه OrcaRouter النموذج Qwen-Audio-3.1-TTS ولا أي نموذج Qwen-Audio، كما لا نوجّه نقاط نهاية Gemini 3.8 Live أيضًا — لا يمكن استدعاء أي من شقّي هذه المنظومة عبرنا، ولا ينبغي قراءة أي شيء هنا كادعاء بأن ذلك ممكن. ما نوفره فعلًا هو الطبقة التي تكتب النص التوجيهي وتتحقق منه: qwen/qwen3.8-flash وgoogle/gemini-3.8-flash ضمن أكثر من 200 نموذج من مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح، مع لغة DSL للتوجيه تجمع عدة نماذج في استدعاء واحد وتحويل تلقائي عند الفشل عندما يتدهور أحد المصادر الأعلى. عندما تكون على وشك إعادة التحقق من عشرة آلاف مطالبة تسليم مقابل نموذج غيّر للتو طريقة قراءته لها، فإن توليد المتغيّرات وتقييمها من حيث الاتساق هو الجزء الذي ينبغي أن يكون عقدًا واحدًا، لا أربعة.
ما الذي يجب قياسه عندما تختار
ثلاث تجارب تُجيب أكثر من أي مجلس إدارة. مرّر صوتًا مرجعيًا واحدًا وفقرة واحدة من النص الخاص بك عبر Qwen-Audio-3.1-TTS، واستمع لترى ما إذا كان التحكم القائم على التعليمات يمنحك نفس الإلقاء مرتين — فهذا هو خطر الترحيل، وقياسه أرخص من التخطيط حوله. مرّر تسجيل مكالمة حقيقيًا مع ضجيج خلفيتك الخاص عبر Gemini 3.8 Live، وتحقق مما إذا كان تبادل الأدوار يصمد عندما يقاطع المتصل في منتصف كلمة — فهذا ما يحاول مؤشر الكلام-إلى-الكلام قياسه كميًا، وهو لا يصمد عند ملامسة خط هاتف حقيقي بموثوقية كافية ليُؤخذ على الثقة. وأجرِ الحساب على حجمك الخاص بالساعات الصوتية بدلًا من الوحدات التي يفوتر بها المورّدان، لأنه في هذا الاقتران تحديدًا لم يكن فرق السعر المتوقع بين "TTS الصيني الرخيص" و"Google flagship" يومًا بحجم ما يبدو، وبعد 23 سبتمبر أصبح أصغر مما كان.

مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
