Breeze TTS 2 — الرائد الجديد في TTS بأوزان مفتوحة بتقييم 1,215 Elo. رسم توضيحي مُعاد توليده.
Guides & Insights

Breeze TTS 2: الرائد الجديد في TTS بأوزان مفتوحة بتقييم 1,215 إيلو

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Breeze TTS 2 هو الآن النموذج الأعلى ترتيبًا بين نماذج تحويل النص إلى كلام مفتوحة الأوزان على منصة Provider Voices Speech Arena التابعة لـ Artificial Analysis، حيث يحمل 1,215 نقطة Elo — متقدمًا بفارق 90 نقطة عن القائد السابق بين النماذج مفتوحة الأوزان، Fish Audio S2 Pro، ومصنفًا في المرتبة السادسة إجمالًا من بين أكثر من 100 نظام مُقيَّم. يُعد هذا الإدراج أول تأكيد مستقل لما ادعته BreezeBlue منذ كشفت عن النموذج في منتصف أغسطس 2026: أن نموذجًا صوتيًا عمره أسبوعان من شركة ناشئة تضم نحو 15 شخصًا يمكنه الجلوس بجانب أحدث التقنيات التجارية في مجال تحويل النص إلى كلام. صدرت الأوزان المفتوحة على Hugging Face في 25 أغسطس 2026، وجاءت نتيجة الساحة خلال يوم واحد. ومهما يكن ما سيتحول إليه Breeze TTS 2، فإنه لم يعد مجرد وعد من البائع — بل أصبح يملك نقاط Elo تثبت ذلك.

ما الذي حدث بالفعل، بالترتيب

الجدول الزمني مهم هنا، لأنه يفسر لماذا يأتي منشور "لوحة صدارة الأوزان المفتوحة" من شركة لم يسمع بها معظم الناس قبل ثلاثة أسابيع. تأسست BreezeBlue على يد يانغ بين، المؤسس التقني المشارك السابق لأحد مختبرات الذكاء الاصطناعي الرائدة في الصين، بجولة تمويل أولية بقيمة 6 ملايين دولار قادتها Yuanjing Capital وRedpoint China. مر النموذج بثلاث مراحل واضحة:

• 7 أغسطس 2026 — نشرت BreezeBlue مجموعة معايير خاصة بها لتحويل النص إلى كلام لتقييم تصميم الصوت واتجاه الصوت وزمن الاستجابة على Hugging Face.

• 16–17 أغسطس 2026 — أعلنت الشركة رسميًا عن إطلاق Breeze TTS 2 كنموذج صوتي رئيسي في الوقت الفعلي للوسائط التفاعلية، وفتحت واجهة برمجة تطبيقات مستضافة بسعر 34 دولارًا لكل مليون حرف.

• 25 أغسطس 2026 — تم فتح مصدر الأوزان ورمز الاستدلال الخاص بـ PyTorch على Hugging Face باسم BreezeBlue/Breeze-TTS-2، وهو نموذج يحوي 3 مليارات معلمة، بموجب رخصة بحثية وغير تجارية.

كان تصنيف Artificial Analysis Provider Voices متاحًا خلال أيام من إصدار الأوزان المفتوحة. لأن الحلبة تقيّم النماذج عبر استماع أعمى جنبًا إلى جنب، فإن 1,215 Elo ليس معيارًا أجرته BreezeBlue على نفسها — بل هو الحكم المتراكم من المستمعين الذين يقارنون عينات حقيقية، وهو بالضبط ما يفتقر إليه نموذج بهذا الصغر.

لوحة النتائج

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• ترتيب الساحة — #6 إجمالًا على Provider Voices؛ و#1 بين جميع نماذج الأوزان المفتوحة، متقدمًا على Fish Audio S2 Pro (1,125 Elo).

• Elo — 1,215، مع فاصل ثقة 95% يبلغ حوالي ±17 (Artificial Analysis، اعتبارًا من أواخر أغسطس 2026).

• اللغات — 50، وفقًا لـ BreezeBlue؛ بطاقة النموذج موسومة بالإنجليزية والصينية.

• السعر — 34 دولارًا لكل مليون حرف على نقطة النهاية المستضافة لدى BreezeBlue؛ الأوزان المفتوحة مجانية للتنزيل ولكنها تحمل ترخيصًا غير تجاري.

• السرعة — حوالي 45 حرفًا في الثانية وفق قياسات Artificial Analysis — أبطأ من عدة منافسين، وهو ما يهم في المهام الطويلة.

• زمن الاستجابة — زمن استجابة للبث أقل من 40 مللي ثانية، وفقًا لـ BreezeBlue (كما ذُكر من قِبل البائع، ولم يتم قياسه بشكل مستقل).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

ما الذي يفعله Breeze TTS 2 بشكل مختلف فعليًا

يحصل Elo على العنوان الرئيسي، لكن ادعاء المنتج أكثر إثارة للاهتمام من النتيجة. تم بناء Breeze TTS 2 حول فكرتين تعاملهما معظم نماذج تحويل النص إلى كلام كأفكار ثانوية: تصميم الصوت وتوجيه الصوت. تصميم الصوت يتم بدون عينات سابقة وبدون مرجع — تصف صوتًا بلغة طبيعية ("راوٍ دافئ في منتصف الأربعينيات مع لكنة جنوبية خفيفة وروح دعابة جافة") ويولّد النموذج ذلك الصوت دون تسجيل في الاستوديو أو مقطع مرجعي. توجيه الصوت يفصل نبرة المتحدث عن نية الأداء، لذا يمكنك جعل الجملة تبدو ساخرة أو خافتة أو متسرعة دون أن ينزلق النموذج إلى شخصية مختلفة. تقول BreezeBlue إن نفس هوية المتحدث تبقى بعد التحول، كما يذكر معيار توجيه الصوت الخاص بها تشابهًا للمتحدث بقيمة 0.67 SPK_SIM (وفقًا لما أبلغ عنه البائع).

تشير هاتان القدرتان إلى السوق المستهدفة من Breeze TTS 2. المواد الصحفية واضحة: شخصيات ألعاب الفيديو، الرفقاء الرقميون، السرد القصصي، الدراما الإذاعية، والمذيعون الافتراضيون — محتوى صوتي طويل الشكل، مدفوع بالأدوار، متعدد الشخصيات، وليس مجرد واجهة برمجة تطبيقات أخرى للتعليق الصوتي. تُصدر الشركة مكتبة أصوات مصاحبة تُدعى Voice Galaxy تضم أكثر من 15,000 صوت شخصية من إبداع المجتمع والاستوديوهات، والشريط التجريبي لـ BreezeBlue هو دراما إذاعية للمعجبين متعددة الشخصيات تمتد لأكثر من عشر دقائق. وفي معاييرها المنشورة ذاتيًا (مقدمة من البائع، وغير مُعاد إنتاجها)، تدّعي Breeze TTS 2 أنها تحتل المركز #1 في معيار Voice Design لتحويل النص إلى كلام، بدرجة Role Fit تبلغ 78.02 مقابل 72.78 لـ MiMo-V2.5-TTS، ومؤشر Voice Direction المركب يبلغ 4.25.

العلامة النجمية للترخيص

قبل أن تقوم عبارة «الأوزان المفتوحة» بالكثير من العمل التسويقي، اقرأ بطاقة النموذج. Breeze TTS 2 هو نموذج بمعلمات 3B، وبتنسيقات safetensors وF32/BF16، والكود المصدري مرخّص بموجب Apache 2.0 — لكن الأوزان والنماذج المشتقة والمخرجات المستضافة ذاتيًا مرخّصة للبحث والاستخدام غير التجاري فقط، بموجب ترخيص breezeblue-research-and-non-commercial-license. وهذا يعني أن «الأوزان المفتوحة» هنا ليست «مجانية لمنتجك». الاستضافة الذاتية التجارية غير مسموح بها بموجب الترخيص كما هو مكتوب؛ أما المسار التجاري فيتمثل في واجهة برمجة التطبيقات المستضافة بسعر 34 دولارًا لكل مليون حرف. وهذا النمط نفسه يتكرر في عدة إصدارات مفتوحة أخرى صدرت في 2026 — يمكن فحصها واستضافتها ذاتيًا للأغراض البحثية، لكن الاستخدام المدرّ للدخل محجوز لنقطة نهاية المورّد نفسه.

لماذا يهمّ جهاز التوجيه لنموذج بهذا الحداثة

الخطر الصادق مع Breeze TTS 2 الآن ليس الجودة — بل العمر. النموذج متاح منذ عشرة أيام، والأوزان منذ يومين. لا ينبغي لأي فريق إنتاج أن يراهن على خط صوتي بنموذج بهذا الحداثة دون وسيلة للتحول عنه، وهذه هي بالضبط طريقة الفشل التي وُجدت طبقة التوجيه لاستيعابها. إذا قيّمت Breeze TTS 2 عبر بوابة تعامل نقطة نهاية البائع كمسار واحد من بين مسارات عديدة، تحصل على صدارة Elo اليوم، وتجاوزًا تلقائيًا إلى مزوّد احتياطي عند تدهور واجهة API، وتغييرًا من سطر واحد إذا أظهر نموذج عمره أسبوع انحدارًا. هذا هو نفس الانضباط الذي تطبقه لغة التوجيه DSL على أي نموذج: ادمجه مع بدائل، وأبقِ الواجهة مستقرة، ودع النموذج يثبت نفسه قبل أن تسمح له بأن يصبح أساسًا يُعتمد عليه. لا يوجد أي من النماذج في هذه السلسلة موجّهًا بعد على OrcaRouter نفسه، لذا فإن النصيحة الصادقة هي ربط Breeze TTS 2 بأي بوابة تشغّلها بالفعل — وإبقاء مزوّدك الحالي نشطًا إلى جانبه بينما يصبح Elo أقدم وأكثر موثوقية.

ماذا تشاهد بعد ذلك

إن احتلال المرتبة الأولى بين طرازات الأوزان المفتوحة في حلبة Provider Voices هو خبر اليوم، لكن هذه الحلبة هي الأضعف بين الحلبتين لهذا الطراز. في حلبة Controlled Voice لدى Artificial Analysis، حيث تُقارن جميع الطرازات باستخدام الأصوات المرجعية الثابتة نفسها، يحتل Breeze TTS 2 المرتبة {{1}}الثالثة{{/1}} بين طرازات الأوزان المفتوحة بتقييم {{2}}1,002{{/2}} Elo، خلف Voxtral من Mistral الذي سجّل {{3}}1,010{{/3}} — والمرتبة 16 إجمالًا من أصل 39. تلك الفجوة بين نتيجته في أصوات المزوّد ({{2}}1,215{{/2}}, الأولى بين الأوزان المفتوحة) ونتيجته في الأصوات الخاضعة للتحكم ({{3}}1,002{{/3}}, الثالثة بين الأوزان المفتوحة) جديرة بالمتابعة: فهي تشير إلى أن ميزة Breeze TTS 2 تتركّز في الأصوات التي يصمّمها لنفسه، وهذا هو بالضبط ادعاء المنتج، وهو أيضًا بالضبط الادعاء الذي ينبغي لأي معيار مستقل أن يواصل الضغط عليه. راقب ما إذا كان تقييم Elo في الأصوات الخاضعة للتحكم يقترب من رقم أصوات المزوّد، وما إذا كان الترخيص التجاري يتشدد أو يتراخى، والأهم من ذلك كله: ما إذا كان أي طرف سيعيد إنتاج معايير تصميم الصوت وتوجيه الصوت خارج حزمة BreezeBlue الخاصة.

بالنسبة لنموذج لم يكن موجودًا قبل شهر، حصل Breeze TTS 2 بالفعل على أكثر شيء مفيد يمكن أن يكسبه نموذج تحويل النص إلى كلام: درجة مستقلة تتفق مع التسويق. ما إذا كان سيصبح صوتًا افتراضيًا للمنتجات التفاعلية يعتمد على تحديث Elo القادم بشكل أقل مما يعتمد على كيفية تطور الترخيص وقصة الاستضافة الذاتية — لكن اعتبارًا من هذا الأسبوع، أصبح لتحويل النص إلى كلام مفتوح الأوزان قائد جديد، وعمره أسبوعان.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.