بطاقة عنوان رئيسية مُولَّدة لـ StepAudio 3 TTS مقابل Qwen-Audio-3.0-TTS، مع عبارة تمهيدية 'OrcaRouter · رادار النماذج — وجهاً لوجه'، وعنوان رئيسي 'StepAudio 3 TTS مقابل Qwen-Audio-3.0-TTS'، وعنوان فرعي 'أحدهما لديه نتيجة في ساحة الاستماع الأعمى. والآخر صدر بعد سبعة أسابيع من آخر تصويت'، فوق بطاقتَي نموذج مستديرتين على جانبي علامة المواجهة.
Guides & Insights

StepAudio 3 TTS مقابل Qwen-Audio-3.0-TTS: أحد هذين لديه Arena Score، وهو ليس الجديد

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إليك المقارنة كاملة في سطر واحد. Qwen-Audio-3.0-TTS تحتل موقعاً في Text-to-Speech Arena بتصنيف Elo قدره 1,234 لفئتها Plus — وهي نتيجة حصلت عليها من 2,502 صوت استماع أعمى. StepAudio 3 TTS، التي أصدرتها StepFun في 15 سبتمبر 2026، ليست على تلك اللوحة على الإطلاق. سابقتها هي: StepAudio 2.5 TTS تحمل تصنيف Elo قدره 1,209 من 1,306 صوتاً.

السؤال الصادق ليس "أيهما يبدو أفضل". بل ما إذا كان فارق Elo البالغ 25 نقطة، مقيسًا على الجيل السابق، يصمد أمام إصدار تقول StepFun إنه حسّن التنغيم وخفض السعر بأكثر من النصف. لم يُجرِ أحد ذلك التصويت بعد، وكل ما يلي مرتب حول تلك الفجوة في الأدلة بدلًا من التظاهر بتجاهلها.

اللوحة، كما تُقرأ فعليًا اليوم

يستحق الأمر رؤية الترتيب الفعلي، لأن عدة كتابات متداولة تستشهد بنسخة قديمة منه. ترتّب ساحة الاستماع العمياء نماذج التركيب وفق العيّنة التي فضّلها المصوّتون. اقرأ عبر أعلى لوحة الأصوات الخاصة بالمزوّدين:

• Cartesia Sonic 3.6 — إيلو 1,277، أغسطس 2026، 49.0 دولار لكل مليون حرف

• Inworld Realtime TTS-2 — Elo 1,243، أغسطس 2026، 20.8 دولار لكل مليون حرف

• SpeechifyAI Simba 3.2 — تصنيف Elo 1,238، يوليو 2026، 6.6 دولار لكل مليون حرف

Alibaba Qwen-Audio-3.0-TTS-Plus — إيلو 1,234، يوليو 2026، 27.6 دولارًا لكل مليون حرف، 8 أصوات في الساحة

• VUI Labs Luna TTS — تصنيف Elo 1,229، يونيو 2026، 80.0 دولار لكل مليون حرف

• إنوورلد رييلتايم TTS-2 فلاش — إيلو 1,213، أغسطس 2026، 10.4 دولار لكل مليون حرف

• StepFun StepAudio 2.5 TTS — Elo 1,209، أغسطس 2026، 85.0 دولار لكل مليون حرف، 8 أصوات في الساحة

Google Gemini 3.1 Flash TTS — إيلو 1,204، أبريل 2026، 18.3 دولار لكل مليون حرف

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

يظهر من تلك القائمة أمران على الفور. الأول أن فئة Plus من Qwen ليست المتصدّرة — بل هي الرابعة، خلف Cartesia وInworld وSpeechify، ورقم 1,234 الذي يُقتبس كتاج ليس إلا نتيجة متوسطة في لوحة صدارة تغيّرت منذ ذلك الحين. والثاني أن StepAudio 2.5 TTS أُعيد تشغيله في أغسطس 2026 وحلّ في المركز السابع، متأخراً عن Qwen بمقدار 25 نقطة Elo، بسعر يزيد على ثلاثة أضعافه.

والأمر الثالث، وهو أهم من كل ما سبق: انظر إلى فترات الثقة. طبقة Plus من Qwen مُدرجة عند −14/+14 عبر 2,502 عينة. وStepAudio 2.5 TTS مُدرج عند −16/+16 عبر 1,306. هذه الفترات متداخلة. إن فجوة قدرها 25 نقطة بين نموذجين تمتد أشرطة الخطأ فيهما 14 و16 نقطة في أي من الاتجاهين ليست فرقًا مُثبتًا في الجودة — بل هما نموذجان لا تستطيع الساحة حاليًا الفصل بينهما، مُرتّبان بترتيب يمكن لبضع مئات من الأصوات الإضافية أن تقلبه.

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

ما الذي تكلفك إياه نقطة البيانات المفقودة

StepAudio 3 TTS هو النموذج الذي استبدلت به StepFun نموذج StepAudio 2.5 TTS، وتزعم الجهة المُطلِقة التحكم في الجرس والنغمة والإيقاع وفواصل التنفس، إضافةً إلى السلوك شبه اللغوي — الضحك، والتردد، والتلعثم، والتكرار، والتصحيح الذاتي — المُقدَّم عبر بنية بثٍّ متدفق يتداخل فيها التوليد والتشغيل.

هذه بالضبط مجموعة الصفات التي تقيسها الساحة. وهذا أيضًا بالضبط سبب كون غياب الدرجة محبطًا لا قاتلًا: فالمعيار الذي سيجيب عن السؤال موجود، ويُدار علنًا، لكنه ببساطة لم يُعَد تشغيله منذ إطلاق النموذج الجديد. وكل من يخبرك أن StepAudio 3 TTS يبدو أفضل من Qwen-Audio-3.0-TTS إنما يستقرئ من سلف خسر بفارق يقع داخل حدود هامش خطئه الخاص.

السعر هو الجزء الموثق بالكامل، وقد تحرك كثيرًا

تسعّر StepAudio 3 TTS بـ2.5 يوان لكل 10,000 حرف على منصة StepFun الخاصة. وكان سعر StepAudio 2.5 TTS 5.8. وفي عمود التسعير الخاص بمنصة arena القائم على عدد الأحرف، كان الطراز الأقدم بسعر 85.00 دولارًا لكل مليون حرف؛ و2.5 يوان لكل 10,000 حرف تعادل نحو 35 دولارًا لكل مليون بأسعار الصرف الحديثة — وهو تحويل خاص بنا وليس رقمًا منشورًا، ويستحق إعادته وفقًا لمنطقتك وسعر الصرف لديك. وهذا خفض يقارب 60% على البند نفسه.

لا يزال أعلى من Qwen. Qwen-Audio-3.0-TTS-Plus مُدرَج عند 27.6 دولارًا لكل مليون حرف، وفئة Flash أرخص بعد، إذ تُفوتر Alibaba Cloud Model Studio التركيب وفق حرف الإدخال لا وفق الصوت المُنتَج — ولا يُحتسب الإخراج بشكل منفصل. تعرض منصات الطرف الثالث التي تُدرج فئة Flash أسعارًا في نطاق العشرات المرتفعة لكل مليون، غير أن التفاوت الإقليمي يجعل أي رقم رئيسي منفرد غير موثوق.

فشكل الأمر هو: خفّضت StepFun تكلفة التوليف إلى النصف تقريبًا، وقلّصت معظم المسافة إلى Qwen، ولم تتجاوزها. إذا كان سعر الحرف هو قيدك الملزم، فإن الحجة تضيق لكن الإجابة لا تتغير. وإذا لم يكن كذلك، فلم يعد السعر سببًا لاختيار أي من النموذجين.

مخزون الأصوات وتغطية اللغات ليسا متقاربين

هنا تتوقف المقارنة عن كونها مسألة اجتهاد تقديري وتصبح مسألة مواصفات.

• قائمة الأصوات — Qwen-Audio-3.0-TTS: أكثر من 1,000 صوت عبر مستوياته، مقابل StepAudio 3 TTS: لا يوجد عدد منشور قابل للمقارنة

• اللغات — Qwen-Audio-3.0-TTS: 16 لغة إضافةً إلى 20 لهجة صينية، مع طبقة Flash المضبوطة من أجل اللغات منخفضة الموارد وأصالة اللهجات، مقابل StepAudio 3 TTS الموجّه بالصينية أولاً، من دون ادعاء تغطية مكافئة

• حجم الطلب — Qwen-Audio-3.0-TTS: 20,000 حرف لكل طلب مقابل StepAudio 3 TTS: غير منشور

• زمن الاستجابة — يستهدف Qwen-Audio-3.0-TTS Flash تحقيق زمن وصول أول حزمة في حدود 200 مللي ثانية وفقًا لوثائق Alibaba الخاصة، مقابل بث StepAudio 3 TTS، ولا يوجد رقم منشور

• التقسيم إلى مستويات — Qwen-Audio-3.0-TTS Plus للتعبيرية وFlash للزمن الحقيقي، وستة أصوات رئيسية مقيّدة بأحد المستويين مقابل StepAudio 3 TTS بمستوى واحد

• سطح التحكم — توجيه الإلقاء باللغة الطبيعية في Qwen-Audio-3.0-TTS بالإضافة إلى وسوم تعبيرية مضمَّنة مثل [excited] و[laughing] و[whispers] مُدمجة في النص المُدخَل، مقابل التنغيم المستنتَج من السياق بواسطة النموذج في StepAudio 3 TTS

• استنساخ الصوت — StepAudio 3 TTS بسعر ثابت 9.9 يوان لكل صوت مستنسخ عبر جميع مستويات TTS الخاصة به، مقابل استنساخ Qwen-Audio-3.0-TTS عبر Alibaba Cloud Model Studio

• الإخراج — معدل العينات الافتراضي لـ Qwen-Audio-3.0-TTS هو 24 kHz مقابل StepAudio 3 TTS: غير منشور

صف سطح التحكم هذا هو الفرق التصميمي الحقيقي، وهو ليس مسألة جودة. وسوم التعبير لدى Qwen صريحة ومتزامنة: تكتب الانفعال في النص فيقوم النموذج بأدائه، مما يجعلها قابلة للاختبار وملائمة لاختبارات الانحدار. أما وصف StepFun فهو لنموذج يستنتج التردد أو الضحكة المناسبة من السياق، وهو يبدو أفضل عندما يصيب، ويصبح تحديده بدقة أصعب بكثير عندما يخطئ. اختر وفقًا لما إذا كنت تفضّل تأليف الأداء بنفسك أو تفويضه.

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

كيف تتخذ قرارًا دون القياس

لا يمكنك الوصول إلى إجابة بالاستدلال انطلاقًا من الأرقام المنشورة، لأن الرقم الحاسم غير موجود. وهذا لا يترك سوى الاختبار، واختبار هذين الاثنين له شكل محدد يستحق التخطيط له.

كلاهما واجهتا برمجة تطبيقات تجاريتان تعملان بالاستضافة فقط — Qwen-Audio-3.0-TTS عبر Alibaba Cloud Model Studio، وStepAudio 3 TTS عبر منصة StepFun المفتوحة. لا يتوفر أي منهما بأوزان مفتوحة، لذا لا يوجد مسار استضافة ذاتية لتقييم أي منهما. ولكي نكون دقيقين بشأن ما يغطيه OrcaRouter هنا: نماذج تحويل النص إلى كلام في كتالوجنا اليوم هي عائلة OpenAI tts-1، وgpt-4o-mini-tts، ومعاينات Gemini TTS من Google. لا يوجد أي من النموذجين المذكورين في هذا المقال ضمنه، ولا Qwen-Audio-3.0-TTS كذلك — ولا ينبغي قراءة أي شيء هنا على أنه ادعاء بأننا نقدّمها.

الجزء الذي يستقر فعلاً على OrcaRouter هو النصف النصي من المسار. السكربتات التي تقرأها طبقة التوليف لديك يولّدها نموذج لغوي، وهذا هو المكوّن الذي يتغيّر أكثر من غيره، ويكلّف أكثر من غيره عند إعادة التعاقد عليه، والأسهل في تركه دون تثبيت — ما يقرب من 200 نموذج نصي خلف واجهة API واحدة، وتجاوز فشل تلقائي، وDSL للتوجيه يركّب عدة نماذج في استدعاء واحد، ودمج النماذج حيث لا يكفي حكم نموذج واحد، مع تمرير سعر قائمة المزوّد كما هو دون أي هامش ربح. إذا أجريت تقييمًا أعمى بين هذين النموذجين للتوليف، فأنشئ المدونة عبر نقطة نهاية واحدة ليقرأ كلا المرشحين مدخلات متطابقة، وأبقِ طبقة التوليف خلف واجهة يمكنك تبديلها.

أين يترك هذا القرار

خذ Qwen-Audio-3.0-TTS اليوم إن كنت بحاجة إلى الاتساع — أكثر من ألف صوت، و16 لغة و20 لهجة، وسقف طلب موثق يبلغ 20,000 حرف، ومستوى زمن استجابة ومستوى تعبيرية، وهدف 200 مللي ثانية لأول حزمة، وسعر أقل من سعر StepFun. إنه النموذج الذي يقف خلفه قياس وذو النطاق الأوسع، وكونه في المركز الرابع في تصنيف إيلو نتيجة حقيقية حتى لو لم يكن التاج الذي يُقتبس به.

اختر StepAudio 3 TTS إذا كنت تبني للصينية أولاً، وتريد فئة واحدة بدلًا من قرار اختيار فئة، وتريد الاستنساخ برسم منشور ثابت، وكنت مستعدًا لأن تكون من الأوائل في تبنّي نموذج لم يخضع لاختبار أعمى. أنت تدفع نحو 27% أكثر لكل حرف من فئة Plus لدى Qwen مقابل جيل من التحسن المزعوم في التنغيم والإيقاع مقارنةً بنموذج كان متأخرًا بـ25 نقطة Elo مع أشرطة خطأ متداخلة.

ما الذي سيحسم الأمر هو إعادة تشغيل واحدة للساحة مع تضمين {{1}}StepAudio 3 TTS{{/1}} في المجموعة. وإلى أن يحدث ذلك التصويت، فإن هذه مقارنة بين نموذج مُقاس وآخر غير مُقاس، والفارق البالغ 25 نقطة الذي يفصل بين سابقيهما يقع ضمن نطاق الضجيج — وهذا ليس تصنيفًا، ولا ينبغي تسويقه على أنه كذلك.