
StepAudio 3 TTS לעומת Qwen-Audio-3.0-TTS: לאחד מהם יש ציון Arena, וזה לא החדש
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
הנה כל ההשוואה בשורה אחת. Qwen-Audio-3.0-TTSנמצאת ב-Text-to-Speech Arena עם Elo של 1,234 עבור דרגת ה-Plus שלה — ניקוד שהושג ב-2,502 הצבעות האזנה עיוורות. StepAudio 3 TTS, שוחררה על ידי StepFun ב-15 בספטמבר 2026, אינה נמצאת בלוח הזה בכלל. קודמתה כן: StepAudio 2.5 TTS מחזיקה ב-Elo של 1,209 מ-1,306 הצבעות.
אז השאלה הכנה אינה "מה נשמע טוב יותר". היא האם פער אלו של 25 נקודות, שנמדד בדור הקודם, שורד שחרור שלדברי StepFun שיפר את הפרוזודיה והוריד את המחיר ביותר ממחצית. איש עדיין לא ערך את ההצבעה הזו, וכל מה שלהלן מסודר סביב הפער הזה בראיות במקום להעמיד פנים שהוא אינו קיים.
הלוח, כפי שהוא מנוסח בפועל היום
כדאי לראות את הדירוג האמיתי, כי כמה פרסומים שמסתובבים מצטטים גרסה מיושנת שלו. זירת ההאזנה בעיוורון מדרגת מודלי סינתזה לפי הדגימה שהמצביעים העדיפו. קראו לרוחב השורה העליונה של לוח הקולות של הספקים:
• Cartesia Sonic 3.6 — Elo 1,277, אוגוסט 2026, $49.0 למיליון תווים
• Inworld Realtime TTS-2 — Elo 1,243, אוגוסט 2026, 20.8 דולר למיליון תווים
• SpeechifyAI Simba 3.2 — Elo 1,238, יולי 2026, 6.6 דולר למיליון תווים
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1,234, יולי 2026, 27.6 דולר למיליון תווים, 8 קולות ארנה
• VUI Labs Luna TTS — Elo 1,229, יוני 2026, $80.0 למיליון תווים
• Inworld Realtime TTS-2 Flash — Elo 1,213, אוגוסט 2026, 10.4$ למיליון תווים
• StepFun StepAudio 2.5 TTS — Elo 1,209, אוגוסט 2026, 85.0$ למיליון תווים, 8 קולות ארנה
• Google Gemini 3.1 Flash TTS — Elo 1,204, אפריל 2026, $18.3 למיליון תווים

שני דברים נובעים מהרשימה הזו מיד. הראשון הוא שדרגת ה-Plus של Qwen אינה המובילה — היא רביעית, אחרי Cartesia, Inworld ו-Speechify, והנתון 1,234 שמצוטט ככתר הוא ציון של אמצע הטבלה בלוח שהשתנה מאז. השני הוא ש-StepAudio 2.5 TTS הורץ מחדש באוגוסט 2026 והגיע למקום השביעי, 25 Elo אחרי Qwen, במחיר יותר מפי שלושה.
ויש דבר שלישי שחשוב יותר מכל זה: הסתכלו על מרווחי הסמך. רמת Plus של Qwen מופיעה עם רווח של −14/+14 על פני 2,502 דגימות. StepAudio 2.5 TTS מופיע עם רווח של −16/+16 על פני 1,306. המרווחים האלה חופפים. פער של 25 נקודות בין שני מודלים שפסי השגיאה שלהם משתרעים על 14 ו-16 נקודות בכל כיוון אינו הבדל איכות מוכח — אלה שני מודלים שהזירה אינה יכולה כרגע להפריד ביניהם, והם מדורגים בסדר שכמה מאות הצבעות נוספות עשויות להפוך.

מה עולה לך נקודת הנתונים החסרה
StepAudio 3 TTS הוא המודל שאיתו החליפה StepFun את StepAudio 2.5 TTS, וההשקה טוענת לשליטה בגוון הקול, באינטונציה, בקצב ובהפסקות נשימה, וכן בהתנהגות פראלינגוויסטית — צחוק, היסוס, גמגום, חזרה, תיקון עצמי — הנמסרת דרך ארכיטקטורת סטרימינג שבה היצירה וההשמעה חופפות.
זו בדיוק קבוצת התכונות שהזירה מודדת. זו גם בדיוק הסיבה לכך שהיעדר ציון מתסכל ולא גורלי: המדד שיענה על השאלה קיים, מופעל באופן ציבורי, ופשוט לא הורץ מחדש מאז שהמודל החדש שוחרר. כל מי שאומר לך ש-StepAudio 3 TTS נשמע טוב יותר מ-Qwen-Audio-3.0-TTS מסיק מקודמו שהפסיד בפער שנמצא בתוך פסי השגיאה של עצמו.
המחיר הוא החלק המתועד במלואו, והוא נע הרבה
StepAudio 3 TTS מחייב 2.5 יואן לכל 10,000 תווים בפלטפורמה של StepFun עצמה. StepAudio 2.5 TTS חויב ב-5.8. בעמודת התמחור מבוססת התווים של הזירה עצמה, המודל הישן יותר עמד על 85.00$ למיליון תווים; 2.5 יואן לכל 10,000 תווים מסתכם בכ-35$ למיליון לפי שערי חליפין עדכניים — המרה שהיא שלנו ולא נתון מפורסם, וכדאי לחשב אותה מחדש מול האזור ושער החליפין שלכם. זהו קיצוץ של קרוב ל-60% באותו סעיף.
הוא עדיין גבוה מ-Qwen. Qwen-Audio-3.0-TTS-Plus רשום במחיר של $27.6 למיליון תווים, ושכבת Flash זולה אף יותר, כאשר Alibaba Cloud Model Studio מחייבת על סינתזה לפי תו קלט ולא לפי אודיו שהופק — הפלט אינו מחויב בנפרד. פלטפורמות צד שלישי שמפרטות את שכבת Flash מצטטות תעריפים בטווח 17–19 למיליון, אם כי שונות אזורית הופכת כל מספר כותרת בודד ללא אמין.
אז התמונה הכללית היא: StepFun בערך חצתה את עלות הסינתזה, סגרה את רוב הפער מול Qwen, ולא עברה אותו. אם מחיר לתו הוא האילוץ המחייב שלך, הטיעון מצטמצם אבל התשובה לא משתנה. אם לא, המחיר הפסיק להיות הסיבה לבחור באף אחד מהמודלים.
מלאי הקולות וכיסוי השפות אינם קרובים
כאן ההשוואה מפסיקה להיות עניין של שיקול דעת והופכת לשאלה של מפרט.
• מלאי קולות — Qwen-Audio-3.0-TTS עם למעלה מ-1,000 קולות על פני שכבותיו לעומת StepAudio 3 TTS ללא נתון מפורסם בר-השוואה
• שפות — Qwen-Audio-3.0-TTS 16 שפות ועוד 20 ניבים סיניים, כאשר שכבת ה-Flash מכווננת לשפות דלות משאבים ולאותנטיות של ניבים לעומת StepAudio 3 TTS בעדיפות לסינית, ללא טענת כיסוי מקבילה
• גודל בקשה — Qwen-Audio-3.0-TTS 20,000 תווים לבקשה לעומת StepAudio 3 TTS לא פורסם
• השהיה — Qwen-Audio-3.0-TTS Flash מכוון להשהיית חבילה ראשונה בתוך 200 מ״ש לפי המסמכים של אליבאבא עצמה, לעומת סטרימינג של StepAudio 3 TTS, ללא נתון מפורסם
• חלוקה לרמות — Qwen-Audio-3.0-TTS Plus ליכולת הבעה ו-Flash לזמן אמת, שישה קולות דגל נעולים לרמה אחת או לאחרת לעומת StepAudio 3 TTS ברמה אחת
• משטח שליטה — הנחיית ביצוע בשפה טבעית של Qwen-Audio-3.0-TTS בתוספת תגיות ביטוי מוטמעות כגון [excited], [laughing], [whispers] בטקסט הקלט לעומת פרוזודיה המוסקת מההקשר על ידי מודל StepAudio 3 TTS
• שיבוט קול — StepAudio 3 TTS בתעריף אחיד של 9.9 יואן לכל קול משוכפל בכל רמות ה-TTS שלו, לעומת שיבוט ב-Qwen-Audio-3.0-TTS דרך Alibaba Cloud Model Studio
• פלט — Qwen-Audio-3.0-TTS: קצב דגימה ברירת מחדל של 24 קילוהרץ לעומת StepAudio 3 TTS: לא פורסם
שורת משטח הבקרה הזו היא ההבדל העיצובי האמיתי, והיא אינה שאלה של איכות. תגי ההבעה של Qwen מפורשים וסינכרוניים: כותבים את הרגש לתוך הטקסט והמודל מבצע אותו, מה שהופך אותם לניתנים לבדיקה וידידותיים לבדיקות רגרסיה. התיאור של StepFun הוא של מודל שמסיק מההקשר את ההיסוס או הצחוק המתאימים, מה שנשמע טוב יותר כשהוא צודק, והרבה יותר קשה לאבחן אותו כשהוא טועה. בחרו לפי האם תעדיפו לעצב את הביצוע בעצמכם או להאציל אותו.

איך להחליט בלי המדידה?
אינך יכול להסיק תשובה ממספרים שפורסמו, משום שהמכריע שבהם אינו קיים. זה משאיר רק את הבדיקה, ולבדיקת השניים האלה יש צורה מסוימת שכדאי לתכנן לקראתה.
שניהם ממשקי API מסחריים באירוח בלבד — Qwen-Audio-3.0-TTS דרך Alibaba Cloud Model Studio, ו-StepAudio 3 TTS דרך הפלטפורמה הפתוחה של StepFun. אף אחד מהם אינו במשקלים פתוחים, כך שאין מסלול באירוח עצמי לבחינה. ליתר דיוק לגבי מה ש-OrcaRouter מכסה כאן: מודלי הטקסט לדיבור בקטלוג שלנו כיום הם משפחת OpenAI tts-1, gpt-4o-mini-tts ותצוגות ה-Gemini TTS של Google. אף אחד מהמודלים במאמר זה אינו נכלל בו, וגם Qwen-Audio-3.0-TTS לא — אין לקרוא כאן דבר כטענה שאנחנו מספקים אותם.
החלק שכן נמצא על OrcaRouter הוא החצי הטקסטואלי של הפייפליין. הסקריפטים ששכבת הסינתזה שלך קוראת נוצרים על ידי מודל שפה, וזה הרכיב שמשתנה בתדירות הגבוהה ביותר, עולה הכי הרבה לחדש חוזה עבורו, והכי קל להשאיר ללא הצמדה — כמעט 200 מודלי טקסט מאחורי API אחד, מעבר אוטומטי לגיבוי, DSL לניתוב שמרכיב כמה מהם לקריאה אחת, והיתוך מודלים שבו שיקול הדעת של מודל אחד אינו מספיק, כאשר מחיר המחירון של הספק מועבר הלאה ללא תוספת מחיר. אם אתה מריץ הערכה עיוורת בין שני מודלי הסינתזה האלה, צור את הקורפוס דרך נקודת קצה אחת כך ששני המועמדים יקראו קלט זהה, והשאר את שכבת הסינתזה מאחורי ממשק שאתה יכול להחליף.
לאן זה משאיר את ההחלטה
קח את Qwen-Audio-3.0-TTS היום אם אתה זקוק לרוחב — למעלה מאלף קולות, 16 שפות ו-20 ניבים, תקרת בקשה מתועדת של 20,000 תווים, שכבת השהיה ושכבת כושר ביטוי, יעד של 200 ms לחבילה הראשונה, ותעריף נמוך מזה של StepFun. זה המודל שיש מאחוריו מדידה והמשטח הרחב יותר, וה-Elo במקום הרביעי שלו הוא תוצאה אמיתית, גם אם הוא לא הכתר שמצטטים אותו ככזה.
בחר ב-StepAudio 3 TTS אם אתה בונה בסינית תחילה, רוצה מסלול אחד במקום החלטה בבחירת מסלול, רוצה שיבוט בתעריף אחיד ומפורסם, ומוכן להיות מוקדם עם מודל שלא נבדק בבדיקה עיוורת. אתה משלם בערך 27% יותר לכל תו מאשר במסלול Plus של Qwen בתמורה לדור של שיפור מוצהר בפרוזודיה לעומת מודל שהיה 25 Elo מאחור עם פסי שגיאה חופפים.
מה שיכריע את זה הוא ריצה חוזרת אחת של הארנה עם StepAudio 3 TTS במאגר. עד שההצבעה הזו תתקיים, מדובר במודל מדוד מול מודל לא מדוד, ו-25 הנקודות שמפרידות בין קודמיהם נמצאות בתוך הרעש — וזה אינו דירוג, ואסור למכור אותו כדירוג.
