
Qwen-Audio-3.1 מול ElevenLabs: הורדת מחיר של 70% פוגשת את השחקן הוותיק
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 177 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1323 tok/s
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
הספק הוריד את מחיר ה-API של Qwen-Audio-3.1-TTS שלו בכ-70% ב-23 בספטמבר 2026, כפי שהוכרז על הבמה בכנס Apsara בהאנגג'ואו יחד עם ארבעה דגמי דיבור אחרים. המספר הבודד הזה הוא הסיבה ששווה לכתוב את ההשוואה הזו: ElevenLabs Eleven v3 היה קול ההפקה המוגדר כברירת מחדל עבור רוב הצוותים המערביים בתעריף אפקטיבי של קרוב ל-100 דולר למיליון תווים, ומתחרה אמין זה עתה תמחר מחדש את אותה עבודה בשבריר ממנו תוך הרחבת כיסוי השפות בו-זמנית. שתי המערכות אינן שקולות — Qwen-Audio-3.1-TTS הוא API מתארח בלבד ממעבדת Tongyi של הספק, עם אקוסיסטם קולי קטן יותר, בעוד ש-ElevenLabs היא פלטפורמת תוכן מלאה עם ספריית הקולות העמוקה ביותר בתעשייה. אבל אם ההחלטה שלך אי פעם הוכרעה על ידי החשבונית, החשבון השתנה השבוע.
מה בעצם הושק ב-23 בספטמבר
Qwen-Audio-3.1 אינו מודל יחיד. זהו רענון של חמישה מודלים של כל סטאק הדיבור של Alibaba, והדרגות חשובות משום שיש להן תמחור שונה ומשימות שונות:
• Qwen-Audio-3.1-TTS — היורש הישיר של מודל הסינתזה שרוב הצוותים משתמשים בו. מוסיף שבע שפות לסך כולל של 16, שומר על 20 אזורי הניבים הסיניים, מוסיף העברת גוון קול טבעית בין שפות (קול אחד שעובר בין מנדרינית, קנטונזית, אנגלית ויפנית), שליטה מבוססת הוראות ברגש, בקצב ובסגנון הדיבור, ומטפל באודיו ייחוס רועש, מהדהד או באיכות ירודה בדרך אחרת בלי מצב נפרד להסרת רעשים.
• Qwen-Audio-3.1-TTS-Next — דרגה חדשה, ומוצר שונה. אליבאבא מכנה אותו מודל "Audiogen": הוא מייצר קול, אפקטי סאונד ואווירת רקע במעבר אחד מתוך טקסט, חותמות זמן ואודיו ייחוס. דיאלוג רב-דוברים, פודקאסטים, נופי קול לקולנוע ולטלוויזיה, פלט ב-48 kHz. על פי התיעוד של Model Studio ב-Alibaba Cloud, הוא קולט עד 3,000 תווים של קלט, מגביל את האודיו המיוצר ל-240 שניות בפודקאסטים ול-120 שניות במקרים אחרים, פועל בקצב של 3 בקשות בשנייה, ומחזיר WAV, MP3 או PCM.
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next וQwen-Audio-3.1-Realtime — זיהוי, הבנת אודיו (רגש, מוזיקה, צליל סביבתי, מיקום אירועים) ושיחה דופלקסית מלאה, בהתאמה. Realtime הוא זה שאליבאבא דוחפת אל תוך החומרה: Qwen Office, Qoder, QwenNote A2, רובוט שולחני QwenNote Eva ומשקפי Qwen AI.
הורדות המחירים חלו על כל הסדרה, לא רק על TTS: הסינתזה ירדה בכ-70%, זמן אמת ירד בכ-85%, והזיהוי ירד בעד 95%. עליבאבא גם שחררה בקוד פתוח את Qwen-Audio-Agent, מסגרת לבניית סוכני קול בזמן אמת, והציגה לראשונה את Qwen3.8-LiveTranslate עם השהיה שהופחתה לפחות מ-2.5 שניות.

לוח התוצאות

• מחיר — Qwen-Audio-3.1-TTS: כ-70% פחות מהדור הקודם של Qwen-Audio, שהעמיד את שכבת 3.0 Plus בסביבות $27.60 לכל מיליון תווים ואת שכבת Flash בסביבות $15. ElevenLabs Eleven v3: כ-$100 לכל מיליון תווים לפי המעקב של Artificial Analysis, כאשר Flash עומד על כ-$50.
• שפות — Qwen-Audio-3.1-TTS: 16 שפות ועוד 20 אזורי ניבים סיניים. ElevenLabs Eleven v3: 74 שפות.
• משקלים — Qwen-Audio-3.1-TTS: סגור, מתארח רק ב-Alibaba Cloud Model Studio. ElevenLabs Eleven v3: סגור, מתארח רק.
• ספריית קולות — Qwen-Audio-3.1-TTS: שיבוט מקורי, בתוספת העברת גוון צליל בין שפות; אין שוק ציבורי דומה. ElevenLabs: ספריית הקולות המשותפת הגדולה בתעשייה, וכן שיבוט מיידי מכ-30 שניות של אודיו.
• שליטה בהגשה — Qwen-Audio-3.1-TTS: רגש, קצב וסגנון מבוססי הוראות, תוך ירושה של 86 תגי ההגשה המוטמעים שהוצגו עם 3.0. ElevenLabs Eleven v3: תגי אודיו בתוספת הפלטפורמה המקיפה (דיבוב, סוכנים, סטודיו).
• מדד השוואה בלתי תלוי — Qwen-Audio-3.1-TTS: אין עדיין. ElevenLabs Eleven v3: 1,168 Elo בטבלת המובילים Provider Voice Arena של Artificial Analysis נכון לאוגוסט 2026.
היכן שהמתחרה באמת מנצח
שלושה דברים, ורק אחד מהם הוא מחיר.
המחיר, כמובן. הוזלה של 70% לעומת ספק קיים שגובה 100 דולר למיליון תווים אינה פער זניח. זה ההבדל בין מוצר שאתם בונים איתו אב-טיפוס לבין מוצר שאתם משחררים לכל משתמש. אם אתם מייצרים קריינות בהיקף גדול, החיסכון השנתי אינו סעיף תקציבי שעליכם להצדיק פנימית — הוא מצדיק את עצמו.
סינית, באופן חד-משמעי. עשרים אזורי ניבים סיניים הם חפיר ששום דבר ש-ElevenLabs מציעה לא מתקרב אליו. אם המוצר שלך משרת משתמשים סיניים מהיבשת, או דוברי קנטונזית, או קהל פזורה שמחליף קודים באמצע משפט, ההשוואה נגמרת עוד לפני שהיא מתחילה.
העברת טימבר חוצת-שפות. Qwen-Audio-3.1-TTS לוקח קול אחד ומעביר אותו באופן טבעי בין מנדרינית, קנטונזית, אנגלית ויפנית. זוהי יכולת ספציפית עם מקרה שימוש ספציפי — קול ממותג יחיד ששורד החלפת שפה — והיא מהווה בידול אמיתי לכל מי שמבצע לוקליזציה של מגיש יחיד ולא מלהק מגיש חדש לכל שוק.
איפה ElevenLabs עדיין מנצחת, וזה לא צמוד
רוחב השפות הוא הדבר הראשון, והוא הגדול ביותר. שבעים וארבע שפות לעומת שש עשרה זה לא פער שסוגרים עם הכרזה על תמחור. אם אתם משיקים בפולנית, טורקית, וייטנאמית ופורטוגזית, ElevenLabs מכסה אתכם היום ו-Qwen-Audio-3.1-TTS לא.
השני הוא המערכת האקולוגית. ElevenLabs אינה נקודת קצה לסינתזה; היא פלטפורמת תוכן. ספריית קולות משותפת שאפשר לקבל ברישיון במקום לשכפל, תהליכי עבודה של דיבוב, תשתית לסוכנים, מוצר סטודיו, ומשטח API מתועד עם שנים של ספריות לקוח מאחוריו. הגירה ממנו היא פרויקט, לא שינוי קונפיגורציה, והצוותים שבנו עליו יודעים בדיוק למה הם יוותרו.
הדבר השלישי הוא משהו שקשה יותר לתת לו שם, ואף על פי כן שווה לתת לו שם: התפיסה של טבעיות בקול אנגלי יחיד. הסינתזה של Qwen הייתה היסטורית מצוינת בסינית ורק טובה מאוד באנגלית, ולמרות ששחרור 3.1 טוען לשפר את ההגשה הרב-לשונית, אין עדיין מבחן האזנה עצמאי למודל החדש. כל מי שאומר לך שהוא יודע איך נשמע הקול החדש של Qwen באנגלית מנחש.
המספר שאף אחד עדיין לא אמור לצטט
זה החלק בסיפור שיעוות בסיקור, אז הנה הוא כפשוטו. ל-Qwen-Audio-3.1-TTS אין ציון בנצ'מרק עצמאי. קודמו, Qwen-Audio-3.0-TTS-Plus, עמד על 1,234 Elo בלוח המובילים Provider Voice Arena של Artificial Analysis נכון לאמצע אוגוסט 2026, ודורג בין המקום השני לחמישי באותו לוח. Qwen-Audio-3.1-TTS טרם נוסף לאף זירה. כל טענת איכות בחומרי ההשקה של Alibaba היא דיווח של הספק ולא שוחזרה.
זה לא הופך את הטענות לשקריות. זה הופך אותן ללא מאומתות, וזה אומר שההצגה הכנה של ההתמודדות הזו כרגע היא: מודל אחד עם מחיר ובלי ציון, מול מודל אחד עם ציון ומחיר גבוה בהרבה. כל דבר חזק מזה הוא ספקולציה שלובשת את בגדיו של מבחן ביצועים.

אותו עיקרון חל גם על השהיה. הנתון הכותרתי של עליבאבא עבור הטוקן הראשון בצד ה-ASR של משפחה זו — 92 אלפיות השנייה — מגיע מבנצ'מרק עומס גבוה של החברה על מפרט 0.6B, ולא מבדיקות צד שלישי, וניתוח שפורסם מאז ההשקה מציין כי ASR ו-TTS הם מוצרים נפרדים בצינור ולא מודל מקצה לקצה אחד, וכי דיווחים בקהילה מתארים השהיה שמצטברת בדיאלוגים ארוכים תחת דפוס סטרימינג מדומה. התייחס לנתוני השהיה של הספק בכל המשפחה הזו כתקרות, ולא כחוויה מדודה.
כמה שווה הפחתת המחיר בפועל
קחו עומס עבודה מציאותי: מוצר שמסנתז 20 מיליון תווים של קריינות בחודש באנגלית ובמנדרינית. בתעריף של ElevenLabs Eleven v3, שעומד על כ־100 דולר למיליון תווים, מדובר בכ־2,000 דולר בחודש, או 24,000 דולר בשנה. בתעריף של Qwen-Audio-3.0-TTS-Plus, שעומד על כ־27.60 דולר למיליון, אותו נפח כבר הסתכם בכ־552 דולר בחודש. החילו את הקיצוץ של כ־70% ש-Alibaba הכריזה עליו ב-23 בספטמבר, ואותו עומס עבודה מגיע למאות בודדות של דולרים בחודש.
אף אחד מהנתונים האלה אינו מחיר מחירון שאפשר לחתום עליו — ElevenLabs מחייבת בקרדיטים דרך מסלולי מנוי, וההנחות של Alibaba הן הפחתות באחוזים על תעריפים שנבדלים לפי אזור ולפי מסלול. אבל צורת ההשוואה חד-משמעית, והצורה היא מה שלפיו בונים תקציב.
אזהרה אחת שכדאי לציין לכל מי שמודל זאת בקפידה: Alibaba Cloud העבירה את החיוב על תמלול בזמן אמת בצומת סינגפור מחיוב מבוסס משך לחיוב מבוסס טוקנים, ב-0.93 דולר למיליון טוקני קלט וב-0.70 דולר למיליון טוקני פלט. חיוב לפי טוקנים פחות צפוי מחיוב לפי משך כאשר אין לך שליטה על מספר הטוקנים שקטע אודיו נתון הופך אליו, ורעש, שקט והקשר רב-תורי כולם מנפחים את צריכת הטוקנים. קיצוץ כותרתי של 70% אינו מתורגם אוטומטית לחיסכון של 70% בתעבורה הספציפית שלך.
איך למעשה מפעילים את המתג
אם אתם בוחנים את זה, הדבר המועיל לדעת הוא כמה הגירה עולה לכם בזמן הנדסה. שני המודלים הם ממשקי API סגורים ומתארחים, כך שבכל מקרה אתם מתממשקים מול נקודת קצה של HTTP, והעבודה היא לקוח, מדיניות ניסיונות חוזרים ומלאי קולות — לא ארכיטקטורה מחדש.
זה המקום שבו הצורה של OrcaRouter עוזרת, עם הסתייגות כנה אחת קודם: אנחנו לא מנתבים את Qwen-Audio-3.1-TTS או כל מודל Qwen-Audio. נקודות הקצה הקוליות של Alibaba מחוץ לתחום שלנו, וכך גם ElevenLabs. מה שכן אנחנו מכסים הוא שכבת ההסקה שמסביבם — מפתח API אחד על פני יותר מ-200 מודלי טקסט ב-0% תוספת מחיר, כלומר מחיר המחירון של הספק עובר ישירות, כך שהורדת מחיר של ספק נכנסת לתוקף אצלנו באותו יום ולא אחרי מחזור תמחור מחדש. עבור צוותים שבונים את האפליקציה שמניעה צינור דיבור — המסכם, מחולל התסריטים, מתכנן התוכן — זה אומר חוזה אחד במקום כמה, מעבר אוטומטי לגיבוי כשספק במעלה הזרם נחלש, ו-DSL לניתוב לשילוב מודלים לקריאה אחת. זה לא אומר שאתם קוראים לקול של Qwen דרכנו. כל מי שאומר לכם אחרת לא קרא את הקטלוג.
מי צריך לזוז, ומי צריך לחכות
עברו עכשיו אם עומס העבודה שלכם מתמקד בסינית בראש ובראשונה, אם כיסוי ניבים נמצא ברשימת הדרישות שלכם, אם עלות הנפח היא האילוץ שהחזיק אתכם על קול זול יותר אך גרוע יותר, או אם אתם זקוקים לקול ממותג אחד שישרוד החלפת שפה. התמחור של 23 בספטמבר הופך את הכדאיות הכלכלית לקשה לערעור, ואיכות השפה הסינית כבר הייתה תחרותית לפני כן.
המתן אם אתה משיק ביותר מבערך שישה־עשר שפות, אם המוצר שלך נשען על ספריית קולות ברת־רישוי ולא על שיבוט, אם אתה שקוע עמוק בכלי הדיבוב או בכלי הסוכנים של פלטפורמה כלשהי, או אם תהליך הרכש שלך דורש ציון איכות בלתי־תלוי לפני אישור סופי. אף אחד מאלה אינו חסם קבוע, אבל אף אחד מהם לא נפתר בהורדת מחיר.
ושימו לב לדבר אחד במיוחד: אם Qwen-Audio-3.1-TTS מופיע בזירת האזנה עיוורת. ברגע שזה יקרה, ההשוואה הזאת מפסיקה להיות על מחיר ומספר שפות ומתחילה להיות על השאלה אם הקול הזול באמת טוב באותה מידה. זו השאלה שההשקה לא ענתה עליה.
