כרטיס Hero המשווה בין Qwen-Audio-3.0-TTS ל-Qwen-Audio-3.1-TTS, ומפרט את השקת הדגם הישן יותר ב-20 ביולי 2026, דירוג Elo של 1,238 ו-86 תגי הגשה מוטבעים, לעומת הכרזת הדגם החדש יותר ב-23 בספטמבר 2026, הורדת מחיר של 70% ושליטה מבוססת הוראות, עם חץ שכתוב עליו "תשעה שבועות" ביניהם.
Guides & Insights

Qwen-Audio-3.1-TTS מול Qwen-Audio-3.0-TTS: מה השיגו חודשיים

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen-Audio-3.0-TTS הושק ב-20 ביולי 2026 ועלה היישר לראש לוחות הדירוג העצמאיים בתחום הדיבור — דרגת Plus הגיעה ל-1,238 Elo בלוח Provider Voice Arena של Artificial Analysis, במקום השני בטבלה. תשעה שבועות לאחר מכן, ב-23 בספטמבר 2026, הכריז הספק על Qwen-Audio-3.1-TTS בכנס Apsara בהאנגג'ואו, בצירוף הורדת מחיר של כ-70%. התזמון הזה הופך את ההשוואה הזו ליוצאת דופן: המודל שמוחלף אינו מיושן; הוא נמדד בדירוגים, מוכח, ועדיין סמוך לראש. אז השאלה האמיתית אינה איזה מהם טוב יותר. היא מה בדיוק השתנה, אם משהו מזה רלוונטי לעומס העבודה שלך, ומה קורה לציון שאתה כבר סומך עליו כשהמחליף כלל לא קיבל ציון.

חודשיים, חמישה נקודות קצה, משפחה אחת

עליבאבא לא שחררה מודל בודד. מהדורת 3.1 כוללת חמישה: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next ו-Qwen-Audio-3.1-Realtime. עבור כל מי שקורא כעת ל-Qwen-Audio-3.0-TTS, רק אחד מאלה הוא תחליף ישיר — שכבת ה-TTS הרגילה — ואחד הוא מוצר חדש לחלוטין ולא שדרוג.

השני הזה שווה להבין גם אם לעולם לא תקרא לו. Qwen-Audio-3.1-TTS-Next הוא מה ש-Alibaba מכנה מודל "Audiogen": מעבר יחיד שמייצר קול, אפקטי סאונד ואווירת רקע יחד מתוך טקסט, חותמות זמן ואודיו ייחוס. דיאלוג מרובה דוברים, הרכבת פודקאסטים, נופי סאונד סצנתיים, פלט 48 kHz. התיעוד של Model Studio מבית Alibaba Cloud מפרט בבירור את מגבלותיו — 3,000 תווים של קלט, 240 שניות של אודיו מיוצר עבור פודקאסטים ו-120 שניות במקרים אחרים, 3 בקשות בשנייה, פלט WAV, MP3 או PCM, והוא מקבל עד שלושה קטעי אודיו ייחוס באורך 30 שניות כל אחד ב-WAV, MP3 או OGG Opus. קלט אודיו ייחוס מסוג PCM גולמי אינו נתמך. תמחורו עומד על $0.848 למיליון טוקני קלט ו-$1.696 למיליון טוקני פלט בצומת בייג'ינג, לא כולל תעריפי מבצע, והוא מטפל רק בסינית ובאנגלית.

אם אתם על 3.0-TTS והתפקיד שלכם הוא "להפוך את התסריט הזה לקול", שום דבר מזה לא משנה את האינטגרציה שלכם. אם התפקיד שלכם הוא "להרכיב פודקאסט עם שני מנחים ומצעים מוזיקליים", 3.1-TTS-Next הוא קטגוריית מוצר שונה, ואולי הסיבה בכלל להסתכל על הגרסה הזו.

השדרוג, שורה אחר שורה

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• שפות — Qwen-Audio-3.1-TTS: 16 שפות לפי דיווח הספק, כששבע נוספו לעומת הדור הקודם. Qwen-Audio-3.0-TTS: 16 שפות כפי שמפורט בסיקור שפורסם של מהדורת יולי.

• ניבים סיניים — Qwen-Audio-3.1-TTS: 20 אזורי ניבים, הועברו. Qwen-Audio-3.0-TTS: 20 אזורי ניבים.

• העברת גוון חוצת-שפות — Qwen-Audio-3.1-TTS: כן, קול אחד מועבר בין מנדרינית, קנטונזית, אנגלית ויפנית. Qwen-Audio-3.0-TTS: לא מוצע.

• שליטה בהגשה — Qwen-Audio-3.1-TTS: שליטה מבוססת הוראות ברגש, בקצב ובסגנון. Qwen-Audio-3.0-TTS: 86 תגי הגשה מוטמעים.

• קלט ייחוס רועש — Qwen-Audio-3.1-TTS: מטפל ישירות באודיו ייחוס רועש או עם הדהוד, ללא מצב נפרד להפחתת רעשים. Qwen-Audio-3.0-TTS: נדרש אודיו ייחוס נקי.

• ציון עצמאי — Qwen-Audio-3.1-TTS: אין עדיין. Qwen-Audio-3.0-TTS-Plus: 1,238 Elo בלוח התוצאות Provider Voice Arena של Artificial Analysis נכון לאוגוסט 2026.

מספר השפות לא מסתדר, וזה משנה

זה עניין קטן שיוחלק בכל מקום אחר, ולכן שווה לציין אותו. בחומרי ההשקה של Alibaba נכתב ששכבת TTS 3.1 מוסיפה שבע שפות. סיקור שפורסם של הדור 3.0 מיולי — כולל כתבות ההשוואה שלנו מאותו חודש — פירט 16 שפות עבור שכבת 3.0. שבע ועוד שש-עשרה זה עשרים ושלוש, לא שש-עשרה, ו-Alibaba לא פרסמה התאמה בין שני המספרים.

הסברים אפשריים אינם זוהרים: ייתכן שמספר 3.1 סופר קבוצה שונה, ייתכן שנתון 3.0 הוגזם בעת ההשקה, או ש"מוסיף שבע" מתאר את שכבת ה-ASR ולא את ה-TTS. איננו יודעים לאיזה מהם הכוונה. מה שכן ידוע לנו הוא שמניין השפות בשני צדי ההשוואה הוא מספר שנמסר על ידי הספק ומעולם לא עבר ביקורת בלתי תלויה, וכל מי שמצטט "16 שפות" כעובדה מוצקה לגבי מי מהמודלים מצטט שקופית שיווקית. בדקו את השפות הספציפיות שאתם זקוקים להן מול התיעוד של Model Studio לפני שאתם מתכננים על בסיס מניין.

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

שליטה בהוראות היא השינוי שבאמת בא לידי ביטוי בקוד

מכל מה שיש בשחרור ה-3.1 TTS, זה הדבר שמשנה את האופן שבו אתם כותבים את הפרומפטים שלכם. הדור 3.0 שלט בהגשה באמצעות 86 תגים מוטבעים — אוצר מילים קבוע שהייתם צריכים ללמוד, להכניס במיקומים הנכונים, ושהיה עושה בדיוק את מה שנאמר בו ולא יותר. שכבת ה-3.1 מחליפה זאת בהוראה בשפה טבעית: אתם מתארים את הרגש, את הקצב, את הסגנון שאתם רוצים, והמודל מפרש זאת.

ההבדל המעשי הוא בין כושר ביטוי לבין יכולת חיזוי. אוצר תגים הוא חוזה — אותו תג מפיק את אותה מסירה בכל פעם, וזה בדיוק מה שרוצים בצינור ייצור שבו הקול חייב להיות עקבי לאורך עשרת אלפים קליפים. הוראה חופשית היא רחבה יותר אך רופפת יותר, והיא יורשת את בעיית הרגישות לפרומפט המוכרת: שני ניסוחים של "חם אך לא סנטימנטלי" לא יתממשו באופן זהה, וכך גם לא שתי הפעלות של אותו ניסוח בימים שונים.

אם הפייפליין הנוכחי שלך בנוי על 86 התגיות האלה, השדרוג אינו בחינם. אתה מחליף משטח שליטה דטרמיניסטי במשטח הסתברותי, והעבודה של הפורטינג אינה קריאת ה-API — היא אימות מחדש של כל תבנית פרומפט שבבעלותך מול הפרשנות של המודל החדש. הקצה לכך תקציב לפני שאתה מקצה תקציב לחיסכון.

העברת גוון צליל בין-לשונית, ולשם מה היא בעצם נועדה

קול ייחוס אחד, המועבר דרך מנדרינית, קנטונזית, אנגלית ויפנית, ושומר על זהותו כשהשפה משתנה. על הנייר זה נקרא כמו סעיף ברשימת תכונות. בפועל זה פותר בעיה ספציפית ויקרה: מגיש יחיד שצריך להתקיים ביותר משפה אחת בלי להישמע כאדם שונה בכל אחת מהן.

הפתרון העקיף המסורתי הוא ללהק מדבב נפרד לכל שפה ולהשלים עם כך שקול המותג שלך הוא כעת ארבעה קולות שחולקים תסריט. החלופה הייתה לשכפל דובר אחד לכל שפה, וזה בדיוק תהליך העבודה שבו קולות משוכפלים נוטים להיסחף — המבטא נשמר, הגוון נעשה דק יותר, והמאזינים שמים לב לכך בתוך משפט. העברת גוון בין-לשונית היא הטענה שאף אחת משתי הפשרות אינה הכרחית.

זה גם, נכון לרגע זה, לא מאומת לחלוטין. אין מבחן האזנה של צד שלישי על Qwen-Audio-3.1-TTS בשום שפה, וההדגמות של Alibaba עצמה הן הראיות היחידות לכך שההעברה תקפה. אם היכולת הזו היא הסיבה שאתה שוקל את השדרוג, בדוק אותה על אודיו הייחוס שלך לפני שאתה מתחייב — זה ניסוי של חמש דקות וזה היחיד שעונה על השאלה.

מה קיצוץ המחיר עושה להצעת חוק 3.0

עליבאבא חתכה את מחירי הדיבור בכל החזית: סינתזה בכ-70%, זמן אמת בכ-85%, זיהוי בעד 95%. ההתאמה נכנסה לתוקף ב-Alibaba Cloud Model Studio ב-22 בספטמבר 2026 בשעה 00:00 לפי שעון בייג'ינג, היא מכסה את אזורי בייג'ינג וסינגפור, והיא חלה על נקודות הקצה 3.1 TTS ו-3.0 realtime. לאחר ההתאמה, שכבת ה-Flash של TTS מתומחרת ב-1.5 יואן למיליון אסימוני קלט ו-12 יואן למיליון אסימוני פלט; שכבת ה-Flash של realtime מתומחרת ב-1.5 לקלט טקסט, 6 לקלט אודיו, 4.5 לפלט טקסט ו-12 לפלט משולב של טקסט ואודיו, למיליון אסימונים.

הנה החלק שחשוב אם אתם כבר מריצים 3.0-TTS. שכבת 3.0 Plus נעה סמוך ל-$27.60 למיליון תווים ב-Artificial Analysis במהלך אוגוסט, כששכבת Flash נעה סמוך ל-$15. אם ההפחתה של כ-70% חלה על השכבה שבה אתם משתמשים, החשבון שלכם על אותו עומס עבודה יורד לכשליש בערך ממה שהיה — בלי שתשנו שורת קוד אחת. זה הדבר יוצא הדופן במהדורה הזו: עבור לקוח של 3.0, הורדת המחיר שווה יותר משדרוג המודל, והיא מגיעה בין אם תבצעו מיגרציה ובין אם לא.

שתי הסתייגויות שכדאי לזכור. קיצוצי אחוזים נמסרים ביחס לתעריפים המשתנים לפי אזור ולפי שכבה, כך ש-70% הכותרתיים אינם הבטחה לגבי התעבורה הספציפית שלכם. ו-Alibaba Cloud העבירה את חיוב התמלול בזמן אמת בצומת סינגפור ממדידה מבוססת משך למדידה מבוססת טוקנים — 0.93 דולר למיליון טוקני קלט ו-0.70 דולר למיליון טוקני פלט — בסיס פחות צפוי כאשר שקט, רעש והקשר רב-תורי מנפחים את צריכת הטוקנים. קראו את המחירון החדש מול האודיו שלכם, לא מול ההודעה לעיתונות.

היכן Qwen-Audio-3.0-TTS הוא עדיין הבחירה הנכונה

שלושה מקרים, והם לא מקרי קצה.

כאשר אתה צריך מספר שתוכל להגן עליו. ל-Qwen-Audio-3.0-TTS-Plus יש Elo עצמאי של 1,238 — אותו לוח מציג 1,259 עבור אותו מודל בספטמבר, עדיין שני, כך שהציון נסחף כלפי מעלה ולא דעך — מתוך זירת האזנה עיוורת עם אלפי הצבעות מאחוריה. ל-Qwen-Audio-3.1-TTS אין ציון זירה כלל. אם תהליך האישור שלך דורש ראיות מצד שלישי, המודל הישן יותר הוא זה שיש לו אותן, והורדת מחיר לא משנה זאת.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

כאשר הדטרמיניזם גובר על כושר הביטוי. אם צינור הייצור שלך בנוי על משטח הבקרה של 86 התגים, יש לך מערכת שאת הפלט שלה אפשר לנתח באופן הגיוני. שליטה מבוססת הוראות היא בעלת יכולות רבות יותר ופחות צפויה, ועלות ההגירה ממשית.

כאשר שום דבר בשדרוג אינו נוגע בעומס העבודה שלך. אם אתה מסנתז מנדרינית ואנגלית בנפח מתון עם קול ייחוס נקי וסט קבוע של תגי הגשה, אז העברת גוון חוצת-שפות, עמידות לקלט רועש ושבע שפות נוספות — כולם פותרים בעיות שאין לך. קח את הפחתת המחיר, הישאר עם המודל.

להריץ את שניהם בלי להריץ שתי אינטגרציות

החלק המסורבל במעבר מדור לדור הוא שלעתים קרובות רוצים ששני המודלים יהיו פעילים בו-זמנית — 3.0 למסלול הייצור עם הציון שמאחוריו, 3.1 לשפות החדשות ולתכונת ההעברה, ודרך להעביר תעבורה ביניהם בלי פריסה מחדש. שניהם ממשקי API מתארחים וסגורים ב-Alibaba Cloud Model Studio, כך שמדובר בשתי נקודות קצה, שתי מגבלות קצב ושני מצבי כשל מאחורי תכונה אחת.

הערה כנה על המקום שבו אנו נמצאים: OrcaRouter אינו מנתב את Qwen-Audio-3.1-TTS או כל מודל Qwen-Audio, ואנחנו כלל לא מנתבים את נקודות הקצה הקוליות של Alibaba. מה שאנחנו כן מספקים הוא שכבת הסקת הטקסט סביב צינור עיבוד כמו זה — מפתח API אחד על פני יותר מ-200 מודלים בתוספת של 0%, מחיר המחירון של הספק עובר ישירות, כך שהורדת מחיר של ספק מגיעה לצד שלנו באותו היום ולא אחרי מחזור תמחור מחדש. אם השירות שמניע את צינור העיבוד הקולי שלך הוא מחולל תסריטים, מסכם או מתכנן תוכן, המשמעות היא חוזה אחד במקום כמה, מעבר אוטומטי לגיבוי כאשר ספק במעלה הזרם נחלש, ו-DSL לניתוב להרכבת מודלים לקריאה אחת. זה לא אומר שאתה קורא לקול של Qwen דרכנו, וכל עמוד שמרמז אחרת טועה לגבי הקטלוג שלנו עצמו.

הסיכום הכן

Qwen-Audio-3.1-TTS הוא שדרוג אמיתי עם שלוש תוספות חשובות — שליטה בהגשה מבוססת הוראות, העברת גוון בין-לשונית, ועמידות בפני אודיו ייחוס לקוי — ובנוסף הורדת מחיר ששווה יותר מכל אחת מהן. Qwen-Audio-3.0-TTS אינו נדחק הצידה כפי שמודל בן חודשיים בדרך כלל נדחק: הוא עדיין מחזיק בציון בנצ'מרק עצמאי שממשיכו לא השיג, והוא עדיין מכסה את טווח הניבים הסיניים שעליו נשען רוב הבידול של המשפחה הזו.

אז ההחלטה צרה יותר ממה שהשיווק מרמז. אם אתה מייצר בהיקף גדול, שינוי התמחור כבר שלך. אם אתה זקוק לשפות החדשות או להעברת טימבר, בצע הגירה ואמת את התכונה על האודיו שלך קודם. אם אתה זקוק לנתון איכות שאפשר להגן עליו, המתן עד ש-Qwen-Audio-3.1-TTS יופיע בזירת האזנה עיוורת — זה האירוע היחיד שיכריע את העניין, ועד שזה יקרה, העמדה הכנה היא שהמודל החדש יותר הוא הזול יותר והמודל הישן יותר הוא המוכח.