
Gemini 3.8 TTS מול Qwen Audio 3.0 TTS: שתי תשובות שונות ל"גרום לזה להישמע נכון"
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
נקודת Elo אחת מפרידה בין שני המודלים האלה ב-Artificial Analysis Provider Voice Arena, והם מגיעים לשם בכך שהם פותרים בעיות שונות לחלוטין. Qwen-Audio-3.0-TTS-Plus נמצא במקום ה-3 עם Elo של 1,259 על פני 1,447 דגימות ו-15 קולות בזירה, שוחרר בספטמבר 2026 ומופיע במחיר של $27.60 למיליון תווים. Gemini 3.8 Flash TTS נמצא במקום ה-2 עם 1,260 על פני 1,999 דגימות ו-8 קולות בזירה, שוחרר ב-23 בספטמבר 2026 ומופיע במחיר של $33.00 למיליון תווים. אין הבדל סטטיסטי ביניהם, פער של עשרים אחוז במחיר, והם בנויים על תיאוריות מנוגדות לגבי מה שהופך דיבור סינתטי לטוב.
התיאוריה היא החלק המעניין. התשובה של Qwen היא שליטה מוטמעת: 86 תגי הגשה שאתם מפזרים בתוך הטקסט כדי שהמודל ידע היכן לנשום, להדגיש ולהחליף רגיסטר. התשובה של Google היא שכבת כיוון: הוראות שורה-אחר-שורה, בימוי של שני דוברים, וקבוצה קטנה של רמזים לא-מילוליים. אם כבר בניתם צינור שמייצר הערות דמויות-SSML, אחד מאלה יתאים והשני לא, והתאימות הזו חשובה יותר מנקודת Elo בודדת.
היכן שהשניים בעצם יושבים על הלוח
קריאה כנה של Provider Voice Arena מחייבת להסתכל על המרווחים, לא על הדירוגים.
• Qwen-Audio-3.0-TTS-Plus — דירוג 3, Elo 1,259, 1,447 דגימות, 15 קולות ארנה, ספטמבר 2026, $27.6 לכל 1M תווים.
• Gemini 3.8 Flash TTS — דירוג 2, Elo 1,260, 1,999 דגימות, 8 קולות ארנה, ספטמבר 2026, $33.0 לכל מיליון תווים.
• Cartesia Sonic 3.6 — דירוג 1, Elo 1,273, 1,757 דגימות, 8 קולות ארנה, אוגוסט 2026, $49.0 למיליון תווים.
שלושת המובילים הם רצועה אחת. המרווחים שפורסמו לשני המובילים משתרעים שבע עשרה נקודות לכל צד, וזה רחב יותר מכל הפער בין הראשון לשלישי, כך שהסדר ביניהם אינו ראיה יציבה. מה שהטבלה כן קובע הוא שכל שלושתם נמצאים בקבוצה המובילה וששום דבר שמתחתיהם אינו קרוב — דירוג 10, Gemini 3.1 Flash TTS, נמצא ב-1,199.
האסימטריה היחידה הראויה לציון היא מספר הקולות בזירה. Qwen מציג 15 קולות לעומת 8 של Gemini, כך שציון Qwen הוא ממוצע על פני מדגם רחב יותר של המוצר של הספק עצמו. זה פועל לשני הכיוונים: זהו אומדן הוגן יותר של איך קטלוג Qwen נשמע בסך הכל, וזה נותן ל-Qwen יותר הזדמנויות להציג קול חלש שמוריד את הממוצע. אף אחת מהפרשנויות לא משנה את המסקנה ששניהם שווים.

86 תגיות אספקה מול שכבת כיוון
זהו ההבדל המהותי והוא קובע את רוב האינטגרציות.
Qwen-Audio-3.0-TTS מגיע עם 86 תגיות הגשה מוטמעות — הערות המוטבעות בטקסט ששולטות באופן שבו קטע נאמר. זו גישת סימון: התסריט שלך נושא את הביצוע. זה מוכר לכל מי שעבד עם SSML, והוא מתחבר היטב עם כלים שמייצרים טקסט באופן פרוגרמטי, מכיוון שמשטח השליטה הוא טרנספורמציה של מחרוזת ולא קריאה ל-API.
Gemini 3.8 Flash TTS הולך בדרך האחרת. אתה מביים שורה כמו שהיית מביים שחקן — קצב, הדגשה, רגיסטר רגשי — כהוראה נפרדת ולא כסימון מוטבע. סצנות עם שני דוברים יכולות להיות מבוימות בתוך קריאה אחת. וקבוצה קטנה של רמזים לא-מילוליים כתובה לתוך התסריט: <צוחק>, <אנחה>, <התנשפות> כרמזים מוטבעים, ובנוסף |מהמה| ו- |כן| לרעשי תקשורת משנית.
אז שני המודלים מקבלים סימון בתוך הטקסט; ההבדל הוא בגודל אוצר המילים והיכן ששאר הבקרה נמצאת. האוצר של Qwen רחב ושטוח יותר — 86 תגים, כולם בטקסט. האוצר של Google צר יותר בטקסט ורחב יותר מחוצה לו, עם כיוון הגשה ובימוי דובר כפרמטרים ברמת הקריאה. אם אתה מסב מערכת שכבר פולטת סימון מוטבע עשיר, ההסבה ל-Qwen היא הקצרה יותר. אם אתה בונה את לוגיקת הכיוון בקוד האפליקציה ממילא, החלוקה של Google נקייה יותר.

כיסוי שפות לעומת כיסוי ניבים
מספרי הכיסוי אינם בני השוואה, והשוואה נאיבית ביניהם היא טעות.
Gemini 3.8 Flash TTS מכסה 130 שפות, המזוהות אוטומטית מהטקסט; Flash-Lite TTS מכסה 101. זהו רוחב על פני משפחות שפות, וזה מה שאתה רוצה במעבר לוקליזציה שצריך להגיע לזנב הארוך של שווקים.
Qwen-Audio-3.0-TTS מכסה 16 שפות בתוספת 20 אזורי ניבים סיניים. זהו עומק בתוך משפחת שפות אחת. עשרים אזורי ניבים אינם מספר קטן יותר מ-130 שפות כפי שזה נראה — זו טענה מסוג אחר, ועבור מוצר שמשרת דוברי סינית ברחבי אזורי סין היבשתית היא השימושית יותר. מודל עם 130 שפות וקול מנדרינית אחד לא משרת משתמש בסצ'ואן כפי שמודל עם 20 אזורי ניבים משרת.
מה שמשנה תלוי לחלוטין בקהל שלך. אם הדרישה שלך היא „לכל הפחות סביר בעשרים שווקים”, Gemini. אם היא „באמת מתאים בשוק הסיני”, Qwen.
המחיר, ומה שמסתתר מאחורי הנתון לפי תו
• Qwen-Audio-3.0-TTS-Plus — $27.60 למיליון תווים לפי הבסיס המנורמל של לוח הדירוג; גרסת Flash עולה כ-$15 למיליון תווים עם זמן השהיה מוצהר של החבילה הראשונה של כ-300 מ״ש.
• Gemini 3.8 Flash TTS — $33.00 לכל מיליון תווים מנורמלים; מחויב על ידי Google לפי $0.50 למיליון אסימוני טקסט בקלט ו-$9.00 למיליון אסימוני אודיו בפלט עד 31 בדצמבר 2026, ולאחר מכן $1.00 ו-$18.00.
• Gemini 3.8 Flash-Lite TTS — $22.10 לכל מיליון תווים מנורמלים, בדירוג 6 עם ציון Elo של 1,235; בחיוב של $6.00 למיליון טוקני אודיו עד 31 בדצמבר 2026.
שני הנתונים לפי תו הם נרמולים של Artificial Analysis, ולא מחירי מחירון של הספקים — Qwen מחייבת דרך Alibaba Cloud Model Studio ו-Google מחייבת בטוקנים, ואף אחת מהן אינה מפרסמת תעריף לפי תו עבור המודלים האלה. השתמשו בהם כדי לגזור את היחס, שהוא בערך פי 1.2 לטובת Qwen, ולא כהצעות מחיר.
הרמות נבדלות במבנה שלהן. Qwen מתפצלת ל-Plus ו-Flash, כאשר רמת Flash מקריבה איכות תמורת טענת חבילה ראשונה של כ-300 מ״ש. Google מתפצלת ל-Flash ו-Flash-Lite, ולאחר מכן עוד ל-Standard, Batch ו-Flex, ו-Priority — $4.50, $9.00 ו-$16.20 למיליון אסימוני אודיו ב-Flash TTS. המודל של Google מתגמל סיווג עומס העבודה שלך; המודל של Qwen מתגמל בחירה מראש ברמת איכות.
הזמינות היא ההבדל האמיתי הנוסף. Gemini 3.8 Flash TTS זמין באופן כללי ב-Gemini Developer API. Qwen-Audio-3.0-TTS הוא סגור ומוצע רק כשירות מתארח, מוגש דרך Alibaba Cloud Model Studio ללא משקלים פתוחים. אם אתה צריך להריץ את המודל בעצמך, אף אחד מאלה אינו מתאים לך — אבל אם התשתית שלך כבר נמצאת ב-Alibaba Cloud, מודל Qwen הוא זה שאין לו סוגיית יציאת נתונים שצריך לפתור.
טענות ספקים משני הצדדים
לאף אחד מהמודלים אין בנצ'מרק בלתי תלוי מעבר לארנה, ושתי הספקיות פרסמו טענות שיש לתייג אותן ככאלה.
של גוגל, עבור Gemini 3.8 Flash TTS: מקום ראשון ב-Hume AI Voice Design Benchmark עם 71.4, מקום ראשון במידול מבטא עם 60.8, מקום ראשון ושני במדד האיכות הכולל של Hume עבור Flash ו-Flash-Lite, ומיקומים מובילים בהעדפה עיוורת שנטענו ביפנית, פורטוגזית ברזילאית, וייטנאמית, ערבית סטנדרטית מודרנית, ספרדית מקסיקנית והינדי. ההרצות אינן פומביות.
של Alibaba, עבור Qwen-Audio-3.0-TTS: מערכת ההגשה בת 86 התגים, 20 אזורי הניבים, ונתון החבילה הראשונה של ~300 מ״ש בגרסת Flash. גם לא שוחזר.
ה-Elo של הארנה הוא מספר האיכות היחיד שנאסף באופן עצמאי במאמר הזה, והוא מראה ששניהם צמודים בראש הטבלה.

מה Gemini מוסיף ש-Qwen לא מוסיף
יצירת קול היא הפער הברור ביותר. Gemini 3.8 Flash TTS תומך בעיצוב קול מתוך תיאור בשפה טבעית ובשכפול קול מדגימה בת 30 שניות, עם אימות הסכמה וסימן מים של SynthID בתוספת אישורי C2PA על הפלט. קולות מותאמים אישית מגיעים בשתי צורות: 200 קולות עם שמירת מצב לכל פרויקט עם זמן חיים של שנה, או קולות ללא שמירת מצב המאותרים באמצעות voicekey_... מזהה שפג תוקפו לאחר שבעה ימים. ערבוב קולות מופיע כ״בקרוב״.
בקרת פורמט הפלט היא השנייה. WAV 24 kHz מונו 16-bit signed PCM בנקודת הקצה ה-unary, PCM ללא כותרת (audio/l16) בנקודת הקצה של הסטרימינג, בתוספת audio/mulaw ו-audio/alaw וקצב דגימה ניתן להגדרה. לעבודה בסמוך לטלפוניה, תמיכת mulaw מסירה שלב של טרנסקודינג.
למי להתקשר
בחר ב-Qwen-Audio-3.0-TTS אם המשתמשים שלך דוברי סינית וכיסוי הניבים הוא הדרישה, אם אתה רוצה אוצר מילים עשיר של סימון מוטבע שהמחולל שלך יכול לפלוט ישירות, או אם אתה כבר על Alibaba Cloud ורוצה את הנתיב הקצר ביותר לנקודת קצה עובדת. הוא גם הזול מבין השניים על בסיס מנורמל, וגרסת Flash זולה עוד יותר אם ~300 ms לחבילה הראשונה מקובלים.
בחר ב-Gemini 3.8 Flash TTS אם אתה זקוק לרוחב על פני שפות רבות ולא לעומק בשפה אחת, אם אתה זקוק ליצור או לשכפל קול ספציפי, אם אתה זקוק לפלט mulaw או alaw, או אם "זמין באופן כללי ולא רק באירוח בלבד" הוא דרישת רכש.
לא זו ולא זו בחירה רעה, ואף אחת מהן אינה טובה יותר באופן ברור — וזה בדיוק העניין בפער של נקודת Elo אחת. ההחלטה היא של תאימות, לא של איכות.
זו גם הטענה בעד לא להתחייב באופן נחרץ לאף אחד מהם עדיין. OrcaRouter נותן לך יותר מ-200 מודלים מאחורי מפתח אחד במחיר המחירון של הספק, ללא תוספת, כך ששינוי בתעריפים מאחת המעבדות מגיע לחשבון שלך באותו היום ולא בעת החידוש, ומעבר אוטומטי בעת כשל פירושו שנקודת קצה לסינתזה שמתקשה תחת עומס נופלת דרך לנקודה אחרת במקום להפיל את הבקשה. אנחנו לא מארחים את Qwen-Audio-3.0-TTS — הוא מוגש דרך Alibaba Cloud Model Studio — ואנחנו לא מארחים את נקודות הקצה של Gemini 3.8 TTS, שמגיעות מ-API של Google. מה שאנחנו מספקים הוא שכבת הטקסט והניתוב שמעליה, וזה מה שמאפשר לך להריץ את שניהם על תנועה אמיתית במשך חודש לפני שתבחר.
המספר שכדאי לעקוב אחריו הוא העדכון הבא של הארנה. עם 1,447 דגימות ב-Qwen ו-1,999 ב-Gemini, שני המרווחים עדיין רחבים מספיק כך שחודש אחד של הצבעות יכול להפריד ביניהם — או לאשר שהתיקו הוא התשובה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
