
Gemini 3.8 Live מול Qwen-Audio-3.1-TTS: שני חצאים של סטאק קולי, שתומחרו מחדש בהפרש של שמונה ימים
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 181 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
Gemini 3.8 Live הוא מודל הדיבור-לדיבור של Google, שוחרר ב-15 בספטמבר 2026 בתור gemini-3.8-live ו- gemini-3.8-live-extended-thinking ב-Live API. Qwen-Audio-3.1-TTS הוא מודל טקסט-לדיבור של Alibaba, שהוכרז בכנס Apsara בהאנגג'ואו ב-23 בספטמבר 2026, שמונה ימים לאחר מכן, עם הפחתת מחיר של כ-70% על סינתזת דיבור שנלוותה לכך. פער שמונת הימים הזה הוא הסיבה שהשוואה זו שווה קריאה עכשיו ולא ביולי. שום דבר בתפקידים של שני המוצרים לא השתנה — האחד מקשיב ומדבר, והאחר קורא טקסט בקול רם — אבל שני החצאים של צינור קולי בייצור נבנו מחדש או תומחרו מחדש בתוך שבועיים בלבד, והחשבון שנהג להכריע בהתמודדות הזו זז בשקט.
שני חצאים, מתרעננים בהפרש של שמונה ימים
נתחיל מהדבר שהופך את הצימוד הזה ליוצא דופן: שני המודלים לא מתחרים. למוצר קולי יש פה ויש לו אוזן, ואלה הם פה אחד ואוזן אחת. Gemini 3.8 Live סוגר את המעגל — אודיו ווידאו נכנסים, אודיו יוצא, הפרעות מטופלות, וקריאות לכלים פועלות מתחת לפני השטח של השיחה. Qwen-Audio-3.1-TTS מקבל מחרוזת וקול ייחוס ומחזיר ביצוע. הוא טוב יותר כפה מאשר בכל תפקיד אחר, והוא לא מנסה להיות אוזן.
מה שהופך את התזמון של ספטמבר למעניין הוא ששתי ההודעות מכוונות לשני קצוות מנוגדים של אותה שורת תקציב. ההשקה של Google ב-15 בספטמבר הייתה סיפור של יכולות בלי שינוי מחיר; ההודעה של Alibaba ב-23 בספטמבר הייתה בעיקר סיפור של שולי רווח, עם יכולת חדשה שנלוותה אליה. צוות שבנה צינור היברידי באוגוסט קיבל, בתוך שמונה ימים, סיבה לבחון מחדש את שתי הרגליים — ורק אחת מהן הוזלה.
מה שהשחרור של 3.1 באמת שינה בצד של Qwen
Alibaba לא שחררה מודל אחד ב-23 בספטמבר. דור ה-3.1 מכסה חמש נקודות קצה — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next ו-Qwen-Audio-3.1-Realtime — ורק אחד מהן, שכבת ה-TTS הרגילה, הוא תחליף ישיר לכל מי שכבר קורא למודל ה-TTS 3.0.
ברמה הזו, שלושה דברים השתנו ואחד מהם הוא עלות מיגרציה אמיתית. השליטה במסירה עברה מאוצר מילים קבוע של 86 תגיות מוטבעות להוראה בשפה טבעית: אתה מתאר את הרגש, הקצב והסגנון שאתה רוצה במקום להכניס את הסוגר הנכון במיקום הנכון. העברת גוון בין-לשונית הגיעה, ומאפשרת לקול ייחוס אחד לשאת את זהותו בין מנדרינית, קנטונזית, אנגלית ויפנית. והמודל כעת מסתדר ישירות עם אודיו ייחוס רועש או מהדהד, ללא שלב נפרד של הפחתת רעש. כיסוי השפות נותר ללא שינוי ועומד על 16 שפות כפי שדווח על ידי הספק, ועוד 20 אזורי ניבים סיניים, ו—כדאי לציין זאת כי נוטים להחליק את זה במקומות אחרים—החומרים של Alibaba עצמה אומרים שרמת 3.1 מוסיפה שבע שפות, דבר שאינו מתיישב עם 16 השפות שהכיסוי שפורסם של דור יולי מנה. התייחס לשני המספרים כאל דיווחי ספק עד שתבדוק את השפות הספציפיות שאתה צריך מול Model Studio.
המוצר החדש באמת בגרסה הוא Qwen-Audio-3.1-TTS-Next, ש-Alibaba מכנה מודל "Audiogen": מעבר אחד שמייצר קול, אפקטי סאונד ורקע סביבתי יחד, לדיאלוג רב-דוברים, להרכבת פודקאסטים ולעבודת סצנות. הוא מתומחר ב-$0.848 למיליון טוקני קלט וב-$1.696 למיליון טוקני פלט בצומת בייג'ינג, עם תקרה של 3,000 תווי קלט, 240 שניות של אודיו מיוצר לפודקאסטים ו-120 שניות במקרים אחרים, שלוש בקשות בשנייה, ומקבל עד שלושה קטעי ייחוס של 30 שניות כל אחד. הוא תומך בסינית ובאנגלית בלבד. אם תהליך העיבוד שלך הוא קריין יחיד שקורא תסריט, המוצר הזה אינו רלוונטי עבורך; אם מדובר בשני מנחים ורקע מוזיקלי, זו הסיבה להסתכל על הגרסה הזאת בכלל.
התפר הוא הדבר שאתה למעשה בוחר
מכיוון ששני המודלים לא עושים את אותה עבודה, ההחלטה אינה תחרות השוואתית. זו שאלה של היכן אתה ממקם את נקודת ההעברה, וכמה אתה מוכן לשלם כדי שהתפר יהיה בלתי נראה.
ישנן שתי ארכיטקטורות כנות. הראשונה היא רשת אחת: Gemini 3.8 Live מטפל בכל התור, שומע את המתקשר, מחליט מה לומר ואומר זאת, ואתה מקבל את הקול שהוא נותן לך — שאותו לא ניתן לשכפל ולא ניתן למתג. השנייה היא קסקדה: זיהוי, אחר כך הסקה, אחר כך Qwen-Audio-3.1-TTS כפה, ומעניק לך אלף קולות כולל אחד שהוקלט על ידי הקריין שלך, במחיר של השהיה על פני שניים או שלושה גבולות ספקים והפרוזודיה שאבודה כאשר משפט מפוצל על פני קריאת API.
רוב הצוותים מגיעים בסופו של דבר לשתי הגישות גם יחד, וזה אינו כישלון של אומץ. השתמשו במודל בזמן אמת במקום שבו חשים בהשהיה — קטיעה, אישור, ה"ממ-הם" שאומר למתקשר שאתם עדיין שם — ובמודל הסינתזה במקום שבו שומעים את האיכות: הקראה חוזרת ארוכה של פוליסה, מספר אישור הנקרא בקצב מכוון, הקול המותגי שחייב להיות זהה בכל שיחה ושיחה. השילוב ההיברידי הוא התשובה הנכונה עבור מחלקה גדולה של מוצרים. זה גם המקום שבו מודל העלויות נעשה קשה, מפני שכעת אתם מודדים שתי יחידות שונות.

מתומחר לפי שעת אודיו, שהיא היחידה ששניהם מתאימים לה.
גוגל מחייבת על Live API לפי דקה; אליבאבא מחייבת על שכבות ה-Qwen TTS לפי תו ולפי טוקן. כדי להשוות ביניהן צריך לבחור מנרמל, והמנרמל היחיד שניתן להצדיק עבור קול הוא שעת אודיו מוגמר.
• חיוב על קלט — Gemini 3.8 Live לפי דקת אודיו, $0.005 בקלט ו-$0.018 בפלט, לעומת Qwen-Audio-3.1-TTS לפי מיליון תווים, כשדרגת 3.0 Plus נעה סביב $27.60 ודרגת Flash סביב $15 לפני הקיצוץ, ודרגת ה-TTS Flash מוצעת במחיר 1.5 יואן למיליון טוקני קלט ו-12 יואן למיליון טוקני פלט אחריו
• חיוב על פלט — שיחה דו-כיוונית ב-Gemini 3.8 Live עולה כ-$1.38 לשעת דיבור בזמן אמת לפי המחירון, לפני כל מטמון, לעומת Qwen-Audio-3.1-TTS שהוא זרם חד-כיווני, כשדרגת 3.1-Next עומדת על $0.848 למיליון טוקני קלט ו-$1.696 למיליון בפלט בצומת בייג'ינג
• שומע את המתקשר — Gemini 3.8 Live כן, קלט אודיו ווידאו מקורי לעומת Qwen-Audio-3.1-TTS לא, טקסט נכנס ואודיו יוצא
• קולות — Gemini 3.8 Live קול אחד, בלתי ניתן לשיבוט, בלתי ניתן למיתוג לעומת Qwen-Audio-3.1-TTS למעלה מאלף, עם שיבוט zero-shot מאודיו ייחוס רועש
• שפות — Gemini 3.8 Live 97 לפי הצהרת הספק, בהחלפה תוך כדי שיחה לעומת Qwen-Audio-3.1-TTS 16 לפי הצהרת הספק ועוד 20 אזורי ניב סיניים, עם העברת גוון בין מנדרינית, קנטונזית, אנגלית ויפנית
• שליטה במסירה — Gemini 3.8 Live פרומפט והקשר השיחה לעומת Qwen-Audio-3.1-TTS הוראה בשפה טבעית, שמחליפה את 86 התגיות המוטמעות של דור 3.0
• ציון בלתי תלוי — Gemini 3.8 Live 82.6 במדד Artificial Analysis Speech to Speech Index עבור גרסת Extended Thinking ו-76.0 עבור הרגילה לעומת Qwen-Audio-3.1-TTS אין; המספר הקרוב ביותר של Qwen הוא 1,259 Elo עבור דרגת הדור הקודם 3.0 Plus ב-Provider Voice Arena, שזה ציון של הדגם הקודם ולא של הדגם הזה
אחוז ההפחתה מצוטט ביחס לתעריפים המשתנים לפי אזור ושכבה, כך שה-70% שבכותרת אינו הבטחה לגבי התעבורה שלך, ו-Alibaba Cloud גם העבירה תמלול בזמן אמת בצומת סינגפור מחיוב לפי משך לחיוב לפי טוקנים — בסיס פחות צפוי, מפני שגם שקט וגם הקשר של ריבוי סבבים מנפחים את צריכת הטוקנים. קראו את כרטיס התעריפים החדש מול האודיו שלכם.

מה שהשדרוג ל-3.1 לא פותר
הנה החלק שקל לטעות בו בשני הכיוונים. השיפורים של 3.1 לא הופכים את Qwen-Audio-3.1-TTS למועמד לעבודה ש-Gemini 3.8 Live עושה — שליטה מבוססת הוראות, העברת גוון וסבילות לקלט רועש הופכים אותו לפה טוב יותר, ואף אחד מהם לא נותן לו אוזן. באותה מידה, המיקום של Gemini 3.8 Live בבנצ'מרק לא אומר לך דבר בשאלה אם הקול הממותג שלך שורד משפט בקנטונזית.
יש גם חור בראיות שהוזלת מחיר הופכת את ההתעלמות ממנו למפתה יותר. ל-Qwen-Audio-3.1-TTS אין ציון עצמאי. ה-1,259 Elo שמופיע לצד השם Qwen ב-Provider Voice Arena שייך ל-Qwen-Audio-3.0-TTS-Plus, המודל שמוחלף, שנמדד על 1,447 דגימות. השורה של היורש עצמו ב-Arena עדיין לא קיימת. אם תהליך האישור שלך דורש מספר של צד שלישי — ולקול מותג הוא כנראה אמור לדרוש — המודל החדש יותר הוא זה שאין לו אותו, והשכבה הזולה יותר היא זו שאינך יכול עדיין להגן עליה. האירוע היחיד שיכריע את זה הוא הופעתו של Qwen-Audio-3.1-TTS בלוח האזנה עיוורת.
היכן מפתח אחד עוזר והיכן לא
יש השלכה אחת של השחרור של גרסה 3.1 שקל לפספס, משום שהיא נראית כמו פרט בהנדסת פרומפטים ולא כמו פרט בתשתית. החלפת 86 תגיות מקודדות קשיח בהנחיה חופשית הופכת את הנחיות המסירה שלך לארטיפקטים טקסטואליים. כעת אתה מייצר אותן, מנהל גרסאות שלהן, ומאמת מחדש כל אחת מהן מול הפרשנות של המודל החדש — ומצב הכשל הוא סחיפה, לא שגיאה, משום ששני ניסוחים של "חם אך לא סנטימנטלי" לא ייקלטו באופן זהה.
זו בעיית הסקה מטקסט שעוטפת צינור עיבוד דיבור, וזה המקום שבו אנחנו מועילים. OrcaRouter אינו מנתב את Qwen-Audio-3.1-TTS או כל מודל Qwen-Audio, ואנחנו גם לא מנתבים את נקודות הקצה של Gemini 3.8 Live — אף אחד משני חלקי המחסנית הזו אינו ניתן לקריאה דרכנו, ואין לקרוא שום דבר כאן כטענה שכן. מה שכן יש לנו הוא השכבה שכותבת ובודקת את טקסט הכיוון: qwen/qwen3.8-flash וגם google/gemini-3.8-flash מבין יותר מ-200 מודלים מתוך מפתח אחד במחיר המחירון של הספק ללא תוספת, עם DSL לניתוב שמרכיב כמה מודלים לקריאה אחת ומעבר אוטומטי לגיבוי כאשר רכיב במעלה הזרם נחלש. כשאתה עומד לאמת מחדש עשרת אלפים פרומפטים של מסירה מול מודל שזה עתה שינה את האופן שבו הוא קורא אותם, יצירת הווריאציות וניקודן לפי עקביות היא החלק שצריך להיות חוזה אחד, לא ארבעה.
מה למדוד לפני שתבחר
שלושה ניסויים עונים יותר מכל דירקטוריון. קחו קול ייחוס אחד ופסקה אחת מהתסריט שלכם והעבירו דרך Qwen-Audio-3.1-TTS, והקשיבו אם השליטה מבוססת ההוראות נותנת לכם אותו ביצוע פעמיים — זהו סיכון המיגרציה, וזול יותר למדוד אותו מאשר לתכנן סביבו. קחו הקלטת שיחה אמיתית עם רעש הרקע שלכם והעבירו דרך Gemini 3.8 Live, ובדקו אם המעבר בין תורות הדיבור נשמר כשהמתקשר מפריע באמצע מילה — זה מה שמדד הדיבור-אל-דיבור מנסה לכמת, והוא אינו שורד מגע עם קו טלפון אמיתי באופן אמין דיו כדי לקבלו באמונה עיוורת. והריצו את החישוב על הנפח שלכם בשעות אודיו ולא ביחידות ששני הספקים מנפיקים בהן חשבוניות, כי בשילוב המסוים הזה פער המחירים הצפוי בין "TTS סיני זול" ל"דגם הדגל של Google" מעולם לא היה גדול כפי שהוא נראה, ואחרי 23 בספטמבר הוא קטן עוד יותר.

השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
