כרטיס הירו מיוצר עבור 'Gemini 3.8 TTS vs ElevenLabs' על רקע לבן עם הדגשות גרדיאנט עדינות בכחול וציאן. הכרטיס השמאלי 'ElevenLabs Eleven v3' מפרט $100 ל-1M תווים, יותר מ-70 שפות, Elo 1,167 ודירוג 17; הכרטיס הימני 'Gemini 3.8 Flash TTS' מפרט $33 ל-1M תווים, 130 שפות, Elo 1,260 ודירוג 2. שורת כותרת תחתונה מציינת 'Elo לפי Artificial Analysis Provider Voice Arena, ספט׳ 2026.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.8 TTS מול ElevenLabs: מה מקבלים בתמורה למחיר גבוה פי שלושה

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

באותו היקף שימוש, מודל הסינתזה המוביל של ElevenLabs עולה בערך פי שלושה מהמודל החדש של אותו ספק. ElevenLabs Eleven v3 מחייב $0.10 לכל אלף תווים — $100 למיליון — וGemini 3.8 Flash TTS מחייב $9.00 למיליון אסימוני אודיו, ש-Artificial Analysis מנרמל ל-$33.00 למיליון תווים. זהו פער של פי 3.0 במונה, וזו העובדה הגדולה היחידה בהשוואה הזו. השאלה המעניינת אינה אם הפער אמיתי; היא מה ששישים ושבעה הדולרים הנוספים למיליון תווים באמת קונים, כי התשובה אינה ״דיבור טוב יותר״.

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

שלושה מטרים, לא אחד

הדבר הראשון שצריך להבהיר הוא ששני המוצרים האלה לא מודדים את אותו הדבר, וכרטיסי התעריפים המפורסמים מסתירים זאת.

• ElevenLabs מחייבת לפי תווים. Eleven v3 עולה $0.10 לכל 1,000 תווים, עם תקרה של 5,000 תווים לבקשה. Eleven v3 Conversational עולה $0.05 לכל 1,000, ומודלי Flash ו-Turbo גם עולים $0.05 לכל 1,000 אך עם מגבלת בקשה של 40,000 תווים והשהיה מוצהרת של ~75 מ"ש לעומת ~280 מ"ש של Eleven v3 Conversational.

Google מחייבת לפי טוקנים, וטוקני אודיו אינם טוקני טקסט. Gemini 3.8 Flash TTS גובה $0.50 למיליון טוקני טקסט בקלט ו-$9.00 למיליון טוקני אודיו בפלט, כאשר המדידה היא 25 טוקני אודיו לשנייה של דיבור שנוצר. לא פורסמה מגבלת תווים לכל בקשה.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis לא גובה תשלום מאף אחד מהשניים; היא מנרמלת. הסכומים $100.00 ו-$33.00 למיליון תווים בלוח המובילים Provider Voice Arena שלה הם מכנה משותף נגזר, כדי שהלוח יוכל בכלל לדרג לפי מחיר. שימושי ליחס, לא להצעת מחיר.

אז הגרסה הכנה של נתון 3.0x היא: על בסיס ההשוואה העקבית היחיד שזמין, גוגל היא כשליש מהמחיר. מה שזה אומר בגיליון האלקטרוני שלכם תלוי אם עומס העבודה שלכם נשלט על ידי מחרוזות קצרות או ארוכות — מדד אודיו לפי שנייה ומדד טקסט לפי תו מתרחקים זה מזה בחדות ככל שהאמירות נעשות ארוכות יותר, מכיוון ששקט, הפסקות וריפוד פרוזודי גובים כולם טוקנים של אודיו ולא תווים.

חודש עבודה

קחו מיליון תווים של טקסט, בערך באורך של רומן בינוני, שהומרו לדיבור פעם אחת.

• ElevenLabs Eleven v3 — $100.00 עבור הסינתזה, בתוספת כל שכבת תוכנית שתזדקק לה כדי להריץ אותה בקונקרנסי שלך. התוכניות המפורסמות מציעות את Starter ב-$6, את Creator ב-$22, את Pro ב-$99, את Scale ב-$299 ואת Business ב-$990, והקצבות התווים כלולות בהן ולא מחויבות בנפרד.

• Gemini 3.8 Flash TTS — בשווי $33.00, או בערך $16.50 אם ניתן לבצע את המשימה באצוות, מפני שמסלול Batch ו-Flex מפחית בחצי את תעריף האודיו ל-$4.50 למיליון טוקנים. שירות Priority מעלה אותו ל-$16.20 למיליון, או בשווי של כ-$59.40, שעדיין נמוך בהרבה מ-ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — 6.00$ למיליון טוקני אודיו, שווה ערך לכ-22.10$ לפי אותו נרמול, במחיר של 101 שפות במקום 130.

הריצו את אותו מיליון תווים דרך התמחור המבצעי של Google והפער ילך ויתרחב עוד יותר, מכיוון ששני דגמי Gemini TTS החדשים מתומחרים בחצי תעריף עד 31 בדצמבר 2026 ואז התעריף מוכפל. כל מי שבונה מקרה עסקי על נתוני ספטמבר בונה אותו על הנחה שתאריך התפוגה שלה פורסם.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

המקום היחיד שבו ההשוואה מתהפכת הוא אמירות קצרות מאוד. חיוב לפי תווים גובה כמעט כלום עבור אישור בן שלוש מילים; חיוב לפי שניות אודיו גובה עבור השנייה שנדרשת כדי לומר את האישור, כולל השקט סביבו. אם המוצר שלך הוא ממשק קולי הבנוי מתגובות בנות משפט אחד, החשבון נוטה לכיוון ElevenLabs. אם מדובר בקריינות, בספרי שמע, בלוקליזציה של תוכן ארוך או בכל דבר שבו הטקסט ארוך והאודיו ארוך ממנו, הוא נע בחדות לכיוון Google.

שאלת האיכות, בכנות

ב-Artificial Analysis Provider Voice Arena — הצבעות זוגיות עיוורות על פני הקולות המקוריים של כל ספק — שני המודלים אינם קרובים, ו-Google מובילה.

• Gemini 3.8 Flash TTS — דירוג 2, Elo 1,260, מרווח של 17 נקודות, 1,999 דגימות, 8 קולות Arena, הושק בספטמבר 2026.

• ElevenLabs Eleven v3 — דירוג 17, Elo 1,167, מרווח של 11 נקודות, 4,345 דגימות, 8 קולות ארנה, מופיע בלוח כפברואר 2026.

תשעים ושלושה נקודות Elo מפרידות ביניהם, ובניגוד לפער בין שלושת המומובילים באותו לוח, הפער הזה אמיתי: הרווח של Eleven v3 הוא 1,156 עד 1,178 ושל Gemini הוא 1,243 עד 1,277, ללא חפיפה. מספר הדגימות של Eleven v3 גדול יותר מפי שניים מזה של Gemini, כך שגם האומדן אינו דל.

זו תוצאה מביכה באמת עבור טיעון המחיר, והיא סותרת את המסקנה המתבקשת. ElevenLabs גובה פי שלושה, וממוקמת שבעה-עשר מקומות נמוך יותר בהעדפה עיוורת. מה ששישים ושבעה הדולרים הנוספים קונים, זה לא קול שנשמע טוב יותר בהשוואה ראש בראש.

מה ElevenLabs בעצם מוכרת

ElevenLabs אינה מוכרת בעיקר נקודת קצה לסינתזה, ותמחור שלה כאילו זה מה שהיא כן מוכרת הוא המקום שבו רוב ההשוואות טועות. מה שהכסף קונה:

• ספריית קולות. ספריית הקולות המשותפת של ElevenLabs מונה מאות קולות והיא משטח מוצר של ממש — מה שאנשים באים אל ElevenLabs בשבילו הוא לעתים קרובות קול ספציפי ששמעו אי־שם, ולא המודל שמאחוריו. Gemini 3.8 Flash TTS מגיע עם 30 קולות אולפן מובנים, מסלול עיצוב קול שמייצר קול מתיאור בשפה טבעית, ומסלול שיבוט שמשכפל מדגימה של 30 שניות עם אימות הסכמה, סימן מים של SynthID ופרטי C2PA מצורפים. הקטלוג המובנה קטן יותר; היכולת ליצור קול ספציפי דומה.

• דרגות השהיה כמוצרים נפרדים. Flash ו-Turbo בכ-75 ms ומגבלה של 40,000 תווים מהווים מוצר שונה מ-v3 בכ-280 ms ו-5,000 תווים, ושניהם זולים יותר מ-v3. אם היישום שלך צריך מתחת ל-100 ms, ElevenLabs מוכרת זאת במפורש וחומר ההשקה של Google לא מציג טענת השהיה דומה עבור אף אחד משני מודלי ה-TTS החדשים.

• אקוסיסטם. דיבוב, סוכני קול, נקודות קצה שיחתיות, מבנה תוכנית עם מקביליות מצורפת — מאותה סיבה ש-Cartesia מוכרת טלפוניה: זה סטאק, לא מודל.

אם אתה קונה סטאק, ה־3.0x הוא המחיר של לא להרכיב אותו. אם אתה קונה קריאת סינתזה, אתה משלם אותה עבור ספריית קולות ורמת השהיה.

מה גוגל בעצם מוכרת

המקרה הנגדי צר יותר וחזק יותר מ"זול יותר".

• כיסוי שפות — 130 שפות ב-Flash TTS ו-101 ב-Flash-Lite TTS, זיהוי אוטומטי מתוך הטקסט, לעומת יותר מ-70 השפות ש-ElevenLabs מתעדת עבור Eleven v3. עבור סבב לוקליזציה, ההבדל הזה אינו השוואת תכונות, אלא פער בכיסוי.

• כיוון — שליטה על מסירה שורה-אחר-שורה, בימוי סצנה של שני דוברים בתוך קריאה אחת, ורמזים לא-מילוליים הכתובים בתסריט בתור <laughs>, <sigh>, <gasp>, |mhm| ו|yeah|. גוגל טוענת שדור 3.8 שיפר עקביות בטקסטים ארוכים ושליטה בשני דוברים לעומת Gemini 3.1 Flash TTS, וזה בדיוק למה התכונות האלה קיימות. טענת יצרן, לא משוחזרת.

• מודל מצב קולי — 200 קולות מותאמים אישית עם מצב לכל פרויקט עם TTL של שנה, או קולות ללא מצב המופנים על ידי voicekey_... מזהה שפג תוקפם בעוד שבעה ימים. זוהי החלטת תשתית שאתה יכול לתכנן לפיה.

• בקרת פלט — WAV 24 kHz מונו PCM חתום 16 סיביות בנקודת הקצה הלא-זורמת, PCM ללא כותרת (audio/l16) בנקודת הקצה הזורמת, ו-audio/mulaw ו-audio/alaw עם קצב דגימה הניתן להגדרה.

מדדי ההשקה של Google מדווחים על ידי הספק ויש לקרוא אותם כך: ראשון במדד Hume AI Voice Design Benchmark בציון 71.4 וראשון במידול מבטא בציון 60.8, ראשון ושני במדד Hume Overall Quality Index עבור Flash ו-Flash-Lite בהתאמה, ומקומות מובילים בהעדפה עיוורת שנתבעו ביפנית, בפורטוגזית ברזילאית, בווייטנאמית, בערבית סטנדרטית מודרנית, בספרדית מקסיקנית ובהינדי. אף אחת מההרצות האלה אינה פומבית. ה-Elo של הזירה שלעיל הוא המספר היחיד שנאסף באופן עצמאי במאמר זה, ובמקרה הוא תואם את הכיוון של טענות הספק.

חשבון המתגים

תעבור אם עומס העבודה שלך הוא תוכן ארוך, רב-לשוני או בנפח גבוה מספיק כדי ש-3.0x יופיע כסעיף, ואם אתה יכול לחיות עם קטלוג קולות ברירת מחדל קטן יותר ובלי מסלול מפורסם מתחת ל-100 ms. זה מכסה קריינות, דיבוב, נגישות ורוב הדיבור המוטמע במוצרים.

הישארו אם אתם קונים את הסטאק — ספריית הקולות, רמות ההשהיה, מוצרי הדיבוב והסוכנים — או אם עומס העבודה שלכם מורכב ברובו מאמירות קצרות מאוד, שבהן מונה אודיו לפי שנייה מעניש אתכם. הישארו גם אם כבר ביצעתם כיוונון עדין לזהות קולית ב-ElevenLabs שהמשתמשים שלכם מזהים, כי המשכיות קולית היא תכונת מוצר, וליצור אותה מחדש על מודל חדש זה פרויקט.

כך או כך, המהלך ההגיוני הוא להריץ את שניהם במשך חודש על תעבורה אמיתית לפני שמתחייבים, וזה הטיעון בעד לא לחבר אף אחד מהם ישירות לבסיס הקוד שלך. OrcaRouter מציג יותר מ-200 מודלים מאחורי מפתח יחיד במחיר המחירון של הספק וללא תוספת, כך ששינוי מחיר מאחת המעבדות מגיע לחשבון שלך באותו יום במקום במועד החידוש, ומעבר אוטומטי לגיבוי שומר על מסלול דיבור בייצור פעיל כאשר נקודת קצה חדשה לגמרי מתנהגת שלא כשורה. אנחנו לא מארחים את ElevenLabs — שכבות הסינתזה והסוכנים שלה הן מוצר שלה עצמה — ואנחנו לא מארחים את נקודות הקצה של Gemini 3.8 TTS, שמגיעות מה-API של Google. מה שאנחנו מספקים הוא שכבת הטקסט שמתחת והניתוב שמעליה.

המספר שכדאי לשים לב אליו הוא ה-Elo של Eleven v3 בעדכון הבא של טבלת המובילים. תשעים ושלושה נקודות הן פיגור גדול עבור מודל שגובה פי שלושה, ואם המרווח מצטמצם בלי שהפער נסגר, טיעון המחיר מפסיק להיות עסקה והופך לפסק דין.