כרטיס Hero מיוצר עבור 'Gemini 3.8 TTS vs VoxCPM2' על רקע לבן עם הדגשות גרדיאנט עדינות בכחול ותכלת. הכרטיס השמאלי 'Gemini 3.8 Flash TTS' מפרט נקודת קצה של API, ‏Elo 1,260 במקום 2, ו-$16.50 לכל מיליון תווים מנורמלים; הכרטיס הימני 'VoxCPM2' מפרט Apache 2.0, ‏2B פרמטרים, כ-8 GB VRAM להרצה, מקדם זמן אמת של 0.30 ב-PyTorch רגיל וללא נקודת קצה מתארחת. שורת כותרת תחתונה מציינת 'Elo לפי Artificial Analysis Provider Voice Arena, ספטמבר 2026; נתוני VoxCPM2 לפי כרטיס המודל שלו.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.8 TTS מול VoxCPM2: לשכור קול או להריץ אחד משלך — במספרים אמיתיים

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אין שורת לוח תוצאות שמעמידה זה לצד זה את Gemini 3.8 Flash TTS ואת VoxCPM2, והיעדרות זו היא העובדה השימושית ביותר בהשוואה הזו. Gemini 3.8 Flash TTS הוא נקודת קצה מתארחת עם Elo של 1,260 במקום ה-2 ב-Artificial Analysis Provider Voice Arena ולוח מחירים מפורסם בטוקנים. VoxCPM2 הוא צ'קפוינט של OpenBMB — 2 מיליארד פרמטרים, Apache 2.0, שוחרר באפריל 2026 — שאין ספק הסקה שמארח אותו. אי אפשר לשכור אותו. אתה מריץ אותו.

אז השאלה היא לא איזה מודל נשמע טוב יותר. השאלה היא אם עומס העבודה שלך יקבל שירות טוב יותר מתשלום לפי תו עבור המעבדים הגרפיים של מישהו אחר, או מהחזקת המעבדים הגרפיים בבעלותך ותשלום עבורם בין אם הם עובדים ובין אם לא. זו שאלה אריתמטית, ובשונה מרוב השוואות המודלים יש לה תשובה שאפשר לחשב לפני שמתחייבים.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

אחד מאלה שוכרים, ואת האחר מפעילים.

התחל ממה שכל אחד מהם בפועל מוסר לך.

• גישה — Gemini 3.8 Flash TTS הוא API בלבד, ונקרא דרך ה-API של Gemini והמשטחים של Google הנקובים בהודעה שלו מ-23 בספטמבר 2026. ל-VoxCPM2 אין נקודת קצה של צד ראשון בשימוש בייצור ואין ספק הסקה שמשרת אותו; הצ'קפוינט הוא המוצר.

• רישיון — VoxCPM2 מופץ תחת Apache 2.0, שמתיר שימוש מסחרי ללא הסכם נפרד. זהו רישיון מתירני באמת, והוא אינו ברירת המחדל עבור משקולות דיבור פתוחות; רבים מהם מופצים בתנאי מחקר בלבד, שמנתבים שימוש מסחרי חזרה דרך API מתארח.

• גודל — VoxCPM2 הוא מודל של 2 מיליארד פרמטרים שנכנס בכ-8 GB של VRAM בדיוק מופחת לצורכי פיתוח, עם שיא של כ-22 GB בזמן הגשה בכרטיס של 24 GB. גוגל לא פרסמה מספר פרמטרים לאף אחד משני דגמי Gemini 3.8 TTS.

• יצירת קול — Gemini 3.8 Flash TTS מבצע עיצוב קול מתיאור כתוב, שכפול קול מדגימה של 30 שניות, ודיאלוג בין שני דוברים בקריאה אחת. VoxCPM2 הוא מודל טקסט לדיבור בקול יחיד; שיחה היא שתי הרצות תפורות יחד.

• ציון עצמאי — ל-Flash TTS יש אחד. VoxCPM2 אינו מופיע בין השורות המדורגות ב-Provider Voice Arena שנלכדה ב-24 בספטמבר 2026. היעדרות מלוח אינה פסק דין על איכות — היא בדרך כלל אומרת שאיש לא הזין את המודל — אבל היא כן אומרת שאין מספר העדפה של צד שלישי לשקול.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

לנקודה האחרונה הזו יש השלכות לשני הכיוונים, וכדאי לומר זאת במפורש ולא לטשטש: אם אתה זקוק לאות איכות בלתי־תלוי לפני שאתה מתחייב, רק אחד מהשניים מספק אות כזה.

המספר שמכריע: מקדם זמן אמת

אירוח עצמי של מודל דיבור ממיר חשבון לפי תו לחשבון לפי שעת GPU, ושער החליפין בין שתי היחידות האלה הוא מקדם זמן האמת של המודל — כמה שניות חישוב נדרשות כדי להפיק שנייה אחת של אודיו.

הנתונים המפורסמים של VoxCPM2 הם 0.30 ב-PyTorch רגיל ו-0.13 תחת Nano-VLLM. יש לקרוא אותם כתפוקה ולא כהשהיה: ב-0.13, שעת GPU אחת של זמן שעון מייצרת בערך 7.7 שעות של אודיו מוגמר. ב-0.30, אותה שעת GPU מייצרת קרוב יותר ל-3.3 שעות. אלה המספרים של כרטיס המודל עצמו, כפי שנמדדו על ידי OpenBMB, והם הקלט החשוב ביותר בכל החלטת לבנות מול לקנות כאן.

מהם נובעים שלושה דברים.

• סטאק ההגשה חשוב יותר מהמודל. מעבר מ-PyTorch רגיל ל-Nano-VLLM יותר ממכפיל את התפוקה על חומרה זהה. כל מודל עלויות שמבוסס על הנתון 0.30 מנפח את עלות האירוח העצמי בפקטור של כ-2.3.

• הניצולת היא כל המשחק. GPU שכור שבטל 90% מהזמן אינו זול יותר מ-API בשום מחיר. נקודת האיזון מופיעה רק כשמחזיקים את הכרטיס עסוק.

• אצווה משנה שוב את החשבון. מקדם זמן אמת נמדד לכל זרם בנפרד; שרת שמטפל בבקשות במקביל מפזר את העלות הקבועה עליהן, וזה בדיוק המשטר שבו אירוח עצמי מתחיל לנצח.

כמה עולה שעה של אודיו, בשני הכיוונים

הצב את שני מודלי החיוב על אותו ציר. שעה אחת של אודיו מוגמר היא 3,600 שניות של פלט.

בצד השכור, Google מחייבת לפי טוקנים ולא לפי תווים: $0.50 למיליון טוקני טקסט בקלט ו-$9.00 למיליון טוקני אודיו בפלט עד 31 בדצמבר 2026, ואז $18.00; Flash-Lite TTS עומד על $0.50 ו-$6.00, ואז $12.00. Batch ו-Flex עומדים על $0.25 ו-$4.50 עבור Flash TTS לעומת $0.25 ו-$3.00 עבור Flash-Lite TTS, ו-Priority עומד על $0.90 ו-$16.00. Artificial Analysis מנרמלת את התעריפים הסטנדרטיים ל-$16.50 ו-$11.00 למיליון תווים, שזו ההמרה של לוח הדירוג ולא הצעת מחיר של Google, וזה הנתון שיש להשתמש בו בעת השוואה למודל שמחייב לפי תווים.

בצד הבעלות העצמית אין תעריף לפי תו כלל. העלות היא שעת GPU, כפול מספר השעות שתזדקק להן בתפוקה שלעיל, ועוד סטאק ההגשה, ועוד האנשים שמתחזקים אותו. היתרון של VoxCPM2 הוא שהעלות השולית של השעה האלפית זהה לזו של השעה הראשונה — והחיסרון שלו הוא שהעלות השולית של השעה הראשונה היא GPU.

וזו הסיבה שההחלטה נקייה באופן יוצא דופן:

• מתחת לנפח מסוים, ה-API מנצח וזה לא צמוד. אתם משלמים דולרים חד-ספרתיים לשעת אודיו לעומת עלות הון, והתעריף המבצעי של Google מרחיב את הפער הזה עד 1 בינואר 2027.

• מעל לנפח הזה, על חומרה שכבר בבעלותך ואתה יכול להשאיר אותה עסוקה, הצ'קפוינט של Apache 2.0 מנצח באופן מכריע — ובשונה מצ'קפוינט ברישיון מחקרי, שום דבר ברישיון לא מונע ממך להפיץ אותו.

• באמצע, התשובה הכנה היא שאתם קונים אופציונליות ולא חיסכון. אירוח עצמי קונה לכם את היכולת לנעוץ גרסה, להשאיר את האודיו בתשתית שלכם, ולהפסיק לדאוג משינוי התעריף של ספק.

כאשר כל אחד מהם הוא התשובה הנכונה

בחר ב-Gemini 3.8 Flash TTS כאשר אתה רוצה את המוצר המתועד טוב יותר. יש לו ציון עצמאי, מחיר מפורסם, דיאלוג של שני דוברים בקריאה אחת, עיצוב קולי ושכפול קולי, ואין שום משטח תפעולי מעבר למפתח API. ה-Flash-Lite TTS האח שלו נותן לך נקודת מחיר שנייה באותו ממשק, במחיר מנורמל של $11.00 למיליון תווים. מה שאתה מקבל בתמורה הוא תעריף שמכפיל את עצמו ב-1 בינואר 2027, וחוסר יכולת להריץ את המודל בשום מקום.

בחר ב-VoxCPM2 כשהעבודה התפעולית היא העיקר. Apache 2.0 פירושו ששימוש מסחרי מותר לחלוטין, גודל 2B פירושו שמאיץ בודד מספיק, ומקדם זמן אמת של 0.13 תחת Nano-VLLM פירושו שכרטיס צנוע מפיק כמה שעות של אודיו לכל שעת זמן קיר. מה שאתה מקבל הוא שאיש אחר לא יריץ אותו עבורך: אין נקודת קצה מתארחת, אין שורה בארנה, אין מחירון ספק, וכל ערבות איכות שתקבל היא כזו שאתה בונה ומודד בעצמך.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

אף אחד מהמודלים אינו מתארח אצל OrcaRouter, וכדאי לומר זאת ישירות ולא לרמוז אחרת. המקום שבו קוראים ל-Gemini 3.8 Flash TTS הוא ה-API של Google עצמה והמשטחים ש-Google ציינה; VoxCPM2 הוא צ'קפוינט שאתם פורסים. מה ש-OrcaRouter מכסה הוא השכבה שמעל ההחלטה הזו — למעלה מ-200 מודלים מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת מחיר, כך ששינוי מחיר של ספק מתעדכן אצלנו באותו יום ולא במחזור החיוב הבא, מעבר אוטומטי לגיבוי כך שמודל שנמצא בהערכה לא צריך להיות תלות בסביבת ייצור, ו-DSL לניתוב שמרכיב כמה מודלים לקריאה אחת כשקול בודד לא נושא את כל העבודה.

מה לצפות בהמשך

שני דברים היו משנים את ההשוואה הזו באופן מהותי, ואף אחד מהם עדיין לא קרה.

הראשון הוא מישהו שמארח את VoxCPM2. היעדרותו משוק האינפרנס היא הסיבה העיקרית לכך ששני המודלים מושווים מבחינה כלכלית ולא מבחינה איכותית — אם ספק יאמץ אותו, החשבון של שכירה מול בעלות מפסיק להיות הגורם המכריע, והשורה החסרה בארנה הופכת לדבר שתרצה למלא.

השני הוא שינוי התעריפים של ינואר מצד גוגל. בתעריף המבצעי ה-API זול מספיק עד שרוב עומסי העבודה לא צריכים לארח דבר בעצמם; בתעריף שלאחר המבצע הפער מצטמצם עד כדי כך שצוות עם קיבולת GPU קיימת ונפח קבוע צריך לחשב שוב את המספרים במקום להניח שה-API עדיין מנצח.

עד שאחד מהמהלכים האלה יתרחש, הנתון המכריע אינו לוח תוצאות. זה כמה שעות אודיו בחודש אתה מפיק, והאם הכרטיס תפוס.