
Gemini 3.8 TTS מול VoxCPM2: לשכור קול או להריץ אחד משלך — במספרים אמיתיים
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
אין שורת לוח תוצאות שמעמידה זה לצד זה את Gemini 3.8 Flash TTS ואת VoxCPM2, והיעדרות זו היא העובדה השימושית ביותר בהשוואה הזו. Gemini 3.8 Flash TTS הוא נקודת קצה מתארחת עם Elo של 1,260 במקום ה-2 ב-Artificial Analysis Provider Voice Arena ולוח מחירים מפורסם בטוקנים. VoxCPM2 הוא צ'קפוינט של OpenBMB — 2 מיליארד פרמטרים, Apache 2.0, שוחרר באפריל 2026 — שאין ספק הסקה שמארח אותו. אי אפשר לשכור אותו. אתה מריץ אותו.
אז השאלה היא לא איזה מודל נשמע טוב יותר. השאלה היא אם עומס העבודה שלך יקבל שירות טוב יותר מתשלום לפי תו עבור המעבדים הגרפיים של מישהו אחר, או מהחזקת המעבדים הגרפיים בבעלותך ותשלום עבורם בין אם הם עובדים ובין אם לא. זו שאלה אריתמטית, ובשונה מרוב השוואות המודלים יש לה תשובה שאפשר לחשב לפני שמתחייבים.

אחד מאלה שוכרים, ואת האחר מפעילים.
התחל ממה שכל אחד מהם בפועל מוסר לך.
• גישה — Gemini 3.8 Flash TTS הוא API בלבד, ונקרא דרך ה-API של Gemini והמשטחים של Google הנקובים בהודעה שלו מ-23 בספטמבר 2026. ל-VoxCPM2 אין נקודת קצה של צד ראשון בשימוש בייצור ואין ספק הסקה שמשרת אותו; הצ'קפוינט הוא המוצר.
• רישיון — VoxCPM2 מופץ תחת Apache 2.0, שמתיר שימוש מסחרי ללא הסכם נפרד. זהו רישיון מתירני באמת, והוא אינו ברירת המחדל עבור משקולות דיבור פתוחות; רבים מהם מופצים בתנאי מחקר בלבד, שמנתבים שימוש מסחרי חזרה דרך API מתארח.
• גודל — VoxCPM2 הוא מודל של 2 מיליארד פרמטרים שנכנס בכ-8 GB של VRAM בדיוק מופחת לצורכי פיתוח, עם שיא של כ-22 GB בזמן הגשה בכרטיס של 24 GB. גוגל לא פרסמה מספר פרמטרים לאף אחד משני דגמי Gemini 3.8 TTS.
• יצירת קול — Gemini 3.8 Flash TTS מבצע עיצוב קול מתיאור כתוב, שכפול קול מדגימה של 30 שניות, ודיאלוג בין שני דוברים בקריאה אחת. VoxCPM2 הוא מודל טקסט לדיבור בקול יחיד; שיחה היא שתי הרצות תפורות יחד.
• ציון עצמאי — ל-Flash TTS יש אחד. VoxCPM2 אינו מופיע בין השורות המדורגות ב-Provider Voice Arena שנלכדה ב-24 בספטמבר 2026. היעדרות מלוח אינה פסק דין על איכות — היא בדרך כלל אומרת שאיש לא הזין את המודל — אבל היא כן אומרת שאין מספר העדפה של צד שלישי לשקול.

לנקודה האחרונה הזו יש השלכות לשני הכיוונים, וכדאי לומר זאת במפורש ולא לטשטש: אם אתה זקוק לאות איכות בלתי־תלוי לפני שאתה מתחייב, רק אחד מהשניים מספק אות כזה.
המספר שמכריע: מקדם זמן אמת
אירוח עצמי של מודל דיבור ממיר חשבון לפי תו לחשבון לפי שעת GPU, ושער החליפין בין שתי היחידות האלה הוא מקדם זמן האמת של המודל — כמה שניות חישוב נדרשות כדי להפיק שנייה אחת של אודיו.
הנתונים המפורסמים של VoxCPM2 הם 0.30 ב-PyTorch רגיל ו-0.13 תחת Nano-VLLM. יש לקרוא אותם כתפוקה ולא כהשהיה: ב-0.13, שעת GPU אחת של זמן שעון מייצרת בערך 7.7 שעות של אודיו מוגמר. ב-0.30, אותה שעת GPU מייצרת קרוב יותר ל-3.3 שעות. אלה המספרים של כרטיס המודל עצמו, כפי שנמדדו על ידי OpenBMB, והם הקלט החשוב ביותר בכל החלטת לבנות מול לקנות כאן.
מהם נובעים שלושה דברים.
• סטאק ההגשה חשוב יותר מהמודל. מעבר מ-PyTorch רגיל ל-Nano-VLLM יותר ממכפיל את התפוקה על חומרה זהה. כל מודל עלויות שמבוסס על הנתון 0.30 מנפח את עלות האירוח העצמי בפקטור של כ-2.3.
• הניצולת היא כל המשחק. GPU שכור שבטל 90% מהזמן אינו זול יותר מ-API בשום מחיר. נקודת האיזון מופיעה רק כשמחזיקים את הכרטיס עסוק.
• אצווה משנה שוב את החשבון. מקדם זמן אמת נמדד לכל זרם בנפרד; שרת שמטפל בבקשות במקביל מפזר את העלות הקבועה עליהן, וזה בדיוק המשטר שבו אירוח עצמי מתחיל לנצח.
כמה עולה שעה של אודיו, בשני הכיוונים
הצב את שני מודלי החיוב על אותו ציר. שעה אחת של אודיו מוגמר היא 3,600 שניות של פלט.
בצד השכור, Google מחייבת לפי טוקנים ולא לפי תווים: $0.50 למיליון טוקני טקסט בקלט ו-$9.00 למיליון טוקני אודיו בפלט עד 31 בדצמבר 2026, ואז $18.00; Flash-Lite TTS עומד על $0.50 ו-$6.00, ואז $12.00. Batch ו-Flex עומדים על $0.25 ו-$4.50 עבור Flash TTS לעומת $0.25 ו-$3.00 עבור Flash-Lite TTS, ו-Priority עומד על $0.90 ו-$16.00. Artificial Analysis מנרמלת את התעריפים הסטנדרטיים ל-$16.50 ו-$11.00 למיליון תווים, שזו ההמרה של לוח הדירוג ולא הצעת מחיר של Google, וזה הנתון שיש להשתמש בו בעת השוואה למודל שמחייב לפי תווים.
בצד הבעלות העצמית אין תעריף לפי תו כלל. העלות היא שעת GPU, כפול מספר השעות שתזדקק להן בתפוקה שלעיל, ועוד סטאק ההגשה, ועוד האנשים שמתחזקים אותו. היתרון של VoxCPM2 הוא שהעלות השולית של השעה האלפית זהה לזו של השעה הראשונה — והחיסרון שלו הוא שהעלות השולית של השעה הראשונה היא GPU.
וזו הסיבה שההחלטה נקייה באופן יוצא דופן:
• מתחת לנפח מסוים, ה-API מנצח וזה לא צמוד. אתם משלמים דולרים חד-ספרתיים לשעת אודיו לעומת עלות הון, והתעריף המבצעי של Google מרחיב את הפער הזה עד 1 בינואר 2027.
• מעל לנפח הזה, על חומרה שכבר בבעלותך ואתה יכול להשאיר אותה עסוקה, הצ'קפוינט של Apache 2.0 מנצח באופן מכריע — ובשונה מצ'קפוינט ברישיון מחקרי, שום דבר ברישיון לא מונע ממך להפיץ אותו.
• באמצע, התשובה הכנה היא שאתם קונים אופציונליות ולא חיסכון. אירוח עצמי קונה לכם את היכולת לנעוץ גרסה, להשאיר את האודיו בתשתית שלכם, ולהפסיק לדאוג משינוי התעריף של ספק.
כאשר כל אחד מהם הוא התשובה הנכונה
בחר ב-Gemini 3.8 Flash TTS כאשר אתה רוצה את המוצר המתועד טוב יותר. יש לו ציון עצמאי, מחיר מפורסם, דיאלוג של שני דוברים בקריאה אחת, עיצוב קולי ושכפול קולי, ואין שום משטח תפעולי מעבר למפתח API. ה-Flash-Lite TTS האח שלו נותן לך נקודת מחיר שנייה באותו ממשק, במחיר מנורמל של $11.00 למיליון תווים. מה שאתה מקבל בתמורה הוא תעריף שמכפיל את עצמו ב-1 בינואר 2027, וחוסר יכולת להריץ את המודל בשום מקום.
בחר ב-VoxCPM2 כשהעבודה התפעולית היא העיקר. Apache 2.0 פירושו ששימוש מסחרי מותר לחלוטין, גודל 2B פירושו שמאיץ בודד מספיק, ומקדם זמן אמת של 0.13 תחת Nano-VLLM פירושו שכרטיס צנוע מפיק כמה שעות של אודיו לכל שעת זמן קיר. מה שאתה מקבל הוא שאיש אחר לא יריץ אותו עבורך: אין נקודת קצה מתארחת, אין שורה בארנה, אין מחירון ספק, וכל ערבות איכות שתקבל היא כזו שאתה בונה ומודד בעצמך.

אף אחד מהמודלים אינו מתארח אצל OrcaRouter, וכדאי לומר זאת ישירות ולא לרמוז אחרת. המקום שבו קוראים ל-Gemini 3.8 Flash TTS הוא ה-API של Google עצמה והמשטחים ש-Google ציינה; VoxCPM2 הוא צ'קפוינט שאתם פורסים. מה ש-OrcaRouter מכסה הוא השכבה שמעל ההחלטה הזו — למעלה מ-200 מודלים מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת מחיר, כך ששינוי מחיר של ספק מתעדכן אצלנו באותו יום ולא במחזור החיוב הבא, מעבר אוטומטי לגיבוי כך שמודל שנמצא בהערכה לא צריך להיות תלות בסביבת ייצור, ו-DSL לניתוב שמרכיב כמה מודלים לקריאה אחת כשקול בודד לא נושא את כל העבודה.
מה לצפות בהמשך
שני דברים היו משנים את ההשוואה הזו באופן מהותי, ואף אחד מהם עדיין לא קרה.
הראשון הוא מישהו שמארח את VoxCPM2. היעדרותו משוק האינפרנס היא הסיבה העיקרית לכך ששני המודלים מושווים מבחינה כלכלית ולא מבחינה איכותית — אם ספק יאמץ אותו, החשבון של שכירה מול בעלות מפסיק להיות הגורם המכריע, והשורה החסרה בארנה הופכת לדבר שתרצה למלא.
השני הוא שינוי התעריפים של ינואר מצד גוגל. בתעריף המבצעי ה-API זול מספיק עד שרוב עומסי העבודה לא צריכים לארח דבר בעצמם; בתעריף שלאחר המבצע הפער מצטמצם עד כדי כך שצוות עם קיבולת GPU קיימת ונפח קבוע צריך לחשב שוב את המספרים במקום להניח שה-API עדיין מנצח.
עד שאחד מהמהלכים האלה יתרחש, הנתון המכריע אינו לוח תוצאות. זה כמה שעות אודיו בחודש אתה מפיק, והאם הכרטיס תפוס.
