
VoxCPM2: 900,000 הורדות בחודש, ו-Transformers עדיין לא מצליחים לטעון אותו
- metaחדשMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 לכל 1M טוקנים · 705 tok/s
- qwenחדשQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 לכל 1M טוקנים · 57 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3150אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 201 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicחדשAnthropic: Claude Opus 52026-07-2461אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2150אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1651אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1557אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0951אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0955אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0959אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0854אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0641אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3053אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1651אינטליגנציה69כתיבת קוד60מתמטיקה
המטא-דאטה של Hugging Face עבור VoxCPM2 מציינת שהספרייה שלו היא voxcpm — לא transformers. השדה הבודד הזה מסביר פער מוזר בעולם הדיבור בקוד הפתוח כרגע: מודל הטקסט-לדיבור של OpenBMB בעל 2B פרמטרים משך 900,282 הורדות בשלושים הימים האחרונים, הוליד 25 גרסאות fine-tune ציבוריות, 10 קוונטיזציות, 7 אדפטרים ולמעלה מ-100 Spaces, ובכל זאת אי אפשר לטעון אותו באמצעות הספרייה שכמעט כל מודל אחר באתר זה נטען באמצעותה. בקשת ה-pull request לתקן זאת נפתחה ב-4 באוגוסט 2026 ועדיין פתוחה נכון להיום.
הפער הזה שווה להבין לפני שהתיקון נוחת, כי הוא מעצב את המחיר ששילוב המודל הזה עולה לך השבוע לעומת הרבעון הבא. והוא נשען על שאלה מעניינת יותר, והיא האם VoxCPM2 אכן מקדים כמו שהסיקור מרמז. כל מה שלהלן נקרא מתוך שלושת המקורות הראשוניים:openbmb/VoxCPM2 כרטיס המודל ומטא-הנתונים של המאגר, ה-README של OpenBMB/VoxCPM ב-GitHub, והדו"ח הטכני של VoxCPM2 (arXiv:2606.06928, הוגש ב-5 ביוני 2026). כל נתון benchmark במאמר זה הוא של OpenBMB עצמה, הופעל על ידי OpenBMB, וכ-כפי שהמאמר עצמו מציין לגבי טבלת ההשוואה המרכזית שלו — המספרים של המתחרים בה הועתקו ממאמרים אחרים, ולא הורצו מחדש בתנאים תואמים. עד כמה שמצאנו, אף מעבדה עצמאית לא פרסמה שכפול של אף אחד מהנתונים.
גיליון המפרט, במסך אחד
VoxCPM2 שוחרר באפריל 2026 (מאגר Hugging Face נוצר ב-3 באפריל, נגעו בו לאחרונה ב-16 באפריל) כדור השלישי של קו VoxCPM. לעומת קודמו המיידי:
• גודל — 2B פרמטרים לעומת 0.8B של VoxCPM1.5 ועמוד שדרה 0.6B של VoxCPM-0.5B.
• שפות — 30 ועוד 9 ניבים סיניים, לעומת סינית ואנגלית בלבד בשתי הגרסאות הקודמות.
• אודיו — מקבל רפרנס של 16 קילוהרץ, פולט 48 קילוהרץ, לעומת 44.1 קילוהרץ הסימטרי של VoxCPM1.5 בכניסה וביציאה.
• Backbone — MiniCPM-4-1B (28 שכבות, רוחב 2048) כמודל השפה הטקסטואלי-סמנטי, במקום MiniCPM-4-0.5B (24 שכבות, רוחב 1024).
• תקציב רצף — 8192 טוקנים בקצב של 6.25 הרץ בצד מודל השפה, שמסתכם בערך ב-20 דקות של אודיו בהקשר אחד.
• עלות של שניית דיבור — פקטור זמן אמת 0.30 ב‑PyTorch רגיל ו‑0.13 דרך Nano‑vLLM על RTX 4090 אחד, בכ‑8 GB של VRAM. VoxCPM1.5 השיגה 0.15 ב‑0.8B ו‑6 GB.
• רישיון — Apache-2.0 על המשקלים, קוד הכוונון העדין וכלי ההסקה. ללא חסם, ללא סעיף שימוש מקובל, שימוש מסחרי מותר.
• נתוני אימון — "למעלה מ-2 מיליון שעות" של דיבור רב-לשוני, ללא ציון שם המאגר וללא הצהרת מקור.
קרא את שורת ה-RTF פעמיים, כי היא רצה בכיוון ההפוך. VoxCPM2 איטי בערך פי שניים לשנייה של אודיו שנוצר בהשוואה למודל ה-0.8B שהוא מחליף, ודורש שליש יותר VRAM. ה-2B לא קנה תפוקה; הוא קנה שפות ושליטה, וגבה עבורן השהיה. אם אתה מריץ סוכן בזמן אמת, הפשרה הזו היא הדבר הראשון שיש לתמחר.
מה בעצם משנה PR #47756
היום, הרצת VoxCPM2 פירושה התקנת החבילה של OpenBMB עצמה — pip install voxcpm, Python 3.10 עד 3.12, PyTorch 2.5 ומעלה, CUDA 12 ומעלה — וטעינת המודל באמצעות קריאת VoxCPM.from_pretrained שאין לה שום קשר ל- Transformers API. כל מה שנובע מההחלטה הזו הוא מותאם אישית: אצווה משלך, תשתית השירות שלך, הטיפול שלך בחמשת מצבי הייצור.
העבודה שבתהליך תשנה זאת. הנושא #47695, "הוסף תמיכה מקורית ב-OpenBMB VoxCPM2", נפתח ב-31 ביולי. PR #47756, "תמיכה ב-VoxCPM2", הגיע ב-4 באוגוסט ועודכן לאחרונה ב-5 באוגוסט. הוא נושא את התווית "דגם חדש" ומוסיף קונפיגורציה מודולרית ומימוש מודל, טוקנייזר ומעבד מותאמים אישית, קידוד ופענוח AudioVAE עם סטרימינג, התניית קול ייחוס, המשך אודיו לפי פרומפט, רישומים אוטומטיים של מחלקות ונקודת כניסה לצינור טקסט-לצורת-גל — עם 64 בדיקות דגם שעברו לפי הדיווח. הוא מוערם על PR #47736, שמוסיף את MiniCPM4 עצמו; עמוד השדרה הטקסטואלי חייב להינחת לפני שמודל הדיבור שעוטף אותו יוכל.

יש לתת משקל לשני פרטים, ושניהם פועלים נגד האופטימיות. ראשית, כל שלושת הפריטים — ה-issue ושתי ה-pull requests — נפתחו על ידי אותו תורם קהילתי יחיד, לא על ידי OpenBMB ולא על ידי מתחזק של Hugging Face. אין מאחורי זה התחייבות של ספק, ולכן אין ציר זמן שניתן לתכנן לפיו. שנית, ערימה של שתי בקשתות משיכה עם 203 קומיטים הנוגעים למודאליות חדשה אינה ביקורת מהירה. בקשתות משיכה למודלים חדשים ב-Transformers נמשכות בדרך כלל שבועות של סבבי דיון עם מתחזקים, ולזו יש עד כה ארבע תגובות.
הקריאה המעשית: אם מחלקת Transformers מקורית היא נדבך מרכזי בארכיטקטורה שלך — משום שאתה מתבסס על AutoModel, או משום ששכבת השרת שלך מדברת רק Transformers — VoxCPM2 אינו מוכן עבורך, ואין תאריך. אם אתה יכול להסתפק בחבילת voxcpm, המודל שמיש במלואו כיום, והאקוסיסטם הצביע בבירור שזה נסבל: 900,282 הורדות התרחשו ללא תמיכה מקורית כלל. יש גם נתיב ביניים שרוב הסיקור מפספס. OpenBMB מספקת אינטגרציה של vLLM-Omni החושפת קצה תואם OpenAI /v1/audio/speech, ובנוסף יש גרסת llama.cpp-omni עם משקלי GGUF שרץ על CPU, Metal, CUDA או Vulkan ללא כל תלות ב-Python. אם מה שבאמת רצית מ-Transformers היה ממשק שירות סטנדרטי ולא המחלקה עצמה, זה כבר קיים.
"ללא טוקנייזר" אינו אומר "לא מכומת"
הביטוי בכל כותרת על המודל הזה הוא זה שמתפרש לעתים קרובות שלא כהלכה. ל־VoxCPM2 אין קודק אודיו דיסקרטי חיצוני — אין אוצר מילים נלמד של אסימוני דיבור היושב בין מודל השפה לצורת הגל, כפי שיש בשושלות CosyVoice או Moshi. זו הטענה, וזו אמת.
עדיין קיים קוונטיזציה בתוך המודל. עמוד השדרה (backbone) מריץ צוואר בקבוק חצי-בדיד דיפרנציאלי המבוסס על Finite Scalar Quantization, והמאמר מפורש לגבי תפקידו: מודל השפה הטקסטואלי-סמנטי מייצר מצבים חבויים, FSQ מבצע קוונטיזציה סקלרית שלהם לכל ממד לתוך "שלד סמנטי", מודל שפה אקוסטי שיורי משחזר את הפרטים העדינים ש-FSQ השליך, וטרנספורמר דיפוזיה מקומי הופך את שני ערוצי התנאי לפאטץ' רציף חבוי הבא על ידי התאמת זרימה (flow matching). ארבעת השלבים שאתה רואה מקוצרים כ-LocEnc, TSLM, RALM ו-LocDiT הם בדיוק השרשרת הזו.
ההבחנה שחשובה בפועל אינה "קוונטיזציה לעומת לא". היא שצוואר הבקבוק (bottleneck) מאומן מקצה לקצה יחד עם כל מה שמסביבו, במקום להיות קפוא מראש כקודק נפרד עם פונקציית הפסד משלו. זה מה שמסיר את מצב הכשל הרגיל שבו מודל שפה לומד לחזות טוקנים שקודק אינו יכול לפענח בנאמנות. VoxCPM2 הרחיב את צוואר הבקבוק של FSQ מ-256 ל-512 ממדים, והחליף את סכום האלמנטים הישן שהוזן למודל השיורי בהיטל שרשור ניתן ללמידה (learnable concatenation-projection) — שינויים קטנים, ובין הבודדים בדוח שמגובים במנגנון מוצהר ולא בהפרש benchmark.
פלט ה-48 קילו-הרץ הוא בחלקו מומצא, וזהו התכנון.
"פלט באיכות אולפן של 48 קילו-הרץ" הוא המפרט הכי מצוטט של המודל ואחד מהכי מובנים לא נכון. AudioVAE V2 הוא א-סימטרי: המקודד פועל ב-16 קילו-הרץ, המפענח משחזר ב-48 קילו-הרץ. המאמר קורא לזה "סופר-רזולוציה מרומזת", וזה שם כן למה שזה.
עקבו אחרי ההשלכה. למקודד 16kHz יש תקרת ניקוויסט של 8kHz, ולכן שום דבר מעל 8kHz באודיו הייחוס שלכם לעולם לא מגיע למודל. כל פיסת אנרגיה בשתי האוקטבות העליונות של הפלט — האוויר בקול, השורקות, בהירות קצה המצילתיים — נוצרת על ידי המפענח מתוך פריור סביר, ולא מועברת מהדובר ששיבטתם. עבור רוב עבודות הקריינות והסוכן, זה בלתי נראה או אפילו שיפור, כי פריור נלמד טוב מנצח מדף 8kHz נוקשה. לכל מי שעבודתו היא נאמנות לקול מוקלט ספציפי, זו עובדה שצריך לתכנן סביבה, וזה לא משהו שמבחן האזנה ברמקולי הלפטופ שלכם יחשוף.
ההצדקה שבמאמר היא הטיעון ההנדסי האמין ביותר בדוח, וכדאי לחזור עליה משום שאינה שיווקית: השארת המקודד ב-16 קילוהרץ מאפשרת ל-{{1}}OpenBMB{{/1}} לעשות שימוש חוזר מלא ב{{2}}קורפוס האימון המקורי של VoxCPM 16 kHz{{/2}}, מבטלת אי-התאמה סמויה בין מקורות שהוקלטו בקצבי דגימה שונים, ומונעת את פיצוץ אורך הרצף שקצב קלט גבוה יותר היה כופה על לולאה אוטורגרסיבית. הרמת המפענח בלבד קונה נאמנות פלט בלי לשלם עליה בחלק היקר של המודל. זהו חילוף טוב, שנעשה במכוון. זה גם אומר שמשתמשי {{3}}VoxCPM1.5{{/3}} עוברים ממקודד של 44.1 קילוהרץ למקודד של 16 קילוהרץ — הורדה בצד הקלט שנמכרת בתוך שדרוג בצד הפלט. טבלת השחזור של {{4}}OpenBMB{{/4}} עצמה מראה את הצורה של זה: הקודק של {{5}}VoxCPM1.5{{/5}} עדיין רושם את מרחק ה-mel הטוב ביותר בפס מלא מבין שלושת הדורות, 1.139 לעומת 1.335 של {{6}}AudioVAE V2{{/6}}, משום שהוא פועל מטבעו בקצב דגימה גבוה במקום לשחזר כלפי מעלה אל קצב כזה.
קריאת לוח התוצאות של OpenBMB כפי ש-OpenBMB כתב אותו
תחרותי, לא ראשון
במדד Seed-TTS-Eval, שהוא מדד הייחוס הסטנדרטי לשכפול קול zero-shot, VoxCPM2 מדווח על 1.84% שיעור שגיאות מילים עם 75.3% דמיון דובר בסט האנגלי, 0.97% שיעור שגיאות תווים עם 79.5% דמיון בסינית, ו-8.13% CER עם 75.3% דמיון בסט הסיני הקשה. המילה של המאמר עצמו לתוצאות אלה היא "תחרותי", והטבלה תומכת במילה זו ולא במילים החזקות יותר שמסתובבות.

בקרב מערכות הקוד הפתוח באותה טבלה, Fish Audio S2 מציגה שיעור שגיאה טוב יותר בכל שלושת תת-הקבוצות (0.99 / 0.54 / 5.99). Qwen3-TTS עוקפת אותה ב-WER לאנגלית עם 1.23. ו-LongCat-Audio-DiT גורפת ניצחון מוחלט בחמישה מתוך שישה תאים — 1.50 WER ו-78.6 דמיון באנגלית, 81.8 דמיון בסינית, 6.04 CER ו-79.7 דמיון בסינית קשה. היכן ש-VoxCPM2 כן בולטת היא האיזון: היא אחת מהמערכות הבודדות שנמצאות בו-זמנית קרוב לפסגה בדמיון ועם מובנות מכובדת, והיא היחידה ברשימה שגם מבצעת עיצוב קול בשפה טבעית. אבל "מתקדמת ביותר" אינו מה שטבלת הכותרת שלה מראה, והמסגור הכנה הוא שמדובר בגנרליסטית חזקה, לא במובילת אמות מידה.
פי 3.3 יותר פרמטרים קנו כמעט שום בהירות
השורה השימושית ביותר בטבלה זו היא זו שאיש אינו מצטט. VoxCPM-0.5B, הדור הראשון של 0.6B מספטמבר 2025, משיג 1.85% WER באנגלית ו-0.93% CER בסינית. VoxCPM2, בגודל 2B, משיג 1.84% ו-0.97%. בתוך רעש באנגלית, וקצת גרוע יותר בסינית.
מה שהפרמטרים הנוספים סיפקו בפועל נראה בעמודות הדמיון ובשום מקום אחר: מדד ה-SIM באנגלית עלה מ-72.9 ל-75.3, ובסינית מ-77.2 ל-79.5. כל השאר שדגם ה-2B קנה נמצא מחוץ למדד הזה לחלוטין — 28 שפות נוספות, עיצוב קול מתיאור טקסט, שכפול עם בקרת סגנון, פלט 48kHz. זה הרבה, וזה הטיעון הכנה בעד השדרוג. אבל אם עומס העבודה שלך הוא שכפול באנגלית או בסינית ואתה בוחר לפי שיעור השגיאות, VoxCPM2 לא נותן לך שום דבר שדגם ה-0.6B כבר לא נתן לך, עם פי שלושה במשקל ופי שניים בהשהיה. למרבה הפלא, VoxCPM1.5 הוא הגרוע מבין השלושה במדד הזה (2.12 / 1.18), מה שגורם להתקדמות המשפחה להיראות פחות כמו סולם ויותר כמו שלושה מוצרים שונים.
מודל אחד, שתי הערכות, בפער של סדר גודל
כאן נדרשת זהירות, כי שתי התוצאות הרב-לשוניות בדוח זה חולקות זו על זו בחריפות, ושתיהן מצוטטות כאילו הן מכריעות את העניין.
הכותרת היא שיעור שגיאה ממוצע של 1.68% על פני 30 שפות. זה מגיע ממערך בדיקה ש-OpenBMB בנתה בעצמה — 500 מבעים לכל שפה — והוערך עם Gemini 3.1 Flash Lite כמזהה הדיבור. עליו, VoxCPM2 רושמת אנגלית 0.42, סינית 0.92, הינדי 0.79, ערבית 1.23.
הדוח מריץ גם את MiniMax-MLS-Test, מערך של צד שלישי ל-24 שפות שמנוקב באמצעות Whisper-large-v3. אותו מודל. שם, VoxCPM2 מציג הינדי 19.70 וערבית 13.05 — גרוע פי עשרים וחמש ופי עשר, בהתאמה, ממה שהבנצ'מרק שלו עצמו מראה, בשפות שהוא תומך בהן רשמית. גם בעמודה הזו: קנטונזית 38.58, צ'כית 24.13, רומנית 21.58, אוקראינית 6.32.
שלושה דברים מיישבים את רוב העניין, וכדאי להפריד ביניהם משום שהגרסה הנפוצה של הסיפור הזה טועה בהם:
• צ'כית, רומנית ואוקראינית אינן שפות נתמכות. בדוק את תגי השפה של המאגר עצמו: 30 קודים, ואף אחד מהם אינו cs, ro או uk. לבקר את VoxCPM2 על 24% WER בצ'כית זה לבקר אותו על שפה שמעולם לא טען לה. קנטונזית ככל הנראה נכללת תחת '9 הניבים הסיניים', אבל כל מערכת בטור הזה היא מעל 30% עליה, מה שמצביע על המזהה ולא על אף אחד מהמודלים.
• ערבית והינדית נתמכות, וזה הממצא האמיתי. אלה הן שתי השפות שבהן OpenBMB טוען לכיסוי, ושתי ההערכות שלו נבדלות בסדר גודל. ההסבר של המאמר עצמו הוא כי בשפות אלו יש "נפח נתונים מוגבל יחסית" בקורפוס האימון, וכי "חלק מה-WER הגבוה עשוי לנבוע מהדיוק המוגבל של המזהה." זו השערה הוגנת ובלתי נבדקת. אם אתם משחררים דיבור בערבית או בהינדית, הטווח שפורסם למודל זה הוא 0.79% עד 19.70%, ואף אחד מהקצוות לא אומת באופן עצמאי. הקדישו יום למדידה משלכם; אל תתבססו על אף אחד מהמספרים.
• המדדים הם אפילו לא באותה יחידה.הינדית נמדדת לפי שיעור שגיאות תווים על הסט הפנימי ולפי שיעור שגיאות מילים על MiniMax-MLS. אלו אינן כמויות שניתנות להשוואה, וזו סיבה נוספת לכך שהפער של פי 25 אינו האשמה נקייה — וסיבה נוספת לכך שאין לקרוא את הממוצע של 1.68% כציון דומה לדומה.
הזהירות הזו חלה גם על הטענה שעושה את עיקר העבודה המספרית בסיקור המודל הזה: ש-VoxCPM2 מנצח את ElevenLabs בדמיון לדובר, 85.4% לעומת 61.3% באנגלית, וזוכה ב-22 מתוך 24 שפות. זה אכן מה שהטבלה אומרת. זוהי גם טבלה שהמאמר מרכיב בחלקה מתוצאות שדווחו בעבר, ואחת שבה עמודת המובנות של ElevenLabs מכילה 73.94% WER בתאילנדית, 73.42% בווייטנאמית ו-16.03% בסינית. אלה אינם המספרים של מוצר מסחרי מתפקד; הם סימן ההיכר של חוסר התאמה בניקוד או בתצורה. טבלה שבורה כל כך בעמודה אחת אינה הופכת למהימנה בעמודה אחרת רק משום שהתוצאה מחמיאה למודל שעליו אתם קוראים.
חמישה מצבים מבסיס אחד — והמתכון שמניע את המספרים שלך
הרעיון הנקי ביותר בארכיטקטורה הוא ש־VoxCPM2 אינו כולל מודלים או ראשים נפרדים ליכולותיו. כל חמשת המצבים הם אותם פרמטרים, כאשר רצף הקלט מסודר אחרת, וזו הסיבה שנקודת ביקורת אחת של 2B מכסה את מה שבדרך כלל דורש צי קטן של מודלים.
• TTS בסיסי — טקסט נכנס, אודיו יוצא.
• עיצוב קול — תיאור בסוגריים פשוט מוצמד לפני הטקסט, כך ש"(גבר מזדקן עייף, בקול גרוני, מדבר לאט)" והשורה עצמה עוברים דרך אותו מודל שפה ללא מודול נוסף. אין אודיו ייחוס כלל.
• שיבוט ייחוס — קליפ ייחוס מבודד מתנה את זהות הדובר, ללא צורך בתמליל.
• שיבוט מבוקר — קליפ ייחוס בתוספת תיאור סגנון, כך שתוכל לשבט קול ואז לבקש ממנו להישמע ממהר או משועשע.
• שיבוט המשך — קטע ייחוס המזווג עם התמלול שלו, המטופל כקידומת שמע שהמודל ממשיך ממנה, ומהווה את מצב הנאמנות הגבוהה ביותר.
טמון בדוח מתג שרוב הכתבות מדלגות עליו, והוא זה שסביר ביותר לשנות את התוצאות שלך. שני מסלולי התניה — התייחסות מבודדת ותחילית המשך — ניתנים לשימוש בנפרד או יחד, והם מתקזזים זה מול זה. באבלציה של OpenBMB עצמם, שימוש בשניהם יחד מניב את הדמיון הטוב ביותר לדובר בכל תת-קבוצה. השמטת תחילית ההמשך והעברת ההתייחסות המבודדת בלבד מניבה את המובנות הטובה ביותר על טקסט סיני קשה, CER של 6.85% לעומת 7.44%, תוך ויתור על כחמש נקודות דמיון. ההסבר במאמר הגיוני: ללא תחילית אודיו זמנית שמקבעת את הפרוזודיה, למודל יש יותר חופש לבחור הגשה שתשרוד טקסט קשה.
אז ברירת המחדל היא בחירה, לא תקרה. עבודת התאמת קול דורשת את שני המסלולים; טקסט קשה או יוצא דופן דורש הפניה בלבד. נקודת אי-בהירות כנה אחת: הנתונים המוחלטים בטבלת האבלציה ההיא אינם מתיישבים עם טבלת הכותרת עבור המתכון שהמאמר טוען שהשתמש בו לאורך כל הדרך, ובפרפרינט סביר להניח שזו שגיאת רישום ולא משהו זדוני — אבל זו סיבה שלישית להתייחס לכל מספר כאן ככיוון לבדיקה, לא כערך לציטוט.
עיצוב קול: צייתני יותר מאשר טבעי
עיצוב קולי הוא התכונה שהופכת את המהדורה הזו למעניינת ולא סתם למהדורה מצטברת, והוא גם התחום שבו המספרים של הספק עצמו חושפים ביותר את הפשרה האמיתית.
ב-InstructTTSEval, VoxCPM2 מקבל 84.2 בפירוט פרמטרים אקוסטיים, 83.2 בהנחיות סגנון תיאוריות ו-71.4 במשחק תפקידים באנגלית — הנתון האחרון הוא הטוב ביותר בטבלה, לפני Qwen3-TTS-1.7B-VD עם 68.4 ו-Gemini-TTS-Pro עם 67.2. בסינית הוא חלש יותר והסדר מתהפך: 85.2 / 71.5 / 60.8, לעומת 89.0 / 90.1 / 75.5 של Gemini-TTS-Pro. לכן הטענה החזקה ביותר הזמינה היא ש-VoxCPM2 מוביל במשחק תפקידים באנגלית ונמצא מאחורי מערכת מתקדמת סגורה כמעט בכל תחום אחר בציות להוראות.
פאנל ההאזנה האנושי — 50 מאזינים, באקראי ובכפול-סמיות, לפי הדוח — מחדד את התמונה. ביצירה מבוקרת, VoxCPM2 זוכה במעקב הוראות עם 4.50 לעומת 4.41 של Qwen3-TTS-VD, ומפסיד בטבעיות עם 4.48 מול 4.61. בקלונינג zero-shot רגיל הוא מנצח בדמיון דובר (4.74 מול 4.69) ומשווה או מפגר בטבעיות (4.78 מול 4.80 של Qwen3-TTS, עם רווחי סמך חופפים).
התבנית עקבית מספיק כדי לתכנן לפיה: VoxCPM2 עושה את מה שאומרים לו ונשמע מעט פחות אנושי כשהוא עושה זאת, בעוד ש-Qwen3-TTS נשמע מעט טוב יותר וממלא הוראות בדיוק מעט נמוך יותר. מי מהם הנכון תלוי לחלוטין בשאלה האם הערך של המוצר שלך הוא שליטה מדויקת או הגשה חלקה. OpenBMB מציין את המסקנה הנלווית בעצמו במגבלותיו, וזה מהסוג שספקים בדרך כלל משמיטים: עיצוב קול וקלונינג可控 "עשויים להפיק תוצאות משתנות בין ריצות לריצות," והשגת הקול הרצוי עשויה לדרוש מספר ניסיונות. בנה מנגנון ניסיון חוזר לתוך הצינור שלך, ואם הקול חשוב, הוסף שער האזנה אנושי.
כמה עולה להפעיל, ומתי השכרה היא הבחירה הנכונה
אין VoxCPM2 מתארח בשום מקום. סרגל הצד של Hugging Face עצמו מצהיר זאת במפורש — "המודל הזה אינו נפרס על ידי אף ספק Inference" — וזה כולל אותנו: OrcaRouter אינו משרת את VoxCPM2, ושום רצון לא ישנה את העובדה שמודל TTS עם 2B פרמטרים וללא שותף Inference הוא משקולות שאתה מארח בעצמך או כלום.
מה שהופך את שאלת העלות לשאלה של GPU, והחשבון פשוט. במקדם זמן-אמת (RTF) של 0.13 של Nano-vLLM על RTX 4090 אחד, שעת GPU אחת מייצרת בערך 7.7 שעות שמע, כך שהעלות שלך לשעת שמע היא התעריף השעתי שלך לכרטיס אחד של 24 GB חלקי בערך 7.7. ב-PyTorch רגיל עם RTF של 0.30, זה יורד לכ-3.3 שעות שמע לשעת GPU. שני הנתונים הם של OpenBMB, נמדדו על החומרה שלהם עם הטקסטים שלהם, ושניהם ישתנו אצלך — גודל ה-batch, קושי הטקסט, ומספר הניסיונות החוזרים שער האיכות שלך כופה, כל אלה הם מכפילים שמספר ה-RTF אינו כולל. שיעור הניסיונות החוזרים הוא הדבר שאנשים שוכחים: מודל שהספק אומר לך שעשוי לדרוש מספר ניסיונות כדי להגיע לקול מטרה, אינו עולה כפי שמשתמע מה-RTF שלו.

ההשוואה שאנשים רוצים בשלב זה היא מול API שכור, והתשובה הכנה היא שאין המרה נקייה בין השניים.openai/tts-1-hdהתעריף הוא $30.00 לכל מיליון טוקנים בכניסה וביציאה — זהו מחיר המחירון של הספק, המועבר ישירות דרך OrcaRouter, מאחר שאיננו מוסיפים שום מרווח (0% markup), כך שהמספר בדף המודל שלנו הוא המספר ש-OpenAI גובה. אבל טוקנים הם לא שניות, ושום תעריף שפורסם לא ממיר את האחד לשני בצורה מהימנה מספיק כדי לבנות עליו גיליון אלקטרוני. כל מי שמציג בפניך השוואה נקייה לשעת שימוש בין מודל TTS עם משקלים פתוחים באירוח עצמי לבין API שנגבה לפי טוקנים, עשה הנחה שלא הראה לך.
מה שחשוב לומר הוא היכן עובר הקו מבחינה ארכיטקטונית. אירוח עצמי של VoxCPM2 הגיוני כשאתה צריך קול משובט ספציפי, כשכמות האודיו יציבה מספיק כדי להעסיק GPU, כשנתונים לא יכולים לצאת מהתשתית שלך, או כשאתה מתכוון לכוונן אותו עם LoRA — והוא תומך בזה עם 5 עד 10 דקות של אודיו מטרה, וזה באמת זול. השכרה הגיונית כשנפח השימוש הוא התפרצותי, כשאתה לא יכול לאייש GPU, או כשהקול הוא בר-החלפה. רוב מוצרי הקול האמיתיים הם שתי מערכות, לא אחת: שכבת סינתזה ומודל שפה שעושה את החשיבה בין האוזניים. החצי החושב הוא החלק שכדאי לשים מאחורי מפתח אחד עם מעבר אוטומטי בין ספקים, כך שהחלפת מודל היא שינוי במחרוזת ולא מחזור רכש; זו הצורה שלשמה נועד OrcaRouter, על פני 200+ מודלים. חצי הסינתזה, כשהוא קול ספציפי שבבעלותך ושאתה מכוונן, מקומו על החומרה שלך. VoxCPM2 נמצא בדיוק בקטגוריה השנייה הזו, והעובדה שאיש לא מספק אותו היא תוצאה של מה שהוא, ולא שגגה.
מה OpenBMB אומר לך שלא לצפות
סעיף המגבלות כן במיוחד עבור גרסה עם כל כך הרבה תנופה, והוא קצר מספיק כדי לקחת אותו ברצינות:
• איכות השיבוט היא משטח ניצול לרעה.הכרטיס אומר זאת במפורש: המודל מפיק דיבור מציאותי מספיק כדי לשמש להתחזות ולהונאה, ויש לסמן אודיו שנוצר על ידי בינה מלאכותית. רישיון Apache-2.0 אינו מטיל כל הגבלה על כך — בניגוד לרישיונות של כמה מודלי קול פתוחים מתחרים, אין סעיף שימוש מקובל שאפשר להתחבא מאחוריו. מדיניות ההסכמה והגילוי שלך היא שלך לכתוב.
• שונות בין ריצה לריצה צפויה על שני מאפייני הבקרה, לא באג שיש לדווח עליו.
• 30 השפות הן גבול אמיתי. כל מה שמחוץ להן עשוי לעבוד ואינו מנוסה; צפו לכוונון עדין.
• עקביות בקרת הסגנון מתוארת כעדיין בפיתוח על ידי האנשים שבנו אותה.
והפערים שהכרטיס אינו מציין: אין כל גילוי של קורפוס האימון, כך שרשיון Apache-2.0 על המשקולות פותר את שאלת הקוד אך לא נוגע כלל למקור הנתונים. אין הערכה בלתי-תלויה של אף נתון במאמר זה. אין פרסום של זמן השהיה במילישניות — RTF הוא יחס תפוקה, וסוכן קולי חי או מת על הזמן עד לאודיו הראשון, שאינו מופיע בשום מקום בדוח.
שלוש שאלות שכרטיס המודל אינו מיישב
האם עלי לעבור מ-VoxCPM1.5 או מ-VoxCPM-0.5B?
רק עבור היכולות החדשות, ורק לאחר מדידה. אם אתה זקוק לשפות מעבר לסינית ואנגלית, עיצוב קול, או שיבוט בשליטת סגנון, השדרוג הוא כל העניין ואין חלופה בתוך המשפחה. אם אתה מריץ כיום שיבוט באנגלית או בסינית ומרוצה, הטיעון חלש על פניו: אותו benchmark מראה ש-VoxCPM-0.5B משתווה ל-VoxCPM2 בשיעור השגיאות, והיית משלם פי שניים בהשהיה ושליש יותר VRAM עבור כ-2.4 נקודות של דמיון דובר. יש גם פרט הגירה שקל לפספס — אם הזנת ל-VoxCPM1.5 אודיו ייחוס של 44.1 קילוהרץ, המקודד של VoxCPM2 קולט 16 קילוהרץ, כך שצינור הייחוס שלך משתנה והקצה הגבוה של חומר המקור שלך מפסיק להיות רלוונטי.
האם אני באמת יכול להשיק מוצר קולי מסחרי על זה?
מבחינה חוקית, הרישיון הוא מהמתירניים ביותר שקיימים: Apache-2.0, ללא שער כניסה, ללא הגבלות שימוש, שימוש מסחרי מותר במפורש, וגם המשקולות (weights) וגם קוד הכיוונון העדין (finetuning) מכוסים. השאלה הפתוחה אינה נוסח הרישיון, אלא מה שחסר מאחוריו. OpenBMB אינה מציינת קורפוס אימון, ולכן איש אינו יכול לומר לך אילו קולות נמצאים בשני מיליון השעות. עבור מודל שתכונת הדגל שלו היא שחזור קולו של אדם ספציפי, זו שאלה ליועץ המשפטי שלך, לא לכרטיס מודל (model card) — והיא אותה שאלה שכל מודל קול עם משקולות פתוחות (open-weight) מתחמק ממנה כיום. מבחינה מעשית, החוסמים הקשים יותר הם תפעוליים: עדיין אין מחלקת Transformers מקורית, אין נקודת קצה (endpoint) מתארחת בשום מקום, יש שונות בין ריצה לריצה בתכונות הבקרה, ואין נתון של זמן עד לאודיו ראשון (time-to-first-audio) אם אתה בונה משהו שיחתי.
האם זה מספיק טוב כדי להחליף ספק TTS בתשלום?
{{1}}לקריינות באנגלית ובסינית, לתוכן מוקלט מראש, ולכל עומס עבודה שבו אתם שולטים בקול ספציפי ויכולים לעבד בקבוצות: כן, על סמך הראיות הקיימות, והרישיון הופך את הניסיון לכמעט בחינם.{{/1}} {{2}}לסוכני שיחה בזמן אמת: מדדו בעצמכם את הזמן עד לאודיו הראשון לפני שמתחייבים, כי אף אחד לא פרסם את הנתון הזה ו-RTF לא יספר לכם אותו.{{/2}} {{3}}לערבית, הינדי, או כל שפה בזנב הארוך: שתי ההערכות של הספק עצמו חלוקות בסדר גודל, אז התייחסו למודל כלא מוכח שם, בלי קשר לאיזה מספר ראיתם מצוטט.{{/3}} {{4}}ולכל מקרה שבו הגייה שגויה היא תקרית עסקית ולא סתם מטרד, שימו לב ש-VoxCPM2 אינו המוביל בבהירות הדיבור אפילו בטבלה שלו עצמו — Fish Audio S2 ו-LongCat-Audio-DiT מקדימים אותו שם, והם גם בעלי משקלים פתוחים.{{/4}}
מה לצפות
שני דברים, בלוחות זמנים שונים. הקרוב הוא PR #47756 וה-PR של MiniCPM4 שמתחתיו. אם הם ימוזגו, VoxCPM2 יהפוך לקריאת AutoModel, ועלות האינטגרציה עבור כל מי שהתקנן על Transformers צונחת לכמעט אפס בין לילה — ובהינתן ש-900,282 הורדות בחודש כבר מתרחשות בדרך הקשה, זהו שחרור משמעותי. אם הם ייתקעו, התשובה עבור הצוותים האלה תישאר "תשתמשו בחבילה של OpenBMB או בנקודת הקצה של vLLM-Omni", ולתורם הקהילתי שמחזיק בשני ה-PR-ים אין מנוף לשנות את זה.
האיטי יותר הוא השאלה האם מישהו מחוץ ל-OpenBMB יפרסם אי פעם מספר. ארבעה חודשים לאחר השחרור, עם 900,000 הורדות חודשיות, 25 כיוונונים עדינים ויותר מ-100 Spaces שנבנו עליו, כל נתון ביצועים שנמצא במחזור עדיין נגזר מדוח טכני אחד שכתבו האנשים שאימנו את המודל. זו אינה ביקורת על OpenBMB, שתיעדו את עבודתם ביסודיות ובכנות יותר מרוב האחרים — הדוח חושף מרצונו את בחירות מזהה הדיבור שלו, את חולשות נפח הנתונים שלו ואת חוסר היציבות שלו עצמו. זו ביקורת על כולנו. הדבר היחיד בעל הערך הרב ביותר שכל אחד בקהילת קוד הפתוח בתחום הדיבור יכול לפרסם החודש הוא ריצת Seed-TTS-Eval ו-MiniMax-MLS בניקוד Whisper של VoxCPM2, Qwen3-TTS, Fish Audio S2 ו-LongCat-Audio-DiT בתנאים זהים. עד שיתקיים דבר כזה, הסיכום ההוגן של VoxCPM2 הוא שזהו מודל הקול בעל המשקלים הפתוחים המסוגל ביותר לפי checkpoint שמישהו שחרר עד כה, שהוא אינו המדויק ביותר, וששני חצאיו של משפט זה נשענים על דבריו של הספק.
