כרטיס hero שנוצר עבור ElevenLabs Eleven v4 לעומת VoxCPM2 עם שני פאנלים: ElevenLabs Eleven v4 כנקודת קצה מתארחת בדירוג Elo 1,319, דירוג 1 ו-$80.00 לכל 1M תווים; VoxCPM2 כנקודת ביקורת Apache-2.0 עם 2B פרמטרים, פלט 48 kHz וללא שורת ארנה. כותרת תחתונה: 'דירוג ומחיר של Eleven v4 לפי Artificial Analysis, ספטמבר 2026; מפרטי VoxCPM2 לפי כרטיס המודל של OpenBMB.' הלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Guides & Insights

Eleven v4 מול VoxCPM2: מודל מדורג לעומת צ'קפוינט שאי אפשר לשכור

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

העובדה השימושית ביותר בהשוואה הזו היא שורה שלא קיימת. ElevenLabs Eleven v4 מחזיק במקום הראשון ב-Provider Voice Arena של Artificial Analysis עם Elo של 1,319 על פני 1,674 הופעות, במחיר של 80.00 דולר למיליון תווים. VoxCPM2, נקודת הבדיקה של OpenBMB שיצאה באפריל 2026, אינה מופיעה בשום מקום באף אחד משני לוחות הדיבור — לא מדורגת, לא בלתי-מדורגת, ולא כרשומת תצוגה מקדימה. זו אינה פסיקה לגבי איכות. זה אומר שכל מספר שקיווית להשוות מול 1,319 — איש לא הפיק אותו, וההשוואה צריכה להיעשות על משהו אחר מלבד העדפה. מה שנשאר הוא בעלות, כיוונון עדין, ושאלת רישוי שנקודת קצה מתארחת לא מאפשרת לשאול.

מה כל צד בעצם נותן לך

אלה סוגים שונים של מוצר, וההבדל אינו קוסמטי.

• גישה — Eleven v4 הוא נקודת קצה מתארחת הנגישה דרך ה-API של ElevenLabs עצמה, בחיוב לפי תו. VoxCPM2 הוא צ'קפוינט ב-Hugging Face תחת openbmb/VoxCPM2; מורידים אותו ומריצים אותו, ואין נקודת קצה של המפתח הראשי לקרוא לה.

• רישיון — VoxCPM2 מופץ תחת Apache 2.0, ובאופן מפורש חופשי לשימוש מסחרי. Eleven v4 הוא API מסחרי שתנאיו הם של ElevenLabs. ההבדל הזה חשוב אם הסקירה המשפטית שלך שואלת אם מותר לך לבצע כוונון עדין, להפיץ מחדש או להפיץ את משקולות המודל; עם ה-checkpoint התשובה כתובה וסטטית.

• גודל וחומרה — VoxCPM2 הוא 2B פרמטרים על שלד MiniCPM-4, והכרטיס מציין כ-8 GB של VRAM ב-bfloat16, עם אורך רצף מרבי של 8,192 טוקנים. ElevenLabs אינה מפרסמת מספר פרמטרים עבור Eleven v4, וטביעת הרגל החומרתית של מודל מתארח היא לא משהו שאתה מנהל.

• שרשרת פלט — VoxCPM2 מקבל אודיו ייחוס ב-16 קילוהרץ ופולט 48 קילוהרץ דרך רזולוציית-העל המובנית של AudioVAE V2, ללא מעלה-דגימה חיצוני בנתיב. TTS מתארח מוסר לך זרם בכל קצב שהספק בחר.

• ציון עצמאי — ל-Eleven v4 יש כזה, והוא במקום הראשון. ל-VoxCPM2 אין. היעדר אינו ציון נמוך; זהו מודל ללא ציון, ואין להזכיר את השניים באותו משפט כאילו השני היה מספר.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

המספר שמחליף את ה-Elo החסר

אם אינך יכול להשוות העדפה, השווה את מה שאתה יכול לחשב, ועבור מודל באירוח עצמי זה תפוקה. הכרטיס של VoxCPM2 מציין מקדם זמן אמת של כ-0.30 ב-PyTorch סטנדרטי על RTX 4090, ויורד לכ-0.13 תחת Nano-VLLM. מקדם זמן אמת הוא שניות חישוב לכל שנייה של אודיו, כך ששני הנתונים האלה אומרים ששעת GPU אחת מניבה בערך 3.3 שעות של דיבור מוגמר במקרה הראשון וכ-7.7 שעות במקרה השני.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

שתי השלכות נובעות מיד. מחסנית ההגשה חשובה יותר מהמודל: אותו צ'קפוינט על אותה כרטיס יותר ממכפיל את התפוקה שלו כשמחליפים את מנוע ההסקה, כך שכל מודל עלויות שמשתמש בנתון 0.30 מגזים בעלות האחסון העצמי שלך בפקטור של כ-2.3. וניצולת היא כל המשחק: כרטיס שיושב בטל לא מנצח API בתשלום לפי תו בכל מחיר, מפני שהחשבון של ה-API מתאים את עצמו למה שאתה אומר בעוד שהחשבון של הכרטיס מתאים את עצמו למתי קנית אותו.

וזו הסיבה שהגרסה הכנה של ההחלטה הזו אינה "מה נשמע טוב יותר". היא "כמה שעות אודיו אתה מייצר בחודש, והאם החומרה עסוקה". מתחת לנפח שבו כרטיס נשאר בעומס, ה-API מנצח וזה לא צמוד. מעליו, על חומרה שכבר בבעלותך, העלות השולית של ה-checkpoint בשעה האלפית זהה לעלות שלו בשעה הראשונה — וזה יתרון מבני שאף כרטיס תעריפים לא יכול להשתוות לו.

היכולת שנקודת קצה מתארחת לא תמכור לך

כאן מפסיקה ההשוואה להיות תמונת מראה, כיוון שיש דבר אחד ש-VoxCPM2 עושה ש-Eleven v4 פשוט אינו מסוגל לו: אפשר לאמן אותו מחדש. כרטיס המודל מתעד גם כיוונון מלא (SFT) וגם כיוונון עדין ב-LoRA על חמש עד עשר דקות של אודיו בלבד, עם סקריפט אימון וקובץ תצורה מסופקים עבור כל אחד מהם.

זה משנה את הצורה של תוכנית קולית. API מתארח נותן לך מודל קבוע בתוספת כל מה שהספק חושף בתחום השיבוט — עשר שניות של אודיו ייחוס במקרה של Eleven v4 לשיבוטים מיידיים, עם שכבה מקצועית מעליו. צ'קפוינט הניתן לכוונון ב-LoRA נותן לך מודל שמעולם לא ראה נתונים של אף אחד אחר, ושניתן לקבע את התנהגותו לפי גרסה. עבור קול מותג, תחום מוסדר, או שפה שקאסט הקולות של הספק מתמודד איתה בצורה גרועה, זה קטגוריה אחרת של פתרון — לא פתרון זול יותר.

העסקה מפורשת וראויה לציון: עם VoxCPM2 אתה מקבל שאף צד שלישי מעולם לא דירג את המודל, שהבטחות האיכות הן משהו שאתה בונה ומודד בעצמך, ושמגבלת הרצף של 8,192 טוקנים והאזהרה של הכרטיס עצמו — שעיצוב קול ושליטה בסגנון משתנים בין הרצות ושמומלץ לבצע בין אחת לשלוש יצירות — הם כעת בעיית ה-QA שלך.

מה Eleven v4 נותן לך שה-checkpoint לא יכול לתת

מהכיוון השני, היתרונות של המודל המתארח הם אלה שמופיעים בלוח השחרורים ולא בדף מפרט.

• דירוג מדוד — מקום ראשון בלוח עם 1,674 דגימות מאחורי האומדן, וטווח של כ-±19 נקודות סביבו. יהא אשר יהא מה שהלוח הזה מודד, הוא בלתי תלוי בשני הספקים וזה אות האיכות היחיד מצד שלישי בהשוואה הזו.

• הנחיית ביצוע בטקסט — תגיות אודיו מוטמעות כגון [צוחק], [לוחש] ו[נאמר בכעס במבטא צרפתי], בנוסף להנחיות מסירה בשפה טבעית ולתמיכה משופרת באלפבית הפונטי הבינלאומי. השגת שינוי במצב רוח ממודל באחסון עצמי פירושה יצירה מחדש או כיוונון עדין; כאן זהו טוקן בתסריט.

• כיסוי שאין צורך לאמת — למעלה מ-90 שפות מול 30 של VoxCPM2, עם הסתייגות שרשימת הצ'קפוינט מפורשת ומנויה בשמות (כולל ניבים סיניים), בעוד ש"יותר מ-90" של הספק הוא מספר ללא רשימה.

• אין משטח תפעולי — אין GPU, אין סטאק הגשה, אין סטיית גרסאות, ותעריף מבצעי של $0.022 לכל 1,000 תווים עד 12 באוקטובר, לעומת מחיר מחירון של $0.08 לאחר מכן.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

אף אחד משני אלה אינו שלנו, וזו הנקודה של הקטע הזה.

OrcaRouter אינה מארחת אף אחד מהמודלים. אין נקודת קצה של ElevenLabs ואין נקודת קצה של VoxCPM2 בקטלוג שלנו, והתשובה הכנה מבחינת הניתוב היא שאל Eleven v4 מגיעים דרך ה-API של ElevenLabs עצמה, בעוד ש-VoxCPM2 הוא משהו שפורסים על החומרה שלכם. לא נרמוז אחרת רק כדי להפוך את ההשוואה למסודרת יותר.

המקום שבו מפתח בודד כן עוזר הוא בהחלטה שלפני ההחלטה. הסיבה ששיחות על אירוח עצמי נתקעות היא שהחלופה לעולם אינה נבחנת: API הוא קריאה אחת ו-checkpoint הוא מחסנית הגשה, ולכן ה-API מנצח כברירת מחדל ולא מתוך אריתמטיקה. התרומה של OrcaRouter היא שהחצי המתארח בהשוואה הזו זול לבדיקה — יותר מ-200 מודלים מאחורי מפתח API אחד, כשמחירי המחירון של הספקים מועברים הלאה בתוספת של 0%, כך שהאפשרות המתארחת נבחנת לפי התעריף האמיתי שלה ולא לפי תעריף מוערך, עם מעבר אוטומטי לגיבוי אם תעמידו מועמד מאחורי נתיב חי לפני שסיימתם להחליט.

איך להחליט במעבר אחד

בחר ב-Eleven v4 אם הקול חייב להיות טוב כבר בטייק הראשון ואתה רוצה שזה ייעשה השבוע. אתה מקבל את המקום הראשון בלוח דירוג עצמאי, תחביר הוראות מתועד, את מספר השפות המתועד הגדול ביותר בהשוואה הזו, ואפס תשתית. אתה משלם $0.08 לכל 1,000 תווים החל מ-13 באוקטובר ואילך, ואתה מקבל את העובדה שלא תוכל לאמן אותו מחדש, לנעוץ גרסה, או לשמור את האודיו על החומרה שלך.

בחר ב-VoxCPM2 אם המודל חייב להיות שלך. Apache 2.0, 2B פרמטרים על כ־8 GB של VRAM, פלט 48 kHz ללא upsampler בשרשרת, ומסלול fine-tuning שרץ על חמש עד עשר דקות של אודיו — אלו יכולות שנקודת קצה מתארחת אינה מציעה בכל מחיר, והיעדרותה של שורה בארנה היא המחיר שלהן. הרץ את נתוני התפוקה על הכרטיס שלך לפני שאתה מתחייב, כי מקדמי זמן האמת 0.30 ו־0.13 הם המדידות של כרטיס המודל עצמו ומחסנית ההגשה שלך לא תשחזר אותם בדיוק.

ואם התשובה הכנה היא שאינך יודע מהו נפח האודיו החודשי שלך, זה המספר שעליך ללכת ולמצוא. הוא מכריע את ההשוואה הזו. אף אחד משני הלוחות לא יגיד לך.