
Eleven v4 מול VoxCPM2: מודל מדורג לעומת צ'קפוינט שאי אפשר לשכור
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 982 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 197 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
העובדה השימושית ביותר בהשוואה הזו היא שורה שלא קיימת. ElevenLabs Eleven v4 מחזיק במקום הראשון ב-Provider Voice Arena של Artificial Analysis עם Elo של 1,319 על פני 1,674 הופעות, במחיר של 80.00 דולר למיליון תווים. VoxCPM2, נקודת הבדיקה של OpenBMB שיצאה באפריל 2026, אינה מופיעה בשום מקום באף אחד משני לוחות הדיבור — לא מדורגת, לא בלתי-מדורגת, ולא כרשומת תצוגה מקדימה. זו אינה פסיקה לגבי איכות. זה אומר שכל מספר שקיווית להשוות מול 1,319 — איש לא הפיק אותו, וההשוואה צריכה להיעשות על משהו אחר מלבד העדפה. מה שנשאר הוא בעלות, כיוונון עדין, ושאלת רישוי שנקודת קצה מתארחת לא מאפשרת לשאול.
מה כל צד בעצם נותן לך
אלה סוגים שונים של מוצר, וההבדל אינו קוסמטי.
• גישה — Eleven v4 הוא נקודת קצה מתארחת הנגישה דרך ה-API של ElevenLabs עצמה, בחיוב לפי תו. VoxCPM2 הוא צ'קפוינט ב-Hugging Face תחת openbmb/VoxCPM2; מורידים אותו ומריצים אותו, ואין נקודת קצה של המפתח הראשי לקרוא לה.
• רישיון — VoxCPM2 מופץ תחת Apache 2.0, ובאופן מפורש חופשי לשימוש מסחרי. Eleven v4 הוא API מסחרי שתנאיו הם של ElevenLabs. ההבדל הזה חשוב אם הסקירה המשפטית שלך שואלת אם מותר לך לבצע כוונון עדין, להפיץ מחדש או להפיץ את משקולות המודל; עם ה-checkpoint התשובה כתובה וסטטית.
• גודל וחומרה — VoxCPM2 הוא 2B פרמטרים על שלד MiniCPM-4, והכרטיס מציין כ-8 GB של VRAM ב-bfloat16, עם אורך רצף מרבי של 8,192 טוקנים. ElevenLabs אינה מפרסמת מספר פרמטרים עבור Eleven v4, וטביעת הרגל החומרתית של מודל מתארח היא לא משהו שאתה מנהל.
• שרשרת פלט — VoxCPM2 מקבל אודיו ייחוס ב-16 קילוהרץ ופולט 48 קילוהרץ דרך רזולוציית-העל המובנית של AudioVAE V2, ללא מעלה-דגימה חיצוני בנתיב. TTS מתארח מוסר לך זרם בכל קצב שהספק בחר.
• ציון עצמאי — ל-Eleven v4 יש כזה, והוא במקום הראשון. ל-VoxCPM2 אין. היעדר אינו ציון נמוך; זהו מודל ללא ציון, ואין להזכיר את השניים באותו משפט כאילו השני היה מספר.

המספר שמחליף את ה-Elo החסר
אם אינך יכול להשוות העדפה, השווה את מה שאתה יכול לחשב, ועבור מודל באירוח עצמי זה תפוקה. הכרטיס של VoxCPM2 מציין מקדם זמן אמת של כ-0.30 ב-PyTorch סטנדרטי על RTX 4090, ויורד לכ-0.13 תחת Nano-VLLM. מקדם זמן אמת הוא שניות חישוב לכל שנייה של אודיו, כך ששני הנתונים האלה אומרים ששעת GPU אחת מניבה בערך 3.3 שעות של דיבור מוגמר במקרה הראשון וכ-7.7 שעות במקרה השני.

שתי השלכות נובעות מיד. מחסנית ההגשה חשובה יותר מהמודל: אותו צ'קפוינט על אותה כרטיס יותר ממכפיל את התפוקה שלו כשמחליפים את מנוע ההסקה, כך שכל מודל עלויות שמשתמש בנתון 0.30 מגזים בעלות האחסון העצמי שלך בפקטור של כ-2.3. וניצולת היא כל המשחק: כרטיס שיושב בטל לא מנצח API בתשלום לפי תו בכל מחיר, מפני שהחשבון של ה-API מתאים את עצמו למה שאתה אומר בעוד שהחשבון של הכרטיס מתאים את עצמו למתי קנית אותו.
וזו הסיבה שהגרסה הכנה של ההחלטה הזו אינה "מה נשמע טוב יותר". היא "כמה שעות אודיו אתה מייצר בחודש, והאם החומרה עסוקה". מתחת לנפח שבו כרטיס נשאר בעומס, ה-API מנצח וזה לא צמוד. מעליו, על חומרה שכבר בבעלותך, העלות השולית של ה-checkpoint בשעה האלפית זהה לעלות שלו בשעה הראשונה — וזה יתרון מבני שאף כרטיס תעריפים לא יכול להשתוות לו.
היכולת שנקודת קצה מתארחת לא תמכור לך
כאן מפסיקה ההשוואה להיות תמונת מראה, כיוון שיש דבר אחד ש-VoxCPM2 עושה ש-Eleven v4 פשוט אינו מסוגל לו: אפשר לאמן אותו מחדש. כרטיס המודל מתעד גם כיוונון מלא (SFT) וגם כיוונון עדין ב-LoRA על חמש עד עשר דקות של אודיו בלבד, עם סקריפט אימון וקובץ תצורה מסופקים עבור כל אחד מהם.
זה משנה את הצורה של תוכנית קולית. API מתארח נותן לך מודל קבוע בתוספת כל מה שהספק חושף בתחום השיבוט — עשר שניות של אודיו ייחוס במקרה של Eleven v4 לשיבוטים מיידיים, עם שכבה מקצועית מעליו. צ'קפוינט הניתן לכוונון ב-LoRA נותן לך מודל שמעולם לא ראה נתונים של אף אחד אחר, ושניתן לקבע את התנהגותו לפי גרסה. עבור קול מותג, תחום מוסדר, או שפה שקאסט הקולות של הספק מתמודד איתה בצורה גרועה, זה קטגוריה אחרת של פתרון — לא פתרון זול יותר.
העסקה מפורשת וראויה לציון: עם VoxCPM2 אתה מקבל שאף צד שלישי מעולם לא דירג את המודל, שהבטחות האיכות הן משהו שאתה בונה ומודד בעצמך, ושמגבלת הרצף של 8,192 טוקנים והאזהרה של הכרטיס עצמו — שעיצוב קול ושליטה בסגנון משתנים בין הרצות ושמומלץ לבצע בין אחת לשלוש יצירות — הם כעת בעיית ה-QA שלך.
מה Eleven v4 נותן לך שה-checkpoint לא יכול לתת
מהכיוון השני, היתרונות של המודל המתארח הם אלה שמופיעים בלוח השחרורים ולא בדף מפרט.
• דירוג מדוד — מקום ראשון בלוח עם 1,674 דגימות מאחורי האומדן, וטווח של כ-±19 נקודות סביבו. יהא אשר יהא מה שהלוח הזה מודד, הוא בלתי תלוי בשני הספקים וזה אות האיכות היחיד מצד שלישי בהשוואה הזו.
• הנחיית ביצוע בטקסט — תגיות אודיו מוטמעות כגון [צוחק], [לוחש] ו[נאמר בכעס במבטא צרפתי], בנוסף להנחיות מסירה בשפה טבעית ולתמיכה משופרת באלפבית הפונטי הבינלאומי. השגת שינוי במצב רוח ממודל באחסון עצמי פירושה יצירה מחדש או כיוונון עדין; כאן זהו טוקן בתסריט.
• כיסוי שאין צורך לאמת — למעלה מ-90 שפות מול 30 של VoxCPM2, עם הסתייגות שרשימת הצ'קפוינט מפורשת ומנויה בשמות (כולל ניבים סיניים), בעוד ש"יותר מ-90" של הספק הוא מספר ללא רשימה.
• אין משטח תפעולי — אין GPU, אין סטאק הגשה, אין סטיית גרסאות, ותעריף מבצעי של $0.022 לכל 1,000 תווים עד 12 באוקטובר, לעומת מחיר מחירון של $0.08 לאחר מכן.

אף אחד משני אלה אינו שלנו, וזו הנקודה של הקטע הזה.
OrcaRouter אינה מארחת אף אחד מהמודלים. אין נקודת קצה של ElevenLabs ואין נקודת קצה של VoxCPM2 בקטלוג שלנו, והתשובה הכנה מבחינת הניתוב היא שאל Eleven v4 מגיעים דרך ה-API של ElevenLabs עצמה, בעוד ש-VoxCPM2 הוא משהו שפורסים על החומרה שלכם. לא נרמוז אחרת רק כדי להפוך את ההשוואה למסודרת יותר.
המקום שבו מפתח בודד כן עוזר הוא בהחלטה שלפני ההחלטה. הסיבה ששיחות על אירוח עצמי נתקעות היא שהחלופה לעולם אינה נבחנת: API הוא קריאה אחת ו-checkpoint הוא מחסנית הגשה, ולכן ה-API מנצח כברירת מחדל ולא מתוך אריתמטיקה. התרומה של OrcaRouter היא שהחצי המתארח בהשוואה הזו זול לבדיקה — יותר מ-200 מודלים מאחורי מפתח API אחד, כשמחירי המחירון של הספקים מועברים הלאה בתוספת של 0%, כך שהאפשרות המתארחת נבחנת לפי התעריף האמיתי שלה ולא לפי תעריף מוערך, עם מעבר אוטומטי לגיבוי אם תעמידו מועמד מאחורי נתיב חי לפני שסיימתם להחליט.
איך להחליט במעבר אחד
בחר ב-Eleven v4 אם הקול חייב להיות טוב כבר בטייק הראשון ואתה רוצה שזה ייעשה השבוע. אתה מקבל את המקום הראשון בלוח דירוג עצמאי, תחביר הוראות מתועד, את מספר השפות המתועד הגדול ביותר בהשוואה הזו, ואפס תשתית. אתה משלם $0.08 לכל 1,000 תווים החל מ-13 באוקטובר ואילך, ואתה מקבל את העובדה שלא תוכל לאמן אותו מחדש, לנעוץ גרסה, או לשמור את האודיו על החומרה שלך.
בחר ב-VoxCPM2 אם המודל חייב להיות שלך. Apache 2.0, 2B פרמטרים על כ־8 GB של VRAM, פלט 48 kHz ללא upsampler בשרשרת, ומסלול fine-tuning שרץ על חמש עד עשר דקות של אודיו — אלו יכולות שנקודת קצה מתארחת אינה מציעה בכל מחיר, והיעדרותה של שורה בארנה היא המחיר שלהן. הרץ את נתוני התפוקה על הכרטיס שלך לפני שאתה מתחייב, כי מקדמי זמן האמת 0.30 ו־0.13 הם המדידות של כרטיס המודל עצמו ומחסנית ההגשה שלך לא תשחזר אותם בדיוק.
ואם התשובה הכנה היא שאינך יודע מהו נפח האודיו החודשי שלך, זה המספר שעליך ללכת ולמצוא. הוא מכריע את ההשוואה הזו. אף אחד משני הלוחות לא יגיד לך.
