כרטיס כותרת ראשי עבור "GPT-Live-1 נגד VoxCPM2", עם כותרת משנה "שיחה בשכירות או GPU בבעלותך", עם תג שעליו כתוב "האחד הוא דופלקס מלא, האחד הוא טקסט לדיבור – משימות שונות" ושלושה כרטיסים: "GPT-Live-1 — $0.05 לדקת קול, API בלבד, אין מה להתקין", "VoxCPM2 — Apache-2.0, 2B פרמטרים, ~8 GB VRAM, אף ספק הסקה לא פורס אותו" ו"תפוקת אירוח עצמי — כ-7.7 שעות אודיו לשעת GPU ב-RTF 0.13, 393,079 הורדות ב-30 הימים האחרונים", מעל פס תחתון שעליו כתוב "מדדי הביצועים של VoxCPM2 כפי שדווחו על ידי OpenBMB; נתוני הקול של GPT-Live-1 כפי שדווחו על ידי OpenAI ולא שוחזרו." הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Engineering & Research

GPT-Live-1 לעומת VoxCPM2: האחד עולה $0.05 לדקה, והשני עולה GPU של 24 GB

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדרך הנקייה ביותר להשוות בין GPT-Live-1 ל-VoxCPM2 היא לשים לב שהם נראים כמתחרים רק עד ששמים מספר על החומרה. GPT-Live-1 הוא מודל הקול הדופלקסי המלא של OpenAI, שנמצא ב-API מאז 10 בספטמבר 2026 במחיר של $0.05 לדקת קול, ללא צורך בהתקנה. VoxCPM2 הוא מודל טקסט-לדיבור עם משקולות פתוחות ובעל 2 מיליארד פרמטרים של OpenBMB, שיצא תחת Apache 2.0 באפריל 2026, שפועל על כ-8 GB של VRAM ואינו מופעל על ידי שום ספק הסקה — אז אם אתה רוצה אותו, אתה הבעלים של המכונה. האחד הוא שיחה שאתה שוכר לפי שנייה; האחר הוא סינתיסייזר שאתה מפעיל. השאלה היא לא איזה מהם טוב יותר, אלא איזה מהם עומס העבודה שלך יכול באמת לספוג.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

שני דגמים, שני תפקידים, שורת מפרט כנה אחת לכל אחד

• פונקציה — GPT-Live-1 מנהל שיחה: הוא מקשיב ומדבר בו-זמנית, מחליף תורות, מתמודד עם הפרעות ועם תגובות גומלין, ומחזיר תמלולים. VoxCPM2 הופך טקסט לדיבור. הוא לעולם אינו שומע דבר.

• גישה — GPT-Live-1 הוא שירות מתארח וסגור, עם מזהה מודל אחד מאחורי נקודת הקצה Live Sessions, כאשר דוגמת האינטגרציה שפורסמה פועלת על גבי WebRTC. VoxCPM2 הוא צ׳קפוינט להורדה ב-Hugging Face וב-ModelScope, תחת Apache 2.0, בחינם לשימוש מסחרי.

• מחיר — GPT-Live-1 הוא $0.05 לדקת קול, בחיוב לפי שנייה, כאשר ה-backend של ההאצלה נמדד בנפרד. VoxCPM2 הוא $0 לקריאה בתוספת GPU, ואחסון בקוד פתוח הוא כל מודל העלויות.

• טביעת רגל — GPT-Live-1 לא דורש חומרה משלך. VoxCPM2 דורש בערך 8 GB של VRAM (6–8 GB ב-Q4), ‏Python 3.10+, ‏PyTorch 2.5+ ו-CUDA 12+.

• מדדים — כל נתון קולי של GPT-Live-1 הוא של Ope​nAI ולא שוחזר; הלוח העצמאי היחיד מציב אותו במקום השביעי מבין אחד עשר. המספרים שפורסמו של VoxCPM2 הם של OpenBMB, והמדידות העצמאיות הקיימות בנוגע לטענות הרב-לשוניות שלו מצביעות דווקא לכיוון ההפוך.

שאלת ה-24 GB, מתומחרת

נתוני ההגשה של VoxCPM2 הם אלה שקובעים אם אירוח עצמי הוא תחביב או ארכיטקטורה. על RTX 4090 בודד, המודל רץ בפקטור זמן אמת של בערך 0.30 ב-PyTorch רגיל ובערך 0.13 עם מסלול Nano-VLLM — כלומר בערך 7.7 שעות של אודיו מיוצר לכל שעת זמן GPU בתצורה המהירה יותר. אלה הנתונים של כרטיס המודל עצמו ולא מדידה חיצונית; מתכון הגשה עצמאי שאומת על 4090 עם CUDA 12.9 מדווח על פקטורי זמן אמת במצב יציב של בערך 0.120 לסינתזה ללא דוגמה (zero-shot) ו-0.139 לשיבוט קול, עם שיא זיכרון GPU קרוב ל-22 GB מתוך 24 GB. שתי הקבוצות הן במצב יציב, לא התנעה קרה — הבקשה הראשונה בתהליך חדש איטית בהרבה, וזה המספר שאנשים מצטטים כשהם אומרים שהמודל אינו שמיש.

שימו את זה לצד ה-API. GPT-Live-1 במחיר 0.05 דולר לדקה הוא 3.00 דולר עבור שעה של שיחה רציפה. כרטיס 24 GB שנשכר בשוק החופשי עומד על דולרים בודדים נמוכים לשעה, והחזקה בבעלות על אחד כזה מתפרסת לסכום דומה לאחר שמביאים בחשבון את הניצולת. אז ההשוואה נוחתת במקום שבו השוואות כאלה בדרך כלל נוחתות, עם אסימטריה לא נוחה אחת: חשבון ה-GPU מגיע בין אם מישהו מדבר עם המוצר שלכם ובין אם לא, וחשבון ה-API מתכווץ לאפס ביום שקט ומגיע לחמש ספרות ביום עמוס. סינתזה באצווה של קטלוג קבוע היא התאמה מושלמת ל-GPU. קו טלפון שפעיל תמיד הוא התאמה מושלמת למונה.

מה VoxCPM2 עושה שאף כלי פתוח אחר לא עושה

הסיבה ש-VoxCPM2 ראוי לתשומת לב כה רבה אינה שהוא מנצח בבנצ'מרקים — ובדרך כלל הוא לא מנצח בהם — אלא שהוא מעצב קול מתוך תיאור טקסטואלי בלי שום אודיו ייחוס כלל. זוהי יכולת חדשה באמת במשקלים פתוחים, והיא משנה את זרימת העבודה לכל מי שזקוק לקול שעדיין אינו קיים: לבחון אותו בטקסט, לבצע איטרציות בטקסט, ורק אז להחליט אם לשכפל. על כך הוא מוסיף 30 שפות ועוד תשעה ניבים סיניים, פלט ב-48 kHz באמצעות שלב סופר-רזולוציה מובנה, וכיוונון עדין עם 5–10 דקות אודיו בלבד.

בסיס הראיות דק יותר מרשימת התכונות. הדוח של OpenBMB עצמו מציג שיעור שגיאות מילים באנגלית של 1.84% ושיעור שגיאות תווים בסינית של 0.97%, ושגיאה ממוצעת של 1.68% על פני 30 שפות, כפי שנמדד בסט שלו עצמו של 500 אמירות לכל שפה ובניקוד של מודל של ספק אחר. במקום שבו קיים מבחן בלתי תלוי, הפער גדול: בסט המבחנים הרב-לשוני של MiniM​ax, שהוערך עם Whisper-large-v3, ההינדי מגיע ל-19.70 והערבית ל-13.05 — גרוע פי כמה מהנתונים המדווחים על ידה. OpenBMB גם מזהיר שעיצוב קולי ובקרת סגנון מפיקים תוצאות משתנות בין הרצות, ומציע לייצר בין פעם אחת לשלוש פעמים כדי לקבל את הפלט הרצוי, שזו דרך שקטה לומר שהעלות לכל קריאה של תוצאה שמישה אינה קריאה אחת.

מס האינטגרציה שאיש לא מכניס להשוואה

פרט אחד לא זוהר קובע אם VoxCPM2 הוא שבוע עבודה או חודש. המאגר שלו ב-Hugging Face מתויג voxcpm ולא transformers, כלומר הספרייה שכמעט כל דבר אחר באתר הזה נטען איתה לא יכולה לטעון את המודל הזה. בקשת המשיכה לתיקון הדבר נפתחה ב-4 באוגוסט 2026 ועדיין לא נכנסה כשבדקנו לאחרונה. בקשות משיכה להוספתו לערימות הגשה אחרות כן נכנסו, והאימוץ אינו מוטל בספק: 393,079 הורדות בשלושים הימים האחרונים נכון למועד לכידה זה, עם 27 מתאמים, 30 כיוונונים עדינים, 12 קוונטיזציות ו-100 Spaces שנבנו על גבי נקודת הבדיקה.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

המס המקביל של GPT-Live-1 הוא שכתוב של שכבת התעבורה. הסשנים שלו בנויים סביב חיבור חי ולא סביב נקודת קצה אודיו של בקשה-תגובה, והחיוב בשני מונים אומר שכל קריאת הסקה שהואצלה, הפעלת כלי וחיפוש באינטרנט מחויבים לפי התעריפים של מודל ה-backend עצמו, בנוסף לדקת הקול. צוותים שעוברים מאינטגרציית realtime בחיוב לפי טוקנים צריכים לתקצב את המעבר כמשימת הנדסה, לא כהחלפת מזהה מודל.

איפה שכבת ניתוב באמת עוזרת

OrcaRouter אינו כולל לא את GPT-Live-1 ולא את VoxCPM2, וכדאי לומר זאת במפורש במקום לתת לשאר החלק הזה לרמוז אחרת. שכבת הקול של GPT-Live-1 נמצאת מאחורי נקודת הקצה של OpenAI עצמה; ל-VoxCPM2 אין כלל ספק מתארח. את אף אחד מהשניים לא ניתן לקרוא באמצעות המפתח שלנו.

הסיבה ששאלת הניתוב עדיין עולה היא ששני המודלים יושבים בקצה של צינור עיבוד שהאמצע שלו הוא טקסט. פריסה של VoxCPM2 בדרך כלל עונה למשהו — מחולל תסריטים, שלב תרגום, מנרמל טקסט, מודל דיאלוג שמחליט מה ייאמר בהמשך — ואלה הן קריאות מודל רגילות. הפעלה של GPT-Live-1 מאצילה את החשיבה שלה למודל backend שמצוין בתצורת ההפעלה, ובמסמכים של OpeAI עצמה ה-backend הזה הוא GPT-5.6 Terra, שזמין דרך OrcaRouter במחיר המחירון של OpeAI. האצלה מהלקוח הולכת אפילו רחוק יותר, ומאפשרת לאפליקציה שלך לספק את ה-backend, כלומר המודל שמאחורי הקול יכול להיות כל נקודת קצה שבשליטתך. כ-190 מודלים מאחד-עשר ספקי מקור יושבים מאחורי מפתח אחד במחיר מחירון וללא תוספת כלשהי — כך שכאשר ספק מוריד מחיר, ההורדה נכנסת לתוקף כאן כבר באותו יום ולא רק בחידוש — עם failover אוטומטי בין ספקים ו-DSL לניתוב שמאפשר להרכיב כמה מודלים לקריאה אחת. ביטוח זול לחצי מהסטאק שמשתנה בתדירות הגבוהה ביותר.

אזהרה אחת מקומה בסעיף הזה ולא קבורה בתוכו, משום שזה הפרט שהופך את חצי ה-GPT-Live-1 של ההשוואה הזו לפחות סגור ממה שהבנצ'מרקים של הספק שלו מרמזים. במדד Artificial Analysis Speech to Speech העצמאי, GPT-Live-1 מקבל ציון 69.8% — שביעי מתוך אחד עשר, אחרי GPT-Realtime-2.1 עם 73.9% ו-Gr​ok Voice Think Fast 2.0 עם 79.0%. המודל הוא הדבר הזול ביותר בלוח הזה לשעת אודיו קלט ב-$4.42, והוא לא הטוב ביותר. הקצו תקציב לאפשרות ששכבת הקול שאתם קובעים כתקן היא לא זו שתישארו איתה.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

איזה אחד, בשביל מה

בחר ב-VoxCPM2 אם הטקסט קיים לפני שהאודיו קיים. קריינות, ספרי שמע, דיבוב, נגישות, שורות קול במשחקים, מוצר שזקוק לקול שאיש עוד לא הקליט — ובמיוחד כל עומס עבודה שבו ההיקף גבוה, צפוי, ושווה עלות הון קבועה. קבל את העובדה שתריץ אותו בעצמך, שהכלים שסביבו עדיין מתייצבים, ושטענות האיכות הרב-לשונית ראויות למבחן האזנה משלך לפני שהן מגיעות ללקוח.

קח את GPT-Live-1 אם יש אדם בצד השני. סוכני קול, תמיכה טלפונית, תהליכי קליטה, כל דבר שבו המודל צריך להחליט בזמן אמת אם האדם סיים לדבר. שלם את התעריף לפי דקה עבור הזכות לא להחזיק בבעיה, ותקצב את ה-backend המואצל כסעיף נפרד, כי שם השיחה נעשית זולה או יקרה.

הטעות היא להתייחס אליהם כאל חלופות בהשוואה ראש בראש. הם שני רבדים של אותו מוצר עבור רוב הצוותים שזקוקים לשניהם, והתשובה היחידה שבאמת שגויה היא לבחור באפשרות ה-self-hosted כי הרישיון אומר חינם בלי לתמחר את ה-GPU שהופך את זה לאמיתי.