כרטיס כותרת ראשי המשווה בין 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe', עם שורת על 'Speech-to-text - Sept 2026', וכותרת משנה שלפיה נקודת ביקורת מסשן חי פוגשת את נקודת הקצה המבוקרת לקבצים של OpenAI – שני רגעים שונים בחיי האודיו; תגיות 'MIT weights - Sep 2', 'OpenAI API - Jul 28' ו-'GPT: 3.31% AA-WER', והערת שוליים 'Evidence is one-sided'. הלוגו של OrcaRouter מולבש בפינה הימנית התחתונה.
Guides & Insights

VibeVoice-ASR-Streaming-7B מול GPT-Transcribe: נקודת ביקורת בסשן חי בהשוואה לנקודת קצה הקבצים של OpenAI

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני הדגמים בעמוד זה אינם יריבים כפי ששמותיהם מרמזים — הם נבנו לרגעים שונים בחיי הקלטת שמע, וההשוואה הכנה היא על איזה רגע המוצר שלכם נמצא בו. GPT Transcribe הוא נקודת הקצה האסינכרונית לתמלול של OpenAI: מעלים קובץ מוגמר, הוא מעבד אותו בערך פי 34 מהר יותר מזמן אמת, ומחזיר תמלול — במחיר של $0.0045 לדקת שמע, עם שיעור שגיאות מילים של 3.31% שנמדד באופן עצמאי במדד AA-WER של Artificial Analysis. VibeVoice-ASR-Streaming-7B הוא הצורה ההפוכה: צ׳קפוינט סטרימינג של Microsoft Research, שהועלה בשקט ל-Hugging Face ב-2 בספטמבר 2026 תחת רישיון MIT, שנועד לתמלל שמע בעודו עדיין מגיע — סשן WebSocket הפולט טקסט במקטעים ככל שההקלטה גדלה. השוואה ביניהם על סמך דיוק בלבד תהיה חסרת משמעות, כי לצד האחד יש מספר שעבר ביקורת, ואילו הצד השני לא פרסם שום נתון בכתב כלל.

הכל להלן מסומן בהתאם. נתוני GPT Transcribe הם המחיר שפרסמה OpenAI והמדידה הבלתי־תלויה של Artificial Analysis, שניהם ברשות הציבור מאז השקת המודל ב־28 ביולי 2026. באשר לצד VibeVoice-ASR-Streaming-7B, זה כל מה שניתן לדעת מהמאגר — תצורת נקודת הבידוק, כרטיס המודל והתיעוד של Microsoft בנושא סטרימינג — מכיוון שאף גורם חיצוני לא בחן אותו, ו-Microsoft לא פרסמה שיעור שגיאות מילים בסטרימינג בטקסט קריא.

שני רגעים שונים בחיי האודיו

GPT Transcribe מיועד להקלטות שכבר התרחשו. ה-API של OpenAI מקבל קבצי אודיו עד 25 MB בפורמטים הרגילים — mp3, mp4, mpeg, mpga, m4a, wav, webm — ומחזיר את התמליל המלא לאחר העיבוד, במהירות של בערך פי 34 מזמן אמת, כך שהקלטה של שעה מסתיימת תוך מספר דקות. זהו מסלול האצווה, ו-OpenAI מתמחרת אותו בהתאם: $0.0045 לדקת אודיו, כ-$0.27 לשעת אודיו. אם הצורך שלך הוא באמת בשידור חי, OpenAI מציעה מודל נפרד לכך — GPT Live Transcribe במחיר של $0.017 לדקה, כמעט פי ארבעה ממחיר האצווה — וזה הדבר הקרוב ביותר בצד של OpenAI למה ש-VibeVoice-ASR-Streaming-7B עושה.

VibeVoice-ASR-Streaming-7B ממוטט את ההבחנה הזו בכיוון ההפוך: זהו checkpoint סטרימינג שמטפל גם בקבצים שלמים. תצורת הפריפרוססור שלו חושפת את החוזה החי — קלט אודיו ב-24 קילו-הרץ, דחוס פי 3,200 לזרם טוקנים של 7.5 הרץ, ולאחר מכן מעובד בנתחים של 22 פריימים עם חלון צפייה של 4 פריימים, כ-2.9 שניות אודיו לכל נתח עם בערך חצי שנייה של הקשר עתידי, ופליטת טקסט ככל שכל נתח נפתר. הקשר השיחה מועבר קדימה דרך מטמון ה-KV, כך שהפעלה ארוכה לא מחשבת הכל מחדש מאפס. נתיב השרת המתועד (תוסף vLLM) חושף נקודת קצה להזרמת WebSocket להפעלות חיות ונקודת קצה לתמלול קבצים שלמים, כך שאותם משקלים משרתים את שתי הצורות — אבל הסיבה לקיומו של המודל היא ההפעלה החיה, ואין מד חיוב לדקה כי אין API מתארח. אתה מביא את ה-GPU.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

יומן הראיות הוא חד-צדדי

GPT Transcribe הוא אחד מממשקי ה-API לתמלול שנמדדו בצורה היסודית ביותר בייצור. Artificial Analysis דירג אותו ב-3.31% שגיאת מילים ב-AA-WER — מקום תשיעי מבין כחמישים מערכות במעקב — עם נקודת חולשה ידועה שקבורה בתת-הציונים: על הסט Earnings22, הקשה מבחינה אקוסטית במכוון, הוא יורד ל-6.10%. אלה נתונים מבוקרים וניתנים לשחזור מלוח תוצאות נייטרלי, והם מגיעים עם מגבלות שמתועדות בעצמן. המודל הושק במחיר נמוך ב-25% מקודמו GPT-4o Transcribe, ובערך 0.7 נקודה טוב יותר על אותו מדד.

ל-{{1}}VibeVoice-ASR-Streaming-7B{{/1}} אין נתון דומה בשום מקום. כרטיס המודל שלו כולל {{2}}איור הערכה כתמונה והדוח הטכני של מיקרוסופט הוא PDF{{/2}}, אך אין מספר WER סטרימינג בר-ציטוט או נתון השהיה בפרוזה, ואין שום דבר שניתן לאימות בלתי-תלוי. עוגן המספרים היחיד במשפחת {{3}}VibeVoice{{/3}} הוא {{4}}הטבלה המדווחת על-ידי הספק בכרטיס המודל של VibeVoice-ASR בקבוצות (batch){{/4}} — ממוצע WER של 7.77% על פני שמונה ערכות מבחן באנגלית ו-2.20% על LibriSpeech clean — המתאר את המודל שאינו סטרימינג, ואין לקרוא אותו כרמת הדיוק של checkpoint זה. אם החלטת הרכישה שלך זקוקה למספר שתוכל/י להגן עליו מול קולגה, רק לצד אחד בהשוואה הזו יש כזה.

מה כל אחד מחזיר מעבר לתמליל הרגיל

שני המודלים מהמרים אחרת על ההקשר, ושם השוואת התכונות נעשית מעניינת. הצעת הערך של GPT Transcribe היא רמיזות הקשר: אפשר להעביר תיאור חופשי של ההקלטה, רשימת מילות מפתח ושמות פרטיים, ורשימת שפות צפויות — ו-OpenAI מדווחת שבמדד ה-Context-Aware ASR שלה, הדיוק הסמנטי השתפר מ-41.6% ללא הקשר ל-45.2% עם הקשר. בנוסף, היא מחזירה את השפה שזוהתה. מה שהיא לא עושה הוא פילוח דוברים או חותמות זמן ברמת המילה — OpenAI מפנה למודלים נפרדים למטרות אלה — ולכן תמלול פגישה חוזר כקיר טקסט אחד בלתי מובחן, אלא אם תבנה בעצמך את שכבת הדוברים.

VibeVoice-ASR-Streaming-7B מהמר בכיוון ההפוך. כרטיס המודל שלו טוען לפלט סטרימינג עם ייחוס דובר — מי אמר מה, נפלט כשהמקטע נפתר — בנוסף למילים חמות מותאמות אישית באמצעות פרומפט הקשר (דגל ה-CLI הוא --context_info). זו התכונה ש-GPT Transcribe משמיט במפורש, וזו הסיבה ששני המודלים אינם ניתנים להחלפה עבור שמע חי עם דוברים מרובים. המשקל הנגדי הוא אימות: התכונות החסרות של GPT Transcribe הן החלטת מוצר מתועדת, בעוד שייחוס הדובר שנטען עבור VibeVoice הוא הצהרה בכרטיס המודל שאיש לא אישר בבדיקה עצמאית. שני הצדדים גם נבדלים בחותמות זמן — אף אחד מהם לא מציע חותמות זמן ברמת מילה במסלול המושווה, אם כי מודל ה-batch של משפחת VibeVoice כן מספק אותן.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

צורות מחיר ושאלת הבעלות

מבני העלויות לא יכולים להיות שונים יותר זה מזה, ואף אחד מהם אינו עדיף בבירור. {{1}}GPT Transcribe הוא API מדוד: $0.27 לשעת אודיו, ללא תשתית, ללא GPU, 25 MB לבקשה, והערבויות התפעוליות של OpenAI — המחיר על כך שאינך מריץ מודל דיבור בעצמך.{{/1}} {{2}}VibeVoice-ASR-Streaming-7B הוא $0 עבור המשקולות, אך דורש בערך 18 GB של bf16 לפני KV cache, כלומר GPU ברמה של 24 GB, קוד ההדגמה של microsoft/VibeVoice או תוסף vLLM, וניטור וקנה מידה משלך.{{/2}} {{3}}רישיון MIT הוא ההבדל ששום מחיר לדקה אינו לוכד: המשקולות הן שלך לשמור, לכוונן ולהריץ על חומרה שבשליטתך, ללא מדידה פר-מושב וללא תקרת 25 MB.{{/3}}

כיסוי השפות הוא התחום שבו שני הצדדים עמומים יותר מכפי שהקונים היו רוצים. VibeVoice-ASR-Streaming-7B מפרט בכרטיס המודל שלו 10 שפות — אנגלית, סינית, ספרדית, פורטוגזית, גרמנית, יפנית, קוריאנית, צרפתית, רוסית, איטלקית — לעומת למעלה מ-50 באצוות VibeVoice-ASR. OpenAI לא מפרסמת רשימה דומה ומאומתת של שפות עבור GPT Transcribe; בחומרי ההשקה שלה היא מדווחת על תוצאות חזקות ב-22 שפות של Common Voice, והחולשה האקוסטית שביקורת גילתה ב-Earnings22 היא תזכורת לכך ש“נתמך” ו“מתמודד עם אודיו רועש בשפה זו” הם טענות שונות. אם צורכי הכיסוי שלכם רחבים, אף אחת מהרשימות לא פותרת את העניין — בדקו את הדיאלקטים שבהם אתם משתמשים בפועל.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

השורה התחתונה: בחר לפי מסלול, לא לפי ציון.

בחרו ב-GPT Transcribe כשהאודיו הוא קובץ מוגמר, כשאתם מעוניינים בנתון דיוק מתועד עם מגבלות ידועות, או כשהבחירה שלא להריץ תשתית דיבור משלכם שווה $0.27 לשעה — ושלבו אותו עם GPT Live Transcribe רק אם אספקה בזמן אמת מצדיקה את המחיר הגבוה כמעט פי 4. בחרו ב-VibeVoice-ASR-Streaming-7B כשהמשימה חיה ורבת-דוברים, כשאתם רוצים שהתמליל יגיע בעוד השיחה עדיין נמשכת, כשפלט סטרימינג עם ייחוס לדובר הוא תכונה שאתם רוצים להעריך, או כשמשקלים פתוחים ושליטה בנתונים חשובים לכם יותר מתוצאה במבחן השוואתי.

הערה מבנית אחת לצוותים הבונים על כל אחת מהן: שכבת התמלול אינה משהו ש-OrcaRouter מנתב כיום — אף אחד ממודלי זיהוי הדיבור לטקסט בעמוד זה לא נמצא בקטלוג שלו, ולכן הבחירה במנגנון ה-ASR נותרת כולה בידכם. מה שהניתוב אכן מעניק לכם הוא השכבה שמעל התמליל. הזנת תמלול חיה שימושית רק כשמשהו פועל עליה — המסכם, כלל ההתראה, מתכנן הסוכן הקולי — וזו המחסנית שעבורה משמש OrcaRouter כשכבת חזית: API אחד על פני יותר מ-200 מודלים במחירי המחירון של הספקים, שמועברים הלאה ללא כל תוספת מחיר, ובנוסף מעבר אוטומטי לגיבוי. הדפוס שהופך צ׳קפוינט לא מוכח כמו VibeVoice-ASR-Streaming-7B לכדי אפשרות משתלמת לניסוי הוא בדיוק זה: להשאיר את נקודת הקצה שצורכת את התמלילים שלכם ניתנת להחלפה, ומודל שעדיין אין לו מדד השוואתי יכול לזכות או לאבד את התעבורה שלכם על סמך הראיות שבאודיו שלכם, במקום על סמך טענת יום ההשקה.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube