כרטיס כותרת ראשי שנוצר עבור 'VibeVoice-ASR-Streaming-1.5B נגד NVIDIA Parakeet TDT 0.6B: מתמודד MIT לא מוכח מול אלוף ה-Open ASR', עם כותרת משנה 'הברירת המחדל המוכחת מול המתמודד בן היום', עם שני כרטיסי מודל — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 בספט׳ 2026 · MIT · אין עדיין Benchmark שפורסם) ו-NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 במאי 2025 · CC-BY-4.0 · Open ASR #1 מאז מאי 2025) — ותגיות: '6.05% avg WER (Parakeet)', 'הפרש של 16 חודשים', ו-'מי אמר מה + hotwords (Microsoft, לא מאומת)'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B מול NVIDIA Parakeet TDT 0.6B: מתמודד MIT לא מוכח נגד אלופת ה-ASR הפתוחה

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אם אתם זקוקים להמרת דיבור לטקסט עם משקלים פתוחים בסביבת ייצור כיום, יש ברירת מחדל, ושמה NVIDIA Parakeet TDT 0.6B. מאז מאי 2025, דגם Parakeet TDT 0.6B v2 עם 600 מיליון הפרמטרים מחזיק במקום הראשון בלוח המובילים של Hugging Face ל-Open ASR, עם שיעור שגיאות מילים ממוצע של 6.05% – מיקום שצדדים שלישיים שחזרו במשך למעלה משנה. המתחרה החדשה ביותר שמנסה לאיים עליו היא VibeVoice-ASR-Streaming-1.5B, ש-Microsoft Research העלתה ב-2 בספטמבר 2026 – 16 חודשים אחרי Parakeet, תחת רישיון MIT, עם סיפור ייחוס דובר בסטרימינג, ועד כה אין עבורה שום נתון דיוק שפורסם. דף זה משווה בין האלופה למתחרה על סמך ראיות, ארכיטקטורה, ומה שכל אחת מהן מספקת בפועל מחוץ לקופסה.

לפני שנגיע למפרטים, שתי תוויות הן העיקר, כי הן מעצבות את כל צורת ההתמודדות. הנתונים של Parakeet קבועים: אחוז ה‑WER הממוצע של 6.05% ומספר התפוקה RTFx של ~3,386, שעומד מאחורי הטענה "שעת אודיו בשנייה בערך", כבר למעלה משנה יושבים על לוחות תוצאות ציבוריים ועל חומרים של NVIDIA. הצד של VibeVoice‑ASR‑Streaming‑1.5B בעמוד הוא מה שניתן לדעת מתוך המאגר שלו — כרטיס מודל, קבצי קונפיגורציה ומסמכי הסטרימינג של מיקרוסופט — משום שמיקרוסופט לא פרסמה בכתב נתוני WER, חביון או תפוקה, ובעת כתיבת שורות אלה לא קיים שום benchmark עצמאי של נקודת הביקורת. בכל ההשוואות שלהלן, עמודה אחת הוכחה בשטח; האחרת היא גיליון מפרטים.

שישה עשר חודשים ותקופת כהונה אחת בראש הדירוג מפרידים ביניהם

Parakeet TDT 0.6B v2 הגיע ב-5 במאי 2025 כתשובתה של NVIDIA לבעיית ה-ASR הרציף: מקודד FastConformer המחובר למפענח טרנסדיוסר אסימון-ומשך (TDT) המנבא כל אסימון ואת משכו בשלב יחיד — טריק יעילות שמסיר את תקרת האסימונים הריקים של טרנסדיוסר קונבנציונלי. הוא מופץ תחת רישיון CC-BY-4.0, ידידותי לשימוש מסחרי, וכבש את ראשות לוח התוצאות של Open ASR בזכות אחוז שגיאת מילים ממוצע של 6.05%. הוא גם הביא תכונות ייצור שלוח התוצאות אינו מודד — פיסוק, אותיות רישיות, חותמות זמן ברמת מילה — ומקודד קשב מלא שמסוגל לקלוט עד 24 דקות שמע במעבר אחד, מה שהופך אותו לשימושי לפגישות ארוכות ופודקאסטים ללא חלוקה אגרסיבית.

VibeVoice-ASR-Streaming-1.5B הוא המתמודד במובן הטהור ביותר: הוא קיים, הוא מתועד, ושום דבר לגבי מידת ההצלחה שלו לא הוכח. שורת החדשות של Microsoft ב-GitHub, מיום 3 בספטמבר, מכריזה על מודל ASR סטרימינג מאוחד ש"מתמלל ברציפות מי אמר מה בזמן שהדיבור מגיע", עם מילות חימום ועשר שפות, והקונפיג של ה-checkpoint מתאר מסורת הנדסית שונה לחלוטין — דקודר מבוסס שפה ממשפחת Qwen2 המוזן מטוקנייזרים קונבולוציוניים של אודיו, עם ראש דיפוזיה שמייצר פלט בנתחים של כ-2.9 שניות וכ-0.5 שניות של lookahead. בעוד ש-Parakeet הוא מודל דיבור ייעודי שחושל במהלך שנה של פריסות אמיתיות, VibeVoice-ASR-Streaming-1.5B הוא checkpoint ממשפחת מחקר בן יומיים.

אסימטריית הראיות היא הסיפור.

קרא את שאר הדף כשלנגד עיניך עובדה אחת: להשוואה הזו יש מספרים רק בצד אחד. בצד של Parakeet TDT 0.6B יש שנה של הגנה על המיקום בלוח הדירוג — ממוצע WER של 6.05% במערכי ה-short-form האנגליים הציבוריים של Open ASR, כ-3,386 RTFx ב-batch 128 בחומרה של NVIDIA, ומערכת אקולוגית של כלי פריסה של NeMo, האצת TensorRT וקוונטיזציית FP8, שכבר הוכיחה את עצמה בייצור. בצד של VibeVoice-ASR-Streaming-1.5B יש את איור ההערכה של כרטיס המודל, שהוא תמונה ולא טקסט, ואת ממוצע ה-WER של 7.77% על פני שמונה מערכי בדיקה באנגלית, כפי שדווח על ידי הספק בכרטיס של VibeVoice-ASR (batch) — מספר שמתאר את המודל הלא-סטרימינג ולא ניתן להעבירו ל-checkpoint הזה. ייתכן מאוד שהמתמודד מצוין; הנקודה היא ש'ייתכן מאוד' הוא כל בסיס הראיות.

בדיקת המפרט

• פרמטרים — NVIDIA Parakeet TDT 0.6B: 600M, מקודד FastConformer + מפענח TDT לעומת VibeVoice-ASR-Streaming-1.5B: כ-3B סך הכול (רשת בסיס Qwen מסוג 1.5B בתוספת טוקנייזרים וראש דיפוזיה).

• שוחרר — 5 במאי 2025 לעומת 2 בספטמבר 2026.

• דיוק — ממוצע WER של 6.05%, Open ASR במקום הראשון מאז מאי 2025, שוכפל על ידי צד שלישי לעומת אף תוצאה שפורסמה.

• מהירות — כ-3,386 RTFx ב-batch של 128 על חומרת NVIDIA, כשעה של אודיו בשנייה, לעומת היעדר נתון תפוקה שפורסם.

• סטרימינג — תומך סטרימינג עם הקשר קשב מלא (full-attention) של עד 24 דקות לכל מעבר (pass) לעומת סטרימינג מבוסס מקטעים (chunked), מקטעים של כ־2.9 שניות עם הסתכלות קדימה של כ־0.5 שניות.

פלט נוסף — פיסוק, רישיות, חותמות זמן ברמת מילה לעומת ייחוס דובר בסטרימינג (לא מאומת) ומילים חמות; עשר שפות.

• רישיון — CC-BY-4.0 לעומת MIT.

• אקוסיסטם — NVIDIA NeMo עם TensorRT ו-FP8 מול הדגמות הריפו של microsoft/VibeVoice ותוסף vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

מתחת למכסה המנוע: שני רעיונות על ייעודם של מודלי דיבור

הארכיטקטורות מגלמות שתי תפיסות שונות בדבר התפקיד. Parakeet TDT 0.6B מתייחס לתמלול כאל בעיית עיבוד אותות שנפתרת ביעילות: מקודד FastConformer מחלץ את המאפיינים האקוסטיים, ומפענח ה-TDT פולט טוקני טקסט ומשכים במשותף — וזו הסיבה שהוא רץ במהירות של אלפי מונים מזמן אמת, וזו גם הסיבה שהוא משתלב בנוחות במחסנית הפריסה של NVIDIA. VibeVoice-ASR-Streaming-1.5B, לעומת זאת, מתייחס לתמלול כאל בעיה לשונית: הוא דוחס את האודיו לזרם טוקנים, מעביר אותו למודל שפה שקרא כמות הקשר של תמליל שלם, ומניח להבנתו של מודל השפה — מי אומר מה וכיצד שיחות משתלבות זו בזו — לעשות את העבודה. שלד ה-LLM הוא גם הסיבה לכך שהצ'קפוינט כולל כ-3 מיליארד פרמטרים במקום 600 מיליון, ולכך שמיקרוסופט לא טוענת לנוכחות בקצה — זהו מודל שרוצה GPU ומשתמש בזיכרון כדי לשאת הקשר.

לתמלול חי, התוצאה המעשית היא צורת ההשהיה. מקודד תשומת־הלב המלא של Parakeet יכול לעבד חלונות זמן ארוכים במעבר יחיד, וזו פילוסופיית סטרימינג שונה מזו של VibeVoice-ASR-Streaming-1.5B, המבוססת על חוזה קבוע של גושים והבטה קדימה (chunk-and-lookahead) של כ־2.9 שניות אודיו לכל קטע שנפלט. אף אחת מהן אינה מזרימה חלקיות ברמת מילה בסגנון ממשקי ה־API המסחריים בעלי ההשהיה הנמוכה ביותר; שתיהן מערכות מבוססות־גושים, והמערכת המתאימה תלויה בשאלה אם האודיו שלך מגיע כקבצים חסומים או כסשן חי פתוח.

סיפור התכונה ושכונות הפריסה

{{1}}כשהוא יוצא מהקופסה, Parakeet TDT 0.6B הוא מוצר התמלול השלם יותר: פיסוק ואותיות רישיות כלולים בתמליל, חותמות זמן ברמת המילה משמשות לצורך יישור, וחלונות של 24 דקות במעבר יחיד משמעותם פחות שגיאות חלוקה למקטעים בהקלטות ארוכות.{{/1}} {{2}}VibeVoice-ASR-Streaming-1.5B משיב בתכונות ש-Parakeet אינו מפרט: פלט המיוחס לדובר ו-hotwords, בעשר שפות.{{/2}} {{3}}הטענה על הפרדת דוברים בסטרימינג היא בדיוק מסוג הדברים שדורשים אימות בלתי תלוי — גבולות המקטעים הם הנקודה שבה הייחוס סוטה — אבל זו הסיבה לשקול דווקא את המודל של Microsoft במקום את זה של NVIDIA אם הדרישה שלך היא לדעת מי אמר מה בפגישה חיה.{{/3}}

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

השכונות שונות זו מזו בדיוק כמו הדגמים. Parakeet TDT 0.6B הוא אזרח NeMo של NVIDIA: TensorRT, FP8 וכלי פריסה מכווננים ל-GPUs של NVIDIA, וזה מצוין אם אתה כבר על תשתית NVIDIA. VibeVoice-ASR-Streaming-1.5B שוכן במאגר מחקרי: הנתיבים המתועדים הם הדגמות Python של Microsoft ותוסף vLLM, מחלקת הארכיטקטורה שלו עדיין לא בתיעוד הציבורי של Transformers, והקמתו דורשת התקנה ממקור (from-source) ואימות משלך שנתיב הטעינה עובד. עבור צוות שמעריך פריסה מתועדת ומשעממת, ההבדל הזה לבדו יכול לגבור על פער הביצועים.

הטיעון בעד המכהן, הטיעון בעד המתמודד

הטיעון בעד NVIDIA Parakeet TDT 0.6B הוא הטיעון בעד ערך ידוע ומוכר: שנה של הגנה על מיקום בלוחות הדירוגים, שחזור על-ידי צד שלישי, רישיון מסחרי, תכונות ייצור, ומערכת אקולוגית לפריסה שכבר ספגה תעבורה אמיתית. אם אתם משיקים ברבעון הזה תכונת תמלול באנגלית ואתם רוצים משקלים פתוחים, זו ברירת המחדל שניתן להגן עליה, ונטל ההוכחה מוטל על כל דבר שטוען שהוא מחליף אותה.

הטיעון בעד VibeVoice-ASR-Streaming-1.5B צר יותר וספציפי: אתה צריך ייחוס דוברים בסטרימינג או hotwords, אתה צריך יותר מאנגלית, או שאתה מאמין שגישת מודל-השפה לדיבור תנצח ואתה רוצה להיות מוקדם. זה הימור, לא החלטה — אין עדיין מספר שמצדיק העברת תעבורת ייצור אליו, והעמדה של Microsoft עצמה היא מחקר-קודם. אף אחד מהמודלים אינו מוגש כיום דרך OrcaRouter, ולכן הדרך הזולה לבחון את ההימור היא התבנית שחלה על כל מודל פתוח צעיר: להשאיר את שכבת ה-ASR מאחורי API ניתוב יחיד שמעמיד 200+ מודלים במחיר המחירון של הספק, ללא תוספת מחיר ועם מעבר אוטומטי למקרה תקלה; לנתב נתח שמע אמיתי אל VibeVoice-ASR-Streaming-1.5B ברגע שספק יארח אותו; ולתת לתמלילים מהתעבורה שלך להכריע אם המתמודד ראוי לכתר ש-Parakeet עונד כבר שישה-עשר חודשים.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube