
VibeVoice-ASR-Streaming-1.5B מול NVIDIA Parakeet TDT 0.6B: מתמודד MIT לא מוכח נגד אלופת ה-ASR הפתוחה
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
אם אתם זקוקים להמרת דיבור לטקסט עם משקלים פתוחים בסביבת ייצור כיום, יש ברירת מחדל, ושמה NVIDIA Parakeet TDT 0.6B. מאז מאי 2025, דגם Parakeet TDT 0.6B v2 עם 600 מיליון הפרמטרים מחזיק במקום הראשון בלוח המובילים של Hugging Face ל-Open ASR, עם שיעור שגיאות מילים ממוצע של 6.05% – מיקום שצדדים שלישיים שחזרו במשך למעלה משנה. המתחרה החדשה ביותר שמנסה לאיים עליו היא VibeVoice-ASR-Streaming-1.5B, ש-Microsoft Research העלתה ב-2 בספטמבר 2026 – 16 חודשים אחרי Parakeet, תחת רישיון MIT, עם סיפור ייחוס דובר בסטרימינג, ועד כה אין עבורה שום נתון דיוק שפורסם. דף זה משווה בין האלופה למתחרה על סמך ראיות, ארכיטקטורה, ומה שכל אחת מהן מספקת בפועל מחוץ לקופסה.
לפני שנגיע למפרטים, שתי תוויות הן העיקר, כי הן מעצבות את כל צורת ההתמודדות. הנתונים של Parakeet קבועים: אחוז ה‑WER הממוצע של 6.05% ומספר התפוקה RTFx של ~3,386, שעומד מאחורי הטענה "שעת אודיו בשנייה בערך", כבר למעלה משנה יושבים על לוחות תוצאות ציבוריים ועל חומרים של NVIDIA. הצד של VibeVoice‑ASR‑Streaming‑1.5B בעמוד הוא מה שניתן לדעת מתוך המאגר שלו — כרטיס מודל, קבצי קונפיגורציה ומסמכי הסטרימינג של מיקרוסופט — משום שמיקרוסופט לא פרסמה בכתב נתוני WER, חביון או תפוקה, ובעת כתיבת שורות אלה לא קיים שום benchmark עצמאי של נקודת הביקורת. בכל ההשוואות שלהלן, עמודה אחת הוכחה בשטח; האחרת היא גיליון מפרטים.
שישה עשר חודשים ותקופת כהונה אחת בראש הדירוג מפרידים ביניהם
Parakeet TDT 0.6B v2 הגיע ב-5 במאי 2025 כתשובתה של NVIDIA לבעיית ה-ASR הרציף: מקודד FastConformer המחובר למפענח טרנסדיוסר אסימון-ומשך (TDT) המנבא כל אסימון ואת משכו בשלב יחיד — טריק יעילות שמסיר את תקרת האסימונים הריקים של טרנסדיוסר קונבנציונלי. הוא מופץ תחת רישיון CC-BY-4.0, ידידותי לשימוש מסחרי, וכבש את ראשות לוח התוצאות של Open ASR בזכות אחוז שגיאת מילים ממוצע של 6.05%. הוא גם הביא תכונות ייצור שלוח התוצאות אינו מודד — פיסוק, אותיות רישיות, חותמות זמן ברמת מילה — ומקודד קשב מלא שמסוגל לקלוט עד 24 דקות שמע במעבר אחד, מה שהופך אותו לשימושי לפגישות ארוכות ופודקאסטים ללא חלוקה אגרסיבית.
VibeVoice-ASR-Streaming-1.5B הוא המתמודד במובן הטהור ביותר: הוא קיים, הוא מתועד, ושום דבר לגבי מידת ההצלחה שלו לא הוכח. שורת החדשות של Microsoft ב-GitHub, מיום 3 בספטמבר, מכריזה על מודל ASR סטרימינג מאוחד ש"מתמלל ברציפות מי אמר מה בזמן שהדיבור מגיע", עם מילות חימום ועשר שפות, והקונפיג של ה-checkpoint מתאר מסורת הנדסית שונה לחלוטין — דקודר מבוסס שפה ממשפחת Qwen2 המוזן מטוקנייזרים קונבולוציוניים של אודיו, עם ראש דיפוזיה שמייצר פלט בנתחים של כ-2.9 שניות וכ-0.5 שניות של lookahead. בעוד ש-Parakeet הוא מודל דיבור ייעודי שחושל במהלך שנה של פריסות אמיתיות, VibeVoice-ASR-Streaming-1.5B הוא checkpoint ממשפחת מחקר בן יומיים.
אסימטריית הראיות היא הסיפור.
קרא את שאר הדף כשלנגד עיניך עובדה אחת: להשוואה הזו יש מספרים רק בצד אחד. בצד של Parakeet TDT 0.6B יש שנה של הגנה על המיקום בלוח הדירוג — ממוצע WER של 6.05% במערכי ה-short-form האנגליים הציבוריים של Open ASR, כ-3,386 RTFx ב-batch 128 בחומרה של NVIDIA, ומערכת אקולוגית של כלי פריסה של NeMo, האצת TensorRT וקוונטיזציית FP8, שכבר הוכיחה את עצמה בייצור. בצד של VibeVoice-ASR-Streaming-1.5B יש את איור ההערכה של כרטיס המודל, שהוא תמונה ולא טקסט, ואת ממוצע ה-WER של 7.77% על פני שמונה מערכי בדיקה באנגלית, כפי שדווח על ידי הספק בכרטיס של VibeVoice-ASR (batch) — מספר שמתאר את המודל הלא-סטרימינג ולא ניתן להעבירו ל-checkpoint הזה. ייתכן מאוד שהמתמודד מצוין; הנקודה היא ש'ייתכן מאוד' הוא כל בסיס הראיות.
בדיקת המפרט
• פרמטרים — NVIDIA Parakeet TDT 0.6B: 600M, מקודד FastConformer + מפענח TDT לעומת VibeVoice-ASR-Streaming-1.5B: כ-3B סך הכול (רשת בסיס Qwen מסוג 1.5B בתוספת טוקנייזרים וראש דיפוזיה).
• שוחרר — 5 במאי 2025 לעומת 2 בספטמבר 2026.
• דיוק — ממוצע WER של 6.05%, Open ASR במקום הראשון מאז מאי 2025, שוכפל על ידי צד שלישי לעומת אף תוצאה שפורסמה.
• מהירות — כ-3,386 RTFx ב-batch של 128 על חומרת NVIDIA, כשעה של אודיו בשנייה, לעומת היעדר נתון תפוקה שפורסם.
• סטרימינג — תומך סטרימינג עם הקשר קשב מלא (full-attention) של עד 24 דקות לכל מעבר (pass) לעומת סטרימינג מבוסס מקטעים (chunked), מקטעים של כ־2.9 שניות עם הסתכלות קדימה של כ־0.5 שניות.
פלט נוסף — פיסוק, רישיות, חותמות זמן ברמת מילה לעומת ייחוס דובר בסטרימינג (לא מאומת) ומילים חמות; עשר שפות.
• רישיון — CC-BY-4.0 לעומת MIT.
• אקוסיסטם — NVIDIA NeMo עם TensorRT ו-FP8 מול הדגמות הריפו של microsoft/VibeVoice ותוסף vLLM.


מתחת למכסה המנוע: שני רעיונות על ייעודם של מודלי דיבור
הארכיטקטורות מגלמות שתי תפיסות שונות בדבר התפקיד. Parakeet TDT 0.6B מתייחס לתמלול כאל בעיית עיבוד אותות שנפתרת ביעילות: מקודד FastConformer מחלץ את המאפיינים האקוסטיים, ומפענח ה-TDT פולט טוקני טקסט ומשכים במשותף — וזו הסיבה שהוא רץ במהירות של אלפי מונים מזמן אמת, וזו גם הסיבה שהוא משתלב בנוחות במחסנית הפריסה של NVIDIA. VibeVoice-ASR-Streaming-1.5B, לעומת זאת, מתייחס לתמלול כאל בעיה לשונית: הוא דוחס את האודיו לזרם טוקנים, מעביר אותו למודל שפה שקרא כמות הקשר של תמליל שלם, ומניח להבנתו של מודל השפה — מי אומר מה וכיצד שיחות משתלבות זו בזו — לעשות את העבודה. שלד ה-LLM הוא גם הסיבה לכך שהצ'קפוינט כולל כ-3 מיליארד פרמטרים במקום 600 מיליון, ולכך שמיקרוסופט לא טוענת לנוכחות בקצה — זהו מודל שרוצה GPU ומשתמש בזיכרון כדי לשאת הקשר.
לתמלול חי, התוצאה המעשית היא צורת ההשהיה. מקודד תשומת־הלב המלא של Parakeet יכול לעבד חלונות זמן ארוכים במעבר יחיד, וזו פילוסופיית סטרימינג שונה מזו של VibeVoice-ASR-Streaming-1.5B, המבוססת על חוזה קבוע של גושים והבטה קדימה (chunk-and-lookahead) של כ־2.9 שניות אודיו לכל קטע שנפלט. אף אחת מהן אינה מזרימה חלקיות ברמת מילה בסגנון ממשקי ה־API המסחריים בעלי ההשהיה הנמוכה ביותר; שתיהן מערכות מבוססות־גושים, והמערכת המתאימה תלויה בשאלה אם האודיו שלך מגיע כקבצים חסומים או כסשן חי פתוח.
סיפור התכונה ושכונות הפריסה
{{1}}כשהוא יוצא מהקופסה, Parakeet TDT 0.6B הוא מוצר התמלול השלם יותר: פיסוק ואותיות רישיות כלולים בתמליל, חותמות זמן ברמת המילה משמשות לצורך יישור, וחלונות של 24 דקות במעבר יחיד משמעותם פחות שגיאות חלוקה למקטעים בהקלטות ארוכות.{{/1}} {{2}}VibeVoice-ASR-Streaming-1.5B משיב בתכונות ש-Parakeet אינו מפרט: פלט המיוחס לדובר ו-hotwords, בעשר שפות.{{/2}} {{3}}הטענה על הפרדת דוברים בסטרימינג היא בדיוק מסוג הדברים שדורשים אימות בלתי תלוי — גבולות המקטעים הם הנקודה שבה הייחוס סוטה — אבל זו הסיבה לשקול דווקא את המודל של Microsoft במקום את זה של NVIDIA אם הדרישה שלך היא לדעת מי אמר מה בפגישה חיה.{{/3}}

השכונות שונות זו מזו בדיוק כמו הדגמים. Parakeet TDT 0.6B הוא אזרח NeMo של NVIDIA: TensorRT, FP8 וכלי פריסה מכווננים ל-GPUs של NVIDIA, וזה מצוין אם אתה כבר על תשתית NVIDIA. VibeVoice-ASR-Streaming-1.5B שוכן במאגר מחקרי: הנתיבים המתועדים הם הדגמות Python של Microsoft ותוסף vLLM, מחלקת הארכיטקטורה שלו עדיין לא בתיעוד הציבורי של Transformers, והקמתו דורשת התקנה ממקור (from-source) ואימות משלך שנתיב הטעינה עובד. עבור צוות שמעריך פריסה מתועדת ומשעממת, ההבדל הזה לבדו יכול לגבור על פער הביצועים.
הטיעון בעד המכהן, הטיעון בעד המתמודד
הטיעון בעד NVIDIA Parakeet TDT 0.6B הוא הטיעון בעד ערך ידוע ומוכר: שנה של הגנה על מיקום בלוחות הדירוגים, שחזור על-ידי צד שלישי, רישיון מסחרי, תכונות ייצור, ומערכת אקולוגית לפריסה שכבר ספגה תעבורה אמיתית. אם אתם משיקים ברבעון הזה תכונת תמלול באנגלית ואתם רוצים משקלים פתוחים, זו ברירת המחדל שניתן להגן עליה, ונטל ההוכחה מוטל על כל דבר שטוען שהוא מחליף אותה.
הטיעון בעד VibeVoice-ASR-Streaming-1.5B צר יותר וספציפי: אתה צריך ייחוס דוברים בסטרימינג או hotwords, אתה צריך יותר מאנגלית, או שאתה מאמין שגישת מודל-השפה לדיבור תנצח ואתה רוצה להיות מוקדם. זה הימור, לא החלטה — אין עדיין מספר שמצדיק העברת תעבורת ייצור אליו, והעמדה של Microsoft עצמה היא מחקר-קודם. אף אחד מהמודלים אינו מוגש כיום דרך OrcaRouter, ולכן הדרך הזולה לבחון את ההימור היא התבנית שחלה על כל מודל פתוח צעיר: להשאיר את שכבת ה-ASR מאחורי API ניתוב יחיד שמעמיד 200+ מודלים במחיר המחירון של הספק, ללא תוספת מחיר ועם מעבר אוטומטי למקרה תקלה; לנתב נתח שמע אמיתי אל VibeVoice-ASR-Streaming-1.5B ברגע שספק יארח אותו; ולתת לתמלילים מהתעבורה שלך להכריע אם המתמודד ראוי לכתר ש-Parakeet עונד כבר שישה-עשר חודשים.
