כרטיס הירו של מאמר עם הכיתוב 'Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B' עם התג 'השוואת מודלים' והכתובית המשנית 'שני לוחות דירוג, השוואה מטעה אחת', עם צ'יפים המציגים 2.7% WER סטרימינג, 6.32% ממוצע Open ASR, 600M פרמטרים תחת CC-BY-4.0 ו-$0.10 לשעת אצווה, על גרדיאנט מלבן לכחול עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Grok Voice Transcribe 2.0 מול NVIDIA Parakeet TDT 0.6B: שני לוחות דירוג, השוואה מטעה אחת

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

NVIDIA Parakeet TDT 0.6B הוא טרנסדיוסר FastConformer-TDT עם 600 מיליון פרמטרים, ששוחרר ב-14 באוגוסט 2025 תחת CC-BY-4.0, והוא ההמלצה כברירת מחדל לכל מי שרוצה להריץ תמלול בעצמו כבר למעלה משנה. Grok Voice Transcribe 2.0 הוא מודל דיבור-לטקסט מנוהל של SpaceXAI, שהושק ב-18 בספטמבר 2026, במחיר של $0.10 לשעת אודיו בעיבוד באצווה ו-$0.20 לשעה בזרימה, עם שיעור שגיאת מילים סופי של 2.7% בלוח הזרימה של Artificial Analysis. אם תחפשו השוואה בין השניים, תמצאו את Parakeet מצוטט ב-13.7% WER ואת Grok Voice Transcribe 2.0 ב-2.7%, מה שגורם למודל המנוהל להיראות מדויק פי חמישה וזה דבר מטעה באמת לקרוא. שני המספרים האלה מגיעים מאינדקסים שונים של Artificial Analysis, שנבנו על מערכי נתונים שונים, פורסמו בהפרש של שנים, ואחד מהם הוחלף על ידי מדידות חדשות יותר של הספק עצמו. ההשוואה האמיתית מעניינת יותר, והיא עוסקת במה ש-600 מגה-בייט של משקולות מקנה לך וש-API לא יכול.

המספר 13.7%, ולמה לא כדאי להשתמש בו

דוח מצב ה-AI של Q3 2025 של Artificial Analysis דירג את NVIDIA Parakeet TDT במקום השלישי במדד ה-AA-WER שלו עם 13.7%, אחרי Chirp 2 של Google עם 11.6% ו-Canary Qwen של NVIDIA עצמה עם 13.2%. המדד הזה היה ממוצע משוקלל לפי משך האודיו על פני כשעתיים מכל אחד מ-VoxPopuli, Earnings-22 ו-AMI-SDM — דיבור מהעולם האמיתי עם מבטאים מגוונים, אוצר מילים תחומי ותנאי ערוץ קשים, ולכן כל מספר בו גבוה. WER של 13.7% ב-AMI-SDM, שהוא אודיו פגישות משדה רחוק שהוקלט בחדרים מהדהדים, אינו תוצאה רעה; זהו מבחן קשה.

המדד הזה כבר לא קיים בצורה הזו. Artificial Analysis בנתה אותו מחדש כ-AA-WER v2, כששקלה את AA-AgentTalk ב-50% ואת VoxPopuli-Cleaned-AA ו-Earnings22-Cleaned-AA ב-25% כל אחד, כשמונה שעות אודיו בערך, והניקוי והשקלול מחדש הזיזו את המספר של כל מודל באופן משמעותי. בלוח הלא-סטרימינג הנוכחי, Parakeet TDT 0.6B V3 נמצא בספרות בודדות נמוכות — באותו טווח כמו מובילים אחרים עם משקולות פתוחות — ולא בכלל קרוב ל-13.7%, וראש הלוח ירד לסביבות 2%. כל מי שעדיין מצטט 13.7% עבור Parakeet מצטט מדידה מיושנת, ואם הוא משווה אותה לנתון סטרימינג של 2026, הוא גם משווה בין שני לוחות שונים.

מה שאפשר בכנות להעמיד זה לצד זה הוא צר יותר. ההערכה של NVIDIA עצמה על Open ASR Leaderboard — מערכי האנגלית הקצרים הסטנדרטיים והציבוריים, שהורצו בכלי העבודה של אותו לוח — מדווחת על WER ממוצע של 6.32% עבור Parakeet TDT 0.6B V3 עם RTFx של 3,332.74, ועל ממוצע של 6.05% עבור ה-v2 באנגלית בלבד. ה-2.7% של Grok Voice Transcribe 2.0 הוא נתון תמלול סופי בלוח הסטרימינג, שנמדד לאחר סיום הדיבור, על אודיו שיחה באנגלית משוקלל לפי סוכנים. מערכים שונים, לוח שונה, מצב שונה. סביר מאוד שהמודל המנוהל מדויק יותר על האודיו ששני הלוחות חולקים; גודל היתרון הזה אינו פי 5, ואף אחד לא פרסם את המדידה שתיישב את זה.

מה הצורה האמיתית של שני המודלים

ההבדל הארכיטקטוני מסביר את רוב ההבדל המעשי. Parakeet TDT 0.6B הוא מקודד FastConformer עם מפענח token-and-duration transducer — הוא חוזה גם טוקן וגם בכמה פריימים להתקדם, מה שמאפשר לו לדלג במקום לפלוט בלַנקים, וזהו המקור העיקרי ליעילות שלו. הוא מגיע עם זיהוי שפה אוטומטי ב-25 שפות אירופיות, חותמות זמן ברמת המילה והמקטע, פיסוק ואותיות רישיות, והוא מטפל באודיו ארוך — עד 24 דקות עם תשומת לב מלאה, או בסביבות שלוש שעות עם תשומת לב מקומית. הוא מוגש דרך NeMo 2.2, יש לו מסלול MLX ל-Apple Silicon, ויש גרסאות ONNX INT8 שרצות על מעבדי CPU רגילים.

Grok Voice Transcribe 2.0 הוא שירות מנוהל, כך שההשוואה היא בין מודל למוצר. מה שהמוצר כולל במחיר המחירון שלו:

• סטרימינג — Grok Voice Transcribe 2.0 נייטיבי מעל WebSocket, פלט חלקי ראשון ב-0.49 שניות לעומת הגישות המקוטעות או המאגרות של Parakeet TDT 0.6B, ללא ממשק תמלול חלקי מובנה

• הטיית מונחי מפתח — עד 100 מונחי מפתח לבקשה, לעומת זאת אין תכונה זו ב-Parakeet

• דיאריזציה — כלולה במחיר הבקשה לעומת מערכת נפרדת שאתה מוסיף בעצמך

• ערוצים — עד שמונה ערוצי אודיו בבקשה אחת לעומת זרם אחד לכל מעבר

• נרמול טקסט הפוך — כלול ב-25 שפות לעומת פיסוק ואותיות רישיות בלבד

• פריסה — נקודת קצה מנוהלת ב-us-east-1 לעומת משקולות שאתה מוריד, מריץ ומפעיל בכל מקום

• רישיון — תנאי API מסחריים לעומת CC-BY-4.0 עם ייחוס

• גודל המודל — לא נחשף לעומת כ-600 מיליון פרמטרים, בקירוב 2.4 GB ב-fp32 או 1.2 GB ב-fp16

השורה האחרונה היא זו שמכריעה הרבה פריסות. Parakeet TDT 0.6B נכנס לכמה גיגה-בייטים, פועל באופן סביר על CPU של מחשב נייד דרך מסלול INT8 ONNX, ונכנס בנוחות בכל GPU צרכני. זו אינה גרסה מוקטנת של מה שה-API עושה — זו יכולת שונה, כי זה ההבדל בין תכונת תמלול שעובדת במצב לא מקוון, על המכשיר, בלי רשת ובלי עלות לפי שעה, לבין אחת שלא.

Screenshot of the Hugging Face model page for nvidia/parakeet-tdt-0.6b-v2, showing the CC-BY-4.0 licence tag, the English language tag, the FastConformer-TDT architecture and 0.6B parameter fields, a callout reading 'NEW: Multilingual Parakeet TDT 0.6B V3 is now available! 25 European Languages', a description stating an RTFx of 3380 on the HF-Open-ASR leaderboard at batch size 128 with transcription of segments up to 24 minutes in a single pass, and a notice that no inference provider deploys it.

חשבון העלויות שאיש לא מחשב כראוי

ההשוואה שמתפרסמת היא "$0.10 לשעה לעומת חינם", והיא שגויה בשני הכיוונים — ה-API אינו הדבר היחיד שאתם משלמים עליו, והמשקלים אינם הדבר היחיד שאתם חוסכים עליו.

• תמלול באצווה — Grok Voice Transcribe 2.0 במחיר $0.10 לשעת אודיו, כ-$1.67 ל-1,000 דקות לעומת Parakeet TDT 0.6B ללא דמי רישיון בתוספת זמן GPU או CPU

• סטרימינג — $0.20 לשעת אודיו, כ-$3.33 ל-1,000 דקות, לעומת אחסון עצמי, שבו המגבלה היא תקרת המקביליות שלך ולא תעריף מפורסם

• מגבלות שירות — 10 בקשות בשנייה ו-100 סשנים של סטרימינג במקביל לכל צוות, לעומת מה שהחומרה שלך מאפשרת, ללא הגבלת קצב וללא תקרת מקביליוּת

• העלות שאינה מופיעה באף אחד מהדוחות — לא הנדסה, לא תשתית הגשה, לא סקיילינג אוטומטי לעומת תורנות הכוננות, לוגיקת הניסיונות החוזרים, עדכוני המודל וה-GPU שאתם מחממים לקראת השיא

בהיקפים קטנים הצד המנוהל הוא כמעט תמיד זול יותר, מפני שהעלות הקבועה של מסלול האירוח העצמי היא אדם. בהיקפים גדולים ויציבים הצד באירוח עצמי מנצח באופן מכריע, ונקודת ההצטלבות היא פונקציה של ניצולת ולא של נפח האודיו: GPU שאתה מחזיק עסוק הוא זול מאוד לשעת אודיו, ואילו זה שאתה מחזיק חם לשיא תעבורה אינו כך. צוות שמעבד 20,000 שעות בחודש משלם $2,000 עבור מסלול האצווה המנוהל, ובערך חודש GPU בינוני אחד בתוספת זמן הנדסה עבור זה שבאירוח עצמי, וזה לא מתקרב.

הסיבה לכך שהחישוב מתבצע בצורה גרועה היא שהצד בהתקנה עצמית מושווה בדרך כלל לאפס, והצד המנוהל מושווה בדרך כלל למחיר המחירון. אף אחד מהשניים אינו מספר אמיתי. מה שכן אמיתי הוא ש-3,332 RTFx של Parakeet TDT 0.6B — הנתון של NVIDIA, בעיבוד באצוות, על חומרת מרכז נתונים, וזה שיש להתייחס אליו כאל גבול עליון ולא כאל הבטחה — פירושו ש-GPU בודד וצנוע יכול לעבד יותר אודיו ממה שרוב הארגונים מייצרים.

היכן ש-Parakeet מפסיק להיות התשובה הנכונה

שלושה דברים דוחפים צוות לזנוח את המודל הפתוח ולעבור למודל מנוהל, ואף אחד מהם אינו דיוק.

הראשון הוא הטיית מונחי מפתח. אם התמלולים שלכם מלאים בשמות מוצרים, שמות משפחה, סימולי טיקר או ז׳רגון תחומי, מודל בלי מנגנון הטיה יטעה בהם בלי פתרון מלבד כיוונון עדין. Grok Voice Transcribe 2.0 מקבל עד 100 מונחי מפתח בכל בקשה. ל-Parakeet TDT 0.6B אין את התכונה. עבור מרכזי קשר, שירותי בריאות ועבודה משפטית, הפער הבודד הזה פוסל את הכלי ללא קשר למה שאומר כל לוח דירוג.

השני הוא דיאריזציה. Parakeet נותן לך מילים עם חותמות זמן; הוא לא אומר לך מי אמר אותן. תמלול מרובה דוברים משמעו להריץ מודל דיאריזציה נפרד וליישר את הפלט, וזה פרויקט ולא אפשרות תצורה. המודל המנוהל מחזיר טקסט עם ייחוס דובר באותה בקשה.

השלישי הוא ממשק הזרימה עצמו. Parakeet מהיר מספיק כדי שאנשים בונים עליו מערכות בזמן אמת — פיצול האודיו לקטעים, הפעלת המודל על כל קטע, והרכבת הפלט — אבל התנהגות התמלול החלקי, זיהוי סוף התור וסמנטיקת ההתחייבות הם כולם דברים שאתם כותבים ומתחזקים. Grok Voice Transcribe 2.0 מחזיר תמלול חלקי ראשון 0.49 שניות אחרי שהפסקתם לדבר, כמאפיין של המוצר.

יש גם פרט רישוי שלעתים מפתיע צוותים: Parakeet TDT 0.6B V3 מופץ תחת CC-BY-4.0, מה שמתיר שימוש מסחרי אך מחייב ייחוס, וכמה ממודלי הדיבור של NVIDIA עברו מאז לרישיון Open Model License של הספק עצמו במקום זאת. אם ייחוס מהווה בעיה עבור המוצר שלך, קרא את הכרטיס של ה-checkpoint הספציפי במקום להניח שתנאי משפחת המודלים חלים.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, diarization included, 100 key terms included, $0.10 per batch hour, managed in us-east-1. The right column gives NVIDIA Parakeet TDT 0.6B the rows: mean WER 6.32% Open ASR, speed 3,332 RTFx batched, diarization not included, no key-term biasing, CC-BY-4.0 weights where you pay compute, 600M params self-hosted anywhere. A footer reads 'Parakeet figures NVIDIA-reported on the Open ASR Leaderboard; Grok figures per Artificial Analysis.'

למה ה-API בכל זאת בדרך כלל מנצח, ומתי הוא לא צריך

הדפוס בשנה האחרונה היה עקבי: צוותים מתחילים במודל פתוח כמו Parakeet TDT 0.6B מפני שהוא חינמי וניתן לשליטה, משיקים את התכונה, ואז מגלים שהעלות השוטפת אינה ה-GPU אלא התחזוקה, ועוברים לנקודת קצה מנוהלת. גם ההגירה ההפוכה קורית, בדרך כלל כשנפח הפעילות חוצה סף שבו החיוב לפי שעה מתחיל להיראות כמו דמי שכירות על משהו שיכולת להחזיק בבעלותך.

שני הכיוונים יקרים לביצוע אם המודל מחובר ישירות לאפליקציה שלך, וזה הנימוק לשמור על נקודת הקריאה משעממת. OrcaRouter חושף יותר מ-200 מודלים מאחורי מפתח יחיד תואם OpenAI, עם מעבר אוטומטי בין ספקים במקרה של כשל ועם תוספת של 0% על מחיר המחירון של הספק, כך שפריסה באירוח עצמי ופריסה מנוהלת יכולות לשבת מאחורי אותו ממשק ולהיות מוחלפות זו בזו באמצעות מחרוזת מודל. זה חשוב יותר מהרגיל בתחום הדיבור, שבו טבלת המובילים מחליפה ידיים כל כמה שבועות, ושירות מנוהל באזור יחיד הוא תקלה באזור יחיד — נתיב המעבר בעת כשל הוא מה שמונע מתכונת תמלול להפוך לתקלת תמלול.

עבור צוותים שרוצים את התפוקה של המודל הפתוח בלי סטאק ההגשה, זו גם צורת ההחלטה: הריצו בנצ'מרק של Parakeet TDT 0.6B על האודיו שלכם, הריצו בנצ'מרק של Grok Voice Transcribe 2.0 על אותו אודיו, ותנו לזה שמנצח להמשיך לקבל את התעבורה בזמן שאתם מפסיקים להתעניין באיזה לוגו של ספק מופיע עליו.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Non-streaming filter selected, showing the WER Index (Non-streaming), Speed Factor and Price highlight cards, the 'See Streaming Benchmarks' toggle, and the Artificial Analysis Word Error Rate Index (Non-streaming) chart with Parakeet TDT 0.6B V3 appearing among the ranked model bars.

אם אתם רוצים את הגרסה בת השורה האחת: Parakeet TDT 0.6B הוא עדיין התשובה הטובה ביותר ל„לתמלל הכול, בכל מקום, בלי עלות לפי שעה, על חומרה שכבר בבעלותי”, ו-Grok Voice Transcribe 2.0 הוא התשובה ל„לתמלל בדיוק עם תוויות דובר ואוצר המילים שלי, בלי להריץ שום דבר”. הנתון של 13.7% שגורם לפער להיראות עצום הוא מדידה שהוצאה משימוש, והפער האמיתי — בין נקודה אחת לשלוש נקודות של WER באודיו חופף — קטן מספיק עד שהשאלה התפעולית היא זו שצריכה להכריע בו.