כרטיס מאמר ראשי עם הכיתוב 'Grok Voice Transcribe 2.0', עם התג 'חדשות' והכתובית 'משבצת הדיוק מספר 1 בזרימה, במחיר שלא השתנה', עם צ'יפים המציינים 2.7% WER תמלול סופי, 3.4% תוצאה חלקית ראשונה, 0.49 שניות לאחר סיום הדיבור ו-$0.20 לשעת זרימה, על גבי גרדיאנט מלבן לכחול עם לוגו OrcaRouter בפינה הימנית התחתונה.
Engineering & Research

Grok Voice Transcribe 2.0 תופס את המקום הראשון בקטגוריית דיוק הזרמה במחיר ללא שינוי

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Grok Voice Transcribe 2.0 הוא מודל התמלול מדיבור לטקסט ש-SpaceXAI השיקה ב-18 בספטמבר 2026, והמספר היחיד שחשוב לגביו אינו זה שפוסט ההשקה פותח בו. הוא זה: התמלול החלקי הראשון — הטקסט שסוכן קולי באמת יכול לפעול לפיו בזמן שעדיין מדברים מעל הקורא — ירד משיעור שגיאות מילים של 18.3% ב-Grok Voice Transcribe 1.0 ל-3.4%. זהו המדד בלוח AA-WER Streaming של Artificial Analysis, שבו המודל החדש נמצא כעת ראשון גם בדירוג התמלול הסופי (2.7% WER, 0.49 שניות לאחר סוף הדיבור) וגם בדירוג התמלול החלקי הראשון (3.4%, 0.49 שניות). גם דיוק התמלול הסופי השתפר, מ-3.9% ל-2.7%, שזה אמיתי אך צנוע. הזינוק בתמלול החלקי הוא זה שמשנה את מה שאפשר לבנות.

מה בעצם השתנה בין 1.0 ל-2.0

שתי הגרסאות הן אותו מוצר באותו API, ו-SpaceXAI לא ביצעה שינויים בממשק: Grok Voice Transcribe 2.0 נבחרת על ידי העברת grok-voice-transcribe-2.0אל /v1/sttבמקום grok-voice-transcribe-1.0, או על ידי בחירה בו כאשר חיבור ה-WebSocket נוצר עבור סטרימינג. אינטגרציות קיימות שמשמיטות את פרמטר המודל ממשיכות לקבל 1.0 עד ש-SpaceXAI תהפוך את ברירת המחדל, שלדברי החברה יקרה בשבועות הקרובים לצד הוצאת הגרסה הישנה משימוש. עד אז 2.0 היא אופציונלית וניתן להצמיד את 1.0 במכוון, שזו הצורה הנכונה לשינוי כזה: אפשר לבצע עליה A/B באודיו שלכם לפני שהיא הופכת לברירת המחדל שלכם בפרודקשן, בין אם ביקשתם ובין אם לא.

המספרים של Artificial Analysis, כאשר קוראים אותם זה לצד זה, מספרים סיפור ספציפי יותר מאשר "מדויק פי שניים":

• דיוק תמלול סופי — Grok Voice Transcribe 2.0 בשיעור WER של 2.7% לעומת Grok Voice Transcribe 1.0 בשיעור WER של 3.9% ב-AA-WER Streaming, שניהם נמדדו לאחר סיום הדיבור

• דיוק תמלול חלקי ראשון — 3.4% WER לעומת 18.3%, הפער הבודד הגדול ביותר בין שתי הגרסאות

• זמן עד לתמלול סופי — 0.49s לעומת 0.37s, כך שהמודל החדש איטי יותר להתחייב מזה שהוא מחליף

• זמן עד לתשובה חלקית ראשונה — 0.49s לעומת 0.25s, וגם איטי יותר

• דיוק במצב אצווה (לא-סטרימינג) — 2.3% AA-WER בלוח הלא-סטרימינג של Artificial Analysis, לעומת 4.07% עבור Whisper Large v3 ו-3.31% עבור GPT Transcribe

• תפוקת אצווה — בערך פי 162 מזמן אמת על אותו לוח, מאחורי ה-333× של MAI-Transcribe-2 ומקדים את ה-88× של Gemini 3.5 Transcribe

השורה הרביעית והחמישית הן ההסתייגות הכנה בגרסה הזו. SpaceXAI קנתה דיוק במחיר השהיה. המודל החדש איטי בכשליש שנייה בערך בהחזרת התוצאה החלקית הראשונה והתמלול הסופי שלו לעומת 1.0. בלוח שבו Deepgram Flux מחזיר תוצאה חלקית תוך 0.02 שניות ו-Soniox v5 תוך 0.05, Grok Voice Transcribe 2.0 בכלל לא מתחרה במהירות — הוא מתחרה בדיוק, והוא מנצח בחילוף הזה בפער עצום. האם זהו החילוף הנכון תלוי לחלוטין בשאלה אם האפליקציה שלך היא סוכן קולי חי שצריך להתחיל לדבר בחזרה, או צינור תמלול שבו חצי שנייה היא בלתי נראית.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

הטענה בדבר "פי שניים יותר מדויק", נבדקה

הכותרת של SpaceXAI היא ש-2.0 מדויקת פי שניים מ-1.0 באותו מחיר, וטבלת ההערכה שלה עצמה תומכת בכך בקבוצות שהיא בחרה. בשיחות תמיכת לקוחות באנגלית ב-8 kHz, שיעור שגיאת המילים ירד מ-10.6% ל-7.1%. בשיחות עם Grok, מ-8.7% ל-3.3%. בפרטי זיהוי מדוברים — קודי חשבון, מספרי טלפון, כתובות דוא"ל — מ-7.2% ל-3.2%. בפקודות קצרות ב-19 שפות, מ-20.6% ל-6.8%, הפחתה של כשני שלישים בשגיאות. ארבע הקבוצות הללו נלקחו מתעבורת הייצור של SpaceXAI וההשוואות הן של SpaceXAI עצמה; איש מחוץ לחברה לא שחזר אותן. התייחסו לטבלה כמפה של היכן שהמודל כוונן, ולא כהבטחת דיוק כללית.

התוצאה של Artificial Analysis היא החלק שאינו מדווח על ידי הספק: מערכת בדיקה עצמאית שהורצה על כשמונה שעות אודיו, משוקללות 50% לסט הפרטי AA-AgentTalk ו-25% כל אחת ל-VoxPopuli ול-Earnings22. היא תומכת בטענה צרה יותר ושימושית יותר מאשר "מדויק פי שניים" — כי על התערובת הספציפית הזו, המודל הזה הוא מתמלל הזרימה המדויק ביותר שנמדד. עיקול אחד שראוי לציין: הפוסט של SpaceXAI מתאר מקום ראשון "בין 32 מודלים של זרימה", בעוד שדף לוח התוצאות עצמו מציג 27 מתוך 33 מודלים. הדירוג אמיתי; גודל השדה בחומר השיווקי הוא הספירה של החברה, לא של לוח התוצאות.

כדאי גם לדייק לגבי מה שמקום ראשון ב-AA-WER Streaming מכסה ומה הוא אינו מכסה. הלוח מוטה לאנגלית ועמוס בדיבור של סוכנים. הוא אינו מודד את המבטא שלך, את הקודק שלך, את אוצר המילים בתחום שלך, או את האודיו בעל שמונה הערוצים של מוקד טלפוני. מודל שמגיע לראשו עדיין יכול להיכשל קשות בהקלטות שלך, וזו בדיוק הסיבה שחלון ההצטרפות חשוב.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

התמחור לא השתנה, וזו העובדה השנייה בגודלה כאן.

Grok Voice Transcribe 2.0 עולה כמו 1.0:‏ $0.10 לשעת אודיו עבור batch וקבצים מוקלטים דרך נקודת הקצה REST,‏ $0.20 לשעת אודיו עבור streaming דרך ה-WebSocket. בלוח המחירים של Artificial Analysis, ה-SKU של ה-streaming עומד על $3.33 ל-1,000 דקות וה-SKU של ה-batch על $1.67 — אותו תעריף batch שגובה Microsoft עבור MAI-Transcribe-2, וכשליש בערך ממה שעולה ElevenLabs Scribe v2 Realtime לדקת streaming.

דיאריזציה, חותמות זמן ברמת המילה עם ציוני ביטחון, והטיה לפי מונחי מפתח — כולם כלולים בתעריף הזה במקום להיות מחויבים בנפרד לפי מדידה, מה שאינו מקובל באופן גורף בשוק הזה. Gemini 3.5 Transcribe Live מחייב לפי טוקן הן על קלט אודיו והן על פלט טקסט, כך שהעלות שלך נעה עם כמות הטקסט שהמודל מייצר, ולא רק עם משך האודיו שרץ. תעריף אחיד לפי שעה קל יותר לתחזית וקל יותר להשוואה בין ספקים — ומכיוון ש-OrcaRouter מעביר את מחירי המחירון של הספקים הלאה עם 0% תוספת, שינוי בתעריף מצד הספק יופיע אצלנו באותו היום ולא אחרי מחזור תמחור מחדש.

מה שה-API באמת נותן לך

רשימת היכולות רחבה, והיא מורכבת ברובה מיכולות שעברו בירושה ולא מיכולות חדשות — דבר שכדאי לדעת אם מעריכים את השדרוג לפי תכונות בלבד:

• עיבוד באצוות ובזרימה במודל אחד — REST עבור קבצים מוקלטים עד 500 MB, WebSocket בכתובת wss://api.x.ai/v1/stt עם תוצאות ביניים הנפלטות בערך כל 500 מ"ש

• דיאריזציה של דוברים כלולה, בתוספת תמלול רב-ערוצי של עד 8 ערוצים בלתי תלויים

• חותמות זמן ברמת המילה הנושאות ציוני ביטחון, כך שתוכלו להחיל סף על מקטעים בעלי ביטחון נמוך במקום לתת אמון שווה בכל התמלול

• הטיית מונחי מפתח של עד 100 מונחי תחום לכל בקשה, כל אחד באורך של עד 50 תווים

• נרמול טקסט הפוך עבור מספרים, תאריכים, מטבעות, מספרי טלפון וכתובות דוא"ל, עם עיצוב בצורה כתובה הנתמך ב-25 שפות

• הסרת מילות מילוי וזיהוי סוף־תור של Smart Turn, המכוונים היישר לסוכני קול

זיהוי שפה אוטומטי עם החלפת שפה במהלך ההקלטה במעבר אחד, על פני 12 פורמטי אודיו וקצבי דגימה מ-8 kHz עד 48 kHz

• מגבלות שירות של 10 בקשות בשנייה הן ב-REST והן בסטרימינג, ו-100 הפעלות סטרימינג במקביל לכל צוות, כאשר השירות מתארח ב-us-east-1

ההערה היחידה לגבי הייצור שאינה ברשימת התכונות: השירות פועל באזור יחיד. אם האודיו שלך מקורו מחוץ לארצות הברית, קטע הרשת הוא כעת חלק מתקציב זמן האחזור שלך, ו-AA-WER Streaming מכניס במפורש השהיית רשת לתוך התזמון שלו. SpaceXAI מציעה תנאי אפס שמירת נתונים ומציינת SOC 2 Type II, BAAs ואפשרויות EU data residency, כך שסיפור התאימות מפותח יותר מהסיפור הגיאוגרפי.

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

מי צריך לזוז, ומה כדאי לראות

אם אתם כבר משתמשים ב-Grok Voice Transcribe 1.0 והאפליקציה שלכם פועלת על תמלולים חלקיים — זיהוי תור, קטיעת דיבור, תגובות סוכנים בזמן אמת — פער הדיוק בתמלולים חלקיים מ-18.3% ל-3.4% גדול מספיק כך שבדיקת 2.0 אינה אופציונלית. המעבר של המספר הזה מ״בדרך כלל שגוי״ ל״בדרך כלל נכון״ הוא ההבדל בין תמלול חלקי שאפשר לבצע ניתוב על סמכו לבין כזה שאפשר רק להציג. אם האפליקציה שלכם ממתינה לתמלולים סופיים בקבצים מוקלטים, השיפור אמיתי אך קטן יותר, ותוספת של 0.12 שניות להשהיית ה-commit היא המחיר שלו.

אם אתם נמצאים אצל ספק אחר לגמרי, הסיבה להסתכל על המהדורה הזו אינה דירוג טבלת המובילים — אלא שמעבדת חזית שיפרה זה עתה את מודל התמלול שלה בפער עצום מבלי להעלות את המחיר, וכך נראה שוק כאשר דיוק מפסיק להיות הדבר שעבורו גובים כסף. נתיב השדרוג הוא גם מהסוג הזול ביותר: פרמטר אחד, בלי שינוי בקוד, בלי חוזה חדש, ואפשרות להצמיד גרסה אם משהו משתבש.

הדבר הבא שכדאי לעקוב אחריו הוא החלפת ברירת המחדל. כאשר SpaceXAI הופכת את 2.0 לברירת מחדל ומתחילה להוציא את 1.0 משימוש, כל אינטגרציה שלא העבירה מעולם פרמטר מודל תעבור למודל החדש בבת אחת, כולל השינוי בהשהיה. צוותים שתלויים בתזמון החלקי הישן של 0.25 שניות צריכים להצמיד גרסה עכשיו, במקום לגלות את השינוי בפרודקשן. הדבר השני שכדאי לעקוב אחריו הוא שחזור בלתי תלוי: הרשומה של Artificial Analysis היא מדידה אמיתית, אבל זה לוח אחד על מיקס אודיו אחד, ואף צד שלישי עדיין לא פרסם הרצת השוואה זהה של 1.0 מול 2.0 על אודיו בפרודקשן.