כרטיס הירו של מאמר המציג 'Grok Voice Transcribe 2.0 לעומת GPT Transcribe' עם תג 'השוואת מודלים' וכותרת משנה 'אותו מחיר סטרימינג, דיוק שונה', עם צ'יפים המציגים 2.7% לעומת 3.9% WER סטרימינג, 3.4% לעומת 6.3% חלקי ראשון, $1.67 לעומת $4.50 ל-1,000 דקות ו-162x לעומת 41x בזמן אמת, מעל גרדיאנט מלבן לכחול עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Grok Voice Transcribe 2.0 לעומת GPT Transcribe: אותו מחיר סטרימינג, דיוק שונה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הצירוף מקרים כמעט נוח מדי. בלוח ה-AA-WER Streaming של Artificial Analysis, Grok Voice Transcribe 2.0 ו-GPT Live Transcribe — נקודת הקצה לתמלול בזרימה — שניהם רשומים במחיר של בדיוק $3.33 לכל 1,000 דקות אודיו. Grok Voice Transcribe 2.0 של SpaceXAI, שיצא ב-18 בספטמבר 2026, מחזיר תמלול סופי בשיעור שגיאות מילים של 2.7%, 0.49 שניות לאחר סיום הדיבור, ותמלול חלקי ראשון בשיעור שגיאה של 3.4%. GPT Live Transcribe, שיצא לצד GPT Transcribe ב-28 ביולי 2026, מחזיר תמלול סופי בשיעור שגיאה של 3.9% ותמלול חלקי ראשון בשיעור שגיאה של 6.3%. אותו מחיר, ובערך 1.2 נקודות דיוק בתמלול הסופי בתוספת 2.9 נקודות דיוק בתמלול החלקי לטובת SpaceXAI. הצד האצוותי של אותה התמודדות הוא בכלל לא צירוף מקרים: GPT Transcribe עולה $4.50 לכל 1,000 דקות לעומת $1.67 של Grok Voice Transcribe 2.0, פער של 63% במסלול הקבצים המוקלטים.

שני הימורים שונים על האופן שבו התמלול משתפר

התשובה של OpenAI לדיוק היא הקשר. גם GPT Transcribe וגם GPT Live Transcribe מקבלים פרומפטים חופשיים, רשימות מילות מפתח ורשימות שפות צפויות, ובהפעלות Realtime הסבבים שתומללו קודם מוזנים חזרה כהקשר עבור הסבבים המאוחרים יותר. במדד Context Aware ASR של OpenAI עצמה, ההתניה הזו העלתה את הדיוק הסמנטי של GPT Live Transcribe מ-38.5% ל-44.6% — נתון שדווח על ידי הספק, והוא מודד אם המשמעות שרדה ולא אם המילים היו נכונות. העסקה ש-OpenAI מציעה היא מפורשת: תנו למודל מידע על מה שהוא עומד לשמוע, והוא יתמלל את התחום שלכם טוב יותר ממודל כללי בעל אותו דיוק גולמי.

התשובה של SpaceXAI היא המודל עצמו. ל-Grok Voice Transcribe 2.0 אכן יש מנגנון הטיה — עד 100 מונחי מפתח לבקשה, כל אחד באורך של עד 50 תווים — אבל זו רשימת אוצר מילים, לא פרומפט. אפשר לומר לו ש"OrcaRouter" ו"Kubernetes" הם מילים אמיתיות; אי אפשר למסור לו פסקה שמסבירה שזו שיחת תמיכה בנוגע להחזר כספי. השיפור בדיוק ב-2.0 מגיע במקום זאת מאימון מחדש: על מערכי הערכה שנגזרו מסביבת הייצור של SpaceXAI עצמה, שיעור שגיאות המילים ירד מ-8.7% ל-3.3% באודיו של שיחה, מ-10.6% ל-7.1% בטלפוניה של 8 kHz, מ-7.2% ל-3.2% בפרטי זיהוי מדוברים, ומ-20.6% ל-6.8% בפקודות קצרות ב-19 שפות. אלה המספרים של החברה על האודיו של החברה, שלא שוחזרו על ידי איש מחוץ לחברה, והם מתארים מודל שהשתפר בבעיה האקוסטית ולא כזה שהשתפר בכך שאומרים לו למה לצפות.

ההבדל המעשי מתגלה בשעה השנייה של העבודה. מודל מותנה-הקשר יכול להיות טוב באופן דרמטי ממה שמרמז המדד הגולמי שלו, משום שסיפקתם את אוצר המילים ואת התחום. הוא גם יכול להזות את מילות המפתח שסיפקתם: הכניסו את "OrcaRouter" לפרומפט, ומודל שלא שומע את המילה בבירור עשוי בכל זאת להפיק אותה. מודל מוטה למונחי מפתח מתדרדר בחן רב יותר, משום שההטיה מזיזה את ההסתברות של מונח במקום לקבוע שהוא נוכח. אף אחד משני מצבי הכשל אינו מופיע בלוח דירוג, ושניהם יופיעו ביומנים שלכם.

המספרים, זה לצד זה

• דיוק תמלול סופי (סטרימינג) — Grok Voice Transcribe 2.0 ב-2.7% WER לעומת GPT Live Transcribe ב-3.9% ב-AA-WER Streaming, שניהם לפי Artificial Analysis

• דיוק חלקי ראשון (בסטרימינג) — 3.4% לעומת 6.3%, הפער הרחב ביותר בהשוואה וזה שמכריע את התנהגות סוכן קולי

• זמן עד לתמלול סופי — 0.49 שניות לעומת 0.81 שניות לאחר סיום הדיבור, כך שהמודל המדויק יותר הוא גם המהיר יותר להתחייב

• זמן עד לתוצאה חלקית ראשונה — 0.49 שניות מול 0.26 שניות, עמודת השהיה היחידה שבה OpenAI מנצחת באופן מוחלט

• מחיר סטרימינג — 3.33 דולר ל-1,000 דקות עבור שניהם, מנורמל על ידי Artificial Analysis מתוך 0.20 דולר לשעה של Grok ו-0.017 דולר לדקה של OpenAI

• דיוק אצווה (לא בזרימה) — Grok Voice Transcribe 2.0 ב-2.3% AA-WER לעומת GPT Transcribe ב-3.31%

• מחיר אצווה — $1.67 לכל 1,000 דקות לעומת $4.50 לכל 1,000 דקות, החל מ-$0.10 לשעה לעומת $0.0045 לדקה

• תפוקת אצווה — פי 162 בקירוב מזמן אמת לעומת פי 41 בקירוב על אותו לוח

קרא את הרשימה הזו כשתי עמודות ולא כפסיקה אחת. OpenAI זוכה בהשהיית החלקי הראשון בפער ברור ומציעה מנגנון הקשר שאין ל-Grok. SpaceXAI זוכה בדיוק הסופי בשני המצבים, בדיוק החלקי בזרימה, בתפוקה, ובמחיר האצווה בפער גדול. אין עמודה שבה GPT Live Transcribe גם מהיר יותר וגם מדויק יותר מ-Grok Voice Transcribe 2.0; יש עמודה אחת שבה הוא מהיר יותר, והיא המוקדמת ביותר.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

באיזה נתיב אצווה אתה נמצא בפועל

הפער בין $1.67 ל-$4.50 הוא המספר הפחות מעורפל כאן, וכדאי לדייק לגבי הסיבה לקיומו. OpenAI תמחרה מחדש את קו המוצרים הזה כלפי מטה ב-25% כאשר השיקה את GPT Transcribe, מעידן GPT-4o Transcribe, והתוצאה הייתה $0.0045 לדקה. SpaceXAI השאירה את תעריף האצווה שלה ללא שינוי על $0.10 לשעה כשעברה מגרסה 1.0 ל-2.0 — היא שיפרה את המודל וחייבה אותו סכום, דבר שקשה יותר לעשות ואות טוב יותר לגבי לאן השוק הולך. MAI-Transcribe-2 של Microsoft הגיע לאותו $0.10 לשעה בדיוק כהצעה לזמן מוגבל, כך שנקודת $1.67 ל-1,000 דקות הפכה לרצפת מעבדות החזית לתמלול באצווה, ולא למספר שיווקי של ספק אחד.

בעשרת אלפי שעות אודיו בחודש, הפער הזה הוא בערך 2,830 דולר לעומת 450 דולר. עבור ארכיון פודקאסטים, צבר הקלטות שיחות, או ספריית מדיה שעוברת תמלול רטרואקטיבי, הבדל המחיר מגמד כל הבדל בדיוק בין 2.3% ל-3.31% WER. עבור סוכן סטרימינג, שבו שני המוצרים עולים אותו דבר, דיוק והשהיה הם הדברים היחידים שנותרו להתווכח עליהם.

יש הבדל מבני מאחורי התעריפים האלה שראוי לתת לו שם: Grok Voice Transcribe 2.0 מחייב בתעריף אחיד לשעת אודיו, ו-GPT Live Transcribe מחייב לפי דקה, אבל Gemini 3.5 Transcribe Live מחייב לפי טוקן גם על קלט אודיו וגם על פלט טקסט. רק אחד מהשלושה הופך את החשבון שלך לפונקציה של מה שהמודל בוחר לומר. אם הנפח שלך גדול מספיק כך שחיזוי חשוב, קל יותר להצדיק את התעריפים האחידים בפני מי שחותם על החשבונית — ובגלל ש-OrcaRouter מעביר הלאה את מחירי המחירון של הספקים עם 0% תוספת, קיצוץ מצד הספק כמו 25% של OpenAI יהיה פעיל אצלנו באותו יום שבו הוא מוכרז, לא בחידוש הבא.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

מה שאף אחד משני המודלים אינו

GPT Transcribe ו-GPT Live Transcribe הם שני מוצרים, לא מוצר אחד עם מתג. מודל האצווה מטפל בקבצים שהושלמו, בתמלולים של קבצים בזרימה, ובתורות מאושרות בסשנים של Realtime, ומעבד אודיו בערך פי 34 מהר יותר מאשר בזמן אמת לפי הנתון של OpenAI עצמה — Artificial Analysis מודדת פי 41 בהרנס שלה. מודל הזרימה הוא היקר יותר, ב-0.017 דולר לדקה, וזה ששיעור השגיאות שלו בתמלולים חלקיים גדול פי 10. לבחור ב-OpenAI פירושו לבחור איזו משתי הבעיות האלה יש לך, כי נקודת הקצה הזולה יותר לא יכולה לעשות את העבודה של האחרת.

Grok Voice Transcribe 2.0 הוא מודל אחד עם שני ערוצי העברה: אותם משקלים משרתים את /v1/stt דרך REST עבור קבצים עד 500 MB ואת wss://api.x.ai/v1/stt דרך WebSocket עבור אודיו חי, כאשר תוצאות ביניים נפלטות בערך כל 500 אלפיות שנייה. קצב הזרימה הוא בדיוק כפול מקצב האצווה ולא מוצר מהונדס בנפרד, מה שאומר שהדיוק שאתם מודדים באודיו הארכיוני שלכם הוא הדיוק שכדאי לצפות לו בשידור חי. זה גם אומר שאין מודל שני להעריך — סט אחד של פרומפטים, סט אחד של מונחי מפתח, סט אחד של ציפיות.

השוויון בתכונות קרוב אך אינו זהה. שניהם מחזירים חותמות זמן ברמת המילה; Grok Voice Transcribe 2.0 מצרף ציון ביטחון לכל מילה, מה שמאפשר לך להחיל סף על מקטעים בעלי ביטחון נמוך במקום לתת אמון שווה בכל התמלול. שניהם מבצעים דיאריזציה של דוברים, וזו של Grok כלולה ללא עלות נוספת. שניהם מטפלים בנרמול טקסט הפוך עבור מספרים, תאריכים, מטבעות ופרטי קשר. Grok Voice Transcribe 2.0 מוסיף תמלול רב-ערוצי על פני עד 8 ערוצים בלתי תלויים, הסרת מילות מילוי, וזיהוי סוף-תור Smart Turn; התוספות הייחודיות של GPT Transcribe הן התניית הקשר ברמת הפרומפט, ובצד ה-Realtime – העברה אוטומטית של תורות קודמים. OpenAI לא פרסמה מספר שפות נתמכות עבור אף אחד מהמודלים; Grok Voice Transcribe 2.0 מתעד עשרות שפות עם החלפה תוך כדי הקלטה ועיצוב בצורה כתובה ב-25 מהן.

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

איך להחליט, ואיך לבדוק את זה

אם אתה בונה סוכן קולי שצריך להגיב לפני שהמתקשר מסיים, עמודת התמלול החלקי היא משתנה ההחלטה שלך, והיא מפרידה בין שני המודלים בצורה נקייה: Grok Voice Transcribe 2.0 מדויק ב-2.9 נקודות יותר בתמלולים חלקיים אך איטי ב-0.23 שניות בהפקתם. בחר ב-SpaceXAI אם תמלול חלקי שגוי גרוע יותר מתמלול חלקי מאוחר — ניתוב, הסלמה ותגובות שמופעלות מדרישות ציות. בחר ב-OpenAI אם תמלול חלקי מאוחר גרוע יותר מתמלול חלקי שגוי, ואם יש לך אוצר המילים התחומי כדי להזין את מנגנון ההקשר כך שפער הדיוק יצטמצם. ואז מדוד את שניהם, כי ההתנהגות של תמלול חלקי אצל אף אחד מהספקים על שמונה שעות של דיבור סוכנים באנגלית לא מנבאת מה כל אחד מהם יעשה עם המבטא שלך, הקודק שלך והז'רגון שלך.

אם אתה מתמלל קבצים, ההחלטה הרבה יותר קלה: $1.67 מול $4.50 לכל 1,000 דקות ו-2.3% מול 3.31% WER, ושניהם מצביעים לאותו כיוון. הסיבה היחידה להישאר עם GPT Transcribe לעבודת אצווה היא אם מנגנון ההתניה ההקשרית עושה משהו לאודיו שלך שפער הדיוק הגולמי לא יכול לקזז — וזו אפשרות ממשית בהקלטות ספציפיות מאוד לתחום, ואחת שניתנת לבדיקה.

אף אחד משני מודלי התמלול לא נמצא היום בקטלוג של OrcaRouter, כך שהקריאות עצמן הולכות ל-API של הספק. מה שכן עומד מאחורי מפתח OrcaRouter אחד הוא כל מה שהתמלול מזין: מודל הסוכן, המסכם, המסווג, הקוד שמחליט מה לעשות עם הטקסט. שם בדרך כלל מופיע החוזה השני — ספק אחד לדיבור, ואחר למודל שחושב עליו — וזה לא חייב להיות כך. מפתח אחד על פני יותר מ-200 מודלים, מעבר אוטומטי לגיבוי אם ספק נחלש, ו-DSL הניתוב אם אתם רוצים לשלוח בקשה דרך כמה מודלים ולהשוות לפני שאתם מתחייבים. זו טענה צנועה יותר מ"אנחנו מנתבים את התמלול שלכם", והיא הנכונה.

הדבר שכדאי לשים לב אליו הוא אם OpenAI תשיב בתחום הדיוק ולא בתחום ההקשר. החברה כבר הוציאה לשוק שני דורות של תמלול בשנה והורידה מחירים פעם אחת; מנגנון ההקשר הוא באמת נקודת בידול, אבל בלוח שמודד תמלול גולמי היא כרגע ממוקמת אחרי גם SpaceXAI וגם Microsoft. אם יגיע GPT Transcribe 2 כשמנגנון ההקשר נשמר בשלמותו ושיעור השגיאות יורד לטווח של 2%, ההשוואה הזאת תתהפך בצד ה-batch בין לילה — ומחיר ה-streaming, שכבר זהה, הופך את זה למירוץ ששווה לעקוב אחריו.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית