כרטיס הירו של מאמר עם הכיתוב 'תקציר AI יומי — 19 בספטמבר', תג 'חדשות' וכתובית המשנה 'Grok Voice Transcribe 2.0 יוצא לדרך, ו-Meta פותחת את Muse', עם צ'יפים המציגים 0.10$ לשעת אצווה, 2.7% WER בזרימה, 3.4% בתוצאה החלקית הראשונה ומחברי Muse פעילים, על גבי גרדיאנט מלבן לכחול עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Engineering & Research

תקציר AI יומי, 19 בספטמבר: Grok Voice Transcribe 2.0 עולה לאוויר ו-Meta פותחת את Muse למפתחים

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Grok Voice Transcribe 2.0 זמין כעת ב-Grok Voice API החל מ-18 בספטמבר 2026, בתעריף של 0.10 דולר לשעת אודיו עבור תמלול מוקלט ו-0.20 דולר לשעה עבור סטרימינג — אותם תעריפים ש-SpaceXAI גבתה עבור גרסה 1.0. באותו שבוע, Meta פתחה את פלטפורמת המחברים Muse בפני מפתחים חיצוניים, ואפשרה לכל שירות לחשוף את ה-API הקיים שלו ולתת לסוכן Muse של Meta לבצע קריאה אליו בשם המשתמש. אלה נראות כמו כותרות לא קשורות משתי חברות שונות על שני מוצרים שונים, ובמשך רוב השנתיים האחרונות הן אכן היו כאלה. כשקוראים אותן יחד, מדובר באותו סיפור: התמלול הופך לקלט, והמאבק עבר לשאלה מי הוא הבעלים של הקריאה שצורכת אותו.

תתחיל במחירים, כי הם החלק שקורא יכול לפעול לפיו היום. אחר כך הדיוק, שהוא אמיתי אך צר יותר ממה שמסגור ההשקה מרמז. ואחר כך הקטע על Meta, שהוא זה שיהיה חשוב בעוד חצי שנה.

תמחור אחיד, ומה זה אומר אם אתם כבר משלמים עבור תמלול

Grok Voice Transcribe 2.0 עולה בדיוק כמו 1.0. לא "מתחיל מ" באותו מחיר, ולא תעריף מבצעי שפוקע — זהה לחלוטין, במחיר של $0.10 לשעת אודיו בעיבוד באצווה ו-$0.20 לשעה בסטרימינג, שהם $1.67 ו-$3.33 לכל 1,000 דקות. דיאריזציה של דוברים, חותמות זמן ברמת המילה עם ציוני ביטחון, נרמול טקסט הפוך, הסרת מילות מילוי והטיית מונחי מפתח — כל אלה כלולים במחיר במקום להימכר בנפרד כתוספות, וזה לא הנורמה בקטגוריה.

ההשפעה המעשית היא אריתמטית ולא דרמטית. צוות שמתמלל 5,000 שעות של אודיו ממוקד שירות בחודש משלם 500 דולר עבור מסלול האצווה בכל מקרה, והמודל החדש מחזיר את אותו נפח עם שיעור שגיאות נמוך באופן מהותי. שום דבר במעבר לא משנה את מה שאתם משלמים, וזו בדיוק הסיבה שהמעבר קל להצדקה: אין החלטת עלות לקבל, אלא רק החלטת איכות, והאיכות עלתה.

אינטגרציות קיימות עוברות באמצעות העברת grok-voice-transcribe-2.0 כפרמטר model ב-/v1/stt, או באמצעות בחירה בו כשסשן WebSocket נפתח לסטרימינג. אין שינוי בסכימה, אין נקודת קצה חדשה, ואין קידוד מחדש של צינור האודיו שלכם. SpaceXAI השאירה את 1.0 כברירת מחדל לעת עתה, כך שאינטגרציה שלא נוגעת בפרמטר model ממשיכה לקבל את הגרסה הישנה עד שהחברה תהפוך אותה — שלדבריה יקרה בשבועות הקרובים, לצד הוצאת 1.0 משימוש. כדאי לנצל את החלון הזה במכוון: כוונו עותק צל של האודיו מסביבת הייצור שלכם אל 2.0 והשוו את התמלילים למה שאתם מספקים היום, כי ברגע שברירת המחדל תתהפך תריצו אותו בין אם בדקתם אותו ובין אם לא.

שאר דף המפרט נשאר באותו מבנה, וכדאי להכיר אותו אם אתם מגדירים את גודל הפריסה ולא רק בוחנים דיוק: 12 פורמטי אודיו קלט, החל מאודיו טלפוני ב-8 kHz ועד 48 kHz, עד שמונה ערוצי אודיו בלתי תלויים בבקשה אחת, 100 מונחי מפתח לכל בקשה עבור אוצר מילים ייעודי לתחום, זיהוי שפה אוטומטי עם החלפה במהלך ההקלטה, ונרמול טקסט הפוך ב-25 שפות כך שתאריכים, מטבעות, מספרי טלפון וכתובות דוא״ל שנאמרים בעל פה יוחזרו כתובים כפי שאדם היה כותב אותם. מגבלות השירות הן 10 בקשות בשנייה ו-100 סשני סטרימינג במקביל לכל צוות, והשירות פועל באזור יחיד — us-east-1 — וזו השורה היחידה בגיליון שצריכה לגרום לצוות פרודקשן לעצור ולחשוב, כי API לדיבור באזור יחיד משמעו השבתה באזור יחיד.

היכן שהדיוק למעשה זז

טענת ההשקה היא "מדויק פי שניים", והמספרים שמאחוריה ספציפיים יותר ופחות אחידים מהביטוי הזה. בלוח AA-WER Streaming של Artificial Analysis, שהוא המדידה העצמאית כאן, שתי הגרסאות נבדלות כך:

• דיוק תמלול סופי — Grok Voice Transcribe 2.0 בשיעור שגיאת מילים של 2.7% לעומת Grok Voice Transcribe 1.0 עם 3.9%, שניהם נמדדו לאחר שהדובר מפסיק

• דיוק התמלול החלקי הראשון — 3.4% WER לעומת 18.3%, שהוא הפער הבודד הגדול ביותר בין שתי הגרסאות, ובפער ניכר

• זמן עד תמלול סופי — 0.49 שניות לעומת 0.37 שניות, כך ש-2.0 איטי יותר במדד זה ולא מהיר יותר

• זמן עד לסגירה חלקית ראשונה — 0.49 שניות לעומת 0.25 שניות, אותה עסקה בכיוון ההפוך

הזוג האחרון הזה הוא הדבר המעניין ביותר בגיליון. Grok Voice Transcribe 2.0 קנתה את הדיוק שלה במחיר של כרבע שנייה של השהיה, בשני הכיוונים. עבור סוכן קולי זה מחיר אמיתי — זה ההבדל בין הפסקה טבעית להפסקה שהמתקשר מבחין בה — ועבור צינור עיבוד באצווה זה בלתי נראה. השיפור בתמלול החלקי הראשון הוא זה שמשנה את מה שאפשר לבנות, כי תמלול חלקי הוא הטקסט שסוכן מקבל לחשוב עליו בזמן שהמתקשר עדיין מדבר. מעבר מ-18.3% ל-3.4% במספר הזה הוא ההבדל בין תמלול חלקי שהוא רמז גס לתמלול חלקי שמיש. התמלול הסופי שעובר מ-3.9% ל-2.7% הוא שיפור טוב שאף משתמש לא יבחין בו.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the 'Speech to Text' heading, the line 'Transcribe audio files into text with a single API call, or stream audio in real time over WebSocket', and a Python quick-start code block that posts an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0 alongside a keyterm parameter.

SpaceXAI גם פרסמה ארבע הערכות פנימיות, וכדאי לקרוא אותן עם התווית מצורפת — אלו המספרים של החברה עצמה על האודיו שלה עצמה, לא משוחזרים באופן עצמאי:

• שיחות תמיכת לקוחות ב-8 kHz — ירידה מ-10.6% WER בגרסה 1.0 ל-7.1% בגרסה 2.0

• שיחות עם Grok — ירידה מ-8.7% ל-3.3%

• פרטי התחברות שנאמרו בקול, כלומר שמות, כתובות דוא״ל ופרטי חשבון שנקראו בקול רם — מ־7.2% ל־3.2%

• ביטויים קצרים ב־19 שפות — ירידה מ־20.6% ל־6.8%

שורת 8 kHz היא זו שכדאי להחזיק בה. אודיו טלפוני הוא הקלט הקשה ביותר מבין הנפוצים בקטגוריה הזו, וזה שרוב קוני מוקדי הקשר באמת מחזיקים בו, וירידה מ-10.6% ל-7.1% בו היא עניין גדול יותר עבור אותם קונים מאשר המספר הכותרתי בלוח.

טענת טבלת המובילים, בקריאה כנה

SpaceXAI אומרת שהמודל מדורג ראשון מבין 32 מודלים בזרימה בדיוק. הלוח של Artificial Analysis אכן מציב אותו ראשון הן בדירוג התמלול הסופי והן בדירוג החלקי הראשון — אבל עמוד הלוח מציג 27 מתוך 33 מודלים, כך שה"32" הוא ספירה של החברה עצמה, והדירוג הוא על קבוצה שהקורא צריך להבין את צורתה. AA-WER Streaming הוא מדד משולב משוקלל של שלוש קבוצות באנגלית: AA-AgentTalk ב-50%, VoxPopuli ב-25% ו-Earnings22 ב-25%, בסך הכל כשמונה שעות אודיו, והוא משוקלל במידה רבה לעבר דיבור שיחתי בסגנון סוכן. הוא אינו מודד מבטאים, קודקים טלפוניים, אוצר מילים תחומי או אודיו רב-ערוצי של מרכזיית שיחות באופן מובנה כלשהו.

שום דבר מזה לא הופך את המספר לשגוי. זה הופך אותו לספציפי. מודל שמוביל לוח אנגלי משוקלל לפי דיבור סוכנים הוא הבחירה הנכונה עבור אודיו באנגלית שצורתו דיבור סוכנים, והסיבה הכנה להאמין שתוצאת 8 kHz היא ההערכה הפנימית של הספק ולא הלוח הציבורי. קונים עם פרופיל אודיו שונה צריכים לבדוק על האודיו שלהם ולא לקרוא את הדירוג כפסק כללי — מה שהיה נכון לפני ההשקה הזו ויהיה נכון אחרי הבאה.

A generated infographic titled 'Grok Voice Transcribe 2.0 — what changed from 1.0', showing two columns of four rows: final transcript 3.9% to 2.7% WER, first partial 18.3% to 3.4% WER, time to first partial 0.25s to 0.49s, and streaming price $0.20 per hour unchanged, with a footer reading 'Board figures per Artificial Analysis AA-WER Streaming; internal evaluations vendor-reported.'

מטא פותחת את מחברי Muse למפתחים

הסיפור השני של השבוע הוא של Meta. Muse, הסוכן האישי ש-Meta השיקה ב-8 בספטמבר ב-iOS, Android, muse.ai וב-WhatsApp, מקבל כעת מחברים של צד שלישי: שירות חושף את ה-API שלו, ו-Muse מספקת את הסוכן, את הדפדפן ואת הקונטקסט של המשתמש שהופכים את ה-API הזה למשהו שאדם יכול להפעיל פשוט by לבקש אותו. המסגור ש-Meta העניקה לכך הוא חלוקת עבודה — אתם מביאים את ה-API, אנחנו מביאים את הכוונה ואת המשתמש. המחברים הראשונים שנקראו בשמם היו Notion וכלי רשימות הפגישות Granola, בנוסף לאלה ש-Meta השיקה בעצמה.

כדאי להיות מדויקים לגבי מה זה ומה זה לא. זה לא פרוטוקול פתוח חוצה-סוכנים. בניית מחבר מקנה לך תפוצה בתוך בסיס המשתמשים של Muse עצמה ובשום מקום אחר; בנייה מול פרוטוקול פתוח מקנה לך הגעה לכל סוכן תואם וללא בסיס משתמשים מסוים. Meta גם לא פרסמה את החלקים שמפתח צריך לתכנן סביבם — תהליך סקירת המחברים, משטח האינטגרציה הטכני, כיצד Muse בוחרת בין שני מחברים שחופפים, או כיצד מפתח מודד האם מחבר אכן הניע שימוש כלשהו.

מה שאינו מוטל בספק הוא הכיוון. Muse מריצה את הסוכן של כל משתמש במכונה וירטואלית משלו, עם דפדפן משלו ושכבת סקירה נפרדת לפני פעולות יוצאות, והיא מחזיקה טוקנים חלופיים ולא מפתחות API אמיתיים. הארכיטקטורה הזו הגיונית רק אם התוכנית היא שהסוכן יבצע קריאות להרבה דברים. ממשקי API לתמלול הם בין הדברים שסוכן קורא להם, ול-Meta יש משלה — Muse Voice Transcribe, המודל בזמן אמת ש-Meta השיקה בתחילת ספטמבר במחיר של $0.18 לשעת אודיו. לפלטפורמה שמחזיקה גם בסוכן וגם במודל דיבור יש סיבה ברורה לנתב את התעבורה שלה למודל שלה, ומפתחים שבונים על קונקטורים צריכים להניח שזו ברירת המחדל, אלא אם משהו גורם לכך שזה לא יהיה ברירת המחדל.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Streaming filter selected, showing the WER Index - Final Transcription, Latency and Price highlight cards, the 'See Non-streaming Benchmarks' toggle, and the AA-WER Streaming Index versus Time to Final Transcription chart.

מה שצוות שמשיק קול החודש צריך למעשה לעשות

שני הסיפורים מצביעים לאותו כיוון. דיוק הדיבור הולך ומתכנס — שלושה מודלים במרחק של נקודה וחצי זה מזה על אותו לוח דירוג בתוך שלושה שבועות — והגורמים המבדילים שנותרו הם מחיר, השהיה, רישיון ומי שולט בניתוב. זה הופך את הבחירה לאן נשלחת קריאת התמלול שלך לבעלת השלכות גדולות יותר מאשר הבחירה איזה מודל עונה לה, מפני שתרצה לשנות את התשובה הזו כמה פעמים במהלך השנה הקרובה.

זו השכבה ש-OrcaRouter יושב בה. מפתח API אחד מכסה יותר מ-200 מודלים מאחורי נקודות קצה תואמות OpenAI, עם מעבר אוטומטי בין ספקים בעת כשל, כך ששירות דיבור באזור בודד שעובר אחר צהריים רע מפסיק להיות ההשבתה שלכם. אנחנו מעבירים הלאה את מחיר המחירון של הספק בתוספת של 0%, מה שאומר שהורדת מחיר של ספק או גרסת מודל חדשה פעילות אצלנו כבר באותו יום, במקום להמתין לתמחור מחדש. ומכיוון שכל מודל יושב מאחורי חוזה אחד, העברת עומס עבודה של תמלול ממודל אחד לאחר היא שינוי של מחרוזת מודל ולא רכש שני.

שלושה צעדים קונקרטיים לשבוע הזה. אם אתם על Grok Voice Transcribe 1.0, ערכו עכשיו בדיקת צל ל-2.0 על האודיו שלכם, בעוד 1.0 הוא עדיין ברירת המחדל ואתם עדיין שולטים במתג. אם אתם בוחנים דיבור בזרם עבור סוכן, מדדו את הזמן עד לחלקי הראשון מול תקציב השיהוי שלכם במקום לסמוך על הלוח של מישהו אחר — רבע השנייה שהמודל הזה השקיע בקניית דיוק הוא או כלום או קטלני, תלוי במה שהסוכן שלכם עושה עם הטקסט. ואם אתם בונים משהו שסוכן אישי עשוי יום אחד לקרוא לו, עקבו מקרוב אחר תוכנית המחברים של Muse, כי טיעון ההפצה שהיא מציגה חזק יותר מהפרט הטכני שאיתו היא הגיעה.