Grok Voice Think Fast 2.0: סוכן הקול המהיר והיקר ביותר של xAI, מוסבר
Guides & Insights

Grok Voice Think Fast 2.0: סוכן הקול המהיר והיקר ביותר של xAI, מוסבר

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

xAI שחררה את Grok Voice Think Fast 2.0 ב-29 ביולי 2026 — כפי שהיא מכנה אותו: "מודל הקול-לדיבור היכול ביותר", והדגל החדש של קו סוכני הקול שלה. הוא עונה מהר יותר מכל מתחרה בחמישייה הראשונה (0.70 שניות עד האודיו הראשון), מוביל במדד סוכני הקול, ומתמלל במדויק יותר מהדור הקודם. הוא גם יקר ב-60% לדקה מהמודל שהוא מחליף, כולל מונה לדקה שמעלה בשקט את החשבון שלך, ומגיע עם מתג כינוי גרסה שמתחלף אוטומטית תוך שבוע. המדריך הזה מסביר מה זה Think Fast 2.0 באמת, מה xAI שינתה מתחת למכסה המנוע, כיצד סיפור המדדים מתפצל לציונים עצמאיים ולהצהרות של הספק, מה זה באמת עולה כשמחשבים את זה, ואיך לבצע אליו קריאה — בנוסף לאזהרות שכדאי לקרוא לפני שמנתבים דרכו שיחות ייצור.

הערת דיוק: פרטי ההשקה, התמחור, ודיוק הכותרת והטענות העסקיות מגיעים מההודעה והמסמכים של xAI (2026-07-29). הציונים המרוכבים של Artificial Analysis נמדדים באופן עצמאי ועל ידי צד שלישי. הטענות המדווחות על ידי xAI — תוצאות ה-A/B של Starlink, מכפלי התמלול, הניסוח "60% פחות אסימוני חשיבה" ו"מהיר כמעט פי 5" — לא פרסמו נתונים תומכים; יש להתייחס אליהן כאל נתוני ספק כיווניים ולהריץ הערכות משלך. המפרט, המחירים והתנהגות הכינויים עשויים להשתנות; יש לאמת לפני שבונים.

TL;DR. Grok Voice Think Fast 2.0 הוא מודל הדיבור-לדיבור מקצה לקצה של xAI עבור סוכני קול: קלט אודיו, פלט אודיו דרך WebSocket, ללא צנרת נפרדת של ASR→LLM→TTS. הוא באמת מהיר (0.70 שניות עד לאודיו הראשון, המודל היחיד בחמישייה הראשונה שנמצא מתחת לשנייה) ובאמת חזק בעבודה קולית של סוכנים, מדורג ראשון במבחן τ-Voice של Artificial Analysis (56.5%) ובמקום השני הכללי במדד איכות הדיבור-לדיבור (82.9%), אחרי Qwen Audio 3.0 Realtime Plus (84.1%). הוא חושב בזמן שהוא מדבר — ומקצץ את השימוש החציוני ב-reasoning tokens לכ-40% מהמודל הישן — ועולה $0.08 לדקה, לעומת $0.05 קודם. המלכוד הוא המונה: הקול מחויב לפי דקת שמע בזמן אמת, כך שעליית מחיר של 60% על מודל שזול יותר לשרת נוחתת ישירות על החשבונית שלך. וב-5 באוגוסט ה-alias grok-voice-latest יתחיל לנתב אוטומטית ל-2.0, ולכן צוותים על הגרסה הישנה צריכים לנעול אותו בכוונה לפני כן.

נקודות עיקריות

• דיבור-לדיבור טבעי: מודל אחד מהמיקרופון לרמקול, ללא שרשרת ASR→LLM→TTS — וזו הסיבה שהשמע הראשון מגיע תוך 0.70 שניות.

• מוביל סוכני: #1 במדד הסוכנים τ-Voice של Artificial Analysis (56.5%), הרבה לפני GPT-Realtime-2.1 (45.7%) ו-Gemini 3.1 Flash (37.7%).

• לא המוביל הכללי: #2 במדד איכות דיבור-לדיבור (82.9%), אחרי Qwen Audio 3.0 Realtime Plus (84.1%); OpenAI עדיין מנצח בדינמיקה השיחתית (95.7% לעומת 95.1%).

• יקר ב-60%: $0.08 לדקה (~$4.80 לשעה) לעומת $0.05 לדקה עבור Think Fast 1.0 — למרות שהמודל מדווח כמשתמש בכ-60% פחות אסימוני חשיבה.

• החלפת אליאס ב-5 באוגוסט: grok-voice-latest ינותב ל-2.0 אוטומטית; הצמד את grok-voice-think-fast-1.0 לפני כן כדי להישאר בגרסה הזולה יותר.

• תייג כל טענה: הציונים של Artificial Analysis הם עצמאיים; מבחן ה-A/B של Starlink, מכפלי התמלול ומסגור המהירות מדווחים על ידי xAI ואינם מפורסמים.

מהו Grok Voice Think Fast 2.0

Grok Voice היא משפחת המודלים של xAI בזמן אמת, מדיבור-לדיבור. "Think Fast" הוא קו התגובה המהירה, שהושק במקור עם Voice Agent Builder באפריל 2026; Think Fast 2.0 הוא הדור השני של קו זה, ששוחרר ב-29 ביולי 2026. המודל הוא מקצה-לקצה: הוא צורך אודיו גולמי, מבצע חשיבה, ומפיק אודיו ישירות, במקום להריץ צינור של מודל זיהוי דיבור המזין מודל LLM טקסטואלי המזין מודל טקסט-לדיבור. בחירה ארכיטקטונית זו היא שורש יתרון השיהוי שלו — אין שלבים טוריים ואין טקסט ביניים, כך שהמודל יכול להתחיל תגובה בעודו עדיין מקשיב.

xAI ממתגת אותה במפורש עבור סוכני בינה מלאכותית קוליים: מוקדי שירות לקוחות, מכירות טלפוניות, קבלה, טלפוניה, ויישומים נוספים שבהם מערכת משוחחת עם אדם בזמן אמת וצריכה actually לבצע דברים — לקבוע שיחה, לסנן ליד, לעדכן רשומה, לחפש באינטרנט — ולא רק לשוחח. הדגש על אוטונומיה ביצועית (agentic), לא על תמלול או סינתזה גולמיים, הוא שדה הקרב שאליו מכוון ההשקה.

מה חדש לעומת Think Fast 1.0

השדרוג מ-1.0 אינו רק קפיצה במספרים; xAI מתארת שלושה שינויים מבניים:

• חשיבה במקביל לדיבור. המודל חושב על שאילתה תוך כדי דיבור, במקום לחשוב קודם ולדבר אחר כך. בפועל, קריאות לכלים יכולות להישלח לפני שהסוכן סיים את המשפט הראשון שלו — עניין משמעותי עבור זרמי קול רגישים להשהיה.

• הרבה פחות אסימוני חשיבה. xAI מדווחת ששימוש חציוני באסימוני חשיבה ירד לכ-0.4x מזה של קודמו (כ-60% פחות), וזה חלק מהסיבה שהיא אומרת שהמודל זול יותר לשרת למרות שהמחיר עלה.

• סגנון שיחה שנלמד בלמידת חיזוק. למידת החיזוק (RL) עיצבה מחדש את אופן הדיבור: משפטים קצרים יותר, שאלה אחת בכל פעם, ללא מילוי — סגנון שיחות תמציתי ו"אנושי" יותר שמתאים לעבודה טלפונית שבה פטפוט מבזבז דקות (ובחיוב לפי דקה, גם כסף).

בנוגע למהירות הניתנת למדידה, הזמן עד לאודיו הראשון ירד מ-1.25 שניות ב-1.0 ל-0.70 שניות ב-2.0. בתמלול, xAI מדווחת על שיפור של כ-1.4x ב-24 שפות (לפי דיווח ספק, להלן).

הבנצ'מרקים, בנצ'מרק אחר בנצ'מרק

ההשקה מעוגנת ב-Artificial Analysis, בית מדדי אמות מידה עצמאי ונייטרלי. זה חשוב: בניגוד לרוב המספרים האחרים בהכרזה, אלה נמדדים על ידי גורם נייטרלי, והם אלה שכדאי להשוות ביניהם ישירות. התמונה המשולבת טובה יותר מאשר כותרת ראשית אחת.

מדד איכות דיבור-לדיבור: 82.9% (מקום שני). זהו המדד המשולב הכולל של דיבור-לדיבור, עלייה מ-75.7% ב-Think Fast 1.0. הוא עוקף את GPT-Realtime-2.1 (79.1%) ואת Gemini 3.1 Flash (69.5%) — אבל לא במקום הראשון. Qwen Audio 3.0 Realtime Plus מוביל עם 84.1%. אז "מודל הקול הכולל הטוב ביותר" הוא מוגזם שהנתונים לא תומכים בו; "מודל הקול הסוכני המהיר ביותר בשכבה העליונה" הוא מדויק.

מדד τ-Voice לסוכנים: 56.5% (מקום ראשון).זה המדד שלגרוֹק (xAI) הכי חשוב בו, והדירוג אמיתי: 56.5% מנצח את Think Fast 1.0 (52.1%), GPT-Realtime-2.1 (45.7%) ו-Gemini 3.1 Flash (37.7%). τ-Voice מודד ביצועי קול סוכניים — כמה טוב מודל מבצע משימות בערוץ קולי, כולל שימוש בכלים באמצע השיחה. על הציר הצר של "האם הוא יכול לעשות את העבודה", Grok מוביל. מאסק קידם בדיוק את הדירוג הזה.

Big Bench Audio: 97.2%. מדד להנמקת דיבור; חזק, אם כי Qwen רשם שיא של 99.2%.

בנצ'מרק Full Duplex: 95.1%. דינמיקת שיחה — טיפול בהפרעות, נטילת תורות, התפרצות. מדובר בקפיצה גדולה מ-77.8% בגרסה 1.0, אבל OpenAI עדיין עוקפת אותה עם 95.7%, ו-Qwen מובילה עם 98.4%.

הזמן עד לאודיו הראשון: 0.70s. המספר החשוב ביותר עבור מוצרי קול אמיתיים. הוא ירד מ-1.25s והוא הנתון היחיד מתחת לשנייה מבין חמשת הדגמים המובילים; בדיקות עצמאיות מאשרות במידה רבה תגובה תת-שנייה. בהזרמת TTS, השהיית הטוקן הראשון היא כ-285ms. לשימוש בטלפון ובזמן אמת, השהיה היא המדד שמשתמשים מרגישים בכל תור ותור, וכאן 2.0 הוא הטוב ביותר באופן מובהק.

כשקוראים את השורות, הפרופיל ספציפי: הכי מהיר בדיבור, הכי טוב בביצוע משימות, שני בסה"כ, שלישי בעדינות שיחה. זהו מודל מצוין לסוכן קולי, וטענה בינונית של "הקול הטוב ביותר לצ'אטבוט". בחרו בו למשימות שהשורה העליונה תואמת.

דיוק התמלול

מעבר לשיחה, xAI טוענת לתמלול טוב יותר באופן משמעותי. ההערכה הפנימית שלה על פני 24 שפות ואלפי ביטויים מראה, לפי הדיווחים, דיוק של פי 1.4 לעומת Think Fast 1.0, ופי 1.5–2 מהדיוק של מודלי תמלול ייעודיים כמו Deepgram Nova 3 ו-ElevenLabs Scribe v2. בתנאים רועשים ובמצבים אמיתיים — רעשי רקע, דחיסת טלפוניה, שיחות ברוחב פס נמוך — פער הדיוק המדווח לעומת מודלי STT ייעודיים מתרחב לכדי פי 10 בערך.

אלה בדיוק הטענות שצריך להתייחס אליהן בזהירות. הן מדווחות על ידי xAI; מתקן ההערכה, קבוצות הביטויים ופרופילי הרעש לא פורסמו. בדיקה עצמאית של תמלול הטלפון הרועש של 2.0 מול Deepgram או ElevenLabs תהיה בעלת ערך, ונכון לכתיבת שורות אלה, טרם פורסמה. מבחינה כיוונית, מודלים של קצה-לקצה שסופגים יותר טלפוניה באימון הם שיפור אמיתי סביר — אבל יש לאמת את "פי 10", ולא לחזור עליו כעובדה.

תמחור: $0.08 לדקה ושאלת ה-60%

כאן הופכת ההשקה לשנויה במחלוקת. Think Fast 2.0 עולה $0.08 לדקת אודיו — בערך $4.80 לשעה — ועוד $0.004 לכל הודעת טקסט נכנסת. Think Fast 1.0 עלה $0.05 לדקה ($3.00 לשעה). זהו גידול של 60%, וזה הגיע באותו חודש שבו OpenAI הורידה מחירים על GPT-5.6 Luna ב-80% ועל Terra ב-20%, כשהיא מצטטת את אותן עלויות הפעלה יורדות ש-xAI טוענת עבור המודל הזה.

המונה הוא כל הסיפור. מודלי טקסט מחויבים לפי טוקן, כך שכאשר מודל הופך ליעיל יותר, החשבון של הלקוח קטן אוטומטית. מודלי קול מחויבים לפי דקת שמע בפועל, ואורך השיחה נקבע על ידי האדם המדבר, לא על ידי המודל. רווחי היעילות במוצר המחויב לדקה הולכים לספק, לא לקונה. זו הסיבה שמודל שמדווח כי משתמש בכ-60% פחות טוקני חשיבה — ולכן זול יותר עבור xAI לשרת — עולה 60% יותר לשכירה.

עשו את החשבון על זרימת שיחה אמיתית. שיחה של 4 דקות ב-1.0 עולה $0.20; אותה שיחה ב-2.0 עולה $0.32. עשרת אלפים שיחות כאלה בחודש הן 40,000 דקות: $2,000 לחודש על 1.0 לעומת $3,200 לחודש על 2.0 — הפרש של $1,200 לחודש, או בערך $14,400 לשנה, שמגיע אך ורק משינוי בניתוב, לא מנפח השיחות. אפילו רווח מהירות נדיב בקושי משפיע על כך: קיצור של 10 שניות מלאות מכל שיחה חוסך בערך $0.013, בעוד עליית המחיר מוסיפה $0.12 — אתה מכסה בערך תשיעית מהעלייה. כל תוכנית עסקית שמציגה את 2.0 כמודל הזול יותר בלבלה בין "מהיר" ל"זול".

לצורך ההקשר, 2.0 עדיין זול בערך פי 2.2 מ-GPT-Realtime-2.1 High, במחיר של כ-10.75 דולר לשעה. אז הוא לא יקר במונחים מוחלטים — הוא יקר יחסית לקודמו ולכיוון שאליו נעו כל ספקי המודלים האחרים באותו חודש.

מלכודת ההגירה של ה-5 באוגוסט

יש מועד אחרון. ב-5 באוגוסט 2026, הכינוי {{1}}grok-voice-latest{{/1}} יתחיל אוטומטית לנתב אל {{2}}Think Fast 2.0{{/2}}. אם אתה פעיל על {{3}}Think Fast 1.0{{/3}} דרך הכינוי הזה, {{4}}"לעשות כלום"{{/4}} ישדרג אותך — ואת החשבון שלך — לגרסה החדשה בתאריך זה. כדי להישאר על 1.0, עליך לקבוע במפורש את מזהה המודל {{5}}grok-voice-think-fast-1.0{{/5}} לפני 5 באוגוסט.

שתי העמדות הניתנות להגנה מחייבות פעולה לפני המועד: או להצמיד את גרסה 1.0 בכוונה, כי התהליכים הסקריפטיים שלך עבדו היטב ב-$3.00 לשעה, או לעבור לגרסה 2.0 בכוונה ולעדכן את התחזית ל-$4.80 לשעה, כשההצדקה היא איכות ולא חיסכון. מה שלא ניתן להגן עליו הוא לגלות את השינוי בחשבונית מספטמבר. כלל טוב: התייחס לכל כינוי שמסתיים ב-"latest" כהוראה קבועה לקבל את מה שהספק שולח הבא — כולל מחירו.

איך לגשת אליו ולהשתמש בו

Think Fast 2.0 זמין דרך ה-API של Speech-to-Speech של xAI תחת מזהה המודל grok-voice-think-fast-2.0, עם grok-voice-latest ככינוי המתגלגל. זהו מודל בזמן אמת, full-duplex, דרך WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, המאומת עם כותרת Authorization: Bearer ב-handshake. עבור אפליקציות דפדפן, יש להנפיק אסימונים זמניים (ephemeral tokens) בצד השרת דרך נקודת הקצה של realtime sessions, כך שמפתח ה-API הראשי לעולם לא מגיע ללקוח.

ה-API תואם ל-OpenAI Realtime, כך שקוד קולי קיים בזמן אמת בדרך כלל נדרש רק להחליף כתובת URL בסיסית ומפתח. הגדרת הסשן מתבצעת דרך אירוע session.update: בוחרים קול מוגדר מראש (eve, ara, rex, sal, leo), מגדירים את פורמט האודיו לקלט ולפלט (PCM16 ב-24kHz כברירת מחדל; μ-law לטלפוניה), מאפשרים זיהוי פעילות קולית בצד השרת, ורושמים כלים — כולל כלי חיפוש אינטרנט מובנה — כך שהסוכן יוכל לפעול באמצע השיחה. זרימת האירועים עוקבת אחר הדפוס הסטנדרטי: הלקוח מוסיף פריימים של חיץ אודיו, השרת מזרים מקטעי אודיו של תגובה, ואירועי ארגומנטים של קריאות כלים מופעלים כשהמודל מחליט לפעול, והתוצאות נדחפות חזרה כפלטים של קריאות פונקציה. המודל תומך ביותר מ-25 שפות ובשכפול קול מותאם אישית מדיבור של בערך דקה.

שים לב מה זה לא: זה מודל סוכן דיבור-לדיבור, לא שירות תמלול או תרגום כללי. אם התפקיד המרכזי של המוצר שלך הוא המרת אודיו לטקסט בעלות נמוכה, מודל STT ייעודי הוא כלי אחר — ובמדידה לפי דקה אתה משלם על כל השיחה, כך שעומסי עבודה של תמלול בלבד הופכים ליקרים מהר.

איך זה משתלב בערימת סוכן קולי

Think Fast 2.0 הוא מודל קולי ייעודי בזמן אמת, הנגיש דרך ה-API הייעודי של xAI, ולא מודל שפה כללי (LLM) שנתב מודלים מארח. ערוץ הקול פועל ישירות על ה-WebSocket של xAI — שם נמצא זמן האחזור התת-שני, והוא לא שורד קפיצת ביניים.

כל מה שמסביב למוצר קולי — הלוגיקה בשפה טבעית שאינה רגישה לזמן, החשיבה החלופית כששיחה סוטה מהתסריט, התקצור, האנליטיקה, אימייל ההמשך שהסוכן מפעיל אחרי שיחה — הוא עבודת טקסט ורב-מודאלית לשימוש כללי. עבור החלק הזה, נקודת קצה נייטרלית לספק כמו OrcaRouter נותנת לך API אחד תואם-OpenAI על פני LLM רבים, כך שלא תהיה כבול לספק אחד עבור חלקי הערימה שאינם זקוקים לנתיב הקול בזמן אמת. החלוקה הנקייה: ה-API הייעודי של xAI לסטרימינג הקולי עצמו, OrcaRouter (או דומה) לטקסט ולחשיבה הרב-מודאלית סביבו.

התחרות: מהירות אג'נטית לעומת אינטליגנציה גולמית

Think Fast 2.0 נוחתת באמצע השוק התחרותי ביותר בתחום הבינה המלאכותית כרגע — סוכני קול בזמן אמת — וטבלת ההשוואה הופכת את הפשרות לגלויות בצורה חריגה.

Qwen Audio 3.0 Realtime Plusהוא מוביל האינטליגנציה: 84.1% במדד האיכות של דיבור-לדיבור (מקום ראשון), שיא של 99.2% ב-Big Bench Audio, ו-98.4% ב-full duplex. אבל זמן ההמתנה הממוצע לאודיו הראשון הוא כ-4.02 שניות — איטי בערך פי 5.7 מ-0.70 שניות של Grok. עבור שיחות ברכב, במכשירים לבישים ובטלפון, ההבדל הזה הוא לא "מהיר מול איטי", אלא שמיש מול בלתי שמיש. Qwen גם מתחלק לשכבת Plus (איכות) ולשכבת Flash (כ-300 אלפיות השנייה לחבילה הראשונה) עבור תרחישים שונים, וזו תשובה מושכלת לאותו מתח.

GPT-Realtime-2.1 ממוקם באמצע ברוב השורות (79.1% איכות, 45.7% אייג'נטית) וזוכה בדינמיקת שיחה (95.7%). שכבת ה-High שלו היא בערך פי 2.2 ממחיר לשעה של Grok. עבור צוותים שכבר עמוק במערכת האקולוגית של OpenAI, הוא נשאר ברירת המחדל עם החיכוך הנמוך ביותר.

Gemini 3.1 Flash מפגר במדדי האיכות והאייג'נטיות (69.5%, 37.7%), אך הוא חלק ממערך קולי רחב יותר של Gemini ומהמערכת האקולוגית של Google שצוותים רבים מעדיפים מסיבות אחרות.

הקריאה המעשית: בחירה לפי עומס העבודה. אם סוכן הקול שלכם חייב להרגיש מיידי ולבצע בצורה אמינה משימות מבוססות כלים (תמיכה, קווליפיקציה, הזמנות), Think Fast 2.0 הוא האפשרות החזקה ביותר שנמדדה כיום. אם העדיפות שלכם היא החשיבה העמוקה ביותר ואתם מסוגלים לספוג זמן אחזור של מספר שניות, Qwen Plus מנצח. אם ליטוש שיחתי והתאמה לאקוסיסטם חשובים יותר מכול, GPT-Realtime-2.1 נותר המוביל שצריך לנצח.

שלושה תרחישים שבהם זה מתאים

1. תמיכה טלפונית וטלפוניה

השילוב החשוב ביותר: סאונד ראשון תוך פחות משנייה, תמלול חזק בשיחות רועשות (לפי דיווח הספק), וטיפול בהפרעות במצב דופלקס מלא. קו תמיכה שבו הנציג מתחיל לדבר כמעט מיד ויכול לשלוף פרטי חשבון באמצע התור הוא בדיוק מה ש-2.0 כוונן עבורו. סגנון הדיבור הקצר יותר שלו, שאלה אחת בכל פעם, מבוסס RL, מתאים גם הוא היטב לטלפוניה, שבה הדקות הן יחידת החיוב — בכל מונה של ספק.

2. מוקדמות לידים ומעקב לאחר שיחה

הקול האגנטי הוא התחום שבו 2.0 באמת ראשונה, והסמכת לידים היא משימת הקול האגנטי הקנונית: להסמיך, לנתב ולהפעיל מעקב כשהכוונה עדיין רעננה. קריאות הכלים שלה יכולות להישלח עוד לפני שהמשפט הראשון מסתיים, כך שסוכן יכול ליצור רשומת CRM בעודו מדבר עם הלקוח הפוטנציאלי. תכננו מראש ייחוס ברמת סשן והרשאות כלים מחמירות — סוכן קולי יכול לטעות בזמן אמת, והניקוי הוא באחריותכם.

3. מוצרי voice-agent בפיתוח פעיל

עבור מפתחים שמשיקים סוכני קול משלהם — האינטגרציות של Tradecraft ו-GrokTerm ש-xAI מצטטת הן בדיוק בצורה הזו — המהירות של 2.0 וה-API התואם ל-OpenAI הופכים את זה לתחליף חלק (drop-in) לקוד של GPT-Realtime. נעלו את הגרסה, הריצו פיילוט מצומצם עם תנאי הצלחה ברור (למשל, "סווגו והפנו מבקרים מדף המחירים"), ומדדו עלות לכל תוצאה שהושלמה, לא עלות לדקה.

מגבלות ואזהרות

Think Fast 2.0 הוא בן חמישה ימים נכון לכתיבת שורות אלה, וזה ניכר בהסתייגויות. תוצאות בדיקות ה-A/B של Starlink (המרה גבוהה יותר והכלת תמיכה) מדווחות על ידי xAI ללא נתונים שפורסמו; מכפלי התמלול והניסוח "מהיר כמעט פי 5" הם אף הם טענות ספק, ולא אמות מידה עצמאיות. המאמר היחיד שתראו הטוען ל"רגרסיית ביצועים ודוחות בדיקה מזויפים" מתייחס לאותה חוסר אימות — המספרים ש-xAI פרסמה לא שוחזרו באופן עצמאי, וקהילת הקול הרגישה לאמינות חושדת בצדק במדדי ספק שלא פורסמו. אמות מידה גם לא יכולות למדוד את השיחה הגרועה ביותר שלכם: תגובה של 0.70 שניות היא חסרת ערך אם הסוכן מנתב בביטחון ליד לצוות הלא נכון. החיוב הקולי הוא לדקה, עם עליית מחיר שכבר מובנית, כך שהחשיפה לעלות היא ממשית. וכמו בכל מודל בזמן אמת חדש לגמרי, צפו לתנודות ב-API. אמתו את טענות הדיוק על האודיו שלכם, נעלו גרסאות בסביבת הייצור, והטמיעו אסקלציה והקלטה לפני השיחה החיה הראשונה.

שאלות נפוצות

מה זה Grok Voice Think Fast 2.0?

מודל הדיבור-לדיבור המוביל של xAI לסוכני קול, שפורסם ב-29 ביולי 2026: שמע-לשמע מלא מקצה לקצה על גבי WebSocket, עם זמן של 0.70 שניות עד לקול הראשון ומקום ראשון במדד ה-agentic benchmark של τ-Voice.

כמה עולה Grok Voice Think Fast 2.0?

$0.08 לדקת אודיו (בערך $4.80 לשעה) בתוספת $0.004 לכל הודעת טקסט — עלייה של 60% לעומת $0.05 לדקה של Think Fast 1.0.

האם Think Fast 2.0 הוא מודל הקול הטוב ביותר?

זהו המהיר והטוב ביותר במשימות סוכניות (56.5% τ-Voice, מקום ראשון) והשני בסך הכול במדד איכות הדיבור-לדיבור (82.9%), אחרי Qwen Audio 3.0 Realtime Plus (84.1%). "הטוב ביותר" תלוי בעומס העבודה.

מה השתנה מ-Think Fast 1.0?

חשיבת דיבור מקבילית (חושב תוך כדי דיבור), כ-60% פחות טוקני חשיבה, סגנון שיחה קצר יותר מכוונן באמצעות RL, שיפור של פי 1.4 בתמלול (לפי דיווח הספק), וקיצור זמן עד לאודיו הראשון מ-1.25 שניות ל-0.70 שניות.

האם מתג התנועה Think Fast 1.0 שלי יעבור אוטומטית?

כן, ב-5 באוגוסט 2026, אם אתה משתמש בכינוי grok-voice-latest. נעל את grok-voice-think-fast-1.0 לפני כן כדי להישאר על 1.0, או קח את 2.0 בכוונה ועדכן את תחזית העלות.

איך אני קורא ל-Grok Voice Think Fast 2.0?

באמצעות ה-API של xAI ל-Speech-to-Speech — WebSocket בזמן אמת (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) התואם ל-OpenAI Realtime API, עם קולות מוגדרים מראש, VAD בשרת, וקריאה לכלים.

עם אילו מודלים קוליים הוא מתחרה?

Qwen Audio 3.0 Realtime Plus (אינטליגנטי יותר, איטי בהרבה עם 4.02 שניות לאודיו הראשון), GPT-Realtime-2.1 (דינמיקת שיחה טובה יותר, יקר בכ-2.2x בדרגה הגבוהה), ו-Gemini 3.1 Flash.

האם טענות ה-benchmark אמינות?

ציוני ה-Artificial Analysis עצמאיים ומוצקים. תוצאות ה-A/B של Starlink, מכפלי התמלול והמסגור המהיר מדווחים על ידי xAI ללא נתונים שפורסמו — התייחסו אליהם ככיווניים ואמתו על האודיו שלכם.

האם Grok Voice טוב לתמלול?

הוא מתמלל בתוך שיחה, ו-xAI טוענת לרווחים גדולים על פני מודלי STT ייעודיים בתנאי רעש — אבל הוא מחויב לפי דקת שיחה, ולכן עומסי תמלול ייעודיים עדיף לשרת באמצעות מודל STT ייעודי.

השורה התחתונה

Grok Voice Think Fast 2.0 הוא מודל הקול הסוכני החזק ביותר שנמדד עד כה, והמהיר ביותר בשכבה העליונה בפער ניכר — 0.70 שניות עד לאודיו הראשון הוא ניצחון אמיתי, בלתי תלוי ומול המשתמש, והמקום הראשון ב-τ-Voice הוא דירוג אמיתי. הסיכום הכנה הוא ספציפי: זה הכלי הטוב ביותר במחלקתו עבור סוכני קול בזמן אמת הנתמכים בכלים, לא מודל הקול הטוב ביותר בכל שורה — Qwen מובילה באינטליגנציה ו-OpenAI בחן השיח. המחלוקות אינן על המהירות, אלא על אמת המידה: עליית מחיר של 60% על מודל ש-xAI אומרת שזול יותר לשרת, הגירת כינוי אוטומטית עם מועד אחרון נוקשה, וטענות כותרות שנשענות על נתוני ספק שלא פורסמו. השתמשו בו לצורך המהירות הסוכנית, נעלו את הגרסה שלכם, תייגו את טענות הספק, ואמתו את הדיוק בקריאות שלכם — ושמרו על הטקסט וההיגיון למטרות כלליות סביב מוצר הקול שלכם בנקודת קצה נייטרלית לספק כמו OrcaRouter.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube