כרטיס כותרת ראשי עבור 'Realtime-Venus נגד Grok Voice Think Fast 2.0', עם כותרת משנה 'אחד ניתן לקנייה היום אחר הצהריים. אחד הוא הורדה.', עם שלושה כרטיסים שאומרים 'Grok Voice Think Fast 2.0: $0.08 לדקת אודיו, 0.70 שניות עד לאודיו הראשון', 'Realtime-Venus: משקולות Apache-2.0, ללא API, ללא מחירון', ו'ההימור המשותף: לחשוב תוך כדי דיבור, לא לפני', מעל פס תחתון שאומר 'נתוני Grok לפי Artificial Analysis ותיעוד xAI; נתוני Realtime-Venus מתוך הדוח הטכני שלה, לא שוחזרו.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Realtime-Venus נגד Grok Voice Think Fast 2.0: רק לאחד מאלה יש מחיר

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הציבו את Realtime-Venus ואת Grok Voice Think Fast 2.0 זה לצד זה, וההבדל הראשון אינו מדד ביצועים — הוא הזמנת רכש. Grok Voice Think Fast 2.0 הוא מודל דיבור-לדיבור מתארח שעלה למכירה ב-29 ביולי 2026 במחיר של 0.08 דולר לדקת אודיו, עם זמן מפורסם עד לאודיו ראשון של 0.70 שניות וציוני בנצ'מרק מצד שלישי. Realtime-Venus הוא מערכת דופלקס מלא בת 9B מצוות Venus של Ant Group ומאוניברסיטת צינגואה, שקיימת כמשקולות Apache-2.0, דו"ח טכני מתאריך 12 בספטמבר 2026, ושום דבר שאפשר לקרוא לו. את אחד מאלה אפשר לחבר לקו טלפון עד סוף השבוע. את האחר אפשר לקרוא. מסתבר שהאסימטריה הזו היא השוואה שימושית הרבה יותר מלוח תוצאות, מפני ששני המודלים עשו כמעט את אותו הימור ארכיטקטוני, ואז התפצלו לחלוטין בשאלה מה לעשות איתו.

התשובה הקצרה

בחר ב-Grok Voice Think Fast 2.0 אם אתה צריך סוכן קולי שעובד עכשיו, בפרודקשן, עם מחירון שאפשר להכניס לתקציב והבטחת השהיה שאפשר לבדוק. בחר ב-Realtime-Venus אם אתה צריך שהסטאק יהיה בבעלותך — אם הנתונים שלך לא יכולים לצאת מהתשתית שלך, אם אתה צריך לכוונן את ה-Front End, או אם אתה בוחן את הארכיטקטורה ולא משיק מוצר. אין מקרה שלישי שבו הם מתחרים, כי לאחד יש API ולשני אין.

הם מסכימים לגבי הבעיה הקשה

הדבר המעניין הוא עד כמה דומה האבחנה. שני המודלים קיימים בגלל אותה סתירה: שליטה בשיחה חייבת לפעול ברזולוציה תת־שנייה, והחשיבה אורכת שניות. מודל שעוצר כדי לחשוב מפסיק להרגיש נוכח.

Grok Voice Think Fast 2.0 פותר זאת בכך שהוא מנמק בזמן שהוא מדבר. סדרת Think Fast נבנתה על הרעיון שהמודל לא אמור להסיק תחילה ולייצר דיבור לאחר מכן; במקום זאת הוא מזרים דיבור וחושב במקביל, כך שקריאה לכלי יכולה לפעול לפני שהסוכן סיים את המשפט הראשון שלו. xAI מדווחת שגרסה 2.0 משתמשת בערך ב-0.4 מטוקני החשיבה של קודמתה, מה שמוצג כשיפור בעלות ובהשהיה ולא באיכות.

Realtime-Venus פותר זאת בכך שהוא לא פותר זאת כלל בצד הפרונטאנד. זמן הריצה הדו-לולאי שלו מחזיק לולאת אינטראקציה בת שנייה אחת — תפיסה, שליטה בתורות, יצירת דיבור — ומעביר כל דבר עתיר משאבים לרכיב נפרד בשם Realtime-Venus-Harness באמצעות סמני האצלה אסינכרוניים הנפלטים ברצף הנסתר של המודל עצמו. השיחה בחזית לעולם אינה נעצרת. תוצאות הרקע משולבות מחדש כשהן מגיעות.

אלה תשובות הנדסיות שונות לאותה שאלה, ויש להן מצבי כשל שונים. חשיבה תוך כדי דיבור מטילה את הנטל על המודל לשמור על שני החוטים קוהרנטיים. האצלה מטילה את הנטל על סביבת ההרצה למנוע משתי הלולאות להשחית זו את זו — ולכן לכידת המשימה הסיבתית של מאמר Realtime-Venus, תמונת מצב מבודדת לכל משימה מואצלת, היא הפרט שנושא את התכנון.

המדד היחיד שעל פיו ניתן למדוד את שניהם

בנצ'מרקים של דופלקס מלא הם המקום היחיד שבו השניים הללו חופפים, והם אינם חופפים באופן נקי.

• טיפול בהפרעות — Realtime-Venus מדווחת שהיא מגיבה ל-75% מהפרעות המשתמשים ב-Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 משיג 95.1% ב-Full Duplex Bench לפי Artificial Analysis, עלייה מ-77.8% בגרסה 1.0.

• המשכיות בחפיפה — Realtime-Venus מדווחת על 97% המשכיות תחת תגובות גיבוי, 88% תחת דיבור המופנה לזולת, ו-86% תחת דיבור רקע, ומציינת שהיא עולה על Gemini 3.1 Live ועל GPT-4o בכל שלושת המקרים.

• מכשירים שונים, מחברים שונים — הנתונים של Realtime-Venus מגיעים מדוח טכני משלה, ללא שחזור חיצוני. הנתונים של Grok מגיעים מצד שלישי שהריץ את המודל. השוואה בין מספר שמדווח על ידי עצמו למספר שנמדד באופן בלתי תלוי אינה השוואה, והפער שלמעלה סביר באותה מידה שהוא מתודולוגי כמו שהוא אמיתי.

הקריאה הכנה: על סמך הראיות הזמינות, Grok Voice Think Fast 2.0 הוא היחיד מבין השניים שהתנהגות הדופלקס המלא שלו נמדדה בידי מישהו שאין לו אינטרס בתוצאה.

לאן המספרים העצמאיים מציבים את Grok Voice Think Fast 2.0

הקריאה העדכנית הנקייה ביותר מגיעה מ-Speech Agent Arena של Artificial Analysis, שמדרגת מודלים לפי העדפה עיוורת בשיחות קוליות חיות במשימות כמו קביעת תור לרופא שיניים והזמנת אוכל מוכן. נכון ל-18 בספטמבר 2026, Grok Voice Think Fast 2.0 High נמצא במקום השביעי מתוך יותר מעשרים רשומות בדירוג Elo של 1,011 על פני 552 דגימות — מאחורי Gemini 3.1 Flash Live Minimal של Google עם 1,096, Gemini 3.8 Live עם 1,083 ו-GPT-Live-1 עם 1,053, ובפער ניכר מקודמו, Grok Voice Think Fast 1.0, עם 908.

העמודה שליד ה-Elo היא המעניינת יותר. בשיעור הצלחת המשימות, Grok Voice Think Fast 2.0 רושם 94.6%, הנתון הגבוה ביותר בכל עשרים המובילים הגלויים — מעל 93.2% של Gemini 3.8 Live, 91.5% של GPT-Realtime-2.1 High ו-90.9% של GPT-Live-1. שביעי לפי העדפה, ראשון לפי השלמת משימות, הוא פרופיל יוצא דופן וספציפי למדי: המאזינים לא אוהבים את הקול, אבל הוא מסיים את העבודה. אם המוצר שלכם עושה דברים ולא מנהל שיחות, זו העמודה שמנבאת את התוצאה שלכם, והיא הראיה העצמאית החזקה ביותר שיש לאחד משני המודלים הללו.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

הנתונים ש-xAI פרסמה בעת ההשקה הם כלי מדידה אחר, ויש לקרוא אותם בנפרד: 82.9% במדד איכות הדיבור-אל-דיבור של Artificial Analysis, מקום ראשון בבנצ'מרק הסוכני τ-Voice עם 56.5%, 97.2% ב-Big Bench Audio ו-95.1% ב-Full Duplex Bench. אלה היו הדירוגים כשהמודל הושק בסוף יולי 2026, ולוחות הדירוג בקטגוריה הזו זזים מדי חודש — וזו בדיוק הסיבה שטבלת הזירה שלמעלה, כשהיא נקראת היום, שווה יותר ממספרי ההשקה.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

החשבון, והחלקים ממנו שאינם על החשבון

Grok Voice Think Fast 2.0 עולה $0.08 לדקת אודיו, בערך $4.80 לשעה, בתוספת $0.004 עבור כל הודעת קלט טקסט. זוהי עלייה של 60% לעומת $0.05 לדקה שגרסה 1.0 גבתה בהשקה, ו-xAI העבירה את grok-voice-latest, הכינוי המתגלגל ל-2.0 אוטומטית ב-5 באוגוסט 2026, כך שצוותים שרצו להישאר במחיר הישן היו צריכים לנעוץ גרסה מפורשת לפני תאריך זה. מודל התשלום לפי דקה גם אומר ששיפורי יעילות נזקפים לזכות הספק: אם המודל ישתפר ויסיים שיחות מהר יותר, החיוב שלך לשיחה יורד, אבל העלות שלך לדקה לא.

Realtime-Venus אין לו חשבון, כי אין לו שירות. מה שיש לו במקום זה הוא רצפת חומרה. שני צ'קפוינטים של 9B ב-BF16 הם בערך שמונה-עשר ג'יגה-בייט של משקולות כל אחד לפני זיכרון אקטיבציה, והכרטיס מתעד לולאת סטרימינג לפי שנייה שצריכה לרוץ ברציפות. לצומת GPU שמסוגל לכך יש עלות חודשית, והיא קבועה — אתה משלם אותה בין אם מישהו מבצע קריאות ובין אם לא. עבור מוצר עם תעבורה יציבה, זה זול יותר מ-$4.80 לשעה. עבור מוצר עם תעבורה לסירוגין, זה יקר באופן דרמטי יותר, ונקודת ההצטלבות היא השאלה הפיננסית היחידה שמשנה כאן.

משקלים, בקרה, ומה כל אחד מהם מאפשר לך לשנות

כאן זה המקום שבו שני המודלים מפסיקים להיות ברי השוואה בכלל.

• כיוונון עדין — Realtime-Venus מגיע עם משקלים. אתה יכול לכוונן אותם עדין, לכמת אותם, להריץ אותם בסביבה מנותקת מרשת, ולבדוק כל שכבה. Grok Voice Think Fast 2.0 הוא מודל סגור ומתארח; מה שאתה יכול לשנות הוא הפרומפט, בחירת הקול והכלים שאתה רושם.

• קול — Grok Voice Think Fast 2.0 מגיע עם קולות מוגדרים מראש ותומך בשיבוט קול מותאם אישית מכדקה בערך של דיבור. Realtime-Venus מגיע עם קול ייחוס ומפענח token-to-waveform מצורף, וכל מה שמעבר לזה הוא הבעיה שלך.

• טווח — Grok Voice Think Fast 2.0 תומך ביותר מ-25 שפות ומדבר PCM16 בקצב 24 kHz כברירת מחדל עם μ-law לטלפוניה, דרך סשן WebSocket שתואם ל-OpenAI Realtime. התאימות הזו היא נכס הגירה אמיתי: רוב קוד הקול בזמן אמת הקיים זקוק לשינוי בכתובת בסיס ובמפתח. Realtime-Venus מתעד אנגלית וסינית.

• וידאו — Realtime-Venus-Omni מקבל וידאו ותמונות בזרימה דרך מקודד SigLIP2 ומבצע תפיסה חזותית רציפה. Grok Voice Think Fast 2.0 הוא שמע וטקסט; אין מסלול מצלמה.

• הקשר ארוך — Realtime-Venus כוללת חלון הקשר של 40,960 טוקנים וזיכרון וידאו ארוך ללא אימון, שניתן להפעיל על חלון של ארבעים דקות. Grok Voice Think Fast 2.0 הוא מודל סשן ללא תכונת זיכרון דומה שפורסמה.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

היכן כל אחד נשבר

הכשלים שכדאי לתכנן לקראתם הם הפוכים. החשיפה של Grok Voice Think Fast 2.0 היא ריכוזיות ספקים ושיווק בלתי ניתן לאימות: תוצאות ה-A/B של Starlink מבית xAI, מכפילי דיוק התמלול שלה ומסגור המהירות שלה — כל אלה מדווחים על ידי החברה בלי שפורסמו נתוני הבסיס, ומודל חיוב לפי דקה שמשנה את המחיר ב-60% בין גרסאות כבר הוכיח שהוא ישנה את המחיר. נעלו את הגרסה שלכם והריצו הערכות משלכם על האודיו שלכם.

החשיפה של Realtime-Venus היא שאיש לא הריץ אותה. המדדים שלה מדווחים על ידי עצמה, מערך הבדיקות שלה אינו מתועד ביחס לחשיבותו, והשהיה שלה בפריסה אמיתית אינה ידועה — הדוח מתאר קצב אינטראקציה של שנייה אחת, שהוא פרמטר תכנון, לא זמן מדוד עד לאודיו ראשון. למודל בלי API ובלי שחזור אין עבר מוכח, אלא רק מפרט.

קיימת דרך ביניים שראוי להציג אותה בגלוי, כי היא מה שרוב הצוותים יעשו בפועל. אם אתם בונים מערכת מבוססת האצלה — בחרו לעצמכם את החזית, והעבירו את העבודה היקרה למודל טקסט — החזית ורגל ההסקה לא חייבות לבוא מאותו מקום. OrcaRouter אינה מספקת לא את Realtime-Venus ולא את Grok Voice Think Fast 2.0; שתי שכבות הקול נמצאות מחוץ למה שאנחנו מספקים, ואנחנו אומרים זאת בגלוי במקום לרמוז אחרת. הרגל המואצלת היא עניין אחר.כמעט 200 מודלים של טקסט יושבים מאחורי מפתח אחד במחיר המחירון של הספק, בלי תוספת, עם מעבר אוטומטי לגיבוי כך שתקלה במעלה הזרם לא מפילה שיחה חיה, DSL לניתוב להרכבת כמה מודלים לשיחה אחת, ומיזוג מודלים להחלטות שראויות ליותר מדעה אחת. זהו החצי של סוכן קולי שמרוויח מכך שאפשר להחליפו, וזה החצי שאפשר לשנות בלי לגעת במודל שמנהל את השיחה.

איזה אחד לבחור?

בחר את Grok Voice Think Fast 2.0 ברבעון הזה. הוא זמין, הוא עבר בנצ'מרק עצמאי, הוא ראשון בהערכה האג'נטית שחוזה אם הסוכן שלך יכול לעשות משהו שימושי, ו-0.70 שניות עד לאודיו הראשון הוא מספר שאפשר לבנות סביבו חוויית משתמש. תקצב עלייה של 60% במחיר לעומת 1.0 ונעל את גרסת המודל שלך.

בחר ב-Realtime-Venus רק אם האילוץ הוא בעלות. אם הפריסה שלך לא יכולה לקרוא ל-API חיצוני, אם אתה צריך לבצע כוונון עדין של החזית השיחתית, או אם אתה צריך את המצלמה — שלושת המקרים האלה הם כל המקרה, והם חזקים כשהם חלים.

מה שלא אמור להכריע את זה הוא טבלת הבנצ'מרק, כי שני הצדדים שלה הופקו על ידי אנשים שונים בתנאים שונים. המספרים של Grok Voice Think Fast 2.0 נמדדו על ידי מישהו אחר. אלה של Realtime-Venus לא. עד שזה ישתנה, ההשוואה שבאמת זמינה היא בין מוצר לבין מאמר.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית