بطاقة عنوان رئيسية لـ 'Realtime-Venus vs Grok Voice Think Fast 2.0'، بعنوان فرعي 'يمكن شراء أحدهما هذا بعد الظهر. والآخر مجرد تنزيل.'، مع ثلاث بطاقات مكتوب عليها 'Grok Voice Think Fast 2.0: $0.08 لكل دقيقة صوتية، 0.70 ثانية إلى أول صوت'، و'Realtime-Venus: أوزان Apache-2.0، لا API، لا بطاقة أسعار'، و'الرهان المشترك: التفكير أثناء التحدث، لا قبله'، فوق شريط تذييل مكتوب عليه 'أرقام Grok وفقًا لـ Artificial Analysis ووثائق xAI؛ أرقام Realtime-Venus من تقريره الفني، غير مُعاد إنتاجها.' شعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Guides & Insights

Realtime-Venus مقابل Grok Voice Think Fast 2.0: واحد فقط من هذين لديه سعر

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع Realtime-Venus وGrok Voice Think Fast 2.0 جنبًا إلى جنب، وسيكون أول فرق ليس معيارًا مرجعيًا، بل أمر شراء. Grok Voice Think Fast 2.0 نموذج مستضاف للكلام إلى الكلام طُرح للبيع في 29 يوليو 2026 بسعر 0.08 دولار لكل دقيقة صوتية، مع زمن معلن للوصول إلى أول صوت يبلغ 0.70 ثانية ونتائج معيارية من طرف ثالث. أما Realtime-Venus فهو نظام ثنائي الاتجاه الكامل بحجم 9B من فريق Venus التابع لمجموعة Ant وجامعة تسينغهوا، وموجود في صورة أوزان Apache-2.0، وتقرير تقني بتاريخ 12 سبتمبر 2026، ولا شيء يمكنك استدعاؤه. يمكنك توصيل أحدهما بخط هاتفي قبل نهاية الأسبوع. والآخر يمكنك قراءته. يتبين أن هذا التفاوت مقارنة أكثر فائدة بكثير مما قد تكون عليه لوحة نتائج، لأن النموذجين قاما بالرهان المعماري نفسه تقريبًا ثم اختلفا تمامًا في ما ينبغي فعله به.

الإجابة المختصرة

اختر Grok Voice Think Fast 2.0 إذا كنت بحاجة إلى وكيل صوتي عامل الآن، في بيئة الإنتاج، مع قائمة أسعار يمكنك إدراجها في الميزانية وضمان زمن استجابة يمكنك اختباره. اختر Realtime-Venus إذا كنت بحاجة إلى امتلاك المنظومة الكاملة — إذا كانت بياناتك لا يمكن أن تغادر بنيتك التحتية، أو إذا كنت بحاجة إلى ضبط الواجهة الأمامية بدقة، أو إذا كنت تقيّم البنية المعمارية بدلاً من إطلاق منتج. لا توجد حالة ثالثة يتنافسان فيها، لأن أحدهما لديه API والآخر لا.

يتفقون بشأن المشكلة الصعبة

المثير للاهتمام هو مدى تشابه التشخيص. كلا النموذجين موجودان بسبب التناقض نفسه: يجب أن يعمل التحكم في المحادثة على مستوى أجزاء من الثانية، بينما يستغرق الاستدلال ثوانٍ. النموذج الذي يتوقف لكي يفكر يتوقف عن الإحساس بالحضور.

يحل Grok Voice Think Fast 2.0 هذه المشكلة عبر الاستدلال أثناء التحدث. بُنيت سلسلة Think Fast على فكرة أن النموذج ينبغي ألا يستنتج أولاً ثم يولّد الكلام ثانياً؛ بل يبثّ الكلام ويفكّر بالتوازي، بحيث يمكن إطلاق استدعاء أداة قبل أن يُكمل الوكيل جملته الأولى. وتفيد xAI بأن الإصدار 2.0 يستخدم نحو 0.4 ضعف رموز الاستدلال لدى سابقه، وهو ما يُقدَّم باعتباره تحسيناً في التكلفة والكمون لا في الجودة.

تحلّ Realtime-Venus هذه المشكلة بعدم حلّها في الواجهة الأمامية على الإطلاق. يُبقي زمن تشغيلها ثنائي الحلقة حلقة تفاعل مدتها ثانية واحدة قيد التشغيل — الإدراك، والتحكم في الأدوار، وتوليد الكلام — ويُحيل أي شيء مكلف إلى مكوّن منفصل يُدعى Realtime-Venus-Harness عبر علامات تفويض لاتزامنية تُصدَر في التسلسل المخفي للنموذج نفسه. لا تتوقف المحادثة الأمامية أبدًا. وتُعاد نتائج الخلفية إلى الدمج عند وصولها.

تلك إجابات هندسية مختلفة عن السؤال نفسه، ولها أنماط فشل مختلفة. إن التفكير أثناء التحدث يضع العبء على النموذج للحفاظ على تماسك الخيطين معًا. أما التفويض فيضع العبء على بيئة التشغيل لمنع الحلقتين من إفساد إحداهما الأخرى — ولهذا فإن التقاط المهمة السببي في ورقة Realtime-Venus، أي لقطة حالة معزولة لكل مهمة مفوّضة، هو التفصيل الذي يحمل التصميم.

المقياس الوحيد الذي يمكن قياسهما به معًا

اختبارات الأداء الخاصة بالإرسال والاستقبال الكامل (full-duplex) هي المكان الوحيد الذي يتداخل فيه هذان الاثنان، وهما لا يتداخلان بشكل نظيف.

• التعامل مع المقاطعات — تفيد Realtime-Venus بأنها تستجيب لـ 75% من مقاطعات المستخدم على Full-Duplex-Bench v1.5. وتسجّل Grok Voice Think Fast 2.0 نسبة 95.1% على Full Duplex Bench وفقًا لـ Artificial Analysis، ارتفاعًا من 77.8% في الإصدار 1.0.

• الاستمرارية في ظل التداخل — تفيد Realtime-Venus باستمرارية بنسبة 97% تحت القنوات الخلفية، و88% تحت الكلام الموجّه إلى الآخر، و86% تحت كلام الخلفية، وتصرّح بأنه يتجاوز Gemini 3.1 Live وGPT-4o في الثلاثة جميعًا.

• أدوات مختلفة، مؤلفون مختلفون — أرقام Realtime-Venus تأتي من تقريرها التقني الخاص دون أي إعادة إنتاج خارجية. أرقام Grok تأتي من طرف ثالث قام بتشغيل النموذج. مقارنة رقم مُبلَّغ عنه ذاتيًّا برقم تم قياسه بشكل مستقل ليست مقارنة، ومن المرجح أن يكون الفارق أعلاه منهجيًّا بقدر ما هو حقيقي.

القراءة الصادقة: استنادًا إلى الأدلة المتاحة، فإن Grok Voice Think Fast 2.0 هو الوحيد من بين الاثنين الذي قام بقياس سلوكه ثنائي الاتجاه الكامل شخصٌ لا مصلحة له في النتيجة.

حيث تضع الأرقام المستقلة Grok Voice Think Fast 2.0

تأتي أنقى قراءة حالية من Speech Agent Arena التابعة لـ Artificial Analysis، والتي تُقيّم النماذج وفق التفضيل الأعمى عبر محادثات صوتية مباشرة في مهام مثل حجز موعد لدى طبيب أسنان وطلب طعام جاهز. اعتبارًا من 18 سبتمبر 2026، يحتل Grok Voice Think Fast 2.0 High المركز السابع من بين أكثر من عشرين مشاركًا برصيد Elo يبلغ 1,011 عبر 552 عينة — خلف Gemini 3.1 Flash Live Minimal من Google عند 1,096، وGemini 3.8 Live عند 1,083، وGPT-Live-1 عند 1,053، وبفارق كبير عن سابقه Grok Voice Think Fast 1.0 عند 908.

العمود المجاور لـ Elo هو الأكثر إثارة للاهتمام. في معدل نجاح المهام، يسجّل Grok Voice Think Fast 2.0 نسبة 94.6%، وهي أعلى رقم في أي مكان ضمن أفضل عشرين الظاهرين — فوق 93.2% لـ Gemini 3.8 Live، و91.5% لـ GPT-Realtime-2.1 High، و90.9% لـ GPT-Live-1. السابع بحسب التفضيل، والأول في إكمال المهام، هو ملف غير معتاد ومحدد جدًا: لا يحب المستمعون الصوت، لكنه ينجز المهمة. إذا كان منتجك يفعل أشياء بدلًا من الدردشة، فهذا هو العمود الذي يتنبأ بنتيجتك، وهو أقوى دليل مستقل يمتلكه أيٌّ من هذين النموذجين.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

الأرقام التي نشرتها xAI عند الإطلاق تخص أداة قياس مختلفة وينبغي قراءتها على نحو منفصل: 82.9% في مؤشر جودة الكلام إلى الكلام التابع لـ Artificial Analysis، والمركز الأول في معيار τ-Voice الوكيلي بنسبة 56.5%، و97.2% في Big Bench Audio و95.1% في Full Duplex Bench. كانت تلك هي المراكز عندما صدر النموذج في أواخر يوليو 2026، ولوحات الترتيب في هذه الفئة تتحرك شهريًا — وهذا بالضبط سبب أن جدول الساحة أعلاه، عند قراءته اليوم، أكثر قيمة من أرقام الإطلاق.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

الفاتورة، والأجزاء منها التي ليست على الفاتورة

تبلغ تكلفة Grok Voice Think Fast 2.0 حوالي 0.08 دولار لكل دقيقة من الصوت، أي نحو 4.80 دولار في الساعة، إضافة إلى 0.004 دولار لكل رسالة نصية مُدخلة. وهذا يمثل زيادة بنسبة 60% عن 0.05 دولار لكل دقيقة التي كانت تفرضها النسخة 1.0 عند الإطلاق، وقد نقلت xAI الاسم المستعار المتجدد grok-voice-latest إلى الإصدار 2.0 تلقائيًا في 5 أغسطس 2026، لذا كان على الفرق التي أرادت البقاء على السعر القديم تثبيت إصدار صريح قبل ذلك التاريخ. كما يعني نموذج التسعير حسب الدقيقة أن تحسينات الكفاءة تعود على المزوّد: إذا تحسّن النموذج في إنهاء المكالمات بشكل أسرع، تنخفض فاتورتك لكل مكالمة، لكن تكلفتك لكل دقيقة لا تنخفض.

لا توجد فاتورة لـ Realtime-Venus، لأنه لا يقدّم خدمة. وما لديه بدلاً من ذلك هو حدّ أدنى من العتاد. نقطتا حفظ بحجم 9B بصيغة BF16 تبلغ كل منهما نحو ثمانية عشر غيغابايت من الأوزان، قبل احتساب ذاكرة التنشيط، وتوثّق البطاقة حلقة بثّ لكل ثانية يجب أن تعمل باستمرار. عقدة GPU قادرة على ذلك لها تكلفة شهرية، وهي تكلفة ثابتة — تدفعها سواء اتصل أحد أم لم يتصل. وبالنسبة لمنتج ذي مرور ثابت، فإن ذلك أرخص من 4.80 دولارات في الساعة. أما بالنسبة لمنتج ذي مرور متقطّع، فهو أغلى بكثير، ونقطة التقاطع هي المسألة المالية الوحيدة المهمة هنا.

الأوزان، والتحكم، وما يتيح لك كل منها تغييره

وهنا يتوقف النموذجان تمامًا عن كونهما قابلين للمقارنة.

• الضبط الدقيق — تأتي Realtime-Venus مزوّدة بالأوزان. يمكنك ضبطها بدقة، وتكميمها، وتشغيلها في بيئة معزولة تماماً، وفحص كل طبقة. أما Grok Voice Think Fast 2.0 فهو نموذج مُستضاف مغلق؛ وما يمكنك تغييره هو الموجّه، واختيار الصوت، والأدوات التي تسجّلها.

• الصوت — تتضمن Grok Voice Think Fast 2.0 أصواتًا مسبقة الضبط وتدعم استنساخ الصوت المخصص من حوالي دقيقة واحدة من الكلام. تتضمن Realtime-Venus صوتًا مرجعيًا ومُفكِّك ترميز مدمجًا يحوّل الرموز إلى شكل موجي، وأي شيء يتجاوز ذلك فهو مشكلتك.

• الانتشار — يدعم Grok Voice Think Fast 2.0 أكثر من 25 لغة، ويتحدث PCM16 عند 24 kHz افتراضيًا مع μ-law للاتصالات الهاتفية، عبر جلسة WebSocket متوافقة مع OpenAI Realtime. هذا التوافق ميزة حقيقية للترحيل: تحتاج معظم شيفرة الصوت في الزمن الحقيقي الحالية إلى تغيير عنوان URL الأساسي والمفتاح فقط. توثّق Realtime-Venus اللغتين الإنجليزية والصينية.

• الفيديو — يستقبل Realtime-Venus-Omni الفيديو المتدفق والصور عبر مُشفِّر SigLIP2 ويقوم بإدراك بصري مستمر. أما Grok Voice Think Fast 2.0 فهو بالصوت والنص؛ ولا يوجد مسار للكاميرا.

• سياق طويل — يحمل Realtime-Venus سياقًا من 40,960 توكن وذاكرة فيديو طويل بدون تدريب يمكن تفعيلها على نافذة مدتها أربعون دقيقة. Grok Voice Think Fast 2.0 هو نموذج جلسة لا يمتلك ميزة ذاكرة منشورة مماثلة.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

أين ينكسر كل واحد

حالات الفشل التي تستحق التخطيط لها هي العكس. تتمثل نقاط تعرّض Grok Voice Think Fast 2.0 للمخاطر في تركّز المورّد والتسويق غير القابل للتحقق: فنتائج Starlink A/B الخاصة بـ xAI، ومضاعفات دقة النسخ، وتأطير السرعة، كلها مُبلَّغ عنها من الشركة دون نشر البيانات الأساسية، ونموذج التسعير بالدقيقة الذي يغيّر السعر بنسبة 60% بين الإصدارات قد أثبت أنه سيغيّر السعر. ثبِّت إصدارك وأجرِ تقييماتك الخاصة على تسجيلاتك الصوتية الخاصة.

مكمن انكشاف Realtime-Venus أنه لم يشغّله أحد. فمعاييره المرجعية مُبلَّغ عنها ذاتيًا، وإطار اختباره غير موثّق قياسًا إلى أهميته، وزمن استجابته في نشر فعلي غير معروف — يصف التقرير وتيرة تفاعل مدتها ثانية واحدة، وهي معامل تصميمي، وليست زمنًا مقيسًا للوصول إلى أول صوت. والنموذج الذي لا يملك API ولا إعادة إنتاج ليس له سجل أداء، بل مواصفة فقط.

هناك مسار وسط يستحق أن يُقال بوضوح، لأنه ما ستفعله معظم الفرق فعلاً. إذا كنت تبني نظاماً قائماً على التفويض — اختر واجهتك الأمامية بنفسك، وسلّم العمل المكلف إلى نموذج نصي — فلا يلزم أن تأتي الواجهة الأمامية وساق الاستدلال من المصدر نفسه. لا يقدّم OrcaRouter أياً من Realtime-Venus أو Grok Voice Think Fast 2.0؛ فكلا طبقتي الصوت تقعان خارج ما نقدّمه، ونقول ذلك بدلاً من الإيحاء بخلافه. أما الساق المفوّضة فمسألة مختلفة. ما يقارب 200 نموذج نصي خلف مفتاح واحد بسعر المزوّد المعلن دون أي هامش، مع تحويل تلقائي عند الفشل كي لا يؤدي انقطاع لدى المزوّد إلى إسقاط مكالمة جارية، ولغة DSL للتوجيه لتأليف عدة نماذج في مكالمة واحدة، ودمج النماذج للقرارات التي تستحق أكثر من رأي واحد. هذا هو النصف من وكيل صوتي الذي يستفيد من قابلية التبديل، وهو النصف الذي يمكنك تغييره دون المساس بالنموذج الذي يدير المحادثة.

أي واحدة تختار؟

اختر Grok Voice Think Fast 2.0 هذا الربع. فهو متاح، وهو مُقيَّم بمعايير مستقلة، وهو الأول في التقييم الوكيلي الذي يتنبأ بما إذا كان وكيلك قادرًا على فعل شيء مفيد، و0.70 ثانية حتى أول صوت هو رقم يمكنك بناء تجربة مستخدم حوله. خصص ميزانية لارتفاع السعر بنسبة 60% مقارنة بالإصدار 1.0 وثبّت نسخة نموذجك.

اختر Realtime-Venus فقط إذا كان القيد هو الملكية. إذا كان نشرك لا يستطيع استدعاء واجهة برمجة تطبيقات خارجية، أو إذا كنت بحاجة إلى الضبط الدقيق للواجهة الأمامية للمحادثة، أو إذا كنت بحاجة إلى الكاميرا — فهذه الحالات الثلاث هي القضية بأكملها، وهي حالات قوية عندما تنطبق.

ما ينبغي ألا يحسم الأمر هو جدول المعايير، لأن جانبيْه أنتجهما أشخاص مختلفون في ظروف مختلفة. أرقام Grok Voice Think Fast 2.0 قاسها شخص آخر. أما أرقام Realtime-Venus فلم تُقَس بواسطة شخص آخر. وإلى أن يتغير ذلك، فإن المقارنة المتاحة فعليًا هي بين منتج وورقة بحثية.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا