
Grok Voice Think Fast 2.0: شرح أسرع وأغلى وكيل صوتي من xAI
- qwenجديدQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 لكل مليون رمز · 56 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3150الذكاء69البرمجة
- qwenجديدQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 201 tok/s
- orcaجديدOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicجديدAnthropic: Claude Opus 52026-07-2461الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2150الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1651الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1557الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0951الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0955الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0959الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0854الذكاء72البرمجة
- tencentTencent: Hy32026-07-0641الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3053الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
- z-aiZ.ai: GLM 5.22026-06-1651الذكاء69البرمجة60الرياضيات
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242الذكاء61البرمجة61الرياضيات
أصدرت xAI Grok Voice Think Fast 2.0 في 29 يوليو 2026 — وهو ما تصفه xAI نفسها بأنه «نموذج الصوت إلى الصوت الأكثر قدرة»، والرائد الجديد في خط وكلائها الصوتيين. يستجيب أسرع من أي منافس في المراكز الخمسة الأولى (0.70 ثانية حتى أول صوت)، ويتصدر معيار الصوت الوكيل، وينسخ بدقة أعلى من الجيل السابق. كما أنه أغلى بنسبة 60% في الدقيقة الواحدة من النموذج الذي يستبدله، ويُطرح بنظام احتساب بالدقيقة يرفع فاتورتك دون أن تلاحظ، ويأتي مع مفتاح تبديل للاسم المستعار للإصدار يتم تلقائيًا خلال أسبوع. يشرح هذا الدليل ما هو Think Fast 2.0 في الحقيقة، وما الذي غيّرته xAI في الكواليس، وكيف تنقسم قصة المعايير إلى نتائج مستقلة وادعاءات يقدمها البائع، وما هي تكلفته الفعلية بعد إجراء الحسابات، وكيفية استدعائه — إلى جانب المحاذير التي من الحكمة قراءتها قبل توجيه تدفق مكالمات إنتاجي عبره.
ملاحظة بشأن الدقة: تفاصيل الإطلاق والأسعار ودقة العناوين الرئيسية والادعاءات التجارية مأخوذة من إعلان xAI ووثائقها (2026-07-29). نتائج التقييم المركّبة من Artificial Analysis مستقلة ومُقاسة من طرف ثالث. الادعاءات التي ذكرتها xAI — نتائج اختبار Starlink A/B، ومضاعفات النسخ، وعبارة "عدد رموز الاستدلال أقل بنسبة 60%"، وعبارة "أسرع بنحو 5 مرات" — لم تُنشر بياناتها الأساسية؛ تعامل معها كأرقام استرشادية من البائع وأجرِ تقييماتك الخاصة. المواصفات والأسعار وسلوك الأسماء المستعارة قابلة للتغيير؛ تحقق منها قبل البناء.
باختصار. نموذج Grok Voice Think Fast 2.0 هو نموذج xAI للتحويل من كلام إلى كلام من البداية إلى النهاية للوكلاء الصوتيين: إدخال صوتي، وإخراج صوتي عبر WebSocket، دون خط أنابيب منفصل ASR→LLM→TTS. إنه سريع حقًا (0.70 ثانية للوصول إلى أول صوت، وهو النموذج الوحيد ضمن الخمسة الأوائل الذي يقل عن ثانية) وقوي حقًا في العمل الصوتي للوكلاء، حيث يحتل المرتبة الأولى في معيار τ-Voice للوكلاء من Artificial Analysis (56.5%) بينما يحتل المرتبة الثانية إجمالًا في مؤشر جودة الكلام إلى الكلام (82.9%)، خلف Qwen Audio 3.0 Realtime Plus (84.1%). إنه يفكر أثناء التحدث — مما يقلل الاستخدام الوسيط لرموز التفكير إلى حوالي 40% من النموذج القديم — وتكلفته $0.08 للدقيقة، مرتفعًا من $0.05. والمشكلة هي العداد: الصوت يُفوتر بالدقيقة على أساس زمن الصوت الفعلي، لذا فإن زيادة السعر بنسبة 60% على نموذج تكلفة تشغيله أرخص تنعكس مباشرة على فاتورتك. وفي 5 أغسطس، سيبدأ الاسم المستعار grok-voice-latest في التوجيه إلى 2.0 تلقائيًا، لذا تحتاج الفرق التي تستخدم الإصدار القديم إلى تثبيته عمدًا قبل ذلك الموعد.
النقاط الرئيسية
• تحويل الكلام إلى كلام بشكل أصلي: نموذج واحد من الميكروفون إلى السماعة، دون سلسلة ASR→LLM→TTS — ولهذا يصل أول صوت خلال 0.70 ثانية.
• الرائد في الأنظمة الوكيلة: #1 في معيار τ-Voice للوكلاء من Artificial Analysis (56.5%)، متقدم بفارق كبير على GPT-Realtime-2.1 (45.7%) وGemini 3.1 Flash (37.7%).
• ليس القائد الإجمالي: #2 في مؤشر جودة الكلام-إلى-كلام (82.9%)، خلف Qwen Audio 3.0 Realtime Plus (84.1%)؛ لا تزال OpenAI تتفوق في ديناميكيات المحادثة (95.7% مقابل 95.1%).
• أغلى بنسبة 60%: $0.08/دقيقة (حوالي $4.80/ساعة) مقابل $0.05/دقيقة لـ Think Fast 1.0 — على الرغم من أن النموذج يستخدم حوالي 60% أقل من رموز الاستدلال حسب التقارير.
• تبديل الاسم المستعار في 5 أغسطس: grok-voice-latest يوجَّه تلقائيًا إلى 2.0؛ ثبّت grok-voice-think-fast-1.0 قبل ذلك للبقاء على الإصدار الأرخص.
• ضع علامة على كل ادعاء: نتائج Artificial Analysis مستقلة؛ بينما Starlink A/B ومضاعفات النسخ وتأطير السرعة واردة من xAI وغير منشورة.
ما هو Grok Voice Think Fast 2.0
Grok Voice هي عائلة xAI من النماذج اللحظية للكلام-إلى-كلام. "Think Fast" هو خط الاستجابة السريعة، الذي أُطلق أصلاً مع Voice Agent Builder في أبريل 2026؛ Think Fast 2.0 هو الجيل الثاني من هذا الخط، صدر في 29 يوليو 2026. النموذج تكاملي من البداية إلى النهاية: يستهلك الصوت الخام، ويُفكّر، ويُصدر الصوت مباشرة، بدلاً من تشغيل خط معالجة لنموذج تعرّف الكلام يغذي نموذج لغة نصي (LLM) يغذي نموذج تحويل نص-إلى-كلام. هذا الخيار المعماري هو جذر ميزة زمن الاستجابة — لا قفزات متسلسلة ولا نص وسيط، لذا يمكن للنموذج أن يبدأ استجابة بينما لا يزال يستمع.
تضعه xAI صراحةً لصالح وكلاء الذكاء الاصطناعي الصوتيين: خطوط دعم العملاء، والمبيعات الهاتفية، والاستقبال، والاتصالات الهاتفية، وتطبيقات أخرى حيث يتحدث نظامٌ مع شخصٍ في الوقت الفعلي ويحتاج إلى إنجاز أمور فعلية — كحجز مكالمة، أو تأهيل عميل محتمل، أو تحديث سجل، أو البحث على الويب — بدلاً من مجرد الدردشة. والتركيز على الجانب التنفيذي الفاعل، لا على مجرد النسخ أو التركيب الصوتي الخام، هو ساحة المعركة التي يستهدفها هذا الإطلاق.
ما الجديد مقارنةً بـ Think Fast 1.0
الترقية من الإصدار 1.0 ليست مجرد تغيير في الأرقام؛ تصف xAI ثلاثة تغييرات هيكلية:
• الاستدلال الكلامي المتوازي. يقوم النموذج بالتفكير في الاستعلام أثناء تحدثه، بدلاً من التفكير أولاً ثم التحدث لاحقًا. عمليًا، يمكن إطلاق استدعاءات الأدوات قبل أن يُنهي الوكيل جملته الأولى — وهو أمر بالغ الأهمية لتدفقات الصوت الحساسة لزمن الاستجابة.
• عدد أقل بكثير من رموز الاستدلال. تُفيد xAI أن استخدام رموز الاستدلال الوسيط انخفض إلى حوالي 0.4 ضعف ما كان عليه في الطراز السابق (أي أقل بنحو 60٪)، وهذا جزء من سبب قولها إن النموذج أرخص في التشغيل على الرغم من ارتفاع السعر.
• أسلوب محادثة مُتعلَّم بالتعزيز. أعاد التعلم بالتعزيز تشكيل طريقة حديثه: جُمل أقصر، سؤال واحد في كل مرة، وبلا حشو — أسلوب مكالمات أكثر إيجازًا وأكثر "بشرية" يناسب العمل الهاتفي حيث الإطالة تحرق الدقائق (وعند الاحتساب بالدقيقة، المال).
فيما يتعلق بالسرعة القابلة للقياس، انخفض زمن أول صوت من 1.25 ثانية في الإصدار 1.0 إلى 0.70 ثانية في الإصدار 2.0. وفيما يتعلق بالنسخ (التفريغ الصوتي)، تذكر xAI تحسنًا بنحو 1.4x عبر 24 لغة (وفقًا لما أبلغ عنه البائع، أدناه).

المعايير، معيارًا بمعيار
يستند الإطلاق إلى Artificial Analysis، وهي مؤسسة معايير مستقلة من طرف ثالث. هذا مهم: فعلى عكس معظم الأرقام الأخرى في الإعلان، فإن هذه الأرقام تُقاس بواسطة جهة محايدة، وهي الأرقام الجديرة بالمقارنة المباشرة. الصورة المركبة أفضل من عنوان واحد منفرد.
مؤشر جودة التحويل من الكلام إلى الكلام: 82.9% (المركز الثاني). هذا هو المجموع العام للتحويل من الكلام إلى الكلام، مرتفعًا من 75.7% لـ Think Fast 1.0. إنه يتفوق على GPT-Realtime-2.1 (79.1%) وGemini 3.1 Flash (69.5%) — لكنه ليس الأول. يتصدر Qwen Audio 3.0 Realtime Plus بنسبة 84.1%. لذا فإن عبارة "أفضل نموذج صوتي بشكل عام" مبالغة لا تدعمها البيانات؛ بينما "أسرع نموذج صوتي وكيل في المستوى الأعلى" دقيقة.
معيار τ-Voice للوكلاء: 56.5% (المركز الأول). هذا هو المقياس الذي يهم xAI أكثر من غيره، والترتيب حقيقي: 56.5% يتفوق على Think Fast 1.0 (52.1%)، وGPT-Realtime-2.1 (45.7%)، وGemini 3.1 Flash (37.7%). يقيس τ-Voice أداء الوكلاء الصوتيين — أي مدى نجاح النموذج في إكمال المهام عبر قناة صوتية، بما في ذلك استخدام الأدوات أثناء المحادثة. على المحور الضيق «هل ينجز المهمة»، يتصدر Grok. روّج ماسك لهذا الترتيب تحديدًا.
Big Bench Audio: 97.2%. معيار لاستدلال الكلام؛ أداء قوي، رغم أن Qwen سجلت رقمًا قياسيًا بنسبة 99.2%.
معيار الإرسال المزدوج الكامل: 95.1%. ديناميكيات المحادثة — التعامل مع المقاطعة، وتناوب الأدوار، والاقتحام. إنها قفزة كبيرة من 77.8% في الإصدار 1.0، لكن OpenAI ما تزال تتفوق عليها بنسبة 95.7%، وتتصدر Qwen بنسبة 98.4%.
الوقت حتى أول صوت: 0.70 ثانية. الرقم الأكثر أهمية لمنتجات الصوت الحقيقية. لقد انخفض من 1.25 ثانية وهو الرقم الوحيد دون الثانية بين أفضل خمسة نماذج مصنّفة؛ وتؤكد الاختبارات المستقلة إلى حد كبير استجابة أقل من ثانية. يبلغ زمن استجابة أول رمز في بث TTS حوالي 285 ملي ثانية. بالنسبة لاستخدام الهاتف والوقت الفعلي، فإن زمن الاستجابة هو المقياس الذي يشعر به المستخدم في كل دورة، وهنا يكون 2.0 الأفضل بشكل حاسم.
عند القراءة عبر الصفوف، يكون الملف الشخصي محددًا: الأسرع في الكلام، الأفضل في إنجاز المهام، الثاني إجمالاً، والثالث في براعة المحادثة. هذا نموذج ممتاز لوَكيل صوتي، وادعاء متوسط بأنه "أفضل صوت لروبوت المحادثة". اختره للوظائف التي يطابقها الصف العلوي.
دقة النسخ
بعيدًا عن المحادثة، تدّعي xAI دقة أفضل بشكل ملموس في النسخ. يُظهر تقييمها الداخلي عبر 24 لغة وآلاف العبارات دقة أفضل بنحو 1.4 مرة مقارنة بـ Think Fast 1.0، و1.5–2 مرة مقارنة بدقة النماذج المخصصة للنسخ مثل Deepgram Nova 3 وElevenLabs Scribe v2. في الظروف الواقعية المزعجة — ضوضاء الخلفية، ضغط الاتصالات الهاتفية، المكالمات منخفضة النطاق الترددي — تتسع الفجوة المبلغ عنها في الدقة مقارنة بنماذج STT المخصصة إلى نحو 10 مرات.
هذه تحديدًا هي الادعاءات التي يجب التعامل معها بحذر. إنها مبلَّغة من xAI؛ فمنظومة التقييم ومجموعات العبارات وملفات الضوضاء غير منشورة. سيكون إجراء اختبار مستقل لتفريغ الصوت الهاتفي المليء بالضوضاء الخاص بـ 2.0 مقارنةً بـ Deepgram أو ElevenLabs أمرًا قيّمًا، ولم يُنشر حتى وقت كتابة هذا النص. من الناحية الاتجاهية، تُعد النماذج الشاملة من البداية إلى النهاية التي تستوعب المزيد من البيانات الهاتفية في التدريب تحسينًا حقيقيًا معقولًا — ولكن يجب التحقق من "10x" بدلًا من ترديدها كحقيقة.
التسعير: 0.08 دولار في الدقيقة وسؤال الـ60%
هنا يصبح الإطلاق مثيرًا للجدل. تبلغ تكلفة Think Fast 2.0 مبلغ 0.08 دولار لكل دقيقة من الصوت — أي حوالي 4.80 دولار في الساعة — بالإضافة إلى 0.004 دولار لكل رسالة نصية مُدخلة. كانت تكلفة Think Fast 1.0 تبلغ 0.05 دولار لكل دقيقة (3.00 دولارات في الساعة). وهذه زيادة بنسبة 60%، وقد جاءت في الشهر نفسه الذي خفضت فيه OpenAI أسعار GPT-5.6 Luna بنسبة 80% وTerra بنسبة 20%، مستشهدة بنفس انخفاض تكاليف التشغيل التي تدّعيها xAI لهذا النموذج.
المقياس هو القصة كلها. نماذج النصوص تُفوتر لكل توكن، لذا عندما يصبح النموذج أكثر كفاءة، تتقلص فاتورة العميل تلقائيًا. نماذج الصوت تُفوتر لكل دقيقة من الصوت الفعلي، وطول المحادثة يحدده الشخص المتحدث، وليس النموذج. مكاسب الكفاءة في منتج يُفوتر بالدقيقة تعود على المورد، وليس المشتري. لهذا السبب، النموذج الذي يُقال إنه يستخدم ~60% توكنات استدلال أقل — وبالتالي فهو أرخص لـ xAI في تقديمه — يكلف 60% أكثر لاستئجاره.
قم بإجراء الحساب على مسار مكالمة حقيقي. مكالمة مدتها 4 دقائق بسعر 1.0 تكلف 0.20 دولار؛ نفس المكالمة على 2.0 تكلف 0.32 دولار. عشرة آلاف مكالمة من هذا القبيل شهريًا تعني 40,000 دقيقة: 2,000 دولار شهريًا على 1.0 مقابل 3,200 دولار شهريًا على 2.0 — فرق قدره 1,200 دولار شهريًا، أو حوالي 14,400 دولار سنويًا، ينشأ من تغيير التوجيه فقط، وليس من حجم المكالمات. حتى مكسب السرعة السخي بالكاد يؤثر فيه: توفير 10 ثوانٍ كاملة من كل مكالمة يوفر حوالي 0.013 دولار بينما تضيف زيادة السعر 0.12 دولار — تسترد حوالي تسع الزيادة. أي دراسة جدوى تبيع 2.0 كنموذج أرخص تكون قد خلطت بين "أسرع" و"أرخص".
للتوضيح، لا يزال الإصدار 2.0 أرخص بنحو 2.2 مرة من GPT-Realtime-2.1 High بسعر يبلغ حوالي 10.75 دولارًا في الساعة. لذا فهو ليس مكلفًا من حيث القيمة المطلقة — بل هو مكلف مقارنةً بنسخته السابقة وبالاتجاه الذي كانت تسلكه جميع مزودي النماذج الآخرين في ذلك الشهر.
فخ هجرة 5 أغسطس
هناك موعد نهائي مرتبط. في 5 أغسطس 2026، سيبدأ اسم grok-voice-latest تلقائيًا في التوجيه إلى Think Fast 2.0. إذا كنت مباشرًا على Think Fast 1.0 عبر هذا الاسم، فإن "عدم فعل أي شيء" يرقّيك — ويرقّي فاتورتك — إلى الإصدار الجديد في ذلك التاريخ. للبقاء على 1.0، يجب عليك صراحةً تثبيت معرّف النموذج grok-voice-think-fast-1.0 قبل 5 أغسطس.
الموقفان اللذان يمكن الدفاع عنهما يتطلبان معًا إجراءً قبل الموعد النهائي: إما تثبيت الإصدار 1.0 عمدًا لأن تدفقاتك النصية عملت بشكل جيد بتكلفة 3.00 دولار في الساعة، أو الانتقال إلى الإصدار 2.0 عمدًا وإعادة التوقعات عند 4.80 دولار في الساعة، مبررًا ذلك على أساس الجودة وليس التوفير. أما ما لا يمكن الدفاع عنه فهو اكتشاف التغيير في فاتورة سبتمبر. قاعدة جيدة: تعامل مع أي اسم مستعار ينتهي بـ "latest" كتعليمات دائمة بقبول ما يرسله البائع بعد ذلك — بما في ذلك سعره.
كيفية الوصول إليه واستخدامه
يتوفر Think Fast 2.0 من خلال واجهة برمجة تطبيقات Speech-to-Speech من xAI تحت معرّف النموذج grok-voice-think-fast-2.0، مع grok-voice-latest كاسم مستعار دوّار. إنه نموذج حقيقي الوقت ومزدوج الاتجاه (full-duplex) عبر WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0، ويتم المصادقة عبر رأس Authorization: Bearer عند بدء الاتصال. لتطبيقات المتصفح، قم بإنشاء رموز مؤقتة من جانب الخادم عبر نقطة نهاية جلسات الوقت الفعلي (realtime sessions) بحيث لا يصل مفتاح API الرئيسي إلى العميل أبدًا.
واجهة البرمجة متوافقة مع OpenAI Realtime، لذا فإن كود الصوت في الوقت الفعلي الحالي يحتاج عادةً فقط إلى تغيير عنوان URL الأساسي والمفتاح. يتم إعداد الجلسة عبر حدث session.update: اختر صوتًا جاهزًا (eve, ara, rex, sal, leo)، واضبط تنسيق الصوت للإدخال والإخراج (PCM16 بتردد 24 كيلوهرتز افتراضيًا؛ وترميز μ-law للهاتف)، وفعّل كشف نشاط الصوت من جانب الخادم، وسجّل الأدوات — بما في ذلك أداة بحث ويب مدمجة — حتى يتمكن الوكيل من التصرف أثناء المحادثة. يتبع تدفق الأحداث النمط القياسي: يضيف العميل إطارات المخزن المؤقت للصوت، ويبث الخادم دلتا الصوت للاستجابة، وتُطلق أحداث وسيطات استدعاء الأدوات عندما يقرر النموذج التصرف، مع إرسال النتائج مرة أخرى كمخرجات استدعاء الدوال. يدعم النموذج أكثر من 25 لغة واستنساخ صوت مخصص من حوالي دقيقة من الكلام.
لاحظ ما ليس عليه: إنه نموذج وكيل من الكلام إلى الكلام، وليس خدمة نسخ أو ترجمة عامة. إذا كانت الوظيفة الأساسية لمنتجك هي تحويل الصوت إلى نص بتكلفة منخفضة، فإن نموذج STT المخصص أداة مختلفة — وبالاحتساب بالدقيقة، تدفع مقابل المحادثة كاملة، لذا فإن مهام النسخ فقط تصبح باهظة الثمن سريعًا.

كيف يندرج ضمن مجموعة تقنيات وكيل الصوت
Think Fast 2.0 هو نموذج صوتي متخصص في الوقت الفعلي يتم الوصول إليه عبر واجهة برمجة التطبيقات المخصصة من xAI، وليس نموذجًا لغويًا كبيرًا للأغراض العامة تستضيفه أداة توجيه النماذج. يعمل مسار الصوت على WebSocket الخاص بـ xAI مباشرة — حيث تكمن زمن الاستجابة الذي يقل عن ثانية، ولا يصمد عبر قفزة وسيطة.
كل ما حول منتج الصوتي — منطق اللغة الطبيعية غير الحساس للزمن، ومنطق التراجع عند خروج المحادثة عن النص، والتلخيص، والتحليلات، ومتابعة البريد الإلكتروني التي يطلقها الوكيل بعد المكالمة — هو عمل نصي ومتعدد الوسائط لأغراض عامة. أما بالنسبة لهذا الجزء، فإن نقطة نهاية محايدة تجاه البائعين مثل OrcaRouter تمنحك واجهة برمجة تطبيقات واحدة متوافقة مع OpenAI عبر العديد من نماذج اللغات الكبيرة، بحيث لا تكون مقيدًا ببائع واحد لأجزاء البنية التي لا تحتاج إلى مسار الصوت في الوقت الفعلي. التقسيم الواضح: واجهة xAI المخصصة للصوت المتدفق نفسه، وOrcaRouter (أو ما يشابهها) للنص والاستدلال متعدد الوسائط حوله.
المنافسة: {{1}}السرعة الوكيلية{{/1}} مقابل {{2}}الذكاء الخام{{/2}}
يأتي Think Fast 2.0 في خضم أكثر الأسواق تنافسية في مجال الذكاء الاصطناعي حاليًا — وكلاء الصوت في الوقت الفعلي — ويجعل جدول المعايير المفاضلات واضحة بشكل غير معتاد.
Qwen Audio 3.0 Realtime Plusهي الرائدة في الذكاء: 84.1% على مؤشر جودة الكلام إلى الكلام (الأول)، ورقم قياسي 99.2% على Big Bench Audio، و98.4% على الازدواج الكامل. لكن متوسط الوقت حتى أول صوت يبلغ حوالي 4.02 ثانية — أي أبطأ بنحو 5.7 مرة من سرعة Grok البالغة 0.70 ثانية. بالنسبة للمحادثات في السيارة والأجهزة القابلة للارتداء والهاتف، هذا الفرق ليس بين "سريع" و"بطيء"، بل بين قابل للاستخدام وغير قابل للاستخدام. كما تنقسم Qwen إلى فئة Plus (الجودة) وفئة Flash (أول حزمة في حوالي 300 مللي ثانية) لسيناريوهات مختلفة، وهو إجابة مدروسة لنفس التوتر.
GPT-Realtime-2.1 يحتل موقعًا وسطًا في معظم الصفوف (جودة 79.1%، ووكيلية 45.7%)، ويتفوق في ديناميكيات المحادثة (95.7%). فئته العالية تبلغ تقريبًا 2.2 ضعف سعر الساعة في Grok. بالنسبة للفرق المنخرطة بالفعل بعمق في النظام البيئي لـ OpenAI، يظل الخيار الافتراضي الأقل احتكاكًا.
Gemini 3.1 Flashيتأخر في مؤشرات الجودة والوكلاء (69.5%، 37.7%) لكنه جزء من الحزمة الصوتية الأوسع لـ Gemini والنظام البيئي لـ Google التي تفضّلها العديد من الفرق لأسباب أخرى.
الخلاصة العملية: اختر حسب عبء العمل. إذا كان وكيلك الصوتي يجب أن يبدو فوريًا وأن يُنجز المهام المدعومة بالأدوات بشكل موثوق (الدعم، التأهيل، الحجز)، فإن Think Fast 2.0 هو الخيار الأقوى المُقاس اليوم. إذا كانت أولويتك هي التفكير الأعمق ويمكنك تحمّل زمن استجابة متعدد الثواني، فإن Qwen Plus هو الفائز. وإذا كانت السلاسة المحادثاتية وملاءمة النظام البيئي هما الأهم، فإن GPT-Realtime-2.1 يظل المرشح الأوفر حظًا الذي يجب التغلب عليه.

ثلاثة سيناريوهات يَصلُحُ فيها
1. دعم الهاتف والاتصالات الهاتفية
المزيج الأكثر أهمية: أول صوت خلال أقل من ثانية، ونسخ قوي للمحادثات الهاتفية في الأجواء المزعجة (وفقًا لتقارير البائع)، ومعالجة المقاطعات في الوضع ثنائي الاتجاه الكامل. خط الدعم حيث يبدأ الوكيل بالتحدث فورًا تقريبًا ويستطيع استرجاع معلومات الحساب في منتصف المحادثة هو بالضبط ما صُمم إصدار 2.0 ليكون مناسبًا له. أسلوب تحدثه الأقصر، بسؤال واحد في كل مرة، والمبني على التعلم المعزز (RL) يتوافق أيضًا بشكل جيد مع الاتصالات الهاتفية، حيث الدقائق هي وحدة الفوترة — على عداد أي من البائعين.
2. تأهيل العملاء المحتملين والمتابعة بعد المكالمة
الصوت الوكيل هو المجال الذي تكون فيه 2.0 متصدّرة فعلًا، وتأهيل العملاء المحتملين هو المهمة النموذجية للصوت الوكيل: تأهيل، وتوجيه، وإطلاق المتابعة بينما الاهتمام لا يزال قائمًا. يمكن لاستدعاء الأدوات أن ينطلق قبل انتهاء الجملة الأولى، لذا يمكن للوكيل إنشاء سجل CRM بينما لا يزال يتحاور مع العميل المحتمل. خطط للإسناد على مستوى الجلسة وأذونات أدوات صارمة — يمكن للوكيل الصوتي أن يُخطئ في الوقت الفعلي، وتقع مسؤولية التصحيح على عاتقك.
3. منتجات الوكلاء الصوتية قيد التطوير النشط
بالنسبة للمطورين الذين يطلقون وكلاء صوتيين خاصين بهم — فإن تكاملات Tradecraft وGrokTerm التي تستشهد بها xAI هي بالضبط بهذا الشكل — سرعة الإصدار 2.0 وواجهة برمجة التطبيقات المتوافقة مع OpenAI تجعلانه بديلاً سهل الاستخدام لرمز GPT-Realtime. ثبّت الإصدار، وشغّل تجربة محدودة بمعيار نجاح واضح (مثل "تأهيل وتوجيه زوار صفحة التسعير")، وقِس التكلفة لكل نتيجة مكتملة، وليس التكلفة لكل دقيقة.
القيود والتحفظات
Think Fast 2.0 عمره خمسة أيام فقط وقت كتابة هذه السطور، وهذا يظهر في التحفظات. نتائج اختبار A/B الخاصة بـ Starlink (ارتفاع معدل التحويل واحتواء الدعم) هي نتائج أبلغت بها xAI دون أرقام منشورة؛ ومضاعفات النسخ الصوتي وصياغة "أسرع بنحو ٥ مرات" هي أيضًا ادعاءات من البائع، وليست معايير مستقلة. المقال الوحيد الذي ستشاهده يدّعي "تراجع الأداء وتقارير اختبارات ملفّقة" يشير إلى نفس عدم قابلية التحقق — فالأرقام التي نشرتها xAI لم تُستنسخ بشكل مستقل، ومجتمع الصوت الحسّاس للموثوقية يشكّ بحق في مقاييس البائع غير المنشورة. كما لا يمكن للمعايير قياس أسوأ مكالماتك: استجابة بزمن 0.70 ثانية لا قيمة لها إذا وجّه الوكيل عميلًا محتملًا إلى الفريق الخطأ بثقة. تُحتسب فوترة الصوت بالدقيقة مع زيادة سعر مدمجة مسبقًا، لذا فإن التعرض للتكلفة حقيقي. وكما هو الحال مع أي نموذج زمن حقيقي جديد تمامًا، توقع تغيّرات في واجهة API. تحقق من ادعاءات الدقة على ملفاتك الصوتية، وثبّت الإصدارات في بيئة الإنتاج، وجهّز آلية التصعيد والتسجيل قبل أول مكالمة مباشرة.
الأسئلة الشائعة
ما هو Grok Voice Think Fast 2.0؟
نموذج xAI الرائد للتحويل من كلام إلى كلام للوكلاء الصوتيين، الذي صدر في 29 يوليو 2026: نقل صوتي-إلى-صوتي أصلي من طرف إلى طرف عبر WebSocket، بزمن 0.70 ثانية حتى أول صوت، والمركز الأول في معيار τ-Voice للوكلاء.
كم تبلغ تكلفة Grok Voice Think Fast 2.0؟
0.08 دولار لكل دقيقة من الصوت (حوالي 4.80 دولار/ساعة) بالإضافة إلى 0.004 دولار لكل رسالة نصية مدخلة — وهي زيادة بنسبة 60% عن 0.05 دولار/دقيقة في Think Fast 1.0.
هل Think Fast 2.0 هو أفضل نموذج صوتي؟
إنه الأسرع والأفضل في المهام الوكيلية (56.5% τ-Voice، المركز الأول) وثانيًا بشكل عام في مؤشر جودة الكلام إلى الكلام (82.9%)، خلف Qwen Audio 3.0 Realtime Plus (84.1%). يعتمد "الأفضل" على عبء العمل.
ما الذي تغيّر منذ Think Fast 1.0؟
{{1}}الاستدلال الكلامي المتوازي (يفكر أثناء التحدث){{/1}}، {{2}}حوالي 60% أقل من رموز الاستدلال{{/2}}، {{3}}أسلوب محادثة أقصر مضبوط بتعلم التعزيز RL{{/3}}، {{4}}تحسين النسخ بمقدار 1.4x (وفقًا لما أبلغه المورّد){{/4}}، {{5}}وانخفاض زمن أول صوت من 1.25 ثانية إلى 0.70 ثانية{{/5}}.
هل سيقوم Think Fast 1.0 بتبديل حركة المرور تلقائيًا؟
نعم، في 5 أغسطس 2026، إذا استخدمت الاسم المستعار grok-voice-latest. ثبّت grok-voice-think-fast-1.0 قبل ذلك للبقاء على الإصدار 1.0، أو اختر 2.0 عمدًا وأعد توقع التكلفة.
كيف أستدعي Grok Voice Think Fast 2.0؟
عبر واجهة برمجة تطبيقات xAI للتحويل من الكلام إلى الكلام — وهي اتصال WebSocket فوري (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) متوافق مع واجهة OpenAI Realtime API، مع أصوات جاهزة، وكشف نشاط الصوت على الخادم، واستدعاء الأدوات.
مع أي نماذج صوتية تنافس؟
Qwen Audio 3.0 Realtime Plus (أكثر ذكاءً، وأبطأ بكثير مع أول صوت بعد 4.02 ثانية)، GPT-Realtime-2.1 (ديناميكيات محادثة أفضل، وأغلى بنحو ~2.2x في الفئة العليا)، وGemini 3.1 Flash.
هل ادعاءات المعايير موثوقة؟
نتائج التحليل الاصطناعي مستقلة ومتينة. نتائج اختبار A/B الخاصة بستارلينك، ومضاعفات النسخ، وتأطير السرعة هي من تقارير xAI دون بيانات منشورة — تعامل معها كمؤشرات اتجاهية وتحقق منها على ملفاتك الصوتية الخاصة.
هل Grok Voice جيد للنسخ الصوتي؟
يقوم بالنسخ الصوتي داخل محادثة، وتدّعي xAI تحقيق مكاسب كبيرة مقارنةً بنماذج تحويل الكلام إلى نص المخصصة في البيئات المزعجة — لكنه يُفوَّر لكل دقيقة محادثة، لذا فإن أعباء النسخ المخصصة تُخدم بشكل أفضل بواسطة نموذج تحويل كلام إلى نص مخصص.
خلاصة القول
Grok Voice Think Fast 2.0 هو أقوى نموذج صوتي وكيل (agentic) مُقاس حتى الآن، والأسرع في الفئة العليا بهامش واسع — إن الوصول إلى أول مقطع صوتي في 0.70 ثانية إنجاز حقيقي ومستقل ملموس للمستخدم، والمركز الأول على τ-Voice ترتيب حقيقي. الخلاصة الصادقة محددة: إنه أفضل أداة في فئته للوكلاء الصوتيين اللحظيين المدعومين بالأدوات، وليس أفضل نموذج صوتي في كل معيار؛ تتصدر Qwen في الذكاء وتتفوق OpenAI في البراعة المحادثية. الخلافات ليست حول السرعة؛ بل حول المقياس: زيادة في السعر بنسبة 60% على نموذج تقول xAI إن تشغيله أرخص، وترحيل تلقائي لاسم مستعار بموعد نهائي صارم، وادعاءات رئيسية تستند إلى أرقام غير منشورة من البائع. استخدمه من أجل السرعة الوكيلة، وثبّت نسختك، وضع وسومًا على ادعاءات البائع، وتحقق من الدقة في مكالماتك الخاصة — وأبقِ النصوص والاستدلال للأغراض العامة حول منتجك الصوتي على نقطة نهاية محايدة تجاه البائعين مثل OrcaRouter.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
