بطاقة مقال رئيسية تعرض 'Grok Voice Transcribe 2.0' مع شارة 'أخبار' وعنوان فرعي 'المركز الأول في دقة البث، بسعر دون تغيير'، مع شرائح تحمل 2.7% WER للنص النهائي، و3.4% لأول نص جزئي، و0.49 ثانية بعد انتهاء الكلام، و0.20 دولار لكل ساعة بث، فوق تدرّج من الأبيض إلى الأزرق مع شعار OrcaRouter أسفل اليمين.
Engineering & Research

Grok Voice Transcribe 2.0 يحتل المرتبة الأولى في دقة البث المباشر بسعر دون تغيير

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Grok Voice Transcribe 2.0 هو نموذج تحويل الكلام إلى نص الذي أطلقته SpaceXAI في 18 سبتمبر 2026، والرقم الوحيد المهم بشأنه ليس الرقم الذي يبدأ به منشور الإطلاق. إنه هذا: النص الجزئي الأول — النص الذي يتمكن وكيل صوتي فعلاً من التصرف بناءً عليه بينما لا يزال يتم التحدث فوق صوت المتصل — انخفض من معدل خطأ كلمات بنسبة 18.3% في Grok Voice Transcribe 1.0 إلى 3.4%. هذا هو القياس على لوحة AA-WER Streaming من Artificial Analysis، حيث يحتل النموذج الجديد الآن المركز الأول في كل من تصنيف النص النهائي (2.7% معدل خطأ كلمات، 0.49 ثانية بعد انتهاء الكلام) وتصنيف النص الجزئي الأول (3.4%، 0.49 ثانية). تحسنت دقة النص النهائي أيضًا، من 3.9% إلى 2.7%، وهو تحسن حقيقي لكن متواضع. قفزة النص الجزئي هي التي تغير ما يمكنك بناؤه.

ما الذي تغيّر فعليًا بين 1.0 و2.0

النسختان هما المنتج نفسه في واجهة API نفسها، ولم تُجرِ SpaceXAI أي تغييرات على الواجهة: يتم اختيار Grok Voice Transcribe 2.0 عبر تمرير grok-voice-transcribe-2.0 إلى /v1/stt بدلاً من grok-voice-transcribe-1.0، أو عبر اختياره عند إنشاء اتصال WebSocket للبث. وتستمر عمليات التكامل الحالية التي تتجاهل معامل الطراز في الحصول على 1.0 حتى تغيّر SpaceXAI الإعداد الافتراضي، وهو ما تقول الشركة إنه سيحدث خلال الأسابيع المقبلة إلى جانب إهمال النسخة الأقدم. وحتى ذلك الحين، يكون 2.0 اختياريًا ويمكن تثبيت 1.0 عمدًا، وهو الشكل الصحيح لتغيير كهذا: يمكنك إجراء اختبار A/B عليه باستخدام صوتك الخاص قبل أن يصبح الافتراضي في بيئة الإنتاج لديك، سواء طلبت ذلك أم لا.

أرقام Artificial Analysis، عند قراءتها جنبًا إلى جنب، تروي قصة أكثر تحديدًا من «الدقة المضاعفة»:

• دقة النص النهائي — Grok Voice Transcribe 2.0 عند 2.7% WER مقابل Grok Voice Transcribe 1.0 عند 3.9% على AA-WER Streaming، وتم قياس كليهما بعد انتهاء الكلام

• دقة النص الجزئي الأول — ‏3.4% WER مقابل 18.3%، وهي أكبر فجوة منفردة بين الإصدارين

• الوقت المستغرق حتى النص النهائي — ‏0.49 ثانية مقابل 0.37 ثانية، لذا فإن النموذج الجديد أبطأ في الحسم من النموذج الذي يحل محله

• الوقت حتى أول نتيجة جزئية — 0.49 ثانية مقابل 0.25 ثانية، وأبطأ بالمثل

• دقة الدفعة (غير المتدفقة) — 2.3% AA-WER على لوحة Artificial Analysis غير المتدفقة، مقابل 4.07% لـ Whisper Large v3 و3.31% لـ GPT Transcribe

• إنتاجية الدفعات — نحو 162× من الزمن الحقيقي على اللوحة نفسها، متأخرة عن 333× التي حققها MAI-Transcribe-2 ومتقدمة على 88× التي حققها Gemini 3.5 Transcribe

السطران الرابع والخامس هما التحذير الصادق في هذا الإصدار. لقد اشترت SpaceXAI الدقة مقابل زمن الاستجابة. النموذج الجديد أبطأ بنحو ثلث ثانية في إرجاع أول نتيجة جزئية والنص النهائي مقارنةً بـ 1.0. على لوحة يعيد فيها Deepgram Flux نتيجة جزئية في 0.02 ثانية وSoniox v5 في 0.05 ثانية، فإن Grok Voice Transcribe 2.0 لا ينافس على السرعة على الإطلاق — بل ينافس على أن يكون صحيحًا، ويفوز بهذه المقايضة بفارق واسع. وسواء كانت هذه هي المقايضة الصحيحة يعتمد كليًا على ما إذا كان تطبيقك وكيلًا صوتيًا مباشرًا يحتاج إلى البدء بالرد، أو خط معالجة نسخ لا يُرى فيه نصف ثانية.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

ادّعاء "الدقة المضاعفة"، تحت الفحص

العنوان الرئيسي لـ SpaceXAI هو أن الإصدار 2.0 أدق بمرتين من 1.0 بالسعر نفسه، وجدول التقييم الخاص بها يدعم ذلك في المجموعات التي اختارتها. في مكالمات دعم العملاء الإنجليزية بتردد 8 كيلوهرتز، انخفض معدل خطأ الكلمات من 10.6% إلى 7.1%. وفي المحادثات مع Grok، من 8.7% إلى 3.3%. وفي بيانات الاعتماد المنطوقة — رموز الحسابات، وأرقام الهواتف، وعناوين البريد الإلكتروني — من 7.2% إلى 3.2%. وفي الأوامر القصيرة عبر 19 لغة، من 20.6% إلى 6.8%، أي انخفاض بنحو الثلثين في الأخطاء. هذه المجموعات الأربع مستمدة من حركة الإنتاج لدى SpaceXAI، والمقارنات خاصة بـ SpaceXAI نفسها؛ ولم يكرّرها أحد من خارج الشركة. تعامل مع الجدول كخريطة لمكان ضبط النموذج، وليس كضمان عام للدقة.

نتيجة Artificial Analysis هي الجزء غير المستند إلى تقارير المورّد: اختبار مستقل أُجري على نحو ثماني ساعات من الصوت، بوزن 50% لمجموعة AA-AgentTalk الخاصة و25% لكل من VoxPopuli وEarnings22. وهي تدعم ادعاءً أضيق وأكثر فائدة من "أدق بمرتين" — وهو أنه على ذلك المزيج تحديدًا، يُعد هذا النموذج أدق مُفرِّغ نصي للبث جرى قياسه. وهناك التفاف يستحق الذكر: يصف منشور SpaceXAI مرتبة أولى "بين 32 نموذجًا للبث"، بينما تعرض صفحة لوحة المتصدرين نفسها 27 من أصل 33 نموذجًا. المرتبة حقيقية؛ أما حجم الميدان في النص التسويقي فهو عدّ الشركة، لا عدّ اللوحة.

من الجدير أيضًا أن نكون دقيقين بشأن ما يغطيه المركز الأول على AA-WER Streaming وما لا يغطيه. لوحة الترتيب ذات وزن إنجليزي وتغلب عليها محادثات الوكلاء. وهي لا تقيس لكنتك، ولا برنامج الترميز لديك، ولا مفردات مجالك، ولا صوت مركز الاتصال ثماني القنوات لديك. والنموذج الذي يتصدّرها قد يخسر خسارة فادحة على تسجيلاتك، ولهذا تحديدًا تهمّ نافذة الاشتراك الاختياري.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

التسعير لم يتغير، وهذه ثاني أكبر حقيقة هنا

Grok Voice Transcribe 2.0 يكلّف ما كان يكلّفه 1.0: 0.10 دولار لكل ساعة صوت للمعالجة المجمّعة والملفات المسجّلة عبر نقطة نهاية REST، و0.20 دولار لكل ساعة صوت للبث عبر WebSocket. على لوحة أسعار Artificial Analysis، يبلغ الـ SKU الخاص بالبث 3.33 دولار لكل 1,000 دقيقة، والـ SKU الخاص بالدفعات 1.67 دولار — وهو نفس سعر الدفعات الذي تفرضه Microsoft على MAI-Transcribe-2، ونحو ثلث ما تكلّفه ElevenLabs Scribe v2 Realtime لكل دقيقة بث.

تمييز المتحدثين، والطوابع الزمنية على مستوى الكلمة مع درجات الثقة، وترجيح المصطلحات الرئيسية كلها مشمولة في ذلك السعر بدلاً من أن تُحتسب بشكل منفصل، وهو أمر ليس معمماً في هذا السوق. تقوم Gemini 3.5 Transcribe Live بالفوترة لكل رمز على كل من إدخال الصوت وإخراج النص، لذا تتحرك تكلفتك وفقاً لما يقوله النموذج، وليس فقط وفقاً لمدة تشغيل الصوت. السعر الثابت لكل ساعة أسهل في التنبؤ وأسهل في المقارنة بين الموردين — ولأن OrcaRouter يمرر أسعار قائمة المزودين دون أي هامش ربح (0%)، فإن أي تغيير من جانب المورد في ذلك السعر سيظهر من جانبنا في نفس اليوم بدلاً من بعد دورة إعادة تسعير.

ما الذي تمنحك إياه واجهة API فعليًا

قائمة القدرات واسعة، وهي في معظمها موروثة وليست جديدة، وهذا أمر يجدر معرفته إذا كنت تقيّم الترقية على أساس الميزات وحدها:

• المعالجة بالدفعات والبث المباشر في نموذج واحد — REST للملفات المسجلة حتى 500 ميغابايت، WebSocket على wss://api.x.ai/v1/stt مع إصدار نتائج مؤقتة كل 500 مللي ثانية تقريبًا

• يتضمّن تمييز المتحدثين، إضافةً إلى النسخ متعدد القنوات لما يصل إلى 8 قنوات مستقلة

• طوابع زمنية على مستوى الكلمة تحمل درجات ثقة، بحيث يمكنك تحديد عتبة للمقاطع منخفضة الثقة بدلًا من الوثوق بالنص الكامل للتفريغ على قدم المساواة

• ترجيح المصطلحات الأساسية لما يصل إلى 100 مصطلح مجال لكل طلب، بحيث لا يتجاوز طول كل منها 50 حرفًا

• تطبيع النص العكسي للأرقام والتواريخ والعملات وأرقام الهواتف وعناوين البريد الإلكتروني، مع دعم تنسيق الصيغة المكتوبة عبر 25 لغة

• إزالة كلمات الحشو واكتشاف نهاية الدور عبر Smart Turn، وهما موجّهان مباشرةً إلى وكلاء الصوت

• اكتشاف تلقائي للغة مع تبديل اللغة أثناء التسجيل في تمريرة واحدة، عبر 12 تنسيقًا صوتيًا ومعدلات عينات تتراوح من 8 kHz إلى 48 kHz

• حدود الخدمة 10 طلبات في الثانية على كلٍّ من REST والبث المتدفق، و100 جلسة بث متزامنة لكل فريق، مستضافة في us-east-1

الملاحظة الإنتاجية الوحيدة التي ليست على قائمة الميزات: تعمل الخدمة في منطقة واحدة. إذا كان صوتك ينشأ خارج الولايات المتحدة، فإن الجزء الشبكي أصبح الآن جزءًا من ميزانية زمن الوصول لديك، وتُضمّن AA-WER Streaming تأخير الشبكة صراحةً في توقيتها. تقدّم SpaceXAI شروطًا لعدم الاحتفاظ بالبيانات، وتستشهد بـ SOC 2 Type II وBAAs وخيارات إقامة البيانات في الاتحاد الأوروبي، لذا فإن قصة الامتثال أكثر تطورًا من القصة الجغرافية.

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

من ينبغي أن ينتقل، وما الذي ينبغي مراقبته

إذا كنت تستخدم بالفعل Grok Voice Transcribe 1.0 وكان تطبيقك يعمل على النصوص الجزئية — كشف الدور، والمقاطعة، وردود الوكيل المباشرة — فإن فجوة الدقة الجزئية من 18.3% إلى 3.4% كبيرة بما يكفي بحيث لا يكون اختبار 2.0 اختياريًا. إن انتقال هذا الرقم من "غالبًا خاطئ" إلى "غالبًا صحيح" هو الفرق بين نص جزئي يمكنك التوجيه بناءً عليه ونص يمكنك عرضه فقط. وإذا كان تطبيقك ينتظر النصوص النهائية في الملفات المسجلة، فإن التحسين حقيقي لكنه أصغر، وتكلفته هي 0.12 ثانية إضافية من تأخير الالتزام.

إذا كنت تستخدم مزودًا مختلفًا تمامًا، فإن سبب النظر في هذا الإصدار ليس تصنيف لوحة الصدارة — بل هو أن مختبرًا رائدًا قد حسّن نموذج النسخ الخاص به بهامش واسع دون رفع السعر، وهو ما يبدو عليه السوق عندما تتوقف الدقة عن كونها الشيء الذي تتقاضى مقابله. كما أن مسار الترقية هو الأرخص من نوعه: معامل واحد، لا تغيير في الكود، لا عقد جديد، ويمكن تثبيت الإصدار إذا ساءت الأمور.

ما تجدر مراقبته تاليًا هو التبديل الافتراضي. عندما تجعل SpaceXAI الإصدار 2.0 هو الافتراضي وتبدأ بإهمال الإصدار 1.0، سينتقل كل تكامل لم يمرّر معامل نموذج قط إلى النموذج الجديد دفعة واحدة، بما في ذلك تغيّر زمن الاستجابة. على الفرق التي تعتمد على توقيت النتائج الجزئية القديم عند 0.25 ثانية أن تثبّت الآن بدلًا من أن تكتشف التغيير في بيئة الإنتاج. الأمر الثاني الجدير بالمراقبة هو إعادة الإنتاج المستقلة: فمدخل Artificial Analysis قياس حقيقي، لكنه لوحة واحدة على مزيج صوتي واحد، ولم ينشر أي طرف ثالث بعد تشغيلًا مماثلًا يقارن بين 1.0 و2.0 على صوت إنتاجي.