بطاقة مقال رئيسية تحمل عنوان «Grok Voice Transcribe 2.0 مقابل Gemini 3.5 Transcribe» مع شارة «مقارنة النماذج» والعنوان الفرعي «مسار البث ينتمي لأحدهما»، مع شرائح تحمل 2.7% مقابل 4.0% WER للبث، 3.4% مقابل 5.8% لأول نتيجة جزئية، 0.49 ثانية مقابل 0.40 ثانية للنتيجة النهائية و1.67 دولار مقابل 5.00 دولار لكل 1,000 دقيقة، فوق تدرج من الأبيض إلى الأزرق مع شعار OrcaRouter في الزاوية اليمنى السفلى.
Guides & Insights

Grok Voice Transcribe 2.0 مقابل Gemini 3.5 Transcribe: مسار البث ينتمي إلى أحدهما

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Grok Voice Transcribe 2.0 وGemini 3.5 Transcribe هما أحدث نموذجين رائدين لتحويل الكلام إلى نص من مختبرين متنافسين، والطريقة الصادقة لمقارنتهما هي الإقرار منذ البداية أنهما لم يُصمَّما للمهمة نفسها. إن Grok Voice Transcribe 2.0 من SpaceXAI، الذي صدر في 18 سبتمبر 2026، نموذج يركّز على البثّ أولاً مع وضع معالجة بالدفعات ملحق به: يتصدر لوحة AA-WER للبثّ بمعدل خطأ كلمات 2.7% في النصوص النهائية و3.4% في النصوص الجزئية الأولى، وكلاهما يصل بعد 0.49 ثانية من انتهاء الكلام. أما Gemini 3.5 Transcribe، الذي صدر في 26 أغسطس 2026، فهو نموذج يركّز على الدفعات أولاً مع وحدة بثّ مرفقة، ويتصرف نصفاه بشكل مختلف جداً — يقيس المسار المسجّل مسبقاً 2.6% AA-WER على لوحة Artificial Analysis غير المتدفقة، بينما المنفصلة gemini-3.5-transcribe-live، تقيس نقطة النهاية 4.0% على لوحة البثّ عند 0.40 ثانية. ضع تلك الأرقام الأربعة بجانب بعضها وستتضح صورة هذه المواجهة: هما متقاربان في الدقة حيث يكون Gemini 3.5 Transcribe قوياً، وغير متقاربين حيث يتميز Grok Voice Transcribe 2.0.

المسار الوحيد الذي يقاتلان فيه كلاهما

كلا النموذجين قادران على نسخ الصوت المباشر، لذا فإن البث هو الساحة الوحيدة التي تكون فيها المقارنة المباشرة ذات معنى. هناك، يتقدم Grok Voice Transcribe 2.0 على Gemini 3.5 Transcribe Live بمقدار 1.3 نقطة في دقة النص النهائي — 2.7% مقابل 4.0% WER على نفس منصة الاختبار، ونفس الصوت البالغ نحو ثماني ساعات، ونفس التوزيع 50/25/25 عبر AA-AgentTalk وVoxPopuli وEarnings22. هذا ليس فرقًا ناتجًا عن التقريب؛ عند معدلات الخطأ تلك، فإنه يعني تقريبًا كلمة خاطئة إضافية واحدة في كل خمسة وسبعين كلمة ينسخها نموذج Google. في النصوص الجزئية الأولى، تكون الفجوة أوسع، 3.4% مقابل 5.8%، والنصوص الجزئية هي التي يجب أن يتصرف بناءً عليها وكيل الصوت المباشر قبل أن ينتهي المتحدث.

الكمون يعمل في الاتجاه المعاكس، وهذا هو الجزء الذي يضيع من المقارنة. يعيد Gemini 3.5 Transcribe Live نصه النهائي بعد 0.40 ثانية من انتهاء الكلام مقابل 0.49 لـ Grok، ويعيد أول نص جزئي خلال 0.25 ثانية مقابل 0.49 لـ Grok — أي أسرع بنحو الضعف حتى أول كلمة قابلة للاستخدام. لا ينافس أي من النموذجين الطرف السريع حقًا في هذه القائمة، حيث يسجل Deepgram Flux 0.02 ثانية وSoniox v5 0.05، لكن بين هذين الاثنين تكون المقايضة صريحة: Google أسرع إلى النطق، وSpaceXAI أكثر احتمالًا أن يكون مصيبًا عندما يتحدث. وبالنسبة لوكيل يتناوب الأدوار ولا يجب أن يقاطع المتصل، فإن 0.24 ثانية إضافية من كمون النص الجزئي تكلفة حقيقية يجب أن يبررها الفوز في الدقة.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and a 100-concurrent-session cap; the right column gives Gemini 3.5 Transcribe 4.0%, 5.8%, 0.40s, $5.00, about $5.40 and a 10-minute session cap.

أين يتفوق Gemini 3.5 Transcribe فعليًا

التغطية اللغوية هي الأوضح، والفرق ليس طفيفًا. يتعامل نموذج Google مع أكثر من 85 لغة؛ ويدعم Grok Voice Transcribe 2.0 العشرات، مع تنسيق الشكل المكتوب — وهو التطبيع العكسي للنص الذي يحوّل الأرقام والتواريخ والعملات وعناوين البريد الإلكتروني المنطوقة إلى أشكالها المكتوبة — موثّق عبر 25 لغة. إذا كان ملفك الصوتي بالبرتغالية أو الفيتنامية، أو مزيجًا بتبديل لغوي بين لغتين داخل الجملة الواحدة، فإن مسألة أي النموذجين أكثر دقة على لوحة Artificial Analysis تصبح أكاديمية إلى حد كبير، لأن تلك اللوحة مرجّحة تجاه الإنجليزية ومثقلة بحديث الوكلاء. وتُبلِغ Google عن معدل خطأ الكلمات (WER) بنسبة 5.50% في الوضع التدفّقي و5.04% في الوضع غير التدفّقي على FLEURS عبر مجموعتها متعددة اللغات الخاصة بها، وهي أرقام مُبلَّغ عنها من المورّد ولم يُعَد إنتاجها بشكل مستقل، لكنها على الأقل تصف الحالة متعددة اللغات بأي شكل.

الميزة الثانية هي الطبقة المجانية. يوفّر Gemini 3.5 Transcribe رموزًا مجانية للإدخال والإخراج على واجهة برمجة تطبيقات Google، مع التحفّظ القائل إن محتوى الطبقة المجانية يُستخدم لتحسين منتجات Google بينما محتوى الطبقة المدفوعة لا يُستخدم. بالنسبة لنموذج أولي، أو مشروع جانبي، أو أداة داخلية تعالج صوتًا لما كنت لتدفع مقابل تفريغه نصيًا لولا ذلك، فهذا خيار حقيقي لا يستطيع أي مزوّد يتقاضى أجرًا بالساعة مجاراته. أما Grok Voice Transcribe 2.0 فهو مدفوع من أول ساعة صوت.

والثالث هو أن Gemini 3.5 Transcribe نموذج متعدد الوسائط عام مزوّد بوضع للنسخ، وليس خدمة ASR مبنية لغرض متخصص. يمكن توجيهه بالتعليمات، ويمكنه أخذ النص كسياق، وهو موجود ضمن نفس واجهة API التي تأتي بها كل ما تطلقه Google. وإذا كان النسخ خطوة واحدة في مسار يتطلب أيضًا استدلالًا على النص المنسوخ، فإن إبقاء الاثنين في نداء نموذج واحد له قيمة لا يلتقطها معدل الخطأ لكل كلمة.

حساب السعر لكل ألف دقيقة

تُطبّع Artificial Analysis كلا النموذجين على التكلفة لكل 1,000 دقيقة من الصوت، وهي الطريقة الوحيدة لمقارنة معدل ساعي ثابت بالفوترة القائمة على الرموز:

• دفعي، مسجّل مسبقًا — Grok Voice Transcribe 2.0 بسعر 1.67 دولار لكل 1,000 دقيقة (0.10 دولار/الساعة) مقابل Gemini 3.5 Transcribe بسعر 5.00 دولارات لكل 1,000 دقيقة (0.30 دولار/الساعة، بدءًا من 2.00 دولار لكل 1 مليون رمز إدخال و12.00 دولارًا لكل 1 مليون رمز إخراج)

• البث — Grok Voice Transcribe 2.0 بسعر $3.33 لكل 1,000 دقيقة ($0.20/ساعة) مقابل Gemini 3.5 Transcribe Live بنحو $5.40 لكل 1,000 دقيقة، محسوبة كمزيج من $3.50 لكل مليون رمز إدخال صوتي و$21.00 لكل مليون رمز إخراج نصي

• معدل نقل الدفعات — Grok Voice Transcribe 2.0 بسرعة تقارب 162× الزمن الحقيقي مقابل Gemini 3.5 Transcribe بسرعة تقارب 88× على اللوحة نفسها، لذا فإن النموذج الأرخص هو أيضًا الأسرع في معالجة الملفات

• حد الجلسة المباشرة — تُبثّ Grok Voice Transcribe 2.0 عبر WebSocket دون سقف معلن لمدة الجلسة عدا 100 جلسة متزامنة لكل فريق، مقابل Gemini 3.5 Transcribe Live المحدود بـ10 دقائق لكل جلسة

هذا السطر الأخير هو التفصيل التشغيلي الذي يحسم معماريات أكثر مما تفعله أرقام الدقة. حدٌّ أقصى مدته 10 دقائق على جلسة مباشرة يعني أنه يجب تقطيع المكالمات الطويلة والاجتماعات الطويلة والبثوث الطويلة وإعادة إنشائها، وكل إعادة إنشاء هي وصلة يُفقد فيها السياق. تحمل نقطة نهاية البث المتدفق الخاصة بـ Grok حدًّا أقصى لحجم الملف قدره 500 ميغابايت على مسار الدُفعات، وحدًّا لتزامن لكل فريق يبلغ 100 جلسة على مسار البث المتدفق، وهو نوع مختلف من القيود — الإنتاجية بدلًا من المدة.

يستحق فهم فوترة الرموز قبل أن تلتزم بجانب Google، لأنها تجعل فاتورتك دالة لمتغيرين بدلاً من متغير واحد. تفرض Gemini رسومًا على الإدخال الصوتي وعلى الإخراج النصي بشكل منفصل، لذا فإن النموذج الذي ينتج تنسيقًا مطولًا أو يكرر نفسه يكلف أكثر من نموذج لا يفعل ذلك، واللغة ذات الكلمات الأطول تكلف أكثر من لغة ذات كلمات أقصر. سعر Grok الثابت لكل ساعة لا يتغير مع أي من ذلك. بالنسبة لأحمال العمل ذات الحجم الكبير، يكون السعر الثابت أسهل في التوقع، ولأن OrcaRouter يمرر أسعار قوائم المزودين بهامش ربح 0%، فإن أي تغيير من جانب أي من الموردين يصل إلى فاتورتك في يوم حدوثه بدلاً من تجديد العقد التالي.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first at 2.728% final-transcript word error rate and 0.490s, Gemini 3.5 Transcribe Live at 3.998% and 0.395s with a 5.774% first-partial figure, and the faster Deepgram Flux and Soniox v5 rows for latency context.

أشكال الميزات: ما يرفض كل واحد منها القيام به

تتباين قوائم القدرات أكثر مما توحي به أرقام الدقة، وتقع الفجوات في مواضع تهم تطبيقات محددة:

• تمييز المتحدثين — مضمّن دون تكلفة إضافية على Grok Voice Transcribe 2.0؛ غير مدعوم على Gemini 3.5 Transcribe Live، لذا فإن النصوص المباشرة المنسوبة إلى المتحدثين غير متاحة على نقطة النهاية تلك على الإطلاق

• الطوابع الزمنية على مستوى الكلمة — يعيدها Grok Voice Transcribe 2.0 مرفقة بدرجات ثقة لكل كلمة؛ بينما لا يعيد Gemini 3.5 Transcribe Live أيًا منها، وهو ما يستبعد اعتماد عتبات الثقة والمحاذاة الدقيقة للترجمات المصاحبة

• صوت متعدد القنوات — يقوم Grok Voice Transcribe 2.0 بنسخ ما يصل إلى 8 قنوات مستقلة في تمريرة واحدة؛ ولا يملك Gemini 3.5 Transcribe Live أي مكافئ، لذا تحتاج تسجيلات المكالمات متعددة القنوات إلى جلسات لكل قناة

• الترجيح حسب المصطلحات الرئيسية — يقبل Grok Voice Transcribe 2.0 حتى 100 مصطلح نطاق لكل طلب؛ ويقبل Gemini 3.5 Transcribe مفردات مخصصة وتلميحات لغة اختيارية

• البنية التحتية لوكيل الصوت — تتضمن Grok Voice Transcribe 2.0 إزالة كلمات الحشو وكشف نهاية الدور عبر Smart Turn؛ بينما تغطي Gemini 3.5 Transcribe Live حالة البث لكنها تترك منطق الدور للتطبيق

• التعامل مع المدخلات — يقبل Grok Voice Transcribe 2.0 رفع الملفات مباشرةً حتى 500 ميغابايت عبر 12 تنسيقًا صوتيًا؛ أما مسار المعالجة المُسجَّلة مسبقًا في Gemini 3.5 Transcribe فيتوقع عنوان URL عامًا عبر HTTPS بحد أقصى 15 دقيقة و300 ميغابايت، ولا يمكنه الجمع بين وضع التنسيق الذكي الخاص به والطوابع الزمنية للكلمات أو تسميات المتحدثين.

النمط في تلك القائمة هو أن SpaceXAI بنت منتج نسخ، وبنت Google قدرة نسخ. وتمييز المتحدثين، والطوابع الزمنية، وتقسيم القنوات، وكشف الأدوار هي الميزات التي تحتاجها عندما يكون النسخ هو التطبيق بأكمله؛ أما القابلية للتوجيه بالمطالبات، واتساع اللغة، وواجهة برمجية واحدة لكل شيء فهي ما تريده عندما يكون النسخ خطوة داخل تطبيق أكبر. لا قائمة أفضل من الأخرى في المجرد، والفريق الذي يختار على أساس الدقة وحده سينتهي به الأمر إلى فقدان المجموعة التي لم يكن يحتاجها.

Screenshot of the Google ai.google.dev speech-generation documentation for Gemini 3.5 Transcribe, showing the pre-recorded and live transcription endpoints, the token-based audio-input and text-output pricing, the supported-language list and the 10-minute live session ceiling.

الاختيار بينهما، وما الذي يغيّر الإجابة

توجّه إلى Grok Voice Transcribe 2.0 عندما يجب أن يكون النص المكتوب صحيحًا بينما لا يزال الصوت قيد التشغيل: تبادل أدوار الوكلاء في الوقت الفعلي، والترجمة النصية الفورية التي لا تحتمل الخطأ، وتدفقات مراكز الاتصال حيث يُعدّ إسناد المتحدث وفصل القنوات جزءًا من المتطلبات، أو أي خط أنابيب دفعي يهم فيه كل من 1.67 دولار لكل 1,000 دقيقة والإنتاجية البالغة 162×. وتوجّه إلى Gemini 3.5 Transcribe عندما يكون الصوت متعدد اللغات بلغة خارج المجموعة الموثّقة لدى Grok، أو عندما يُغذّي النص المكتوب نموذجًا يجب عليه أيضًا الاستدلال بشأنه، أو عندما تريد طبقة مجانية تبني عليها نموذجًا أوليًا، أو عندما يكون معدل AA-WER البالغ 2.6% في المسار الدفعي كافيًا ببساطة لما تفعله، وتكون التغطية اللغوية الإضافية أكثر قيمة من فرق السعر.

ما تفعله معظم الفرق فعليًا هنا ليس الاختيار. فكلا النموذجين يمكن الوصول إليهما عبر مفتاح {{1}}OrcaRouter{{/1}} API واحد إلى جانب أكثر من 200 نموذج آخر، ما يعني أنه يمكنك توجيه حركة الوكلاء الحية إلى {{2}}Grok Voice Transcribe 2.0{{/2}} والأرشيفات متعددة اللغات الطويلة إلى {{3}}Gemini 3.5 Transcribe{{/3}} دون الحفاظ على عقدين مع موردين، وعلاقتي فوترة، ومجموعتي بيانات اعتماد. وهذه أيضًا هي الطريقة التي تحسم بها مسألة الدقة بالنسبة لصوتك أنت: شغّل كلا النموذجين على التسجيلات نفسها، وقارن النصوص التي حصلت عليها فعليًا، ودع لغة التوجيه {{4}}DSL{{/4}} ترسل الحركة إلى حيث تنتمي. تخبرك لوحة الصدارة أي نموذج يفوز على ثماني ساعات من حديث وكلاء بالإنجليزية يخص شخصًا آخر؛ لكن صوتك أنت وحده هو ما يخبرك أيّهما يفوز على صوتك.

السؤال المطروح هو ما الذي يحدث لتلك الفجوة في البث عندما تعيد Google مراجعة نقطة نهاية Live في المرة القادمة. أُطلقت Gemini 3.5 Transcribe Live في معاينة عامة، وقِيست نسبة 4.0% بعد نحو يوم من إتاحتها للاستدعاء — إشارة مبكرة قوية، لكن الوقت المتاح لها للاستقرار كان أقل من الوقت المتاح لرقم Grok الذي تتخلف عنه الآن. إذا أغلقت Google فجوة البث البالغة 1.3 نقطة مع الحفاظ على زمن استجابة جزئية يبلغ 0.25 ثانية، لم تعد المقايضة مقايضة، وتتقلص ميزة Grok إلى السعر والميزات. حتى ذلك الحين، الانقسام واضح: أسرع النتائج الجزئية هي نتائج Google، وأدقها هي نتائج SpaceXAI، ولا يوجد أي نموذج في القائمة يجمع بين الاثنين.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا