
Grok Voice Transcribe 2.0 مقابل MAI Transcribe 2: مساران، لا متنافسان
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
صدر هذان الطرازان بفارق خمسة عشر يومًا وبسعر متطابق حتى السنت، ولن يكونا تقريبًا أبدًا في نفس قرار الشراء. Grok Voice Transcribe 2.0، الذي أطلقته SpaceXAI في 18 سبتمبر 2026، هو الطراز الذي تستدعيه عندما لا يزال الصوت قادمًا — فهو يبث عبر WebSocket، ويصدر نتائج مؤقتة كل 500 مللي ثانية تقريبًا، ويتصدر لوحة AA-WER Streaming الخاصة بـ Artificial Analysis بمعدل خطأ كلمات 2.7% للنسخ النهائية و3.4% للنتائج الجزئية الأولى. MAI-Transcribe-2، الذي أصدرته Microsoft AI في 3 سبتمبر 2026، هو الطراز الذي تستدعيه عندما يكون الصوت ملفًا بالفعل — فهو يعمل بنظام الدفعات فقط، وعلى لوحة Artificial Analysis غير المتدفقة، هو أدق طراز مُدار تم قياسه بنسبة 2.04% AA-WER، متقدمًا على Grok Voice Transcribe 2.0 بنسبة 2.29% وأسرع بنحو مرتين في الإنتاجية. كلا الطرازين مسعران عند 0.10 دولار لكل ساعة صوت، أي حوالي 1.67 دولار لكل 1000 دقيقة. إذا كان متطلبك هو الوقت الفعلي، فلا مجال للمقارنة. وإذا كان متطلبك هو ملف، فهناك مقارنة.
الخط الذي لن يرسمه لك أي بائع
دعم البث ليس مفتاحًا لتبديل الميزات. يقدّم Grok Voice Transcribe 2.0 النموذج نفسه عبر REST للملفات المسجلة وعبر `wss://api.x.ai/v1/stt` للصوت المباشر، لذا فإن الدقة التي تقيسها على أرشيفك هي الدقة التي تحصل عليها في مكالمة مباشرة. لا يمتلك MAI-Transcribe-2 أي SKU للبث على الإطلاق: تضع مواد إطلاق Microsoft هذا النموذج صراحةً ضمن فئة الصوت الطويل والدفعات، وبينما تدرج بطاقة النموذج التسميات التوضيحية في الوقت الفعلي ضمن سيناريوهات تطبيقه، فإن الطريق إلى ذلك هو تقطيع الصوت وتغذية كل مقطع عبر واجهة برمجة تطبيقات الدفعات — وهو خط أنابيب تبنيه وتشغّله، وليس ضمانًا لزمن استجابة تشتريه. إن معدل الإنتاجية الرئيسي لدى Microsoft البالغ نحو 411× من الوقت الحقيقي هو رقم سرعة معالجة، وليس رقم زمن استجابة، ويختلط الاثنان باستمرار في التغطية الصحفية لهذا الإصدار.
النتيجة العملية: إذا كنت تبني وكلاء صوتيين يتناوبون الأدوار، أو ترجمة نصية مباشرة، أو أي شيء يتفاعل فيه إنسان أو نموذج مع كلام جارٍ، فإن MAI-Transcribe-2 ليس مرشحًا مهما كانت دقته عالية. وإذا كنت تفرّغ الاجتماعات بعد انتهائها، أو تسجيلات مراكز الاتصال ليلًا، أو أرشيفات إعلامية، أو متأخرات الامتثال، فإن البث المباشر عبء بلا طائل، وأرقام المعالجة بالدفعات هي القصة كاملة.
أين يتفوق MAI-Transcribe-2 حقًا
الدقة في الملفات، أولًا. الفارق بين 2.04% و2.29% مقاس على إطار الاختبار المستقل نفسه — AA-WER v2 من Artificial Analysis، بنسبة 50% من AA-AgentTalk و25% لكل من VoxPopuli وEarnings22 — ما يجعله أنقى معطى في هذه المقارنة. إنه فارق مقداره 0.25 نقطة، أي نحو خطأين ونصف أقل لكل ألف كلمة. ويتوقف ما إذا كان ذلك مهمًا على ما تفعله بالنص المكتوب؛ فبالنسبة لأرشيف قابل للبحث لا يهم، وبالنسبة لسجل قانوني أو طبي قد يهم.
الإنتاجية، ثانيًا، وبفارق يتجاوز فارق الدقة: 333 ضعف الزمن الحقيقي مقابل 162 ضعفًا لدى Grok Voice Transcribe 2.0. وكلا الرقمين قياسان من Artificial Analysis لثواني الصوت المُدخلة المنسوخة في الثانية، وليسا ادعاءات من المورّد. وبهذا المعدل، يكتمل أرشيف من ألف ساعة في نحو ثلاث ساعات من الحوسبة على نموذج Microsoft ونحو ست على نموذج SpaceXAI. وفي حالة الترحيل لمرة واحدة لا يهم ذلك؛ أما في خط أنابيب يستقبل البيانات باستمرار، فإن خفض زمن التنفيذ إلى النصف يمثل فارقًا حقيقيًا في السعة.
تغطية اللغات، ثالثًا. تحدّد Microsoft 60 لغة مع اكتشاف تلقائي، وتبديل بين اللغات أثناء التسجيل الواحد، ومتوسط معدل خطأ في الكلمات قدره 5.2% عبرها على FLEURS — وهو رقم مُبلَّغ عنه من المورّد، لم يُعَد إنتاجه بشكل مستقل، لكنه على الأقل يصف الحالة متعددة اللغات عبر قائمة لغات معلنة. وتوثّق SpaceXAI عشرات اللغات مع التبديل أثناء التسجيل وتنسيق الشكل المكتوب عبر 25 لغة. إذا كان صوتك خارج المجموعة المغطاة جيدًا من الإنجليزية واللغات الأوروبية الرئيسية، فإن رقم FLEURS أكثر إفادة من لوحة صدارة ذات وزن إنجليزي ومثقلة بكلام الوكلاء.
اختلافان إضافيان مهمان من الناحية التشغيلية. يقدّم MAI-Transcribe-2 أنماط نسخ قابلة للتهيئة — حرفي، يحافظ على الترددات اللفظية، مقابل نظيف، يزيلها — بينما يعالج Grok Voice Transcribe 2.0 المشكلة نفسها بخيار إزالة كلمات الحشو. ونموذج Microsoft في المعاينة العامة على Microsoft Foundry، ما يعني عدم وجود اتفاقية مستوى خدمة (SLA) وتوصية دائمة بعدم استخدامه في الإنتاج حتى يصبح متاحاً للجميع (GA)؛ أما نموذج SpaceXAI فهو متاح للجميع بشكل عام مع حدود معدل منشورة تبلغ 10 طلبات في الثانية و100 جلسة بث متزامنة لكل فريق.

حيث يتقدّم Grok Voice Transcribe 2.0 حقًا
• بثّ في الوقت الفعلي — نقطة نهاية WebSocket مع نتائج مؤقتة كل ~500 مللي ثانية، مقابل الدفعات فقط دون وحدة SKU مُعلَنة في الوقت الفعلي
• دقة أول نص جزئي — 3.4% WER عند 0.49 ثانية على AA-WER Streaming، وهي فئة لا تنافس فيها MAI-Transcribe-2
• دقة الدُفعة على صوت محادثات الوكلاء — 2.29% إجمالًا، لكن في المجموعة الفرعية AA-AgentTalk من اللوحة غير المتدفقة يكون الترتيب أكثر تقاربًا مما يوحي به العنوان الرئيسي، وفي المزيج كثيف الوكلاء في لوحة البث يتصدّر Grok بلا منازع
• البنية التحتية لوكيل الصوت — يأتي اكتشاف نهاية الدور عبر Smart Turn وإزالة كلمات الحشو مضمَّنين في النموذج، في حين يترك MAI-Transcribe-2 منطق الأدوار للجهة المستدعية
• صوت متعدد القنوات — حتى 8 قنوات مستقلة تُفرَّغ في تمريرة واحدة، وهو ما يهم في تسجيلات الاستريو أو المكالمات متعددة الأطراف
• الثقة على مستوى الكلمة — تحمل الطوابع الزمنية درجة ثقة لكل كلمة، بحيث يمكن تمييز النطاقات منخفضة الثقة بدلاً من الثقة بها بالتساوي
• شروط التوفر — متاح عمومًا مع حدود تزامن منشورة، مقابل معاينة عامة بدون SLA
• ثبات السعر — 0.10 دولار في الساعة هو السعر الثابت لكل من الدفعات والسعر الأساسي لفئة البث البالغة 0.20 دولار، حيث إن سعر Microsoft المطابق البالغ 0.10 دولار هو عرض إطلاق لفترة محدودة دون سعر قياسي معلن لعام 2027
تلك النقطة الأخيرة هي التي تتجاهلها معظم المقارنات. يكلف النموذجان نفس الشيء اليوم، وأحد هذين السعرين له تاريخ انتهاء صلاحية بينما الآخر ليس له. لم تنشر Microsoft سعرًا بعد الترويج، وتختلف التغطيات حول ما إذا كان العرض يستمر حتى نهاية عام 2026 أو ليس له تاريخ انتهاء محدد على الإطلاق. إذا كنت تُعدّ ميزانية نسخ نصي لثلاث سنوات بناءً على 1.67 دولار لكل 1,000 دقيقة من Microsoft، فإنك تُعدّ رقمًا لم تلتزم به الشركة الموردة.

التداخل حقيقي، وهو يشكل معظم قائمة الميزات.
إذا وضعنا مسألة البث جانبًا، يتقارب المنتجان بقوة. كلاهما يقوم بتمييز المتحدثين. كلاهما يعيد الطوابع الزمنية على مستوى الكلمة. كلاهما يتعامل مع التطبيع العكسي للنص — الأرقام والتواريخ والعملات وتفاصيل الاتصال معروضة في شكل مكتوب. كلاهما يقبل مصطلحات المجال: Grok Voice Transcribe 2.0 بما يصل إلى 100 مصطلح رئيسي لكل طلب، وMAI-Transcribe-2 كقوائم مصطلحات المجال والاختصارات. كلاهما يكتشف اللغة تلقائيًا ويتابع المتحدث الذي يبدل اللغة أثناء التسجيل. كلاهما يتعامل مع صوت الهاتف بتردد 8 كيلوهرتز، وهي الحالة التي تفشل فيها معظم نماذج النسخ الصوتي بصمت، والحالة التي ضبطت SpaceXAI نموذجها ضدها بأقصى جهد — فقد انخفض معدل خطأ الكلمات (WER) في مجموعة الهاتف الداخلية الخاصة بها من 10.6% إلى 7.1% بين الإصدارات، وهو رقم أعلنته الشركة على بيانات صوتية خاصة بها.
كلاهما أيضًا يحمل حدودًا للمدخلات تشكّل البنى المعمارية وليس الميزانيات فحسب. يقبل Grok Voice Transcribe 2.0 ملفات يصل حجمها إلى 500 ميجابايت عبر 12 تنسيقًا صوتيًا بمعدلات عينات تتراوح من 8 كيلوهرتز إلى 48 كيلوهرتز. يتم تحديد حدود MAI-Transcribe-2 بواسطة مسار Foundry وليس النموذج، ويجب على الفرق قراءة وثائق Microsoft الخاصة بالحد الأقصى الحالي بدلاً من افتراض التكافؤ مع خدمة STT مخصصة.
ما يعنيه هذا التقارب هو أن القرار يتلخص في ثلاثة أسئلة بالترتيب: هل يحتاج إلى أن يكون مباشرًا، وكم عدد اللغات التي لديك فعليًا، وما مقدار ما تكلفك إياه فجوة الدقة. السؤال الأول ثنائي ويستبعد أحد الخيارين تمامًا. والسؤال الثاني يمكن عادةً الإجابة عنه من عينة من تسجيلاتك الصوتية الخاصة. أما السؤال الثالث فهو صغير بما يكفي بحيث لا يحدد أي شيء في معظم أحمال العمل القائمة على الملفات — فجوة الـ 0.25 نقطة حقيقية، لكن كون كلا النموذجين ضمن نصف نقطة من أفضل رقم قاسه أي شخص هو أمر حقيقي أيضًا.

ماذا نفعل بهذا؟
تعامل معهما كمسارات مزدوجة لا كمواجهة مباشرة. فمركز اتصال يشغّل مساعدة الوكلاء المباشرة وأرشيف امتثال ليلي لا يختار بين Grok Voice Transcribe 2.0 وMAI-Transcribe-2 — بل يشغّلهما معًا، والسؤال الوحيد هو ما إذا كان ذلك سيكلّفه علاقتين مع مورّدين، ومجموعتي بيانات اعتماد، وفاتورتين، وحدَّي معدّل استخدام. لا يوجد أي من النموذجين في كتالوج OrcaRouter اليوم، لذا تذهب نداءات النسخ نفسها إلى واجهة API الخاصة بكل مورّد. أما ما يغطيه مفتاح OrcaRouter واحد فهو كل ما يأتي لاحقًا في المسار: الملخِّص، والمصنِّف، والوكيل الذي يستنتج انطلاقًا من النص المنسوخ، ومهمة التقييم التي تقارن مخرجات المورّدين على التسجيل نفسه. وهذه الأخيرة هي سبب الاهتمام — فلا يمكنك الحسم بين هذين النموذجين استنادًا إلى لوحة صدارة، لأن لوحة الصدارة ثماني ساعات من حديث وكلاء بالإنجليزية، وصوتك ليس كذلك.
راقب أمرين. أولاً، ما إذا كانت مايكروسوفت ستُثبّت سعراً قياسياً على MAI-Transcribe-2 عند انتهاء عرض الإطلاق؛ فسعر دائم قدره 1.67 دولار لكل 1000 دقيقة سيجعله الخيار الافتراضي للدفعات على أساس التكلفة وحدها، أما العودة إلى سعر MAI-Transcribe-1 البالغ 0.36 دولار لكل ساعة فستجعل هذه المحادثة أقصر بكثير. ثانياً، ما إذا كانت مايكروسوفت ستطرح SKU للبث المباشر. فبطاقة النموذج تسمّي بالفعل التسمية التوضيحية الفورية كسيناريو مستهدف، والشيء الوحيد الذي يفصل MAI-Transcribe-2 عن مسار البث المباشر هو نقطة نهاية — وإذا تحقق ذلك، يكفّ هذان عن كونهما مسارين ويصبحان متنافسين.
