بطاقة مقال رئيسية تحمل عنوان 'MAI-Transcribe-2-Streaming مباشر' مع شارة 'نموذج جديد · MICROSOFT AI' والعنوان الفرعي 'Microsoft تنتزع تاج النص المباشر عند 2.5% WER'، مع شريط إحصائي يظهر معدل خطأ الكلمات في البث المباشر بنسبة 2.5% عند 0.13 ثانية بعد نهاية الكلام، مُوصوف على البطاقة بأنه ادعاء Microsoft والأول لكل من النصوص النهائية والجزئية؛ 60 لغة مع اكتشاف تلقائي مستمر للغة؛ و 9.00 دولار لكل 1,000 دقيقة، موصوفًا بأنه 0.54 دولار لكل ساعة صوتية كسعر تعريفي حتى 2026؛ على تدرج من الأبيض إلى الأزرق مع شعار OrcaRouter في أسفل اليمين.
Guides & Insights

MAI-Transcribe-2-Streaming متاح الآن: Microsoft تنتزع تاج النسخ المباشر بمعدل خطأ كلمات يبلغ 2.5% WER

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

‏MAI-Transcribe-2-Streaming هو إجابة Microsoft AI عن السؤال الوحيد الذي تركه إصدارها في سبتمبر مفتوحًا، وقد أجابت عنه خلال 28 يومًا. صدر في 1 أكتوبر 2026، و‏MAI-Transcribe-2-Streaming نموذج تحويل كلام إلى نص في الوقت الفعلي ينسخ النص أثناء وصول الكلمات لا بعد انتهاء الملف. تقول Microsoft إنه يحتل المرتبة الأولى في الدقة على النصوص النهائية والجزئية معًا في تقييم AA-WER Streaming الخاص بـ Artificial Analysis، بمعدل خطأ كلمات 2.5% مع جاهزية النص النهائي بعد 0.13 ثانية من انتهاء الكلام. هذا ادعاء من مورّد يستند إلى منهجية متتبّع، لا صفّ ينشره المتتبّع — واعتبارًا من وقت الصياغة، لا تتضمنه النماذج الـ37 في لوحة الصدارة، والنموذج الذي كان سيزيحه هو Grok Voice Transcribe 2.0 (Streaming) عند 2.73% و0.49 ثانية. النموذج الذي بُني عليه، MAI-Transcribe-2، صدر في 3 سبتمبر كنموذج دفعات بمعدل WER 2.0% ومن دون SKU للوقت الفعلي؛ ونسخة البث المباشر تسد هذه الفجوة من دون التخلي عن الكثير من الدقة التي جعلت نسخة الدفعات بارزة. لكن ما تتخلى عنه فعلاً هو السعر: البث المباشر يبلغ 5.4× سعر الدفعات عند الإطلاق.

الإطار الذي تريده Microsoft هو اكتساح كامل للوحة البث. الإطار الذي تدعمه الأرقام أضيق وأكثر إثارة للاهتمام — نموذج يزعم أنه يتصدّر في الدقة وزمن الاستجابة في آن واحد، على حدود يكون فيها أدق إدخال في اللوحة أبطأ أربع مرات في الاستقرار من أسرع إدخالاتها، ولا يقل أي من تلك السريعة عن 3% من معدل خطأ الكلمات، ومسعّر على قدم المساواة مع اللاعب الحالي بدلاً من أن يكون أقل منه. إليك الإطلاق كما حدث، مع وسم مزاعم المورّد.

ما الذي أطلقته Microsoft في الأول من أكتوبر

يتم تقديم MAI-Transcribe-2-Streaming من خلال حزمة الكلام الخاصة بـ Microsoft في خدمة Azure AI Speech، مع توثيق تحت اسم النموذج نفسه ونفس نموذج التوزيع المعتمد على API فقط، بدون أوزان، كما في الإصدار الدفعي. ينسخ 60 لغة مع كشف تلقائي مستمر للغة، بحيث لا يلزم التصريح مسبقًا بجلسة تبدّل اللغات في منتصف البث. تضع Microsoft هذا النموذج على حدود باريتو بين الدقة وزمن التأخير في مخطط البث الخاص بـ Artificial Analysis — وهو التفسير الخاص بالمورّد لبيانات المتتبع، والتفسير الذي يدعمه مخطط المتتبع نفسه.

لم يكن نموذج البث هو الإصدار بأكمله. فقد أطلقت مايكروسوفت نموذجَي صوت إلى جانبه: MAI-Voice-2.1، الذي يغطي 23 لغة في 26 منطقة لغوية، وMAI-Voice-2.1-Flash، الذي يعالج ما يصل إلى 45 ثانية من الصوت بزمن استجابة يقارب 150 مللي ثانية. وإذا قُرئت هذه الإطلاقات كمنظومة واحدة، فإن إصدار الأول من أكتوبر يشكّل حزمة محادثة كاملة في الزمن الحقيقي — اسمع، افهم، تحدّث — لا مجرد إطلاق نموذج واحد.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

قراءة لوحة صدارة البث المباشر

يقيس AA-WER Streaming أمرين لكل نموذج: مقدار خطأ النص المكتمل، وكم يستغرق من الوقت بعد توقف المتحدث حتى الانتهاء. وتدّعي مايكروسوفت أن MAI-Transcribe-2-Streaming يتقدم في كليهما: معدل خطأ كلمات بنسبة 2.5% في النص النهائي عند 0.13 ثانية بعد نهاية الكلام، والنسبة نفسها 2.5% في أول نص جزئي عند 0.12 ثانية، وهو ما تقول مايكروسوفت إنه الأول في الدقة في كليهما. اقرأ ذلك كرقم صادر عن مورّد — فحتى وقت إعداد المسودة، لم ترسم لوحة البث الخاصة بالمتتبّع النموذج بعد، لذا لا يوجد صف مستقل لـ MAI-Transcribe-2-Streaming لقراءته. ما تُظهره اللوحة هو المجال الذي يزعم أنه يتفوق عليه، والمجال أقرب مما توحي به صياغة "التاج":

• Grok Voice Transcribe 2.0 — معدل خطأ الكلمات (WER) في النص النهائي ‏2.73% عند 0.49 ثانية بعد انتهاء الكلام، وفقًا لـ Artificial Analysis، وهو المتصدر الحالي على لوحة الصدارة. وهذا متأخر بـ 0.23 نقطة عن نسبة 2.5% التي تدّعيها Microsoft، وأبطأ بنحو أربع مرات في الاستقرار — الفرق بين ترجمة نصية تواكب وأخرى تتخلف.

• Muse Voice Transcribe — 3.06% عند 0.16 ثانية، وفقًا لـ Artificial Analysis. أقرب منافس من حيث زمن التأخير: متأخر بنحو 30 مللي ثانية، وأسوأ في الدقة بمقدار 0.5 نقطة من ادعاء Microsoft.

• ElevenLabs Scribe v2 Realtime — 3.59% خلال 0.14 ثانية، وفقًا لـ Artificial Analysis. متعادل فعليًا في السرعة، ومتأخر بأكثر من نقطة مئوية في الدقة.

• Gemini 3.5 Transcribe Live — معدل خطأ الكلمات في البث (WER) بنسبة 4.00% عند 0.40 ثانية، وهو الرقم الذي نشرته Artificial Analysis وتستشهد به Google لنموذج Live API الخاص بها. هذه فجوة قدرها 1.5 نقطة، وهي المقارنة التي يستهدفها هذا الإصدار.

عمود النتيجة الجزئية الأولى هو المكان الذي يكون فيه الادعاء أقل تشابهًا مع بقية اللوحة. على المتتبع نفسه، تستقر النتائج الجزئية الأولى لـ Grok Voice Transcribe 2.0 عند 3.36% ولـ Gemini 3.5 Transcribe Live عند 5.77% — من المفترض أن تكون النتائج الجزئية أسوأ من النص النهائي، غالبًا بفارق نقطة أو أكثر، لأن النموذج يحسم قبل أن تنتهي الجملة. النتيجة الجزئية الأولى التي تطابق الرقم النهائي هي الجزء غير المعتاد حقًا في إطلاق Microsoft، وهي الجزء الذي لا تستطيع بيانات المتتبع نفسه تأكيده بعد. استشهد به كادعاء حتى يوجد صف.

التحفّظ الصادق هو أن 0.13 ثانية و0.16 ثانية تمثلان التجربة نفسها بالنسبة لإنسان يقرأ التسميات التوضيحية، وأن 2.5% مقابل 2.73% المتصدرة حالياً تعني نحو خطأين لكل 1000 كلمة. الفارق بهذا الحجم حقيقي لكنه صغير، وما إذا كان فارقاً يمكن لأي شخص أن يستشعره يعتمد على عبء العمل. وحيث يكون له أثر فعلي هو في الذيل: بثّ مركز اتصال يعمل ثماني ساعات يومياً بنسبة 2.73% مقابل 2.5% يعني عشرات الآلاف من الكلمات الخاطئة الإضافية سنوياً، وأخطاء الكلمات في النص المكتوب ليست موزعة بالتساوي — بل تتركز تحديداً على أسماء الأعلام والأرقام التي تجعل النص المكتوب مفيداً.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

ما الذي يمكن شراؤه مقابل 9.00 دولارات لكل 1000 دقيقة

تكلفة البث المباشر أعلى من المعالجة بالدفعات، وقد سعّرتها مايكروسوفت عند أعلى فئة الخدمة الفورية لا دونها. يبلغ سعر MAI-Transcribe-2-Streaming ‏0.54 دولار لكل ساعة صوتية، وهو ما يعادل 9.00 دولارات لكل 1000 دقيقة من الصوت المُبَثّ، ويوصف بأنه سعر تمهيدي سارٍ حتى نهاية العام. وللمقارنة، فإن MAI-Transcribe-2 للدفعات يبلغ 0.10 دولار لكل ساعة صوتية — 1.67 دولار لكل 1000 دقيقة — لذا تبلغ تكلفة النسخ الفوري نحو 5.4 أضعاف السعر المعتمد على الملفات لنفس العائلة الأساسية، مع خطأ في الكلمات أعلى بمقدار 0.5 نقطة. هذا ليس هامش ربح تخفيه مايكروسوفت؛ بل هو السعر الصادق لاتصال مستمر ونص جزئي يجب أن يكون صحيحًا قبل انتهاء الجملة.

مقارنةً ببقية فئة البث، الصورة متباينة. يعادل MAI-Transcribe-2-Streaming نموذج Gemini 3.5 Transcribe Live عند نحو 9 دولارات لكل 1000 دقيقة — أكثر دقة، بالتكلفة نفسها. وهو يقع فوق ElevenLabs Scribe v2 Realtime وDeepgram Flux عند نحو 6.50 دولارات لكل 1000 دقيقة، وفوق Cartesia Ink-2 عند نحو 4 دولارات، ونحو ثلاثة أضعاف Muse Voice Transcribe عند نحو 3 دولارات. لذا فإن الإطلاق رهان على الدقة وزمن الاستجابة بسعر مكافئ، وليس حرب أسعار؛ أما الفرق التي تشغّل بالفعل نموذج بث أرخص فستقايض الدولارات مقابل نقاط في WER.

تستحق هذه المقايضة أن تُسمّى بدقة، لأنها المقايضة نفسها التي عكستها إطلاقة الدُفعات. في سبتمبر جعلت Microsoft الدقة رخيصة. وفي أكتوبر جعلت دقة الوقت الفعلي تكلّف مثل أي جهة أخرى. إذا كانت خط أنابيبك لا تحتاج إلى النصوص المفرّغة إلا في النهاية، فلا شيء في 1 أكتوبر يغيّر فاتورتك. أما إذا كانت تحتاج إليها بينما المكالمة لا تزال جارية، فقد انتقل الحساب للتو إلى الجودة.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

البناء على نص مفرغ هو النصف الآخر من ذلك القرار، وهنا تبرر طبقة متعددة النماذج قيمتها. نادراً ما يكون النص المفرغ في الوقت الفعلي نهاية خط المعالجة — إذ يتم تلخيصه، وتقييمه، والبحث فيه، وتوجيهه، وتصعيده، وتتطلب تلك الخطوات نماذج مختلفة بتكاليف مختلفة. يوجد OrcaRouter لتلك الطبقة: واجهة برمجة تطبيقات واحدة عبر أكثر من 200 نموذج، وأسعار قوائم المزودين تُمرر بهامش ربح 0%، وتجاوز فشل تلقائي، ولغة توجيه DSL يمكنها إرسال نص مفرغ مباشر إلى نموذج لفحص الامتثال وآخر لملاحظات الاجتماع دون تكامل ثانٍ. MAI-Transcribe-2-Streaming نفسه ليس ضمن تلك القائمة — يتم تقديمه عبر حزمة الكلام الخاصة بمايكروسوفت — لكن النص المفرغ المتدفق الذي ينتجه هو بالضبط نوع المدخلات عالية الحجم والحساسة للتأخير الذي يدفع إلى إبقاء الطبقة التي فوقه محايدة تجاه النموذج.

ما لم يُثبت بعد

هناك ثلاثة أمور مفتوحة حقًا. أولًا، تمييز المتحدثين: تجمع النموذج الدفعي إسناد المتحدثين دون نشر معدل خطأ تمييز المتحدثين، ولا تقدم مواد Microsoft المتعلقة بالبث أي ادعاء بشأن تمييز المتحدثين على الإطلاق — فبالنسبة لنموذج زمن حقيقي يغذّي مساعدة الوكلاء المباشرة أو التسميات التوضيحية، غالبًا ما تكون ميزة «من قال ماذا» أكثر أهمية من معدل WER الخام. ثانيًا، التفصيل متعدد اللغات: 60 لغة مع كشف تلقائي مستمر للغة هو ادعاء واسع، ويمكن أن يتفاوت زمن الاستجابة لكل لغة في النموذج البثي أكثر بكثير من نظيره الدفعي، لأن جودة النص الجزئي تعتمد على مدى سرعة حسم النموذج للغة. ولم تنشر Microsoft أي جدول بث لكل لغة. ثالثًا، يُقاس WER للبث على صوت معياري نظيف؛ ونمط الفشل الذي يضر بعمليات النشر الحقيقية هو بث بعيد المجال مليء بالضوضاء، ولم تكن توجد أي مقارنة مستقلة للبث بعيد المجال يوم الإطلاق.

إلى أين يترك حزمة التقنيات لديك

الأمر المثير في هذا الإطلاق ليس أن Microsoft تملك أدق نص مُنتَج من البث المباشر. بل هو الإيقاع: المعالجة على دفعات في سبتمبر، والبث في أكتوبر، في العائلة نفسها، وعلى سطح المستندات نفسه، مع بنية تسعير تمتد الآن من 1.67 دولار إلى 9.00 دولارات لكل 1000 دقيقة للقدرة الأساسية نفسها. يمنح ذلك الفرق خيارًا حقيقيًا لأول مرة — الدفع مقابل الوقت الفعلي فقط حيث يهم الوقت الفعلي، ومعالجة كل ما عدا ذلك على شكل دفعات — لكنه يعني أيضًا أن طبقة التفريغ النصي أصبحت الآن شيئًا تضبطه حسب كل حمل عمل بدلًا من أن توحّده مرة واحدة.

اقرأ الادعاء الرئيسي حرفيًا وسيبقى صالحًا كتصريح من مورّد: تقول Microsoft إن MAI-Transcribe-2-Streaming هو الأول في كل من دقة النص النهائي ودقة النص الجزئي الأول، وإنه يقع على حدود باريتو. التحفظات هي أن لوحة المتعقّب لم تُدرج النموذج بعد، وأن التقدم الذي تدّعيه على المتصدر الحالي صغير بما يكفي ليختفي عند إعادة التشغيل، وأن ميزة السعر صفر، وأن قصة فصل المتحدثين لم تُروَ بعد. هذه أمور يجب مراقبتها، لا التاج.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا