
MAI-Transcribe-2-Streaming متاح الآن: Microsoft تنتزع تاج النسخ المباشر بمعدل خطأ كلمات يبلغ 2.5% WER
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 221 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
MAI-Transcribe-2-Streaming هو إجابة Microsoft AI عن السؤال الوحيد الذي تركه إصدارها في سبتمبر مفتوحًا، وقد أجابت عنه خلال 28 يومًا. صدر في 1 أكتوبر 2026، وMAI-Transcribe-2-Streaming نموذج تحويل كلام إلى نص في الوقت الفعلي ينسخ النص أثناء وصول الكلمات لا بعد انتهاء الملف. تقول Microsoft إنه يحتل المرتبة الأولى في الدقة على النصوص النهائية والجزئية معًا في تقييم AA-WER Streaming الخاص بـ Artificial Analysis، بمعدل خطأ كلمات 2.5% مع جاهزية النص النهائي بعد 0.13 ثانية من انتهاء الكلام. هذا ادعاء من مورّد يستند إلى منهجية متتبّع، لا صفّ ينشره المتتبّع — واعتبارًا من وقت الصياغة، لا تتضمنه النماذج الـ37 في لوحة الصدارة، والنموذج الذي كان سيزيحه هو Grok Voice Transcribe 2.0 (Streaming) عند 2.73% و0.49 ثانية. النموذج الذي بُني عليه، MAI-Transcribe-2، صدر في 3 سبتمبر كنموذج دفعات بمعدل WER 2.0% ومن دون SKU للوقت الفعلي؛ ونسخة البث المباشر تسد هذه الفجوة من دون التخلي عن الكثير من الدقة التي جعلت نسخة الدفعات بارزة. لكن ما تتخلى عنه فعلاً هو السعر: البث المباشر يبلغ 5.4× سعر الدفعات عند الإطلاق.
الإطار الذي تريده Microsoft هو اكتساح كامل للوحة البث. الإطار الذي تدعمه الأرقام أضيق وأكثر إثارة للاهتمام — نموذج يزعم أنه يتصدّر في الدقة وزمن الاستجابة في آن واحد، على حدود يكون فيها أدق إدخال في اللوحة أبطأ أربع مرات في الاستقرار من أسرع إدخالاتها، ولا يقل أي من تلك السريعة عن 3% من معدل خطأ الكلمات، ومسعّر على قدم المساواة مع اللاعب الحالي بدلاً من أن يكون أقل منه. إليك الإطلاق كما حدث، مع وسم مزاعم المورّد.
ما الذي أطلقته Microsoft في الأول من أكتوبر
يتم تقديم MAI-Transcribe-2-Streaming من خلال حزمة الكلام الخاصة بـ Microsoft في خدمة Azure AI Speech، مع توثيق تحت اسم النموذج نفسه ونفس نموذج التوزيع المعتمد على API فقط، بدون أوزان، كما في الإصدار الدفعي. ينسخ 60 لغة مع كشف تلقائي مستمر للغة، بحيث لا يلزم التصريح مسبقًا بجلسة تبدّل اللغات في منتصف البث. تضع Microsoft هذا النموذج على حدود باريتو بين الدقة وزمن التأخير في مخطط البث الخاص بـ Artificial Analysis — وهو التفسير الخاص بالمورّد لبيانات المتتبع، والتفسير الذي يدعمه مخطط المتتبع نفسه.
لم يكن نموذج البث هو الإصدار بأكمله. فقد أطلقت مايكروسوفت نموذجَي صوت إلى جانبه: MAI-Voice-2.1، الذي يغطي 23 لغة في 26 منطقة لغوية، وMAI-Voice-2.1-Flash، الذي يعالج ما يصل إلى 45 ثانية من الصوت بزمن استجابة يقارب 150 مللي ثانية. وإذا قُرئت هذه الإطلاقات كمنظومة واحدة، فإن إصدار الأول من أكتوبر يشكّل حزمة محادثة كاملة في الزمن الحقيقي — اسمع، افهم، تحدّث — لا مجرد إطلاق نموذج واحد.

قراءة لوحة صدارة البث المباشر
يقيس AA-WER Streaming أمرين لكل نموذج: مقدار خطأ النص المكتمل، وكم يستغرق من الوقت بعد توقف المتحدث حتى الانتهاء. وتدّعي مايكروسوفت أن MAI-Transcribe-2-Streaming يتقدم في كليهما: معدل خطأ كلمات بنسبة 2.5% في النص النهائي عند 0.13 ثانية بعد نهاية الكلام، والنسبة نفسها 2.5% في أول نص جزئي عند 0.12 ثانية، وهو ما تقول مايكروسوفت إنه الأول في الدقة في كليهما. اقرأ ذلك كرقم صادر عن مورّد — فحتى وقت إعداد المسودة، لم ترسم لوحة البث الخاصة بالمتتبّع النموذج بعد، لذا لا يوجد صف مستقل لـ MAI-Transcribe-2-Streaming لقراءته. ما تُظهره اللوحة هو المجال الذي يزعم أنه يتفوق عليه، والمجال أقرب مما توحي به صياغة "التاج":
• Grok Voice Transcribe 2.0 — معدل خطأ الكلمات (WER) في النص النهائي 2.73% عند 0.49 ثانية بعد انتهاء الكلام، وفقًا لـ Artificial Analysis، وهو المتصدر الحالي على لوحة الصدارة. وهذا متأخر بـ 0.23 نقطة عن نسبة 2.5% التي تدّعيها Microsoft، وأبطأ بنحو أربع مرات في الاستقرار — الفرق بين ترجمة نصية تواكب وأخرى تتخلف.
• Muse Voice Transcribe — 3.06% عند 0.16 ثانية، وفقًا لـ Artificial Analysis. أقرب منافس من حيث زمن التأخير: متأخر بنحو 30 مللي ثانية، وأسوأ في الدقة بمقدار 0.5 نقطة من ادعاء Microsoft.
• ElevenLabs Scribe v2 Realtime — 3.59% خلال 0.14 ثانية، وفقًا لـ Artificial Analysis. متعادل فعليًا في السرعة، ومتأخر بأكثر من نقطة مئوية في الدقة.
• Gemini 3.5 Transcribe Live — معدل خطأ الكلمات في البث (WER) بنسبة 4.00% عند 0.40 ثانية، وهو الرقم الذي نشرته Artificial Analysis وتستشهد به Google لنموذج Live API الخاص بها. هذه فجوة قدرها 1.5 نقطة، وهي المقارنة التي يستهدفها هذا الإصدار.
عمود النتيجة الجزئية الأولى هو المكان الذي يكون فيه الادعاء أقل تشابهًا مع بقية اللوحة. على المتتبع نفسه، تستقر النتائج الجزئية الأولى لـ Grok Voice Transcribe 2.0 عند 3.36% ولـ Gemini 3.5 Transcribe Live عند 5.77% — من المفترض أن تكون النتائج الجزئية أسوأ من النص النهائي، غالبًا بفارق نقطة أو أكثر، لأن النموذج يحسم قبل أن تنتهي الجملة. النتيجة الجزئية الأولى التي تطابق الرقم النهائي هي الجزء غير المعتاد حقًا في إطلاق Microsoft، وهي الجزء الذي لا تستطيع بيانات المتتبع نفسه تأكيده بعد. استشهد به كادعاء حتى يوجد صف.
التحفّظ الصادق هو أن 0.13 ثانية و0.16 ثانية تمثلان التجربة نفسها بالنسبة لإنسان يقرأ التسميات التوضيحية، وأن 2.5% مقابل 2.73% المتصدرة حالياً تعني نحو خطأين لكل 1000 كلمة. الفارق بهذا الحجم حقيقي لكنه صغير، وما إذا كان فارقاً يمكن لأي شخص أن يستشعره يعتمد على عبء العمل. وحيث يكون له أثر فعلي هو في الذيل: بثّ مركز اتصال يعمل ثماني ساعات يومياً بنسبة 2.73% مقابل 2.5% يعني عشرات الآلاف من الكلمات الخاطئة الإضافية سنوياً، وأخطاء الكلمات في النص المكتوب ليست موزعة بالتساوي — بل تتركز تحديداً على أسماء الأعلام والأرقام التي تجعل النص المكتوب مفيداً.

ما الذي يمكن شراؤه مقابل 9.00 دولارات لكل 1000 دقيقة
تكلفة البث المباشر أعلى من المعالجة بالدفعات، وقد سعّرتها مايكروسوفت عند أعلى فئة الخدمة الفورية لا دونها. يبلغ سعر MAI-Transcribe-2-Streaming 0.54 دولار لكل ساعة صوتية، وهو ما يعادل 9.00 دولارات لكل 1000 دقيقة من الصوت المُبَثّ، ويوصف بأنه سعر تمهيدي سارٍ حتى نهاية العام. وللمقارنة، فإن MAI-Transcribe-2 للدفعات يبلغ 0.10 دولار لكل ساعة صوتية — 1.67 دولار لكل 1000 دقيقة — لذا تبلغ تكلفة النسخ الفوري نحو 5.4 أضعاف السعر المعتمد على الملفات لنفس العائلة الأساسية، مع خطأ في الكلمات أعلى بمقدار 0.5 نقطة. هذا ليس هامش ربح تخفيه مايكروسوفت؛ بل هو السعر الصادق لاتصال مستمر ونص جزئي يجب أن يكون صحيحًا قبل انتهاء الجملة.
مقارنةً ببقية فئة البث، الصورة متباينة. يعادل MAI-Transcribe-2-Streaming نموذج Gemini 3.5 Transcribe Live عند نحو 9 دولارات لكل 1000 دقيقة — أكثر دقة، بالتكلفة نفسها. وهو يقع فوق ElevenLabs Scribe v2 Realtime وDeepgram Flux عند نحو 6.50 دولارات لكل 1000 دقيقة، وفوق Cartesia Ink-2 عند نحو 4 دولارات، ونحو ثلاثة أضعاف Muse Voice Transcribe عند نحو 3 دولارات. لذا فإن الإطلاق رهان على الدقة وزمن الاستجابة بسعر مكافئ، وليس حرب أسعار؛ أما الفرق التي تشغّل بالفعل نموذج بث أرخص فستقايض الدولارات مقابل نقاط في WER.
تستحق هذه المقايضة أن تُسمّى بدقة، لأنها المقايضة نفسها التي عكستها إطلاقة الدُفعات. في سبتمبر جعلت Microsoft الدقة رخيصة. وفي أكتوبر جعلت دقة الوقت الفعلي تكلّف مثل أي جهة أخرى. إذا كانت خط أنابيبك لا تحتاج إلى النصوص المفرّغة إلا في النهاية، فلا شيء في 1 أكتوبر يغيّر فاتورتك. أما إذا كانت تحتاج إليها بينما المكالمة لا تزال جارية، فقد انتقل الحساب للتو إلى الجودة.

البناء على نص مفرغ هو النصف الآخر من ذلك القرار، وهنا تبرر طبقة متعددة النماذج قيمتها. نادراً ما يكون النص المفرغ في الوقت الفعلي نهاية خط المعالجة — إذ يتم تلخيصه، وتقييمه، والبحث فيه، وتوجيهه، وتصعيده، وتتطلب تلك الخطوات نماذج مختلفة بتكاليف مختلفة. يوجد OrcaRouter لتلك الطبقة: واجهة برمجة تطبيقات واحدة عبر أكثر من 200 نموذج، وأسعار قوائم المزودين تُمرر بهامش ربح 0%، وتجاوز فشل تلقائي، ولغة توجيه DSL يمكنها إرسال نص مفرغ مباشر إلى نموذج لفحص الامتثال وآخر لملاحظات الاجتماع دون تكامل ثانٍ. MAI-Transcribe-2-Streaming نفسه ليس ضمن تلك القائمة — يتم تقديمه عبر حزمة الكلام الخاصة بمايكروسوفت — لكن النص المفرغ المتدفق الذي ينتجه هو بالضبط نوع المدخلات عالية الحجم والحساسة للتأخير الذي يدفع إلى إبقاء الطبقة التي فوقه محايدة تجاه النموذج.
ما لم يُثبت بعد
هناك ثلاثة أمور مفتوحة حقًا. أولًا، تمييز المتحدثين: تجمع النموذج الدفعي إسناد المتحدثين دون نشر معدل خطأ تمييز المتحدثين، ولا تقدم مواد Microsoft المتعلقة بالبث أي ادعاء بشأن تمييز المتحدثين على الإطلاق — فبالنسبة لنموذج زمن حقيقي يغذّي مساعدة الوكلاء المباشرة أو التسميات التوضيحية، غالبًا ما تكون ميزة «من قال ماذا» أكثر أهمية من معدل WER الخام. ثانيًا، التفصيل متعدد اللغات: 60 لغة مع كشف تلقائي مستمر للغة هو ادعاء واسع، ويمكن أن يتفاوت زمن الاستجابة لكل لغة في النموذج البثي أكثر بكثير من نظيره الدفعي، لأن جودة النص الجزئي تعتمد على مدى سرعة حسم النموذج للغة. ولم تنشر Microsoft أي جدول بث لكل لغة. ثالثًا، يُقاس WER للبث على صوت معياري نظيف؛ ونمط الفشل الذي يضر بعمليات النشر الحقيقية هو بث بعيد المجال مليء بالضوضاء، ولم تكن توجد أي مقارنة مستقلة للبث بعيد المجال يوم الإطلاق.
إلى أين يترك حزمة التقنيات لديك
الأمر المثير في هذا الإطلاق ليس أن Microsoft تملك أدق نص مُنتَج من البث المباشر. بل هو الإيقاع: المعالجة على دفعات في سبتمبر، والبث في أكتوبر، في العائلة نفسها، وعلى سطح المستندات نفسه، مع بنية تسعير تمتد الآن من 1.67 دولار إلى 9.00 دولارات لكل 1000 دقيقة للقدرة الأساسية نفسها. يمنح ذلك الفرق خيارًا حقيقيًا لأول مرة — الدفع مقابل الوقت الفعلي فقط حيث يهم الوقت الفعلي، ومعالجة كل ما عدا ذلك على شكل دفعات — لكنه يعني أيضًا أن طبقة التفريغ النصي أصبحت الآن شيئًا تضبطه حسب كل حمل عمل بدلًا من أن توحّده مرة واحدة.
اقرأ الادعاء الرئيسي حرفيًا وسيبقى صالحًا كتصريح من مورّد: تقول Microsoft إن MAI-Transcribe-2-Streaming هو الأول في كل من دقة النص النهائي ودقة النص الجزئي الأول، وإنه يقع على حدود باريتو. التحفظات هي أن لوحة المتعقّب لم تُدرج النموذج بعد، وأن التقدم الذي تدّعيه على المتصدر الحالي صغير بما يكفي ليختفي عند إعادة التشغيل، وأن ميزة السعر صفر، وأن قصة فصل المتحدثين لم تُروَ بعد. هذه أمور يجب مراقبتها، لا التاج.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
