بطاقة مقال بارزة تحمل نص 'MAI-Transcribe-2-Streaming مقابل MAI-Transcribe-2' مع شارة 'العائلة نفسها · فئتان سعريتان' وعنوان فرعي 'ادفع 5.4x مقابل التوقيت على مستوى الكلمة'، مبنية كبطاقتَي اسم طراز تفصل بينهما شارة VS، مع شريط شرائح يعرض 9.00$ مقابل 1.67$ لكل 1,000 دقيقة، ومعدل خطأ كلمات مُعلن 2.5% مقابل 2.0% مُدقّق، و0.13 ثانية للوصول إلى النص النهائي مقابل نحو 411x من الزمن الحقيقي، وطوابع زمنية إضافة إلى فصل المتحدثين على فئة الدفعات فقط، على خلفية متدرجة من الأبيض إلى الأزرق مع شعار OrcaRouter في أسفل اليمين.
Guides & Insights

MAI-Transcribe-2-Streaming مقابل MAI-Transcribe-2: ادفع 5.4× مقابل التوقيت على مستوى الكلمة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

MAI-Transcribe-2-Streaming وMAI-Transcribe-2 هما عائلة النموذج نفسها مقسّمة على فئتين سعريتين، والانقسام واضح بما يكفي للتخطيط على أساسه. صدر MAI-Transcribe-2 في 3 سبتمبر 2026 كنموذج دُفعات: معدل خطأ كلمات 2.0% على لوحة Artificial Analysis غير التدفقية، وبسرعة تقارب 411× الزمن الحقيقي، و0.10 دولار لكل ساعة صوت — أي نحو 1.67 دولار لكل 1000 دقيقة. صدر MAI-Transcribe-2-Streaming في 1 أكتوبر 2026 كنسخة الزمن الحقيقي: معدل خطأ كلمات تدفقي معلن 2.5% عند 0.13 ثانية حتى النص النهائي، وهو ما تصفه Microsoft بأنه الأول من حيث الدقة على النصوص النهائية والجزئية معًا، مقيسًا وفق منهجية التدفق لدى Artificial Analysis بدلًا من أن يكون قد رُسم بعد كصف على لوحة المتتبّع. 0.54 دولار لكل ساعة صوت — أي نحو 9.00 دولارات لكل 1000 دقيقة. اللغات الستون نفسها، والتوزيع نفسه عبر API فقط، ولا أوزان منشورة. تكلّف التدفق 5.4× سعر الدُفعات، ووفق أرقام Microsoft نفسها، 0.5 نقطة من الدقة. وما إذا كان ذلك صفقة رابحة أم ضريبة يعتمد كليًا على سؤال واحد: هل يحتاج أي شيء في مسارك إلى النص قبل أن تنتهي الجملة؟

لأنّ النموذجين يأتيان من مورّد واحد ومن واجهة توثيق واحدة، تكون المقارنة نظيفة على نحو غير معتاد — فلا تخمين بشأن تكافؤ الميزات، ولا عدم تطابق في إصدارات المعايير المرجعية، ولا «أرقامهم مقابل أرقامنا». إنه مورّد واحد يسعّر سرعتين للقدرة نفسها، والعمل المثير هو تحديد أحمال العمل التي تغطيها الطبقة الرخيصة فعلاً.

العائلة، في صفّين

• MAI-Transcribe-2 — دفعات، صوت مسجل مسبقًا، صدر في 3 سبتمبر 2026. معدل AA-WER بنسبة 2.0%، في المرتبة الثانية على لوحة المتصدرين غير المتدفقة لدى Artificial Analysis. نحو 411× من الوقت الفعلي، أيضًا في المرتبة الثانية. 0.10 دولار لكل ساعة صوتية، حوالي 1.67 دولار لكل 1000 دقيقة، كعرض لفترة محدودة حتى نهاية العام دون نشر سعر قياسي. يجمع تجزئة المتحدثين ويعيد الطوابع الزمنية على مستوى الكلمة. 60 لغة مع التعرف التلقائي على اللغة.

• MAI-Transcribe-2-Streaming — نسخ مستمر في الوقت الفعلي بنمط WebSocket، تم إصداره في 1 أكتوبر 2026. تعلن Microsoft عن WER بنسبة 2.5% للنص النهائي عند 0.13 ثانية بعد انتهاء الكلام، ونفس 2.5% على أول نتيجة جزئية عند 0.12 ثانية، وهو ما تصفه بأنه الأول في الدقة على كليهما — ادعاء المورد الذي تم قياسه وفق منهجية البث الخاصة بـ Artificial Analysis، ومع ذلك حتى وقت الصياغة لم يتم بعد رسم النموذج على لوحة المتتبع الخاصة (37 نموذجًا)، ومتصدره الحالي هو Grok Voice Transcribe 2.0 بنسبة 2.73% و0.49 ثانية. 0.54 دولار لكل ساعة صوتية، حوالي 9.00 دولارات لكل 1,000 دقيقة، عرض تقديمي حتى نهاية العام. 60 لغة مع كشف تلقائي مستمر للغة. لا يوجد ادعاء منشور بشأن فصل المتحدثين، ولا ادعاء منشور بشأن الطوابع الزمنية للكلمات.

التفاوت الوحيد الذي لا يتعلق بالسرعة أو السعر هو القدرات: فميزتا تمييز المتحدثين والطوابع الزمنية للكلمات في نموذج المعالجة بالدفعات ميزتان موثقتان، بينما ليستا كذلك في نموذج البث. وهذا أهم من فجوة الدقة البالغة 0.5 نقطة، وهو السبب في أن كثيرًا من الفرق سينتهي بها الأمر إلى تشغيل كليهما.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

ما الذي يمنحه 5.4× فعليًا

عند 1.67 دولار لكل 1000 دقيقة، يصبح النسخ على دفعات عند مستوى الدقة هذا قريبًا من المجانية على الهامش. وعند 9.00 دولارات لكل 1000 دقيقة، يصبح النسخ المتدفق بندًا حقيقيًا في التكلفة — إذ يعادل تقريبًا تكلفة نسخ الصوت نفسه خمس مرات، مضافًا إليها نصف نقطة من الدقة. لذا فالسؤال ليس ما إذا كان النسخ في الوقت الفعلي يستحق أكثر؛ بل أي دقائق محددة تحتاج إليه.

أحمال العمل التي يكون فيها ذلك واضحًا: الترجمات المباشرة التي يقرأها شخص بينما يتحدث المتحدث، حيث يكون الفارق بين 0.13 ثانية ونهاية الملف هو المنتج بأكمله؛ ومساعدة الوكيل في الوقت الفعلي وتقييم الامتثال، حيث يكون أي تدخل يصل بعد انتهاء المكالمة بلا قيمة؛ وتطبيقات الصوت التفاعلية، حيث لا يمكن إكمال دور حتى يكتمل النص. في هذه الحالات الثلاث جميعها، لا يُعد نموذج المعالجة بالدفعات خيارًا أرخص، بل هو خيار غير مطروح — لا يوجد سعر يمكن عنده أن يصبح النسخ اللاحق فوريًا.

أعباء العمل التي لا يكون فيها ذلك مناسبًا بوضوح: تسجيل الاجتماعات والمكالمات الذي يُعالَج بعد وقوع الحدث، والأرشيفات الإعلامية، وضمان الجودة الدفعي لمراكز الاتصال، ومراجعة الامتثال للمكالمات المكتملة، وإعداد التسميات التوضيحية للبودكاست والفيديو. هذه بالضبط هي خطوط المعالجة التي صُمّمت فيها سرعة النموذج الدفعي البالغة 411× من الوقت الحقيقي وتعرفته البالغة 1.67 دولار لتفوز، ودفع 5.4× لاقتطاع بضع مئات من الميلي ثانية من نص مفرغ لا يقرؤه أحد حتى الغد إهدار مباشر. أضف ميزتي تمييز المتحدثين والطوابع الزمنية للكلمات — فالنموذج الدفعي يوثّقهما، أما النموذج التدفقي فلا — وستصبح حجة المعالجة اللاحقة أقوى، لا أضعف.

المنطقة الوسطى المثيرة للاهتمام هي حيث يكون الاثنان مكمّلين أحدهما للآخر حقًا: شغّل المعالجة التدفقية للواجهة الحية والمعالجة الدُفعية للسجل. مكالمة دعم تُنسَخ نصيًا في الوقت الفعلي لتشغيل لوحة مساعدة الوكيل، ثم يُعاد نسخها نصيًا على شكل دُفعة طوال الليل لإنتاج النص الأرشيفي مع تمييز المتحدثين والطوابع الزمنية، تكلّف علاوة صغيرة مقارنةً بالمعالجة الدُفعية وحدها وتحصل على السلوكين معًا. لم يصبح هذا النمط ممكنًا إلا في سبتمبر، وإصدار أكتوبر هو ما يكمله.

حيث يظهر هيكل القسمين

ثمة أمران في هذه العائلة يستحقان الملاحظة، لأنهما بنيويان وليسا عارضين.

أولاً، التسلسل الهرمي للدقة مقلوب عن النمط المعتاد. عادةً ما تدفع النماذج المتدفقة ضريبة دقة كبيرة مقابل الإخراج في الوقت الفعلي؛ وهنا تبلغ الضريبة 0.5 نقطة، من 2.0% على لوحة الدفعات إلى 2.5% المزعومة على لوحة التدفق. حققت مايكروسوفت نموذجاً في الوقت الفعلي ضمن نصف نقطة من طرازها الرائد للدفعات وفق أرقامها الخاصة، وهو الإنجاز الهندسي الفعلي لإصدار أكتوبر إذا ثبت — وليس تصدّر اللوحة، الذي قد تغيّره إعادة تشغيل جيدة والذي لم يؤكده المتتبع بعد.

ثانيًا، التسعير معكوس عن النمط المعتاد أيضًا. عادةً ما يمنح المورّدون خصمًا على الطبقة الأعلى حجمًا؛ لكن Microsoft سعّرت البث عند 5.4 أضعاف تسعير الدفعات، وأبقت كليهما على أسعار تمهيدية تنتهي في الوقت نفسه. وهذا يبدو أقل كعلاوة بث مقصودة وأكثر كإطلاقين منفصلين يحمل كل منهما خصم إطلاق، من دون سعر قياسي منشور لأي منهما. على الفرق التي تخطط لميزانية 2027 أن تتعامل مع كلا الرقمين على أنهما مؤقتان — فكل من $1.67 و$9.00 موسوم بأنه لفترة محدودة، ولم يُعلَن عن سعر لاحق لأي منهما.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

ما لم يُثبت بعد

لا تزال الأسئلة المفتوحة لنموذج المعالجة بالدفعات منذ سبتمبر مفتوحة: لا معدل خطأ منشور في فصل المتحدثين، ولا تفصيل لكل لغة يدعم ادعاء الـ60 لغة، وسعر ترويجي دون تسمية خلف له. ويضيف النموذج التدفقي سؤالاً آخر خاصاً بالعمل في الزمن الحقيقي — إذ يُقاس معدل خطأ الكلمات (WER) في البث على صوت نظيف، بينما جودة النص الجزئي في بث بعيد المجال ومليء بالضجيج هي نمط الفشل الأكثر أهمية في النشر وأقل ما تغطيه مواد الإطلاق. كما يرث تقارب لوحة البث: فالمراكز الثلاثة الأولى على لوحة المتتبع المكوّنة من 37 نموذجًا تقع ضمن جزء من نقطة، لذا فإن «الأول» حالة يمكن أن تغيّرها إعادة التشغيل — وكون Microsoft في المرتبة الأولى ادعاء وليس صفًّا.

مع ذلك، فإن السؤال على مستوى العائلة هو الجدير بالمراقبة. فمايكروسوفت الآن تبيع القدرة نفسها بسعرين يفصل بينهما فارق خمسة أضعاف، مع أن الفئة الغالية تفتقد ميزتين توثقهما الفئة الرخيصة. إذا وصل كل من الفصل بين المتحدثين والطوابع الزمنية للكلمات إلى SKU الخاصة بالبث، تضيق الفجوة لتصبح مجرد مقايضة بين زمن الاستجابة والسعر، وهو قرار أبسط بكثير. وإذا لم يحدث ذلك، فإن بنية القسمين تصبح دائمة وينبغي بناء البنى المعمارية حولها.

إلى أين يترك هذا حزمة النسخ

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

المحصلة العملية هي أن النسخ الصوتي كفَّ عن كونه بندًا واحدًا في سبتمبر، وصار قرار توجيه في أكتوبر. فخط المعالجة الذي كان يعتمد على واجهة برمجية واحدة أصبح الآن يريد البث المباشر للواجهة الحيّة، والمعالجة الدفعية للتسجيل، وقاعدة تحدِّد أي صوت يسلك أي مسار — وهذه القاعدة نفسها مشكلة توجيه، وهو قدر غريب من التعقيد لأن ينتهي به المطاف داخل دورة إصدار مورّد واحد.

يقع أشدّ الأثر على ما يعلو النص المفرّغ. أيًا كانت الطبقة التي تنتج النص، فإن ذلك النص يُلخّص ويُصنّف وتُحذف منه المعلومات الحساسة ويُوجّه، وتعمل هذه الخطوات على نماذج لغوية لها ملفاتها الخاصة من زمن الاستجابة والتكلفة: فالنص المفرّغ المباشر يريد نموذجًا سريعًا ورخيصًا، أما الأرشيفي فيمكنه تحمّل نموذج أقوى. تغطي OrcaRouter هذه الطبقة تحديدًا: واجهة API واحدة عبر أكثر من 200 نموذج، وأسعار قوائم المزوّدين تُمرَّر دون أي هامش ربح (0%)، وتحويل تلقائي عند الفشل، ولغة DSL للتوجيه تختار نموذجًا لكل حمل عمل بدلًا من كل خط أنابيب. لا MAI-Transcribe-2-Streaming ولا MAI-Transcribe-2 ضمن تلك القائمة — فكلاهما يُقدَّم عبر مكدّس الكلام الخاص بمايكروسوفت — لكن طبقة تفريغ منقسمة إلى قسمين هي أقوى حجة حتى الآن للإبقاء على كل ما يقع بعدها قابلًا للنقل.

الخلاصة الصادقة: البث ليس نسخةً أفضل من MAI-Transcribe-2، بل هو منتج ثانٍ بسعر ثانٍ. اشترِه من أجل الدقائق التي تحتاج حقًا إلى الزمن الحقيقي، واترك الباقي على الطبقة الرخيصة، وخطط لاحتمال إعادة تسعير كلا المعدّلين عند انتهاء الفترة التمهيدية.