
MAI-Transcribe-2-Streaming مقابل MAI-Transcribe-2: ادفع 5.4× مقابل التوقيت على مستوى الكلمة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 221 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
MAI-Transcribe-2-Streaming وMAI-Transcribe-2 هما عائلة النموذج نفسها مقسّمة على فئتين سعريتين، والانقسام واضح بما يكفي للتخطيط على أساسه. صدر MAI-Transcribe-2 في 3 سبتمبر 2026 كنموذج دُفعات: معدل خطأ كلمات 2.0% على لوحة Artificial Analysis غير التدفقية، وبسرعة تقارب 411× الزمن الحقيقي، و0.10 دولار لكل ساعة صوت — أي نحو 1.67 دولار لكل 1000 دقيقة. صدر MAI-Transcribe-2-Streaming في 1 أكتوبر 2026 كنسخة الزمن الحقيقي: معدل خطأ كلمات تدفقي معلن 2.5% عند 0.13 ثانية حتى النص النهائي، وهو ما تصفه Microsoft بأنه الأول من حيث الدقة على النصوص النهائية والجزئية معًا، مقيسًا وفق منهجية التدفق لدى Artificial Analysis بدلًا من أن يكون قد رُسم بعد كصف على لوحة المتتبّع. 0.54 دولار لكل ساعة صوت — أي نحو 9.00 دولارات لكل 1000 دقيقة. اللغات الستون نفسها، والتوزيع نفسه عبر API فقط، ولا أوزان منشورة. تكلّف التدفق 5.4× سعر الدُفعات، ووفق أرقام Microsoft نفسها، 0.5 نقطة من الدقة. وما إذا كان ذلك صفقة رابحة أم ضريبة يعتمد كليًا على سؤال واحد: هل يحتاج أي شيء في مسارك إلى النص قبل أن تنتهي الجملة؟
لأنّ النموذجين يأتيان من مورّد واحد ومن واجهة توثيق واحدة، تكون المقارنة نظيفة على نحو غير معتاد — فلا تخمين بشأن تكافؤ الميزات، ولا عدم تطابق في إصدارات المعايير المرجعية، ولا «أرقامهم مقابل أرقامنا». إنه مورّد واحد يسعّر سرعتين للقدرة نفسها، والعمل المثير هو تحديد أحمال العمل التي تغطيها الطبقة الرخيصة فعلاً.
العائلة، في صفّين
• MAI-Transcribe-2 — دفعات، صوت مسجل مسبقًا، صدر في 3 سبتمبر 2026. معدل AA-WER بنسبة 2.0%، في المرتبة الثانية على لوحة المتصدرين غير المتدفقة لدى Artificial Analysis. نحو 411× من الوقت الفعلي، أيضًا في المرتبة الثانية. 0.10 دولار لكل ساعة صوتية، حوالي 1.67 دولار لكل 1000 دقيقة، كعرض لفترة محدودة حتى نهاية العام دون نشر سعر قياسي. يجمع تجزئة المتحدثين ويعيد الطوابع الزمنية على مستوى الكلمة. 60 لغة مع التعرف التلقائي على اللغة.
• MAI-Transcribe-2-Streaming — نسخ مستمر في الوقت الفعلي بنمط WebSocket، تم إصداره في 1 أكتوبر 2026. تعلن Microsoft عن WER بنسبة 2.5% للنص النهائي عند 0.13 ثانية بعد انتهاء الكلام، ونفس 2.5% على أول نتيجة جزئية عند 0.12 ثانية، وهو ما تصفه بأنه الأول في الدقة على كليهما — ادعاء المورد الذي تم قياسه وفق منهجية البث الخاصة بـ Artificial Analysis، ومع ذلك حتى وقت الصياغة لم يتم بعد رسم النموذج على لوحة المتتبع الخاصة (37 نموذجًا)، ومتصدره الحالي هو Grok Voice Transcribe 2.0 بنسبة 2.73% و0.49 ثانية. 0.54 دولار لكل ساعة صوتية، حوالي 9.00 دولارات لكل 1,000 دقيقة، عرض تقديمي حتى نهاية العام. 60 لغة مع كشف تلقائي مستمر للغة. لا يوجد ادعاء منشور بشأن فصل المتحدثين، ولا ادعاء منشور بشأن الطوابع الزمنية للكلمات.
التفاوت الوحيد الذي لا يتعلق بالسرعة أو السعر هو القدرات: فميزتا تمييز المتحدثين والطوابع الزمنية للكلمات في نموذج المعالجة بالدفعات ميزتان موثقتان، بينما ليستا كذلك في نموذج البث. وهذا أهم من فجوة الدقة البالغة 0.5 نقطة، وهو السبب في أن كثيرًا من الفرق سينتهي بها الأمر إلى تشغيل كليهما.

ما الذي يمنحه 5.4× فعليًا
عند 1.67 دولار لكل 1000 دقيقة، يصبح النسخ على دفعات عند مستوى الدقة هذا قريبًا من المجانية على الهامش. وعند 9.00 دولارات لكل 1000 دقيقة، يصبح النسخ المتدفق بندًا حقيقيًا في التكلفة — إذ يعادل تقريبًا تكلفة نسخ الصوت نفسه خمس مرات، مضافًا إليها نصف نقطة من الدقة. لذا فالسؤال ليس ما إذا كان النسخ في الوقت الفعلي يستحق أكثر؛ بل أي دقائق محددة تحتاج إليه.
أحمال العمل التي يكون فيها ذلك واضحًا: الترجمات المباشرة التي يقرأها شخص بينما يتحدث المتحدث، حيث يكون الفارق بين 0.13 ثانية ونهاية الملف هو المنتج بأكمله؛ ومساعدة الوكيل في الوقت الفعلي وتقييم الامتثال، حيث يكون أي تدخل يصل بعد انتهاء المكالمة بلا قيمة؛ وتطبيقات الصوت التفاعلية، حيث لا يمكن إكمال دور حتى يكتمل النص. في هذه الحالات الثلاث جميعها، لا يُعد نموذج المعالجة بالدفعات خيارًا أرخص، بل هو خيار غير مطروح — لا يوجد سعر يمكن عنده أن يصبح النسخ اللاحق فوريًا.
أعباء العمل التي لا يكون فيها ذلك مناسبًا بوضوح: تسجيل الاجتماعات والمكالمات الذي يُعالَج بعد وقوع الحدث، والأرشيفات الإعلامية، وضمان الجودة الدفعي لمراكز الاتصال، ومراجعة الامتثال للمكالمات المكتملة، وإعداد التسميات التوضيحية للبودكاست والفيديو. هذه بالضبط هي خطوط المعالجة التي صُمّمت فيها سرعة النموذج الدفعي البالغة 411× من الوقت الحقيقي وتعرفته البالغة 1.67 دولار لتفوز، ودفع 5.4× لاقتطاع بضع مئات من الميلي ثانية من نص مفرغ لا يقرؤه أحد حتى الغد إهدار مباشر. أضف ميزتي تمييز المتحدثين والطوابع الزمنية للكلمات — فالنموذج الدفعي يوثّقهما، أما النموذج التدفقي فلا — وستصبح حجة المعالجة اللاحقة أقوى، لا أضعف.
المنطقة الوسطى المثيرة للاهتمام هي حيث يكون الاثنان مكمّلين أحدهما للآخر حقًا: شغّل المعالجة التدفقية للواجهة الحية والمعالجة الدُفعية للسجل. مكالمة دعم تُنسَخ نصيًا في الوقت الفعلي لتشغيل لوحة مساعدة الوكيل، ثم يُعاد نسخها نصيًا على شكل دُفعة طوال الليل لإنتاج النص الأرشيفي مع تمييز المتحدثين والطوابع الزمنية، تكلّف علاوة صغيرة مقارنةً بالمعالجة الدُفعية وحدها وتحصل على السلوكين معًا. لم يصبح هذا النمط ممكنًا إلا في سبتمبر، وإصدار أكتوبر هو ما يكمله.
حيث يظهر هيكل القسمين
ثمة أمران في هذه العائلة يستحقان الملاحظة، لأنهما بنيويان وليسا عارضين.
أولاً، التسلسل الهرمي للدقة مقلوب عن النمط المعتاد. عادةً ما تدفع النماذج المتدفقة ضريبة دقة كبيرة مقابل الإخراج في الوقت الفعلي؛ وهنا تبلغ الضريبة 0.5 نقطة، من 2.0% على لوحة الدفعات إلى 2.5% المزعومة على لوحة التدفق. حققت مايكروسوفت نموذجاً في الوقت الفعلي ضمن نصف نقطة من طرازها الرائد للدفعات وفق أرقامها الخاصة، وهو الإنجاز الهندسي الفعلي لإصدار أكتوبر إذا ثبت — وليس تصدّر اللوحة، الذي قد تغيّره إعادة تشغيل جيدة والذي لم يؤكده المتتبع بعد.
ثانيًا، التسعير معكوس عن النمط المعتاد أيضًا. عادةً ما يمنح المورّدون خصمًا على الطبقة الأعلى حجمًا؛ لكن Microsoft سعّرت البث عند 5.4 أضعاف تسعير الدفعات، وأبقت كليهما على أسعار تمهيدية تنتهي في الوقت نفسه. وهذا يبدو أقل كعلاوة بث مقصودة وأكثر كإطلاقين منفصلين يحمل كل منهما خصم إطلاق، من دون سعر قياسي منشور لأي منهما. على الفرق التي تخطط لميزانية 2027 أن تتعامل مع كلا الرقمين على أنهما مؤقتان — فكل من $1.67 و$9.00 موسوم بأنه لفترة محدودة، ولم يُعلَن عن سعر لاحق لأي منهما.

ما لم يُثبت بعد
لا تزال الأسئلة المفتوحة لنموذج المعالجة بالدفعات منذ سبتمبر مفتوحة: لا معدل خطأ منشور في فصل المتحدثين، ولا تفصيل لكل لغة يدعم ادعاء الـ60 لغة، وسعر ترويجي دون تسمية خلف له. ويضيف النموذج التدفقي سؤالاً آخر خاصاً بالعمل في الزمن الحقيقي — إذ يُقاس معدل خطأ الكلمات (WER) في البث على صوت نظيف، بينما جودة النص الجزئي في بث بعيد المجال ومليء بالضجيج هي نمط الفشل الأكثر أهمية في النشر وأقل ما تغطيه مواد الإطلاق. كما يرث تقارب لوحة البث: فالمراكز الثلاثة الأولى على لوحة المتتبع المكوّنة من 37 نموذجًا تقع ضمن جزء من نقطة، لذا فإن «الأول» حالة يمكن أن تغيّرها إعادة التشغيل — وكون Microsoft في المرتبة الأولى ادعاء وليس صفًّا.
مع ذلك، فإن السؤال على مستوى العائلة هو الجدير بالمراقبة. فمايكروسوفت الآن تبيع القدرة نفسها بسعرين يفصل بينهما فارق خمسة أضعاف، مع أن الفئة الغالية تفتقد ميزتين توثقهما الفئة الرخيصة. إذا وصل كل من الفصل بين المتحدثين والطوابع الزمنية للكلمات إلى SKU الخاصة بالبث، تضيق الفجوة لتصبح مجرد مقايضة بين زمن الاستجابة والسعر، وهو قرار أبسط بكثير. وإذا لم يحدث ذلك، فإن بنية القسمين تصبح دائمة وينبغي بناء البنى المعمارية حولها.
إلى أين يترك هذا حزمة النسخ

المحصلة العملية هي أن النسخ الصوتي كفَّ عن كونه بندًا واحدًا في سبتمبر، وصار قرار توجيه في أكتوبر. فخط المعالجة الذي كان يعتمد على واجهة برمجية واحدة أصبح الآن يريد البث المباشر للواجهة الحيّة، والمعالجة الدفعية للتسجيل، وقاعدة تحدِّد أي صوت يسلك أي مسار — وهذه القاعدة نفسها مشكلة توجيه، وهو قدر غريب من التعقيد لأن ينتهي به المطاف داخل دورة إصدار مورّد واحد.
يقع أشدّ الأثر على ما يعلو النص المفرّغ. أيًا كانت الطبقة التي تنتج النص، فإن ذلك النص يُلخّص ويُصنّف وتُحذف منه المعلومات الحساسة ويُوجّه، وتعمل هذه الخطوات على نماذج لغوية لها ملفاتها الخاصة من زمن الاستجابة والتكلفة: فالنص المفرّغ المباشر يريد نموذجًا سريعًا ورخيصًا، أما الأرشيفي فيمكنه تحمّل نموذج أقوى. تغطي OrcaRouter هذه الطبقة تحديدًا: واجهة API واحدة عبر أكثر من 200 نموذج، وأسعار قوائم المزوّدين تُمرَّر دون أي هامش ربح (0%)، وتحويل تلقائي عند الفشل، ولغة DSL للتوجيه تختار نموذجًا لكل حمل عمل بدلًا من كل خط أنابيب. لا MAI-Transcribe-2-Streaming ولا MAI-Transcribe-2 ضمن تلك القائمة — فكلاهما يُقدَّم عبر مكدّس الكلام الخاص بمايكروسوفت — لكن طبقة تفريغ منقسمة إلى قسمين هي أقوى حجة حتى الآن للإبقاء على كل ما يقع بعدها قابلًا للنقل.
الخلاصة الصادقة: البث ليس نسخةً أفضل من MAI-Transcribe-2، بل هو منتج ثانٍ بسعر ثانٍ. اشترِه من أجل الدقائق التي تحتاج حقًا إلى الزمن الحقيقي، واترك الباقي على الطبقة الرخيصة، وخطط لاحتمال إعادة تسعير كلا المعدّلين عند انتهاء الفترة التمهيدية.
