'بطاقة مقال رئيسي تعرض "MAI-Transcribe-2 ضد GPT Transcribe" مع شارة "مقارنة النماذج" والعنوان الفرعي "Microsoft تقلّص أرقام OpenAI في كل مقياس"، مع شرائح مقارنة {{1}}2.0%{{/1}} مقابل {{2}}3.31%{{/2}} AA-WER، و{{3}}$1.67{{/3}} مقابل {{4}}$4.50{{/4}} لكل 1,000 دقيقة، و{{5}}~411x{{/5}} مقابل {{6}}~34x{{/6}} من الزمن الحقيقي، على خلفية متدرجة من الأبيض إلى الأزرق مع شعار OrcaRouter في الأسفل يمينًا.'
Guides & Insights

MAI-Transcribe-2 مقابل GPT Transcribe: Microsoft تتفوق على أداة النسخ من OpenAI في كل رقم

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ثلاثة أرقام تفصل بين MAI-Transcribe-2 وGPT Transcribe، وكل واحد منها يشير في الاتجاه نفسه. على لوحة صدارة معدل الخطأ في الكلمات لغير البث المباشر لدى Artificial Analysis، يسجّل MAI-Transcribe-2، الذي أصدرته مايكروسوفت في 3 سبتمبر 2026، نسبة 2.0% وفق مقياس AA-WER، مقابل 3.31% لـGPT Transcribe، واجهة برمجة تطبيقات النسخ للتسجيلات المسبقة من OpenAI، التي أُطلقت قبل خمسة أسابيع في 28 يوليو 2026. وعلى عامل السرعة في اللوحة نفسها، يعمل MAI-Transcribe-2 بسرعة تعادل تقريبًا 411 ضعف الوقت الفعلي، مقابل حوالي 34 ضعفًا لـGPT Transcribe. وفي السعر، يُعرض MAI-Transcribe-2 بـ0.10 دولار لكل ساعة صوتية — أي حوالي 1.67 دولار لكل 1,000 دقيقة كعرض إطلاق لفترة محدودة — مقابل 4.50 دولار لكل 1,000 دقيقة لـGPT Transcribe. وتلك الفجوة الأخيرة تمثل تخفيضًا بنسبة 63%، وهي تصيب منتجًا كانت OpenAI قد خفّضت سعره بنسبة 25% قبل أسابيع فقط. هكذا يبدو سوق السلع الأساسية في اللحظة التي يقرر فيها مختبر حدودي ثانٍ المنافسة على السعر.

الفجوة، رقم واحد في كل مرة

الدقة أولاً، لأنها الرقم الذي لا يمكن لأي من البائعَين إخفاؤه وراء ادعاء تسويقي. إن نسبة 2.0% و3.31% تأتيان من نفس المنصة المستقلة، Artificial Analysis، التي أُجريت على كلا النموذجين — وهو ما يجعل الفارق البالغ 1.3 نقطة أوضح حقيقة في هذه المقارنة بأكملها: ما يقرب من ثلاثة عشر خطأً أقل لكل ألف كلمة عند نفس خط WER. نسبة 3.31% في GPT Transcribe كانت بحد ذاتها تحسّناً بنحو 0.7 نقطة عن سابقتها، GPT-4o Transcribe، وأظهرت تشغيلات OpenAI متعددة اللغات أنها خفّضت معدلات الأخطاء في عصر Whisper إلى النصف تقريباً. لقد استحوذت Microsoft الآن على المركز الثاني في اللوحة نفسها بشكل قاطع، وفي اختبار FLEURS متعدد اللغات تُبلغ عن متوسط WER يبلغ 5.2% عبر 60 لغة — وهذا الرقم منشور في إعلان إطلاق Microsoft، ولم تتم إعادة استخلاصه بشكل مستقل لكل لغة بعد.

الآن عن السرعة. إن سرعة GPT Transcribe البالغة نحو 34 ضعفًا من الزمن الفعلي هي أمر نموذجي لنقطة نهاية نسخ غير متزامنة: فهي تُنجز ملفًا مدته ساعة في نحو دقيقتين من المعالجة. أما MAI-Transcribe-2 فتعمل بنحو 411 ضعفًا من الزمن الفعلي، وتنسخ الساعة نفسها في أقل من تسع ثوانٍ من المعالجة. ووفق أرقام Artificial Analysis، فإن الفجوة الحقيقية أقرب إلى 12 ضعفًا؛ وتسوّقها Microsoft على أنها «أسرع بـ10× من GPT-Transcribe التابع لـOpenAI»، أي أن البائع يقرّب ميزته إلى الأسفل لا إلى الأعلى — وهي إشارة غير مألوفة. أما التحفّظ الصادق فهو أن رقم MAI-Transcribe-2 عمره أربعة أيام فقط، ويعبّر عن إنتاجية ملفات الدفعات وليس زمن الاستجابة الحي، في حين أن رقم GPT Transcribe خلفه خمسة أسابيع من الاستخدام الإنتاجي الفعلي. لكن لا شيء في بنية المنتجين يوحي بأن فجوة السرعة ستُسدّ؛ فقد بُنيا لمعالجة مهمة الدفعات نفسها لكن بكفاءة مختلفة جدًا.

السعر يأتي أخيرًا، لأنه الرقم الذي يغيّر القرارات. يبلغ السعر المدرج لـGPT Transcribe نحو 0.0045 دولار للدقيقة — أي 4.50 دولار لكل 1,000 دقيقة، أو نحو 0.27 دولار لكل ساعة صوتية — بعد خفض OpenAI في يوليو من 0.006 دولار في GPT-4o Transcribe. أمّا MAI-Transcribe-2 فسعرها المدرج 0.10 دولار لكل ساعة صوتية حتى نهاية العام، دون الإفصاح عن سعر عادي لما بعد انتهاء العرض. وعند احتساب 1,000 ساعة صوتية شهريًا، يبلغ الفارق نحو 170 دولارًا: نحو 100 دولار بسعر MAI-Transcribe-2 المبكّر مقابل نحو 270 دولارًا بالسعر المدرج لـGPT Transcribe. بدا خفض OpenAI بنسبة 25% في يوليو عدوانيًا؛ لكن تقديم Microsoft سعرًا أقل بنسبة 63% من السعر بعد الخفض يُعدّ تحرّكًا من فئة مختلفة، وهو السبب الكامل وراء وجود هذه المقارنة.

A two-column scoreboard titled 'MAI-Transcribe-2 vs GPT Transcribe — the scoreboard': left column MAI-Transcribe-2 lists 2.0% AA-WER, ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages, bundled diarization and verbatim/clean styles; right column GPT Transcribe lists 3.31% AA-WER, ~34x real time, $4.50 per 1,000 minutes, languages not published, no diarization and caller-side post-processing; footer notes AA-WER and speed per Artificial Analysis and vendor list prices.

لماذا كان رقم OpenAI هو الرقم الموثوق به

هناك سبب جعل نتيجة 3.31% التي حققها GPT Transcribe في قياس AA-WER أثقل وزنًا من معظم أرقام الإطلاق: فقد خضعت لتدقيق مستقل، وصمد هذا التدقيق عند التعامل مع تسجيلات صوتية صعبة. نفس عملية تشغيل Artificial Analysis التي أنتجت الرقم الرئيسي أظهرت أيضًا موطن ضعف GPT Transcribe — وهي WER بنسبة 6.10% على مجموعة مكالمات الأرباح Earnings22، وهي أصعب معيار عام في هذه الفئة — مما أخبر المشترين بأين لا ينبغي توجيهه بالضبط. بعد ذلك، جاءت خمسة أسابيع من حركة المرور الإنتاجية، وأظهر خفض OpenAI للأسعار أنها تنافس على التكلفة لا على حماية هوامش الربح بشكل دفاعي. ويرث GPT Transcribe أيضًا القيد العملي لواجهة برمجة التطبيقات (API) الخاصة به: فهو منتج دفعات فقط، بملفات يصل حجمها إلى 25 ميغابايت لكل طلب، بدون طبقة تدفق عند سعر $4.50، وبدون فصل للمتحدثين، وبدون ضبط للمفردات، وبدون دعم للغات التي لم تنشرها OpenAI. إنه يقوم بالنسخ الصوتي فقط؛ وكل ما يتجاوز مجرد الكلمات يقع على عاتق المستدعي.

تلك الوضوحية هي ما جعلت GPT Transcribe جديرًا بالثقة بسهولة، وهي بالضبط الوضوحية التي لم يستحقها نموذج عمره أربعة أيام بعد. لم تنشر Microsoft أي معدل خطأ في تمييز المتحدثين لـ MAI-Transcribe-2، ولا جدول دقة لكل لغة خلف متوسط FLEURS المغطي لـ 60 لغة، ولا وحدة بيع للبث المباشر. لا يعني أي من هذه الإغفالات أن النموذج ضعيف — إذ إن تمييز المتحدثين المدمج والانتشار عبر 60 لغة يمثلان سطح منتج حقيقيًا لا تقدمه حتى GPT Transcribe — لكن كل منها يمثل موضعًا يمكن أن تعيد فيه إعادة تشغيل مستقلة صياغة القصة. رقم الدقة مُقاس عبر AA وهو حقيقي؛ المنتج من حوله غير مُثبت بالضبط في الجوانب التي لا يكشفها إلا حركة الإنتاج الفعلية.{{1}}تلك الوضوحية هي ما جعلت GPT Transcribe جديرًا بالثقة بسهولة، وهي بالضبط الوضوحية التي لم يستحقها نموذج عمره أربعة أيام بعد.{{/1}}{{2}}لم تنشر Microsoft أي معدل خطأ في تمييز المتحدثين لـ MAI-Transcribe-2، ولا جدول دقة لكل لغة خلف متوسط FLEURS المغطي لـ 60 لغة، ولا وحدة بيع للبث المباشر. لا يعني أي من هذه الإغفالات أن النموذج ضعيف — إذ إن تمييز المتحدثين المدمج والانتشار عبر 60 لغة يمثلان سطح منتج حقيقيًا لا تقدمه حتى GPT Transcribe — لكن كل منها يمثل موضعًا يمكن أن تعيد فيه إعادة تشغيل مستقلة صياغة القصة.{{/2}}{{3}}رقم الدقة مُقاس عبر AA وهو حقيقي؛ المنتج من حوله غير مُثبت بالضبط في الجوانب التي لا يكشفها إلا حركة الإنتاج الفعلية.{{/3}}

مجموعات الميزات ليست بنفس الشكل

• فصل المتحدثين — يجمع MAI-Transcribe-2 بين إسناد المتحدثين دون نشر معدل خطأ؛ أما GPT Transcribe فلا يقدّمه إطلاقًا، لذا يصل النص المكتوب كتيار واحد غير متمايز.

• التحكم — توفّر MAI-Transcribe-2 ترجيحًا للكلمات المفتاحية للأسماء والمصطلحات المتخصصة، بالإضافة إلى أسلوبَي النسخ الحرفي والنسخ النظيف؛ بينما لا توفّر GPT Transcribe أيًّا منهما، إذ تعيد الكلمات الخام والنص دون علامات ترقيم ليقوم المتصل بمعالجته لاحقًا.

• الطوابع الزمنية — كلاهما يُرجع مخرجات بمحاذاة زمنية؛ طوابع MAI-Transcribe-2 على مستوى الكلمة افتراضيًا.

• اللغات — يصدر MAI-Transcribe-2 قائمة تضم 60 لغة مع التحديد التلقائي؛ بينما لا ينشر GPT Transcribe قائمة لغاته، وهو ما يمثل في حد ذاته مشكلة تخطيط لأحمال العمل متعددة اللغات.

• البث المباشر — فئة GPT Transcribe البالغة 4.50 دولار مخصصة للمعالجة بالدُفعات فقط، بينما نظيرتها للبث المباشر، GPT Live Transcribe، منتج منفصل بسعر 17 دولارًا لكل 1000 دقيقة؛ ولا يملك MAI-Transcribe-2 أي منتج للبث المباشر، لا مُعلنًا عنه ولا مُعروضًا.

• Shape — كلاهما واجهتا برمجة تطبيقات مُدارتان للملفات المسجَّلة مسبقًا، ولهذا فإن هذه المقارنة عادلة؛ والفرق أن مايكروسوفت أضافت المزيد من المعالجة اللاحقة المفيدة إلى المنتج الأساسي بثلث السعر.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

من يجب أن ينتقل، ومتى؟

إذا كنت تنسخ ملفات صوتية مجمّعة بكميات كبيرة، وكان سعر الحجز المبكر لا يزال صالحًا عند تطبيقه على ملفاتك الخاصة، فإن MAI-Transcribe-2 هو الخيار المنطقي الافتراضي الآن: معدل خطأ WER مُقاس أفضل، وإنتاجية أكبر بنحو اثني عشر ضعفًا، وسعر أقل بنسبة 63% لكل 1000 دقيقة على منتج يجمع بين فصل المتحدثين (diarization) والتحكم في الأسلوب، وهي ميزات لا تفرض OpenAI رسومًا إضافية عليها — لأنها لا توفرها. تكلفة التحول بسيطة: اختبار على عينة من أصعب ملفاتك الصوتية يزيل معظم عدم اليقين، وسعر 1.67 دولار يجعل التجربة شبه مجانية حتى نهاية العام.

إذا كانت أعباء عملك حرجة للإنتاج، أو خاضعة للتنظيم، أو مربوطة بالفعل حول OpenAI، فإن التقدم بخمسة أسابيع وضعف Earnings22 المنشور يستحقان أكثر من فجوة السعر. GPT Transcribe هو النموذج الذي يمكنك تسمية أنماط فشله؛ بينما أنماط فشل MAI-Transcribe-2 ما تزال قيد الاكتشاف. النمط الحكيم هو الذي توجد طبقة التوجيه لدعمه: إبقاء النموذج المُثبت كنمط افتراضي وإرسال حصة محسوبة من حركة المرور إلى المنافس، ومقارنة النصوص المفرَّغة على بياناتك الخاصة قبل ترقية أي منها. ذلك الانضباط القائم على التجربة ثم الترقية هو جوهر التبديل التلقائي عند الفشل ولغة التوجيه في OrcaRouter — النماذج الجديدة تكسب حركة مرور الإنتاج بنِسَب مئوية، وليس بمراسيم، ونفس الإعداد بمفتاح واحد الذي يصل إلى أكثر من 200 نموذج يجعل بقية الطبقات فوق مزوّد التفريغ النصي محايدة تقنيًا بينما تتصارع أنظمة تحويل الكلام إلى نص.

منشور الإطلاق الذي يقف وراء أرقام MAI-Transcribe-2 يؤطر كل شيء كمقارنة مع منافسين مذكورين بالاسم بدلاً من أرقام مطلقة — وهو تمرين انضباطي مفيد لأي شخص يقرؤه: خذ الادعاءات النسبية، وابحث عن الأرقام المطلقة على اللوحة المستقلة، وصنّف الباقي كتأطير من البائع.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

معدل 1.67 دولار له تاريخ انتهاء، ونسبة 2.0% لها سمعة أربعة أيام، وسيجيب OpenAI على كلاهما في النهاية. لكن شكل هذا السوق تغيّر للتو: لأول مرة، أرخص واجهة برمجية عالية الدقة للنسخ المُدار هي أيضًا الأكثر دقة والأسرع، وهي ليست من OpenAI. حتى لو كان السعر القياسي لـMAI-Transcribe-2 أعلى بكثير من عرض الإطلاق، فإن معيار الدقة مقابل الدولار في النسخ المُدار قد انتقل — وانتقل بشروط مايكروسوفت.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا