
MAI-Transcribe-2 مقابل Muse Voice Transcribe: في نفس الأسبوع، رهانان متعاكسان على الصوت
- openaiجديدOpenAI: GPT-6 Astra2026-09-0455الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0247الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0247الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0157الذكاء82البرمجة
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2646الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1849الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1541الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1251الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0547الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0347الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2140الذكاء69البرمجة
أسفر أسبوع الأول من سبتمبر 2026 عن نموذجَي كلام من مختبرين رائدين، ويُفهَم نموذجا MAI-Transcribe-2 وMuse Voice Transcribe على أفضل وجه بوصفهما إجابتين متضادتين عن سؤال: أين ينبغي أن يعيش ذكاء الصوت؟ نموذج Muse Voice Transcribe، الذي أصدرته Meta Superintelligence Labs في الأول من سبتمبر، هو نموذج إدراك صوتي يعمل في الزمن الحقيقي: فهو يفرّغ الكلام نصيًّا، ويفصل بين أكثر من عشرين متحدثًا، ويرصد انتهاء المتحدث من حديثه، كل ذلك في تمريرة دفق واحدة عبر شرائح من الصوت الحي طول كل منها 80 مللي ثانية، ويحتل صدارة لوحة نماذج تحويل الكلام إلى نص الدفقّية التي قيس عليها. أما نموذج MAI-Transcribe-2، الذي أصدرته Microsoft بعد يومين، أي في الثالث من سبتمبر، فيمثّل الرهان المعاكس: محرك معالجة دفعات لا يطارد زمن الاستجابة اللحظي إطلاقًا، بل يكرّس كل جهوده لتفريغ ملفات مسجّلة مسبقًا بأفضل معدل خطأ في الكلمات على اللوحة المستقلة غير الدفقّية، بسرعة تعادل 411 ضعف الزمن الحقيقي تقريبًا، وبتكلفة تناهز 1.67 دولار لكل 1000 دقيقة. والمقارنة المباشرة بينهما بوصفهما «نموذجي تفريغ» تحجب القرار الفعلي، الذي يدور حول اللحظة من عمر الصوت التي تحتاج فيها إلى الكلمات: بينما يحدث الصوت، أم بعد انتهائه.
منتجان أشارا إلى لحظات مختلفة
تم بناء Muse Voice Transcribe ليلائم اللحظة التي لا يزال فيها الصوت مستمرًا. إنه نموذج متعدد الوسائط تراجعي ذاتيًا ضمن عائلة Muse من Meta، يجمع ثلاث مهام في تمرير واحد — التعرف التلقائي على الكلام، وتحديد المتحدثين لأكثر من عشرين متحدثًا، وتحديد نهاية الكلام، أي اكتشاف أن المتحدث توقف عن الحديث ليتمكن النظام من الرد. تشير Meta إلى أن نصها النهائي يظهر بعد حوالي 0.16 ثانية من توقف المتحدث، مع معدل خطأ في الكلمات بنسبة 3.1% على النصوص النهائية و3.6% على النصوص الجزئية الأولى — وهي أرقام نشرتها Meta في يوم الإطلاق، مستشهدة بمؤشر Artificial Analysis للبث المباشر، ولم يتم إعادة إنتاجها بشكل مستقل حتى وقت كتابة هذا المقال. كما يعالج صوتًا أطول من ساعة في تدفق واحد، ويبدّل بين اللغات في منتصف الجملة، وتدرب على أكثر من 70 لغة مع التحقق من 25 لغة بدقة عند الإطلاق. سعره 3.00 دولارات لكل 1,000 دقيقة من الصوت، أي حوالي 0.18 دولار في الساعة، عبر Meta Model API. وأكدت Meta أن الأوزان لن تُفتح.
تم بناء MAI-Transcribe-2 للحظة التي يكون فيها الصوت ملفًا بالفعل. يقيس نموذج Microsoft نسبة AA-WER بنسبة 2.0% على لوحة الصدارة الخاصة بـ Artificial Analysis للنماذج غير اللحظية — في المركز الثاني، وهو أفضل رقم بين واجهات برمجة تطبيقات معالجة الدفعات المُدارة — ويعمل بسرعة تقارب 411 ضعف الوقت الفعلي، وهو رقم للإنتاجية وليس وعدًا بزمن الاستجابة. يقوم بالنسخ بـ 60 لغة مع تحديد اللغة تلقائيًا، ويتضمن فصل المتحدثين، وطوابع زمنية على مستوى الكلمة، وانحياز الكلمات الرئيسية، وأنماط النص الحرفي مقابل النص المنقح، ويتعامل مع تبديل اللغات مثل الهنجليزية والإسبانجليزية. وهو متاح عبر Microsoft Foundry في المعاينة العامة وMAI Playground بسعر 0.10 دولار لكل ساعة صوتية كعرض إطلاق لفترة محدودة حتى نهاية العام، دون الإعلان عن منتج للبث المباشر. يضع منشور إطلاق Microsoft النموذج صراحةً للمحتوى الصوتي الطويل والدفعات — وهي أعباء العمل التي يكون فيها زمن الاستجابة المنخفض لنموذج البث عديم القيمة، ولكن تكلفته للدقيقة ليست كذلك.

لماذا لا يتعارض رقما الدقة؟
الغريزة الطبيعية هي مقارنة 2.0% بـ 3.1% وإعلان فائز، وسيكون ذلك خطأً من ناحيتين. أولاً، الرقمان يقيسان مهام مختلفة: نسبة MAI-Transcribe-2 البالغة 2.0% هي دقة غير البث (non-streaming) على صوت مُسجَّل مسبقًا، حيث يمكن للنموذج الاطلاع على الملف بأكمله؛ بينما نسبة Muse Voice Transcribe البالغة 3.1% هي دقة البث (streaming) على النصوص النهائية، وهي ناتجة عن قيد النسخ أثناء وصول الصوت. البث هو المشكلة الأصعب، ولهذا فإن لوحة متصدّري البث ولوحة متصدّري غير البث لوحتان منفصلتان بنتائج منفصلة. ثانيًا، التصنيفان مختلفان في الوزن: رقم MAI-Transcribe-2 هو قياس من Artificial Analysis للنموذج، بينما رقم Muse Voice Transcribe هو تقرير Meta في يوم الإطلاق عمّا قاسه Artificial Analysis — معلنٌ من البائع وغير مُعاد تكراره. والبيان الصادق هو أن كلا النموذجين يمثلان ادعاءات موثوقة في صدارة لوحتيهما، ولا يخبرك أي من الرقمين بأي شيء عن المسار الآخر.
يكمن جوهر المقارنة الحقيقية في فصل المتحدثين، لأنه الميزة الوحيدة التي يتضمنها كلا المنتجين، والميزة التي تختلف فيها طموحاتهما بشكل واضح. يفصل Muse Voice Transcribe أكثر من عشرين متحدثًا كخاصية أساسية في البث المباشر، مع إعلان Meta عن متوسط معدل خطأ في فصل المتحدثين يبلغ 17.5% مقابل نطاق منافس تذكره يتراوح بين 21.1% و28.6% — وهو إعلان من Meta مرة أخرى وغير مُتحقق منه. كما يتضمن MAI-Transcribe-2 خاصية فصل المتحدثين أيضًا، لكن Microsoft لا تنشر أي حد أقصى لعدد المتحدثين ولا أي معدل خطأ لفصل المتحدثين على الإطلاق. بالنسبة لمكالمة بين طرفين، كلا المنتجين جيدان والفرق غير جوهري. أما بالنسبة لمجموعة تركيز من اثني عشر شخصًا أو تسجيل حلقة نقاش، فإن Muse Voice Transcribe هو الوحيد من بين الاثنين الذي يُذكر فيه الحد الأقصى لعدد المتحدثين أصلاً، وإن عدم قياس فصل المتحدثين في MAI-Transcribe-2 هو السبب الأكبر لاختباره قبل الوثوق به في ملفاتك الصوتية الأكثر صعوبة.
مقارنة الأسعار المنطقية
فيما يتعلق بالسعر، فإن الاثنين أقرب مما يوحي به الإطار الذي يقارن بين المعالجة بالدفعات والبث المباشر، لأن 1.67 دولارًا لكل 1000 دقيقة (MAI-Transcribe-2، سعر الحجز المبكر) و3.00 دولارات لكل 1000 دقيقة (Muse Voice Transcribe) يقعان معًا في الطرف الأرخص من خدمات الكلام المُدارة. ولا تكون المقارنة منطقية إلا ضمن مسار واحد. بالنسبة إلى النسخ بالدفعات للملفات المسجلة مسبقًا، فإن MAI-Transcribe-2 أقل من نصف سعر النموذج المصمَّم أصلاً للبث المباشر، مع تمتعه بمعدل خطأ كلمات (WER) أفضل في الوضع غير البثي — لكنك لن توجّه الملفات المسجلة إلى Muse Voice Transcribe إلا إذا أردت تحديدًا خط أنابيب البث لديه، وهو ليس الطريقة الفعّالة لمعالجة أرشيف. أما في حالة الصوت المباشر للاجتماعات، فإن Muse Voice Transcribe هو المنتج الوحيد في هذا المقال الذي يعمل على الإطلاق، ومعدله البالغ 3.00 دولارات يقلّ عن أسعار واجهات برمجة التطبيقات الأخرى للنسخ الفوري التي نافسها عند إطلاقه — Gemini 3.5 Transcribe Live بسعر 9 دولارات تقريبًا لكل 1000 دقيقة، وGPT Live Transcribe بسعر 17 دولارًا — في حين يضيف ميزة فصل المتحدثين لأكثر من عشرين متحدثًا، وهو ما لا تضاهيه تلك المنتجات. والعنوان السعري الصادق هو أن Meta حددت سعر البث المباشر بسعر منخفض، بينما حددت Microsoft سعر المعالجة بالدفعات بسعر أقل من ذلك، وكلاهما أسعارٌ من مرحلة ترويجية ستتبدل بمجرد أن يعلن كل مورّد عن سعره القياسي.

أي واحد لأي صوت
إذا كان صوتك مباشرًا — اجتماعات تُنسخ في الوقت الفعلي، ووكلاء صوتيون، وترجمة فورية للنصوص، أو أي شيء تحتاج فيه الكلمات بينما تُنطق — فإن Muse Voice Transcribe هو الخيار الأمثل، {{1}}والأمر ليس قريبًا حتى.{{/1}} إنه النموذج الوحيد للبث المباشر هنا، {{2}}ويفصل بين أكثر من عشرين متحدثًا في نفس المسار،{{/2}} وكان مُسعَّرًا للسيطرة على هذه الفئة منذ اليوم الأول. {{3}}نقاط ضعفه هي ما ينبغي أن تحمله معك إلى التجربة:{{/3}} أرقام الدقة والتمييز بين المتحدثين منشورة من قِبل Meta، {{4}}والنموذج البثّي الذي عمره أسبوع واحد لم يُظهر بعد كيف يتعامل مع الصوت الفوضوي الذي يعيش خارج معايير الإطلاق.{{/4}}
إذا كان صوتك بالفعل ملفات — أرشيفات، تسجيلات مكالمات، مكتبات وسائط، أي شيء يُعالَج بكميات كبيرة — فإن MAI-Transcribe-2 هو الخيار الأفضل على كل محور مهم: انخفاض WER المُقاس، وإنتاجية أعلى بنحو مرتبة من حيث الحجم، وسعر لكل 1,000 دقيقة أقل من نموذج البث المباشر. أما مخاطره فهي صورة معكوسة لمخاطر Muse: عمره أربعة أيام فقط، لا يحتوي على SKU للبث المباشر، جودة فصل المتحدثين غير مُقاسة، وسعر مبكر خلفه سعر قياسي غير معلن.
صفحة الإطلاق من مايكروسوفت التي تقدّم MAI-Transcribe-2 تعرض الميزات التي تُضمّنها مايكروسوفت ولا يقدّمها المنافس البثّيّ في نفس المرور، وهي المستند الذي يجب مراجعته عند تحديد أيّ الادعاءات تمثّل نطاق المنتج الفعليّ وأيّها ما تزال وعودًا على مستوى المعايير.

إذا كان النص الحرفي ليس سوى النصف الأول من خط أنابيبك، فإن الاختيار بين هذين الاثنين أقل أهميةً من الاختيار الذي تتخذه في المستوى الأعلى منهما. فالصوت المباشر للاجتماعات الذي يفرّغه Muse Voice Transcribe لا يزال بحاجة إلى تلخيص، واستخراج بنود الإجراءات، وصياغة المتابعات قبل أن يصبح مفيدًا؛ والمكالمات المؤرشفة التي يفرّغها MAI-Transcribe-2 لا تزال بحاجة إلى بحث، أو تنقيح، أو توجيه إلى النظام النهائي المناسب. في تلك الطبقة تجد منصةُ تعدد النماذج قيمتَها الحقيقية — فـAPI الموحّد من OrcaRouter عبر أكثر من 200 نموذج، مع تمرير أسعار المزوّدين كما هي بهامش ربح 0%، يتيح لتلك المهام النهائية استدعاء نموذج مختلف لكل عبء عمل عبر تكامل واحد، بحيث أيًّا كان نموذج الكلام الذي يفوز في تجربتك التجريبية، فإن الطبقة فوق النص الحرفي لا تحتاج إلى إعادة بناء عند التبديل. لا Muse Voice Transcribe ولا MAI-Transcribe-2 موجودة في تلك القائمة اليوم؛ كلاهما يعمل على واجهات برمجية خاصة بمورّديه. الرهان الذي حُسم فعلًا هذا الأسبوع أكثر ضيقًا وفائدةً: النسخ الفوري والنسخ المجمّع أصبحا للتو رخيصين بما يكفي بحيث لم يعد الفارق في الكلمات نفسها — بل في ما تفعله بها.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
