بطاقة العنوان الرئيسي لـ Muse Voice Transcribe، أول نموذج من Meta Superintelligence Labs للإدراك الصوتي في الوقت الفعلي، تعرض موجة صوتية متدفقة مع تسميات للتعرف التلقائي على الكلام (ASR)، وتمييز أكثر من 20 متحدثًا، وتحديد نقاط نهاية الكلام، بالإضافة إلى شارة سعر تقرأ 0.18 دولار لكل ساعة صوتية.
Guides & Insights

Muse Voice Transcribe أصبح متاحًا: أول نموذج إدراك صوتي في الوقت الفعلي من Meta

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Muse Voice Transcribe، أول نموذج للإدراك الصوتي في الوقت الفعلي من مختبرات Meta للذكاء الفائق، أُطلق في 1 سبتمبر 2026، وسعره يبدو كأنه حرق للأحداث: 3.00 دولارات لكل 1000 دقيقة من الصوت — أي حوالي 0.18 دولار في الساعة — عبر واجهة Meta Model API. في تمرير واحد متدفق، يقوم بما تقوم به معظم أنظمة النسخ مقسومةً على ثلاثة أنظمة: التعرف التلقائي على الكلام، والفصل بين المتحدثين عبر أكثر من 20 صوتًا، وتحديد نهاية الكلام، وهي مهمة تحديد ما إذا كان المتحدث قد انتهى فعلًا أم توقف مؤقتًا في منتصف فكرته. تقول Meta إن النموذج يتصدر لوحة Artificial Analysis لقياس الأداء في تحويل الكلام إلى نص بالتدفق، بمعدل خطأ كلمات يبلغ 3.1% في النسخ النهائية، ويُسلَّم النص بعد 0.16 ثانية من توقف المتحدث عن الكلام.

ذلك الرقم الأخير يحتاج إلى وسمه الصادق قبل أن يُعتمد عليه: إنه ادعاء ميتا في يوم الإطلاق، يشير إلى لوحة صدارة مستقلة، لنموذج لم يكن متاحًا للاستدعاء سوى أقل من يوم عند صدور الإعلان. لم يُكرِّر أحد خارج المختبر نتيجة 3.1% بعد. أمّا ادعاء الدقة فشيء، وأمّا بقية العرض الترويجي — أكثر من 70 لغة مُدرَّبة، والتناوب اللغوي العفوي، و«التأخير التكيفي» المتعلَّم بالتعزيز — فمجموعة منفصلة من تصريحات الشركة المطوّرة، تقع في المركب نفسه. كل ما في هذا المنشور يصف حالة النموذج في يومه الأول، مع تصنيف أرقام الشركة المطوّرة بوصفها أرقامًا صادرة عن الشركة المطوّرة.

الأرقام المهمة في اليوم الأول

• السعر — 3.00 دولارًا لكل 1000 دقيقة صوتية (حوالي 0.18 دولارًا لكل ساعة صوتية) عبر Meta Model API، وهو أقل من كل واجهات برمجة تطبيقات تحويل الكلام الرئيسية التي نتتبعها.

• ادعاء الدقة — معدل خطأ الكلمات (WER) يبلغ 3.1% في النصوص النهائية بعد 0.16 ثانية من انتهاء الكلام؛ و3.6% في النصوص الجزئية الأولى عند 0.13 ثانية. ورد ذلك من المورّد نقلاً عن لوحة متصدرات البث المباشر من Artificial Analysis.

• الديارزة — أكثر من 20 متحدثًا، تصدر بشكل متدفق دون خطوة معالجة لاحقة منفصلة (تشير Meta إلى أن متوسط معدل خطأ الديارزة يبلغ 17.5%).

• اللغات — تم التدريب على أكثر من 70 لغة؛ 25 منها "تم التحقق منها على نطاق واسع" عند الإطلاق؛ انتقال سلس بين اللغات داخل الجمل وبين الجمل.

• السياق — يعالج ملفات صوتية أطول من ساعة؛ مع تحيز للغة والكلمات المفتاحية والسياق للمجالات التي تعتمد على المصطلحات المتخصصة.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

ما معنى "نموذج الإدراك السمعي" هنا؟

القصة هي الهندسة المعمارية. يستهلك "Muse Voice Transcribe" الصوت في أجزاء مدتها 80 مللي ثانية، ويبثّ الكلمات فور استقرارها، وهذا هو المعنى العملي لـ"الوقت الفعلي". الجزء المثير للاهتمام هو كيفية اتخاذه لقرار تثبيت الكلمة. فبدلاً من ميزانية زمنية ثابتة — وهي المقايضة المعتادة حيث يلتزم المُعرّف الصوتي مبكراً فيخمّن، أو ينتظر أطول فيتحوّط — يستخدم النموذج ما تسميه "Meta" بـ"التأخير التكيفي": فهو يتحرك بسرعة عبر الكلام السهل، ويحتجز سياقاً صوتياً أطول للكلمات التي يكون أقل ثقة بشأنها. أما سياسة التأخير نفسها فقد تعلّمها النموذج عبر التعلم المعزّز، لذا فهو في الواقع يوازن بين السرعة والدقة لكل كلمة على حدة بدلاً من تطبيق إعداد عام واحد.

هذا التمييز هو السبب في أن ميتا تسمي Muse Voice Transcribe "نموذج إدراك صوتي" بدلاً من نموذج ASR. تيار المخرجات هو نسخة نصية حية واحدة تحمل أيضًا هوية المتحدث ولحظة اكتمال الكلام — وهي ثلاث تصنيفات عادةً ما تجمعها الأنظمة المتدفقة عبر لصق متعرف صوتي بكاشف نشاط صوتي ونموذج فصل متحدثين، حيث يضيف كلٌّ منها زمن استجابة خاصًا به وأنماط فشل خاصة به.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

فصل المتحدثين وكشف نهاية الكلام، مدمجان

يعد التصنيف الصوتي {{1}}الجزء الأجدر بالتدقيق،{{/1}} لأنه الميزة التي غالبًا ما تبالغ فيها منتجات البث المباشر. تقول ميتا إن النموذج يفصل {{2}}أكثر من 20 متحدثًا في تسجيل واحد{{/2}} وتُعلن عن متوسط معدل خطأ في التصنيف يبلغ {{3}}17.5%{{/3}}، وهو ما تقابله بنطاق يتراوح بين {{3}}21.1% و28.6%{{/3}} تنسبه إلى أنظمة المنافسين. كلا الرقمين منشور من قِبل البائع في يوم الإطلاق، ولم يؤكد أي تقييم مستقل رقم {{3}}17.5%{{/3}} حتى الآن. أما ما هو حقيقي من الناحية البنيوية، فهو أن التصنيف الصوتي يعمل داخل نفس مسار البث المباشر الذي يعمل فيه التعرف — فلا توجد خطوة ثانية من نوع "ارفع الصوت، انتظر، واستعد المتحدثين"، وهذا هو الخيار التصميمي الذي يجعل تتبع {{2}}أكثر من 20 متحدثًا{{/2}} أمرًا ممكنًا في بيئة البث المباشر أصلًا.

تحديد نهاية الكلام هو القدرة الأقل بروزًا، لكنه على الأرجح الأكثر فائدة. واجهات برمجة تطبيقات النسخ التي تعرض تدفق التعرف التلقائي على الكلام (ASR) الخام تُجبر المستدعي على تنفيذ كشف نهاية الكلام بنفسه، ولهذا السبب كثيرًا ما تقاطع المساعدات الصوتية المتحدثين أو تترك فترات صمت. تحدد أداة Muse Voice Transcribe متى يكتمل دور المتحدث، وتُصدر تلك الحدود كجزء من التدفق، فيحصل التطبيق على إشارة واضحة بأن "هذا المتحدث انتهى" دون بناء طبقة VAD.

الادعاء متعدد اللغات، اقرأ بعناية

درّبت Meta النموذج على 70+ لغة لكنها تتحقق من 25 لغة عند الإطلاق. هذان أمران مختلفان: "التدريب على" يعني أن البيانات شملتها؛ أما "التحقق الموسّع" فهو المجموعة الفرعية التي تدعمها Meta فعليًا عبر اختبارات داخلية. للاستخدام الإنتاجي، فإن قائمة الـ25 لغة المُتحقق منها هي التغطية الحقيقية، والفجوة بين 70 و25 جديرة بالمعرفة قبل أن توجّه 40 لغة من خلالها. ما هو غير اعتيادي حقًا هو قصة تبديل اللغات (code-switching) — فالنموذج مصمم للتبديل بين اللغات في منتصف الجملة وأثناء الكلام دون أن يُطلب منه، وهو ما يمثل نقطة ألم حقيقية في المناطق متعددة اللغات، وشيئًا لا تستطيع معظم منتجات التعرّف على الكلام أحادية اللغة القيام به. وتُكمل انحيازات اللغة والكلمات الرئيسية والسياق قصة التخصيص: يمكنك توجيه التعرّف نحو مفردات مجال معيّن، وهي الميزة التي تجعل التعرّف على الكلام المتدفّق (streaming ASR) قابلًا للاستخدام في مجالات الطب والقانون والدعم الفني.

ثلاثة أسطح، طراز واحد

يُطلق Muse Voice Transcribe على ثلاث واجهات في وقت واحد. النسخة المدفوعة هي Meta Model API بسعر 3.00 دولار لكل 1000 دقيقة صوتية. النسخة الاستهلاكية هي Meta AI لأجهزة Mac، حيث يتيح الضغط باستمرار على مفتاح Fn الإملاء في أي تطبيق — ردّ Meta على خاصية الإملاء المدمجة في Apple، وأكثر حالات نشر النموذج ظهورًا في العالم الحقيقي منذ اليوم الأول. نسخة المطورين هي Muse Code، وكيل البرمجة من Meta، حيث توجّه الأوامر الصوتية جلسات متعددة الوكلاء وسير عمل إعادة الهيكلة. إن نموذجًا واحدًا يدعم ميزة الإملاء ووكيل برمجة هو التجسيد المنتجي لفكرة «نموذج بث واحد، واجهات متعددة».

ما الذي يقلّ عنه السعر؟

بسعر 0.18 دولار لكل ساعة صوتية، يقدّم Muse Voice Transcribe سعرًا أقل من الأسعار المعلنة في مجال النسخ الفوري. ومجموعة المقارنة كما نتتبّعها: نموذج Gemini 3.5 Transcribe Live من Google يكلّف نحو 9 دولارات لكل 1000 دقيقة، ونموذج Scribe v2 Realtime من ElevenLabs مُدرج بسعر 6.50 دولار لكل 1000 دقيقة، وInk-2 من Cartesia بسعر 4.00 دولارات، وGPT Live Transcribe من OpenAI بسعر 17.00 دولارًا. هذه هي الأرقام المنشورة من البائعين، والعديد من تلك النماذج لديها أدلة دقة مستقلة لا يمتلكها Muse بعد — ريادة السعر في اليوم الأول ليست مثل ترتيب صدارة مستقر. لكن نموذج نسخ فوري مزوّد بتمييز المتحدثين وتحديد نهاية الكلام (endpointing) بشكل مدمج، ويدخل السوق بسعر يبلغ تقريبًا ما بين خمس وعُشر تكلفة واجهات النسخ الفوري القائمة، هو النوع من الأرقام الذي يعيد ضبط التوقعات على أي حال.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

التحفظات الصادقة

إن Muse Voice Transcribe برمجية احتكارية، وأوزان النموذج غير منشورة — لا يوجد خيار "تشغيلها بنفسك"، ولا يوجد مسار أوزان مفتوحة للتدقيق أو الضبط الدقيق. ادعاء الدقة يعود إلى يوم الإطلاق ولم يتم تكراره. واللغات الخمس والعشرون الموثّقة قد لا تطابق رقم "التدريب عليها" الذي يتجاوز سبعين لغةً في ما يخص تغطية الموارد المنخفضة. ومعيار فصل المتحدثين، مهما كان واعدًا، يظل قياسًا من البائع حتى تؤكده عملية تشغيل مستقلة. أما بالنسبة للفرق التي لا يتطلب سوى النسخ الدقيق والتجميعي لملفات صوتية مسجلة مسبقًا، فلا تزال هناك خيارات أرخص وأفضل تدقيقًا — فحديث البث المباشر يدور حول التفاعل اللحظي، لا حول التفوق على عالم النسخ التجميعي من حيث التكلفة لكل ساعة صوتية.

ماذا تشاهد بعد ذلك

أربعة أمور ستحدد ما إذا كان هذا الإطلاق لحظةً عابرةً أم اتجاهًا مستدامًا. أولًا، {{1}}ما إذا كانت لوحة صدارة البث في Artificial Analysis تُدرج فعلًا Muse Voice Transcribe في المركز الأول بعد التحقق المستقل — إذ إن ادعاء يوم الإطلاق يحتاج إلى إدراج نهائي مستقر في اللوحة{{/1}}. ثانيًا، {{2}}ما إذا كانت خاصية تمييز المتحدثين التي تدعم أكثر من 20 متحدثًا ستصمد أمام اجتماعات حقيقية مليئة بالضوضاء{{/2}}. ثالثًا، {{3}}ما إذا كانت واجهة الإملاء من Meta على Mac ستتحول إلى تبنٍّ من المطورين لواجهة API{{/3}}. رابعًا، {{4}}كيف ستستجيب الشركات القائمة من حيث السعر، لأن نموذج بث يتضمن تمييز المتحدثين وكشف نهاية الكلام بسعر 0.18 دولار للساعة يمارس ضغطًا واضحًا على كل الحلول الأعلى منه سعرًا{{/4}}. وعندما تتيح Meta النموذج لشركاء استضافة إضافيين، فإن بوابة تمرير مباشر مثل {{KEEP}}OrcaRouter{{/KEEP}} — التي تحيل الأسعار المعلنة لمقدمي الخدمة بهامش ربح 0% — ستُظهر الرقم نفسه البالغ 3.00 دولارات لكل 1,000 دقيقة دون أي زيادة من جهة إعادة البيع، في اليوم الذي يُتاح فيه النموذج. وإلى ذلك الحين، يظل المكان الوحيد المتاح لاستدعاء Muse Voice Transcribe هو واجهة API الخاصة بـ Meta نفسها.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube