
Muse Voice Transcribe أصبح متاحًا: أول نموذج إدراك صوتي في الوقت الفعلي من Meta
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
Muse Voice Transcribe، أول نموذج للإدراك الصوتي في الوقت الفعلي من مختبرات Meta للذكاء الفائق، أُطلق في 1 سبتمبر 2026، وسعره يبدو كأنه حرق للأحداث: 3.00 دولارات لكل 1000 دقيقة من الصوت — أي حوالي 0.18 دولار في الساعة — عبر واجهة Meta Model API. في تمرير واحد متدفق، يقوم بما تقوم به معظم أنظمة النسخ مقسومةً على ثلاثة أنظمة: التعرف التلقائي على الكلام، والفصل بين المتحدثين عبر أكثر من 20 صوتًا، وتحديد نهاية الكلام، وهي مهمة تحديد ما إذا كان المتحدث قد انتهى فعلًا أم توقف مؤقتًا في منتصف فكرته. تقول Meta إن النموذج يتصدر لوحة Artificial Analysis لقياس الأداء في تحويل الكلام إلى نص بالتدفق، بمعدل خطأ كلمات يبلغ 3.1% في النسخ النهائية، ويُسلَّم النص بعد 0.16 ثانية من توقف المتحدث عن الكلام.
ذلك الرقم الأخير يحتاج إلى وسمه الصادق قبل أن يُعتمد عليه: إنه ادعاء ميتا في يوم الإطلاق، يشير إلى لوحة صدارة مستقلة، لنموذج لم يكن متاحًا للاستدعاء سوى أقل من يوم عند صدور الإعلان. لم يُكرِّر أحد خارج المختبر نتيجة 3.1% بعد. أمّا ادعاء الدقة فشيء، وأمّا بقية العرض الترويجي — أكثر من 70 لغة مُدرَّبة، والتناوب اللغوي العفوي، و«التأخير التكيفي» المتعلَّم بالتعزيز — فمجموعة منفصلة من تصريحات الشركة المطوّرة، تقع في المركب نفسه. كل ما في هذا المنشور يصف حالة النموذج في يومه الأول، مع تصنيف أرقام الشركة المطوّرة بوصفها أرقامًا صادرة عن الشركة المطوّرة.
الأرقام المهمة في اليوم الأول
• السعر — 3.00 دولارًا لكل 1000 دقيقة صوتية (حوالي 0.18 دولارًا لكل ساعة صوتية) عبر Meta Model API، وهو أقل من كل واجهات برمجة تطبيقات تحويل الكلام الرئيسية التي نتتبعها.
• ادعاء الدقة — معدل خطأ الكلمات (WER) يبلغ 3.1% في النصوص النهائية بعد 0.16 ثانية من انتهاء الكلام؛ و3.6% في النصوص الجزئية الأولى عند 0.13 ثانية. ورد ذلك من المورّد نقلاً عن لوحة متصدرات البث المباشر من Artificial Analysis.
• الديارزة — أكثر من 20 متحدثًا، تصدر بشكل متدفق دون خطوة معالجة لاحقة منفصلة (تشير Meta إلى أن متوسط معدل خطأ الديارزة يبلغ 17.5%).
• اللغات — تم التدريب على أكثر من 70 لغة؛ 25 منها "تم التحقق منها على نطاق واسع" عند الإطلاق؛ انتقال سلس بين اللغات داخل الجمل وبين الجمل.
• السياق — يعالج ملفات صوتية أطول من ساعة؛ مع تحيز للغة والكلمات المفتاحية والسياق للمجالات التي تعتمد على المصطلحات المتخصصة.

ما معنى "نموذج الإدراك السمعي" هنا؟
القصة هي الهندسة المعمارية. يستهلك "Muse Voice Transcribe" الصوت في أجزاء مدتها 80 مللي ثانية، ويبثّ الكلمات فور استقرارها، وهذا هو المعنى العملي لـ"الوقت الفعلي". الجزء المثير للاهتمام هو كيفية اتخاذه لقرار تثبيت الكلمة. فبدلاً من ميزانية زمنية ثابتة — وهي المقايضة المعتادة حيث يلتزم المُعرّف الصوتي مبكراً فيخمّن، أو ينتظر أطول فيتحوّط — يستخدم النموذج ما تسميه "Meta" بـ"التأخير التكيفي": فهو يتحرك بسرعة عبر الكلام السهل، ويحتجز سياقاً صوتياً أطول للكلمات التي يكون أقل ثقة بشأنها. أما سياسة التأخير نفسها فقد تعلّمها النموذج عبر التعلم المعزّز، لذا فهو في الواقع يوازن بين السرعة والدقة لكل كلمة على حدة بدلاً من تطبيق إعداد عام واحد.
هذا التمييز هو السبب في أن ميتا تسمي Muse Voice Transcribe "نموذج إدراك صوتي" بدلاً من نموذج ASR. تيار المخرجات هو نسخة نصية حية واحدة تحمل أيضًا هوية المتحدث ولحظة اكتمال الكلام — وهي ثلاث تصنيفات عادةً ما تجمعها الأنظمة المتدفقة عبر لصق متعرف صوتي بكاشف نشاط صوتي ونموذج فصل متحدثين، حيث يضيف كلٌّ منها زمن استجابة خاصًا به وأنماط فشل خاصة به.

فصل المتحدثين وكشف نهاية الكلام، مدمجان
يعد التصنيف الصوتي {{1}}الجزء الأجدر بالتدقيق،{{/1}} لأنه الميزة التي غالبًا ما تبالغ فيها منتجات البث المباشر. تقول ميتا إن النموذج يفصل {{2}}أكثر من 20 متحدثًا في تسجيل واحد{{/2}} وتُعلن عن متوسط معدل خطأ في التصنيف يبلغ {{3}}17.5%{{/3}}، وهو ما تقابله بنطاق يتراوح بين {{3}}21.1% و28.6%{{/3}} تنسبه إلى أنظمة المنافسين. كلا الرقمين منشور من قِبل البائع في يوم الإطلاق، ولم يؤكد أي تقييم مستقل رقم {{3}}17.5%{{/3}} حتى الآن. أما ما هو حقيقي من الناحية البنيوية، فهو أن التصنيف الصوتي يعمل داخل نفس مسار البث المباشر الذي يعمل فيه التعرف — فلا توجد خطوة ثانية من نوع "ارفع الصوت، انتظر، واستعد المتحدثين"، وهذا هو الخيار التصميمي الذي يجعل تتبع {{2}}أكثر من 20 متحدثًا{{/2}} أمرًا ممكنًا في بيئة البث المباشر أصلًا.
تحديد نهاية الكلام هو القدرة الأقل بروزًا، لكنه على الأرجح الأكثر فائدة. واجهات برمجة تطبيقات النسخ التي تعرض تدفق التعرف التلقائي على الكلام (ASR) الخام تُجبر المستدعي على تنفيذ كشف نهاية الكلام بنفسه، ولهذا السبب كثيرًا ما تقاطع المساعدات الصوتية المتحدثين أو تترك فترات صمت. تحدد أداة Muse Voice Transcribe متى يكتمل دور المتحدث، وتُصدر تلك الحدود كجزء من التدفق، فيحصل التطبيق على إشارة واضحة بأن "هذا المتحدث انتهى" دون بناء طبقة VAD.
الادعاء متعدد اللغات، اقرأ بعناية
درّبت Meta النموذج على 70+ لغة لكنها تتحقق من 25 لغة عند الإطلاق. هذان أمران مختلفان: "التدريب على" يعني أن البيانات شملتها؛ أما "التحقق الموسّع" فهو المجموعة الفرعية التي تدعمها Meta فعليًا عبر اختبارات داخلية. للاستخدام الإنتاجي، فإن قائمة الـ25 لغة المُتحقق منها هي التغطية الحقيقية، والفجوة بين 70 و25 جديرة بالمعرفة قبل أن توجّه 40 لغة من خلالها. ما هو غير اعتيادي حقًا هو قصة تبديل اللغات (code-switching) — فالنموذج مصمم للتبديل بين اللغات في منتصف الجملة وأثناء الكلام دون أن يُطلب منه، وهو ما يمثل نقطة ألم حقيقية في المناطق متعددة اللغات، وشيئًا لا تستطيع معظم منتجات التعرّف على الكلام أحادية اللغة القيام به. وتُكمل انحيازات اللغة والكلمات الرئيسية والسياق قصة التخصيص: يمكنك توجيه التعرّف نحو مفردات مجال معيّن، وهي الميزة التي تجعل التعرّف على الكلام المتدفّق (streaming ASR) قابلًا للاستخدام في مجالات الطب والقانون والدعم الفني.
ثلاثة أسطح، طراز واحد
يُطلق Muse Voice Transcribe على ثلاث واجهات في وقت واحد. النسخة المدفوعة هي Meta Model API بسعر 3.00 دولار لكل 1000 دقيقة صوتية. النسخة الاستهلاكية هي Meta AI لأجهزة Mac، حيث يتيح الضغط باستمرار على مفتاح Fn الإملاء في أي تطبيق — ردّ Meta على خاصية الإملاء المدمجة في Apple، وأكثر حالات نشر النموذج ظهورًا في العالم الحقيقي منذ اليوم الأول. نسخة المطورين هي Muse Code، وكيل البرمجة من Meta، حيث توجّه الأوامر الصوتية جلسات متعددة الوكلاء وسير عمل إعادة الهيكلة. إن نموذجًا واحدًا يدعم ميزة الإملاء ووكيل برمجة هو التجسيد المنتجي لفكرة «نموذج بث واحد، واجهات متعددة».
ما الذي يقلّ عنه السعر؟
بسعر 0.18 دولار لكل ساعة صوتية، يقدّم Muse Voice Transcribe سعرًا أقل من الأسعار المعلنة في مجال النسخ الفوري. ومجموعة المقارنة كما نتتبّعها: نموذج Gemini 3.5 Transcribe Live من Google يكلّف نحو 9 دولارات لكل 1000 دقيقة، ونموذج Scribe v2 Realtime من ElevenLabs مُدرج بسعر 6.50 دولار لكل 1000 دقيقة، وInk-2 من Cartesia بسعر 4.00 دولارات، وGPT Live Transcribe من OpenAI بسعر 17.00 دولارًا. هذه هي الأرقام المنشورة من البائعين، والعديد من تلك النماذج لديها أدلة دقة مستقلة لا يمتلكها Muse بعد — ريادة السعر في اليوم الأول ليست مثل ترتيب صدارة مستقر. لكن نموذج نسخ فوري مزوّد بتمييز المتحدثين وتحديد نهاية الكلام (endpointing) بشكل مدمج، ويدخل السوق بسعر يبلغ تقريبًا ما بين خمس وعُشر تكلفة واجهات النسخ الفوري القائمة، هو النوع من الأرقام الذي يعيد ضبط التوقعات على أي حال.

التحفظات الصادقة
إن Muse Voice Transcribe برمجية احتكارية، وأوزان النموذج غير منشورة — لا يوجد خيار "تشغيلها بنفسك"، ولا يوجد مسار أوزان مفتوحة للتدقيق أو الضبط الدقيق. ادعاء الدقة يعود إلى يوم الإطلاق ولم يتم تكراره. واللغات الخمس والعشرون الموثّقة قد لا تطابق رقم "التدريب عليها" الذي يتجاوز سبعين لغةً في ما يخص تغطية الموارد المنخفضة. ومعيار فصل المتحدثين، مهما كان واعدًا، يظل قياسًا من البائع حتى تؤكده عملية تشغيل مستقلة. أما بالنسبة للفرق التي لا يتطلب سوى النسخ الدقيق والتجميعي لملفات صوتية مسجلة مسبقًا، فلا تزال هناك خيارات أرخص وأفضل تدقيقًا — فحديث البث المباشر يدور حول التفاعل اللحظي، لا حول التفوق على عالم النسخ التجميعي من حيث التكلفة لكل ساعة صوتية.
ماذا تشاهد بعد ذلك
أربعة أمور ستحدد ما إذا كان هذا الإطلاق لحظةً عابرةً أم اتجاهًا مستدامًا. أولًا، {{1}}ما إذا كانت لوحة صدارة البث في Artificial Analysis تُدرج فعلًا Muse Voice Transcribe في المركز الأول بعد التحقق المستقل — إذ إن ادعاء يوم الإطلاق يحتاج إلى إدراج نهائي مستقر في اللوحة{{/1}}. ثانيًا، {{2}}ما إذا كانت خاصية تمييز المتحدثين التي تدعم أكثر من 20 متحدثًا ستصمد أمام اجتماعات حقيقية مليئة بالضوضاء{{/2}}. ثالثًا، {{3}}ما إذا كانت واجهة الإملاء من Meta على Mac ستتحول إلى تبنٍّ من المطورين لواجهة API{{/3}}. رابعًا، {{4}}كيف ستستجيب الشركات القائمة من حيث السعر، لأن نموذج بث يتضمن تمييز المتحدثين وكشف نهاية الكلام بسعر 0.18 دولار للساعة يمارس ضغطًا واضحًا على كل الحلول الأعلى منه سعرًا{{/4}}. وعندما تتيح Meta النموذج لشركاء استضافة إضافيين، فإن بوابة تمرير مباشر مثل {{KEEP}}OrcaRouter{{/KEEP}} — التي تحيل الأسعار المعلنة لمقدمي الخدمة بهامش ربح 0% — ستُظهر الرقم نفسه البالغ 3.00 دولارات لكل 1,000 دقيقة دون أي زيادة من جهة إعادة البيع، في اليوم الذي يُتاح فيه النموذج. وإلى ذلك الحين، يظل المكان الوحيد المتاح لاستدعاء Muse Voice Transcribe هو واجهة API الخاصة بـ Meta نفسها.
