بطاقة عنوان رئيسي تقارن بين "VibeVoice-ASR-Streaming-7B مقابل Muse Voice Transcribe"، بسطر علوي "Streaming ASR - سبتمبر 2026"، وعنوان فرعي يصف متحديين في البث الصوتي يفصل بينهما يوم واحد؛ إذ توفّر Meta واجهة API بسعر 0.18 دولارًا للساعة، بينما تطرح Microsoft checkpoint بترخيص MIT دون أيّ استضافة، مع شارات "MIT weights - 2 سبتمبر" و"Meta API - 1 سبتمبر" و"كلاهما غير موثق"، وملاحظة سفلى عن "نفس الوعود التي يقدّمها العنوان الرئيسي". شعار OrcaRouter مركّب في أسفل اليمين.
Guides & Insights

VibeVoice-ASR-Streaming-7B مقابل Muse Voice Transcribe: منافسان في البث المباشر، بفارق يوم واحد

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

خلال ما يقارب ستًّا وثلاثين ساعة في أوائل سبتمبر 2026، طرح مختبران كبيران نموذجَي تحويل كلام إلى نصّ يعملان بالبث المباشر، ويقدّمان الوعد الرئيسي نفسه — نسخة نصّية حيّة تخبرك أيضًا من قال ماذا، بينما تُنطَق الكلمات. في الأول من سبتمبر، أطلقت Meta Superintelligence Labs خدمة Muse Voice Transcribe كواجهة برمجية مستضافة بسعر 3.00 دولارات لكل 1,000 دقيقة صوتية، أي نحو 0.18 دولار للساعة، مع تعرّف على الكلام بالبث، وفصلٍ لأكثر من 20 متحدثًا، وتحديدِ نهاية المقاطع الصوتية في تمريرة واحدة. وفي الثاني من سبتمبر، رفع Microsoft Research نموذج VibeVoice-ASR-Streaming-7B إلى Hugging Face: أوزان مفتوحة بترخيص MIT، دون أي إعلان، وبطاقة نموذج تدّعي النسخَ النصيَّ بالبث مع نسب الكلام إلى المتحدثين، ودعمَ كلماتٍ مفتاحية وعشر لغات، وليس له أي موطن مستضاف في أي مكان. الطرح نفسه، ونموذجا عمل متعاكسان تمامًا، وأدلة من الجانبين أهزل مما يرغب المختبران في أن تلاحظه.

هذه الصفحة مكتوبة بصيغة "ما نعرفه حتى الآن"، لأنّه لا يوجد لدى أيٍّ من النموذجين رقم دقّة تم التحقق منه بشكل مستقل. أرقام Muse Voice Transcribe هي ادعاءات Meta يوم الإطلاق، مُبلَّغة من قِبل البائع وغير مُعاد إنتاجها؛ بينما لم ينشر VibeVoice-ASR-Streaming-7B أي رقم دقّة للبث المباشر في نصٍّ على الإطلاق. لذلك تعتمد المقارنة أدناه على ما هو بنيويّ وقابل للمعرفة — البنية، السعر، الترخيص، السلوك الموثَّق — وتضع علامة على أرقام البائع القليلة حيثما تظهر.

منافسان لخط أنابيب المعالجة الدفعية، بفارق يوم واحد.

كلا النموذجين هجومان على الافتراض نفسه: أنّ تحويل الكلام إلى نص هو أمر تُشغّله على تسجيل منتهٍ. Muse Voice Transcribe هو أول منتج تصفه Meta بأنه "نموذج إدراك صوتي في الوقت الفعلي" — تمريرة بثّ واحدة تتولّى التعرّف، وفصل المتحدثين عبر أكثر من عشرين صوتًا، وكشف نهاية الكلام، وهي مهمة تحديد ما إذا كان المتحدث قد انتهى فعلًا بدلًا من أنّه توقف مؤقتًا. يُطرح على ثلاث واجهات دفعة واحدة: Meta Model API بسعر 0.18 دولارًا لكل ساعة صوتية، وMeta AI لأجهزة Mac حيث الضغط مع الاستمرار على مفتاح Fn يُملي النص داخل أي تطبيق، وMuse Code. أما VibeVoice-ASR-Streaming-7B من Microsoft فهو العضو البثّي من عائلة VibeVoice مفتوحة المصدر، ومسار إصداره أكثر هدوءًا بكثير: مستودع على Hugging Face أُنشئ في 2 سبتمبر (تشير الطوابع الزمنية إلى 15:46 UTC، وآخر تعديل بعد ثلاث دقائق)، وثماني شرائح safetensors بترخيص MIT، وسطر في سجلّ الأخبار بتاريخ 3 سبتمبر داخل مستودع microsoft/VibeVoice على GitHub يصفه بأنه "نموذج ASR بثّي موحّد ينسخ بشكل متواصل من قال ماذا مع ورود الكلام، مع دعم كلمات مخصصة و10 لغات." بعد يوم من الرفع، ما زال يعرض صفر عمليات تنزيل.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

تصادم الميزات

— آلية البث: يستهلك Muse Voice Transcribe الصوت على شكل دفعات مدتها 80 ميلي ثانية ويثبّت الكلمات فور استقرارها، بينما يعالج VibeVoice-ASR-Streaming-7B دفعات مدتها حوالي 2.9 ثانية مع نظرة استباقية تبلغ حوالي 0.5 ثانية، ويُصدر النص مرة واحدة لكل دفعة مكتملة.

• إسناد المتحدثين — أكثر من 20 متحدثًا في تمرير واحد، متوسط خطأ في فصل المتحدثين 17.5% كما أبلغ البائع، مقابل مخرجات "من قال ماذا" في البث المباشر المُدَّعاة في بطاقة النموذج، غير مُتحقَّق منه.

• تحديد نهاية الكلام — مدمج: يحمل التدفق حدًّا يشير إلى اكتمال الجملة، على خلاف عدم توثيقه كإشارة إخراج.

• ضوابط السياق — انحياز اللغة والكلمات الرئيسية والسياق مقابل الكلمات الساخنة المخصصة عبر موجه سياق (--context_info).

• اللغات — تم التدريب على أكثر من 70 لغة، مع التحقق الموسّع من 25 لغة عند الإطلاق، وتبديل لغوي طبيعي مقابل 10 لغات معلنة (en, zh, es, pt, de, ja, ko, fr, ru, it).

• الأدلة — ادعاءات البائع في يوم الإطلاق: معدل خطأ الكلمات 3.1% على النتائج النهائية بعد 0.16 ثانية من الكلام، و3.6% على النتائج الجزئية الأولى، مستشهدًا بلوحة متصدرات البث في Artificial Analysis مقابل عدم نشر أي رقم لمعدل خطأ الكلمات أو زمن الاستجابة للبث كنص.

• التكلفة والترخيص — 0.18 دولار لكل ساعة صوتية، مستضاف، أوزان مغلقة مقابل 0 دولار للأوزان (MIT)، حوالي 18 جيجابايت من bf16، مستضاف ذاتيًا.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

فكرتان مختلفتان تمامًا عن "البث"

تغطي كلمة «البث» نطاقًا واسعًا من الإيقاعات، والفجوة بين هذين الطرفين واسعة بما يكفي لتغيير ما يمكنك بناؤه على كلٍّ منهما. يبثّ Muse Voice Transcribe النصوص على مستوى الكلمات. تستهلك بنية Meta الصوت في مقاطع طول كل منها 80 مللي ثانية وتستخدم ما تسميه «التأخير التكيفي» — وهي سياسة تأخير تعلَّمتها عبر التعلم المعزز تُثبِّت كل كلمة بمجرد أن يثق النموذج بها، مع الاحتفاظ بسياق أكبر للكلمات التي يكون أقل ثقةً بها بدلاً من تطبيق ميزانية تأخير ثابتة. وتدّعي الشركة أن النصوص النهائية تُنتج بعد 0.16 ثانية من توقف المتحدث، وأن النصوص الجزئية الأولى تُنتج بعد 0.13 ثانية. هذا الإيقاع مصمم للحلقات التفاعلية: التسميات التوضيحية المباشرة، والإملاء، وعميل صوتي يحتاج إلى الاستجابة للفظٍ مكتمل على الفور تقريبًا.

{{1}}VibeVoice-ASR-Streaming-7B{{/1}} يبثّ الصوت بمستوى تجزئة أخشن. تُظهر إعدادات المعالج المسبق أن الصوت يصل بمعدل 24 كيلوهرتز، ويُضغط 3,200× إلى رموز (tokens) بمعدل نحو 7.5 إطارًا في الثانية، ثم يُعالَج في دفعات من 22 إطارًا مع نظرة استباقية من 4 إطارات — أي ما يعادل نحو 2.9 ثانية من الصوت لكل دفعة، ونحو نصف ثانية من النظرة الاستباقية؛ وهي أرقام مشتقة من الإعدادات لا من قياسٍ فعليٍّ لزمن الاستجابة. يُخرَج النص عند اكتمال كل دفعة، مع حفظ سياق الدفعات السابقة عبر ذاكرة التخزين المؤقت KV، ومن ثم لا تُعاد المعالجة من الصفر في الجلسات الطويلة. النص المفرَّغ الذي ينمو بزيادات تبلغ نحو ثلاث ثوانٍ يصلح لتدوين محاضر الاجتماعات وتحليلات المكالمات؛ غير أنه منتج مختلف عن بثّ الكلمات بزمن استجابة دون الثانية للمحادثة المباشرة. لم ينشر أيٌّ من المختبرين قياسًا لزمن الاستجابة من البداية إلى النهاية لنسخة البث هذه؛ لذا تعامل مع هذا الإيقاع بوصفه المقصود في التصميم، ومع التجربة الفعلية في العالم الحقيقي بوصفها غير مُختبَرة بعد.

تسميات المتحدثين وتحديد نهاية الكلام: مدمجان في أحدهما، ومُدّعيان في الآخر.

يُعد إسناد المتحدث المجال الذي تكثر فيه المبالغات بين المنتجات القائمة على المعالجة التدفقية، وكلاهما يدّعي هذه القدرة. وما تقدّمه Muse Voice Transcribe في هذا الصدد ملموس وبنيوي: يعمل فصل المتحدثين (diarization) داخل مسار التدفق نفسه الذي يعمل فيه التعرّف، لذا يمكن لتسجيل مكالمة تضمّ عشرين شخصًا أن يحمل تسميات لكل متحدث على حدة دون خطوة منفصلة من قبيل «ارفع الملف، وانتظر، ثم استرجع المتحدثين»، وتذكر Meta أن متوسط معدل خطأ فصل المتحدثين يبلغ 17.5% — وهو رقم من الشركة المورِّدة لم يُكرَّر من طرف مستقل، لكنه مرتبط بآلية فعلية. كما أنها تُصدر حدود نهاية الكلام، وهي قدرة أقل بروزًا: يحصل التطبيق على إشارة واضحة بأن «دور هذا المتحدث انتهى» دون أن يبني كاشف نشاط صوتي، وهذا هو السبب في أن الوكلاء الصوتيين المبنيين على تقنية ASR الخام يقاطعون المتحدثين في منتصف كلامهم كثيرًا.

يدّعي نموذج VibeVoice-ASR-Streaming-7B على بطاقة النموذج الخاصة به أنه يقدّم مخرجات بثّية تحدّد "من قال ماذا"، بما يتماشى مع المخرجات المنظّمة (من/متى/ماذا) لنموذج VibeVoice-ASR الدُفَعي — لكن بالنسبة لنقطة التحقّق الخاصة بالبث، فإن هذا الادعاء غير مُتحقَّق منه، ولم تنجح أي اختبارات مستقلة في إعادة إنتاجه، ولا توجد إشارة موثّقة لإنهاء الكلام من النوع الذي توفّره Muse. إذا كانت مهمتك تتعلق فعليًا بالصوت المباشر متعدد المتحدثين، فإن Muse تقدم اليوم آلية أكثر اكتمالًا؛ أما إذا كنت تقيّم ما إذا كان نموذج مفتوح الأوزان قادرًا على أداء المهمة نفسها على أجهزة تتحكّم بها، فإن ادعاء VibeVoice هو بالضبط النوع الذي ينبغي اختباره بتسجيلات اجتماعاتك الخاصة قبل تصديقه.

الأدلة: ادعاءات يوم الإطلاق مقابل بطاقة فارغة.

من الجدير أن نكون دقيقين بشأن ما يملكه كل طرف، لأن لا أحد منهما يملك ما يريده المشتري فعلاً. توفّر Muse Voice Transcribe مجموعة كثيفة من أرقام المورّد — معدل خطأ في الكلمات بنسبة 3.1% في النصوص النهائية، و3.6% في النتائج الجزئية الأولى، وزمن استجابة نهائي يبلغ 0.16 ثانية، ومتوسط خطأ في تمييز المتحدثين بنسبة 17.5% — وكلها نشرتها Meta يوم الإطلاق وتشير إلى لوحة صدارة Artificial Analysis للتحويل المتدفق من الكلام إلى نص، حيث تدّعي Meta المركز الأول. هذه ادعاءات لم يعِد إنتاجها أي شخص خارج المختبر، لكنها محدّدة بما يكفي لإمكانية دحضها، وهو نوع من التقدّم.

VibeVoice-ASR-Streaming-7B لا يمتلك أيًّا من ذلك. فبطاقة طرازه تعرض رقم تقييم كصورة، والملخص الفني للبث هو ملف PDF، لكن لا يوجد رقم WER للبث أو زمن استجابة قابل للاقتباس في النثر. المرساة الرقمية الوحيدة في عائلة VibeVoice هي جدول مقدم من البائع لبطاقة VibeVoice-ASR الدفعي — 7.77% متوسط WER عبر ثماني مجموعات اختبار إنجليزية، و2.20% على LibriSpeech clean — وهو صراحةً ليس رقم هذا الموديل. عندما يدّعي إطلاقُ اليوم رقمًا في وجه بطاقة فارغة، يكون الحكم النزيه هو كل شيء عدا رقم WER الرئيسي: السعر، والترخيص، وإيقاع البث، والميزات التي يوثّقها كل طرف فعليًا.

اللغات: تم التحقق من 25 مقابل 10 معلنة

إن تغطية اللغات هي ما يفصل بين الاثنين أكثر من ادعاءات الدقة التي تتصدر العناوين. تم تدريب Muse Voice Transcribe على أكثر من 70 لغة، لكن Meta تتحقق من 25 لغة فقط عند الإطلاق — والقائمة المُتحقَّق منها، وليست قائمة التدريب، هي تغطية الإنتاج الفعلية، وما يميّزه هو التبديل المدمج بين اللغات: فهو مصمَّم للانتقال بين اللغات في منتصف الجملة دون أن يُطلب منه ذلك. يعلن VibeVoice-ASR-Streaming-7B في بطاقة النموذج الخاصة به عن 10 لغات — الإنجليزية، الصينية، الإسبانية، البرتغالية، الألمانية، اليابانية، الكورية، الفرنسية، الروسية، الإيطالية — مقابل أكثر من 50 لغة في VibeVoice-ASR المجمَّع. إذا كانت حركة المرور لديك تتضمن محادثات مختلطة اللغات، فإن Muse يقدّم طرحًا أكثر تحديدًا؛ أما إذا كانت محصورة ضمن تلك اللغات العشر، فإن تغطية نموذج Microsoft تعدّ صريحة على الأقل، وهذا أكثر مما تقدمه معظم مواد الإطلاق.

التكلفة وما تحتفظ به

الفرق في نموذج العمل هو أوضح وسيلة للحسم بين الخيارين. خدمة Muse Voice Transcribe بسعر 0.18 دولار للساعة الصوتية تقدّم سعرًا يقلّ عن السعر المعلن لكل واجهات برمجة التطبيقات الرئيسية للنسخ المتدفّق — لا حاجة إلى GPU، ولا عمليات تشغيل، أوزان مغلقة، والسعر محدد من Meta. أما VibeVoice-ASR-Streaming-7B فتحميله مجاني، لكنه يتطلب نحو 18 غيغابايت من الأوزان بصيغة bf16 قبل احتساب KV cache ليتسنى استضافته ذاتيًا على GPU بذاكرة 24 غيغابايت، مع نصوص microsoft/VibeVoice التجريبية أو إضافة vLLM كمسارَين تشغيليَّين موثّقَين، ولا يوجد مزوّد استدلال يستضيفه حتى الآن. رخصة MIT هي الأصل الدائم: الأوزان تبقى ملكك وتحتفظ بها وتضبطها بدقة (fine-tuning) على نحو لا يوفّره أي اشتراك في واجهة برمجة تطبيقات. وهنا أيضًا قد تزداد صورة التسعير إثارة — فبمجرد أن يستضيف مزوّد ما نقطة التحقق المفتوحة، يتحول سؤال الـ 0.18 دولار للساعة من سعر قائمة بائعٍ واحد إلى سعر سوق، وهذا هو بالضبط الوضع الذي يُثبت فيه الموجّه الممرّر للأسعار قيمته. لا يقوم OrcaRouter اليوم بتوجيه تحويل الكلام إلى نص، ولا يوجد أيٌّ من هذين الطرازين في فهرسه؛ لكن ما يفعله هو تمرير أسعار المزوّدين المعلنة بهامش ربح 0% على أكثر من 200 نموذج لغوي تستهلك نصًا مباشرًا (live transcript)، لذا فإن أي خفض للسعر من أي مزوّد في أي موضع من تلك الحزمة يصبح ساريًا لدى المشتري في اليوم نفسه الذي يُعلن فيه.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

الأسئلة الشائعة

هل تعني نسبة خطأ الكلمات (WER) البالغة 3.1% في Muse Voice Transcribe أنها أكثر دقة من VibeVoice-ASR-Streaming-7B؟

لا، والمقارنة غير ذات معنى بعد. نسبة 3.1% التي أعلنتها Meta هي ادعاء صادر يوم الإطلاق لمسار البث، مبلَّغ من البائع ولم يتم التحقق منه بتكرار مستقل. لم تنشر VibeVoice-ASR-Streaming-7B أي رقم لدقة البث في نص على الإطلاق. إلى أن يُختبر كلا النموذجين عبر نفس المنصة العامة على نفس المادة الصوتية، فإن التصريح الوحيد الصادق هو أن Muse لديها ادعاء محدد قابل للاختبار بينما VibeVoice لا تملك واحدًا بعد.

هل يمكنني استخدام أيٍّ من النموذجين على صوتٍ تم تسجيله مسبقًا؟

نعم لكليهما، لكن بأشكال مختلفة. يتعامل Muse Voice Transcribe مع التسجيلات التي تزيد مدتها على ساعة عبر واجهة البث نفسها. وأمّا المكوّن الإضافي vLLM الخاص بـ VibeVoice-ASR-Streaming-7B فيوفّر نقطة نهاية لنسخ الملف بالكامل إلى جانب نقطة نهاية بث WebSocket. لكن كلاهما مصمَّم ومسعَّر للاستخدام المباشر — Muse بنموذج أعماله القائم على البث فقط، وVibeVoice بمعمارية التقطيع التي تُخرج النص فور وصول الصوت — لذا إذا كان عبء عملك ملفات دفعية بحتة، فإن واجهة برمجة تطبيقات مخصّصة لنسخ الملفات ستكون عادةً أرخص وأدقّ قياسًا من أيٍّ منهما.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube