بطاقة عنوان رئيسية للمواجهة بين Muse Voice Transcribe وGranite Speech 5.0 470M TurboCTC، تعرض شريحة GPU مستضاف ذاتيًا تحمل تسمية 12,600 RTFx على جانب، وموجة دفق تحمل تسمية 20+ متحدثًا على الجانب الآخر.
Guides & Insights

Muse Voice Transcribe مقابل Granite Speech 5.0 470M TurboCTC: GPU تمتلكه أم API تُدفع بالاستخدام

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أكثر ما ينبغي معرفته عن هذه المقارنة هو أن Muse Voice Transcribe وGranite Speech 5.0 470M TurboCTC بالكاد يُعَدّان بديلين أحدهما عن الآخر. فقد أصدرت IBM نموذج Granite Speech 5.0 470M TurboCTC في 25 أغسطس 2026 بوصفه نموذج تعرّف آلي على الكلام (ASR) باللغة الإنجليزية فقط، يضم 470 مليون معامل، ومرخّصًا بموجب Apache-2.0، ومصمَّمًا للاستضافة الذاتية — وهو نموذج Conformer من نوع encoder-only مدرَّب بتقنية CTC، وتقول IBM إنه يحوّل الكلام إلى نص بسرعة تتجاوز 12,600 ضعف الزمن الفعلي على شريحة NVIDIA H200 واحدة. وفي المقابل، أصدرت Meta Superintelligence Labs نموذج Muse Voice Transcribe في 1 سبتمبر 2026 بوصفه نموذجًا خاصًّا مستضافًا للإدراك الصوتي بالبث المباشر؛ يغطي 25 لغة موثَّقة طَوال فترة ما بعد الإطلاق، ويميّز أصوات أكثر من 20 متحدثًا، ويكشف نهاية الكلام (endpointing)، وتبلغ تكلفته 3.00 دولارات لكل 1,000 دقيقة صوتية. أحدهما يريد بطاقة الرسوميات (GPU) لديك؛ والآخر يريد مفتاح واجهة البرمجة (API) الخاص بك. أما مقارنة أرقام WER الرائجة بينهما فتُضيع الفكرة الأساسية تمامًا — فالسؤال الحقيقي هو أين يُسمح بأن يحدث النسخ، وما الذي يمكن لكل نموذج فعله بمجرد أن يصل إلى هناك.

فلسفتان للنشر

Granite Speech 5.0 470M TurboCTC هو ذروة حركة التعرّف على الكلام مفتوحة الأوزان عند الحافة. بعدد معاملات يبلغ 470 مليونًا، يناسب بشكل مريح جهاز كمبيوتر محمولًا أو هاتفًا أو معالج GPU واحدًا؛ وترخيصه Apache-2.0، لذا يمكنك تضمينه في منتج تجاري؛ كما توفّر IBM عرضًا تجريبيًا بتقنية WebGPU يُشغّل النسخ الصوتي مباشرةً في نافذة المتصفح دون أي خادم إطلاقًا. البنية مُبسَّطة عن قصد — 16 كتلة Conformer، وفك ترميز جشِع، وبلا عمود فقري لنموذج لغوي — لأن الهدف التصميمي بأكمله هو معدل المعالجة على الأجهزة المتواضعة. أما Muse Voice Transcribe فهو الرهان المعاكس: نموذج ملكي ضخم لا تراه أبدًا، يُقدَّم عبر البنية التحتية لـ Meta بسعر 0.18 دولار لكل ساعة صوتية، وتأتي قيمته في الميزات لا في السيليكون. إذا كان قيدك هو «لا يغادر أي صوت هذا المبنى»، فقد اتُّخذ القرار مسبقًا وهو Granite. وإذا كان قيدك هو «أريد أقوى نموذج تدفّق وسأدفع مقابل كل دقيقة»، فالحل هو Muse.

A generated two-column scoreboard titled 'Muse Voice Transcribe vs Granite Speech 5.0 470M TurboCTC — the scoreboard.' Left column Muse Voice Transcribe: Deployment hosted API only, License proprietary closed weights, WER 3.1% streaming (Meta-reported), Languages 25 verified code-switch, Diarization 20+ speakers, Endpointing built-in. Right column Granite Speech 5.0 470M TurboCTC: Deployment self-host 470M params, License Apache-2.0 open weights, WER 5.00% Open ASR (IBM-reported), Languages English only, Diarization none, Endpointing none. Footer reads 'Muse figures Meta-reported; Granite 12,600 RTFx and 5.00% WER IBM-reported, unreproduced.'

السرعة تعني أشياء مختلفة هنا

الرقم الرئيسي لدى Granite، 12,600 RTFx، هو مقياس إنتاجية: H200 واحدة تشغّل استدلالًا بالدفعات تعالج 12,600 ثانية من الصوت كل ثانية — أي ثلاثة ساعات ونصف من الصوت في الثانية. هذا هو المقياس المهم للأعمال المتراكمة في مراكز الاتصال، أو أرشيف وسائط، أو أي خط معالجة بالدفعات تُغذّي فيه GPU باستمرار. إنه ليس مقياس كمون، والكمون التفاعلي أحادي التدفق ليس مجال تميّز هذا النموذج. أمّا Muse Voice Transcribe فتمثّل الصورة المعكوسة تمامًا: معالجة القطع خلال 80 مللي ثانية والتأخير التكيفي مصمّمان لأول 300 مللي ثانية بعد توقّف المتحدث عن الكلام، وليس للإنتاجية الضخمة المستمرة. على المقياس الذي صُمم كلٌّ منهما من أجله، كلاهما قوي؛ وعلى أرض الطرف الآخر، كلاهما في غير عنصره. إذا احتجت إلى نسخ مليون ساعة من الصوت الإنجليزي المؤرشف، فإن اقتصاديات Granite الأولية تفوز بفارق مرتبة كاملة. وإذا احتجت إلى محادثة مباشرة متعددة المتحدثين تتحوّل إلى نص موسوم لحظة حدوثها، فإن Muse هي التي تقدّم هذا أصلًا.

الدقة، موصوفة بصدق

• Granite Speech 5.0 470M TurboCTC — نسبة خطأ كلمات إجمالية تبلغ 5.00% على مجموعات اختبار اللغة الإنجليزية القصيرة العامة في لوحة صدارة Open ASR؛ نتيجة تشغيل IBM لمنصة اختبار رسمية خاصة بها، مُبلَّغة من البائع ولم يتم إعادة إنتاجها، على صوتيات إنجليزية فقط.

• Muse Voice Transcribe — 3.1% في معدل خطأ الكلمات (WER) للبث المباشر، وفقًا لادعاء Meta في يوم الإطلاق بالاستناد إلى لوحة متصدر البث المباشر من Artificial Analysis؛ و3.6% على أول النصوص الجزئية؛ كذلك فهو مُعلَن من البائع وغير مُعاد إنتاجه.

الرقمان ليسا قابلين للمقارنة المباشرة — فهما يعتمدان على مدونات مختلفة، إحداهما إنجليزية فقط وتعمل دون اتصال، والأخرى متعددة اللغات وتعمل ببث مباشر — وهذا هو بالضبط سبب عدم جواز حسم هذه المواجهة بناءً على WER وحده. واستنادًا إلى الأدلة المتاحة، كلاهما معقول لكنه غير مُثبت لأحمال العمل الخاصة بكل منهما. أما الثابت بنيويًا فهو أن رقم Granite يغطي الإنجليزية فقط، بينما يقع ادعاء Muse في سياق بث مباشر وتنقّل لغوي (code-switching) لا يستطيع Granite حتى منافسته فيه.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

ما يعجز عنه كل نموذج ببساطة

يتخلّى Granite Speech 5.0 470M TurboCTC عن كل ما يجعل النص المفرَّغ مفيدًا لفريق المنتج. إنه يدعم اللغة الإنجليزية فقط. لا يتضمّن فصلًا للمتحدثين — إذ تندمج كل الأصوات في تدفّق واحد. ولا يُخرِج علامات الترقيم أو الأحرف الكبيرة أو الطوابع الزمنية، كما أنّ تصميم CTC فيه يتخلى عن ترجيح الكلمات الرئيسية وترجمة الكلام التي كانت متوفرة في نماذج Granite Speech السابقة. هذه ليست فجوات في الجودة؛ بل هي اختيارات معمارية، وهي تعني أنّ حزمة الإنتاج المبنية على Granite لا تزال بحاجة إلى نموذج ترقيم، وأداة فصل متحدثين، وطبقة كشف نشاط صوتي (VAD) تُثبَّت عليها. أمّا Muse Voice Transcribe فهي المكان الذي تعيش فيه تلك الميزات داخل النموذج نفسه: إذ تتدفق ميزة فصل المتحدثين لأكثر من 20 متحدثًا وتحديد نهايات الكلام جنبًا إلى جنب مع الكلمات، كما أنّ التغطية اللغوية مع التبديل اللغوي في منتصف الجملة أمر لا تملك Granite أي إجابة عنه إطلاقًا. الخلاصة الصادقة: Granite محرك تعرّف على الكلام يفترض أنّك ستبني المنتج بنفسك؛ بينما Muse واجهة برمجية (API) مصمَّمة بشكل منتج جاهز، تفترض أنّك تريد نصًا مفرَّغًا ومتحدثين وحدود أدوار واضحة فور وصول النتيجة.

الترخيص والملكية

Granite Speech 5.0 470M TurboCTC مرخّص بموجب Apache-2.0، ويوجد إصدار شقيق غير تجاري (granite-speech-5.0-470m-turboctc-nc، بموجب CC-BY-NC-SA-4.0) للاستخدام البحثي بمعدل خطأ كلمات (WER) أفضل قليلاً يبلغ 4.85% بفضل بيانات تدريب إضافية. يعني ترخيص Apache-2.0 أنه يمكنك تقديمه كخدمة ودمجه وضبطه بدقة وبيع منتج حوله دون إتاوات ودون مخاطر تدقيق. أما Muse Voice Transcribe فهو مغلق ولا يتوفر إلا كخدمة مستضافة: لا أوزان، لا استضافة ذاتية، لا ضبط دقيق، وتتدفق بيانات نصوصك عبر خدمة Meta بموجب شروط Meta. بالنسبة للصناعات الخاضعة للتنظيم، أو أي فريق تحظر سياسة بياناته معالجة الصوت عبر أطراف ثالثة، فإن هذه الحقيقة وحدها تنهي المقارنة قبل أن تبدأ المعايير. أما بالنسبة للباقين، فإن "Apache-2.0 مع وحدة معالجة الرسومات الخاصة بك" و"خاص ومحسوب بالاستخدام" هما ببساطة ملفات مخاطر مختلفة، وليس أفضل وأسوأ.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc showing the English-language and automatic-speech-recognition tags, a model summary describing a compact 470 million parameter English ASR model, the safetensors and Transformers tags, and the Open ASR leaderboard evaluation table.

مسألة التكلفة

جرانيت عند 12,600 RTFx يجعل الرياضيات الخاصة بالاستضافة الذاتية شبه سخيفة لمعالجة الصوت الإنجليزي المجمع: ساعة واحدة من حوسبة H200 تغطي أكثر من 12,000 ساعة صوتية، لذا فإن ألف ساعة من النسخ تكلف بضعة دولارات من وقت GPU الخام بأسعار الإيجار النموذجية — قبل أن تحسب وقت الخمول والهندسة وطبقة الفصل بين المتحدثين المفقودة. تفرض Muse Voice Transcribe رسومًا قدرها 0.18 دولار لكل ساعة صوتية، وهو سعر رخيص لواجهة برمجة تطبيقات بث مباشر، لكنه ليس رخيصًا مقارنة بوحدة GPU مغذاة. القاعدة الذهبية الصادقة: إذا كان الصوت إنجليزيًا ومسجّلًا مسبقًا ولديك حجم كبير، فاستضف Granite ذاتيًا وستكسب اقتصاديًا. أما إذا كان الصوت مباشرًا أو متعدد المتحدثين أو متعدد اللغات، فإن Muse تُسعَّر كخدمة ميزات مُدارة — و180 دولارًا لألف ساعة من البث المباشر مع الفصل بين المتحدثين وتحديد نقاط النهاية هو رقم صغير مقارنة بما تكلفه تلك البنية لبنائها بنفسك.

تشغيل كلاهما دون إحداث فوضى

الفرق التي تحتاج إلى كلا النمطين — استضافة Granite ذاتيًا لمسار المعالجة بالدفعات للنصوص الإنجليزية، واستخدام واجهة برمجية مُدارة للمحادثات الفورية متعددة اللغات — تجد نفسها أمام تكاملين مختلفين تمامًا. الجزء المستضاف هو بالضبط شكل عبء العمل الذي تخدمه بوابة التوجيه: مفتاح API واحد عبر مزودين كثيرين، وتمرير الأسعار المعلنة بهامش ربح 0% بحيث يكون الرقم الذي يعتمده المزود لكل دقيقة هو الرقم الذي تُدفع على أساسه فعلًا، وتحويل تلقائي عند تدهور نقطة نهاية أحد المزودين. أما الجزء المستضاف ذاتيًا فيبقى ملكك. لا حاجة إلى توجيه Granite عبر بوابة — فهو يعمل على أجهزتك الخاصة — لكن المكدس المختلط الذي يستتبعه هو بالتحديد ما توجد منصة الواجهة البرمجية الموحدة لمنع تحوّله إلى مشروعين هندسيين متوازيين.

أيُّ واحدٍ يجب أن تختار؟

إذا كانت مهمتك هي التفريغ النصي للغة الإنجليزية على نطاق واسع — أرشيفات، تسجيلات مكالمات، خطوط إنتاج الترجمة المصاحبة — وكنت تملك وحدة معالجة رسومية (GPU) يمكنك توجيهها إلى المهمة، فإن Granite Speech 5.0 470M TurboCTC هو الخيار الهندسي الأفضل من حيث التكلفة والترخيص والتحكم، مع التحذير من أنك ستبني طبقات الترقيم والفصل بين المتحدثين والبث التدفقي بنفسك. أما إذا كانت مهمتك محادثة مباشرة أو متعددة المتحدثين أو متعددة اللغات — وكلاء الصوت، التسميات التوضيحية المباشرة، منتجات الاجتماعات — فإن Muse Voice Transcribe يقدم ميزات لا يمتلكها Granite، بسعر واجهة برمجة تطبيقات مُدارة، مع التحذير من أن أرقامه مجرد ادعاءات يوم الإطلاق على أوزان مغلقة. إنهما ليسا منافسين بقدر ما هما إجابتان عن سؤالين مختلفين، والفِرق التي تُحسن هذا الاختيار غالبًا ما ينتهي بها الأمر إلى تشغيل النظامين معًا.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube