بطاقة المقال الرئيسية التي تحمل العنوان «Grok Voice Transcribe 2.0 مقابل Muse Voice Transcribe»، مع شارة «مقارنة النماذج» وعنوان فرعي «17 يومًا من التصدّر وربع ثانية»، مع شرائح تقرأ 2.7% مقابل 3.1% لمعدل خطأ الكلمات النهائي WER، و0.49 ثانية مقابل 0.16 ثانية بعد الكلام، و0.20 دولار مقابل 0.18 دولار لكل ساعة بثّ، والدفعة بنصف السعر، فوق تدرّج لوني من الأبيض إلى الأزرق مع شعار OrcaRouter في أسفل اليمين.
Guides & Insights

Grok Voice Transcribe 2.0 مقابل Muse Voice Transcribe: هيمنة دامت 17 يومًا وربع ثانية

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 1 سبتمبر 2026، قالت Meta إن Muse Voice Transcribe قد احتلّ المركز الأول في تقييم Artificial Analysis للتعرف على الكلام المتدفق، بمعدل خطأ كلمات نهائي قدره 3.1%، وظل هذا الادعاء دون منازع سبعة عشر يومًا. وفي 18 سبتمبر، أطلقت SpaceXAI نموذج Grok Voice Transcribe 2.0 بنسبة 2.7% على اللوحة نفسها، وانتزعت المركز. نموذجان، وتصنيف واحد، بفارق سبعة عشر يومًا — والمقارنة الأكثر إثارة للاهتمام ليست فجوة 0.4 نقطة في الدقة، لأن نموذج Meta لا يزال أسرع بنحو ثلاث مرات في إنهاء الجملة: 0.16 ثانية بعد انتهاء الكلام مقابل 0.49 ثانية لـ Grok Voice Transcribe 2.0. Muse Voice Transcribe هو نموذج إدراك صوتي في الوقت الفعلي بنته Meta Superintelligence Labs ليعمل داخل منتجات Meta نفسها، حيث يشكّل ربع الثانية الفرق بين مساعد يبدو حاضرًا وآخر يبدو بطيئًا. Grok Voice Transcribe 2.0 هو واجهة برمجة تطبيقات للنسخ صُمّمت ليستدعيها أي شخص، بسعر يجعل العمل بالدفعات مجديًا. كلا الرقمين مُبلَّغ عنهما من المورّد يوم الإطلاق، ولم يُدرج منذ ذلك الحين سوى أحد الرقمين بشكل مستقل على لوحة عامة.

ما تقوله لوحة المتصدرين فعليًا الآن

لوحة AA-WER Streaming هي مركّب مرجّح — AA-AgentTalk بنسبة 50%، وVoxPopuli بنسبة 25%، وEarnings22 بنسبة 25%، أي نحو ثماني ساعات من صوت إنجليزي معظمه على شكل محادثات وكلاء — ويُقاس كلا النموذجين عليها، وهو ما يجعل هذه مواجهة مباشرة نادرة تكون فيها الأرقام قابلة للمقارنة على الأقل. جنبًا إلى جنب، مع تضمين الأرقام المعلنة من المورّدين:

• دقة النص النهائي — Grok Voice Transcribe 2.0 عند 2.7% WER مقابل Muse Voice Transcribe عند 3.1%

• دقة أول تفريغ نصي جزئي — 3.4% مقابل 3.6%

• زمن الوصول إلى أول نتيجة جزئية — 0.49 ثانية مقابل 0.13 ثانية

• الزمن من نهاية الكلام إلى النص النهائي — 0.49 ثانية مقابل 0.16 ثانية

• معدل خطأ تمييز المتحدثين — مُدرَج، لم يُنشر رقم مقابل متوسط 17.5% في تقييم Meta

اقرأ صفوف الدقة وصفوف زمن الاستجابة كلًا على حدة، لأنهما يشيران في اتجاهين متعاكسين وكلاهما صحيح. من حيث الدقة، لا يفصل بين النموذجين سوى أربعة أعشار نقطة في النصوص النهائية، وعُشْرَي نقطة في النتائج الجزئية الأولى — وهي فجوة صغيرة بما يكفي لأن تنعكس مع الإصدار التالي من أي من الشركتين، وصغيرة بما يكفي بحيث لا ينبغي لأي شخص عاقل أن يختار بينهما بناءً عليها. أما من حيث زمن الاستجابة، فهما ليسا متقاربين. يُرجع نموذج Meta نتيجة جزئية في نحو ثُمن ثانية ويُنهيها في نحو سُدس ثانية، مقابل نحو نصف ثانية في كلا الاتجاهين لنموذج SpaceXAI.

هذه هي المقارنة كلها في سطر واحد: لقد استهلك Grok Voice Transcribe 2.0 زمن استجابة ليكسب دقة، بينما فعل Muse Voice Transcribe العكس. خفّض SpaceXAI معدل الخطأ في أول نتيجة جزئية من 18.3% في الإصدار 1.0 إلى 3.4% في 2.0، وكان ثمن ذلك الانتقال من 0.25 ثانية إلى 0.49 ثانية على المقياس نفسه. أما نموذج Meta فقد صُمم على النحو المعاكس، باستخدام مقاطع صوتية بمدة 80 مللي ثانية وتأخير تكيّفي مُتعلَّم عبر التعلم المعزز يقرر مقدار الانتظار قبل تثبيت النص — وهي آلية غايتها كلها الحفاظ على الدقة مع إبقاء التثبيت سريعاً. لا يُعد أي من الخيارين خطأً. إنهما إجابتان لسؤالين مختلفين.

أي سؤال تسأل؟

إذا كان النص المنسوخ يغذّي وكيلاً صوتياً يجب أن يرد ضمن وقفة حوارية، فإن 0.16 ثانية و0.49 ثانية منتجان مختلفان. يتحمّل تناوب الأدوار البشري فجوة من بضع مئات من المللي ثانية قبل أن يبدأ التفاعل في الظهور بمظهر خاطئ، وميزانية الكمون مشتركة — النسخ، ثم الاستدلال، ثم تركيب الكلام. النموذج الذي يعيد نصاً نهائياً في سُدس ثانية يترك مجالاً لبقية خط المعالجة؛ أما الذي يستغرق نصف ثانية فيستهلك معظم الميزانية قبل أن يفكر النموذج في أي شيء. هذا ما بنت Meta من أجله، ولهذا يعمل النموذج داخل Meta AI على Mac وداخل Muse Code بدلاً من تقديمه أساساً كنقطة نهاية لخطوط معالجة الآخرين.

إذا كان النص المفرغ مستندًا — تسجيل مكالمة، أو اجتماع، أو مكتبة فيديو، أو أرشيف امتثال — فإن نصف ثانية لا شيء، وفجوة الدقة لا تزال لا شيء، والرقم الوحيد الذي يهم هو تكلفة ساعة من الصوت. وهنا يتباعد هذان بشكل حاد، وفي اتجاه يفاجئ من ينظرون فقط إلى معدل البث.

نصف السعر في وضع الدفعات، وأغلى بعُشر في وضع البث.

تسرد Meta خدمة Muse Voice Transcribe بسعر 0.18 دولار لكل ساعة من الصوت، أو 3.00 دولارات لكل 1,000 دقيقة. وتُدرج Grok Voice Transcribe 2.0 بسعر 0.10 دولار لكل ساعة للدفعات و0.20 دولار لكل ساعة للبث. إذن:

• البث — Grok Voice Transcribe 2.0 بسعر $0.20 في الساعة مقابل Muse Voice Transcribe بسعر $0.18، لذا فإن Meta أرخص بنحو 10%

• دفعة أو مسجّل — 0.10 دولار في الساعة مقابل 0.18 دولار، لذا فإن SpaceXAI أرخص بنسبة 44%

• مُضمَّن بسعر القائمة — فصل المتحدثين، وطوابع زمنية للكلمات مع درجة ثقة، وترجيح المصطلحات المفتاحية، والتطبيع العكسي للنص على جانب SpaceXAI، مقابل النسخ المتدفق، وفصل المتحدثين، وكشف نقاط النهاية كنموذج واحد على جانب Meta

• خطة مجانية أو استضافة ذاتية — لا هذا ولا ذاك، في كلتا الحالتين

الفريق الذي يبثّ فقط ينبغي ألّا يفرّق بينهما من حيث السعر، وأن يختار بناءً على زمن الاستجابة، وهذا يعني Meta. أما الفريق الذي لديه أي حجم ملموس من الصوت المسجّل فينبغي أن ينظر إلى صف المعالجة الدُفعية، لأن 0.08 دولار في الساعة تتراكم: 5,000 ساعة شهرياً تبلغ 500 دولار على أحدهما و900 دولار على الآخر، والفرق في الدقة بينهما أصغر من هامش التقريب في أيّ من الرقمين.

وضع الترخيص متماثل من حيث يهم، ومختلف من حيث لا يهم. كلاهما أوزان مغلقة — فـ Muse Voice Transcribe احتكاري ولا يتاح إلا عبر واجهة برمجة التطبيقات المستضافة من Meta، أما Grok Voice Transcribe 2.0 فهو واجهة برمجة تطبيقات تجارية لا تتوفر للتنزيل. لا يُعد أي منهما خيارًا إذا كان متطلبك هو ألا يغادر الصوت أبدًا بنية تحتية تتحكم بها، وكلاهما يتركك معرّضًا لتغيير المورّد لسعره أو إصدار نموذجه أو جدول إيقافه من تحت قدميك. وهذا اعتبار حقيقي وليس افتراضيًا: فـ Grok Voice Transcribe 1.0 يسير بالفعل على مسار إيقاف بعد أقل من أسبوعين من إطلاق خليفته.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

فصل المتحدثين، وهي الميزة التي لا يقدّمها أيّ منهما في المقدمة

كلا النموذجين يقومان بإسناد المتحدث في تمريرة واحدة، وهو ما كان قبل عامين نظامًا منفصلًا يُضاف لاحقًا، والمقارنة هنا ملموسة على نحو غير معتاد لأن Meta نشرت رقمًا ولم ينشره SpaceXAI.

تُفيد Meta بمعدل خطأ متوسط في التقسيم الصوتي (diarization) يبلغ 17.5% خلال تقييمها، وتتعامل مع 20 متحدثًا أو أكثر دون معالجة لاحقة، وتتعامل معهم كجزء من نموذج البث بدلًا من خطوة لاحقة — يأتي «من قال ماذا» مع النص وليس بعده. هذا صعب حقًا في سياق البث، حيث لا يمكن تحديد دور المتحدث إلا بعد سماع ما يكفي منه، و17.5% رقم حقيقي مع تحفظ حقيقي: فهو رقم Meta الخاص، بمتوسط على مجموعة تقييم اختارتها Meta.

يتضمن نموذج SpaceXAI ميزة التمييز بين المتحدثين (diarization) دون أي تكلفة إضافية، ويدعم أيضًا ما يصل إلى ثماني قنوات صوتية مستقلة في طلب واحد، وهو أسلوب مختلف لحل المشكلة نفسها — فإذا وصل صوتك كقنوات منفصلة لكل مشارك، وهو ما تفعله غالبًا الاتصالات الهاتفية في مراكز الاتصال، فإن فصل القنوات أكثر موثوقية من التمييز بين المتحدثين ولا يحتاج إلى أي معدل خطأ على الإطلاق. أما إذا وصل صوتك كتدفق مختلط واحد، فأنت تعتمد على جودة التمييز بين المتحدثين، ولم يخبرك سوى واحد من هذين المورّدين بما هي.

هناك فرق من الدرجة الثانية يجدر ملاحظته: يتعامل Muse Voice Transcribe مع تمييز المتحدثين والنسخ وكشف نقاط النهاية كنموذج واحد ينتج مخرجًا واحدًا، ما يعني أن المكوّنات لا يمكن أن تفشل بشكل مستقل. أما Grok Voice Transcribe 2.0 فيتيح لك استخدام القنوات والمصطلحات المفتاحية وتمييز المتحدثين كروافع منفصلة. النموذج الواحد أبسط في التشغيل وأصعب في تصحيح الأخطاء.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

اللغات، وأين تتوقف بطاقتا النموذج عن كونهما قابلتين للمقارنة

درّبت Meta نموذج Muse Voice Transcribe على أكثر من 70 لغة، وتحققت من 25 منها على نحو موسّع عند الإطلاق، مع دعم أصلي للتبديل اللغوي داخل الجمل وبينها، ودعم للصوت الذي تتجاوز مدته ساعة. أما Grok Voice Transcribe 2.0 فيتعامل مع الكشف التلقائي عن اللغة مع التبديل أثناء التسجيل، ويطبّق التطبيع النصي العكسي — أي عرض التواريخ والعملات وأرقام الهواتف وعناوين البريد الإلكتروني المنطوقة في صيغتها المكتوبة — عبر 25 لغة.

التقاطع يتمثل في الـ25 لغةً المُتحقَّق منها على نطاق واسع من جهة، والـ25 لغةً الخاصة بالتطبيع من جهة أخرى؛ والمجموعتان ليستا المجموعة نفسها المكوّنة من 25 لغة، ولم ينشر أيٌّ من المورّدين القائمة. إنّ «أكثر من 70 لغة مدرّبة» و«25 لغة مع دعم التنسيق» ليستا ادعاءين قابلين للمقارنة، ولا ينبغي طرح أحدهما من الآخَر. ما يمكن قوله هو إنّ Meta تقدّم ادعاءً أوسع متعدد اللغات، بينما تقدّم SpaceXAI ادعاءً أضيق لكنه أكثر تشغيلية: اكتشاف اللغة شرط أساسي لا غنى عنه، أما تنسيق ما سمعه النموذج إلى صيغة يستطيع نظام لاحق تحليلها فهو الجزء الذي يؤدي غيابه إلى تعطّل عمليات التكامل.

الخيار، والسبب في أنه قد لا يكون لك اتخاذه

جرّد الأمر من التسويق، وسيختزل القرار إلى ثلاث جمل. اختر Muse Voice Transcribe إذا كان النص المنسوخ يُستهلك مباشرةً داخل محادثة، لأن 0.16 ثانية ليست تفصيلًا. اختر Grok Voice Transcribe 2.0 إذا كان لديك صوت مسجّل بكميات كبيرة، لأن نصف سعر المعالجة المجمّعة ليس تفصيلًا أيضًا. وإذا لم تكن بحاجة إلى أي من الطرفين المتطرفين، فاختر بناءً على أي شيء آخر يقيّدك — المنطقة، أو العقد، أو التكامل القائم — لأن اختلاف الدقة لن يحسم الأمر.

التعقيد هو أن أحد هذين النموذجين ليس معروضًا للبيع بالمعنى المعتاد. يوجد Muse Voice Transcribe لجعل مساعد Meta الخاص يبدو سريعًا، وهو متاح عبر Meta Model API إلى حد كبير لأن Meta قررت أن قيمة الظهور في النظام البيئي تتجاوز قيمة الحصرية. قد يتغير ذلك، وقد يتغير بسرعة: أمضت Meta الأسبوع نفسه في فتح منصة موصلات Muse أمام مطوري الطرف الثالث، وهي شركة تستثمر في قناة توزيعها الخاصة بدلًا من أن تكون موردًا محايدًا للجميع. بناء اعتماد إنتاجي على نموذج داخلي لمنافس هو رهان على أن الشروط لن تتغير، وهذا الرهان له سجل تاريخي سيئ.

هذا التفاوت هو الحجة ضد تثبيت أيٍّ منهما في الكود. يتيح OrcaRouter أكثر من 200 نموذج عبر مفتاح واحد متوافق مع OpenAI، مع تحويل تلقائي عند الفشل بين المزوّدين وهامش ربح 0% على سعر القائمة لدى المزوّد — لذا عندما يغيّر SpaceXAI الإعداد الافتراضي إلى 2.0 ويلغي دعم 1.0، أو عندما تعيد Meta تموضع واجهة برمجة التطبيقات الصوتية الخاصة بها، يكون التغيير مجرّد سلسلة نصية لنموذج بدلاً من مشروع ترحيل. وفي فئة تغيّر فيها المتصدر مرتين خلال ثلاثة أسابيع، فإن طبقة التوجيه هي الجزء الذي ينبغي أن يكون مستقرًا في المنظومة، والنموذج هو الجزء الذي ينبغي ألا يكون كذلك.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

شيء واحد يستحق المراقبة خلال الشهر المقبل: ما إذا كانت Artificial Analysis تعيد قياس Muse Voice Transcribe على لوحة التدفق، الآن بعد أن حلّ Grok Voice Transcribe 2.0 محلها. أُبلغ عن نسبة Meta البالغة 3.1% ونسبة SpaceXAI البالغة 2.7% عند الإطلاق، لكن نسبة SpaceXAI فقط أُدرجت بشكل مستقل. إذا صمد رقم Meta عند إعادة القياس، فإن فجوة الدقة صغيرة كما تبدو، وفجوة زمن الاستجابة هي التي تحسم كل شيء. وإذا لم يصمد، فإن الهيمنة التي استمرت سبعة عشر يومًا كانت القصة بأكملها.