بطاقة المقال الرئيسية التي تحمل 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B' مع شارة 'مقارنة النماذج' والعنوان الفرعي 'الرقم الذي لم تنشره Microsoft'، مع شرائح تعرض 2.7% WER للبث، و0.49 ثانية لأول نتيجة جزئية، ومقاطع 2.9 ثانية مع إسناد المتحدث، وأوزان MIT عند 18 GB، فوق تدرج من الأبيض إلى الأزرق مع شعار OrcaRouter في أسفل اليمين.
Guides & Insights

Grok Voice Transcribe 2.0 مقابل VibeVoice ASR Streaming 7B: الرقم الذي لم تنشره مايكروسوفت

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

VibeVoice ASR Streaming 7B هو مُعرّف الكلام المتدفق الموحّد من Microsoft، تم رفعه إلى Hugging Face في 2 سبتمبر 2026 وأُعلن عنه في مستودع microsoft/VibeVoice بعد يوم واحد بموجب ترخيص MIT، وهو يفعل شيئًا لا يفعله Grok Voice Transcribe 2.0 ولا معظم منافسيه: فهو يصدر نصًا منسوبًا إلى المتحدث أثناء وصول الصوت، دون مرحلة فصل المتحدثين منفصلة. يقول التقرير الفني لـ Microsoft إن نقطة التفتيش 7B تحقق أدنى متوسط WER و CER عبر خمس مجموعات تقييم وأفضل أو أفضل-متعادل إسناد للمتحدث في 12 من 13 إعداد تقييم. ما لا تفعله بطاقة النموذج هو نشر رقم واحد في النص — لا WER، ولا RTF، ولا رقم زمن استجابة؛ النتائج موجودة فقط كصور في التقرير. Grok Voice Transcribe 2.0، الذي شُحن بعد ستة عشر يومًا في 18 سبتمبر 2026 بسعر 0.10 دولار لكل ساعة صوتية للدفعات و0.20 دولار لكل ساعة للبث، ينشر كل شيء: 2.7% WER للنص النهائي و3.4% WER لأول جزء على لوحة البث التابعة لـ Artificial Analysis، 0.49 ثانية لكل منهما. لذا فإن نقطة البداية الصادقة لهذه المقارنة هي أن أحد النموذجين موثّق بشكل أفضل بشكل قابل للقياس من الآخر، وهذا التفاوت نفسه هو أكثر حقيقة وثيقة الصلة بالقرار في هذه المواجهة.

ما الذي نشرته Microsoft، وما يمكن للقارئ أن يفعله به

تقرير VibeVoice هو بحث حقيقي، والادعاءات الواردة فيه محددة في شكلها، إن لم تكن في قيمتها. قيّم أربعة معايير للاجتماعات — AliMeeting وAISHELL-4 وAMI-SDM وAMI-IHM — إضافة إلى MLC-Challenge، عبر تسع لغات، ويقدّم نتيجتين رئيسيتين: النموذج 7B كان الأدنى في متوسط WER/CER عبر المجموعات الخمس، والأفضل أو المتعادل في أفضل إسناد للمتحدثين في 12 من 13 إعداد تقييم. كلاهما ادعاءان نسبيان، وهما نوع ذو مغزى من الادعاءات: "الأدنى عبر هذه المجموعات الخمس" عبارة عن ترتيب، والترتيب هو ما يحتاجه المشتري.

كل الأرقام المطلقة غائبة. لا توجد نسبة WER لمقارنتها بأي شيء، ولا رقم إنتاجية، ولا قياس زمن استجابة، ولا تفصيل لكل مجموعة في النص. أي جدول مقارنة يضع VibeVoice بجانب Grok Voice Transcribe 2.0 ويُسند إلى نموذج Microsoft رقمًا فإنه يختلق ذلك الرقم. وما يمكن قوله هو أن VibeVoice فاز بتقييمه الخاص المكوّن من خمس مجموعات، وأنه لم يُعِد أحد من خارج Microsoft تشغيله — فلا معيار مرجعي مستقل، ولا تقييم من طرف ثالث، وفي وقت كتابة هذا النص لا يوجد أي مزوّد استدلال مستضاف يُدرج النموذج على الإطلاق. وعليه، فالمقارنة تقع بين رقم موثّق وترتيب غير موثّق، والترتيب غير الموثّق ليس أضعف الاثنين لمجرد أنه يفتقر إلى فاصلة عشرية.

توثيق Grok Voice Transcribe 2.0 يعاني المشكلة المعاكسة. تأتي نسبتاه 2.7% و3.4% من لوحة AA-WER Streaming التابعة لـ Artificial Analysis، وهي مركّب مرجّح من AA-AgentTalk بنسبة 50% مع VoxPopuli وEarnings22 بنسبة 25% لكل منهما — نحو ثماني ساعات من صوت محادثات إنجليزية بنمط الوكلاء، تُدار بشكل مستقل، وهو مصدر أقوى بحق من تقييم المورّد نفسه. لكنه شريحة ضيقة واحدة من الإنجليزية، وصفحة اللوحة نفسها تعرض 27 من النماذج الـ33 التي تُحصيها SpaceXAI عندما تدّعي أنها الأولى من بين 32. الرقم الدقيق في اختبار ضيّق والادّعاء غير الدقيق في اختبار أوسع ليسا قابلين للمقارنة المباشرة، وهذه المقالة لن تتظاهر بغير ذلك.

ثانيتان ونصف مقابل نصف ثانية

مقارنة زمن الوصول هي الموضع الوحيد الذي يمكن فيه وضع النموذجين جنبًا إلى جنب دون أي تحفّظ بشأن مجموعات البيانات، لأن كليهما ينشر إعدادات البثّ الخاصة به — والاختلاف معماريّ لا يتعلق بخيار ضبط.

يعمل VibeVoice ASR Streaming 7B على شكل مقاطع. تستخدم نقاط التحقق الصادرة عنه 22 إطارًا كامنًا لكل مقطع، وهو ما يعادل عند معدل النموذج البالغ 7.5 إطارات كامنة في الثانية نحو 2.9 ثانية من الصوت لكل مقطع، مع استباق مقداره أربعة إطارات كامنة — أي نحو 0.5 ثانية من الصوت المستقبلي — وزمن تأخير متوقع لإسناد المتحدث يبلغ نحو 2.00 ثانية. يُصدر نصًا مرة واحدة لكل مقطع. هذا نظام بث حقيقي، لكن وتيرته تُقاس بالثواني، لا بالملي ثانية.

يُرجع Grok Voice Transcribe 2.0 أول نص جزئي له بعد 0.49 ثانية من توقف المتحدث، ويضع النص النهائي بعد 0.49 ثانية من انتهاء الكلام. لقد حقق تلك السرعة بالدقة — إذ انخفض معدل خطأ النص الجزئي الأول من 18.3% في الإصدار 1.0 إلى 3.4% في الإصدار 2.0، على حساب الانتقال من 0.25 ثانية إلى 0.49 ثانية في المقياس نفسه.

ضع بجانب بعضهما البعض:

• وتيرة البث المتدفق — يُصدر Grok Voice Transcribe 2.0 نتائج جزئية باستمرار بزمن استجابة لأول نتيجة جزئية يبلغ 0.49 ثانية، مقابل VibeVoice ASR Streaming 7B الذي يُصدر كتلة نصية واحدة كل 2.9 ثانية تقريبًا

• زمن استجابة إسناد المتحدث — مُضمَّن ضمن المسار نفسه البالغ 0.49 ثانية مقابل نحو 2.00 ثانية بحكم التصميم

• الاستباق — غير منشور مقابل أربع إطارات كامنة، حوالي 0.5 ثانية من الصوت المستقبلي

• الأثر العملي — يمكن لوكيل صوتي أن يتصرف بناءً على جملة لا تزال قيد النطق، مقابل نظام يستقبل فقرة موسومة بالمتحدث كل ثلاث ثوانٍ

لا يُعدّ أيٌّ من هذين خطأً. إنّ مقطعًا مدته 2.9 ثانية تصميم معقول تمامًا لتفريغ الاجتماعات، حيث يكون الناتج مستندًا وتكمن القيمة في أن المستند يصل أثناء الاجتماع لا بعده. لكنه التصميم الخاطئ لوكيل محادثة، حيث لا يكون صمت مدته ثلاث ثوانٍ وقفةً، بل فشلًا. والفارق بين الإيقاعين نحو ستة أضعاف، وهو يطابق تقريبًا على نحو شبه تام الفرق بين تفريغ محادثة والمشاركة فيها.

Screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B, showing the MIT licence tag, the 10 languages and Streaming tags, the model card opening line 'a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the 9B parameter and BF16 tensor type fields, a notice that no inference provider deploys it, and the architecture diagram showing 2.9 second chunks with 0.5 second lookahead.

إسناد المتحدث كمخرج، وليس كمرحلة في خط المعالجة

هنا يتفوق نموذج مايكروسوفت حقًا، ويستحق التصميم أن يُفهَم لأنه السبب في أن التقسيم إلى أجزاء خشن.

يستخدم VibeVoice مُرمِّزَي رموز مُسبقَي التدريب — أحدهما مُرمِّز صوتي والآخر دلالي — يعملان بتردد 24 كيلوهرتز مع تخفيض بمقدار 3,200× لإنتاج 7.5 إطارًا كامنًا في الثانية، إطار واحد كل 133 مللي ثانية. تُدخَل هذه الإطارات إلى بنية أساسية لنموذج لغة Qwen2.5، ويتداخل الكلام الوارد والنص المولّد في تسلسل واحد، مع الاحتفاظ بالكلام والنص الملاحظين سابقًا في سياق النموذج. والنتيجة أن هوية المتحدث ليست أبدًا مشكلة منفصلة: فالنموذج لا ينسخ ثم يقرر من تحدث، بل يولّد نصًا مشروطًا بتاريخ صوتي لا يزال يحتوي على الأصوات. ولهذا لا توجد مرحلة فصل متحدثين تحتاج إلى مواءمة، ولماذا يكون ادعاء Microsoft حول إسناد المتحدث عبر 12 من 13 إعدادًا موثوقًا معماريًا بدلًا من كونه نتيجة مُلحَقة.

تكلفة هذا التصميم هي الاحتفاظ بالسجل التاريخي الذي ينمو خطيًا مع طول التسجيل، ولهذا تستهدف نقاط التحقق الصادرة تسجيلات تصل مدتها إلى ثماني دقائق. هذا سقف حقيقي ويُذكر بوضوح. وهو يستبعد النموذج من العمل الطويل — مكالمة أرباح مدتها ساعتان، أو يوم كامل من صوت مركز الاتصال — إلا إذا بنيت التقسيم وإعادة التهيئة بنفسك، مما يعيد بالضبط التعقيد الذي صُممت البنية لإزالته.

يعالج Grok Voice Transcribe 2.0 المشكلة نفسها بطريقة مختلفة وبمجموعة مختلفة من القيود. فهو يتضمن فصل المتحدثين دون تكلفة إضافية، ويدعم ما يصل إلى ثماني قنوات صوتية مستقلة في طلب واحد. بالنسبة للاتصالات الهاتفية في مراكز الاتصال، حيث يصل كل مشارك غالبًا عبر قناته الخاصة، يكون فصل القنوات أكثر موثوقية من فصل المتحدثين ولا يرتبط به معدل خطأ. أما بالنسبة للصوت المختلط، فإن الأمر يعتمد على جودة فصل المتحدثين، وعلى عكس Muse Voice Transcribe من Meta — الذي نشر متوسط معدل خطأ في فصل المتحدثين قدره 17.5% — لم تنشر SpaceXAI أي رقم لفصل المتحدثين على الإطلاق. لذا يترك كلا النموذجين فجوة في أدلة فصل المتحدثين: أحدهما ينشر تصنيفًا دون قيمة، والآخر ينشر قائمة ميزات دون قياس.

ثمانية عشر غيغابايت، عشر لغات، MIT

تتباين حقائق النشر تباينًا كاملًا لدرجة أنها تكاد لا تُعد مقارنة. يبلغ حجم أوزان VibeVoice ASR Streaming 7B بنسخة bf16 نحو 18 غيغابايت — إذ تُدرج بطاقة Hugging Face إجمالي 9B معاملًا لنقطة التحقق المسماة 7B، مع طراز شقيق بحجم 1.5B بنحو 5.6 غيغابايت — بترخيص MIT، مع عروض Python التوضيحية وإضافة vLLM للخدمة. عشر لغات: الصينية والإنجليزية والفرنسية والألمانية والإيطالية واليابانية والكورية والبرتغالية والروسية والإسبانية. وتضع Microsoft هذا الطراز في إطار البحث والتطوير.

Grok Voice Transcribe 2.0 هو نقطة نهاية مُدارة لا توجد أوزان لتنزيلها، و12 صيغة إدخال من صوت هاتفي بتردد 8 كيلوهرتز إلى 48 كيلوهرتز، وحتى ثماني قنوات، و100 مصطلح رئيسي لكل طلب، واكتشاف تلقائي للغة مع التبديل أثناء التسجيل، وتطبيع عكسي للنص عبر 25 لغة، وملفات حتى 500 ميغابايت، وحدود خدمة تبلغ 10 طلبات في الثانية و100 جلسة بث متزامنة لكل فريق. يعمل في us-east-1 وفي us-east-1 فقط.

• الأوزان — MIT، 18 GB، لك لتشغيلها في أي مكان مقابل لا شيء، مستضافة لدى المورّد فقط

• اللغات — 10 لغات مُسمّاة مقابل الكشف التلقائي مع دعم التنسيق عبر 25

• ترجيح المصطلحات الرئيسية — مدعوم عبر hotwords مقابل ما يصل إلى 100 مصطلح رئيسي لكل طلب

• مدة التسجيل — حوالي ثماني دقائق لكل نقطة تحقق قبل أن يصبح الاحتفاظ بالمحفوظات هو القيد، مقابل عدم وجود سقف معلن، وملفات تصل إلى 500 ميجابايت

• التحكم في المنطقة — أيًّا كانت المنطقة التي تنشر عليها مقابل us-east-1

• التكلفة — لا رسوم ترخيص، بالإضافة إلى 18 GB من ذاكرة GPU ومكدّس خدمة، مقابل 0.10 دولار لكل ساعة معالجة دفعية و0.20 دولار لكل ساعة بث.

نموذج بحجم 18 غيغابايت ليس شيئًا تشغّله على حاسوب محمول، كما أن إضافة vLLM تعني الحاجة إلى وحدة معالجة رسومات بذاكرة حقيقية. وفي مقابل ذلك، فإن رخصة MIT على نموذج بهذا الحجم أمر غير معتاد وقيّم: فهو الوحيد من بين الاثنين الذي يمكنك تشغيله داخل شبكتك الخاصة دون أي علاقة مع مورّد على الإطلاق، وهذا بالنسبة للصوت الخاضع للتنظيم ليس تفضيلًا بل متطلبًا. أما البديل المُدار فرخيص بالساعة ويستحيل نشره محليًا.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, cadence continuous partials, diarization included with no figure published, $0.10 per batch hour, managed in us-east-1. The right column gives VibeVoice ASR Streaming 7B the rows: WER lowest of five sets but unpublished, speaker attribution about 2.00s, cadence 2.9 second chunks, diarization built into streaming, MIT weights at about 18 GB, recordings up to 8 minutes. A footer reads 'VibeVoice figures Microsoft-reported with no absolute values published; Grok figures per Artificial Analysis.'

أين ينتمي قرار التوجيه

التكلفة هي النقطة التي يصبح عندها النموذجان أخيرًا قابلين للمقارنة بطريقة تُنتج رقمًا. يكلّف مسار المعالجة بالدفعات في Grok Voice Transcribe 2.0 حوالي $0.10 لكل ساعة صوت، أي نحو $1.67 لكل 1,000 دقيقة، بينما يكلّف مسار البث فيه $0.20، أي نحو $3.33. لا توجد لدى VibeVoice ASR Streaming 7B أي تكلفة ترخيص على الإطلاق؛ وما لديه بدلًا من ذلك هو نحو 18 GB من ذاكرة GPU المقيمة وحزمة خدمة vLLM تشغّلها بنفسك. نموذج من فئة 7B بهذا الحجم لن يكون رخيصًا لكل ساعة صوت على عتاد مستأجر، ومنحنى الاستخدام لا يرحم — إذ تكلّف وحدة GPU المُبقاة دافئة لذروة الحركة الشيء نفسه سواء كانت تحوّل الكلام إلى نص أو خاملة.

هذا هو الشكل المعتاد لحجة البناء مقابل الشراء، وهي تُحسم بشكل مختلف حسب الحجم وما إذا كان مسموحًا للصوت بمغادرة شبكتك. ما تغيّر في الشهر الماضي هو مدى سرعة تحرّك الإجابة: تغيّر المتصدر في دقة البث مرتين خلال ثلاثة أسابيع، ونموذج صدر في أوائل سبتمبر أُزيح عنه بحلول منتصف سبتمبر. وأي بنية تجعل تغيير اختيار النموذج مكلفًا في حال الرغبة في التراجع عنه هي الآن البنية الخاطئة لهذه الفئة.

أوركا راوتر هو المكان الذي يصبح فيه هذا الانقلاب غير مكلف. مفتاح واحد متوافق مع OpenAI يغطي أكثر من 200 نموذج مع تحويل تلقائي عند الفشل بين المزوّدين، بحيث لا يكون تعطّل نقطة نهاية مُدارة في منطقة واحدة سوى حدث توجيه لا انقطاع في الخدمة، كما يمرّر سعر القائمة من المزوّد بهامش ربح 0% — ما يعني أن أي تغيير في سعر مورّد أو نقطة تحقق جديدة يصبح فعّالاً لدينا في اليوم نفسه. وبالنسبة لفريق يريد اختبار VibeVoice مقابل Grok Voice Transcribe 2.0 على الصوت الخاص به، أو يريد الإبقاء على خيار احتياطي مُستضاف ذاتياً خلف الواجهة نفسها التي تستخدمها نقطة النهاية الأساسية المُدارة، فإن موقع الاستدعاء يتوقف عن كونه الشيء الذي يجب تغييره.

Screenshot of the microsoft/VibeVoice GitHub repository showing the description 'Open-Source Frontier Voice AI' and the MIT licence in the About sidebar, the file listing with demo and vibevoice directories both updated with streaming ASR inference code and a vllm_plugin directory, the repository's 53.6 thousand stars, and a GitHub Trending badge reading number 1 Repository Of The Day.

الحكم الصادق: VibeVoice ASR Streaming 7B هو النموذج الأكثر إثارة للاهتمام، وGrok Voice Transcribe 2.0 هو المنتج الأكثر قابلية للاستخدام، والفجوة بين هذين القولين يفسرها بالكامل أن أحد البائعين ينشر مخططات والآخر ينشر أرقامًا. إذا كان متطلبك هو تفريغ نصي منسوب إلى المتحدثين، يعمل محليًا، لاجتماعات تقل مدتها عن ثماني دقائق، فإن نقطة التحقق من Microsoft هي الوحيدة بين الاثنين التي تستوفي الشرط. وإذا كان متطلبك وكيلًا صوتيًا يجيب خلال وقفة محادثة، فإن إيقاع المقاطع البالغ 2.9 ثانية يستبعده قبل أن تُناقش الدقة. وإذا كنت تنتظر المقارنة التي ستحسم الأمر — الصوت نفسه عبر كلا النموذجين، مقيَّمًا من شخص لا يعمل لدى أي من الشركتين — فإن ذلك القياس غير موجود بعد، وهو أمر يستحق التذكر في المرة القادمة التي يضع فيها جدول رقمًا بجوار اسم VibeVoice.