
VibeVoice-ASR-Streaming-7B مقابل Whisper Large v3 Turbo: ما الذي يضيفه نقطة تفتيش البث من Microsoft إلى الافتراضي مفتوح الوزن؟
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
على مدى معظم السنتين الماضيتين، كان الجواب عن "نسخه بأنفسنا وبتكلفة زهيدة" هو Whisper Large v3 Turbo — نموذج OpenAI مفتوح الأوزان الذي يضم 809 ملايين معامل، ومرخّص بموجب MIT، ويدعم 99 لغة، وصغير بما يكفي ليعمل على محطة عمل، ومجاني بمجرد امتلاكك للعتاد. وفي 2 سبتمبر 2026، رفعت Microsoft Research منافسًا لهذا الخيار الافتراضي: VibeVoice-ASR-Streaming-7B، وهو نقطة تفتيش بثّية مرخّصة بموجب MIT على Hugging Face، ينسخ الصوت فور وصوله، ويدّعي مخرجات تُنسب إلى المتحدثين، وعلى عكس النموذج الذي تشغّله معظم الفرق بالفعل، لم يُصمم قط كوظيفة معالجة مجمّعة. كلا النموذجين مفتوح الأوزان من مختبرات كبرى. وكل شيء آخر تقريبًا فيهما هو مقايضة، وهذه الصفحة تتحدث عن المقايضة التي تقوم بها فعليًا.
هناك عدمُ تماثلٍ واحد يشكّل المقارنة بأكملها، لذا فهو يأتي أولًا. إن Whisper Large v3 Turbo هو نموذج الكلام الأكثر استنساخًا بشكل مستقل في العالم: فقد أُعيد حساب أرقام أخطاء الكلمات الخاصة به من قِبل آلاف الفرق على معايير عامة وعلى صوتياتهم الخاصة لسنوات، ونقاط ضعفه موثقة مثل نقاط قوته تمامًا. أما VibeVoice-ASR-Streaming-7B فلم يمضِ على إطلاقه سوى يوم، ولا يوجد له أي معيار مستقل في أي مكان، ولم تنشر Microsoft معدل خطأ كلمات للبث المباشر في نص قابل للقراءة. وكل ما يخص جانب Microsoft أدناه مقروء من المستودع — الإعدادات، وبطاقة النموذج، ووثائق البث المباشر من Microsoft — وموسوم على هذا النحو.
الأوزان المفتوحة كخيار افتراضي، ولماذا يدوم
Whisper Large v3 Turbo هو النسخة المقطّرة الشقيقة لـ Whisper Large v3: فهو يحتفظ بالمشفّر ذي 32 طبقة ويخفض عدد طبقات وحدة فك التشفير من 32 إلى أربع، وهذا ما يجعل عدد المعاملات ينخفض إلى 809 ملايين ويجعل الإنتاجية تتضاعف تقريبًا أربع مرات على وحدة معالجة الرسوميات (GPU) مع بقاء الدقة قريبة من الأصل. ونظرًا لأن الأوزان مرخّصة برخصة MIT ولأن النموذج صغير، فقد أصبح محرك النسخ المدمج الافتراضي لروبوتات الاجتماعات وأدوات الترجمة النصية وخطوط معالجة سجلات المكالمات. حدوده معروفة جيدًا أيضًا. إنه نموذج معالجة دفعات (batch) — فهو يأخذ ملفًا صوتيًا ويعيد نصًا مكتوبًا، بدلًا من إنتاج الكلمات أثناء نطقها. لم يُدرَّب على الترجمة، وهذه المهمة تتدهور بشكل كبير. دقته على الكلام المزعج أو الملتبس أو المتداخل متفاوتة، ويعيد نصًا بسيطًا: لا علامات ترقيم أو أحرف كبيرة بشكل افتراضي، ولا فصل للمتحدثين، ولا طوابع زمنية في هذا الإصدار، ولا ترجيح للكلمات المفتاحية. الأنظمة الإنتاجية المبنية على Whisper تُجمّع تلك المكونات بشكل منفصل، كل منها يضيف زمن استجابة وأنماط فشل خاصة به.

فجوة المواصفات
• المعلمات — 809M (وحدة فك ترميز مقطّرة) مقابل حوالي 9B إجمالاً (نواة لغة Qwen2-7B بالإضافة إلى مُرمِّزات الكلام؛ "7B" تُشير إلى نموذج اللغة الكبير، بينما تعرض صفحة Hugging Face الرقم 9B).
• الترخيص — MIT، أوزان مفتوحة، كلاهما.
• البث — دفعي بالتصميم: عادةً ما تحقق تطبيقات البث ذاتية الاستضافة زمن استجابة يتراوح بين 1–5 ثوانٍ مقابل البث الأصلي: أجزاء تبلغ ~2.9 ثانية مع نظرة استباقية ~0.5 ثانية، يُصدَر النص لكل جزء، ويُحتفَظ بالسياق في ذاكرة تخزين مؤقتة من نوع KV.
• اللغات — 99 مع سنوات من إعادة الإنتاج المجتمعي مقابل 10 معلنة (en, zh, es, pt, de, ja, ko, fr, ru, it).
• ما وراء النص الحرفي — لا شيء افتراضيًا مقابل مخرجات البث المباشر المزعومة لتحديد “من قال ماذا” وكلمات مخصصة للتنبيه (غير مؤكدة).
• الدقة المنشورة — {{1}}معدل خطأ الكلمات 2.1% على LibriSpeech test-clean، و4.2% على test-other، ونحو 7.7% على مركّب Open ASR، و8–12% على الصوت المزعج في الاختبارات المجتمعية، وكلها أُعيد إنتاجها بشكل مستقل{{/1}} مقابل {{2}}عدم نشر أي رقم معدل خطأ كلمات للبث المباشر كنص{{/2}}.
• الموارد المطلوبة — يعمل على حاسوب محمول أو GPU واحدة متواضعة، مقابل نحو 18 جيجابايت من أوزان bf16 قبل ذاكرة التخزين المؤقت KV؛ خصّص GPU من فئة 24 جيجابايت.

ما الذي يضيفه البث فعليًا
السبب وراء التفكير في تجاوز Whisper Large v3 Turbo أصلًا هو المسار المباشر؛ وهنا يتوقف التشابه بين النموذجين. فنموذج Whisper موجّه نحو المعالجة بالدُفعات: لكي تحصل على الكلمات بينما المتحدث لا يزال يتكلم، تلجأ الفرق إلى إضافة تقسيم الصوت إلى مقاطع (chunking)، وكشف نشاط الصوت (VAD)، وكود لصق (glue code)، وتستقر تطبيقات البث ذاتية الاستضافة عادةً عند زمن استجابة من ثانية إلى خمس ثوانٍ، مما يعني الإخفاق في بلوغ عتبة ما دون الثانية التي يتطلبها وكلاء الهاتف والترجمة النصية الفورية ما لم تُبذل هندسة دقيقة. أما VibeVoice-ASR-Streaming-7B فهو مصمَّم لهذا المسار بالذات؛ إذ تُظهر إعداداته أن الصوت يُضغط 3,200× ليصبح تدفقًا من الرموز بمعدل 7.5 إطارًا في الثانية، ويُعالَج في مقاطع من 22 إطارًا مع نظرة استشرافية لأربعة إطارات — أي نحو 2.9 ثانية من الصوت لكل مقطع — ويُخرَج النص كلما اكتمل مقطع، مع حمل السياقات السابقة في ذاكرة التخزين المؤقت (KV cache)، فلا تُعيد الجلسة الحساب من الصفر. هذه الوتيرة تصميم مستمد من الإعدادات، لا زمن استجابة مُقاس؛ ولم ينشر أحدٌ بعدُ رقمًا لزمن الاستجابة من الطرف إلى الطرف. غير أن البنية، بلا التباس، بنية معمارية للنسخ المباشر على نحوٍ لا ينطبق على Whisper.
سجلُّ Whisper طويل وعلني؛ بينما سجلُّ checkpoint الجديد فارغ
في ما يخص الدقة، يُعَدّ عمر نموذج Whisper Large v3 Turbo ميزةً. معدل خطأ الكلمات (WER) البالغ 2.1% على LibriSpeech test-clean و4.2% على test-other هو أرقام بأوزان مفتوحة أعاد إنتاجها عدد لا يُحصى من الفرق؛ ونتيجته البالغة نحو 7.7% على المؤشر المركّب للوحة Open ASR تجعله متخلفًا بنقطة واحدة تقريبًا عن النسخة الكاملة Large v3؛ ومعدّله الموثّق من 8% إلى 12% على الصوت المزعج في اختبارات المجتمع يعني أن لا أحد يفاجأ به. هذه نقاط الضعف جزءٌ من السجل — فهي تخبرك بالضبط أين يحتاج النموذج إلى المساعدة قبل أن تبني عليه.
لا يمتلك VibeVoice-ASR-Streaming-7B أيًا من هذا السجل. بطاقة نموذجه تعرض رقم التقييم على هيئة صورة، والتقرير الفني لنظام البث من Microsoft هو ملف PDF، لكن لا يوجد أي معدل خطأ كلمات قابل للاقتباس ضمن نص مكتوب. المرساة الرقمية الوحيدة في العائلة هي الجدول المُبلَّغ عنه من جهة البائع في بطاقة نموذج VibeVoice-ASR للدفعات — متوسط WER بنسبة 7.77% عبر ثماني مجموعات اختبار إنجليزية و2.20% على LibriSpeech clean — وهو ليس رقم هذا checkpoint، كما أن استقبال المجتمع للنموذج الدفعي نفسه كان متباينًا: حظي بالثناء لتقديمه التمييز الصوتي (diarization) الجاهز، لكنه تعرض لانتقادات لكونه ثقيلًا وعرضة للهلوسة أحيانًا. لا شيء من ذلك يُنقل إلى نموذج البث، وهذه هي النقطة تمامًا: مع Whisper تعرف أوضاع الفشل مسبقًا؛ مع VibeVoice-ASR-Streaming-7B أنت المُختبِر الأول.
اللغات والحجم: 99 مقابل 10، و0.8 مليار مقابل 9 مليارات
التكلفتان الأكثر واقعية للتبديل هما اللغات والحجم. Whisper Large v3 Turbo ينسخ 99 لغة؛ اللغات منخفضة الموارد واللغات النغمية تتردى جودتها — التايلندية والكانتونية والويلزية هي نقاط الضعف الأكثر شيوعًا — لكن هذه القائمة مدعومة بسنوات من إعادة الإنتاج المجتمعي. VibeVoice-ASR-Streaming-7B يصرح بعشر لغات: الإنجليزية، الصينية، الإسبانية، البرتغالية، الألمانية، اليابانية، الكورية، الفرنسية، الروسية، والإيطالية. إذا كانت حركة مرورك ضمن هذه العشر، فالتغطية ليست مشكلة؛ وإذا لم تكن كذلك، تنتهي المقارنة هنا. الحجم هو التكلفة الثانية: 809M معاملًا يعمل على حاسوب محمول، بينما حوالي 9B معاملًا إجماليًا بصيغة bf16 يعني نحو 18 جيجابايت من الأوزان قبل KV cache وGPU من فئة 24 جيجابايت لتشغيله بشكل مريح. بالنسبة للفرق التي تشغل Whisper بالفعل على أجهزة متواضعة، فهذه قفزة حقيقية في البنية التحتية، لا تبررها سوى حاجة فعلية للنسخ الفوري المباشر.
عندما لا يكون المجاني هو الهدف
إن تشغيل Whisper Large v3 Turbo مجاني؛ أما التكلفة فتتمثل في العتاد والهندسة البرمجية المحيطة به. فنشر faster-whisper على بطاقة T4 واحدة يكلف نحو 0.05–0.10 دولار لكل ساعة صوت وفق السعر السائد لبطاقات GPU، كما أن عبء العمل المستمر يضيف الحاجة إلى بناء مجموعة أدوات تمييز المتحدثين وعلامات الترقيم، لأن Whisper يُرجع نصًا عاديًا. كذلك، فإن VibeVoice-ASR-Streaming-7B مجاني التشغيل، لكنه يتطلب عتادًا أكثر كلفة، مقابل بنية بث (streaming) تدّعي توفير إسناد الكلام إلى المتحدثين والتحكم في السياق، وهما ما يفتقر إليهما Whisper — وهي ادعاءات ستتأكد منها بنفسك، إذ لا يوجد اختبار معياري مستقل. أما في النسخ الدفعي (batch) بكميات كبيرة، فما تزال إنتاجية Whisper وبصمته الصغيرة تتفوقان. وفي الصوت المباشر متعدد المتحدثين، حيث يجب أن يصل النص المفرَّغ أثناء المحادثة نفسها، فإن Whisper يعمل ضد تصميمه بينما يعمل checkpoint البث معه — إن صحّ عمله أصلًا، وهذا هو السؤال الذي ينبغي أن تجيب عنه بصوتك أنت على بطاقة GPU الخاصة بك.

المكدس البراغماتي
الإجابة الأكثر شيوعًا في التطبيق العملي الواقعي ليست "إما/أو" بل "كلاهما"، وهذا هو التوصية هنا: أبقِ Whisper Large v3 Turbo بوصفه مسار المعالجة المجمّعة عالية الحجم حيث يجعل سجلّه وبصمته من الموارد منافسًا لا يُقهَر، وقيّم VibeVoice-ASR-Streaming-7B على المسار المباشر الذي لا يستطيع Whisper تقديم الخدمة فيه بزمن الاستجابة المطلوب — مع بوابة تقييم صريحة، إذ لا يوجد معيار مرجعي يُعتمد عليه. يمكن للنموذجين مشاركة ميزانية واحدة لوحدات معالجة الرسوميات وقاعدة برمجية واحدة. وأينما تستحق طبقة التوجيه مكانها في هذه البنية فهو المستوى الذي يعلو النصوص المفرَّغة، لا عملية التفريغ نفسها: OrcaRouter لا يوجّه التعرّف على الكلام حتى الآن ولا أيٌّ من النموذجين موجود في كتالوجه، غير أن أدوات التلخيص وقواعد التنبيه وخطط الوكلاء التي تستهلك نصًا مباشرًا هي تحديدًا نماذج اللغة الـ 200+ التي يتيحها عبر واجهة برمجة تطبيقات واحدة وبأسعار المزودين كما هي دون أي زيادة، مع تجاوز تلقائي للفشل بين المزودين. نقطة تدفق تُطرح دون أي معيار مرجعي واحد تستحق المعاملة ذاتها التي تُعامل بها أي نموذج غير مُثبت — جزء من حركة حقيقية خلف مسار احتياطي، تربح ثقتك أو تخسرها استنادًا إلى أدلة اجتماعاتك أنت لا إلى بطاقة النموذج.
