
VibeVoice-ASR-Streaming-1.5B مقابل Whisper Large v3 Turbo: البث المباشر الأصلي في مواجهة حصان العمل ذي الـ99 لغة
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
من المرجّح أن نموذج تحويل الكلام إلى نص الذي تشغّله اليوم هو Whisper Large v3 Turbo، وهناك نموذج جديد يطرح سؤالاً عمّا إذا كان ينبغي لهذا الأخير أن يبقى الخيار الأول. نموذج Whisper Large v3 Turbo من OpenAI — وهو الإصدار المقطّر بنقطة تحقق معاملاتها 809M والذي صدر في أكتوبر 2024 — هو الحصان العامل في عالم الأوزان المفتوحة: يدعم 99 لغة، وهو أسرع بنحو أربعة إلى ثمانية أضعاف من large-v3 الأصلي، وصغير بما يكفي ليعمل على حاسوب محمول، ومرخّص برخصة MIT، ومدعوم بأكبر نظام بيئي للنسخ transcription في الوجود. أما نموذج VibeVoice-ASR-Streaming-1.5B، الذي رفعته Microsoft Research في 2 سبتمبر 2026، فهو المنافس الذي صُمّم للشيء الوحيد الذي لا يؤديه Whisper بشكل أصلي: البثّ المباشر. فهو ينسخ النص على شكل مقاطع مع وصول الصوت بدلاً من ابتلاع نوافذ زمنية ثابتة، ويدّعي إنتاج نص منسوب إلى المتحدثين، لكنه يدعم عشر لغات فقط ولا يحمل أي معيار قياس منشور باسمه.
تلك العبارة الأخيرة هي السبب في أن هذه الصفحة مبنية حول سؤال انتقال بدلاً من مواجهة مباشرة. أرقام Whisper Large v3 Turbo مُقاسَة ومنشورة — LibriSpeech، والمركّب Open ASR، وCommon Voice — بينما بطاقة نموذج VibeVoice-ASR-Streaming-1.5B لا تنشر أي رقم لـ WER أو زمن استجابة في نصّها، ولا يوجد معيار مستقل حتى وقت كتابة هذه السطور. كل ما يتعلق بجانب Microsoft أدناه هو ما يمكن معرفته من مستودعها: ملفات الإعداد، وبطاقة النموذج، ووثائق البث الخاصة بـ Microsoft. كل ما يتعلق بجانب Whisper هو سجلّ عام راسخ. لم يُجرَ اختبار مباشر بين الاثنين؛ المقارنة هي بين ما هو مُثبت وما هو موعود.
النموذج الذي ربما تقوم بتشغيله بالفعل
حاز Whisper Large v3 Turbo مكانه بالطريقة غير الملفتة: فهو سريع، صغير، متعدد اللغات، ومملّ بالطرق التي تحبها فرق الإنتاج. تم تقطيره من نموذج Whisper large-v3 بمعاملات 1.55B إلى 809M معامل، مع الحفاظ على تغطية 99 لغة ونحو 95% من دقة large-v3 — أي حوالي 2.1% WER على LibriSpeech النظيف، وحوالي 7.7–7.8% على مركّب Open ASR، مع أكبر تدهور في اللغات منخفضة الموارد واللغات النغمية — بينما يعمل أسرع بعدة مرات ويتسع في حوالي 1.6 GB من VRAM بصيغة FP16. وهو مرخّص بموجب MIT، ويعمل عبر faster-whisper وwhisper.cpp وثلاث سنوات من التكاملات، وتعرض صفحته على Hugging Face أكثر من سبعة ملايين تحميل في شهر واحد. إذا كنت تستضيف النسخ الصوتي بنفسك، فمن المرجح جدًا أن هذا هو النموذج الذي يقوم بذلك.
ما ليس عليه Whisper Large v3 Turbo، ولم يَدَّعِ قط أنه كذلك، هو نموذج بث مباشر. إذ يستقبل الصوت في نوافذ زمنية ثابتة مدتها 30 ثانية، ويُعيد نصًّا مكتوبًا لكل نافذة؛ وهو لا يمتلك كشفًا مدمجًا لنشاط الصوت، ولا تحديدًا لنهاية الكلام، ولا فصلًا للمتحدثين، ولا آليةً للكلمات المفتاحية. أما النسخ المباشر على Whisper فهو دائمًا عملية تركيب (retrofit) تقوم ببنائها أنت — وفي هذا التركيب يكمن زمن الاستجابة والتكلفة الهندسية.
ما الذي يتغير فعليًا إذا قمت بالتبديل؟
• نموذج زمن الاستجابة — يصدر VibeVoice-ASR-Streaming-1.5B النص مرة واحدة لكل مقطع مكتمل يبلغ حوالي 2.9 ثانية مع هامش استباق يبلغ ~0.5 ثانية، وذلك بالتصميم مقارنةً بـ Whisper Large v3 Turbo: نموذج دفعي بنافذة 30 ثانية يحتاج إلى طبقة تقسيم وتجميع لتقريب المخرجات المباشرة.
• شكل الجلسة — جلسات مباشرة غير محدودة، يُحمَل السياق عبر الأجزاء في ذاكرة تخزين مؤقتة بادئة، مقابل نوافذ منفصلة مدتها 30 ثانية دون حالة محادثة بين النوافذ.
• اللغات — عشرة (الصينية، الإنجليزية، الفرنسية، الألمانية، الإيطالية، اليابانية، الكورية، البرتغالية، الروسية، الإسبانية) مقابل 99.
• الدقة في المطبوعات — لا شيء منشور مقابل ~2.1% في LibriSpeech clean، و~7.7–7.8% في مركب Open ASR، وكلها مُقاسة وعلنية.
مخرجات إضافية — يدّعي وجود إسنادٍ تدفقيٍّ لـ«من قال ماذا» وكلماتٍ مفتاحية، مقابل توفّر طوابع زمنية للكلمات، لكن لا يوجد فصلٌ للمتحدثين ولا كلمات مفتاحية بشكلٍ أصلي.
• العتاد — ~5.6 GB من أوزان bf16 على معالج NVIDIA GPU، بينما التثبيت من المصدر يستهلك ~1.6 GB بصيغة FP16، ويعمل على أجهزة الكمبيوتر المحمولة ووحدات المعالجة المركزية عبر whisper.cpp وfaster-whisper.
• الترخيص — MIT، كلاهما

مشكلة إعادة تجهيز البث
الطريقة الصادقة للتفكير في هذه المواجهة هي أن Whisper Large v3 Turbo يواجه مشكلة في المعالجة المتدفقة، وهي المشكلة التي دفعت تكلفتها بالفعل أو ما زلت تدفعها. أي خط أنابيب متدفق يعتمد على Whisper يستلزم كاشف نشاط صوتي لتحديد مواضع الكلام، ومقسّمًا يقطّع الصوت إلى نوافذ بحجم Whisper، ونوافذ متداخلة حتى لا تُفقد الكلمات عند الحدود، ومُجمّعًا للتوفيق بين النسخ الجزئية. التطبيقات المجتمعية لهذه الحزمة تحقق زمن استجابة من طرف إلى طرف يتراوح تقريبًا بين ثانية وخمس ثوانٍ — وهو مقبول لتدوين ملاحظات الاجتماعات، لكنه دون المستوى المطلوب لوكلاء الهاتف والتسميات التوضيحية المباشرة.
VibeVoice-ASR-Streaming-1.5B يلغي التعديل الترقيعي من خلال بنيته التصميمية. إذ إن إعدادات المعالج الأولي الخاص به تثبّت مقطعًا من 22 إطارًا ونظرة استشرافية من 4 إطارات على دفق رموز كلام بتردد يبلغ حوالي 7.5 هرتز — أي حوالي 2.9 ثانية من الصوت لكل مقطع مُصدَر، ونصف ثانية من السياق المستقبلي — وتصف توثيقات Microsoft الحفاظ على السياق من المقاطع السابقة عبر ذاكرة التخزين المؤقت KV، لذا فإن الجلسة المباشرة لا تعيد الحساب من الصفر. لكن اقرأ كلمة "streaming" بعناية على جانبي هذه المقارنة: فليس أي من النموذجين محركًا للنتائج الجزئية على مستوى الكلمات من النوع الذي تبيعه واجهات برمجة التطبيقات التجارية ذات زمن الاستجابة الأقل. ينمو نص VibeVoice بزيادات تبلغ حوالي ثلاث ثوانٍ حسب التصميم، وهو إيقاع مختلف ومقبول عادةً للاجتماعات، لكنه ليس في نطاق أقل من ثانية؛ وإذا كان مطلوبك ظهور الكلمات على الشاشة خلال ثانية، فينبغي أن تضع هندسة المقاطع هذه في الحسبان مقابل هذا الميزان قبل البناء عليها.
الدقة: ما الذي تتخلى عنه للانتقال إلى البث الأصلي
هذه هي الفجوة التي ينبغي أن تحكم القرار. يتمتع Whisper Large v3 Turbo بسجل دقة عام يمكنك تدقيقه — وعندما يكون التسجيل ضمن لغاته الـ99، فإن ذلك السجل قوي. أما VibeVoice-ASR-Streaming-1.5B فليس لديه مثل هذا السجل: تقييم بطاقة النموذج عبارة عن صورة، ومايكروسوفت لم تنشر أي WER للبث المباشر في نص، والمرجع الرقمي الوحيد في العائلة هو متوسط WER المُعلَن من البائع بنسبة 7.77% عبر ثماني مجموعات اختبار إنجليزية في بطاقة VibeVoice-ASR للدفعات، وهو يصف نموذجًا مختلفًا غير مخصص للبث المباشر. الجملة الصادقة هي أن نقل النسخ الصوتي الخاص بك إلى VibeVoice-ASR-Streaming-1.5B اليوم يعني قبول مستوى دقة غير معروف على صوتك الخاص — وهذا هو بالضبط السبب في أن أي تقييم له يجب أن يُجرى بواسطتك، على أصعب تسجيلاتك الحقيقية، قبل أن يستحق حركة مرور الإنتاج.

اللغات وإسناد المتحدث: فجوة الميزات تؤثر في الاتجاهين
مقارنة الميزات ليست أحادية الجانب، وهذا هو ما يجعل الاختيار مثيرًا للاهتمام حقًا. إذا كان صوتك متعدد اللغات، فإن القرار ينتهي فورًا: لغات Whisper Large v3 Turbo البالغة 99 لغة تغطي ما لا تغطيه لغات VibeVoice-ASR-Streaming-1.5B العشر، وسقف العشر لغات يُعدّ مستبعدًا لأي خط أنابيب يواجه مزيجًا واسعًا من الكلام. لكن إذا كان عبء عملك ضمن تلك اللغات العشر، وكان ما تحتاجه فعلًا هو معرفة من قال ماذا في اجتماع مباشر، فإن السهم يشير إلى الاتجاه الآخر: لا يقدم Whisper تمييزًا أصليًا للمتحدثين ولا كلمات مفتاحية ساخنة، بينما يدّعي VibeVoice-ASR-Streaming-1.5B كلاهما — مخرجات تدفق منسوبة إلى المتحدث وكلمات مفتاحية للمصطلحات المجالية تُمرَّر كسياق استدلالي. الادعاء غير مُتحقَّق منه، وتمييز المتحدثين التدفقي عبر حدود المقاطع صعب بما يكفي لاستحقاقه التشكك، لكنه الميزة الملموسة التي لا يمنحك إياها أي قدر من هندسة Whisper مباشرةً.
حسابات الهجرة
التكلفة والجهد في صالح الحل القائم. يعمل Whisper Large v3 Turbo بالفعل داخل بيئتك على أجهزة تملكها — حاسوب محمول، معالج مركزي، بطاقة رسوميات متواضعة — والانتقال إلى VibeVoice-ASR-Streaming-1.5B يعني إعداد تثبيت بحثي من المصدر على GPU من NVIDIA بأوزان تبلغ حوالي 5.6 جيجابايت، والتحقق من مسار تحميل لم يُوثَّق صنفه المعماري بعد في وثائق Transformers العامة، وبناء المعيار الذي يعتمد عليه قرارك من الصفر. إنه مشروع حقيقي، والعائد مشروطٌ بمدى أهمية الميزات غير المُتحقق منها بالنسبة لك.

الطريقة الأقل تكلفة لتشغيل هذا المشروع هي ألا تتعامل معه كاستبدال. أبقِ Whisper Large v3 Turbo كخيار افتراضي، ووجّه جزءًا من الصوت المباشر إلى VibeVoice-ASR-Streaming-1.5B عبر واجهة برمجة تطبيقات واحدة — وهو النمط الذي توجد طبقة التوجيه لتحقيقه: أكثر من 200 نموذج خلف نقطة نهاية واحدة بسعر قائمة المزوّد دون أي زيادة، وتجاوز تلقائي للفشل عندما يتعثر النموذج الجديد، ولغة توجيه مخصصة (DSL) تتيح لأعباء العمل المختلفة اختيار نماذج نسخ مختلفة من استدعاء واحد. هذا هو نموذج OrcaRouter، وهو الفرق بين المراهنة على خط إنتاجك بنقطة تحقق عمرها يومان فقط، وبين ترك تلك النقطة تثبت جدارتها أمام النموذج العامل الموثوق على نصوصك الخاصة.
الأسئلة الشائعة
هل يستطيع Whisper Large v3 Turbo القيام بالبث المباشر على الإطلاق؟
فقط كتركيب لاحق. إنّ Whisper Large v3 Turbo نموذجُ دفعاتٍ يعالج نوافذ ثابتة مدتها 30 ثانية، لذا تتطلب النسخ المباشر بناءَ كاشف نشاط صوت، ومُقسِّمًا، واستراتيجية تداخل، وأداة تجميع فوقه. توجد تطبيقات عاملة وتحقق زمن استجابة يتراوح تقريبًا بين ثانية وخمس ثوانٍ، وهو ما يناسب ملاحظات الاجتماعات لكنه يفشل في بلوغ عتبة أقل من ثانية المطلوبة لوكلاء الهاتف والتسميات التوضيحية المباشرة. إنّ VibeVoice-ASR-Streaming-1.5B أصلي للبث — فهو يُصدر نصًا لكل جزءٍ مدته حوالي 2.9 ثانية مع استبصارٍ يبلغ نحو 0.5 ثانية — لكنه بثٌّ مُجزأ وليس نتائج جزئية لكل كلمة، لذا تحقق من هذا الإيقاع ضمن ميزانية زمن الاستجابة الخاصة بك أيضًا.
هل VibeVoice-ASR-Streaming-1.5B أكثر دقة من Whisper Large v3 Turbo؟
لا يمكن لأحد الإجابة على ذلك بعد، بما في ذلك مايكروسوفت. دقة Whisper Large v3 Turbo مُقاسة وعلنية — إذ تبلغ نحو 2.1% في WER على LibriSpeech clean و7.7–7.8% على المجمع Open ASR. أما VibeVoice-ASR-Streaming-1.5B فليس لديه رقم WER للبث المباشر منشور في نص، ولا معيار مستقل حتى كتابة هذه السطور. الطريقة الوحيدة للإجابة على السؤال هي تشغيل نقطة التحقق على الصوت الخاص بك ومقارنة النصوص المكتوبة مع نظامك الحالي — وهذا هو بالضبط الاختبار الذي توصي به هذه الصفحة قبل أي عملية ترحيل.
ما اللغات التي يدعمها الاثنان؟
يدعم Whisper Large v3 Turbo 99 لغة بمجموعة أوزان واحدة. بينما يذكر VibeVoice-ASR-Streaming-1.5B عشر لغات فقط: الصينية، والإنجليزية، والفرنسية، والألمانية، والإيطالية، واليابانية، والكورية، والبرتغالية، والروسية، والإسبانية. بالنسبة لأي محتوى صوتي خارج مجموعة اللغات العشر هذه، يظل Whisper هو الخيار الوحيد في هذا الاقتران، وتُعد الفجوة متعددة اللغات السبب الأوضح الذي سيجعل معظم الفرق تبقى حيث هي.
Whisper Large v3 Turbo هو النموذج المناسب لمعظم الفرق في معظم الأوقات، ونقطة تفتيش عمرها يومان دون معايير أداء ليست سببًا لتغيير المنصة. بل هي سبب لإجراء تجربة. إذا كان صوتك ضمن لغاتها العشر، وكان الإسناد المباشر للمتحدث سيغيّر منتجك، فقُم بتشغيل VibeVoice-ASR-Streaming-1.5B خلف موجه، ووجّه جزءًا من حركة المرور الحقيقية إليه، ودع النسخ المفرَّغة — لا غياب معيار الأداء على أي من الجانبين — هي التي تتخذ القرار.
