بطاقة العنوان الرئيسية لمقال 'VibeVoice-ASR-Streaming-1.5B' مع وسم 'ما نعرفه حتى الآن'، وعنوان فرعي 'خدمة تحويل الكلام إلى نص المتدفقة من Microsoft صدرت بهدوء'، وشارات تحمل: 'أُصدر في 2 سبتمبر 2026'، 'MIT · أوزان مفتوحة'، و'10 لغات'. شعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B، شرح: تقنية التعرف على الكلام الفوري من مايكروسوفت وصلت دون إطلاق رسمي

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 2 سبتمبر 2026، قامت Microsoft Research برفع نقطتي فحص جديدتين إلى Hugging Face لتحويل الكلام إلى نص، دون بيان صحفي أو تدوينة أو ضجة: microsoft/VibeVoice-ASR-Streaming-1.5B ونسختها الأكبر حجمًا microsoft/VibeVoice-ASR-Streaming-7B. الإعلان الوحيد حتى الآن هو إدخال إخباري بتاريخ 3 سبتمبر 2026 في قسم الأخبار في مستودع VibeVoice مفتوح المصدر على GitHub التابع لمايكروسوفت، يصف الإصدار بأنه نموذج تحويل كلام إلى نص متدفق موحّد يُدوّن من قال ماذا بينما لا يزال الصوت قادمًا، مع كلمات مخصصة وعشر لغات. كلا نقطتي الفحص مرخصتان بموجب رخصة MIT، وقد أُنشئتا خلال نحو خمس دقائق من بعضهما البعض على حساب microsoft الرسمي على Hugging Face، وأظهرت كلتاهما صفر تنزيلات عندما تحققنا بعد يوم واحد. لم نتمكن من العثور على أي تغطية من طرف ثالث لأيٍّ منهما.

ذلك يجعل هذه المراجعة غير اعتيادية: إصدار حقيقي قابل للتأريخ — أوزان على Hugging Face مؤرخة في 2 سبتمبر، وإعلان داخل المستودع مؤرخ في 3 سبتمبر — لم يلحق به العالم الأوسع بعد. كل ما هو قابل للمعرفة أدناه يأتي من قراءة المستودع: ملفات الإعدادات، وبطاقة النموذج، ووثائق البث الخاصة بمايكروسوفت. كل ما لم يُؤكد بعد — الدقة، وزمن الاستجابة الفعلي، وما إذا كان تحديد المتحدث في البث يصمد أمام مكالمة حقيقية بين متحدثين — يُصنَّف على هذا النحو. لا يوجد معيار مرجعي للاستشهاد به لأن مايكروسوفت لم تنشر واحدًا في شكل نصي بعد.

الإعلان الوحيد هو سطر إخباري.

VibeVoice هي عائلة نماذج الكلام مفتوحة المصدر والمرخصة بموجب MIT التابعة لأبحاث مايكروسوفت. أشهر أعضائها في التعرف على الكلام، microsoft/VibeVoice-ASR، صدر في 21 يناير 2026: نموذجٌ دفعيٌّ يستوعب حتى ستين دقيقة من الصوت في تمريرة واحدة ويُخرج نصوصًا منظمة تتضمن المتحدث والتوقيت والمحتوى — وقد أعقب ذلك نحو 700,000 عملية تنزيل من Hugging Face. في 2 سبتمبر، نشرت المنظمة نفسها النموذجين المتدفقين، microsoft/VibeVoice-ASR-Streaming-7B وmicrosoft/VibeVoice-ASR-Streaming-1.5B؛ وتُظهر الطوابع الزمنية لواجهة برمجة التطبيقات الخاصة بـ Hugging Face أن 7B صدر في 2026-09-02T15:46 UTC وأن 1.5B صدر بعده بخمس دقائق في 15:51 UTC. يعرض جدول النماذج في مستودع GitHub الآن VibeVoice-ASR-Streaming كمدخلٍ مستقل، ويحمل قسم الأخبار فيه سطر 3 سبتمبر الذي يعلن عنه.

ما هو جديد فعلاً مقارنةً بنسخة يناير هو نموذج التفاعل: نقاط التفتيش المتدفقة تُفرّغ النص الصوتي فور وصول الصوت بدلاً من انتظار ملف كامل. كل شيء آخر — البنية الأساسية لرموز الكلام، والمخرجات المنسوبة إلى المتحدث، وآلية الكلمات الساخنة — هو امتداد لتصميم المعالجة الدفعية، تم توسيعه وإعادة توجيهه نحو الاستخدام الفوري. لاحظ الفرق في اللغات من البداية: نموذج المعالجة الدفعية يعلن عن دعم أكثر من 50 لغة، بينما بطاقة المعالجة المتدفقة تدرج عشر لغات فقط.

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

ما معنى "streaming" في نقطة التفتيش هذه؟

يصف مستند البث من Microsoft القصد بوضوح: يقوم النموذج بالنسخ بينما لا يزال الصوت قادمًا، ويصدر نصًا مرة واحدة لكل جزء صوتي، لذلك يظهر النص المكتوب بينما يتحدث المتحدث. كما أن ملف preprocessor_config.json في مستودع 1.5B يجعل الإيقاع ملموسًا:

• معدل أخذ العينات ومعدل الرموز — {{1}}إدخال صوت بتردد 24 كيلوهرتز، مضغوط 3,200×،{{/1}} مما ينتج تقريبًا {{2}}دفقًا من رموز الكلام بتردد 7.5 هرتز{{/2}} (أي حوالي رمز واحد كل 133 مللي ثانية).

• كتلة — 22 إطارًا، والتي عند 7.5 هرتز تعادل حوالي 2.9 ثانية من الصوت لكل مقطع مُصدَر.

• النظرة المستقبلية — 4 إطارات، حوالي 0.5 ثانية من الصوت المستقبلي تُستخدم لتثبيت المقطع الحالي.

(الحساب واضح من المستودع: 22 × 3,200 = 70,400 عينة ≈ 2.93 ثانية عند 24 كيلوهرتز؛ 4 × 3,200 = 12,800 عينة ≈ 0.53 ثانية. توثيق مايكروسوفت نفسه يلاحظ أن نقطة التفتيش تعمل دائمًا على المقطع الذي تدرّبت عليه، لذا لا يمكن ضبط هذه القيم في وقت الاستدلال.)

وهذا يضع هذا ضمن عائلة البث المُجزَّأ بدلًا من البث كلمةً-بكلمة: ينمو النص الحرفي المباشر بزيادات تبلغ نحو ثلاث ثوانٍ مع نصف ثانية من الاستباق، وليس في أجزاءٍ لكل رمز. هذا تصميم مشروع وشائع لتفريغ الاجتماعات والمكالمات، لكنه يختلف في ملفّ زمن الاستجابة عن الأنظمة التي تُصدر أجزاءً خلال أقل من ثانية — لذلك تعامل مع "البث" بوصفه طيفًا، وقِسْه وفق ميزانية زمن الاستجابة الخاصة بك قبل بناء منتج للتعليقات التوضيحية المباشرة عليه.

من الداخل: نموذج لغوي كبير للكلام بمقياس Qwen

قراءة ملف config.json الخاص بنقطة التحقق 1.5B تعطي وصفة VibeVoice المألوفة الآن على نطاق أصغر:

- وحدة فك الترميز هي نموذج لغوي من عائلة Qwen2 تتطابق أبعاده تمامًا مع فئة Qwen2.5 بسعة 1.5B — 28 طبقة، و1,536 وحدة مخفية، و12 رأس انتباه مع رأسَي مفتاح-قيمة، ونافذة تضم 65,536 رمزًا. إن نموذج اللغة الكبير هو ما يمكّن النموذج من حمل فهم المتحدث والمحتوى عبر النص الكامل.

• المُرمِّزات الصوتية والدلالية — مُرمِّزات التفاف عميقة بخطوات 8/5/5/4/2/2 — تحوّل صوتًا بتردد 24 kHz إلى تدفق رموز الكلام بمعدل ~7.5 Hz الذي يقرؤه مفكك الترميز.

• رأس انتشار (DDPM، 20 خطوة لإزالة الضوضاء، تنبؤ v) يقع على جانب التوليد، بما يتوافق مع بقية خط VibeVoice.

• صدق الحجم: بيانات safetensors الوصفية لنقطة التفتيش نفسها تسرد حوالي 3 مليارات معامل، أي نحو 5.6 جيجابايت من الأوزان. إن "1.5B" في الاسم هو مقياس العمود الفقري اللغوي — القراءة الطبيعية لإعدادات يكون مفكك التشفير فيها نموذج Qwen من فئة 1.5B — بحيث تضيف مُرمِّزات الصوت ورأس الانتشار الباقي. سلسلة البنية في الإعدادات، VibeVoiceForASRStreamingTraining، تشير إلى أن هذه نقطة تفتيش من عائلة الأبحاث.

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

من قال ماذا، بعشر لغات

القدرة الرئيسية الموضحة في بطاقة النموذج هي النسخ الفوري مع نسب الكلام إلى المتحدثين: فهي "تنسخ باستمرار من قال ماذا فور وصول الكلام"، وفقًا لما ورد في بطاقة النموذج نفسها. كما تروّج البطاقة لكلمات مخصصة للمصطلحات المتخصصة، وتدرج عشر لغات مدعومة: الصينية، والإنجليزية، والفرنسية، والألمانية، والإيطالية، واليابانية، والكورية، والبرتغالية، والروسية، والإسبانية.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

يتم تنفيذ الكلمات الساخنة (Hotwords) من خلال نفس آلية انحياز السياق التي يستخدمها نموذج الدُفعات. في العرض التوضيحي لسطر الأوامر من Microsoft، تمرّرها كمعلومات سياق — على سبيل المثال --context_info "Microsoft,VibeVoice" — لتحييز التعرف نحو الأسماء والمصطلحات التقنية دون أي ضبط دقيق. لا تذكر البطاقة شيئًا عن الكشف التلقائي عن اللغة أو التبديل بين اللغات للنموذج المتدفق، وهو فجوة أخرى مقارنةً بادعاءات نموذج الدُفعات.

تحذير واحد يستحق التأكيد. تركز صفحة توثيق البث على الإرسال المجزأ والكلمات الساخنة؛ ولا توضح بالتفصيل كيفية الحفاظ على إسناد المتحدث عبر حدود الأجزاء. إن فصل الأصوات في البث المباشر صعب حقًا — فالمتحدثون يتداخلون، وحدود الأجزاء هي بالتحديد حيث ينحرف الإسناد. إن تأطير «من قال ماذا» على البطاقة هو ادعاء من البائع حتى يقوم شخص بتشغيل مكالمة حية حقيقية لمتحدثين اثنين من خلالها والتحقق.

مكانتها: عائلة VibeVoice ومجال التعرف التلقائي على الكلام المتدفق (streaming-ASR) لعام 2026

ضمن العائلة، يُدرج الإصدار على النحو التالي:

• microsoft/VibeVoice-ASR (21 يناير 2026) — الرائد في المعالجة الدفعية: حتى 60 دقيقة في تمريرة واحدة، أكثر من 50 لغة، مخرجات من/متى/ماذا، كلمات مهمة، حوالي 700 ألف عملية تحميل.

• microsoft/VibeVoice-ASR-Streaming-7B وmicrosoft/VibeVoice-ASR-Streaming-1.5B (2 سبتمبر 2026) — الإصداران الجديدان للبث المباشر؛ موضوع هذا المقال هو إصدار 1.5B.

• microsoft/VibeVoice-ASR-BitNet (٢٣ يوليو ٢٠٢٦) — محرك طرفي مُكمَّم موجّه لوحدة المعالجة المركزية للنموذج الدفعي.

• نماذج VibeVoice-1.5B TTS وVibeVoice-Realtime-0.5B streaming-TTS هي أعضاء منفصلة من العائلة نفسها، وليست جزءًا من خط ASR.

مجال التعرف على الكلام مفتوح الأوزان يتجه نحو المعالجة اللحظية طوال العام، لذا فإن أي دخول جديد في البث المباشر يجد نقاط مقارنة مباشرة. Qwen3-ASR (من Alibaba، حوالي 1.7 مليار معامل) هو نموذج موحّد يعمل بالبث المباشر وبشكل غير متصل، ويغطي أكثر من 50 لغة ولهجة. أما Nemotron 3.5 ASR من NVIDIA فهو نموذج بث مباشر بحجم 0.6 مليار معامل يغطي 40 لغة، وهو مرخّص بموجب OpenMDW وليس MIT. كما أن Granite Speech 5.0 470M TurboCTC من IBM مرخّص بموجب Apache-2.0، مع أرقام إنتاجية أعلنها البائع تبدو مرتفعة بشكل غير معتاد. وفي مقابل ذلك، يتميز نموذج البث المباشر من Microsoft بثلاثة أمور: ترخيص MIT، وأساس LLM الذي يحمل فهمًا للمتحدث والمحتوى بدلًا من كونه نموذجًا صوتيًا بحتًا، وتأطير النسخ المباشر المنسوب إلى المتحدث. أما أسئلته المفتوحة فهي الدقة وزمن الاستجابة الفعلي — فلا يوجد رقم مستقل لأي منهما حتى الآن.

ما الذي لم يتم التحقق منه بعد؟

قراءة المستودع تخبرك بالتصميم؛ لكنها لا تخبرك بمدى جودة عمله. تحديدًا:

• لا توجد أرقام دقة أو زمن استجابة في النص. تأتي بطاقة النموذج مع شكل نتائج كصورة، لكن لا يوجد جدول رقمي لـ WER أو RTF أو زمن الاستجابة في النثر — لا شيء يمكن الاستشهاد به بشكل مستقل.

• لا يوجد تقييم من طرف ثالث. كانت التنزيلات صفرًا بعد يوم واحد من الرفع؛ لا يوجد معيار مجتمعي، ولا إدراج في لوحة المتصدرين، ولا اختبار مستقل تمكّنا من العثور عليه.

• مسار التقديم هو إعداد بحثي مبني من المصدر. تعمل وثائق البث من Microsoft من استنساخ لمستودع VibeVoice على GitHub داخل حاوية NVIDIA PyTorch (nvcr.io/nvidia/pytorch، مع التوصية بـ flash-attention). كما تُظهر بطاقة النموذج مقتطفًا من خط أنابيب Transformers وتُحيل تفاصيل التثبيت إلى GitHub؛ وما إذا كان إصدار Transformers المُصدر حاليًا يشغّل الاستدلال المتدفق على نقطة التفتيش هذه مباشرةً دون إعدادات إضافية، لم نتحقق منه.

• الإطار العام هنا بحثي أولًا. يصف مستودع Microsoft نماذج VibeVoice بأنها مخصّصة لأغراض البحث والتطوير. الأوزان مرخّصة بموجب MIT؛ والموقف هو «هذا هو العلم»، وليس «هذا منتج مدعوم». خصّص ميزانية لبوابة تقييم خاصة بك.

هل ينبغي أن تبني عليه؟

بالنسبة للفرق التي تستضيف أنظمة التعرّف على الكلام (ASR) ذاتيًا بالفعل، فإن هذا الأمر يستحق تقييمًا في عطلة نهاية الأسبوع إذا كان صوتكم ضمن مجموعة اللغات العشر، وكنتم بحاجة محددة إلى نسخ مباشر مُسنَد إلى المتحدث من نموذج مرخّص برخصة MIT. خصّصوا نحو 5.6 جيجابايت من الأوزان لنموذج 1.5B على وحدة معالجة رسوميات من NVIDIA، مع تثبيت من المصدر، وخططوا لقياس الدقة بأنفسكم على صوتكم الخاص قبل الوثوق به.

بالنسبة للفرق التي تُطلق خط إنتاج لتحويل الكلام إلى نص في بيئة إنتاج اليوم، فإن الإجابة الحكيمة هي الانتظار حتى يتحقق أحد ثلاثة أمور: أن تنشر Microsoft أرقام الدقة والزمن الكامن التي لا توجد حاليًا إلا كصورة؛ أو ظهور معيار مستقل؛ أو توفّر مسار خدمة مُدار مع بيئة تشغيل مدعومة. كما أن الإيقاع المجزأ الذي يبلغ حوالي 3 ثوانٍ هو مواصفة يجب التحقق منها مقابل متطلب الزمن الكامن لديك، بدلاً من افتراض ذلك من كلمة "streaming".

الطريقة الرخيصة لإبقاء الخيار مفتوحًا هي تجنّب ربط تطبيقك بشكل صارم بمحرك نسخٍ واحد. طبقة توجيه تُقدّم كثيرًا من النماذج عبر واجهةٍ برمجيةٍ واحدة تعني أنّه عند توفّر VibeVoice-ASR-Streaming — أو نموذج ASR مفتوح المصدر التالي — على مزوّد استدلال، فإن اختبار A/B له مقابل محركك الحالي على نفس حركة المرور يصبح تغيير إعدادات لا إعادة بناء للمنصة. ولأن الموجّه الممرّر يتقاضى سعر القائمة من المزوّد دون أي زيادة، تظل تلك المقارنة رخيصة، ويمنع التحويل التلقائي عند الفشل نموذجًا جديدًا لم يُثبت جدارته من أن يصبح نقطة فشل مفردة في خط المعالجة لديك. هذا هو النمط العام لتبنّي أي نموذج وُلد لتوّه: اتركه يثبت وجوده على حركة مرور حقيقية قبل أن تُراهن عليه في الإنتاج.

الأسئلة الشائعة

هل VibeVoice-ASR-Streaming-1.5B إصدار حقيقي من Microsoft؟

نعم. تقع نقطة التحقق على الحساب الرسمي لشركة microsoft في منصة Hugging Face، مع طابع زمني للإنشاء بتاريخ 2 سبتمبر 2026. ويشير مستودع microsoft/VibeVoice على GitHub إلى VibeVoice-ASR-Streaming في جدول النماذج الخاص به، مع خبر مؤرخ في 3 سبتمبر 2026. ما يثير الدهشة ليس المصدر بل الصمت: لا بيان صحفي، ولا تدوينة، ولا أي تغطية من طرف ثالث حتى وقت كتابة هذه السطور.

لماذا حجمين، 7B و1.5B؟

رفعت Microsoft نقطتي التحقق في نفس الدقيقة ولكنها لم تنشر مقارنة. من الإعدادات، يبدو أن 1.5B هو الطرف الصغير — نواة لغة من فئة Qwen بحجم 1.5B بالإضافة إلى حزمة الصوت، بحوالي 3 مليارات معامل و~5.6 جيجابايت من الأوزان. القراءة الطبيعية هي أن 7B أكثر دقة و1.5B أرخص وأسرع، لكن Microsoft لم تذكر ذلك، ولا توجد معايير لتأكيد المفاضلة.

كيف يختلف هذا عن VibeVoice-ASR السابق؟

يستوعب نموذج دفعة يناير ما يصل إلى 60 دقيقة من الصوت في تمريرة واحدة ويعلن دعمه لأكثر من 50 لغة. بينما نقاط التحقق الخاصة بالبث تحوّل الصوت إلى نص أثناء وصوله، وتُصدر نصًا مكتوبًا في مقاطع تبلغ حوالي 3 ثوانٍ مع نظرة استباقية تبلغ حوالي 0.5 ثانية، وتُدرج بطاقة النموذج عشر لغات. ويتشارك الاثنان في بنية رموز الكلام نفسها، وفكرة الإخراج المنسوب إلى المتحدث، وآلية الكلمة الساخنة.

في الوقت الحالي، VibeVoice-ASR-Streaming-1.5B هو نقطة تفتيش (checkpoint) إضافةً إلى خط أخباري. اقرأ المستودع إذا كنت تستضيف الخدمة ذاتيًا وتحتاج إلى نظام ASR تدفقي برخصة متسامحة للتقييم؛ أمّا إذا كنت تختار محرك إنتاج فانتظر الأرقام. الإشارة المثيرة للاهتمام هي أن Microsoft تدفع خطها الصوتي نحو الوقت الفعلي بحجمين في آنٍ واحد — وفعلت ذلك بهدوءٍ لدرجة أنه بعد يومٍ واحد، ما زال عداد التنزيلات عند الصفر.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube