بطاقة عنوان رئيسية مولّدة لـ 'VibeVoice-ASR-Streaming-1.5B مقابل Gemini 3.5 Transcribe: تقنية Microsoft الهادئة للتعرف الآلي على الكلام بالبث في مواجهة واجهة Google البرمجية الجديدة'، بعنوان فرعي 'تقنية Microsoft المفتوحة الهادئة للتعرف الآلي على الكلام بالبث في مواجهة واجهة Google البرمجية المستضافة الجديدة'، مع بطاقتَي نموذج — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · أوزان MIT، 2 سبتمبر 2026 · checkpoint مفتوح · 10 لغات) وGemini 3.5 Transcribe (Google · معاينة عامة، 26 أغسطس 2026 · واجهة API مستضافة · نقطتا وصول) — ووسوم نصّها: 'لا يوجد إعلان بعد'، 'لا يوجد معيار منشور'، و'~$0.30–0.54 لكل ساعة صوتية (Google)'. شعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B مقابل Gemini 3.5 Transcribe: نظام التعرف على الكلام المتدفق الصامت من Microsoft ضد واجهة برمجة التطبيقات الجديدة من Google

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

{{1}}تفصل سبعة أيام وفجوة فلسفية واحدة بين أحدث نظامين لتحويل الكلام إلى نص في البث المباشر.{{/1}} {{2}}في 26 أغسطس 2026، أتاحت Google خدمة Gemini 3.5 Transcribe للمعاينة العامة: واجهة برمجة تطبيقات مستضافة ومغلقة لتحويل الكلام إلى نص، تُسعَّر لكل توكن صوتي، مع نقطة نهاية Live منفصلة للجلسات في الوقت الفعلي.{{/2}} {{3}}وفي 2 سبتمبر 2026، رفعت Microsoft Research نموذج VibeVoice-ASR-Streaming-1.5B إلى Hugging Face تحت مساحة اسم microsoft — أوزان مرخّصة بموجب MIT؛ لا بيان صحفي، ولا منشور إطلاق، ولا تغطية من أي طرف ثالث في أي مكان حتى وقت كتابة هذا المقال.{{/3}} {{4}}كلا النظامين يحوّل الكلام إلى نص أثناء وصوله.{{/4}} {{5}}أما كل شيء آخر تقريبًا عنهما — من يُسمح له بتشغيلهما، وما تكلفتهما، وما الدليل على أنهما يعملان — فمختلف.{{/5}}

تقارن هذه الصفحة بين المنتجين كما يوجدان فعليًا اليوم، ما يعني أن جانبيّ الأدلة غير متماثلين. Gemini 3.5 Transcribe هو منتج Google يعمل حاليًا، بأسعار توكنات منشورة وأرقام دقة مستقلة صادرة عن Artificial Analysis؛ وتلك هي الأرقام الموسومة بـ AA أدناه. أما VibeVoice-ASR-Streaming-1.5B فهو نقطة تحقق لا يتضمن نصُّ بطاقتها التعريفية أي معدل خطأ كلمات ولا أي رقم لزمن الاستجابة إطلاقًا — إذ إن تقييم البطاقة عبارة عن صورة، ولا يوجد حتى الآن عن عائلة نماذج البث سوى سطر إخباري واحد بتاريخ 3 سبتمبر في مستودع VibeVoice على GitHub الخاص بـ Microsoft. وكل ما يخص جانب Microsoft أدناه هو ما يمكن معرفته من المستودع: ملفات الإعدادات، والبطاقة التعريفية للنموذج، وتوثيق Microsoft الخاص بالبث. ولم يُقيَّم أيٌّ من ذلك بمعايير مستقلة بعد.

النموذجان في لمحة

• ما هو — VibeVoice-ASR-Streaming-1.5B: نقطة تحقق مفتوحة، رخصة MIT، استضافة ذاتية مقابل Gemini 3.5 Transcribe: واجهة برمجة تطبيقات مستضافة، أوزان مغلقة.

• الإصدار — أوزان في 2 سبتمبر 2026، وخط أخبار المستودع في 3 سبتمبر، مقابل المعاينة العامة في 26 أغسطس 2026 مع مواد الإطلاق الكاملة.

• شكل البث — يُصدر النص في دفعات تبلغ حوالي 2.9 ثانية مع نظرة استباقية تبلغ 0.5 ثانية، وتُحمل حالة الجلسة في ذاكرة تخزين مؤقتة للبادئة مقابل جلسة WebSocket المباشرة التي تُفوتر لكل رمز صوتي، مع حد أقصى يبلغ 10 دقائق من الصوت لكل جلسة.

• الدقة المنشورة — لا يوجد رقم WER أو زمن استجابة منشور كنص، بينما بلغ قياس AA 2.6% WER على الواجهة المسجلة مسبقًا و4.0% على الواجهة المباشرة.

• مخرج المتحدث — يزعم إسناد "من قال ماذا" أثناء البث المباشر (غير موثّق) مقابل عدم وجود تمييز للمتحدثين وعدم وجود طوابع زمنية على مستوى الكلمة في نقطة النهاية المباشرة.

• Hotwords — مدعومة، عبر نفس موجه السياق الخاص بـ VibeVoice-ASR للدفعات، بينما ليست ميزة مدرجة في نقطة النهاية Live.

• التكلفة — 0 دولار للأوزان، وحوالي 5.6 جيجابايت للاستضافة الذاتية، مقابل حوالي 0.30 دولار لكل ساعة صوتية بمعدل إجمالي على نقطة النهاية المسجلة مسبقًا، وحوالي 0.54 دولار على Live، وفقًا لأسعار التوكنات المدرجة من Google.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, License MIT open weights, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, Speaker output who-said-what claimed, Cost $0 weights / ~5.6 GB self-host. Right column Gemini 3.5 Transcribe: Released Aug 26 2026, License closed API, Streaming WebSocket Live, 10-min cap, WER 2.6% batch / 4.0% Live (AA), Speaker output none on Live, Cost ~$0.30–0.54 per audio-hour. Footer reads 'Gemini figures per Google pricing and Artificial Analysis; VibeVoice specs read from the HF repo; no VibeVoice benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

واجهة برمجة تطبيقات مستضافة ورفع هادئ، يفصل بينهما سبعة أيام

Gemini 3.5 Transcribe هو نموذج النسخ البديل من Google، ويُطرح في صورة منتجين. نقطة النهاية الخاصة بالتسجيلات المسبقة، التي تُقدَّم عبر Interactions API، تأخذ ملفًا صوتيًا كاملًا وتُعيد نصًا مكتوبًا مع الإضافات المتوقعة. نقطة النهاية المباشرة، gemini-3.5-transcribe-live، تعمل عبر WebSocket ثنائي الاتجاه، وهي التي تنافس VibeVoice-ASR-Streaming-1.5B في شكل المهمة: نسخ جلسة أثناء حدوثها. أعلنت Google عنه بالآلية المعتادة — إطلاق معاينة عامة في 26 أغسطس، والتسعير على صفحة النموذج، ولوحات متصدّرين من جهات خارجية تلتقطه خلال أيام.

لم يتضمن إصدار مايكروسوفت المباشر أيًا من ذلك. في 2 سبتمبر، أنشأ حساب Hugging Face التابع لمايكروسوفت نقطتي تفتيش في الدقيقة ذاتها: VibeVoice-ASR-Streaming-7B وVibeVoice-ASR-Streaming-1.5B. يسرد جدول النماذج في مستودع GitHub الآن VibeVoice-ASR-Streaming كأحد أفراد العائلة، ويحمل قسم الأخبار سطرًا بتاريخ 3 سبتمبر يعلن "نموذج تحويل كلام إلى نص (ASR) مباشر وموحّد ينسخ باستمرار من قال ماذا أثناء وصول الكلام، مع دعم لكلمات ساخنة مخصصة و10 لغات" — لكن هذا الإعلان يذكر الإصدار 7B، بينما الإصدار 1.5B هو الشقيق الأصغر الذي صدر معه دون أن يُشار إليه. وعندما تحققنا بعد يوم من الرفع، أظهرت نقطتا التفتيش صفر تنزيلات.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

ما معنى "البث" في كل جانب؟

كلمة streaming تخفي فرقًا تصميميًا حقيقيًا. تهيئة المعالج المسبق من Microsoft تجعل إيقاع VibeVoice ملموسًا: يصل الصوت بمعدل 24 كيلوهرتز ويُضغط بنسبة 3,200× إلى تدفّق من رموز الكلام بمعدل نحو 7.5 هرتز (رمز واحد كل ~133 مللي ثانية). ثم تُعلن التهيئة أن حجم الدفعة (chunk) هو 22 إطارًا وأن النظرة المستقبلية (lookahead) هي 4 إطارات — أي نحو 2.9 ثانية من الصوت لكل دفعة، مع استخدام نحو نصف ثانية من الصوت المستقبلي لتثبيت المقطع الحالي. يُصدِر النموذج النص مرة واحدة لكل دفعة مكتملة، وتشير وثائق Microsoft إلى أن سياق الدفعات السابقة يُحفظ عبر ذاكرة التخزين المؤقت KV، لذا لا يُعاد الحساب من الصفر في جلسة طويلة. الحسابات مثبتة في التهيئة؛ والنتيجة العملية هي نص ينمو بزيادات تبلغ نحو ثلاث ثوانٍ، وليس بجزئيات لكل كلمة.

نقطة نهاية Live من Google هي نمط بث مختلف: جلسة WebSocket ثنائية الاتجاه يُحتسب الصوت فيها بمعدل 25 رمزًا صوتيًا في الثانية، وهي مصممة للاستخدام التفاعلي، لكنها محدودة بسقف 10 دقائق من الصوت لكل جلسة، كما أنها — تحديدًا على نقطة نهاية Live — بلا تمييز للمتحدثين أو طوابع زمنية على مستوى الكلمات. ولمن يقارن بين الاثنين كمحركي نسخ مباشر، فإن الفروق الجوهرية هي: سقف الجلسة (10 دقائق على جانب Google Live، بينما لا يخضع جانب Microsoft إلا لحدود كرت الشاشة والذاكرة لديك)، وإيقاع إصدار النتائج (مقاطع تبلغ نحو 3 ثوانٍ مقابل ما تقدمه جلسة WebSocket)، والمزايا الإضافية في المخرجات (إسناد الكلام إلى المتحدثين والكلمات المفتاحية (hotwords) المذكورة في بطاقة Microsoft، والغائبة عن قائمة ميزات Google Live).

الدقة: جانب واحد يحتوي على أرقام، والجانب الآخر يحتوي على صورة

هذه أوسع فجوة في المواجهة، وهي فجوة في الأدلة، وليست بالضرورة في الجودة. يقيس Artificial Analysis نموذج Gemini 3.5 Transcribe بمعدل خطأ في الكلمات يبلغ 2.6% على نقطة النهاية المسجلة مسبقًا، و4.0% على نقطة النهاية المباشرة — العلاوة التي تدفعها مقابل التسليم في الوقت الفعلي تظهر في معدل الخطأ، وهي مقايضة شائعة وصادقة للأنظمة المتدفقة. هذه أرقام من طرف ثالث على لوحة متصدرين محايدة، نُشرت بعد أيام من الإطلاق.

لا يوجد أي رقم قابل للمقارنة لنموذج VibeVoice-ASR-Streaming-1.5B في أي مكان. تأتي بطاقة النموذج مع شكل بياني لنتائج التقييم على هيئة صورة، لكن من دون أي WER أو RTF أو زمن استجابة رقمي في النص — لا شيء يمكن اقتباسه ولا شيء يمكن التحقق منه بشكل مستقل. لم تنشر Microsoft أرقام دقة البث في نص مكتوب لا لإصدار 7B ولا لإصدار 1.5B. الارتكاز الرقمي الوحيد في العائلة بأكملها هو بطاقة نموذج VibeVoice-ASR الدفعي، التي تذكر متوسط WER بنسبة 7.77% أجراه البائع عبر ثماني مجموعات اختبار إنجليزية و2.20% على LibriSpeech النظيفة — لكن ذلك يصف النموذج غير المتدفق، وعادةً ما تقايض نماذج البث قليلاً من الدقة مقابل كسب زمن الاستجابة. وحتى يُشغَّل نموذج البث عبر أداة اختبار عامة، يبقى الموقف الصادق أن نموذج Google مُقاس ونموذج Microsoft غير مُقاس.

التكلفة: لكل ساعة صوتية مقابل كل ساعة GPU

تبيع Google خدمة Gemini 3.5 Transcribe بالتوكن، وينقسم التسعير بوضوح بين نقطتي النهاية. تعرض نقطة نهاية التسجيلات المُسبقة دولارين لكل مليون توكن إدخال صوتي و12 دولارًا لكل مليون توكن إخراج نصي، وهو ما يعادل إجمالًا نحو 0.30 دولار لكل ساعة صوتية. بينما تعرض نقطة نهاية البث المباشر 3.50 دولار لكل مليون توكن صوتي و21 دولارًا لكل مليون توكن نصي — أي نحو 0.54 دولار لكل ساعة صوتية إجمالًا، أي أعلى بنحو 80% من نقطة نهاية التسجيلات المُسبقة، وهذا هو ثمن التسليم في الوقت الفعلي. تحتسب Google الصوت بمعدل 25 توكنًا في الثانية، لذا لا يكون الصمت مجانيًا إلا إذا لم يقم عميلك ببثّه؛ وقد تضيف عمليات إعادة الاتصال والصوت المكرّر وتسجيل السجلات جميعها إلى الفاتورة الفعلية. توجد طبقة مجانية، مع التنبيه إلى أن محتوى الطبقة المجانية قد يُستخدم لتحسين منتجات Google.

A generated comparison card titled 'Gemini 3.5 Transcribe — the two endpoints'. Left column 'Pre-recorded': $2 / $12 per 1M audio / text tokens, ~$0.30 per audio-hour, AA WER 2.6%, diarization and word-level timestamps. Right column 'Live': $3.50 / $21 per 1M tokens, ~$0.54 per audio-hour, AA WER 4.0%, no diarization, 10-minute session cap. Footer reads 'Token prices per Google's model page; WER per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

نموذج مايكروسوفت يُسعّر بدلاً من ذلك بساعات استخدام وحدات معالجة الرسوم (GPU-hours). نقطة التحقق 1.5B تزن تقريبًا 5.6 جيجابايت من أوزان bf16 (نواة لغة Qwen بحجم 1.5B بالإضافة إلى مُرمِّزات الصوت ورأس الانتشار — مجموع بيانات safetensors الوصفية يصل إلى حوالي 3B معاملًا)، والمسارات الموثَّقة لتشغيله هي الاستضافة الذاتية: العروض التوضيحية بلغة Python في مستودع microsoft/VibeVoice، أو إضافة vLLM التي تصفها مايكروسوفت لخدمة نقاط نهاية متوافقة مع OpenAI ونقاط نهاية WebSocket. لا يوجد سعر استضافة بعد، لأن أي مزوّد استدلال لا يدرج النموذج بعد. مسألة التكلفة برمّتها تتعلق بما إذا كان وقت وحدة معالجة الرسوم لديك أرخص من سعر غوغل بالساعة، وهو كذلك في الغالب لأي حجم نسخ مستمر — ومسألة الترخيص منفصلة عن مسألة التكلفة، لأن أوزان MIT ملك لك تحتفظ بها بطريقة لا يوفرها أي اشتراك في واجهة برمجة تطبيقات.

الأمران ليسا متنافيين في البنية الإنتاجية. النمط العملي لفريق يحتاج إلى النسخ الصوتي المباشر اليوم هو إبقاء طبقة التعرّف على الكلام خلف نقطة وصول واحدة بحيث يظل الخيار قابلاً للعكس: واجهة برمجية للتوجيه تقدّم أكثر من 200 نموذج بأسعار القوائم لدى المزوّد — دون أي هامش ربح، لذا فإن أي تغيير في أسعار البائع يصبح ساريًا في اليوم نفسه — مع تجاوز تلقائي للأعطال، وهي بالضبط الطبقة التي تتيح لك تشغيل واجهة Google المقاسة كخيار افتراضي بينما تختبر شريحة من الحركة الفعلية نموذج VibeVoice-ASR-Streaming-1.5B فور استضافته لدى أي مزوّد. هذا هو نموذج OrcaRouter، وهو الطريقة المنخفضة المخاطر لتبنّي نقطة فحص لم يتحقق أحد من دقتها بعد.

من الذي يجب أن يختار ماذا

اختر Gemini 3.5 Transcribe إذا كنت تريد واجهة برمجة تطبيقات للنسخ تعمل اليوم، بدقة معلنة، وتسعير متوقع لكل ساعة، دون الحاجة إلى مراقبة وحدة معالجة رسومية (GPU) — وخاصة إذا كان صوتك ليس ضمن اللغات العشر التي تدرجها Microsoft، أو إذا كنت تحتاج إلى ميزة تمييز المتحدثين (diarization) والطوابع الزمنية على مستوى الكلمة من نقطة نهاية الملفات المسجلة مسبقًا لنسخ الملفات. حدّ الجلسة المباشرة (Live) البالغ 10 دقائق هو قيد حقيقي يجب اختباره مع حالة الاستخدام الخاصة بك قبل الالتزام به للجلسات المباشرة.

اختر VibeVoice-ASR-Streaming-1.5B إذا كنت تستضيفه بنفسك، أو إذا كنت تريد الأوزان والتحكم في البيانات التي يوفرها ترخيص MIT، أو إذا كنت بحاجة إلى طول جلسة غير محدود، أو إذا كانت ميزات الإخراج المتدفق الذي يوضح من قال ماذا، والكلمات الساخنة، هي ميزات تريد تقييمها تحديدًا. خصّص ميزانيتك لتركيب من المصدر، وحوالي 5.6 جيجابايت من الأوزان على وحدة معالجة رسوميات NVIDIA، وبوابة تقييم خاصة بك — فلا يوجد معيار جاهز تعتمد عليه، لذا فإن مسألة الدقة مسؤوليتك أنت للإجابة عنها باستخدام ملفاتك الصوتية الخاصة.

خلاصة الأسبوع: أصدرت Google المنتج المُقيَّس، بينما أصدرت Microsoft الرهان المثير. يعد Gemini 3.5 Transcribe الخيار الافتراضي الأكثر أمانًا، وهو المدعوم بأرقام من جهات خارجية؛ أما VibeVoice-ASR-Streaming-1.5B فهو البديل المفتوح، القابل للاستضافة الذاتية، وغير المختبَر تمامًا. وما يجعل الاختيار رخيصًا هو أنه ليس نهائيًا — أبقِ نقطة نهاية ASR قابلة للتبديل، ويمكن لنموذج checkpoint يُطلق دون معيار مرجعي واحد أن يكسب حركة مرورك أو يخسرها استنادًا إلى أدلة نصوصك الخاصة.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube