بطاقة عنوان رئيسية تقارن بين 'VibeVoice-ASR-Streaming-7B' و'Gemini 3.5 Transcribe Live'، مع سطر علوي 'تحويل الكلام إلى نص مباشر - سبتمبر 2026'، وعنوان فرعي يُشير إلى أن نقطة الفحص المفتوحة الهادئة من Microsoft تلتقي بواجهة Google المدروسة Live API، مع شارات 'أوزان MIT - 2 سبتمبر' و'Google API - 26 أغسطس' و'لا يوجد WER منشور لـ VibeVoice'، وحاشية سفلية 'ما نعرفه حتى الآن'. شعار OrcaRouter مُركّب في أسفل اليمين.
Guides & Insights

VibeVoice-ASR-Streaming-7B مقابل Gemini 3.5 Transcribe Live: أسبوع واحد، نوعان من تحويل الكلام إلى نص بالبث المباشر

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أنتج الأسبوع الأخير من أغسطس وأوائل أيام سبتمبر 2026 نظامين للتعرف على الكلام وتحويله إلى نص بشكل متدفق يبدوان كمنافسين، لكنهما في الحقيقة إجابتان مختلفتان على السؤال نفسه. في 26 أغسطس، طرحت Google إصدار Gemini 3.5 Transcribe Live للمعاينة العامة: نقطة نهاية مستضافة ومغلقة للتعرف على الكلام وتحويله إلى نص، تعيد نصًا مكتملًا بعد 0.40 ثانية من توقف المتحدث عن الكلام، مدعومة بمعدل خطأ كلمات متدفق مُقاس قدره 4.0% من Artificial Analysis ومواد إطلاق كاملة. وفي 2 سبتمبر، رفعت Microsoft Research نموذج VibeVoice-ASR-Streaming-7B إلى Hugging Face تحت مساحة microsoft: أوزان مفتوحة مرخصة بترخيص MIT، دون بيان صحفي أو صفحة إطلاق، وبطاقة نموذج لا تنشر أي معدل خطأ كلمات أو رقم زمن استجابة في نص قابل للقراءة إطلاقًا. كلاهما يقبل الصوت بينما ما يزال قادمًا. وهذا هو الشيء الوحيد المشترك بينهما تقريبًا.

أدلة الجانبين غير متكافئة، لذا تُكتب هذه المقارنة على أساس «ما نعرفه حتى الآن». Gemini 3.5 Transcribe Live منتج من Google له أسعار رموز منشورة وقياسات من جهات خارجية، وهذه موضَّحة أدناه. VibeVoice-ASR-Streaming-7B نقطة تحقق تُقرأ كل ادعاءاتها من المستودع نفسه: ملفات الإعداد، وبطاقة النموذج، وتوثيق Microsoft للبث المتدفق في مستودع VibeVoice على GitHub. لم يخضع أي جانب من جوانب Microsoft بعد لتقييم مستقل، ونحن نصرّح بذلك في كل موضع قد يوحي فيه رقمٌ بغير ذلك.

مسار الإصدار: إطلاق API ورفع هادئ

أطلقت Google نموذج Gemini 3.5 Transcribe Live بالطريقة المعتادة. يندرج النموذج تحت لافتة Gemini Audio إلى جانب شقيقه Gemini 3.5 Transcribe (مسار واجهة برمجة تطبيقات Interactions للملفات المسجلة مسبقًا)، والأسعار معروضة على صفحة النموذج، وقد رصدت لوحات المتصدرين المستقلة نقطة نهاية Live خلال أيام — ومن هنا يأتي معدل WER للبث المباشر البالغ 4.0% وزمن الاستجابة النهائي البالغ 0.40 ثانية. توجد طبقة مجانية، مع التحذير المعتاد بأن محتوى الطبقة المجانية قد يُستخدم لتحسين منتجات Google.

لم يتضمن الإصدار المتدفق من Microsoft أيًّا من تلك الآليات. تم إنشاء مستودع Hugging Face باسم microsoft/VibeVoice-ASR-Streaming-7B في 2026-09-02 الساعة 15:46 بالتوقيت العالمي المنسق (UTC)، وآخر تعديل عليه كان بعد ثلاث دقائق؛ ويحتوي على ثماني شرائح من نوع safetensors، ومُرمِّز (tokenizer)، وإعدادات معالج مسبق بموجب ترخيص MIT. السجل الرسمي هو سطر في سجل الأخبار مؤرخ في 3 سبتمبر في مستودع microsoft/VibeVoice يعلن عن "نموذج ASR متدفق موحّد ينسخ باستمرار من قال ماذا فور وصول الكلام، مع دعم كلمات مخصصة و10 لغات"، مع روابط إلى عرض توضيحي على الرابط aka.ms/vibeasr وتقرير تقني عن التدفق. عندما تحققنا بعد يوم من الرفع، كان checkpoint لا يزال يعرض صفر تنزيلات، ولا يدرجه أي مزود استدلال مستضاف. بطاقة النموذج تقول أكثر مما يقوله الإعلان، والمستودع هو مصدر كل ما يلي تقريبًا.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

المواصفات جنبًا إلى جنب

• ما هو — VibeVoice-ASR-Streaming-7B: تعرّف تلقائي على الكلام (ASR) تدفقي مفتوح الأوزان، مستضاف ذاتيًا مقابل Gemini 3.5 Transcribe Live: واجهة برمجة تطبيقات (API) تدفقية مستضافة، بأوزان مغلقة.

نمط التدفق — يُصدر نصًا على دفعات تبلغ مدتها حوالي 2.9 ثانية، مع ما يقارب 0.5 ثانية من الاستباق (مشتق من إعدادات نقطة التحقق)، مقارنة بجلسة WebSocket ثنائية الاتجاه تقدّم نصوصًا جزئية مستمرة، ونتيجة نهائية بعد 0.40 ثانية من توقف المتحدث.

الدقة المنشورة — لا يُنشر أي رقم WER أو زمن استجابة كنص، مقابل 4.0% WER للبث المباشر و2.6% على النموذج المُسجَّل مسبقًا، وفقًا لتحليل Artificial Analysis.

• المتحدثون — يدّعي توفير إسناد من قال ماذا في البث المباشر (غير مُتحقق منه)، في حين لا يوجد فصل للمتحدثين على نقطة النهاية المباشرة (الميزة متاحة على النموذج المُسجَّل مسبقًا لما يصل إلى ثلاثة متحدثين).

• اللغات — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) مقابل الكشف التلقائي عبر أكثر من 85 لغة مع التبديل في منتصف التدفق.

• طول الجلسة — لا يقيّده سوى وحدة معالجة الرسومات والذاكرة لديك، مقارنةً بحدّ أقصى صارم يبلغ 10 دقائق لكل جلسة مباشرة.

• التكلفة — {{1}}$0 للأوزان، حوالي 18 جيجابايت بصيغة bf16 للاستضافة الذاتية مقابل {{2}}تقريبًا $0.54 لكل ساعة صوتية على Live عند احتساب الرموز النصية الناتجة.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

ما معنى "البث" في كل جانب؟

الكلمة تخفي فرقًا تصميميًا حقيقيًا، ومن الجدير أن نكون دقيقين لأن النظامين لا يحاولان حتى إنتاج نفس الإيقاع. إعداد المعالج المسبق من Microsoft يجعل إيقاع VibeVoice ملموسًا: يصل الصوت بمعدل 24 كيلوهرتز ويُضغط 3,200 مرة إلى تيار رموز بمعدل 7.5 إطارًا في الثانية تقريبًا، ثم يعلن الإعداد عن كتلة من 22 إطارًا ونظرة استباقية من 4 إطارات — أي حوالي 2.9 ثانية من الصوت لكل كتلة مع ما يقارب نصف ثانية من الصوت المستقبلي لتثبيتها. يصدر النموذج النص مرة واحدة لكل كتلة محلولة، وتُحفظ سياقات الكتل السابقة عبر ذاكرة التخزين المؤقت KV، لذا لا تعيد الجلسة الطويلة الحساب من الصفر. ينمو النص الحرفي العملي بزيادات تبلغ نحو ثلاث ثوانٍ.

نقطة نهاية Google Live مصممة لحلقة تفاعلية أسرع: يتدفق الصوت عبر WebSocket في مقاطع PCM بتردد 16 أو 24 كيلوهرتز، وتعود النصوص الجزئية بشكل مستمر بينما المتحدث مستمر، ويصل النص المنسق النهائي بعد 0.40 ثانية من نهاية الكلام — وهذا الرقم هو قياس Artificial Analysis الذي تستشهد به Google. أما المفاضلات فهي سقف الجلسة (عشر دقائق من الصوت، وبعدها يجب على تطبيقك إعادة الاتصال وتجميع الأجزاء)، والميزات الإضافية المفقودة: لا يوجد فصل للمتحدثين ولا طوابع زمنية على مستوى الكلمة في مسار Live، وكلاهما موجود في Gemini 3.5 Transcribe الخاص بالتسجيلات المسبقة. إذن الخلاصة الصادقة هي أن نموذج البث من Google أسرع لكل نطق، بينما نموذج البث من Microsoft أبطأ لكل مقطع لكنه يدّعي توفير إسناد المتحدث الذي يسقطه مسار Live في Google، وبطول جلسة لا توفره Google.

الدقة: مُقاسة، مقارنةً بمساحة فارغة.

أكبر فجوة في هذه المواجهة هي فجوة في الأدلة، وليس بالضرورة في الجودة. قامت Artificial Analysis بقياس Gemini 3.5 Transcribe Live بمتوسط معدل خطأ في الكلمات يبلغ 4.0% في وضع البث المباشر، و2.6% في النموذج غير المباشر (non-streaming)، وقد احتل الأخير المرتبة الخامسة على لوحة صدارة معدل خطأ الكلمات (WER) عند الإطلاق؛ وتستشهد Google بشكل منفصل بنسبة 5.50% للبث و5.04% لغير البث على مجموعة FLEURS متعددة اللغات. اقرأ هذه الأرقام كما هي مصنّفة: Artificial Analysis مستقلة عن Google، لكن أرقام واجهة برمجة تطبيقات (API) عمرها يوم واحد لا تزال مبكرة، والعلاوة التي يدفعها البث مقابل النموذج الدفعي (batch model) — 4.0% مقابل 2.6% — هي الثمن المعتاد للتسليم في الوقت الفعلي.

لا يوجد لنموذج VibeVoice-ASR-Streaming-7B أي رقم مماثل في أي مكان. ترفق بطاقة النموذج رقم التقييم كصورة، والتقرير الفني لشركة Microsoft بصيغة PDF، لكن لا يقدم أيٌّ من المصدرين رقمًا نصيًا صريحًا لمعدل الخطأ في الكلمات (WER) أو زمن الاستجابة في وضع البث يمكن الاستشهاد به أو التحقق منه بشكل مستقل. المرساة الرقمية الوحيدة في العائلة بأكملها هي بطاقة نموذج VibeVoice-ASR بنمط المعالجة الدفعية (batch)، التي تذكر متوسط WER بنسبة 7.77% عبر ثماني مجموعات اختبار إنجليزية و2.20% على LibriSpeech clean — وهي أرقام خاصة بالنموذج غير البثي لا بهذا النموذج، ونماذج البث عادةً ما تقايض قليلًا من الدقة مقابل كسب زمن الاستجابة. وإلى أن يخضع checkpoint البث لتقييم عبر منصة عامة، فإن القول المنصف هو أن أحد جانبي هذه المقارنة مُقاس والآخر غير مُقاس.

التكلفة: واجهة برمجة تطبيقات تُحتسب حسب الاستخدام مقابل وحدة معالجة رسومية خصصت لها ميزانية مسبقًا

تسعّر Google نموذج Gemini 3.5 Transcribe Live حسب الرمز (Token)، وتحتسب الصوت بمعدل 25 رمزًا في الثانية. وفقًا لأسعار Live المنشورة — 3.50 دولار لكل مليون رمز صوتي، و21 دولارًا لكل مليون رمز نصي مخرَج — يبلغ متوسط تكلفة ساعة الصوت المدمجة حوالي 0.54 دولار، أي نحو 9 دولارات لكل 1,000 دقيقة صوتية، في حين أن النموذج المُسجَّل مسبقًا أقل تكلفة، إذ يبلغ سعره حوالي 0.30 دولار في الساعة. الصمت لا يكون مجانيًا إلا إذا لم يقم عميلك ببثّه: فعمليات إعادة الاتصال، والصوت المكرر، وتسجيل السجلات، كلها تضيف رموزًا محسوبة إلى الفاتورة الفعلية.

بدلاً من ذلك، يُسعَّر checkpoint من مايكروسوفت بساعات استخدام وحدات معالجة الرسوميات (GPU-hours). تبلغ أوزان bf16 وحدها نحو 18 جيجابايت قبل احتساب أي KV cache، والمسارات الموثّقة هي العروض التوضيحية بلغة بايثون في مستودع microsoft/VibeVoice وإضافة vLLM التي توفّر نقاط نهاية متوافقة مع WebSocket وOpenAI، ولا يوجد سعر استضافة لأنّه لا يوجد مزوّد يستضيف النموذج بعد — فهو غير متاح على Azure AI Foundry بالطريقة التي يتوفّر بها VibeVoice-ASR بالجملة منذ مارس. الاستضافة الذاتية لنموذج كلام-LLM من فئة 7B تعني تخصيص ميزانية لوحدة معالجة رسوميات من فئة 24 جيجابايت ووقت تشغيل خاص بك؛ في المقابل تحصل على مدة جلسة غير محدودة وأوزانًا تبقى ملكك. النموذجان ليسا متنافيين، وهذه هي نقطة القسم الأخير.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

إبقاء الخيار رخيصًا

الخيار الذي تختاره يعتمد على ما إذا كنت بحاجة إلى رقم أم رمز. اختر Gemini 3.5 Transcribe Live عندما تريد تفريغًا نصيًا يعمل اليوم بدقة منشورة وبدون GPU للتشغيل — وعندما لا يقتصر صوتك على عشر لغات، أو كنت مستعدًا لبناء تصنيف المتحدث بنفسك لأن نقطة نهاية Live لا توفّره. اختر VibeVoice-ASR-Streaming-7B عندما تستضيفه ذاتيًا، وعندما تكون مدة الجلسة غير المحدودة أو مخرجات البث المنسوبة إلى المتحدث المُعلن عنها أمرًا مهمًا، وعندما تكون مستعدًا لتشغيل بوابة التقييم الخاصة بك نظرًا لعدم وجود معيار مرجعي تعتمد عليه.

لا يلزم أن يكون أيٌّ من الخيارين دائمًا، وهنا موضع استحقاق طبقة التوجيه لوجودها — للنماذج المحيطة بالنص المكتوب، لا لعملية النسخ نفسها. لا تُوجّه OrcaRouter تحويلَ الكلام إلى نص اليوم، ولا يوجد أيٌّ من النماذج المذكورة في هذه الصفحة ضمن كتالوجها؛ بل إنها توفّر واجهة برمجة تطبيقات واحدة لأكثر من 200 نموذج لغوي تستهلك نصًا مكتوبًا مباشرًا — المُجمِّع، ومستخرِج بنود العمل، ومُخطِّط وكيل الصوت — بأسعار القائمة لدى المزوّد مع تمريرها دون أي زيادة، مع تجاوز تلقائي للفشل عبر المزوّدين. أي تخفيض سعري من مزوّد على أي نموذج في تلك الحزمة يسري في اليوم نفسه، لأن أسعار القائمة تُمرَّر كما هي بدلاً من إضافة هامش ربح. تبقى خطوة النسخ حيثما وضعتَها؛ أما الحزمة التي تتعامل مع النص المكتوب فهي بالضبط الطبقة التي تتكفّل بجعل نقطة تحقق عمرها أسبوع واحد وغير مُقيَّمة بالمعايير، بمفتاح واحد ومسار احتياطي، تتحول من رهان إلى خيار قابل للاختبار.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube