
VibeVoice-ASR-Streaming-1.5B مقابل Gemini 3.5 Transcribe: نظام التعرف على الكلام المتدفق الصامت من Microsoft ضد واجهة برمجة التطبيقات الجديدة من Google
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
{{1}}تفصل سبعة أيام وفجوة فلسفية واحدة بين أحدث نظامين لتحويل الكلام إلى نص في البث المباشر.{{/1}} {{2}}في 26 أغسطس 2026، أتاحت Google خدمة Gemini 3.5 Transcribe للمعاينة العامة: واجهة برمجة تطبيقات مستضافة ومغلقة لتحويل الكلام إلى نص، تُسعَّر لكل توكن صوتي، مع نقطة نهاية Live منفصلة للجلسات في الوقت الفعلي.{{/2}} {{3}}وفي 2 سبتمبر 2026، رفعت Microsoft Research نموذج VibeVoice-ASR-Streaming-1.5B إلى Hugging Face تحت مساحة اسم microsoft — أوزان مرخّصة بموجب MIT؛ لا بيان صحفي، ولا منشور إطلاق، ولا تغطية من أي طرف ثالث في أي مكان حتى وقت كتابة هذا المقال.{{/3}} {{4}}كلا النظامين يحوّل الكلام إلى نص أثناء وصوله.{{/4}} {{5}}أما كل شيء آخر تقريبًا عنهما — من يُسمح له بتشغيلهما، وما تكلفتهما، وما الدليل على أنهما يعملان — فمختلف.{{/5}}
تقارن هذه الصفحة بين المنتجين كما يوجدان فعليًا اليوم، ما يعني أن جانبيّ الأدلة غير متماثلين. Gemini 3.5 Transcribe هو منتج Google يعمل حاليًا، بأسعار توكنات منشورة وأرقام دقة مستقلة صادرة عن Artificial Analysis؛ وتلك هي الأرقام الموسومة بـ AA أدناه. أما VibeVoice-ASR-Streaming-1.5B فهو نقطة تحقق لا يتضمن نصُّ بطاقتها التعريفية أي معدل خطأ كلمات ولا أي رقم لزمن الاستجابة إطلاقًا — إذ إن تقييم البطاقة عبارة عن صورة، ولا يوجد حتى الآن عن عائلة نماذج البث سوى سطر إخباري واحد بتاريخ 3 سبتمبر في مستودع VibeVoice على GitHub الخاص بـ Microsoft. وكل ما يخص جانب Microsoft أدناه هو ما يمكن معرفته من المستودع: ملفات الإعدادات، والبطاقة التعريفية للنموذج، وتوثيق Microsoft الخاص بالبث. ولم يُقيَّم أيٌّ من ذلك بمعايير مستقلة بعد.
النموذجان في لمحة
• ما هو — VibeVoice-ASR-Streaming-1.5B: نقطة تحقق مفتوحة، رخصة MIT، استضافة ذاتية مقابل Gemini 3.5 Transcribe: واجهة برمجة تطبيقات مستضافة، أوزان مغلقة.
• الإصدار — أوزان في 2 سبتمبر 2026، وخط أخبار المستودع في 3 سبتمبر، مقابل المعاينة العامة في 26 أغسطس 2026 مع مواد الإطلاق الكاملة.
• شكل البث — يُصدر النص في دفعات تبلغ حوالي 2.9 ثانية مع نظرة استباقية تبلغ 0.5 ثانية، وتُحمل حالة الجلسة في ذاكرة تخزين مؤقتة للبادئة مقابل جلسة WebSocket المباشرة التي تُفوتر لكل رمز صوتي، مع حد أقصى يبلغ 10 دقائق من الصوت لكل جلسة.
• الدقة المنشورة — لا يوجد رقم WER أو زمن استجابة منشور كنص، بينما بلغ قياس AA 2.6% WER على الواجهة المسجلة مسبقًا و4.0% على الواجهة المباشرة.
• مخرج المتحدث — يزعم إسناد "من قال ماذا" أثناء البث المباشر (غير موثّق) مقابل عدم وجود تمييز للمتحدثين وعدم وجود طوابع زمنية على مستوى الكلمة في نقطة النهاية المباشرة.
• Hotwords — مدعومة، عبر نفس موجه السياق الخاص بـ VibeVoice-ASR للدفعات، بينما ليست ميزة مدرجة في نقطة النهاية Live.
• التكلفة — 0 دولار للأوزان، وحوالي 5.6 جيجابايت للاستضافة الذاتية، مقابل حوالي 0.30 دولار لكل ساعة صوتية بمعدل إجمالي على نقطة النهاية المسجلة مسبقًا، وحوالي 0.54 دولار على Live، وفقًا لأسعار التوكنات المدرجة من Google.

واجهة برمجة تطبيقات مستضافة ورفع هادئ، يفصل بينهما سبعة أيام
Gemini 3.5 Transcribe هو نموذج النسخ البديل من Google، ويُطرح في صورة منتجين. نقطة النهاية الخاصة بالتسجيلات المسبقة، التي تُقدَّم عبر Interactions API، تأخذ ملفًا صوتيًا كاملًا وتُعيد نصًا مكتوبًا مع الإضافات المتوقعة. نقطة النهاية المباشرة، gemini-3.5-transcribe-live، تعمل عبر WebSocket ثنائي الاتجاه، وهي التي تنافس VibeVoice-ASR-Streaming-1.5B في شكل المهمة: نسخ جلسة أثناء حدوثها. أعلنت Google عنه بالآلية المعتادة — إطلاق معاينة عامة في 26 أغسطس، والتسعير على صفحة النموذج، ولوحات متصدّرين من جهات خارجية تلتقطه خلال أيام.
لم يتضمن إصدار مايكروسوفت المباشر أيًا من ذلك. في 2 سبتمبر، أنشأ حساب Hugging Face التابع لمايكروسوفت نقطتي تفتيش في الدقيقة ذاتها: VibeVoice-ASR-Streaming-7B وVibeVoice-ASR-Streaming-1.5B. يسرد جدول النماذج في مستودع GitHub الآن VibeVoice-ASR-Streaming كأحد أفراد العائلة، ويحمل قسم الأخبار سطرًا بتاريخ 3 سبتمبر يعلن "نموذج تحويل كلام إلى نص (ASR) مباشر وموحّد ينسخ باستمرار من قال ماذا أثناء وصول الكلام، مع دعم لكلمات ساخنة مخصصة و10 لغات" — لكن هذا الإعلان يذكر الإصدار 7B، بينما الإصدار 1.5B هو الشقيق الأصغر الذي صدر معه دون أن يُشار إليه. وعندما تحققنا بعد يوم من الرفع، أظهرت نقطتا التفتيش صفر تنزيلات.

ما معنى "البث" في كل جانب؟
كلمة streaming تخفي فرقًا تصميميًا حقيقيًا. تهيئة المعالج المسبق من Microsoft تجعل إيقاع VibeVoice ملموسًا: يصل الصوت بمعدل 24 كيلوهرتز ويُضغط بنسبة 3,200× إلى تدفّق من رموز الكلام بمعدل نحو 7.5 هرتز (رمز واحد كل ~133 مللي ثانية). ثم تُعلن التهيئة أن حجم الدفعة (chunk) هو 22 إطارًا وأن النظرة المستقبلية (lookahead) هي 4 إطارات — أي نحو 2.9 ثانية من الصوت لكل دفعة، مع استخدام نحو نصف ثانية من الصوت المستقبلي لتثبيت المقطع الحالي. يُصدِر النموذج النص مرة واحدة لكل دفعة مكتملة، وتشير وثائق Microsoft إلى أن سياق الدفعات السابقة يُحفظ عبر ذاكرة التخزين المؤقت KV، لذا لا يُعاد الحساب من الصفر في جلسة طويلة. الحسابات مثبتة في التهيئة؛ والنتيجة العملية هي نص ينمو بزيادات تبلغ نحو ثلاث ثوانٍ، وليس بجزئيات لكل كلمة.
نقطة نهاية Live من Google هي نمط بث مختلف: جلسة WebSocket ثنائية الاتجاه يُحتسب الصوت فيها بمعدل 25 رمزًا صوتيًا في الثانية، وهي مصممة للاستخدام التفاعلي، لكنها محدودة بسقف 10 دقائق من الصوت لكل جلسة، كما أنها — تحديدًا على نقطة نهاية Live — بلا تمييز للمتحدثين أو طوابع زمنية على مستوى الكلمات. ولمن يقارن بين الاثنين كمحركي نسخ مباشر، فإن الفروق الجوهرية هي: سقف الجلسة (10 دقائق على جانب Google Live، بينما لا يخضع جانب Microsoft إلا لحدود كرت الشاشة والذاكرة لديك)، وإيقاع إصدار النتائج (مقاطع تبلغ نحو 3 ثوانٍ مقابل ما تقدمه جلسة WebSocket)، والمزايا الإضافية في المخرجات (إسناد الكلام إلى المتحدثين والكلمات المفتاحية (hotwords) المذكورة في بطاقة Microsoft، والغائبة عن قائمة ميزات Google Live).
الدقة: جانب واحد يحتوي على أرقام، والجانب الآخر يحتوي على صورة
هذه أوسع فجوة في المواجهة، وهي فجوة في الأدلة، وليست بالضرورة في الجودة. يقيس Artificial Analysis نموذج Gemini 3.5 Transcribe بمعدل خطأ في الكلمات يبلغ 2.6% على نقطة النهاية المسجلة مسبقًا، و4.0% على نقطة النهاية المباشرة — العلاوة التي تدفعها مقابل التسليم في الوقت الفعلي تظهر في معدل الخطأ، وهي مقايضة شائعة وصادقة للأنظمة المتدفقة. هذه أرقام من طرف ثالث على لوحة متصدرين محايدة، نُشرت بعد أيام من الإطلاق.
لا يوجد أي رقم قابل للمقارنة لنموذج VibeVoice-ASR-Streaming-1.5B في أي مكان. تأتي بطاقة النموذج مع شكل بياني لنتائج التقييم على هيئة صورة، لكن من دون أي WER أو RTF أو زمن استجابة رقمي في النص — لا شيء يمكن اقتباسه ولا شيء يمكن التحقق منه بشكل مستقل. لم تنشر Microsoft أرقام دقة البث في نص مكتوب لا لإصدار 7B ولا لإصدار 1.5B. الارتكاز الرقمي الوحيد في العائلة بأكملها هو بطاقة نموذج VibeVoice-ASR الدفعي، التي تذكر متوسط WER بنسبة 7.77% أجراه البائع عبر ثماني مجموعات اختبار إنجليزية و2.20% على LibriSpeech النظيفة — لكن ذلك يصف النموذج غير المتدفق، وعادةً ما تقايض نماذج البث قليلاً من الدقة مقابل كسب زمن الاستجابة. وحتى يُشغَّل نموذج البث عبر أداة اختبار عامة، يبقى الموقف الصادق أن نموذج Google مُقاس ونموذج Microsoft غير مُقاس.
التكلفة: لكل ساعة صوتية مقابل كل ساعة GPU
تبيع Google خدمة Gemini 3.5 Transcribe بالتوكن، وينقسم التسعير بوضوح بين نقطتي النهاية. تعرض نقطة نهاية التسجيلات المُسبقة دولارين لكل مليون توكن إدخال صوتي و12 دولارًا لكل مليون توكن إخراج نصي، وهو ما يعادل إجمالًا نحو 0.30 دولار لكل ساعة صوتية. بينما تعرض نقطة نهاية البث المباشر 3.50 دولار لكل مليون توكن صوتي و21 دولارًا لكل مليون توكن نصي — أي نحو 0.54 دولار لكل ساعة صوتية إجمالًا، أي أعلى بنحو 80% من نقطة نهاية التسجيلات المُسبقة، وهذا هو ثمن التسليم في الوقت الفعلي. تحتسب Google الصوت بمعدل 25 توكنًا في الثانية، لذا لا يكون الصمت مجانيًا إلا إذا لم يقم عميلك ببثّه؛ وقد تضيف عمليات إعادة الاتصال والصوت المكرّر وتسجيل السجلات جميعها إلى الفاتورة الفعلية. توجد طبقة مجانية، مع التنبيه إلى أن محتوى الطبقة المجانية قد يُستخدم لتحسين منتجات Google.

نموذج مايكروسوفت يُسعّر بدلاً من ذلك بساعات استخدام وحدات معالجة الرسوم (GPU-hours). نقطة التحقق 1.5B تزن تقريبًا 5.6 جيجابايت من أوزان bf16 (نواة لغة Qwen بحجم 1.5B بالإضافة إلى مُرمِّزات الصوت ورأس الانتشار — مجموع بيانات safetensors الوصفية يصل إلى حوالي 3B معاملًا)، والمسارات الموثَّقة لتشغيله هي الاستضافة الذاتية: العروض التوضيحية بلغة Python في مستودع microsoft/VibeVoice، أو إضافة vLLM التي تصفها مايكروسوفت لخدمة نقاط نهاية متوافقة مع OpenAI ونقاط نهاية WebSocket. لا يوجد سعر استضافة بعد، لأن أي مزوّد استدلال لا يدرج النموذج بعد. مسألة التكلفة برمّتها تتعلق بما إذا كان وقت وحدة معالجة الرسوم لديك أرخص من سعر غوغل بالساعة، وهو كذلك في الغالب لأي حجم نسخ مستمر — ومسألة الترخيص منفصلة عن مسألة التكلفة، لأن أوزان MIT ملك لك تحتفظ بها بطريقة لا يوفرها أي اشتراك في واجهة برمجة تطبيقات.
الأمران ليسا متنافيين في البنية الإنتاجية. النمط العملي لفريق يحتاج إلى النسخ الصوتي المباشر اليوم هو إبقاء طبقة التعرّف على الكلام خلف نقطة وصول واحدة بحيث يظل الخيار قابلاً للعكس: واجهة برمجية للتوجيه تقدّم أكثر من 200 نموذج بأسعار القوائم لدى المزوّد — دون أي هامش ربح، لذا فإن أي تغيير في أسعار البائع يصبح ساريًا في اليوم نفسه — مع تجاوز تلقائي للأعطال، وهي بالضبط الطبقة التي تتيح لك تشغيل واجهة Google المقاسة كخيار افتراضي بينما تختبر شريحة من الحركة الفعلية نموذج VibeVoice-ASR-Streaming-1.5B فور استضافته لدى أي مزوّد. هذا هو نموذج OrcaRouter، وهو الطريقة المنخفضة المخاطر لتبنّي نقطة فحص لم يتحقق أحد من دقتها بعد.
من الذي يجب أن يختار ماذا
اختر Gemini 3.5 Transcribe إذا كنت تريد واجهة برمجة تطبيقات للنسخ تعمل اليوم، بدقة معلنة، وتسعير متوقع لكل ساعة، دون الحاجة إلى مراقبة وحدة معالجة رسومية (GPU) — وخاصة إذا كان صوتك ليس ضمن اللغات العشر التي تدرجها Microsoft، أو إذا كنت تحتاج إلى ميزة تمييز المتحدثين (diarization) والطوابع الزمنية على مستوى الكلمة من نقطة نهاية الملفات المسجلة مسبقًا لنسخ الملفات. حدّ الجلسة المباشرة (Live) البالغ 10 دقائق هو قيد حقيقي يجب اختباره مع حالة الاستخدام الخاصة بك قبل الالتزام به للجلسات المباشرة.
اختر VibeVoice-ASR-Streaming-1.5B إذا كنت تستضيفه بنفسك، أو إذا كنت تريد الأوزان والتحكم في البيانات التي يوفرها ترخيص MIT، أو إذا كنت بحاجة إلى طول جلسة غير محدود، أو إذا كانت ميزات الإخراج المتدفق الذي يوضح من قال ماذا، والكلمات الساخنة، هي ميزات تريد تقييمها تحديدًا. خصّص ميزانيتك لتركيب من المصدر، وحوالي 5.6 جيجابايت من الأوزان على وحدة معالجة رسوميات NVIDIA، وبوابة تقييم خاصة بك — فلا يوجد معيار جاهز تعتمد عليه، لذا فإن مسألة الدقة مسؤوليتك أنت للإجابة عنها باستخدام ملفاتك الصوتية الخاصة.
خلاصة الأسبوع: أصدرت Google المنتج المُقيَّس، بينما أصدرت Microsoft الرهان المثير. يعد Gemini 3.5 Transcribe الخيار الافتراضي الأكثر أمانًا، وهو المدعوم بأرقام من جهات خارجية؛ أما VibeVoice-ASR-Streaming-1.5B فهو البديل المفتوح، القابل للاستضافة الذاتية، وغير المختبَر تمامًا. وما يجعل الاختيار رخيصًا هو أنه ليس نهائيًا — أبقِ نقطة نهاية ASR قابلة للتبديل، ويمكن لنموذج checkpoint يُطلق دون معيار مرجعي واحد أن يكسب حركة مرورك أو يخسرها استنادًا إلى أدلة نصوصك الخاصة.
