
VibeVoice-ASR-Streaming-7B مقابل Gemini 3.5 Transcribe Live: أسبوع واحد، نوعان من تحويل الكلام إلى نص بالبث المباشر
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
أنتج الأسبوع الأخير من أغسطس وأوائل أيام سبتمبر 2026 نظامين للتعرف على الكلام وتحويله إلى نص بشكل متدفق يبدوان كمنافسين، لكنهما في الحقيقة إجابتان مختلفتان على السؤال نفسه. في 26 أغسطس، طرحت Google إصدار Gemini 3.5 Transcribe Live للمعاينة العامة: نقطة نهاية مستضافة ومغلقة للتعرف على الكلام وتحويله إلى نص، تعيد نصًا مكتملًا بعد 0.40 ثانية من توقف المتحدث عن الكلام، مدعومة بمعدل خطأ كلمات متدفق مُقاس قدره 4.0% من Artificial Analysis ومواد إطلاق كاملة. وفي 2 سبتمبر، رفعت Microsoft Research نموذج VibeVoice-ASR-Streaming-7B إلى Hugging Face تحت مساحة microsoft: أوزان مفتوحة مرخصة بترخيص MIT، دون بيان صحفي أو صفحة إطلاق، وبطاقة نموذج لا تنشر أي معدل خطأ كلمات أو رقم زمن استجابة في نص قابل للقراءة إطلاقًا. كلاهما يقبل الصوت بينما ما يزال قادمًا. وهذا هو الشيء الوحيد المشترك بينهما تقريبًا.
أدلة الجانبين غير متكافئة، لذا تُكتب هذه المقارنة على أساس «ما نعرفه حتى الآن». Gemini 3.5 Transcribe Live منتج من Google له أسعار رموز منشورة وقياسات من جهات خارجية، وهذه موضَّحة أدناه. VibeVoice-ASR-Streaming-7B نقطة تحقق تُقرأ كل ادعاءاتها من المستودع نفسه: ملفات الإعداد، وبطاقة النموذج، وتوثيق Microsoft للبث المتدفق في مستودع VibeVoice على GitHub. لم يخضع أي جانب من جوانب Microsoft بعد لتقييم مستقل، ونحن نصرّح بذلك في كل موضع قد يوحي فيه رقمٌ بغير ذلك.
مسار الإصدار: إطلاق API ورفع هادئ
أطلقت Google نموذج Gemini 3.5 Transcribe Live بالطريقة المعتادة. يندرج النموذج تحت لافتة Gemini Audio إلى جانب شقيقه Gemini 3.5 Transcribe (مسار واجهة برمجة تطبيقات Interactions للملفات المسجلة مسبقًا)، والأسعار معروضة على صفحة النموذج، وقد رصدت لوحات المتصدرين المستقلة نقطة نهاية Live خلال أيام — ومن هنا يأتي معدل WER للبث المباشر البالغ 4.0% وزمن الاستجابة النهائي البالغ 0.40 ثانية. توجد طبقة مجانية، مع التحذير المعتاد بأن محتوى الطبقة المجانية قد يُستخدم لتحسين منتجات Google.
لم يتضمن الإصدار المتدفق من Microsoft أيًّا من تلك الآليات. تم إنشاء مستودع Hugging Face باسم microsoft/VibeVoice-ASR-Streaming-7B في 2026-09-02 الساعة 15:46 بالتوقيت العالمي المنسق (UTC)، وآخر تعديل عليه كان بعد ثلاث دقائق؛ ويحتوي على ثماني شرائح من نوع safetensors، ومُرمِّز (tokenizer)، وإعدادات معالج مسبق بموجب ترخيص MIT. السجل الرسمي هو سطر في سجل الأخبار مؤرخ في 3 سبتمبر في مستودع microsoft/VibeVoice يعلن عن "نموذج ASR متدفق موحّد ينسخ باستمرار من قال ماذا فور وصول الكلام، مع دعم كلمات مخصصة و10 لغات"، مع روابط إلى عرض توضيحي على الرابط aka.ms/vibeasr وتقرير تقني عن التدفق. عندما تحققنا بعد يوم من الرفع، كان checkpoint لا يزال يعرض صفر تنزيلات، ولا يدرجه أي مزود استدلال مستضاف. بطاقة النموذج تقول أكثر مما يقوله الإعلان، والمستودع هو مصدر كل ما يلي تقريبًا.

المواصفات جنبًا إلى جنب
• ما هو — VibeVoice-ASR-Streaming-7B: تعرّف تلقائي على الكلام (ASR) تدفقي مفتوح الأوزان، مستضاف ذاتيًا مقابل Gemini 3.5 Transcribe Live: واجهة برمجة تطبيقات (API) تدفقية مستضافة، بأوزان مغلقة.
نمط التدفق — يُصدر نصًا على دفعات تبلغ مدتها حوالي 2.9 ثانية، مع ما يقارب 0.5 ثانية من الاستباق (مشتق من إعدادات نقطة التحقق)، مقارنة بجلسة WebSocket ثنائية الاتجاه تقدّم نصوصًا جزئية مستمرة، ونتيجة نهائية بعد 0.40 ثانية من توقف المتحدث.
الدقة المنشورة — لا يُنشر أي رقم WER أو زمن استجابة كنص، مقابل 4.0% WER للبث المباشر و2.6% على النموذج المُسجَّل مسبقًا، وفقًا لتحليل Artificial Analysis.
• المتحدثون — يدّعي توفير إسناد من قال ماذا في البث المباشر (غير مُتحقق منه)، في حين لا يوجد فصل للمتحدثين على نقطة النهاية المباشرة (الميزة متاحة على النموذج المُسجَّل مسبقًا لما يصل إلى ثلاثة متحدثين).
• اللغات — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) مقابل الكشف التلقائي عبر أكثر من 85 لغة مع التبديل في منتصف التدفق.
• طول الجلسة — لا يقيّده سوى وحدة معالجة الرسومات والذاكرة لديك، مقارنةً بحدّ أقصى صارم يبلغ 10 دقائق لكل جلسة مباشرة.
• التكلفة — {{1}}$0 للأوزان، حوالي 18 جيجابايت بصيغة bf16 للاستضافة الذاتية مقابل {{2}}تقريبًا $0.54 لكل ساعة صوتية على Live عند احتساب الرموز النصية الناتجة.

ما معنى "البث" في كل جانب؟
الكلمة تخفي فرقًا تصميميًا حقيقيًا، ومن الجدير أن نكون دقيقين لأن النظامين لا يحاولان حتى إنتاج نفس الإيقاع. إعداد المعالج المسبق من Microsoft يجعل إيقاع VibeVoice ملموسًا: يصل الصوت بمعدل 24 كيلوهرتز ويُضغط 3,200 مرة إلى تيار رموز بمعدل 7.5 إطارًا في الثانية تقريبًا، ثم يعلن الإعداد عن كتلة من 22 إطارًا ونظرة استباقية من 4 إطارات — أي حوالي 2.9 ثانية من الصوت لكل كتلة مع ما يقارب نصف ثانية من الصوت المستقبلي لتثبيتها. يصدر النموذج النص مرة واحدة لكل كتلة محلولة، وتُحفظ سياقات الكتل السابقة عبر ذاكرة التخزين المؤقت KV، لذا لا تعيد الجلسة الطويلة الحساب من الصفر. ينمو النص الحرفي العملي بزيادات تبلغ نحو ثلاث ثوانٍ.
نقطة نهاية Google Live مصممة لحلقة تفاعلية أسرع: يتدفق الصوت عبر WebSocket في مقاطع PCM بتردد 16 أو 24 كيلوهرتز، وتعود النصوص الجزئية بشكل مستمر بينما المتحدث مستمر، ويصل النص المنسق النهائي بعد 0.40 ثانية من نهاية الكلام — وهذا الرقم هو قياس Artificial Analysis الذي تستشهد به Google. أما المفاضلات فهي سقف الجلسة (عشر دقائق من الصوت، وبعدها يجب على تطبيقك إعادة الاتصال وتجميع الأجزاء)، والميزات الإضافية المفقودة: لا يوجد فصل للمتحدثين ولا طوابع زمنية على مستوى الكلمة في مسار Live، وكلاهما موجود في Gemini 3.5 Transcribe الخاص بالتسجيلات المسبقة. إذن الخلاصة الصادقة هي أن نموذج البث من Google أسرع لكل نطق، بينما نموذج البث من Microsoft أبطأ لكل مقطع لكنه يدّعي توفير إسناد المتحدث الذي يسقطه مسار Live في Google، وبطول جلسة لا توفره Google.
الدقة: مُقاسة، مقارنةً بمساحة فارغة.
أكبر فجوة في هذه المواجهة هي فجوة في الأدلة، وليس بالضرورة في الجودة. قامت Artificial Analysis بقياس Gemini 3.5 Transcribe Live بمتوسط معدل خطأ في الكلمات يبلغ 4.0% في وضع البث المباشر، و2.6% في النموذج غير المباشر (non-streaming)، وقد احتل الأخير المرتبة الخامسة على لوحة صدارة معدل خطأ الكلمات (WER) عند الإطلاق؛ وتستشهد Google بشكل منفصل بنسبة 5.50% للبث و5.04% لغير البث على مجموعة FLEURS متعددة اللغات. اقرأ هذه الأرقام كما هي مصنّفة: Artificial Analysis مستقلة عن Google، لكن أرقام واجهة برمجة تطبيقات (API) عمرها يوم واحد لا تزال مبكرة، والعلاوة التي يدفعها البث مقابل النموذج الدفعي (batch model) — 4.0% مقابل 2.6% — هي الثمن المعتاد للتسليم في الوقت الفعلي.
لا يوجد لنموذج VibeVoice-ASR-Streaming-7B أي رقم مماثل في أي مكان. ترفق بطاقة النموذج رقم التقييم كصورة، والتقرير الفني لشركة Microsoft بصيغة PDF، لكن لا يقدم أيٌّ من المصدرين رقمًا نصيًا صريحًا لمعدل الخطأ في الكلمات (WER) أو زمن الاستجابة في وضع البث يمكن الاستشهاد به أو التحقق منه بشكل مستقل. المرساة الرقمية الوحيدة في العائلة بأكملها هي بطاقة نموذج VibeVoice-ASR بنمط المعالجة الدفعية (batch)، التي تذكر متوسط WER بنسبة 7.77% عبر ثماني مجموعات اختبار إنجليزية و2.20% على LibriSpeech clean — وهي أرقام خاصة بالنموذج غير البثي لا بهذا النموذج، ونماذج البث عادةً ما تقايض قليلًا من الدقة مقابل كسب زمن الاستجابة. وإلى أن يخضع checkpoint البث لتقييم عبر منصة عامة، فإن القول المنصف هو أن أحد جانبي هذه المقارنة مُقاس والآخر غير مُقاس.
التكلفة: واجهة برمجة تطبيقات تُحتسب حسب الاستخدام مقابل وحدة معالجة رسومية خصصت لها ميزانية مسبقًا
تسعّر Google نموذج Gemini 3.5 Transcribe Live حسب الرمز (Token)، وتحتسب الصوت بمعدل 25 رمزًا في الثانية. وفقًا لأسعار Live المنشورة — 3.50 دولار لكل مليون رمز صوتي، و21 دولارًا لكل مليون رمز نصي مخرَج — يبلغ متوسط تكلفة ساعة الصوت المدمجة حوالي 0.54 دولار، أي نحو 9 دولارات لكل 1,000 دقيقة صوتية، في حين أن النموذج المُسجَّل مسبقًا أقل تكلفة، إذ يبلغ سعره حوالي 0.30 دولار في الساعة. الصمت لا يكون مجانيًا إلا إذا لم يقم عميلك ببثّه: فعمليات إعادة الاتصال، والصوت المكرر، وتسجيل السجلات، كلها تضيف رموزًا محسوبة إلى الفاتورة الفعلية.
بدلاً من ذلك، يُسعَّر checkpoint من مايكروسوفت بساعات استخدام وحدات معالجة الرسوميات (GPU-hours). تبلغ أوزان bf16 وحدها نحو 18 جيجابايت قبل احتساب أي KV cache، والمسارات الموثّقة هي العروض التوضيحية بلغة بايثون في مستودع microsoft/VibeVoice وإضافة vLLM التي توفّر نقاط نهاية متوافقة مع WebSocket وOpenAI، ولا يوجد سعر استضافة لأنّه لا يوجد مزوّد يستضيف النموذج بعد — فهو غير متاح على Azure AI Foundry بالطريقة التي يتوفّر بها VibeVoice-ASR بالجملة منذ مارس. الاستضافة الذاتية لنموذج كلام-LLM من فئة 7B تعني تخصيص ميزانية لوحدة معالجة رسوميات من فئة 24 جيجابايت ووقت تشغيل خاص بك؛ في المقابل تحصل على مدة جلسة غير محدودة وأوزانًا تبقى ملكك. النموذجان ليسا متنافيين، وهذه هي نقطة القسم الأخير.

إبقاء الخيار رخيصًا
الخيار الذي تختاره يعتمد على ما إذا كنت بحاجة إلى رقم أم رمز. اختر Gemini 3.5 Transcribe Live عندما تريد تفريغًا نصيًا يعمل اليوم بدقة منشورة وبدون GPU للتشغيل — وعندما لا يقتصر صوتك على عشر لغات، أو كنت مستعدًا لبناء تصنيف المتحدث بنفسك لأن نقطة نهاية Live لا توفّره. اختر VibeVoice-ASR-Streaming-7B عندما تستضيفه ذاتيًا، وعندما تكون مدة الجلسة غير المحدودة أو مخرجات البث المنسوبة إلى المتحدث المُعلن عنها أمرًا مهمًا، وعندما تكون مستعدًا لتشغيل بوابة التقييم الخاصة بك نظرًا لعدم وجود معيار مرجعي تعتمد عليه.
لا يلزم أن يكون أيٌّ من الخيارين دائمًا، وهنا موضع استحقاق طبقة التوجيه لوجودها — للنماذج المحيطة بالنص المكتوب، لا لعملية النسخ نفسها. لا تُوجّه OrcaRouter تحويلَ الكلام إلى نص اليوم، ولا يوجد أيٌّ من النماذج المذكورة في هذه الصفحة ضمن كتالوجها؛ بل إنها توفّر واجهة برمجة تطبيقات واحدة لأكثر من 200 نموذج لغوي تستهلك نصًا مكتوبًا مباشرًا — المُجمِّع، ومستخرِج بنود العمل، ومُخطِّط وكيل الصوت — بأسعار القائمة لدى المزوّد مع تمريرها دون أي زيادة، مع تجاوز تلقائي للفشل عبر المزوّدين. أي تخفيض سعري من مزوّد على أي نموذج في تلك الحزمة يسري في اليوم نفسه، لأن أسعار القائمة تُمرَّر كما هي بدلاً من إضافة هامش ربح. تبقى خطوة النسخ حيثما وضعتَها؛ أما الحزمة التي تتعامل مع النص المكتوب فهي بالضبط الطبقة التي تتكفّل بجعل نقطة تحقق عمرها أسبوع واحد وغير مُقيَّمة بالمعايير، بمفتاح واحد ومسار احتياطي، تتحول من رهان إلى خيار قابل للاختبار.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
