
VibeVoice-ASR-Streaming-1.5B مقابل Granite Speech 5.0 470M TurboCTC: الرهانان الهادئان في مجال البثّ عبر النماذج مفتوحة الأوزان
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
كان الإصداران الأكثر إثارة للاهتمام من نماذج التعرّف على الكلام بالتسلسل مفتوحة الأوزان في أواخر أغسطس 2026، قد صدرا دون أي حدث إطلاق. ففي 25 أغسطس، وضعت IBM نموذج Granite Speech 5.0 470M TurboCTC على منصة Hugging Face — أوزانًا وبطاقة نموذج ومنشور مدونة فقط، لا أكثر — وفي 2 سبتمبر، رفع باحثو Microsoft نموذج VibeVoice-ASR-Streaming-1.5B ضمن مساحة microsoft دون أي إعلان يتجاوز سطرًا إخباريًا في مستودع VibeVoice على GitHub. إنهما من نفس القالب لكنهما رهانان هندسيان متعاكسان: نموذج IBM هو مشفّر CTC نقي بعدد 470 مليون معامل، صُمم ليعمل بسرعات الحافة على جهاز محمول، بينما نموذج Microsoft هو نموذج لغوي كلامي من فئة 1.5 مليار معامل ملفوف بمحوِّلات رموز صوتية ورأس نشر — بإجمالي نحو ثلاثة مليارات معامل — صُمم لفهم الكلام بوصفه لغة أثناء تفريغه نصيًا.
قبل الأرقام، هناك تسميات المصادر التي تُبقِي هذا الطرح نزيهًا. كل ما يحمل وسم "مُبلَّغ من IBM" مأخوذ من بطاقة نموذج Granite Speech 5.0 470M TurboCTC ومن إدخالاته في لوحة Open ASR للتقييم، حيث شُغِّل عبر منصة التقييم الرسمية من قِبل IBM في يوم الإصدار، ولم تتم إعادة إنتاجه بشكل مستقل حتى الآن. أما كل ما يخص VibeVoice-ASR-Streaming-1.5B فيأتي من قراءة المستودع البرمجي — ملفات الإعدادات، وبطاقة النموذج، ووثائق Microsoft الخاصة بالبث — لأن Microsoft لم تنشر أي أرقام دقة أو زمن استجابة في نصوصها، ولم يقم أي شخص خارج Microsoft بقياس أداء هذا النموذج. ولم يعمل النموذجان في بيئة تقييم موحدة؛ إذ تقرأ هذه المقارنة كلاهما بالاستناد إلى الأدلة العامة نفسها، وهي كل ما قدّمته أي من الشركتين حتى الآن.
إصداران هادئان بفارق ثمانية أيام
وصل النموذجان بالطريقة غير الاحتفالية نفسها، وهذا يستحق الذكر بوضوح لأن أياً من الشركتين لم يقل الكثير منذ ذلك الحين. يُعدّ Granite Speech 5.0 470M TurboCTC من IBM العضو المرخّص بموجب Apache-2.0 ضمن إطلاقٍ بنسختين — إذ نشرت IBM أيضاً نسخةً شقيقة غير تجارية (-NC) بأرقام رئيسية أفضل قليلاً — وتحمل بطاقة نموذجه تاريخَ إصدار في 25 أغسطس 2026، مع دعم أصلي لمكتبة Transformers وتقديمٍ إلى لوحة Open ASR بتاريخ اليوم نفسه. أما زوج Microsoft الخاص بالبث، VibeVoice-ASR-Streaming-7B وVibeVoice-ASR-Streaming-1.5B، فقد أُنشئ على Hugging Face خلال الدقيقة نفسها في 2 سبتمبر؛ وسطر الأخبار على GitHub الذي يعلن عن «نموذج ASR بثّ موحّد يفرّغ باستمرار من قال ماذا مع وصول الكلام» مؤرّخ في 3 سبتمبر ويذكر النموذج 7B، تاركاً النموذج 1.5B المُغطّى هنا بوصفه الشقيق الأصغر الذي صدر بهدوء إلى جانبه.
الجزء المثير للاهتمام هو أن فريقين استخدما كلمة "streaming" وبنيا أمرين متعاكسين. Granite Speech 5.0 470M TurboCTC هو مُرمّز Conformer مدرَّب باستخدام CTC ويُفكَّك ترميزه في مرور واحد غير انحداري ذاتي — لا يوجد جهاز فك تشفير يولّد النص رمزًا بعد رمز، لذا فالنموذج رخيص من ناحية البنية وسريع من ناحية البنية. VibeVoice-ASR-Streaming-1.5B هو نموذج لغوي كبير للكلام: مُرمِّزان تلافيفيان يحوّلان الصوت بتردد 24 كيلوهرتز إلى تدفق رموز كلام بتردد ~7.5 هرتز، ثم يقرأه جهاز فك تشفير من عائلة Qwen2 (28 طبقة، 1,536 وحدة خفية — فئة 1.5B)، ويُنتج رأس الانتشار النص في أجزاء تبلغ نحو 2.9 ثانية مع نصف ثانية من الاستبصار تقريبًا. أحدهما سيارة سباق؛ والآخر نموذج لغوي صغير يستمع.
فحص المواصفات
• المعلمات — Granite Speech 5.0 470M TurboCTC: 470M، مُرمِّز فقط مقابل VibeVoice-ASR-Streaming-1.5B: ~3B إجمالًا (عمود فقري لنموذج لغوي من فئة 1.5B بالإضافة إلى مُقسِّمات الرموز ورأس الانتشار).
الهندسة المعمارية — مُرمِّز Conformer مع انتباه ذاتي قائم على الكتل وتهيئة ذاتية، مُدرَّب عبر CTC، وفك ترميز جشع غير ذاتي الانحدار مقابل مُرمِّزات مزدوجة صوتية/دلالية تُغذي مُفكك ترميز سببي من عائلة Qwen2 مع رأس انتشار DDPM.
• إيقاع الإخراج — حوالي 12.5 إطار إخراج في الثانية، مع تدفق مجزأ مقابل حوالي 7.5 هرتز لرموز الكلام، وإصدار نص لكل دفعة تبلغ حوالي 2.9 ثانية، باستباق يبلغ حوالي 0.5 ثانية.
• اللغات — الإنجليزية فقط مقابل عشر لغات: الصينية، الإنجليزية، الفرنسية، الألمانية، الإيطالية، اليابانية، الكورية، البرتغالية، الروسية، والإسبانية.
• الأوزان — حوالي 0.5 مليار معلمة / جزء صغير من غيغابايت، فئة الحافة مقابل ~5.6 غيغابايت bf16، فئة وحدات معالجة الرسومات NVIDIA.
• الدقة في المطبوعات — متوسط WER يبلغ نحو 5.00% كما أبلغت IBM على مجموعات Open ASR القصيرة مقابل عدم وجود رقم WER منشور في النص.
• الترخيص — Apache-2.0 مقابل MIT.
تم الإصدار — 25 أغسطس 2026 مقابل 2 سبتمبر 2026.

السرعة: أحدهما مبني ليكون صغيرًا، والآخر ليكون نموذج لغة.
يظهر الانقسام المعماري أولاً في السرعة والعتاد. تم تصميم Granite Speech 5.0 470M TurboCTC لأجهزة الكمبيوتر المحمولة والهواتف الذكية وغيرها من أجهزة الحافة. ولأن مُرمِّز CTC الخالص لا يأخذ عينات — فالإخراج هو مرور جشع واحد عبر رأس BPE مكوّن من 16,384 وحدة — فإن تشغيله غير مكلف للغاية، وتُبلغ بطاقة نموذج IBM عن رقم إنتاجية Open ASR مُقاسًا على H200 واحدة يصل إلى عشرات الآلاف من RTFx لخط TurboCTC، إلى جانب عرض تجريبي بتقنية WebGPU يقوم بالنسخ المباشر في علامة تبويب المتصفح. هذه الأرقام مقاسة من IBM وغير معاد إنتاجها، لكن النقطة البنيوية تظل قائمة بذاتها: مُرمِّز 470M بدون وحدة فك ترميز ذاتية الانحدار هو نموذج يمكنك تشغيله على عتاد يأتي به الهاتف.
يقدّم VibeVoice-ASR-Streaming-1.5B المقايضة المعاكسة. فوحدة فك الترميز فيه نموذج لغوي سببي، ما يعني أن النص يُولَّد عبر حلقة تكرار أثقل من أسلوب CTC argmax، والطرق الموثّقة لتشغيله تعتمد على استضافة ذاتية لوحدات NVIDIA الرسومية — عبر الأمثلة البرمجية بلغة Python في مستودع microsoft/VibeVoice أو ملحقه الخاص بـ vLLM — بوزن يبلغ نحو 5.6 غيغابايت بصيغة bf16 قبل احتساب أي ذاكرة KV مؤقتة. ولم تنشر Microsoft أي رقم عن الإنتاجية أو معامل الزمن الفعلي، فلا يوجد رقم منافس من البائع يمكن مقابلته بأرقام IBM. أمّا ما يوفره هذا البنيان القائم على نماذج اللغة فهو السياق: إذ يحمل النموذج فهماً للمتحدث والمحتوى عبر كامل النص كما تفعل نماذج اللغة، وهذا هو الفرق بين مجرد نسخ الصوت ومتابعة المحادثة.
الدقة: أحد الموردين طبع أرقامًا، والآخر طبع صورة.
بناءً على الأدلة، يتقدّم Granite Speech 5.0 470M TurboCTC على VibeVoice-ASR-Streaming-1.5B بفارق معيار كامل قابل للنشر. فقد قامت IBM بتشغيل نموذجها عبر المنصة الرسمية لمعيار Open ASR يوم الإصدار، وتُبلّغ عن متوسط معدل خطأ في الكلمات يبلغ نحو 5.00% على مجموعات اللغة الإنجليزية القصيرة العامة — وهو رقم مُقاسة من قِبل البائع، وغير مُتحقَّق منه من أي طرف ثالث، وغائب تمامًا عن الجانب الخاص بـ Microsoft في هذه المقارنة. كما أن بطاقة نموذج VibeVoice-ASR-Streaming-1.5B تعرض نتيجة تقييماتها كصورة دون أي رقم WER أو RTF أو كمون في النص؛ والمرجع الرقمي الوحيد في عائلة VibeVoice هو مُتوسط WER المذكور من قِبل البائع والبالغ 7.77% عبر ثماني مجموعات اختبار إنجليزية في بطاقة نموذج VibeVoice-ASR الدُفعي، وهو يصف النموذج غير المتدفّق ولا ينطبق على هذا السياق. وبغضّ النظر عن النتائج النهائية المستقلة، فإن الملخّص الصادق اليوم هو أن IBM نشرت رقمًا ونشرت Microsoft صورةً.

اللغات والمخرجات: الإنجليزية فقط مقابل من قال ماذا في عشر
{{1}}Granite Speech 5.0 470M TurboCTC{{/1}} يدعم الإنجليزية فقط، ويُرجِع نصًّا مفرَّغًا خامًا. ولا يُعَدُّ ذلك قصورًا بالنظر إلى أحمال العمل التي تستهدفها IBM — أي التفريغ النصي الإنجليزي للمؤسسات على أجهزة الحافة — لكنه يضع حدًّا للمقارنة بمجرد ألّا تكون المادة الصوتية بالإنجليزية. {{2}}VibeVoice-ASR-Streaming-1.5B{{/2}} يُدرج عشر لغات ويدّعي مخرجاتٍ متدفقةً منسوبةً إلى المتحدث: فتقول بطاقة النموذج إنه "يفرّغ باستمرارٍ من قال ماذا مع ورود الكلام"، مع تمرير hotwords الخاصة بمصطلحات المجال بوصفها موجهًا سياقيًا. والميزتان الإضافيتان معًا تستحقان قراءةً متشككة — ففصلُ المتحدثين تدفقيًا عبر حدود مقاطع الصوت صعبٌ فعلًا، وهذا الادعاءُ غيرُ مُتحقَّقٍ منه — لكنهما السببُ الذي يجعل أيَّ فريقٍ لديه اجتماعات مباشرة متعددة اللغات يلتفت إلى نموذج Microsoft أصلًا.
الترخيص والنظام البيئي: Apache-2.0 مقابل MIT، Transformers مقابل مستودع بحثي
كلا الترخيصين يسمحان بالاستخدام التجاري، وهو ما يميّز هذا الثنائي بالفعل عن نسخة -NC الخاصة بشركة IBM من البنية نفسها. نموذج Granite Speech 5.0 470M TurboCTC مرخّص بموجب Apache-2.0 مع شرط منح براءات الاختراع المعتاد، وهو مدعوم بشكل أصلي في Hugging Face Transformers (AutoModelForCTC من transformers >= 5.16) بالإضافة إلى mlx-audio لأجهزة Apple Silicon — أي أنه يعمل أينما يعمل أكبر مجتمع نشر في هذه البيئة، على أجهزة أي بائع. أما VibeVoice-ASR-Streaming-1.5B فهو مرخّص بموجب MIT، وهو ترخيص أبسط من حيث الصياغة، لكن مسار تقديمه إعداد بحثي من المصدر: فئة البنية الخاصة بنقطة التحقق، VibeVoiceForASRStreamingTraining، غير موثقة في وثائق Transformers العامة، وتشير وثائق البث الرسمية من Microsoft إلى الكود التجريبي في المستودع وإلى إضافة vLLM بدلاً من التحميل من مكتبة جاهزة. بالنسبة لفريق الإنتاج، الفرق ملموس: أحد النموذجين يُدمج اليوم مباشرة في خط أنابيب Transformers قائم، والآخر يطلب منك إنشاء مستودع بحثي والتحقق من مسار التحميل بنفسك.

أي إصدار هادئ يجب عليك تقييمه؟
قيّم Granite Speech 5.0 470M TurboCTC أولاً إذا كانت مهامك باللغة الإنجليزية، وكان جهازك من فئة الحافة أو مقيدًا بوحدة المعالجة المركزية، وتريد نموذجًا يندمج مع Transformers مع رقم على البطاقة للتحقق منه. إنه الخيار الأقل خطورة في كل جانب باستثناء واحد — فهو لن يساعدك في لغة ثانية أو في تفريغ اجتماع مباشر يحتاج إلى معرفة من المتحدث.
قم بتقييم VibeVoice-ASR-Streaming-1.5B إذا كنت تحتاج إلى بثّ متعدد اللغات، أو إذا كانت مخرجات "من قال ماذا" أو الكلمات الساخنة من الميزات التي ترغب في اختبارها، أو إذا كنت تفضّل المراهنة على نهج قائم على نماذج اللغة في التعرّف على الكلام بدلًا من الاعتماد على مشفّر خالص. خصّص ميزانية لوحدة معالجة رسومية من NVIDIA، وللتثبيت من المصدر، ولنحو 5.6 جيجابايت من الأوزان، ولتقييم تصمّمه بنفسك، لأنه لا أحد — بما في ذلك Microsoft — نشر بعدُ رقمًا يمكنك الاعتماد عليه.
ما لا تغيّره أيٌّ من الإصدارات الهادئة هو قيمة إبقاء طبقة ASR قابلة للاستبدال بينما تكتشف أيُّ الرهانات يُثمر. كلا النموذجين حديثان، ولا يُقدَّم أيٌّ منهما عبر OrcaRouter حتى وقت كتابة هذه السطور؛ فعندما يستضيف مزوّدٌ أيًّا منهما، تكون الطريقة منخفضة المخاطر لتجربته خلف طبقة توجيه تتصدّر أكثر من 200 نموذج بسعر القائمة لدى المزوّد — دون أي هامش ربح، فتظهر تغييرات الأسعار في اليوم نفسه — مع تجاوز تلقائي إلى ما تثق به بالفعل. وجّه جزءًا من الصوت الفعلي إلى النموذج الجديد، واقرأ نصوص التفريغ، ودع حركة المرور الخاصة بك — لا ورقة المعايير الصادرة يوم الإطلاق — تقرر أيُّ رهان هادئ كان هو الصحيح.
