بطاقة عنوان رئيسية لـ Granite Speech 5.0 470M TurboCTC، تعرض أيقونة موجة صوتية، وشارة مكتوبًا فيها 12,600 RTFx على 1 H200، وملصقات مكتوبًا فيها 470M معلمة، وCTC بالمشفّر فقط، وApache 2.0، وعنوانًا فرعيًا 'نظام IBM للتعرف على الكلام باللغة الإنجليزية بموجب Apache-2.0'، وتذييلًا مكتوبًا فيه "صدر في 25 أغسطس 2026"، وشعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: نظام التعرف على الكلام من IBM المرخّص بـ Apache-2.0 يدّعي تحقيق 12,600 RTFx

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نموذج Granite Speech 5.0 470M TurboCTC هو النموذج في الإصدار الصوتي الجديد من IBM الذي يُسمح لك فعليًا بشحنه، وهذا أول ما يجب معرفته عنه. وضعت IBM نقطتي فحص للتعرف على الكلام باللغة الإنجليزية على Hugging Face في 25 أغسطس 2026 — Granite Speech 5.0 470M TurboCTC بموجب Apache 2.0 وGranite Speech 5.0 470M TurboCTC-NC بموجب ترخيص CC-BY-NC-SA-4.0 غير التجاري. نفس البنية ذات 470 مليون معامل، بيانات مختلفة، ترخيصان متعاكسان. نموذج Apache هو الذي تشير إليه IBM لـ"حالات استخدام أخرى" — وهي لغة البائعين للإنتاج التجاري — وهو أيضًا الذي يحمل الرقم الأبرز: تبلغ IBM عن إنتاجية إجمالية تتجاوز 12,600 RTFx على وحدة NVIDIA H200 واحدة، وهو ما تترجمه إلى أكثر من ثلاث ساعات ونصف من الصوت الإنجليزي تُنسخ في الثانية باستخدام الاستدلال بالدفعات.

رقم السرعة هذا هو ادعاء من البائع عمره يوم واحد ولم يعِد أي طرف ثالث إنتاجه، لذا اقرأه كرقم نظري قوي وليس كحقيقة مدققة. السبب في أنه يستحق انتباهك على أي حال هو التصميم الذي يقف خلفه: Granite Speech 5.0 TurboCTC يستغني عن مفكك ترميز نموذج اللغة الذي استخدمته جميع نماذج Granite Speech السابقة، تاركًا مشفر Conformer نقيًا مدرَّبًا بالتصنيف الزمني الترابطي (CTC) ومفكك الترميز بشكل غير تتابعي ذاتي. عدم وجود حلقة توليد رمزًا برمز هو ما يجعل نموذجًا بمعاملات 470M يدّعي إنتاجية تتغلب على نماذج أكبر منه بعدة مرات — ولهذا تهم هذه النسخة أي شخص يبني تحويل الكلام إلى نص، وليس فقط لجدول المعايير.

ما الذي تم شحنه فعليًا

نقطتا فحص، كلتاهما صدرت في 25 أغسطس 2026 على منظمة ibm-granite على Hugging Face، وكلاهما نموذج ASR بالإنجليزية فقط بنفس البنية التي تعتمد على الترميز فقط:

• Granite Speech 5.0 470M TurboCTC — Apache 2.0، يُسمح بالاستخدام التجاري، تم تدريبه على حوالي 60,000 ساعة من الصوت الإنجليزي.

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0، للاستخدام البحثي وغير التجاري فقط، مُدرَّب على حوالي 75,000 ساعة من الصوتيات الإنجليزية.

تتناول هذه المقالة نموذج Apache — النموذج الذي يمكن لمنتج أن يعتمد عليه قانونيًا — مع الإشارة إلى التوأم -NC حيثما تتطلب قصة الترخيص ذلك. تأتي نقاط التفتيش كلاهما بصيغة safetensors في F32 وBF16، وكلاهما مدعوم أصليًا في Hugging Face Transformers عبر AutoModelForCTC وAutoProcessor. تظهر هذه الميزة في إصدار Transformers القادم؛ وحتى ذلك الحين، يمكنك تثبيت Transformers من المصدر، وتحميل المعالج والنموذج، وتشغيل فك الترميز الجشع. كما تقدم IBM رابطًا لعرض توضيحي للبث عبر WebGPU قائم على المتصفح، وهو أسرع طريقة لسماع مدى انخفاض زمن الاستجابة في الواقع.

رهان البنية: مُشفِّر بلا مُشفِّر عكسي، 12.5 رمزًا في الثانية.

التغيير في التصميم هو القصة وراء ادعاء السرعة. في الإصدارات السابقة من Granite Speech، كان يتم إقران مُرمِّز صوتي بمُسقِط ومُفكك ترميز لنموذج اللغة، وهذا الأخير هو ما تم إسقاطه. Granite Speech 5.0 470M TurboCTC هو مُرمِّز Conformer من 16 طبقة تم تدريبه باستخدام CTC، والاستدلال يتم عبر تمريرة جشعة واحدة غير ذاتية الانحدار. لا يوجد شيء لأخذ عينات منه، لذلك لا يوجد زمن انتظار للتوليد.

ثلاث تفاصيل في الإعداد تجعلها سريعة وليست صغيرة فقط.

• الاختزال الزمني بعامل 8. تعمل الواجهة الأمامية بمعدل 100 إطار في الثانية؛ بينما ينتج النموذج 12.5 رمزًا في الثانية. يؤدي تكديس إطارات log-mel وتخطيها، ثم الالتفافات المخططة والبقايا المجمّعة في أول كتلتين من Conformer، إلى خفض معدل الإخراج عبر ثلاث مراحل 2x.

• مفردات كلمات فرعية بدلاً من الأحرف. كانت مُرمِّزات Granite Speech السابقة تُصدر 50 حرفًا في الثانية؛ بينما يُصدر الإصدار 5.0 12.5 رمزًا فرعيًا في الثانية من مفردات BPE مكونة من 16,384 وحدة (SentencePiece في متغير -NC). عدد أقل من وحدات الإخراج لكل ثانية من الصوت يعني أن وحدة فك ترميز CTC لديها قرارات أقل لاتخاذها.

• CTC مشروطة ذاتيًا. تعمل طبقة Conformer الوسطى على صقل التمثيلات الوسيطة الخاصة بالنموذج نفسه، وهذه هي الحيلة التي تسمح لمشفر صغير بالحفاظ على دقته في غياب وحدة فك الترميز.

كل ذلك موجود في بطاقة النموذج والوثيقة الفنية لشركة IBM، وخلاصته نقطة فحص مصممة لأجهزة الحاسوب المحمولة والهواتف وخطوط معالجة البيانات المتدفقة حيث لا تتسع وحدة فك ترميز ذاتية الانحدار ثقيلة — فتموضع النموذج على الحافة واضح في وصف IBM نفسه.

الأرقام التي تزعمها IBM

كل ما ورد في هذا القسم مبلّغ عنه من IBM، وقد شُغّل عبر الأدوات العامة للوحة متصدرة Open ASR على بنية Hugging Face التحتية حتى 25 أغسطس 2026، ولم يُعاد إنتاجه بشكل مستقل. تعامل مع هذه الأرقام باعتبارها أرقام بائع تبدو موثوقة، لا كحقيقة ثابتة:

• الإنتاجية — أكثر من 12,600 RTFx على معالج NVIDIA H200 واحد مع الاستدلال المجمّع (batched inference)، وهو ما يساوي عند IBM أكثر من 3.5 ساعات من الصوت في الثانية. وتضيف IBM أن هذا يفوق إنتاجية نماذج Granite Speech السابقة بأكثر من 20 ضعفًا. وهذا رقم خاص بمعالجات الرسوميات في مراكز البيانات مع الاستدلال المجمّع، وليس ما ستحصل عليه من كمبيوتر محمول.

• {{1}}الدقة{{/1}} — معدل خطأ كلمات إجمالي بنسبة 5.00% لنموذج Apache على مجموعات اختبار اللغة الإنجليزية القصيرة العامة في لوحة Open ASR المتصدرة (تحقق النسخة {{2}}-NC{{/2}} نتيجة 4.85% على نفس المجموعات). تم تنفيذ الاستدلال عبر البنية التحتية للوظائف في Hugging Face وتقييمه باستخدام أدوات اللوحة، لذا {{3}}تتوقع IBM أن تطابق هذه النتائج الجدول الرسمي{{/3}} بمجرد دمج النماذج الجديدة فيه.

الحقل البعيد — على لوحة متصدرّي FFASR للضوضاء والصدى، يحتل نموذج Apache المرتبة التاسعة في الدقة، ونموذج -NC المرتبة الخامسة، وهما الأسرع على تلك اللوحة (الإنتاجية مُقاسة على NVIDIA L4 واحدة).

• التدريب — ما يقارب ٦٠,٠٠٠ ساعة من الصوت الإنجليزي العام لنموذج Apache، أُنجز في عشرة أيام على ثماني وحدات NVIDIA H100s في عنقود Blue Vela التابع لشركة IBM.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

ما الذي تمنحك إياه رخصة Apache 2.0 فعليًا

الترخيص هو ما يجعل هذا الإصدار غير معتاد. نماذج الكلام مفتوحة الأوزان غالبًا ما تُطرح بموجب تراخيص بحثية أو مع التزامات تجعل القسم القانوني في فريق الإنتاج يتردد؛ هنا، النسخة القابلة للاستخدام تجاريًا هي التي سجّلت فيها IBM دقة أقل قليلًا. {{1}}تستبدل 0.15 نقطة من معدل الخطأ في الكلمات الإجمالي (5.00% مقابل 4.85%){{/1}} مقابل الحق في النشر في منتج، وتحقيق أرباح من المخرجات، وضبط النموذج بدقة والاحتفاظ بأوزانك المشتقة لنفسك، واستخدامه في البنية التحتية السحابية دون أي بند يقيّد الاستخدام بالبحث فقط في طريقك.

من السهل أن تتم هذه الصفقة في الاتجاه الخاطئ إذا كنت تطارد قائمة الصدارة. نسبة 4.85% لنموذج -NC تأتي من حوالي 15,000 ساعة إضافية من بيانات التدريب (GigaSpeech وSPGI Speech)، وهو الإصدار الذي تصفه IBM حرفيًا بأنه "لأغراض البحث والأغراض غير التجارية فقط." إنه نموذج معياري جيد ولكنه اعتماد سيئ كمنتج. يفقد نموذج Apache قليلًا من الدقة ويكتسب القدرة على أن يكون أساسًا لخط أنابيب النسخ التجاري، أو نظام ضمان جودة لمراكز الاتصال، أو جهازًا طرفيًا. إذا كنت تقيّم هذه العائلة، فإن قرار الترخيص يأتي قبل قرار المعيار.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

ما الذي تتخلى عنه

التخلي عن نموذج اللغة ليس مجانيًا، وبطاقة النموذج صادقة بشأن هذه التخفيضات:

• لا توجد ترجمة للكلام. كانت أجيال Granite Speech السابقة قادرة على المرور عبر نموذج لغوي للترجمة أثناء النسخ؛ أما الإصدار 5.0 فهو للنسخ فقط.

• لا تحيز للكلمات المفتاحية. كما كان نموذج اللغة يتعامل مع التحيز نحو مصطلحات المجال والأسماء؛ وبدونه، تحصل على ما تنتجه مفردات الوحدات الفرعية بشكل طبيعي.

• اللغة الإنجليزية فقط. لا توجد نقطة تحقق متعددة اللغات في هذا الإصدار، ولا توجد أي إشارة إلى أنها ستأتي قريبًا.

• إن معدل WER البالغ 5.00% هو رقم خاص بالتسجيلات القصيرة والصوت النقي. أما نتيجة FFASR (المرتبة التاسعة، على الكلام البعيد المليء بالضوضاء) فهي المؤشر الأكثر واقعية للاستخدام في غرف الاجتماعات والأوضاع الحرة اليدين، وهي مرتبة وليست رقمًا رئيسيًا.

بالنسبة لمهمة تفريغ صوتي محدودة — المكالمات الصوتية، الاجتماعات، المذكرات الصوتية، الترجمة النصية، الإملاء — لا تُعد أيٌّ من هذه عوائق. فهي تصبح مهمة فقط إذا كنت تأمل أن يقوم نموذج صغير واحد بالترجمة أيضًا، أو أن يفرّغ مفردات مخصصة بدقة دون أي إعداد مسبق.

كيفية تشغيله اليوم

أنت لا تحتاج إلى واجهة برمجة تطبيقات سحابية غير موجودة بعد. النموذج يعمل محليًا:

• ثبّت Transformers من المصدر (مجموعة ميزات CTC ليست في أحدث إصدار بعد)، ثم AutoModelForCTC مع AutoProcessor وفك الترميز الجشع — وهو المسار القياسي. يمكن للمعالج حساب ميزات log-mel على جهاز النموذج، مما يلغي الحاجة إلى نسخة من المضيف إلى الجهاز.

• مثال بطاقة النموذج هو سطران عبر خط الأنابيب: automatic-speech-recognition مع النموذج "ibm-granite/granite-speech-5.0-470m-turboctc".

يعمل عرض توضيحي للبث عبر WebGPU في علامة تبويب المتصفح، وهو أسرع طريقة لقياس زمن الاستجابة قبل أن تخصص بعد الظهر لإطار اختبار الأداء.

• للإنتاج، السؤال العملي هو الخدمة. نماذج التعرف التلقائي على الكلام مفتوحة المصدر من هذه الفئة تُشغَّل عادة على وحدة معالجة مركزية أو وحدة معالجة رسوميات صغيرة مع شيء مثل الاستدلال المتدفق على دفعات — الرقم البارز 12,600 RTFx هو رقم دفعة H200؛ الرقم الواقعي لدفق واحد على حاسوب محمول سيكون أقل بكثير، ولم تنشر IBM أرقام زمن الوصول إلى أول رمز.

هذه الطبقة الخادمة هي حيث تكمن التكلفة الحقيقية والتعقيد الحقيقي لـ ASR مفتوح المصدر، وهي أيضًا حيث تُثبت منصة التوجيه قيمتها. نموذج OrcaRouter هو واجهة برمجة واحدة عبر أكثر من 200 نموذج مع تمرير سعر القائمة من المزود بهامش ربح 0% — لذلك عندما يخفض بائع سعرًا، يصبح التخفيض ساريًا في نفس اليوم — بالإضافة إلى تجاوز الفشل التلقائي عبر المزودين وDSL للتوجيه لتأليف نماذج متعددة في استدعاء واحد. لا ينطبق أي من ذلك على Granite Speech 5.0 470M TurboCTC تحديدًا، لأن كلا الإصدارين غير متوفرين بعد على OrcaRouter: الأوزان عمرها يوم واحد ولا يوجد مزود تجاري يقدمها. عندما يحصل نموذج كلام مفتوح مثل هذا على مسار مستضاف — أو عندما تقارنه بواجهات ASR المستضافة الموجودة بالفعل — فإن طبقة التوجيه هي كيف تجرّبه وتتراجع عنه دون إعادة كتابة التكامل، وتمرير الأسعار هو ما يُبقي المقارنة نزيهة.

ما الذي لا يزال غير مؤكد؟

نموذج عمره يوم واحد لديه سجل ورقي قصير، ومن الجدير تحديد ما هو غير معروف بعد بالضبط:

• لا يوجد معيار مرجعي من طرف ثالث. إن نتائج 12,600 RTFx و5.00% WER وتصنيفات FFASR كلها عبارة عن تشغيلات خاصة بشركة IBM عبر منصة لوحة الصدارة العامة. لم ينشر أي طرف مستقل أي أرقام.

• لا توجد واجهة برمجة تطبيقات مستضافة بواسطة IBM. لا توجد صفحة نموذج watsonx، ولا نقطة نهاية مُدارة، ولا تسعير، ولا تاريخ لوصول أي من ذلك.

• لا توجد أرقام لزمن استجابة البث. يوجد دعم للبث وعرض توضيحي لـ WebGPU؛ لكن لا توجد أرقام لزمن الاستجابة حتى الرمز الأول ولا لزمن استجابة الأجزاء.

• لا توجد مقارنة بنفس الإطار ضد نماذج ASR السريعة مفتوحة المصدر الأخرى. المواجهات المهمة — ضد Whisper large-v3 و NVIDIA Parakeet TDT 0.6B وواجهات برمجة تطبيقات النسخ المستضافة — لم تُجرَ على بيانات متطابقة من قبل أي شخص حتى الآن.

ماذا تشاهد بعد ذلك

الإشارات قصيرة المدى هي عمليات إعادة الإنتاج المستقلة. لوحة صدارة Open ASR علنية، ومنصة التقييم معيارية، والأوزان موجودة على Hugging Face، لذا من المتوقع أن تظهر نتيجة تشغيل من طرف ثالث خلال أيام — راقب ما إذا كانت 5.00% ستظل صامدة وما إذا كان 12,600 RTFx سيصمد على H200 واحدة خارج إعداد الدفعات الخاص بـ IBM. الأمر الآخر الذي يستحق المراقبة هو ما إذا كانت IBM ستحوّل التوأم Apache إلى خدمة مُدارة؛ لأن نقطة نهاية watsonx ستجعل هذا فورًا أداة ASR المفتوحة المصدر ذات المسار التجاري الأكثر مصداقية. Granite Speech 5.0 470M TurboCTC هي، اعتبارًا من اليوم الأول، أداة ASR إنجليزية سريعة حقًا ومتسامحة حقًا مع أثر تحقق ضئيل حقًا. الأولان حقيقيان؛ أما الثالث فمسألة وقت.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube