بطاقة مقال رئيسية تحمل النص 'Grok Voice Transcribe 2.0 مقابل Granite Speech 5.0 470M TurboCTC' مع شارة 'مقارنة النماذج' وعنوان فرعي 'الإنتاجية مقابل زمن الاستجابة'، مع شرائح تعرض 12,600 RTFx، و2.7% WER للبث، و470 مليون معامل، و0.20 دولار لكل ساعة بث، فوق تدرج لوني من الأبيض إلى الأزرق مع شعار OrcaRouter في أسفل اليمين.
Guides & Insights

Grok Voice Transcribe 2.0 مقابل Granite Speech 5.0 470M TurboCTC: 12,600× من الزمن الحقيقي يلتقي بنصف ثانية

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Granite Speech 5.0 470M TurboCTC يفرّغ نحو 3.5 ساعات من الصوت كل ثانية على وحدة H200 واحدة، وGrok Voice Transcribe 2.0 يعيد أول نص جزئي بعد 0.49 ثانية من توقفك عن الكلام. يُوضع هذان الرقمان جنبًا إلى جنب في منشورات المقارنة وكأنهما النوع نفسه من القياس، وهما ليسا كذلك بأي شكل — أحدهما رقم إنتاجية معالجة دفعية في مركز بيانات دون أي زمن استجابة مرتبط به، والآخر رقم زمن استجابة لنموذج لم ينشر أحد إنتاجيته. أصدرت IBM Granite Speech 5.0 470M TurboCTC في 25 أغسطس 2026 تحت رخصة Apache 2.0، مع إسقاط مفكك ترميز نموذج اللغة كليًا والترميز بتمريرة CTC واحدة غير ذاتية الانحدار. وأطلقت SpaceXAI Grok Voice Transcribe 2.0 في 18 سبتمبر 2026 كواجهة برمجة تطبيقات مُدارة بسعر 0.10 دولار لكل ساعة صوتية للدفعات، و0.20 دولار لكل ساعة للبث. كلاهما نموذجان ممتازان للتفريغ الصوتي يحلان نصفين متقابلين من المشكلة نفسها، ويصبح الاختيار بينهما أسهل بمجرد أن تتوقف عن مقارنة الأرقام مباشرة.

12,600× من الزمن الحقيقي، والكلمات التي تصفه

رقم Granite هو 12,600 RTFx تم قياسه على وحدة NVIDIA H200 واحدة باستخدام الاستدلال المُجمَّع — رقم IBM، الذي أُعلن عند الإطلاق ولم يُعَد إنتاجه بشكل مستقل منذ ذلك الحين. RTFx هو نسبة مدة الصوت إلى وقت المعالجة، لذا فإن 12,600 تعني تقريبًا 3.5 ساعات من الصوت لكل ثانية من الوقت الفعلي. صياغة IBM نفسها هي أن هذا أكثر من 20× من إنتاجية إصدارات Granite Speech السابقة، وهذا هو الادعاء الذي يهم حقًا هنا: جاء التسريع من إزالة العمل، وليس من إضافة العتاد.

ما ليس عليه هو رقم زمن استجابة. فالمهمة المجمّعة التي تُنهي 3.5 ساعات من الصوت في الثانية يمكن أن تستغرق وقتًا طويلًا لإرجاع أول رمز لأي ملف فردي، اعتمادًا على كيفية تجميع الدفعة وكمية الصوت التي تغذّيها بها قبل أن تبدأ. لا تنشر IBM أي أرقام عن زمن الاستجابة على الإطلاق لـ TurboCTC. على لوحة المتصدرين للمجال البعيد، تُعد نقطتا التفتيش أسرع مشاركتين، لكن الإنتاجية هناك قيست على وحدة NVIDIA L4 واحدة، وهي مسرّع قريب من مراكز البيانات وليس هاتفًا.

السبب في أن هذا مهم هو أن النموذج موجّه صراحةً نحو الحواسيب المحمولة والهواتف والأجهزة الطرفية — وهو التأطير الذي تستخدمه IBM نفسها — ولم ينشر أحد أداء المسار الواحد على أيٍّ منها. وإلى أن يفعل أحدهم ذلك، تعامل مع "12,600×" كبيان عن مدى رخص إنجازك لعملية تعبئة رجعية على وحدات معالجة رسومات مستأجرة، وهو ادعاء ذو قيمة حقيقية ومدعوم بأدلة جيدة، وليس كبيان عن مدى سرعة حصول مستخدم واحد على جملة واحدة كردّ.

ما الذي أزالته IBM، وما الذي يكلّفك ذلك

TurboCTC هو تصميم بمُشفّر فقط: مُشفّر صوتي من نوع Conformer مكوّن من 16 طبقة، مُدرَّب باستخدام CTC، ويُفكّ ترميزه بطريقة جشعة في تمريرة واحدة غير ذاتية الانحدار، مع طبقة إخراج للوحدات الفرعية بحجم 16,384 وحدة. لا يوجد نموذج لغوي في الحلقة. من هنا يأتي السرعات، ومن هنا أيضًا تأتي التخفيضات في القدرات، وهي ليست صغيرة. مقارنةً بنماذج Granite Speech السابقة، يُسقط TurboCTC ترجمة الكلام، ويُسقط التحييز بالكلمات المفتاحية، ولا يوفّر أي أدوات للطوابع الزمنية أو الترقيم.

ضع ذلك في مقابل ما يشمله النموذج المُدار بسعر قائمته، وعندها يصبح شكل الصفقة ملموسًا:

• ترجيح المصطلحات الرئيسية — لا يمتلك Granite Speech 5.0 470M TurboCTC هذه الميزة مقابل ما يصل إلى 100 مصطلح رئيسي لكل طلب في Grok Voice Transcribe 2.0

• الطوابع الزمنية على مستوى الكلمة — غير مُضمَّنة مع TurboCTC مقابل مضمنة مع درجات الثقة

• ترجمة الكلام — كانت موجودة في نماذج Granite Speech السابقة، وأُزيلت هنا مقابل عدم تقديمها بأي حال

• تغطية اللغات — الإنجليزية فقط مقابل الكشف التلقائي عبر مجموعة مدخلات واسعة متعددة اللغات مع دعم التنسيق في 25 لغة

• الفصل بين المتحدثين — مشكلة منفصلة تحلها بنفسك مقابل تضمينها في سعر الطلب

• القنوات — تدفق واحد لكل تمريرة مقابل ما يصل إلى ثماني قنوات صوتية في طلب واحد

• تطبيع النص — لا شيء مقابل تطبيع النص العكسي الذي يحوّل التواريخ والعملات وأرقام الهواتف المنطوقة إلى شكل مكتوب

• النشر — أوزان تقوم بتنزيلها وتشغيلها مقابل نقطة نهاية مُدارة في us-east-1

اقرأ تلك القائمة كوصف لمنتجين مختلفين وليس كبطاقة تقييم. إزالة تجزئة المتحدثين والتحيز والتطبيع هي ما اشترت الإنتاجية. إن إعادة الملء الدفعي بأثر رجعي لـ 40,000 تسجيل مكالمة في فهرس بحث لا يحتاج إلى طوابع زمنية أو أدوار متحدثين — بل يحتاج إلى أن يكون رخيصًا ويحتاج إلى أن ينتهي — وبالنسبة لتلك المهمة، فإن الميزات المفقودة ليست مفقودة، بل هي وزن محذوف.

والعكس صحيح بالنسبة لأي شيء مباشر. إذا كنت تبني وكيلاً صوتياً، فإن قائمة المصطلحات الرئيسية هي وسيلتك لتهجئة "Kubernetes" و"Granola" وأسماء العملاء بشكل صحيح، وأي أداة نسخ بلا آلية ترجيح ستخطئ فيها في كل مرة، دون أي سبيل لإصلاح ذلك سوى الضبط الدقيق، وهو مشروع مختلف بميزانية مختلفة. هذه الميزة الواحدة الناقصة تستبعد TurboCTC من بعض أعباء العمل ولا تهم أخرى، ولهذا فإن مقارنة النماذج أقل فائدة من مقارنة أعباء العمل.

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

مقارنة الدقة التي لا يمكن إجراؤها بشكل نظيف

تُبلغ IBM عن معدل خطأ كلمات إجمالي قدره 5.00% لنقطة التحقق Apache 2.0 و4.85% للنظير غير التجاري في لوحة Open ASR Leaderboard، وذلك على مجموعات اختبار إنجليزية عامة قصيرة الصيغة. وتلك أرقام دفعية في لوحة تشمل تقييماتها مجموعات AMI وEarnings22 والمجموعات الحوارية الطويلة، وهي أرقام مُبلَّغ عنها من المُورِّد — مُرَّرت عبر أدوات اللوحة لكن لم تُدمَج بعد في الجدول الرسمي، الذي يضم أيضًا مجموعات اختبار خاصة. ويستحق التفصيل المنشور لكل مجموعة على بطاقة النموذج القراءة، لأن المتوسط يخفي الكثير: LS Clean 1.42%، وLS Other 2.66%، وSPGISpeech 3.18%، وVoxpopuli-Cleaned-AA 4.88%، وEarnings22-Cleaned-AA-chunked 6.69%، وAMI-Cleaned 7.52%، وGigaspeech-Cleaned 8.67%، بمتوسط يبلغ 5.00% تمامًا. وتذكر البطاقة نفسها متوسط RTFx قدره 13,042.98 مقيسًا على وحدة H200 واحدة — وهو أعلى من رقم 12,600 الذي استخدمته تدوينة إطلاق IBM، والرقمان كلاهما من الشركة نفسها، وفي الأسبوع نفسه، وعلى العتاد نفسه.

إن رقم النص النهائي البالغ 2.7% لدى Grok Voice Transcribe 2.0 ليس قياسًا قابلًا للمقارنة. فهو يأتي من لوحة AA-WER Streaming board التابعة لـ Artificial Analysis، وهي مركّب مرجّح يتكوّن من AA-AgentTalk بنسبة 50%، وVoxPopuli بنسبة 25%، وEarnings22 بنسبة 25% — أي نحو ثماني ساعات من صوت محادثة إنجليزي مرجّح حسب الوكلاء، قِيست عبر واجهة بث. مجموعات مختلفة، وترجيح مختلف، وطريقة تشغيل مختلفة. إن وضع 2.7% إلى جانب 5.00% والاستنتاج بأن النموذج المُدار أدق بنحو الضعف تقريبًا هو الخطأ الأكثر شيوعًا على الإطلاق الذي يمكن الوقوع فيه في هذه المقارنة.

ما يمكن قوله بصدق أضيق نطاقًا ومع ذلك مفيد. كلا النموذجين قويان على الصوت الذي قيس كل منهما عليه. يتصدّر Grok Voice Transcribe 2.0 لوحة بث تُدار بشكل مستقل وتُقاس عليها نماذج أخرى أيضًا، ما يجعل ترتيبه قابلًا للتحقق حتى لو لم تكن قيمته الدقيقة قابلة للنقل. لدى Granite Speech 5.0 470M TurboCTC معدل WER إجمالي على مجموعات ASR المفتوحة القياسية، وبشكل منفصل، نتيجة في المجال البعيد حيث يحتل نقطة التفتيش غير التجارية المرتبة الخامسة في الدقة ونسخة Apache المرتبة التاسعة — مقيسة على كلام صاخب وذو صدى، وهو أصعب شرط في المجموعة ويمكن القول إنه أصدق ما في أرقام أي من النموذجين.

إذا كان الصوت لديك كلامًا إنجليزيًا مقروءًا ونقيًا، فمن المرجح أن تكون فجوة الدقة بين هذين أصغر مما توحي به مراتب لوحة الصدارة. أما إذا كان مشوّشًا أو بلكنة أو هاتفيًا أو غير إنجليزي، فلا تخبرك أي من اللوحتين بالكثير، وتكون مجموعة الاختبار الخاصة بك هي الأداة الوحيدة التي تفعل ذلك.

أوزان حرة مقابل 1.67 دولار في الساعة

مقارنة التكلفة هي الموضع الوحيد الذي يسهل فيه حقًا التمييز بين هذين الطرازين، والرقم الذي يستشهد به الناس عادةً خاطئ في كلا الاتجاهين.

• النسخ بالدفعات — Grok Voice Transcribe 2.0 بسعر 0.10 دولار لكل ساعة صوت، أو نحو 1.67 دولار لكل 1,000 دقيقة، مقابل Granite Speech 5.0 470M TurboCTC دون تكلفة ترخيص، بالإضافة إلى وقت GPU

• البث — 0.20 دولار لكل ساعة صوتية، أي نحو 3.33 دولار لكل 1,000 دقيقة، مقابل عدم وجود مسار بث مستضاف منشور من IBM

• الترخيص — واجهة برمجة تطبيقات تجارية بدون أوزان مقابل Apache 2.0 لنقطة التحقق الرئيسية وCC-BY-NC-SA-4.0 للنسخة غير التجارية الأكثر دقة

كلمة «مجاني» تقوم بالكثير في ذلك الصف الأول. نموذج بحجم 470 مليون معلمة قائم على المُشفّر فقط صغير بما يكفي ليعمل على أجهزة متواضعة — وهذا هو جوهر التصميم، وهو السبب الذي دفع IBM إلى تدريبه في عشرة أيام على ثماني وحدات H100 وطرحه ليعمل مع `transformers>=5.16.0` مع عرض تجريبي بتقنية WebGPU — لكن ما زال هناك من يدفع ثمن وحدة GPU، ومنظومة تقديم الخدمة، والتوسع التلقائي، وإعادات المحاولة، ومناوبات الاستدعاء. عند الأحجام الصغيرة تكون تكلفة الخدمة المُدارة عادةً أرخص من وقت المهندسين. وعند الأحجام الكبيرة المستقرة يفوز مسار الأجهزة المستأجرة، ونقطة التقاطع دالة على معدل استغلالك لا على حجم الصوت لديك: وحدة GPU تُبقيها مشغولة تكون رخيصة بالساعة، أما وحدة تُبقيها جاهزة لذروة الطلب فليست كذلك.

ثمة تفصيل واحد يتعلق بالترخيص يجدر التنبيه إليه قبل أن يبني أي أحد تصميماً على أساسه. إن نقطة التحقق الأدق بين نقطتَي التحقق، تلك التي عند 4.85% WER، هي غير التجارية الخاضعة لـ CC-BY-NC-SA-4.0. أما نقطة التحقق الخاصة بـ Apache 2.0 فهي التي عند 5.00%، وهي التي يجوز لك شحنها داخل منتج. وهذا فرق في الدقة قدره 0.15 نقطة، تُقايَض به مقابل الحق في استخدام النموذج من الأساس، كما يعني أيضاً أن أي مقارنة تستشهد بنسبة 4.85% لـ "Granite Speech 5.0" ثم تتناول النشر التجاري إنما تستشهد بنقطة التحقق الخطأ.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

قاعدة القرار

ثلاثة أسئلة تفصل بين هذين النموذجين أسرع من أي جدول معايير.

هل يُستهلك النص المفرَّغ مباشرةً، بينما لا يزال المتحدث يتحدث؟ إذا كان الجواب نعم، فإن TurboCTC ليس المرشح — لا لأنه بطيء، بل لأنه لا يمتلك واجهة بث ولا مخرجات جزئية، والنص المفرَّغ الجزئي يمثل التزامًا معماريًا مختلفًا عن فك الترميز الدفعي السريع. وإذا كان الجواب لا، تصبح ميزة الإنتاجية هي القصة كاملة، ويصعب جدًا التغلب على نموذج IBM من حيث التكلفة لكل ساعة من الصوت تتم معالجتها.

هل يحتاج العمل إلى مفردات مجال؟ إذا كانت الإجابة نعم، فإن نموذجًا يدعم الترجيح يفوز تلقائيًا، وغياب ترجيح المصطلحات الرئيسية في TurboCTC يُعد مُقصيًا لا مجرد إزعاج. وإذا كانت الإجابة لا، فأنت تدفع مقابل ميزة لن تستخدمها على الجانب المُدار.

هل المقطع الصوتي كلام إنجليزي مقروء على عتاد جيد؟ إذا نعم، فكلاهما قوي والاختيار يتعلق بالعمليات. إذا لا، فكلتا اللوحتين لا تقدمان معلومات، وتقييمك أنت وحدك هو ما يهم.

أيًّا كانت النتيجة، فإن طبقة التشغيل هي ما يجعل هذا القرار رخيصًا. يضع OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI، مع تحويل تلقائي بين المزوّدين عند الفشل، بحيث لم يعد تعثّر نقطة نهاية صوتية مُدارة في منطقة واحدة في أصعب أوقاتها انقطاعًا لك، كما تُمرَّر أسعار قوائم المزوّدين دون أي هامش ربح (0%) — وهو ما يعني أن أي تغيير في أسعار مورّد أو نقطة تحقق جديدة يصبح متاحًا لدينا في اليوم نفسه. وبالنسبة لعبء عمل تكون فيه الإجابة الصحيحة غير واضحة فعلًا، فإن ذلك يزيل تكلفة الخطأ: قارن كلا الخيارين مقابل صوتك الخاص خلف نقطة نهاية واحدة، وأبقِ الفائز، وغيّر سلسلة النموذج عندما يصدر التالي.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

باختصار: إن Granite Speech 5.0 470M TurboCTC هو الإجابة الأفضل عن سؤال «نسخ كل ما سجّلناه على الإطلاق، بتكلفة منخفضة، على عتاد نتحكم فيه»، وGrok Voice Transcribe 2.0 هو الإجابة الأفضل عن سؤال «نسخ هذا أثناء حدوثه، بدقة، دون أن ندير نحن حزمة تقديم الخدمة». إن عنوان 12,600× وعنوان 0.49 ثانية كلاهما صحيحان، ولا يصلح أي منهما دليلًا على الآخر.