بطاقة بطل المقال بعنوان «Grok Voice Transcribe 2.0 مقابل Whisper Large v3 Turbo» مع شارة «مقارنة النماذج» والعنوان الفرعي «ما الذي لا يزال الأساس المجاني يفعله بشكل أفضل»، مع شرائح تعرض 2.7% مقابل 4.07% WER، و0.20 دولار في الساعة مقابل أوزان MIT، و0.49 ثانية مقابل 1-5 ثوانٍ مستضافة ذاتيًا ومُدارة مقابل مملوكة، فوق تدرج لوني من الأبيض إلى الأزرق مع شعار OrcaRouter في أسفل اليمين.
Guides & Insights

Grok Voice Transcribe 2.0 مقابل Whisper Large v3 Turbo: ما الذي لا يزال خط الأساس المجاني يتفوق فيه

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ظلّ Whisper Large v3 Turbo الجواب الافتراضي عن "نحتاج إلى تفريغ صوتي" منذ إصداره بموجب رخصة MIT في 1 أكتوبر 2024، ولا شيء في Grok Voice Transcribe 2.0 يغيّر السبب وراء ذلك. نموذج SpaceXAI الجديد، الذي طُرح في 18 سبتمبر 2026، هو مُفرِّغ أفضل حقًا بفارق واسع — معدل خطأ كلمات 2.7% في التفريغات النهائية و3.4% في النتائج الجزئية الأولى على لوحة AA-WER Streaming من Artificial Analysis، مقابل رقم عائلة Whisper البالغ 4.07% على اللوحة غير المتدفقة، مع أن Turbo نفسه يتخلف عادةً ببضعة أعشار نقطة عن Large v3 الكامل الذي قُطّر منه. كما أن سعره 0.10 دولار لكل ساعة صوتية للمعالجة الدفعية و0.20 دولار لكل ساعة للبث. Whisper Large v3 Turbo هو ملف بحجم 1.6 GB يضم 809 ملايين معامل، يعمل على عتادك الخاص، ولا يقيس أي استهلاك، ولا يرسل أي صوت إلى أي مكان، وليس له حد للمعدل، ولا سقف للتزامن، ولا جدول لإيقاف الدعم. المقارنة ليست بين نموذج أفضل ونموذج أسوأ. إنها بين استئجار الدقة وامتلاك مكوّن.

نافذة الثلاثين ثانية هي البنية بأكملها

يرث Whisper Large v3 Turbo بنية كل نموذج Whisper: تتم معالجة الصوت في نوافذ ثابتة مدتها 30 ثانية، ويعمل المُرمِّز مرة واحدة لكل نافذة، ويُصدر المُفكِّك نصًا لتلك الكتلة. جعل Turbo ذلك أرخص — أربع طبقات مفكِّك بدلًا من اثنتين وثلاثين، أسرع بنحو 8× من Large v3، ونحو 6 غيغابايت من VRAM بدلًا من 10 — لكنه لم يغيّر الشكل. لا يوجد أي تصوّر لـ«الجملة حتى الآن» داخل النموذج، لأنه لا توجد حالة مستمرة عبر النوافذ.

تلك الحقيقة التصميمية الواحدة تفسر كل ما يليها. لا يوجد بث أصلي، لأن البث يتطلب الالتزام بمخرجات جزئية في منتصف الكلام، والنموذج لا يملك آلية لذلك. توجد عمليات نشر لنموذج Whisper في الوقت الفعلي، لكنها عبارة عن تقطيع بالإضافة إلى كشف النشاط الصوتي بالإضافة إلى طبقة ربط كتبها شخص ما ويصونها الآن، وزمن الاستجابة الذي ينتج عن ذلك المسار يُقاس بالثواني وليس بنصف الثانية التي يحققها Grok Voice Transcribe 2.0. لا يوجد فصل للمتحدثين، لأن الفصل مشكلة منفصلة تتعلق بمن يتحدث وليس بما قيل. وبشكل خاص، يُرجع متغير Turbo نصًا عاديًا — لا طوابع زمنية، ولا درجات ثقة، ولا تطبيع نصي عكسي يحول الأرقام المنطوقة وعناوين البريد الإلكتروني إلى شكل مكتوب.

بُني Grok Voice Transcribe 2.0 بالطريقة المعاكسة. البث هو وسيلة النقل الأساسية، أما المعالجة بالدفعات فهي الأوزان نفسها خلف نقطة نهاية REST، وقائمة الميزات تبدو وكأنها قائمة بالأمور التي تركتها Whisper للتطبيق: طوابع زمنية على مستوى الكلمة مع درجة ثقة لكل كلمة، وفصل المتحدثين مشمول دون تكلفة إضافية، ونسخ متعدد القنوات عبر ما يصل إلى 8 قنوات مستقلة، وترجيح المصطلحات المفتاحية بما يصل إلى 100 مصطلح مجال لكل طلب، وتطبيع نصي عكسي عبر 25 لغة، وإزالة كلمات الحشو، وكشف نهاية الدور عبر Smart Turn لوكلاء الصوت. إذا كنت تدير خط أنابيب للتقطيع والخياطة حول Whisper، فإن تلك القائمة وصف للشيفرة التي كتبتها.

فجوة الدقة، ولماذا هي أصغر مما تبدو عليه

• دقة النص النهائي (البث) — Grok Voice Transcribe 2.0 بنسبة 2.7% WER على AA-WER Streaming مقابل عدم وجود إدخال لـ Whisper Large v3 Turbo، لأن النموذج لا يستطيع البث أصليًا

• دقة المعالجة بالدفعات — Grok Voice Transcribe 2.0 عند 2.29% AA-WER مقابل Whisper Large v3 عند 4.07% على لوحة Artificial Analysis غير المتدفقة، مع تأخر Turbo عادةً بمقدار 0.4 إلى 0.6 نقطة عن Large v3 الكامل في الاختبارات المستقلة

• صوت إنجليزي نظيف — يصل Whisper Large v3 Turbo إلى معدل خطأ الكلمات (WER) يقارب 2.1% على LibriSpeech test-clean وحوالي 4.2% على test-other، لذا في الكلام بجودة الاستوديو تضيق الفجوة مع واجهة API الرائدة إلى حد يكاد ينعدم

• الصوت الواقعي — تضع الاختبارات المعيارية المستقلة نفسها Turbo عند نحو 4.6% في مكالمات الأعمال ثنائية المتحدثين و8–12% في الصوت المشوّش، وهنا يتّسع فارق النموذج الرائد

• إنتاجية الدفعات — Grok Voice Transcribe 2.0 بسرعة تقارب 162× من الزمن الحقيقي مقابل Whisper Large v3 Turbo بنحو 80× على وحدة معالجة رسومات استهلاكية واحدة متواضعة، مع بلوغ عتاد التقديم الأسرع أضعافًا مضاعفة من ذلك

• زمن استجابة البث — 0.49 ثانية للوصول إلى أول نتيجة جزئية على Grok Voice Transcribe 2.0 مقابل 1–5 ثوانٍ لخطوط أنابيب البث ذاتية الاستضافة لـ Whisper، وهي كود ربط بالإضافة إلى VAD وليس قدرة النموذج.

القراءة الصادقة لتلك القائمة هي أن حجة الدقة المؤيدة للدفع حقيقية لكنها مشروطة. في الإنجليزية النظيفة، أحادية المتحدث، جيدة التسجيل، يكون Whisper Large v3 Turbo قريبًا بدرجة كافية بحيث نادرًا ما يغيّر الفارق النتيجة. أما في الاتصالات الهاتفية بتردد 8 kHz، وصوت مراكز الاتصال الصاخب، والكلام ذي اللكنة، والعبارات القصيرة الخاصة بمجال معين — وهي بالضبط المجموعات التي ضبط SpaceXAI الإصدار 2.0 مقابلها، حيث انتقلت أرقامه المُبلَّغ عنها من 10.6% إلى 7.1% في الاتصالات الهاتفية ومن 20.6% إلى 6.8% في الأوامر القصيرة متعددة اللغات — يصبح الفارق هو الفرق بين نص يمكنك توجيه المكالمات بناءً عليه ونص يتعين عليك قراءته. تلك أرقام تُعلنها الشركة عن تسجيلات صوتية تابعة للشركة، لم يكررها أحد خارج SpaceXAI، والاتجاه الذي تشير إليه يتسق مع كل اختبار مستقل لـ Whisper على صوت متدهور الجودة.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

مقارنة التكلفة ليست $0.10 مقابل $0

ترخيص Whisper لا يكلف شيئًا؛ أما تشغيله فليس كذلك. فمثيل GPU يستوعب نموذجًا بحجم 1.6 GB داخل 6 GB من VRAM ويفرّغ الصوت بنحو 80× من سرعة الزمن الحقيقي هو البند الحقيقي في التكلفة، وعند أسعار GPU السحابية المعتادة يقع ذلك في رتبة الحجم ذاتها التي تقع فيها واجهات API المستضافة لأحمال العمل المستمرة — مع استثناء مهم هو أنك تدفع مقابل السعة سواء كان الصوت يتدفق أم لا. تتوافر نقاط نهاية Whisper المستضافة بأسعار متباينة على نطاق واسع، من أقل من 1.20 دولار لكل 1,000 دقيقة عند الطرف الأرخص إلى بضعة دولارات، وهذا التباين تذكير مفيد بأن "Whisper" نموذج، وليس مستوى خدمة. تضع لوحة الأسعار المعيارية لدى Artificial Analysis أرخص نقاط نهاية Whisper Large v3 المستضافة عند 0.50 دولار و1.15 دولار لكل 1,000 دقيقة، وكلاهما يقل عن سعر الدفعة البالغ 1.67 دولار لدى Grok Voice Transcribe 2.0 — لكنك لا تملك أياً من هاتين النقطتين، وكلتاهما تأتيان مرفقتين بحدود معدل الطلبات وسياسة احتفاظ تخص طرفًا آخر.

الموضع الذي تتفوق فيه الاستضافة الذاتية تفوقًا كاسحًا هو الحجم ذو النمط المتقطع. أرشيف وسائط من عشرة آلاف ساعة يكلّف المبلغ نفسه على وحدة معالجة الرسومات الخاصة بك سواء عالجته خلال أسبوع أو خلال سنة، ولا يعمل أي عدّاد بالساعة بينما تقرر. وخط أنابيب الامتثال الذي يجب ألا يرسل الصوت خارج الشبكة أبدًا لا يوجد له بديل مستضاف بأي ثمن، لأن المتطلّب معماري وليس ماليًا. والضبط الدقيق لا يكون متاحًا لك إلا إذا كنت تملك الأوزان: رخصة MIT الخاصة بـ Whisper تتيح لك أن تأخذ النموذج ذا 809 ملايين معامل وتكيّفه مع متحدث واحد، أو لهجة واحدة، أو مفردات مجال ضيقة، وهي قدرة لا تتيحها أي واجهة برمجة تطبيقات عند أي مستوى سعري.

الصورة المعكوسة هي أن سعر النموذج المستضاف قد يتغيّر تحتك. أبقى SpaceXAI على سعره دون تغيير عندما انتقل من 1.0 إلى 2.0 — تحسين للنموذج بسعر ثابت — واستقرت MAI-Transcribe-2 من Microsoft عند السعر نفسه البالغ $0.10 لكل ساعة صوت، وهو ما يخبرك أين يقع الحد الأدنى لسعر الطليعة. إذا وجّهت عبر OrcaRouter، تمر أسعار القائمة هذه دون هامش ربح 0%، لذا يصل تخفيض المورّد إلى فاتورتك في اليوم الذي يحدث فيه بدلاً من أن يصل بعد دورة إعادة تسعير. هذه ميزة حقيقية للجانب المستأجر في هذه المقارنة، ويستحق وزنها مقابل حقيقة أن الجانب المجاني لا يرسل لك فاتورة على الإطلاق.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

ما هو الغرض الفعلي من كل واحد منها

احتفظ بـ Whisper Large v3 Turbo عندما يكون الصوت ملفًا موجودًا بالفعل، ويكون مستوى الصوت مرتفعًا أو غير منتظم، وتكون التسجيلات نظيفة بدرجة معقولة، وإما أن تكون البيانات غير قادرة على مغادرة شبكتك أو لا تستطيع الميزانية تحمّل عدّادًا بالساعة. يظل الخيار الصحيح للأرشيفات دون اتصال، والنسخ على الحافة وعلى الجهاز حيث يُكمَّم نموذج بحجم 1.6 GB ليتناسب، وخطوط المعالجة الدفعية حيث يكون معدل الإنتاجية هو القيد بدلًا من زمن الاستجابة، وأي مشروع يكون فيه الضبط الدقيق باستخدام الصوت الخاص بك هو الطريق إلى الدقة التي تحتاجها. الأدوات المحيطة به — whisper.cpp للحافة، وfaster-whisper للإنتاج، وبنى GGUF للذاكرة المقيّدة — وراءها عامان من التقوية المجتمعية، وهو شكل من الموثوقية لا يمتلكه أي API عمره يومان.

انتقل إلى Grok Voice Transcribe 2.0 عندما لا يزال الصوت يصل، وعندما تكون التسجيلات متدهورة، وعندما تحتاج إلى معرفة من تحدث ومتى، وعندما يجب ترجيح مفردات المجال بدلاً من ضبطها الدقيق، أو عندما يتخذ التطبيق إجراءً بناءً على تفريغ جزئي قبل أن ينتهي المتحدث. مسار الترقية هو معامل واحد في تكامل قائم، وإعادة تثبيت الإصدار 1.0 إذا حدث خطأ، مما يجعل التجربة رخيصة. تجدر الإشارة إلى أن الترحيل العكسي ليس رخيصًا: الكود المكتوب مقابل واجهة برمجة تطبيقات بث مع تمييز المتحدثين وكشف أدوار التحدث لا يتحول بسلاسة إلى نموذج دفعي يعيد نصًا عاديًا، وهو حجة لإثبات المسار المستضاف على شريحة من صوتك الحقيقي قبل الالتزام بخط أنابيب به.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

حيث يتم اتخاذ القرار فعليًا

معظم الفرق التي تشغّل Whisper على أي نطاق لا تختار بين هذين النموذجين، بل تشغّل نظامًا هجينًا: Whisper للأرشيف لأنه مجاني وجيد بما يكفي مع الصوت النقي، وAPI رائدة للمسار المباشر لأنه لا شيء آخر يبث عند 3.4% من WER الجزئي، ونموذج ثالث لاحق يلخّص أو يصنّف أو يتصرف بناءً على أي نص ينتج. تلك الخطوة الثالثة هي حيث يحدث التشعّب عادةً — عقد مورّد ثانٍ لنموذج الاستدلال، ومجموعة ثانية من بيانات الاعتماد، وحد ثانٍ للمعدل يجب مراقبته. يدمج OrcaRouter تلك الطبقة: مفتاح واحد عبر أكثر من 200 نموذج، وتجاوز فشل تلقائي عندما يتدهور مزوّد، ولغة DSL للتوجيه إذا أردت إرسال النص نفسه عبر عدة نماذج ومقارنتها قبل اختيار واحد. تظل استدعاءات النسخ نفسها تذهب إلى المورّد الذي اخترته؛ ما يتوقف عن التضاعف هو كل ما يأتي بعدها.

الشيء الذي يجب مراقبته على جانب Whisper ليس نقطة تفتيش جديدة — فالعائلة لم تتحرك منذ Turbo، وقد اتجه تركيز OpenAI إلى خط GPT Transcribe. بل هي طبقة الخدمة. كل عام تصبح الأدوات المستضافة ذاتيًا أسرع، ويصبح العتاد الذي تحتاجه أصغر، وكل تحسين هناك يضيّق مبرر الدفع بالساعة. الشيء الذي يجب مراقبته على جانب SpaceXAI هو تبديل الإعداد الافتراضي: عندما يصبح 2.0 هو الافتراضي ويُهمَل 1.0، فإن كل تكامل لم يحدد اسم طراز سينتقل دفعة واحدة، بما في ذلك زمن الاستجابة. لا يغيّر أي من التطويرين الانقسام الجوهري. طراز تملكه وتضبطه، وطراز تستأجره وتستدعيه، والجواب الصادق أن معظم مكدسات الإنتاج تنتهي إلى تشغيل كليهما.