بطاقة عنوان رئيسية مُولَّدة تحتوي على العنوان الرئيسي 'StepAudio 3 ASR مقابل Whisper Large v3 Turbo' والعنوان الفرعي '1.7 في المئة مقابل 4.6 في المئة، ولا يوجد اختبار مواجهة مباشرة بينهما'، فوق تذييل 'StepAudio وفق Artificial Analysis؛ Whisper وفق Hugging Face.'
Guides & Insights

StepAudio 3 ASR مقابل Whisper Large v3 Turbo: 1.7% مقابل 4.6%، ولم يقم أحد بإجراء الاختبار

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

المقارنة التي تريدها غير موجودة. StepAudio 3 ASR و Whisper Large v3 Turboيقعان على نفس مؤشر Artificial Analysis AA-WER لتحويل الكلام إلى نص غير المتدفق — بمعدل خطأ في الكلمات يبلغ 1.7% مقابل أرقام تتراوح بين 4% و5.5% — واعتبارًا من أواخر سبتمبر 2026، لم ينشر أحد مقارنة مباشرة على صوتيات متطابقة. لا StepFun، ولا القائمون على Whisper، ولا مختبر مستقل. تقدم وثائق StepFun الخاصة مقارنات مرجعية مقابل Doubao ASR 2.0 وSeed 2.0 Lite وHY3.0 ASR Preview، وكلها منتجات ASR صينية. لا يوجد لدى جهة Whisper أي مورّد ينشر مقارنات على الإطلاق، لأن Whisper Large v3 Turbo متاح للتنزيل منذ سنوات وأرقامه تعتمد على من يقوم بتشغيله.

إذن، تقدم هذه الصفحة النسخة الصادقة: فهي تقرأ اللوحة الوحيدة التي تقيس كليهما، وتفصل ما هو قابل للمقارنة عما ليس كذلك، وتصرّح بوضوح حيث تنتهي الأدلة. الجواب المختصر هو أن الفجوة في الدقة حقيقية ويبلغ عرضها نحو ثلاث نقاط، أما الفجوة في كل ما عدا ذلك — السعر، والترخيص، وقابلية النشر — فتسير في الاتجاه المعاكس وهي أكبر.

ما هو كل واحد منها في الحقيقة

StepAudio 3 ASR هو نموذج تفريغ صوتي مستضاف أصدرته StepFun في 15 سبتمبر 2026 ضمن عائلة StepAudio 3 الصوتية المكوّنة من خمسة نماذج. يتم الوصول إليه عبر نقطة نهاية بث واحدة تُرجع نصًا تدريجيًا أثناء فك التشفير، ونصًا نهائيًا في النهاية. تصفه StepFun بأنه تفريغ صوتي مع نموذج لغوي مرتبط به من أجل السياق، ومضبوط على الصوت الطبي والقانوني والمالي وصوت السيارات والبرمجة، وعلى المدخلات التي تُربك أنظمة التعرف التقليدية — الكلام المهموس، والكلام السريع، والكلام المتصل، والغناء، والصوت المصحوب بموسيقى في الخلفية. لا توجد أوزان مفتوحة، ولا مسار نشر محلي، ولا خيار استضافة ذاتية في أي فئة. سعر القائمة المنشور هو 2.8 يوان لكل ساعة، أي نحو 6.67 دولار لكل 1000 دقيقة على محور السعر الخاص بلوحة الصدارة.

Whisper Large v3 Turbo هو نموذج مفتوح الأوزان نشرته OpenAI بموجب ترخيص MIT: 809 ملايين معلمة، و99 لغة، وهو مشتق مُقلَّم ومضبوط بدقة من Whisper large-v3 مع تقليل طبقات فك التشفير. وقد جرى تنزيله ملايين المرات، وتقدّمه تجاريًا قائمة طويلة من المنصات، ويمكن تشغيله على عتادك الخاص. هذه الخاصية الأخيرة هي المقارنة كلها، وهي السبب في أن فجوة الدقة ليست الرقم الوحيد الذي يهم.

اللوحة الوحيدة التي تقيس كليهما

يُبلغ مؤشر AA-WER من Artificial Analysis عن النسبة المئوية للكلمات المفرّغة بشكل غير صحيح، والأقل أفضل، وتدمج النسخة الثانية منه ثلاث مجموعات بيانات: AA-AgentTalk بنسبة 50%، وVoxPopuli-Cleaned-AA بنسبة 25%، وEarnings22-Cleaned-AA بنسبة 25%. يعرض العرض غير المتدفق 36 من أصل 71 نموذجًا يتتبعها. يظهر كلا النموذجين عليه، وهو أكثر مما تستطيع معظم المقارنات ادعاءه.

اقرأ كما تسردها اللوحة:

• StepAudio 3 ASR — AA-WER بنسبة 1.7%، بنحو 6.67 دولار لكل 1,000 دقيقة من الصوت

• Whisper Large v3 Turbo، نقطة نهاية مستضافة واحدة — ‏4.6% AA-WER، حوالي 0.67 دولار لكل 1000 دقيقة

• Whisper Large v3 Turbo، نقطة نهاية مستضافة ثانية — 5.5% AA-WER، بنحو 15.00 دولارًا لكل 1,000 دقيقة

• Whisper Large v3، جيل مختلف من الأوزان المفتوحة — 4.1% على نقطة نهاية واحدة، 10.1% على أخرى

• StepAudio 2.5 ASR، الجيل السابق من StepFun — 4.7%

السطران الأخيران هما الأكثر إفادة على اللوحة، وهما لا يتعلقان بـ StepFun إطلاقًا. الأوزان المفتوحة نفسها الخاصة بـ Whisper تسجل 4.1% على نقطة نهاية واحدة و10.1% على أخرى. هذا فارق قدره 6 نقاط على معلمات متطابقة، ناتج بالكامل عن اختلافات في تقديم الخدمة: استراتيجية التقطيع، والعتاد، وإعدادات فك التشفير، وكيف يتعامل كل مضيف مع الصوت الأطول من حدوده الداخلية. وتقول الحاشية الخاصة باللوحة نفسها ذلك، إذ تشير إلى أنه في إحدى مجموعات بياناتها يتم تقطيع صوت بعض النماذج إلى نحو تسع دقائق بينما يتم تقطيع صوت نماذج أخرى إلى نحو ثلاثين ثانية بسبب حدود الوقت.

مما يعني أن المقارنة «StepAudio 3 ASR vs Whisper Large v3 Turbo» هي في الحقيقة مقارنتان متراكبتان. النموذج مقابل الأوزان، والنموذج مقابل أي نقطة نهاية صادف أنك قمت بقياسها. وتتفاوت الثانية أكثر من الأولى.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

من أين تأتي فجوة الدقة، وإلى أي مدى يمكن الوثوق بها

ثلاث نقاط في معدل خطأ الكلمات فجوة كبيرة في مجال تكون فيه أفضل خمسة أنظمة ضمن 0.6 نقطة من بعضها البعض. وهو أيضًا الرقم الوحيد في هذه المقارنة الذي قاسه طرف ثالث، ويأتي مع تحفظات حقيقية تعمل في كلا الاتجاهين.

في مقابل StepAudio 3 ASR: الرقم مؤشر مدمج، والمزيج يتكوّن بنسبة 50% من AA-AgentTalk — مجموعة بيانات لمحادثات الوكلاء. النموذج المضبوط للنسخ الخاص بمجال معيّن مع نموذج لغوي كبير مرتبط به للسياق مناسب جيدًا لهذا النمط من الصوت. أعد وزن المؤشر نحو الكلام المقروء أو الأخبار الإذاعية، وقد يصبح الترتيب أكثر تقاربًا. كذلك لا يزال لا يوجد تقرير تقني منشور لنموذج ASR، ولا مجموعة اختبار مُتاحة، ولا إعداد فك ترميز، ولا بروتوكول قابل لإعادة الإنتاج من أي جهة خارج StepFun.

في مقابل Whisper Large v3 Turbo: نسبة 4.6% هي رقم نقطة نهاية مستضافة واحدة، وليست خاصية من خصائص النموذج. الأوزان ثابتة ومتاحة للعموم؛ أما النتيجة فليست كذلك. الفريق الذي يشغّل الأوزان نفسها بعناية، مع تقسيم مناسب للنطاق وإعداد جيد لفك التشفير، يمكن أن يحقق نتيجة أفضل بدرجة معتبرة من صف لوحة النتائج — بينما الفريق الذي يشغّلها بإهمال يمكن أن يهبط إلى نتيجة أسوأ من 10.1% التي سجّلها الجيل الآخر مفتوح الأوزان. الخلاصة الصادقة هي أن الجانب مفتوح الأوزان في هذه المقارنة له حدّ أدنى يمكن قياسه وحدّ أعلى عليك أن تستحقه.

ما ينقص هو الرقم الذي يحسم الأمر: كلا النظامين، مجموعة صوتية واحدة، بروتوكول فك ترميز واحد، منشور. لم يشغله أحد، وإلى أن يفعل أحدهم ذلك، فإن "1.7% مقابل 4.6%" هو مقارنة بين قياسين تم إجراؤهما في ظروف مختلفة وليس قياسًا لنظامين مقابل بعضهما البعض.

الأبعاد الأربعة الأخرى، حيث يتفوق Whisper بفارق أكبر

الدقة هي البُعد الذي يفوز فيه StepFun. أما في بقية القائمة، فإن النموذج مفتوح الأوزان ليس قريبًا، وهذه هي العوامل التي تحدد ما إذا كان النشر ممكنًا من الأساس:

• الترخيص والأوزان — أوزان مفتوحة مرخّصة بموجب MIT تضم 809 مليون معامل، مقابل واجهة برمجة تطبيقات مستضافة لا تُنشر أي أوزان عند أي مستوى.

• النشر — استضافة ذاتية، أو داخل المقر، أو في بيئة معزولة شبكيًا، أو عبر أي من عشرات المنصات التجارية، مقابل واجهة برمجة تطبيقات StepFun فقط.

• الحد الأدنى للتكلفة — نحو 0.67 دولار لكل 1000 دقيقة على نقطة نهاية واحدة مستضافة، وأقل من ذلك إذا شغّلته بنفسك، مقابل نحو 6.67 دولار لكل 1000 دقيقة وفق السعر المعلن للبائع.

• موقع تخزين البيانات — لا يغادر الصوت البنية التحتية التي تتحكم بها مقابل إرسال الصوت إلى نقطة طرف ثالث.

• خطر التكامل — لا يمكن سحب النموذج من تحتك أو إعادة تسعيره أو التخلي عنه، لأنك تحتفظ بالأوزان في مقابل سعر استضافة يمكن أن يتغير وفق قائمة أسعار.

• سلوك الصوت الطويل — التقسيم إلى أجزاء قرارك أنت، ويمكن ضبطه لكل ملف مقابل ما تفعله نقطة نهاية المورّد داخليًا، وهو أمر غير موثّق.

فجوة السعر تلك تبلغ نحو عشرة إلى واحد مقابل نقطة نهاية Whisper الأرخص، وهي الصورة المعكوسة لما حدث داخل خط StepFun نفسه: فالنموذج الذي يحل هذا محلّه، StepAudio 2.5 ASR، كان مُسعَّرًا عند 0.15 يوان لكل ساعة، بينما تُسعَّر الفئة الحالية عند 2.8. وقد رفعت StepFun سعر التفريغ نحو تسعة عشر ضعفًا مقابل الحصول على الدقة، ما يضعه في سوق مختلف عن نموذج مفتوح الأوزان مُستضاف ذاتيًا، لا كنسخة أغلى منه.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

أي واحد يجب أن تختاره؟

الانقسام أنظف من معظم المواجهات المباشرة:

• اختر Whisper Large v3 Turbo إذا كان الصوت عاديًا، أو كان حجم الاستخدام كبيرًا، أو تعذّر خروج البيانات من بنيتك التحتية، أو كنت بحاجة إلى نشر دائم ومستقر السعر. ويعني ترخيص MIT أن القرار قرارك ويمكنك التراجع عنه، ولا يمكن لأحد أن يسلبك ذلك.

• استخدم StepAudio 3 ASR إذا كان الصوت صعبًا حقًا — بلكنة، أو همس، أو غناء، أو مع موسيقى تحته — أو إذا كان المجال أحد المجالات الخمسة التي ضبطت StepFun نموذجها من أجلها. هذا ما يشتريه الاشتراك المميز، وفي مثل هذا الصوت يكون فارق الدقة البالغ ثلاث نقاط هو الفرق بين نص قابل للاستخدام وجولة تصحيح يدوية.

• لا تتّبع أيًا منهما على نحو حصري إذا كنت لا تعرف إلى أيّهما ينتمي ملفك الصوتي. تكلفة الخطأ غير متماثلة: يمكن اختبار مسار الأوزان المفتوحة على عتادك الخاص مقابل ثمن ساعة GPU، أما المسار المستضاف فلا يكلّف شيئًا لتجربته، لكنه يُلزمك بسعر لا يمكنك التحكم فيه.

تكون الحجة لصالح النموذج الهجين أقوى هنا مما في معظم المقارنات، والسبب هو توزّع نقاط النهاية على لوحة الصدارة. ولأن أوزان Whisper نفسها تحصل على نتيجة تتراوح بين 4.1% و10.1% حسب من يقدّمها، فإن الخطوة العملية هي توجيه مسار الأوزان المفتوحة عبر أكثر من مضيف بدلاً من الالتزام بمضيف واحد — وهو ما يوفره لك التبديل التلقائي عند الفشل، وهي الآلية نفسها التي تتيح لك وضع نموذج مستضاف أمام مسار إنتاجي دون المراهنة على ذلك المسار عليه.

كيف يتلاءم هذا مع حزمة تقنية، وما الذي نقدّمه وما لا نقدّمه

أيًّا كان ما تختاره للنسخ، فإن النص المنسوخ يذهب إلى مكان ما. ملخِّص، أو استخراج مُهيكل، أو فحص امتثال، أو فهرس بحث — تلك الاستدعاءات تهبط على نماذج نصية عادية، وهي الجزء من الفاتورة الذي يتوسع مع الاستخدام لا مع دقائق الصوت. يعلن نموذج StepFun الزمني الخاص به عن استدعاء الأدوات والتنفيذ غير المتزامن للمهام الطويلة، ما يعني أن حتى طبقة الصوت تسلّم العمل باستمرار إلى شيء ليس نموذجًا صوتيًا.

لكي نكون صريحين بشأن النطاق، لأن من السهل أن يُفهَم خلاف ذلك: لا StepAudio 3 ASR ولا Whisper Large v3 Turbo موجودان على OrcaRouter. يُوصَل إلى StepAudio عبر واجهة StepFun الخاصة، وأوزان Whisper ملكٌ لك لتشغيلها أو أخذها إلى منصة استضافة. وما يحمله OrcaRouter هو طبقة التفويض التي يغذّيها النص المنسوخ — نحو 200 نموذج نصي خلف واجهة API واحدة، مع التبديل التلقائي عند الفشل بحيث لا يموت استدعاء لاحق مع مزوّد واحد، ولغة توجيه (DSL) تجمع عدة نماذج في استدعاء واحد، ودمج النماذج عندما لا يكفي حكم نموذج واحد. وحيث ينشر مزوّد سعراً، يُمرَّر سعر القائمة هذا دون أي هامش ربح، لذا يصل تغيير السعر إلى فاتورتك يوم الإعلان عنه — وهذا، بالنظر إلى أن هذه المقارنة تتضمن مورّداً رفع سعر النسخ لديه تسعة عشر ضعفاً في إصدار واحد، ليس ميزة افتراضية.

إذا كنت على وشك إنفاق أموال حقيقية على مسألة الدقة، فإن التسلسل الأقل تكلفة هو هذا: شغّل الأوزان المفتوحة على بياناتك الصوتية الخاصة أولًا، لأنك تستطيع ذلك، ولأن الرقم الذي ستحصل عليه سيكون أكثر ملاءمة من أي رقم في أي لوحة صدارة. ثم قرّر ما إذا كانت الفجوة المتبقية تستحق عشرة أضعاف السعر. ستجد معظم الفرق أن الأمر يستحق ذلك لشريحة من حركة المرور لديها وليس للبقية، وهذه مسألة توجيه لا اختيار نموذج.

ما الذي سيحسم الأمر؟

اختبار منشور واحد. كلا النظامين، والصوت نفسه، وبروتوكول فك الترميز نفسه، وتقسيم أمين بين الكلام المقروء والصوت الحواري والحالات الصعبة التي تدّعي StepFun أنها ضبطت أنظمتها من أجلها. وإلى أن يوجد ذلك، تظل المقارنة مؤشرًا من طرف ثالث من جهة، ومجموعة أوزان مفتوحة ذات درجة متغيّرة من الجهة الأخرى، والطريقة المسؤولة الوحيدة لقراءتها هي اعتبارها نقطة انطلاق لا إجابة.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.