بطاقة عنوان رئيسية مُولَّدة تحمل العنوان الرئيسي "StepAudio 3 ASR مقابل StepAudio 3" والعنوان الفرعي "أحدهما نموذج. والآخر خمسة منتجات تحت اسم واحد"، أعلى تذييل "أرقام StepFun كما نُشرت في سبتمبر 2026."
Guides & Insights

StepAudio 3 ASR مقابل StepAudio 3: لا يوجد نموذج بهذا الاسم

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ابحث عن StepAudio 3 وستجد عائلة، لا نموذجًا. إصدار StepFun الصوتي في 15 سبتمبر 2026 وضع خمسة منتجات تحت هذا الاسم — Realtime وASR وتحويل النص إلى كلام وGen وMusic — والمنتج الخاص بالنسخ الصوتي بينها، StepAudio 3 ASR، هو الذي يتسلق لوحات الصدارة منذ ذلك الحين. الفئة التي تصفها وثائق StepFun نفسها بأنها أكبر نموذج ASR لها حتى الآن هي StepAudio 3 ASR Max، والنظير الحواري الذي يتشارك معه في العمود الفقري هو StepAudio 3 Realtime. إذا كنت تحاول مقارنة "StepAudio 3 ASR" مع "StepAudio 3"، فأنت تقارن منتجًا بخط منتجات، والجواب يعتمد كليًا على أي من الثلاثة كنت تقصد فعلاً.

هذه الصفحة تحل ذلك. إنها ليست مقارنة تسويقية — بل هي التوضيح الذي تحتاجه قبل أن تتمكن من قراءة أي ورقة مواصفات StepAudio 3 بشكل صحيح، لأن الأسماء الثلاثة أعلاه تحمل أسعارًا مختلفة ونقاط نهاية مختلفة وأنماط فشل مختلفة.

لماذا الاسم غامض؟

أطلقت StepFun مجموعة الصوت الكاملة في يوم واحد، وجعلت اتفاقية التسمية اسم العائلة جذرًا لكل اسم منتج. هذا مرتب على شريحة إطلاق، لكنه غير مناسب في كل مكان آخر. فهو يعني أن البحث عن اسم العائلة يعيد خليطًا من خمسة منتجات مختلفة، وأن صفًا في اختبار أداء موسومًا بـ "StepAudio 3" يمكن أن يكون أيًّا منها بشكل معقول.

النتيجة العملية هي أنه لا يمكنك أن تعرف من العنوان ما الذي تم قياسه. منشور يقول "StepAudio 3 يتصدر لوحة صدارة النسخ" يصف StepAudio 3 ASR. منشور يقول "StepAudio 3 يفوز في الديناميكيات الحوارية" يصف StepAudio 3 Realtime. كلاهما صحيح، فهما منتجان مختلفان، وليسا قابلين للتبادل.

هناك التباس ثانٍ داخل خط ASR تحديدًا. تشير وثائق StepFun إلى طبقة ASR Max باعتبارها أكبر طراز ASR لديها حتى الآن، مع تسعير خاص بها ونقطة نهاية خاصة بها، بينما تحمل صفوف لوحة الصدارة العامة تسمية أبسط. إن تحديد ما إذا كانت تلك وحدة SKU واحدة تحت اسمين أم وحدتي SKU هو أكثر ما يمكن أن تقدّمه هذه الصفحة من فائدة، وهو ما يفعله القسم التالي.

الأشياء الثلاثة التي يمكن أن يعنيها الاسم

StepAudio 3 ASR — منتج النسخ الصوتي. نقطة نهاية بث تُرجع نصًا تدريجيًا أثناء فك الترميز ونصًا نهائيًا في النهاية. تصفه StepFun بأنه نسخ مزود بنموذج لغوي مرفق للسياق، مُهيأ للمحتوى الصوتي الطبي والقانوني والمالي والخاص بالسيارات والبرمجة، وللمدخلات الصعبة مثل الكلام الهامس والكلام السريع والكلام المتصل والغناء والموسيقى الخلفية. وهو النموذج الذي يبلغ معدل خطأ الكلمات فيه 1.7% على مؤشر AA-WER الخاص بـ Artificial Analysis للتحويل غير المتدفق من الكلام إلى نص.

StepAudio 3 ASR Max— الفئة التي تصفها وثائق StepFun بأنها أكبر طراز ASR لديها حتى الآن. وهي تحمل سعر القائمة المعلن البالغ 2.8 يوان في الساعة. إنها ليست أداة تفريغ أرخص؛ إنها قمة سلسلة ASR.

StepAudio 3 Realtime — النموذج الحواري كامل الازدواجية. فهو يستدل على الكلام مباشرةً بدلًا من تشغيل سلسلة نسخٍ ثم استدلال، وينسخ كنتيجة ثانوية لذلك. وهو ليس منتج ASR، ودقته في مهام النسخ ليست ما ضُبط من أجله.

كل شيء آخر في العائلة — TTS وGen وMusic — هو مهمة مختلفة تمامًا ولا ينبغي أن يظهر في مقارنة النسخ على الإطلاق.

هل ASR و ASR Max هما نفس الطراز؟

تشير الأدلة إلى نعم، والتحقق حسابي. تُدرج StepFun فئة ASR Max بسعر 2.8 يوان في الساعة. عند التحويل بمعدل 7.1 يوان للدولار تقريبًا، فإن ذلك يعادل حوالي 0.39 دولار في الساعة، أو ما يقرب من 6.6 دولار لكل 1000 دقيقة. تُدرج Artificial Analysis النموذج على لوحة الصدارة الخاصة بها بسعر 6.67 دولار لكل 1000 دقيقة. رقمان منشوران بشكل مستقل، أحدهما من قائمة أسعار البائع والآخر من لوحة الطرف الثالث، ويقعان في حدود سنت واحد من بعضهما البعض. هذا ما تتوقعه إذا كان صف لوحة الصدارة وسعر قائمة ASR Max يصفان نفس SKU.

يستحق الأمر الدقة بشأن ما يثبته ذلك وما لا يثبته. فهو يثبت أن محور السعر في لوحة الصدارة وبطاقة أسعار المورّد يصفان المنتج نفسه بالسعر نفسه. لكنه لا يثبت أن نسبة 1.7% في لوحة الصدارة قيست على نقطة النهاية نفسها التي قد تستدعيها، لأن اللوحة لا تنشر إعدادات فك الترميز الخاصة بها ولا نقطة النهاية التي استهدفتها. إذن: المنتج نفسه، على الأرجح جدًا؛ وظروف القياس نفسها، غير مُتحقَّق منها.

ما هو مؤكد هو القفزة الجيلية داخل الخط. يسجّل StepAudio 2.5 ASR نتيجة 4.7% على اللوحة نفسها مقابل 0.15 يوان في الساعة. أما الفئة الحالية فهي 1.7% مقابل 2.8 يوان في الساعة. وهذا انخفاض بنسبة 64% في معدل خطأ الكلمات مقابل نحو تسعة عشر ضعف السعر — وهي أحدّ مقايضة في العائلة، والمقايضة التي تحدد ما إذا كانت الترقية تستحق العناء.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

الأبعاد التي تختلف فعليًا

بمجرد أن تُحسم التسمية، تنحصر المقارنة في قائمة قصيرة. هذه هي التي تغيّر القرار:

• الدقة — StepAudio 3 ASR بنسبة 1.7% في AA-WER غير المتدفق مقابل StepAudio 2.5 ASR بنسبة 4.7% على نفس اللوحة. تم القياس بواسطة Artificial Analysis، وليس بواسطة StepFun.

• السعر — 2.8 يوان في الساعة مقابل 0.15 يوان في الساعة. كلاهما من أسعار قائمة المورّد، وكلاهما ساري. نحو 19 ضعفًا.

• الأوزان — واجهة برمجة تطبيقات مستضافة فقط لكليهما. لا أوزان مفتوحة في أي مكان في العائلة، ولا مسار نشر محلي، ولا خيار استضافة ذاتية في أي مستوى.

• شكل نقطة النهاية — نقطة نهاية واحدة للنسخ المتدفق تُرجع نصًا تدريجيًا ونهائيًا، مقابل الشكل نفسه في الجيل السابق. لم يتغير أي شيء في نموذج التكامل، لذا فإن الترحيل هو مجرد تبديل لمعرّف النموذج وليس إعادة كتابة.

• ضبط الصوت الصعب — تم ضبط StepAudio 3 ASR صراحةً للكلام المهموس والسريع والمتصل والمُغنّى، وللصوت المصحوب بموسيقى في الخلفية. هذا الضبط هو المنتج؛ فالجيل السابق لم يُبنَ لذلك.

• مكاسب النطاقات التي تدّعيها الجهة المورّدة — تُفيد StepFun بانخفاض الصينية بنسبة 9.3%، والإنجليزية بنسبة 25.0%، واللهجات بنسبة 22.3%، والقطاعات الرأسية بنسبة 42.1%، والتبديل اللغوي بنسبة 27.9% من جيل إلى جيل. وهي أرقام مُبلَّغ عنها من الجهة المورّدة ولم يُعَد إنتاجها، لذا تعامل معها على أنها مؤشرات اتجاهية فحسب.

من الملاحظ غياب ما يلي عن تلك القائمة: طول السياق، ودعم صيغ الصوت، والحد الأقصى لمدة الصوت، ومعرّف النموذج. ولا تذكر وثائق StepFun العامة الخاصة بهذا النموذج هذه المعلومات، وأي شخص يستشهد بتلك الأرقام فإنه يستشهد بشيء آخر.

مقارنة ASR بـ Realtime هي المقارنة التي يحتاجها الناس فعلاً

إذا كنت تختار بين منتجات النسخ الصوتي وليس بين أجيال، فإن المقارنة المثيرة ليست بين ASR وASR Max — بل بين ASR وRealtime. تقول المواد التقنية الخاصة بـ StepFun نفسها إن الاثنين يتشاركان مرحلتي التدريب المسبق والتدريب الوسيط ولا يختلفان إلا أثناء الضبط الدقيق الخاضع للإشراف. القاعدة نفسها، الضبط الدقيق مختلف، المنتج مختلف.

لهذه الحقيقة الواحدة قراءة عملية. إن معدل خطأ الكلمات البالغ 1.7% هو خاصية من خصائص الضبط الدقيق لنظام ASR. وهو ليس وعدًا بشأن النموذج الفوري، الذي يحسّن تبادل الأدوار والتعامل مع المقاطعات والاستدلال على الكلام بدلًا من دقة النص. إذا كانت بنيتك تنسخ النص كأثر جانبي لمحادثة مباشرة، فأنت لا تشتري نسبة 1.7% — بل تشتري نموذجًا حواريًا يصدر النص بالمناسبة.

والعكس صحيح أيضًا وأقل وضوحًا: لأنها تشترك في بنية أساسية واحدة، فإن نموذج ASR ليس نموذجًا متخصصًا صغيرًا يُركَّب على العائلة. إنه النظام نفسه من حيث الحجم، لكنه مُضبوط بدقة بشكل مختلف. ولهذا فإن سعر ASR قريب من بقية أفراد العائلة بدلًا من أن يكون قريبًا من الطرف الرخيص في السوق.

ماذا تفعل بهذا إذا كنت تختار واحدًا

ثلاثة أسئلة تحسم الأمر. هل تحتاج إلى نص مكتوب، أم تحتاج إلى محادثة؟ إن كنت تحتاج نصًا مكتوبًا، فإن StepAudio 3 ASR هو المنتج، واسم العائلة مجرد ضجيج. وإن كنت تحتاج محادثة، فأنت تريد StepAudio 3 Realtime، ولا ينبغي أن تقرأ مقاييس أداء ASR على الإطلاق. وإذا احتجت إلى نص مكتوب لصوت صعب حقًا — بلكنة، أو همس، أو غناء، أو تصحبه موسيقى — فإن علاوة 19 ضعفًا هي ثمن الفئة التي ضُبطت من أجل ذلك، والاختبار الصادق هو صوتك أنت لا مؤشر مركّب.

القرار الذي يسهل الخطأ فيه هو التعامل مع طبقة النسخ كطبقة دائمة. أياً كان ما تختاره، فإن النص المنسوخ هو مدخل لشيء آخر — مُلخِّص، أو استخراج منظم، أو فحص امتثال، أو فهرس بحث — وتلك الاستدعاءات تصل إلى نماذج نصية عادية. تلك هي الطبقة التي تتوسع مع الاستخدام بدلاً من دقائق الصوت، وهي الطبقة التي تستحق أن تبقى قابلة للنقل من البداية. OrcaRouter يضع ما يقرب من 200 نموذج نصي خلف واجهة برمجة تطبيقات واحدة مع تجاوز تلقائي للفشل عبر المزودين، ولغة خاصة بالتوجيه (DSL) تجمع عدة نماذج في استدعاء واحد، ودمج النماذج عندما لا يكون حكم نموذج واحد كافياً. وحيثما ينشر مزود سعراً، يتم تمرير سعر القائمة هذا دون هامش ربح، لذا يصل تغيير السعر على الجانب النصي إلى فاتورتك في اليوم الذي يُعلن فيه.

توضيحًا للنطاق، وبما أن هذه الصفحة تتناول عائلة لا نخدمها: لا وجود لأي نقطة وصول StepAudio 3 على OrcaRouter. فالوصول إلى نماذج النسخ والصوت يتم عبر واجهة StepFun البرمجية الخاصة بها. أما ما يحمله OrcaRouter فهو طبقة الاستدلال الواقعة بعد النص المنسوخ، وهي الموضع الذي يكون فيه قرار التبديل رخيصًا ويسيرًا، ومكلفًا إذا أُجّل.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

ما لم يحسمه أحد

يمكن حسم مسألة التسمية. أما ادعاء الأداء فليس بعد. فلا يزال لا يوجد تقرير تقني منشور لنموذج ASR، ولا مجموعة اختبار صادرة، ولا إعدادات فك ترميز، ولا بروتوكول قابل لإعادة الإنتاج من أي جهة خارج StepFun، كما أن مقارنات المورّد نفسه تجري مع منتجات ASR صينية أخرى لا مع النموذج السائد مفتوح الأوزان. نسبة 1.7% قياس حقيقي من طرف ثالث على مؤشر مدمج من ثلاث مجموعات بيانات؛ أما كل ما عدا ذلك بشأن هذا النموذج فهو ادعاء من المورّد.

ثمة أمران سيغيّران الصورة. مقارنة مباشرة وجهاً لوجه مع Whisper Large v3 Turbo على تسجيل صوتي متطابق، وهو ما لم ينشره أحد. وسعرٌ لبقية العائلة — فقد كانت أربعة من طرازات StepAudio 3 الخمسة لا تزال ضمن تسعير معاينة مجانية لفترة محدودة عند الإطلاق، ولم تكن تحمل أسعاراً منشورة سوى خدمتي النسخ والتوليف، ما يعني أن قائمة الأسعار التي يمكنك الاطلاع عليها اليوم تغطي منتجين فقط من أصل خمسة منتجات.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

تلك هي الطبقة التي تتوسع مع الاستخدام لا مع دقائق الصوت، وهي الطبقة التي يستحق الحفاظ على قابليتها للنقل منذ البداية. التجاوز التلقائي للفشل عبر المزودين، ولغة توجيه (DSL) تجمع عدة منها في استدعاء واحد، ودمج النماذج عندما لا يكون حكم نموذج واحد كافياً.