כרטיס כותרת ראשי שנוצר עם הכותרת 'StepAudio 3 ASR vs StepAudio 3' והכתובית 'האחד הוא מודל. האחר הוא חמישה מוצרים תחת שם אחד', מעל הכיתוב התחתון 'נתוני StepFun כפי שפורסמו בספטמבר 2026.'
Guides & Insights

StepAudio 3 ASR לעומת StepAudio 3: אין דגם בשם הזה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

חפשו StepAudio 3 ותמצאו משפחה, לא מודל. השחרור האודיו של StepFun ב-15 בספטמבר 2026 הציג חמישה מוצרים תחת השם הזה — Realtime, ASR, text-to-speech, Gen ו-Music — ומוצר התמלול מביניהם, StepAudio 3 ASR, הוא זה שמטפס בטבלאות המובילים מאז. הדרגה שהתיעוד של StepFun עצמו מכנה מודל ה-ASR הגדול ביותר שלה עד כה היא StepAudio 3 ASR Max, והאח השיחתי שאיתה היא חולקת עמוד שדרה הוא StepAudio 3 Realtime. אם אתם מנסים להשוות את "StepAudio 3 ASR" מול "StepAudio 3", אתם משווים מוצר לקו מוצרים, והתשובה תלויה לחלוטין באיזה מבין השלושה באמת התכוונתם.

הדף הזה פותר את זה. זו לא השוואה שיווקית — זה ההבהרה שאתם זקוקים לה לפני שתוכלו לקרוא נכון כל מפרט של StepAudio 3, מפני ששלושת השמות שלמעלה נושאים מחירים שונים, נקודות קצה שונות ומצבי כשל שונים.

מדוע השם דו־משמעי?

StepFun הוציאה את כל מכלול האודיו ביום אחד, והמוסכמה למתן שמות הפכה את שם המשפחה לשורש של כל שם מוצר. זה מסודר ונאה בשקופית השקה ומגושם בכל מקום אחר. המשמעות היא שחיפוש אחר שם המשפחה מחזיר ערבוב של חמישה מוצרים שונים, ושורת בנצ'מרק שתויגה "StepAudio 3" יכולה בסבירות גבוהה להיות כל אחד מהם.

המשמעות המעשית היא שאי אפשר לדעת מכותרת איזו ישות נמדדה. פוסט שאומר "StepAudio 3 בראש טבלת המובילים בתחום התמלול" מתאר את StepAudio 3 ASR. פוסט שאומר "StepAudio 3 מנצח בדינמיקה שיחתית" מתאר את StepAudio 3 Realtime. שניהם נכונים, מדובר בשני מוצרים שונים, והם אינם ניתנים להחלפה זה בזה.

קיימת אי־בהירות שנייה, ספציפית בתוך קו ה-ASR. התיעוד של StepFun מתייחס לרמת ASR Max כמודל ה-ASR הגדול ביותר שלה עד כה, עם תמחור משלו ונקודת קצה משלו, בעוד ששורות לוח המובילים הציבורי נושאות את התווית הפשוטה יותר. לברר אם אלה מק״ט אחד תחת שני שמות או שני מק״טים הוא הדבר המועיל ביותר שעמוד זה יכול לעשות, והחלק הבא עושה זאת.

שלושת הדברים שהשם יכול להתכוון אליהם

StepAudio 3 ASR — מוצר התמלול. נקודת קצה בזרימה שמחזירה טקסט מצטבר בזמן הפענוח ותמלול סופי בסיום. StepFun מתארת אותו כתמלול עם מודל שפה מצורף להקשר, מכוון לאודיו רפואי, משפטי, פיננסי, רכבי ותכנותי, ולקלטים קשים כמו דיבור בלחש, דיבור מהיר, דיבור רציף, שירה ומוזיקת רקע. זהו המודל שניצב בשיעור שגיאת מילים של 1.7% במדד AA-WER של Artificial Analysis לתמלול דיבור שאינו בזרימה.

StepAudio 3 ASR Max — הדרגה שתיעוד של StepFun מכנה מודל ה-ASR הגדול ביותר שלה עד כה. היא נושאת את תעריף המחירון המפורסם של 2.8 יואן לשעה. זה אינו מתמלל זול יותר; זהו הדגם הבכיר בקו ה-ASR.

StepAudio 3 Realtime — המודל השיחתי בדופלקס מלא. הוא מבצע הסקה ישירות על הדיבור במקום להריץ שרשרת תמלול-ואז-הסקה, והוא מתמלל כתוצר לוואי של כך. הוא אינו מוצר ASR, והדיוק שלו במשימות תמלול אינו מה שעבורו כוונן.

כל השאר במשפחה — TTS, Gen, Music — הוא עבודה שונה לחלוטין ולא אמור להופיע כלל בהשוואת תמלול.

האם ASR ו-ASR Max הם אותו מודל?

הראיות מצביעות על כן, והבדיקה היא אריתמטית. StepFun מפרטת את שכבת ASR Max ב-2.8 יואן לשעה. בהמרה לפי כ-7.1 יואן לדולר, זה בערך $0.39 לשעה, או בערך $6.6 לכל 1,000 דקות. Artificial Analysis מפרטת את המודל בלוח המובילים שלה ב-$6.67 לכל 1,000 דקות. שני נתונים שפורסמו באופן בלתי תלוי, אחד ממחירון הספק ואחד מלוח הצד השלישי, שנמצאים בפער של פחות מסנט זה מזה. זה מה שהיית מצפה לו אם שורת לוח המובילים ותעריף המחירון של ASR Max מתארים את אותו SKU.

כדאי להיות מדויקים לגבי מה זה מוכיח ומה זה אינו מוכיח. זה מוכיח שציר המחירים בטבלת המובילים ומחירון הספק מתארים את אותו מוצר באותו מחיר. זה אינו מוכיח שה־1.7% של טבלת המובילים נמדד בדיוק בנקודת הקצה שאליה היית קורא, מפני שהטבלה אינה מפרסמת את הגדרות הפענוח שלה או את נקודת הקצה שאליה פנתה. אז: אותו מוצר, סביר מאוד; אותם תנאי מדידה, לא מאומת.

מה שבטוח הוא הקפיצה הדורית בתוך הסדרה. StepAudio 2.5 ASR עומד על 4.7% באותו לוח במחיר 0.15 יואן לשעה. הדרגה הנוכחית היא 1.7% במחיר 2.8 יואן לשעה. מדובר בהפחתה של 64% בשיעור שגיאות המילים תמורת תעריף גבוה פי תשעה עשר בערך — הפשרה החדה ביותר במשפחה, וזו שמכריעה אם השדרוג משתלם.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

הממדים ששונים בפועל

לאחר שהשמות נקבעים, ההשוואה מצטמצמת לרשימה קצרה. אלה הם אלה שמשנים החלטה:

• דיוק — StepAudio 3 ASR ב-1.7% AA-WER ללא זרימה לעומת StepAudio 2.5 ASR ב-4.7% על אותו מדד. נמדד על ידי Artificial Analysis, לא על ידי StepFun.

• מחיר — 2.8 יואן לשעה לעומת 0.15 יואן לשעה. שניהם תעריפי מחירון של הספקים, שניהם עדכניים. בערך פי 19.

• משקלים — API מתארח בלבד עבור שניהם. אין משקלים פתוחים בשום מקום במשפחה, אין מסלול on-premise, אין אפשרות אירוח עצמי בשום דרג.

• צורת נקודת הקצה — נקודת קצה אחת לתמלול בזרימה שמחזירה טקסט מצטבר וסופי לעומת אותו מבנה בדור הקודם. שום דבר במודל האינטגרציה לא השתנה, כך שההגירה היא החלפת מזהה מודל ולא שכתוב.

• כיוונון לשמע מאתגר — StepAudio 3 ASR מכוון במפורש לדיבור בלחש, מהיר, רציף ומושר, ולשמע שיש מתחתיו מוזיקה. הכיוונון הזה הוא המוצר; הדור הקודם לא נבנה לכך.

• רווחים בתחום המוצהרים על ידי הספק — StepFun מדווחת על ירידה של 9.3% בסינית, 25.0% באנגלית, 22.3% בניבים, 42.1% באנכים ו-27.9% בחילופי קוד מדור לדור. מדווח על ידי הספק ולא משוחזר, ולכן יש להתייחס אליהם כאל כיווניים.

בולט בהיעדרם מהרשימה הזו: אורך ההקשר, תמיכה בפורמטי אודיו, משך אודיו מקסימלי ומזהה מודל. התיעוד הציבורי של StepFun עבור המודל הזה אינו מציין אותם, וכל מי שמצטט את המספרים האלה מצטט משהו אחר.

ההשוואה בין ASR ל-Realtime היא ההשוואה שאנשים באמת צריכים.

אם אתם בוחרים בין מוצרי תמלול ולא בין דורות, ההשוואה המעניינת היא לא ASR לעומת ASR Max — אלא ASR לעומת Realtime. החומר הטכני של StepFun עצמה אומר ששניהם חולקים את שלבי האימון המקדים והאימון הביניים שלהם, ונבדלים רק בשלב הכיוונון העדין המפוקח. אותו בסיס, כיוונון עדין שונה, מוצר שונה.

לעובדה הבודדת הזו יש משמעות מעשית. שיעור שגיאת המילים של 1.7% הוא מאפיין של הכיוונון העדין של ASR. הוא אינו הבטחה לגבי מודל זמן-האמת, שמבצע אופטימיזציה לחילופי תורות, לטיפול בהפרעות ולהסקה על גבי הדיבור ולא לדיוק התמלול. אם הארכיטקטורה שלך מתמללת כתוצר לוואי של שיחה חיה, אינך קונה את ה-1.7% — אתה קונה מודל שיחתי שבמקרה פולט טקסט.

גם ההפך נכון ופחות מובן מאליו: מכיוון שהם חולקים שלד משותף, מודל ASR אינו מודל מומחה קטן שהוצמד למשפחה. הוא מערכת באותו סדר גודל, שעברה כיוונון עדין באופן שונה. לכן התעריף של ASR קרוב לזה של שאר המשפחה ולא לקצה הזול של השוק.

מה לעשות עם זה אם אתם בוחרים אחד

שלוש שאלות מכריעות את העניין. האם אתה צריך תמלול, או שאתה צריך שיחה? אם תמלול, StepAudio 3 ASR הוא המוצר ושם המשפחה הוא רעש. אם שיחה, אתה רוצה StepAudio 3 Realtime ואתה בכלל לא אמור לקרוא מדדי ASR. ואם אתה צריך תמלול של אודיו קשה באמת — עם מבטא, בלחישה, בשירה, או עם מוזיקה מתחתיו — תוספת המחיר של פי 19 היא המחיר של השכבה שכויילה לכך, והמבחן הכנה הוא האודיו שלך עצמך ולא מדד משולב.

ההחלטה שקל לטעות בה היא להתייחס לשכבת התמלול כאל קבועה. מה שתבחרו, התמלול הוא קלט למשהו אחר — מסכם, חילוץ מובנה, בדיקת תאימות, אינדקס חיפוש — והקריאות האלה מגיעות למודלים רגילים של טקסט. זו השכבה שמתרחבת עם השימוש ולא עם דקות האודיו, והיא השכבה ששווה לשמור עליה ניידת מההתחלה. OrcaRouter מציב כמעט 200 מודלים של טקסט מאחורי API אחד עם מעבר אוטומטי בין ספקים בעת כשל, DSL לניתוב שמרכיב כמה מהם לקריאה אחת, ומיזוג מודלים כשהשיפוט של מודל אחד אינו מספיק. במקום שבו ספק מפרסם תעריף, מחיר המחירון הזה מועבר הלאה ללא תוספת, כך ששינוי מחיר בצד הטקסט מגיע לחשבון שלכם ביום שבו הוא מוכרז.

לשם בהירות לגבי ההיקף, מכיוון שדף זה עוסק במשפחה שאיננו משרתים: אין נקודת קצה של StepAudio 3 ב-OrcaRouter. מודלי התמלול והקול נגישים דרך ה-API של StepFun עצמה. מה ש-OrcaRouter מספק הוא שכבת ההסקה שבמורד הזרם מהתמלול, וזה המקום שבו קבלת החלטת החלפה היא זולה, בעוד דחייתה יקרה.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

מה שאף אחד לא יישב

נושא השם ניתן לפתרון. טענת הביצועים – עדיין לא. עדיין אין דוח טכני מפורסם עבור מודל ה-ASR, אין ערכת בדיקה שפורסמה, אין תצורת פענוח ואין פרוטוקול שניתן לשחזר מאף גורם מחוץ ל-StepFun, וההשוואות של הספק עצמו הן מול מוצרי ASR סיניים אחרים ולא מול השחקן הדומיננטי במשקולות פתוחות. ה-1.7% הוא מדידה אמיתית של צד שלישי על מדד משולב של שלושה מערכי נתונים; כל השאר בנוגע למודל הזה הוא טענה של הספק.

שני דברים היו משנים את התמונה. השוואה ישירה מול Whisper Large v3 Turbo על אותו אודיו, שאיש לא פרסם. ותעריף לשאר המשפחה — ארבעה מחמשת דגמי StepAudio 3 עדיין היו בתמחור תצוגה מקדימה חינמי לזמן מוגבל בעת ההשקה, ורק תמלול וסינתזה נשאו תעריפים מפורסמים, מה שאומר שהמחירון שאפשר לקרוא היום מכסה שניים מחמישה מוצרים.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

זו השכבה שמתרחבת בהתאם לשימוש ולא בהתאם לדקות אודיו, והיא השכבה שכדאי לשמור עליה כניידת מלכתחילה. מעבר כשל אוטומטי בין ספקים, DSL לניתוב שמרכיב כמה מהם לקריאה אחת, ומיזוג מודלים כששיקול הדעת של מודל אחד אינו מספיק.