כרטיס כותרת הירו מיוצר עם הכותרת הראשית 'StepAudio 3 ASR vs Whisper Large v3 Turbo' והכתובית '1.7 אחוזים לעומת 4.6 אחוזים, ולא קיים מבחן ראש בראש', מעל הכיתוב התחתון 'StepAudio לפי Artificial Analysis; Whisper לפי Hugging Face.'
Guides & Insights

StepAudio 3 ASR מול Whisper Large v3 Turbo: 1.7% לעומת 4.6%, ואף אחד לא הריץ את המבחן

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ההשוואה שאתם רוצים אינה קיימת. StepAudio 3 ASR ו-Whisper Large v3 Turboנמצאים על אותו מדד Artificial Analysis AA-WER עבור המרת דיבור לטקסט שאינה בזרימה — שיעור שגיאת מילים של 1.7% לעומת נתונים בטווח של 4 עד 5.5% — ונכון לסוף ספטמבר 2026 איש לא פרסם השוואה ישירה על אודיו זהה. לא StepFun, לא מתחזקי Whisper, לא מעבדה עצמאית. התיעוד של StepFun עצמו מציג השוואות מול Doubao ASR 2.0, Seed 2.0 Lite ו-HY3.0 ASR Preview, כולם מוצרי ASR סיניים. בצד של Whisper אין ספק שפרסם השוואות בכלל, מכיוון ש-Whisper Large v3 Turbo זמין להורדה כבר שנים והמספרים שלו תלויים במי שמשרת אותו.

אז הדף הזה עושה את הגרסה הכנה: הוא קורא את הלוח האחד שמודד את שניהם, מפריד בין מה שניתן להשוות לבין מה שלא, ואומר בבירור היכן הראיות נגמרות. התשובה הקצרה היא שהפער בדיוק הוא אמיתי ורוחבו כשלוש נקודות, והפער בכל השאר — מחיר, רישיון, יכולת פריסה — נע בכיוון ההפוך והוא גדול יותר.

מה כל אחד הוא בפועל

StepAudio 3 ASR הוא מודל תמלול מתארח שפורסם על ידי StepFun ב-15 בספטמבר 2026 כחלק ממשפחת השמע StepAudio 3, המונה חמישה מודלים. הוא נגיש דרך נקודת קצה זורמת אחת שמחזירה טקסט מצטבר במהלך הפענוח ותמלול סופי בסיומו. StepFun מתארת אותו כתמלול עם מודל שפה מצורף לצורך הקשר, מכוונן לשמע רפואי, משפטי, פיננסי, רכבי ותכנותי, ולקלטים שמפילים מזהים קונבנציונליים — דיבור בלחישה, דיבור מהיר, דיבור רציף, שירה, ושמע עם מוזיקה ברקע. אין משקלים פתוחים, אין מסלול התקנה באתר הלקוח, ואין אפשרות לאירוח עצמי בשום דרג. מחיר המחירון המפורסם הוא 2.8 יואן לשעה, כ-6.67 דולר ל-1,000 דקות בציר המחירים של לוח הדירוג עצמו.

Whisper Large v3 Turbo הוא מודל במשקלים פתוחים שפורסם על ידי OpenAI תחת רישיון MIT: 809 מיליון פרמטרים, 99 שפות, נגזרת מגוזמת ומכווננת של Whisper large-v3 עם הפחתה בשכבות המפענח. הוא הורד מיליוני פעמים ומוצע באופן מסחרי על ידי רשימה ארוכה של פלטפורמות, וניתן להריץ אותו על החומרה שלך. התכונה האחרונה היא כל ההשוואה, והיא הסיבה לכך שפער הדיוק אינו המספר היחיד שחשוב.

הלוח היחיד שמודד את שניהם

מדד AA-WER של Artificial Analysis מדווח על אחוז המילים שתומללו באופן שגוי, ככל שנמוך יותר כך טוב יותר, וגרסה 2 שלו משלבת שלושה מערכי נתונים: AA-AgentTalk ב-50%, VoxPopuli-Cleaned-AA ב-25%, ו-Earnings22-Cleaned-AA ב-25%. התצוגה הלא-זורמת מציגה 36 מתוך 71 המודלים שהיא עוקבת אחריהם. שני המודלים מופיעים בה, וזה יותר ממה שרוב ההשוואות יכולות לטעון.

קרא כפי שהלוח מפרט אותם:

• StepAudio 3 ASR — ‏1.7% AA-WER, בערך $6.67 לכל 1,000 דקות אודיו

• Whisper Large v3 Turbo, נקודת קצה אחת מתארחת — 4.6% AA-WER, כ-$0.67 לכל 1,000 דקות

• Whisper Large v3 Turbo, נקודת קצה מתארחת שנייה — 5.5% AA-WER, כ-15.00$ לכל 1,000 דקות

• Whisper Large v3, דור שונה עם משקלים פתוחים — 4.1% בנקודת קצה אחת, 10.1% באחרת

• StepAudio 2.5 ASR, הדור הקודם של StepFun — 4.7%

שתי השורות האחרונות הן המאלפות ביותר בלוח, והן בכלל לא עוסקות ב-StepFun. אותם משקולות Whisper הפתוחות משיגות 4.1% בנקודת קצה אחת ו-10.1% באחרת. זהו פער של 6 נקודות באותם פרמטרים ממש, שנוצר כולו מהבדלים בשירות: אסטרטגיית חיתוך, חומרה, תצורת פענוח, והאופן שבו כל מארח מתמודד עם אודיו ארוך מהמגבלות הפנימיות שלו. הערת השוליים של הלוח עצמו אומרת בדיוק זאת, ומציינת שבאחד ממערכי הנתונים שלו חלק מהמודלים מקבלים את האודיו שלהם מחולק לקטעים של כתשע דקות ואחרים לכשלושים שניות בערך, בגלל מגבלות זמן.

מה שאומר שההשוואה "StepAudio 3 ASR מול Whisper Large v3 Turbo" היא למעשה שתי השוואות בערימה. המודל מול המשקולות, והמודל מול נקודת הקצה שבה במקרה בדקת את הביצועים. השנייה משתנה יותר מהראשונה.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

מאיפה מגיע פער הדיוק, ועד כמה כדאי לסמוך עליו

שלוש נקודות בשיעור שגיאת המילים הן פער גדול בתחום שבו חמש המערכות המובילות נמצאות בטווח של 0.6 נקודות זו מזו. זהו גם המספר היחיד בהשוואה הזו שנמדד על ידי צד שלישי, והוא מגיע עם הסתייגויות אמיתיות שפועלות בשני הכיוונים.

מול StepAudio 3 ASR: הנתון הוא אינדקס משוקלל, והשילוב הוא 50% AA-AgentTalk — מערך נתונים של שיחות סוכנים. מודל שמכוונן לתמלול ייעודי-תחום, עם LLM שמצורף להקשר, מתאים היטב לצורה הזו של אודיו. שנו את משקלות האינדקס לעבר דיבור נקרא או חדשות שידור, והסדר עשוי להתהדק. כמו כן, עדיין אין דוח טכני מפורסם עבור מודל ה-ASR, אין מערך בדיקות שפורסם, אין תצורת פענוח ואין פרוטוקול שניתן לשחזר מאת אף גורם מחוץ ל-StepFun.

מול Whisper Large v3 Turbo: ה-4.6% הוא המספר של נקודת קצה מתארחת אחת, ולא תכונה של המודל. המשקולות קבועות וציבוריות; הציון — לא. צוות שמריץ את אותן משקולות בקפידה, עם חלוקה למקטעים המתאימה לתחום ותצורת מפענח טובה, יכול להשיג תוצאה טובה באופן משמעותי מהשורה בטבלת הדירוג — וצוות שמריץ אותן ברשלנות יכול להשיג תוצאה גרועה יותר מה-10.1% שרשם הדור האחר של משקולות פתוחות. הסיכום הכנה הוא שלצד המשקולות הפתוחות בהשוואה הזו יש רצפה שאפשר למדוד ותקרה שצריך להרוויח.

מה שחסר הוא המספר שיכריע את העניין: שתי המערכות, סט אודיו אחד, פרוטוקול פענוח אחד, מפורסם. אף אחד לא הריץ אותו, ועד שמישהו יעשה זאת, "1.7% לעומת 4.6%" הוא השוואה בין שתי מדידות שנעשו בתנאים שונים ולא מדידה של שתי מערכות זו מול זו.

ארבעת הממדים האחרים, שבהם Whisper מנצח בפער גדול יותר

דיוק הוא הממד שבו StepFun מנצחת. בשאר הרשימה, המודל עם משקולות פתוחות לא מתקרב, ואלה הם אלה שמכריעים אם פריסה אפשרית בכלל:

• רישיון ומשקולות — משקולות פתוחות ברישיון MIT עם 809 מיליון פרמטרים, לעומת API מתארח שלא פורסמו בו משקולות בשום רמה.

• פריסה — באחסון עצמי, באתר הלקוח, בסביבה מבודדת מרשת, או דרך כל אחת מעשרות פלטפורמות מסחריות לעומת ה-API של StepFun בלבד.

• רצפת עלות — כ-$0.67 ל-1,000 דקות בנקודת קצה מתארחת אחת, ואף נמוך יותר אם תריץ זאת בעצמך, לעומת כ-$6.67 ל-1,000 דקות לפי התעריף המפורסם של הספק.

• שהיית נתונים — השמע לעולם אינו יוצא מתשתית שבשליטתך, לעומת שמע שנשלח לנקודת קצה של צד שלישי.

• סיכון אינטגרציה — לא ניתן למשוך את המודל, לתמחר אותו מחדש או להוציאו משימוש מתחתיך, מכיוון שאתה מחזיק במשקלים לעומת תעריף מתארח שיכול להשתנות עם מחירון.

• התנהגות אודיו ארוך — חלוקה למקטעים היא החלטה שלך, וניתן לכוונן אותה לכל קובץ בנפרד לעומת מה שנקודת הקצה של הספק עושה באופן פנימי, וזה אינו מתועד.

פער המחיר הזה הוא בערך עשרה לאחד לעומת נקודת הקצה הזולה יותר של Whisper, והוא תמונת המראה של מה שקרה בתוך סדרת המוצרים של StepFun עצמה: המודל שאותו מחליף המודל הזה, StepAudio 2.5 ASR, תומחר ב-0.15 יואן לשעה, והדרגה הנוכחית רשומה במחיר 2.8. StepFun העלתה את תעריף התמלול פי בערך תשע עשרה כדי לקנות דיוק, מה שמציב אותו בשוק שונה ממודל בהארחה עצמית עם משקולות פתוחות, ולא כגרסה יקרה יותר שלו.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

איזה אחד כדאי לך לבחור

הפיצול נקי יותר מאשר ברוב המפגשים ראש-בראש:

• בחרו ב-Whisper Large v3 Turbo אם האודיו רגיל, עוצמת הקול גבוהה, הנתונים לא יכולים לצאת מהתשתית שלכם, או שאתם זקוקים לפריסה קבועה עם מחיר יציב. רישיון MIT אומר שההחלטה היא שלכם לחזור בה, ואף אחד לא יכול לקחת אותה בחזרה.

• בחרו ב-StepAudio 3 ASR אם האודיו באמת קשה — עם מבטא, בלחישה, בשירה, או עם מוזיקה ברקע — או אם התחום הוא אחד מחמשת התחומים ש-StepFun כיוונה עבורם. זה מה שהפרמיה קונה, ובאודיו כזה פער דיוק של שלוש נקודות הוא ההבדל בין תמלול שמיש לבין סבב תיקונים ידני.

• אל תבחר באף אחד מהם באופן בלעדי אם אינך יודע לאיזה סוג שייך האודיו שלך. העלות של טעות אינה סימטרית: ניתן לבדוק את מסלול ה-open-weights על החומרה שלך במחיר של שעת GPU, ואילו המסלול המתארח לא עולה דבר לנסות אך מחייב אותך בתעריף שאינך יכול לשלוט בו.

הטיעון בעד תצורה היברידית חזק כאן יותר מאשר ברוב ההשוואות, והסיבה היא פיזור נקודות הקצה בלוח. מכיוון שאותן משקולות Whisper מקבלות ציון שנע בין 4.1% ל-10.1% בתלות במי שמשרת אותן, המהלך המעשי הוא לנתב את נתיב המשקולות הפתוחות דרך יותר ממארח אחד במקום להתחייב למארח אחד — וזה בדיוק מה שמעבר אוטומטי בעת כשל מספק לך, וזה אותו מנגנון שמאפשר לך להציב מודל מתארח לפני נתיב ייצור בלי להמר עליו את הנתיב.

איך זה משתלב בסטָק, ומה אנחנו מגישים ומה לא

לא משנה מה שתבחרו לתמלול, התמלול מגיע לאנשהו. מסכם, חילוץ מובנה, בדיקת תאימות, אינדקס חיפוש — הקריאות האלה מגיעות למודלים רגילים של טקסט, והן החלק בחשבון שגדל בהתאם לשימוש ולא בהתאם לדקות אודיו. המודל בזמן אמת של StepFun עצמה מפרסם קריאה לכלים וביצוע אסינכרוני של משימות ארוכות, מה שאומר שאפילו שכבת האודיו מעבירה כל הזמן עבודה למשהו שאינו מודל אודיו.

ליתר בהירות לגבי ההיקף, משום שקל היה לרמוז אחרת: לא StepAudio 3 ASR ולא Whisper Large v3 Turbo נמצאים ב-OrcaRouter. StepAudio נגיש דרך ה-API של StepFun עצמה, ומשקלי Whisper הם שלך להרצה או להעברה לפלטפורמת אירוח. מה ש-OrcaRouter מספק הוא שכבת ההאצלה שאליה התמלול מזין — כמעט 200 מודלים טקסטואליים מאחורי API אחד, עם מעבר אוטומטי לגיבוי כך שקריאה במורד השרשרת לא נופלת יחד עם ספק בודד, DSL לניתוב שמרכיב כמה מודלים לקריאה אחת, ומיזוג מודלים כששיקול הדעת של מודל אחד אינו מספיק. כאשר ספק מפרסם תעריף, מחיר המחירון הזה מועבר הלאה ללא תוספת רווח, כך ששינוי מחיר מגיע לחשבון שלך ביום שבו הוא מוכרז — וזה, בהתחשב בכך שהשוואה זו כוללת ספק שהעלה את תעריף התמלול שלו פי תשעה עשר במהדורה אחת, אינו יתרון היפותטי.

אם אתם עומדים להוציא כסף אמיתי על שאלת הדיוק, הרצף הזול הוא זה: הריצו קודם את המשקלים הפתוחים על האודיו שלכם, כי אתם יכולים, וכי המספר שתקבלו יהיה רלוונטי יותר מכל לוח דירוג. ואז החליטו אם הפער שנותר שווה פי עשרה מהתעריף. רוב הצוותים יגלו שזה שווה את זה עבור חלק מהתעבורה שלהם ולא עבור השאר, וזו בעיית ניתוב ולא בחירת מודל.

מה יפתור את זה?

מבחן מפורסם אחד. שתי המערכות, אותו אודיו, אותו פרוטוקול פענוח, חלוקה הוגנת בין דיבור נקרא, אודיו שיחתי והמקרים הקשים ש-StepFun טוענת שכיוונה עבורם. עד שמבחן כזה יהיה קיים, ההשוואה היא מדד של צד שלישי מצד אחד וקבוצה של משקולות פתוחות עם ציון משתנה מצד שני, והדרך האחראית היחידה לקרוא אותה היא כנקודת מוצא ולא כתשובה.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.