כרטיס כותרת שנוצר עבור Step 5 Preview עם הכיתוב 'Step 5 Preview — ההדלפה עד כה', המפרט שש מפרטים כשורות של תווית וערך: סך הפרמטרים כ-600B, מופעלים לכל הסקה כ-27B, קלט טקסט ותמונה, חלון הקשר של 1M טוקנים, AA Intelligence Index 44, ומחיר $1.00 לקלט ו-$2.70 לפלט לכל 1M טוקנים. כותרת תחתונה מציינת 'כל המספרים מגוף שלישי ולא מבוקרים - StepFun לא הכריזה על מודל זה.' הלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Guides & Insights

תצוגה מקדימה ל-Step 5: מודל הדגל 600B שטרם הוכרז של StepFun כבר נמצא בלוח המובילים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Step 5 Preview יש לו דירוג בלוח המובילים, מחיר מפורסם, מהירות פלט מדודה וציון Intelligence Index של 44 — אותו ציון כמו Kimi K3, מודל שגדול ממנו בערך פי חמישה. מה שאין לו הוא השקה. StepFun לא הכריזה עליו, התיעוד של הפלטפורמה של StepFun עצמה לא מציין אותו, ואין משקולות להורדה. כל נתון למטה מגיע מצד שלישי שקיבל גישה לפני שהספק אמר משהו בפומבי, מה שהופך את זה לכתבה של "מה ידוע לנו עד כה" ולא לסקירה. יש לקרוא את המספרים כראיות למה שעומד לבוא, לא כדף מפרט.

ההדלפה היא הסיפור

העקבות הציבוריות הראשונות של Step 5 Preview הן ריצת הערכה. ל-Artificial Analysis יש דף מודל חי עבורו, שנמדד דרך ה-API של StepFun עצמה תחת תג הבדיקה step-5-preview-b, כאשר הפלטפורמה מתארכת את המודל ל-18 בספטמבר 2026. הדף הזה הוא המקור ל-44, לתמחור, למדידת המהירות ולשורות המדדים במאמר זה.

מול זה, בצד הספק הכל ריק. התיעוד למפתחים של StepFun מפרט מודלים עד Step 3.7 Flash ו-Step 3.5 Flash ונעצר שם — אין step-5, אין רשומת תצוגה מקדימה. לארגון stepfun-ai ב-Hugging Face אין מאגר של Step 5, מה שמתיישב עם דגם דגל במשקלים סגורים ולא עם מחדל. דיווחים קהילתיים בפורומים של מפתחים בסין מצביעים על חשיפה אפשרית באירוע AGI Frontier בשנגחאי ב-19 בספטמבר, שזה בערך יום אחרי שההערכות צצו. נכון לזמן כתיבת שורות אלה, לאף אחד מחוץ ל-StepFun אין מפרט רשמי, מחיר רשמי או שם רשמי לגרסה המשוחררת.

השם עצמו הוא הרמז הראשון לכך שמדובר בתצוגה מקדימה ולא בהשקה. StepFun דילגה לחלוטין על סדרת Step 4.x ועברה ישירות ל-Step 5. מודל שמשוחרר תחת Preview כסיומת, ושעבר בנצ'מרק לפני שיש לו אפילו דף מוצר, הוא מודל שהספק עדיין מכייל — התמחור, הניתוב והמגבלות יכולים כולם להשתנות לפני הזמינות הכללית.

איך המפרט נראה, ככל שאפשר לדעת

אלה המספרים שמסתובבים, והם הטענות החוזרות ביותר של ההדלפה — וזה לא אותו דבר כמו הטענות המאומתות ביותר שלה:

• סה״כ פרמטרים — כ-600B, לעומת כ-2.8T אצל Kimi K3

• מופעלים לכל היסק — כ-27B, כ-4.5% מהסך הכול, יחס תערובת מומחים דליל במיוחד

• אופני קלט — טקסט ותמונות; הפלט הוא טקסט בלבד

• הסקה — כן, עם חשיבה מורחבת

• חלון הקשר — מיליון אסימונים ב-Artificial Analysis; תצורה נפרדת של צד שלישי שמסתובבת בכלי פיתוח מפרטת 350,000 עם פלט מרבי של 64,000

• זמינות משקל — סגור, אין מאגר

כדאי לסמן בבירור את הסתירה הזו בחלון ההקשר, מכיוון שאיש לא פתר אותה. חלון של 1M טוקנים וחלון של 350k טוקנים הם מוצרים שונים עם עלויות זיכרון שונות, והנתון השני מגיע עם תקרת פלט של 64k שהראשון לא אומר עליה דבר. אם אתם מתכננים צינור עיבוד למסמכים ארוכים על סמך נתון ה-1M, תצורת 350k היא הסיבה להמתין לעמוד ספק. גם למספרי הפרמטרים יש מידת אי-ודאות דומה: העוקב של DataLearner עדיין מתעד את ארכיטקטורת MoE ומספרי הפרמטרים של Step 5 Preview כלא זמינים, כלומר צמד 600B/27B — העובדה המצוטטת ביותר על המודל הזה — הוא גם אחד הפרטים הפחות מאושרים רשמית.

המספר המעניין הוא 27B, לא 600B

מודלים דלילים מסוג תערובת מומחים (sparse mixture-of-experts) מקצים חישוב רק למומחים שטוקן אכן מנותב אליהם, ולכן הנתון של הפרמטרים הפעילים הוא זה שקובע כיצד המודל מתנהג בפרודקשן. עם כ-27B פעילים, Step 5 Preview מבצע עבודה לכל טוקן באותו טווח כמו מודלים שגודלם שבריר מגודלו, בעוד ש-600B בסך הכול הם במידה רבה שאלה של תפוסת זיכרון.

שתי השלכות נובעות מכך, ושתיהן מופיעות במדידות של צד שלישי. עלות ההגשה נגזרת מפרמטרים פעילים, וזה חלק מהסיבה שהמחיר הוא כפי שהוא. וגם המהירות לכל טוקן מרוויחה מכך: Artificial Analysis מודדת 99.8 טוקני פלט לשנייה, במקום ה-42 מתוך 200 מודלים, לעומת חציון של 64.6. זמן לטוקן הראשון עומד על 2.96 שניות לעומת חציון של כ-3.57 שניות. אם הפיצול 600B/27B מדויק, זהו מודל שתוכנן להיות זול להגשה ולא זול לאירוח — הבחנה חשובה אם אתם אלה שמשלמים על ה-GPUs ולא על הטוקנים.

היכן זה ממוקם ב-Intelligence Index

Artificial Analysis מעניקה ל-Step 5 Preview ציון 44 ב-Intelligence Index v4.3, הכולל עשר הערכות. זהו המקום ה-25 מתוך 200 מודלים בלוח הדירוג, והרבה מעל המודל החציוני שהמדד מדרג, שעומד על 25.

• מדד האינטליגנציה — Step 5 Preview 44 מול Kimi K3 44

• ממש מעל — GLM-5.3 ו-Claude Opus 5, שניהם ב-45

• ממש מתחת — DeepSeek V4.1 Flash ב-40 ו-DeepSeek V4 Pro ב-36

• Terminal-Bench 4.0 — Step 5 Preview 33.3% לעומת Kimi K3 בסביבות 12.6%, ולעומת DeepSeek V4.1 Flash בסביבות 26.8%

• SciCode — 59% עבור Step 5 Preview, בשוויון עם Kimi K3

• מהירות פלט — 99.8 טוקנים לשנייה לעומת חציון התחום של 64.6

הכותרת היא השוויון עם Kimi K3, והקריאה הכנה צרה יותר ממה שהכותרות מרמזות. התאמה של מודל בעל 2.8T פרמטרים במדד מצרפי ב-600B בסך הכול היא תוצאה אמיתית של יעילות, אבל המצרפי מסתיר את הצורה שלה: הפער ב-Terminal-Bench 4.0 לטובת Step 5 Preview דרמטי, בעוד שתוצאת SciCode היא תיקו מוחלט. שוויון מצרפי במדד אינו שוויון בכל מקום, וגרסת preview היא הרגע הפחות אמין להניח שהפערים יישמרו.

אי-התאמה נוספת שראויה להזכיר: Artificial Analysis מדווחת על 44, בעוד שהעוקב העצמאי של DataLearner מתעד את אותה הרצה כ-43.6. זהו הבדל עיגול ולא מחלוקת על היכולת, אבל זה בדיוק סוג הדבר שממחיש את הנקודה לגבי המספרים של המודל הזה באופן כללי — אלה קריאות של צד שלישי של מודל שלא הוכרז, שנלקחו ברגעים מעט שונים, ואף אחת מהן לא אושרה על ידי StepFun. אף אחד מהבנצ'מרקים האלה לא דווח על ידי הספק, וזה עובד לשני הכיוונים: אף אחד ב-StepFun לא טען למספר כאן, ואף אחד ב-StepFun לא עמד מאחורי מספר כזה.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

המחיר, והמילוליות שמכרסמת בו

התמחור הוא החלק בהדלפה הזו שישפיע על התקציב במועד המוקדם ביותר. דרך ה-API של StepFun, Artificial Analysis מתעדת את הדברים הבאים:

• קלט — $1.00 למיליון טוקנים, לעומת חציון של $1.88 עבור מודלים דומים

• פלט — $2.70 למיליון טוקנים, לעומת חציון של $10.00

• מטמון — הנחה של 95% על מטמון, מה שמעמיד פגיעות מטמון על כ-$0.05 למיליון טוקנים

• משולב — כ-$0.51 למיליון טוקנים בתמהיל של 7:2:1 של פגיעות מטמון, קלט ופלט

• עלות לכל משימה של Intelligence Index — $0.71

• עלות הרצת אינדקס מלאה — $918.34 בסך הכול

הפלט במחיר $2.70 הוא השורה החשובה ביותר, כי הוא פחות מחמישית ממה ש-Kimi K3 גובה עבור אותו מיליון טוקנים במחיר $15.00. אבל יש מלכוד שהשוואה לפי טוקן מסתירה, ו-Artificial Analysis מודדת אותו ישירות: מילוליות. Step 5 Preview הפיק 160 מיליון טוקני פלט כדי להשלים את Intelligence Index, לעומת חציון של 90 מיליון בתחום ודירוג במקום ה-65 מתוך 200 לפי מדד זה.

תעשה את החשבון עד הסוף. במחיר של $2.70 למיליון, 160M טוקנים של פלט הם כ-$432 — בערך חצי מהעלות הכוללת של $918.34 של כל ריצת האינדקס, שהוצאה על הפטפטת של המודל עצמו ולא על המשימות. אם תעביר את אותם 160M טוקנים בתעריף הפלט של $15.00 של Kimi K3, תגיע ל-$2,400, ומשם מגיע יתרון המחיר. אבל האזהרה המעשית היא לכל מי שמעריך עלויות על ידי שאיבת מספר טוקנים ממודל אחר: Step 5 Preview כותב בערך פי 1.8 מהחציון, כך שעומס עתיר פלט קונה גם את התעריף הזול יותר וגם יותר טוקנים בו-זמנית. ההנחה שורדת, אבל היא קטנה ממה שההשוואה בין $1.00/$2.70 ל-$3.00/$15.00 מציגה, וגודלה תלוי לגמרי בכמה שהפרומפטים שלך גורמים למודל לפטפט.

הנחת המטמון של 95% היא המנוף האחר, והיא אגרסיבית באופן יוצא דופן. עומס עבודה עם שימוש חוזר כבד בפרומפט — פרומפט מערכת ארוך, מסמך קבוע, בסיס קוד משותף — מגיע קרוב הרבה יותר ל-$0.51 המשוקלל מאשר לתעריף הקלט של $1.00. הנתון המשוקלל הזה מניח יחס של 7:2:1, שהוא הנחת מודל ולא הבטחה, אבל זו הצורה הנכונה של חשבון להריץ מול התעבורה שלכם.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

מה בודקים מוקדמים נתקלים בו

אלה דיווחים בודדים מפורומים של מפתחים ומפוסטים ברשתות חברתיות בימים סביב ההדלפה, ולא מדידות, ויש להעניק להם משקל בהתאם:

• קריאה לכלים היא התלונה הנפוצה ביותר — נבחרים שמות כלים שגויים, ומתבצעים ניסיונות עריכה בלי לקרוא תחילה את קובץ היעד

• שגיאות שדווחו מעבר לכ-340,000 טוקנים של הקשר, וזהו מצב הכשל שיש לשים לב אליו אם חלון ה-1M יתברר כמספר האמיתי

• סינון תוכן מקצר פלטים בפרומפטים מסוימים

• ההתרשמויות לגבי היכולות חלוקות: חלק מהבודקים ממקמים אותו מעל GLM-5.3 Flash, ואחרים ממקמים אותו מתחת ל-DeepSeek V4.1 Flash

גרסת תצוגה מקדימה שטרם שוחררה שנכשלת בשימוש בכלים אינה שערורייה — לשם כך נועדה תווית התצוגה המקדימה. אבל זה כן אומר שאין לקרוא את ה-44 כהבטחה לגבי אמינות סוכנית, מפני שמדד האינטליגנציה לא בודק את הדבר שעליו מתלוננים הבודקים המוקדמים ביותר.

איך היית באמת קורא לזה — ומה להשתמש בינתיים

OrcaRouter אינו מנתב את Step 5 Preview. אין נקודת קצה ציבורית ואין משקולות, כך שאין מה לנתב, ואף פלטפורמת צד שלישי לא יכולה עדיין לטעון אחרת ביושר. כל מי שאומר לך היכן לקרוא לו היום מתאר נקודת קצה להערכה, לא מוצר.

המודלים שמולם הוא נמדד הם עניין אחר. Kimi K3, GLM-5.3 ו-DeepSeek V4.1 Flash זמינים כולם דרך OrcaRouter, לצד 199 מודלים מ-15 ספקים, מאחורי מפתח API יחיד וחיוב יחיד. התמחור מועבר כפי שהוא במחיר המחירון של הספק, עם 0% תוספת, מה שחשוב יותר מהרגיל במודל כמו זה: אם המחיר של Step 5 Preview,‏ $1.00/$2.70, יישאר בהשקה ואחר כך ישתנה, מסלול העברת מחירים משתנה באותו יום ולא לפי לוח הזמנים של מישהו אחר לתמחור מחדש.

כאשר הוא אכן נעשה ניתן לקריאה, הדרך ההגיונית להריץ מודל סמוך-לבלתי-משוחרר היא הדרך שבה היית מריץ כל מודל שאתה עדיין לא סומך עליו — מאחורי נתיב עם מעבר אוטומטי לגיבוי, כך שכשל בקריאת כלי או שגיאת הקשר ארוך עוברים למודל שעובד במקום להפיל איתם את היישום שלך. זה הדפוס שהדיווחים המוקדמים טוענים לו כאן באופן ספציפי: גרסת תצוגה מקדימה עם בעיות מדווחות בקריאת כלים ושגיאות הקשר ארוך היא בדיוק המודל שאתה רוצה גיבוי מאחוריו, ולא כזה שאתה רוצה בנתיב ייצור בעצמו.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

מה יהפוך את זה מהדלפה לשחרור?

שלושה דברים שכדאי לשים לב אליהם, לפי סדר מידת ההכרעה שלהם. ראשית, עמוד מודל ותמחור בפלטפורמת המפתחים של StepFun עצמה — ברגע שstep-5יופיע ברשימת המודלים, מפרט היצרן יחליף כל קריאה של צד שלישי במאמר הזה, כולל הצמד 600B/27B וטענת חלון ההקשר של 1M. שנית, ההכרעה בסתירה בין חלון הקשר של 1M לזה של 350k; תקרת פלט של 64k תחת חלון של 1M היא הבדל משמעותי לכל מי שבונה צינורות עיבוד למסמכים ארוכים או מבוססי סוכנים, ונכון לעכשיו היא אינה פתורה. שלישית, האם התמחור הוא עמדת השקה או קו קבוע — לתמחור מקדים של מודלי דגל סיניים יש היסטוריה של תזוזה כשהקיבולת מתהדקת, ו-2.70 דולר למיליון אסימוני פלט הוא אגרסיבי מספיק כדי להזמין את השאלה הזאת.

עד שלפחות הראשון מאלה יתממש, הסיכום הכנה הוא ש-Step 5 Preview נראה כמו מודל יעיל באמת — 600B בסך הכול שמבצע עבודה מצטברת בדרגת 2.8T, במחיר שנמוך פי כמה מהמקובל בתחום — עם מפרט לא מאומת, קנס אמיתי של עודף מילוליות, ומוניטין בקריאה לכלים שטרם נרכש. שווה לתכנן סביבו. עדיין לא שווה להמר עליו כמסלול ייצור.

השוואות במאמר הזה4

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית