
תצוגה מקדימה ל-Step 5: מודל הדגל 600B שטרם הוכרז של StepFun כבר נמצא בלוח המובילים
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Step 5 Preview יש לו דירוג בלוח המובילים, מחיר מפורסם, מהירות פלט מדודה וציון Intelligence Index של 44 — אותו ציון כמו Kimi K3, מודל שגדול ממנו בערך פי חמישה. מה שאין לו הוא השקה. StepFun לא הכריזה עליו, התיעוד של הפלטפורמה של StepFun עצמה לא מציין אותו, ואין משקולות להורדה. כל נתון למטה מגיע מצד שלישי שקיבל גישה לפני שהספק אמר משהו בפומבי, מה שהופך את זה לכתבה של "מה ידוע לנו עד כה" ולא לסקירה. יש לקרוא את המספרים כראיות למה שעומד לבוא, לא כדף מפרט.
ההדלפה היא הסיפור
העקבות הציבוריות הראשונות של Step 5 Preview הן ריצת הערכה. ל-Artificial Analysis יש דף מודל חי עבורו, שנמדד דרך ה-API של StepFun עצמה תחת תג הבדיקה step-5-preview-b, כאשר הפלטפורמה מתארכת את המודל ל-18 בספטמבר 2026. הדף הזה הוא המקור ל-44, לתמחור, למדידת המהירות ולשורות המדדים במאמר זה.
מול זה, בצד הספק הכל ריק. התיעוד למפתחים של StepFun מפרט מודלים עד Step 3.7 Flash ו-Step 3.5 Flash ונעצר שם — אין step-5, אין רשומת תצוגה מקדימה. לארגון stepfun-ai ב-Hugging Face אין מאגר של Step 5, מה שמתיישב עם דגם דגל במשקלים סגורים ולא עם מחדל. דיווחים קהילתיים בפורומים של מפתחים בסין מצביעים על חשיפה אפשרית באירוע AGI Frontier בשנגחאי ב-19 בספטמבר, שזה בערך יום אחרי שההערכות צצו. נכון לזמן כתיבת שורות אלה, לאף אחד מחוץ ל-StepFun אין מפרט רשמי, מחיר רשמי או שם רשמי לגרסה המשוחררת.
השם עצמו הוא הרמז הראשון לכך שמדובר בתצוגה מקדימה ולא בהשקה. StepFun דילגה לחלוטין על סדרת Step 4.x ועברה ישירות ל-Step 5. מודל שמשוחרר תחת Preview כסיומת, ושעבר בנצ'מרק לפני שיש לו אפילו דף מוצר, הוא מודל שהספק עדיין מכייל — התמחור, הניתוב והמגבלות יכולים כולם להשתנות לפני הזמינות הכללית.
איך המפרט נראה, ככל שאפשר לדעת
אלה המספרים שמסתובבים, והם הטענות החוזרות ביותר של ההדלפה — וזה לא אותו דבר כמו הטענות המאומתות ביותר שלה:
• סה״כ פרמטרים — כ-600B, לעומת כ-2.8T אצל Kimi K3
• מופעלים לכל היסק — כ-27B, כ-4.5% מהסך הכול, יחס תערובת מומחים דליל במיוחד
• אופני קלט — טקסט ותמונות; הפלט הוא טקסט בלבד
• הסקה — כן, עם חשיבה מורחבת
• חלון הקשר — מיליון אסימונים ב-Artificial Analysis; תצורה נפרדת של צד שלישי שמסתובבת בכלי פיתוח מפרטת 350,000 עם פלט מרבי של 64,000
• זמינות משקל — סגור, אין מאגר
כדאי לסמן בבירור את הסתירה הזו בחלון ההקשר, מכיוון שאיש לא פתר אותה. חלון של 1M טוקנים וחלון של 350k טוקנים הם מוצרים שונים עם עלויות זיכרון שונות, והנתון השני מגיע עם תקרת פלט של 64k שהראשון לא אומר עליה דבר. אם אתם מתכננים צינור עיבוד למסמכים ארוכים על סמך נתון ה-1M, תצורת 350k היא הסיבה להמתין לעמוד ספק. גם למספרי הפרמטרים יש מידת אי-ודאות דומה: העוקב של DataLearner עדיין מתעד את ארכיטקטורת MoE ומספרי הפרמטרים של Step 5 Preview כלא זמינים, כלומר צמד 600B/27B — העובדה המצוטטת ביותר על המודל הזה — הוא גם אחד הפרטים הפחות מאושרים רשמית.
המספר המעניין הוא 27B, לא 600B
מודלים דלילים מסוג תערובת מומחים (sparse mixture-of-experts) מקצים חישוב רק למומחים שטוקן אכן מנותב אליהם, ולכן הנתון של הפרמטרים הפעילים הוא זה שקובע כיצד המודל מתנהג בפרודקשן. עם כ-27B פעילים, Step 5 Preview מבצע עבודה לכל טוקן באותו טווח כמו מודלים שגודלם שבריר מגודלו, בעוד ש-600B בסך הכול הם במידה רבה שאלה של תפוסת זיכרון.
שתי השלכות נובעות מכך, ושתיהן מופיעות במדידות של צד שלישי. עלות ההגשה נגזרת מפרמטרים פעילים, וזה חלק מהסיבה שהמחיר הוא כפי שהוא. וגם המהירות לכל טוקן מרוויחה מכך: Artificial Analysis מודדת 99.8 טוקני פלט לשנייה, במקום ה-42 מתוך 200 מודלים, לעומת חציון של 64.6. זמן לטוקן הראשון עומד על 2.96 שניות לעומת חציון של כ-3.57 שניות. אם הפיצול 600B/27B מדויק, זהו מודל שתוכנן להיות זול להגשה ולא זול לאירוח — הבחנה חשובה אם אתם אלה שמשלמים על ה-GPUs ולא על הטוקנים.
היכן זה ממוקם ב-Intelligence Index
Artificial Analysis מעניקה ל-Step 5 Preview ציון 44 ב-Intelligence Index v4.3, הכולל עשר הערכות. זהו המקום ה-25 מתוך 200 מודלים בלוח הדירוג, והרבה מעל המודל החציוני שהמדד מדרג, שעומד על 25.
• מדד האינטליגנציה — Step 5 Preview 44 מול Kimi K3 44
• ממש מעל — GLM-5.3 ו-Claude Opus 5, שניהם ב-45
• ממש מתחת — DeepSeek V4.1 Flash ב-40 ו-DeepSeek V4 Pro ב-36
• Terminal-Bench 4.0 — Step 5 Preview 33.3% לעומת Kimi K3 בסביבות 12.6%, ולעומת DeepSeek V4.1 Flash בסביבות 26.8%
• SciCode — 59% עבור Step 5 Preview, בשוויון עם Kimi K3
• מהירות פלט — 99.8 טוקנים לשנייה לעומת חציון התחום של 64.6
הכותרת היא השוויון עם Kimi K3, והקריאה הכנה צרה יותר ממה שהכותרות מרמזות. התאמה של מודל בעל 2.8T פרמטרים במדד מצרפי ב-600B בסך הכול היא תוצאה אמיתית של יעילות, אבל המצרפי מסתיר את הצורה שלה: הפער ב-Terminal-Bench 4.0 לטובת Step 5 Preview דרמטי, בעוד שתוצאת SciCode היא תיקו מוחלט. שוויון מצרפי במדד אינו שוויון בכל מקום, וגרסת preview היא הרגע הפחות אמין להניח שהפערים יישמרו.
אי-התאמה נוספת שראויה להזכיר: Artificial Analysis מדווחת על 44, בעוד שהעוקב העצמאי של DataLearner מתעד את אותה הרצה כ-43.6. זהו הבדל עיגול ולא מחלוקת על היכולת, אבל זה בדיוק סוג הדבר שממחיש את הנקודה לגבי המספרים של המודל הזה באופן כללי — אלה קריאות של צד שלישי של מודל שלא הוכרז, שנלקחו ברגעים מעט שונים, ואף אחת מהן לא אושרה על ידי StepFun. אף אחד מהבנצ'מרקים האלה לא דווח על ידי הספק, וזה עובד לשני הכיוונים: אף אחד ב-StepFun לא טען למספר כאן, ואף אחד ב-StepFun לא עמד מאחורי מספר כזה.

המחיר, והמילוליות שמכרסמת בו
התמחור הוא החלק בהדלפה הזו שישפיע על התקציב במועד המוקדם ביותר. דרך ה-API של StepFun, Artificial Analysis מתעדת את הדברים הבאים:
• קלט — $1.00 למיליון טוקנים, לעומת חציון של $1.88 עבור מודלים דומים
• פלט — $2.70 למיליון טוקנים, לעומת חציון של $10.00
• מטמון — הנחה של 95% על מטמון, מה שמעמיד פגיעות מטמון על כ-$0.05 למיליון טוקנים
• משולב — כ-$0.51 למיליון טוקנים בתמהיל של 7:2:1 של פגיעות מטמון, קלט ופלט
• עלות לכל משימה של Intelligence Index — $0.71
• עלות הרצת אינדקס מלאה — $918.34 בסך הכול
הפלט במחיר $2.70 הוא השורה החשובה ביותר, כי הוא פחות מחמישית ממה ש-Kimi K3 גובה עבור אותו מיליון טוקנים במחיר $15.00. אבל יש מלכוד שהשוואה לפי טוקן מסתירה, ו-Artificial Analysis מודדת אותו ישירות: מילוליות. Step 5 Preview הפיק 160 מיליון טוקני פלט כדי להשלים את Intelligence Index, לעומת חציון של 90 מיליון בתחום ודירוג במקום ה-65 מתוך 200 לפי מדד זה.
תעשה את החשבון עד הסוף. במחיר של $2.70 למיליון, 160M טוקנים של פלט הם כ-$432 — בערך חצי מהעלות הכוללת של $918.34 של כל ריצת האינדקס, שהוצאה על הפטפטת של המודל עצמו ולא על המשימות. אם תעביר את אותם 160M טוקנים בתעריף הפלט של $15.00 של Kimi K3, תגיע ל-$2,400, ומשם מגיע יתרון המחיר. אבל האזהרה המעשית היא לכל מי שמעריך עלויות על ידי שאיבת מספר טוקנים ממודל אחר: Step 5 Preview כותב בערך פי 1.8 מהחציון, כך שעומס עתיר פלט קונה גם את התעריף הזול יותר וגם יותר טוקנים בו-זמנית. ההנחה שורדת, אבל היא קטנה ממה שההשוואה בין $1.00/$2.70 ל-$3.00/$15.00 מציגה, וגודלה תלוי לגמרי בכמה שהפרומפטים שלך גורמים למודל לפטפט.
הנחת המטמון של 95% היא המנוף האחר, והיא אגרסיבית באופן יוצא דופן. עומס עבודה עם שימוש חוזר כבד בפרומפט — פרומפט מערכת ארוך, מסמך קבוע, בסיס קוד משותף — מגיע קרוב הרבה יותר ל-$0.51 המשוקלל מאשר לתעריף הקלט של $1.00. הנתון המשוקלל הזה מניח יחס של 7:2:1, שהוא הנחת מודל ולא הבטחה, אבל זו הצורה הנכונה של חשבון להריץ מול התעבורה שלכם.

מה בודקים מוקדמים נתקלים בו
אלה דיווחים בודדים מפורומים של מפתחים ומפוסטים ברשתות חברתיות בימים סביב ההדלפה, ולא מדידות, ויש להעניק להם משקל בהתאם:
• קריאה לכלים היא התלונה הנפוצה ביותר — נבחרים שמות כלים שגויים, ומתבצעים ניסיונות עריכה בלי לקרוא תחילה את קובץ היעד
• שגיאות שדווחו מעבר לכ-340,000 טוקנים של הקשר, וזהו מצב הכשל שיש לשים לב אליו אם חלון ה-1M יתברר כמספר האמיתי
• סינון תוכן מקצר פלטים בפרומפטים מסוימים
• ההתרשמויות לגבי היכולות חלוקות: חלק מהבודקים ממקמים אותו מעל GLM-5.3 Flash, ואחרים ממקמים אותו מתחת ל-DeepSeek V4.1 Flash
גרסת תצוגה מקדימה שטרם שוחררה שנכשלת בשימוש בכלים אינה שערורייה — לשם כך נועדה תווית התצוגה המקדימה. אבל זה כן אומר שאין לקרוא את ה-44 כהבטחה לגבי אמינות סוכנית, מפני שמדד האינטליגנציה לא בודק את הדבר שעליו מתלוננים הבודקים המוקדמים ביותר.
איך היית באמת קורא לזה — ומה להשתמש בינתיים
OrcaRouter אינו מנתב את Step 5 Preview. אין נקודת קצה ציבורית ואין משקולות, כך שאין מה לנתב, ואף פלטפורמת צד שלישי לא יכולה עדיין לטעון אחרת ביושר. כל מי שאומר לך היכן לקרוא לו היום מתאר נקודת קצה להערכה, לא מוצר.
המודלים שמולם הוא נמדד הם עניין אחר. Kimi K3, GLM-5.3 ו-DeepSeek V4.1 Flash זמינים כולם דרך OrcaRouter, לצד 199 מודלים מ-15 ספקים, מאחורי מפתח API יחיד וחיוב יחיד. התמחור מועבר כפי שהוא במחיר המחירון של הספק, עם 0% תוספת, מה שחשוב יותר מהרגיל במודל כמו זה: אם המחיר של Step 5 Preview, $1.00/$2.70, יישאר בהשקה ואחר כך ישתנה, מסלול העברת מחירים משתנה באותו יום ולא לפי לוח הזמנים של מישהו אחר לתמחור מחדש.
כאשר הוא אכן נעשה ניתן לקריאה, הדרך ההגיונית להריץ מודל סמוך-לבלתי-משוחרר היא הדרך שבה היית מריץ כל מודל שאתה עדיין לא סומך עליו — מאחורי נתיב עם מעבר אוטומטי לגיבוי, כך שכשל בקריאת כלי או שגיאת הקשר ארוך עוברים למודל שעובד במקום להפיל איתם את היישום שלך. זה הדפוס שהדיווחים המוקדמים טוענים לו כאן באופן ספציפי: גרסת תצוגה מקדימה עם בעיות מדווחות בקריאת כלים ושגיאות הקשר ארוך היא בדיוק המודל שאתה רוצה גיבוי מאחוריו, ולא כזה שאתה רוצה בנתיב ייצור בעצמו.

מה יהפוך את זה מהדלפה לשחרור?
שלושה דברים שכדאי לשים לב אליהם, לפי סדר מידת ההכרעה שלהם. ראשית, עמוד מודל ותמחור בפלטפורמת המפתחים של StepFun עצמה — ברגע שstep-5יופיע ברשימת המודלים, מפרט היצרן יחליף כל קריאה של צד שלישי במאמר הזה, כולל הצמד 600B/27B וטענת חלון ההקשר של 1M. שנית, ההכרעה בסתירה בין חלון הקשר של 1M לזה של 350k; תקרת פלט של 64k תחת חלון של 1M היא הבדל משמעותי לכל מי שבונה צינורות עיבוד למסמכים ארוכים או מבוססי סוכנים, ונכון לעכשיו היא אינה פתורה. שלישית, האם התמחור הוא עמדת השקה או קו קבוע — לתמחור מקדים של מודלי דגל סיניים יש היסטוריה של תזוזה כשהקיבולת מתהדקת, ו-2.70 דולר למיליון אסימוני פלט הוא אגרסיבי מספיק כדי להזמין את השאלה הזאת.
עד שלפחות הראשון מאלה יתממש, הסיכום הכנה הוא ש-Step 5 Preview נראה כמו מודל יעיל באמת — 600B בסך הכול שמבצע עבודה מצטברת בדרגת 2.8T, במחיר שנמוך פי כמה מהמקובל בתחום — עם מפרט לא מאומת, קנס אמיתי של עודף מילוליות, ומוניטין בקריאה לכלים שטרם נרכש. שווה לתכנן סביבו. עדיין לא שווה להמר עליו כמסלול ייצור.
השוואות במאמר הזה4
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
