
Step 5 Preview הוכרז: מה בפועל משוחרר בדגם הדגל 600B של StepFun, ומה עדיין חסר
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun הודיעה Step 5 Preview ב-20 בספטמבר 2026 — דגם דגל של תערובת מומחים דלילה עם 600 מיליארד פרמטרים, שבו 27B פרמטרים פעילים לכל טוקן, חלון הקשר של 1M טוקנים, קלט תמונה ילידי, וציון 44 ב-Artificial Analysis Intelligence Index. ה-API נפתח באותו יום. מה שלא נפתח הוא המודל עצמו: מאגר ה-Hugging Face stepfun-ai/Step-5-Preview-BF16 היה קיים כבר אחר הצהריים של ההכרזה ומכיל בדיוק קובץ אחד, .gitattributes, ללא משקלים, ללא רישיון, ללא כרטיס דגם וללא קונפיגורציה. החומרים של StepFun עצמה קובעים את הפצת המשקלים הפתוחים ל-15 באוקטובר 2026. אז הסיכום הכנה בשורה אחת של ההשקה הזו הוא שהמודל ניתן לקריאה היום וניתן להורדה בעוד כשלושה שבועות וחצי, ואלה שני דברים שונים. זהו גם אותו מודל שהבלוג הזה סיקר מוקדם יותר היום כדליפה שלא הוכרזה, שנבחן תחת תג בדיקה לפני ש-StepFun פרסמה עמוד מוצר — תזכורת מועילה לכך שתצוגה מקדימה יכולה לעבור מדליפה להשקה בלי שאף מספר ישתנה.
הריפו הוא מציין מקום, וזה כל הסיפור
כאשר ספק מפרסם משקלים, המאגר הוא הראיה. יש בו קובץ רישיון, קונפיגורציה שכתוב בה מספר פרמטרים, קובץ README עם השימוש המיועד וטבלת ההערכה, ושברי safetensors שגודלם הכולל אומר לך אם הצהרת מספר הפרמטרים אמיתית. stepfun-ai/Step-5-Preview-BF16אין בו דבר מכל זה. רשומת ה-API של Hugging Face עבורו מציגה חותם זמן יצירה של 2026-09-20T03:52Z, אפס הורדות, שני לייקים, אובייקט config ריק, ללא pipeline_tag, ללא רישיון וקובץ אחים בודד. עמוד הארגון של StepFun מפרט אותו, ואינו מפרט שום מאגר אחר של Step 5 — אין בניין FP8, אין בניין NVFP4, אין GGUF, ואף לא אחד מגרסאות הכימות שליוו את Step-3.7-Flash ביוני.
קראו את זה כתזמון, לא כתעלומה. הסיומת BF16 בשם המאגר היא הרמז המסגיר: מעבדה שמתכוונת לפרסם תחילה צ'קפוינט bfloat16 — הפורמט שממנו עושים כוונון עדין וקוונטיזציה, לפני שיגיעו גרסאות ההגשה של FP8 ו-NVFP4 — נותנת למאגר את השם הזה בזמן היצירה וממלאת אותו אחר כך. StepFun ציינה את ה-15 באוקטובר בחומרי ההכרזה שלה. עד אז המאגר הוא הצהרה על כוונה, והדבר היחיד שהוא מוכיח הוא ש-StepFun שמרה לעצמה את מרחב השמות.
לכך יש חשיבות מסיבה מעשית. הסיומת Preview והמשקלים החסרים הם אותו אות המצביע לאותו כיוון: המודל ניתן לקריאה, התמחור נקבע, והארטיפקט שאותו הייתם מריצים על החומרה שלכם עוד אינו קיים. כל תוכנית שמניחה Step 5 Preview באירוח עצמי לפני אמצע אוקטובר היא תוכנית שאין מאחוריה ארטיפקט.
מה בעצם הוכרז?
המסגור של StepFun צר וספציפי: Step 5 Preview הוא מודל בסיס לעבודה אג'נטית בעולם האמיתי — קידוד עם AI, הנדסת תוכנה, עבודת ידע מקצועית ופיננסים — עם דגש על הקשר ארוך, קריאות לכלים מרובות־תורות וביצוע מתמשך ולא על איכות צ'אט. החברה דילגה לחלוטין על סדרת Step 4.x, ועברה מ-Step-3.7-Flash ישירות ל-Step 5, וזה כשלעצמו הצהרה על כמה גדול הצעד שהיא מחשיבה אותו.
פרט תיארוך אחד ראוי לציון, מפני שזה מסוג הדברים שמכשילים לוח זמנים של רכש: Artificial Analysis מתארכת את המודל הזה ל-18 בספטמבר 2026, יומיים לפני ההכרזה של StepFun עצמה. הלוח מדרג מודל כשהוא יכול להגיע אליו, והפער הזה של יומיים הוא הפיגור הרגיל בין הרגע שבו מודל הופך לזמין לקריאה לבין פרסום של הספק עליו. ההכרזה של StepFun — 20 בספטמבר, עם פתיחת ה-API וה-Studio באותו יום — היא התאריך שיש לציין, ותאריך המשקלים 15 באוקטובר מגיע מאותם חומרים.
המפרט כפי שפורסם:
• סך הפרמטרים — 600B, תערובת מומחים דלילה
• פעילים לכל טוקן — 27B, כ־4.5% מהסך הכול, יחס דליל במיוחד
• חלון הקשר — 1M טוקנים
• קלט — טקסט ותמונות באופן מקורי; פלט הוא טקסט בלבד
• הסקה — כן, עם חשיבה מורחבת
• מחיר — $1.00 למיליון טוקני קלט, $2.70 למיליון טוקני פלט, עם הנחת מטמון של 95%
• זמינות — API ו-Studio פתוחים החל מ-20 בספטמבר; המשקלים מתוכננים ל-15 באוקטובר
טענת היעילות שסטפ-פאן (StepFun) מובילה איתה היא שפיצול 600B/27B מציב את המודל על גבול פארטו — יכולת ליחידת מחשוב — והחברה מציגה זאת כשלושה דורות של אותה חתירה, מ-Step-3.5-Flash דרך Step-3.7-Flash ועד לזה. זה סיפור קוהרנטי, והיחס הדליל הוא המנגנון: כש-27B פעילים, עלות ההגשה לכל טוקן נמצאת בטווח של מודל קטן בהרבה, בעוד שהסך הכולל של 600B הוא בעיקר שאלה של תפוסת זיכרון.
טענות ספקים, והמספרים של צד שלישי שלצידם
שני סוגים של מספרים מופיעים בחומרי ההשקה, ואין לקרוא אותם באותו אופן. ההערכות של StepFun עצמה הן הסוג הראשון: טענת עלות למשימה בודדת בגובה שמינית מזו של Claude Opus 5; מקום שני אחרי GPT-6 Astra או Claude Opus 5 ב-ALE-CLI, FrontierFinance ו-DRACO; ריצת אופטימיזציה בת 24 שעות של קרנל GPU, שהעלתה את ביצועי השיא של קרנל MLA ל-508 TFLOPS לעומת 493 של Claude Opus 5; ניסוי אוטומטי של פוסט-אימון שהעביר את Qwen3-30B-A3B מ-53.3% ל-60% ב-AIME24; DeepSWE v1.1 ב-67.7% ו-StepCodeBench הפנימי שלה ב-49.0%. StepFun בנתה את StepCodeBench בעצמה — 553 מאגרי קוד, תשעה סוגי משימות, 33 שפות תכנות — מה שהופך אותו לכלי סביר למדידת המודל שלה עצמה, ולא לכלי עצמאי.
הקטגוריה השנייה נמדדת על ידי מישהו אחר, והיא החלק שצריך לתכנן מולו. Artificial Analysis מעניקה ל-Step 5 Preview ציון 44 במדד Intelligence Index v4.3.2, ומדרגת אותו במקום ה-24 מתוך 200 מודלים — בשווה ל-Kimi K3, נקודה אחת אחרי GLM-5.3, ובשווה להגדרת מאמץ החשיבה הבינונית של Claude Opus 5. ב-Terminal-Bench 4.0 אותו לוח רושם 33.3%, מעל DeepSeek V4.1 Flash עם 26.8%, ובפער ניכר מעל Kimi K3 עם כ-12.6%. מהירות הפלט נמדדת ב-99.8 טוקנים לשנייה וזמן עד לטוקן הראשון ב-2.96 שניות — שניהם מאותה הרצה עצמאית, ושניהם מסוג הנתונים שמכריעים אם לולאת סוכן מרגישה אינטראקטיבית.
נתון אחד של צד שלישי חותך דווקא לכיוון ההפוך וראוי לעמוד לצד המחיר. אותה ריצת אינדקס השתמשה ב-160 מיליון טוקני פלט עבור Step 5 Preview לעומת חציון של 92 מיליון בקרב המודלים שנמדדו — המודל עתיר מילים. במחיר של 2.70 דולר למיליון טוקני פלט, המילוליות הזו אינה בחינם: 160 מיליון טוקני פלט הם בערך 432 דולר מתוך 922.84 דולר שעלתה הריצה בסך הכול, ובמודל שגובה פי שלושה זה יהיה השורה הדומיננטית בחשבונית. מחיר כותרת נמוך ומספר טוקנים גבוה לכל משימה הם שני חצאים של מספר אחד, והעלות לכל משימת אינדקס — 0.71 דולר — היא זו שכבר מכילה את שניהם.

מה שההדלפה קלעה בו, והדבר האחד שהיא לא הכריעה בו
הסיקור המוקדם יותר של הבלוג הזה נכתב מתוך ריצת הערכה שהופיעה לפני כל הכרזה, והוא סימן את הטענות שלא יכול היה לאמת. ההכרזה פתרה את רובן. צמד 600B/27B מצוין כעת על ידי הספק ולא מוסק. חלון ההקשר של 1M טוקנים נמצא כעת במפרט של StepFun עצמה, ולא רק בלוח של צד שלישי. המחיר של $1.00 ו-$2.70 הוא המחיר. השם הוא Step 5 Preview, ולא חלופה שהופצה כשמועה.
מה שההכרזה לא עשתה הוא לפתור את הסתירה בחלון ההקשר שסיקור ההדלפה העלה. קונפיגורציה נפרדת של צד שלישי שמסתובבת בכלי פיתוח רשמה את המודל עם חלון הקשר של 350,000 טוקנים ופלט מקסימלי של 64,000 טוקנים. חלון של 1M וחלון של 350k הם מוצרים שונים עם עלויות זיכרון שונות, ותקרת פלט של 64k היא אילוץ קשיח בדיוק על העבודה האייג'נטית לטווח ארוך שהמודל הזה נמכר עבורה. ההכרזה של StepFun אומרת 1M ואינה מזכירה תקרת פלט. כדאי לדעת לאיזה מהם יגיע בסופו של דבר הניתוב שלך לפני שתבנה צינור עיבוד שתלוי בתשובה, וזו שאלה לתיעוד של הספק ולא ללוח דירוג.
הדבר הנוסף שההשקה לא שינתה הוא שחזור בלתי תלוי. כל שורת בנצ'מרק שלמעלה שאינה מ-Artificial Analysis היא של StepFun עצמה, שהורצה על ההר�nesses של StepFun, ואף צד שלישי לא שחזר את התוצאות האג'נטיות. התבנית מדגמי הדגל של מעבדות סיניות השנה היא שמדד משוקלל מחזיק מעמד ושורות הכותרת של הספק סוטות; התייחסו למדד המצטבר כמספר לתכנון.
מה אפשר להתקשר אליו היום, ומה לנתב בינתיים
Step 5 Preview אינו בקטלוג שלנו, ו-OrcaRouter אינו מנתב אותו — יש API ציבורי ו-Studio בצד של StepFun, ושם זה רץ. מה שכן יש לנו הוא מערך המודלים שכנגדם הוא נמדד, מאחורי מפתח אחד: DeepSeek V4.1 Flash ב-$0.15 לקלט ו-$0.60 לפלט למיליון, GLM-5.3 ב-$1.26 ו-$3.96 לעומת ה-$1.40 וה-$4.40 ש-Z.ai מציגה, Claude Opus 5 ב-$5.00 ו-$25.00, ו-Kimi K3 לצידם. זו התמונה המעשית של שלושת השבועות הבאים: תצוגה מקדימה שאפשר להשוות מולה, וגם מערך של מודלים לייצור שאפשר באמת להסתמך עליהם, נגישים דרך API אחד ליותר מ-200 מודלים, כשמחיר המחירון של הספק מועבר הלאה ב-0% תוספת — כך שאם התמחור של StepFun זז לפני אוקטובר, המספר שתשלמו זז איתו באותו יום, ולא בעת החידוש.
מעבר אוטומטי לגיבוי שווה יותר מהרגיל בחלון הזה, כי מצב הכשל של תצוגה מקדימה אינו שהיא גרועה — אלא שהיא מוגבלת בקיבולת. מודל שפתח את ה-API שלו ביום ההכרזה ועדיין אין לו משקולות הוא מודל שצי ההרצה שלו עדיין נבנה, ונקודת קצה של תצוגה מקדימה שמדרדרת בשתיים לפנות בוקר גוררת איתה את לולאת הסוכן שלך. הצב את התצוגה המקדימה מאחורי ראוטר עם מודל מוכח כגיבוי, ותקבל אות איכות על עומס העבודה שלך בלי להמר על נתיב ייצור על צי לא מוכח.

התאריך שחשוב הוא ה-15 באוקטובר
כל מה שלמעלה הוא זמני בדרך אחת ספציפית: המשקלים הם הדבר שהופך מודל לקבוע. תצוגה מקדימה סגורה במחיר של $1.00 ו-$2.70 היא מחיר טוב מספק יחיד, וצ'קפוינט BF16 תחת רישיון מפורסם הוא מחיר שאף ספק יחיד כבר לא שולט בו. StepFun התחייבה לאפשרות השנייה ל-15 באוקטובר, ושם המאגר שהיא כבר שמרה מראש מציין bfloat16 תחילה.
מה שכדאי לעקוב אחריו בין עכשיו לבין אז הוא צר וניתן לבדיקה. האם המאגר מתמלא — ובאיזה רישיון? האם קובץ קונפיגורציה מאשר 600B בסך הכול ו-27B פעילים? האם StepFun מפרסמת את תקרת הפלט לצד חלון ההקשר, ובכך פותרת את שאלת 350k/64k? האם המחיר מחזיק מעמד כשהפריוויו מאבד את הסיומת שלו? ארבע התשובות האלה קובעות אם Step 5 Preview יהפוך למודל שתארחו בעצמכם, למודל שתשכרו, או למודל שתבחנו פעם אחת ותעברו הלאה. עד שבמאגר יהיה יותר מ-.gitattributes בתוכו, ההכרזה היא תחילתו של הסיפור ולא סופו.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
