
Step 5 Preview מול Claude Opus 5: שבע נקודות מדד תמורת פי שבעה מהחשבון
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
חומר ההשקה של StepFun עבור Step 5 Preview נפתח בטענה השוואתית אחת: משימה בודדת עליו עולה שמינית מאותה משימה על Claude Opus 5. שני המודלים יושבים כעת על אותו לוח הערכה בלתי־תלוי, כך שאת הטענה הזו אפשר לבדוק במקום להתווכח עליה. Artificial Analysis העבירה כל אחד מהם דרך Intelligence Index v4.3.2 — עשר הערכות — ופרסמה כמה עלתה כל הרצה, כאשר Claude Opus 5 נמדד בהגדרת מאמץ החשיבה המרבית שלו. Step 5 Preview: 44 במדד, 922.84 דולר להשלמת ההרצה. Claude Opus 5: 51 במדד, 7,274.74 דולר. כלומר פי 7.9 מהכסף תמורת 7 נקודות במדד, והיחס שציטטה StepFun מתברר כיחס המדויק. מה שהיחס הזה מסתיר הוא החלק המעניין, משום שהפער אינו בעיקרו פער במחיר. זהו פער בארכנות העוטה את בגדיו של פער במחיר, וההפרדה בין השניים משנה איזה מודל כדאי להעמיד מול איזה עומס עבודה.
שתי עלויות ריצה, לוח אחד, ומה שלמעשה נמצא בתוכם
עלות ריצה כוללת היא ההשוואה הבודדת הנקייה ביותר הזמינה כאן, מפני ששני המודלים ענו על אותן שאלות תחת אותה מסגרת בדיקה, ואף אחד מהספקים לא הפיק את הנתון. זה גם הנתון שסביר ביותר שייקרא שלא כהלכה, ולכן כדאי לפתוח אותו לדיון.
• ציון המדד — Step 5 Preview 44 לעומת Claude Opus 5 51, Claude Opus 5 קיבל ציון בהגדרת מאמץ החשיבה המרבית שלו
• עלות כוללת להשלמת האינדקס — Step 5 Preview $922.84 לעומת Claude Opus 5 $7,274.74
• מחיר משוקלל בתמהיל של 7:2:1 של פגיעות מטמון / קלט / פלט — Step 5 Preview $0.51 למיליון טוקנים לעומת Claude Opus 5 $3.85
• אסימוני פלט שנוצרו במהלך ריצת האינדקס — Step 5 Preview 160M לעומת Claude Opus 5 140M
• מחיר מחירון — Step 5 Preview $1.00 לקלט / $2.70 לפלט לעומת Claude Opus 5 $5.00 לקלט / $25.00 לפלט
הסתכלו על שורות שלוש וחמש יחד והחישוב מפסיק להיות השוואת מחירים ישרה. התעריף המשוקלל של Step 5 Preview זול פי 7.5, ותעריף המחירון זול פי 5 בקלט ופי 9.3 בפלט — כך שהשילוב עושה עבודה שמחיר הקלט לא עושה. הסיבה לכך היא שהשילוב מוטה כלפי הפלט, והפלט הוא המקום שבו שני המודלים נבדלים ביותר. Claude Opus 5 גובה פי 9.3 מתעריף הפלט של Step 5 Preview, ושני המודלים כותבים הרבה מאוד: 140M אסימוני פלט עבור Claude Opus 5 לעומת חציון של 92M בקרב המודלים שהמדד מדרג, ו-160M עבור Step 5 Preview לעומת אותו חציון של 92M.
אז הקריאה הכנה צרה יותר מ"המודל הזול הוא מציאה". Step 5 Preview זול יותר בכל ציר, והוא אינו מודל חסכני — הוא כותב 74% יותר פלט מאשר המודל החציוני שמולו הוא נמדד, וזה בדיוק ההתנהגות שהמחיר אמור להעניש. Claude Opus 5 כותב 52% יותר מהחציון ומחייב פי 9.3 על כל אחד מהטוקנים האלה. קורא שמגביל את אורך הפלט מקבל יחס שונה מזה של מי שלא עושה זאת.
השאלה היא לא מה טוב יותר. היא היכן שנמצאת נקודת המעבר.
נניח שהמדד הוא פרוקסי סביר לעבודה שאתה בעצם שולח — משימות סוכניות ארוכות טווח, קוד, שימוש בכלים רב-שלבי. אז נקודת האיזון פשוטה לאמירה: Claude Opus 5 צריך להיות שימושי פי 7.9 לפחות לכל משימה לפני שהוא שווה את החשבון שלו, ובמדד הוא טוב ב-7 נקודות בסולם של 100 נקודות. שתי העובדות האלה לא חייבות להצביע לאותו כיוון, כי פער של 7 נקודות במדד אינו שיפור של 16% בכל דבר. זהו סכום של עשר הערכות, וההרכב חשוב יותר מהסכום הכולל.
זו הטענה שבעד להתעניין בצורתם של שני הציונים ולא בכותרת. הקריאה של Step 5 Preview ב-Terminal-Bench 4.0 היא 33.3% — תוצאה אג'נטית אמיתית, שלפניה DeepSeek V4.1 Flash עם 26.8% — אבל שום דבר בפרסומים עדיין לא מראה שהיא משתווה ל-Claude Opus 5 בהערכות האופק הארוך שבהן המודל של Anthropic הוא החזק ביותר. החומרים של StepFun עצמה מודים בכך בניסוח: ב-ALE-CLI, ב-FrontierFinance וב-DRACO, החברה ממקמת את Step 5 Preview במקום השני, אחרי GPT-6 Astra או Claude Opus 5, ולפני שאר המודלים הפתוחים בהשוואה. מקום שני בחמישית מהמחיר הוא תוצאה טובה באמת. זה גם לא מקום ראשון, והמשימות שבהן מודל מסיים שני הן בדרך כלל המשימות שהיו זקוקות לראשון.
האסימטריה האחרת היא מה שקורה בקריאה גרועה. תשובה שגויה ממודל זול שלקח ארבע שניות ו-2,000 טוקנים עולה לך בניסיון חוזר; אותה תשובה שגויה מ-Claude Opus 5 במחיר 25 דולר למיליון טוקני פלט עולה לך בניסיון החוזר בתוספת ההתלבטות. אם הצינור שלך מנסה שוב במקרה של כשל — כך עושות רוב לולאות הסוכנים — העלות האפקטיבית לכל מוצלחת היא המספר שקובע, והיא אינה אותו יחס כמו מחיר המחירון, מפני ששני המודלים לא ייכשלו באותו שיעור. אף אחד עוד לא פרסם את המספר הזה עבור Step 5 Preview.

ההבדל במפרט, ממד אחר ממד
• ציון המדד — Step 5 Preview 44 לעומת Claude Opus 5 51, שניהם על Intelligence Index v4.3.2, Claude Opus 5 בהגדרת מאמץ החשיבה המרבי שלו
• מחיר לכל מיליון טוקנים — Step 5 Preview $1.00 בקלט / $2.70 בפלט לעומת Claude Opus 5 $5.00 בקלט / $25.00 בפלט
• הנחת מטמון — Step 5 Preview 95% לעומת Claude Opus 5 90%
• הקשר — לשניהם 1M טוקנים; StepFun לא פרסמה תקרת פלט, וזו של Anthropic היא 128K
• קלט — שניהם מקבלים טקסט ותמונות; שניהם מפיקים טקסט בלבד
• מהירות פלט — Step 5 Preview 99.8 טוקנים/שנייה לעומת Claude Opus 5 55.3 טוקנים/שנייה
• משטח בקרה — Step 5 Preview חושף חשיבה מורחבת; Claude Opus 5 מחליף את temperature ואת top_p בחוגת מאמץ חשיבה אדפטיבית
• משקלים — Step 5 Preview נסגר היום, צ'קפוינט BF16 מתוכנן ל-15 באוקטובר; Claude Opus 5 קנייני לאורך כל הדרך
• עדות בלתי תלויה — שניהם קיבלו ציון על ידי Artificial Analysis; שורות הבנצ'מרק האג'נטיות של StepFun מבוצעות על ידי הספק ואינן משוחזרות
שתי שורות ראויות להערה. פער המהירות אמיתי וגדול יותר ממה שהטבלה מרמזת בפועל: 99.8 טוקנים לשנייה לעומת 55.3 מצביעים על מודל שמסיים בערך פי שניים מהר יותר על אותו פלט, והזמן עד לטוקן הראשון של Step 5 Preview, 2.96 שניות, לעומת 56.84 השניות של Claude Opus 5 על אותו לוח, הוא סדר גודל אחר — אף שהנתון השני מודד את תצורת ההסקה במאמץ מקסימלי, שבה המודל מהרהר לפני שהוא פולט משהו. זו אינה ההשהיה שקריאה בסביבת ייצור רואה. מול נקודת הקצה הסטנדרטית, הקטלוג שלנו מדווח על זמן p50 עד לטוקן הראשון של 6.73 שניות עבור Claude Opus 5, וזה המספר שלפיו יש לתכנן אם אינכם מבקשים במכוון מקסימום התעמקות.
שורת הנחת המטמון היא זו שבשקט מכריעה עומסי עבודה חוזרים, והיא מעדיפה את Step 5 Preview, 95% עד 90%. לולאת סוכן ששולחת מחדש את אותה הנחיית מערכת והקשר מאגר בכל קריאה חיה כמעט כולה בהנחה הזו, כך שהפרש של חמש נקודות מצטבר לאורך מפגש ארוך.

היכן ש-Claude Opus 5 הוא עדיין התשובה היחידה
שום דבר מהאמור לעיל אינו טוען נגד המודל של Anthropic. הוא עולה מה שהוא עולה כי הוא עושה את הדבר שהאינדקס מנסה למדוד, והוא עושה זאת קרוב לראש הטבלה — 51 ב-Intelligence Index v4.3.2, בפער של שבע נקודות מ-Step 5 Preview ובטווח נגיעה מהמובילים של הדור הנוכחי. סוגי העבודה שבהם פער מצטבר של 7 נקודות ממעיט בהבדל הם אלה שאין בהם סובלנות לתשובה של מקום שני: ריפקטור של שעות רבות שבו מצב הכשל הוא שינוי התנהגות עדין, מודל פיננסי שבו שרשרת הנימוקים חייבת להיות ברת-ביקורת, מיגרציה שבה החלטה שגויה מתגלה כעבור שבוע. במקרים כאלה, הניסיון החוזר אינו זול וההתלבטות היא המוצר.
סוגי העומסים שבהם הפער אינו רלוונטי הם אלה הבנויים מהחלטות קטנות רבות: שלבי סיווג וניתוב, חילוץ, תמצות, פיגומי בדיקה, אלף הקריאות שסוכן מבצע בין שתי הקריאות שבאמת חשובות. באלה, מודל עם ציון 44 שעונה בחצי מהזמן ובחמישית ממחיר הקלט אינו פשרה. זוהי ברירת המחדל הנכונה, כשהמודל היקר שמור לשלב שחייב להיות נכון.
הרצת הפיצול מבלי להריץ שתי אינטגרציות
הגרסה המעשית של ההשוואה הזו היא צינור מדורג, והסיבה שצוותים לא בונים אחד היא רכש ולא הנדסה — שני ספקים, שני חוזים, שתי ערכות SDK, שני מפתחות לסיבוב. Claude Opus 5 נמצא בקטלוג שלנו במחיר של $5.00 ו-$25.00, ומודלי הטקסט הזולים יותר שהייתם שמים לפניו נמצאים באותו קטלוג, הכול מאחורי מפתח אחד עבור יותר מ-200 מודלים, כשמחיר המחירון של הספק מועבר הלאה בתוספת של 0%. Step 5 Preview לא נמצא ברשימה הזו — הוא פועל דרך ה-API של StepFun עצמה, ועד שהמשקלים יגיעו זה המקום היחיד שבו הוא פועל. הרכבת הדירוג בין המודלים שאנחנו כן מנתבים היא ביטוי בשפת ניתוב (routing-DSL) ולא שינוי בקוד — שלחו את הקריאות השגרתיות למודל הקטן, הסלימו ליקר על פי תנאי של ביטחון או מורכבות, והשאירו את שתי הרגליים מאחורי אותו endpoint.
כאן כשל אוטומטי חשוב מסיבה ספציפית, ולא כתכונה גנרית. Step 5 Preview חשפה את ה-API שלה ביום ההכרזה בלי משקולות מפורסמות ובלי צי הגשה גלוי; זהו נקודת קצה לתצוגה מקדימה בת ימים ספורים, ונקודות קצה לתצוגה מקדימה מוגבלות בקיבולת באופן שנקודות קצה בוגרות אינן. את Claude Opus 5 מגישים ספקים עצמאיים רבים — וזו היתירות שתצוגה מקדימה אינה יכולה להציע. הותרת מודל מוכח כרגל הגיבוי — בצד שלנו זה אומר מודל ייצורי מהקטלוג, לא התצוגה המקדימה — היא הדרך לקבל אות איכות אמיתי על עומס העבודה שלך בלי לתלות את נתיב הייצור שלך בצי שעדיין נמצא בהגדרת גודלו.

כלל ההחלטה
אם עומס העבודה שלך הוא מספר קטן של משימות קשות במיוחד, Claude Opus 5 אינו האפשרות היקרה — הוא האפשרות הזולה, כי התשובה השנייה בטיבה עולה יותר מההפרש. אם עומס העבודה שלך הוא מספר גדול של משימות רגילות עם מספר קטן של משימות קשות בתוכן, Step 5 Preview במחיר $1.00 ו-$2.70 עם הנחת מטמון של 95% הוא ברירת המחדל הטובה יותר, ופער של 7 נקודות הוא בעיקר שגיאת עיגול בעבודה שלא נזקקה לכך.
מה שישנה את החישוב הזה הוא ראיות בלתי תלויות על שיעורי כשל ועל השורות האג'נטיות בטווח הארוך. המספרים של StepFun עצמה מציבים את המודל במקום השני בהערכות שסביבן בנתה את ההשקה שלו, ואף צד שלישי לא שחזר אותם. שימו לב לצ'קפוינט של 15 באוקטובר בשני דברים: האם הרישיון מתיר את הכוונון העדין שיאפשר לכם לסגור פער של 7 נקודות על הנתונים שלכם, והאם הפירוטיות נשמרת כשמסירים את סיומת התצוגה המקדימה. הראשון ישנה את היחס; השני כבר הזיז אותו פעם אחת.
