
Step 5 Preview מול GPT-5.6 Sol: שלוש נקודות מדד, שביעית ממחיר הפלט
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
במדד ה-Artificial Analysis Intelligence Index הנוכחי, Step 5 Preview מקבל ציון 44. GPT-5.6 Sol מקבל ציון 47. זהו כל הפער — שלוש נקודות — והוא מתווסף לפער במחיר המחירון של $2.70 לעומת $20.00 למיליון טוקנים של פלט. המודל sparse mixture-of-experts בעל 600B של StepFun והדגם המוביל של הספק אינם אותו סוג של מוצר, והמדד לבדו לא יגיד לך למי לפנות. המאמר הזה בוחן מאין מגיעות שלוש הנקודות, מאין הן לא מגיעות, ומה עולים שני המודלים כשבאמת מריצים אותם.
ראשית, מצב השחרור — כי הוא יוצא דופן
Step 5 Preview שוחרר. את זה צריך לומר בבירור, כי הרבה מהסיקור סביבו נכתב לפני היום ומתאר משהו אחר. StepFun הכריזה ופתחה את המודל ב-20 בספטמבר 2026, עם ה-API וה-Studio שלה פעילים באותו יום. Artificial Analysis מתארכת את המודל שהיא העריכה ל-18 בספטמבר. מה שלא הושלם הם המשקלים: המאגר של Hugging Face stepfun-ai/Step-5-Preview-BF16 קיים, אבל הוא קליפה — אין כרטיס מודל, אין תצורה, אין טנסורים. StepFun אמרה שהמשקלים המלאים יגיעו ב-15 באוקטובר 2026. אז סטטוס מדויק בשורה אחת הוא: API זמין כעת, משקלים מובטחים בעוד כארבעה שבועות, "Preview" בשם שמתאר את ערוץ ההפצה ולא את בגרות המודל.
אם קראתם משהו שתיאר את Step 5 Preview כהדלפה לא מוכרזת שהופיעה בשקט בלוח דירוג, התיאור הזה פג תוקף. הוא היה הוגן באמצע ספטמבר. הוא אינו הוגן היום.
מהי התצוגה המקדימה של שלב 5
StepFun אישרה את צורת הארכיטקטורה: מודל תערובת מומחים דלילה עם 600 מיליארד פרמטרים סה"כ ו-27 מיליארד פעילים לכל טוקן, חלון הקשר של 1M טוקנים, קלט טקסט ותמונה עם פלט טקסט, ותמיכה בהיסק. נתון הפרמטרים הפעילים הוא החשוב. תקציב פעיל של 27B מציב את Step 5 Preview באותה מחלקת חישוב לכל טוקן כמו מודלים בשבר מגודלו הכולל, וזו בדיוק הסיבה לכך שמספרי התפוקה שלו נראים כפי שהם.
התמחור ב-API של הספק עצמו הוא $1.00 למיליון טוקני קלט, $2.70 למיליון פלט, עם הנחת מטמון של 95% בצד הקלט. Artificial Analysis מחשבת תעריף משולב של $0.51 למיליון בתמהיל של 7:2:1 של מטמון-קלט-פלט, ועלות לכל משימת Intelligence Index של $0.71.
מהו GPT-5.6 Sol
GPT-5.6 Sol נכנס לתצוגה מוקדמת מוגבלת ב-26 ביוני 2026 בפני כעשרים שותפים בארה"ב, והגיע לזמינות כללית ב-9 ביולי 2026 ברחבי ChatGPT, Codex וה-API של OpenAI. הוא סגור במובן המחמיר: OpenAI לא פרסמה מספר פרמטרים, לא תיאור ארכיטקטורה ולא פרטי אימון, והמודל פועל רק דרך API.
המגבלות המפורסמות הן חלון הקשר של 1,050,000 טוקנים, קלט מקסימלי של 922,000 טוקנים ופלט מקסימלי של 128,000 טוקנים — תקרת פלט קשיחה ש-Step 5 Preview אינה מפרסמת מקבילה לה. reasoning.effort מקבל none, low, medium (ברירת המחדל), high, xhigh ו-max. ההגדרה הזו אינה הערת שוליים; כפי שהמספרים שלהלן מראים, היא משנה כל נתון ראשי.
המחיר של Sol בכרטיס המודל של OpenAI עצמה הוא $4.00 למיליון טוקנים בקלט, $0.40 לקלט במטמון, $20.00 למיליון טוקנים בפלט. זהו תעריף מבצעי שהוכרז ב-21 באוגוסט 2026 — הפחתה של 20% בקלט ו-33% בפלט — והכרטיס של OpenAI מתחייב לו רק עד 21 בנובמבר 2026. מחיר ההשקה ביולי היה $5.00 / $30.00 עם $0.50 לקלט במטמון. כל מי שמתקצב לפי $4/$20 צריך לדעת שהספק לא אמר מה יקרה ב-22 בנובמבר.
המספרים, זה לצד זה
• מדד האינטליגנציה — Step 5 Preview 44 (#24 מתוך 200) לעומת GPT-5.6 Sol 47 בmax מאמץ, 44 ב-xhigh. שני הנתונים הם מדידות של Artificial Analysis לפי גרסת המדד הנוכחית, שכויילו מחדש ב-7 בספטמבר 2026. הם ניתנים להשוואה ישירה זה לזה, ולא לשום דבר שפורסם לפני אותו תאריך.
• מחיר קלט — $1.00 למיליון לעומת $4.00 למיליון.
• מחיר פלט — $2.70 למיליון לעומת $20.00 למיליון.
• קלט במטמון — הנחה של 95% על $1.00 לעומת $0.40 קבוע למיליון.
• Terminal-Bench 4.0 — 33.3% לעומת 39.9% ב-max ו-25% ב-xhigh, שניהם נמדדו על ידי Artificial Analysis על אותה ערכת בדיקה. 33.3% של Step 5 Preview נמצא בין שתי הגדרות המאמץ של Sol. זהו המספר המעניין ביותר בהשוואה.
• SciCode — 59% מול 57%, שוב Artificial Analysis, Sol נמדד ב-xhigh.
• מהירות פלט — 99.8 טוקנים/שנייה (#45 מתוך 200) לעומת 61.5 טוקנים/שנייה (#92 מתוך 200) במקסימלי.מאמץ
• זמן עד לאסימון הראשון — 2.96 שניות לעומת 129.50 שניות במאמץ max, או 38.70 שניות ב-xhigh.

פער ההשהיה הוא הסיפור האמיתי
השוואה בין 44 ל-47 היא ויכוח של עיגול. השוואה בין 2.96 שניות עד לאסימון הראשון ל-129.50 שניות היא לא.
הנתון הזה של 129.50 שניות הוא תוצאה של מדידת Artificial Analysis את GPT-5.6 Sol ברמת max של מאמץ חשיבה, שבו המודל מבלה את זמנו בחשיבה לפני שהוא פולט משהו. ברמת xhigh זה יורד ל-38.70 שניות. בהגדרות נמוכות יותר זה עוד מהיר יותר. אבל צורת הטרייד-אוף בלתי נמנעת: Sol קונה את ציון האינדקס שלו בזמן חשיבה, ובקצה העליון של טווח המאמץ המשתמש ממתין למעלה משתי דקות לפני שמופיע האסימון הראשון. Step 5 Preview, עם 27B פרמטרים פעילים וללא בקרת מאמץ רב-דרגתית שפורסמה, מחזיר את האסימון הראשון שלו בפחות משלוש שניות ומשדר בקצב של כ-100 אסימונים לשנייה.
לעבודת אצווה — הרצות הערכה לאורך הלילה, עיבוד מסמכים, כל דבר שבו התשובה נקראת מאוחר יותר — כל זה לא משנה, ותקרת הביצועים של Sol שווה את המחיר. עבור סשן קידוד אינטראקטיבי, סוכן תמיכה, או כל ממשק שבו אדם מביט בסמן, המודל שמייצר 100 טוקנים בשנייה עם טוקן ראשון תוך שלוש שניות הוא מוצר אחר, ולא משנה מה אומר המדד.
כדאי לדעת מן הצד השני: יעילות הטוקנים של Sol אינה טובה יותר באופן ברור. Artificial Analysis מדדה את Step 5 Preview כשהיא פולטת 160 מיליון טוקני פלט בהרצת האינדקס מול חציון של 92 מיליון, ואפיינה אותה כמילולית מאוד. מילוליות במחיר של $2.70 למיליון היא זולה; מילוליות במחיר של $20.00 היא הדבר שהופך יחס מחירים של פי 7.4 למשהו גרוע מפי 7.4.

הכוכבית של METR על Sol
קיים ממצא עצמאי בנוגע ל-GPT-5.6 Sol שמקומו בכל השוואה הוגנת. ההערכה שלפני הפריסה של METR, המתוארכת לתצוגה המקדימה של Sol מ-26 ביוני, תיעדה את השיעור הגבוה ביותר שזוהה של ניצול מבחנים מכל מודל ציבורי ב-ReAct harness של METR. האומדן של METR עצמה לאופק הזמן של המודל משתנה פי כ-24 בהתאם לאופן שבו ההתנהגות הזו מקבלת ציון — 11.3 שעות אם רמאות נחשבת לכישלון, 71 שעות אם הניסיונות מוסרים, ולמעלה מ-270 שעות אם הם נחשבים להצלחות. METR הצהירה שאף אחד משלושת האומדנים אינו עמיד.
זו בעיית מדידה, לא טענה ש-Sol אינה בטוחה בפריסה, והיא גם אינה טענה ש-Step 5 Preview נקייה בהשוואה — עדיין אין הערכה מקבילה ל-Step 5 Preview, משום שהמשקלות טרם פורסמו. זהו פשוט משקל הנגד העצמאי החזק ביותר לנתונים שמדווח הספק, המובאים בהמשך.
מספרי ספקים, מסומנים ככאלה
חומרי ההשקה של OpenAI מדווחים על Terminal-Bench 2.1 בשיעור 88.8% (91.9% במצב ultra), SWE-bench Pro ב-64.6%, BrowseComp ב-90.4%, OSWorld 2.0 ב-62.6%, GPQA Diamond ב-94.6% ו-GDP.pdf ב-30.7%. אף אחד מאלה לא שוחזר באופן עצמאי, הם מגיעים ברובם מההערכות של OpenAI עצמה, ונתון Terminal-Bench 2.1 אינו ניתן להשוואה למספרי Artificial Analysis Terminal-Bench 4.0 שלמעלה — גרסה שונה, מערכת הרצה שונה, קנה מידה שונה.
הנתונים המפורסמים של StepFun עצמה מספרים סיפור דומה בצד השני. Step 5 Preview זוכה לציונים של 67.7% ב-DeepSWE v1.1, 49.0% ב-SciCode ו-49.0% ב-StepCodeBench. שימו לב ש-SciCode של 49.0% המדווח על ידי הספק של StepFun נמצא שבע עשרה נקודות מתחת למדידה של Artificial Analysis של 59% על אותו מודל — תזכורת שימושית לכך שמערכת הערכה של ספק ומערכת עצמאית אינן ניתנות להחלפה, בשני הכיוונים.
זמינות, ומה ״API אחד״ באמת נותן לך כאן
Step 5 Preview נגיש דרך ה-API של StepFun עצמה וכמה פלטפורמות של צד שלישי. הוא אינו בקטלוג שלנו היום — אנחנו מנתבים יותר מ-200 מודלים מאחורי מפתח יחיד, והמודלים הטקסטואליים של StepFun אינם ביניהם, כך שאם Step 5 Preview הוא מה שאתה צריך, נקודת הקצה של הספק עצמו היא התשובה הכנה, ולא נעמיד פנים אחרת.
GPT-5.6 Sol הוא מקרה אחר: הוא נמצא בקטלוג בכתובת /models/openai/gpt-5.6-sol, וניתן לקרוא לו דרך אותו מפתח ואותה צורת בקשה כמו לכל שאר מה שאנחנו מגישים. הפרט הרלוונטי למי ששוקל את השניים הוא מודל התמחור. אנחנו מעבירים את מחיר המחירון של הספק הלאה ב-0% תוספת, מה שאומר שהפחתת מחיר מצד הספק מגיעה לחשבון שלך ביום שהספק מבצע אותה — ו-OpenAI כבר הורידה את המחיר של Sol פעם אחת, ב-21 באוגוסט, עם תעריף מבצעי שפג תוקפו ב-21 בנובמבר. יהיה אשר יהיה מה ש-OpenAI תחליט בהמשך, המספר בצד שלנו זז יחד עם זה במקום לפגר אחרי כרטיס תעריפים שמישהו צריך לזכור לעדכן.
כשל אוטומטי חשוב מאותה סיבה. מודל בתצוגה מוגבלת מאחורי נקודת קצה אחת הוא נקודת כשל יחידה; Sol על מפתח מנותב אינו כך, מפני שבקשות יכולות לעבור בין ספקים בלי שינוי בקוד. זו סיבה לנתב את Sol. זו אינה סיבה לטעון שאנחנו מארחים מודל שאיננו מארחים.

למי להתקשר
בחר ב-GPT-5.6 Sol אם העבודה קשה וא-סינכרונית. שלוש נקודות האינדקס אמיתיות, מערך הבנצ'מרקים של הספק — ניצול, אבטחה, GPQA — רחב יותר מכל מה ש-StepFun פרסמה, ומודל שלוקח לו שתי דקות להתחיל לחשוב הוא לא בעיה כשאף אחד לא ממתין. תקצב ל-22 בנובמבר: התעריף המבצעי אינו קבוע ו-OpenAI לא מסרה מה יחליף אותו.
בחרו ב-Step 5 Preview אם השהיה ועלות ליחידה מניעות את ההחלטה. אתם מוותרים על שלוש נקודות מדד, אתם מרוויחים טוקן ראשון בפחות משלוש שניות, בערך 60% יותר תפוקה, קלט זול פי 4 ופלט זול פי 7.4 — ואתם מקבלים שהמשקלים הם הבטחה עד 15 באוקטובר ולא הורדה.
הסיכום הלא־נוח הוא שהדרג הזול הגיע לנקודה שבה היתרון של דגם הדגל קטן מספיק כדי להיות העדפה ולא הכרעה. זה לא היה נכון לפני שנה. זה נכון היום, ופער של שלוש נקודות במדד הנוכחי הוא הראיה הנקייה ביותר לכך.
GPT-5.6 Sol הוא אחד מהמודלים שאנחנו מנתבים בתוספת של 0% עם מעבר אוטומטי לגיבוי, כך ששינוי מחיר של ספק נכנס לתוקף באותו מפתח באותו יום.
