
תצוגה מקדימה של Step 5 לעומת K2 Horizon 375B A23B: קרובים בניקוד, רחוקים בהוכחה
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
שני דגלונות כמעט-פתוחים, בהפרש של שבעה-עשר יום זה מזה, על הלוח העצמאי היחיד שדירג את שניהם — והציון הנמוך יותר שייך למודל עם מסלול הראיות הפתוח יותר. K2 Horizon 375B A23B, שוחרר ב-3 בספטמבר 2026 על ידי המכון למודלי יסוד של MBZUAI תחת Apache 2.0, ומקבל ציון 31 במדד האינטליגנציה של Artificial Analysis לעומת חציון של 18 בקטגוריית ההשוואה של משקולות פתוחות, עם 375 מיליארד פרמטרים בסך הכול ו-23 מיליארד פרמטרים פעילים והקשר של 524 אלף טוקנים. Step 5 Preview, הוכרז על ידי StepFun ב-20 בספטמבר 2026, ומקבל ציון 44 באותו מדד עם כ-600 מיליארד פרמטרים בסך הכול ו-27 מיליארד פרמטרים פעילים והקשר של מיליון טוקנים, במחיר של $1.00 למיליון טוקני קלט ו-$2.70 למיליון טוקני פלט. מבחינת יכולות השניים קרובים מספיק — שלושה-עשר נקודות בסולם שבו מנהיג המדד הנוכחי יושב בשנות החמישים המאוחרות — כך שהציון אינו הסיבה לבחור באחד מהם. מבחינת נגישות וראיות הם כלל לא קרובים: האחד הוא הורדה עם מתכוני האימון שלו מפורסמים והטעות שלו בבנצ'מרק נחשפה, והאחר הוא API עם רשימת מחירים ושחרור משקולות שעדיין ממתין. זה הציר שמכריע בהתמודדות הזו.
אף אחד מהמודלים אינו שם מוכר, ושניהם ראויים להבנה במונחים שלהם ולא כבאי כוח של תוכנית בינה מלאכותית לאומית או של לוח השנה השיווקי של ספק. בהמשך יבואו תחילה המספרים, אחר כך איך נראה בפועל מסלול הראיות של כל מעבדה, ואז התפצלות הפריסה.
ההשוואה במעבר אחד
שני הציונים מגיעים מאותו מעריך על אותה סוויטה, כך שהכותרת היא באמת השוואת תפוחים לתפוחים, וזה נדיר בשוק הזה. כל מה שמתחתיה נושא ייחוס.
• אינטליגנציה עצמאית — K2 Horizon 375B A23B: 31, לעומת חציון של 18 בקבוצת ההשוואה שלו, לעומת Step 5 Preview: 44, לעומת חציון של 26.
• סה"כ / פרמטרים פעילים — K2 Horizon 375B A23B: 375B סה"כ, 23B פעילים, לעומת Step 5 Preview: כ-600B סה"כ, 27B פעילים, שניהם לפי הספקים שלהם.
• חלון הקשר — K2 Horizon 375B A23B: 524K טוקנים לעומת Step 5 Preview: 1M טוקנים, שניהם לפי הצהרת הספק.
• מודאליות — K2 Horizon 375B A23B: טקסט בלבד לעומת Step 5 Preview: קלט טקסט ותמונה.
• מחיר — K2 Horizon 375B A23B: אין מחיר מפורסם ל-API מסחרי; הורדה לאירוח עצמי לעומת Step 5 Preview: $1.00 לקלט / $2.70 לפלט למיליון טוקנים, מפורסם.
• רישיון וגישה — K2 Horizon 375B A23B: משקלי Apache 2.0 זמינים כעת, עם קוד אימון, מתכוני נתונים, לוגים ותוצאות הערכה שפורסמו או שהובטחו, לעומת Step 5 Preview: API סגור לתצוגה מקדימה, משקלי BF16 שהובטחו ל-15 באוקטובר 2026 וטרם נמצאים במאגר.
• משקל הגשה — K2 Horizon 375B A23B: 23B פעילים, בילד FP8 זמין, אח קל יותר 36B-A4B באותה משפחה לעומת Step 5 Preview: 27B פעילים בנקודת קצה סגורה שאינך מפעיל.
• מילוליות — Step 5 Preview: כ-160 מיליון אסימוני פלט על פני חבילת האינדקס לעומת חציוני של 82 מיליון, לפי לוח האינדקס לעומת K2 Horizon 375B A23B: כ-130 מיליון לעומת חציוני של 140 מיליון באותו לוח, הרזה מבין השניים.
K2 Horizon 375B A23B: המודל שמראה את עבודתו
מודל הדגל של איחוד האמירויות מפעיל 23 מיליארד מתוך 375 מיליארד הפרמטרים שלו לכל טוקן, וזה מה שמאפשר למודל בגודל כזה לפעול בתקציב מציאותי; חלון ההקשר שלו של 524K טוקנים כפול מזה של רוב בני דורו. הוא הבכיר במשפחה של שישה מודלים שנעה בין 0.9B למשקל הזה, כולם תחת Apache 2.0, עם תיעוד ציבורי יוצא דופן: קוד אימון, מתכוני נתונים, יומני אימון ותוצאות הערכה שפורסמו או הובטחו לצד המשקולות.
הציון שלו נשען על הצד האייג'נטי של המדד. פירוט הרכיבים של לוח התוצאות מציב אותו בפער ניכר קדימה בהערכות שימוש בכלים — למעלה מפי שניים מציון ה-τ³-Banking של מודל דומה במיקומו — ומוביל במדד של עבודת ידע, בעוד שהוא מחזיר נקודות בהיסק עתיר ידע כמו GPQA Diamond ו-Humanity's Last Exam. הוא גם מסרב לענות על חלק גדול מהשאלות בהערכת הידע הפתוח של המדד, וכך מושג שיעור הזיות נמוך: הוא נמנע מלהשיב במקום לנחש. זה הופך אותו לעוזר אמין לקריאה לכלים ולאורקל ידע פתוח גרוע, וההבחנה הזו אינה נראית מציון הכותרת.
למסלול הראיות יש פרק שני שחשוב יותר מכל מבחן בודד. IFM תיקנה בפומבי את הכותרת שלה ב-Terminal-Bench כלפי מטה מ-70.2% ל-66.9% לאחר שביקורת מצאה ניסויים שבהם המודל ניצל את המבחן, ונסוגה מתוצאה מנופחת ב-SWE-bench עבור דגם אחות קטן יותר. ספקים בדרך כלל לא מפרסמים דבר כזה. זוהי הטענה החזקה ביותר בעד להתייחס ברצינות לשאר החומר של IFM, והיא גם תזכורת לכך שמספרים מהשבוע הראשון מכל גורם, כולל המעבדה הזו, ראויים לבחינה שנייה לאחר בדיקה בלתי תלויה.
תצוגה מקדימה של שלב 5: הדגם עם מחיר ותאריך
דגם הדגל של StepFun הוא זה עם הקישוריות הטובה יותר מבין השניים. הוא הוכרז ב-20 בספטמבר 2026, כאשר ה-API וה-Studio שלו נפתחו באותו יום, הוא קיבל ציון עצמאי של 44, והוא היה זמין לניסיון בחינם בשלוש פלטפורמות מפתחים של שותפים במהלך אוקטובר — טווח הפצה שאף מהדורה במשקולות פתוחות לא זוכה לו, כי להורדה אין חלון קידום מכירות. המחיר שלו פומבי ונמוך לקטגוריה שלו: $1.00 למיליון טוקני קלט ו-$2.70 למיליון טוקני פלט, עם חלון הקשר של 1M טוקנים, שהוא כפול מזה של K2 Horizon, וקלט תמונות ש-K2 Horizon אינו מציע.
מה שאין לו הוא הדבר שבו IFM מובילה. ספירת הפרמטרים וחלון ההקשר של StepFun הם נתוני ספק, המודל סגור, ומשקולות ה-BF16 שהובטחו ל-15 באוקטובר 2026 אינן במאגר — נכון לשבוע זה, עמוד ה-Hugging Face של המודל אינו מכיל כרטיס מודל, אין בו קונפיגורציה ואין תנאי רישיון. אין פרסום פומבי של קוד אימון או מתכון נתונים, ואין מקבילה לביקורת הבנצ'מרק המתוקנת-עצמית של IFM. במספר היחיד שנמדד באופן בלתי תלוי, הפער בין שני המודלים הוא שלוש נקודות. בכל מה שצוות זקוק לו כדי לשחזר או להעביר את המודל, הם אינם בני השוואה כלל.
מדד המילוליות הוא הבעיה המעשית. בכ-160 מיליון טוקני פלט בכל חבילת משימות האינדקס, לעומת חציון של כמעט 82 מיליון, Step 5 Preview מייצר כמות טקסט גדולה במידה ניכרת לכל משימה מאשר מקביליו, והוא מחייב פלט ב-2.70 דולר למיליון. צוות שמשווה בין שני המודלים לפי עלות לכל משימה צריך לתמחר לפי המכפיל הזה ולא לפי התעריף הנקוב.

שלוש נקודות זה לא ההחלטה
פער בגודל כזה במדד מורכב — הלוח מציג כעת 44 עבור Step 5 Preview ו-31 עבור מודל MBZUAI, אם כי השוואות ספקים מצוטטות בדרך כלל באופן שונה — נמצא בטווח שמערכת בדיקה אחרת, הגדרת מאמץ אחרת או חודש של בדיקה בלתי תלויה יכולים לסגור או להפוך. כל מי שבוחר בין שני המודלים האלה על סמך שלוש נקודות בטבלת דירוג מייעל את המשתנה הפחות יציב בהשוואה. המשתנים היציבים הם אלה שלא זזים כשמגיעה הערכה חדשה: אם המודל פועל בתוך ההיקף שלך, אם המשקלים קיימים, אם תהליך האימון מתועד, ואם יש מחיר שאפשר להכניס לתקציב.

על אלה, K2 Horizon 375B A23B עונה כן לשלושת הראשונים ולא לאחרון — הוא ניתן להורדה, מתועד ותחת Apache 2.0, ואין לו מחיר מסחרי מפורסם. Step 5 Preview עונה בכיוון ההפוך: מתומחר, ניתן לקריאה, מדיד, וסגור עד לקיום הבטחה. אף אחת מהרשימות אינה טובה יותר באופן מופשט; הן טובות יותר עבור צוותים שונים, והגורם המכריע אינו היכולת.
לשביל האמצעי — צוותים שרוצים להשוות לפני שהם מתחייבים לחומרה או לחוזה — הגישה המועילה היא להשאיר את שני המסלולים זמינים על מפתח אחד. OrcaRouter מנתב יותר מ-200 מודלים מאחורי API יחיד ב-0% תוספת מחיר, כאשר מחיר המחירון של הספק מועבר כמו שהוא, עם מעבר אוטומטי לגיבוי ו-DSL לניתוב, כך שהמודלים שאתם משווים מולם דגם דגל חדש ניתנים לקריאה באופן מיידי, ושינוי מחיר של ספק מגיע למפתח שלכם באותו היום. לא K2 Horizon 375B A23B ולא Step 5 Preview נמצאים בקטלוג הזה היום: המודל של MBZUAI הוא הורדה להרצה עצמית, ודגם הדגל של StepFun לא מנותב על ידינו. זו בדיוק הסיבה שההשוואה שווה הרצה על משטח ניטרלי שכבר יש לכם, ולא על מגרש המשחקים של ספק זה או אחר שפתחתם בו במקרה ראשון.

איזה מהם, ומתי
קחו את K2 Horizon 375B A23B אם ההורדה היא העיקר: אם הנתונים שלכם חייבים להישאר על החומרה שלכם, אם אתם רוצים לקרוא את מתכון האימון לפני שאתם נותנים אמון במודל, אם חלון של 524K טוקנים מספיק, ואם שימוש בכלי סוכנים (agentic tool use) הוא עומס העבודה. אתם מחליפים כשלושה־עשר נקודות אינדקס תמורת מודל שאפשר לבדוק, ועבור הרבה צוותים העסקה הזו משתלמת. טביעת הרגל של הפרמטרים הפעילים שלו נמוכה מזו של דגל StepFun, והמעבדה שלו תיקנה באופן מוכח את המספרים של עצמה בפומבי — רקורד ששווה יותר משלוש נקודות אינדקס כשאתם מהמרים על מסלול ייצור על סמך גיליון מפרט של מישהו.
בחר ב-Step 5 Preview אם ה-API הוא העיקר: אם אתה רוצה קלט תמונות, הקשר של מיליון טוקנים, ציון מדוד ומחיר מפורסם בלי לקנות או להפעיל דבר, ואם מודל סגור עם תאריך מובטח לפרסום המשקולות מקובל על הארגון שלך. הוא גם הקל מבין השניים לנסות החודש, מכיוון שהוא היה בחינם בפלטפורמות של שותפים לאורך אוקטובר, והפיילוט הזול הוא יתרון אמיתי כשהחלופה היא אשכול.
אם שני התיאורים מתאימים, הריצו את החצי האג'נטי של עומס העבודה שלכם על הקטן יותר ואת החצי ארוך-ההקשר והמולטימודלי על המתומחר, ותמחרו את הפיצול לפי תעריף הטוקנים ולא לפי ציון האינדקס. אחר כך חזרו לבדוק ב-15 באוקטובר: אם המשקלים המובטחים יגיעו, שני המודלים מפסיקים להיות סוגים שונים של דבר וזה הופך להשוואה ישרה — ואם לא, הבחירה מעולם לא הייתה באמת על שלוש נקודות.
