נוצר כרטיס השוואה דו-טורי שכותרתו 'Step 5 Preview vs Intern-S2 Mobius' עם כותרת המשנה 'דגל 600B שאתם שוכרים, או מודל הסקה 35B שאתם מריצים'. הכרטיס השמאלי 'Step 5 Preview' מציין: מדד AA 44 (נמדד); כ-600B סה"כ / 27B פעילים; הקשר 1M טוקנים; $1.00 קלט / $2.70 פלט ל-1M; API סגור בתצוגה מקדימה; משקלים הובטחו ל-15 באוקטובר 2026. הכרטיס הימני 'Intern-S2 Mobius' מציין: אין ציון עצמאי; 35B פרמטרים; הקשר לא פורסם; אין מחיר API, אירוח עצמי; Apache 2.0 זמין כעת; נטענה האצה של פי כ-4, שלא שוחזרה. בשוליים התחתונים נכתב: 'הנתונים של Step 5 Preview לפי StepFun ו-Artificial Analysis; הנתונים של Intern-S2 Mobius הם טענות של InternLM, שלא שוחזרו.'
Engineering & Research

Step 5 Preview מול Intern-S2 Mobius: האם אתם צריכים דגם דגל של 600B, או מודל הסקה מהיר של 35B?

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הסיבה האמיתית להשוות Step 5 Preview עם Intern-S2 Mobius אינה שהם דומים. היא שהם תשובות לשתי שאלות שונות של אותו קונה — הצוות שיש לו עומס reasoning להריץ ואין לו תיאבון לקנות קלאסטר. מבית StepFun Step 5 Preview, שהוכרז ב-20 בספטמבר 2026, הוא התשובה הגדולה: כ-600 מיליארד פרמטרים בסך הכול עם 27 מיליארד פעילים, חלון הקשר של 1M טוקנים, ציון Artificial Analysis Intelligence Index שנמדד באופן עצמאי של 44, ומחיר שפורסם של $1.00 למיליון טוקני קלט ו-$2.70 למיליון טוקני פלט. מבית InternLM Intern-S2 Mobius, שיצא ב-29 ביולי 2026, הוא התשובה הקטנה: מודל במשקלים פתוחים עם 35 מיליארד פרמטרים, שנבנה על ארכיטקטורת Mobius-v0, שעבר אימון מקדים מתמשך מ-Qwen3.5-35B, והטענה המרכזית שלו אינה יכולת אלא מהירות — האצה מקצה לקצה של פי 4 בערך במבחני reasoning לעומת הבסיס שממנו אומן, בלי שום ציון benchmark עצמאי מכל סוג. האחד הוא דגם דגל שאתה שוכר; האחר הוא מודל קטן שאתה מריץ. ההשוואה היא בעצם בשאלה אם עומס העבודה שלפניך מצדיק בכלל את דגם הדגל.

הערת סדר אחת לפני המספרים, כי זה עולה לאנשים זמן אמיתי: InternLM שחררה כמה מודלים תחת המותג Intern-S2, והם לא אותו דבר. Intern-S2-397B הוא מודל הדגל המדעי הרב־מודאלי; Intern-S2 Mobius הוא מודל החשיבה היעיל בעל 35B הנדון כאן; מהדורה מוקדמת יותר של Intern-S2 היא שוב מודל נפרד. אם אתם מחפשים "Intern-S2" ונוחתים על טבלאות בנצ'מרק של מודל 397B, אתם קוראים על צ'קפוינט אחר.

מה כל מודל למעשה טוען

ההצהרות של Step 5 Preview הן ההצהרות המקובלות עבור מודל דגל של 2026, ואחת מהן נבדקת באופן בלתי תלוי. StepFun מפרטת כ-600B פרמטרים בסך הכול עם 27B פעילים, קלט טקסט ותמונה, חלון הקשר של 1M טוקנים, ומחיר של $1.00/$2.70 למיליון טוקני קלט ופלט. Artificial Analysis מודדת אותו ב-44 במדד ה-Intelligence Index שלה, מעל חציון של 26 במודלים דומים, עם פלט של 87 טוקנים לשנייה לעומת ממוצע של 78, וכ-160 מיליון טוקני פלט שנוצרו לאורך חבילת המשימות של המדד לעומת חציון של 82 מיליון — בערך כפול מטביעת הרגל המילולית האופיינית, מה שחשוב במודל שחיובו מבוסס פלט.

הטענה של Intern-S2 Mobius היא ארכיטקטונית וצרה יותר. העיצוב שלו מפריד בין ידע לחישוב: זיכרון משותף גלובלית מכיל וקטורי ידע, ומספר מכונני-היסק שואלים באופן איטרטיבי מצבים חבויים ומעדנים אותם מולו, במקום לקשור אחסון וחישוב שכבה אחר שכבה כפי שטרנספורמר קונבנציונלי עושה. התמורה המוצהרת של InternLM היא האצה מקצה-לקצה של פי-4 בקירוב במבחני היסק לעומת ה-Qwen3.5-35B שממנו הוא נגזר, עם ציוני היסק דומים או חזקים יותר, ובנוסף שרשראות מחשבה גלויות קצרות יותר. המודל הוא Apache 2.0, קלט טקסט ותמונה, והוא הורדה.

• קנה מידה — Step 5 Preview: כ-600B סה"כ, 27B פעילים לפי StepFun לעומת Intern-S2 Mobius: 35B סה"כ.

• ציון בלתי תלוי — Step 5 Preview: 44 ב-Artificial Analysis Intelligence Index לעומת Intern-S2 Mobius: לא פורסם על ידי שום צד שלישי.

• מהירות — Step 5 Preview: 87 אסימוני פלט לשנייה לעומת ממוצע של 78, כפי שנמדד על ידי לוח האינדקס לעומת Intern-S2 Mobius: "כמעט פי 4" לעומת קו הבסיס Qwen3.5-35B של עצמו, מדווח על ידי הספק ולא שוחזר.

• חלון הקשר — Step 5 Preview: 1M טוקנים לפי StepFun לעומת Intern-S2 Mobius: לא פורסם נתון הקשר עצמאי.

• מחיר — Step 5 Preview: ‏$1.00 קלט / $2.70 פלט למיליון טוקנים לעומת Intern-S2 Mobius: אין מחיר API; אתם משלמים על החומרה.

• רישיון וגישה — Step 5 Preview: תצוגה מקדימה סגורה דרך ה-API של הספק, משקולות BF16 מובטחות ל-15 באוקטובר 2026 לעומת Intern-S2 Mobius: משקולות Apache 2.0 זמינות כעת.

• מילוליות — Step 5 Preview: כ-160M טוקני פלט בכל סדרת האינדקס, לעומת חציון של 82M, לפי לוח האינדקס לעומת Intern-S2 Mobius: עקבות חשיבה גלויות קצרות יותר, כפי שטוענת InternLM, שלא נמדדו על ידי אף אחד אחר.

הטענה בדבר פי 4, ולמה זה המספר המעניין כאן

קראו את המספרים של שני הספקים זה לצד זה, ואי-ההתאמה בולטת לעין: הנתון המוביל של StepFun הוא ציון יכולת, ואילו זה של InternLM הוא מכפיל תפוקה. זה לא מקרי, וזה הדבר השימושי ביותר בהשוואה הזו. האצה מקצה לקצה פי 4 במשימות חשיבה, אם היא שורדת מפגש עם מערכת ההרצה של מישהו אחר, שווה יותר לפריסה בנפח גבוה מאשר כמה נקודות על מדד — היא משנה את החשבון של הרצת עומס העבודה בכלל. Intern-S2 Mobius מכוון לצוותים שצוואר הבקבוק שלהם הוא טוקנים לשנייה לדולר, לא יכולת שיא.

ההסתייגות היא שהמכפיל נמדד ביחס ל-Qwen3.5-35B, המודל שממנו בוצע האימון המקדים המתמשך של Intern-S2 Mobius, ואשר מעולם לא עבר את אימון Mobius. זו השוואה לנקודת ההתחלה של עצמו ולא מול מתחרה. אין שחזור עצמאי של טענת התפוקה, אין ציון אינדקס מצד שלישי, ואין חלון הקשר שפורסם על ידי מישהו מלבד הספק. התייחסו ל"כמעט פי 4" כאות ארכיטקטוני מעניין וכהשערה לבדיקה בהרנס שלכם, לא כמפרט.

ל-Step 5 Preview יש פרופיל ראיות הפוך. נתון היכולות שלו נמדד באופן בלתי תלוי; סיפור היעילות שלו הוא החלק החלש. מדד המילוליות של לוח האינדקס — כ-160 מיליון טוקני פלט, בעוד שהמודל החציוני פולט כ-82 מיליון — הוא משקל הנגד ההגון מול מחיר פלט של 2.70 דולר, והוא מלמד שעומס עבודה הנשען על יצירות מובנות ארוכות יוציא בפועל הרבה יותר ממה שהמחיר המוצהר מרמז. מה שכן יש לו ולחסר ל-Intern-S2 Mobius הוא מחיר API מפורסם בכלל, וזה מה שמאפשר להשוות מלכתחילה.

המאגר של Hugging Face עבור ה-build המובטח של הספק מספר את החצי השני של הסיפור: כך נראית מהדורה עם משקולות פתוחות כשהיא כבר הוכרזה אך טרם שוחררה.

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

היכן ששאלת טביעת הרגל באמת נושכת

היתרון האמיתי של Intern-S2 Mobius אינו הציון שלו, שאיש לא מדד, אלא המחיר של לטעות לגביו. שלושים וחמישה מיליארד פרמטרים הם גודל שצוות יכול להריץ על חומרה שכבר בבעלותו, להעריך בלי הזמנת רכש, ולנטוש בלי למחוק דבר מהמאזן. זהו יתרון מבני שדגם הדגל לא יכול להשתוות לו, לא משנה כמה נקודות הוא יצבור, וזו הסיבה שההשוואה הזו ראויה להתקיים במקום להידחות כאי-התאמה.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

היתרון של דגם הדגל הוא תמונת ראי. ההקשר של 1M טוקנים, קלט התמונות ויכולת ההסקה הכללית הנמדדת של Step 5 Preview מכסים עבודה שמודל 35B לא סביר שיכסה היטב, ואין עלות לנסות במשך חלון חינם — המודל היה בחינם בשלושה משטחי מפתחים נפרדים במהלך אוקטובר. אף אחד מהנתונים האלה אינו זמין עבור מודל באירוח עצמי: אין שבוע חינם להרצת כרטיסי GPU משלך, ואין מחירון שהופך את ההחלטה לשורת חיוב.

אם ברצונך שההשוואה תשרוד מעבר לחלון הפרסומי, הדבר שיש לבנות הוא מערך בדיקה ולא העדפה. OrcaRouter מנתב יותר מ-200 מודלים מאחורי מפתח API אחד וחשבונית אחת ברווח של 0%, כשמחיר המחירון של הספק מועבר הלאה כפי שהוא, עם מעבר אוטומטי לגיבוי ו-DSL לניתוב לצורך הכוונת תעבורה לפי עלות, השהיה או יכולת. לא Step 5 Preview ולא Intern-S2 Mobius נמצאים בקטלוג הזה — מודל הדגל של StepFun אינו מנותב על ידינו ו-Intern-S2 Mobius הוא הורדה להתקנה עצמית — כך שהערך כאן אינו בגישה לאף אחד מהשניים. הערך הוא שהמודלים שתשווה אותם מולם נמצאים במרחק מפתח אחד, והחלטה שמתקבלת על סמך מדידה נעה עם הראיות ולא עם פוסט בלוג של השקה.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

איך להחליט

אם עומס העבודה שלך הוא סוכני, רב-מודלי, בעל הקשר ארוך או בעל סוף פתוח — מהסוג שבו אינך יכול למנות את המשימות מראש — דגם הדגל הוא התשובה, ו-Step 5 Preview הוא מופע סביר שלו: מדוד, מתומחר, זול לפיילוט, והפיך ברמת הטוקן. רק תתקצב את אריכות הדברים ולא את המחיר המוצהר.

אם עומס העבודה שלך הוא הסקה צרה, חזרתית, בנפח גבוה, על נתונים שחייבים להישאר בתוך ההיקף שלך, המודל הקטן הוא התשובה, ו-Intern-S2 Mobius הוא מועמד אמיתי בדיוק מפני שהוא קטן: הוא רץ על חומרה שיש לך, הוא Apache 2.0, והטענה לגבי המהירות, אם היא מחזיקה, היא מהסוג שמכריע שאלה של כלכלת יחידה. היכנס לזה בידיעה שאתה בודק את טענת הספק ולא יורש את הפסיקה של מישהו אחר.

הטעות היא להתייחס לבחירה כקבועה. קנה תחילה את הערכת המודל הקטן, כי זהו הניסוי הזול; שכור את דגם הדגל למשימות שבהן המודל הקטן נכשל, כי זהו התיקון הזול. צוותים שמשאירים את שתי האפשרויות פעילות באותו מפתח ובאותה מערכת בדיקה מגיעים בסופו של דבר לקבל את ההחלטה הזו עם הנתונים שלהם, וזו הגרסה היחידה שלה שמחזיקה מעמד כאשר אחד מהספקים משיק יורש.