כרטיס Hero שנוצר המשווה בין Intern-S2-397B ל-Grok 4.6, ומציג משמאל מודל מדעי עם משקולות פתוחות הכולל מתג חשיבה שכותרתו enable_thinking וצורת גל של סדרת זמן, ומימין נקודת קצה עננית סגורה עם חוגת מאמץ חשיבה וסמלי כלים בצד השרת, עם תווית של הניגוד שבין שליטה באירוח עצמי תחת Apache-2.0 לבין API בתשלום לפי שימוש של $2 / $6, עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Intern-S2-397B מול Grok 4.6: מי זוכה לסובב את הכפתורים

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Intern-S2-397B ו-Grok 4.6 הושקו בהפרש של כחודש בערך ועונים על אותה שאלת יסוד בדרכים מנוגדות: מי זוכה לשלוט בחשיבה. Grok 4.6, ספינת הדגל של xAI שעלתה לאוויר ב-12 באוגוסט 2026, מוכר לך חוגה — בקרת מאמץ חשיבה הניתנת להגדרה ב-API סגור, במחיר של 2.00 דולר למיליון טוקני קלט ו-6.00 דולר למיליון טוקני פלט, עם חלון של 500,000 טוקנים, וכלים בצד השרת של xAI שמחויבים בנוסף. Intern-S2-397B, המודל המדעי המולטימודלי בעל 403 מיליארד פרמטרים שצוות InternLM של Shanghai AI Laboratory שחרר תחת Apache-2.0 ב-13 בספטמבר, מוסר לידיך את המכונה כולה — משקלים, מתג חשיבה, מסלול ראייה, ראש סדרות זמן — ומצפה שתריץ אותה בעצמך. האחד נשכר עם כפתורים; האחר נמצא בבעלות מלאה. ההשוואה שחשובה כאן אינה מי משיג ציון גבוה יותר בטבלת בנצ'מרק; היא איזה סוג של שליטה עומס העבודה שלך באמת זקוק לו, ומה העלות של כל סוג.

שתי חוגות שונות

הדרך הנקייה ביותר להבדיל בין השניים היא להסתכל היכן שנמצאות בקרות החשיבה. Grok 4.6 חושף הגדרת מאמץ חשיבה דרך ה-API של xAI, ומסביבו נמצאת חבילה של כלים בצד השרת — קריאה לפונקציות, חיפוש באינטרנט, חיפוש ב-X, הרצת קוד — ש-xAI מתפעלת ומחייבת בנפרד. אתה מכוון את המאמץ, משרשר את הכלים שהיא נותנת לך, ואתה אף פעם לא נוגע במשקל. ההתנהגות של המודל היא הרכוש של xAI והבעיה של xAI; המנוף שלך הוא פרמטר בבקשה.

Intern-S2-397B נותן לך סט אחר של מנופים, והם נמצאים נמוך יותר בשכבות המערכת. החשיבה מופעלת כברירת מחדל, ואתה מכבה אותה בכל בקשה עם enable_thinking=False. מכיוון שהמודל הוא Apache-2.0, אתה יכול גם לקחת את המשקולות ולכוונן עדין את התנהגות החשיבה עצמה על הנתונים שלך, ואז להגיש את התוצאה על LMDeploy, vLLM או SGLang. משטח הקלט שלו רחב יותר מ-API של טקסט ותמונה: הוא מקבל אותות של סדרות עתיות ומפיק תחזיות — יכולת שמחווטת כרגע דרך LMDeploy בלבד — והוא אומן לעבודת סוכנים בטווח ארוך בסביבות מסונדבוקסות. הפשרה ברורה באותה מידה — רמת שליטה כזו משמעותית רק אם אתה מוכן להפעיל את החומרה ואת מחסנית ההגשה שמגיעות איתה.

• שליטה בהסקה — Grok 4.6: חוגת מאמץ חשיבה ב-API סגור לעומת Intern-S2-397B: מתג enable_thinking בתוספת שליטה מלאה ברמת המשקלים תחת Apache-2.0.

• כלים — Grok 4.6: חיפוש אינטרנט בצד השרת של xAI, חיפוש ב-X והרצת קוד, בחיוב נפרד לעומת Intern-S2-397B: קריאות לכלים שאתה מחבר בעצמך, ובנוסף מסלול לחיזוי סדרות עיתיות דרך LMDeploy.

• קלטים — Grok 4.6: טקסט, תמונה, קובץ לעומת Intern-S2-397B: טקסט, תמונה, סדרת זמן.

• הקשר — Grok 4.6: 500,000 טוקנים לעומת Intern-S2-397B: 256K להסקת טקסט, 64K למולטימודאלי, שני הנתונים מכרטיס המודל.

• מחיר — Grok 4.6: $2.00 / $6.00 לכל 1M, עם מדרגות ל-$4.00 / $12.00 מעבר ל-200K אסימונים לעומת Intern-S2-397B: אין מחירון; אירוח עצמי או ה-Intern API הרשמי.

מה שהמספרים בעצם מכסים

כל נתון של Intern-S2-397B המובא להלן הוא של InternLM עצמה, שהורץ דרך OpenCompass, VLMEvalKit ו-AgentCompass ופורסם לצד המשקלים בלי שחזור עצמאי. המספרים של Grok 4.6 הם מסוג אחר: הם הצטברו דרך הזירה הציבורית ו-Artificial Analysis לאחר שהמודל עלה לאוויר, ולכן הם נושאים תווית של צד שלישי.

בצד הנמדד באופן בלתי תלוי, Grok 4.6 עומד על 44 במדד Artificial Analysis Intelligence Index הנוכחי, עם GPQA Diamond של 94.9, Humanity's Last Exam של 61.0 וציון קידוד של 76.8, ו-Artificial Analysis מעמידה את נתון ה-TerminalBench 2.1 שלו קרוב ל-80.3. בצד הספק, הכרטיס של Intern-S2-397B מדווח על 89.77 ב-MMLU Pro,‏ 93.56 ב-HMMT-2026,‏ 81.68 ב-MMMU Pro ו-68.54 ב-SWE-bench-Pro, לצד שורות מדעיות שבהן הוא נראה כמו מין אחר: 55.71 ב-Biology-Instructions,‏ 63.28 ב-SciReasoner 1.5,‏ 53.95 ב-Mol-Instructions,‏ 62.35 ב-MolecularIQ. המספר האחד בטבלת הספק שאמור לגרום לבונה סוכנים להירתע הוא TerminalBench 2.1 עם 64.04 — נתון שהיוצרים של המודל עצמו מדווחים כי הוא מפסיד לדור סגור ישן יותר בפער גדול, בדיוק במסלול עבודת הטרמינל שבו מודל פרונטירי בשכירות כמו Grok 4.6 הוא החזק ביותר.

קרא את הפיצול הזה כפורטרט, לא כדירוג. Intern-S2-397B הוא מומחה מדעי שהוא מודל כללי מוכשר; Grok 4.6 הוא כללן שיש לו עניין חולף במדע. העובדה שהשורות המדעיות מוטות היא צפויה — אף מודל דגל כללני לא עבר אימון מקדים על דפים גולמיים של ספרות מדעית עם איורים, פריסה וסימון סמלי יחד, וזה בדיוק הפרדיגמה שסביבה בנוי Intern-S2-397B. שום דבר באף אחד משני בסיסי הראיות לא תומך בטענה ש"Intern-S2-397B טוב כמו Grok 4.6 בהיסק שרירותי", ושום דבר בראיות של Grok 4.6 לא מרמז שהוא כוונן לניתוח רצפים רב-אומי.

מחיר השליטה

ל-Grok 4.6 יש מחיר שאפשר לשים בגיליון אלקטרוני: $2.00 למיליון טוקנים בקלט ו-$6.00 למיליון בפלט, כשהתעריף מטפס ל-$4.00 / $12.00 ברגע שפרומפט חוצה 200,000 טוקנים, בתוספת שכבת עדיפות אופציונלית לתגובות מהירות יותר. הוא זמין דרך OrcaRouter במחיר המחירון של xAI שמועבר הלאה בתוספת של 0%, כך ששינוי בתעריף ב-xAI מגיע לכאן באותו יום בלי פער של מתווך — החוגה שאתם שוכרים נשארת מתומחרת כפי שהספק מתמחר אותה.

ל-Intern-S2-397B אין כלל תעריף מפורסם לפי טוקן. כרטיס המודל מפנה ל-Intern API רשמי, אבל השיקולים הכלכליים שאנשים באמת רוצים להשוות הם אלה של אירוח עצמי: צ'קפוינט של 403B פרמטרים, כ-807 GB של משקלים על פני 188 שרדים ב-BF16, כלומר צומת רציני עם ריבוי GPU, כאשר גרסת ה-FP8 מקטינה בערך בחצי את הנפח. אם כבר יש לך את הקיבולת הזו, העלות השולית של השאילתה המדעית הבאה מתקרבת לעלות החשמל, וזו כל הנקודה של עמדת Apache-2.0. אם אין לך אותה, המודל ה"חינמי" הוא פיילוט של הוצאות הון, לא סעיף תקציבי.

מה שראוטר מקנה בהתמודדות הספציפית הזו הוא התפר, לא המחיר. Grok 4.6 יושב על המפתח שכבר יש לך לתעבורת ייצור כללית; Intern-S2-397B אינו מנותב ב-OrcaRouter — זהו צ'קפוינט חדש לגמרי, והנתיב שלך אליו הוא ה-API של הספק עצמו או פריסה באירוח עצמי. נתב את החשיבה הכללית הרגישה להשהיה למודל הנמדד, השאר את עבודת האצווה המדעית על המודל שאתה מריץ, ואפשר למעבר האוטומטי לגיבוי לכסות אותך כשנקודת הקצה של מי מהצדדים אינה תקינה. הגבול ביניהם הופך לכלל ניתוב במקום לאינטגרציה שנייה.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

איזה אחד לבחור?

בחרו ב-Grok 4.6 כשהמשימה כללית, כשההיסק צריך לחזור מהר ובצורה נכונה, וכשאינכם רוצים להחזיק בבעלותכם את הסטאק שמייצר אותו. חלון ה-500K שלו, ציון GPQA Diamond הנמדד שלו של 94.9 וחבילת הכלים שלו הם תכונות ייצור, ותעריף ה-$2/$6 הוא מה שאתם משלמים על כך שאינכם מתפעלים שום דבר.

בחרו ב-Intern-S2-397B כאשר הקלט הוא מדעי — מאמר עמוס באיורים, תרשים מולקולרי, אות של סדרת זמן — וכאשר ההיסק חייב להתבצע על נתונים שאינם יכולים לצאת מהסביבה שלכם, או על התנהגות שברצונכם לכוונן בעצמכם. Apache-2.0 מאפשר זאת; שום API בשכירות לא. הקצו תקציב לחומרה, אל תצפו ללוח תוצאות בלתי תלוי במשך זמן מה, והתייחסו לכל מספר בכרטיס שלו כאל טענה עד שמישהו מחוץ ל-InternLM ישחזר אחד כזה.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.