כרטיס הירו שנוצר המשווה בין Intern-S2-397B ל-Kimi K3, כשמשמאל מוצג עמוד ספרות מדעית עם תרשים מולקולרי שמזין כרטיס במשקלים פתוחים בעל 403 מיליארד פרמטרים, ומימין סרט מסמך ארוך שמזין דגם דגל בעל 2.8 טריליון פרמטרים עם מד הקשר של 1M, כשהלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Guides & Insights

Intern-S2-397B לעומת Kimi K3: מודל המדע 397B וענק החשיבה 2.8T

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Intern-S2-397B ו-Kimi K3 ניצבים משני צדדיו של קו המשקלים הפתוחים שיגדיר את יתרת 2026: המומחה המדעי להורדה לעומת הגנרליסט בעל ההקשר הארוך שהוכח באופן בלתי תלוי. Intern-S2-397B הוא המודל הרב-מודאלי המדעי בעל 403 מיליארד פרמטרים ש-InternLM שחררה תחת Apache-2.0 ב-13 בספטמבר 2026 — בלי מחירון, בלי ציון בלתי תלוי, ועם מסלול ראייה שאומן על עמודים גולמיים של ספרות מדעית. Kimi K3 הוא דגל תערובת-המומחים בעל 2.8 טריליון פרמטרים של Moonshot AI, שהושק ביולי 2026 במחיר של 3.00 דולר למיליון טוקני קלט ו-15.00 דולר למיליון טוקני פלט, פתח את משקולותיו ב-27 ביולי תחת רישיון Modified MIT, ועבר שישה שבועות של הערכה בלתי תלויה. הדבר יוצא הדופן בהתמודדות הזו הוא שלשני המודלים יש אותה שאיפה של אופק ארוך — להמשיך לעבוד דרך משימה גדולה ומבולגנת — והם פותרים אותה בכיוונים מנוגדים.

שניהם שאפתניים, מנגנונים מנוגדים

השאיפה משותפת: כל מודל רוצה להיות הדבר שממשיך לפעול כשהמשימה ארוכה. הם משיגים זאת בדרכים שונות, וההבדל הוא ארכיטקטוני.

התשובה של Kimi K3 היא ההקשר. חלון של 1,048,576 טוקנים גם בקלט וגם בפלט משמעו שמאגר שלם, חדר נתונים שלם, או לולאת סוכן בת חמישים שלבים יכולים להתקיים בשיחה אחת. על פי הדיווחים, ערימת ההסקה Mooncake של Moonshot שומרת על שיעורי פגיעת מטמון מעל 90% בעומסי קידוד, וכך מחיר פלט של 15 דולר למיליון הופך לאפשרי לשרוד בפועל. Kimi K3 חושף בקרת reasoning_effort ברמה העליונה ואינו מקבל פרמטרי דגימה, מבצע הסקה בעומק מקסימלי כברירת מחדל, ומצפה שתשחזר מילה במילה reasoning_content ו-tool_calls קודמים בלולאות כלים מרובות-תורות, אחרת האיכות נפגעת.

התשובה של Intern-S2-397B היא התמחות פלוס שליטה ברמת המשקולות. חלון ההקשר שלו — 256K של הסקה טקסטואלית ו-64K מולטימודלי, שני הנתונים מכרטיס המודל — הוא סוג אחר של חלון, שמספיק למאמר משמעותי או לסשן מחקר ארוך, אבל לא לערכת עבודה של מיליון טוקנים. במקום זאת, מה שהוא מציע הוא מסלול חזותי שקורא ספרות מדעית באופן ילידי — איורים, פריסה, סימון סמלי ופרוזה יחד — וקלט של סדרות זמן שמפיק תחזיות, לצד חשיבה שדלוקה כברירת מחדל וניתנת להדלקה או לכיבוי לפי בקשה. אם המשימה הארוכה שלך היא מדעית, המודל אומן בדיוק בשבילה; אם המשימה הארוכה שלך היא בסיס קוד, זה לא המודל עם חלון מיליון הטוקנים עבורה.

• הקשר — Kimi K3: 1,048,576 טוקנים בקלט ובפלט לעומת Intern-S2-397B: 256K טקסט / 64K מולטימודאלי.

• היקף — Kimi K3: 2.8T סה"כ, ~104B פעילים לכל טוקן לעומת Intern-S2-397B: 403B סה"כ, 512 מומחים / 10 פעילים.

• משטח בקרה — Kimi K3: חוגת reasoning_effort, ללא פרמטרי דגימה לעומת Intern-S2-397B: מתג enable_thinking בתוספת שליטה מלאה ברמת המשקל תחת Apache-2.0.

• קלטים — Kimi K3: טקסט, תמונה לעומת Intern-S2-397B: טקסט, תמונה, סדרת זמן.

• משקלים — Kimi K3: פתוח תחת Modified MIT (27 ביולי) לעומת Intern-S2-397B: פתוח תחת Apache-2.0 (13 בספטמבר).

• ראיות בלתי תלויות — Kimi K3: שישה שבועות של ציוני צד שלישי לעומת Intern-S2-397B: אין עדיין.

אסימטריית הראיות היא ההבדל האמיתי.

Kimi K3 עבר את המסחטה הבלתי־תלויה ויצא עם ציונים שאפשר לבנות עליהם. Artificial Analysis ממקמת אותו באמצע שנות ה־40 במדד ה-Intelligence הנוכחי שלה, עם GPQA Diamond בשנות ה־90 הנמוכות, HLE באמצע שנות ה־40, שחזור בהקשר ארוך שנמדד באופן בלתי־תלוי של 88.7, וציון קידוד באמצע שנות ה־70. הוא מחזיק במקום הראשון ב-Frontend Code Arena (Elo בשנות ה־1670) ורשם 91.2 ב-BrowseComp, הנתון הגבוה ביותר במבחן האחזור ארוך־הטווח הזה — אם כי Moonshot עצמה מזהירה ש-K3 "עדיין מפגר אחרי המודלים הקנייניים החזקים ביותר", וכמה משורות הנתונים מיום ההשקה שלו נותרו בגדר דיווחי ספק.

הראיות של Intern-S2-397B הן טבלת ההשקה של עצמו, שהורצה דרך OpenCompass, VLMEvalKit ו-AgentCompass, ופורסמה שעות לפני שאתם קוראים זאת. כל מספר הוא של היצרן עצמו ולא שוחזר: MMLU Pro 89.77,‏ MMMU Pro 81.68,‏ HMMT-2026 93.56,‏ SWE-bench-Pro 68.54, ו-TerminalBench 2.1 ב-64.04 — נתון שהכרטיס מציג כמפסיד לדור סגור קודם בפער ניכר. השורות המדעיות שלו הן המספרים שמבססים את עמדת המומחה: 55.71 ב-Biology-Instructions,‏ 63.28 ב-SciReasoner 1.5,‏ 53.95 ב-Mol-Instructions,‏ 62.35 ב-MolecularIQ. שני בסיסי הראיות אינם נוגעים זה בזה, ולכן המסגור ההגון של ההתמודדות הזו אינו "מי מנצח" אלא "איזה סוג של ראיות דרוש לעומס העבודה שלך".

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

כמה עולה כל אחד, מהדורת משקלים פתוחים

שני המודלים הם בעלי משקלים פתוחים, מה שמשנה את שאלת העלות מהסיפור המוכר של תשלום לפי מדידה מול חינם להשוואה בין שתי הצעות אירוח. ל-Kimi K3 יש מחיר API מפורסם — 3.00 / 15.00 דולר למיליון טוקנים במחירון של Moonshot, מועבר דרך OrcaRouter בתוספת של 0%, עם תמחור קריאה מהמטמון בנוסף — והוא גם ניתן להורדה: מהדורת משקלים פתוחים בת 96 שארדים שדורשת חומרה ברמת סופרנוד, 64 מאיצים או יותר, כדי לשרת. הקהל המעשי ל-K3 באירוח עצמי הוא צוותים עם תקציבי מרכזי נתונים. ל-Intern-S2-397B אין כלל מחיר API מפורסם; כרטיס המודל מפנה אל ה-Intern API הרשמי, והכלכלה האמיתית היא זו של אירוח עצמי: כ-807 GB של משקלים על פני 188 שארדים ב-BF16, צומת עם ריבוי GPUs רציני, כאשר בנייה ב-FP8 מקטינה את הנפח בכמחצית.

שני המודלים ניתנים לקריאה דרך אותו תפר אם תנתב: Kimi K3 זמין ב-OrcaRouter במחיר המחירון של Moonshot עם 0% תוספת, בעוד ש-Intern-S2-397B אינו מנותב — צ׳קפוינט חדש לגמרי תחת Apache-2.0, כשהדרך שלך אליו היא ה-API של הספק עצמו או פריסה באחסון עצמי. הערך שבניתוב בהתמודדות הזו הוא להשאיר את תעבורת המודל הכללי עם ההקשר הארוך על המפתח שכבר יש לך, ואת עבודת האצווה המדעית על המודל שאתה מפעיל, עם מעבר אוטומטי לגיבוי בין השניים. ה-DSL הופך את הגבול הזה להגדרה ולא לאינטגרציה שנייה.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

פסק הדין

בחר ב-Kimi K3 כשהעבודה היא עבודה כללית עם הקשר ארוך — קידוד של מאגר שלם, לולאות סוכנים מתמשכות, עבודת ידע שזקוקה למיליון טוקנים של זיכרון עבודה — ואתה רוצה לוח תוצאות בלתי תלוי מאחוריו. זהו המודל עם הראיות החזקות ביותר מכל בחינה, המשקלים הפתוחים שלו אמיתיים (Modified MIT, 27 ביולי), ואם אתה כבר מפעיל תשתית ברמת supernode, הכלכלה לפי טוקן עם מטמון משתלמת.

בחר ב-Intern-S2-397B כאשר המשימה היא מדעית: מאמרים עתירי איורים, דיאגרמות מולקולריות, ספרות סרוקה, אותות של סדרות זמן, ונתונים שחייבים להישאר בתוך ההיקף שלך או משקלים שברצונך לכוונן על תוצאות קנייניות. Apache-2.0 מאפשר זאת, אף API שכור לא עושה זאת, והשורות המדעיות שבכרטיס הן מין שונה ממה שג'נרליסט כוונן עבורו אי פעם. תקצב את החומרה, הרץ הערכה משלך, והתייחס לכל מספר שפורסם עליו כאל טענה עד שמישהו מחוץ ל-InternLM ישחזר אחד.

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.