
Intern-S2 מול Gemini 3.1 Pro: ההתמודדות הרב-מודלית ש-InternLM באמת מדדה
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
רוב ההתמודדויות בסדרה הזו דורשות לחבר יחד טענות של שני ספקים. זו לא. Intern-S2, המודל המולטימודלי Apache-2.0 בעל 397 מיליארד פרמטרים ש-InternLM שחררה היום, ו-Gemini 3.1 Pro, מודל ההסקה המוביל של Google, מופיעים שניהם כעמודות מדודות באותה טבלת בנצ'מרק — מה שהופך את זה לראש בראש ההוגן ביותר בסט, ולא במקרה, לזה שבו למודל הפתוח יש הכי הרבה לתת עליו את הדין. Gemini 3.1 Pro קורא טקסט, תמונות, אודיו ווידאו, מחזיק הקשר של 1M טוקנים, ונקרע לגזרים על ידי מעבדות עצמאיות ותעבורת ייצור מאז שנכנס לתצוגה מקדימה ב-19 בפברואר 2026. Intern-S2 קורא טקסט, תמונות וסדרות זמן, הועלה ל-Hugging Face הבוקר, ואין לו ציון של צד שלישי מכל סוג שהוא. בשורות שבהן שניהם נמדדו, המודל של Google מנצח ביותר מהן מאשר לא.
שניהם קוראים תמונות. שם נגמר הדמיון.
המילה "מולטימודאלי" גורמת למודלים האלה להישמע כמו שווים. הם לא שווים, וההבדל הוא במה שכל אחד מהם נבנה להסתכל עליו.
מסלול הראייה של Intern-S2 אומן לצרוך עמודים גולמיים של ספרות מדעית — איורים, משוואות, דיאגרמות מבניות, פריסה — כייצוג משותף יחיד במקום לחלץ טקסט תחילה. המדדים המולטימודליים שלו הם מדעיים: VQA של מיקרוסקופיה ביולוגית, חישה מרחוק, מענה על שאלות בתרשימים מדעיים. הוא גם מקבל נתוני סדרות עתיות ויכול להפיק תחזיות, שזה סוג קלט שכמעט אף דגם דגל כללי לא מטפל בו כלל.
הרב-מודאליות של Gemini 3.1 Pro היא כלל-מטרית ורחבה יותר בסוגה: טקסט, תמונה, אודיו וווידאו, במודל אחד, המכוונת לכל טווח משימות הייצור שבהן מפנים מודל לקובץ ושואלים שאלה. הקלטת פגישה, צילום מסך של ממשק משתמש, תרשים ב-PDF, קטע וידאו — הכול קביל, וכולם עם שישה חודשים של הערכה ציבורית מאחוריהם.
אם הקלט שלך הוא איור מדעי, Intern-S2 נבנה במיוחד לשם כך, ויש לו את הנתונים מהספק כדי להציג את טענתו. אם הקלט שלך הוא כל דבר אחר, Gemini 3.1 Pro תומך באודיו ובווידאו, ו-Intern-S2 לא תומך באף אחד מהם. זה פותר חלק ניכר מהשאלות "במה עליי להשתמש" לפני שמחיר או מבחני ביצועים נכנסים לתמונה, וכל מי שאומר לך שהשניים ניתנים להחלפה לא קרא את רשימת הקלט.
מה שהטבלה המשותפת מציגה, קראו ביושר
מכיוון ש-InternLM בחנה את שניהם, זהו אחד המקומות הבודדים שבהם השוואה ישירה היא לגיטימית ולא מלוקטת. ההסתייגות לא משתנה וכדאי לציין אותה פעם אחת: כל נתון של Intern-S2 הוא דיווח של הספק, שהורץ על ידי InternLM בהרנס שלה באמצעות OpenCompass, VLMEvalKit ו-AgentCompass, בלי שחזור עצמאי. הנתונים של Gemini בטבלה ההיא גם הם מההרצה של InternLM של ההשוואה, אם כי ל-Gemini יש רקורד עצמאי נרחב מחוצה לה.
• ידע מולטימודלי — Gemini 3.1 Pro 83.99 ב-MMMU Pro לעומת Intern-S2 81.68.
• שאלות ותשובות על תרשימים מדעיים — Gemini 3.1 Pro 71.18 ב-ChartQAPro לעומת Intern-S2 71.12. תיקו מוחלט עד שתי ספרות עשרוניות.
• חישה מרחוק — Gemini 3.1 Pro 54.27 ב-XLRS-Bench לעומת Intern-S2 51.38.
• מיקרוסקופיה VQA — Gemini 3.1 Pro 71.02 על MicroVQA לעומת Intern-S2 69.67.
• משימות מולטימודליות מדעיות — Intern-S2 60.74 ב-SFE לעומת Gemini 3.1 Pro 59.57. הניצחון המולטימודלי היחיד של Intern-S2.
• ידע כללי — Gemini 3.1 Pro 91.00 ב-MMLU Pro לעומת Intern-S2 89.77.
• מתמטיקה ברמת תיכון — Gemini 3.1 Pro 94.70 ב-HMMT-2026 לעומת Intern-S2 93.56.
• הסקה בספרות מדעית — Intern-S2 55.71 ב-Biology-Instructions לעומת Gemini 3.1 Pro 13.87, ו-53.95 לעומת 38.84 ב-Mol-Instructions.
• בעיות אולימפיאדת מדעים — Intern-S2 87.00 ב-FrontierScience-Olympiad לעומת Gemini 3.1 Pro 79.00.
• שליטה בטרמינל — Gemini 3.1 Pro 73.80 ב-TerminalBench 2.1 לעומת Intern-S2 64.04.
הקריאה הכנה: Gemini 3.1 Pro מנצח בשורות המולטימודאליות הרחבות בפערים צרים, Intern-S2 מנצח בשורות הספרות המדעית העמוקה בפערים עצומים, ואף אחת מהתוצאות אינה מפתיעה בהינתן מה שכל אחד מהם אומן עליו. המצומצמות של ההפסדים המולטימודאליים היא, אפשר לטעון, הממצא המעניין יותר — צ'קפוינט פתוח מאותו יום שנוחת בטווח של שתי נקודות ממודל דגל סגור בן חצי שנה ב-MMMU Pro וב-ChartQAPro היא תוצאה חזקה יותר עבור InternLM מכל אחד מהמספרים המדעיים המרשימים שלו.
הקשר, פלט ושאלת התצוגה המקדימה
סיפור הקלט הארוך מתפצל בצורה נקייה. Gemini 3.1 Pro מחזיק חלון הקשר של 1M טוקנים עם תקרת פלט של 64K — מספיק למערך מסמכים ארוך ולתשובה מהותית. Intern-S2 מוערך בעד 256K טוקנים להסקת טקסט ו-64K לרב-מודאלי, ואינו מפרסם תקרת פלט; התייחס לחלון השמיש שלו כקטן מזה של Gemini עד שמישהו ימדוד אותו באופן עצמאי.
יש הסתייגות תפעולית אחת בצד של Google שמקומה בכל השוואה הוגנת. Gemini 3.1 Pro הוא עדיין מודל בתצוגה מקדימה, לא מהדורת GA. מודלים בתצוגה מקדימה נושאים ציפיות אמינות נמוכות יותר, ולוח שיעור שגיאות של 7 ימים בעמוד של מודל הוא תזכורת מתמדת לעקוף חוסר יציבות במקום לבנות נתיב קריטי על גביו. Intern-S2 הוא מהדורה מלאה של Apache-2.0 עם משקלים שאפשר לקבע — מה שבאופן מנוגד לאינטואיציה הופך את המודל הפתוח החדש לגמרי ליציב יותר תפעולית מבין השניים במובן החשוב ביותר: אף אחד לא יכול לשנות אותו מתחת לרגליים שלך.
• הקשר — Intern-S2 עם 256K טקסט / 64K מולטימודאלי, הוערך לעומת Gemini 3.1 Pro עם 1M טוקנים.
• קלטים — Intern-S2 טקסט, תמונה, סדרות זמן לעומת Gemini 3.1 Pro טקסט, תמונה, אודיו, וידאו.
• משקלים — Intern-S2 Apache-2.0, ניתן להורדה לעומת Gemini 3.1 Pro סגור.
• בגרות — Intern-S2 בן שעות ספורות, אין ציון בלתי־תלוי מול Gemini 3.1 Pro preview מאז פברואר 2026, נבדק רבות ובאופן בלתי־תלוי.
• מחיר — ל-Intern-S2 אין מחירון פומבי; אירוח עצמי או Intern API הרשמי לעומת Gemini 3.1 Pro: $2.00 לקלט / $12.00 לפלט למיליון, ועולים ל-$4.00/$18.00 מעל 200K טוקני קלט.

מחיר ואיפה כל אחד גר
ג'מיני 3.1 Pro מחייב 2.00$ למיליון טוקני קלט ו-12.00$ למיליון טוקני פלט במסלול הסטנדרטי, ועולה ל-4.00$/18.00$ ברגע שבקשה חוצה 200 אלף טוקני קלט — תוספת מחיר להקשר ארוך שנושכת בדיוק כשמשתמשים בחלון של מיליון הטוקנים שמצדיק את הבחירה בו. אפשר לנתב אותו ב-OrcaRouter באותו מחיר מחירון, בהעברה ישירה עם 0% תוספת, על מפתח שנושא גם יותר מ-200 מודלים אחרים; ההעברה הישירה חשובה כאן משום ששינוי מחיר של גוגל נוחת בצד שלנו באותו יום ולא אחרי מחזור תמחור מחדש. ה-DSL לניתוב הוא החלק השימושי בהתאמה המסוימת הזו: אפשר לשלוח עבודות תמונה ווידאו לג'מיני 3.1 Pro וקבוצות של מסמכים מדעיים ל-Intern-S2 המתארח בעצמך, ולהחזיק את שניהם מאחורי נקודת קצה אחת בלי חוזה נוסף או שינוי בקוד.
ל-Intern-S2 אין מחיר API מפורסם. אירוח עצמי של משקולות Apache-2.0 הוא המסלול שרוב הצוותים יבחרו בו בפועל, ועם 403B פרמטרים זו התחייבות חומרתית אמיתית. ה-API הרשמי של Intern קיים עבור צוותים שמעדיפים לא להריץ GPUs, אבל בלי מחירון ציבורי, השוואת העלויות ל-$2/$12 של Gemini היא לא משהו שאפשר לעשות על הנייר — צריך לבקש מכסה ולעשות את החשבון בעצמך.

השיחה
יש לבחור ב-Gemini 3.1 Pro אם אתם זקוקים למודל מולטימודלי כללי שקולט אודיו וווידאו, מכיל מיליון טוקנים, עבר חודשים של אימות בלתי־תלוי, וניתן לשכור אותו לפי טוקן כבר היום. זהו המודל עם הראיות הטובות יותר והיכולות הרחבות יותר, ותג ה-preview הוא הסתייגות של אמינות ולא של יכולת.
בחר ב-Intern-S2 אם הקלט הרב-מודלי שלך הוא מדעי והנתונים שלך אינם יכולים לצאת מהתשתית שלך. זהו היחיד מבין השניים שקורא דפי ספרות גולמיים באופן ילידי, מבצע תחזיות מאותות של סדרות זמן, וניתן לכוונן אותו על נתונים ניסיוניים קנייניים תחת רישיון מתירני. קבל את העובדה שאתה האדם הראשון שמריץ אותו, ושטבלת הבנצ'מרק שמצדדת בו נכתבה על ידי האנשים שיצרו אותו.

אף אחד מהמודלים לא מנצח כאן באופן מוחלט, והטבלה מוכיחה זאת טוב יותר מכל הכרעה. האחד הוא ג'נרליסט שבמקרה טוב במדע; האחר הוא מכשיר מדעי שבמקרה תחרותי בעבודה מולטימודלית כללית — ובשחרור פתוח באותו יום, "תחרותי" הוא התוצאה המפתיעה יותר.
כדי להכיל את שני החצאים של ההשוואה הזו בלי חוזה נוסף: מפתח API יחיד שמכסה יותר מ-200 מודלים מעמיד את דגם הדגל המולטימודאלי הסגור וכל חלופה מאחורי נקודת קצה אחת, כך שתוכל לנתב עבודות של תמונות וווידאו בדרך אחת ואצוות מסמכים בדרך האחרת.
