Intern-S2-Mobius-1
Engineering & Research

Intern-S2-Mobius: המודל בעל 35B שמפריד בין ידע לחשיבה

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

צוות InternLM של Shanghai AI Laboratory פרסם בשקט את Intern-S2-Mobius, מודל יסוד בעל משקלים פתוחים בגודל 35B שעושה משהו שכמעט אף מודל ששוחרר אחר לא עושה: הוא מפסיק לאחסן ידע בתוך השכבות שלו. במקום סידור ה-Transformer הסטנדרטי — שבו כל שכבה נושאת בלוק feed-forward משלה המלא בעובדות משוננות — Mobius מוציא את כל הידע הזה אל זיכרון גלובלי משותף יחיד ומאפשר למספר קטן של Reasoners לשאול אותו שוב ושוב. הרווח המוצהר אינו ציון benchmark גבוה יותר. הוא מהירות: אותן תשובות בכשליש עד חמישית מטוקני החשיבה, ועד פי 4.6 בתפוקת הבקשות. מדריך זה מסביר מהו Mobius בפועל, מה קובץ התצורה שלו חושף שדף המודל אינו חושף, מה מראים המדדים שפורסמו שורה אחר שורה — כולל שתי השורות שבהן הוא מפסיד — היכן הטענה "מהיר פי 4" מתקיימת והיכן היא מתפוגגת, ומי צריך באמת להתעניין בכך.

הערת דיוק: כל מספר להלן מגיע מכרטיס המודל של InternLM עצמו, מנתוני הביצועים והיעילות שפורסמו, ממדריך הפריסה שלו ומקבצי התצורה של המודל ב-Hugging Face. אין הערכה בלתי תלויה של צד שלישי ל-Intern-S2-Mobius נכון לכתיבת שורות אלה — הוא אינו מופיע באף לוח תוצאות עצמאי, אינו פרוס אצל אף ספק inference, ומונה ההורדות שלו עדיין עומד על אפס. יש להתייחס לכל הנתונים ההשוואתיים כאל נתונים המדווחים על ידי הספק, עד שמישהו ישחזר אותם. המפרטים והקוד של מודל חדש כל כך משתנים במהירות; ודא הכל לפני שאתה בונה.

בקצרה. Intern-S2-Mobius הוא מודל בסיס מולטימודלי עם 35B פרמטרים, ברישיון Apache 2.0, שאומן מראש ברציפות מ-Qwen3.5-35B ולאחר מכן אומן לאחר עם SFT ולמידת חיזוק. החידוש הוא ארכיטקטוני: עיצוב Mobius-v0 מחליף אחסון ידע הזנה-קדמית הקשור לשכבה ב-Memory משותף גלובלי אחד של 2,560 מומחים, שאליהם פונים ארבעה בלוקי Reasoner מוערמים שיכולים לגשת לידע מחוץ לעומק שלהם (Backward Residual Connection) ולחדד מצבים נסתרים באמצעות איטרציה סמויה חוזרת לפני הפענוח (Dynamic Latent Reasoning). בהערכה של InternLM עצמו, הוא מנצח את קו הבסיס Qwen3.5-35B שממנו נבנה בשבעה מתוך תשעה מדדים כלליים (ממוצע 67.88 לעומת 65.05) ומנפץ אותו במשימות מדעיות (52.14 לעומת 18.20), תוך יצירת עקבות נימוק קצרים יותר בערך פי 1.5 בממוצע — פי 4.6 קצרים יותר ב-MMLU Pro, פי 5.0 קצרים יותר ב-GPQA Diamond. דחיסת העקבות הזו היא מקור רווח התפוקה: פי 2.9 ב-batch 16, שעולה לפי 4.6 ב-batch 256. החסרונות אמיתיים: הוא מפסיד בשני מדדי הנימוק הקשים ביותר (HLE ו-UGD hard), רווח התפוקה נעלם ברובו במתמטיקה תחרותית, ואף אחד מחוץ למעבדה לא אימת את כל זה.

נקודות עיקריות

שחרור מוכוון-ארכיטקטורה: Mobius-v0 מפריד בין וקטורי ידע לבין אופרטורי הנמקה — זיכרון משותף אחד של 2,560 מומחים, שמשרת ארבעה בלוקי Reasoner, במקום 40 שכבות שכל אחת מהן אוגרת לעצמה ידע FFN.

• היעילות, לא האינטליגנציה, היא נקודת המכירה: אורך הפלט הממוצע יורד בערך פי 1.5, ותפוקת הבקשות עולה פי 2.9 באצווה של 16 עד פי 4.6 באצווה של 256 בהשוואה לקו הבסיס של Transformer.

• הוא באמת מביס את מודל הבסיס שלו: ממוצע 67.88 לעומת 65.05 במשימות כלליות, זוכה ב-MMLU Pro (89.05 לעומת 85.31), AIME 2026 (95.31 לעומת 92.08) ו-HMMT 2026 (85.51 לעומת 78.50).

• אבל הוא מפסיד במקום שבו החשיבה המעמיקה היא קריטית: HLE 19.11 לעומת 22.40 ו-UGD hard 73.02 לעומת 78.02 — שתי ההערכות הקשות ביותר בסט, שתיהן זכו בטרנספורמר הפשוט.

• הזינוק במדע הוא התוצאה הבודדת הגדולה ביותר: Biology-Instructions 51.40 לעומת 3.77, Mol-Instructions 45.73 לעומת 21.70, MolecularIQ 59.29 לעומת 29.13.

• פתוח אך לא זמין: משקולות Apache 2.0 ב-Hugging Face, אין ספק אינפרנס המארח אותן, ~73 GB של משקולות bfloat16 — אירוח עצמי הוא כיום הדרך היחידה להריץ את זה.

מה זה בעצם Intern-S2-Mobius

Intern-S2-Mobius הוא מודל בסיס (foundation model) בעל 35B פרמטרים, שפורסם על ידי internlm, ארגון ה-Hugging Face שעומד מאחורי סדרת Intern של מעבדת הבינה המלאכותית של שנחאי. המשקלים (weights) עלו ל-Hugging Face ב-29 ביולי 2026, ומאגר ה-GitHub הנלווה — קובץ ה-README, מדריך הפריסה ודוח טכני מלא בפורמט PDF — פורסם לציבור ב-5 באוגוסט 2026. המודל משוחרר תחת רישיון Apache 2.0, שהוא בערך הרישיון הגמיש ביותר שניתן לקבל עבור משקלים פתוחים: שימוש מסחרי, שינוי והפצה מחודשת — כולם מותרים.

זה לא כיוונון עדין. זה אימון מקדים רציף עם ניתוח ארכיטקטורה. InternLM לקח את Qwen3.5-35B — המודל של Alibaba בעל 35B פרמטרים, עם משקלים פתוחים וארכיטקטורת תערובת מומחים, ששוחרר ב-4 במרץ 2026 — ארגן מחדש את הדרך שבה המודל מאחסן וניגש לידע, המשיך באימון מקדים של התוצאה, ואז החיל כיוונון מונחה ולמידת חיזוק על גבי זה. השושלת הזאת חשובה לפירוש מדדי הביצועים: כל השוואה ש-InternLM מפרסם היא Mobius מול המודל המדויק שממנו הוא צמח, שהיא ההסרה הנקייה ביותר האפשרית של השינוי הארכיטקטוני, וגם, באופן נוח, ההשוואה שסביר להניח שתחמיא לו.

המודל הוא רב-מודאלי. Hugging Face מסווג אותו כ"תמונה-טקסט-לטקסט", והתצורה מאשרת מקודד ראייה מלא וטיפול בטוקני וידאו. כמו כן, אם לשפוט לפי מה שמגיע יחד עם המשקלים, הוא מכוון ישירות למדע — עוד על כך בהמשך.

ארכיטקטורת Mobius, באנגלית פשוטה

טרנספורמר קונבנציונלי משלב שתי משימות בכל שכבה. מנגנון הקשב מעביר מידע בין טוקנים; רשת ההזנה קדימה (או, במודל תערובת מומחים, מאגר של רשתות FFN מומחות) אוגרת ידע. מכיוון שה-FFN יושבת בתוך השכבה, הידע שהיא מחזיקה נגיש רק בעומק זה. עובדה שנלמדה בשכבה 30 אינה זמינה לחשיבה המתרחשת בשכבה 5. המידע זורם קדימה, שכבה אחר שכבה, וזהו הנתיב היחיד.

מוביוס שובר את הקשר הזה. InternLM מתאר שלוש השלכות.

הפרדה בין ידע להנמקה. אחסון ה-FFN הצמוד לשכבה מוחלף במאגר גלובלי משותף הנקרא Memory. במקום 40 שכבות, שכל אחת מהן מחזיקה נתח מהידע של המודל, יש מאגר אחד שכל שלב הנמקה יכול לפנות אליו. הטיעון של InternLM הוא שזה משפר את דחיסת הידע — אין צורך ללמוד את אותן עובדות שוב ושוב בעומקים מרובים — ומעניק לכל Reasoner מרחב ידע רחב בהרבה ממה שה-FFN של שכבה אחת יכול היה להציע.

חיבור שיורי לאחור. מכיוון שהזיכרון משותף, שלבי חשיבה רדודים ועמוקים מגיעים שניהם לאותו מאגר. הגישה לידע אינה זורמת עוד אך ורק קדימה. שלב רדוד יכול לשלוף משהו שבמחסנית סטנדרטית היה זמין רק אחרי שלושים שכבות. הטענה של InternLM היא שזה מאפשר למודל להרכיב ידע על פני עומקים בצורה גמישה יותר, וחשוב מכך, לסנתז מידע שימושי בפחות צעדי חשיבה. הפסוקית האחרונה הזו היא כל התזה של ההשקה.

חשיבה סמויה דינמית.במקום להחצין כל שלב חשיבה כטוקנים גלויים של שרשרת מחשבה, מוביוס משכלל את המצבים החבויים הרציפים שלו באמצעות איטרציה סמויה חוזרת לפני שהוא מפענח דבר. חלק מה"חשיבה" מתרחש במרחב הייצוג הפנימי של המודל, במקום בטקסט המופק, וכמות החישוב הפנימי הזה מוקצית באופן דינמי לכל טוקן. ההשפעה המעשית היא שהמודל צריך לכתוב פחות מילים כדי להגיע לאותה מסקנה — ומכיוון שיצירת הטקסט היא אוטורגרסיבית וסדרתית, כתיבת פחות מילים היא הדרך הישירה ביותר להפוך מודל חשיבה למהיר יותר.

בסך הכול, ההצעה היא מודל חשיבה שחושב יותר ומקליד פחות.

Intern-S2-Mobius-2

מה שקובץ התצורה חושף

כרטיס המודל מתאר את הארכיטקטורה בפרוזה. הcode>config.json/code> הופך אותה למוחשית, והוא מכיל כמה מספרים שכדאי לדעת.

ארבעה רציונרים על פני 40 שכבות. תצורת הטקסט מצהירה על 40 שכבות נסתרות אך רק ארבעה בלוקים. 40 השכבות מאורגנות בארבעה שלבי רציונר שמבצעים איטרציות מול הזיכרון המשותף, במקום ארבעים יחידות עצמאיות של ידע וקשב.

2,560 מומחים. זהו הזיכרון המשותף שהפך למוחשי. Mobius מכיל 2,560 מומחים, כש-8 מתוכם מופעלים לכל טוקן, וגודל ביניים זעיר של 512 לכל מומחה, בתוספת מומחה משותף אחד. לשם השוואה, האחות Intern-S2-Preview משתמשת ב-256 מומחים. מאגר גדול פי עשרה של מומחים קטנים בהרבה הוא בדיוק איך "מאגר ידע גלובלי אחד במקום FFNs לכל שכבה" נראה כשכותבים אותו כקונפיגורציה.

35B על הקופסה, ~36B בדיסק, ~3B פעילים. כרטיס המודל אומר 35B; קורא ה-safetensors של Hugging Face מדווח על 36B פרמטרים; אינדקס המשקולות מסתכם ב-72.96 GB ב-bfloat16, מה שמגיע בערך ל-36.5B. מדריך הפריסה הוא המדויק ביותר: הוא מכנה את השחרור 30B-A3B מודל — בערך 3B פרמטרים פעילים לכל טוקן. כמו בכל MoE דליל, אתה משלם על סט המשקולות המלא בזיכרון ומקבל חישוב של מודל קטן לכל טוקן.

תשומת לב היברידית, 3:1. רשימת השכבות מתחלפת בין שלוש שכבות של תשומת לב לינארית לשכבה אחת של תשומת לב מלאה, לכל אורך הדרך — עשר שכבות של תשומת לב מלאה מתוך 40. תשומת לב לינארית מונעת מזיכרון ההקשר הארוך ומהחישוב להתפוצץ; שכבות תשומת הלב המלאות המחזוריות משמרות את השליפה המדויקת שתשומת לב לינארית טהורה מוותרת עליה. השכבות הלינאריות משתמשות בליבת קונבולוציה ברוחב 4 ובמצב SSM ב-float32, הנוסחה הסטנדרטית כיום בסגנון gated-delta.

הקשר של 256K. הטמעות המיקום המקסימליות הן 262,144. שימו לב לפער בין מה שהארכיטקטורה תומכת בו לבין האופן שבו היא הוערכה: InternLM הריץ את מדדי הטקסט שלו ב-128K, ועל MMLU Pro, SimpleQA ו-HLE ב-64K. תקרת 256K אינה זהה ל-256K של איכות מאומתת.

ראש חיזוי רב-טוקנים מובנה. יש מודול MTP חד-שכבתי עם 256 מומחים משלו. זה לא קישוט — מדריך הפריסה ממליץ להריץ עם פענוח ספקולטיבי של MTP וארבעה טוקני טיוטה, כך שחלק מסיפור המהירות בעולם האמיתי הוא פענוח ספקולטיבי, לא הארכיטקטורה בלבד.

מגדל ראייה אמיתי.מקודד ראייה נסתר בעל 27 שכבות ו-1152 ממדים, עם גודל פאץ' 16, מיזוג מרחבי של 2×2, ו-patching זמני עבור וידאו, המקרין לתוך זרם הטקסט בעל 2048 ממדים עם RoPE מולטימודאלי משולב. תמונות ווידאו נכנסים, טקסט יוצא.

• פרטים נוספים לסקרנים: 16 ראשי קשב עם ממד ראש של 256, 2 ראשי מפתח-ערך (קשב מקובץ-שאילתות אגרסיבי), פלטי קשב מגודרים, מקדם רוטציוני חלקי של 0.25, תטא מסוג RoPE של 10 מיליון, ואוצר מילים של 251,392 אסימונים.

המדדים, שורה אחר שורה

InternLM הוערך באמצעות OpenCompass ופרסם השוואה יחידה: Intern-S2-Mobius-35B נגד Qwen3.5-35B, המודל שממנו הוא המשיך את האימון המקדים. תשעה מדדי benchmark כלליים, שלושה מדעיים.

במשימות כלליות, Mobius מנצח בשבע מתוך תשע. MMLU Pro — ידע רחב רב-תחומי עם מסיחים קשים יותר מ-MMLU המקורי — מגיע ל-89.05 לעומת 85.31, רווח של 3.7 נקודות ותוצאת הידע הברורה ביותר בקבוצה. GPQA Diamond, שאלות מדע ברמת תואר שני שנכתבו כדי להיות חסינות-Google, הוא למעשה תיקו עם 80.81 לעומת 80.24. IMO Bench, מתמטיקה ברמת אולימפיאדה, מגיע ל-81.25 לעומת 77.50. AIME 2026, הבחינה האמריקאית למתמטיקה בהזמנה, מגיע ל-95.31 לעומת 92.08. HMMT 2026, טורניר המתמטיקה של הרווארד ו-MIT, הוא הפער הגדול ביותר במתמטיקה עם 85.51 לעומת 78.50. AMO מגיע ל-58.00 לעומת 50.00. ו-SimpleQA — בדיקת שליפת עובדות קצרה, המדד שמודד בצורה הישירה ביותר האם מודל באמת יודע דברים — קופץ מ-21.39 ל-28.90, שיפור יחסי של 35% שהוא הראיה הטובה ביותר לטיעון של InternLM ש'זיכרון משותף דוחס ידע טוב יותר'.

אז שתי ההפסדים, והם השורות המעניינות. UGD hard הולך בכיוון ההפוך: 73.02 למוביוס לעומת 78.02 לקו הבסיס, פער של חמש נקודות. וHLE — Humanity's Last Exam, ההערכה הכללית הקשה ביותר בשימוש נרחב, שבה מודלים פורצי דרך עדיין מקבלים ציונים בשנות העשרה ובשנות העשרים — עומד על 19.11 לעומת 22.40. הטרנספורמר הפשוט מנצח ב-3.3 נקודות במדד שתוכנן במיוחד לדרוש את מירב החשיבה.

הדפוס הזה אינו רעש, והוא אינו נסתר: InternLM פרסמה אותו. הקריאה הסבירה ביותר היא שחשיבה סמויה היא דחיסה, ודחיסה מאבדת מידע בזנב. הפנמת העיון לתוך מצבים חבויים רציפים עובדת יפה מאוד כשהעיון מבוסס-שליפה או עוקב אחר צורה מוכרת — וזה מתאר את MMLU Pro, SimpleQA ורוב המתמטיקה התחרותית. בבעיות שבאמת דורשות שרשראות חשיבה ארוכות, חקריות ומתקנות-שגיאות, העקיבה המפורשת אסימון-אחר-אסימון עדיין נראית שווה את מחירה. הממוצע הכולל — 67.88 מול 65.05 — הוא ניצחון אמיתי, אבל הוא ממוצע שמסתיר עסקת חליפין, לא שיפור אחיד.

התוצאות המדעיות הן בקנה מידה אחר של הבדל. Biology-Instructions עולה מ-3.77 ל-51.40. Mol-Instructions, המכסה הבנה ויצירה מולקולרית, עולה מ-21.70 ל-45.73. MolecularIQ עולה מ-29.13 ל-59.29. הממוצע הוא 52.14 לעומת 18.20. מספרים כמו 3.77 שעולים ל-51.40 אינם ניצחונות ארכיטקטורה; הם סימן ההיכר של אימון ממוקד בתחום על משימות שהמודל הבסיסי פשוט מעולם לא אומן לבצע. הציון של Qwen3.5-35B מתחת ל-4% ב-Biology-Instructions פירושו שהוא לא מבין את פורמט המשימה, לא שהוא חלש בביולוגיה. קרא את שלוש השורות הללו כ-"InternLM הוסיף התמחות מדעית", שזה באמת בעל ערך וזה כל העניין של קו Intern-S — רק אל תייחס את זה לארכיטקטורת Mobius.

איפה "מהיר פי 4" הוא אמיתי, ואיפה לא

טענת היעילות היא הסיבה לכך שהמודל הזה קיים, ולכן היא ראויה לקריאה זהירה. הכותרת הראשית של InternLM היא "האצה של כמעט פי 4 במסקנות מקצה לקצה". נתון התפוקה שפורסם אינפורמטיבי יותר מהכותרת הראשית, וגם כן הוגן יותר.

נמדד כתפוקת בקשות ביחס לגודל אצווה, בממוצע על פני בנצ'מרקים, Mobius מביס את קו הבסיס של Transformer ב-2.9x באצווה 16 ו-4.6x באצווה 256. הפער מתרחב עם גודל האצווה, וזה מה שהיית מצפה לו כאשר היתרון נובע מייצור של פחות טוקנים לכל בקשה: ככל שאורזים יותר בקשות יחד, כך שלבי הפענוח שנחסכים מצטברים יותר. הכותרת "כמעט פי 4" היא נקודת אמצע של טווח, לא קבוע.

פרקו את זה לכל מדד והתמונה מתחדדת. במדד MMLU Pro ו-GPQA Diamond, Mobius מהיר באופן דרמטי בכל גודל אצווה — עקומות התפוקה נפרדות מיד וממשיכות להתרחק. במדד IMO Bench, הוא מוביל בעקביות אך במתינות. במדד AIME 2026 ו-HMMT 2026, ה-Transformer הבסיסי הוא למעשה מהיר יותר בגדלי אצווה ביניים, כש-Mobius משיג יתרון רק באצווה 256. במתמטיקה התחרותית הקשה ביותר, יתרון התפוקה הוא אפסי או גרוע יותר על פני חלק גדול מטווח ההפעלה השימושי.

למה? כי התפוקה עוקבת כמעט באופן מושלם אחר דחיסת הטרייס. אורך הפלט הממוצע בין כל ה-benchmarks יורד בערך פי 1.5, מכ-20,400 טוקנים לכ-13,200. אבל הממוצע הזה מסתיר טווח עצום: קצר פי 4.6 ב-MMLU Pro (כ-1,100 טוקנים לעומת 5,150) ו-קצר פי 5.0 ב-GPQA Diamond (כ-2,600 לעומת 12,900), לעומת רק פי 1.4 ב-IMO Bench, פי 1.5 ב-AIME 2026, ו-פי 1.2 ב-HMMT 2026. כאשר המודל יכול לדחוס את החשיבה שלו, הוא עף. כאשר הבעיה דורשת 24,000 טוקנים של גזירה בכל מקרה, הוא לא יכול, ותקורות הארכיטקטורה מופיעות במקום.

התרגום המעשי: אם עומס העבודה שלך דומה לאחזור ידע, שאלות רב-ברירתיות, שאלות טכניות מסוג Q&A, או סיווג — ההאצה גדולה ומידית. אם עומס העבודה שלך הוא גזירה מתמטית או מדעית קשה, צפה לפרפורמנס דומה בערך ותהיה מופתע לטובה. מי שמצטט "מהיר פי 4" כתכונה גורפת של המודל מצטט ממוצע של שתי התנהגויות שונות מאוד.

Intern-S2-Mobius-3

מחסנית המדע שמסתתרת ברשימת הקבצים

אחד הדברים החושפניים ביותר לגבי המהדורה הזאת אינו בכרטיס המודל כלל — הוא ברשימת הקבצים של המאגר. לצד קבצי הטוקנייזר הרגילים, Intern-S2-Mobius כולל שלושה טוקנייזרים תחומיים נוספים: code>tokenizer_PROT.model/code> לרצפי חלבון, code>tokenizer_SMILES.model/code> למבנים מולקולריים בסימון SMILES, ו- code>tokenizer_XNA.model/code> לרצפי חומצות גרעין. יש גם מערך NumPy תועה של נתונים סייסמיים שמונח במאגר.

טוקנייזרים ייעודיים לחלבונים, מולקולות ו-DNA/RNA הם לא משהו שמוסיפים כלאחר יד. המשמעות היא שהמודל אומן לקרוא את סוגי הרצפים הללו כקלטים מדרגה ראשונה, ולא כטקסט רגיל שבמקרה מכיל אותיות. זה מה שהופך ציון 3.77 ל-51.40 במדד Biology-Instructions, וזה מציב את Mobius באותה משפחה כמו אחיו Intern-S2-Preview, שהוסיף מודאליות של סדרות זמן וראייה, ולדברי InternLM, היה מודל הקוד הפתוח הראשון עם יכולת יצירת מבנה גבישי של חומרים.

אם אתה מפתח לשימוש כללי, זה טריוויה. אם אתה עובד בביולוגיה חישובית, כימיה אינפורמטית או מדעי החומרים, זו אולי השורה החשובה ביותר במאמר הזה: זהו מודל קטן, ברישיון Apache-2.0, בר-אירוח עצמי, שמדבר SMILES ורצף חלבון בשפת אם.

מיקומו במשפחת Intern

קו Intern-S הוא הסדרה המולטי-מודאלית המדעית של המעבדה לבינה מלאכותית של שנגחאי. Intern-S1 קבע את הפורמט. Intern-S1-Pro הרחיב אותו לדרגת טריליון הפרמטרים. Intern-S2-Preview, ששוחרר זמן קצר לפני Mobius, הוא מהלך היעילות: מודל עם 36B סה"כ ו-3B פעילים, 256 מומחים והקשר של 262K, אשר InternLM טוען כי משתווה ל-S1-Pro בקנה מידה טריליוני במשימות מדעיות מקצועיות מרכזיות — הפחתה של פי 30 בערך בפרמטרים עבור יכולת מדעית דומה.

Intern-S2-Mobius הוא דבר שלישי: מהדורה ארכיטקטונית הנושאת את השם Intern-S2. ה-"v0" ב-Mobius-v0 עושה עבודה אמיתית בתווית הזו — זוהי האיטרציה הציבורית הראשונה של עיצוב, לא קו מוצרים בוגר. היא מתחברת ל- ArchSpace, הפלטפורמה הפתוחה של InternLM לאימות חידושי ארכיטקטורת LLM, שמטרתה המוצהרת היא "הפיכת חקר ארכיטקטורת LLM לידע לשימוש חוזר עבור הקהילה", עם ביקורת עמיתים ותוצאות שפורסמו כולל שליליות. Mobius הוא איך שהתוכנית הזו נראית כשהצעה עוברת מבדיקה בקנה מידה 1B למודל 35B שאפשר באמת להוריד. דוח טכני מלא מגיע עם מאגר GitHub לכל מי שרוצה את הנגזרות.

כשקוראים את זה כך, שני ההפסדים במדדים הם תכונה של המהדורה, לא מבוכה. זו מעבדה שמפרסמת ניסוי ארכיטקטוני בכנות, כולל המקומות שבהם הוא נסוג.

איך להריץ את זה

Intern-S2-Mobius נתמך על ידי שלוש ערימות הסקה, ומדריך הפריסה מספק קריאות תקינות עבור כל אחת.

LMDeploy הוא הנתיב המומלץ והיחיד שהמדריך מציג על GPU יחיד: הגישו עם הקצה האחורי PyTorch, code>--trust-remote-code/code>, מקביליות טנזור של 1, ופענוח ספקולטיבי MTP מופעל באמצעות האלגוריתם הספקולטיבי qwen3_5_mtp עם ארבעה טוקני טיוטה. vLLM מוצג עם מקביליות טנזור של 2, מנתח ההיסקים qwen3, מנתח קריאות הכלים qwen3_coder, בחירת כלים אוטומטית, ופענוח ספקולטיבי MTP עם ארבעה טוקנים ספקולטיביים. Transformers עובד להסקה בסיסית באמצעות code>AutoModelForImageTextToText/code> עם code>trust_remote_code=True/code> ו-bfloat16 — שים לב שהמודל כולל קוד מידול מותאם אישית, ולכן ביצוע קוד מרחוק הוא חובה, והתצורה מיועדת ל-Transformers 5.2.

הפרמטרים המומלצים של InternLM לדגימה הם טמפרטורה 0.8, top-p 0.95, top-k 50 ו-min-p 0.0 — חמים יותר מההגדרות הקרובות לחמדניות שרוב מודלי החשיבה מעדיפים, וכדאי לכבד זאת במקום לעקוף אותן מתוך הרגל.

מבחינת חומרה: כ-73 GB של משקלי bfloat16 בתוספת מטמון KV ואקטיבציות — משמעות הדבר היא שמאיץ יחיד של 80 GB בקושי מספיק, וכרטיס יחיד של 141 GB נוח. זו כנראה הסיבה שדוגמת vLLM משתמשת בשני GPUs, בעוד שדוגמת LMDeploy מניחה כרטיס אחד גדול. עבודה עם קונטקסט ארוך תדחוף את זה גבוה יותר. הפעל MTP — המדריך ממליץ על כך במפורש, וחלק משמעותי מההאצה המוצהרת נמצא שם, ולא בארכיטקטורת הבסיס.

האזהרה המעשית החשובה ביותר: אף ספק הסקה לא מארח כרגע את המודל הזה. פאנל הספקים של Hugging Face מציין זאת במפורש, ומונה ההורדות עדיין עמד על אפס במועד כתיבת שורות אלה. אין נקודת קצה של API, אין מחיר למיליון טוקנים, ואין דרך מנוהלת לנסות את המודל. אירוח עצמי הוא האפשרות היחידה כיום.

Intern-S2-Mobius-4

מי באמת צריך לדאוג?

1. צוותים המריצים עומסי עבודה של חשיבה מבוססת אחזור בנפח גבוה

זהו הפרופיל שעבורו נבנתה הארכיטקטורה. אם אתה משרת קבוצות גדולות של שאלות ותשובות טכניות, ניתוח מסמכים, חילוץ מובנה, או סיווג בסגנון בחירה מרובה, באמצעות מודל חשיבה, והחשבון שלך נשלט על ידי אסימוני חשיבה שלעולם אינך מציג למשתמש, מודל שמגיע לאותה תשובה בחמישית מהאסימונים הוא הפחתת עלות ישירה. הנתונים של MMLU Pro ו-GPQA — מסלולים קצרים פי 4.6 ופי 5.0 עם דיוק שווה או טוב יותר — הם בדיוק בצורה זו. בחן את זה מול התעבורה שלך לפני שתאמין לזה, אבל המנגנון מוצק והתמריץ גדול.

2. קבוצות מדע חישובי

טוקנייזרים מקוריים לחלבון, SMILES, ולחומצות גרעין, בתוספת שיפורים גדולים שנמדדו בבינצ'מרקים ביולוגיים ומולקולריים, במודל Apache 2.0 שמתאים ל-GPU אחד או שניים. עבור מעבדה שצריכה שהנתונים יישארו on-premises ולא יכולה לשלוח מבנים מולקולריים ל-API מסחרי, השילוב הזה הוא נדיר. קו Intern-S נבנה לקראת זה, ו-Mobius הוא נקודת הכניסה הזולה ביותר אליו עד כה.

3. חוקרים ומשקיפי אדריכלות

ניתוק בין ידע להסקה והסקה סמויה הם קווי מחקר פעילים כבר זמן מה; מעטים מאוד אומתו בקנה מידה של 35B ושוחררו בגלוי עם מקרי הכישלון כפי שהם. אם אכפת לכם לאן הולכות הארכיטקטורות שלאחר ה-Transformer, הדוח הטכני ושתי השורות המפסידות מעניינים יותר מהציון הממוצע. ArchSpace נבנה במפורש כדי להפוך תוצאה מסוג זה לניתנת לשימוש חוזר.

מי שלא צריך להתעניין, לפחות בינתיים: כל מי שמחפש עוזר כללי ברמת ייצור. אין נקודת קצה מתארחת, אין הערכה בלתי תלויה, אין כלים אקולוגיים, ואין רקורד. זו לא ביקורת על המודל — זה תיאור של מהדורת מחקר בת שבוע.

איך זה משתלב בערימת הייצור

המיקום הכנה של Intern-S2-Mobius כיום הוא מועמד להערכה, לא מודל ברירת מחדל. זהו ארטיפקט מחקרי לא מתארח, לא מאומת, בן שבוע, עם ארכיטקטורה מעניינת באמת וחוזק ספציפי אחד — חשיבה חסכונית בטוקנים במשימות בעלות אופי אחזורי — בתוספת התמחות אמיתית בנתוני רצפים מדעיים.

דפוס הגיוני הוא לשמור את התעבורה היצרנית שלך על נקודת קצה נייטרלית מבחינת ספק כמו OrcaRouter, שמספקת לך API תואם OpenAI אחד על פני מודלים רבים, ולהריץ את Mobius בנפרד על מחשבי GPU משלך עבור הנתח הצר שבו הוא עשוי לנצח. מדוד את הדבר שבאמת חשוב למודל הזה: לא רק דיוק, אלא אסימונים שהושקעו לכל תשובה נכונה. זהו הציר שעבורו Mobius מותאם, וזהו הציר שרוב מערכות ההערכה מתעלמות ממנו. אם הוא עומד במבחן על עומס העבודה שלך, יש לך נתיב אירוח עצמי שזול להפעלה וללא מכשולים משפטיים. אם לא, איבדת יום של זמן GPU והנתיב היצרני שלך מעולם לא זז.

אותו היגיון חל גם בכיוון ההפוך אם ספק יארח אותו בסופו של דבר: ראוטר מאפשר לך לבדוק מודל חדש בהשוואת A/B מול המודל הקיים שלך בלי לשכתב דבר, וזו בדיוק הדרך הנכונה לאמץ ארכיטקטורה שאיש לא בחן באופן עצמאי.

מגבלות ואזהרות

התחל עם הגדול ביותר: אין אימות בלתי תלוי לאף אחד מהמספרים במאמר זה. כל מדד, כל עקומת תפוקה, וכל השוואת אורך טוקנים מגיעים מ-InternLM. ההשוואה גם מעניקה יתרון מבני — Mobius נמדד רק מול קו הבסיס הספציפי שממנו הוא אומן מראש באופן רציף, ולא מול החזית הנוכחית, והפוסט-טריינינג הנוסף של SFT ו-RL גורם לכך שההשוואה אינה אבלציה נקייה של הארכיטקטורה, אף על פי שהיא מוצגת ככזו. חלק מהשיפור הוא Mobius; חלק הוא פשוט אימון נוסף.

הרגרסיות אמיתיות והן נוגעות למשימות הקשות ביותר. לאבד 3.3 נקודות ב-HLE ו-5 נקודות ב-UGD hard, בעוד שזוכה כמעט בכל מה שקל יותר, הוא חתימה קוהרנטית ומדאיגה במקצת עבור מודל שנקודת המכר שלו היא יעילות הנמקה.

מבחינה תפעולית, החיכוך משמעותי. קוד מידול מותאם אישית פירושו code>trust_remote_code/code> וגרסת Transformers חדשנית ביותר. הפריימוורקים שתומכים בכך צריכים להיות עדכניים מספיק כדי לדעת מה code>interns2_mobius/code> הוא, והמדריך של InternLM עצמו מזהיר שאלו הם תצורות ייחוס בפיתוח פעיל. בערך 73 GB של משקולות זה לא מודל למחשב נייד. אין API מתארח, אין תמחור, אין מגבלות קצב, ואין SLA — כי אין שירות.

לבסוף, שימו לב למה שלא פורסם: אין תוצאות בנצ'מרק מולטי-מודאליות למרות מקודד ראייה מלא, אין הערכת קונטקסט ארוך למרות תקרה של 256K, אין בנצ'מרקי קוד כלל, אין הערכת בטיחות או alignment, ואין השוואה לאף מודל מלבד Qwen3.5-35B. עבור פריסה לשימוש כללי, אלה הם שטחים ריקים גדולים. עבור מאמר ארכיטקטורה עם משקלים מצורפים, הם פשוט מחוץ לתחום — וזו הדרך הנכונה לקרוא את הפרסום הזה.

שאלות נפוצות

מה זה Intern-S2-Mobius?

מודל בסיס מולטי-מודאלי עם 35B פרמטרים, תחת רישיון Apache 2.0, מאת צוות InternLM של המעבדה המלאכותית של שנגחאי, הבנוי על ארכיטקטורת Mobius-v0 המפרידה בין אחסון ידע לחישוב היקש. הוא עבר אימון מקדים רציף מ-Qwen3.5-35B ואימון עוקב עם SFT ולמידת חיזוק, ופורסם ב-Hugging Face ב-29 ביולי 2026.

במה שונה ארכיטקטורת מוביוס?

טרנספורמרים קונבנציונליים מאחסנים ידע בבלוק הזנה-קדימה בתוך כל שכבה, כך שידע נגיש רק בעומק שבו הוא נמצא. Mobius מחליף זאת בזיכרון משותף גלובלי אחד — 2,560 מומחים בתצורה ששוחררה — שארבעה בלוקי Reasoner מבצעים אליו שאילתות שוב ושוב, מה שמאפשר גישה לידע בין-עומקי ומאפשר שחלק מההנמקה תתקיים במצבים חבויים רציפים במקום בטוקנים של שרשרת חשיבה שנוצרים.

האם Intern-S2-Mobius באמת מהיר פי 4?

בממוצע ובגדלי אצווה גדולים, בערך כן: InternLM מודד תפוקת בקשות גבוהה פי 2.9 באצווה של 16, שעולה לפי 4.6 באצווה של 256. אבל זה משתנה מאוד לפי המשימה. ב-MMLU Pro וב-GPQA Diamond הרווח גדול בכל גודל אצווה; ב-AIME וב-HMMT מתמטיקה תחרותית, ה-Transformer הבסיסי הוא למעשה מהיר יותר בגדלי אצווה בינוניים. ההאצה תלויה בכמה המודל יכול לקצר את מסלול ההיגיון שלו.

איך זה משתווה ל-Qwen3.5-35B?

הוא זוכה בשבעה מתוך תשעה מדדי ביצוע כלליים עם ממוצע של 67.88 לעומת 65.05, כולל MMLU Pro (89.05 לעומת 85.31), AIME 2026 (95.31 לעומת 92.08), HMMT 2026 (85.51 לעומת 78.50) ו-SimpleQA (28.90 לעומת 21.39). הוא מפסיד ב-UGD hard (73.02 לעומת 78.02) ו-HLE (19.11 לעומת 22.40). במשימות מדעיות הוא מקדים בהרבה — ממוצע של 52.14 לעומת 18.20.

האם אני יכול להשתמש ב-Intern-S2-Mobius דרך API?

לא כרגע. אף ספק אינפרנס לא מארח אותו, אין תמחור שפורסם, ו-Hugging Face לא מציגה פריסה. אירוח עצמי באמצעות LMDeploy, vLLM או Transformers הוא הדרך היחידה להריץ אותו כיום.

איזו חומרה אני צריך כדי להריץ את זה?

המשקלים הם כ-73 GB ב-bfloat16, אז תכננו על מאיץ אחד בדרגת 141 GB או שני GPUs של 80 GB, בתוספת מרווח ראש ל-KV cache. דוגמת ה-LMDeploy של InternLM משתמשת במקביליות טנזור של 1; דוגמת ה-vLLM שלה משתמשת ב-2. מומלץ להפעיל פענוח ספקולטיבי MTP עם ארבעה טוקני דראפט.

מה אורך ההקשר שלו?

התצורה תומכת ב-262,144 אסימונים (256K). שים לב ש-InternLM הוערך ב-128K ברוב מבחני הטקסט וב-64K ב-MMLU Pro, SimpleQA ו-HLE, כך שאיכות מאומתת ב-256K המלא לא הודגמה.

האם זה מולטי-מודאלי?

כן. Hugging Face מסווג אותו כ-image-text-to-text, והתצורה כוללת מקודד ראייה עם 27 שכבות וטיפול בטוקנים של וידאו. עם זאת, InternLM לא פרסמה תוצאות benchmark מולטימודליות עם שחרור זה, כך שיכולת הראייה אינה מתועדת בפועל.

למה זה כולל טוקנייזרים לחלבון ו-SMILES?

מכיוון שסדרת Intern-S היא משפחת מודלים מדעית. טוקנייזרים ייעודיים לרצפי חלבון, לסימון מולקולרי SMILES ולחומצות גרעין פירושם שהמודל קורא את הפורמטים האלה כסוגי קלט טבעיים, וזו הסיבה שהוא משיג 51.40 ב-Biology-Instructions, בעוד שקו הבסיס משיג 3.77.

האם הרישיון הוא באמת Apache 2.0?

כן — Apache 2.0, עם קובץ הרישיון במאגר. שימוש מסחרי, שינוי והפצה מחדש מותרים, דבר שהוא מתירני באופן ניכר יותר מאשר שחרורים פתוחי־משקל רבים ממעבדות גדולות.

האם עליי להשתמש בזה בפרודקשן?

עדיין לא. הוא בן שבוע, לא מתארח, לא אומת על ידי צד שלישי כלשהו, וחסרות בו הערכות קידוד, רב-מודאליות, הקשר ארוך ובטיחות. התייחסו אליו כמועמד להערכה עבור חשיבה חסכונית בטוקנים או עבודת רצפים מדעית, שמרו על תעבורת ייצור במודלים מבוססים דרך נקודת קצה נייטרלית לספק, וחזרו לבחון כשיהיו נתונים בלתי תלויים.

השורה התחתונה

Intern-S2-Mobius הוא אחד משחרורי המודלים המעניינים באמת של השנה, וכמעט כל זה לא קשור לציונים שלו. InternLM לקח רעיון ארכיטקטוני אמיתי — להפסיק לקשור ידע לשכבות, לשים אותו ב-Memory משותפת אחת, ולתת למודל לעשות חלק מהחשיבה שלו במרחב החבוי במקום בטוקנים — הגדיל אותו ל-35B, אימן אותו כראוי, ושחרר את המשקלים תחת רישיון Apache 2.0 יחד עם הדו"ח הטכני והתוצאות שלא הלכו לטובתו. מנגנון היעילות קריא והראיות לו עקביות פנימית: העקבות מתקצרות בממוצע פי 1.5 ועד פי 5 במשימות עתירות ידע, והתפוקה עולה בדיוק בפרופורציה שניתן לחזות מכך.

האזהרות ברורות באותה מידה. איש מחוץ למעבדת הבינה המלאכותית של שנגחאי לא אימת ולו מספר אחד. ההשוואה היא מול הבסיס של המודל עצמו וכוללת אימון נוסף לאחר מכן, כך שזו לא אבלציה נקייה כפי שהיא נראית. האצת הביצועים נעלמת ברובה במתמטיקה קשה. המודל מפסיד בשני מדדי ההיגיון התובעניים ביותר בטבלה שלו. ואין דרך לנסות אותו בלי לשכור GPUs.

אז: זה לא מודל שצריך לפרוס השבוע, אבל בהחלט מודל שכדאי לעקוב אחריו, ואופציה אטרקטיבית באמת עבור שני קהלים ספציפיים — צוותים שחשבון החשיבה שלהם נשלט על ידי טוקנים שאיש אינו קורא, וקבוצות מדעיות שזקוקות למודל קטן עם רישיון מתירני שמדבר בשפת החלבונים והמולקולות באופן טבעי. השאירו את מחסנית הייצור על מודלים מוכחים דרך נקודת קצה נייטרלית לספק כמו OrcaRouter, הקימו את Mobius על החומרה שלכם למקרה המצומצם, ומדדו טוקנים לכל תשובה נכונה במקום דיוק בלבד. אם הארכיטקטורה תחזיק מעמד תחת בדיקה בלתי תלויה, Mobius-v0 ייזכר פחות כמודל 35B ויותר כמספר הגרסה שבא לפני זו שהייתה חשובה.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube