כרטיס כותרת ראשי עם הכיתוב 'Xiaomi MiMo-V2.6-Flash יצא' מעל כותרת המשנה '309B של משקלים פתוחים, רישיון MIT, הקשר של 1M טוקנים - פורסם ב-21 בספטמבר 2026', עם ארבעה תגי גלולה: '309B סה"כ / 15B פעילים', '173 GB של משקלי FP8', 'הקשר של 1M טוקנים' ו'דוח טכני כלול'.
Guides & Insights

Xiaomi MiMo-V2.6-Flash יצא: מודל פתוח של 309B שאתם מארחים בעצמכם

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

MiMo-V2.6-Flash חדל להיות משימת אימון ב-21 בספטמבר 2026 בשעה 15:39 UTC, כאשר צוות MiMo של Xiaomi פרסם את הצ'קפוינט בתור XiaomiMiMo/MiMo-V2.6-Flash-RL ב-Hugging Face — ללא הגבלת גישה, ברישיון MIT, עם דוח טכני מצורף, 65 מקטעי משקל באינדקס. XiaomiMiMo/MiMo-V2.6-Pro-RL הופיע שמונה עשרה שניות לאחר מכן. שבוע קודם לכן, שני המודלים היו שני כרטיסים שסומנו כ"הופסקו" על לוח מחוונים ציבורי לאימון, והשורה שחזרה על עצמה רבות לגביהם הייתה שלא קיימים משקלים. כעת הם קבצים שכל אחד יכול להוריד ולשרת. זהו שינוי אמיתי במה שאפשר לעשות עם המודל, וזה דבר שונה מהכרזה על אחד כזה.

פתחו בזמן החתימה, כי ההשקה הגיעה בלי הכוריאוגרפיה הרגילה של הספק. הבלוג של שיאומי עצמה, שנבדק ב-22 בספטמבר, עדיין מציג את השקת MiMo-V2-Flash מדצמבר 2025 כפוסט החדש ביותר שלו. אין מאמר השקה ל-V2.6, אין רשימת מחירים מפורסמת לדור החדש, ואין מזהה מודל שניתן לקרוא לו ששיאומי הכריזה עליו עבור אף אחד משני הצ'קפוינטים. מה שכן קיים הוא מאגר קוד, דוח טכני, מתכוני פריסה וסט של טבלאות בנצ'מרק שהספק הריץ — ובנוסף פרט קטן ועוין בכרטיס המודל שחשוב רק לאנשים שמתכננים למעשה לטעון את הדבר.

שני הכרטיסים שאתה יכול להחזיק

שני הצ'קפוינטים הם אומנימודליים ילידיים עם חלון הקשר מוצהר של 1M טוקנים, ושניהם נושאים את רישיון MIT — ניתנים לשימוש מסחרי, לכוונון עדין, להפצה מחדש, ללא מחסום הכנסות וללא סעיף מחקר. הכרטיס מכנה את Flash "צ'קפוינט מאוזן ביעילות" של הסדרה ואת Pro כספינת הדגל; החלק המעניין הוא כיצד השניים נבדלים ברגע שמסתכלים על הקונפיגורציות ולא על משפט השיווק.

• מספר הפרמטרים — MiMo-V2.6-Flash עם 309B סה"כ ו-15B מופעלים לכל טוקן; MiMo-V2.6-Pro עם 1.02T סה"כ ו-42B מופעלים. שניהם מבוססים על תערובת מומחים דלילה.

• עמוד שדרה — Flash הוא 48 שכבות (39 חלון הזזה, 9 קשב גלובלי), גודל מוסתר 4096, 256 מומחים מנותבים עם 8 מופעלים, חלון הזזה של 128 אסימונים, ללא מומחים משותפים. הבלוק הראשון הוא קשב גלובלי עם רשת הזנה קדימה צפופה; כל מה שאחריו משתלב לסירוגין.

• מקודדים — MiMo ViT בעל 681M פרמטרים (28 שכבות: 24 עם חלון הזזה ו-4 מלאות), מטקנן אודיו בעל 308M ומקודד טלאי אודיו בעל 127M, כך שטקסט, תמונה, וידאו ואודיו נכנסים כולם לאותו מודל ולא לשלושה צינורות מוברגים יחד.

• פענוח ספקולטיבי — מנסח חיזוי רב-אסימוני בן חמש שכבות, בסגנון DFlash, המתואר בכרטיס כחוזה שבעה אסימונים קדימה בכל מעבר קדימה לצורך אימות מקבילי.

• אחסון — האינדקס שפורסם מדווח על 172.9 GB של נתוני משקלים על פני 65 מקטעים, ב-FP8 (e4m3) עם סכמת אקטיבציה דינמית. יש לקרוא זאת ככתשעה בתים לפרמטר: Xiaomi שלחה את המודל הגדול, לא כימות בגודל מחשב נייד שלו.

שלושה מספרים שאינם תואמים

כדאי לומר זאת בפשטות, מכיוון שכל שלושתם משפיעים על החלטת פריסה ולא על טיעון בנצ'מרק, ואף אחד מהם אינו זדוני — הם נראים כמו סחף תיעוד בין הכתוב, עמוד המאגר והקבצים שסופקו.

הראשון הוא המפענח הספקולטיבי. סיכום המודל אומר שראש ה-MTP הוא מנסח טיוטות בן חמש שכבות שמנבא שבעה טוקנים בכל מעבר. הקובץ config.json באותו מאגר מגדיר את num_nextn_predict_layers ל-3. שני המספרים לא יכולים לתאר את אותו ארטיפקט, והקונפיג הוא זה שסביבת ההרצה תקרא. אם אתה מחשב נפח זיכרון לפענוח ספקולטיבי, סמוך על הקונפיג ובדוק לאחר הטעינה.

הדבר השני עדין יותר, והוא כלל אינו שגיאה אלא מוסכמת שמות שנשמעת כמו שגיאה. המאגר נקרא MiMo-V2.6-Flash-RL, מה שמזמין את ההנחה שמדובר במתאם ללמידת חיזוק ולא במודל. זהו המודל. הסיומת -RL מסמנת את שושלת הפוסט-אימון — נקודת הביקורת הזו היא הפלט של ריצת ה-RL המעורבת ששיאומי שידרה, ולא LoRA שיושב מעל איזה בסיס אחר. אינדקס המשקלים מאשר זאת: עשרות אלפי טנסורים המכסים את עמוד השדרה המלא, מקודד הראייה, מחסנית האודיו והדרפטר.

השלישי הוא זה שתפגשו ראשון אם תקבעו את גודל החומרה לפי עמוד המאגר ולא לפי הכרטיס. בלוק ה-Safetensors באותו עמוד מדווח 159 מיליארד פרמטרים. זה אינו אף אחד משני המספרים של הכרטיס — לא 309 מיליארד בסך הכול, ולא 15 מיליארד פעילים — וזהו הנתון שסביר ביותר שמתכנן קיבולת יעתיק, מפני שהוא יושב לצד כפתור ההורדה. שיאומי לא הסבירה את ההבדל ואיננו יכולים להכריע בכך מבחוץ; הקריאה הסבירה ביותר היא שמדובר במוסכמת ספירה על טנסורים מכומתים ולא במודל שונה. המהלך הבטוח הוא לקבוע את הגודל לפי נתוני המשקולות המפורסמים במקום: 172.9 GB של FP8 על פני 65 רסיסים הוא מספר שצריך לשלם עליו ב-VRAM ללא קשר לאופן שבו נספרים הפרמטרים.

מה אומרים מבחני הביצועים, ומי הריץ אותם

כל נתון שלהלן מגיע מטבלאות ההערכה של Xiaomi עצמה בכרטיס המודל. שום דבר מזה לא שוחזר באופן עצמאי, שום דבר מזה לא מופיע בלוח דירוג ציבורי, ועמודות ההשוואה הן הרצות של הספק עצמו של אותן ערכות בדיקה מול המודלים של חברות אחרות. התייחסו לצורת התוצאות כאל אינפורמטיבית ולמקומות העשרוניים כאל קישוט.

• סוכן קוד — DeepSWE v1.1: Flash 67.9, Pro 71.9, לעומת Claude Opus 5 ב-74.0, GPT-5.6 Sol ב-73.0 ו-Claude Fable 5 ב-70.0. ב-Terminal Bench 2.1, Flash מגיע ל-87.6 לעומת 89.1 של Opus 5 — פער קטן מספיק שייתכן שההרנס, ולא המודל, הוא זה שקובע אותו.

• סוכן כללי — AutomationBench v1.0.6 מציב את Flash ב-52.3, גבוה יותר הן מ-GPT-5.6 Sol (45.8) והן מ-Claude Opus 5 (50.3) בהרצה של Xiaomi. Toolathlon-Verified: Flash 73.6, Pro 76.9, Opus 5 80.6.

• אבטחת סייבר — העמודה הכי לא מאוזנת בטבלה. CyberGym: Flash 95.1, מעל האח הגדול של עצמו ב-94.0, עם MiMo-V2.5-Pro ב-40.0. ואז הרצפה נופלת: ExploitGym 6.0 עבור Flash לעומת 22.1 עבור Opus 5, ExploitBench 25.3 לעומת 70.0, SEC Bench Pro 47.5 לעומת 79.1 עבור GPT-5.6 Sol.

• סוכן חזותי — MiMo VisualCoding: Flash 71.5, Pro 72.3, Opus 5 70.0.

מספר אחד שווה להבליט, כי זה מסוג הדברים שפוסט השקה בדרך כלל מסתיר. לוח המחוונים של RL של Xiaomi פרסם את Flash ב-65.68 ב-DeepSWE v1.1 — וכרטיס המודל מציג כעת 67.9 עבור אותו בנצ'מרק על הצ'קפוינט המוגמר. אלה לא אותה מדידה. הנתון בלוח המחוונים סומן כ-mini-swe-agent, avg@3, על תמונת מצב של אימון; הטבלה בכרטיס היא ההערכה הלא-מקוונת של הספק למשקולות ששוחררו. ההפרש של שתי נקודות הוא הרווח מהחלק האחרון של הריצה בתוספת כל מה שהשתנה בהגדרות ההערכה, ואיש מחוץ ל-Xiaomi לא יכול כרגע להפריד בין השניים. אם ציטטתם 65.68 מאז השבוע שעבר, זהו כעת מספר מיושן עבור ארטיפקט אחר.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

כמה עולה להפעיל את זה בפועל

משקלים פתוחים הם רישיון, לא חשבון, וכאן השחרור הופך פחות חגיגי. סעיף הפריסה של הכרטיס עצמו ממליץ על SGLang (מקביליות טנזורית 16, מקביליות נתונים 2, עם מסלול ספקולטיבי רב-שכבתי בסגנון EAGLE מופעל) או מתכון vLLM ב-מקביליות טנזורית 8, ומציין ש-vLLM יציב עשוי לפגר אחרי הארכיטקטורה. זו עבודת הגשה רב-צומתית עבור מודל 309B שהמשקלים שלו תופסים כ-173 GB לפני שמוסיפים מטמון KV עבור הקשר של 1M טוקנים. הדגימה המומלצת היא temperature 1.0, top_p 0.95.

אז הניסוח הכנה של „קוד פתוח” כאן הוא: שיאומי הסירה את מחסום הרישוי והשאירה את מחסום החומרה בדיוק במקום שבו היה. כיוונון עדין של Flash על העקבות שלך הוא כעת חוקי ואפשרי; לעשות זאת על משהו קטן יותר מצומת GPU רציני — לא. זו הצעה אמיתית ושונה מנקודת קצה מתארחת, ולכן שתי הדרכים להשתמש בדור הזה אינן מתחרות — הן מכסות תקציבים שונים.

אם אתה רוצה את היכולת בלי הצומת, המודלים ששיאומי משווה אליהם בטבלה הזו הם החלופה המעשית: GPT-5.6 Sol, Claude Opus 5 ו-Claude Fable 5 ניתנים כולם לקריאה היום, והם מפתח API אחד במחיר המחירון של הספק עם 0% תוספת שמועברת ב-OrcaRouter, כך שההחלטה שאתה בעצם מקבל היא "לקנות צומת" לעומת "לחייב לפי קריאות". אם אתה רוצה לראות איך שכבת הקריאה משתווה באותן משימות קידוד לפני שאתה מתחייב לכאן או לכאן, לוח הקידוד הוא קריאה מהירה יותר מאשר טבלת הספק. מה שאתה לא יכול לעשות בכל ראוטר היום הוא לקרוא ל-MiMo-V2.6-Flash עצמו — אנחנו לא מנתבים שום מודל של שיאומי, ושורת הזמינות בכרטיס של שיאומי עצמה מצביעה על הערוצים של שיאומי עצמה: פלטפורמת MiMo API, AI Studio, MiMo Code ואפליקציית שולחן העבודה.

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

שאלת התמחור עדיין פתוחה

Xiaomi לא פרסמה תעריף לכל טוקן עבור MiMo-V2.6-Flash. דיווחים על ההשקה אומרים שהסדרה תשמור על תמחור ה-API של MiMo-V2.5, וזו טענה עיתונאית ולא מחירון של הספק — התעריפים בחו״ל שפורסמו עבור הדור V2.5 היו בסביבות עשירית דולר למיליון טוקני קלט, כאשר קלט במטמון זול בסדר גודל, אך שום דבר באתר של Xiaomi לא מאשר שהצ׳קפוינטים החדשים יורשים אותם. עד שתופיע רשימת מחירים, כל מספר שתראו עבור נקודת קצה של MiMo-V2.6 הוא הסקה של מישהו.

שני דברים נוספים עדיין חסרים, ושניהם נמצאים ברשימת המשימות של Xiaomi עצמה ולא של מישהו אחר. ההצהרה של Luo Fuli במהלך שידור ה-RL החי הייתה שסביבות האימון וקוד ה-RL ייפתחו בקוד פתוח, וחומרי ההשקה חוזרים על ההתחייבות הזו; המאגרים מספקים כיום משקולות, דוח טכני והוראות פריסה, ולא את מערך האימון. ואין הערכה בלתי תלויה: אין הגשה ללוח התוצאות, אין הרצה חוזרת של צד שלישי של העמודות DeepSWE או CyberGym. זהו הפער שהכי חשוב לכל מי שמחליט אם מודל 309B עם תקציב פעיל של 15B מצדיק צומת.

מה היה משנה את התמונה

שלושה אותות שכדאי לעקוב אחריהם, לפי סדר גס של מידת ההשפעה שלהם על החלטה. רשימת מחירים מפורסמת הופכת את זה מפרויקט אירוח עצמי לסעיף שאפשר להשוות מול החזית המתארחת. הרצה של צד שלישי על אותן מסגרות הבדיקה — DeepSWE או Terminal Bench, כזו שמוגשת ולא מדווחת עצמית — תכריע אם 67.9 הוא מיקום אמיתי או תצורה נוחה. וסביבות ה-RL, אם הן יגיעו, יהיו הארטיפקט המעניין יותר עבור רוב הצוותים, מפני שהן מה שתצטרכו כדי לשחזר את לולאת השיפור העצמי על הנתונים שלכם.

עד אז, הקריאה המעשית של השחרור הזה היא צרה וברורה. MiMo-V2.6-Flash הוא מודל סוכן אומנימודאלי לגיטימי, במשקלים פתוחים וברישיון MIT, בגודל שמניח אשכול — והוא נקודת הביקורת הראשונה בדור MiMo-V2.6 שאפשר להחזיק בידיים, וזה יותר ממה שאפשר היה לומר עליו בשבוע שעבר.

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית