
MiniMax M3.1 Flash Preview לעומת MiniMax M3: כאשר המודל החדש יותר הוא המסוכן יותר
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 468 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 192 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
התיעוד של הספק עצמו מציג כעת את MiniMax-M3.1-Flash-Preview מעל MiniMax-M3, והסדר הזה עושה עבודה שכנועית רבה. זהו מודל הטקסט החדש ביותר בסדרה, יש לו אותו חלון הקשר של מיליון טוקנים, והוא מוסיף בקרת עומק חשיבה שאין למודל הישן יותר. מה שהטבלה אינה מראה הוא שהמודל הישן יותר הוא היחיד מבין השניים שאפשר להוריד, לתמחר לפי טוקן, להריץ בנצ'מרק מול משהו, או לפנות אליו ללא מנוי — ושהחדש יותר הסיר מתג שמודל MiniMax-M3 נתן לך.
זה לא סיפור על מודל שהוחלף בחדש. זה סיפור על ספק שמפצל את הקו של עצמו לסוס עבודה מחויב לפי שימוש ולתצוגה מקדימה שמוגבלת למנויים, והשניים אינם תחליפיים זה לזה באף כיוון. הנה מה שכל אחד מהם באמת.
שני דפי המפרט, זה לצד זה
התחל ממה שהעמודים של הספק עצמו מציינים עבור שניהם, כי צורת ההבדל מופיעה כאן ולא בטבלת בנצ'מרק.
• הוכרז — MiniMax-M3 ב-1 ביוני 2026 עם הערת ארכיטקטורה, גיליון בנצ'מרק וכרטיס תעריפים; MiniMax-M3.1-Flash-Preview ב-27 בספטמבר 2026 עם ערך תיעוד ופוסט בחשבון הסוכן של MiniMax • חלון הקשר — 1,000,000 טוקנים לשניהם, לפי טבלאות המודלים של MiniMax עצמה • פלט מקסימלי — 512,000 טוקנים עבור MiniMax-M3 בערך הקטלוג שלנו, נתון ש-MiniMax עצמה אינה מפרסמת; לא מפורסם עבור MiniMax-M3.1-Flash-Preview בשום מקום • מודאליות קלט — קלט טקסט, תמונה ווידאו, פלט טקסט, לשניהם • שליטה בחשיבה — פרמטר חשיבה שניתן לומר ל-MiniMax-M3 לדלג עליו, ושאותו ניתן להפריד לשדה reasoning_details באמצעות reasoning_split; ב-MiniMax-M3.1-Flash-Preview החשיבה היא חובה ו-reasoning_split לא ניתן לכבות • עומק חשיבה — לא זמין ב-MiniMax-M3; סולם ה-effort של low, medium, high, xhigh ו-max, כשברירת המחדל היא max, ב-MiniMax-M3.1-Flash-Preview • מהירות פלט מפורסמת — בערך 100+ טוקנים לשנייה עבור MiniMax-M3, לפי טבלת המודלים של MiniMax עצמה; דבר לא מפורסם עבור MiniMax-M3.1-Flash-Preview • משקלים — MiniMax-M3 הוא בעל משקלים פתוחים עם מאגר ציבורי; ל-MiniMax-M3.1-Flash-Preview אין כזה • תמחור — $0.30 למיליון טוקני קלט ו-$1.20 למיליון טוקני פלט עבור MiniMax-M3 בתעריף הספק; אין תעריף לפי טוקן עבור MiniMax-M3.1-Flash-Preview • גישה — MiniMax-M3 בתשלום לפי שימוש ובמסלול Token Plan, וניתן לנתב אותו דרך פלטפורמות צד שלישי; MiniMax-M3.1-Flash-Preview ב-Token Plan וב-MiniMax Code בלבד
שתי שורות שם שייכות לקטגוריה שונה משאר השורות. מהירות הפלט המפורסמת היא נתון יצרן עבור הדגם הישן בלבד, כך שהדגם החדש נמכר בתור המהיר, בלי נתון מצורף. ובקרת החשיבה נעה בכיוון ההפוך מהשיווק: הדגם החדש מציע שליטה עדינה יותר בכמה הוא חושב, ובמקביל מסיר את היכולת שלך לעצור אותו מלחשוב בכלל.
המתג ש־MiniMax הסירה
זה הפרט שהכי סביר שיכאב, והוא מתועד ולא מוסתר. עם MiniMax-M3, שליחת thinking: {"type": "disabled"} בנקודת הקצה התואמת ל-OpenAI מדלגת על חשיבה ומחזירה תשובה ישירה; בנקודת הקצה התואמת ל-Anthropic, חשיבה כבויה כברירת מחדל וניתן להפעיל אותה עם adaptive. ב-MiniMax-M3.1-Flash-Preview, אותה בקשה בדיוק מחזירה HTTP 400 עם ההודעה requires adaptive thinking. אין דרך נתמכת לקבל תשובה ללא חשיבה.
באופן מעשי, המשמעות היא שלעומס עבודה שהשתמש ב-MiniMax-M3 כמסווג או כנתב זול ומהיר — פרומפט קצר נכנס, תשובה מובנית קצרה יוצאת, בלי שרשרת חשיבה — אין מסלול שדרוג ישיר למודל החדש. אפשר להנמיך את effort אל low, וההנחיה של MiniMax מפורשת שהורדת effort היא הדרך המיועדת להפחתת ההשהיה והטוקנים של החשיבה, ולא השבתתה. אבל הטוקנים וההשהיה לא מגיעים לאפס, ובמשימת חילוץ בנפח גבוה שכותבת ארבעה שדות בכל קריאה, "תמיד חושב קודם" הוא מבנה עלות שונה מ"חושב כשמבקשים".

מה בעצם נמדד בכל אחד
בצד אחד של ההשוואה הזו יש מספרים, ובצד האחר יש עמודה ריקה, וכדאי לדייק לגבי אילו מספרים שייכים למי.
הרקורד העצמאי של MiniMax-M3 הוא אמיתי: Artificial Analysis מציבה אותו על 29.2 במדד הבינה — מקום 60 מתוך 145 — עם 58.6 במדד הקידוד, 59.18 במדד המתמטיקה שלה, 92.9% ב-GPQA Diamond תחת אותה משפחת מדדים, 83% שליפה של הקשר ארוך ו-82.9% ב-IFBench. אלו הערכות של צד שלישי של מודל שכל אחד יכול להוריד ולהריץ מחדש. המספרים של MiniMax עצמה להשקת M3 — BrowseComp ב-83.5%, SWE-Bench Pro ב-59.0%, Terminal-Bench 2.1 ב-66.0%, MCP Atlas ב-74.2%, OSWorld-Verified ב-70% — הם נתוני ספק ולא ראינו אותם משוחזרים.
ל-MiniMax-M3.1-Flash-Preview אין אף אחד מהשניים. MiniMax לא פרסמה טבלת בנצ'מרקים, ולמודל אין רשומה באינדקס של Artificial Analysis, ולכן אין ציון עצמאי, אין מדד קידוד, אין נתון recall להקשר ארוך ואין מדידת הזיות. כל אפיון שלו שנמצא בתפוצה — "מהיר", "אמין", "בנוי לפיתוח יומיומי" — הוא שם התואר של הספק עצמו מפוסט ההשקה. היעדרו ראוי לומר בפשטות משום שהוא פועל בשני הכיוונים: דבר לא הוצג כגרוע יותר, ודבר לא הוצג כטוב יותר.
האסימטריה הזו היא כל ההחלטה. תוכלו להעריך את MiniMax-M3 כבר אחר הצהריים על ידי הורדה שלו או על ידי קריאה אליו, ותוכלו להשוות את ההערכה הזו ללוח תוצאות ציבורי. עם MiniMax-M3.1-Flash-Preview תוכלו רק להשתמש בו ולגבש דעה פרטית.
היכן שהמודל החדש יותר באמת מנצח
יהיה קל לקרוא את האמור לעיל כטיעון להתעלמות מהמודל החדש, וגם זו אינה המסקנה הנכונה. שלושה דברים הם אמיתיים וייחודיים לו.
סולם המאמץ הוא יכולת אמיתית, לא מתג. חמש רמות — נמוכה עד מקסימלית — מאפשרות למודל אחד לשרת שינוי שם שגרתי וריפקטור בכל הריפוזיטורי בעלויות חישוב שונות, והוא מתועד כיעיל עבור MiniMax-M3.1-Flash-Preview בלבד. ב-MiniMax-M3 הבחירה שלך היא בינארית. אם הבעיה שלך היא שאינך יכול לחזות את זמן התגובה לכל משימה, עומק מתכוונן הוא בדיוק הבקרה שרצית.
זהו המודל הבכיר הנוכחי של הספק, מה שאומר שהוא יורש כל מה ששושלת סדרת M למדה מאז יוני, ו-MiniMax מצהירה במפורש שזהו המודל העדכני ביותר לחשיבה סוכנית, שימוש בכלים, קידוד ומשימות הקשר ארוך. מנגנון השימוש בכלים עם חשיבה משתלבת (interleaved-thinking) ש-M3 הציג ממשיך הלאה, כולל הדרישה לצרף את התגובה המלאה — בלוקי חשיבה וכל היתר — בחזרה להיסטוריית ההודעות.
והיא קולטת וידאו, בנקודת מחיר של Flash, בתוך מנוי. גם MiniMax-M3 עושה זאת, במחיר לפי טוקן. אם אתם כבר משלמים עבור מושב ב-Token Plan והמכשול היחיד שעומד בפניכם לשימוש בקלט וידאו הוא העלות השולית לכל קריאה, M3.1-Flash-Preview מסיר את המכשול הזה.
במקרים שבהם הדגם הישן הוא עדיין הכתובת
שלושה מקרים, כולם קשורים ליכולת חיזוי ולא לאיכות.
כאשר אתה צריך למדל עלות. ל-MiniMax-M3 יש מחירון: $0.30 למיליון טוקני קלט, $1.20 למיליון טוקני פלט, ותעריף קריאה מהמטמון של $0.06 למיליון בקטלוג שלנו. אתה יכול להעריך את החשבון החודשי של עומס עבודה עד האגורה לפני שאתה מריץ אותו. ל-MiniMax-M3.1-Flash-Preview אין תעריף לפי טוקן בשום מקום בדפים של MiniMax, ולכן העלות שלו היא המנוי שלך מחולק בכמה שאתה משתמש בו — מתאים לתקציב קבוע, חסר תועלת לכלכלת יחידה.
כשאתה צריך שהמודל יהיה המודל. MiniMax-M3 הוא open-weight: אתה יכול להוריד אותו, להריץ אותו על החומרה שלך, ולדעת שהחפץ שמגיב לקריאות שלך בעוד חצי שנה הוא אותו אחד שמגיב להן היום. ל-MiniMax-M3.1-Flash-Preview אין checkpoint, וגישה בדרגת preview משמעה שמערך ההגשה, הרכב המכסה והזמינות — כולם בשליטת הספק וכפופים במפורש לשינוי.
כאשר אתם זקוקים לתשובה ללא חשיבה. כפי שצוין לעיל — זו הרגרסיה היחידה ביכולות בהשוואה, והיא זו שמפתיעה אנשים, מפני שמודל חדש יותר שאינו מסוגל לעשות משהו שהמודל הישן יותר יכול היה לעשות אינו מקרה שאף אחד מתכנן לקראתו.

להתקשר לשניהם ממקום אחד
המבוכה כאן היא ששני המודלים נרכשים בדרכים שונות — אחד בתשלום לפי שימוש, אחד במנוי — והאינסטינקט הטבעי הוא לבחור צד. המהלך השימושי יותר הוא לנתב ביניהם לפי צורת המשימה, וזה עובד רק אם הצד בתשלום לפי שימוש נגיש מאותו מקום שממנו נגיש כל השאר.
MiniMax-M3 ב-OrcaRouter נושא את מחיר המחירון של MiniMax עם 0% תוספת, כך ש-$0.30 ו-$1.20 בלוח התעריפים הם מה שעולה קריאה, ללא מרווח פלטפורמה מעל. הוא יושב על אותה נקודת קצה תואמת OpenAI כמו MiniMax M2.7 — אותו תג מחיר של $0.30/$1.20 על חלון של 200,000 טוקנים, גם במשקלים פתוחים — וכמו 200+ מודלים אחרים, מאחורי מפתח API אחד, עם מעבר אוטומטי בין ספקים כאשר נקודת קצה אחת מתנדנדת. מול הטלמטריה שלנו, שהיא סוג אחר של מספר מזה של ספק: בשבעת הימים האחרונים M3 השיב בקצב של כ-238 טוקני פלט לשנייה ב-p50 של כ-4.1 שניות עד לטוקן הראשון, עם שיעור שגיאות של קרוב ל-0.15%, כפי שנמדד ב-OrcaRouter playground. אם אתם רוצים להחזיק את MiniMax-M3 כחצי האמין של pipeline ולהתייחס ל-MiniMax-M3.1-Flash-Preview כחצי הניסיוני, החצי האמין הוא שורת קונפיגורציה אחת במקום מערכת יחסים עם ספק שני. MiniMax-M3.1-Flash-Preview עצמו לא נמצא בקטלוג שלנו; הדרך אליו היא ה-Token Plan ומוצר הקידוד של הספק עצמו.
מה שישנה את המאמר הזה הוא ספציפי וקל לשים לב אליו. מחירון מפורסם עבור MiniMax-M3.1-Flash-Preview ימוטט את הסיבה העיקרית להעדיף את M3 מבחינה כלכלית. סט של ציונים בלתי־תלויים יחליף את העמודה הריקה במשהו שניתן להשוות אליו. צ׳קפוינט להורדה יסיר את ההסתייגות בנושא שחזוריות. עד שלפחות אחד מאלה יגיע, MiniMax-M3 נשאר המודל בזוג הזה שאפשר לדרוש ממנו דין וחשבון — והחדש יותר נשאר גרסת התצוגה המקדימה המהירה יותר, עם הבקרה הטובה יותר, שאינה נמדדת, ש-MiniMax החליטה לגבות עליה לפי חודש ולא לפי טוקן.

