
Nex-N2.5 Pro לעומת MiniMax M3: הפער המוצהר של 34 נקודות והמודל שבאמת ניתן להוריד
- openaiחדשOpenAI: GPT-6 Astra2026-09-0455אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0247אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0247אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0157אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2646אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1849אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1541אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1251אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0547אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0347אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2140אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128אינטליגנציה49כתיבת קוד
המספר הבולט ביותר בהתמודדות הזו הוא 56.4 מול 22.3 — וגם הכי פחות ניתן לאימות. אלה ציוני OSWorld-2 ש-Nex-N2.5 Pro של Nex-AGI ושל MiniMax M3 נושאים בכרטיס המדדים של המודל החדש עצמו: Pro עם 56.4, M3 של MiniMax עם 22.3 — פער של 34 נקודות במדד שימוש ממושך במחשב, שלפיו נמדד היום כל סוכן GUI רציני. Nex-N2.5 Pro, שהוצג ב-8 בספטמבר 2026, הוא סוכן רב-מודאלי עם 397B סך הכול / כ-17B פעילים, שמשקולותיו עדיין “בקרוב”. MiniMax M3, שיצא ב-1 ביוני 2026, הוא דגל רב-מודאלי בעל משקלות פתוחים עם 428B סך הכול / כ-23B פעילים, שמקבל גם קלט וידאו, מספק הקשר של 1M עם MiniMax Sparse Attention, וזמין להורדה מאז תחילת יוני. את אחד משני המודלים האלה אפשר למשוך מההאב ולהריץ הערב. השני הוא תצוגה מקדימה מתארחת עם הבטחה. ואת פער 34 הנקודות, שהופך את ההתמודדות הזו לכדאית קריאה, מדפיס הספק של המודל שאי אפשר להריץ — על מדד שבו אפילו הנתון של הדגם הנוכחי מדווח על ידי הספק.
אז הדף הזה עוסק בעצם בשאלה איך שוקלים יתרון דרמטי שלא ניתן לאימות מול יתרון צנוע שאפשר לאמת חלקית — ומה קיומו של המודל הזול עושה לטיעון של המודל היקר. MiniMax M3 הוא משקל-הנגד שכל מומחה שעדיין לא שיחרר משקולות חייב לטעון נגדו: הוא כבר עושה את רוב העבודה, הוא עולה כמעט כלום, והקבצים שלו על הדיסק שלך. כדי ש-Nex-N2.5 Pro יהיה משמעותי, טענת ה-34 נקודות חייבת לשרוד את שלוש הבדיקות הבאות.
בדיקה ראשונה: האם המספרים בכלל מודדים את אותו הדבר?
OSWorld-2 הוא ההרחבה ארוכת-האופק והעולם-האמיתי של מדד OSWorld המקורי — סוכן מפעיל תוכנת שולחן עבודה בפועל על פני משימות מרובות-שלבים, ומוערך לפי האם הוא מבצע עבודה אמיתית, לא לפי האם הוא לוחץ על הכפתור הנכון. הוא קשה בהרבה מקודמו, וזה המדד שבו Nex-AGI טוענת שהדרגה Pro שלה נבדלת מהמתחרות הרב-מודליות. אבל הביטו מאיפה מגיעות שתי השורות. הציון 56.4 של Nex-N2.5 Pro הוא מדידה עצמית של Nex-AGI באמצעות תשתית ה-NexCUA הפנימית שלה, שלפי הכרטיס עתידה להיות בקוד פתוח "בקרוב". הציון 22.3 של MiniMax M3 הוא מספר ש-Nex-AGI פרסמה עבור דגם מתחרה — MiniMax לא פרסמה תוצאת OSWorld-2 משלה, והנתון הציבורי של M3 לשימוש במחשב הוא מדד OSWorld-Verified הישן והקל יותר, ש-Nex מציינת גם כן בכרטיס כ-75.2 עבור M3 לעומת 82.2 עבור Pro. שתי השורות בכותרת 56.4-מול-22.3 מגיעות מאותה תשתית, מופעלות על ידי אותו ספק, באותו היום, לגבי דגם אחד שהוא בבעלותו ודגם אחד שאינו בבעלותו. אין זה הופך את הפער לשקרי — תשתיות השוואה קיימות בדיוק כדי להשוות דגמים בתנאים זהים. אבל זה אומר שהמספר הוא השוואה מבוקרת של ספק יחיד, לא תוצאה שאושרה על ידי מעבדה חיצונית כלשהי, והפער אמין בדיוק כמו התשתית שהפיקה אותו.
בדיקה שנייה: מה המודל שאתה יכול בפועל להריץ מספק?
MiniMax M3 לא צריך את השורה שלו ב-OSWorld-2 כדי להיות שימושי, כי הטיעון שלו נשען על דברים שאפשר לאמת על ידי הורדה שלו. הוא 428B סה"כ / ~23B פעילים, בנוי על MiniMax Sparse Attention, עם הקשר של 1M טוקנים ותקציב פלט של 512K; הוא מקבל טקסט, תמונה וווידאו ומחזיר טקסט; המשקולות שלו נמצאות ב-Hugging Face מאז השבוע הראשון של יוני; והמחיר המפורסם שלו ב-API של MiniMax הוא $0.30 למיליון טוקני קלט ו-$1.20 למיליון פלט, עם $0.06 לקלט במטמון — כחמישית ממחיר הפלט של הדגמים הסגורים הזולים ביותר, עם חיוב נפרד לווידאו. המעמד העצמאי שלו אמיתי אך צנוע: ציון 44 במדד האינטליגנציה של Artificial Analysis ממקם אותו בשכבה הבינונית בין דגמי הדגל, מתחת לטווח 56-61 שבו נמצאים המובילים הסגורים. המספרים האג'נטיים הכותרתיים שלו — 75.2 ב-OSWorld-Verified כפי שחושב בכרטיס של Nex, ~70 בדיווח של MiniMax עצמו, 83.5 ב-BrowseComp — הם בדיווח ספק ולא שוחזרו, אותו כוכבית שמלווה את Nex. ההבדל הוא שהטענות של M3 מצביעות על מודל שאפשר להריץ ולבדוק בעצמך, ולכן "בדיווח ספק" עוקץ פחות בצד שבו יש משקולות להורדה.

בדיקה שלישית: מה בעצם היית עושה עם כל אחד?
• קונים היום — MiniMax M3: משקלים אמיתיים, מחירון ו-API שעובד. Nex-N2.5 Pro: תצוגה מקדימה מתארחת בחינם ומפת דרכים.
• שימוש במחשב — MiniMax M3: גנרליסט המעבד צילומי מסך וסרטוני וידאו ומשיג ציוני GUI באמצע הטבלה. Nex-N2.5 Pro: סוכן חזותי־מלידה, שתוכנן לעבוד בלולאת משוב חזותית, וטוען להובלה בדירוג OSWorld-2.
• מחיר — MiniMax M3: $0.30 / $1.20, cache $0.06 — זול מספיק כדי לזרוק על לולאות סוכן ארוכות. Nex-N2.5 Pro: עדיין אין מחיר רשמי; טיעון היעילות (17B פעילים על צומת יחיד של 8×H100) הוא השערה, לא חשבונית.
• הקשר — MiniMax M3: 1M tokens, כשבקשות מעל 512K מחויבות בתעריף 2×. Nex-N2.5 Pro: תצורת משפחה של 262K.
• קלטים — MiniMax M3: טקסט, תמונה ווידאו, באופן מובנה. Nex-N2.5 Pro: תמונה וטקסט, מכוון לתפיסה ברמת מסך.
• יכולת אימות — MiniMax M3: ניתן לאירוח עצמי, כך שכל טענה ניתנת לבדיקה פנימית. Nex-N2.5 Pro: ללא משקלים, כך שכל טענה היא על-פי Nex-AGI בלבד.
• מדד עצמאי — MiniMax M3: 44 (AA). Nex-N2.5 Pro: אין עדיין.
מדוע המתחרה הקיים והזול הוא היריב הקשה יותר
יש סיבה שנקס-AGI בחרה לכלול את MiniMax M3 בטבלת המולטי-מודאליות שלה במקום להתעלם ממנו: M3 הוא עוגן המחיר שהופך את הפרמיה של מומחה לשימוש במחשב לקשה להצדקה. אם גנרליסט שעולה $0.30/$1.20 ומקבל וידאו יכול לבצע אפילו 70-75% ממה שסוכן GUI ייעודי טוען, המומחה חייב להיות טוב בהרבה במשימה עצמה כדי לזכות במקומו — והכרטיס של Nex-N2.5 Pro אומר שזה אכן כך, ב-OSWorld-2, בהפרש של 34 נקודות. אבל יתרון של 34 נקודות שמפרסם המתחרה על המודל שלו שטרם שוחרר הוא השערה, בעוד שה-44 Index של M3, המשקולות הפתוחות שלו ומחירו הם עובדות שאפשר לבנות עליהן. העמדה הרציונלית מבחינה כלכלית היא לא לפסול את ההשערה — אלא להתעקש שהיא תשרוד ריצה עצמאית לפני שהיא עולה למישהו כסף.
הרצת ההשוואה על המפתח שלך
שכבת הניתוב היא המקום שבו השוואה מעוגנת במחיר כמו זו נבחנת בפועל, בלי להתחייב לאף אחד מהצדדים.MiniMax M3 זמין על OrcaRouterבמחיר המחירון של MiniMax — $0.30 / $1.20, מועבר ב־0% תוספת, כך שביום שבו MiniMax משנה תעריף, השינוי נכנס לתוקף על אותו מפתח שכבר משמש אותך לשאר הקטלוג. Nex-N2.5 Pro אינו מוצע דרכנו, ולכן מגיעים אליו דרך התצוגה המקדימה המתארחת של Nex-AGI, עד שהמשקלים המובטחים יופיעו. הניסוי שבאמת מכריע את ההשוואה הזו: כוון את תעבורת הסוכנים רבת־הנפח ובעלת ההקשר הארוך שלך אל MiniMax M3 דרך נקודת הקצה האחת, הרץ ענף הערכה קטן מול התצוגה המקדימה של Nex-N2.5 Pro, והשווה אותם על תמהיל המשימות שלך — בזמן שמנגנון מעבר אוטומטי שומר על אמינות שניהם. טענת ספק של 34 נקודות שווה בדיוק כמו שכפול עצמאי שלך שלה, ו־M3 זול מספיק כדי ששכפול המבחן יעלה כמעט כלום. כשהמשקלים של Pro יגיעו, המתכון של שמונת ה־H100 הוא התוצר האמיתי לבדיקה: האם המומחה עם 17B פעילים שומר על ההובלה שלו ב־OSWorld-2 כשמישהו אחר מלבד Nex-AGI מריץ אותו.


פסק הדין שהראיות תומכות בו
בכל מה שניתן לפעול עליו כיום, MiniMax M3 מנצח בהתמודדות הזאת כברירת מחדל: הוא ניתן להורדה, מחירו הוא חמישית מהנורמה של המודלים המובילים, הוא מקבל וידאו, יש לו Index עצמאי, וטענותיו בנוגע לשימוש במחשב — אף שהן מדווחות על ידי היצרן — מצביעות על מודל שתוכלו לבדוק מחדש בתשתית שלכם השבוע. Nex-N2.5 Pro הוא המודל המעניין יותר, אך הרכישה הגרועה יותר: מומחה לשימוש במחשב, המבוסס על ראייה ממוחשבת מיסודו, שכרטיס המודל שלו מצהיר על ציון מוביל בכיתה ב-OSWorld-2, ושמשקלי המודל שלו עדיין אינם קיימים. התייחסו לפער שבין 56.4 ל-22.3 כאל ההשערה הטובה ביותר שזמינה בנוגע לכיוון שאליו צועד תחום השימוש במחשב, ולא כאל תוצאה שאפשר לפעול על פיה — וראו את MiniMax M3 כסיבה לכך שהמומחה, כשישוגר סופית לשוק, ייאלץ להוכיח את הפער הזה על מערכת בדיקה של מישהו אחר כדי להצדיק כל מחיר מעל $0.30/$1.20.
