כרטיס הירו של מכ״ם המודלים של OrcaRouter להשוואה בין MiMo-V2.6-Pro ל-DeepSeek V4 Pro, עם כתובית משנה ׳שני דגלי-על פתוחים, במרחק עשרה נקודות מדד זה מזה.׳, עם פאנל אחד לכל מודל וכותרת תחתונה שמציינת ששניהם ברישיון MIT עם חלון הקשר של 1M טוקנים, ושהציונים הם v4.3.2 ואינם ניתנים להשוואה לגרסאות מדד קודמות.
Guides & Insights

MiMo-V2.6-Pro לעומת DeepSeek V4 Pro: שני דגמי דגל פתוחים, במרחק עשר נקודות מדד

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Xiaomi MiMo-V2.6-Pro ו-DeepSeek V4 Pro הם אותו סוג של אובייקט — דגמי דגל סיניים מסוג mixture-of-experts עם טריליון פרמטרים, ברישיון MIT, הקשר של מיליון טוקנים, ומשקולות פתוחות שאפשר להוריד היום — והם רחוקים זה מזה עשר נקודות במדד Artificial Analysis Intelligence Index v4.3.2, 46 מול 36. הם גם חלוקים בדעתם לגבי למה מיועד דגם דגל. DeepSeek V4 Pro, שיצא ב-13 באוגוסט 2026, הוא מודל חשיבה טקסטואלי בלבד: 1.6 טריליון פרמטרים עם 49 מיליארד פעילים, ובלי קלט חזותי, אודיו או וידאו בשום מקום במפרט שפורסם. Xiaomi MiMo-V2.6-Pro, שיצא ב-21 בספטמבר 2026, הוא 1.02 טריליון פרמטרים עם 42 מיליארד פעילים ומקבל טקסט, תמונה, וידאו ואודיו. ההבדל הזה מכריע ביותר פריסות מאשר עשר הנקודות, והוא הדבר הראשון שצריך ליישב לפני שמשווים כל דבר אחר.

אותו רישיון, מכונות שונות

התחילו במה שזהה באמת, כי זה יותר ממה שהייתם מצפים בין שתי מעבדות מתחרות. שתיהן מופצות תחת תווית רישיון MIT במאגרים ציבוריים, כלומר פריסה מסחרית, שינוי ואימון נוסף ללא שער הכנסות או סעיף תחום שימוש. שתיהן טוענות לחלון הקשר של 1M טוקנים. שתיהן עיצובי תערובת מומחים דלילים — הארכיטקטורה הפכה לברירת המחדל בקנה מידה הזה, לא לגורם מבדל. ושתיהן אומנו על ידי מעבדות שמפרסמות פחות ממעבדות חזית מערביות בנוגע לשיטה.

• פרמטרים — MiMo-V2.6-Pro 1.02T סה"כ / 42B פעילים; DeepSeek V4 Pro 1.6T סה"כ / 49B פעילים

• מודאליות קלט — MiMo-V2.6-Pro טקסט, תמונה, וידאו, אודיו; DeepSeek V4 Pro טקסט בלבד

• הקשר — 1M טוקנים בשניהם; DeepSeek V4 Pro מגביל את הפלט ל-384K טוקנים

• ציון מדד — MiMo-V2.6-Pro 46 ב-Intelligence Index v4.3.2; DeepSeek V4 Pro 36 באותה גרסה

• עלות לכל משימת Index — MiMo-V2.6-Pro ‏$0.13; DeepSeek V4 Pro ‏$0.67

• תעריף רשום — MiMo-V2.6-Pro $0.43 / $0.87 לכל מיליון טוקנים; DeepSeek V4 Pro $1.32 / $3.96 כפי ש-Artificial Analysis מפרטת, לפני לוח הזמנים של DeepSeek עצמה לשעות עומס/שפל

• מהירות — MiMo-V2.6-Pro 134.3 אסימוני פלט לשנייה; DeepSeek V4 Pro 97.4

• זמן עד לאסימון הראשון — MiMo-V2.6-Pro‏ 2.15 שנ׳; DeepSeek V4 Pro‏ 1.62 שנ׳

קרא את הרשימה הזו פעמיים, כי שתי שורות מנוגדות לאינטואיציה. המודל הקטן יותר משיג ציון גבוה יותר בעשר נקודות — 42 מיליארד פרמטרים פעילים שגוברים על 49 מיליארד אינו הבדל הנובע מעיגול, זו תוצאה של שלב שלאחר האימון המקדים, וזה האות הברור ביותר והיחיד בהשוואה הזו לכך שאיכות למידת החיזוק עקפה את הסקייל הגולמי כמנוף. והמודל הזול יותר הוא גם המהיר יותר, הן בתפוקה והן בעלות לכל משימה, וזה ההפך מהפשרה הרגילה. Xiaomi לא מוכרת לך הנחה בתמורה לסבלנות. היתרון של DeepSeek הוא זמן לטוקן הראשון, 1.62 שניות לעומת 2.15 — אמיתי, אבל הקטגוריה היחידה שבה V4 Pro מוביל.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

למה אותה גרסת אינדקס חשובה כאן

השוואת מודלים עם משקלים פתוחים בין עדכוני גרסאות של האינדקס היא הדבר שגורם לרוב ההשוואות המפורסמות להשתבש, ולכן מספר הגרסה אינו הערת שוליים. Artificial Analysis בנתה מחדש את ה-Intelligence Index כ-v4.3 בספטמבר 2026, והציונים השתנו באופן מהותי מעבר לגבול הזה — Claude Opus 5 איבד שלוש נקודות בין v4.2 ל-v4.3, ותחום המשקלים הפתוחים עבר מיון מחדש. שני המספרים שלמעלה הם v4.3.2, מה שאומר שה-46 וה-36 ניתנים להשוואה ישירה זה לזה. הם אינם ניתנים להשוואה למספרים הישנים יותר שתמצאו מצוטטים במקומות אחרים עבור כל אחד מהמודלים.

זה לא תרחיש היפותטי. DeepSeek V4 Pro דווח בהרחבה כ-53 בסולם מדד קודם באוגוסט 2026, והסיקור שלנו מאותה תקופה כלל זאת. ב-v4.3.2 אותו מודל נקרא 36. שום דבר במודל לא השתנה; הסרגל כן. אם יש לך גיליון אלקטרוני עם 53 לצד 46 עבור MiMo-V2.6-Pro, יש לך השוואה שתַפנה אותך למודל הלא נכון. הזיווג הנכון הוא 46 מול 36, והמסקנה הנכונה היא שהמודל שיצא חמישה שבועות לאחר מכן, עם שני שלישים ממספר הפרמטרים, מקדים באופן מהותי.

פער הדיווח בין שתי המעבדות

יש הבדל שני, עדין יותר, והוא נוגע למה שכל מעבדה מוכנה לתת לבדוק.

ה-46 של MiMo-V2.6-Pro הוא מדידה של Artificial Analysis. בית ההערכה הפעיל חבילה משלו — עשר הערכות בתחומי הסקה, ידע, מתמטיקה וקידוד — על המודל שפורסם ופרסם את התוצאה, יחד עם נתוני התפעול: 134.3 אסימונים/שנייה, 2.15 שניות לאסימון הראשון, הנחת מטמון של 99%, $0.13 למשימת אינדקס, ועלות הערכה כוללת של $206.66. זהו נתון של צד שלישי על המודל של Xiaomi.

המספרים הסוכניים המרכזיים של DeepSeek V4 Pro הם של DeepSeek עצמה, והפער בינם לבין המספרים הבלתי־תלויים תועד. חומר ההשקה של החברה מדווח על Terminal-Bench 2.1 בתוצאה 87.9, DeepSWE ב-62.7, CyberGym ב-83.3 ו-SWE-bench Verified ב-80.6. הרצות בלתי־תלויות מציבות את Terminal-Bench 2.1 על 78.7 — כתשע נקודות מתחת לנתון הספק — ואת Artificial Analysis Coding Index על 68.8. אף אחד ממספרי הספק הללו לא שוחזר, וגודלו של הפער ב-Terminal-Bench הוא הסיבה להתייחס לשאר הסט כאל טענות ולא כאל מדידות.

לשיאומי יש גרסה משלה של אותה בעיה. לוח המחוונים שלה מדווח כי MiMo-V2.6-Pro עובר מ-58.4 ל-72.57 ב-DeepSWE v1.1 לאורך ריצת למידת החיזוק שלו, כשהוא מוערך על תשתית ההערכה של שיאומי עם mini-swe-agent בממוצע של שלוש. זו אינה הגשה ללוח דירוג ואף גורם חיצוני לא הריץ אותה מחדש. כך שאף אחד מהמודלים אינו מגיע עם אישור בריא על מבחני ספק. ההבדל הוא ש-MiMo-V2.6-Pro מגיע גם עם ציון מורכב בלתי תלוי שלא היה להשקת DeepSeek ברגע המקביל — ואם אתם בוחרים ביניהם על סמך ראיות ולא על סמך שיווק, זו האסימטריה שצריכה לשאת משקל.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

איך זה נראה בפרודקשן

ההבדל במודאליות הוא הפיצול המעשי, והוא נוטה לטובת DeepSeek לעתים רחוקות יותר ממה שפער עשר הנקודות מרמז. אם הפייפליין שלך קולט צילומי מסך, קובצי PDF המוצגים כתמונות, פריימים של וידאו או אודיו, MiMo-V2.6-Pro מטפל בזה באופן מקורי במודל אחד, ו-DeepSeek V4 Pro לא יכול לטפל בזה בכלל — תצטרך מודל ראייה נפרד לפניו, מה שאומר חוזה שני, מצב כשל שני וחשבון שני. אם עומס העבודה שלך הוא הסקה בטקסט בלבד, המודאליות הנוספת היא משקל מת שאתה לא משלם עליו דבר.

העלות לכל משימת אינדוקס היא המספר הנוסף שצריך לזכור. $0.13 מול $0.67 הם פער של פי חמישה על מערך משימות מבוקר וזהה, שנמדד באותה צורה לשניהם. DeepSeek מפעיל לוח חיוב של שעות שיא/שעות שאינן שיא, שיכול להפחית באופן משמעותי את התעריף האפקטיבי שלו בהתאם למועד שבו אתה מבצע קריאה, כך שהיחס בעולם האמיתי מצטמצם בשעות שאינן שיא ומתרחב בשעות שיא — פרט שחשוב אם התעבורה שלך מתאפיינת בפרצים ואינך יכול לבחור מתי היא תגיע.

כאן יש לצד של DeepSeek יתרון אמיתי שאין לו שום קשר למודל: הוא נמצא בפלטפורמה שלנו. אפשר להגיע אל DeepSeek V4 Pro בתור deepseek/deepseek-v4-pro דרך מפתח OrcaRouter במחיר המחירון של הספק עם 0% תוספת, עם מעבר אוטומטי בין ספקים וה-routing DSL זמין מעל — כך שחישובי שיא/שפל, פער הספקים ומסלול הנפילה הם כולם דברים שאתם מגדירים ולא דברים שאתם בונים. MiMo-V2.6-Pro אינו נמצא בפלטפורמה שלנו, ונאמר זאת בפשטות: להגיע אליו היום משמעו הפלטפורמה של Xiaomi עצמה או אחד מהקטלוגים של צד שלישי שמפרטים אותו, ו-Artificial Analysis ספר ספק API אחד בלבד עבורו בזמן הלכידה. מסלול אחד אינו מסלול ייצור, וזהו הטיעון החזק ביותר לכך שיש להתייחס ל-MiMo-V2.6-Pro כמודל שיש להעריך עכשיו ולנתב אליו בזהירות, עם משהו אחר מאחוריו.

איזה מהם, ומתי

בחרו ב-DeepSeek V4 Pro אם העבודה שלכם היא טקסט בלבד, אם אתם זקוקים לתקרת הפלט של 384K, אם אתם רוצים את הזמן המהיר ביותר עד לאסימון הראשון מבין השניים, או אם אתם כבר נמצאים בפלטפורמה שלנו ורוצים מסלול בקוד פתוח עם טריליון פרמטרים, עם מעבר אוטומטי לגיבוי וללא אינטגרציה חדשה. הוא המכהן מסיבה טובה, ולהיות מבוגר בחמישה שבועות פירושו חמישה שבועות של כלים, קוונטיזציה ומתכוני הגשה שמודל מספטמבר טרם צבר.

בחרו ב-MiMo-V2.6-Pro אם המשימה היא מולטימודלית, אם עלות לכל משימה היא הגורם הדומיננטי בכלכלת היחידה שלכם, אם התפוקה חשובה יותר מחצי שנייה של השהיה, או אם אתם רוצים את מוביל המשקולות הפתוחות הנוכחי במדד הנמדד באופן בלתי תלוי. רישיון MIT על שניהם אומר ששאלת המשקולות מוכרעת ממילא — תוכלו להריץ כל אחד מהם על החומרה שלכם, לכוונן אותו ולהפיץ אותו מסחרית.

התצורה שכדאי לשקול אינה בחירה כלל. נתב מאפשר לך לשמור על מסלול DeepSeek להסקה טקסטואלית בלבד בתעריפי שעות שפל ולהוסיף מסלול MiMo לבקשות הרב-מודאליות, עם מנגנון גיבוי לפני המסלול הדק יותר. זה לא גידור; זה התאמה של כל בקשה למודל שבאמת מטפל בה, וזו תשובה זולה ועמידה יותר מאשר לבחור מנצח ולקוות שהעומס לא ישנה צורה.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

השאלה שההשוואה הזו עדיין לא יכולה לענות עליה

הבנצ'מרקים המצוטטים ביותר של שני המודלים מבוצעים על ידי הספק ואינם משוחזרים. עבור DeepSeek V4 Pro הפער הזה פתוח מאז אוגוסט, וזו הסיבה שהציונים העצמאיים שלו נקראים נמוכים יותר ממספרי ההשקה שלו. עבור MiMo-V2.6-Pro המדד המשולב העצמאי קיים, אבל הפילוח הסוכני לא — Artificial Analysis מפרסמת 46 ולא את הפיזור לפי הערכה שמתחתיו, וזה הפרט שאומר לך אם מודל שייך ללולאת סוכן או לצינור שאלות-תשובות.

עד שהפיזור הזה יפורסם, ועד שמישהו יריץ מחדש את הארנס DeepSWE של Xiaomi, העמדה הניתנת להגנה צרה יותר מהשיווק של כל אחת מהמעבדות: MiMo-V2.6-Pro מוביל במדד משולב עצמאי ובעלות מדודה לכל משימה, ואילו DeepSeek V4 Pro מוביל בבגרות, באורך הפלט, בהשהיית הטוקן הראשון ובכך שהוא נגיש דרך נתיב שיש מאחוריו יתירות. חמישה שבועות הם יתרון התחלה קצר, וזהו היתרון היחיד שיש ל-DeepSeek.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית