כרטיס כותרת ראשי עבור המאמר 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro', שמעליו הקיקר 'OrcaRouter · model radar — serving tiers', עם כותרת המשנה 'צ׳קפוינט 1T אחד, שתי דרכים לקנות אותו: $0.435/$0.87 למיליון טוקנים, או $4.35/$8.70 עבור פי עשרה מהירות לכאורה.' מתחתיו שני כרטיסים: משמאל, 'Standard tier', שעליו כתוב '134.3 טוקני פלט לשנייה כפי שנמדדו על ידי Artificial Analysis; חלון הקשר של 1M; משקולות MIT ב-Hugging Face'; מימין, 'UltraSpeed tier', שעליו כתוב '$4.35 נכנס / $8.70 יוצא למיליון; אותו צ׳קפוינט, אותה הצהרת איכות; מתארח בלבד'. ארבעה צ׳יפים מציגים 'AA Index: 46', 'Total params: 1.0T', 'Active params: 42B', ו-'DeepSWE: 72.57 vendor-reported'. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Xiaomi MiMo-V2.6-Pro-UltraSpeed לעומת Xiaomi MiMo-V2.6: צ'קפוינט אחד, פי עשרה מהמחיר

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Xiaomi MiMo-V2.6-Pro-UltraSpeed ו-Xiaomi MiMo-V2.6-Pro אינם שני מודלים. הם מודל אחד שנמכר בשתי דרכים. שניהם מוגשים מאותו צ׳קפוינט MiMo-V2.6 בעל טריליון פרמטרים ש-Xiaomi פרסמה בספטמבר 2026 — דרגת ה-Pro של סדרת Xiaomi MiMo-V2.6, שהאח הקטן שלה הוא Xiaomi MiMo-V2.6-Flash. ההבדל בין שתי ההצעות של Pro הוא כולו בכמה מהר הטוקנים יוצאים ובכמה משלמים עליהם. הדרגה הסטנדרטית דורשת 0.435 דולר למיליון טוקני קלט ו-0.87 דולר למיליון טוקני פלט. דרגת UltraSpeed דורשת 4.35 ו-8.70 דולר. זה יחס נקי של עשרה לאחד בשני צידי המונה, והוא מקנה טענה של בערך פי עשרה ממהירות הפלט — טענה ש-Xiaomi מציגה לגבי סטאק ההגשה שלה עצמה, ואחת שאף מבחן ביצועים בלתי תלוי לא פרסם עבורה מספר עדיין.

אז השאלה המעניינת היא לא איזה מודל טוב יותר, אלא האם מכפיל פי עשרה הוא המחיר הנכון עבור מהירות גבוהה פי עשרה, ומסתבר שלכך יש תקדים שכדאי לקרוא לפני שמתחייבים למסלול פרודקשן עבורו.

השכבה המהירה היא החלטת הגשה, לא החלטת מודל

ההצגה של Xiaomi עצמה עבור סדרת UltraSpeed היא שהיא משתווה למודל הסטנדרטי באיכות ונבדלת רק בתפוקה. זה חשוב יותר ממה שזה נשמע, כי זה מסיר את הסיבה הרגילה להתלבט לגבי דרגה חדשה. אתה לא מהמר על האישיות של נקודת ביקורת אחרת, התנהגות הסירוב שלה, או המוזרויות שלה בעיצוב. אתה מהמר שאותם משקלים, שמופעלים דרך תצורת הגשה אגרסיבית יותר, יתנהגו באותו אופן לפרומפטים שלך. אם זה מחזיק, מעבר בין שתי הדרגות הוא שינוי תצורה, לא הגירה.

מה שיש בתוך תצורת ההגשה הזו לא תועד עבור הדור הזה. שכבת ה-UltraSpeed הקודמת, שנבנתה על נקודת הביקורת MiMo-V2.5-Pro ביוני 2026, תוארה על ידי Xiaomi ככזו שמשתמשת בכימות FP4 בשכבות המומחים בלבד, בסכימת פענוח ספקולטיבי מקבילית-בלוקים בשם DFlash, ובסביבת הרצה בשם TileRT, והיא רצה על צומת בודד עם שמונה מעבדים גרפיים. Xiaomi לא פרסמה את הפרטים המקבילים עבור שכבת ה-V2.6. יש להתייחס למחסנית הקודמת כהקשר לאופן שבו מושגת המהירות, ולא כתיאור של מה שרץ כעת.

המערך שהוא נמצא בו קצר. לצד שתי רמות ה-Pro נמצא MiMo-V2.6-Flash, האח הקטן עם 309 מיליארד פרמטרים בסך הכול ו-15 מיליארד פעילים. Pro הוא דגם הדגל מסוג תערובת מומחים דלילה: Artificial Analysis מציין אותו עם 1.0 טריליון פרמטרים בסך הכול, עם 42 מיליארד פעילים לכל טוקן, חלון הקשר של מיליון טוקנים, ורישיון MIT עם משקולות ב-Hugging Face. אלה המספרים שצריך לזכור, כי כל ההשוואה נשענת עליהם.

מה שלמעשה מאומת, ומה שלא

A two-column scoreboard titled 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro — the scoreboard'. The left column, badged VENDOR-REPORTED, is headed 'MiMo-V2.6-Pro-UltraSpeed' and reads: Output speed — about 10x the standard tier, Xiaomi's claim; Price in — $4.35 per 1M tokens; Price out — $8.70 per 1M tokens; Context — 1M tokens; Weights — hosted only, none published; Independent speed test — none published. The right column, badged INDEPENDENTLY MEASURED, is headed 'MiMo-V2.6-Pro' and reads: Output speed — 134.3 tokens/sec per Artificial Analysis; Price in — $0.435 per 1M tokens; Price out — $0.87 per 1M tokens; Context — 1M tokens; Weights — MIT, on Hugging Face; Independent speed test — Artificial Analysis, 114-model class. A footer reads 'UltraSpeed figures are Xiaomi's own serving claims with no independent verification. MiMo-V2.6-Pro figures per Artificial Analysis, read 2026-09-22.' The OrcaRouter logo is composited in the bottom-right corner.

האסימטריה בין שתי העמודות שלמעלה היא הדבר החשוב ביותר במאמר הזה. כמעט כל דבר שניתן למדוד בנוגע לזיווג הזה נמדד בצד האיטי.

Artificial Analysis בחנה את MiMo-V2.6-Pro ומפרסמת עבורו מדד Intelligence Index של 46 — הציון הגבוה ביותר בקטגוריית 114 המודלים שאליה היא משייכת את המודל. היא מודדת 134.3 אסימוני פלט לשנייה דרך ה-API של Xiaomi, לעומת חציון קטגורייתי של 77.9, וזמן עד למקטע הראשון של 2.15 שניות לעומת חציון של 2.34. היא מציינת את העלות לכל משימת Intelligence Index כ-$0.13, הנחת מטמון של 99% על מחיר הקלט, ופירוט פלט של 140 מיליון אסימונים. אלה נתונים בלתי תלויים על תצורה בעלת שם, והם עוגן התפוקה הקשיח היחיד שיש להשוואה הזו.

עבור UltraSpeed, הרשימה המאומתת קצרה בהרבה:

• מהירות פלט — בערך פי עשרה מהמסלול הסטנדרטי, כפי שנמסר על ידי Xiaomi וחזר על ידי הפלטפורמות שמפרטות אותו. אף צד שלישי לא פרסם מדידת טוקנים לשנייה עבור המסלול הספציפי הזה.

• מחיר — 4.35 דולר למיליון טוקני קלט ו-8.70 דולר למיליון טוקני פלט, פי עשרה מהשכבה הסטנדרטית בשניהם. לא מופיעה שכבת מטמון לצד שני התעריפים האלה.

• איכות — "תואם את המקור", שוב הצהרה של הספק. לא פורסמה הערכה בלתי תלויה של נקודת הקצה UltraSpeed, ולכן הטענה שהאיכות לא השתנתה לא נבדקה ולא הופרכה.

• הקשר ומודאליות — 1,048,576 טוקנים וקלט נייטיבי של טקסט, תמונה, וידאו ואודיו, בירושה מצ'קפוינט הבסיסי.

יש גם בנצ'מרק של ספק שראוי להזכירו דווקא בגלל האופן שבו הוא נדד. לוח המחוונים הציבורי של Xiaomi ללמידת חיזוק, שהעביר בשידור חי את ריצות ה-post-training של V2.6 בספטמבר 2026, מדווח על ציוני DeepSWE v1.1 של 72.57 עבור ריצת ה-Pro ושל 65.68 עבור Flash. אלה מגיעים מההערכה הלא-מקוונת של Xiaomi עצמה, תוך שימוש במערך בדיקה (harness) מסוג mini-swe-agent בממוצע של שלוש ריצות; הם מעולם לא הוגשו ללוח הדירוג הציבורי, והם לא שוחזרו מחוץ למעבדה. אם ראיתם את 72.57 מצוטט כציון של לוח דירוג, זהו מספר של ספק שלובש את בגדיו של לוח דירוג.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 22, 2026, headed 'MiMo-V2.6-Pro Intelligence, Performance & Price Analysis' with the labels 'Open weights model' and 'Released September 2026'. The metric strip reads Intelligence #1/114, Speed #11/114, Cost #12/114 and Verbosity #18/114. The cost panel reads $0.435 in and $0.87 out per million tokens, a 99% cache discount, and $0.13 per Intelligence Index task; the speed panel reads 134.3 output tokens per second, ranked eleventh of 114 against a median of 77.9, with a first-chunk time of 2.15 seconds; verbosity reads 140M output tokens. The comparison summary states the model scores 46 on the Artificial Analysis Intelligence Index against a class median of 18, is notably fast at 134 tokens per second against a median of 78, is somewhat verbose, supports text, image, speech and video input and outputs text, and has a 1M-token context window. Technical specifications list reasoning enabled, input modalities text and image, output text, a 1M context window, 1.0T total parameters, 42B active parameters, an MIT licence, and model weights on Hugging Face.

התקדים: בפעם הקודמת שיאומי גבתה פי שלושה, לא פי עשרה

זו לא דרגת המהירות הראשונה של Xiaomi, והקודמת היא ההשוואה המועילה ביותר בכל הסיפור — כי המכפיל השתנה.

MiMo-V2.5-Pro-UltraSpeed הגיע ביוני 2026, נבנה על בסיס הצ'קפוינט V2.5-Pro, ותומחר בערך פי שלושה מתעריף הפלט של המודל הסטנדרטי. המסר השיווקי של Xiaomi אז היה אותו מסר שהיא מעבירה כעת: בערך פי עשרה ממהירות הפלט. הסיקור באותה תקופה דיווח על תפוקה מתמשכת של כ-1,000 טוקנים לשנייה עם שיאים קרוב ל-1,200, על צומת אחת עם שמונה GPUs, אם כי דף המודל עצמו פירט טווח רחב יותר של 500 עד 1,000 — ואף אחד מזה לא אומת באופן בלתי תלוי. הגישה הוגבלה לטופס בקשה ולא להרשמה פתוחה.

העמידו את השניים זה לצד זה, והשינוי הוא הסיפור. מכפיל המהירות נשאר בערך עשר. מכפיל המחיר עבר משלוש לעשר. זו עסקה שונה מאוד עבור אותו סוג של שדרוג, ו-Xiaomi לא פרסמה הסבר לשינוי. ייתכן שזה משקף הגשה יקרה יותר באמת — נקודת ביקורת גדולה יותר, תצורת פענוח אגרסיבית יותר, או קיבולת הדוקה יותר בעת ההשקה. ייתכן שזה משקף תמחור של חלון השקה בדרגה שהייתה זמינה ליום אחד בלבד. מה שעדיין אין לו הוא הצדקה ציבורית שאפשר לבדוק.

הבדל מעשי אחד שווה לציון לכל מי שהשתמש ברמת V2.5: זו הייתה גרסת ניסיון בגישה מוגבלת. רמת V2.6 מוצגת כזמינה באופן כללי דרך ה-API של Xiaomi עצמה וכמה פלטפורמות צד שלישי, בתעריפים המפורסמים, בלי צורך בשלב הגשה. מה עוד שהשתנה, החיכוך לנסות אותה ירד.

מה עולה פי עשרה בעומס עבודה אמיתי

אחוזים מסתירים את הצורה של זה, אז הנה החשבון על הרצת סוכן קונקרטית — כזו שקוראת 20 מיליון טוקני קלט ופולטת 2 מיליון טוקני פלט לאורך חייה. זהו עומס עבודה סוכני כבד אך לא אקזוטי, מהסוג שבו מודל מבצע לולאות של קריאות לכלים וקורא מחדש את ההקשר של עצמו.

• מסלול סטנדרטי, קלט — 20M טוקנים ב-0.435 דולר למיליון: 8.70 דולר.

• רמה סטנדרטית, פלט — 2 מיליון טוקנים ב-0.87 דולר למיליון: 1.74 דולר.

• מסלול סטנדרטי, סה״כ — $10.44 לכל הרצה.

• מסלול UltraSpeed, קלט — 20 מיליון טוקנים ב־$4.35 למיליון: $87.00.

• מסלול UltraSpeed, פלט — 2 מיליון טוקנים ב-$8.70 למיליון: $17.40.

• דרגת UltraSpeed, סה״כ — $104.40 לכל הרצה.

ההפרש הוא $93.96, והוא בדיוק פי עשרה מהחשבון כולו ולא פי עשרה משורה אחת בו, מפני ששני התעריפים משתנים יחד. ועתה הצד השני של המאזן. בקצב של 134.3 אסימוני פלט לשנייה שמודדת Artificial Analysis עבור הרמה הסטנדרטית, יצירת 2 מיליון אסימוני פלט אורכת קצת יותר מארבע שעות של זמן יצירה טהור. בקצב גבוה פי עשרה מכך זה אורך כעשרים וחמש דקות. אז התוספת של $94 מחזירה בסביבות שלוש וחצי שעות של זמן שעון קיר בהרצה הזו — בערך $27 עבור כל שעה שנחסכה, אם רוצים לנסח זאת כך.

האם העסקה הזו משתלמת תלוי לחלוטין בכמה ששעון הקיר שווה לך, ויש פרט אחד שמקשה על קריאה נאיבית. מחיר הקלט של המסלול הסטנדרטי מגלם הנחת מטמון של 99% בדף של Artificial Analysis, מה שאומר שחצי הקלט של החשבונית יכול להתכווץ לכמעט כלום בעומסי עבודה שקוראים מחדש את אותו הקשר. הרשומה של UltraSpeed מציגה את שני התעריפים המוצהרים ואין בה מסלול מטמון. אם עומס העבודה שלך עתיר מטמון, המכפיל האפקטיבי אינו עשר — הוא גרוע בהרבה, כי אתה מאבד את ההנחה בצד שבו שילמת כמעט כלום. אם עומס העבודה שלך עתיר פלט ודל מטמון, פי עשרה קרוב למספר האמיתי. מדוד את התמהיל שלך לפני שאתה סומך על אחד מהנתונים.

אסימטריית המשקלים הפתוחים

קיים הבדל מבני בין שתי השכבות שאין לו שום קשר למחיר או למהירות, והוא עשוי להיות חשוב יותר מכל אחד מהם.

MiMo-V2.6-Pro מופץ תחת רישיון MIT, כאשר המשקולות שלו מפורסמות ב-Hugging Face. הדבר מאפשר פריסה מסחרית, שינוי ואימון נוסף, והוא גם אומר שלמודל הסטנדרטי יש רצפת מחיר שאין ספק שיכול להסיר: אם התעריף של השירות המתארח מפסיק להיות הגיוני, תוכלו להריץ את נקודת הביקורת בעצמכם. לא תשיגו את התפוקה של Xiaomi בחומרה שלכם, ותשלמו על כרטיסי ה-GPU, אבל האפשרות קיימת והיא מגבילה את מה ששכבת השירות המתארח יכולה לגבות.

ל-UltraSpeed אין רצפה כזו. אין משקולות UltraSpeed, מפני שהדרגה היא סטאק ההגשה ולא המודל — הצ'קפוינט הוא אותו אחד שכבר ציבורי, ומה שאתה שוכר הוא היכולת של Xiaomi להריץ אותו במהירות. זה דבר לגיטימי למכור, וזה באותה צורה כמו כל דרגת מהירות אחרת בשוק. זה אכן אומר שלמחיר של פי עשרה אין בלם תחרותי מלבד ספקים אחרים שמריצים את אותן משקולות פתוחות, ואין פתח מילוט של אירוח עצמי אם המחיר יזוז שוב.

Screenshot of Xiaomi's MiMo homepage captured September 22, 2026, headed 'HELLO, I'M MiMo'. Two product cards are visible: 'Xiaomi MiMo-V2.6-Series', subtitled 'Frontier intelligence, all the modalities, built in public', and 'Xiaomi MiMo-V2.5-TTS Series'. Below them a 'Build with MiMo' section lists two numbered routes, '01 Web Demo' and '02 API Access', with the lines 'Interact with MiMo directly through the web' and 'Developer portal for quick integration of MiMo capabilities'.

קרא את זה מול תמונת הזמינות. הצ'קפוינט הסטנדרטי נגיש דרך הערוצים של Xiaomi עצמה ומספר פלטפורמות צד שלישי, והוא גם זמין כהורדה. דרגת ה-UltraSpeed נגישה דרך ה-API של Xiaomi עצמה ומספר פלטפורמות צד שלישי, וזו הדרך היחידה להשיג אותה. לכל מי ששוקל תלות ארוכת טווח, הבדל הזה באופציונליות ראוי לתמחור לצד התעריף לכל טוקן.

מי צריך לקחת איזה?

ההחלטה מתפצלת בצורה חדה לפי השאלה כמה מהעלות שלך מוקדש לטוקני פלט וכמה מתקציב ההשהיה שלך מוקדש להפקה ולא להמתנה בתור.

• השתמש ב-UltraSpeed כאשר עומס העבודה עתיר פלט, דל במטמון ואינטראקטיבי — יצירה ארוכה, לולאות סוכנים שבהן המודל כותב הרבה נימוקים בין קריאות לכלים, או כל דבר שבו אדם ממתין בצד השני של הבקשה.

• בחרו בדרג הסטנדרטי כשעומס העבודה עתיר-מטמון, סובלני-לאצוות, או רגיש-לעלות בשוליים — סיווג בכמות גדולה, מענה מבוסס-אחזור (retrieval-augmented) על קורפוס קבוע, ריצות הערכה לאורך הלילה, כל דבר שבו ארבע שעות של יצירה זה בסדר כי אף אחד לא מסתכל.

• בחר במסלול הסטנדרטי כשאתה רוצה את האפשרות לארח בעצמך. אם עמדת התאימות שלך דורשת משקולות שאתה יכול להחזיק, UltraSpeed לא זמינה לך בשום מחיר.

• אל תבחר באף אחד מהם עד שתמדוד. הטענה בדבר פי עשרה היא המספר הנושא את המשקל כאן, והיא כרגע הצהרה של ספק. אחר צהריים אחד שבו תריץ את הפרומפטים שלך דרך שתי הרמות מלמד אותך יותר מכל הנתונים שפורסמו, מפני שנתון התפוקה היחיד שמישהו אימת באופן עצמאי שייך לצד האיטי של ההשוואה.

בנקודה האחרונה הזו, המכניקה של בדיקת שכבת שירות זהה לבדיקת מודל, ושם שכבת ניתוב מוכיחה את מקומה. OrcaRouter מציע יותר מ-200 מודלים מאחורי מפתח API יחיד במחיר המחירון של הספק, עם 0% תוספת, כך ששינוי מחיר של ספק נוחת אצלכם באותו יום ולא בחידוש החוזה הבא. מעבר אוטומטי בין שרתים פירושו ששכבה שאתם עדיין בוחנים לעולם אינה נמצאת לבדה בנתיב ייצור, ושפת ה-DSL של הניתוב מאפשרת לכם לשלוח סוג אחד של בקשות לנקודת הקצה המהירה ואת כל השאר לרגילה, בלי לתחזק שתי אינטגרציות. שום דבר מזה אינו דורש דווקא את המודלים של Xiaomi — הנקודה היא שהחלטות ברמת השכבה כמו זו זולות לביטול כשהשכבות יושבות מאחורי מפתח אחד.

מה יפתור את זה?

המצב האמיתי של השאלה MiMo-V2.6-Pro-UltraSpeed לעומת MiMo-V2.6-Pro הוא שחציו נמדד וחציו נטען. בדרג הסטנדרטי יש מדד Intelligence Index עצמאי, נתון תפוקה עצמאי, ומשקולות פתוחות שפורסמו. בדרג המהיר יש מחיר, חלון הקשר, והבטחה של הספק שזה אותו מודל שפועל מהר יותר.

שלושה דברים יסגרו את הפער. מדידת תפוקה בלתי תלויה בנקודת הקצה UltraSpeed — Artificial Analysis מדדה את השכבה הסטנדרטית דרך ה-API של Xiaomi, כך שאותו טיפול אפשרי ופשוט עוד לא קרה. מדיניות מטמון עבור השכבה המהירה, מאחר שהיעדרה הוא מה שהופך חשבון יקר פי עשרה למשהו גרוע יותר בעבודה עתירת מטמון. וכל פרט מפורסם על מחסנית ההגשה של V2.6, כפי ש-Xiaomi תיעדה מומחי FP4, DFlash ו-TileRT עבור הדור V2.5.

עד אז, המחיר הגבוה פי עשרה הוא עובדה, והמהירות הגבוהה פי עשרה היא רק הצהרה. אם עומס העבודה שלכם עתיר פלט ומישהו ממתין, שווה לבדוק את ההצהרה הזו על הפרומפטים שלכם — ושווה לבדוק אותה מאחורי שכבה שמאפשרת לכם לחזור אחורה כבר באותו אחר הצהריים אם היא לא מחזיקה מעמד.