
MiniCPM-V 4.7 לעומת Microsoft Mage-VL: שני הימורים שונים בתכלית על מה שמודל ראייה צריך לעלות לפריים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
MiniCPM-V 4.7 ו-Microsoft Mage-VL הם שניהם מודלים של שפה-חזות שטוענים שהם חוסכים לך טוקנים, והם מגיעים לשם בדרכים מנוגדות. Mage-VL, שהושק על ידי Microsoft ב-25 ביולי 2026, תוקף את צד הווידאו: הוא לווה את המבנה של קודק וידאו, שומר כל patch של מסגרת עוגן ורק את ה-patches של המסגרות החזויות שנושאים תנועה אמיתית, וטוען להפחתה של יותר מ-75% בטוקנים חזותיים עם האצה של עד פי 3.5 בזמן שעון לעומת דגימת מסגרות אחידה. MiniCPM-V 4.7, שהועלה על ידי OpenBMB ב-6 באוקטובר 2026, תוקף את צד הרצף: MoE דליל עם 35.2 מיליארד פרמטרים, ש-30 מתוך 40 השכבות שלו במסלול קשב ליניארי, מה שגורם ל-KV cache לגדול לאט לאורך הקשר של 256K. מודל אחד דוחס את מה שהוא מסתכל עליו. האחר דוחס את מה שהוא זוכר. ורק אחד מהם מגיע עם משהו שאפשר להעריך.
מה כל אחד מהם הוא
Microsoft Mage-VL הוא מודל בסיס מולטימודלי קודק-נייטיב, עם סטרימינג פרואקטיבי, בקנה מידה של 4B, שיצא תחת Apache-2.0 עם דו"ח טכני וסעיף הערכה משמעותי. הוא נבנה במכוון כנגד מה שהמחברים מכנים פרדוקס מורבק של מודלים חזותיים-לשוניים — חזק בהיסק לא מקוון, איטי בתפיסה בזמן אמת. המקודד החזותי, Mage-ViT, מאומן כולו מאפס על כ-100 מיליון תמונות וסרטונים ללא תוויות ולא מאותחל מ-ViT מאומן מראש באינטרנט, והרכיב המאומן מראש היחיד במערכת הוא עמוד השדרה הלשוני Qwen3-4B-Instruct-2507. נקודת הביקורת המלאה היא מודל מאוחד יחיד שמבצע הבנת תמונות, היסק וידאו לא מקוון, ופרשנות סטרימינג מבוקרת אירועים ללא וריאנטים נפרדים, וכן microsoft/Mage-ViT מהדורה מספקת את המקודד בפני עצמו. הוא צבר כ-10,600 הורדות ו-420 לייקים מאז יציאתו.
MiniCPM-V 4.7 הוא openbmb/MiniCPM-V-4.7-35B-A3B, צ'קפוינט BF16 בעל 35,212,875,824 פרמטרים ב-16 שברים בסך כולל של 70.4 GB, נכתב על ידי Transformers 5.2.0 והועלה ב-6 באוקטובר 2026 ללא כרטיס מודל.

תצורת הטקסט שלו מסומנת בשם qwen3_5_moe_text עם 256 מומחים ו-8 פעילים לכל טוקן; מערך ה-layer_types שלו מפעיל שלוש שכבות קשב ליניארי לכל שכבת קשב מלא אחת לאורך 40 שכבות; מגדל הראייה שלו הוא המודל הפנימי minicpmv4_7_vision עם 27 שכבות, דגימה יורדת של פי 16 ועד תשעה פרוסות תמונה. ההקשר הוא 256K. במאגר יש אפס הורדות, שלושה לייקים, ללא מבחני ביצועים וללא רישיון.
שש השורות שקורא יכול לבדוק
אותם שישה ממדים, בשני הצדדים. היכן שמספר אינו קיים, הפער נשאר גלוי.
• פרמטרים — Mage-VL: 4.74B, צפוף, כולם פעילים לכל טוקן. MiniCPM-V 4.7: 35.2B בסך הכול, דליל, 8 מתוך 256 מומחים לכל טוקן. המספר של MiniCPM אינו בר-השוואה לזה של מודל צפוף.
• רישיון — Mage-VL: Apache-2.0, מצוין בכרטיס ובתגיות המאגר. MiniCPM-V 4.7: לא הוצהר דבר.
• מניין מגיע החיסכון בטוקנים — Mage-VL: דלילות טוקנים ויזואליים במקודד, תואמת קודק, בטענה להפחתה של למעלה מ-75%. MiniCPM-V 4.7: תשומת לב לינארית במפענח, שמצמצמת את גידול מטמון ה-KV ברצפים ארוכים אך אינה מפחיתה את הטוקנים שמזינים לו.
• הקשר — Mage-VL: אומן דרך שלב של הקשר ארוך על 350K סרטונים כחלונות קודק מתגלגלים של עד 384 או 768 פריימים. MiniCPM-V 4.7: max_position_embeddings: 262144.
• מקור מקודד הראייה — Mage-VL: מאפס, אומן על כ־100 מיליון פריימים ללא תיוג; הכרטיס מדווח על 85.69% ב-ImageNet עם 256 טוקנים ועל שיפור מונוטוני עם תקציב הטוקנים. MiniCPM-V 4.7: מגדל ה-lineage עושה שימוש חוזר בעיצוב של MiniCPM-V 4.6 באותו מבנה של 1152 מוסתרים ו-27 שכבות, עם ברירת מחדל של דגימה מוקטנת פי 16.
• ראיות — Mage-VL: כרטיס מלא עם DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 ופער CrossPoint של +53.1 לעומת Qwen3-VL-4B, הכל מדווח על ידי הספק מול backbone תואם. MiniCPM-V 4.7: אין.
• התנהגות סטרימינג — Mage-VL: שער קוגניציה שנותן ציון לכל חלון מתגלגל ונשאר שקט עד שאירוע מסתיים, מאומן על ~3.3M דגימות סטרימינג. MiniCPM-V 4.7: לא מתואר בשום מקום.

החלק שכולם טועים בו לגבי המספרים של Mage-VL
טבלאות הבנצ'מארק של הכרטיס Mage-VL חזקות, והחזקות שבהן הן גם אלה שקל ביותר לקרוא שלא כהלכה. שורות ההשוואה מעמידות את Mage-VL-4B מול Qwen3-VL-4B, Phi-4-Multimodal-Instruct ו-Phi-4-Reasoning-Vision, והרווחים הבולטים — +22.5 ב-QVHighlight, +24.5 ב-VideoEval-Pro, +53.1 ב-CrossPoint — אמיתיים במובן זה שהם מופיעים בטבלאות של הספק. הם גם מדידות של הספק עצמו, שהופקו בידי הצוות שאימן את המודל, על אותה מערכת בדיקה. אף גורם בלתי תלוי לא שחזר אותן. זה נורמלי עבור מודל בן ארבעה חודשים וזה לא מהווה כתם נגדו, אבל כן פירושו שהפועל הנכון הוא "מדווח", לא "משיג".
שני דברים ראויים לזקיפה לזכות מעבר לטבלאות. ראשית, עיצוב ה-backbone המותאם — החזקת המפענח Qwen3-4B קבוע והחלפה רק של ה-ViT — הוא ראיה נקייה יותר ממיקום בלוח דירוג, מפני שהוא מבודד את המערך החזותי ולא את המערכת כולה. שנית, קורפוס האימון של Mage-ViT הוא כ-100 מיליון פריימים ללא תיוג, לעומת מיליארדי זוגות תמונה-טקסט שבהם משתמשים מקודדים שעברו אימון מקדים על נתוני אינטרנט, כך שההתאמה להתנהגות של SigLIP2-at-10B-class בהבחנה בין אשכולות היא טענה ספציפית וניתנת לבדיקה בנוגע ליעילות נתונים, ולא התפארות כללית.
ל-MiniCPM-V 4.7 אין שום דבר מזה. לא גרסה חלשה יותר — כלום.

אין שום טבלה, לא של ספק ולא אחרת, וקובץ התצורה שמתאר את הארכיטקטורה מחריג את עצמו במפורש מלהצהיר דבר על דיוק.
אדריכלות: שתי תשובות לאותה שאלה
שני המודלים מנסים לענות על השאלה "כיצד להוזיל הסקה מולטימודלית", והניגוד מאלף משום ששתי התשובות משלימות זו את זו ולא מתחרות זו בזו.
Mage-VL מצמצם את הקלט. רשת הטלאים שלו בגודל 16×16 משותפת בין פריימי עוגן לפריימים חזויים, והפריימים החזויים תורמים טלאים רק היכן שהקודק מוציא סיביות — כלומר היכן שנמצאים תנועה ופרט חדש. התוצאה היא זרמי טוקנים באורך משתנה לכל פריים, ולכן הסטאק זקוק למקרן שיכול למסור רצף משתנה למפענח סיבתי, ולכן אותו ממשק יכול לקבל וקטורי תנועה של H.264/HEVC או מפת קצב נלמדת של קודק עצבי בלי אימון מחדש. לאחר מכן, קידוד רוטורי תלת-ממדי שומר על עקביות של מיקומים מרחביים-זמניים לאורך הדלילות. תקציב הטוקנים הוא הכמות שמנוהלת.
MiniCPM-V 4.7 מפחית את המצב. שכבות הקשב הלינאריות שלו שומרות על מצב חוזר בגודל קבוע במקום מטמון מפתח-ערך גדל, כך שעלות הזיכרון של שיחה ארוכה מפסיקה לגדול באופן לינארי עם מספר הטוקנים. תקציב הרצף שלו הוא הכמות המנוהלת, והקשר של 256K הוא התמורה. באופן בולט, התצורה של MiniCPM-V 4.7 מפרסמת את הדגימה החזותית המוקטנת פי 16 — היא גם דוחסת את הקלט — אך שותקת בשאלה אם היא שומרת על מצב פי 4 הניתן להחלפה ש-MiniCPM-V 4.6 חשף.
במילים פשוטות: הטריק של Mage-VL משתלם בווידאו שבו רוב הפריימים כמעט זהים לשכניהם. הטריק של MiniCPM-V 4.7 משתלם במסמכים ארוכים ובשיחות מרובות-תורות ארוכות שבהן הטוקנים מצטברים. צינור עיבוד שקולט שידור חי ואז מקיים עליו שיחה ארוכה ירוויח משניהם, ואף אחד מהמודלים עדיין לא עושה את העבודה של האחר.
משלבים אותם בתהליך עבודה אמיתי
Mage-VL הוא פרקטי לנסות כבר היום: צ'קפוינט אחד, ארכיטקטורה מתועדת, Apache-2.0, וכרטיס שמספר לך מה המאגר כולל. הוא זמין מאז יולי, ולכלים שסביבו היה זמן להתייצב.
MiniCPM-V 4.7 אינו מעשי לניסיון היום, מסיבות משעממות. 70 GB ב-BF16 ללא קוונטיזציה פירושו זיכרון מאיץ שסביר להניח שאין לך פנוי, ורישיון חסר פירושו שהשאלה אם מותר לך להשתמש בו בכלל נותרת פתוחה. נתיבי הקוד המותאמים דורשים trust_remote_code, והאם לשילוב MoE עם קשב ליניארי יש קרנלים במערך ההגשה שלך — לא נבדק.
המשותף לשניהם הוא שמודל ראייה המתארח בעצמכם הוא רכיב אחד במערכת שאמורה גם לקרוא למודלים חזיתיים. זהו הטיעון להציב את החצי המתארח מאחורי ראוטר יחיד ולא מאחורי חוזה שני ו-SDK נוסף: OrcaRouter מגיע ליותר מ-200 מודלים במפתח אחד, מעביר הלאה את מחיר המחירון של כל ספק בלי תוספת מצדנו, ומבצע מעבר אוטומטי כשספק נחלש. לא Mage-VL ולא MiniCPM-V 4.7 הם מודל מתארח בשירות הזה — שניהם משקלים שאתם מארחים בעצמכם — אז התייחסו לכך כתשתית בצדו המרוחק של מסירת השליטה, ולא כערוץ זמינות לאף אחד משני המודלים.
פסק דין
Mage-VL הוא מודל גמור, בעל רישיון, שעבר בנצ'מרק, עם פילוסופיית תכנון ספציפית ומנומקת היטב, והטיעון בעדו נשען על הזרמת וידאו וחשיבה מרחבית, שבהן המקודד הילידי-קודק שלו עושה משהו שונה מבחינה מבנית מכולם. MiniCPM-V 4.7 הוא צ'קפוינט גדול יותר, חסר רישיון ולא נמדד, שפילוסופיית התכנון שלו קריאה אך התנהגותו היא בבחינת חידה. בכל מה שקורא יכול לפעול על פיו היום, Mage-VL מנצח כברירת מחדל — לא מפני שהוא טוב יותר, אלא מפני שהוא היחיד מבין השניים שאפשר בכלל לשפוט. חזרו להשוואה הזו כאשר ה-README של MiniCPM-V 4.7 יופיע; אם אותו יום יביא בנצ'מרקים ורישיון, השאלה המעניינת תהיה האם MoE עם קשב ליניארי בהקשר של 256K מנצח מקודד דלילות ילידי-קודק על וידאו ארוך, וזהו קרב פתוח באמת.
