
MiniCPM-V 4.7 לעומת UI-Venus 2.9B: מודל ראייה כללי מול סוכן GUI ייעודי
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
MiniCPM-V 4.7 ו-UI-Venus 2.9B הם שניהם מודלים חזותיים-לשוניים שמסתכלים על צילום מסך ומפיקים טקסט, ושם מסתיים הדמיון — כי אחד מהם נבנה בדיוק למשימה הזו. UI-Venus 2.9B הוא סוכן GUI לשימוש כללי מבית inclusionAI, שיצא ב-26 באוגוסט 2026, שכל תכנונו מתמקד בהתבוננות בממשק, בחשיבה על מצב המשימה, בביצוע פעולה ובשילוב המשוב הנובע מכך; הוא מגיע עם דוח טכני, טבלאות בנצ'מרק על פני משימות GUI grounding, מובייל, ווב, שימוש במחשב ו-CAPTCHA, והערכה מפורשת של באיזו תדירות ניתן לשכנע אותו לבצע פעולה מסוכנת. MiniCPM-V 4.7 הוא צ'קפוינט דליל של תערובת מומחים (sparse mixture-of-experts) בעל 35.2 מיליארד פרמטרים, שהועלה על ידי OpenBMB ב-6 באוקטובר 2026 ללא כרטיס מודל, ללא רישיון וללא בנצ'מרק. השוואה בין מומחה לבין ג'נרליסט שלא נמדד היא תרגיל קצת יוצא דופן, והעמוד הזה מפרט במפורש היכן ההשוואה מחזיקה והיכן לא.
שני סוגים שונים מאוד של שחרור
UI-Venus 2.9B הוא inclusionAI/UI-Venus-2-9B, מודל בעל 9B פרמטרים שאותחל מ-Qwen3.5-9B ואומן לאחר מכן במיוחד כסוכן GUI. הכרטיס מתאר לולאה סגורה — לצפות בממשק, לחשוב על מצב המשימה, לבצע פעולה, לשלב את המשוב לתוך ההחלטה הבאה — שאומנה בשלושה שלבים: אימון ביניים מולטימודלי על מסלולי מובייל, ווב ושולחן עבודה מדומים בקנה מידה גדול; למידת חיזוק לא מקוונת המחולקת לחמש משפחות משימות; וזיקוק מרובה-מורים על-מדיניות המאחד מורים מתמחים בתחום למדיניות אחת. הוא מוערך על עיגון GUI, מובייל, ווב, שימוש במחשב ומבחני CAPTCHA, ובנפרד על בטיחות פעולות תוצאתיות: הכרטיס מדווח על שיעור הצלחת תקיפה של 11.3% על OSHarm ו-48.8% על OSBlind לעומת 25.3% ו-79.4% עבור בסיס Qwen3.5-9B שלו. האח התאום של OpenBMB, אגב, הסתכל על קרקע דומה: לארגון MiniCPM יש פרויקט AgentCPM-GUI מינואר 2026, אז זה נתיב ששתי המעבדות נכנסו אליו.
MiniCPM-V 4.7 הוא openbmb/MiniCPM-V-4.7-35B-A3B, 35,212,875,824 פרמטרי BF16 הפרוסים על פני 70.4 GB ושש עשרה רסיסים, הועלה ב-6 באוקטובר 2026.

עמוד שדרה טקסטואלי MoE דליל המתויג qwen3_5_moe_text — 256 מומחים, 8 לכל טוקן — מעל 40 שכבות עם תבנית קשב של שלוש לינאריות לאחת מלאה, מגדל ראייה פנימי בן 27 שכבות עם דגימה יורדת של 16× ועד תשעה פרוסות תמונה, וחלון הקשר של 256K. אין README, ולכן אין רישיון ואין בנצ'מרקים. שלושה לייקים, אפס הורדות, דיונים ריקים.
ההשוואה, עם הפערים שהושארו פתוחים
• מטרה — UI-Venus 2.9B: סוכן GUI, שאומן מקצה לקצה לאינטראקציה עם ממשקי משתמש. MiniCPM-V 4.7: מודל ראייה-שפה כללי; לא צוין למה הוא מותאם.
• פרמטרים — UI-Venus 2.9B: 9.41B, צפוף. MiniCPM-V 4.7: 35.2B סה"כ, דליל, 8 מתוך 256 מומחים לכל טוקן.
• מודל בסיס — UI-Venus 2.9B: מאותחל מ-Qwen3.5-9B, סטאק טקסט צפוף של Qwen. MiniCPM-V 4.7: סטאק טקסט MoE נגזר מ-Qwen3.5, מחלקה qwen3_5_moe_text. ענפים שונים של אותו עץ משפחה.
• עיגון ממשק — UI-Venus 2.9B: היכולת הליבה, עם משפחות משימות ייעודיות של עיגון ו-CAPTCHA באימון, ומערכת אימות מעוגנת בנקודות מפתח המשתמשת בהצבעת מודלים מרובים. MiniCPM-V 4.7: אין טענה ספציפית לעיגון, ולא מתועד פורמט פלט של קואורדינטות.
• הערכת בטיחות — UI-Venus 2.9B: מדווח על ASR של 11.3% ב-OSHarm ו-48.8% ב-OSBlind. MiniCPM-V 4.7: אין.
• ראיות — UI-Venus 2.9B: דוח טכני ב-arXiv, דף פרויקט, מאגר GitHub וטבלאות בנצ'מרק. MiniCPM-V 4.7: קובץ קונפיגורציה.
• כלי עבודה — UI-Venus 2.9B: התחלה מהירה עם vLLM עם דגל reasoning-parser, וכן המרות GGUF מהקהילה. MiniCPM-V 4.7: עדיין אין כלום.

למה סוכן GUI הוא לא רק „VLM שמסתכל על מסכים”
הפער בין שני המודלים האלה אינו נוגע בעיקר למספר הפרמטרים, וכדאי לפרט אותו משום שזה מה שהופך את ההתמודדות למעניינת ולא רק לחד-צדדית.
למשימת צילום מסך יש תכונה שרוב מבחני הראייה אינם כוללים: הפלט חייב להיות בר-הרצה. כאשר מבקשים מ-UI-Venus 2.9B להקיש על כפתור, עליו לפלוט קואורדינטה או פעולה מובנית שהסביבה יכולה למעשה ליישם, וטעות קטנה בעיגון אינה תשובה שגויה בלוח תוצאות, אלא משימה שנכשלה ומצב פגום. זו הסיבה שהכרטיס של UI-Venus 2 מקדיש חלק כה גדול מאורכו לאימות: השלמת המשימה נשפטת לפי נקודות מפתח חזותיות רלוונטיות למשימה ולא לפי מבט הוליסטי על המסך הסופי, ושופטים הטרוגניים מצביעים כדי להפחית הטיה של שופט יחיד. מטרת המנגנון הזה היא להפוך את אות הגמול של למידת חיזוק לעמיד בפני פריצת גמול — מודל שלומד להשביע את רצונו של מאמת עצלן במקום להשלים את המשימה.
הוא גם מסביר את מדור הבטיחות.

לסוכן שמסוגל להפעיל טלפון או מחשב שולחני יש משטח תקיפה שלמודל תיאור תמונות אין, ודיווח על שיעור הצלחת תקיפה הוא המינימום שמעבדה צריכה לעשות כשהיא משיקה סוכן כזה. UI-Venus 2.9B מדווח על 11.3% ב-OSHarm ועל 48.8% ב-OSBlind — הנתון השני גבוה במונחים מוחלטים, והמסגור בכרטיס הוא השוואה למודל הבסיס שלו ולא טענה מוחלטת לחוסן. יש לקרוא זאת כ"טוב יותר באופן משמעותי מנקודת הפתיחה שלו", ולא כ"בטוח".
הארכיטקטורה של MiniCPM-V 4.7 אינה יכולה לומר דבר על אף אחד מאלה. קשב לינארי על הקשר ארוך יעזור לסוכן שצריך לזכור היסטוריית אינטראקציה ארוכה, וה-MoE הדליל יעזור לתפוקה אם אתם מריצים אפיזודות רבות. אבל ארכיטקטורה שתהיה שימושית עבור סוכן אינה סוכן, ושום חלק מהארטיפקט שפורסם אינו מתעד פלט פעולות, דיוק עיגון או התנהגות בטיחותית.
ההערכה הכנה של הצד של MiniCPM
מפתה למלא את הקטע הזה במספרים של 4.6. התנגדו לכך. MiniCPM-V 4.6 הוא מודל dense בגודל 1.3B על backbone של Qwen3.5-0.8B עם סכימת דחיסה חזותית ניתנת להחלפה של 4x/16x, והתוצאות המפורסמות שלו — ציון של 13 ב-Artificial Analysis Intelligence Index, לפי דיווח הספק, בעלות טוקנים שהיא שבריר מהעלות של מודלים קטנים דומים — מתארות את המודל הזה. MiniCPM-V 4.7 משנה את ה-backbone, משנה את דפוס הקשב, ומשנה את ברירת המחדל של הדחיסה החזותית. אף אחת מהמדידות של 4.6 אינה ניתנת להעברה, ואף אחת מהן אינה מתארת סוכן GUI מלכתחילה.
מה שאפשר לומר בכנות על MiniCPM-V 4.7 הוא צר ועובדתי: המשקלים קיימים, הצורה יוצאת דופן למשפחה, חלון ההקשר ארוך, והשחרור אינו שלם. היעדר רישיון הוא החסם המעשי; היעדר בנצ'מרקים הוא החסם ההערכתי. ויש סיבה צנועה אחת להתעניינות ולא לאדישות — OpenBMB בונה כלי GUI, ובהם AgentCPM-GUI, כך שמודל ראייה מבוסס MoE דליל עם הקשר ארוך מאותה מעבדה אינו בלתי סביר כעמוד שדרה עתידי לסוכנים. זו השערה לגבי כוונה, והמאגר אינו מאשר אותה.
מה היית בוחר, ומתי
לכל דבר הכרוך בצילום מסך ובפעולה — הקשה, הקלדה, גלילה, ניווט באפליקציה או באתר, חילוץ נתונים מממשק משתמש — UI-Venus 2.9B הוא היחיד מבין השניים שמטפל במשימה. יש לו את האימון, את מנגנון האימות, את נתוני הבטיחות המדווחים, ודי כלים כדי להעמיד אותו על vLLM כבר היום. שום דבר ב-MiniCPM-V 4.7 לא מרמז שהוא מתחרה שם, ובלי כרטיס אתה אפילו לא יכול לבדוק אם הוא פולט קואורדינטות.
לעבודה מולטימודלית כללית — תיאור תמונות, קריאת מסמכים, ניתוח ארוך-הקשר על חומר עתיר תמונות — ההשוואה עדיין אינה ניתנת להכרעה, מכיוון שלאחד הצדדים אין ראיות איכות מפורסמות. אם אתם זקוקים לכך היום, UI-Venus 2.9B הוא לפחות מדיד, אם כי הוא כוונן עבור ממשקים ולא עבור הסקה על מסמכים, וגם אינו בחירה ראשונה מובהקת למשימה הזו.
התבנית בשני המקרים זהה: מודל באחסון עצמי שמטפל בעבודה השגרתית, ומודל חזית מתארח עבור המקרים הקשים שהוא מעביר הלאה. ההעברה הזו היא המקום שבו ראוטר מוכיח את ערכו — מפתח אחד על פני יותר מ-200 מודלים מתארחים, שכל אחד מהם מועבר במחיר המחירון של הספק בלי שום תוספת מצדנו, עם מעבר אוטומטי לכשל כשספק נחלש. לא UI-Venus 2.9B ולא MiniCPM-V 4.7 מתארחים על גבי OrcaRouter; שניהם משקלות שאתם מריצים בעצמכם. הראוטר הוא זה שאליו הסוכן שלכם מדבר כשהוא מחליט שהמודל המקומי אינו מספיק.
איפה זה משאיר אותך
זו לא החלטה גבולית, והסיבה היא מבנית ולא שיפוט לגבי איכות. UI-Venus 2.9B הוא מומחה עם דוח, רישיון, טבלאות בנצ'מרק, הערכת בטיחות ומתכון הגשה. MiniCPM-V 4.7 הוא ג'נרליסט עם קובץ תצורה. אחד מהם הוא מוצר והאחר הוא הבטחה, והדרך האחראית היחידה להשוות ביניהם היא לומר זאת. עקבו אחר המאגר: אם OpenBMB תפרסם כרטיס שמציג עיגון ממשק ופלט פעולה, אז ההשוואה בין MoE דליל עם הקשר של 256K לבין סוכן 9B מזוקק הופכת לשאלה מעניינת באמת. עד אז, התשובה לשאלה "באיזה מהם כדאי לי להשתמש" היא זו שקיימת.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
