כרטיס כותרת ראשי עבור 'UI-Venus-2-9B vs Microsoft Mage-VL' עם כותרת המשנה 'The screenshot agent vs the codec-stream watcher', הכולל תג כחול עם הכיתוב '9B · SCREENSHOT AGENT' וגלולת 'acts', ותג ציאן עם הכיתוב '4B · STREAM WATCHER' וגלולת 'describes', ואת הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

UI-Venus-2-9B לעומת Microsoft Mage-VL: סוכן צילום המסך מול משקיף זרם הקודק

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

UI-Venus-2-9B ו-Microsoft Mage-VL שניהם שוחררו בשקט תוך חודש זה מזה — המאגר של Mage-VL הופיע ב-26 ביולי 2026, ושל UI-Venus-2-9B ב-26 באוגוסט 2026 — שניהם בעלי משקלים פתוחים תחת רישיון Apache-2.0, ושניהם מבוססים על שלדות ממשפחת Qwen. כאן בערך מסתיים הדמיון, וההבדל אינו עניין של מידה אלא של איזה צד של המסך כל מודל חי. Microsoft Mage-VL הוא מודל תפיסת סטרימינג ילידי-קודק: הוא צופה בווידאו דחוס, שותק במהלך קטעים שגרתיים, ופולט טקסט כשהאירוע מסתיים. UI-Venus-2-9B הוא סוכן GUI: הוא קולט צילום מסך סטטי, מנתח את המצב, ופולט פעולה מובנית. אחד צופה במסך ומתאר אותו; השני צופה במסך ומפעיל אותו. הבחירה ביניהם אינה החלטת בנצ'מרק, כי הם אינם חולקים אף בנצ'מרק אחד — היא החלטה בשאלה אם האוטומציה שלך מסתיימת בתשובה או בפעולה.

מה כל מודל הוא בפועל

Microsoft Mage-VL, ששוחרר תחת המאגר microsoft/Mage-VL ללא הכרזה, הוא מודל מולטי-מודאלי עם כ-4 מיליארד פרמטרים, הבנוי ממפענח שפה Qwen3-4B-Instruct-2507, ממקודד חזותי שנבנה מאפס בשם Mage-ViT, ומשער זרימה נפרד עם כ-0.5 מיליארד פרמטרים. העיצוב שלו הוא ילידי-קודק וידאו: במקום דגימה אחידה של פריימים, הוא שומר פריימי עוגן (I) במלואם ושומר רק על פאצ'ים בעלי חשיבות תנועתית של פריימים חזויים (P), מה שלפי דיווחי Microsoft מקצץ את צריכת הטוקנים החזותיים ביותר מ-75% ומניב האצה של עד פי 3.5 בזמן ההסקה בפועל לעומת דגימה אחידה. עיצוב דו-תהליכי — שער קוגניציה של System 1 צופה בכל חלון קודק מתגלגל, ו-VLM של System 2 מופעל רק כאשר יש אירוע שכדאי להגיב אליו — הופך אותו לצופה וידאו פעיל תמיד, שזול דווקא משום שהוא שותק ברוב הזמן.

UI-Venus-2-9B, ששוחרר על ידי inclusionAI (המעבדה של צוות ונוס בקבוצת Ant), הוא סוכן GUI רב-תכליתי עם 9B פרמטרים, שאותחל מ-Qwen3.5-9B. הוא מתבונן בממשק, מבצע הנמקה על מצב המשימה, מבצע פעולה ומשלב משוב — לולאה סגורה של התבוננות–הנמקה–פעולה–משוב — והכרטיס שלו טוען שאימונו מכסה אפליקציות מובייל, פלטפורמות אינטרנט ומערכות הפעלה שולחניות בנקודת ביקורת אחת. בכרטיס המודל שלו הוא מדווח על AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 ו-ScreenSpot-Pro 73.0, כולם דיווחי ספק ואף אחד מהם לא שוחזר באופן עצמאי.

פער הקלט: פיקסלים שתופסים לעומת זרם שאתה שומר

ההבדל המאלף ביותר הוא מה כל מודל "אוכל". UI-Venus-2-9B הוא סוכן צילומי מסך: הקלט שלו הוא המסך הנוכחי, פריים אחד בכל פעם, וחלון ההקשר של 256K טוקנים הוא הדרך שבה הוא שומר היסטוריה של הפריימים הללו לאורך משימה ארוכה. Mage-VL הוא סוכן זרם: הקלט שלו הוא וידאו דחוס, והיעילות שלו נובעת מהתייחסות לתנועה בין פריימים כנתונים — וקטורי תנועה ואנרגיה שיורית עבור קודקים מסורתיים, ומפות קצב שנלמדו עבור קודקים נוירליים. זה ההבדל בין מודל שרואה רגעים לבין מודל שרואה ציר זמן רציף. סוכן צילומי מסך עיוור מבנית ל-100 מילישניות שבין צילומים — הספינר, מעבר הטעינה, מצב הריחוף (hover) שקיים על המסך רק לרגע. צופה הזרם חי בתוך הפער הזה. זו לא פגם באף אחד מהעיצובים; זו הסיבה שסוכן GUI שצריך לפעול על מסך חי ומודל תפיסה שצריך לסכם פיד הם מוצרים שונים עם חוזי קלט שונים.

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

פער התפוקה: מעשים מול הערות

צד הפלט הוא המקום שבו השניים מפסיקים להיות ברי השוואה. הפלט של UI-Venus-2-9B הוא פעולה מובנית במרחב פעולה מוגדר — עכבר, מקלדת, גלילה, ניווט — שהוא פולט לאחר טוקנים של חשיבה בסגנון Qwen3, והאימון שלו בנוי סביב משימות עיגון ו-CAPTCHA שמתגמלות איתור מדויק של אלמנטים תחת עומס ויזואלי. הפלט של Mage-VL הוא טקסט: פרשנות מונחית-אירועים על מה שהוא רואה. אין לו מרחב פעולה, אין קריאות לפונקציות, ואין לולאת סוכן. קרא את שני כרטיסי המודל זה לצד זה ואתה מסתכל על צדדים מנוגדים של קו התפיסה–פעולה — Mage-VL מסתיים בתיאור, UI-Venus-2-9B מסתיים בקליק.

משימה — UI-Venus-2-9B: סוכן GUI, מפעיל את הממשק. Microsoft Mage-VL: תפיסה רציפה, מתאר את הממשק.

קלט — UI-Venus-2-9B: צילומי מסך סטטיים, היסטוריית 256K טוקנים. Microsoft Mage-VL: זרמי codec וידאו דחוסים, דלילות טוקנים בולטי-תנועה.

פלט — UI-Venus-2-9B: פעולות עכבר/מקלדת/ניווט מובנות. Microsoft Mage-VL: פרשנות טקסט המופעלת על ידי אירועים.

גודל — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + שער סטרימינג של ~0.5B.

עמוד שדרה — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507, ובנוסף Mage-ViT שנבנה מאפס.

רישיון — שניהם Apache-2.0 (הכרטיס של Mage-VL מציין שימוש למטרות מחקר בלבד במאגר שלו).

פער ההגשה

כאן הדגם החדש והגדול יותר הוא הקל יותר להרצה. UI-Venus-2-9B מתעד פקודת vLLM יחידה עם חלון הקשר של 256K ו-API תואם OpenAI סטנדרטי. Mage-VL דורש trust_remote_code כדי להריץ את ה-Python המותאם אישית של מיקרוסופט, כולל FFmpeg, נתיב neural-codec לוידאו, ותלויות כמו mamba-ssm, ואין לו עדיין מחסן שרתים (serving stack) של vLLM או SGLang — ללא paged attention, ללא נתיב שרת ייצור. מיקרוסופט מדווחת על כ-10.6 GB של פרמטרים ב-BF16 בסך הכול, כלומר GPU של 16 GB הוא הרף הריאלי לעבודה על תמונות ו-24 GB ומעלה לוידאו ארוך. לצוות שרוצה להעלות משהו לייצור היום, ל-UI-Venus-2-9B יש מסלול כניסה נקי יותר; לצוות שבונה צינור ניטור או סיכום שפועל תמיד, מחסן השרתים של Mage-VL הוא הדבר שאתה מקבל על עצמך בכל מקרה, כולל ה-Python המותאם אישית והכל.

לוח תוצאות שלא קיים

אין מדד השוואתי משותף בין שני המודלים האלה, ולהמציא אחד כזה יהיה לא ישר. המספרים של UI-Venus-2-9B מתפרסמים בלוחות מדדים של התבססות על GUI, מובייל, ווב ושימוש במחשב (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, כולם לפי דיווחי הספק). המספרים של Mage-VL מתפרסמים בלוחות מדדים של הבנת וידאו ומרחב (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 מעל Qwen3-VL-4B, כולם לפי דיווחי הספק). הדרך הנכונה לקרוא את ההתמודדות הזאת היא כהתפצלות דרכים: אם המשימה היא "להבין מה קורה על המסך הזה לאורך זמן," Mage-VL הוא הכלי הרלוונטי ו-UI-Venus-2-9B לא בנוי לכך; אם המשימה היא "לגרום למסך הזה לעשות משהו," ההפך הוא הנכון.

היכן שהשניים מרכיבים

הגרסה המעניינת של ההשוואה הזו אינה או/או. לסוכן GUI המפעיל אפליקציה חיה יש נקודה עיוורת אמיתית — הזמן בין צילומי מסך, וכל שינוי מצב שאינו מתייצב לפריים סטטי — וצופה סטרים יליד-קודק הוא בדיוק סוג המודל שיכול לשמש כשכבת תפיסה בפער הזה, ולזהות שדף סיים להיטען או שמודאל סיים לעבור אנימציה לפני מעבר הגראונדינג הבא של הסוכן. מיקרוסופט לא בנתה את Mage-VL לתפקיד הזה, ו-Ant Group לא בנתה את UI-Venus-2-9B כדי שיופנה על ידי מודל שני, אבל ההתאמה אמיתית. לגבי החלקים של מחסנית כזו שכבר ברמת ייצור — מודל השפה המתכנן שמפרק משימה, מודל הראייה שמאמת מצב מסך, מודל התמלול שמתעד את הסשן של הסוכן — ממשק API אחד עם תמחור מעבר ומעבר אוטומטי בעת תקלה הוא מה שהופך את הניסוי לזול, ולשם כך נועד ראוטר. לא UI-Venus-2-9B ולא Microsoft Mage-VL מוגשים כיום דרך OrcaRouter; שניהם פרויקטים של אירוח עצמי במשקלים פתוחים, ושניהם יופיעו במחיר המחירון של הספק אם אי פעם יגיעו לספק מנותב.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

מי צריך לבחור איזה

בחרו ב-Microsoft Mage-VL כשהבעיה שלכם היא תפיסה רציפה — פיד מצלמה, הקלטת מסך, סטרים שצריך לסכם או לנטר בזמן אמת, בזול מספיק כדי להמשיך להריץ אותו. בחרו ב-UI-Venus-2-9B כשהבעיה שלכם היא שליטה — משימה שמסתיימת בפעולה שהושלמה, טופס שמולא, תהליך ניווט שהושלם, אפליקציה שהופעלה. ואם האוטומציה שלכם באמת צריכה את שניהם — לתפוס את הזרם, ואז לפעול על הפריים — הריצו אותם כצמד והתייחסו לצופה הזרם כגלאי אירועים שמזין לסוכן צילומי מסך את הרגעים שכדאי לפעול עליהם. הם שני חצאים של אותו מסך, לא מתחרים על אותה עבודה.