
UI-Venus-2-9B לעומת Microsoft Mage-VL: סוכן צילום המסך מול משקיף זרם הקודק
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
UI-Venus-2-9B ו-Microsoft Mage-VL שניהם שוחררו בשקט תוך חודש זה מזה — המאגר של Mage-VL הופיע ב-26 ביולי 2026, ושל UI-Venus-2-9B ב-26 באוגוסט 2026 — שניהם בעלי משקלים פתוחים תחת רישיון Apache-2.0, ושניהם מבוססים על שלדות ממשפחת Qwen. כאן בערך מסתיים הדמיון, וההבדל אינו עניין של מידה אלא של איזה צד של המסך כל מודל חי. Microsoft Mage-VL הוא מודל תפיסת סטרימינג ילידי-קודק: הוא צופה בווידאו דחוס, שותק במהלך קטעים שגרתיים, ופולט טקסט כשהאירוע מסתיים. UI-Venus-2-9B הוא סוכן GUI: הוא קולט צילום מסך סטטי, מנתח את המצב, ופולט פעולה מובנית. אחד צופה במסך ומתאר אותו; השני צופה במסך ומפעיל אותו. הבחירה ביניהם אינה החלטת בנצ'מרק, כי הם אינם חולקים אף בנצ'מרק אחד — היא החלטה בשאלה אם האוטומציה שלך מסתיימת בתשובה או בפעולה.
מה כל מודל הוא בפועל
Microsoft Mage-VL, ששוחרר תחת המאגר microsoft/Mage-VL ללא הכרזה, הוא מודל מולטי-מודאלי עם כ-4 מיליארד פרמטרים, הבנוי ממפענח שפה Qwen3-4B-Instruct-2507, ממקודד חזותי שנבנה מאפס בשם Mage-ViT, ומשער זרימה נפרד עם כ-0.5 מיליארד פרמטרים. העיצוב שלו הוא ילידי-קודק וידאו: במקום דגימה אחידה של פריימים, הוא שומר פריימי עוגן (I) במלואם ושומר רק על פאצ'ים בעלי חשיבות תנועתית של פריימים חזויים (P), מה שלפי דיווחי Microsoft מקצץ את צריכת הטוקנים החזותיים ביותר מ-75% ומניב האצה של עד פי 3.5 בזמן ההסקה בפועל לעומת דגימה אחידה. עיצוב דו-תהליכי — שער קוגניציה של System 1 צופה בכל חלון קודק מתגלגל, ו-VLM של System 2 מופעל רק כאשר יש אירוע שכדאי להגיב אליו — הופך אותו לצופה וידאו פעיל תמיד, שזול דווקא משום שהוא שותק ברוב הזמן.
UI-Venus-2-9B, ששוחרר על ידי inclusionAI (המעבדה של צוות ונוס בקבוצת Ant), הוא סוכן GUI רב-תכליתי עם 9B פרמטרים, שאותחל מ-Qwen3.5-9B. הוא מתבונן בממשק, מבצע הנמקה על מצב המשימה, מבצע פעולה ומשלב משוב — לולאה סגורה של התבוננות–הנמקה–פעולה–משוב — והכרטיס שלו טוען שאימונו מכסה אפליקציות מובייל, פלטפורמות אינטרנט ומערכות הפעלה שולחניות בנקודת ביקורת אחת. בכרטיס המודל שלו הוא מדווח על AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 ו-ScreenSpot-Pro 73.0, כולם דיווחי ספק ואף אחד מהם לא שוחזר באופן עצמאי.
פער הקלט: פיקסלים שתופסים לעומת זרם שאתה שומר
ההבדל המאלף ביותר הוא מה כל מודל "אוכל". UI-Venus-2-9B הוא סוכן צילומי מסך: הקלט שלו הוא המסך הנוכחי, פריים אחד בכל פעם, וחלון ההקשר של 256K טוקנים הוא הדרך שבה הוא שומר היסטוריה של הפריימים הללו לאורך משימה ארוכה. Mage-VL הוא סוכן זרם: הקלט שלו הוא וידאו דחוס, והיעילות שלו נובעת מהתייחסות לתנועה בין פריימים כנתונים — וקטורי תנועה ואנרגיה שיורית עבור קודקים מסורתיים, ומפות קצב שנלמדו עבור קודקים נוירליים. זה ההבדל בין מודל שרואה רגעים לבין מודל שרואה ציר זמן רציף. סוכן צילומי מסך עיוור מבנית ל-100 מילישניות שבין צילומים — הספינר, מעבר הטעינה, מצב הריחוף (hover) שקיים על המסך רק לרגע. צופה הזרם חי בתוך הפער הזה. זו לא פגם באף אחד מהעיצובים; זו הסיבה שסוכן GUI שצריך לפעול על מסך חי ומודל תפיסה שצריך לסכם פיד הם מוצרים שונים עם חוזי קלט שונים.

פער התפוקה: מעשים מול הערות
צד הפלט הוא המקום שבו השניים מפסיקים להיות ברי השוואה. הפלט של UI-Venus-2-9B הוא פעולה מובנית במרחב פעולה מוגדר — עכבר, מקלדת, גלילה, ניווט — שהוא פולט לאחר טוקנים של חשיבה בסגנון Qwen3, והאימון שלו בנוי סביב משימות עיגון ו-CAPTCHA שמתגמלות איתור מדויק של אלמנטים תחת עומס ויזואלי. הפלט של Mage-VL הוא טקסט: פרשנות מונחית-אירועים על מה שהוא רואה. אין לו מרחב פעולה, אין קריאות לפונקציות, ואין לולאת סוכן. קרא את שני כרטיסי המודל זה לצד זה ואתה מסתכל על צדדים מנוגדים של קו התפיסה–פעולה — Mage-VL מסתיים בתיאור, UI-Venus-2-9B מסתיים בקליק.
• משימה — UI-Venus-2-9B: סוכן GUI, מפעיל את הממשק. Microsoft Mage-VL: תפיסה רציפה, מתאר את הממשק.
• קלט — UI-Venus-2-9B: צילומי מסך סטטיים, היסטוריית 256K טוקנים. Microsoft Mage-VL: זרמי codec וידאו דחוסים, דלילות טוקנים בולטי-תנועה.
• פלט — UI-Venus-2-9B: פעולות עכבר/מקלדת/ניווט מובנות. Microsoft Mage-VL: פרשנות טקסט המופעלת על ידי אירועים.
• גודל — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + שער סטרימינג של ~0.5B.
• עמוד שדרה — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507, ובנוסף Mage-ViT שנבנה מאפס.
• רישיון — שניהם Apache-2.0 (הכרטיס של Mage-VL מציין שימוש למטרות מחקר בלבד במאגר שלו).
פער ההגשה
כאן הדגם החדש והגדול יותר הוא הקל יותר להרצה. UI-Venus-2-9B מתעד פקודת vLLM יחידה עם חלון הקשר של 256K ו-API תואם OpenAI סטנדרטי. Mage-VL דורש trust_remote_code כדי להריץ את ה-Python המותאם אישית של מיקרוסופט, כולל FFmpeg, נתיב neural-codec לוידאו, ותלויות כמו mamba-ssm, ואין לו עדיין מחסן שרתים (serving stack) של vLLM או SGLang — ללא paged attention, ללא נתיב שרת ייצור. מיקרוסופט מדווחת על כ-10.6 GB של פרמטרים ב-BF16 בסך הכול, כלומר GPU של 16 GB הוא הרף הריאלי לעבודה על תמונות ו-24 GB ומעלה לוידאו ארוך. לצוות שרוצה להעלות משהו לייצור היום, ל-UI-Venus-2-9B יש מסלול כניסה נקי יותר; לצוות שבונה צינור ניטור או סיכום שפועל תמיד, מחסן השרתים של Mage-VL הוא הדבר שאתה מקבל על עצמך בכל מקרה, כולל ה-Python המותאם אישית והכל.
לוח תוצאות שלא קיים
אין מדד השוואתי משותף בין שני המודלים האלה, ולהמציא אחד כזה יהיה לא ישר. המספרים של UI-Venus-2-9B מתפרסמים בלוחות מדדים של התבססות על GUI, מובייל, ווב ושימוש במחשב (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, כולם לפי דיווחי הספק). המספרים של Mage-VL מתפרסמים בלוחות מדדים של הבנת וידאו ומרחב (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 מעל Qwen3-VL-4B, כולם לפי דיווחי הספק). הדרך הנכונה לקרוא את ההתמודדות הזאת היא כהתפצלות דרכים: אם המשימה היא "להבין מה קורה על המסך הזה לאורך זמן," Mage-VL הוא הכלי הרלוונטי ו-UI-Venus-2-9B לא בנוי לכך; אם המשימה היא "לגרום למסך הזה לעשות משהו," ההפך הוא הנכון.
היכן שהשניים מרכיבים
הגרסה המעניינת של ההשוואה הזו אינה או/או. לסוכן GUI המפעיל אפליקציה חיה יש נקודה עיוורת אמיתית — הזמן בין צילומי מסך, וכל שינוי מצב שאינו מתייצב לפריים סטטי — וצופה סטרים יליד-קודק הוא בדיוק סוג המודל שיכול לשמש כשכבת תפיסה בפער הזה, ולזהות שדף סיים להיטען או שמודאל סיים לעבור אנימציה לפני מעבר הגראונדינג הבא של הסוכן. מיקרוסופט לא בנתה את Mage-VL לתפקיד הזה, ו-Ant Group לא בנתה את UI-Venus-2-9B כדי שיופנה על ידי מודל שני, אבל ההתאמה אמיתית. לגבי החלקים של מחסנית כזו שכבר ברמת ייצור — מודל השפה המתכנן שמפרק משימה, מודל הראייה שמאמת מצב מסך, מודל התמלול שמתעד את הסשן של הסוכן — ממשק API אחד עם תמחור מעבר ומעבר אוטומטי בעת תקלה הוא מה שהופך את הניסוי לזול, ולשם כך נועד ראוטר. לא UI-Venus-2-9B ולא Microsoft Mage-VL מוגשים כיום דרך OrcaRouter; שניהם פרויקטים של אירוח עצמי במשקלים פתוחים, ושניהם יופיעו במחיר המחירון של הספק אם אי פעם יגיעו לספק מנותב.


מי צריך לבחור איזה
בחרו ב-Microsoft Mage-VL כשהבעיה שלכם היא תפיסה רציפה — פיד מצלמה, הקלטת מסך, סטרים שצריך לסכם או לנטר בזמן אמת, בזול מספיק כדי להמשיך להריץ אותו. בחרו ב-UI-Venus-2-9B כשהבעיה שלכם היא שליטה — משימה שמסתיימת בפעולה שהושלמה, טופס שמולא, תהליך ניווט שהושלם, אפליקציה שהופעלה. ואם האוטומציה שלכם באמת צריכה את שניהם — לתפוס את הזרם, ואז לפעול על הפריים — הריצו אותם כצמד והתייחסו לצופה הזרם כגלאי אירועים שמזין לסוכן צילומי מסך את הרגעים שכדאי לפעול עליהם. הם שני חצאים של אותו מסך, לא מתחרים על אותה עבודה.
