
InternLumina-U2 מול Tencent UI-Mate-27B: סוכן שולחן העבודה שאפשר להריץ עכשיו מול מודל הראייה המאוחד שאפשר רק לקרוא עליו
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
Tencent UI-Mate-27B ו-InternLumina-U2 הם שני שחרורים שקטים ברישיון Apache-2.0 ממעבדות סיניות, שפורסמו בהפרש של שבועיים זה מזה, והם אינם מתחרים — וזו בדיוק הסיבה שכדאי להשוות ביניהם. Tencent UI-Mate-27B, ששוחרר עם משקלים פתוחים ב-14 באוגוסט 2026, הוא סוכן שולחן עבודה: הוא צופה במסך ומפיק פעולות עכבר ומקלדת. InternLumina-U2, שפורסם כקוד הסקה ב-1 בספטמבר 2026 על ידי Shanghai AI Laboratory, הוא מודל ראייה אחיד שאפתני: הוא טוען שהוא קורא תמונות, וידאו ותלת-ממד ומייצר ועורך תמונות. האחד פועל על מה שהוא רואה; השני, כשיהיו לו משקלים סוף סוף, ידבר ויצייר על מה שהוא רואה. אם העבודה שלך היא הפעלת שולחן עבודה, רק אחד משני אלה יכול לעשות אותה היום — וזה לא זה עם הארכיטקטורה המרשימה יותר.
הסוכן שפועל: Tencent UI-Mate-27B
UI-Mate-27B הוא סוכן GUI (ממשק משתמש גרפי) מבוסס מודל-יסוד עם משקלים פתוחים ו-27 מיליארד פרמטרים, מבית צוות הסוכנים הרב-מודאליים HY Frontier של Tencent, מכוונן מ-Qwen3.6-27B. הוא בוחן צילומי מסך חיים, מבצע חשיבה על מצב המסך הנוכחי, ומפיק פעולות מקלדת ועכבר מובנות במרחב קואורדינטות מנורמל — תוצר של מודל שאומן להפעיל סביבת שולחן עבודה אמיתית, ולא לשוחח על אודותיה. המאפיין הייחודי שלו הוא ביצוע מונחה-הדגמה: הראה לו זרימת עבודה פעם אחת, והוא מתאים את ההדגמה שהוקלטה למשימה שלפניו, כשהוא מתייחס לצילום המסך החי כאל מקור סמכותי כשהממשק שונה ממה שתועד. הציונים הבולטים שדיווחה Tencent: OSWorld-Verified 77.0 ו-WindowsAgentArena 66.2 — נתונים שהיו מובילים את טבלאות הדירוג של 2026 אילו שוכפלו במבחן בלתי תלוי — לצד מגוון רחב של מדדי OSWorkerBench. המשקולות אמיתיות וניתנות להורדה: שנים-עשר shards בפורמט safetensors ב-Hugging Face, הניתנים לאירוח עצמי באמצעות vLLM או SGLang על כמה GPUs. כרטיס המודל נושא הסתייגות חשובה: מדובר ב-agent checkpoint, לא במודל עצמאי לשיח חזותי — אם תפנה אליו עם "תאר את התמונה הזאת", אתה משתמש בו לא נכון.
העיניים שהובטחו: InternLumina-U2
InternLumina-U2 הוא מין שונה לחלוטין. זהו מודל דיפוזיה דליל־מומחים (sparse mixture-of-experts) עם 16 מיליארד פרמטרים (מיליארד אחד פעיל), שהמעבדה מתכננת אותו כמודל אחד להבנה חזותית כוללת, יצירת תמונות ועריכת תמונות — עיצוב דיסקרטי לחלוטין עם שמונה ספרי־קוד, שבו עמוד שדרה יחיד גם קורא תמונה, תרשים, וידאו או נכס תלת־ממדי וגם כותב פיקסלים חדשים. אם המודל המנטלי שלך הוא סוכן GUI, InternLumina-U2 הוא הקוטב ההפוך: הוא לא רוצה ללחוץ על שום דבר, הוא רוצה להבין הכול ולצייר לפי בקשה. הצורה שפורסמה ב־1 בספטמבר 2026 כוללת קוד הסקה וארכיטקטורה — שש נקודות כניסה למשימות במאגר GitHub, דף פרויקט עם טבלת אמות מידה ראשונית, ו־stub ריק של Hugging Face — ומשקלי המודל, קוד האימון והדוח הטכני כולם עדיין מסומנים כ"בקרוב". איש אינו יכול להריץ אותו. הפער בין שני המודלים אינו באיכות; הוא בקיום.
לוח התוצאות
הנתונים של UI-Mate-27B הם דיווח של Tencent, שלא שוחזרו; הנתונים של InternLumina-U2 הם דיווח מעבדה, ראשוניים וחלקיים. כל שורה נושאת את מקור הנתונים שלה.
• תפקיד — Tencent UI-Mate-27B: להפעיל שולחן עבודה — לקרוא צילומי מסך חיים, ולפלוט פעולות עכבר ומקלדת. InternLumina-U2: תפיסה ויצירה — להבין תמונות/וידאו/תלת-ממד, לייצר ולערוך תמונות.
• משקלים — Tencent UI-Mate-27B: ציבוריים מאז 14 באוגוסט 2026, שנים-עשר רסיסי safetensors, Apache-2.0. InternLumina-U2: לא ציבורי — מאגר Hugging Face ריק, המשקלים "בקרוב".
• קנה מידה — 27B צפוף, מכוונן עדין מ-Qwen3.6-27B, לעומת 16B סה"כ / 1B פעיל של מודל דיפוזיה MoE דליל.
פלט — Tencent UI-Mate-27B: פעולות מובנות התואמות ל-pyautogui במרחב קואורדינטות מנורמל. InternLumina-U2: טוען לטקסט, המרת טקסט לתמונה עד 1024×1024, ועריכת תמונה מבוססת הוראות.
• המספרים הבולטים — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench: שיפור בזכות הדגמות (הכול לפי דיווח Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (לפי דיווח מעבדה, ראשוני).
• אזהרת מקור — Tencent UI-Mate-27B: הכרטיס עצמו מזהיר כי מדובר ב־checkpoint של סוכן, ולא במודל שיחה־חזותי עצמאי. InternLumina-U2: דף הפרויקט מגדיר את תוצאותיו שלו כ"ראשוניות, חלקיות".
מציאות ההגשה — Tencent UI-Mate-27B: אירוח עצמי באמצעות vLLM או SGLang על כ-2 GPU; אין כיום ספק inference מארח שפורס אותו. InternLumina-U2: אף אחד לא יכול לשרת אותו — הדרייבר שפורסם מצפה לנקודות ביקורת שאינן במאגר.

שני טעמים שונים של לא מוכח
שני הדגמים אינם מוכחים, והמילה אינה מתכוונת לאותו דבר בשני המקרים. Tencent UI-Mate-27B אינו מוכח במובן הרגיל של דגם חדש: הציונים הבולטים הם של הספק עצמו, אף אחד לא הריץ אותם מחדש באופן בלתי תלוי, ומספר ההורדות זעיר ביחס להצהרות — המצב האופייני לצ'קפוינט שנראה במבט ראשון כבן ארבעה ימים, ומאז צמחה סביבו קהילה קטנה. אבל הוא אינו מוכח במובן הניתן לבדיקה. מכיוון שהמשקולות קיימות, את ה‑66.2 ואת ה‑77.0 אפשר לבדוק השבוע, כל מי שיש לו שתי יחידות GPU וסביבת בדיקה של Windows, ואת הטענות המבוססות על הדגמות אפשר לשחזר או להפריך בזרימות עבודה אמיתיות. InternLumina-U2 אינו מוכח במובן מחמיר יותר: הוא בלתי ניתן לבדיקה. הארכיטקטורה שלו ציבורית וקריאה, המספרים שלו — לא. אין שום ארטיפקט שיכול לאשש אותם, והטבלה החלקית של המעבדה עצמה כבר מראה שהוא מפגר אחרי יריב בעל שם במדד גנרטיבי אחד לפחות. מספר של ספק המחובר לקובץ להורדה הוא טענה הממתינה לשופט. מספר של ספק המחובר למפת דרכים הוא תקווה.

כרטיס המודל tencent/UI-Mate-27B ב-Hugging Face, שצולם ב-27 באוגוסט 2026 — בסיס Qwen3.6-27B, ציוני OSWorld ו-WindowsAgentArena שדווחו על ידי הספק, וההערה שאף ספקית inference אינה פורסת אותו כעת.
חלוקת העבודה הטבעית: שחקן ועיניו
כשמציבים אותם זה לצד זה, שני המודלים משרטטים את קווי המתאר של צינור אוטומציה אמין. הבעיה הקשה עם סוכני GUI היא לא המקרה הממוצע; היא הסוכן שעושה בשקט את הדבר הלא נכון במצב מסך בלתי צפוי ואף אחד לא שם לב. זו בדיוק העבודה שלשמה קיים מודל ראייה זול ואמין — לוודא את מצב המסך לפני ואחרי כל פעולה, לאשר שהדיאלוג שהופיע הוא הדיאלוג שהסוכן חושב שהופיע, ולעצור את הלולאה כשהמציאות ומודל המציאות של הסוכן מתפצלים. Tencent UI-Mate-27B הוא השחקן; מודל ראייה מאוחד מהסוג ש-InternLumina-U2 טוענת להיות הוא המאמת הטבעי, שיכול לקרוא את אותם צילומי מסך שהסוכן פועל עליהם. כאשר — ורק כאשר — משקלי InternLumina-U2 אכן ישוחררו וטענות ההבנה שלה ישרדו בדיקות בלתי תלויות, זה התפקיד שהיא תוכל למלא לצד סוכן ולא נגדו. השניים אינם יריבים על אותה עבודה; הם שני חצאיה של עבודה אחת.

מאגר ה-GitHub של InternLM/InternLumina-U2, שצולם ב-2 בספטמבר 2026 — דף הנחיתה של המאגר המציג את סקריפטי ההסקה לפי משימה, כולל נקודת הכניסה להבנת תמונה שממנה ייבנה מאמת מצב מסך; המשקולות שהיו הופכות אותו לבר-הרצה אינן בעץ הקבצים.
מה שכבת ניתוב עושה עבור מחסנית סוכן-פלוס-עיניים
אף אחד מהמודלים אינו מתארח ב־OrcaRouter, ולא נציג זאת אחרת — ל־Tencent UI-Mate-27B אין ספק מארח בשום מקום, ול־InternLumina-U2 אין משקלים שספק כלשהו יכול לארח. תבנית הניתוב החלה היא זו שתואמת בדיוק לארכיטקטורה הזו: סוכן שפועל ומודל ראייה שמאמת, המורכבים כך שהשלב היקר או המסוכן מותנה בשלב הזול והאמין. ה־Routing DSL מבטא זאת כקריאה לוגית אחת — פעל, אמת, ואז המשך או עצור — במקום קוד גישור ייעודי בין שני ספקי מודלים, ומעבר אוטומטי (failover) נותן מענה למצב הכשל הריאלי: סוכן GUI כמו UI-Mate-27B הוא בדיוק סוג נקודת הביקורת הבלתי־מוכחת שבוחנים תחילה על נתיב בדיקה, כשהקריאה מוסטת למודל מוכח ברגע שהמודל החדש מתנהג שלא כהלכה. API אחד על פני יותר מ־200 מודלים מתארחים, מחיר המחירון של הספק מועבר בתוספת 0%, והחלקים הבלתי־מוכחים של הערימה נשמרים מאחורי גדרות בטיחות בעודם זוכים באמונכם.
השורה התחתונה
אם אתה בונה משהו שמפעיל שולחן עבודה, Tencent UI-Mate-27B הוא היחיד מבין השניים שקיים במובן שמיש — ניתן להרצה היום על ה-GPUs שלך, עם ציונים מרשימים אך לא משוכפלים שאתה יכול למעשה ללכת לבדוק. אם אתה בונה משהו שזקוק למודל שיבין ויצייר על מה שהוא רואה, InternLumina-U2 היא ארכיטקטורה מבטיחה שמחכה למשקולות שלה — שווה לקרוא עכשיו, לא שווה דבר כתלות עד שה-safetensors יופיעו. עקוב אחרי השניים ליום שבו חלוקת העבודה תהפוך לאפשרית: שחקן על שולחן העבודה שלך, זוג עיניים מאומתות שצופות בו, ושכבת ניתוב ששומרת עליהן אמינות.
