כרטיס כותרת ראשי להשוואה 'InternLumina-U2 לעומת Tencent UI-Mate-27B' עם כותרת המשנה 'סוכן שולחן העבודה שאפשר להריץ עכשיו לעומת מודל הראייה שאפשר רק לקרוא עליו' ושלושה שבבי נתונים — 'UI-Mate-27B: מתפעל שולחן עבודה כיום', 'InternLumina-U2: ראייה מאוחדת, ללא משקלים', 'שניהם Apache-2.0, שניהם לא מוכחים' — ועם לוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

InternLumina-U2 מול Tencent UI-Mate-27B: סוכן שולחן העבודה שאפשר להריץ עכשיו מול מודל הראייה המאוחד שאפשר רק לקרוא עליו

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Tencent UI-Mate-27B ו-InternLumina-U2 הם שני שחרורים שקטים ברישיון Apache-2.0 ממעבדות סיניות, שפורסמו בהפרש של שבועיים זה מזה, והם אינם מתחרים — וזו בדיוק הסיבה שכדאי להשוות ביניהם. Tencent UI-Mate-27B, ששוחרר עם משקלים פתוחים ב-14 באוגוסט 2026, הוא סוכן שולחן עבודה: הוא צופה במסך ומפיק פעולות עכבר ומקלדת. InternLumina-U2, שפורסם כקוד הסקה ב-1 בספטמבר 2026 על ידי Shanghai AI Laboratory, הוא מודל ראייה אחיד שאפתני: הוא טוען שהוא קורא תמונות, וידאו ותלת-ממד ומייצר ועורך תמונות. האחד פועל על מה שהוא רואה; השני, כשיהיו לו משקלים סוף סוף, ידבר ויצייר על מה שהוא רואה. אם העבודה שלך היא הפעלת שולחן עבודה, רק אחד משני אלה יכול לעשות אותה היום — וזה לא זה עם הארכיטקטורה המרשימה יותר.

הסוכן שפועל: Tencent UI-Mate-27B

UI-Mate-27B הוא סוכן GUI (ממשק משתמש גרפי) מבוסס מודל-יסוד עם משקלים פתוחים ו-27 מיליארד פרמטרים, מבית צוות הסוכנים הרב-מודאליים HY Frontier של Tencent, מכוונן מ-Qwen3.6-27B. הוא בוחן צילומי מסך חיים, מבצע חשיבה על מצב המסך הנוכחי, ומפיק פעולות מקלדת ועכבר מובנות במרחב קואורדינטות מנורמל — תוצר של מודל שאומן להפעיל סביבת שולחן עבודה אמיתית, ולא לשוחח על אודותיה. המאפיין הייחודי שלו הוא ביצוע מונחה-הדגמה: הראה לו זרימת עבודה פעם אחת, והוא מתאים את ההדגמה שהוקלטה למשימה שלפניו, כשהוא מתייחס לצילום המסך החי כאל מקור סמכותי כשהממשק שונה ממה שתועד. הציונים הבולטים שדיווחה Tencent: OSWorld-Verified 77.0 ו-WindowsAgentArena 66.2 — נתונים שהיו מובילים את טבלאות הדירוג של 2026 אילו שוכפלו במבחן בלתי תלוי — לצד מגוון רחב של מדדי OSWorkerBench. המשקולות אמיתיות וניתנות להורדה: שנים-עשר shards בפורמט safetensors ב-Hugging Face, הניתנים לאירוח עצמי באמצעות vLLM או SGLang על כמה GPUs. כרטיס המודל נושא הסתייגות חשובה: מדובר ב-agent checkpoint, לא במודל עצמאי לשיח חזותי — אם תפנה אליו עם "תאר את התמונה הזאת", אתה משתמש בו לא נכון.

העיניים שהובטחו: InternLumina-U2

InternLumina-U2 הוא מין שונה לחלוטין. זהו מודל דיפוזיה דליל־מומחים (sparse mixture-of-experts) עם 16 מיליארד פרמטרים (מיליארד אחד פעיל), שהמעבדה מתכננת אותו כמודל אחד להבנה חזותית כוללת, יצירת תמונות ועריכת תמונות — עיצוב דיסקרטי לחלוטין עם שמונה ספרי־קוד, שבו עמוד שדרה יחיד גם קורא תמונה, תרשים, וידאו או נכס תלת־ממדי וגם כותב פיקסלים חדשים. אם המודל המנטלי שלך הוא סוכן GUI, InternLumina-U2 הוא הקוטב ההפוך: הוא לא רוצה ללחוץ על שום דבר, הוא רוצה להבין הכול ולצייר לפי בקשה. הצורה שפורסמה ב־1 בספטמבר 2026 כוללת קוד הסקה וארכיטקטורה — שש נקודות כניסה למשימות במאגר GitHub, דף פרויקט עם טבלת אמות מידה ראשונית, ו־stub ריק של Hugging Face — ומשקלי המודל, קוד האימון והדוח הטכני כולם עדיין מסומנים כ"בקרוב". איש אינו יכול להריץ אותו. הפער בין שני המודלים אינו באיכות; הוא בקיום.

לוח התוצאות

הנתונים של UI-Mate-27B הם דיווח של Tencent, שלא שוחזרו; הנתונים של InternLumina-U2 הם דיווח מעבדה, ראשוניים וחלקיים. כל שורה נושאת את מקור הנתונים שלה.

• תפקיד — Tencent UI-Mate-27B: להפעיל שולחן עבודה — לקרוא צילומי מסך חיים, ולפלוט פעולות עכבר ומקלדת. InternLumina-U2: תפיסה ויצירה — להבין תמונות/וידאו/תלת-ממד, לייצר ולערוך תמונות.

• משקלים — Tencent UI-Mate-27B: ציבוריים מאז 14 באוגוסט 2026, שנים-עשר רסיסי safetensors, Apache-2.0. InternLumina-U2: לא ציבורי — מאגר Hugging Face ריק, המשקלים "בקרוב".

• קנה מידה — 27B צפוף, מכוונן עדין מ-Qwen3.6-27B, לעומת 16B סה"כ / 1B פעיל של מודל דיפוזיה MoE דליל.

פלט — Tencent UI-Mate-27B: פעולות מובנות התואמות ל-pyautogui במרחב קואורדינטות מנורמל. InternLumina-U2: טוען לטקסט, המרת טקסט לתמונה עד 1024×1024, ועריכת תמונה מבוססת הוראות.

• המספרים הבולטים — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench: שיפור בזכות הדגמות (הכול לפי דיווח Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (לפי דיווח מעבדה, ראשוני).

• אזהרת מקור — Tencent UI-Mate-27B: הכרטיס עצמו מזהיר כי מדובר ב־checkpoint של סוכן, ולא במודל שיחה־חזותי עצמאי. InternLumina-U2: דף הפרויקט מגדיר את תוצאותיו שלו כ"ראשוניות, חלקיות".

מציאות ההגשה — Tencent UI-Mate-27B: אירוח עצמי באמצעות vLLM או SGLang על כ-2 GPU; אין כיום ספק inference מארח שפורס אותו. InternLumina-U2: אף אחד לא יכול לשרת אותו — הדרייבר שפורסם מצפה לנקודות ביקורת שאינן במאגר.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

שני טעמים שונים של לא מוכח

שני הדגמים אינם מוכחים, והמילה אינה מתכוונת לאותו דבר בשני המקרים. Tencent UI-Mate-27B אינו מוכח במובן הרגיל של דגם חדש: הציונים הבולטים הם של הספק עצמו, אף אחד לא הריץ אותם מחדש באופן בלתי תלוי, ומספר ההורדות זעיר ביחס להצהרות — המצב האופייני לצ'קפוינט שנראה במבט ראשון כבן ארבעה ימים, ומאז צמחה סביבו קהילה קטנה. אבל הוא אינו מוכח במובן הניתן לבדיקה. מכיוון שהמשקולות קיימות, את ה‑66.2 ואת ה‑77.0 אפשר לבדוק השבוע, כל מי שיש לו שתי יחידות GPU וסביבת בדיקה של Windows, ואת הטענות המבוססות על הדגמות אפשר לשחזר או להפריך בזרימות עבודה אמיתיות. InternLumina-U2 אינו מוכח במובן מחמיר יותר: הוא בלתי ניתן לבדיקה. הארכיטקטורה שלו ציבורית וקריאה, המספרים שלו — לא. אין שום ארטיפקט שיכול לאשש אותם, והטבלה החלקית של המעבדה עצמה כבר מראה שהוא מפגר אחרי יריב בעל שם במדד גנרטיבי אחד לפחות. מספר של ספק המחובר לקובץ להורדה הוא טענה הממתינה לשופט. מספר של ספק המחובר למפת דרכים הוא תקווה.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

כרטיס המודל tencent/UI-Mate-27B ב-Hugging Face, שצולם ב-27 באוגוסט 2026 — בסיס Qwen3.6-27B, ציוני OSWorld ו-WindowsAgentArena שדווחו על ידי הספק, וההערה שאף ספקית inference אינה פורסת אותו כעת.

חלוקת העבודה הטבעית: שחקן ועיניו

כשמציבים אותם זה לצד זה, שני המודלים משרטטים את קווי המתאר של צינור אוטומציה אמין. הבעיה הקשה עם סוכני GUI היא לא המקרה הממוצע; היא הסוכן שעושה בשקט את הדבר הלא נכון במצב מסך בלתי צפוי ואף אחד לא שם לב. זו בדיוק העבודה שלשמה קיים מודל ראייה זול ואמין — לוודא את מצב המסך לפני ואחרי כל פעולה, לאשר שהדיאלוג שהופיע הוא הדיאלוג שהסוכן חושב שהופיע, ולעצור את הלולאה כשהמציאות ומודל המציאות של הסוכן מתפצלים. Tencent UI-Mate-27B הוא השחקן; מודל ראייה מאוחד מהסוג ש-InternLumina-U2 טוענת להיות הוא המאמת הטבעי, שיכול לקרוא את אותם צילומי מסך שהסוכן פועל עליהם. כאשר — ורק כאשר — משקלי InternLumina-U2 אכן ישוחררו וטענות ההבנה שלה ישרדו בדיקות בלתי תלויות, זה התפקיד שהיא תוכל למלא לצד סוכן ולא נגדו. השניים אינם יריבים על אותה עבודה; הם שני חצאיה של עבודה אחת.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

מאגר ה-GitHub של InternLM/InternLumina-U2, שצולם ב-2 בספטמבר 2026 — דף הנחיתה של המאגר המציג את סקריפטי ההסקה לפי משימה, כולל נקודת הכניסה להבנת תמונה שממנה ייבנה מאמת מצב מסך; המשקולות שהיו הופכות אותו לבר-הרצה אינן בעץ הקבצים.

מה שכבת ניתוב עושה עבור מחסנית סוכן-פלוס-עיניים

אף אחד מהמודלים אינו מתארח ב־OrcaRouter, ולא נציג זאת אחרת — ל־Tencent UI-Mate-27B אין ספק מארח בשום מקום, ול־InternLumina-U2 אין משקלים שספק כלשהו יכול לארח. תבנית הניתוב החלה היא זו שתואמת בדיוק לארכיטקטורה הזו: סוכן שפועל ומודל ראייה שמאמת, המורכבים כך שהשלב היקר או המסוכן מותנה בשלב הזול והאמין. ה־Routing DSL מבטא זאת כקריאה לוגית אחת — פעל, אמת, ואז המשך או עצור — במקום קוד גישור ייעודי בין שני ספקי מודלים, ומעבר אוטומטי (failover) נותן מענה למצב הכשל הריאלי: סוכן GUI כמו UI-Mate-27B הוא בדיוק סוג נקודת הביקורת הבלתי־מוכחת שבוחנים תחילה על נתיב בדיקה, כשהקריאה מוסטת למודל מוכח ברגע שהמודל החדש מתנהג שלא כהלכה. API אחד על פני יותר מ־200 מודלים מתארחים, מחיר המחירון של הספק מועבר בתוספת 0%, והחלקים הבלתי־מוכחים של הערימה נשמרים מאחורי גדרות בטיחות בעודם זוכים באמונכם.

השורה התחתונה

אם אתה בונה משהו שמפעיל שולחן עבודה, Tencent UI-Mate-27B הוא היחיד מבין השניים שקיים במובן שמיש — ניתן להרצה היום על ה-GPUs שלך, עם ציונים מרשימים אך לא משוכפלים שאתה יכול למעשה ללכת לבדוק. אם אתה בונה משהו שזקוק למודל שיבין ויצייר על מה שהוא רואה, InternLumina-U2 היא ארכיטקטורה מבטיחה שמחכה למשקולות שלה — שווה לקרוא עכשיו, לא שווה דבר כתלות עד שה-safetensors יופיעו. עקוב אחרי השניים ליום שבו חלוקת העבודה תהפוך לאפשרית: שחקן על שולחן העבודה שלך, זוג עיניים מאומתות שצופות בו, ושכבת ניתוב ששומרת עליהן אמינות.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube