כרטיס כותרת ראשי עבור UI-Mate-27B, סוכן GUI יסודי במשקל פתוח של Tencent ששוחרר ב-14 באוגוסט 2026, המציג צג שולחני עם סמן עכבר וחיצי אוטומציה, כתובית 'סוכן GUI יסודי במשקל פתוח', תוויות 'Apache-2.0', '27B params', 'vLLM ready', ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Tencent UI-Mate-27B: סוכן ה-GUI השקט במשקל פתוח שטוען למקום ראשון ב-WindowsAgentArena

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-14 באוגוסט 2026, צוות ה-HY Frontier Multimodal Agent של Tencent דחף שלוש נקודות ביקורת ל-Hugging Face תחת הארגון tencent/ — UI-Mate-27B, ה-UI-Mate-9B הקטן יותר, וה-UI-Mate-democua-27B המודרך על ידי הדגמות. ארבעה ימים לאחר מכן עדיין אין הכרזה בשום מקום: אין פוסט השקה, אין הודעה לעיתונות, אין ציוץ מוצר. מה שנשלח במקום זאת הוא שלם בצורה יוצאת דופן לשחרור שקט: דף פרויקט, מאגר GitHub עם רתמה עובדת, ומאמר arXiv שהוגש לפני יומיים שמכנה את המודל הגדול יותר כמצב-האומנות החדש עם משקלים פתוחים בשליטה בממשקי GUI שולחניים.

כל מה שבקטע הזה מגיע מכרטיסי המודל, מהמאגר ב-GitHub, מדף הפרויקט ומהמאמר הזה — ואף אחד מזה לא שוחזר באופן עצמאי עדיין. לנקודות הביקורת (checkpoints) יש אפס הורדות ב-Hugging Face נכון למועד כתיבת שורות אלה, מה שאומר שאנחנו כנראה בין הראשונים מחוץ לטנסנט שלוקחים אותן ברצינות על הנייר. הנה מה שבאמת ניתן לדעת מהמאגרים, ומה שנשאר בלתי מאומת עד שמישהו אחר יריץ את זה.

תוכן עניינים

• מה ששוחרר, ומה שעדיין לא הוכרז

• מה זה UI-Mate-27B באמת

• התכונה ששונה: ביצוע מונחה הדגמה

• המספרים — כולם דווחו על ידי הספק

• היכן שהמספרים האלה היו יושבים — אם הם מחזיקים

איך להריץ את זה

• המחסנית סביב סוכן GUI חדש

• מה לצפות בהמשך

• שאלות נפוצות

מה שוחרר, ומה שעדיין לא הוכרז

Tencent פרסמה את UI-Mate-27B (27 מיליארד פרמטרים, רישיון Apache-2.0, safetensors בפורמט BF16) ב-14 באוגוסט 2026, לצד הגרסה האחות 9B וה-checkpoint המותאם להדגמות UI-Mate-democua-27B. שני ה-checkpoints של 27B בנויים על Qwen3.6-27B — שהוא בעצמו מודל מולטי-מודאלי ברישיון Apache-2.0 ששוחרר באפריל 2026 — כלומר כל המחסנית, הבסיס והכיוונון העדין, ניתנים לשימוש מסחרי. המאגרים נושאים חותמות זמן של שינוי אחרון מהשבוע — ה-checkpoint המותאם להדגמות עודכן כבר היום — כך שטנסנט עובדת עליהם באופן פעיל.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

מה שפומבי עד כה:

• המשקלים של UI-Mate-27B, UI-Mate-9B ו-UI-Mate-democua-27B ב-Hugging Face, כל אחד עם כרטיס מודל, טבלאות הערכה ומתכון הגשה.

• דף פרויקט באתר ui-mate.github.io עם סרטון הדגמה, מדריך שימוש, ואפליקציית macOS ל-Apple Silicon (DMG v0.2.4).

• מאגר ה-GitHub (github.com/Tencent/UI-Mate) המכיל את הפרומפט הרשמי, מפענח התגובות ושלד האינטראקציה — הכרטיס מבהיר שמדובר ב"נקודת ביקורת של סוכן ולא במודל שיחה-חזותי עצמאי", ומומלץ להשתמש בשלד האינטראקציה לכל שימוש אמיתי.

• פרה-פרינט של arXiv (2608.15930), שהוגש ב-16 באוגוסט, בשם "UI-Mate: קידום סוכני GUI מבוססי-מודל יסוד עם משקלים פתוחים באמצעות הדגמות בהקשר."

מה שעדיין לא פומבי: טנסנט עצמה לא אמרה דבר — זו הוצאה ראשונית של ריפו, לא השקה. הווריאנט המודרך-הדגמה שעמוד הפרויקט רשם כעוד לא פומבי, כעת יש לו משקלים זמינים על Hugging Face: הריפו tencent/UI-Mate-democua-27B, שנוצר באותו push של 14 באוגוסט, מתויג במפורש כצ'קפוינט המודרך-הדגמה של המשפחה — מודל נפרד, לא מיתוג מחדש של ה-27B. עדיין אין API מתארח בשום מקום. זה חשוב: הדרך היחידה להריץ את UI-Mate כיום היא להוריד את המשקלים ולשרת אותם בעצמך.

מה זה UI-Mate-27B בעצם

UI-Mate-27B הוא סוכן GUI בסיסי לעבודה ארוכת-טווח על פני יישומים ומערכות הפעלה. הוא צופה בצילומי מסך חיים, מנמק על סמך המצב הנראה, ופולט פעולות מקלדת ועכבר מובנות לאינטראקציה עם שולחן העבודה המקורי. האימון כולל כוונון עדין מפוקח ולאחר מכן למידת חיזוק מקוונת בסביבות GUI הניתנות להרצה — המודל למד על ידי נהיגה ממשית בשולחנות עבודה, לא מתוך צילומי מסך סטטיים בלבד.

מרחב הפעולות הוא החלק שחשוב למפתחים: עכבר, מקלדת, גלילה, המתנה, אינטראקציה עם המשתמש, והשלמת משימות, עם פלטים תואמים ל-pyautogui. המודל עובד במרחב קואורדינטות מנורמל של 1000×1000, וסוכן הייחוס משנה את קנה המידה של התחזיות שלו בחזרה לרזולוציית צילום המסך האמיתית, כך שהפעולות שורדות הבדלי קנה מידה בתצוגה בין מכונות. ה-README של המודל ממליץ לשרת אותו עם vLLM מאחורי נקודת קצה תואמת OpenAI.

התכונה שמייחדת: ביצוע מונחה הדגמה

רוב סוכני ה-GUI מקבלים קלט אחד: הוראה. UI-Mate מקבל קלט שני, שהוא באמת נדיר בצ'קפוינט פתוח — הדגמה. "הראה את זרימת העבודה פעם אחת. תן לסוכן להתאים אותה למשימה," כפי שמנסח זאת דף הפרויקט.

המנגנון אינו וידאו-בהקשר או סקריפט פעולה קבוע. הדגמה מתעדת צילומי מסך מיד לפני ואחרי כל פעולת מקלדת או מצביע, והצינור (pipeline) מנרמל את הרצף לייצוג עקבי של פעולה ופריים, מתייג אותו עם תצפיות, כוונה, פעולות וראיות אימות, ומחלק אותו לתת-משימות בעלות שמות עם קריטריוני השלמה. בזמן הסקה, זה הופך לזרימת עבודה קומפקטית שמוזרקת עבור תת-המשימה הפעילה — אבל צילום המסך החי נשאר סמכותי לאורך כל הדרך, כך שכאשר מצב היישום שונה מההדגמה, המודל מתכנן מחדש במקום לנגן שוב.

טנסנט הפכה את נקודת הביקורת שמאחורי זרימת העבודה הזו למודל ציבורי משלה: כרטיס ה-UI-Mate-democua-27B {{1}}מזווג תוצאות של הוראות-בלבד לעומת הדגמה-אחת על אותן הערכות{{/1}}, וסכמת הכלים שלו {{2}}מוסיפה פעולת subtask_complete — המנגנון שמאחורי אותן תת-משימות בעלות השם{{/2}}. בתת-קבוצת ה-self-demo של OSWorkerBench, הדגמה אחת {{3}}מעלה את שיעור ההצלחה הקפדני מ-17.17 ל-35.35 ואת ההתקדמות מ-67.85 ל-81.14{{/3}}; בתת-קבוצת OSWorld, {{4}}ההתקדמות עולה מ-40.27 ל-65.75{{/4}}; בסט ההערכה GameDev, {{5}}הציון הממוצע עולה מ-76.76 ל-81.15 בעוד שאורך מסלול הביצוע הממוצע יורד מ-303.6 ל-253.1 צעדים — ההדגמה מקצרת את המשימה לצד שיפורה{{/5}}. {{6}}הכרטיס מדווח כי ההדגמה שיפרה 28 מתוך 33 משימות ה-self-demo ופתרה ארבע משימות שמקבלות אפס ללא הדרכה{{/6}}. {{7}}האזהרה היא אותה אזהרה העוברת כחוט השני לאורך כל המאמר: אלה הערכות מזווגות של הצוות עצמו, הממוצעות על פני שלוש עד חמש ריצות, ואיש לא שחזר אותן{{/7}}.

המספרים — כולם דווחו על ידי הספק

ביצוע לפי הוראות בלבד, ישירות מכרטיס המודל:

ציון ממוצע של OSWorld-Verified — 77.0

• ציון ממוצע של WindowsAgentArena — 66.2

• הצלחה קפדנית ב-OSWorkerBench — 41.00

התקדמות OSWorkerBench — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench הוא עצמו אחת משלוש התרומות במאמר: מדד חדש של 100 משימות משרדיות ארוכות טווח על פני 41 יישומים, עם 33 תת־קבוצות של הדגמה עצמית ו־45 תת־קבוצות של הדגמה משתנה. זהו מדד חדש, ולכן אין אמנות קודמת להשוואת שני הציונים הללו. לעומת מודל הבסיס שלו עצמו, נטען כי UI-Mate-27B מביס את Qwen3.6-27B ב־17.7 נקודות של הצלחה מחמירה ו־24.5 נקודות של התקדמות ב־OSWorkerBench — וזהו המספר הנקי ביותר של השוואה הוגנת בכל הפרסום, מאחר ששני המודלים ירוצו דרך אותה תשתית.

כל נתון לעיל הוא הערכה עצמית של הצוות. אין עדיין ציונים בלתי תלויים, אין הרצות חוזרות של צד שלישי, ועם אפס הורדות, אין גם שחזורים קהילתיים. התייחסו לכל מספר כאן כאל טענה, לא כאל עובדה.

היכן שהמספרים האלה היו יושבים — אם הם יחזיקו מעמד

WindowsAgentArena הוא זה שיהווה כותרת אמיתית. תוצאות ה‑WAA הטובות ביותר שפורסמו בפומבי מוקדם יותר ב‑2026 התרכזו סביב 61.0 (מערכת מודולרית בשם VLAA‑GUI, אפריל 2026); ה‑EvoCUA‑32B בעל המשקלים הפתוחים של מייטן (Meituan) עמד על 56.5, וה‑UI‑TARS‑2 הסגור של ByteDance היה בשנות ה‑50 הנמוכות עד האמצעיות באותו לוח תוצאות. תוצאה של 66.2 בהערכה של UI‑Mate‑27B עצמו תציב אותו מעל לכל מה שדווח על המדד הזה השנה — פתוח או סגור. זו טענה חזקה, והיא דורשת הרצה חוזרת בלתי תלויה.

OSWorld-Verified ב-77.0 הוא תוצאה חזקה, אבל לא שיא חדש במשקל פתוח בלוח הציבורי. בתמונת המצב של לוח המובילים של OSWorld-Verified מתחילת אוגוסט 2026, Holo3-35B-A3B בעל המשקל הפתוח רשום ב-82.6, עם כמה מודלים סגורים מתקדמים מעליו (Qwen3.8 Max ב-86.1, Claude Mythos 5 ו-Claude Fable 5 ב-85.0, Claude Opus 4.8 ב-83.4). הניסוח "המתקדם ביותר" במאמר הוא אפוא טענה לגבי מערך ההערכה שלו עצמו, לא עובדה מוסכמת — רתמות שונות, מפענחי פעולות וסחף בדיווח עצמי הופכים את ההשוואה בין 77.0 ל-82.6 לשאלה שרק הרצה עצמאית חוזרת יכולה להכריע. לצורך הקשר לגבי המשמעות של מודל פתוח בגודל 27B שמשיג 77.0: הוא היה ממוקם מעל קו הבסיס של מומחים אנושיים (~72.4) ומעל כמה מערכות מתקדמות גדולות יותר באותו לוח, כולל Claude Opus 4.6 ב-72.7 ו-Kimi K2.6 ב-73.1.

טנסנט אינה חדשה בתחום הזה — היא שחררה את POINTS-GUI-G, מודל ביסוס ממשק גרפי (GUI) בגודל 8B, בפברואר 2026, השיקה את העוזר Marvis OS במאי, ותרמה לפרויקט השימוש במחשב GUICrafter ביוני. UI-Mate היא קו מוצרים נפרד שממוקד ספציפית בשליטה מלאה בשולחן העבודה, והיא הראשונה מבין סוכני ה-GUI של טנסנט שיוצאת כמודל בסיס פתוח, ולא כרכיב ביסוס או כמוצר.

איך להריץ את זה

המודל מיועד ל-vLLM, וכרטיס המודל נותן את הפקודה המדויקת — vllm serve tencent/UI-Mate-27B עם tensor-parallel size 2 ותבנית הצ'אט התואמת ל-OpenAI. פרט מעשי אחד בולט: הסוכן שומר כברירת מחדל חמישה צילומי מסך בהקשר, כך שהשרת חייב לאפשר לפחות שש תמונות לכל בקשה, מכיוון שצילום המסך החדש ביותר מגיע לפני שהכי ישן מושמט. הדגל המומלץ הוא --limit-mm-per-prompt עם שש תמונות ואפס וידאו. נקודת הבידוק המונחית-על-ידי-הדגמות משרתת באותה דרך — הכרטיס שלה מזכיר את vLLM ו-SGLang מאחורי נקודת קצה תואמת OpenAI.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

כאשר מגישים לו צילום מסך והוראה, מחלקת סוכן Python (UIMateAgent) מחזירה את התגובה יחד עם פעולות מובנות, וממירה את הקואורדינטות של 1000×1000 בחזרה לרזולוציה שלך. דף הפרויקט מציע גם אפליקציית macOS עבור Apple Silicon למצב המודרך על ידי הדגמה, שהיא הדרך הקלה ביותר לנסות את זרימת העבודה "הראה פעם אחת" מבלי לבנות את התשתית בעצמך. הרישיון הוא Apache-2.0 בכל הפרויקט, כך ששימוש מקומי, כוונון עדין ושילוב מסחרי – כולם מותרים.

שתי אזהרות מתאימות לצד כל "איך להריץ את זה" עבור סוכן שימוש במחשב, ושתיהן מגיעות מכרטיס המודל עצמו. השתמשו בסביבות מבודדות או חד-פעמיות. דרשו אישור אנושי לפני כל פעולה רגישה, עקבו אחר מסלול הפעולה, ואל תתייחסו להצלחה שדווחה על ידי המודל כהוכחה לכך שהתוצאה המיועדת אכן התרחשה. סוכני GUI עלולים ללחוץ לא נכון, והזרקת פרומפטים דרך תוכן שעל המסך היא מודל איום ממשי, לא היפותטי.

המחסנית הטכנולוגית סביב סוכן GUI חדש

אף אחד מצ'קפוינטי ה-UI-Mate עדיין לא נמצא ב-OrcaRouter — המשפחה בת ימים ספורים עם אפס הורדות, ומודל הבסיס שלה Qwen3.6-27B גם לא. אין API מתארח, אז אם אתה רוצה להריץ אחד השבוע, אתה מריץ vLLM בעצמך. זה בסדר למעבדה, אבל זו הצורה הלא נכונה לייצור.

צנרת ייצור לשימוש במחשב היא רק לעתים נדירות נקודת ביקורת אחת. היא כוללת מודל מתכנן שמחליט על הכוונה הבאה, מודל עיגון או ראייה שקורא את המסך, סוכן ה-GUI עצמו, ומנגנון גיבוי זול כששלב משנה נכשל — וכל החלקים האלה הם מודלים מוגשים, גם כשסוכן ה-GUI פועל מקומית. השילוב הזה הוא בדיוק מה ששכבת ניתוב נועדה לו: API אחד על פני יותר מ-200 מודלים מתארחים, מחיר המחירון של הספק מועבר ללא תוספת (0%), ומעבר גיבוי אוטומטי כך שהשבתה חולפת אצל ספק אחד לא עוצרת ריצת סוכן ארוכה. ה-DSL של הניתוב גם מאפשר להרכיב כמה מודלים לקריאה אחת — מתכנן בהתחלה, מאמת זול בסוף — בלי לתפור ספקים יחד בקוד שלך. הסיכום הכנה פשוט: הסוכן שמפעיל את שולחן העבודה הוא מקומי, אבל המודלים שמחליטים מה לעשות סביבו ניתנים לניתוב, וניסיון בטוח של נקודות ביקורת חדשות ובלתי מוכחות הוא בדיוק מה שמעבר הגיבוי מיועד לו.

מה לצפות בהמשך

ארבעה דברים היו משנים את התמונה עבור UI-Mate-27B, בסדר חשיבות משוער:

• ריצה עצמאית חוזרת של OSWorld-Verified ו-WindowsAgentArena. במיוחד, הנתון של WAA הוא או עניין גדול או תוצר לוואי של מנגנון הבדיקה (harness artifact), ורק הערכה חיצונית תכריע מה נכון.

• הדוח הטכני הרשמי. הציטוט הנוכחי הוא מציין מקום זמני, והמאמר המלא צפוי לחשוף את פרטי מנוע הנתונים שהתקציר רק מרמז עליהם.

• ההכרזה של Tencent עצמה. שחרור ראשוני של רפו כמו זה בדרך כלל מקדים משהו — אינטגרציה של Marvis, שירות מתארח, או דחיפה רחבה יותר של מודלים פתוחים.

• ממשק API מתארח. המשקלים של כל שלוש נקודות הביקורת הם ציבוריים כעת, אבל שום דבר לא מוגש בשום מקום — אין נקודת קצה של Tencent, אין ספק אינפרנס חיצוני — לכן אירוח עצמי נותר הדרך היחידה, ורק הודעה של Tencent או אימוץ של ספק תשנה זאת.

שאלות נפוצות

מה זה Tencent UI-Mate-27B?

{{1}}UI-Mate-27B{{/1}} הוא סוכן GUI בסיסי בעל {{2}}27 מיליארד פרמטרים{{/2}} ברישיון Apache-2.0, מטעם צוות HY Frontier לסוכנים מולטי‑מודאליים של Tencent, המכוונן מ‑{{3}}Qwen3.6-27B{{/3}}. הוא צופה בצילומי מסך שולחן עבודה בזמן אמת, מבצע עליהם חשיבה, ומפיק פעולות עכבר ומקלדת {{4}}תואמות pyautogui{{/4}}. הוא שוחרר בשקט ב‑Hugging Face ב‑14 באוגוסט 2026 — לצד האח בגודל 9B ו‑{{5}}UI-Mate-democua-27B{{/5}} מונחה‑ההדגמות — ללא כל הכרזה, ומדדיו {{6}}מדווחים על ידי הספק{{/6}} בלבד עד כה.

במה שונה ביצוע מונחה הדגמה מהרצה חוזרת של סקריפט?

במקום להריץ מאקרו מוקלט, UI-Mate מתייחס להדגמה כזרימת עבודה בעלת כיתובים ומובנית כתת-משימות, המוזרקת כהנחיה. צילום המסך החי נשאר הסמכות העליונה, כך שכאשר פריסת האפליקציה, התוכן או המצב שונים ממה שהוצג, המודל מתכנן מחדש במקום להפעיל קואורדינטות מיושנות. זהו המנגנון מאחורי הקפיצה המוצהרת מ-17.2 ל-35.4 בהצלחה קפדנית בתת-קבוצת ההדגמה העצמית — וזו עדיין טענת ספק עד שמישהו משחזר אותה.

האם UI-Mate-27B הוא באמת המתקדם ביותר עבור סוכני GUI במשקל פתוח?

זה תלוי לחלוטין במבנה ההערכה. תוצאת ה-WindowsAgentArena שלו, 66.2, הייתה מדורגת בראש התוצאות הציבוריות הטובות ביותר של WAA מתחילת 2026, אך תוצאת ה-OSWorld-Verified שלו, 77.0, נמוכה מ-Holo3-35B-A3B בעל המשקלים הפתוחים, שעומד על 82.6 בלוח הציבורי. המאמר מכנה אותו "state of the art" חדש בעל משקלים פתוחים; ריצה חוזרת עצמאית על תשתית הערכה עקבית היא הדרך היחידה לדעת.

האם אני יכול להריץ את UI-Mate-27B היום?

כן, אם תשרת את זה בעצמך: הורד את המשקולות מ־Hugging Face — את נקודת הבידוק הכללית 27B, את 9B, או את UI-Mate-democua-27B המונחית על־ידי הדגמות — הרץ את פקודת vLLM מכרטיס המודל (גודל מקביליות טנזור 2, שש תמונות לכל הנחיה), והנהג בו באמצעות סוכן Python או אפליקציית macOS. אין API מתארח, ואף אחת מנקודות הבידוק לא נמצאת עדיין על OrcaRouter — וזו, עבור מודלים חדשים ובלתי־מאומתים כל כך, סיבה הגיונית להשאיר אותם בסביבה מבודדת לעת עתה.

הקריאה הנכונה על UI-Mate-27B אינה {{1}}"המנצח"{{/1}} אלא {{2}}"שווה מעקב."{{/2}} מודל פתוח של 27B שטוען להובלה ב-WAA ומשחרר זרימת עבודה של הדגמה חד-פעמית הוא נתון משמעותי בשנה שבה סוכני שימוש במחשב עם משקלים פתוחים עברו מבדיחה למרחק נגיעה מהחזית. עכשיו, כשהצ'קפוינט שמבוסס על הדגמות הוא משקלים פתוחים במקום הבטחה בדף הפרויקט, זרימת העבודה של "הראה פעם אחת" היא משהו שאפשר באמת להריץ. Tencent הייתה זהירה בשחרורים בעבר, והשחרור הזה נראה כמו עבודה בתהליך שפורסמה לציבור. הריצו אותה בארגז חול, הריצו שוב את מבחני הביצועים, והמשיכו לעקוב אחר ההכרזות — {{3}}החלק המעניין בסיפור הזה עדיין לפנינו.{{/3}}

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube