
PixelUMM לעומת UI-Mate-27B: מודל אחד מצייר את מה שהוא רואה, והאחר לוחץ עליו
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 223 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Tencen UI-Mate-27B ו-NVIDIA PixelUMM נראים בני-השוואה על דף מפרט — 27 מיליארד פרמטרים מול כ-15.2 מיליארד, שניהם זמינים להורדה באופן פתוח, שניהם מבוססים על תשתית Qwen — והם כלל אינם בני-השוואה. UI-Mate-27B הוא סוכן GUI בסיסי: הוא צופה בצילומי מסך חיים, מתכנן על סמך מה שנמצא כעת על המסך, ופולט פעולות עכבר ומקלדת מובנות עבור שולחן עבודה אמיתי. PixelUMM הוא מודל מולטימודלי מאוחד ללא מקודד, שקורא תמונות ווידאו במרחב פיקסלים גולמי ומייצר תמונות ווידאו מטקסט — הוא תופס והוא יוצר, אך אין לו מרחב פעולה, אין לו סמן ואין לו דרך לגעת במסך. האחד פועל על העולם. האחר מתאר ומצייר אותו. כל מה שלהלן נובע מהפיצול הזה, ופער הרישוי ביניהם הוא הדבר השני שצריך לדעת.
שתי המעבדות מדווחות על המספרים שלהן עצמן ולאף אחת מהן אין הערכה בלתי תלויה. שתיהן פרסמו בשקט — סגנון הפרסום הוא למעשה המקום שבו הדמיון ביניהן נגמר.
פועל ותופס
UI-Mate-27B מבצע משימה מהוראה בשפה טבעית ומצילומי מסך בזמן אמת בלבד. הוא מנמק על המצב הנראה, מתכנן מחדש כשהממשק משתנה, ומוציא הנמקה, תיאור פעולה תמציתי וקריאות כלים מובנות לשימוש במחשב עבור עכבר, מקלדת, גלילה, המתנה, אינטראקציה עם המשתמש והשלמת משימה. התכונה המייחדת אותו היא ביצוע מונחה הדגמה: הראו לו זרימת עבודה פעם אחת והוא מתאים את ההדגמה המוקלטת למשימה הנוכחית, תוך התייחסות לצילום המסך הנוכחי כסמכותי כאשר הממשק התקדם. הוא עבר כיוונון עדין מ-Qwen3.6-27B עם כיוונון עדין מפוקח ולאחריו למידת חיזוק מקוונת בסביבות GUI ניתנות להרצה, והוא מוגש דרך vLLM עם ממשק תואם OpenAI.
• מדדים מדווחים — OSWorld-Verified ממוצע 77.0, WindowsAgentArena ממוצע 66.2, OSWorkerBench הצלחה מחמירה 41.00 והתקדמות 76.86. הכול מדווח על ידי Tencent וללא שחזור.
• מרחב פעולה — עכבר, מקלדת, גלילה, המתנה, אינטראקציית משתמש, השלמת משימה, במרחב קואורדינטות מנורמל עם קריאות מובנות תואמות pyautogui.
• מציאות החומרה — 27B צפוף, מוגש עם מקביליות טנזורית על פני שני GPUs במדריך ההתחלה המהירה של Tencent עצמה, תחת רישיון Apache-2.0.
• הסתייגות חשובה בכרטיס עצמו — UI-Mate-27B הוא צ'ק-פוינט של סוכן ולא מודל צ'אט חזותי עצמאי. Tencent ממליצה להשתמש בפרומפט הרשמי, במפענח התגובות ובְּרתמת האינטראקציה מהמאגר שלה. אם תכוונו אותו ל"תאר את התמונה הזו", אתם משתמשים בכלי הלא נכון.
PixelUMM תופס את הקוטב הנגדי. כל הארכיטקטורה שלו היא טיעון על ייצוג: ללא VAE, ללא מקודד ראייה, תמונות כטלאי פיקסלים בגודל 16×16 וסרטונים כצינוריות מרחב-זמן של 4 פריימים, ישר לתוך Transformer מסוג decoder-only דרך הקרנות ליניאריות חד-שכבתיות, עם עיצוב Mixture-of-Transformers המשלב תשומת לב משותפת עם פרמטרים ייעודיים למשימה. הבנה היא טקסט אוטורגרסיבי; יצירה היא התאמת זרימה במרחב הפיקסלים. ארבעה צ'קפוינטים משוחררים, S8-F22-R05 כברירת מחדל המכסה טקסט-לתמונה, טקסט-לסרטון ב-96 פריימים ו-24 fps, ושני כיווני ההבנה.

שתי תבניות השחרור מהוות דוגמה מאלפת לניגוד.
UI-Mate-27B הופיע ב-Hugging Face ב-14 באוגוסט 2026 עם כרטיס מודל, מאמר מוקדם של arXiv שמספרו 2608.15930, דף פרויקט, מאגר GitHub ומתכון הגשה מתועד. בין אז לתחילת אוקטובר הוא צבר כ-780 הורדות ו-93 לייקים — צנוע, אך הפצה רגילה של סוכן מחקר עם הניירת מסודרת.
העקבות של PixelUMM שונות במהותן. מאגר GitHub נוצר ב-4 בספטמבר 2026; הפרסום המוקדם ב-arXiv מתוארך ל-29 בספטמבר; מאגר Hugging Face נוצר בשעה 21:40 UTC ב-1 באוקטובר 2026, דקות לאחר הקומיט האחרון של המאגר. לא צץ עבורו שום פוסט בבלוג של NVIDIA, הודעה לעיתונות או שרשור השקה. בנתיב ה-URL של עמוד הפרויקט עצמו עדיין כתוב pixelumm-project-page-preview. מספר ההורדות שלו היה אפס בעת כתיבת הדברים.
לייחס כוונה לכך זו טעות — מעבדה יכולה לפרסם תוצר מחקר ולקבוע השקה למועד מאוחר יותר. מה שניתן לדעת הוא צר יותר ושימושי יותר: למודל אחד יש נתיב הגשה רשמי ועשרה שבועות של הורדות; ולשני יש מאמר, מאגר, ואין שום הצהרת ספק בכלל.

לוחות תוצאות שאינם חופפים
אין בנצ'מרק ששני המודלים מדווחים עליו, וזו בדיוק הנקודה: הם לא פותרים את אותה הבעיה.
• שימוש במחשב אג'נטי — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: אין מרחב פעולה, ולכן לא ניתן לתת ציון.
• הבנת תמונות — UI-Mate-27B: צורך צילומי מסך כקלט סוכן, ולא מוערך כ-VLM כללי. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.
• וידאו — UI-Mate-27B: אין. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.
• יצירה — UI-Mate-27B: אין. PixelUMM: GenEval 0.83 עם משכתב פרומפטים, DPG-Bench 85.74, VBench חלק 1 איכות 84.10.
• עלות פריסה — UI-Mate-27B: 27B dense על פני בערך שני GPUs דרך vLLM, בתוספת ההארנס הרשמי. PixelUMM: כ-30 GB של מקטעי checkpoint מבוזרים, CUDA 13 עם FlashAttention שנבנה מקוד המקור, מודל guardrail מגודר עבור מסלול הווידאו וסביבת Python שנייה עבורו.
• רישיון — UI-Mate-27B: Apache-2.0, קוד ומשקלים. PixelUMM: קוד Apache-2.0, רישיון NVIDIA One-Way Noncommercial על הצ'קפוינט.
• קנה מידה — 27B צפוף לעומת כ-15.2B בסך הכול, מוצג כ-"8B MoT" בטבלאות המאמר של PixelUMM עצמה.
ההצהרה היחידה שאכן ניתנת להשוואה היא בנוגע למקור, והיא חלה על שניהם: כל מספר לעיל הוא של הספק עצמו, אף אחד מהם לא הורץ מחדש מחוץ למעבדה שהפיקה אותו, ואחד משני המודלים מתייג במפורש את תוצאותיו שלו כראשוניות.
לבנות איתם, ולמה ייתכן שתשתמש בשניהם
שני אלה משתלבים טוב יותר מאשר מתחרים. מערכת אוטומציה לשולחן העבודה רוצה את UI-Mate-27B עבור שכבת הפעולה ומשהו שיכול להסיק ממה שראה; צינור תוכן או פיקוח רוצה את הקריאה והיצירה של PixelUMM ואין לו צורך בסמן. החפיפה היא בגבול התפיסה, שבו עיגון צילום המסך של UI-Mate-27B הוא ספציפי למשימה וזה של PixelUMM הוא כללי — אותם פיקסלים, שתי עבודות שונות לחלוטין.
כשאתה אכן מריץ כמה מודלים זה מול זה — הסוכן מול VLM כללי, או צ'קפוינט מחקרי חדש מול זה שכבר בפרודקשן — עלות ההשוואה היא בדרך כלל האינטגרציה, לא האינפרנס: שני מבני API, שתי סכמות אימות, שני חוזים. זו הבעיה ששכבת ניתוב נועדה להסיר, וכאן התכנון של OrcaRouter משתלם: מפתח אחד ליותר מ-200 מודלים, מחירי מחירון של הספקים מועברים הלאה ב-0% תוספת, מעבר אוטומטי בין ספקים בעת תקלה, ו-DSL לניתוב בתוספת מיזוג מודלים לשילוב כמה מודלים לקריאה אחת. לא PixelUMM ולא UI-Mate-27B נמצאים היום באף נקודת קצה מתארחת, וOrcaRouter לא מנתב אף אחד מהם — אז מדובר בזרימת העבודה כשאלה יהיו זמינים, ולא בטענה על זמינות כרגע.
איזה אחד לאיזו עבודה
אם המשימה מסתיימת בלחיצה, בהקשה על מקש או בטופס שמולא, יש כאן מועמד אחד בלבד והוא UI-Mate-27B. הוא תחת רישיון Apache-2.0, יש לו מאמר ב־arXiv והרנס רשמי, והציונים המדווחים שלו ב-OSWorld וב-WindowsAgentArena הם טענות מהסוג שאפשר לבדוק על ידי כל מי שיש לו שני GPUs ותמונת בדיקה של Windows או Ubuntu — וזה בדיוק מה שהופך אותן לראויות לבדיקה במקום להסתמך עליהן.
אם המשימה מסתיימת בתשובה או בתמונה, PixelUMM הוא זה שיכול לעשות זאת, והוא בראש ובראשונה ארטיפקט מחקרי. המאמר שלו כן באופן יוצא דופן לגבי המגבלות של עצמו, ומודה שנתוני אימון שונים גורמים לכך שהשוואת הבנצ'מרק שלו "לא יכולה לקבוע איזו ארכיטקטורה עדיפה". הצ'קפוינט שלו אינו מסחרי. החוזקות שלו הן חדשנות ארכיטקטונית ורוחב, לא מספרי state-of-the-art, והערך המיידי שלו הוא לכל מי שחוקר האם מודלים מאוחדים נטולי מקודד עובדים בקנה מידה של וידאו. הורד אותו כדי לקרוא את הקוד ולהריץ את ההדגמות; אל תוריד אותו כדי לשחרר פיצ'ר.
סיכום שתי השורות הוא אותו סיכום שהראיות מספקות: מודל אחד יכול לפעול ואינו יכול ליצור, האחר יכול ליצור ואינו יכול לפעול, והפער ברישוי ובבגרות ביניהם חשוב יותר מכל מספר פרמטרים.
