
PixelUMM vs UI-Mate-27B: En modell ritar vad den ser, den andra klickar på det
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Tencent UI-Mate-27B och NVIDIA PixelUMM ser jämförbara ut på ett specifikationsblad – 27 miljarder parametrar mot ungefär 15,2 miljarder, båda öppet nedladdningsbara, båda byggda på Qwen-stommar – och de är inte alls jämförbara. UI-Mate-27B är en grundläggande GUI-agent: den observerar live-skärmbilder, planerar utifrån vad som för närvarande finns på skärmen och avger strukturerade mus- och tangentbordsåtgärder för ett verkligt skrivbord. PixelUMM är en encoderfri enhetlig multimodal modell som läser bilder och video i rå pixelrymd och genererar bilder och video från text – den uppfattar och den skapar, men den har inget handlingsutrymme, ingen markör och inget sätt att röra vid en skärm. Den ena agerar på världen. Den andra beskriver och avbildar den. Allt nedan följer av den uppdelningen, och licensgapet mellan dem är det andra du behöver känna till.
Båda labben rapporterar sina egna siffror och ingen av dem har en oberoende utvärdering. Båda släpptes tyst – det är i sättet de släpptes på som likheten faktiskt upphör.
Aktör och uppfattare
UI-Mate-27B utför en uppgift utifrån en instruktion i naturligt språk och enbart live-skärmbilder. Den resonerar över det synliga tillståndet, omplanerar när gränssnittet förändras och producerar resonemang, en kortfattad åtgärdsbeskrivning och strukturerade verktygsanrop för datoranvändning inom mus, tangentbord, rullning, väntan, användarinteraktion och slutförande av uppgift. Dess utmärkande egenskap är demonstrationsstyrd exekvering: visa den ett arbetsflöde en gång och den anpassar den inspelade demonstrationen till den aktuella uppgiften, och behandlar den aktuella skärmbilden som auktoritativ när gränssnittet har gått vidare. Den är finjusterad från Qwen3.6-27B med övervakad finjustering följt av online-förstärkningsinlärning i körbara GUI-miljöer, och den serveras via vLLM med ett OpenAI-kompatibelt gränssnitt.
• Rapporterade benchmarks — OSWorld-Verified medelvärde 77,0, WindowsAgentArena medelvärde 66,2, OSWorkerBench strikt framgång 41,00 och framsteg 76,86. Alla rapporterade av Tencent och ej reproducerade.
• Handlingsutrymme — mus, tangentbord, rullning, väntan, användarinteraktion, slutförande av uppgift, i ett normaliserat koordinatutrymme med pyautogui-kompatibla strukturerade anrop.
• Hårdvaruverklighet — 27B dense, serverad med tensorparallellism över två GPU:er i Tencents egen snabbstart, under Apache-2.0.
• Ett viktigt förbehåll på själva kortet — UI-Mate-27B är en agent-checkpoint snarare än en fristående visuell chattmodell. Tencent rekommenderar den officiella prompten, svarsparsern och interaktionsramverket från sitt repo. Rikta den mot "beskriv den här bilden" och du använder fel verktyg.
PixelUMM intar den motsatta polen. Hela dess arkitektur är ett argument om representation: ingen VAE, ingen visionsencoder, bilder som 16×16-pixelpatchar och videor som rumsligt-temporala tubelets om 4 bildrutor, rakt in i en Transformer med enbart dekoder via enkellagers linjära projektioner, med en Mixture-of-Transformers-design som parar ihop delad uppmärksamhet med uppgiftsspecifika parametrar. Förståelse är autoregressiv text; generering är flödesmatchning i pixelrummet. Fyra checkpoints levereras, S8-F22-R05 som standardval som täcker text-till-bild, text-till-video vid 96 bildrutor och 24 fps, samt båda förståelseriktningarna.

De två utgivningsmönstren är en studie i kontraster.
UI-Mate-27B dök upp på Hugging Face den 14 augusti 2026 med ett modellkort, en arXiv-preprint numrerad 2608.15930, en projektsida, ett GitHub-repositorium och ett dokumenterat serveringsrecept. Mellan då och början av oktober samlade den ungefär 780 nedladdningar och 93 gillamarkeringar – blygsamt, men en normal release av en forskningsagent med papperna i ordning.
PixelUMM:s spår är annorlunda till sin karaktär. GitHub-repositoriet skapades den 4 september 2026; arXiv-förhandstrycket är daterat den 29 september; Hugging Face-repositoriet skapades kl. 21:40 UTC den 1 oktober 2026, några minuter efter repositoriets sista commit. Inget NVIDIA-blogginlägg, pressmeddelande eller lanseringstråd dök upp för det. Projektsidans egen URL-sökväg lyder fortfarande pixelumm-project-page-preview. Dess nedladdningsantal var noll när detta skrevs.
Att läsa in en avsikt i det är ett misstag – ett labb kan publicera en forskningsartefakt och schemalägga en lansering senare. Det som går att veta är snävare och mer användbart: en modell har en officiell serveringsväg och tio veckors nedladdningar; den andra har en artikel, ett kodförråd och inget leverantörsuttalande alls.

Resultattavlor som inte överlappar
Det finns ingen benchmark som båda modellerna rapporterar, vilket i sig är själva poängen: de löser inte samma problem.
• Agentisk datoranvändning — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: ingen handlingsrymd, så ingen poäng är möjlig.
• Bildförståelse — UI-Mate-27B: tar emot skärmbilder som agentindata, utvärderas inte som en allmän VLM. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00.
• Video — UI-Mate-27B: inga. PixelUMM: MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, LVBench 40,41.
• Generering — UI-Mate-27B: ingen. PixelUMM: GenEval 0,83 med en prompt-omskrivare, DPG-Bench 85,74, VBench del 1 kvalitet 84,10.
• Driftsättningskostnad — UI-Mate-27B: 27B dense över ungefär två GPU:er via vLLM, plus den officiella testharnesken. PixelUMM: cirka 30 GB distribuerade checkpoint-shards, CUDA 13 med FlashAttention byggt från källkod, en åtkomstbegränsad guardrail-modell för videovägen och en andra Python-miljö för den.
• Licens — UI-Mate-27B: Apache-2.0, kod och vikter. PixelUMM: Apache-2.0-kod, NVIDIA One-Way Noncommercial License för checkpointen.
• Skala — 27B dense mot cirka 15,2B totalt, benämns som "8B MoT" i PixelUMM:s egna tabeller i artikeln.
Det enda genuint jämförbara påståendet gäller härkomst, och det gäller båda: varje siffra ovan är leverantörens egen, ingen har körts om utanför laboratoriet som tog fram den, och en av de två modellerna märker uttryckligen sina egna resultat som preliminära.
Att bygga med dem, och varför du kanske vill använda båda
Dessa två kompletterar varandra bättre än de konkurrerar. En stack för skrivbordsautomatisering vill ha UI-Mate-27B för handlingslagret och något som kan resonera kring det den såg; en innehålls- eller inspektionspipeline vill ha PixelUMMs läsning och generering och har ingen nytta av en markör. Överlappningen finns vid perceptionsgränsen, där UI-Mate-27B:s skärmdumpsgrundning är uppgiftsspecifik och PixelUMMs är allmän — samma pixlar, två helt olika jobb.
När du faktiskt kör flera modeller mot varandra — agenten mot en generalist-VLM, eller en ny forskningscheckpoint mot den som redan är i produktion — är kostnaden för jämförelsen normalt integrationen, inte inferensen: två API-former, två autentiseringsscheman, två kontrakt. Det är problemet som ett routningslager finns för att ta bort, och det är där OrcaRouters design lönar sig: en nyckel över 200+ modeller, leverantörslistpriser som vidaresänds med 0 % påslag, automatisk failover mellan leverantörer, och ett routnings-DSL plus modellfusion för att komponera flera modeller till ett enda anrop. Varken PixelUMM eller UI-Mate-27B finns på någon hostad endpoint idag, och OrcaRouter dirigerar ingen av dem — så detta handlar om arbetsflödet när de väl är det, inte ett påstående om tillgänglighet nu.
Vilken till vilket jobb
Om uppgiften slutar med ett klick, ett tangenttryck eller ett ifyllt formulär finns det bara en kandidat här, och det är UI-Mate-27B. Den är Apache-2.0, den har en arXiv-artikel och en officiell testrigg, och dess rapporterade OSWorld- och WindowsAgentArena-poäng är den typ av påstående som vem som helst med två GPU:er och en Windows- eller Ubuntu-testavbildning kan kontrollera – vilket är precis vad som gör den värd att kontrollera i stället för att lita på.
Om uppgiften slutar med ett svar eller en bild är PixelUMM den som kan göra det, och det är först och främst en forskningsartefakt. Dess artikel är ovanligt ärlig om sina egna begränsningar och medger att olika träningsdata innebär att dess benchmarkjämförelse ”inte kan fastställa vilken arkitektur som är överlägsen”. Dess checkpoint är icke-kommersiell. Dess styrkor är arkitektonisk nyskapelse och bredd, inte toppmoderna siffror, och dess omedelbara värde är för alla som studerar huruvida encoder-fria enhetliga modeller fungerar på videoskala. Ladda ner den för att läsa koden och köra demosarna; ladda inte ner den för att leverera en funktion.
Den tvåradiga sammanfattningen är densamma som underlaget ger: en modell kan agera men inte skapa, den andra kan skapa men inte agera, och gapet i licensiering och mognad mellan dem spelar större roll än något parameterantal.
