
PixelUMM vs UI-Mate-27B: Het ene model tekent wat het ziet, het andere klikt erop
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 223 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Tencent UI-Mate-27B en NVIDIA PixelUMM lijken op een specificatieblad vergelijkbaar — 27 miljard parameters tegenover ongeveer 15,2 miljard, beide vrij te downloaden, beide gebouwd op Qwen-backbones — en ze zijn helemaal niet vergelijkbaar. UI-Mate-27B is een foundation-GUI-agent: hij observeert live schermafbeeldingen, plant op basis van wat er momenteel op het scherm staat, en genereert gestructureerde muis- en toetsenbordacties voor een echte desktop. PixelUMM is een encoder-vrij uniform multimodaal model dat afbeeldingen en video in de ruwe pixelruimte leest en afbeeldingen en video uit tekst genereert — het neemt waar en het creëert, maar het heeft geen actieruimte, geen cursor en geen manier om een scherm aan te raken. De een werkt in op de wereld. De ander beschrijft en beeldt die af. Alles hieronder volgt uit die tweedeling, en het licentieverschil tussen hen is het tweede dat je moet weten.
Beide labs rapporteren hun eigen cijfers en geen van beide heeft een onafhankelijke evaluatie. Beide werden geruisloos uitgebracht — de manier van uitbrengen is waar de gelijkenis eigenlijk ophoudt.
Actor en waarnemer
UI-Mate-27B voert een taak uit op basis van alleen een natuurlijke-taalinstructie en live screenshots. Het redeneert over de zichtbare staat, herplant naarmate de interface verandert, en levert redeneringen, een beknopte actiebeschrijving en gestructureerde tool-aanroepen voor computergbruik op het gebied van muis, toetsenbord, scrollen, wachten, gebruikersinteractie en taakvoltooiing. Het onderscheidende kenmerk is demonstratiegestuurde uitvoering: laat het eenmaal een workflow zien en het past de opgenomen demonstratie aan op de taak in kwestie, waarbij het de huidige screenshot als gezaghebbend beschouwt wanneer de interface verder is gegaan. Het is fijn-afgesteld op Qwen3.6-27B met gesuperviseerde fine-tuning gevolgd door online reinforcement learning in uitvoerbare GUI-omgevingen, en het wordt via vLLM geserveerd met een OpenAI-compatibele interface.
• Gerapporteerde benchmarks — OSWorld-Verified gemiddelde 77,0, WindowsAgentArena gemiddelde 66,2, OSWorkerBench strikte succes 41,00 en voortgang 76,86. Allemaal door Tencent gerapporteerd en niet gereproduceerd.
• Actieruimte — muis, toetsenbord, scrollen, wachten, gebruikersinteractie, taakvoltooiing, in een genormaliseerde coördinatenruimte met pyautogui-compatibele gestructureerde aanroepen.
• Hardware-realiteit — 27B dense, geserveerd met tensor-parallelisme over twee GPU's in Tencent's eigen snelstart, onder Apache-2.0.
• Een belangrijke kanttekening op de kaart zelf — UI-Mate-27B is een agent-checkpoint in plaats van een zelfstandig visueel chatmodel. Tencent raadt de officiële prompt, responsparser en interactie-harness uit de repository aan. Richt het op "beschrijf deze afbeelding" en je gebruikt de verkeerde tool.
PixelUMM bezet de tegenovergestelde pool. De hele architectuur ervan is een betoog over representatie: geen VAE, geen visie-encoder, afbeeldingen als 16×16 pixelpatches en video's als 4-frame spatiotemporele tubelets, rechtstreeks in een decoder-only Transformer via lineaire projecties met één laag, met een Mixture-of-Transformers-ontwerp dat gedeelde attention koppelt aan taakspecifieke parameters. Begrip is autoregressieve tekst; generatie is flow matching in de pixelruimte. Er worden vier checkpoints geleverd, S8-F22-R05 als de standaardoptie voor tekst-naar-afbeelding, tekst-naar-video met 96 frames en 24 fps, en beide begripsrichtingen.

De twee releasepatronen zijn een schoolvoorbeeld van contrast
UI-Mate-27B verscheen op 14 augustus 2026 op Hugging Face met een modelkaart, een arXiv-preprint met nummer 2608.15930, een projectpagina, een GitHub-repository en een gedocumenteerd serveerrecept. Tussen dat moment en begin oktober verzamelde het ongeveer 780 downloads en 93 likes — bescheiden, maar een normale onderzoeksagent-release met het papierwerk in orde.
Het spoor van PixelUMM is anders van aard. De GitHub-repository werd op 4 september 2026 aangemaakt; de arXiv-preprint is gedateerd op 29 september; de Hugging Face-repository werd op 1 oktober 2026 om 21:40 UTC aangemaakt, enkele minuten na de laatste commit van de repository. Er dook geen NVIDIA-blogbericht, persbericht of aankondigingsthread voor op. Het URL-pad van de projectpagina zelf luidt nog steeds pixelumm-project-page-preview. Het aantal downloads was nul toen dit werd geschreven.
Daar een bedoeling in lezen is een vergissing — een lab kan een onderzoeksartefact publiceren en een lancering later plannen. Wat kenbaar is, is beperkter en nuttiger: het ene model heeft een officiële servingroute en tien weken aan downloads; het andere heeft een paper, een repository en helemaal geen leveranciersverklaring.

Scoreborden die niet overlappen
Er is geen enkele benchmark die beide modellen rapporteren, en dat is juist het punt: ze lossen niet hetzelfde probleem op.
• Agentisch computergebruik — UI-Mate-27B: OSWorld-Verified 77,0, WindowsAgentArena 66,2. PixelUMM: geen actieruimte, dus geen score mogelijk.
• Beeldbegrip — UI-Mate-27B: neemt schermafbeeldingen als invoer voor de agent, wordt niet geëvalueerd als een algemene VLM. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.
• Video — UI-Mate-27B: geen. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.
• Generatie — UI-Mate-27B: geen. PixelUMM: GenEval 0,83 met een prompt-herschrijver, DPG-Bench 85,74, VBench Part 1-kwaliteit 84,10.
• Implementatiekosten — UI-Mate-27B: 27B dense verdeeld over ongeveer twee GPU's via vLLM, plus de officiële harness. PixelUMM: ongeveer 30 GB aan gedistribueerde checkpoint-shards, CUDA 13 met FlashAttention gebouwd vanaf de broncode, een gated guardrail-model voor het videopad en een tweede Python-omgeving daarvoor.
• Licentie — UI-Mate-27B: Apache-2.0, code en gewichten. PixelUMM: Apache-2.0-code, NVIDIA One-Way Noncommercial License op het checkpoint.
• Schaal — 27B dense versus ongeveer 15,2B totaal, weergegeven als "8B MoT" in de eigen papertabellen van PixelUMM.
De enige echt vergelijkbare bewering gaat over herkomst, en die geldt voor beide: elk getal hierboven is van de leverancier zelf, geen ervan is opnieuw uitgevoerd buiten het lab dat het heeft geproduceerd, en een van de twee modellen bestempelt zijn eigen resultaten expliciet als voorlopig.
Bouwen ermee, en waarom je beide zou kunnen gebruiken
Deze twee vullen elkaar beter aan dan dat ze concurreren. Een desktopautomatiseringsstack wil UI-Mate-27B voor de uitvoerende laag en iets dat kan redeneren over wat het heeft gezien; een content- of inspectiepijplijn wil het lezen en genereren van PixelUMM en heeft niets aan een cursor. De overlap ligt bij de perceptiegrens, waar de screenshot-grounding van UI-Mate-27B taakspecifiek is en die van PixelUMM algemeen — dezelfde pixels, twee totaal verschillende taken.
Wanneer je meerdere modellen tegen elkaar laat lopen — de agent tegen een generalistische VLM, of een nieuw onderzoekscheckpoint tegen het exemplaar dat al in productie is — zijn de kosten van de vergelijking doorgaans de integratie, niet de inferentie: twee API-vormen, twee authenticatieschema's, twee contracten. Dat is het probleem dat een routeringslaag beoogt weg te nemen, en dat is waar het ontwerp van OrcaRouter zich uitbetaalt: één sleutel voor 200+ modellen, lijstprijzen van providers doorgegeven tegen 0% opslag, automatische failover tussen providers, en een routerings-DSL plus modelfusie om meerdere modellen in één aanroep samen te stellen. Noch PixelUMM noch UI-Mate-27B is vandaag op een gehost endpoint te vinden, en OrcaRouter routeert geen van beide — dus dit gaat over de workflow wanneer ze dat wel zijn, niet over een claim over beschikbaarheid nu.
Welke voor welke taak
Als de taak eindigt met een klik, een toetsaanslag of een ingevuld formulier, is er hier slechts één kandidaat, en dat is UI-Mate-27B. Het is Apache-2.0, het heeft een arXiv-paper en een officiële harness, en de gerapporteerde OSWorld- en WindowsAgentArena-scores zijn het soort bewering dat door iedereen met twee GPU's en een Windows- of Ubuntu-testimage kan worden gecontroleerd — en dat is precies wat het de moeite waard maakt om te controleren in plaats van te vertrouwen.
Als de taak eindigt met een antwoord of een afbeelding, is PixelUMM degene die het kan, en het is in de eerste plaats een onderzoeksartefact. De paper is ongewoon eerlijk over zijn eigen beperkingen en geeft toe dat verschillende trainingsdata betekenen dat de benchmarkvergelijking "niet kan vaststellen welke architectuur superieur is". De checkpoint is niet-commercieel. De sterke punten zijn architectonische nieuwheid en breedte, niet de state-of-the-artcijfers, en de onmiddellijke waarde ligt bij iedereen die onderzoekt of encoderloze uniforme modellen op videoschaal werken. Download het om de code te lezen en de demo's uit te voeren; download het niet om een feature uit te brengen.
De tweeregelige samenvatting is dezelfde die het bewijs geeft: het ene model kan handelen en kan niet creëren, het andere kan creëren en kan niet handelen, en de kloof in licenties en volwassenheid tussen hen is belangrijker dan welk aantal parameters dan ook.
