Ett genererat titelkort i OrcaRouters husstil med texten ”PixelUMM vs UI-Mate-27B”, med fyra statistikrutor: ”77.0” (UI-Mate-27B:s rapporterade genomsnitt för OSWorld-Verified), ”66.2” (dess genomsnitt för WindowsAgentArena), ”ingen” (PixelUMM:s aktionsutrymme) och ”Apache-2.0” (UI-Mate-27B:s licens för kod och vikter, mot PixelUMM:s icke-kommersiella checkpoint). En sidfotsrad lyder ”Tencent-rapporterade agentpoäng; PixelUMM:s siffror från dess preprint. Ingen oberoende omkörning.”. OrcaRouter-logotypen är komponerad in i den utfyllda remsan längst ned till höger.
Guides & Insights

PixelUMM vs UI-Mate-27B: En modell ritar vad den ser, den andra klickar på det

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Tencen​t UI-Mate-27B och NVIDIA PixelUMM ser jämförbara ut på ett specifikationsblad – 27 miljarder parametrar mot ungefär 15,2 miljarder, båda öppet nedladdningsbara, båda byggda på Qwe​n-stommar – och de är inte alls jämförbara. UI-Mate-27B är en grundläggande GUI-agent: den observerar live-skärmbilder, planerar utifrån vad som för närvarande finns på skärmen och avger strukturerade mus- och tangentbordsåtgärder för ett verkligt skrivbord. PixelUMM är en encoderfri enhetlig multimodal modell som läser bilder och video i rå pixelrymd och genererar bilder och video från text – den uppfattar och den skapar, men den har inget handlingsutrymme, ingen markör och inget sätt att röra vid en skärm. Den ena agerar på världen. Den andra beskriver och avbildar den. Allt nedan följer av den uppdelningen, och licensgapet mellan dem är det andra du behöver känna till.

Båda labben rapporterar sina egna siffror och ingen av dem har en oberoende utvärdering. Båda släpptes tyst – det är i sättet de släpptes på som likheten faktiskt upphör.

Aktör och uppfattare

UI-Mate-27B utför en uppgift utifrån en instruktion i naturligt språk och enbart live-skärmbilder. Den resonerar över det synliga tillståndet, omplanerar när gränssnittet förändras och producerar resonemang, en kortfattad åtgärdsbeskrivning och strukturerade verktygsanrop för datoranvändning inom mus, tangentbord, rullning, väntan, användarinteraktion och slutförande av uppgift. Dess utmärkande egenskap är demonstrationsstyrd exekvering: visa den ett arbetsflöde en gång och den anpassar den inspelade demonstrationen till den aktuella uppgiften, och behandlar den aktuella skärmbilden som auktoritativ när gränssnittet har gått vidare. Den är finjusterad från Qwen3.6-27B med övervakad finjustering följt av online-förstärkningsinlärning i körbara GUI-miljöer, och den serveras via vLLM med ett OpenAI-kompatibelt gränssnitt.

• Rapporterade benchmarks — OSWorld-Verified medelvärde 77,0, WindowsAgentArena medelvärde 66,2, OSWorkerBench strikt framgång 41,00 och framsteg 76,86. Alla rapporterade av Tencent och ej reproducerade.

• Handlingsutrymme — mus, tangentbord, rullning, väntan, användarinteraktion, slutförande av uppgift, i ett normaliserat koordinatutrymme med pyautogui-kompatibla strukturerade anrop.

• Hårdvaruverklighet — 27B dense, serverad med tensorparallellism över två GPU:er i Tencents egen snabbstart, under Apache-2.0.

• Ett viktigt förbehåll på själva kortet — UI-Mate-27B är en agent-checkpoint snarare än en fristående visuell chattmodell. Tencent rekommenderar den officiella prompten, svarsparsern och interaktionsramverket från sitt repo. Rikta den mot "beskriv den här bilden" och du använder fel verktyg.

PixelUMM intar den motsatta polen. Hela dess arkitektur är ett argument om representation: ingen VAE, ingen visionsencoder, bilder som 16×16-pixelpatchar och videor som rumsligt-temporala tubelets om 4 bildrutor, rakt in i en Transformer med enbart dekoder via enkellagers linjära projektioner, med en Mixture-of-Transformers-design som parar ihop delad uppmärksamhet med uppgiftsspecifika parametrar. Förståelse är autoregressiv text; generering är flödesmatchning i pixelrummet. Fyra checkpoints levereras, S8-F22-R05 som standardval som täcker text-till-bild, text-till-video vid 96 bildrutor och 24 fps, samt båda förståelseriktningarna.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

De två utgivningsmönstren är en studie i kontraster.

UI-Mate-27B dök upp på Hugging Face den 14 augusti 2026 med ett modellkort, en arXiv-preprint numrerad 2608.15930, en projektsida, ett GitHub-repositorium och ett dokumenterat serveringsrecept. Mellan då och början av oktober samlade den ungefär 780 nedladdningar och 93 gillamarkeringar – blygsamt, men en normal release av en forskningsagent med papperna i ordning.

PixelUMM:s spår är annorlunda till sin karaktär. GitHub-repositoriet skapades den 4 september 2026; arXiv-förhandstrycket är daterat den 29 september; Hugging Face-repositoriet skapades kl. 21:40 UTC den 1 oktober 2026, några minuter efter repositoriets sista commit. Inget NVIDIA-blogginlägg, pressmeddelande eller lanseringstråd dök upp för det. Projektsidans egen URL-sökväg lyder fortfarande pixelumm-project-page-preview. Dess nedladdningsantal var noll när detta skrevs.

Att läsa in en avsikt i det är ett misstag – ett labb kan publicera en forskningsartefakt och schemalägga en lansering senare. Det som går att veta är snävare och mer användbart: en modell har en officiell serveringsväg och tio veckors nedladdningar; den andra har en artikel, ett kodförråd och inget leverantörsuttalande alls.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Resultattavlor som inte överlappar

Det finns ingen benchmark som båda modellerna rapporterar, vilket i sig är själva poängen: de löser inte samma problem.

• Agentisk datoranvändning — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: ingen handlingsrymd, så ingen poäng är möjlig.

• Bildförståelse — UI-Mate-27B: tar emot skärmbilder som agentindata, utvärderas inte som en allmän VLM. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00.

• Video — UI-Mate-27B: inga. PixelUMM: MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, LVBench 40,41.

• Generering — UI-Mate-27B: ingen. PixelUMM: GenEval 0,83 med en prompt-omskrivare, DPG-Bench 85,74, VBench del 1 kvalitet 84,10.

• Driftsättningskostnad — UI-Mate-27B: 27B dense över ungefär två GPU:er via vLLM, plus den officiella testharnesken. PixelUMM: cirka 30 GB distribuerade checkpoint-shards, CUDA 13 med FlashAttention byggt från källkod, en åtkomstbegränsad guardrail-modell för videovägen och en andra Python-miljö för den.

• Licens — UI-Mate-27B: Apache-2.0, kod och vikter. PixelUMM: Apache-2.0-kod, NVIDIA One-Way Noncommercial License för checkpointen.

• Skala — 27B dense mot cirka 15,2B totalt, benämns som "8B MoT" i PixelUMM:s egna tabeller i artikeln.

Det enda genuint jämförbara påståendet gäller härkomst, och det gäller båda: varje siffra ovan är leverantörens egen, ingen har körts om utanför laboratoriet som tog fram den, och en av de två modellerna märker uttryckligen sina egna resultat som preliminära.

Att bygga med dem, och varför du kanske vill använda båda

Dessa två kompletterar varandra bättre än de konkurrerar. En stack för skrivbordsautomatisering vill ha UI-Mate-27B för handlingslagret och något som kan resonera kring det den såg; en innehålls- eller inspektionspipeline vill ha PixelUMMs läsning och generering och har ingen nytta av en markör. Överlappningen finns vid perceptionsgränsen, där UI-Mate-27B:s skärmdumpsgrundning är uppgiftsspecifik och PixelUMMs är allmän — samma pixlar, två helt olika jobb.

När du faktiskt kör flera modeller mot varandra — agenten mot en generalist-VLM, eller en ny forskningscheckpoint mot den som redan är i produktion — är kostnaden för jämförelsen normalt integrationen, inte inferensen: två API-former, två autentiseringsscheman, två kontrakt. Det är problemet som ett routningslager finns för att ta bort, och det är där OrcaRouters design lönar sig: en nyckel över 200+ modeller, leverantörslistpriser som vidaresänds med 0 % påslag, automatisk failover mellan leverantörer, och ett routnings-DSL plus modellfusion för att komponera flera modeller till ett enda anrop. Varken PixelUMM eller UI-Mate-27B finns på någon hostad endpoint idag, och OrcaRouter dirigerar ingen av dem — så detta handlar om arbetsflödet när de väl är det, inte ett påstående om tillgänglighet nu.

Vilken till vilket jobb

Om uppgiften slutar med ett klick, ett tangenttryck eller ett ifyllt formulär finns det bara en kandidat här, och det är UI-Mate-27B. Den är Apache-2.0, den har en arXiv-artikel och en officiell testrigg, och dess rapporterade OSWorld- och WindowsAgentArena-poäng är den typ av påstående som vem som helst med två GPU:er och en Windows- eller Ubuntu-testavbildning kan kontrollera – vilket är precis vad som gör den värd att kontrollera i stället för att lita på.

Om uppgiften slutar med ett svar eller en bild är PixelUMM den som kan göra det, och det är först och främst en forskningsartefakt. Dess artikel är ovanligt ärlig om sina egna begränsningar och medger att olika träningsdata innebär att dess benchmarkjämförelse ”inte kan fastställa vilken arkitektur som är överlägsen”. Dess checkpoint är icke-kommersiell. Dess styrkor är arkitektonisk nyskapelse och bredd, inte toppmoderna siffror, och dess omedelbara värde är för alla som studerar huruvida encoder-fria enhetliga modeller fungerar på videoskala. Ladda ner den för att läsa koden och köra demosarna; ladda inte ner den för att leverera en funktion.

Den tvåradiga sammanfattningen är densamma som underlaget ger: en modell kan agera men inte skapa, den andra kan skapa men inte agera, och gapet i licensiering och mognad mellan dem spelar större roll än något parameterantal.