
PixelUMM vs UI-Mate-27B: Un modello disegna ciò che vede, l'altro lo clicca
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Tencen�t UI-Mate-27B e NVIDIA PixelUMM sembrano comparabili su una scheda tecnica — 27 miliardi di parametri contro circa 15,2 miliardi, entrambi scaricabili apertamente, entrambi costruiti su backbone Qwe�n — e non sono affatto comparabili. UI-Mate-27B è un agente GUI di base: osserva screenshot in tempo reale, pianifica in base a ciò che è attualmente sullo schermo ed emette azioni strutturate di mouse e tastiera per un desktop reale. PixelUMM è un modello multimodale unificato senza encoder che legge immagini e video nello spazio dei pixel grezzi e genera immagini e video dal testo — percepisce e crea, ma non ha uno spazio d'azione, né un cursore, né un modo per toccare uno schermo. Uno agisce sul mondo. L'altro lo descrive e lo raffigura. Tutto quanto segue deriva da questa separazione, e il divario di licenza tra i due è la seconda cosa da sapere.
Entrambi i laboratori riportano i propri numeri e nessuno dei due ha una valutazione indipendente. Entrambi hanno pubblicato in sordina — è nello stile della pubblicazione che la somiglianza finisce davvero.
Attore e percettore
UI-Mate-27B esegue un'attività a partire da un'istruzione in linguaggio naturale e da soli screenshot in tempo reale. Ragiona sullo stato visibile, ripianifica man mano che l'interfaccia cambia e restituisce il ragionamento, una descrizione concisa dell'azione e chiamate strutturate a strumenti di uso del computer per mouse, tastiera, scorrimento, attesa, interazione con l'utente e completamento dell'attività. La sua caratteristica distintiva è l'esecuzione guidata da dimostrazione: mostragli una volta un flusso di lavoro e adatta la dimostrazione registrata all'attività in questione, considerando lo screenshot corrente come autorevole quando l'interfaccia è cambiata. È sottoposto a fine-tuning da Qwen3.6-27B con fine-tuning supervisionato seguito da apprendimento per rinforzo online in ambienti GUI eseguibili, ed è servito tramite vLLM con un'interfaccia compatibile con OpenAI.
• Benchmark dichiarati — media OSWorld-Verified 77,0, media WindowsAgentArena 66,2, successo rigoroso OSWorkerBench 41,00 e progresso 76,86. Tutti dichiarati da Tencent e non riprodotti.
• Spazio delle azioni — mouse, tastiera, scorrimento, attesa, interazione con l'utente, completamento dell'attività, in uno spazio di coordinate normalizzato con chiamate strutturate compatibili con pyautogui.
• Realtà hardware — 27B dense, servito con tensor parallelism su due GPU nel quick-start di Tencent, con licenza Apache-2.0.
• Un'importante avvertenza sulla scheda stessa — UI-Mate-27B è un checkpoint per agenti piuttosto che un modello visual-chat autonomo. Tencent consiglia il prompt ufficiale, il parser delle risposte e l'harness di interazione dal suo repository. Puntalo su "descrivi questa immagine" e stai usando lo strumento sbagliato.
PixelUMM occupa il polo opposto. La sua intera architettura è un argomento sulla rappresentazione: niente VAE, niente vision encoder, immagini come patch di pixel 16×16 e video come tubelet spaziotemporali di 4 frame, direttamente in un Transformer solo decoder attraverso proiezioni lineari a singolo strato, con un design Mixture-of-Transformers che abbina attenzione condivisa a parametri specifici per l'attività. La comprensione è testo autoregressivo; la generazione è flow matching nello spazio dei pixel. Vengono forniti quattro checkpoint, S8-F22-R05 come predefinito, che copre text-to-image, text-to-video a 96 frame e 24 fps, ed entrambe le direzioni di comprensione.

I due pattern di rilascio sono un esempio lampante di contrasto.
UI-Mate-27B è apparso su Hugging Face il 14 agosto 2026 con una scheda del modello, un preprint arXiv numerato 2608.15930, una pagina del progetto, un repository GitHub e una ricetta di serving documentata. Da allora ai primi di ottobre ha accumulato circa 780 download e 93 like: modesto, ma una normale release di un agente di ricerca con le carte in regola.
La traccia di PixelUMM è di natura diversa. Il repository GitHub è stato creato il 4 settembre 2026; il preprint arXiv è datato 29 settembre; il repository Hugging Face è stato creato alle 21:40 UTC del 1º ottobre 2026, pochi minuti dopo il commit finale del repository. Non è emerso alcun post sul blog NVIDIA, comunicato stampa o thread di lancio al riguardo. Il percorso URL della pagina del progetto riporta ancora pixelumm-project-page-preview. Il suo conteggio dei download era zero quando questo è stato scritto.
Leggere un’intenzione in questo è un errore: un laboratorio può pubblicare un artefatto di ricerca e programmare un lancio più avanti. Ciò che è conoscibile è più ristretto e più utile: un modello ha un percorso di servizio ufficiale e dieci settimane di download; l’altro ha un paper, un repository e nessuna dichiarazione del fornitore.

Tabelloni che non si sovrappongono
Non esiste un benchmark che entrambi i modelli riportino, il che è di per sé il punto: non stanno risolvendo lo stesso problema.
• Uso agentico del computer — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: nessuno spazio d'azione, quindi non è possibile alcun punteggio.
• Comprensione delle immagini — UI-Mate-27B: utilizza gli screenshot come input per l'agente, non viene valutato come VLM generico. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00.
• Video — UI-Mate-27B: nessuno. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.
• Generazione — UI-Mate-27B: nessuno. PixelUMM: GenEval 0.83 con un riscrittore di prompt, DPG-Bench 85.74, VBench Parte 1 qualità 84.10.
• Costo di deployment — UI-Mate-27B: 27B denso su circa due GPU tramite vLLM, più l'harness ufficiale. PixelUMM: circa 30 GB di shard di checkpoint distribuiti, CUDA 13 con FlashAttention compilato dai sorgenti, un modello guardrail gated per il percorso video e un secondo ambiente Python per quest'ultimo.
• Licenza — UI-Mate-27B: Apache-2.0, codice e pesi. PixelUMM: codice Apache-2.0, NVIDIA One-Way Noncommercial License sul checkpoint.
• Scala — 27B denso rispetto a circa 15,2B totali, indicato come "8B MoT" nelle tabelle del paper di PixelUMM stesso.
L'unica affermazione realmente comparabile riguarda la provenienza, e vale per entrambi: ogni numero sopra riportato è di un fornitore, nessuno è stato rieseguito al di fuori del laboratorio che l'ha prodotto, e uno dei due modelli etichetta esplicitamente i propri risultati come preliminari.
Costruire con essi, e perché potresti usare entrambi
Questi due si compongono meglio di quanto competano. Uno stack di automazione desktop vuole UI-Mate-27B per il livello di azione e qualcosa in grado di ragionare su ciò che ha visto; una pipeline di contenuti o ispezione vuole la lettura e la generazione di PixelUMM e non ha alcun bisogno di un cursore. La sovrapposizione è al confine della percezione, dove il grounding sugli screenshot di UI-Mate-27B è specifico per il compito e quello di PixelUMM è generale — gli stessi pixel, due lavori completamente diversi.
Quando metti effettivamente a confronto più modelli tra loro — l'agente contro un VLM generalista, o un nuovo checkpoint di ricerca contro quello già in produzione — il costo del confronto è normalmente l'integrazione, non l'inferenza: due forme di API, due schemi di autenticazione, due contratti. È il problema che un livello di routing serve a rimuovere, ed è qui che il design di OrcaRouter dà i suoi frutti: una sola chiave per oltre 200 modelli, prezzi di listino dei provider passati attraverso con markup 0%, failover automatico tra provider, e un DSL di routing più fusione di modelli per comporre più modelli in un'unica chiamata. Né PixelUMM né UI-Mate-27B sono oggi su alcun endpoint ospitato, e OrcaRouter non instrada nessuno dei due — quindi questo riguarda il flusso di lavoro per quando lo saranno, non un'affermazione sulla disponibilità attuale.
Quale per quale lavoro
Se il compito termina con un clic, la pressione di un tasto o un modulo compilato, qui c'è un solo candidato, ed è UI-Mate-27B. È Apache-2.0, ha un articolo su arXiv e un harness ufficiale, e i punteggi riportati su OSWorld e WindowsAgentArena sono il tipo di affermazione che chiunque può verificare con due GPU e un'immagine di test Windows o Ubuntu — ed è esattamente questo che lo rende degno di essere verificato invece che dato per fidato.
Se il compito termina con una risposta o un'immagine, PixelUMM è quello che può farlo, ed è prima di tutto un artefatto di ricerca. Il suo paper è insolitamente onesto riguardo ai propri limiti, ammettendo che dati di addestramento diversi fanno sì che il suo confronto benchmark "non possa stabilire quale architettura sia superiore". Il suo checkpoint è non commerciale. I suoi punti di forza sono la novità architetturale e l'ampiezza, non i numeri allo stato dell'arte, e il suo valore immediato è per chiunque studi se i modelli unificati senza encoder funzionano su scala video. Scaricalo per leggere il codice ed eseguire le demo; non scaricarlo per rilasciare una funzionalità.
Il riassunto in due righe è lo stesso che danno le prove: un modello può agire e non può creare, l'altro può creare e non può agire, e il divario di licenza e maturità tra loro conta più di qualsiasi numero di parametri.
