Una hero card per UI-Mate-27B, l'agente GUI foundation open-weight di Tencent rilasciato il 14 agosto 2026, che mostra un monitor desktop con cursore del mouse e frecce di automazione, sottotitolo 'Open-Weight Foundation GUI Agent', chip etichetta 'Apache-2.0', '27B params', 'vLLM ready', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Tencent UI-Mate-27B: il silenzioso agente GUI open-weight che conquista un posto di vertice in WindowsAgentArena

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 14 agosto 2026, l'HY Frontier Multimodal Agent Team di Tencent ha caricato tre checkpoint su Hugging Face nell'organizzazione tencent/ — UI-Mate-27B, un UI-Mate-9B più piccolo e il UI-Mate-democua-27B guidato da dimostrazioni. Quattro giorni dopo non c'è ancora alcun annuncio da nessuna parte: nessun post di lancio, nessun comunicato stampa, nessun tweet sul prodotto. Ciò che è stato rilasciato, invece, è insolitamente completo per un rilascio silenzioso: una pagina di progetto, un repository GitHub con un harness funzionante e un paper arXiv presentato due giorni fa che definisce il modello più grande un nuovo stato dell'arte open-weight nel controllo GUI desktop.

Tutto ciò che è contenuto in questo materiale proviene dalle schede dei modelli, dal repository GitHub, dalla pagina del progetto e da quel paper — nessuna di queste cose è stata ancora riprodotta in modo indipendente. I checkpoint hanno zero download su Hugging Face al momento in cui scrivo, il che significa che siamo probabilmente tra le prime persone al di fuori di Tencent a prenderli seriamente sulla carta. Ecco ciò che è realmente conoscibile dai repository, e ciò che resta non confermato finché qualcun altro non li esegue.

Contenuti

• Cosa è stato rilasciato e cosa non è stato annunciato

• Cosa è realmente UI-Mate-27B

La caratteristica distintiva: esecuzione guidata da dimostrazioni

• I numeri — tutti riportati dal fornitore

• Dove si troverebbero quei numeri — se reggono

• Come eseguirlo

• Lo stack attorno a un nuovo agente GUI

• Cosa guardare dopo

• Domande frequenti

Cosa è stato rilasciato e cosa non è stato annunciato.

Tencent ha pubblicato UI-Mate-27B (27 miliardi di parametri, Apache-2.0, safetensors in BF16) il 14 agosto 2026, insieme al modello gemello da 9B e al checkpoint guidato da demo UI-Mate-democua-27B. I due checkpoint da 27B sono costruiti su Qwen3.6-27B — anch'esso un modello multimodale Apache-2.0 rilasciato ad aprile 2026 — il che significa che l'intero stack, base e fine-tuning, è utilizzabile commercialmente. I repository riportano timestamp di ultima modifica di questa settimana — il checkpoint guidato da demo è stato aggiornato proprio oggi — quindi Tencent ci ha lavorato attivamente.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

Cosa è pubblico finora:

• I pesi di UI-Mate-27B, UI-Mate-9B e UI-Mate-democua-27B su Hugging Face, ciascuno con una scheda del modello, tabelle di valutazione e una ricetta per il serving.

• Una pagina di progetto su ui-mate.github.io con un video demo, una guida all'uso e un'app macOS Apple Silicon (DMG v0.2.4).

• Il repository GitHub (github.com/Tencent/UI-Mate) contenente il prompt ufficiale, il parser di risposta e l'harness di interazione — la scheda è esplicita: si tratta di "un checkpoint di agente piuttosto che un modello di chat visivo autonomo" e per qualsiasi uso reale è consigliato l'harness.

• Un preprint arXiv (2608.15930), presentato il 16 agosto, intitolato "UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations."

Ciò che non è ancora pubblico: Tencent stessa non ha detto nulla — questa è una release basata sul repository, non un lancio. La variante guidata da dimostrazioni che la pagina del progetto aveva elencato come non ancora pubblica ora ha pesi live su Hugging Face: il repository tencent/UI-Mate-democua-27B, creato nello stesso push del 14 agosto, è esplicitamente etichettato come checkpoint guidato da dimostrazioni della famiglia — un modello distinto, non un rebranding del 27B. Non esiste ancora alcuna API ospitata da nessuna parte. Questo conta: l'unico modo per eseguire UI-Mate oggi è scaricare i pesi e servirli da soli.

Cosa è realmente UI-Mate-27B

UI-Mate-27B è un agente GUI fondamentale per il "lavoro a lungo orizzonte tra applicazioni e sistemi operativi." Osserva screenshot dal vivo, ragiona sullo stato visibile e genera azioni strutturate di tastiera e mouse per l'interazione nativa con il desktop. L'addestramento consiste in un fine-tuning supervisionato seguito da apprendimento per rinforzo online in ambienti GUI eseguibili — il modello ha imparato guidando realmente i desktop, non solo da screenshot statici.

Lo spazio delle azioni è la parte a cui gli sviluppatori presteranno attenzione: mouse, tastiera, scorrimento, attesa, interazione utente e completamento delle attività, con output compatibili con pyautogui. Il modello ragiona in uno spazio di coordinate normalizzato 1000×1000 e l'agente di riferimento ridimensiona le sue previsioni alla risoluzione reale dello screenshot, quindi le azioni sopravvivono alle differenze di scala di visualizzazione tra macchine. Il README del modello stesso raccomanda di servirlo con vLLM dietro un endpoint compatibile con OpenAI.

La caratteristica che fa la differenza: esecuzione guidata da dimostrazione

La maggior parte degli agenti GUI accetta un solo input: un'istruzione. UI-Mate ne accetta un secondo, davvero raro in un checkpoint aperto: una dimostrazione. "Mostra il flusso di lavoro una volta. Lascia che l'agente lo adatti al compito da svolgere", come si legge nella pagina del progetto.

Il meccanismo non è video-in-contesto né uno script di azioni fisse. Una dimostrazione registra screenshot immediatamente prima e dopo ogni azione da tastiera o del puntatore, e la pipeline normalizza la traccia in una rappresentazione coerente azione-fotogramma, la annota con osservazioni, intenzioni, azioni ed evidenze di verifica, e la segmenta in sottocompiti denominati con criteri di completamento. Al momento dell'inferenza, questa diventa un workflow compatto iniettato per il sottocompito attivo — ma lo screenshot live rimane autorevole per tutto il processo, così quando lo stato dell'applicazione differisce dalla demo, il modello ri-pianifica invece di riprodurre.

Tencent ha reso il checkpoint alla base di questo flusso di lavoro un suo modello pubblico: la scheda UI-Mate-democua-27B confronta i risultati con sole istruzioni e con una dimostrazione sugli stessi benchmark, e il suo schema degli strumenti aggiunge un'azione subtask_complete — il meccanismo dietro quelle sottoattività denominate. Sul sottoinsieme self-demo di OSWorkerBench, una dimostrazione porta il successo rigoroso da 17.17 a 35.35 e il progresso da 67.85 a 81.14; sul sottoinsieme OSWorld, il progresso passa da 40.27 a 65.75; sul set di valutazione GameDev, il punteggio medio passa da 76.76 a 81.15 mentre la lunghezza media della traiettoria scende da 303.6 a 253.1 passi — la dimostrazione accorcia il compito oltre a migliorarlo. La scheda riporta che la dimostrazione ha migliorato 28 dei 33 compiti self-demo e risolto quattro compiti che ottengono zero senza guida. Il limite è lo stesso che attraversa l'intero articolo: si tratta di valutazioni accoppiate del team stesso, mediate su tre o cinque esecuzioni, e nessuno le ha riprodotte.

I numeri — tutti quanti riportati dal fornitore

Esecuzione solo su istruzione, direttamente dalla scheda del modello:

Punteggio medio OSWorld-Verified — 77.0

• Punteggio medio di WindowsAgentArena — 66.2

• OSWorkerBench successo rigoroso — 41.00

Avanzamento OSWorkerBench — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench è esso stesso uno dei tre contributi dell'articolo: un nuovo benchmark di 100 compiti d'ufficio a lungo orizzonte (long-horizon) su 41 applicazioni, con sotto-insiemi composti da 33 auto-demo e 45 demo varianti. È una nuova valutazione, quindi non esiste un precedente con cui confrontare questi due punteggi. Rispetto al proprio modello base, si afferma che UI-Mate-27B superi Qwen3.6-27B di 17,7 punti di successo rigoroso e di 24,5 punti di progresso su OSWorkerBench — che è il confronto più pulito alla pari (apples-to-apples) dell'intera release, poiché entrambi i modelli verrebbero eseguiti attraverso lo stesso harness.

Ogni cifra sopra è una valutazione del team stesso. Non ci sono ancora punteggi indipendenti, nessuna ripetizione da parte di terzi e, con zero download, nessuna riproduzione da parte della comunità. Tratta ogni numero qui come un'affermazione, non come un fatto.

Dove starebbero quei numeri — se reggono

WindowsAgentArena è quella che sarebbe un vero titolo da prima pagina. I migliori risultati WAA riportati pubblicamente all'inizio del 2026 si aggiravano intorno a 61.0 (un sistema modulare chiamato VLAA-GUI, aprile 2026); il modello open-weight EvoCUA-32B di Meituan si attestava a 56.5, e l'UI-TARS-2 closed di ByteDance si collocava nella fascia bassa-media dei 50 sulla stessa classifica. Un 66.2 sulla valutazione di UI-Mate-27B lo metterebbe al di sopra di tutto ciò che è stato riportato su questo benchmark quest'anno — open o closed. È un'affermazione forte, e richiede una riesecuzione indipendente.

OSWorld-Verified a 77.0 è un risultato forte ma non un nuovo record open-weight nella classifica pubblica. Nello snapshot della leaderboard OSWorld-Verified di inizio agosto 2026, il modello open-weight Holo3-35B-A3B risulta elencato a 82.6, con diversi modelli closed frontier sopra di esso (Qwen3.8 Max a 86.1, Claude Mythos 5 e Claude Fable 5 a 85.0, Claude Opus 4.8 a 83.4). L'espressione "state of the art" del paper è quindi un'affermazione relativa alla propria configurazione di valutazione, non un fatto consolidato — diversi harness, parser di azioni e derive nell'auto-segnalazione rendono il confronto 77.0 contro 82.6 una questione che solo una riesecuzione indipendente può risolvere. Per contestualizzare cosa significhi un modello open da 27B che raggiunge 77.0: si collocherebbe sopra la baseline di esperti umani di ~72.4 e sopra diversi sistemi frontier più grandi sulla stessa classifica, tra cui Claude Opus 4.6 a 72.7 e Kimi K2.6 a 73.1.

Tencent non è nuova a questo territorio — ha rilasciato POINTS-GUI-G, un modello GUI-grounding da 8B, a febbraio 2026, ha lanciato l'assistente Marvis OS a maggio e ha contribuito al progetto computer-use GUICrafter a giugno. UI-Mate è una linea distinta pensata specificamente per il controllo completo del desktop, ed è il primo degli agenti GUI di Tencent a essere rilasciato come modello foundation aperto, piuttosto che come componente di grounding o prodotto.

Come eseguirlo

Il modello è progettato per vLLM, e la scheda del modello fornisce il comando esatto — vllm serve tencent/UI-Mate-27B con tensor-parallel size 2 e il template di chat compatibile con OpenAI. Un dettaglio pratico salta all'occhio: l'agente conserva di default cinque screenshot nel contesto, quindi il server deve ammettere almeno sei immagini per prompt, perché lo screenshot più recente arriva prima che il più vecchio venga compresso. Il flag raccomandato è --limit-mm-per-prompt con sei immagini e zero video. Il checkpoint guidato da dimostrazioni serve allo stesso modo — la sua scheda menziona vLLM e SGLang dietro un endpoint compatibile con OpenAI.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

Una volta avviata, una classe agente Python (UIMateAgent) acquisisce uno screenshot e un'istruzione e restituisce la risposta più azioni strutturate, ridimensionando le coordinate 1000×1000 alla tua risoluzione. La pagina del progetto offre anche un'app per macOS Apple Silicon per la modalità guidata da dimostrazione, che è il modo più semplice per provare il flusso di lavoro "mostralo una volta" senza dover costruire tu stesso l'harness. La licenza è Apache-2.0 per l'intero progetto, quindi l'uso locale, il fine-tuning e l'integrazione commerciale sono tutti consentiti.

Due avvertimenti dovrebbero affiancare qualsiasi "come eseguirlo" per un agente per uso del computer, ed entrambi provengono dalla scheda del modello stessa. Utilizzare ambienti isolati o usa e getta. Richiedere conferma umana prima di qualsiasi azione sensibile, monitorare la traiettoria e non trattare un successo riportato dal modello come prova che il risultato previsto sia effettivamente avvenuto. Gli agenti GUI sbagliano clic e l'iniezione di prompt tramite contenuti sullo schermo è un modello di minaccia reale, non un'ipotesi.

Lo stack attorno a un nuovo agente GUI

Nessuno dei checkpoint di UI-Mate è ancora su OrcaRouter — la famiglia ha solo pochi giorni e zero download, e il suo modello base Qwen3.6-27B non lo è nemmeno. Non c'è un'API ospitata, quindi se vuoi eseguirne uno questa settimana, devi servire vLLM da solo. Va bene per un laboratorio, ma è la forma sbagliata per la produzione.

Una pipeline di utilizzo del computer in produzione raramente è un singolo checkpoint. È composta da un modello pianificatore che decide l'intento successivo, un modello di grounding o di visione che legge lo schermo, l'agente GUI stesso e un fallback economico quando un sotto-passaggio fallisce — e questi componenti sono tutti modelli serviti, anche quando l'agente GUI è locale. Questo mix è esattamente ciò per cui esiste un livello di routing: un'unica API su 200+ modelli ospitati, prezzo di listino del provider applicato con markup 0%, e failover automatico così che un'interruzione temporanea su un provider non blocchi una lunga esecuzione dell'agente. Il DSL di routing consente anche di comporre più modelli in un'unica chiamata — un pianificatore all'inizio, un verificatore economico alla fine — senza dover collegare i provider nel tuo codice. Il riepilogo onesto è semplice: l'agente che guida il desktop è locale, ma i modelli che decidono cosa fare attorno ad esso sono instradabili, e provare in sicurezza checkpoint nuovissimi e non collaudati è esattamente ciò per cui esiste il failover.

Cosa guardare dopo

Quattro cose cambierebbero il quadro per UI-Mate-27B, in ordine approssimativo di importanza:

• Una riesecuzione indipendente di OSWorld-Verified e WindowsAgentArena. Il dato WAA in particolare è o un grande risultato o un artefatto del framework di valutazione, e solo una valutazione esterna può stabilire quale dei due.

• Il rapporto tecnico formale. La citazione attuale è un segnaposto, e l'articolo completo probabilmente rivelerà i dettagli del motore dati che l'abstract si limita a delineare.

L'annuncio di Tencent. Un rilascio incentrato sul repository come questo di solito precede qualcosa: un'integrazione con Marvis, un'offerta in hosting o una più ampia spinta verso modelli aperti.

• Un'API hosted. I pesi di tutti e tre i checkpoint sono ora pubblici, ma non viene servito nulla da nessuna parte — nessun endpoint Tencent, nessun provider di inferenza di terze parti — quindi il self-hosting rimane l'unica strada, e solo un annuncio di Tencent o l'adozione da parte di un provider può cambiare la situazione.

Domande frequenti

Cos'è Tencent UI-Mate-27B?

UI-Mate-27B è un agente GUI fondamentale con licenza Apache-2.0 e 27 miliardi di parametri, creato dal team HY Frontier Multimodal Agent di Tencent e affinato a partire da Qwen3.6-27B. Osserva screenshot del desktop in tempo reale, ragiona su di essi e genera azioni di mouse e tastiera compatibili con pyautogui. È stato rilasciato in modo silenzioso su Hugging Face il 14 agosto 2026 — insieme al fratello da 9B e al UI-Mate-democua-27B guidato da dimostrazioni — senza alcun annuncio, e i suoi benchmark finora sono interamente riportati dal fornitore.

Come si differenzia l'esecuzione guidata da dimostrazioni dalla riproduzione di uno script?

Invece di eseguire una macro registrata, UI-Mate tratta una dimostrazione come un flusso di lavoro sottotitolato e strutturato in sotto-attività, iniettato come guida. Lo screenshot dal vivo rimane autorevole, quindi quando il layout, il contenuto o lo stato dell'app differiscono da quanto mostrato, il modello rielabora il piano piuttosto che riprodurre coordinate obsolete. Questo è il meccanismo alla base del presunto salto dal 17.2 al 35.4 di successo rigoroso sul sottoinsieme di auto-dimostrazione — e rimane un'affermazione del fornitore finché qualcuno non la riproduce.

UI-Mate-27B è davvero all'avanguardia per gli agenti GUI con pesi aperti?

Dipende interamente dalla configurazione di valutazione. Il suo 66.2 su WindowsAgentArena supererebbe i migliori risultati WAA riportati pubblicamente all'inizio del 2026, ma il suo 77.0 su OSWorld-Verified si colloca sotto l'Holo3-35B-A3B open-weight con 82.6 nella classifica pubblica. L'articolo lo definisce un nuovo stato dell'arte open-weight; una riesecuzione indipendente su un setup coerente è l'unico modo per saperlo.

Posso eseguire UI-Mate-27B oggi?

Sì, se lo servi tu stesso: scarica i pesi da Hugging Face — il checkpoint generale 27B, il 9B, o il checkpoint UI-Mate-democua-27B guidato da dimostrazioni — esegui il comando vLLM dalla scheda del modello (dimensione tensor-parallel 2, sei immagini per prompt), e guidalo con l'agente Python o con l'app macOS. Non esiste un'API ospitata, e nessuno dei checkpoint è ancora su OrcaRouter — il che, per modelli così nuovi e così poco verificati, è una ragione ragionevole per tenerli in un ambiente isolato per ora.

La lettura giusta di UI-Mate-27B non è "il vincitore" ma "degno di attenzione". Un modello open da 27B che rivendica un vantaggio WAA e offre un flusso di lavoro dimostrativo one-shot è un dato significativo in un anno in cui gli agenti open-weight per l'uso del computer sono passati dall'essere uno scherzo a essere a portata della frontiera. Ora che il checkpoint guidato dalla dimostrazione è pesi pubblici anziché un segnaposto della pagina di progetto, il flusso di lavoro "mostralo una volta" è qualcosa che puoi davvero eseguire. Tencent è stata prudente con i rilasci in passato, e questo ha la forma di un lavoro in corso reso pubblico. Eseguitelo in una sandbox, rifate i benchmark e continuate a seguire gli annunci: la parte interessante di questa storia deve ancora arrivare.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube