Una card hero per il titolo del confronto 'InternLumina-U2 vs Tencent UI-Mate-27B' con il sottotitolo 'L'agente desktop che puoi eseguire oggi vs il modello di visione che puoi solo leggere' e tre chip statistici — 'UI-Mate-27B: opera su un desktop oggi', 'InternLumina-U2: visione unificata, senza pesi', 'Entrambi Apache-2.0, entrambi non comprovati' — con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

InternLumina-U2 vs Tencent UI-Mate-27B: l'agente desktop che puoi eseguire ora vs il modello di visione unificato di cui puoi solo leggere

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tencent UI-Mate-27B e InternLumina-U2 sono due rilasci Apache-2.0 passati in sordina, provenienti da laboratori cinesi e pubblicati a due settimane di distanza l'uno dall'altro — e non sono concorrenti: è proprio per questo che vale la pena confrontarli. Tencent UI-Mate-27B, rilasciato con pesi aperti il 14 agosto 2026, è un agente desktop: osserva lo schermo ed emette azioni di mouse e tastiera. InternLumina-U2, pubblicato come codice di inferenza il 1° settembre 2026 dallo Shanghai AI Laboratory, è un aspirante modello di visione unificato: sostiene di saper leggere immagini, video e 3D e di generare e modificare immagini. Uno agisce su ciò che vede; l'altro, quando i suoi pesi finalmente esisteranno, parlerà e disegnerà ciò che vede. Se il tuo lavoro consiste nell'operare su un desktop, solo uno di questi due può farlo oggi — e non è quello con l'architettura più appariscente.

L'agente che agisce: Tencent UI-Mate-27B

UI-Mate-27B è un agente GUI foundation open-weight da 27 miliardi di parametri, sviluppato dal team HY Frontier di Tencent, specializzato in agenti multimodali, tramite fine-tuning di Qwen3.6-27B. Osserva screenshot in tempo reale, ragiona sullo stato corrente dello schermo ed emette azioni strutturate di tastiera e mouse in uno spazio di coordinate normalizzato — il risultato di un modello addestrato a operare su un desktop reale, non a parlarne. La sua caratteristica distintiva è l'esecuzione guidata da dimostrazioni: mostragli un flusso di lavoro una volta e adatterà la dimostrazione registrata al compito in questione, trattando lo screenshot in tempo reale come riferimento autorevole quando l'interfaccia differisce da quella registrata. I punteggi principali riportati da Tencent sono OSWorld-Verified 77.0 e WindowsAgentArena 66.2 — cifre che, se riprodotte in modo indipendente, si piazzerebbero in cima a quelle classifiche del 2026 — insieme a una serie di punteggi OSWorkerBench. I pesi sono reali e scaricabili: dodici shard safetensors su Hugging Face, auto-ospitabili tramite vLLM o SGLang su un paio di GPU, e la scheda del modello reca un'importante avvertenza: è un checkpoint per agenti, non un modello autonomo di chat visiva — se gli chiedi «descrivi questa immagine», lo stai usando male.

Gli occhi promessi: InternLumina-U2

InternLumina-U2 è una specie completamente diversa. È un modello di diffusione a miscela sparsa di esperti con 16B parametri (1B attivi) che il laboratorio intende come modello unico per la comprensione visiva omni-comprensiva, la generazione di immagini e l'editing di immagini — un design a otto codebook completamente discreti in cui un singolo backbone sia legge un'immagine, un grafico, un video o una risorsa 3D, sia scrive nuovi pixel. Se il tuo modello mentale è un agente GUI, InternLumina-U2 è il polo opposto: non vuole cliccare nulla, vuole capire tutto e disegnare su richiesta. La sua forma pubblicata il 1 settembre 2026 è codice di inferenza e un'architettura — sei punti di ingresso per attività in un repository GitHub, una pagina di progetto con una tabella di benchmark preliminare, uno stub vuoto di Hugging Face — e i suoi pesi, il codice di addestramento e il rapporto tecnico sono ancora tutti contrassegnati come "in arrivo". Nessuno può eseguirlo. Il divario tra i due modelli non è la qualità; è l'esistenza.

Il tabellone

I dati di UI-Mate-27B sono dichiarati da Tencent e non riprodotti; quelli di InternLumina-U2 sono dichiarati dal laboratorio, preliminari e parziali. Ogni riga riporta la propria provenienza.

{{1}}• Impiego — Tencent UI-Mate-27B: gestire un desktop — leggere screenshot in tempo reale, emettere azioni di mouse e tastiera. InternLumina-U2: percepire e creare — comprendere immagini/video/3D, generare e modificare immagini.{{/1}}

• Pesi — Tencent UI-Mate-27B: pubblici dal 14 agosto 2026, dodici shard safetensors, Apache-2.0. InternLumina-U2: non pubblici — repository Hugging Face vuoto, pesi "disponibili a breve".

• Scala — 27B denso, affinato da Qwen3.6-27B, rispetto a 16B totali / 1B attivi del modello di diffusione MoE sparso.

Output — Tencent UI-Mate-27B: azioni strutturate compatibili con pyautogui in uno spazio di coordinate normalizzato. InternLumina-U2: dichiara supporto per testo, generazione di immagini da testo fino a 1024×1024 e modifica di immagini basata su istruzioni.

• Numeri principali — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, miglioramenti su OSWorkerBench grazie alle dimostrazioni (tutti riportati da Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (riportati dal laboratorio, preliminari).

• Nota sulla provenienza — Tencent UI-Mate-27B: la scheda stessa avverte che si tratta di un checkpoint di agente, non di un modello autonomo di chat visiva. InternLumina-U2: la pagina del progetto etichetta i propri risultati come "preliminari, parziali".

• La realtà del serving — Tencent UI-Mate-27B: self-hosting tramite vLLM o SGLang su ~2 GPU; nessun provider di inferenza ospitata lo distribuisce attualmente. InternLumina-U2: non servibile da nessuno — il driver rilasciato richiede checkpoint che non sono presenti nel repository.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Due diversi tipi di non provato

Entrambi i modelli non sono comprovati, e la parola non significa la stessa cosa due volte. Tencent UI-Mate-27B non è comprovato nel senso ordinario di un nuovo modello: i suoi punteggi principali sono quelli dichiarati dal fornitore stesso, nessuno li ha rieseguiti in modo indipendente e il suo numero di download è esiguo rispetto alle affermazioni — la tipica situazione di un checkpoint che a prima vista ha quattro giorni e attorno al quale nel frattempo è cresciuta una piccola comunità. Ma questa non comprovazione è verificabile. Poiché i pesi esistono, i punteggi 66,2 e 77,0 possono essere verificati questa settimana da chiunque disponga di due GPU e di un ambiente di test Windows, e le affermazioni guidate da dimostrazioni possono essere riprodotte o confutate su flussi di lavoro reali. InternLumina-U2 non è comprovato in un senso più stretto: non è testabile. La sua architettura è pubblica e leggibile; i suoi numeri, invece, non lo sono — non esiste alcun artefatto che possa confermarli, e la tabella parziale dello stesso laboratorio mostra già che è in ritardo rispetto a un rivale esplicitamente nominato su almeno un benchmark di generazione. Un numero del fornitore allegato a un file scaricabile è un'affermazione in attesa di un revisore. Un numero del fornitore allegato a una roadmap è una speranza.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

La scheda Hugging Face di tencent/UI-Mate-27B, catturata il 27 agosto 2026 — la base Qwen3.6-27B, i punteggi OSWorld e WindowsAgentArena riportati dal fornitore e la nota secondo cui nessun provider di inferenza lo ha attualmente in produzione.

La divisione naturale del lavoro: un attore e i suoi occhi

Affiancati, i due modelli delineano la forma di una pipeline di automazione affidabile. Il problema difficile con gli agenti GUI non è il caso medio; è l'agente che compie silenziosamente l'azione sbagliata su uno stato dello schermo inaspettato e nessuno che se ne accorge. È esattamente il compito per cui esiste un modello di visione economico e affidabile: verificare lo stato dello schermo prima e dopo ogni azione, confermare che la finestra di dialogo comparsa è quella che l'agente pensa sia comparsa, e fermare il ciclo quando la realtà e il modello di realtà dell'agente divergono. Tencent UI-Mate-27B è l'attore; un modello di visione unificato come InternLumina-U2 sostiene di essere è il verificatore naturale, in grado di leggere gli stessi screenshot su cui l'agente agisce. Quando — e solo quando — i pesi di InternLumina-U2 saranno effettivamente disponibili e le sue affermazioni sulla comprensione resisteranno a test indipendenti, questo è il ruolo che potrebbe ricoprire al fianco di un agente, piuttosto che contro di esso. I due non sono rivali per un lavoro; sono le due metà di un lavoro.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

Il repository GitHub InternLM/InternLumina-U2, catturato il 2 settembre 2026 — la pagina di destinazione del repository che mostra gli script di inferenza per singola attività, incluso il punto di ingresso per la comprensione delle immagini a partire dal quale sarebbe stato costruito un verificatore dello stato dello schermo; i pesi che lo renderebbero eseguibile non sono presenti nell'albero.

Cosa fa un livello di routing per uno stack agente-con-occhi

Nessuno dei due modelli è ospitato su OrcaRouter, e non lasceremo intendere il contrario — Tencent UI-Mate-27B non ha alcun provider di hosting da nessuna parte, e InternLumina-U2 non dispone di pesi che alcun provider possa ospitare. Il pattern di routing che si applica è esattamente quello per questa architettura: un agente che agisce e un modello di visione che verifica, composti in modo che il passo costoso o rischioso sia vincolato a quello economico e affidabile. Il DSL di routing esprime tutto ciò come una singola chiamata logica — agisci, poi verifica, poi procedi o fermati — invece di un collante su misura tra due provider di modelli, e il failover automatico copre la modalità di guasto realistica: un agente GUI come UI-Mate-27B è esattamente il tipo di checkpoint non collaudato che metti alla prova prima su un percorso di test, con la chiamata che ricade su un modello collaudato nel momento in cui il nuovo si comporta male. Un'unica API su oltre 200 modelli ospitati, prezzo di listino del provider applicato con markup 0%, e le parti non collaudate dello stack tenute protette da guardrail di sicurezza finché non si guadagnano la tua fiducia.

La conclusione

Se stai costruendo qualcosa che opera su un desktop, Tencent UI-Mate-27B è l'unico dei due che esiste in senso utilizzabile — eseguibile oggi sulle tue GPU, con punteggi impressionanti ma non riprodotti che puoi davvero andare a testare. Se stai costruendo qualcosa che ha bisogno di un modello che capisca e disegni ciò che vede, InternLumina-U2 è un'architettura promettente in attesa dei suoi pesi — degna di essere letta ora, ma inutile come dipendenza finché non appariranno i safetensors. Tieni d'occhio entrambi per il giorno in cui la divisione del lavoro diventerà possibile: un attore sul tuo desktop, un insieme di occhi verificati che lo osservano, e un livello di instradamento che li tiene onesti.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube