Une carte de titre générée dans le style maison d’OrcaRouter, portant « PixelUMM vs UI-Mate-27B », avec quatre tuiles statistiques : « 77.0 » (moyenne OSWorld-Verified déclarée d’UI-Mate-27B), « 66.2 » (sa moyenne WindowsAgentArena), « aucun » (espace d’action de PixelUMM) et « Apache-2.0 » (licence d’UI-Mate-27B sur le code et les poids, contre le checkpoint non commercial de PixelUMM). Une ligne de pied de page indique « Scores d’agents rapportés par Tencent ; chiffres de PixelUMM issus de sa prépublication. Aucune réexécution indépendante. ». Le logo OrcaRouter est incrusté dans la bande de remplissage en bas à droite.
Guides & Insights

PixelUMM vs UI-Mate-27B : l'un dessine ce qu'il voit, l'autre le clique

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Sur une fiche technique, Tencen​t UI-Mate-27B et NVIDIA PixelUMM semblent comparables — 27 milliards de paramètres contre environ 15,2 milliards, tous deux en téléchargement libre, tous deux bâtis sur des backbones Qwe​n — et ils ne sont absolument pas comparables. UI-Mate-27B est un agent GUI de base : il observe des captures d'écran en direct, planifie à partir de ce qui se trouve actuellement à l'écran et émet des actions structurées de souris et de clavier pour un bureau réel. PixelUMM est un modèle multimodal unifié sans encodeur qui lit les images et la vidéo dans l'espace des pixels bruts et génère des images et de la vidéo à partir de texte — il perçoit et il crée, mais il n'a pas d'espace d'action, pas de curseur et aucun moyen de toucher un écran. L'un agit sur le monde. L'autre le décrit et le représente. Tout ce qui suit découle de cette séparation, et l'écart de licence entre eux est la deuxième chose que vous devez savoir.

Les deux laboratoires publient leurs propres chiffres et aucun ne fait l'objet d'une évaluation indépendante. Tous deux ont communiqué discrètement — c'est dans le style de publication que la ressemblance s'arrête réellement.

Acteur et percepteur

UI-Mate-27B exécute une tâche à partir d'une instruction en langage naturel et de captures d'écran en direct uniquement. Il raisonne sur l'état visible, replanifie au fur et à mesure que l'interface change et produit un raisonnement, une description concise de l'action et des appels d'outils structurés d'utilisation de l'ordinateur pour la souris, le clavier, le défilement, l'attente, l'interaction utilisateur et l'achèvement de la tâche. Sa caractéristique distinctive est l'exécution guidée par démonstration : montrez-lui un flux de travail une fois et il adapte la démonstration enregistrée à la tâche en cours, en considérant la capture d'écran actuelle comme faisant autorité lorsque l'interface a évolué. Il est affiné à partir de Qwen3.6-27B avec un affinage supervisé suivi d'un apprentissage par renforcement en ligne dans des environnements GUI exécutables, et il est servi via vLLM avec une interface compatible OpenAI.

• Benchmarks rapportés — moyenne OSWorld-Verified 77,0, moyenne WindowsAgentArena 66,2, taux de réussite strict OSWorkerBench 41,00 et progression 76,86. Tous rapportés par Tencent et non reproduits.

• Espace d'action — souris, clavier, défilement, attente, interaction utilisateur, achèvement de tâche, dans un espace de coordonnées normalisé avec des appels structurés compatibles pyautogui.

• Réalité matérielle — 27B dense, servi avec parallélisme tensoriel sur deux GPU dans le quick-start de Tencent, sous Apache-2.0.

• Une mise en garde importante sur la fiche elle-même — UI-Mate-27B est un checkpoint d’agent plutôt qu’un modèle autonome de conversation visuelle. Tencent recommande d’utiliser le prompt officiel, l’analyseur de réponses et le harnais d’interaction de son dépôt. Si vous lui demandez « décrivez cette image », vous utilisez le mauvais outil.

PixelUMM occupe le pôle opposé. Toute son architecture est un argument sur la représentation : pas de VAE, pas d’encodeur visuel, des images sous forme de patchs de 16×16 pixels et des vidéos sous forme de tubelets spatiotemporels de 4 images, directement dans un Transformer de type décodeur seul via des projections linéaires à une seule couche, avec une conception Mixture-of-Transformers associant une attention partagée à des paramètres spécifiques à la tâche. La compréhension est du texte autorégressif ; la génération est du flow matching dans l’espace pixel. Quatre checkpoints sont fournis, S8-F22-R05 comme configuration par défaut couvrant le texte-vers-image, le texte-vers-vidéo à 96 images et 24 fps, ainsi que les deux directions de compréhension.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Les deux schémas de publication offrent un contraste saisissant.

UI-Mate-27B est apparu sur Hugging Face le 14 août 2026 avec une fiche de modèle, une prépublication arXiv numérotée 2608.15930, une page de projet, un dépôt GitHub et une recette de service documentée. Entre cette date et début octobre, il a accumulé environ 780 téléchargements et 93 likes — modeste, mais une publication normale d’un agent de recherche avec les documents en règle.

La trace de PixelUMM est différente par nature. Le dépôt GitHub a été créé le 4 septembre 2026 ; la prépublication arXiv est datée du 29 septembre ; le dépôt Hugging Face a été créé à 21 h 40 UTC le 1er octobre 2026, quelques minutes après le commit final du dépôt. Aucun billet de blog, communiqué de presse ou fil de lancement NVIDIA n'a fait surface à son sujet. Le chemin URL de la page du projet lui-même affiche encore pixelumm-project-page-preview. Son nombre de téléchargements était de zéro au moment de la rédaction.

Chercher une intention là-dedans est une erreur — un laboratoire peut publier un artefact de recherche et planifier un lancement plus tard. Ce que l'on peut savoir est plus restreint et plus utile : un modèle dispose d'une voie de mise en service officielle et de dix semaines de téléchargements ; l'autre a un article, un dépôt de code, et aucune déclaration de son éditeur.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Tableaux de scores qui ne se chevauchent pas

Il n'existe aucun benchmark que les deux modèles rapportent, et c'est bien là tout l'intérêt : ils ne résolvent pas le même problème.

• Utilisation agentique de l'ordinateur — UI-Mate-27B : OSWorld-Verified 77,0, WindowsAgentArena 66,2. PixelUMM : aucun espace d'action, donc aucun score n'est possible.

• Compréhension d’images — UI-Mate-27B : consomme des captures d’écran comme entrée d’agent, n’est pas évalué comme un VLM général. PixelUMM : MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00.

• Vidéo — UI-Mate-27B : aucun. PixelUMM : MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.

• Génération — UI-Mate-27B : aucun. PixelUMM : GenEval 0,83 avec un réécrivain de prompt, DPG-Bench 85,74, qualité VBench Partie 1 84,10.

• Coût de déploiement — UI-Mate-27B : 27B dense réparti sur environ deux GPU via vLLM, plus le harness officiel. PixelUMM : environ 30 Go de fragments de checkpoint distribués, CUDA 13 avec FlashAttention compilé depuis les sources, un modèle de garde-fou à accès restreint pour le chemin vidéo et un second environnement Python qui lui est dédié.

• Licence — UI-Mate-27B : Apache-2.0, code et poids. PixelUMM : code Apache-2.0, licence NVIDIA One-Way Noncommercial sur le checkpoint.

• Échelle — 27B dense contre environ 15,2B au total, présenté comme « 8B MoT » dans les propres tableaux de l'article de PixelUMM.

La seule affirmation réellement comparable porte sur la provenance, et elle vaut pour les deux : chacun des chiffres ci-dessus provient du fournisseur lui-même, aucun n'a été reproduit en dehors du laboratoire qui l'a produit, et l'un des deux modèles qualifie explicitement ses propres résultats de préliminaires.

Construire avec eux, et pourquoi vous pourriez utiliser les deux

Ces deux-là se complètent mieux qu’ils ne se concurrencent. Une pile d’automatisation de bureau veut UI-Mate-27B pour la couche d’action et quelque chose capable de raisonner sur ce qu’elle a vu ; un pipeline de contenu ou d’inspection veut la lecture et la génération de PixelUMM et n’a que faire d’un curseur. Le chevauchement se situe à la frontière de la perception, où l’ancrage des captures d’écran d’UI-Mate-27B est spécifique à la tâche et celui de PixelUMM est général — les mêmes pixels, deux finalités entièrement différentes.

Lorsque vous faites tourner plusieurs modèles les uns contre les autres — l'agent face à un VLM généraliste, ou un nouveau checkpoint de recherche face à celui déjà en production —, le coût de la comparaison réside normalement dans l'intégration, pas dans l'inférence : deux formats d'API, deux mécanismes d'authentification, deux contrats. C'est le problème qu'une couche de routage a pour vocation de supprimer, et c'est là que la conception d'OrcaRouter porte ses fruits : une seule clé pour plus de 200 modèles, les prix catalogue des fournisseurs répercutés avec 0 % de marge, le basculement automatique entre fournisseurs, ainsi qu'un DSL de routage et une fusion de modèles permettant de composer plusieurs modèles en un seul appel. Ni PixelUMM ni UI-Mate-27B ne sont disponibles sur aucun point de terminaison hébergé aujourd'hui, et OrcaRouter ne route ni l'un ni l'autre — il s'agit donc du flux de travail lorsqu'ils le seront, et non d'une affirmation sur leur disponibilité actuelle.

Lequel pour quel travail ?

Si la tâche se termine par un clic, une frappe au clavier ou un formulaire rempli, il n’y a ici qu’un seul candidat, et c’est UI-Mate-27B. Il est sous Apache-2.0, dispose d’un article arXiv et d’un harnais officiel, et ses scores rapportés sur OSWorld et WindowsAgentArena relèvent du type d’affirmation qui peut être vérifiée par quiconque dispose de deux GPU et d’une image de test Windows ou Ubuntu — ce qui est exactement ce qui la rend digne d’être vérifiée plutôt que crue.

Si la tâche se termine par une réponse ou une image, c'est PixelUMM qui peut le faire, et c'est d'abord un artefact de recherche. Son article est d'une honnêteté inhabituelle sur ses propres limites, reconnaissant que des données d'entraînement différentes signifient que sa comparaison de benchmarks « ne peut pas établir quelle architecture est supérieure ». Son checkpoint est non commercial. Ses atouts sont la nouveauté architecturale et l'étendue, pas des chiffres à l'état de l'art, et sa valeur immédiate s'adresse à quiconque étudie si les modèles unifiés sans encodeur fonctionnent à l'échelle vidéo. Téléchargez-le pour lire le code et exécuter les démos ; ne le téléchargez pas pour livrer une fonctionnalité.

Le résumé en deux lignes est le même que celui que fournissent les éléments de preuve : un modèle peut agir et ne peut pas créer, l’autre peut créer et ne peut pas agir, et l’écart de licences et de maturité entre eux compte plus que n’importe quel nombre de paramètres.