Une carte de titre hero pour UI-Mate-27B, l'agent GUI de fondation open-weight de Tencent sorti le 14 août 2026, montrant un moniteur de bureau avec un curseur de souris et des flèches d'automatisation, sous-titre 'Agent GUI de fondation open-weight', chips de libellés 'Apache-2.0', '27B de paramètres', 'prêt pour vLLM', et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Tencent UI-Mate-27B : l'agent GUI open-weight discret qui revendique une place de premier plan dans WindowsAgentArena

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 14 août 2026, l'équipe HY Frontier Multimodal Agent de Tencent a publié trois checkpoints sur Hugging Face sous l'organisation tencent/ — UI-Mate-27B, un UI-Mate-9B plus petit, et le UI-Mate-democua-27B guidé par démonstrations. Quatre jours plus tard, aucune annonce nulle part : ni post de lancement, ni communiqué de presse, ni tweet produit. Ce qui a été publié à la place est inhabituellement complet pour une sortie silencieuse : une page projet, un dépôt GitHub avec un harnais fonctionnel, et un article arXiv soumis il y a deux jours qui présente le modèle plus grand comme nouvel état de l'art en open-weight dans le contrôle d'interfaces graphiques de bureau.

Tout ce qui figure dans cet article provient des fiches de modèles, du dépôt GitHub, de la page du projet et de ce papier de recherche — rien de tout cela n'a encore été reproduit de manière indépendante. Les checkpoints n'ont aucun téléchargement sur Hugging Face au moment où nous écrivons, ce qui signifie que nous sommes probablement parmi les premières personnes en dehors de Tencent à les prendre au sérieux par écrit. Voici ce qui est réellement connaissable à partir des dépôts, et ce qui reste non confirmé jusqu'à ce que quelqu'un d'autre les exécute.

Sommaire

• Ce qui a été livré, et ce qui n'a pas été annoncé

Ce qu'est réellement UI-Mate-27B

• La fonctionnalité qui fait la différence : l'exécution guidée par démonstration

• Les chiffres — tous rapportés par le vendeur

• Où ces nombres se situeraient — s'ils tiennent.

• Comment l'exécuter

• La stack autour d'un nouvel agent GUI

• À regarder ensuite

• FAQ

Ce qui a été livré, et ce qui n'a pas encore été annoncé

Tencent a publié UI-Mate-27B (27 milliards de paramètres, licence Apache-2.0, safetensors en BF16) le 14 août 2026, en même temps que le modèle frère 9B et le checkpoint guidé par démonstration UI-Mate-democua-27B. Les deux checkpoints 27B reposent sur Qwen3.6-27B — lui-même un modèle multimodal sous Apache-2.0 sorti en avril 2026 — ce qui signifie que toute la pile, de la base au fine-tuning, est utilisable commercialement. Les dépôts portent des horodatages de dernière modification remontant à cette semaine — le checkpoint guidé par démonstration a été modifié aujourd'hui encore — ce qui montre que Tencent y travaille activement.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

Ce qui est public jusqu'à présent :

• Les poids UI-Mate-27B, UI-Mate-9B et UI-Mate-democua-27B sur Hugging Face, chacun avec une fiche modèle, des tableaux d'évaluation et une recette de déploiement.

• Une page de projet sur ui-mate.github.io avec une vidéo de démonstration, un guide d'utilisation et une application macOS Apple Silicon (DMG v0.2.4).

• Le dépôt GitHub (github.com/Tencent/UI-Mate) contenant le prompt officiel, l’analyseur de réponses et le harnais d’interaction — la fiche précise explicitement qu’il s’agit « d’un point de contrôle d’agent plutôt que d’un modèle de chat visuel autonome » et le harnais est recommandé pour toute utilisation réelle.

• Une prépublication arXiv (2608.15930), soumise le 16 août, intitulée « UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations ».

Ce qui n'est pas encore public : Tencent lui-même n'a rien dit — il s'agit d'une sortie qui passe d'abord par le dépôt, pas d'un lancement. La variante guidée par démonstration que la page du projet avait listée comme pas encore publique a désormais des poids disponibles sur Hugging Face : le dépôt tencent/UI-Mate-democua-27B, créé lors du même push du 14 août, est explicitement étiqueté comme le checkpoint guidé par démonstration de la famille — un modèle distinct, pas un re-branding du 27B. Il n'y a toujours aucune API hébergée nulle part. C'est important : la seule façon d'exécuter UI-Mate aujourd'hui est de télécharger les poids et de les servir vous-même.

Ce qu'est réellement UI-Mate-27B

UI-Mate-27B est un agent GUI de base pour le « travail à long horizon sur plusieurs applications et systèmes d'exploitation ». Il observe des captures d'écran en direct, raisonne sur l'état visible et émet des actions structurées de clavier et de souris pour une interaction native avec le bureau. L'entraînement est un fine-tuning supervisé suivi d'un apprentissage par renforcement en ligne dans des environnements GUI exécutables — le modèle a appris en pilotant réellement des bureaux, pas seulement à partir de captures d'écran statiques.

L'espace d'action est la partie qui intéressera les développeurs : souris, clavier, défilement, attente, interaction utilisateur et achèvement de tâche, avec des sorties compatibles avec pyautogui. Le modèle raisonne dans un espace de coordonnées normalisé de 1000×1000 et l'agent de référence reconvertit ses prédictions à la résolution réelle de la capture d'écran, de sorte que les actions survivent aux différences de mise à l'échelle d'affichage entre les machines. Le README du modèle recommande de le servir avec vLLM derrière un endpoint compatible OpenAI.

La fonctionnalité qui fait la différence : l'exécution guidée par démonstration.

La plupart des agents GUI ne prennent qu'une seule entrée : une instruction. UI-Mate en prend une seconde, qui est véritablement rare dans un checkpoint ouvert — une démonstration. « Montrez le flux de travail une fois. Laissez l'agent l'adapter à la tâche à accomplir », comme le dit la page du projet.

Le mécanisme n'est pas une vidéo contextuelle ni un script d'action fixe. Une démonstration enregistre des captures d'écran immédiatement avant et après chaque action clavier ou pointeur, puis le pipeline normalise la trace en une représentation cohérente d'actions et de trames, l'annote avec les observations, l'intention, les actions et les preuves de vérification, et la segmente en sous-tâches nommées avec des critères de complétion. Au moment de l'inférence, cela devient un workflow compact injecté pour la sous-tâche active — mais la capture d'écran en direct reste la référence autoritaire tout au long du processus, de sorte que lorsque l'état de l'application diffère de la démonstration, le modèle réélabore un plan plutôt que de rejouer.

Tencent a fait du checkpoint derrière ce workflow son propre modèle public : la fiche UI-Mate-democua-27B compare les résultats avec instruction seule et avec une démonstration sur les mêmes évaluations, et son schéma d'outils ajoute une action subtask_complete — le mécanisme derrière ces sous-tâches nommées. Sur le sous-ensemble self-demo d'OSWorkerBench, une démonstration fait passer le succès strict de 17.17 à 35.35 et la progression de 67.85 à 81.14 ; sur le sous-ensemble OSWorld, la progression passe de 40.27 à 65.75 ; sur l'ensemble d'évaluation GameDev, le score moyen passe de 76.76 à 81.15 tandis que la longueur moyenne de trajectoire chute de 303.6 à 253.1 étapes — la démonstration raccourcit la tâche en plus de l'améliorer. La fiche indique que la démonstration a amélioré 28 des 33 tâches self-demo et résolu quatre tâches qui obtiennent zéro sans guidage. La réserve est la même que celle qui parcourt tout cet article : il s'agit des évaluations appariées de l'équipe, moyennées sur trois à cinq exécutions, et personne ne les a reproduites.

Les chiffres — tous rapportés par le fournisseur.

Exécution sur instructions uniquement, directement depuis la fiche du modèle :

• Score moyen OSWorld-Verified — 77.0

• Score moyen de WindowsAgentArena — 66.2

• Succès strict OSWorkerBench — 41.00

• Progression d'OSWorkerBench — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench est lui-même l'une des trois contributions de l'article : un nouveau benchmark de 100 tâches de bureau à long horizon couvrant 41 applications, avec des sous-ensembles de 33 self-demo et 45 variant-demo. Il s'agit d'une nouvelle évaluation, il n'existe donc aucun travail antérieur auquel comparer ces deux scores. Par rapport à son propre modèle de base, UI-Mate-27B prétend surpasser Qwen3.6-27B de 17,7 points de succès strict et de 24,5 points de progrès sur OSWorkerBench — ce qui constitue le chiffre de comparaison directe le plus propre de toute la publication, puisque les deux modèles passeraient par le même harnais d'évaluation.

Chaque chiffre ci-dessus est une évaluation de l'équipe elle-même. Il n'existe pas encore de scores indépendants, ni de ré-exécutions par des tiers, et avec zéro téléchargement, pas de reproductions communautaires non plus. Traitez chaque chiffre ici comme une déclaration, pas un fait.

Où ces nombres se trouveraient — s'ils tiennent.

WindowsAgentArena est celui qui ferait vraiment la une. Les meilleurs résultats WAA publiquement rapportés plus tôt en 2026 se situaient autour de 61,0 (un système modulaire appelé VLAA-GUI, avril 2026) ; l'open-weight EvoCUA-32B de Meituan était à 56,5, et l'UI-TARS-2 fermé de ByteDance se situait dans les 50 à 55 sur le même tableau. Un score de 66,2 sur l'évaluation propre d'UI-Mate-27B le placerait au-dessus de tout ce qui avait été rapporté sur ce benchmark cette année — ouvert ou fermé. C'est une affirmation forte, et elle nécessite une nouvelle exécution indépendante.

OSWorld-Verified à 77,0 est solide mais ne constitue pas un nouveau record open-weight sur le classement public. Sur l'instantané du classement OSWorld-Verified de début août 2026, le modèle open-weight Holo3-35B-A3B figure à 82,6, avec plusieurs modèles fermés de pointe au-dessus (Qwen3.8 Max à 86,1, Claude Mythos 5 et Claude Fable 5 à 85,0, Claude Opus 4.8 à 83,4). La formulation d'« état de l'art » dans l'article relève donc de son propre dispositif d'évaluation, et non d'un fait établi — les différences de bancs d'essai, d'analyseurs d'actions et les dérives d'auto-évaluation font tous du 77,0 face au 82,6 une question que seule une réexécution indépendante peut trancher. Pour replacer dans son contexte ce que signifie un modèle ouvert de 27B atteignant 77,0 : il se situerait au-dessus de la référence humaine experte d'environ 72,4 et au-dessus de plusieurs grands systèmes de pointe sur ce même classement, notamment Claude Opus 4.6 à 72,7 et Kimi K2.6 à 73,1.

Tencent n'est pas nouveau dans ce domaine — il a livré POINTS-GUI-G, un modèle d'ancrage GUI de 8B, en février 2026, lancé l'assistant Marvis OS en mai, et contribué au projet GUICrafter d'utilisation d'ordinateur en juin. UI-Mate est une gamme distincte visant spécifiquement le contrôle complet du bureau, et c'est le premier des agents GUI de Tencent à être publié en tant que modèle de fondation ouvert plutôt qu'en tant que composant d'ancrage ou produit.

Comment l'exécuter

Le modèle est conçu pour vLLM, et la fiche du modèle donne la commande exacte — vllm serve tencent/UI-Mate-27B avec une taille de parallélisme tensoriel de 2 et le modèle de chat compatible OpenAI. Un détail pratique ressort : l’agent conserve cinq captures d’écran en contexte par défaut, le serveur doit donc accepter au moins six images par requête, car la capture la plus récente arrive avant que la plus ancienne ne soit supprimée. Le drapeau recommandé est --limit-mm-per-prompt avec six images et zéro vidéo. Le checkpoint guidé par démonstration fonctionne de la même manière — sa fiche mentionne vLLM et SGLang derrière un point de terminaison compatible OpenAI.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

Une fois déployé, une classe d'agent Python (UIMateAgent) prend une capture d'écran et une instruction, puis renvoie la réponse ainsi que des actions structurées, en ramenant les coordonnées 1000×1000 à votre résolution. La page du projet propose également une application macOS pour Apple Silicon destinée au mode guidé par démonstration, ce qui est le moyen le plus simple d'essayer le flux « montrez-le une fois » sans avoir à construire l'infrastructure vous-même. La licence est Apache-2.0 pour l'ensemble, donc l'utilisation locale, le fine-tuning et l'intégration commerciale sont tous autorisés.

Deux avertissements doivent accompagner toute instruction « comment l’exécuter » pour un agent d’utilisation d’ordinateur, et les deux proviennent de la carte de modèle elle-même. Utilisez des environnements isolés ou jetables. Exigez une confirmation humaine avant toute action sensible, surveillez la trajectoire, et ne considérez pas qu’un succès rapporté par le modèle prouve que le résultat prévu s’est réellement produit. Les agents d’interface graphique font des clics erronés, et l’injection d’instructions par le contenu affiché à l’écran est une menace réelle, pas une hypothèse.

La stack autour d'un nouvel agent GUI

Aucun des points de contrôle UI-Mate n'est encore sur OrcaRouter — la famille vient tout juste de sortir, avec zéro téléchargement, et son modèle de base Qwen3.6-27B n'y est pas non plus. Il n'existe pas d'API hébergée, donc si vous voulez en exécuter un cette semaine, c'est vous qui servez vLLM vous-même. C'est acceptable pour un laboratoire, mais ce n'est pas la bonne configuration pour la production.

Un pipeline de computer-use en production est rarement un unique checkpoint. Il comprend un modèle planificateur qui décide de l’intention suivante, un modèle de grounding ou de vision qui lit l’écran, l’agent GUI lui-même, et un repli peu coûteux quand une sous-étape échoue — et toutes ces pièces sont des modèles servis, même lorsque l’agent GUI est local. C’est exactement à cela que sert une couche de routage : une seule API sur plus de 200 modèles hébergés, le prix catalogue du fournisseur répercuté sans marge (0 %), et un basculement automatique (failover) afin qu’une panne transitoire chez un fournisseur ne bloque pas une longue exécution d’agent. Le DSL de routage permet aussi de composer plusieurs modèles en un seul appel — un planificateur au début, un vérificateur peu coûteux à la fin — sans avoir à assembler les fournisseurs dans votre propre code. Le résumé honnête est simple : l’agent qui pilote le bureau est local, mais les modèles qui décident quoi faire autour sont routables, et tester en toute sécurité des checkpoints tout nouveaux et non éprouvés est précisément à cela que sert le failover.

Que regarder ensuite

Quatre choses changeraient la donne pour UI-Mate-27B, par ordre approximatif d'importance :

• Une réexécution indépendante d'OSWorld-Verified et de WindowsAgentArena. Le chiffre WAA en particulier est soit un gros problème, soit un artefact de harnais, et seule une évaluation externe permettra de trancher.

• Le rapport technique officiel. La citation actuelle est un espace réservé, et l'article complet révélera probablement les détails du moteur de données que le résumé ne fait qu'esquisser.

• L'annonce de Tencent elle-même. Une publication « repo-first » comme celle-ci précède généralement quelque chose — une intégration Marvis, une offre hébergée, ou une poussée plus large en faveur des modèles ouverts.

• Une API hébergée. Les poids des trois points de contrôle sont désormais publics, mais rien n'est servi nulle part — aucun endpoint Tencent, aucun fournisseur d'inférence tiers — donc l'auto-hébergement reste la seule voie, et seule une annonce de Tencent ou une adoption par un fournisseur change cela.

FAQ

Qu'est-ce que Tencent UI-Mate-27B ?

UI-Mate-27B est un agent GUI de fondation de 27 milliards de paramètres sous licence Apache-2.0, développé par l'équipe d'agents multimodaux HY Frontier de Tencent, affiné à partir de Qwen3.6-27B. Il observe les captures d'écran du bureau en temps réel, raisonne dessus et génère des actions de souris et de clavier compatibles avec pyautogui. Il a été publié discrètement sur Hugging Face le 14 août 2026 — aux côtés du modèle frère 9B et du UI-Mate-democua-27B guidé par démonstrations — sans aucune annonce, et ses benchmarks sont jusqu'à présent entièrement rapportés par le fournisseur.

En quoi l'exécution guidée par démonstration diffère-t-elle de la relecture d'un script ?

Au lieu d'exécuter une macro enregistrée, UI-Mate traite une démonstration comme un workflow sous-titré et structuré en sous-tâches, injecté à titre d'orientation. La capture d'écran en direct reste la référence : lorsque la disposition, le contenu ou l'état de l'application diffère de ce qui a été montré, le modèle réélabore son plan plutôt que de rejouer des coordonnées obsolètes. C'est le mécanisme derrière le bond revendiqué de 17,2 à 35,4 en réussite stricte sur le sous-ensemble d'auto-démo — et ce n'est toujours qu'une affirmation du fournisseur tant que personne ne l'a reproduite.

UI-Mate-27B est-il vraiment l'état de l'art pour les agents GUI open-weight ?

Cela dépend entièrement de la {{1}}configuration d'évaluation{{/1}}. Son score {{2}}WindowsAgentArena 66.2{{/2}} dépasserait les meilleurs résultats WAA publiquement rapportés début 2026, mais son score {{3}}OSWorld-Verified 77.0{{/3}} se situe sous le modèle open-weight {{4}}Holo3-35B-A3B à 82.6{{/4}} au classement public. L'article le qualifie de {{5}}nouvel état de l'art open-weight{{/5}} ; une réexécution indépendante sur un banc d'essai cohérent est le seul moyen de le savoir.

Puis-je faire tourner UI-Mate-27B aujourd'hui ?

Oui, si vous l'hébergez vous-même : téléchargez les poids depuis Hugging Face — le checkpoint général 27B, le 9B, ou le UI-Mate-democua-27B guidé par démonstration — exécutez la commande vLLM de la fiche du modèle (taille de parallélisme tensoriel 2, six images par prompt), et pilotez-le avec l'agent Python ou l'application macOS. Il n'y a pas d'API hébergée, et aucun des checkpoints n'est encore sur OrcaRouter — ce qui, pour des modèles si récents et si peu vérifiés, est une raison valable de les conserver dans un environnement isolé pour l'instant.

La bonne lecture de UI-Mate-27B n'est pas « le gagnant », mais « à surveiller ». Un modèle ouvert de 27B revendiquant une avance WAA et livrant un flux de travail de démonstration en une seule prise est un point de données significatif dans une année où les agents d'utilisation d'ordinateur à poids ouverts sont passés d'une plaisanterie à toucher la frontière. Maintenant que le point de contrôle guidé par démonstration est un ensemble de poids publics plutôt qu'un espace réservé sur une page de projet, le flux de travail « montrez-le une fois » est quelque chose que l'on peut réellement exécuter. Tencent a déjà été prudent avec ses publications, et celle-ci a la forme d'un travail en cours rendu public. Exécutez-le dans un bac à sable, relancez les benchmarks et continuez à suivre les annonces : la partie intéressante de cette histoire est encore à venir.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube