
InternLumina-U2 vs Tencent UI-Mate-27B : l'agent de bureau que vous pouvez exécuter dès maintenant contre le modèle de vision unifié que vous ne pouvez que lire
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Tencent UI-Mate-27B et InternLumina-U2 sont deux modèles sous licence Apache-2.0 publiés en toute discrétion par des laboratoires chinois, à deux semaines d'intervalle. Ils ne sont pas concurrents — et c'est précisément pour cela qu'ils méritent d'être comparés. Tencent UI-Mate-27B, diffusé à poids ouverts le 14 août 2026, est un agent de bureau : il observe l'écran et émet des actions de souris et de clavier. InternLumina-U2, publié sous forme de code d'inférence le 1er septembre 2026 par le Shanghai AI Laboratory, se veut un modèle de vision unifié : il prétend lire les images, les vidéos et la 3D, et générer et modifier des images. L'un agit sur ce qu'il voit ; l'autre, lorsque ses poids existeront enfin, parlera de ce qu'il voit et le dessinera. Si votre travail consiste à utiliser un ordinateur de bureau, un seul de ces deux peut le faire aujourd'hui — et ce n'est pas celui qui a l'architecture la plus sophistiquée.
L'agent qui agit : Tencent UI-Mate-27B
UI-Mate-27B est un agent GUI de fondation open-weight à 27 milliards de paramètres, développé par l'équipe d'agents multimodaux HY Frontier de Tencent, affiné à partir de Qwen3.6-27B. Il observe des captures d'écran en direct, raisonne sur l'état actuel de l'écran et produit des actions structurées de clavier et de souris dans un espace de coordonnées normalisé — le fruit d'un modèle entraîné à opérer un véritable bureau, et non à en discuter. Sa caractéristique distinctive est l'exécution guidée par démonstration : montrez-lui un flux de travail une seule fois et il adapte la démonstration enregistrée à la tâche en cours, en considérant la capture d'écran en direct comme faisant autorité lorsque l'interface diffère de ce qui a été enregistré. Les scores phares rapportés par Tencent sont OSWorld-Verified 77,0 et WindowsAgentArena 66,2 — des chiffres qui domineraient ces classements 2026 s'ils étaient reproduits de manière indépendante — complétés par un ensemble de résultats OSWorkerBench. Les poids sont bien réels et téléchargeables : douze fragments safetensors sur Hugging Face, auto-hébergeables via vLLM ou SGLang sur quelques GPU, et la fiche du modèle comporte un avertissement important : il s'agit d'un checkpoint d'agent plutôt que d'un modèle autonome de vision-dialogue — lui demander de « décrire cette image », c'est l'utiliser à mauvais escient.
Les yeux qui sont promis : InternLumina-U2
InternLumina-U2 est une espèce entièrement différente. C'est un modèle de diffusion à mélange d'experts épars de 16 milliards de paramètres (1 milliard actif) que le laboratoire envisage comme un modèle unique pour la compréhension omni-visuelle, la génération d'images et l'édition d'images — une conception entièrement discrète à huit codebooks où un seul backbone lit à la fois une image, un graphique, une vidéo ou un actif 3D et écrit de nouveaux pixels. Si votre modèle mental est un agent GUI, InternLumina-U2 est le pôle opposé : il ne veut rien cliquer, il veut tout comprendre et dessiner sur demande. Sa forme publiée le 1er septembre 2026 est un code d'inférence et une architecture — six points d'entrée de tâches dans un dépôt GitHub, une page de projet avec un tableau de référence préliminaire, un stub Hugging Face vide — et ses poids, son code d'entraînement et son rapport technique sont tous encore marqués « bientôt disponible ». Personne ne peut l'exécuter. L'écart entre les deux modèles n'est pas une question de qualité ; c'est une question d'existence.
Le tableau d'affichage
Les chiffres d'UI-Mate-27B proviennent de Tencent et n'ont pas été reproduits ; ceux d'InternLumina-U2 proviennent de laboratoire, sont préliminaires et partiels. Chaque ligne indique sa provenance.
• Poste — Tencent UI-Mate-27B : piloter un bureau — lire des captures d'écran en direct, émettre des actions de souris et de clavier. InternLumina-U2 : percevoir et créer — comprendre les images/vidéos/3D, générer et modifier des images.
• Poids — Tencent UI-Mate-27B : public depuis le 14 août 2026, douze shards safetensors, Apache-2.0. InternLumina-U2 : non public — dépôt Hugging Face vide, poids « bientôt disponibles ».
• Échelle — 27B dense, affiné à partir de Qwen3.6-27B, vs 16B total / 1B actif pour un modèle de diffusion MoE épars.
• Sortie — Tencent UI-Mate-27B : actions structurées compatibles pyautogui dans un espace de coordonnées normalisé. InternLumina-U2 : revendique la prise en charge du texte, la génération texte-image jusqu’à 1024×1024 et l’édition d’images basée sur des instructions.
• Chiffres clés — Tencent UI-Mate-27B : OSWorld-Verified 77,0, WindowsAgentArena 66,2, gains sur OSWorkerBench grâce aux démonstrations (tous rapportés par Tencent). InternLumina-U2 : ChartQA 86,52, GenEval 0,81, MathVision 33,22 (rapportés par le laboratoire, préliminaires).
• Mise en garde sur la provenance — Tencent UI-Mate-27B : la fiche elle-même avertit qu’il s’agit d’un checkpoint d’agent, et non d’un modèle de chat visuel autonome. InternLumina-U2 : la page du projet qualifie ses propres résultats de « préliminaires et partiels ».
• Réalité du service — Tencent UI-Mate-27B : auto-hébergement via vLLM ou SGLang sur ~2 GPU ; aucun fournisseur d'inférence hébergée ne le déploie actuellement. InternLumina-U2 : personne ne peut le servir — le pilote publié attend des checkpoints qui ne sont pas dans le dépôt.

Deux saveurs différentes de non prouvé
Les deux modèles sont non éprouvés, mais le mot n'a pas le même sens dans les deux cas. Tencent UI-Mate-27B est non éprouvé au sens ordinaire d'un nouveau modèle : ses scores mis en avant sont ceux du fournisseur lui-même, personne ne les a réexécutés de manière indépendante, et son nombre de téléchargements est dérisoire face aux affirmations — la posture habituelle d'un checkpoint qui, à première vue, n'avait que quatre jours et qui a depuis rassemblé une modeste communauté. Mais cette absence de preuve est testable. Comme les poids existent, les 66,2 et 77,0 peuvent être vérifiés cette semaine par quiconque dispose de deux GPU et d'un environnement de test Windows, et les affirmations appuyées sur des démonstrations peuvent être reproduites ou réfutées sur des workflows réels. InternLumina-U2 est non éprouvé en un sens plus strict : il est impossible à tester. Son architecture est publique et lisible, mais ses chiffres ne sont pas divulgués — aucun artefact ne peut les confirmer, et le tableau partiel publié par le laboratoire montre déjà qu'il est distancé par un concurrent nommé sur au moins un benchmark de génération. Un chiffre du fournisseur associé à un fichier téléchargeable est une affirmation qui attend un évaluateur. Un chiffre du fournisseur associé à une feuille de route est un espoir.

La carte Hugging Face de tencent/UI-Mate-27B, capturée le 27 août 2026 — la base Qwen3.6-27B, les scores OSWorld et WindowsAgentArena rapportés par le fournisseur, et la mention qu'aucun fournisseur d'inférence ne le déploie actuellement.
La division naturelle du travail : un acteur et ses yeux
Mis côte à côte, les deux modèles esquissent les contours d'un pipeline d'automatisation fiable. Le vrai problème des agents GUI n'est pas le cas moyen : c'est l'agent qui, en silence, fait la mauvaise action sur un état d'écran inattendu, sans que personne ne le remarque. C'est exactement la tâche pour laquelle un modèle de vision peu coûteux et fiable existe : vérifier l'état de l'écran avant et après chaque action, confirmer que la boîte de dialogue apparue est bien celle que l'agent pense avoir vu apparaître, et interrompre la boucle lorsque la réalité et la représentation que l'agent s'en fait divergent. Tencent UI-Mate-27B est l'acteur ; un modèle de vision unifié de la nature de celui qu'InternLumina-U2 prétend être est le vérificateur naturel, capable de lire les mêmes captures d'écran sur lesquelles l'agent agit. Lorsque — et seulement lorsque — les poids d'InternLumina-U2 seront effectivement publiés et que ses allégations de compréhension résisteront à des tests indépendants, c'est le rôle qu'il pourrait remplir aux côtés d'un agent plutôt que contre lui. Les deux ne sont pas des rivaux pour un même poste ; ils sont les deux moitiés d'une même fonction.

Le dépôt GitHub InternLM/InternLumina-U2, capturé le 2 septembre 2026 — la page d’accueil du dépôt montrant les scripts d’inférence par tâche, y compris le point d’entrée de compréhension d’image à partir duquel un vérificateur d’état d’écran serait construit ; les poids qui le rendraient exécutable ne sont pas dans l’arborescence.
Ce que fait une couche de routage pour une pile agent-plus-yeux.
Aucun des deux modèles n'est hébergé sur OrcaRouter, et nous ne laisserons pas entendre le contraire — Tencent UI-Mate-27B ne dispose d'aucun fournisseur d'hébergement où que ce soit, et InternLumina-U2 n'a pas de poids qu'un quelconque fournisseur pourrait héberger. Le modèle de routage qui s'applique est celui qui correspond exactement à cette architecture : un agent qui agit et un modèle de vision qui vérifie, composés de sorte que l'étape coûteuse ou risquée soit conditionnée par l'étape peu coûteuse et fiable. Le DSL de routage exprime cela comme un seul appel logique — agir, puis vérifier, puis poursuivre ou s'arrêter — au lieu d'un assemblage sur mesure entre deux fournisseurs de modèles, et le basculement automatique couvre le mode de défaillance réaliste : un agent GUI comme UI-Mate-27B est exactement le type de point de contrôle non éprouvé que l'on auditionne d'abord sur un parcours de test, l'appel retombant sur un modèle éprouvé dès que le nouveau se comporte mal. Une seule API sur plus de 200 modèles hébergés, le prix catalogue du fournisseur répercuté avec 0 % de marge, et les éléments non éprouvés de la pile maintenus derrière des garde-fous le temps de gagner votre confiance.
En résumé
Si vous construisez quelque chose qui agit sur un bureau, Tencent UI-Mate-27B est le seul des deux qui soit réellement utilisable — il tourne dès aujourd'hui sur vos propres GPU, avec des scores impressionnants mais non reproduits que vous pouvez concrètement aller tester. Si vous construisez quelque chose qui exige d'un modèle qu'il comprenne et dessine ce qu'il voit, InternLumina-U2 est une architecture prometteuse qui attend encore ses poids — bonne à lire dès maintenant, mais sans valeur comme dépendance tant que les safetensors ne sont pas sortis. Suivez les deux jusqu'au jour où la division du travail deviendra possible : un acteur sur votre bureau, un ensemble d'yeux vérifiés qui le surveille, et une couche de routage qui s'assure qu'ils restent honnêtes.
