Een hero-titelkaart voor de vergelijking 'InternLumina-U2 vs Tencent UI-Mate-27B' met de ondertitel 'De desktop-agent die je nu kunt draaien versus het vision-model dat je alleen kunt lezen' en drie stat-chips — 'UI-Mate-27B: bedient vandaag een desktop', 'InternLumina-U2: uniforme visie, geen gewichten', 'Beide Apache-2.0, beide onbewezen' — met het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

InternLumina-U2 vs Tencent UI-Mate-27B: de desktopagent die je nu kunt draaien versus het geünificeerde vision-model dat je alleen kunt lezen

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Tencent UI-Mate-27B en InternLumina-U2 zijn twee stille Apache-2.0-releases van Chinese laboratoria, met twee weken verschil gepubliceerd, en ze zijn geen concurrenten — precies daarom zijn ze het vergelijken waard. Tencent UI-Mate-27B, op 14 augustus 2026 uitgebracht met open gewichten, is een desktopagent: het houdt het scherm in de gaten en genereert muis- en toetsenbordacties. InternLumina-U2, op 1 september 2026 door Shanghai AI Laboratory gepubliceerd als inferentiecode, is een beoogd uniform visiemodel: het beweert afbeeldingen, video en 3D te kunnen lezen en afbeeldingen te genereren en bewerken. De ene handelt naar wat het ziet; de andere zal, wanneer de gewichten er uiteindelijk zijn, praten en tekenen over wat het ziet. Als je taak is om een desktop te bedienen, kan slechts één van deze twee dat vandaag doen — en dat is niet degene met de fraaiere architectuur.

De agent die handelt: Tencent UI-Mate-27B

UI-Mate-27B is een GUI-agent met open gewichten en 27 miljard parameters, afkomstig van Tencent's HY Frontier multimodale agentteam en verfijnd op basis van Qwen3.6-27B. Het observeert live screenshots, redeneert over de huidige schermstatus en genereert gestructureerde toetsenbord- en muisacties in een genormaliseerde coördinatenruimte — het product van een model dat is getraind om een echte desktop te bedienen, niet om erover te chatten. Het onderscheidende kenmerk is demonstratiegestuurde uitvoering: laat het één keer een workflow zien en het past de opgenomen demonstratie aan de taak in kwestie aan, waarbij de live-screenshot als gezaghebbend wordt beschouwd wanneer de interface afwijkt van wat is opgenomen. De door Tencent gerapporteerde hoofdresultaten zijn OSWorld-Verified 77.0 en WindowsAgentArena 66.2 — cijfers die die 2026-ranglijsten zouden aanvoeren als ze onafhankelijk zouden worden gereproduceerd — naast een reeks OSWorkerBench-scores. De gewichten zijn echt en downloadbaar: twaalf safetensors-shards op Hugging Face, zelf te hosten via vLLM of SGLang op een paar GPU's, en de modelkaart bevat een belangrijke kanttekening dat het een agent-checkpoint is en geen op zichzelf staand visueel-chatmodel — wijs het op 'beschrijf deze afbeelding' en je gebruikt het verkeerd.

De beloofde ogen: InternLumina-U2

InternLumina-U2 is een heel ander soort beest. Het is een 16B-parameter schaars mixture-of-experts diffusiemodel (1B actief) dat het lab bedoelt als één model voor allesomvattend visueel begrip, beeldgeneratie en beeldbewerking — een volledig discreet ontwerp met acht codeboeken waarin één enkele backbone zowel een afbeelding, grafiek, video of 3D-asset leest als nieuwe pixels schrijft. Als jouw mentale model een GUI-agent is, dan is InternLumina-U2 de tegenpool: het wil niets aanklikken, het wil alles begrijpen en op verzoek tekenen. De gepubliceerde vorm op 1 september 2026 is inferentiecode en een architectuur — zes taaktoegangspunten in een GitHub-repository, een projectpagina met een voorlopige benchmarktabel, een lege Hugging Face-stub — en de gewichten, trainingscode en het technisch rapport staan allemaal nog gemarkeerd als 'binnenkort'. Niemand kan het draaien. Het verschil tussen de twee modellen is geen kwaliteit; het is bestaan.

Het scorebord

UI-Mate-27B's cijfers zijn door Tencent gerapporteerd en niet gereproduceerd; InternLumina-U2's zijn laboratoriumgerapporteerd, voorlopig en gedeeltelijk. Elke rij draagt zijn herkomst.

• Taak — Tencent UI-Mate-27B: een desktop bedienen — live schermafbeeldingen lezen, muis- en toetsenbordacties uitsturen. InternLumina-U2: waarnemen en creëren — afbeeldingen/video/3D begrijpen, afbeeldingen genereren en bewerken.

• Gewichten — Tencent UI-Mate-27B: openbaar sinds 14 augustus 2026, twaalf safetensors-shards, Apache-2.0. InternLumina-U2: niet openbaar — lege Hugging Face-repo, gewichten "binnenkort beschikbaar."

• Schaal — 27B dicht, fijngetuned vanuit Qwen3.6-27B versus 16B totaal / 1B actief sparse MoE-diffusiemodel.

• Output — Tencent UI-Mate-27B: gestructureerde pyautogui-compatibele acties in een genormaliseerde coördinatenruimte. InternLumina-U2: claimt tekst, tekst-naar-afbeelding tot 1024×1024, en instructiegebaseerde beeldbewerking.

• Hoofdcijfers — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench-winst door demonstraties (alle door Tencent gerapporteerd). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (door het lab gerapporteerd, voorlopig).

• Voorbehoud bij herkomst — Tencent UI-Mate-27B: de kaart zelf waarschuwt dat het om een agent-checkpoint gaat, niet om een zelfstandig visueel-chatmodel. InternLumina-U2: de projectpagina bestempelt zijn eigen resultaten als "voorlopig, onvolledig."

• Realiteit van het aanbieden — Tencent UI-Mate-27B: zelf te hosten via vLLM of SGLang op ~2 GPU's; geen gehoste inferentieprovider draait het momenteel. InternLumina-U2: door niemand te serveren — de uitgebrachte driver verwacht checkpoints die niet in de repository staan.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Twee verschillende smaken van het onbewezene.

Beide modellen zijn onbewezen, en het woord betekent niet twee keer hetzelfde. Tencent UI-Mate-27B is onbewezen op de gebruikelijke manier voor een nieuw model: zijn belangrijkste cijfers komen van de leverancier zelf, niemand heeft ze onafhankelijk herhaald, en het aantal downloads is minuscuul vergeleken met de claims — het gebruikelijke beeld bij een checkpoint dat er op het eerste gezicht vier dagen oud uitzag en sindsdien een bescheiden community heeft opgebouwd. Maar het is onbewezen op een toetsbare manier. Omdat de gewichten bestaan, kunnen de 66,2 en de 77,0 deze week door iedereen met twee gpu's en een Windows-testomgeving worden gecontroleerd, en kunnen de met demonstraties onderbouwde claims op echte workflows worden gereproduceerd of weerlegd. InternLumina-U2 is in strengere zin onbewezen: het is niet toetsbaar. De architectuur is openbaar en leesbaar, de cijfers niet — er is geen artefact dat ze kan bevestigen, en de eigen partiële tabel van het lab laat al zien dat het op ten minste één generatiebenchmark achterblijft bij een met naam genoemde concurrent. Een leverancierscijfer dat aan een downloadbaar bestand is gekoppeld, is een claim die wacht op een beoordelaar. Een leverancierscijfer dat aan een roadmap is gekoppeld, is hoop.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

De Hugging Face-modelkaart van {{1}}tencent/UI-Mate-27B{{/1}}, vastgelegd op {{2}}27 augustus 2026{{/2}} — het {{3}}Qwen3.6-27B-basismodel{{/3}}, de door de leverancier gerapporteerde {{4}}OSWorld- en WindowsAgentArena-scores{{/4}}, en de vermelding dat {{5}}momenteel geen enkele inferentieprovider het model implementeert{{/5}}.

De natuurlijke taakverdeling: een actor en zijn ogen

Naast elkaar geplaatst schetsen de twee modellen de vorm van een betrouwbare automatiseringspijplijn. Het lastige probleem met GUI-agents is niet het gemiddelde geval; het is de agent die stilletjes het verkeerde doet bij een onverwachte schermstatus en niemand die het merkt. Dat is precies waarvoor een goedkoop, betrouwbaar visionmodel bestaat: de schermstatus vóór en na elke actie verifiëren, bevestigen dat het dialoogvenster dat verschijnt het dialoogvenster is waarvan de agent denkt dat het verscheen, en de lus stoppen wanneer de werkelijkheid en het model van de werkelijkheid van de agent uiteenlopen. Tencent UI-Mate-27B is de actor; een verenigd visionmodel van het soort waar InternLumina-U2 beweert er een te zijn, is de natuurlijke verificateur, die dezelfde schermafbeeldingen kan lezen waarop de agent handelt. Wanneer — en alleen wanneer — de gewichten van InternLumina-U2 daadwerkelijk beschikbaar komen en de beweringen over het begripsvermogen onafhankelijke tests doorstaan, is dat de rol die het naast een agent zou kunnen vervullen in plaats van ertegenover. De twee zijn geen concurrenten voor één baan; ze zijn de twee helften van één baan.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

De GitHub-repository InternLM/InternLumina-U2, vastgelegd op 2 september 2026 — de landingspagina van de repository toont de inferentiescripts per taak, waaronder het startpunt voor beeldbegrip op basis waarvan een schermstatusverificator zou worden gebouwd; de gewichten die nodig zijn om deze uitvoerbaar te maken, bevinden zich niet in de boom.

Wat een routinglaag doet voor een agent-plus-ogen-stack

Geen van beide modellen wordt gehost op OrcaRouter, en we zullen niet het tegendeel suggereren — Tencent UI-Mate-27B wordt door geen enkele provider gehost, en InternLumina-U2 heeft geen gewichten beschikbaar voor welke provider dan ook om te hosten. Het routeringspatroon dat van toepassing is, is dat voor precies deze architectuur: een agent die acties uitvoert en een visionmodel dat verifieert, zo samengesteld dat de dure of risicovolle stap pas wordt uitgevoerd nadat de goedkope, betrouwbare stap is geslaagd. De routerings-DSL drukt dat uit als één enkele logische aanroep — handel, verifieer, ga dan verder of stop — in plaats van maatwerklijm tussen twee modelproviders, en automatische failover dekt de realistische faalmodus af: een GUI-agent zoals UI-Mate-27B is precies het soort onbewezen checkpoint dat u eerst op een testpad uitprobeert, waarbij de aanroep terugvalt op een bewezen model op het moment dat het nieuwe model zich misdraagt. Eén API voor meer dan 200 gehoste modellen, de lijstprijs van de provider wordt zonder opslag doorberekend, en de onbewezen onderdelen van de stack blijven achter veiligheidsrails terwijl ze uw vertrouwen verdienen.

De bottom line

Als je iets bouwt dat een desktop bedient, is Tencent UI-Mate-27B de enige van deze twee die in bruikbare zin bestaat — vandaag al draaibaar op je eigen GPU's, met indrukwekkende maar niet gereproduceerde scores die je daadwerkelijk kunt gaan testen. Als je iets bouwt dat een model nodig heeft om te begrijpen en te tekenen wat het ziet, is InternLumina-U2 een veelbelovende architectuur die op zijn gewichten wacht — de moeite waard om nu te lezen, niets waard als afhankelijkheid totdat de safetensors verschijnen. Houd deze twee in de gaten tot de dag waarop de taakverdeling mogelijk wordt: een actor op je desktop, een set geverifieerde ogen die erop toeziet, en een routeringslaag die ze eerlijk houdt.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube