Een hero-titelkaart voor UI-Mate-27B, Tencent's open-weight foundation GUI-agent, uitgebracht op 14 augustus 2026, met een desktopmonitor met een muiscursor en automatiseringspijlen, ondertitel 'Open-Weight Foundation GUI Agent', labelchips 'Apache-2.0', '27B params', 'vLLM ready', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Tencent UI-Mate-27B: De stille open-gewicht GUI-agent die een toppositie in WindowsAgentArena opeist

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 14 augustus 2026 heeft Tencent's HY Frontier Multimodal Agent Team drie checkpoints naar Hugging Face gepusht onder de organisatie tencent/ — UI-Mate-27B, een kleiner UI-Mate-9B, en het demonstratiegestuurde UI-Mate-democua-27B. Vier dagen later is er nog steeds nergens een aankondiging: geen lanceerbericht, geen persbericht, geen producttweet. Wat in plaats daarvan is uitgebracht, is ongewoon compleet voor een stille release: een projectpagina, een GitHub-repository met een werkende testopstelling, en een arXiv-paper die twee dagen geleden is ingediend en die het grotere model een nieuwe open-weight state of the art in desktop-GUI-bediening noemt.

Alles in dit stuk komt uit de modelkaarten, de GitHub-repo, de projectpagina en dat paper — niets ervan is onafhankelijk gereproduceerd. De checkpoints hebben op dit moment nul downloads op Hugging Face, wat betekent dat we waarschijnlijk tot de eersten buiten Tencent behoren die ze serieus op papier nemen. Hier is wat er daadwerkelijk te weten valt uit de repos, en wat onbevestigd blijft tot iemand anders het draait.

Inhoud

• Wat er is uitgekomen, en wat nog niet is aangekondigd

• Wat UI-Mate-27B eigenlijk is

• Het onderscheidende kenmerk: demonstratiegestuurde uitvoering

• De cijfers — allemaal door leveranciers gerapporteerd

• Waar die cijfers zouden staan — als ze standhouden

• Hoe je het uitvoert

• De stack rond een nieuwe GUI-agent

• Wat nu te kijken

• FAQ

Wat er is uitgebracht, en wat niet is aangekondigd

Tencent heeft UI-Mate-27B (27 miljard parameters, Apache-2.0, safetensors in BF16) gepubliceerd op 14 augustus 2026, samen met het 9B-zustermodel en de demonstratiegestuurde checkpoint UI-Mate-democua-27B. De twee 27B-checkpoints zijn gebaseerd op Qwen3.6-27B — zelf een Apache-2.0 multimodaal model dat in april 2026 is uitgebracht — wat betekent dat de hele stack, zowel de basis als de fine-tune, commercieel bruikbaar is. De repos hebben tijdstempels van de laatste wijziging van deze week — de demonstratiegestuurde checkpoint is nog vandaag aangepast — dus Tencent heeft er actief aan gewerkt.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

Wat is er tot nu toe openbaar:

• De gewichten van UI-Mate-27B, UI-Mate-9B en UI-Mate-democua-27B op Hugging Face, elk met een modelkaart, evaluatietabellen en een serveerrecept.

• Een projectpagina op ui-mate.github.io met een demovideo, een gebruikshandleiding en een macOS Apple Silicon-app (DMG v0.2.4).

• De GitHub-repository (github.com/Tencent/UI-Mate) met daarin de officiële prompt, response-parser en interactie-harness — de kaart vermeldt expliciet dat dit "een agent-checkpoint is in plaats van een op zichzelf staand visueel-chatmodel" en de harness wordt aanbevolen voor alles wat echt is.

• Een arXiv-preprint (2608.15930), ingediend op 16 augustus, getiteld "UI-Mate: Vooruitgang in open-weight foundation GUI-agenten met in-context demonstraties."

Wat nog niet openbaar is: Tencent zelf heeft niets gezegd — dit is een repo-first release, geen lancering. De demonstratiegestuurde variant die op de projectpagina stond vermeld als nog niet openbaar, heeft nu live gewichten op Hugging Face: de repo tencent/UI-Mate-democua-27B, gemaakt op dezelfde push van 14 augustus, is expliciet getagd als het demonstratiegestuurde checkpoint van de familie — een apart model, geen rebranding van de 27B. Er is nog steeds geen gehoste API ergens. Dat is belangrijk: de enige manier om UI-Mate vandaag te draaien is door de gewichten te downloaden en ze zelf te serveren.

Wat UI-Mate-27B eigenlijk is

UI-Mate-27B is een basis-GUI-agent voor "werk over lange termijn binnen applicaties en besturingssystemen." Het observeert live screenshots, redeneert over de zichtbare staat en genereert gestructureerde toetsenbord- en muisacties voor interactie met het native desktop. De training bestaat uit supervised fine-tuning, gevolgd door online reinforcement learning in uitvoerbare GUI-omgevingen — het model leerde door daadwerkelijk desktops te besturen, niet alleen op basis van statische screenshots.

De actieruimte is het onderdeel dat ontwikkelaars zal interesseren: muis, toetsenbord, scrollen, wachten, gebruikersinteractie en taakvoltooiing, met uitvoer die compatibel is met pyautogui. Het model redeneert in een genormaliseerde 1000×1000-coördinatenruimte en de referentieagent herschaalt zijn voorspellingen terug naar de echte screenshotresolutie, zodat acties verschillen in displayschaling tussen machines overleven. De eigen README van het model raadt aan om het te serveren met vLLM achter een OpenAI-compatibel endpoint.

Het kenmerk dat anders is: demonstratiegeleide uitvoering

De meeste GUI-agenten nemen één invoer: een instructie. UI-Mate neemt een tweede die echt zeldzaam is in een open checkpoint — een demonstratie. "Laat de workflow één keer zien. Laat de agent zich aanpassen aan de taak die voorhanden is," zoals de projectpagina het stelt.

Het mechanisme is geen video-in-context of een vast actiescript. Een demonstratie legt screenshots vast onmiddellijk vóór en na elke toetsenbord- of pointeractie, en de pipeline normaliseert vervolgens het spoor naar een consistente actie-en-frame-weergave, annoteert het met observaties, intentie, acties en verificatiebewijs, en segmenteert het in benoemde subtaken met voltooiingscriteria. Tijdens inferentie wordt dat een compacte workflow die wordt geïnjecteerd voor de actieve subtaak — maar de live screenshot blijft gedurende het hele proces gezaghebbend, dus wanneer de applicatiestatus afwijkt van de demonstratie, plant het model opnieuw in plaats van af te spelen.

Tencent heeft het checkpoint achter deze workflow tot een eigen openbaar model gemaakt: de UI-Mate-democua-27B-kaart paart instructie-alleen en één-demonstratieresultaten op dezelfde evals, en het toolschema voegt een subtask_complete-actie toe — het mechanisme achter die genoemde subtaken. Op de OSWorkerBench self-demo-subset tilt één demonstratie het strikte succes van 17,17 naar 35,35 en de voortgang van 67,85 naar 81,14; op de OSWorld-subset gaat de voortgang van 40,27 naar 65,75; op de GameDev-evalset gaat de gemiddelde score van 76,76 naar 81,15, terwijl de gemiddelde trajectlengte daalt van 303,6 naar 253,1 stappen — de demo verkort de taak naast dat hij die verbetert. De kaart meldt dat de demonstratie 28 van de 33 self-demo-taken verbeterde en vier taken oploste die zonder begeleiding nul scoren. De kanttekening is dezelfde die door dit hele artikel loopt: dit zijn de eigen gepaarde evals van het team, gemiddeld over drie tot vijf runs, en niemand heeft ze gereproduceerd.

De cijfers — allemaal door leveranciers gerapporteerd

Alleen instructie-uitvoering, rechtstreeks uit de modelkaart:

• OSWorld-Verified gemiddelde score — 77.0

• WindowsAgentArena gemiddelde score — 66.2

• OSWorkerBench strikt succes — 41.00

OSWorkerBench voortgang — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench is zelf een van de drie bijdragen aan het artikel: een nieuwe benchmark van 100 langdurige kantoortaken in 41 applicaties, met 33 self-demo- en 45 variant-demo-subsets. Het is een nieuwe evaluatie, dus er is geen eerder werk om die twee scores mee te vergelijken. Ten opzichte van het eigen basismodel zou UI-Mate-27B Qwen3.6-27B verslaan met 17,7 punten strikt succes en 24,5 punten vooruitgang op OSWorkerBench — wat de zuiverste appels-met-appels-vergelijking in de hele release is, aangezien beide modellen door dezelfde testomgeving zouden draaien.

Elk cijfer hierboven is de eigen evaluatie van het team. Er zijn nog geen onafhankelijke scores, geen herhalingen door derden, en met nul downloads ook geen reproducties door de gemeenschap. Beschouw elk getal hier als een bewering, niet als een feit.

Waar die cijfers zouden staan — als ze standhouden

WindowsAgentArena is degene die een echte headline zou zijn. De beste openbaar gerapporteerde WAA-resultaten eerder in 2026 schommelden rond de 61,0 (een modulair systeem genaamd VLAA-GUI, april 2026); de open-gewicht EvoCUA-32B van Meituan stond op 56,5, en de gesloten UI-TARS-2 van ByteDance zat in de lage tot midden 50 op dezelfde ranglijst. Een 66,2 op UI-Mate-27B's eigen eval zou het boven alles plaatsen wat dit jaar op deze benchmark is gerapporteerd — open of gesloten. Dat is een sterke claim, en die heeft een onafhankelijke herrun nodig.

OSWorld-Verified op 77,0 is sterk, maar geen nieuw open-gewichtenrecord op het openbare leaderboard. Op de OSWorld-Verified leaderboard-snapshot van begin augustus 2026 staat het open-gewichtenmodel Holo3-35B-A3B op 82,6, met verschillende frontier-gesloten modellen erboven (Qwen3.8 Max op 86,1, Claude Mythos 5 en Claude Fable 5 op 85,0, Claude Opus 4.8 op 83,4). De bewoording 'state of the art' in het paper is daarom een claim over de eigen evaluatie-opzet, geen vaststaand feit — verschillende harnesses, actieparsers en zelfrapportage-drift maken van 77,0 versus 82,6 een vraag die alleen een onafhankelijke herrun kan beantwoorden. Ter context over wat een 27B open model dat 77,0 haalt betekent: het zou boven de ~72,4 human-expert-baseline liggen en boven verschillende grotere frontier-systemen op datzelfde leaderboard, waaronder Claude Opus 4.6 op 72,7 en Kimi K2.6 op 73,1.

Tencent is geen nieuwkomer op dit gebied — het leverde in februari 2026 POINTS-GUI-G, een 8B GUI-grounding-model, lanceerde in mei de Marvis OS-assistent en droeg in juni bij aan het GUICrafter-project voor computergebruik. UI-Mate is een aparte productlijn die specifiek gericht is op volledige desktopbediening, en het is de eerste van Tencent's GUI-agents die wordt uitgebracht als een open basismodel in plaats van als een groundingcomponent of een product.

Hoe het uit te voeren

Het model is ontworpen voor vLLM, en de modelkaart geeft het exacte commando — vllm serve tencent/UI-Mate-27B met tensor-parallel size 2 en de OpenAI-compatibele chat-sjabloon. Een praktisch detail valt op: de agent behoudt standaard vijf schermafbeeldingen in de context, dus de server moet ten minste zes afbeeldingen per prompt toestaan, omdat de nieuwste schermafbeelding arriveert voordat de oudste wordt samengevouwen. De aanbevolen vlag is --limit-mm-per-prompt met zes afbeeldingen en nul video. De demonstratiegeleide checkpoint werkt op dezelfde manier — de kaart noemt vLLM en SGLang achter een OpenAI-compatibel endpoint.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

Zodra deze actief is, neemt een Python-agentklasse (UIMateAgent) een screenshot en een instructie en retourneert de respons plus gestructureerde acties, waarbij de 1000×1000-coördinaten worden teruggeschaald naar jouw resolutie. De projectpagina biedt ook een macOS Apple Silicon-app voor de demonstratiegestuurde modus, wat de eenvoudigste manier is om de "show it once"-workflow uit te proberen zonder zelf de testopstelling te hoeven bouwen. De licentiëring is overal Apache-2.0, dus lokaal gebruik, fine-tuning en commerciële integratie zijn allemaal toegestaan.

Twee waarschuwingen horen bij elke "hoe je het moet uitvoeren" voor een computer-use agent, en beide komen uit de modelkaart zelf. Gebruik geïsoleerde of wegwerpbare omgevingen. Vereis menselijke bevestiging vóór iets gevoeligs, monitor het traject, en behandel een door het model gerapporteerd succes niet als bewijs dat het beoogde resultaat daadwerkelijk is bereikt. GUI-agenten misklikken, en promptinjectie via inhoud op het scherm is een reëel dreigingsmodel, geen hypothese.

De stack rond een nieuwe GUI-agent

Geen van de UI-Mate-checkpoints staat al op OrcaRouter — de familie is een paar dagen oud met nul downloads, en het basismodel Qwen3.6-27B ook niet. Er is geen gehoste API, dus als je er deze week een wilt draaien, serveer je vLLM zelf. Dat is prima voor een lab, maar het is de verkeerde vorm voor productie.

Een productie-pijplijn voor computergebruik is zelden één checkpoint. Het is een plannermodel dat de volgende intentie bepaalt, een grounding- of visionmodel dat het scherm leest, de GUI-agent zelf, en een goedkope fallback wanneer een substap faalt — en die onderdelen zijn allemaal geserveerde modellen, zelfs wanneer de GUI-agent lokaal draait. Die mix is precies waar een routinglaag voor dient: één API voor 200+ gehoste modellen, de listprijs van de provider doorberekend met 0% opslag, en automatische failover zodat een tijdelijke uitval bij één provider een lange agentrun niet laat stagneren. De routing-DSL stelt je ook in staat om meerdere modellen in één enkele aanroep te combineren — een planner vooraf, een goedkope verificateur aan het einde — zonder providers in je eigen code aan elkaar te rijgen. De eerlijke samenvatting is eenvoudig: de agent die de desktop aanstuurt is lokaal, maar de modellen die bepalen wat eromheen gebeurt zijn routeerbaar, en het veilig uitproberen van gloednieuwe onbewezen checkpoints is precies waar failover voor dient.

Wat nu te kijken

Vier dingen zouden het beeld voor UI-Mate-27B veranderen, in ruwe volgorde van belangrijkheid:

• Een onafhankelijke heruitvoering van OSWorld-Verified en WindowsAgentArena. Met name het WAA-cijfer is ofwel een groot probleem ofwel een artefact van de testopstelling, en alleen een externe evaluatie beslist welke.

• Het formele technische rapport. De huidige verwijzing is een tijdelijke aanduiding, en het volledige artikel zal naar verwachting de details van de data-engine onthullen die de samenvatting slechts schetst.

• Tencent's eigen aankondiging. Zo'n repo-first-drop gaat meestal aan iets vooraf — een Marvis-integratie, een gehoste aanbieding of een bredere open-model-push.

• Een gehoste API. De gewichten van alle drie de checkpoints zijn nu openbaar, maar er wordt nergens iets aangeboden — geen Tencent-endpoint, geen externe inferentieprovider — dus self-hosting blijft de enige optie, en alleen een aankondiging van Tencent of een provider die het oppikt verandert dat.

Veelgestelde vragen

Wat is Tencent UI-Mate-27B?

UI-Mate-27B is een foundation-GUI-agent met een Apache-2.0-licentie en 27 miljard parameters van Tencent's HY Frontier Multimodal Agent Team, verfijnd op basis van Qwen3.6-27B. Het bekijkt live desktopscreenshots, redeneert erover en produceert pyautogui-compatibele muis- en toetsenbordacties. Het werd op 14 augustus 2026 geruisloos uitgebracht op Hugging Face — naast het 9B-zusje en de demonstratiegestuurde UI-Mate-democua-27B — zonder aankondiging, en de benchmarks zijn tot nu toe volledig door de leverancier gerapporteerd.

Hoe verschilt demonstratiegeleide uitvoering van het afspelen van een script?

In plaats van een opgenomen macro uit te voeren, behandelt UI-Mate een demonstratie als een met bijschriften gedocumenteerde, in subtaken gestructureerde workflow die als begeleiding wordt ingebracht. De live-screenshot blijft leidend, dus wanneer de lay-out, inhoud of status van de app afwijkt van wat werd getoond, plant het model opnieuw in plaats van verouderde coördinaten af te spelen. Dat is het mechanisme achter de geclaimde sprong van 17,2 naar 35,4 bij strict succes op de self-demo-subset — en het blijft een leveranciersclaim totdat iemand het reproduceert.

Is UI-Mate-27B echt state-of-the-art voor open-weight GUI-agents?

Dat hangt volledig af van de opzet van de evaluatie. Een score van 66,2 op WindowsAgentArena zou de beste openbaar gerapporteerde WAA-resultaten van eerder in 2026 overtreffen, maar de 77,0 op OSWorld-Verified staat op de openbare ranglijst lager dan de open-weight Holo3-35B-A3B met 82,6. Het paper noemt het een nieuwe open-weight state of the art; een onafhankelijke heruitvoering op een consistente testopstelling is de enige manier om het zeker te weten.

Kan ik UI-Mate-27B vandaag draaien?

Ja, als je het zelf serveert: download de gewichten van Hugging Face — de 27B algemene checkpoint, de 9B, of de demonstratiegestuurde UI-Mate-democua-27B — voer het vLLM-commando uit van de modelkaart (tensor-parallelle grootte 2, zes afbeeldingen per prompt), en gebruik het met de Python-agent of de macOS-app. Er is geen gehoste API, en geen van de checkpoints staat al op OrcaRouter — wat, voor modellen die zo nieuw en zo ongeverifieerd zijn, een redelijke reden is om ze voorlopig in een geïsoleerde omgeving te houden.

De juiste duiding van UI-Mate-27B is niet "de winnaar" maar "het bekijken waard". Een open 27B-model dat een WAA-voorsprong claimt en een one-shot demonstratieworkflow uitbrengt, is een betekenisvol datapunt in een jaar waarin open-weight computer-use agenten zijn gegaan van een grap tot iets dat binnen handbereik van de frontier ligt. Nu de demonstratiegeleide checkpoint publieke gewichten bevat in plaats van een placeholder op de projectpagina, is de "show it once"-workflow iets dat je daadwerkelijk kunt draaien. Tencent is eerder voorzichtig geweest met releases, en deze heeft de vorm van een openbaar gemaakt werk-in-uitvoering. Draai het in een sandbox, draai de benchmarks opnieuw en blijf de aankondigingen volgen — het interessante deel van dit verhaal ligt nog in het verschiet.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube