
Tencent UI-Mate-27B: Den tysta open-weight GUI-agenten som tar en topplats i WindowsAgentArena
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
Den 14 augusti 2026 skickade Tencents HY Frontier Multimodal Agent Team tre checkpoints till Hugging Face under organisationen tencent/ – UI-Mate-27B, en mindre UI-Mate-9B och den demonstrationsguidade UI-Mate-democua-27B. Fyra dagar senare finns fortfarande inget tillkännagivande någonstans: inget lanseringsinlägg, inget pressmeddelande, ingen produkt-tweet. Det som istället släpptes är ovanligt komplett för en tyst lansering: en projektsida, ett GitHub-repository med en fungerande testmiljö och en arXiv-artikel som skickades in för två dagar sedan och som kallar den större modellen för en ny state of the art med öppna vikter inom styrning av skrivbordsgränssnitt.
Allt i den här texten kommer från modellkorten, GitHub-repot, projektsidan och den där uppsatsen — inget av det har oberoende reproducerats ännu. Checkpoints har noll nedladdningar på Hugging Face när detta skrivs, vilket innebär att vi sannolikt är bland de första utanför Tencent som tar dem på allvar på papper. Här är vad som faktiskt går att veta från repona, och vad som förblir obekräftat tills någon annan kör det.
Innehåll
• Vad som släppts, och vad som inte har tillkännagivits
• Vad UI-Mate-27B faktiskt är
• Funktionen som är annorlunda: demonstrationsstyrd exekvering
• Siffrorna — alla leverantörsrapporterade
• Var dessa siffror skulle sitta — om de håller
• Så här kör du det
• Stacken kring en ny GUI-agent
• Vad du ska titta på härnäst
• Vanliga frågor
Vad som levererades, och vad som inte har tillkännagivits
Tencent publicerade UI-Mate-27B (27 miljarder parametrar, Apache-2.0, safetensors i BF16) den 14 augusti 2026, tillsammans med syskonmodellen 9B och den demo-guidade checkpointen UI-Mate-democua-27B. De två 27B-checkpointarna är byggda på Qwen3.6-27B – i sig en multimodal Apache-2.0-modell som släpptes i april 2026 – vilket innebär att hela stacken, bas och finjusterad, är kommersiellt användbar. Repositoryerna har tidsstämplar för senaste ändring från den här veckan – den demo-guidade checkpointen ändrades så sent som idag – så Tencent har aktivt arbetat med dem.

Vad är offentligt hittills:
• Vikterna för UI-Mate-27B, UI-Mate-9B och UI-Mate-democua-27B på Hugging Face, var och en med en modellkort, utvärderingstabeller och ett serveringsrecept.
• En projektsida på ui-mate.github.io med en demovideo, en användarguide och en macOS Apple Silicon-app (DMG v0.2.4).
• GitHub-repositoriet (github.com/Tencent/UI-Mate) som innehåller den officiella prompten, svarsparsern och interaktionsramverket — kortet anger tydligt att detta är "en agentkontrollpunkt snarare än en fristående visuell chattmodell" och att ramverket rekommenderas för allt som är på riktigt.
• En arXiv-preprint (2608.15930), inlämnad den 16 augusti, med titeln "UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations."
Det som ännu inte är offentligt: Tencent själv har inte sagt något — detta är ett repo-först-släpp, inte en lansering. Den demonstrationsstyrda varianten som projektsidan hade listat som ännu inte offentlig har nu live-vikter på Hugging Face: repot tencent/UI-Mate-democua-27B, skapat i samma push den 14 augusti, är uttryckligen taggat som familjens demonstrationsstyrda checkpoint — en distinkt modell, inte en omprofilering av 27B. Det finns fortfarande inget värdbaserat API någonstans. Det spelar roll: det enda sättet att köra UI-Mate idag är att ladda ner vikterna och servera dem själv.
Vad UI-Mate-27B faktiskt är
UI-Mate-27B är en grundläggande GUI-agent för "långsiktigt arbete över applikationer och operativsystem." Den observerar live-skärmbilder, resonerar kring det synliga tillståndet och genererar strukturerade tangentbords- och musåtgärder för inbyggd skrivbordsinteraktion. Träningen består av övervakad finjustering följt av online-förstärkningsinlärning i körbara GUI-miljöer — modellen lärde sig genom att faktiskt driva skrivbord, inte från statiska skärmbilder enbart.
Handlingsutrymmet är den del som utvecklare kommer att bry sig om: mus, tangentbord, rullning, väntan, användarinteraktion och slutförande av uppgifter, med utdata som är kompatibla med pyautogui. Modellen resonerar i ett normaliserat 1000×1000-koordinatutrymme och referensagenten skalar om sina förutsägelser tillbaka till den verkliga skärmupplösningen, så att åtgärder överlever skillnader i visningsskalning mellan maskiner. Modellens egen README rekommenderar att den serveras med vLLM bakom en OpenAI-kompatibel slutpunkt.
Funktionen som skiljer sig: demonstrationsstyrd exekvering
De flesta GUI-agenter tar en enda input: en instruktion. UI-Mate tar en andra som är genuint sällsynt i en öppen checkpoint — en demonstration. ”Visa arbetsflödet en gång. Låt agenten anpassa det till den aktuella uppgiften,” som projektsidan uttrycker det.
Mekanismen är inte video i kontext eller ett fast åtgärdsskript. En demonstration registrerar skärmbilder omedelbart före och efter varje tangentbords- eller pekaråtgärd, och pipelinen normaliserar sedan spåret till en konsekvent åtgärds- och bildrutsrepresentation, annoterar det med observationer, avsikt, åtgärder och verifieringsbevis, samt segmenterar det i namngivna deluppgifter med slutförandekriterier. Vid inferenstillfället blir detta ett kompakt arbetsflöde som injiceras för den aktiva deluppgiften — men den live-skärmbilden förblir auktoritativ genom hela processen, så när applikationstillståndet avviker från demon, planerar modellen om snarare än att spela upp.
Tencent har gjort checkpojnten bakom detta arbetsflöde till sin egen publika modell: UI-Mate-democua-27B-kortet parar ihop instruktions-endast- och en-demonstrationsresultat på samma utvärderingar, och dess verktygsschema lägger till en subtask_complete-åtgärd — mekanismen bakom dessa namngivna deluppgifter. På OSWorkerBench self-demo-delmängden lyfter en demonstration strikt framgång från 17,17 till 35,35 och framsteg från 67,85 till 81,14; på OSWorld-delmängden går framstegen från 40,27 till 65,75; på GameDev-utvärderingssetet går medelpoängen från 76,76 till 81,15 medan den genomsnittliga banlängden sjunker från 303,6 till 253,1 steg — demonstrationen förkortar uppgiften såväl som förbättrar den. Kortet rapporterar att demonstrationen förbättrade 28 av de 33 self-demo-uppgifterna och löste fyra uppgifter som får noll poäng utan vägledning. Förbehållet är detsamma som löper genom hela denna artikel: det är teamets egna parade utvärderingar, genomsnittliga över tre till fem körningar, och ingen har reproducerat dem.
Siffrorna — alla av dem leverantörsrapporterade
Instruktionsbaserad exekvering, direkt från modellkortet:
• OSWorld-Verified genomsnittspoäng — 77.0
• WindowsAgentArena genomsnittspoäng — 66.2
• OSWorkerBench strikt framgång — 41.00
• OSWorkerBench-förlopp — 76.86

OSWorkerBench är i sig själv ett av de tre bidragen i artikeln: ett nytt benchmark med 100 långsiktiga kontorsuppgifter över 41 applikationer, med 33 self-demo- och 45 variant-demo-delmängder. Det är en ny utvärdering, så det finns ingen tidigare forskning att jämföra dessa två poäng mot. Mot sin egen basmodell hävdas UI-Mate-27B slå Qwen3.6-27B med 17,7 poäng i strikt framgång och 24,5 poäng i framsteg på OSWorkerBench – vilket är den mest rättvisa jämförelsen i hela releasen, eftersom båda modellerna skulle köras genom samma testmiljö.
Varje siffra ovan är teamets egen utvärdering. Det finns ännu inga oberoende poäng, inga tredjepartsomkörningar, och med noll nedladdningar finns det inte heller några reproduktioner från communityn. Behandla varje siffra här som ett påstående, inte ett faktum.
Där dessa siffror skulle sitta — om de håller
WindowsAgentArena är den som skulle bli en riktig rubrik. De bästa offentligt rapporterade WAA-resultaten tidigare under 2026 låg runt 61,0 (ett modulärt system som kallas VLAA-GUI, april 2026); EvoCUA-32B från Meituan, med öppna vikter, låg på 56,5, och ByteDances stängda UI-TARS-2 låg i låga till mellersta 50-talet på samma lista. Att uppnå 66,2 på UI-Mate-27B:s egen utvärdering skulle placera den över allt som hade rapporterats på detta riktmärke i år — öppet eller stängt. Det är ett starkt påstående, och det behöver en oberoende omkörning.
OSWorld-Verified på 77,0 är starkt men inte ett nytt open-weight-rekord på den offentliga listan. I en ögonblicksbild av OSWorld-Verified-topplistan från tidigt i augusti 2026 är open-weight-modellen Holo3-35B-A3B noterad på 82,6, med flera frontier-slutna modeller ovanför den (Qwen3.8 Max på 86,1, Claude Mythos 5 och Claude Fable 5 på 85,0, Claude Opus 4.8 på 83,4). Papperets formulering "state of the art" är därför ett påstående om dess egen utvärderingsmiljö, inte ett fastställt faktum – olika testmiljöer, action-parseare och självrapporteringsdrift gör alla att 77,0 mot 82,6 är en fråga som bara en oberoende omkörning kan avgöra. För att sätta i sammanhang vad en 27B öppen modell som presterar 77,0 innebär: den skulle hamna ovanför mänsklig-expertbaslinjen på cirka 72,4 och ovanför flera större frontier-system på samma lista, inklusive Claude Opus 4.6 på 72,7 och Kimi K2.6 på 73,1.
Tencent är inte ny på detta område — man släppte POINTS-GUI-G, en 8B GUI-grounding-modell, i februari 2026, lanserade Marvis OS-assistenten i maj och bidrog till GUICrafter-projektet för datoranvändning i juni. UI-Mate är en separat produktlinje som är specifikt inriktad på fullständig skrivbordsstyrning, och det är den första av Tencents GUI-agenter som släpps som en öppen grundmodell snarare än en grounding-komponent eller en produkt.
Så här kör du det
Modellen är designad för vLLM, och modellkortet ger det exakta kommandot — vllm serve tencent/UI-Mate-27B med tensor-parallel size 2 och den OpenAI-kompatibla chattmallen. En praktisk detalj sticker ut: agenten behåller som standard fem skärmbilder i kontexten, så servern måste tillåta minst sex bilder per prompt eftersom den nyaste skärmbilden anländer innan den äldsta kollapsas. Den rekommenderade flaggan är --limit-mm-per-prompt med sex bilder och noll video. Den demonstrationsstyrda checkpointen serveras på samma sätt — dess kort nämner vLLM och SGLang bakom en OpenAI-kompatibel slutpunkt.

När en Python-agentklass (UIMateAgent) väl har startats tar den en skärmdump och en instruktion, och returnerar svaret tillsammans med strukturerade åtgärder, varvid koordinaterna 1000×1000 skalas om tillbaka till din upplösning. Projektsidan erbjuder även en macOS Apple Silicon-app för det demonstrationsstyrda läget, vilket är det enklaste sättet att prova arbetsflödet "show it once" utan att bygga harnesset själv. Licensen är Apache-2.0 genomgående, så lokal användning, finjustering och kommersiell integration är alla tillåtna.
Två varningar hör hemma bredvid alla "så här kör du det"-guider för en datoranvändande agent, och båda kommer från själva modellkortet. Använd isolerade eller engångsmiljöer. Kräv mänsklig bekräftelse innan något känsligt utförs, övervaka händelseförloppet och behandla inte en modellrapporterad framgång som bevis på att det avsedda resultatet faktiskt uppnåddes. GUI-agenter missklickar, och prompt injection via innehåll på skärmen är en verklig hotmodell, inte en hypotetisk sådan.
Stacken kring en ny GUI-agent
Inga av UI-Mate-checkpoints finns på OrcaRouter ännu — familjen är bara några dagar gammal med noll nedladdningar, och dess basmodell Qwen3.6-27B är inte det heller. Det finns inget hostat API, så om du vill köra ett den här veckan får du servera vLLM själv. Det är okej för ett labb, men det är fel form för produktion.
En produktionsklar datoranvändningspipeline är sällan en enda checkpoint. Det är en planeringsmodell som bestämmer nästa avsikt, en groundnings- eller visionsmodell som läser skärmen, själva GUI-agenten och en billig fallback när ett delsteg misslyckas – och alla dessa delar är serverade modeller, även när GUI-agenten är lokal. Den blandningen är precis vad ett routningslager är till för: ett API för över 200 värdbaserade modeller, leverantörens listpris vidarebefordrat med 0 % påslag, och automatisk failover så att ett tillfälligt avbrott hos en leverantör inte stoppar en lång agentkörning. Routnings-DSL:n låter dig också komponera flera modeller i ett enda anrop – en planerare i början, en billig verifierare i slutet – utan att sy ihop leverantörer i din egen kod. Den ärliga sammanfattningen är enkel: agenten som styr skrivbordet är lokal, men modellerna som bestämmer vad som ska göras runt omkring är routbara, och att säkert testa helt nya obeprövade checkpoints är precis vad failover är till för.
Vad du ska titta på härnäst
Fyra saker skulle förändra bilden för UI-Mate-27B, i ungefärlig prioritetsordning:
• En oberoende omkörning av OSWorld-Verified och WindowsAgentArena. WAA-siffran i synnerhet är antingen en stor sak eller en artefakt av testmiljön, och bara en extern utvärdering avgör vilket.
• Den formella tekniska rapporten. Den nuvarande citeringen är en platshållare, och den fullständiga uppsatsen kommer förmodligen att presentera datamotorns detaljer som abstraktet bara skisserar.
• Tencents eget tillkännagivande. Ett sådant repo-först-släpp föregår vanligtvis något — en Marvis-integrering, ett värdbaserat erbjudande eller en bredare satsning på öppna modeller.
• En hostad API. Alla tre checkpointernas vikter är nu offentliga, men inget serveras någonstans — ingen Tencent-endpoint, ingen tredjepartsinferensleverantör — så self-hosting är fortfarande enda vägen, och bara ett Tencent-tillkännagivande eller att en leverantör tar upp det ändrar detta.
FAQ
Vad är Tencent UI-Mate-27B?
UI-Mate-27B är en Apache-2.0-licensierad, grundmodellbaserad GUI-agent med 27 miljarder parametrar från Tencents HY Frontier Multimodal Agent Team, finjusterad från Qwen3.6-27B. Den tittar på live-skrivbordsskärmbilder, resonerar över dem och genererar pyautogui-kompatibla mus- och tangentbordsåtgärder. Den släpptes tyst på Hugging Face den 14 augusti 2026 — tillsammans med 9B-syskonmodellen och den demonstrationsstyrda UI-Mate-democua-27B — utan något tillkännagivande, och dess riktmärken är hittills helt leverantörsrapporterade.
Hur skiljer sig demonstrationsstyrd exekvering från att spela upp ett skript?
Istället för att utföra ett inspelat makro behandlar UI-Mate en demonstration som ett textat, deluppgiftsstrukturerat arbetsflöde som injiceras som vägledning. Live-skärmdumpen förblir auktoritativ, så när appens layout, innehåll eller tillstånd skiljer sig från vad som visades, planerar modellen om snarare än att spela upp inaktuella koordinater. Det är mekanismen bakom den påstådda ökningen från 17.2 till 35.4 i strikt framgång på självdemo-delmängden — och det är fortfarande ett leverantörspåstående tills någon reproducerar det.
Är UI-Mate-27B verkligen i framkant för GUI-agenter med öppna vikter?
Det beror helt på utvärderingsupplägget. Dess WindowsAgentArena 66.2 skulle toppa de bästa offentligt rapporterade WAA-resultaten från tidigare under 2026, men dess OSWorld-Verified 77.0 ligger under den open-weight-modellen Holo3-35B-A3B på 82.6 på den offentliga listan. I artikeln kallas det för en ny state of the art för open-weight-modeller; en oberoende omkörning på en konsekvent testmiljö är det enda sättet att få veta.
Kan jag köra UI-Mate-27B idag?
Ja, om du serverar den själv: ladda ner vikterna från Hugging Face — den 27B allmänna checkpointen, 9B, eller den demonstrationsguidada UI-Mate-democua-27B — kör vLLM-kommandot från modellkortet (tensor-parallell storlek 2, sex bilder per prompt), och driv den med Python-agenten eller macOS-appen. Det finns inget värdbaserat API, och inga av checkpointarna finns på OrcaRouter än — vilket, för modeller så nya och så overifierade, är ett rimligt skäl att hålla dem i en isolerad miljö tills vidare.
Rätt sätt att se på UI-Mate-27B är inte "vinnaren" utan "värd att hålla ögonen på." En öppen 27B-modell som gör anspråk på en WAA-ledning och levererar ett one-shot-demonstrationsarbetsflöde är en betydelsefull datapunkt under ett år då datoranvändningsagenter med öppna vikter har gått från att vara ett skämt till att vara inom räckhåll för frontlinjen. Nu när den demonstrationsstyrda kontrollpunkten är offentliga vikter snarare än en platshållare på projektsidan, är "show it once"-arbetsflödet något du faktiskt kan köra. Tencent har varit försiktiga med releaser tidigare, och den här har formen av ett offentliggjort pågående arbete. Kör det i en sandlåda, kör om benchmarks, och fortsätt följa announcement-bevakningen – den intressanta delen av den här historien ligger fortfarande framför oss.
