
InternLumina-U2 vs Tencent UI-Mate-27B: Skrivbordsagenten du kan köra nu vs den enhetliga visionsmodellen du bara kan läsa om
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Tencent UI-Mate-27B och InternLumina-U2 är två stillsamma Apache-2.0-släpp från kinesiska labb, publicerade med två veckors mellanrum, och de är inte konkurrenter – vilket är precis varför de är värda att jämföra. Tencent UI-Mate-27B, som släpptes som öppna vikter den 14 augusti 2026, är en skrivbordsagent: den övervakar skärmen och genererar mus- och tangentbordsåtgärder. InternLumina-U2, publicerad som inferenskod den 1 september 2026 av Shanghai AI Laboratory, är en tänkt enhetlig visionsmodell: den hävdar att den kan läsa bilder, video och 3D samt generera och redigera bilder. Den ena agerar på det den ser; den andra, när dess vikter slutligen existerar, kommer att prata och rita om det den ser. Om ditt jobb är att manövrera ett skrivbord, är det bara en av dessa två som kan göra det idag – och det är inte den med den häftigare arkitekturen.
Agenten som agerar: Tencent UI-Mate-27B
UI-Mate-27B är en grundmodell för GUI-agenter med öppna vikter och 27 miljarder parametrar, från Tencent HY Frontiers multimodala agentteam, finjusterad från Qwen3.6-27B. Den observerar live-skärmbilder, resonerar över det aktuella skärmtillståndet och matar ut strukturerade tangentbords- och musåtgärder i ett normaliserat koordinatrum — resultatet av en modell som tränats för att hantera en riktig skrivbordsmiljö, inte för att chatta om en. Dess utmärkande egenskap är demonstrationsstyrd exekvering: visa den ett arbetsflöde en gång, så anpassar modellen den inspelade demonstrationen till den aktuella uppgiften och behandlar live-skärmbilden som auktoritativ när gränssnittet skiljer sig från vad som spelades in. Tencents rapporterade toppsiffror är OSWorld-Verified 77,0 och WindowsAgentArena 66,2 — siffror som skulle toppa dessa 2026-topplistor om de oberoende reproducerades — tillsammans med en rad OSWorkerBench-siffror. Vikterna är verkliga och nedladdningsbara: tolv safetensors-delar på Hugging Face, som kan self-hostas via vLLM eller SGLang på ett par GPU:er, och modellkortet bär en viktig varning om att det är en agentcheckpoint snarare än en fristående visuell chattmodell — rikta den mot "describe this image" så använder du den fel.
De utlovade ögonen: InternLumina-U2
InternLumina-U2 är en helt annan art. Det är en diffusionsmodell med 16B-parameter och sparsam mixture-of-experts (1B aktiva) som labbet avser som en enda modell för omni-visuell förståelse, bildgenerering och bildredigering — en helt diskret design med åtta codebooks där en enda stomme både läser en bild, ett diagram, en video eller en 3D-tillgång och skriver nya pixlar. Om din mentala modell är en GUI-agent är InternLumina-U2 den motsatta polen: den vill inte klicka på någonting, den vill förstå allt och rita på begäran. Dess publicerade form den 1 september 2026 är inferenskod och en arkitektur — sex uppgiftsingångar i ett GitHub-repository, en projektsida med en preliminär benchmark-tabell, en tom Hugging Face-stubb — och dess vikter, träningskod och teknisk rapport är alla fortfarande märkta ”kommer snart”. Ingen kan köra den. Gapet mellan de två modellerna är inte kvalitet; det är existens.
Resultattavlan
UI-Mate-27B:s siffror är rapporterade av Tencent och ej oberoende verifierade; InternLumina-U2:s är laboratorierapporterade, preliminära och ofullständiga. Varje rad anger sin källa.
• Jobb — Tencent UI-Mate-27B: hantera ett skrivbord — läsa skärmbilder i realtid, sända mus- och tangentbordsåtgärder. InternLumina-U2: uppfatta och skapa — förstå bilder/video/3D, generera och redigera bilder.
• Vikter — Tencent UI-Mate-27B: offentliga sedan 14 augusti 2026, tolv safetensors-delar, Apache-2.0. InternLumina-U2: inte offentliga — tomt Hugging Face-repo, vikter "kommer snart."
• Skala — 27B tät, finjusterad från Qwen3.6-27B, jämfört med 16B totalt / 1B aktiv gles MoE-diffusionsmodell.
• Utdata — Tencent UI-Mate-27B: strukturerade pyautogui-kompatibla åtgärder i ett normaliserat koordinatutrymme. InternLumina-U2: hanterar text, text-till-bild upp till 1024×1024 och instruktionsbaserad bildredigering.
• Nyckelsiffror — Tencent UI-Mate-27B: OSWorld-Verified 77,0, WindowsAgentArena 66,2, OSWorkerBench-förbättringar från demonstrationer (samtliga rapporterade av Tencent). InternLumina-U2: ChartQA 86,52, GenEval 0,81, MathVision 33,22 (labbrapporterade, preliminära).
• Ursprungsförbehåll — Tencent UI-Mate-27B: modellkortet varnar självt för att det är en agent-checkpoint, inte en fristående visuell chattmodell. InternLumina-U2: projektsidan kallar sina egna resultat ”preliminära, ofullständiga”.
• Verkligheten kring servering — Tencent UI-Mate-27B: hosta själv via vLLM eller SGLang på ~2 GPU:er; ingen värdbaserad inferensleverantör erbjuder den för närvarande. InternLumina-U2: kan inte serveras av någon — den publicerade drivern förväntar sig checkpoints som inte finns i repositoryt.

Två olika varianter av det obevisade.
Båda modellerna är oprövade, och ordet har inte samma betydelse i de två fallen. Tencent UI-Mate-27B är oprövad på det sätt som en ny modell vanligtvis är oprövad: dess annonserade siffror är leverantörens egna, ingen har oberoende upprepat dem, och antalet nedladdningar är försvinnande litet i förhållande till påståendena — det vanliga mönstret för en checkpoint som vid första anblicken är fyra dagar gammal och som sedan dess har fått en blygsam community. Men den är oprövad på ett testbart sätt. Eftersom vikterna finns kan vem som helst med två GPU:er och en Windows-testmiljö kontrollera 66,2 och 77,0 den här veckan, och de demonstrationsstyrda påståendena kan reproduceras eller vederläggas i verkliga arbetsflöden. InternLumina-U2 är oprövad i en striktare mening: den är otestbar. Dess arkitektur är offentlig och läsbar, men siffrorna är inte det — det finns ingen artefakt som skulle kunna bekräfta dem, och labbets egen ofullständiga tabell visar redan att InternLumina-U2 ligger efter en namngiven konkurrent på åtminstone ett genereringsbenchmark. En leverantörssiffra kopplad till en nedladdningsbar fil är ett påstående som väntar på en granskare. En leverantörssiffra kopplad till en färdplan är ett hopp.

Tencent/UI-Mate-27B Hugging Face-kortet, fångat 27 augusti 2026 — Qwen3.6-27B-basen, leverantörsrapporterade OSWorld- och WindowsAgentArena-poäng, och noteringen att ingen inferensleverantör för närvarande distribuerar det.
Den naturliga arbetsfördelningen: en aktör och dess ögon
Ställda sida vid sida skisserar de två modellerna formen av en tillförlitlig automatiseringskedja. Det svåra problemet med GUI-agenter är inte normalfallet; det är att agenten tyst gör fel sak på ett oväntat skärmtillstånd och ingen märker det. Det är precis det jobb som en billig, pålitlig visionmodell finns till för — verifiera skärmtillståndet före och efter varje åtgärd, bekräfta att dialogen som dök upp är den dialog som agenten tror dök upp, och stoppa loopens när verkligheten och agentens modell av verkligheten divergerar. Tencent UI-Mate-27B är aktören; en enhetlig visionmodell av det slag InternLumina-U2 utger sig för att vara är den naturliga verifieraren, som kan läsa samma skärmbilder som agenten agerar på. När — och endast när — InternLumina-U2:s vikter faktiskt publiceras och dess förståelseanspråk överlever oberoende tester, är det den roll den skulle kunna fylla vid sidan av en agent snarare än emot den. De två är inte rivaler om ett jobb; de är de två halvorna av ett jobb.

The InternLM/InternLumina-U2 GitHub-repository, avbildad den 2 september 2026 – repots landningssida som visar inferensskripten per uppgift, inklusive startpunkten för bildförståelse som en skärmtillståndsverifierare skulle byggas utifrån; vikterna som skulle göra den körbar finns inte i trädet.
Vad ett routinglager gör för en agent-plus-ögon-stack
Ingen av modellerna är hostad på OrcaRouter, och vi kommer inte att antyda något annat – Tencent UI-Mate-27B erbjuds inte av någon värdleverantör över huvud taget, och InternLumina-U2 saknar vikter som någon leverantör kan hosta. Det routningsmönster som gäller är det för just denna arkitektur: en agent som agerar och en visionsmodell som verifierar, sammansatta så att det dyra eller riskfyllda steget villkoras av det billiga, pålitliga. Routnings-DSL:n uttrycker det som ett enda logiskt anrop – agera, verifiera, fortsätt eller avbryt – i stället för skräddarsydd kopplingskod mellan två modellleverantörer, och automatisk failover hanterar det realistiska felscenariot: en GUI-agent som UI-Mate-27B är precis den typ av obeprövad checkpoint som du först provkör på en testväg, där anropet faller tillbaka på en beprövad modell i samma ögonblick som den nya beter sig illa. Ett API för 200+ hostade modeller, leverantörens listpris förs vidare med 0 % påslag, och de obeprövade delarna av stacken hålls bakom säkerhetsspärrar medan de vinner ditt förtroende.
Slutsatsen
Om du bygger något som styr en dator, är Tencent UI-Mate-27B den enda av dessa två som finns i användbar form — körbar idag på dina egna GPU:er, med imponerande men inte reproducerade resultat som du faktiskt kan testa. Om du bygger något som behöver en modell för att förstå och rita det den ser, är InternLumina-U2 en lovande arkitektur som väntar på sina vikter — värd att läsa nu, värd ingenting som beroende tills safetensors dyker upp. Håll ett öga på båda tills den dag då arbetsfördelningen blir möjlig: en aktör på din dator, en uppsättning verifierade ögon som bevakar den, och ett routinglager som håller dem ärliga.
