Ein Hero-Titelbild für UI-Mate-27B, Tencents Open-Weight-Foundation-GUI-Agent, veröffentlicht am 14. August 2026, das einen Desktop-Monitor mit Mauszeiger und Automatisierungspfeilen zeigt, mit dem Untertitel „Open-Weight Foundation GUI Agent“, Label-Chips „Apache-2.0“, „27B params“, „vLLM ready“ und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Tencent UI-Mate-27B: Der unauffällige Open-Weight-GUI-Agent, der einen Spitzenplatz in WindowsAgentArena beansprucht

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 14. August 2026 veröffentlichte das HY Frontier Multimodal Agent Team von Tencent drei Checkpoints auf Hugging Face unter der Organisation tencent/ – UI-Mate-27B, ein kleineres UI-Mate-9B und das demonstrationsgesteuerte UI-Mate-democua-27B. Vier Tage später gibt es immer noch keine Ankündigung irgendwo: keinen Startbeitrag, keine Pressemitteilung, keinen Produkt-Tweet. Was stattdessen veröffentlicht wurde, ist für eine stille Veröffentlichung ungewöhnlich vollständig: eine Projektseite, ein GitHub-Repository mit einem funktionierenden Harness und ein vor zwei Tagen eingereichtes arXiv-Paper, das das größere Modell als neuen Open-Weight-Stand der Technik bei der Desktop-GUI-Steuerung bezeichnet.

Alles in diesem Beitrag stammt aus den Model Cards, dem GitHub-Repository, der Projektseite und dem Paper — nichts davon wurde bisher unabhängig reproduziert. Die Checkpoints haben zum Zeitpunkt dieses Schreibens null Downloads auf Hugging Face, was bedeutet, dass wir wahrscheinlich zu den ersten Menschen außerhalb von Tencent gehören, die sie auf dem Papier ernst nehmen. Hier ist, was tatsächlich aus den Repos bekannt ist, und was unbestätigt bleibt, bis jemand anderes es ausführt.

Inhalt

• Was ausgeliefert wurde und was noch nicht angekündigt wurde

• Was UI-Mate-27B eigentlich ist

Das besondere Merkmal: demonstrationsgesteuerte Ausführung

• Die Zahlen — alle vom Anbieter gemeldet

• Wo diese Zahlen sitzen würden — falls sie gelten

• So führen Sie es aus

• Der Stack rund um einen neuen GUI-Agenten

• Was als Nächstes ansehen

• FAQ

Was veröffentlicht wurde und was noch nicht angekündigt wurde

Tencent veröffentlichte UI-Mate-27B (27 Milliarden Parameter, Apache-2.0, safetensors in BF16) am 14. August 2026, zusammen mit dem 9B-Geschwistermodell und dem demonstrationsgesteuerten Checkpoint UI-Mate-democua-27B. Die beiden 27B-Checkpoints basieren auf Qwen3.6-27B – selbst ein multimodales Apache-2.0-Modell, das im April 2026 veröffentlicht wurde – was bedeutet, dass der gesamte Stack, Basismodell und Feintuning, kommerziell nutzbar ist. Die Repositories tragen Zeitstempel der letzten Änderung aus dieser Woche – der demonstrationsgesteuerte Checkpoint wurde noch heute angefasst – Tencent hat also aktiv daran gearbeitet.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

Was ist bisher öffentlich:

• Die Gewichte von UI-Mate-27B, UI-Mate-9B und UI-Mate-democua-27B auf Hugging Face, jeweils mit einer Modellkarte, Bewertungstabellen und einem Serving-Rezept.

• Eine Projektseite unter ui-mate.github.io mit einem Demo-Video, einer Bedienungsanleitung und einer macOS-Apple-Silicon-App (DMG v0.2.4).

• Das GitHub-Repository (github.com/Tencent/UI-Mate) mit dem offiziellen Prompt, dem Antwort-Parser und der Interaktions-Harness — die Karte weist ausdrücklich darauf hin, dass dies „ein Agent-Checkpoint und kein eigenständiges visuelles Chat-Modell“ ist, und die Harness wird für alles Ernsthafte empfohlen.

• Ein arXiv-Preprint (2608.15930), eingereicht am 16. August, mit dem Titel „UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations."

Was noch nicht öffentlich ist: Tencent selbst hat nichts gesagt — dies ist eine Repo-First-Veröffentlichung, kein Launch. Die demonstrationsgesteuerte Variante, die die Projektseite als noch nicht öffentlich gelistet hatte, hat jetzt Live-Gewichte auf Hugging Face: das Repo tencent/UI-Mate-democua-27B, das im selben Push vom 14. August erstellt wurde, ist ausdrücklich als demonstrationsgesteuerter Checkpoint der Familie gekennzeichnet — ein eigenständiges Modell, keine Umbenennung der 27B. Es gibt weiterhin keine gehostete API. Das ist wichtig: Der einzige Weg, UI-Mate heute auszuführen, besteht darin, die Gewichte herunterzuladen und selbst zu hosten.

Was UI-Mate-27B eigentlich ist

UI-Mate-27B ist ein grundlegendes GUI-Agentenmodell für „langfristige Arbeit über Anwendungen und Betriebssysteme hinweg". Es beobachtet Live-Bildschirmaufnahmen, analysiert den sichtbaren Zustand und erzeugt strukturierte Tastatur- und Mausaktionen für die native Desktop-Interaktion. Das Training besteht aus überwachtem Feintuning, gefolgt von Online-Verstärkungslernen in ausführbaren GUI-Umgebungen — das Modell lernte durch tatsächliches Bedienen von Desktops, nicht allein aus statischen Bildschirmaufnahmen.

Der Aktionsraum ist der Teil, um den sich Entwickler kümmern werden: Maus, Tastatur, Scrollen, Warten, Benutzerinteraktion und Aufgabenabschluss, mit Ausgaben, die mit pyautogui kompatibel sind. Das Modell denkt in einem normalisierten 1000×1000-Koordinatenraum, und der Referenz-Agent skaliert seine Vorhersagen zurück auf die tatsächliche Screenshot-Auflösung, sodass Aktionen Unterschiede bei der Bildschirmskalierung zwischen Rechnern überstehen. Das eigene README des Modells empfiehlt, es mit vLLM hinter einem OpenAI-kompatiblen Endpunkt bereitzustellen.

Das Besondere: demonstrationsgesteuerte Ausführung

Die meisten GUI-Agenten nehmen nur eine Eingabe entgegen: eine Anweisung. UI-Mate nimmt eine zweite, die in einem offenen Checkpoint wirklich selten ist – eine Demonstration. „Zeigen Sie den Arbeitsablauf einmal. Lassen Sie den Agenten ihn an die jeweilige Aufgabe anpassen“, so die Projektseite.

Der Mechanismus ist kein Video-in-Kontext-Verfahren und kein festes Aktionsskript. Eine Demonstration zeichnet unmittelbar vor und nach jeder Tastatur- oder Zeigeraktion Screenshots auf, und die Pipeline normalisiert die Ablaufspur anschließend in eine konsistente Darstellung aus Aktionen und Frames, annotiert sie mit Beobachtungen, Absicht, Aktionen und Verifikationsnachweisen und segmentiert sie in benannte Teilaufgaben mit Abschlusskriterien. Zur Inferenzzeit wird daraus ein kompakter Workflow, der für die aktive Teilaufgabe injiziert wird – aber der Live-Screenshot bleibt durchgehend maßgeblich. Wenn sich der Anwendungszustand von der Demonstration unterscheidet, plant das Modell neu, anstatt sie abzuspielen.

Tencent hat den Checkpoint hinter diesem Workflow zu einem eigenen öffentlichen Modell gemacht: Die UI-Mate-democua-27B-Karte vergleicht Ergebnisse mit reiner Instruktion und mit einer Demonstration auf denselben Evals, und ihr Tool-Schema fügt eine subtask_complete-Aktion hinzu – der Mechanismus hinter diesen benannten Teilaufgaben. Auf dem Self-Demo-Subset von OSWorkerBench hebt eine Demonstration den strikten Erfolg von 17,17 auf 35,35 und den Fortschritt von 67,85 auf 81,14; auf dem OSWorld-Subset steigt der Fortschritt von 40,27 auf 65,75; beim GameDev-Evalset steigt die durchschnittliche Punktzahl von 76,76 auf 81,15, während die durchschnittliche Trajektorienlänge von 303,6 auf 253,1 Schritte sinkt – die Demo verkürzt die Aufgabe und verbessert sie zugleich. Die Karte berichtet, dass die Demonstration 28 der 33 Self-Demo-Aufgaben verbessert und vier Aufgaben gelöst hat, die ohne Anleitung null Punkte erzielen. Der Vorbehalt ist derselbe, der sich durch diesen gesamten Artikel zieht: Es handelt sich um die eigenen gepaarten Evals des Teams, gemittelt über drei bis fünf Läufe, und niemand hat sie reproduziert.

Die Zahlen — alle von den Anbietern gemeldet

Nur-Anweisungs-Ausführung, direkt aus der Modellkarte:

• OSWorld-Verified durchschnittliche Punktzahl — 77.0

• WindowsAgentArena Durchschnittspunktzahl — 66.2

OSWorkerBench strikter Erfolg — 41.00

• OSWorkerBench Fortschritt — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench ist selbst einer der drei Beiträge in dem Papier: eine neue Benchmark mit 100 langfristigen Büroaufgaben in 41 Anwendungen, mit 33 Self-Demo- und 45 Variant-Demo-Teilmengen. Es ist eine neue Evaluierung, daher gibt es keine früheren Arbeiten, mit denen diese beiden Werte verglichen werden könnten. Gegenüber seinem eigenen Basismodell soll UI-Mate-27B Qwen3.6-27B auf OSWorkerBench um 17,7 Punkte beim strikten Erfolg und 24,5 Punkte beim Fortschritt übertreffen — was die sauberste Äpfel-mit-Äpfel-Zahl in der gesamten Veröffentlichung ist, da beide Modelle durch dieselbe Testumgebung laufen würden.

Jede Abbildung oben ist die eigene Bewertung des Teams. Es gibt noch keine unabhängigen Ergebnisse, keine Wiederholungen durch Dritte, und bei null Downloads auch keine Reproduktionen durch die Community. Behandeln Sie jede Zahl hier als Behauptung, nicht als Tatsache.

Wo diese Zahlen sitzen würden — wenn sie halten.

WindowsAgentArena wäre das, was eine echte Schlagzeile abgeben würde. Die besten öffentlich gemeldeten WAA-Ergebnisse lagen Anfang 2026 bei etwa 61,0 (ein modulares System namens VLAA-GUI, April 2026); das quelloffene EvoCUA-32B von Meituan stand bei 56,5, und ByteDances geschlossenes UI-TARS-2 lag auf derselben Bestenliste im unteren bis mittleren 50er-Bereich. Eine 66,2 in der eigenen Evaluierung von UI-Mate-27B würde es über alles stellen, was dieses Jahr auf diesem Benchmark berichtet wurde – offen oder geschlossen. Das ist eine starke Behauptung, und sie braucht einen unabhängigen Neulauf.

OSWorld-Verified mit 77.0 ist stark, aber kein neuer Open-Weight-Rekord auf dem öffentlichen Board. Auf dem OSWorld-Verified-Leaderboard-Snapshot von Anfang August 2026 ist das Open-Weight-Modell Holo3-35B-A3B mit 82.6 gelistet, mit mehreren geschlossenen Frontier-Modellen darüber (Qwen3.8 Max bei 86.1, Claude Mythos 5 und Claude Fable 5 bei 85.0, Claude Opus 4.8 bei 83.4). Die Formulierung „State of the Art“ in dem Paper ist daher eine Behauptung über das eigene Evaluierungssetup, keine gesicherte Tatsache – unterschiedliche Harnesses, Aktions-Parser und Selbstberichts-Drift machen 77.0 gegenüber 82.6 zu einer Frage, die nur ein unabhängiger Wiederholungslauf klären kann. Zur Einordnung, was ein 27B-Open-Modell mit 77.0 bedeutet: Es läge über der menschlichen Experten-Baseline von etwa 72.4 und über mehreren größeren Frontier-Systemen auf demselben Board, darunter Claude Opus 4.6 bei 72.7 und Kimi K2.6 bei 73.1.

Tencent ist in diesem Bereich nicht neu — das Unternehmen hat im Februar 2026 POINTS-GUI-G, ein 8B-GUI-Grounding-Modell, ausgeliefert, im Mai den Marvis-OS-Assistenten gestartet und im Juni zum GUICrafter-Computer-Use-Projekt beigetragen. UI-Mate ist eine eigene Produktlinie, die speziell auf die vollständige Desktop-Steuerung abzielt, und es ist der erste GUI-Agent von Tencent, der als offenes Basismodell ausgeliefert wird, statt als Grounding-Komponente oder Produkt.

Wie man es ausführt

Das Modell ist für vLLM konzipiert, und die Modellkarte gibt den genauen Befehl an — vllm serve tencent/UI-Mate-27B mit tensor-parallel size 2 und der OpenAI-kompatiblen Chat-Vorlage. Ein praktisches Detail sticht hervor: Der Agent behält standardmäßig fünf Screenshots im Kontext, sodass der Server mindestens sechs Bilder pro Prompt zulassen muss, da der neueste Screenshot eintrifft, bevor der älteste entfernt wird. Die empfohlene Flag ist --limit-mm-per-prompt mit sechs Bildern und null Videos. Der demonstrationsgesteuerte Checkpoint funktioniert auf dieselbe Weise — die zugehörige Karte nennt vLLM und SGLang hinter einem OpenAI-kompatiblen Endpunkt.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

Sobald sie bereitgestellt ist, nimmt eine Python-Agentenklasse (UIMateAgent) einen Screenshot und eine Anweisung entgegen und gibt die Antwort sowie strukturierte Aktionen zurück, wobei sie die 1000×1000-Koordinaten wieder auf Ihre Auflösung skaliert. Die Projektseite bietet außerdem eine macOS-App für Apple Silicon für den demonstrationsgesteuerten Modus, der der einfachste Weg ist, den „Einmal zeigen“-Workflow auszuprobieren, ohne die Infrastruktur selbst aufbauen zu müssen. Die Lizenzierung erfolgt durchgängig unter Apache-2.0, sodass lokale Nutzung, Feintuning und kommerzielle Integration alle erlaubt sind.

Zwei Warnungen gehören in jede Anleitung zur Ausführung eines Computer-Use-Agenten, und beide stammen aus der Modellkarte selbst. Nutzen Sie isolierte oder wegwerfbare Umgebungen. Verlangen Sie menschliche Bestätigung, bevor etwas Sensibles ausgeführt wird, überwachen Sie den Verlauf und behandeln Sie einen vom Modell gemeldeten Erfolg nicht als Beweis dafür, dass das beabsichtigte Ergebnis tatsächlich eingetreten ist. GUI-Agenten verklicken sich, und Prompt-Injection über auf dem Bildschirm angezeigte Inhalte ist ein reales Bedrohungsmodell, keine Hypothese.

Der Stack rund um einen neuen GUI-Agenten

Noch keiner der UI-Mate-Checkpoints ist auf OrcaRouter — die Familie ist erst ein paar Tage alt, hat null Downloads, und auch ihr Basismodell Qwen3.6-27B ist nicht dort. Es gibt keine gehostete API. Wenn Sie also diese Woche eine ausführen möchten, müssen Sie vLLM selbst bereitstellen. Das ist für ein Labor in Ordnung, aber es ist die falsche Form für die Produktion.

Eine Computer-Use-Pipeline im Produktionseinsatz besteht selten aus nur einem Checkpoint. Sie besteht aus einem Planermodell, das die nächste Absicht festlegt, einem Grounding- oder Vision-Modell, das den Bildschirm liest, dem GUI-Agenten selbst und einem günstigen Fallback, wenn ein Teilschritt fehlschlägt – und all diese Komponenten sind gehostete Modelle, selbst wenn der GUI-Agent lokal läuft. Genau für diese Mischung ist eine Routing-Schicht gedacht: eine API für über 200 gehostete Modelle, Listenpreise der Anbieter, die ohne Aufschlag durchgereicht werden, und automatisches Failover, damit ein vorübergehender Ausfall eines Anbieters einen langen Agentenlauf nicht stoppt. Die Routing-DSL ermöglicht es außerdem, mehrere Modelle in einem einzigen Aufruf zu kombinieren – einen Planer am Anfang, einen günstigen Verifizierer am Ende –, ohne Anbieter im eigenen Code miteinander verbinden zu müssen. Die ehrliche Zusammenfassung ist einfach: Der Agent, der den Desktop steuert, ist lokal, aber die Modelle, die entscheiden, was darum herum zu tun ist, lassen sich routen – und genau dafür ist Failover da: brandneue, unerprobte Checkpoints sicher auszuprobieren.

Was als Nächstes ansehen

Vier Dinge würden das Bild für UI-Mate-27B verändern, in etwa nach Wichtigkeit geordnet:

• Eine unabhängige Wiederholung von OSWorld-Verified und WindowsAgentArena. Insbesondere der WAA-Wert ist entweder eine große Sache oder ein Artefakt der Testumgebung, und nur eine externe Evaluierung klärt, was davon zutrifft.

• Der formelle technische Bericht. Das derzeitige Zitat ist ein Platzhalter, und das vollständige Paper wird vermutlich die Details der Daten-Engine offenlegen, die das Abstract nur skizziert.

• Tencents eigene Ankündigung. Ein solcher Repo-First-Release geht normalerweise etwas voraus – einer Marvis-Integration, einem gehosteten Angebot oder einem breiteren Open-Model-Vorstoß.

• Eine gehostete API. Die Gewichte aller drei Checkpoints sind jetzt öffentlich, aber nichts wird irgendwo bereitgestellt – kein Tencent-Endpunkt, kein Drittanbieter-Inferenzdienst – daher bleibt Selbsthosting der einzige Weg, und nur eine Ankündigung von Tencent oder die Übernahme durch einen Anbieter ändert das.

FAQ

Was ist Tencent UI-Mate-27B?

UI-Mate-27B ist ein Apache-2.0-lizenzierter Foundation-GUI-Agent mit 27 Milliarden Parametern vom HY Frontier Multimodal Agent Team von Tencent, der auf Basis von Qwen3.6-27B feinabgestimmt wurde. Er beobachtet Live-Desktop-Screenshots, zieht daraus Schlussfolgerungen und gibt pyautogui-kompatible Maus- und Tastaturaktionen aus. Er wurde am 14. August 2026 still auf Hugging Face veröffentlicht – zusammen mit dem 9B-Geschwistermodell und dem demonstrationsgesteuerten UI-Mate-democua-27B – ohne Ankündigung, und seine Benchmarks stammen bisher vollständig vom Anbieter.

Wie unterscheidet sich die demonstrationsgeführte Ausführung vom Abspielen eines Skripts?

Anstatt ein aufgezeichnetes Makro auszuführen, behandelt UI-Mate eine Demonstration als einen mit Bildunterschriften versehenen, in Teilaufgaben strukturierten Workflow, der als Anleitung eingebunden wird. Der Live-Screenshot bleibt maßgeblich, sodass das Modell bei Abweichungen des App-Layouts, -Inhalts oder -Zustands von der gezeigten Darstellung neu plant, anstatt veraltete Koordinaten abzuspielen. Das ist der Mechanismus hinter dem behaupteten Anstieg der strikten Erfolgsquote von 17,2 auf 35,4 bei der Selbst-Demo-Teilmenge – und es bleibt eine Herstellerangabe, bis jemand sie reproduziert.

Ist UI-Mate-27B wirklich der neueste Stand der Technik für Open-Weight-GUI-Agenten?

Das hängt vollständig vom Evaluations-Setup ab. Mit 66,2 bei WindowsAgentArena würde es die besten öffentlich berichteten WAA-Ergebnisse von Anfang 2026 übertreffen, aber mit 77,0 bei OSWorld-Verified liegt es auf der öffentlichen Bestenliste unter dem Open-Weight-Modell Holo3-35B-A3B mit 82,6. Das Paper bezeichnet es als neuen Stand der Technik bei Open-Weight-Modellen; eine unabhängige Wiederholung auf einer konsistenten Testumgebung ist der einzige Weg, das herauszufinden.

Kann ich UI-Mate-27B heute ausführen?

Ja, wenn Sie es selbst bereitstellen: Laden Sie die Gewichte von Hugging Face herunter — den 27B-Allzweck-Checkpoint, den 9B oder den demonstrationsgesteuerten UI-Mate-democua-27B — führen Sie den vLLM-Befehl von der Modellkarte aus (Tensor-Parallel-Größe 2, sechs Bilder pro Prompt) und steuern Sie es mit dem Python-Agenten oder der macOS-App. Es gibt keine gehostete API, und keiner der Checkpoints ist bisher auf OrcaRouter — was bei so neuen und so unverifizierten Modellen ein vernünftiger Grund ist, sie vorerst in einer isolierten Umgebung zu behalten.

Die richtige Einschätzung zu UI-Mate-27B ist nicht „der Gewinner“, sondern „beobachtenswert“. Ein offenes 27B-Modell, das eine WAA-Führung beansprucht und einen One-Shot-Demonstrations-Workflow mitliefert, ist ein bedeutender Datenpunkt in einem Jahr, in dem Open-Weight-Agenten zur Computernutzung von einem Witz bis an die Schwelle zur Spitzenklasse gelangt sind. Jetzt, da der demonstrationsgeführte Checkpoint aus öffentlichen Gewichten besteht und nicht nur ein Platzhalter auf der Projektseite ist, lässt sich der „Einmal zeigen“-Workflow tatsächlich ausführen. Tencent war bei Veröffentlichungen bisher stets vorsichtig, und diese hier hat die Form eines öffentlich gemachten Work-in-Progress. Führen Sie ihn in einer Sandbox aus, wiederholen Sie die Benchmarks und beobachten Sie die Ankündigungen weiter – der interessante Teil dieser Geschichte steht noch bevor.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube