Eine generierte Titelkarte im OrcaRouter-Hausstil mit der Aufschrift „PixelUMM vs UI-Mate-27B“, mit vier Statistik-Kacheln: „77.0“ (der von UI-Mate-27B gemeldete OSWorld-Verified-Durchschnitt), „66.2“ (sein WindowsAgentArena-Durchschnitt), „keiner“ (PixelUMMs Aktionsraum) und „Apache-2.0“ (UI-Mate-27Bs Lizenz für Code und Gewichte, im Gegensatz zu PixelUMMs nichtkommerziellem Checkpoint). Eine Fußzeile lautet: „Von Tencent gemeldete Agenten-Scores; PixelUMM-Zahlen aus seinem Preprint. Kein unabhängiger Rerun.“ Das OrcaRouter-Logo ist in den gepolsterten Streifen unten rechts eingefügt.
Guides & Insights

PixelUMM vs. UI-Mate-27B: Das eine Modell zeichnet, was es sieht, das andere klickt es an

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencen​t UI-Mate-27B und NVIDIA PixelUMM wirken auf dem Datenblatt vergleichbar – 27 Milliarden Parameter gegen ungefähr 15,2 Milliarden, beide frei herunterladbar, beide auf Qwe​n-Backbones aufgebaut – und sie sind überhaupt nicht vergleichbar. UI-Mate-27B ist ein Foundation-GUI-Agent: Er beobachtet Live-Screenshots, plant anhand dessen, was gerade auf dem Bildschirm zu sehen ist, und gibt strukturierte Maus- und Tastaturaktionen für einen echten Desktop aus. PixelUMM ist ein encoderfreies, einheitliches multimodales Modell, das Bilder und Videos im rohen Pixelraum liest und aus Text Bilder und Videos erzeugt – es nimmt wahr und es erschafft, doch es hat keinen Aktionsraum, keinen Cursor und keine Möglichkeit, einen Bildschirm zu berühren. Das eine handelt in der Welt. Das andere beschreibt und bildet sie ab. Alles Folgende ergibt sich aus dieser Trennung, und die Lizenzierungslücke zwischen den beiden ist das Zweite, was Sie wissen müssen.

Beide Labore berichten ihre eigenen Zahlen, und keines verfügt über eine unabhängige Bewertung. Beide wurden still veröffentlicht – beim Stil der Veröffentlichung endet die Ähnlichkeit tatsächlich.

Akteur und Wahrnehmer

UI-Mate-27B führt eine Aufgabe allein anhand einer natürlichsprachigen Anweisung und Live-Screenshots aus. Es zieht Schlussfolgerungen aus dem sichtbaren Zustand, plant neu, wenn sich die Schnittstelle ändert, und gibt Reasoning, eine prägnante Aktionsbeschreibung sowie strukturierte Tool-Aufrufe zur Computernutzung über Maus, Tastatur, Scrollen, Warten, Nutzerinteraktion und Aufgabenabschluss aus. Sein herausragendes Merkmal ist die demonstrationsgesteuerte Ausführung: Zeigt man ihm einen Workflow einmal, passt es die aufgezeichnete Demonstration an die jeweilige Aufgabe an und betrachtet den aktuellen Screenshot als maßgeblich, wenn sich die Schnittstelle weiterentwickelt hat. Es wird aus Qwen3.6-27B heraus mit überwachtem Fine-Tuning und anschließendem Online-Reinforcement-Learning in ausführbaren GUI-Umgebungen feinabgestimmt und über vLLM mit einer OpenAI-kompatiblen Schnittstelle bereitgestellt.

• Gemeldete Benchmarks — OSWorld-Verified-Durchschnitt 77,0, WindowsAgentArena-Durchschnitt 66,2, OSWorkerBench strikte Erfolgsquote 41,00 und Fortschritt 76,86. Alle von Tencent gemeldet und nicht reproduziert.

• Aktionsraum — Maus, Tastatur, Scrollen, Warten, Benutzerinteraktion, Aufgabenabschluss, in einem normalisierten Koordinatenraum mit pyautogui-kompatiblen strukturierten Aufrufen.

• Hardware-Realität — 27B dicht, mit Tensor-Parallelität über zwei GPUs im eigenen Quick-Start von Tencent bereitgestellt, unter Apache-2.0.

• Ein wichtiger Vorbehalt direkt auf der Karte — UI-Mate-27B ist ein Agenten-Checkpoint und kein eigenständiges visuelles Chat-Modell. Tencent empfiehlt den offiziellen Prompt, den Antwort-Parser und das Interaktions-Harness aus seinem Repository. Richte es auf „Beschreibe dieses Bild“ und du verwendest das falsche Werkzeug.

PixelUMM besetzt den entgegengesetzten Pol. Seine gesamte Architektur ist ein Argument über die Repräsentation: kein VAE, kein Vision-Encoder, Bilder als 16×16-Pixel-Patches und Videos als raumzeitliche 4-Frame-Tubelets, direkt hinein in einen Decoder-only-Transformer über einlagige lineare Projektionen, mit einem Mixture-of-Transformers-Design, das geteilte Attention mit aufgabenspezifischen Parametern kombiniert. Das Verstehen ist autoregressiver Text; die Generierung ist Flow Matching im Pixelraum. Vier Checkpoints werden ausgeliefert, S8-F22-R05 als Standard, der Text-zu-Bild, Text-zu-Video mit 96 Frames und 24 fps sowie beide Verstehensrichtungen abdeckt.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Die beiden Release-Muster sind ein Paradebeispiel für Gegensätze.

UI-Mate-27B erschien am 14. August 2026 auf Hugging Face mit einer Modellkarte, einem arXiv-Preprint mit der Nummer 2608.15930, einer Projektseite, einem GitHub-Repository und einem dokumentierten Serving-Rezept. Zwischen diesem Zeitpunkt und Anfang Oktober kamen rund 780 Downloads und 93 Likes zusammen – bescheiden, aber ein normales Research-Agent-Release mit vollständigen Unterlagen.

PixelUMMs Spur ist anders geartet. Das GitHub-Repository wurde am 4. September 2026 erstellt; der arXiv-Preprint ist auf den 29. September datiert; das Hugging Face-Repository wurde am 1. Oktober 2026 um 21:40 UTC erstellt, Minuten nach dem letzten Commit des Repositorys. Weder ein NVIDIA-Blogbeitrag noch eine Pressemitteilung noch ein Launch-Thread ist dafür aufgetaucht. Der URL-Pfad der Projektseite selbst lautet noch immer pixelumm-project-page-preview. Seine Download-Zahl betrug null, als dies geschrieben wurde.

Eine Absicht hineinzulesen, ist ein Fehler — ein Labor kann ein Forschungsartefakt veröffentlichen und einen Launch später ansetzen. Was man wissen kann, ist enger und nützlicher: Das eine Modell hat einen offiziellen Serving-Pfad und zehn Wochen Downloads; das andere hat ein Paper, ein Repository und überhaupt keine Aussage des Anbieters.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Anzeigetafeln, die sich nicht überlappen

Es gibt keinen Benchmark, den beide Modelle ausweisen, was an sich schon der Punkt ist: Sie lösen nicht dasselbe Problem.

• Agentische Computernutzung — UI-Mate-27B: OSWorld-Verified 77,0, WindowsAgentArena 66,2. PixelUMM: kein Aktionsraum, daher ist keine Bewertung möglich.

• Bildverständnis — UI-Mate-27B: verwendet Screenshots als Agenteneingabe, wird nicht als allgemeines VLM bewertet. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.

• Video — UI-Mate-27B: keine. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.

• Generierung — UI-Mate-27B: keine. PixelUMM: GenEval 0,83 mit einem Prompt-Rewriter, DPG-Bench 85,74, VBench Teil 1 Qualität 84,10.

• Deployment-Kosten — UI-Mate-27B: 27B dense, verteilt auf etwa zwei GPUs via vLLM, plus das offizielle Harness. PixelUMM: etwa 30 GB verteilte Checkpoint-Shards, CUDA 13 mit aus dem Quellcode gebautem FlashAttention, ein zugangsbeschränktes Guardrail-Modell für den Videopfad und eine zweite Python-Umgebung dafür.

• Lizenz — UI-Mate-27B: Apache-2.0, Code und Gewichte. PixelUMM: Apache-2.0-Code, NVIDIA One-Way Noncommercial License für den Checkpoint.

• Skalierung — 27B dicht gegenüber etwa 15,2B insgesamt, wiedergegeben als „8B MoT“ in den Tabellen in PixelUMMs eigenem Paper.

Die einzige wirklich vergleichbare Aussage betrifft die Herkunft, und sie gilt für beide: Jede oben genannte Zahl stammt vom Anbieter selbst, keine wurde außerhalb des Labors, das sie erzeugt hat, erneut durchgeführt, und eines der beiden Modelle kennzeichnet seine eigenen Ergebnisse ausdrücklich als vorläufig.

Mit ihnen bauen – und warum Sie beide verwenden könnten

Diese beiden ergänzen sich besser, als dass sie konkurrieren. Ein Desktop-Automatisierungs-Stack will UI-Mate-27B für die Handlungsschicht und etwas, das über das Gesehene Schlussfolgerungen ziehen kann; eine Content- oder Inspektions-Pipeline will PixelUMMs Lesen und Generieren und kann mit einem Cursor nichts anfangen. Die Überschneidung liegt an der Wahrnehmungsgrenze, wo UI-Mate-27Bs Screenshot-Grounding aufgabenspezifisch und das von PixelUMM allgemein ist — dieselben Pixel, zwei völlig unterschiedliche Aufgaben.

Wenn man mehrere Modelle gegeneinander laufen lässt – den Agenten gegen ein Generalisten-VLM oder einen neuen Forschungs-Checkpoint gegen den, der bereits in Produktion ist –, liegen die Kosten des Vergleichs normalerweise in der Integration, nicht in der Inferenz: zwei API-Formen, zwei Authentifizierungsschemata, zwei Verträge. Das ist das Problem, das eine Routing-Schicht beseitigen soll, und genau hier zahlt sich das Design von OrcaRouter aus: ein Schlüssel für über 200 Modelle, durchgereichte Anbieter-Listenpreise mit 0 % Aufschlag, automatisches Failover über Anbieter hinweg sowie eine Routing-DSL plus Modellfusion, um mehrere Modelle zu einem einzigen Aufruf zusammenzusetzen. Weder PixelUMM noch UI-Mate-27B ist heute auf einem gehosteten Endpunkt verfügbar, und OrcaRouter routet keines von beiden — es geht also um den Workflow, wenn sie verfügbar sind, nicht um eine Aussage über die aktuelle Verfügbarkeit.

Welches für welchen Job?

Wenn die Aufgabe mit einem Klick, einem Tastendruck oder einem ausgefüllten Formular endet, gibt es hier nur einen Kandidaten, und der ist UI-Mate-27B. Es steht unter Apache-2.0, verfügt über ein arXiv-Paper und einen offiziellen Harness, und seine berichteten OSWorld- und WindowsAgentArena-Ergebnisse sind die Art von Behauptung, die jeder mit zwei GPUs und einem Windows- oder Ubuntu-Testimage überprüfen kann – was genau sie überprüfenswert macht, statt ihr zu vertrauen.

Wenn die Aufgabe mit einer Antwort oder einem Bild endet, ist PixelUMM das Modell, das es kann, und es ist in erster Linie ein Forschungsartefakt. Sein Paper ist ungewöhnlich ehrlich über die eigenen Grenzen und räumt ein, dass unterschiedliche Trainingsdaten bedeuten, dass sein Benchmark-Vergleich „nicht feststellen kann, welche Architektur überlegen ist". Sein Checkpoint ist nicht kommerziell nutzbar. Seine Stärken sind architektonische Neuheit und Breite, nicht State-of-the-Art-Zahlen, und sein unmittelbarer Wert liegt bei allen, die untersuchen, ob encoderfreie einheitliche Modelle im Video-Maßstab funktionieren. Laden Sie es herunter, um den Code zu lesen und die Demos auszuführen; laden Sie es nicht herunter, um ein Feature auszuliefern.

Die zweizeilige Zusammenfassung entspricht genau der, die die Beweise liefern: Ein Modell kann handeln und nicht erschaffen, das andere kann erschaffen und nicht handeln, und die Lizenzierungs- und Reifegradlücke zwischen ihnen wiegt schwerer als jede Parameterzahl.