Eine Hero-Titelkarte für den Vergleich 'InternLumina-U2 vs. Tencent UI-Mate-27B' mit dem Untertitel 'Der Desktop-Agent, den Sie jetzt ausführen können, vs. das Vision-Modell, über das Sie nur lesen können' und drei Statistik-Chips — 'UI-Mate-27B: bedient heute einen Desktop', 'InternLumina-U2: einheitliche Vision, keine Gewichte', 'Beide Apache-2.0, beide unbewiesen' — mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

InternLumina-U2 vs Tencent UI-Mate-27B: Der Desktop-Agent, den Sie jetzt nutzen können, vs. das einheitliche Vision-Modell, von dem Sie nur lesen können

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent UI-Mate-27B und InternLumina-U2 sind zwei unauffällige Apache-2.0-Veröffentlichungen aus chinesischen Laboren, die im Abstand von zwei Wochen erschienen sind – und sie sind keine Konkurrenten, genau deshalb lohnt sich ihr Vergleich. Tencent UI-Mate-27B, das am 14. August 2026 mit offenen Gewichten veröffentlicht wurde, ist ein Desktop-Agent: Es beobachtet den Bildschirm und gibt Maus- und Tastaturaktionen aus. InternLumina-U2, das am 1. September 2026 vom Shanghai AI Laboratory als Inferenzcode veröffentlicht wurde, soll ein einheitliches Vision-Modell sein: Es beansprucht, Bilder, Videos und 3D zu verstehen sowie Bilder zu erzeugen und zu bearbeiten. Das eine handelt nach dem, was es sieht; das andere wird, sobald seine Gewichte endlich existieren, über das Gesehene sprechen und zeichnen. Wenn Ihre Aufgabe darin besteht, einen Desktop zu bedienen, kann das heute nur eines dieser beiden – und es ist nicht das mit der ausgefalleneren Architektur.

Der handelnde Agent: Tencent UI-Mate-27B

UI-Mate-27B ist ein Foundation-GUI-Agent mit offenen Gewichten und 27 Milliarden Parametern vom multimodalen Agententeam HY Frontier von Tencent, feinabgestimmt auf Basis von Qwen3.6-27B. Das Modell beobachtet Live-Screenshots, analysiert den aktuellen Bildschirmzustand und gibt strukturierte Tastatur- und Mausaktionen in einem normalisierten Koordinatenraum aus – das Produkt eines Modells, das darauf trainiert wurde, einen echten Desktop zu bedienen, statt über einen zu chatten. Seine herausragende Eigenschaft ist die demonstrationsgesteuerte Ausführung: Zeigen Sie ihm einmal einen Arbeitsablauf, und es passt die aufgezeichnete Demonstration an die jeweilige Aufgabe an, wobei es den Live-Screenshot als maßgeblich betrachtet, wenn sich die Benutzeroberfläche von dem unterscheidet, was aufgezeichnet wurde. Die von Tencent gemeldeten Top-Werte sind OSWorld-Verified 77.0 und WindowsAgentArena 66.2 – Werte, die diese 2026er-Bestenlisten anführen würden, wenn sie unabhängig reproduziert würden –, zusammen mit einer Reihe von OSWorkerBench-Zahlen. Die Gewichte sind real und herunterladbar: zwölf Safetensors-Shards auf Hugging Face, selbst hostbar über vLLM oder SGLang auf ein paar GPUs. Die Modellkarte enthält zudem einen wichtigen Hinweis: Es handelt sich um einen Agenten-Checkpoint und nicht um ein eigenständiges visuelles Chat-Modell – wer es mit „describe this image“ füttert, nutzt es falsch.

Die verheißenen Augen: InternLumina-U2

InternLumina-U2 ist eine völlig andere Spezies. Es ist ein Sparse-Mixture-of-Experts-Diffusionsmodell mit 16 Milliarden Parametern (davon 1 Milliarde aktiv), das das Labor als ein einziges Modell für omni-visuelles Verständnis, Bildgenerierung und Bildbearbeitung vorsieht – ein vollständig diskretes Acht-Codebook-Design, bei dem ein einziger Backbone sowohl ein Bild, ein Diagramm, ein Video oder ein 3D-Asset liest als auch neue Pixel schreibt. Wenn Ihr mentales Modell ein GUI-Agent ist, ist InternLumina-U2 der Gegenpol: Es will nichts anklicken, sondern alles verstehen und auf Wunsch zeichnen. Seine am 1. September 2026 veröffentlichte Fassung ist Inferenzcode und eine Architektur – sechs Task-Einstiegspunkte in einem GitHub-Repository, eine Projektseite mit einer vorläufigen Benchmark-Tabelle, ein leerer Hugging-Face-Stub – und seine Gewichte, Trainingscode und technischer Bericht sind alle noch mit „Coming soon“ gekennzeichnet. Niemand kann es ausführen. Der Unterschied zwischen den beiden Modellen ist nicht qualitativer, sondern existenzieller Natur.

Die Anzeigetafel

UI-Mate-27B-Zahlen wurden von Tencent gemeldet und nicht reproduziert; InternLumina-U2-Zahlen stammen aus Laborberichten und sind vorläufig und unvollständig. Jede Zeile trägt ihren Quellenhinweis.

• Aufgabe — Tencent UI-Mate-27B: Desktop bedienen — Live-Screenshots lesen, Maus- und Tastaturaktionen ausführen. InternLumina-U2: wahrnehmen und erstellen — Bilder/Videos/3D verstehen, Bilder generieren und bearbeiten.

• Gewichte — Tencent UI-Mate-27B: öffentlich seit 14. August 2026, zwölf Safetensors-Shards, Apache-2.0. InternLumina-U2: nicht öffentlich — leeres Hugging-Face-Repository, Gewichte „demnächst verfügbar“.

• Größe — 27B dichtes, aus Qwen3.6-27B feinabgestimmtes Modell vs. sparsames MoE-Diffusionsmodell mit 16B gesamt / 1B aktiv.

• Ausgabe — Tencent UI-Mate-27B: strukturierte pyautogui-kompatible Aktionen in einem normalisierten Koordinatenraum. InternLumina-U2: unterstützt Text, Text-zu-Bild bis zu 1024×1024 und anweisungsbasierte Bildbearbeitung.

• Kernzahlen — Tencent UI-Mate-27B: OSWorld-Verified 77,0; WindowsAgentArena 66,2; Zuwächse auf OSWorkerBench durch Demonstrationen (alle von Tencent gemeldet). InternLumina-U2: ChartQA 86,52; GenEval 0,81; MathVision 33,22 (vom Labor gemeldet, vorläufig).

• Provenienz-Hinweis — Tencent UI-Mate-27B: Die Model Card selbst warnt, dass es sich um einen Agent-Checkpoint handelt, nicht um ein eigenständiges visuelles Chat-Modell. InternLumina-U2: Die Projektseite bezeichnet ihre eigenen Ergebnisse als „vorläufig, unvollständig".

• Serving-Realität — Tencent UI-Mate-27B: selbst hosten über vLLM oder SGLang auf ~2 GPUs; kein gehosteter Inferenzanbieter stellt es derzeit bereit. InternLumina-U2: niemand kann es bereitstellen — der veröffentlichte Treiber erwartet Checkpoints, die nicht im Repository vorhanden sind.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Zwei verschiedene Spielarten des Unbewiesenen

Beide Modelle sind unbewiesen, und das Wort bedeutet nicht beide Male dasselbe. Tencent UI-Mate-27B ist im gewöhnlichen Sinne eines neuen Modells unbewiesen: Seine Spitzenwerte stammen vom Anbieter selbst, niemand hat sie unabhängig reproduziert, und die Download-Zahl ist winzig im Vergleich zu den Behauptungen – das übliche Muster für einen auf den ersten Blick vier Tage alten Checkpoint, der inzwischen eine bescheidene Community gefunden hat. Doch diese Unbewiesenheit ist überprüfbar. Weil die Gewichte existieren, können die 66.2 und die 77.0 noch diese Woche von jedem überprüft werden, der über zwei GPUs und eine Windows-Testumgebung verfügt, und die demonstrationsbasierten Behauptungen lassen sich anhand realer Workflows reproduzieren oder widerlegen. InternLumina-U2 ist in einem strengeren Sinne unbewiesen: Es ist nicht testbar. Seine Architektur ist öffentlich und nachvollziehbar, seine Zahlen sind es nicht – es gibt kein Artefakt, das sie bestätigen könnte, und die eigene unvollständige Tabelle des Labs zeigt bereits, dass es bei mindestens einem Generation-Benchmark hinter einem namentlich genannten Rivalen zurückliegt. Eine vom Anbieter genannte Zahl, die einer herunterladbaren Datei beigefügt ist, ist eine Behauptung, die auf einen Gutachter wartet. Eine vom Anbieter genannte Zahl, die auf einer Roadmap steht, ist eine Hoffnung.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

Die tencent/UI-Mate-27B Hugging-Face-Karte, erfasst am 27. August 2026 — die Qwen3.6-27B-Basis, die vom Anbieter gemeldeten OSWorld- und WindowsAgentArena-Werte sowie der Hinweis, dass derzeit kein Inferenzanbieter dieses Modell bereitstellt.

Die natürliche Arbeitsteilung: ein Akteur und seine Augen

Nebeneinander betrachtet umreißen die beiden Modelle die Form einer zuverlässigen Automatisierungspipeline. Das harte Problem mit GUI-Agenten ist nicht der Durchschnittsfall; es ist der Agent, der bei einem unerwarteten Bildschirmzustand still das Falsche tut – und niemand merkt es. Genau dafür gibt es ein billiges, vertrauenswürdiges Vision-Modell: den Bildschirmzustand vor und nach jeder Aktion verifizieren, bestätigen, dass der erschienene Dialog derselbe ist, von dem der Agent glaubt, dass er erschienen ist, und die Schleife stoppen, wenn die Realität und das Realitätsmodell des Agenten auseinanderdriften. Tencent UI-Mate-27B ist der Akteur; ein einheitliches Vision-Modell der Art, wie InternLumina-U2 es zu sein beansprucht, ist der natürliche Verifizierer, das in der Lage ist, dieselben Screenshots zu lesen, auf die der Agent einwirkt. Wenn – und nur wenn – die Gewichte von InternLumina-U2 tatsächlich veröffentlicht werden und seine Verständnisbehauptungen unabhängigen Tests standhalten, ist das die Rolle, die es neben einem Agenten einnehmen könnte, statt gegen ihn. Die beiden sind keine Rivalen um einen Job; sie sind die zwei Hälften eines Jobs.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

Das GitHub-Repository InternLM/InternLumina-U2, aufgenommen am 2. September 2026 — die Landingpage des Repos zeigt die aufgabenspezifischen Inferenzskripte, einschließlich des Einstiegspunkts für Bildverständnis, auf dem ein Screen-State-Verifier aufgebaut werden würde; die Gewichte, die es ausführbar machen würden, befinden sich nicht im Baum.

Was eine Routing-Schicht für einen Agent-plus-Augen-Stack leistet

Keines der beiden Modelle ist auf OrcaRouter gehostet, und wir werden das auch nicht suggerieren — Tencent UI-Mate-27B hat überhaupt keinen Hosting-Anbieter, und InternLumina-U2 hat keine Gewichte, die ein Anbieter hosten könnte. Das anwendbare Routing-Muster ist genau das für diese Architektur: ein Agent, der handelt, und ein Vision-Modell, das verifiziert, so kombiniert, dass der teure oder riskante Schritt vom günstigen, zuverlässigen abhängig gemacht wird. Die Routing-DSL drückt das als einen einzigen logischen Aufruf aus — handeln, dann verifizieren, dann fortfahren oder anhalten — statt als individuellen Klebcode zwischen zwei Modellanbietern, und automatisches Failover deckt den realistischen Fehlermodus ab: Ein GUI-Agent wie UI-Mate-27B ist genau die Art unerprobten Checkpoints, den man zuerst auf einem Testpfad erprobt, wobei der Aufruf in dem Moment auf ein bewährtes Modell durchgereicht wird, in dem sich das neue danebenbenimmt. Eine API für über 200 gehostete Modelle, Listenpreise der Anbieter ohne Aufschlag durchgereicht, und die unerprobten Teile des Stacks bleiben hinter Sicherheitsvorkehrungen, bis sie sich Ihr Vertrauen verdient haben.

Das Fazit

Wenn Sie etwas bauen, das einen Desktop bedient, ist Tencent UI-Mate-27B der einzige der beiden, der in einem brauchbaren Sinne existiert — heute auf Ihren eigenen GPUs lauffähig, mit beeindruckenden, aber nicht reproduzierten Ergebnissen, die Sie tatsächlich selbst testen können. Wenn Sie etwas bauen, das ein Modell braucht, das versteht und beschreibt, was es sieht, ist InternLumina-U2 eine vielversprechende Architektur, die auf ihre Gewichte wartet — jetzt schon lesenswert, aber als Abhängigkeit nichts wert, bis die Safetensors erscheinen. Behalten Sie beide im Auge bis zu dem Tag, an dem die Arbeitsteilung möglich wird: ein Akteur auf Ihrem Desktop, ein Satz verifizierter Augen, die ihn beobachten, und eine Routing-Schicht, die sie ehrlich hält.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube