Karta tytułowa hero dla porównania 'InternLumina-U2 vs Tencent UI-Mate-27B' z podtytułem 'Agent desktopowy, który możesz uruchomić już teraz, kontra model wizyjny, który możesz tylko przeczytać' i trzema chipami statystyk — 'UI-Mate-27B: obsługuje pulpit już dziś', 'InternLumina-U2: ujednolicona wizja, brak wag', 'Oba Apache-2.0, oba niezweryfikowane' — z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

InternLumina-U2 vs Tencent UI-Mate-27B: agent desktopowy, który możesz już teraz uruchomić, vs zunifikowany model wizyjny, o którym możesz tylko przeczytać

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencent UI-Mate-27B i InternLumina-U2 to dwa niepozorne wydania na licencji Apache-2.0 z chińskich laboratoriów, opublikowane w odstępie dwóch tygodni, i nie są konkurentami — właśnie dlatego warto je porównać. Tencent UI-Mate-27B, wydany jako otwarte wagi 14 sierpnia 2026 roku, to agent desktopowy: obserwuje ekran i generuje akcje myszy i klawiatury. InternLumina-U2, opublikowany jako kod inferencyjny 1 września 2026 roku przez Shanghai AI Laboratory, to model pretendujący do miana ujednoliconego modelu wizyjnego: twierdzi, że potrafi czytać obrazy, wideo i 3D oraz generować i edytować obrazy. Jeden działa na tym, co widzi; drugi, gdy wreszcie powstaną jego wagi, będzie mówił i rysował o tym, co widzi. Jeśli twoja praca polega na obsłudze pulpitu, tylko jeden z tych dwóch może to zrobić dzisiaj — i nie jest to ten z bardziej wymyślną architekturą.

Agent, który działa: Tencent UI-Mate-27B

UI-Mate-27B to bazowy agent GUI o otwartych wagach i 27 miliardach parametrów, stworzony przez zespół multimodalnych agentów HY Frontier z Tencent, dostrojony na bazie Qwen3.6-27B. Obserwuje zrzuty ekranu na żywo, rozumuje na podstawie bieżącego stanu ekranu i generuje ustrukturyzowane akcje klawiatury i myszy w znormalizowanej przestrzeni współrzędnych — artefakt modelu wytrenowanego do obsługi realnego pulpitu, a nie do czatowania o nim. Jego wyróżnikiem jest działanie sterowane demonstracją: wystarczy raz pokazać mu przebieg pracy (workflow), a on dostosowuje zarejestrowaną demonstrację do bieżącego zadania, traktując zrzut ekranu na żywo jako rozstrzygający, gdy interfejs różni się od tego zarejestrowanego. Flagowe wyniki zgłoszone przez Tencent to OSWorld-Verified 77,0 i WindowsAgentArena 66,2 — wartości, które zajęłyby czołowe miejsca w rankingach z 2026, gdyby doczekały się niezależnej reprodukcji — a obok nich cały wachlarz liczb z OSWorkerBench. Wagi modelu są prawdziwe i można je pobrać: dwanaście shardów safetensors na Hugging Face, samodzielne hostowanie przez vLLM lub SGLang na kilku GPU. Do tego karta modelu zawiera ważne zastrzeżenie: to punkt kontrolny agenta, a nie samodzielny model do czatu wizualnego — jeśli skierujesz do niego prośbę „opisz ten obrazek”, używasz go w niewłaściwy sposób.

Obiecane oczy: InternLumina-U2

InternLumina-U2 to zupełnie inny gatunek. To rzadki model dyfuzyjny typu mixture-of-experts z 16 miliardami parametrów (1 miliard aktywnych), który laboratorium zamierza jako jeden model do wszechstronnego rozumienia wizualnego, generowania obrazów i edycji obrazów — w pełni dyskretna konstrukcja z ośmioma codebookami, w której pojedynczy backbone czyta obraz, wykres, wideo lub zasób 3D, a także zapisuje nowe piksele. Jeśli twój model mentalny to agent GUI, InternLumina-U2 jest przeciwnym biegunem: nie chce niczego klikać — chce wszystko zrozumieć i rysować na żądanie. Jego opublikowana 1 września 2026 r. forma to kod wnioskowania i architektura: sześć punktów wejścia zadań w repozytorium GitHub, strona projektu ze wstępną tabelą benchmarków, pusty stub na Hugging Face — a jego wagi, kod treningowy i raport techniczny wciąż są oznaczone jako „coming soon”. Nikt nie może go uruchomić. Różnica między tymi dwoma modelami nie polega na jakości; polega na istnieniu.

Tablica wyników

Wyniki UI-Mate-27B pochodzą od Tencent i nie zostały odtworzone; wyniki InternLumina-U2 pochodzą z laboratorium i mają charakter wstępny oraz częściowy. Każdy wiersz zawiera informację o swoim pochodzeniu.

• Zadanie — Tencent UI-Mate-27B: obsługa pulpitu — odczyt na żywo zrzutów ekranu, emitowanie akcji myszy i klawiatury. InternLumina-U2: percepcja i tworzenie — rozumienie obrazów/wideo/3D, generowanie i edycja obrazów.

• Wagi — Tencent UI-Mate-27B: publiczne od 14 sierpnia 2026, dwanaście shardów safetensors, Apache-2.0. InternLumina-U2: niepubliczne — puste repozytorium Hugging Face, wagi „wkrótce”.

• Skala — gęsty model 27B, dostrojony z Qwen3.6-27B, vs rzadki model dyfuzyjny MoE: 16B łącznie / 1B aktywnych.

Wyjście — Tencent UI-Mate-27B: ustrukturyzowane działania zgodne z pyautogui w znormalizowanej przestrzeni współrzędnych. InternLumina-U2: deklaruje obsługę tekstu, generowanie obrazu z tekstu do 1024×1024 oraz edycję obrazów na podstawie instrukcji.

• Kluczowe wyniki — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench: wzrosty dzięki demonstracjom (wszystkie dane od Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (dane laboratoryjne, wstępne).

• Zastrzeżenie dotyczące pochodzenia — Tencent UI-Mate-27B: sama karta ostrzega, że jest to punkt kontrolny agenta, a nie samodzielny model czatu wizualnego. InternLumina-U2: strona projektu określa własne wyniki jako „wstępne, częściowe".

• Rzeczywistość serwowania — Tencent UI-Mate-27B: samodzielny hosting przez vLLM lub SGLang na ~2 GPU; żaden zewnętrzny dostawca inferencji obecnie go nie wdraża. InternLumina-U2: nie może być serwowany przez nikogo — opublikowany sterownik wymaga punktów kontrolnych, których nie ma w repozytorium.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Dwa różne smaki nieudowodnionego.

Oba modele są niepotwierdzone, ale słowo to nie znaczy za każdym razem tego samego. Tencent UI-Mate-27B jest niepotwierdzony w zwykłym sensie nowego modelu: jego flagowe wyniki pochodzą od samego producenta, nikt ich niezależnie nie powtórzył, a liczba pobrań jest znikoma w porównaniu z deklaracjami — typowa sytuacja dla checkpointu, który na pierwszy rzut oka ma cztery dni, a który od tego czasu zyskał skromną społeczność. Jest on jednak niepotwierdzony w sposób testowalny. Ponieważ wagi istnieją, wyniki 66.2 i 77.0 może w tym tygodniu sprawdzić każdy, kto ma dwa GPU i środowisko testowe Windows, a twierdzenia oparte na demonstracjach można odtworzyć lub obalić na rzeczywistych przepływach pracy. InternLumina-U2 jest niepotwierdzony w ściślejszym sensie: jest nietestowalny. Jego architektura jest publiczna i czytelna, lecz liczby już nie — nie istnieje żaden artefakt, który mógłby je potwierdzić, a częściowa tabela samego laboratorium już pokazuje, że ustępuje wymienionemu z nazwy rywalowi w co najmniej jednym benchmarku generacji. Liczba producenta przypisana do pliku do pobrania to twierdzenie oczekujące na arbitra. Liczba producenta przypisana do mapy drogowej to nadzieja.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

Karta Hugging Face modelu tencent/UI-Mate-27B, przechwycona 27 sierpnia 2026 r. — baza Qwen3.6-27B, wyniki OSWorld i WindowsAgentArena zgłoszone przez dostawcę oraz notatka, że żaden dostawca wnioskowania nie wdraża obecnie tego modelu.

Naturalny podział pracy: aktor i jego oczy

Zestawione obok siebie oba modele zarysowują kształt niezawodnego potoku automatyzacji. Trudny problem z agentami GUI nie dotyczy typowego przypadku; polega na tym, że agent po cichu robi coś złego w nieoczekiwanym stanie ekranu i nikt tego nie zauważa. Właśnie do tego służy tani, godny zaufania model wizyjny — do weryfikowania stanu ekranu przed każdą akcją i po każdej akcji, potwierdzania, że okno dialogowe, które się pojawiło, jest tym, które według agenta się pojawiło, oraz zatrzymywania pętli, gdy rzeczywistość i model rzeczywistości agenta zaczynają się rozchodzić. Tencent UI-Mate-27B jest aktorem; zunifikowany model wizyjny tego rodzaju, jakim według własnych deklaracji jest InternLumina-U2, jest naturalnym weryfikatorem, zdolnym odczytywać te same zrzuty ekranu, na których działa agent. Wtedy — i tylko wtedy — gdy wagi InternLumina-U2 rzeczywiście zostaną udostępnione, a jej deklaracje o zdolności rozumienia przetrwają niezależne testy, będzie to rola, którą InternLumina-U2 mogłaby pełnić u boku agenta, a nie przeciwko niemu. Te dwa modele nie są rywalami do jednego zadania; są dwiema połowami jednego zadania.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

Repozytorium GitHub InternLM/InternLumina-U2, zrzut z 2 września 2026 r. — strona główna repozytorium pokazująca skrypty inferencyjne dla poszczególnych zadań, w tym punkt wejścia do rozumienia obrazu, na bazie którego można zbudować weryfikator stanu ekranu; wagi, które umożliwiłyby jego uruchomienie, nie znajdują się w drzewie repozytorium.

Co warstwa routingu robi dla stacku agent-plus-eyes

Żaden z tych modeli nie jest hostowany na OrcaRouter i nie będziemy sugerować, że jest inaczej — Tencent UI-Mate-27B nie ma nigdzie dostawcy hostingu, a InternLumina-U2 nie ma wag, które jakikolwiek dostawca mógłby hostować. Właściwy wzorzec routingu to ten przewidziany dla dokładnie takiej architektury: agent, który działa, i model wizyjny, który weryfikuje, złożone tak, aby kosztowny lub ryzykowny krok był warunkowany przez tani i niezawodny. DSL routingu wyraża to jako pojedyncze wywołanie logiczne — działaj, potem weryfikuj, potem kontynuuj lub zatrzymaj się — zamiast szytego na miarę kodu łączącego dwóch dostawców modeli, a automatyczne przełączanie awaryjne pokrywa realistyczny scenariusz awarii: agent GUI, taki jak UI-Mate-27B, to dokładnie ten rodzaj niesprawdzonego punktu kontrolnego, który najpierw testuje się na ścieżce testowej, a gdy nowy model zacznie źle działać, wywołanie przechodzi do sprawdzonego modelu. Jedno API dla ponad 200 hostowanych modeli, cena katalogowa dostawcy przekazywana dalej bez narzutu, a niesprawdzone elementy stosu pozostają za barierkami bezpieczeństwa, dopóki nie zdobędą Twojego zaufania.

Najważniejsze

Jeśli budujesz coś, co obsługuje pulpit, Tencent UI-Mate-27B jest jedynym z tych dwóch, który istnieje w użytecznym sensie — uruchamialnym już dziś na twoich własnych GPU, z imponującymi, ale niezreprodukowanymi wynikami, które możesz faktycznie przetestować. Jeśli budujesz coś, co potrzebuje modelu do rozumienia i rysowania tego, co widzi, InternLumina-U2 to obiecująca architektura czekająca na swoje wagi — warto ją przeczytać już teraz, ale jako zależność jest warta nic, dopóki nie pojawią się pliki safetensors. Obserwuj oba rozwiązania do dnia, w którym podział pracy stanie się możliwy: aktor na twoim pulpicie, zestaw zweryfikowanych oczu, które go obserwują, oraz warstwa routingu pilnująca, żeby nie oszukiwały.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube