
InternLumina-U2 vs Tencent UI-Mate-27B: agent desktopowy, który możesz już teraz uruchomić, vs zunifikowany model wizyjny, o którym możesz tylko przeczytać
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Tencent UI-Mate-27B i InternLumina-U2 to dwa niepozorne wydania na licencji Apache-2.0 z chińskich laboratoriów, opublikowane w odstępie dwóch tygodni, i nie są konkurentami — właśnie dlatego warto je porównać. Tencent UI-Mate-27B, wydany jako otwarte wagi 14 sierpnia 2026 roku, to agent desktopowy: obserwuje ekran i generuje akcje myszy i klawiatury. InternLumina-U2, opublikowany jako kod inferencyjny 1 września 2026 roku przez Shanghai AI Laboratory, to model pretendujący do miana ujednoliconego modelu wizyjnego: twierdzi, że potrafi czytać obrazy, wideo i 3D oraz generować i edytować obrazy. Jeden działa na tym, co widzi; drugi, gdy wreszcie powstaną jego wagi, będzie mówił i rysował o tym, co widzi. Jeśli twoja praca polega na obsłudze pulpitu, tylko jeden z tych dwóch może to zrobić dzisiaj — i nie jest to ten z bardziej wymyślną architekturą.
Agent, który działa: Tencent UI-Mate-27B
UI-Mate-27B to bazowy agent GUI o otwartych wagach i 27 miliardach parametrów, stworzony przez zespół multimodalnych agentów HY Frontier z Tencent, dostrojony na bazie Qwen3.6-27B. Obserwuje zrzuty ekranu na żywo, rozumuje na podstawie bieżącego stanu ekranu i generuje ustrukturyzowane akcje klawiatury i myszy w znormalizowanej przestrzeni współrzędnych — artefakt modelu wytrenowanego do obsługi realnego pulpitu, a nie do czatowania o nim. Jego wyróżnikiem jest działanie sterowane demonstracją: wystarczy raz pokazać mu przebieg pracy (workflow), a on dostosowuje zarejestrowaną demonstrację do bieżącego zadania, traktując zrzut ekranu na żywo jako rozstrzygający, gdy interfejs różni się od tego zarejestrowanego. Flagowe wyniki zgłoszone przez Tencent to OSWorld-Verified 77,0 i WindowsAgentArena 66,2 — wartości, które zajęłyby czołowe miejsca w rankingach z 2026, gdyby doczekały się niezależnej reprodukcji — a obok nich cały wachlarz liczb z OSWorkerBench. Wagi modelu są prawdziwe i można je pobrać: dwanaście shardów safetensors na Hugging Face, samodzielne hostowanie przez vLLM lub SGLang na kilku GPU. Do tego karta modelu zawiera ważne zastrzeżenie: to punkt kontrolny agenta, a nie samodzielny model do czatu wizualnego — jeśli skierujesz do niego prośbę „opisz ten obrazek”, używasz go w niewłaściwy sposób.
Obiecane oczy: InternLumina-U2
InternLumina-U2 to zupełnie inny gatunek. To rzadki model dyfuzyjny typu mixture-of-experts z 16 miliardami parametrów (1 miliard aktywnych), który laboratorium zamierza jako jeden model do wszechstronnego rozumienia wizualnego, generowania obrazów i edycji obrazów — w pełni dyskretna konstrukcja z ośmioma codebookami, w której pojedynczy backbone czyta obraz, wykres, wideo lub zasób 3D, a także zapisuje nowe piksele. Jeśli twój model mentalny to agent GUI, InternLumina-U2 jest przeciwnym biegunem: nie chce niczego klikać — chce wszystko zrozumieć i rysować na żądanie. Jego opublikowana 1 września 2026 r. forma to kod wnioskowania i architektura: sześć punktów wejścia zadań w repozytorium GitHub, strona projektu ze wstępną tabelą benchmarków, pusty stub na Hugging Face — a jego wagi, kod treningowy i raport techniczny wciąż są oznaczone jako „coming soon”. Nikt nie może go uruchomić. Różnica między tymi dwoma modelami nie polega na jakości; polega na istnieniu.
Tablica wyników
Wyniki UI-Mate-27B pochodzą od Tencent i nie zostały odtworzone; wyniki InternLumina-U2 pochodzą z laboratorium i mają charakter wstępny oraz częściowy. Każdy wiersz zawiera informację o swoim pochodzeniu.
• Zadanie — Tencent UI-Mate-27B: obsługa pulpitu — odczyt na żywo zrzutów ekranu, emitowanie akcji myszy i klawiatury. InternLumina-U2: percepcja i tworzenie — rozumienie obrazów/wideo/3D, generowanie i edycja obrazów.
• Wagi — Tencent UI-Mate-27B: publiczne od 14 sierpnia 2026, dwanaście shardów safetensors, Apache-2.0. InternLumina-U2: niepubliczne — puste repozytorium Hugging Face, wagi „wkrótce”.
• Skala — gęsty model 27B, dostrojony z Qwen3.6-27B, vs rzadki model dyfuzyjny MoE: 16B łącznie / 1B aktywnych.
Wyjście — Tencent UI-Mate-27B: ustrukturyzowane działania zgodne z pyautogui w znormalizowanej przestrzeni współrzędnych. InternLumina-U2: deklaruje obsługę tekstu, generowanie obrazu z tekstu do 1024×1024 oraz edycję obrazów na podstawie instrukcji.
• Kluczowe wyniki — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench: wzrosty dzięki demonstracjom (wszystkie dane od Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (dane laboratoryjne, wstępne).
• Zastrzeżenie dotyczące pochodzenia — Tencent UI-Mate-27B: sama karta ostrzega, że jest to punkt kontrolny agenta, a nie samodzielny model czatu wizualnego. InternLumina-U2: strona projektu określa własne wyniki jako „wstępne, częściowe".
• Rzeczywistość serwowania — Tencent UI-Mate-27B: samodzielny hosting przez vLLM lub SGLang na ~2 GPU; żaden zewnętrzny dostawca inferencji obecnie go nie wdraża. InternLumina-U2: nie może być serwowany przez nikogo — opublikowany sterownik wymaga punktów kontrolnych, których nie ma w repozytorium.

Dwa różne smaki nieudowodnionego.
Oba modele są niepotwierdzone, ale słowo to nie znaczy za każdym razem tego samego. Tencent UI-Mate-27B jest niepotwierdzony w zwykłym sensie nowego modelu: jego flagowe wyniki pochodzą od samego producenta, nikt ich niezależnie nie powtórzył, a liczba pobrań jest znikoma w porównaniu z deklaracjami — typowa sytuacja dla checkpointu, który na pierwszy rzut oka ma cztery dni, a który od tego czasu zyskał skromną społeczność. Jest on jednak niepotwierdzony w sposób testowalny. Ponieważ wagi istnieją, wyniki 66.2 i 77.0 może w tym tygodniu sprawdzić każdy, kto ma dwa GPU i środowisko testowe Windows, a twierdzenia oparte na demonstracjach można odtworzyć lub obalić na rzeczywistych przepływach pracy. InternLumina-U2 jest niepotwierdzony w ściślejszym sensie: jest nietestowalny. Jego architektura jest publiczna i czytelna, lecz liczby już nie — nie istnieje żaden artefakt, który mógłby je potwierdzić, a częściowa tabela samego laboratorium już pokazuje, że ustępuje wymienionemu z nazwy rywalowi w co najmniej jednym benchmarku generacji. Liczba producenta przypisana do pliku do pobrania to twierdzenie oczekujące na arbitra. Liczba producenta przypisana do mapy drogowej to nadzieja.

Karta Hugging Face modelu tencent/UI-Mate-27B, przechwycona 27 sierpnia 2026 r. — baza Qwen3.6-27B, wyniki OSWorld i WindowsAgentArena zgłoszone przez dostawcę oraz notatka, że żaden dostawca wnioskowania nie wdraża obecnie tego modelu.
Naturalny podział pracy: aktor i jego oczy
Zestawione obok siebie oba modele zarysowują kształt niezawodnego potoku automatyzacji. Trudny problem z agentami GUI nie dotyczy typowego przypadku; polega na tym, że agent po cichu robi coś złego w nieoczekiwanym stanie ekranu i nikt tego nie zauważa. Właśnie do tego służy tani, godny zaufania model wizyjny — do weryfikowania stanu ekranu przed każdą akcją i po każdej akcji, potwierdzania, że okno dialogowe, które się pojawiło, jest tym, które według agenta się pojawiło, oraz zatrzymywania pętli, gdy rzeczywistość i model rzeczywistości agenta zaczynają się rozchodzić. Tencent UI-Mate-27B jest aktorem; zunifikowany model wizyjny tego rodzaju, jakim według własnych deklaracji jest InternLumina-U2, jest naturalnym weryfikatorem, zdolnym odczytywać te same zrzuty ekranu, na których działa agent. Wtedy — i tylko wtedy — gdy wagi InternLumina-U2 rzeczywiście zostaną udostępnione, a jej deklaracje o zdolności rozumienia przetrwają niezależne testy, będzie to rola, którą InternLumina-U2 mogłaby pełnić u boku agenta, a nie przeciwko niemu. Te dwa modele nie są rywalami do jednego zadania; są dwiema połowami jednego zadania.

Repozytorium GitHub InternLM/InternLumina-U2, zrzut z 2 września 2026 r. — strona główna repozytorium pokazująca skrypty inferencyjne dla poszczególnych zadań, w tym punkt wejścia do rozumienia obrazu, na bazie którego można zbudować weryfikator stanu ekranu; wagi, które umożliwiłyby jego uruchomienie, nie znajdują się w drzewie repozytorium.
Co warstwa routingu robi dla stacku agent-plus-eyes
Żaden z tych modeli nie jest hostowany na OrcaRouter i nie będziemy sugerować, że jest inaczej — Tencent UI-Mate-27B nie ma nigdzie dostawcy hostingu, a InternLumina-U2 nie ma wag, które jakikolwiek dostawca mógłby hostować. Właściwy wzorzec routingu to ten przewidziany dla dokładnie takiej architektury: agent, który działa, i model wizyjny, który weryfikuje, złożone tak, aby kosztowny lub ryzykowny krok był warunkowany przez tani i niezawodny. DSL routingu wyraża to jako pojedyncze wywołanie logiczne — działaj, potem weryfikuj, potem kontynuuj lub zatrzymaj się — zamiast szytego na miarę kodu łączącego dwóch dostawców modeli, a automatyczne przełączanie awaryjne pokrywa realistyczny scenariusz awarii: agent GUI, taki jak UI-Mate-27B, to dokładnie ten rodzaj niesprawdzonego punktu kontrolnego, który najpierw testuje się na ścieżce testowej, a gdy nowy model zacznie źle działać, wywołanie przechodzi do sprawdzonego modelu. Jedno API dla ponad 200 hostowanych modeli, cena katalogowa dostawcy przekazywana dalej bez narzutu, a niesprawdzone elementy stosu pozostają za barierkami bezpieczeństwa, dopóki nie zdobędą Twojego zaufania.
Najważniejsze
Jeśli budujesz coś, co obsługuje pulpit, Tencent UI-Mate-27B jest jedynym z tych dwóch, który istnieje w użytecznym sensie — uruchamialnym już dziś na twoich własnych GPU, z imponującymi, ale niezreprodukowanymi wynikami, które możesz faktycznie przetestować. Jeśli budujesz coś, co potrzebuje modelu do rozumienia i rysowania tego, co widzi, InternLumina-U2 to obiecująca architektura czekająca na swoje wagi — warto ją przeczytać już teraz, ale jako zależność jest warta nic, dopóki nie pojawią się pliki safetensors. Obserwuj oba rozwiązania do dnia, w którym podział pracy stanie się możliwy: aktor na twoim pulpicie, zestaw zweryfikowanych oczu, które go obserwują, oraz warstwa routingu pilnująca, żeby nie oszukiwały.
