Wygenerowana karta tytułowa w firmowym stylu OrcaRouter z napisem „PixelUMM vs UI-Mate-27B”, z czterema kafelkami statystyk: „77.0” (raportowana przez UI-Mate-27B średnia OSWorld-Verified), „66.2” (jego średnia WindowsAgentArena), „brak” (przestrzeń akcji PixelUMM) i „Apache-2.0” (licencja UI-Mate-27B na kod i wagi, w porównaniu z niekomercyjnym checkpointem PixelUMM). Wiersz stopki brzmi: „Wyniki agentów raportowane przez Tencent; dane PixelUMM z jego preprintu. Brak niezależnego powtórzenia.” Logo OrcaRouter jest wkomponowane w pas z paddingiem w prawym dolnym rogu.
Guides & Insights

PixelUMM vs UI-Mate-27B: Jeden model rysuje to, co widzi, drugi to klika

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tencen​t UI-Mate-27B i NVIDIA PixelUMM wyglądają porównywalnie na karcie specyfikacji — 27 miliardów parametrów wobec około 15,2 miliarda, oba ogólnodostępne do pobrania, oba zbudowane na szkieletach Qwe​n — a wcale nie są porównywalne. UI-Mate-27B to bazowy agent GUI: obserwuje obrazy ekranu na żywo, planuje na podstawie tego, co aktualnie znajduje się na ekranie, i emituje ustrukturyzowane działania myszy i klawiatury dla prawdziwego pulpitu. PixelUMM to pozbawiony enkodera zunifikowany model multimodalny, który odczytuje obrazy i wideo w surowej przestrzeni pikseli i generuje obrazy oraz wideo z tekstu — postrzega i tworzy, ale nie ma przestrzeni akcji, nie ma kursora ani sposobu, by dotknąć ekranu. Jeden działa na świat. Drugi go opisuje i przedstawia. Wszystko poniżej wynika z tego podziału, a różnica w licencjach między nimi to druga rzecz, którą trzeba wiedzieć.

Oba laboratoria podają własne liczby i żadne z nich nie ma niezależnej oceny. Oba opublikowały wyniki po cichu — i właśnie na stylu publikacji to podobieństwo się kończy.

Aktor i spostrzegający

UI-Mate-27B wykonuje zadanie wyłącznie na podstawie instrukcji w języku naturalnym i zrzutów ekranu na żywo. Rozumuje nad widocznym stanem, planuje ponownie w miarę zmian interfejsu i generuje rozumowanie, zwięzły opis działania oraz ustrukturyzowane wywołania narzędzi do obsługi komputera obejmujące mysz, klawiaturę, przewijanie, oczekiwanie, interakcję z użytkownikiem i ukończenie zadania. Jego wyróżniającą cechą jest wykonywanie sterowane demonstracją: pokaż mu raz przepływ pracy, a dostosuje zarejestrowaną demonstrację do bieżącego zadania, traktując bieżący zrzut ekranu jako miarodajny, gdy interfejs się zmienił. Został dostrojony z modelu Qwen3.6-27B za pomocą dostrajania nadzorowanego, po którym następuje uczenie ze wzmocnieniem online w wykonywalnych środowiskach GUI, i jest udostępniany przez vLLM z interfejsem zgodnym z OpenAI.

• Zgłoszone wyniki testów — OSWorld-Verified średnio 77,0, WindowsAgentArena średnio 66,2, OSWorkerBench ścisły wskaźnik sukcesu 41,00 i postęp 76,86. Wszystkie zgłoszone przez Tencent i niezweryfikowane.

• Przestrzeń akcji — mysz, klawiatura, przewijanie, oczekiwanie, interakcja z użytkownikiem, ukończenie zadania, w znormalizowanej przestrzeni współrzędnych z ustrukturyzowanymi wywołaniami zgodnymi z pyautogui.

• Rzeczywistość sprzętowa — gęsty model 27B, obsługiwany z równoległością tensorową na dwóch GPU we własnym quick-start Tencent, na licencji Apache-2.0.

• Ważne zastrzeżenie na samej karcie — UI-Mate-27B to checkpoint agenta, a nie samodzielny model czatu wizualnego. Tencent zaleca oficjalny prompt, parser odpowiedzi i środowisko interakcji z jego repozytorium. Skieruj go na „opisz ten obraz”, a używasz niewłaściwego narzędzia.

PixelUMM zajmuje przeciwny biegun. Cała jego architektura jest argumentem o reprezentacji: żadnego VAE, żadnego enkodera wizyjnego, obrazy jako 16×16-pikselowe patche, a wideo jako 4-ramkowe czasoprzestrzennne tubelety, prosto do Transformera typu decoder-only poprzez jednowarstwowe rzutowania liniowe, z projektem Mixture-of-Transformers łączącym współdzieloną uwagę z parametrami specyficznymi dla zadania. Rozumienie to autoregresyjny tekst; generacja to dopasowywanie przepływu w przestrzeni pikseli. Dostarczane są cztery checkpointy, S8-F22-R05 jako domyślny, obejmujący text-to-image, text-to-video przy 96 klatkach i 24 fps oraz oba kierunki rozumienia.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Te dwa wzorce wydań to studium kontrastu.

UI-Mate-27B pojawił się na Hugging Face 14 sierpnia 2026 r. z kartą modelu, preprintem arXiv o numerze 2608.15930, stroną projektu, repozytorium GitHub i udokumentowanym przepisem serwowania. Od tego czasu do początku października zgromadził około 780 pobrań i 93 polubienia — skromny wynik, ale to normalne wydanie agenta badawczego z dokumentacją w należytym porządku.

Ślad PixelUMM jest innego rodzaju. Repozytorium GitHub zostało utworzone 4 września 2026 r.; preprint na arXiv jest datowany na 29 września; repozytorium Hugging Face zostało utworzone o 21:40 UTC 1 października 2026 r., kilka minut po ostatnim commicie w repozytorium. Nie pojawił się żaden wpis na blogu NVIDIA, komunikat prasowy ani wątek premiery. Ścieżka URL samej strony projektu wciąż brzmi pixelumm-project-page-preview. W momencie pisania tego tekstu liczba jego pobrań wynosiła zero.

Doszukiwanie się w tym intencji jest błędem — laboratorium może opublikować artefakt badawczy i zaplanować premierę później. To, co można wiedzieć, jest węższe i bardziej użyteczne: jeden model ma oficjalną ścieżkę udostępniania i dziesięć tygodni pobrań; drugi ma artykuł, repozytorium i żadnego oświadczenia dostawcy.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Tablice wyników, które się nie nakładają

Nie istnieje żaden benchmark, który raportowałyby oba modele — i na tym właśnie polega rzecz: nie rozwiązują tego samego problemu.

• Agentowe korzystanie z komputera — UI-Mate-27B: OSWorld-Verified 77,0, WindowsAgentArena 66,2. PixelUMM: brak przestrzeni akcji, więc nie można uzyskać wyniku.

• Rozumienie obrazu — UI-Mate-27B: przyjmuje zrzuty ekranu jako dane wejściowe agenta, nie jest oceniany jako ogólny VLM. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.

• Wideo — UI-Mate-27B: brak. PixelUMM: MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, LVBench 40,41.

• Generowanie — UI-Mate-27B: brak. PixelUMM: GenEval 0,83 z modułem przepisywania promptów, DPG-Bench 85,74, jakość VBench Part 1: 84,10.

• Koszt wdrożenia — UI-Mate-27B: gęsty model 27B rozłożony na około dwóch GPU przez vLLM, plus oficjalny harness. PixelUMM: około 30 GB shardów rozproszonego checkpointu, CUDA 13 z FlashAttention zbudowanym ze źródeł, model guardrail z ograniczonym dostępem dla ścieżki wideo i drugie środowisko Python dla niego.

• Licencja — UI-Mate-27B: Apache-2.0, kod i wagi. PixelUMM: kod na licencji Apache-2.0, licencja NVIDIA One-Way Noncommercial License na checkpoint.

• Skala — 27B w modelu gęstym w porównaniu z około 15,2B łącznie, przedstawione jako „8B MoT" w tabelach samej publikacji PixelUMM.

Jedynym naprawdę porównywalnym stwierdzeniem jest to dotyczące pochodzenia danych i odnosi się ono do obu: każda z powyższych liczb pochodzi od samego dostawcy, żadnej nie powtórzono poza laboratorium, które ją wygenerowało, a jeden z dwóch modeli wyraźnie określa własne wyniki jako wstępne.

Budowanie z nimi i dlaczego możesz użyć obu

Te dwa komponują się lepiej, niż ze sobą konkurują. Stos automatyzacji pulpitu potrzebuje UI-Mate-27B w warstwie działania oraz czegoś, co potrafi wnioskować o tym, co zobaczył; pipeline treści lub inspekcji potrzebuje odczytu i generowania PixelUMM i nie potrzebuje kursora. Wspólny obszar leży na granicy percepcji, gdzie ugruntowanie UI-Mate-27B na zrzutach ekranu jest specyficzne dla zadania, a PixelUMM — ogólne: te same piksele, dwa całkowicie różne zadania.

Kiedy faktycznie zestawiasz ze sobą kilka modeli — agenta przeciwko ogólnemu VLM albo nowy checkpoint badawczy przeciwko temu już produkcyjnemu — koszt porównania to zwykle integracja, a nie wnioskowanie: dwa kształty API, dwa schematy uwierzytelniania, dwa kontrakty. To problem, który ma usunąć warstwa routingu, i tu projekt OrcaRouter procentuje: jeden klucz na ponad 200 modeli, ceny katalogowe dostawców przekazywane przy 0% marży, automatyczne przełączanie awaryjne między dostawcami oraz DSL routingu i fuzja modeli do składania kilku modeli w jedno wywołanie. Ani PixelUMM, ani UI-Mate-27B nie znajdują się dziś na żadnym hostowanym endpoincie, a OrcaRouter nie routuje żadnego z nich — więc chodzi o proces pracy, gdy się pojawią, a nie o twierdzenie o obecnej dostępności.

Który do którego zadania

Jeśli zadanie kończy się kliknięciem, naciśnięciem klawisza lub wypełnionym formularzem, jest tu tylko jeden kandydat i jest nim UI-Mate-27B. Jest na licencji Apache-2.0, ma artykuł na arXiv i oficjalny harness, a podawane wyniki OSWorld i WindowsAgentArena to rodzaj twierdzenia, które może sprawdzić każdy, kto ma dwa GPU oraz obraz testowy Windows lub Ubuntu — i to jest dokładnie to, co sprawia, że warto je sprawdzić, zamiast mu ufać.

Jeśli zadanie kończy się odpowiedzią lub obrazem, PixelUMM jest tym, który potrafi to zrobić, i jest przede wszystkim artefaktem badawczym. Jego artykuł jest niezwykle szczery co do własnych ograniczeń, przyznając, że różniące się dane treningowe oznaczają, iż jego porównanie benchmarków „nie może ustalić, która architektura jest lepsza”. Jego checkpoint jest niekomercyjny. Jego mocne strony to nowatorstwo architektoniczne i szeroki zakres, a nie wyniki na poziomie state-of-the-art, a jego bezpośrednia wartość jest dla każdego, kto bada, czy modele zunifikowane bez enkodera działają w skali wideo. Pobierz go, aby przeczytać kod i uruchomić dema; nie pobieraj go, aby wdrażać funkcję.

To dwuwersowe podsumowanie jest tym samym, które wynika z dowodów: jeden model może działać, ale nie może tworzyć, drugi może tworzyć, ale nie może działać, a różnica w licencjonowaniu i dojrzałości między nimi ma większe znaczenie niż jakakolwiek liczba parametrów.