Karta hero z tytułem dla UI-Mate-27B, fundamentowego agenta GUI o otwartych wagach od Tencenta, wydanego 14 sierpnia 2026 roku, pokazująca monitor z kursorem myszy i strzałkami automatyzacji, z podtytułem „Fundamentowy agent GUI o otwartych wagach", chipami z etykietami „Apache-2.0", „27B parametrów", „gotowy na vLLM" oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Tencent UI-Mate-27B: Cichy agent GUI o otwartych wagach zajmujący czołowe miejsce w WindowsAgentArena

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

14 sierpnia 2026 roku zespół HY Frontier Multimodal Agent firmy Tencent przesłał trzy punkty kontrolne do Hugging Face w organizacji tencent/ — UI-Mate-27B, mniejszy UI-Mate-9B oraz UI-Mate-democua-27B oparty na demonstracjach. Cztery dni później nadal nie ma żadnego ogłoszenia: żadnego postu o premierze, żadnego komunikatu prasowego, żadnego tweeta o produkcie. To, co zamiast tego opublikowano, jest jak na ciche wydanie niezwykle kompletne: strona projektu, repozytorium GitHub z działającym harnessem oraz artykuł na arXiv złożony dwa dni temu, który nazywa większy model nowym stanem sztuki o otwartych wagach w sterowaniu GUI na komputerach stacjonarnych.

Wszystko w tym tekście pochodzi z kart modeli, repozytorium GitHub, strony projektu i tamtego artykułu naukowego — nic z tego nie zostało jeszcze niezależnie odtworzone. Punkty kontrolne mają zero pobrań na Hugging Face w chwili pisania tego tekstu, co oznacza, że prawdopodobnie jesteśmy jednymi z pierwszych osób spoza Tencent, które traktują je poważnie na piśmie. Oto, co faktycznie można ustalić na podstawie repozytoriów, a co pozostaje niepotwierdzone, dopóki ktoś inny tego nie uruchomi.

Spis treści

• Co wypuszczono, a czego nie ogłoszono

Czym tak naprawdę jest UI-Mate-27B

• Cecha, która się wyróżnia: wykonywanie sterowane demonstracją

• Liczby — wszystkie raportowane przez dostawcę

• Gdzie te liczby by się znalazły — jeśli się utrzymają

• Jak to uruchomić

• Stos wokół nowego agenta GUI

• Co obejrzeć dalej

• FAQ

Co wydano, a czego nie ogłoszono

Tencent opublikował UI-Mate-27B (27 miliardów parametrów, licencja Apache-2.0, safetensors w BF16) 14 sierpnia 2026 roku, wraz z siostrzanym modelem 9B oraz checkpointem UI-Mate-democua-27B sterowanym demonstracjami. Oba checkpointy 27B bazują na Qwen3.6-27B — który sam jest multimodalnym modelem na licencji Apache-2.0 wydanym w kwietniu 2026 — co oznacza, że cały stos, od modelu bazowego po dostrojenie, można wykorzystywać komercyjnie. Repozytoria mają znaczniki ostatniej modyfikacji z tego tygodnia — checkpoint sterowany demonstracjami był modyfikowany jeszcze dzisiaj — więc Tencent aktywnie nad nimi pracuje.

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

Co dotychczas jest publiczne:

• Wagi UI-Mate-27B, UI-Mate-9B i UI-Mate-democua-27B na Hugging Face, każda z kartą modelu, tabelami ewaluacyjnymi i przepisem na serwowanie.

• Strona projektu pod adresem ui-mate.github.io z filmem demonstracyjnym, przewodnikiem użytkowania oraz aplikacją na macOS Apple Silicon (DMG v0.2.4).

Repozytorium GitHub (github.com/Tencent/UI-Mate) zawierające oficjalny prompt, parser odpowiedzi i harness interakcji — na karcie modelu wyraźnie zaznaczono, że jest to „checkpoint agenta, a nie samodzielny model czatu wizualnego", a do rzeczywistych zastosowań zalecany jest harness.

• Preprint arXiv (2608.15930), przesłany 16 sierpnia, zatytułowany „UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations.”

Co nie jest jeszcze publiczne: sam Tencent nic nie powiedział — to publikacja w repozytorium, a nie premiera. Wariant kierowany demonstracjami, który na stronie projektu figurował jako jeszcze niepubliczny, ma teraz dostępne wagi na Hugging Face: repozytorium tencent/UI-Mate-democua-27B, utworzone w ramach tego samego pusha z 14 sierpnia, jest wyraźnie oznaczone jako checkpoint tej rodziny kierowany demonstracjami — to odrębny model, a nie rebranding modelu 27B. Nadal nie ma nigdzie hostowanego API. To ma znaczenie: jedynym sposobem na uruchomienie UI-Mate jest dziś pobranie wag i serwowanie ich samodzielnie.

Czym właściwie jest UI-Mate-27B

UI-Mate-27B to podstawowy agent GUI przeznaczony do „długoterminowej pracy w wielu aplikacjach i systemach operacyjnych”. Obserwuje zrzuty ekranu w czasie rzeczywistym, analizuje widoczny stan i generuje ustrukturyzowane akcje klawiatury i myszy do natywnej interakcji z pulpitem. Trening obejmuje nadzorowane dostrajanie, po którym następuje uczenie przez wzmacnianie online w wykonywalnych środowiskach GUI — model nauczył się, faktycznie sterując pulpitami, a nie tylko na podstawie statycznych zrzutów ekranu.

Przestrzeń akcji to część, która będzie interesować developerów: mysz, klawiatura, przewijanie, czekanie, interakcja z użytkownikiem i ukończenie zadania, z wyjściem kompatybilnym z pyautogui. Model rozumuje w znormalizowanej przestrzeni współrzędnych 1000×1000, a agent referencyjny przeskalowuje jego przewidywania z powrotem do rzeczywistej rozdzielczości ekranu, dzięki czemu akcje działają mimo różnic w skalowaniu wyświetlania między maszynami. README samego modelu zaleca uruchamianie go z vLLM za punktem końcowym kompatybilnym z OpenAI.

Cecha wyróżniająca: wykonanie sterowane demonstracją

Większość agentów GUI przyjmuje jedno wejście: instrukcję. UI-Mate przyjmuje drugie, które jest prawdziwie rzadkie w otwartym checkpointcie — demonstrację. „Pokaż przepływ pracy raz. Pozwól agentowi dostosować go do zadania” — jak ujmuje to strona projektu.

Mechanizm ten nie jest wideo-w-kontekście ani stałym skryptem działań. Demonstracja rejestruje zrzuty ekranu bezpośrednio przed i po każdej akcji klawiatury lub wskaźnika, a potok następnie normalizuje ślad do spójnej reprezentacji akcja-klatka, adnotuje go obserwacjami, intencją, akcjami i dowodami weryfikacji oraz segmentuje go na nazwane podzadania z kryteriami ukończenia. W czasie wnioskowania staje się to kompaktowym przepływem pracy wstrzykiwanym dla aktywnego podzadania — ale bieżący zrzut ekranu pozostaje przez cały czas autorytatywny, więc gdy stan aplikacji różni się od demonstracji, model planuje ponownie, a nie odtwarza.

Tencent udostępnił punkt kontrolny stojący za tym przepływem pracy jako swój publiczny model: karta modelu UI-Mate-democua-27B zestawia wyniki dla wariantu tylko z instrukcjami oraz dla wariantu z jedną demonstracją na tych samych ewaluacjach, a jej schemat narzędzi dodaje akcję subtask_complete — mechanizm stojący za tymi nazwanymi podzadaniami. W podzbiorze self-demo benchmarku OSWorkerBench jedna demonstracja podnosi wskaźnik pełnego sukcesu z 17,17 do 35,35, a wskaźnik postępu z 67,85 do 81,14; w podzbiorze OSWorld wskaźnik postępu rośnie z 40,27 do 65,75; w zestawie ewaluacyjnym GameDev średni wynik wzrasta z 76,76 do 81,15, podczas gdy średnia długość trajektorii spada z 303,6 do 253,1 kroków — demo skraca zadanie, a jednocześnie poprawia jego wynik. Karta podaje, że demonstracja poprawiła wyniki w 28 z 33 zadań self-demo i rozwiązała cztery zadania, które bez wskazówek uzyskują zero punktów. Zastrzeżenie jest takie samo, jak to przewijające się przez cały ten artykuł: to własne ewaluacje porównawcze zespołu, uśrednione na podstawie od trzech do pięciu przebiegów, i nikt dotąd ich nie powtórzył.

Liczby — wszystkie podane przez dostawcę

Wykonywanie wyłącznie na podstawie instrukcji, prosto z karty modelu:

• Średni wynik OSWorld-Verified — 77.0

• Średni wynik WindowsAgentArena — 66.2

• OSWorkerBench ścisły sukces — 41.00

• Postęp OSWorkerBench — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench sam w sobie jest jednym z trzech wkładów w artykule: nowym benchmarkiem 100 długoterminowych zadań biurowych w 41 aplikacjach, z podzbiorami 33 self-demo i 45 variant-demo. Jest to nowa ewaluacja, więc nie ma wcześniejszych prac, z którymi można by porównać te dwa wyniki. W porównaniu z własnym modelem bazowym, UI-Mate-27B ma rzekomo pokonywać Qwen3.6-27B o 17,7 punktów ścisłego sukcesu i 24,5 punktów postępu w OSWorkerBench — co jest najczystszym porównaniem jabłko do jabłka w całej publikacji, ponieważ oba modele byłyby uruchamiane przez ten sam harness.

Wszystkie powyższe liczby to własne oceny zespołu. Nie ma jeszcze niezależnych wyników, żadnych powtórzonych testów przez zewnętrzne podmioty, a przy zerowej liczbie pobrań nie ma też odtworzeń przez społeczność. Każdą liczbę tutaj należy traktować jako twierdzenie, a nie fakt.

Gdzie znalazłyby się te liczby — jeśli się utrzymają.

WindowsAgentArena to ten, który byłby prawdziwym nagłówkiem. Najlepsze publicznie zgłoszone wyniki WAA z początku 2026 roku grupowały się wokół 61.0 (modularny system o nazwie VLAA-GUI, kwiecień 2026); EvoCUA-32B o otwartych wagach od Meituan osiągnął 56.5, a zamknięty UI-TARS-2 od ByteDance był na poziomie 50–55 na tej samej liście. Wynik 66.2 we własnej ewaluacji UI-Mate-27B umieściłby go powyżej wszystkiego, co dotychczas zgłoszono w tym benchmarku w tym roku — zarówno w przypadku modeli otwartych, jak i zamkniętych. To mocne twierdzenie i wymaga niezależnego powtórzenia.

OSWorld-Verified na poziomie 77.0 to mocny wynik, ale nie nowy rekord wśród modeli open-weight na publicznej tablicy. Na zrzucie tablicy liderów OSWorld-Verified z początku sierpnia 2026 r. model open-weight Holo3-35B-A3B widnieje z wynikiem 82.6, a nad nim znajduje się kilka zamkniętych modeli z czołówki (Qwen3.8 Max z 86.1, Claude Mythos 5 i Claude Fable 5 z 85.0, Claude Opus 4.8 z 83.4). Sformułowanie „state of the art" w artykule jest zatem twierdzeniem dotyczącym własnego środowiska ewaluacji, a nie ustalonym faktem — różne harnessy, parsery akcji i dryf w samodzielnym raportowaniu wyników sprawiają, że porównanie 77.0 i 82.6 to kwestia, którą może rozstrzygnąć jedynie niezależne ponowne uruchomienie testów. Dla kontekstu, co oznacza wynik 77.0 osiągnięty przez otwarty model 27B: plasowałby się powyżej baseline'u ludzkich ekspertów wynoszącego ~72.4 oraz powyżej kilku większych systemów z czołówki na tej samej tablicy, w tym Claude Opus 4.6 z 72.7 i Kimi K2.6 z 73.1.

Tencent nie jest nowy w tej dziedzinie — w lutym 2026 roku wydał POINTS-GUI-G, model ugruntowujący GUI o 8B parametrów, w maju wprowadził asystenta Marvis OS, a w czerwcu przyczynił się do projektu GUICrafter dotyczącego obsługi komputera. UI-Mate to odrębna linia stworzona z myślą o pełnej kontroli pulpitu i jest pierwszym z agentów GUI Tencenta wydanym jako otwarty model fundamentowy, a nie komponent ugruntowujący ani produkt.

Jak to uruchomić

Model jest zaprojektowany dla vLLM, a karta modelu podaje dokładne polecenie — vllm serve tencent/UI-Mate-27B z rozmiarem tensor-parallel 2 i szablonem czatu kompatybilnym z OpenAI. Jedna praktyczna kwestia rzuca się w oczy: agent domyślnie przechowuje w kontekście pięć zrzutów ekranu, więc serwer musi przyjmować co najmniej sześć obrazów na prompt, ponieważ najnowszy zrzut przychodzi zanim najstarszy zostanie zwinięty. Zalecana flaga to --limit-mm-per-prompt z sześcioma obrazami i zerowym wideo. Punkt kontrolny oparty na demonstracjach działa w ten sam sposób — jego karta wymienia vLLM i SGLang za punktem końcowym kompatybilnym z OpenAI.

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

Po udostępnieniu klasa agenta Pythona (UIMateAgent) przyjmuje zrzut ekranu oraz instrukcję i zwraca odpowiedź wraz ze ustrukturyzowanymi działaniami, przeliczając współrzędne 1000×1000 z powrotem do Twojej rozdzielczości. Strona projektu oferuje także aplikację na macOS dla Apple Silicon w trybie prowadzonym przez demonstrację, co jest najłatwiejszym sposobem wypróbowania przepływu pracy „pokaż to raz” bez samodzielnego budowania środowiska. Licencja Apache-2.0 obowiązuje w całym projekcie, więc użycie lokalne, dostrajanie i integracja komercyjna są w pełni dozwolone.

Dwa ostrzeżenia powinny towarzyszyć każdej instrukcji „jak to uruchomić" dla agenta obsługującego komputer — i oba pochodzą wprost z karty modelu. Korzystaj z izolowanych lub jednorazowych środowisk. Wymagaj potwierdzenia przez człowieka przed każdą wrażliwą operacją, monitoruj trajektorię działań i nie traktuj sukcesu zgłoszonego przez model jako dowodu, że zamierzony rezultat faktycznie nastąpił. Agenci GUI klikają w niewłaściwe miejsca, a wstrzykiwanie promptów przez treść wyświetlaną na ekranie to realny model zagrożeń, nie hipoteza.

Stos technologiczny wokół nowego agenta GUI

Żaden z checkpointów UI-Mate nie jest jeszcze na OrcaRouter — ta rodzina ma zaledwie kilka dni i zero pobrań, a jej model bazowy Qwen3.6-27B również nie. Nie ma hostowanego API, więc jeśli chcesz uruchomić jeden w tym tygodniu, musisz samodzielnie serwować vLLM. To jest w porządku do laboratorium, ale to nieodpowiednia forma dla produkcji.

{{1}}Produkcyjny potok obsługi komputera rzadko jest pojedynczym punktem kontrolnym.{{/1}} {{2}}To model planisty decydujący o następnym zamiarze, model ugruntowujący lub wizyjny odczytujący ekran, sam agent GUI oraz tani mechanizm awaryjny na wypadek niepowodzenia podkroku — a te elementy to wszystko modele serwowane, nawet gdy agent GUI działa lokalnie.{{/2}} {{3}}Właśnie dla takiej mieszanki istnieje warstwa routingu: jedno API obejmujące ponad 200 hostowanych modeli, cena listowa dostawcy przekazywana dalej z 0% narzutu oraz automatyczne przełączanie awaryjne, aby chwilowa awaria u jednego dostawcy nie wstrzymywała długiego działania agenta.{{/3}} {{4}}Routingowy DSL pozwala również złożyć kilka modeli w jedno wywołanie — planista na początku, tani weryfikator na końcu — bez ręcznego spinania dostawców we własnym kodzie.{{/4}} {{5}}Uczciwe podsumowanie jest proste: agent sterujący pulpitem działa lokalnie, ale modele decydujące o tym, co robić wokół niego, są routowalne, a bezpieczne testowanie zupełnie nowych, niesprawdzonych punktów kontrolnych to dokładnie rola mechanizmu przełączania awaryjnego.{{/5}}

Co obejrzeć dalej

Cztery rzeczy zmieniłyby obraz dla UI-Mate-27B, w przybliżonej kolejności ważności:

• Niezależne ponowne uruchomienie OSWorld-Verified i WindowsAgentArena. W szczególności wynik WAA to albo duża sprawa, albo artefakt środowiska testowego, i tylko zewnętrzna ewaluacja rozstrzygnie, które to jest.

Formalny raport techniczny. Obecne cytowanie jest tymczasowe, a pełny artykuł prawdopodobnie ujawni szczegóły silnika danych, które streszczenie jedynie szkicuje.

• Ogłoszenie samego Tencenta. Publikacja repozytorium w pierwszej kolejności zwykle zapowiada coś więcej — integrację z Marvis, ofertę hostowaną lub szerszą promocję otwartych modeli.

• Hostowane API. Wagi wszystkich trzech punktów kontrolnych są już publiczne, ale nic nie jest nigdzie udostępniane — ani punkt końcowy Tencent, ani zewnętrzny dostawca inferencji — więc samodzielne hostowanie pozostaje jedyną opcją i tylko komunikat Tencent lub uruchomienie modelu przez dostawcę może to zmienić.

Często zadawane pytania

Co to jest Tencent UI-Mate-27B?

UI-Mate-27B to fundamentalny agent GUI o 27 miliardach parametrów na licencji Apache-2.0, opracowany przez zespół HY Frontier Multimodal Agent firmy Tencent i dostrojony na bazie Qwen3.6-27B. Śledzi zrzuty ekranu pulpitu w czasie rzeczywistym, rozumuje nad nimi i generuje akcje myszy i klawiatury zgodne z pyautogui. Został po cichu opublikowany na Hugging Face 14 sierpnia 2026 roku — wraz z bratnim modelem 9B i sterowanym demonstracjami UI-Mate-democua-27B — bez żadnego ogłoszenia, a jego benchmarki są jak dotąd w całości raportowane przez producenta.

Czym różni się wykonywanie kierowane demonstracją od odtwarzania skryptu?

Zamiast wykonywać nagrane makro, UI-Mate traktuje demonstrację jako opatrzony podpisami przepływ pracy o strukturze podzadań, wstrzykiwany jako wskazówki. Bieżący zrzut ekranu pozostaje źródłem prawdy, więc gdy układ, zawartość lub stan aplikacji różni się od tego, co pokazano, model planuje na nowo, a nie odtwarza nieaktualnych współrzędnych. To jest mechanizm stojący za deklarowanym skokiem z 17,2 do 35,4 ścisłego sukcesu na podzbiorze self-demo — i wciąż jest to deklaracja producenta, dopóki ktoś tego nie odtworzy.

Czy UI-Mate-27B naprawdę jest najnowocześniejszy wśród agentów GUI o otwartych wagach?

To zależy wyłącznie od konfiguracji ewaluacji. Wynik 66,2 w WindowsAgentArena przewyższyłby najlepsze publicznie opublikowane wyniki WAA z początku 2026 roku, ale wynik 77,0 w OSWorld-Verified plasuje się poniżej modelu Holo3-35B-A3B o otwartych wagach (82,6) na publicznej tablicy wyników. Publikacja określa go jako nowy stan sztuki wśród modeli o otwartych wagach; jedynym sposobem, aby się o tym przekonać, jest niezależne ponowne uruchomienie na jednolitym środowisku testowym.

Czy mogę dziś uruchomić UI-Mate-27B?

Tak, jeśli serwujesz go samodzielnie: pobierz wagi z Hugging Face — ogólny checkpoint 27B, 9B lub kierowany demonstracjami UI-Mate-democua-27B — uruchom polecenie vLLM z karty modelu (rozmiar tensor-parallel 2, sześć obrazów na prompt) i steruj nim za pomocą agenta Pythona lub aplikacji na macOS. Nie ma hostowanego API i żaden z checkpointów nie jest jeszcze na OrcaRouter — co, dla modeli tak nowych i tak niezweryfikowanych, jest rozsądnym powodem, aby na razie trzymać je w izolowanym środowisku.

Właściwy odbiór modelu UI-Mate-27B to nie „zwycięzca", lecz „wart uwagi". Otwarty model o parametrach 27B, który deklaruje przewagę w WAA i udostępnia jednorazowy demonstracyjny przepływ pracy, to znaczący punkt odniesienia w roku, w którym agenci obsługi komputera o otwartych wagach przeszli od żartu do bycia w zasięgu czołówki. Teraz, gdy punkt kontrolny sterowany demonstracją ma postać publicznych wag, a nie placeholdera na stronie projektu, przepływ „pokaż raz" można faktycznie uruchomić. Tencent już wcześniej ostrożnie podchodził do wydań, a to wygląda na upublicznioną pracę w toku. Uruchom go w piaskownicy, powtórz benchmarki i nie przestawaj śledzić ogłoszeń — najciekawsza część tej historii wciąż przed nami.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube