Wygenerowana karta tytułowa hero dla „MiniCPM-V 4.7 vs UI-Venus 2.9B” z podtytułem „Ogólny model wizyjny kontra dedykowany agent GUI”, lewa karta z napisem „UI-Venus 2.9B: grounding, CAPTCHA, urządzenia mobilne, web, obsługa komputera”, prawa karta z napisem „MiniCPM-V 4.7: 35.2B sparse, brak karty, brak benchmarków” oraz pigułka z napisem „Specjalista kontra niezmierzony generalista”, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MiniCPM-V 4.7 vs UI-Venus 2.9B: Ogólny model wizyjny kontra specjalnie zaprojektowany agent GUI

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MiniCPM-V 4.7 i UI-Venus 2.9B to oba modele językowo-wizualne, które patrzą na zrzut ekranu i generują tekst, i na tym podobieństwo się kończy — ponieważ jeden z nich został stworzony dokładnie do tego zadania. UI-Venus 2.9B to agent GUI ogólnego przeznaczenia od inclusionAI, wydany 26 sierpnia 2026 roku, którego cała konstrukcja koncentruje się na obserwowaniu interfejsu, rozumowaniu o stanie zadania, emitowaniu akcji i uwzględnianiu wynikającej z niej informacji zwrotnej; dołączono do niego raport techniczny, tabele wyników obejmujące zadania z zakresu ugruntowania w GUI, urządzeń mobilnych, stron internetowych, obsługi komputera i CAPTCHA oraz wyraźną ocenę tego, jak często można go nakłonić do niebezpiecznej akcji. MiniCPM-V 4.7 to rzadki punkt kontrolny typu mixture-of-experts o 35,2 miliarda parametrów, przesłany przez OpenBMB 6 października 2026 roku, bez karty, bez licencji i bez wyników benchmarku. Porównywanie specjalisty z niezmierzonym generalistą to dość nietypowe ćwiczenie, a ta strona wyraźnie określa, gdzie porównanie jest zasadne, a gdzie nie.

Dwa bardzo różne rodzaje uwolnienia

UI-Venus 2.9B to inclusionAI/UI-Venus-2-9B, model o 9 mld parametrów zainicjowany z Qwen3.5-9B i poddany treningowi końcowemu specjalnie jako agent GUI. Karta opisuje zamkniętą pętlę — obserwuj interfejs, rozumuj o stanie zadania, wykonaj akcję, uwzględnij informację zwrotną w kolejnej decyzji — trenowaną w trzech etapach: multimodalny trening pośredni na wielkoskalowych symulowanych trajektoriach mobilnych, webowych i desktopowych; uczenie ze wzmocnieniem w trybie offline podzielone na pięć rodzin zadań; oraz destylacja on-policy z wieloma nauczycielami, która konsoliduje nauczycieli wyspecjalizowanych w domenach w jedną politykę. Jest oceniany na benchmarkach GUI grounding, mobilnych, webowych, computer-use i CAPTCHA, a osobno pod kątem bezpieczeństwa działań o istotnych skutkach: karta podaje współczynnik skuteczności ataków na poziomie 11,3% w przypadku OSHarm i 48,8% w przypadku OSBlind, w porównaniu z 25,3% i 79,4% dla jego bazowego modelu Qwen3.5-9B. Swoją drogą, pokrewny projekt samego OpenBMB przyjrzał się podobnemu obszarowi: organizacja MiniCPM ma projekt AgentCPM-GUI ze stycznia 2026 r., więc jest to tor, na który weszły oba laboratoria.

MiniCPM-V 4.7 to openbmb/MiniCPM-V-4.7-35B-A3B, 35 212 875 824 parametrów BF16 w 70,4 GB i szesnastu shardach, przesłany 6 października 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Rzadki szkielet tekstowy MoE oznaczony jako qwen3_5_moe_text — 256 ekspertów, 8 na token — ponad 40 warstw ze wzorcem uwagi typu trzy liniowe do jednej pełnej, 27-warstwową własną wieżą wizyjną z 16× downsamplingiem i maksymalnie dziewięcioma fragmentami obrazu oraz oknem kontekstu 256K. Brak README, zatem brak licencji i brak benchmarków. Trzy polubienia, zero pobrań, puste dyskusje.

Porównanie, z lukami pozostawionymi otwartymi

• Przeznaczenie — UI-Venus 2.9B: agent GUI, wytrenowany end-to-end do interakcji z interfejsem. MiniCPM-V 4.7: ogólny model wizyjno-językowy; nie podano, do czego jest optymalizowany.

• Parametry — UI-Venus 2.9B: 9,41 mld, gęsty. MiniCPM-V 4.7: łącznie 35,2 mld, rzadki, 8 z 256 ekspertów na token.

• Model bazowy — UI-Venus 2.9B: zainicjowany z Qwen3.5-9B, gęsty stos tekstowy Qwen. MiniCPM-V 4.7: wywodzący się z Qwen3.5 stos tekstowy MoE, klasa qwen3_5_moe_text. Różne gałęzie tego samego drzewa genealogicznego.

• Ugruntowanie interfejsu — UI-Venus 2.9B: kluczowa kompetencja, z dedykowanymi rodzinami zadań ugruntowania i CAPTCHA w treningu oraz systemem weryfikacji opartym na ugruntowaniu punktów kluczowych wykorzystującym głosowanie wielu modeli. MiniCPM-V 4.7: brak deklaracji dotyczącej ugruntowania i brak udokumentowanego formatu wyjściowego współrzędnych.

• Ocena bezpieczeństwa — UI-Venus 2.9B: raportuje ASR na poziomie 11,3% w OSHarm i 48,8% w OSBlind. MiniCPM-V 4.7: brak.

• Dowody — UI-Venus 2.9B: raport techniczny na arXiv, strona projektu, repozytorium GitHub i tabele benchmarków. MiniCPM-V 4.7: plik konfiguracyjny.

• Narzędzia — UI-Venus 2.9B: szybki start z vLLM z flagą reasoning-parser oraz konwersje GGUF od społeczności. MiniCPM-V 4.7: na razie nic.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Dlaczego agent GUI to nie tylko „VLM, który patrzy na ekrany”

Przepaść między tymi dwoma modelami nie dotyczy głównie liczby parametrów i warto to jasno powiedzieć, ponieważ to właśnie ona sprawia, że starcie jest interesujące, a nie jedynie jednostronne.

Zadanie polegające na pracy ze zrzutami ekranu ma właściwość, której nie ma większość benchmarków wizyjnych: wynik musi być wykonywalny. Gdy UI-Venus 2.9B ma dotknąć przycisku, musi wygenerować współrzędną lub ustrukturyzowaną akcję, którą środowisko może faktycznie zastosować, a niewielki błąd w ugruntowaniu nie jest błędną odpowiedzią na tabeli wyników — to nieudane zadanie i uszkodzony stan. Dlatego karta UI-Venus 2 poświęca tak dużą część swojej objętości weryfikacji: ukończenie zadania ocenia się na podstawie istotnych dla zadania wizualnych punktów kluczowych, a nie całościowego spojrzenia na końcowy ekran, a niejednorodni sędziowie głosują, aby ograniczyć stronniczość pojedynczego sędziego. Sens tego mechanizmu polega na tym, aby sygnał nagrody w uczeniu ze wzmocnieniem był odporny na hacking nagrody — model, który uczy się zadowalać leniwego weryfikatora, zamiast wykonać zadanie.

Wyjaśnia również sekcję dotyczącą bezpieczeństwa.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

Agent, który potrafi obsługiwać telefon lub komputer stacjonarny, ma powierzchnię ataku, jakiej model opisujący obrazy nie ma, a raportowanie wskaźnika skuteczności ataków to minimum, jakie laboratorium powinno robić, wprowadzając takiego agenta na rynek. UI-Venus 2.9B podaje 11,3% na OSHarm i 48,8% na OSBlind — druga liczba jest wysoka w ujęciu bezwzględnym, a sposób przedstawienia jej na karcie to porównanie z modelem bazowym, a nie bezwzględne twierdzenie o odporności. Czytaj to jako „znacząco lepszy niż punkt wyjścia”, a nie jako „bezpieczny”.

Architektura MiniCPM-V 4.7 nie ma nic do powiedzenia na temat żadnego z tych elementów. Liniowa uwaga w długim kontekście pomogłaby agentowi, który musi pamiętać długą historię interakcji, a rzadki MoE pomógłby w przepustowości, jeśli uruchamiasz wiele epizodów. Jednak architektura, która byłaby użyteczna dla agenta, nie jest agentem, i żadna część udostępnionego artefaktu nie dokumentuje wyników działań, dokładności ugruntowania ani zachowań związanych z bezpieczeństwem.

Uczciwa ocena strony MiniCPM

Kuszące jest wypełnienie tej sekcji liczbami wersji 4.6. Oprzyj się tej pokusie. MiniCPM-V 4.6 to gęsty model o rozmiarze 1,3B na szkielecie Qwen3.5-0.8B z przełączalnym schematem kompresji wizualnej 4x/16x, a jego prezentowane wyniki — wynik 13 w Artificial Analysis Intelligence Index, podany przez dostawcę, przy ułamku kosztu tokenów porównywalnych małych modeli — opisują ten model. MiniCPM-V 4.7 zmienia szkielet, zmienia wzorzec uwagi i zmienia domyślną kompresję wizualną. Żadnego z pomiarów wersji 4.6 nie można przenieść, a żaden z nich i tak nie opisuje agenta GUI.

To, co można uczciwie powiedzieć o MiniCPM-V 4.7, jest wąskie i rzeczowe: wagi istnieją, kształt jest nietypowy dla tej rodziny, okno kontekstowe jest długie, a wydanie jest niekompletne. Brak licencji to praktyczna przeszkoda; brak benchmarków to przeszkoda ewaluacyjna. I istnieje jeden skromny powód do zainteresowania, a nie obojętności — OpenBMB tworzy narzędzia GUI, w tym AgentCPM-GUI, więc długokontekstowy rzadki model wizyjny MoE z tego laboratorium nie jest nieprawdopodobny jako przyszły trzon agentów. To hipoteza dotycząca intencji, a repozytorium jej nie potwierdza.

Co wybrać i kiedy

W przypadku wszystkiego, co wiąże się ze zrzutem ekranu i jakąś czynnością — stukaniem, pisaniem, przewijaniem, nawigowaniem w aplikacji lub witrynie, wyodrębnianiem danych z interfejsu użytkownika — UI-Venus 2.9B jest jedynym z tych dwóch, który zajmuje się tym zadaniem. Ma za sobą trening, mechanizmy weryfikacji, raportowane wskaźniki bezpieczeństwa i wystarczające narzędzia, by uruchomić go na vLLM już dziś. Nic w MiniCPM-V 4.7 nie wskazuje, że konkuruje w tym obszarze, a bez karty modelu nie można nawet sprawdzić, czy generuje współrzędne.

W przypadku ogólnych zadań multimodalnych — opisywania obrazów, czytania dokumentów, analizy długiego kontekstu na materiałach o dużej liczbie obrazów — porównanie nie jest jeszcze rozstrzygalne, ponieważ jedna ze stron nie ma opublikowanych dowodów jakości. Jeśli potrzebujesz tego już dziś, UI-Venus 2.9B jest przynajmniej mierzalny, choć został dostrojony do interfejsów, a nie do rozumowania na dokumentach, i również nie jest oczywistym pierwszym wyborem do tego zadania.

Wzorzec w obu przypadkach jest taki sam: model hostowany samodzielnie, który obsługuje rutynową pracę, oraz hostowany model frontier do trudnych przypadków, które są mu przekazywane. To właśnie na tym przekazaniu router zasługuje na swoje miejsce — jeden klucz do ponad 200 hostowanych modeli, z których każdy jest rozliczany według ceny katalogowej dostawcy, bez naszej marży, z automatycznym przełączaniem awaryjnym, gdy dostawca zaczyna zawodzić. Ani UI-Venus 2.9B, ani MiniCPM-V 4.7 nie są hostowane w OrcaRouter; oba to wagi, które uruchamiasz samodzielnie. Router to ten, z którym rozmawia twój agent, gdy uzna, że model lokalny nie wystarcza.

Gdzie cię to stawia

To nie jest kwestia na styk, a powód jest strukturalny, a nie oparty na ocenie jakości. UI-Venus 2.9B to specjalista z raportem, licencją, tabelami benchmarków, oceną bezpieczeństwa i receptą na serwowanie. MiniCPM-V 4.7 to generalista z plikiem konfiguracyjnym. Jedno z nich jest produktem, a drugie obietnicą, i jedynym odpowiedzialnym sposobem ich porównania jest powiedzieć to wprost. Obserwuj repozytorium: jeśli OpenBMB opublikuje kartę, która pokazuje ugruntowanie interfejsu i wyjście akcji, wtedy rzadki MoE z kontekstem 256K kontra destylowany agent 9B staje się naprawdę interesującym pytaniem. Do tego czasu odpowiedzią na „którego powinienem użyć” jest ten, który istnieje.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie