
MiniCPM-V 4.7 vs UI-Venus 2.9B: Ogólny model wizyjny kontra specjalnie zaprojektowany agent GUI
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
MiniCPM-V 4.7 i UI-Venus 2.9B to oba modele językowo-wizualne, które patrzą na zrzut ekranu i generują tekst, i na tym podobieństwo się kończy — ponieważ jeden z nich został stworzony dokładnie do tego zadania. UI-Venus 2.9B to agent GUI ogólnego przeznaczenia od inclusionAI, wydany 26 sierpnia 2026 roku, którego cała konstrukcja koncentruje się na obserwowaniu interfejsu, rozumowaniu o stanie zadania, emitowaniu akcji i uwzględnianiu wynikającej z niej informacji zwrotnej; dołączono do niego raport techniczny, tabele wyników obejmujące zadania z zakresu ugruntowania w GUI, urządzeń mobilnych, stron internetowych, obsługi komputera i CAPTCHA oraz wyraźną ocenę tego, jak często można go nakłonić do niebezpiecznej akcji. MiniCPM-V 4.7 to rzadki punkt kontrolny typu mixture-of-experts o 35,2 miliarda parametrów, przesłany przez OpenBMB 6 października 2026 roku, bez karty, bez licencji i bez wyników benchmarku. Porównywanie specjalisty z niezmierzonym generalistą to dość nietypowe ćwiczenie, a ta strona wyraźnie określa, gdzie porównanie jest zasadne, a gdzie nie.
Dwa bardzo różne rodzaje uwolnienia
UI-Venus 2.9B to inclusionAI/UI-Venus-2-9B, model o 9 mld parametrów zainicjowany z Qwen3.5-9B i poddany treningowi końcowemu specjalnie jako agent GUI. Karta opisuje zamkniętą pętlę — obserwuj interfejs, rozumuj o stanie zadania, wykonaj akcję, uwzględnij informację zwrotną w kolejnej decyzji — trenowaną w trzech etapach: multimodalny trening pośredni na wielkoskalowych symulowanych trajektoriach mobilnych, webowych i desktopowych; uczenie ze wzmocnieniem w trybie offline podzielone na pięć rodzin zadań; oraz destylacja on-policy z wieloma nauczycielami, która konsoliduje nauczycieli wyspecjalizowanych w domenach w jedną politykę. Jest oceniany na benchmarkach GUI grounding, mobilnych, webowych, computer-use i CAPTCHA, a osobno pod kątem bezpieczeństwa działań o istotnych skutkach: karta podaje współczynnik skuteczności ataków na poziomie 11,3% w przypadku OSHarm i 48,8% w przypadku OSBlind, w porównaniu z 25,3% i 79,4% dla jego bazowego modelu Qwen3.5-9B. Swoją drogą, pokrewny projekt samego OpenBMB przyjrzał się podobnemu obszarowi: organizacja MiniCPM ma projekt AgentCPM-GUI ze stycznia 2026 r., więc jest to tor, na który weszły oba laboratoria.
MiniCPM-V 4.7 to openbmb/MiniCPM-V-4.7-35B-A3B, 35 212 875 824 parametrów BF16 w 70,4 GB i szesnastu shardach, przesłany 6 października 2026.

Rzadki szkielet tekstowy MoE oznaczony jako qwen3_5_moe_text — 256 ekspertów, 8 na token — ponad 40 warstw ze wzorcem uwagi typu trzy liniowe do jednej pełnej, 27-warstwową własną wieżą wizyjną z 16× downsamplingiem i maksymalnie dziewięcioma fragmentami obrazu oraz oknem kontekstu 256K. Brak README, zatem brak licencji i brak benchmarków. Trzy polubienia, zero pobrań, puste dyskusje.
Porównanie, z lukami pozostawionymi otwartymi
• Przeznaczenie — UI-Venus 2.9B: agent GUI, wytrenowany end-to-end do interakcji z interfejsem. MiniCPM-V 4.7: ogólny model wizyjno-językowy; nie podano, do czego jest optymalizowany.
• Parametry — UI-Venus 2.9B: 9,41 mld, gęsty. MiniCPM-V 4.7: łącznie 35,2 mld, rzadki, 8 z 256 ekspertów na token.
• Model bazowy — UI-Venus 2.9B: zainicjowany z Qwen3.5-9B, gęsty stos tekstowy Qwen. MiniCPM-V 4.7: wywodzący się z Qwen3.5 stos tekstowy MoE, klasa qwen3_5_moe_text. Różne gałęzie tego samego drzewa genealogicznego.
• Ugruntowanie interfejsu — UI-Venus 2.9B: kluczowa kompetencja, z dedykowanymi rodzinami zadań ugruntowania i CAPTCHA w treningu oraz systemem weryfikacji opartym na ugruntowaniu punktów kluczowych wykorzystującym głosowanie wielu modeli. MiniCPM-V 4.7: brak deklaracji dotyczącej ugruntowania i brak udokumentowanego formatu wyjściowego współrzędnych.
• Ocena bezpieczeństwa — UI-Venus 2.9B: raportuje ASR na poziomie 11,3% w OSHarm i 48,8% w OSBlind. MiniCPM-V 4.7: brak.
• Dowody — UI-Venus 2.9B: raport techniczny na arXiv, strona projektu, repozytorium GitHub i tabele benchmarków. MiniCPM-V 4.7: plik konfiguracyjny.
• Narzędzia — UI-Venus 2.9B: szybki start z vLLM z flagą reasoning-parser oraz konwersje GGUF od społeczności. MiniCPM-V 4.7: na razie nic.

Dlaczego agent GUI to nie tylko „VLM, który patrzy na ekrany”
Przepaść między tymi dwoma modelami nie dotyczy głównie liczby parametrów i warto to jasno powiedzieć, ponieważ to właśnie ona sprawia, że starcie jest interesujące, a nie jedynie jednostronne.
Zadanie polegające na pracy ze zrzutami ekranu ma właściwość, której nie ma większość benchmarków wizyjnych: wynik musi być wykonywalny. Gdy UI-Venus 2.9B ma dotknąć przycisku, musi wygenerować współrzędną lub ustrukturyzowaną akcję, którą środowisko może faktycznie zastosować, a niewielki błąd w ugruntowaniu nie jest błędną odpowiedzią na tabeli wyników — to nieudane zadanie i uszkodzony stan. Dlatego karta UI-Venus 2 poświęca tak dużą część swojej objętości weryfikacji: ukończenie zadania ocenia się na podstawie istotnych dla zadania wizualnych punktów kluczowych, a nie całościowego spojrzenia na końcowy ekran, a niejednorodni sędziowie głosują, aby ograniczyć stronniczość pojedynczego sędziego. Sens tego mechanizmu polega na tym, aby sygnał nagrody w uczeniu ze wzmocnieniem był odporny na hacking nagrody — model, który uczy się zadowalać leniwego weryfikatora, zamiast wykonać zadanie.
Wyjaśnia również sekcję dotyczącą bezpieczeństwa.

Agent, który potrafi obsługiwać telefon lub komputer stacjonarny, ma powierzchnię ataku, jakiej model opisujący obrazy nie ma, a raportowanie wskaźnika skuteczności ataków to minimum, jakie laboratorium powinno robić, wprowadzając takiego agenta na rynek. UI-Venus 2.9B podaje 11,3% na OSHarm i 48,8% na OSBlind — druga liczba jest wysoka w ujęciu bezwzględnym, a sposób przedstawienia jej na karcie to porównanie z modelem bazowym, a nie bezwzględne twierdzenie o odporności. Czytaj to jako „znacząco lepszy niż punkt wyjścia”, a nie jako „bezpieczny”.
Architektura MiniCPM-V 4.7 nie ma nic do powiedzenia na temat żadnego z tych elementów. Liniowa uwaga w długim kontekście pomogłaby agentowi, który musi pamiętać długą historię interakcji, a rzadki MoE pomógłby w przepustowości, jeśli uruchamiasz wiele epizodów. Jednak architektura, która byłaby użyteczna dla agenta, nie jest agentem, i żadna część udostępnionego artefaktu nie dokumentuje wyników działań, dokładności ugruntowania ani zachowań związanych z bezpieczeństwem.
Uczciwa ocena strony MiniCPM
Kuszące jest wypełnienie tej sekcji liczbami wersji 4.6. Oprzyj się tej pokusie. MiniCPM-V 4.6 to gęsty model o rozmiarze 1,3B na szkielecie Qwen3.5-0.8B z przełączalnym schematem kompresji wizualnej 4x/16x, a jego prezentowane wyniki — wynik 13 w Artificial Analysis Intelligence Index, podany przez dostawcę, przy ułamku kosztu tokenów porównywalnych małych modeli — opisują ten model. MiniCPM-V 4.7 zmienia szkielet, zmienia wzorzec uwagi i zmienia domyślną kompresję wizualną. Żadnego z pomiarów wersji 4.6 nie można przenieść, a żaden z nich i tak nie opisuje agenta GUI.
To, co można uczciwie powiedzieć o MiniCPM-V 4.7, jest wąskie i rzeczowe: wagi istnieją, kształt jest nietypowy dla tej rodziny, okno kontekstowe jest długie, a wydanie jest niekompletne. Brak licencji to praktyczna przeszkoda; brak benchmarków to przeszkoda ewaluacyjna. I istnieje jeden skromny powód do zainteresowania, a nie obojętności — OpenBMB tworzy narzędzia GUI, w tym AgentCPM-GUI, więc długokontekstowy rzadki model wizyjny MoE z tego laboratorium nie jest nieprawdopodobny jako przyszły trzon agentów. To hipoteza dotycząca intencji, a repozytorium jej nie potwierdza.
Co wybrać i kiedy
W przypadku wszystkiego, co wiąże się ze zrzutem ekranu i jakąś czynnością — stukaniem, pisaniem, przewijaniem, nawigowaniem w aplikacji lub witrynie, wyodrębnianiem danych z interfejsu użytkownika — UI-Venus 2.9B jest jedynym z tych dwóch, który zajmuje się tym zadaniem. Ma za sobą trening, mechanizmy weryfikacji, raportowane wskaźniki bezpieczeństwa i wystarczające narzędzia, by uruchomić go na vLLM już dziś. Nic w MiniCPM-V 4.7 nie wskazuje, że konkuruje w tym obszarze, a bez karty modelu nie można nawet sprawdzić, czy generuje współrzędne.
W przypadku ogólnych zadań multimodalnych — opisywania obrazów, czytania dokumentów, analizy długiego kontekstu na materiałach o dużej liczbie obrazów — porównanie nie jest jeszcze rozstrzygalne, ponieważ jedna ze stron nie ma opublikowanych dowodów jakości. Jeśli potrzebujesz tego już dziś, UI-Venus 2.9B jest przynajmniej mierzalny, choć został dostrojony do interfejsów, a nie do rozumowania na dokumentach, i również nie jest oczywistym pierwszym wyborem do tego zadania.
Wzorzec w obu przypadkach jest taki sam: model hostowany samodzielnie, który obsługuje rutynową pracę, oraz hostowany model frontier do trudnych przypadków, które są mu przekazywane. To właśnie na tym przekazaniu router zasługuje na swoje miejsce — jeden klucz do ponad 200 hostowanych modeli, z których każdy jest rozliczany według ceny katalogowej dostawcy, bez naszej marży, z automatycznym przełączaniem awaryjnym, gdy dostawca zaczyna zawodzić. Ani UI-Venus 2.9B, ani MiniCPM-V 4.7 nie są hostowane w OrcaRouter; oba to wagi, które uruchamiasz samodzielnie. Router to ten, z którym rozmawia twój agent, gdy uzna, że model lokalny nie wystarcza.
Gdzie cię to stawia
To nie jest kwestia na styk, a powód jest strukturalny, a nie oparty na ocenie jakości. UI-Venus 2.9B to specjalista z raportem, licencją, tabelami benchmarków, oceną bezpieczeństwa i receptą na serwowanie. MiniCPM-V 4.7 to generalista z plikiem konfiguracyjnym. Jedno z nich jest produktem, a drugie obietnicą, i jedynym odpowiedzialnym sposobem ich porównania jest powiedzieć to wprost. Obserwuj repozytorium: jeśli OpenBMB opublikuje kartę, która pokazuje ugruntowanie interfejsu i wyjście akcji, wtedy rzadki MoE z kontekstem 256K kontra destylowany agent 9B staje się naprawdę interesującym pytaniem. Do tego czasu odpowiedzią na „którego powinienem użyć” jest ten, który istnieje.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
