Ett genererat hjältetitelkort för 'MiniCPM-V 4.7 vs UI-Venus 2.9B' med undertexten 'En generell visionsmodell mot en specialbyggd GUI-agent', ett vänsterkort med texten 'UI-Venus 2.9B: grundning, CAPTCHA, mobil, webb, datoranvändning', ett högerkort med texten 'MiniCPM-V 4.7: 35,2B sparse, inget kort, inga benchmarks' och en pillerformad etikett med texten 'En specialist mot en omätt generalist', med OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

MiniCPM-V 4.7 vs UI-Venus 2.9B: En generell visionsmodell mot en specialbyggd GUI-agent

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MiniCPM-V 4.7 och UI-Venus 2.9B är båda visions-språkmodeller som tittar på en skärmbild och producerar text, och där tar likheten slut – för en av dem byggdes för exakt det jobbet. UI-Venus 2.9B är en GUI-agent för allmänna ändamål från inclusionAI, släppt den 26 augusti 2026, vars hela design kretsar kring att observera ett gränssnitt, resonera om uppgiftens tillstånd, avge en åtgärd och införliva den resulterande återkopplingen; den levereras med en teknisk rapport, benchmarktabeller över GUI-grounding, mobil-, webb-, datoranvändnings- och CAPTCHA-uppgifter samt en explicit utvärdering av hur ofta den kan övertalas att utföra en farlig handling. MiniCPM-V 4.7 är en sparse mixture-of-experts-checkpoint med 35,2 miljarder parametrar som laddades upp av OpenBMB den 6 oktober 2026 med modellkort, ingen licens och inga benchmarks. Att jämföra en specialist mot en omätt generalist är en något ovanlig övning, och den här sidan är tydlig med var jämförelsen håller och var den inte gör det.

Två väldigt olika typer av release

UI-Venus 2.9B är inclusionAI/UI-Venus-2-9B, en modell med 9B parametrar som initierats från Qwen3.5-9B och eftertränats specifikt som en GUI-agent. Kortet beskriver en sluten loop – observera gränssnittet, resonera kring uppgiftens tillstånd, utför en åtgärd, väv in återkopplingen i nästa beslut – tränad i tre steg: multimodal mellanträning på storskaliga simulerade mobil-, webb- och skrivbordsbanor; offline-förstärkningsinlärning uppdelad över fem uppgiftsfamiljer; och on-policy-destillation med flera lärare som konsoliderar domänspecialiserade lärare till en policy. Den utvärderas på benchmarks för GUI-grounding, mobil, webb, datoranvändning och CAPTCHA, och separat på säkerhet för konsekvensbärande åtgärder: kortet rapporterar en attackframgångsgrad på 11,3 % på OSHarm och 48,8 % på OSBlind mot 25,3 % och 79,4 % för dess Qwen3.5-9B-bas. OpenBMB:s eget syskon tittade för övrigt på liknande område: MiniCPM-organisationen har ett AgentCPM-GUI-projekt från januari 2026, så detta är en bana som båda labben har gett sig in på.

MiniCPM-V 4.7 är openbmb/MiniCPM-V-4.7-35B-A3B, 35 212 875 824 BF16-parametrar över 70,4 GB och sexton shards, uppladdade 6 oktober 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Sparse MoE-textryggrad taggad qwen3_5_moe_text — 256 experter, 8 per token — över 40 lager med ett uppmärksamhetsmönster där tre linjära lager följs av ett fullt, ett egenutvecklat visionstorn på 27 lager med 16× nedskalning och upp till nio bildskivor, samt ett kontextfönster på 256K. Ingen README, därför varken licens eller benchmarks. Tre gillningar, noll nedladdningar, tomma diskussioner.

Jämförelsen, med luckorna lämnade öppna

• Syfte — UI-Venus 2.9B: en GUI-agent, tränad end-to-end för gränssnittsinteraktion. MiniCPM-V 4.7: en generell bild- och språkmodell; vad den är optimerad för framgår inte.

• Parametrar — UI-Venus 2.9B: 9,41B, tät. MiniCPM-V 4.7: 35,2B totalt, gles, 8 av 256 experter per token.

• Basmodell — UI-Venus 2.9B: initierad från Qwen3.5-9B, en tät Qwen-textstack. MiniCPM-V 4.7: en Qwen3.5-härledd MoE-textstack, klass qwen3_5_moe_text. Olika grenar av samma släktträd.

• Gränssnittsgrounding — UI-Venus 2.9B: kärnkompetensen, med dedikerade uppgiftsfamiljer för grounding och CAPTCHA i träningen samt ett keypoint-grundat verifieringssystem som använder röstning mellan flera modeller. MiniCPM-V 4.7: inget grounding-specifikt påstående, och inget dokumenterat format för koordinatutdata.

• Säkerhetsutvärdering — UI-Venus 2.9B: rapporterar ASR på 11,3 % på OSHarm och 48,8 % på OSBlind. MiniCPM-V 4.7: inga.

• Underlag — UI-Venus 2.9B: en teknisk rapport på arXiv, en projektsida, ett GitHub-repo och en konfigurationsfil. MiniCPM-V 4.7: en konfigurationsfil.

• Verktyg — UI-Venus 2.9B: snabbstart för vLLM med en flagga för reasoning-parser, plus GGUF-konverteringar från communityn. MiniCPM-V 4.7: inget ännu.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Varför en GUI-agent inte bara är "en VLM som tittar på skärmar"

Gapet mellan dessa två modeller handlar inte i första hand om antalet parametrar, och det är värt att klargöra, eftersom det är det som gör jämförelsen intressant i stället för bara ensidig.

En skärmbildsuppgift har en egenskap som de flesta visionsbenchmarkar inte har: utdata måste vara körbara. När UI-Venus 2.9B ombeds att trycka på en knapp måste den avge en koordinat eller en strukturerad åtgärd som miljön faktiskt kan tillämpa, och ett litet fel i grundningen är inte ett felaktigt svar på en resultattavla, det är en misslyckad uppgift och ett korrumperat tillstånd. Det är därför UI-Venus 2-kortet ägnar så stor del av sin längd åt verifiering: uppgiftens slutförande bedöms utifrån uppgiftsrelevanta visuella nyckelpunkter i stället för en helhetsblick på den slutliga skärmen, och heterogena domare röstar för att minska bias från en enskild domare. Poängen med det maskineriet är att göra förstärkningsinlärningens belöningssignal robust mot belöningshackning – en modell som lär sig att tillfredsställa en lat verifierare i stället för att slutföra uppgiften.

Det förklarar också säkerhetsavsnittet.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

En agent som kan styra en telefon eller en stationär dator har en attackyta som en bildbeskrivningsmodell inte har, och att rapportera andelen lyckade attacker är det minsta ett labb bör göra när det lanserar en. UI-Venus 2.9B rapporterar 11,3 % på OSHarm och 48,8 % på OSBlind – den andra siffran är hög i absoluta tal, och kortets inramning är en jämförelse mot dess basmodell snarare än ett absolut påstående om robusthet. Läs det som ”betydligt bättre än var den började”, inte som ”säker”.

MiniCPM-V 4.7:s arkitektur har inget att säga om något av detta. Linjär attention över en lång kontext skulle hjälpa en agent som måste komma ihåg en lång interaktionshistorik, och den glesa MoE:n skulle hjälpa genomströmningen om man kör många episoder. Men en arkitektur som skulle vara användbar för en agent är inte en agent, och ingen del av den släppta artefakten dokumenterar aktionsutdata, grounding-noggrannhet eller säkerhetsbeteende.

Den ärliga bedömningen av MiniCPM-sidan

Det är frestande att fylla det här avsnittet med 4.6:s siffror. Låt bli. MiniCPM-V 4.6 är en tät 1,3B-modell på en Qwen3.5-0.8B-stomme med ett växlingsbart 4x/16x-system för visuell komprimering, och dess annonserade resultat – en poäng på 13 i Artificial Analysis Intelligence Index, enligt leverantören, till en bråkdel av tokenkostnaden för jämförbara små modeller – beskriver den modellen. MiniCPM-V 4.7 ändrar stommen, ändrar uppmärksamhetsmönstret och ändrar den förvalda visuella komprimeringen. Inga av 4.6:s mätvärden går att överföra, och ingen av dem beskriver ens en GUI-agent från början.

Det som ärligt kan sägas om MiniCPM-V 4.7 är snävt och sakligt: vikterna finns, formen är ovanlig för familjen, kontextfönstret är långt och släppet är ofullständigt. Avsaknaden av en licens är det praktiska hindret; avsaknaden av benchmarks är det utvärderingsmässiga hindret. Och det finns en blygsam anledning till intresse snarare än likgiltighet — OpenBMB bygger GUI-verktyg, däribland AgentCPM-GUI, så en gles MoE-visionmodell med lång kontext från det labbet är inte orimlig som framtida agentryggrad. Det är en hypotes om avsikten, och repoet bekräftar den inte.

Vad du skulle välja, och när

För allt som involverar en skärmbild och en åtgärd – att trycka, skriva, scrolla, navigera i en app eller på en webbplats, extrahera data från ett användargränssnitt – är UI-Venus 2.9B den enda av de två som tar sig an uppgiften. Den har träningen, verifieringsmekanismerna, de rapporterade säkerhetssiffrorna och tillräckligt med verktyg för att sätta upp den på vLLM idag. Inget hos MiniCPM-V 4.7 tyder på att den konkurrerar där, och utan ett modellkort kan du inte ens kontrollera om den avger koordinater.

För allmänt multimodalt arbete – beskriva bilder, läsa dokument, långkontextanalys av bildtungt material – går jämförelsen ännu inte att avgöra, eftersom ena sidan inte har några publicerade kvalitetsbevis. Om du behöver det i dag är UI-Venus 2.9B åtminstone mätbar, även om den har optimerats för gränssnitt snarare än för dokumentresonemang och inte heller är ett självklart förstahandsval för den uppgiften.

Mönstret är detsamma i båda fallen: en självhostad modell som hanterar rutinarbetet, och en hostad frontiermodell för de svåra fall som den skickar vidare. Det är i den överlämningen som en router förtjänar sin plats — en nyckel över 200+ hostade modeller, var och en vidarebefordrad till leverantörens listpris utan något påslag från oss, som automatiskt växlar över när en leverantör presterar sämre. Varken UI-Venus 2.9B eller MiniCPM-V 4.7 hostas på OrcaRouter; båda är vikter som du kör själv. Routern är vad din agent talar med när den beslutar att den lokala modellen inte räcker.

Var detta lämnar dig

Det här är inte ett gränsfall, och anledningen är strukturell snarare än en bedömning av kvalitet. UI-Venus 2.9B är en specialist med en rapport, en licens, benchmarktabeller, säkerhetsutvärdering och ett serveringsrecept. MiniCPM-V 4.7 är en generalist med en konfigurationsfil. En av dem är en produkt och den andra är ett löfte, och det enda ansvarsfulla sättet att jämföra dem är att säga det. Bevaka repositoryt: om OpenBMB publicerar ett kort som visar gränssnittsförankring och handlingsutdata, då blir en sparse MoE med 256K-kontext mot en destillerad 9B-agent en genuint intressant fråga. Fram till dess är svaret på ”vilken ska jag använda” den som finns.