
MiniCPM-V 4.7 vs UI-Venus 2.9B: Een algemeen visiemodel tegenover een speciaal gebouwde GUI-agent
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
MiniCPM-V 4.7 en UI-Venus 2.9B zijn beide vision-language-modellen die naar een schermafbeelding kijken en tekst produceren, en daar houdt de gelijkenis op — want een van hen is precies voor die taak gebouwd. UI-Venus 2.9B is een general-purpose GUI-agent van inclusionAI, uitgebracht op 26 augustus 2026, waarvan het hele ontwerp draait om het observeren van een interface, redeneren over de taakstatus, het uitvoeren van een actie en het integreren van de resulterende feedback; het wordt geleverd met een technisch rapport, benchmarktabellen voor GUI-grounding, mobiele, web-, computer-use- en CAPTCHA-taken, en een expliciete evaluatie van hoe vaak het tot een gevaarlijke actie kan worden overgehaald. MiniCPM-V 4.7 is een sparse mixture-of-experts-checkpoint met 35,2 miljard parameters, geüpload door OpenBMB op 6 oktober 2026 zonder modelkaart, zonder licentie en zonder benchmark. Een specialist vergelijken met een ongemeten generalist is een enigszins ongebruikelijke exercitie, en deze pagina is expliciet over waar de vergelijking opgaat en waar niet.
Twee heel verschillende soorten release
UI-Venus 2.9B is inclusionAI/UI-Venus-2-9B, een model met 9B parameters dat is geïnitialiseerd vanuit Qwen3.5-9B en specifiek is nabijgeschoold als GUI-agent. De kaart beschrijft een gesloten lus — de interface observeren, over de taakstatus redeneren, een actie uitvoeren, de feedback meenemen in de volgende beslissing — getraind in drie fasen: multimodale mid-training op grootschalige gesimuleerde mobiele, web- en desktoptrajecten; offline reinforcement learning, verdeeld over vijf taakfamilies; en multi-teacher on-policy-distillatie die domeingespecialiseerde teachers consolideert tot één policy. Het wordt geëvalueerd op benchmarks voor GUI-grounding, mobiel, web, computer-use en CAPTCHA, en afzonderlijk op veiligheid bij acties met gevolgen: de kaart rapporteert een aanvalssuccespercentage van 11,3% op OSHarm en 48,8% op OSBlind tegenover 25,3% en 79,4% voor zijn Qwen3.5-9B-basis. Het zusterproject van OpenBMB zelf keek overigens naar vergelijkbaar terrein: de MiniCPM-organisatie heeft een AgentCPM-GUI-project van januari 2026, dus dit is een gebied dat beide labs hebben betreden.
MiniCPM-V 4.7 is openbmb/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 BF16-parameters verdeeld over 70,4 GB en zestien shards, geüpload op 6 oktober 2026.

Sparse MoE-tekstbackbone getagd qwen3_5_moe_text — 256 experts, 8 per token — meer dan 40 lagen met een three-linear-to-one-full attentionpatroon, een interne visiontoren van 27 lagen met 16× downsampling en tot negen afbeeldingsslices, en een contextvenster van 256K. Geen README, dus geen licentie en geen benchmarks. Drie likes, nul downloads, lege discussies.
De vergelijking, met de gaten open gelaten
• Doel — UI-Venus 2.9B: een GUI-agent, end-to-end getraind voor interface-interactie. MiniCPM-V 4.7: een algemeen visie-taalmodel; waarvoor het is geoptimaliseerd, wordt niet vermeld.
• Parameters — UI-Venus 2.9B: 9,41B, dense. MiniCPM-V 4.7: 35,2B totaal, sparse, 8 van de 256 experts per token.
• Basismodel — UI-Venus 2.9B: geïnitialiseerd vanuit Qwen3.5-9B, een dense Qwen-tekststack. MiniCPM-V 4.7: een van Qwen3.5 afgeleide MoE-tekststack, klasse qwen3_5_moe_text. Verschillende takken van dezelfde stamboom.
• Interface-grounding — UI-Venus 2.9B: de kerncompetentie, met toegewijde grounding- en CAPTCHA-taakfamilies in de training en een op keypoints gebaseerd verificatiesysteem dat gebruikmaakt van multi-model-stemming. MiniCPM-V 4.7: geen specifieke claim over grounding, en geen gedocumenteerd formaat voor coördinatenuitvoer.
• Veiligheidsevaluatie — UI-Venus 2.9B: rapporteert een ASR van 11,3% op OSHarm en 48,8% op OSBlind. MiniCPM-V 4.7: geen.
• Bewijsmateriaal — UI-Venus 2.9B: een technisch rapport op arXiv, een projectpagina, een GitHub-repo en benchmarktabellen. MiniCPM-V 4.7: een configuratiebestand.
• Gereedschap — UI-Venus 2.9B: vLLM-snelstart met een reasoning-parser-flag, plus GGUF-conversies vanuit de community. MiniCPM-V 4.7: nog niets.

Waarom een GUI-agent niet zomaar "een VLM die naar schermen kijkt" is
Het verschil tussen deze twee modellen draait niet in de eerste plaats om het aantal parameters, en het is de moeite waard om dat duidelijk te maken, want dat is juist wat de confrontatie interessant maakt in plaats van louter eenzijdig.
Een screenshot-taak heeft een eigenschap die de meeste vision-benchmarks niet hebben: de output moet uitvoerbaar zijn. Wanneer UI-Venus 2.9B wordt gevraagd op een knop te tikken, moet het een coördinaat of een gestructureerde actie produceren die de omgeving daadwerkelijk kan toepassen, en een kleine fout in grounding is niet een fout antwoord op een leaderboard, het is een mislukte taak en een corrupte staat. Daarom besteedt de UI-Venus 2-kaart zo veel van zijn lengte aan verificatie: taakvoltooiing wordt beoordeeld op taakrelevante visuele keypoints in plaats van een holistische blik op het uiteindelijke scherm, en heterogene beoordelaars stemmen om de bias van een enkele beoordelaar te verminderen. Het doel van dat mechanisme is om het reinforcement-learning-beloningssignaal robuust te maken tegen reward hacking — een model dat leert een luie verifier tevreden te stellen in plaats van de taak te voltooien.
Het legt ook de veiligheidssectie uit.

Een agent die een telefoon of een desktop kan bedienen, heeft een aanvalsoppervlak dat een captioningmodel niet heeft, en het rapporteren van een aanvalssuccespercentage is het minimum dat een lab zou moeten doen bij het uitbrengen van zo'n agent. UI-Venus 2.9B rapporteert 11,3% op OSHarm en 48,8% op OSBlind — het tweede cijfer is hoog in absolute termen, en de framing van de kaart is een vergelijking met zijn basismodel in plaats van een absolute claim van robuustheid. Lees het als 'beduidend beter dan waar het begon', niet als 'veilig'.
De architectuur van MiniCPM-V 4.7 zegt niets over dit alles. Lineaire attention over een lange context zou een agent helpen die een lange interactiegeschiedenis moet onthouden, en de sparse MoE zou de doorvoer ten goede komen als je veel episodes draait. Maar een architectuur die nuttig zou zijn voor een agent is geen agent, en geen enkel deel van het vrijgegeven artefact documenteert actie-output, groundingnauwkeurigheid of veiligheidsgedrag.
De eerlijke beoordeling van de MiniCPM-kant
Het is verleidelijk om deze sectie te vullen met de cijfers van 4.6. Weersta die verleiding. MiniCPM-V 4.6 is een 1,3B dense model op een Qwen3.5-0.8B-backbone met een omschakelbaar 4x/16x visueel compressieschema, en de geadverteerde resultaten — een score van 13 op de Artificial Analysis Intelligence Index, door de leverancier gerapporteerd, tegen een fractie van de tokenkosten van vergelijkbare kleine modellen — beschrijven dat model. MiniCPM-V 4.7 verandert de backbone, verandert het attentionpatroon en verandert de standaard visuele compressie. Geen van de metingen van 4.6 is overdraagbaar, en geen enkele beschrijft überhaupt een GUI-agent.
Wat er eerlijk over MiniCPM-V 4.7 gezegd kan worden, is beperkt en feitelijk: de gewichten bestaan, de vorm is ongebruikelijk voor de familie, het contextvenster is lang, en de release is onvolledig. Het ontbreken van een licentie is de praktische belemmering; het ontbreken van benchmarks is de evaluatieve belemmering. En er is één bescheiden reden voor interesse in plaats van onverschilligheid — OpenBMB bouwt GUI-tooling, waaronder AgentCPM-GUI, dus een sparse MoE-visiemodel met lange context uit dat lab is niet onwaarschijnlijk als toekomstige agent-backbone. Dat is een hypothese over de intentie, en de repository bevestigt die niet.
Wat je zou kiezen, en wanneer
Voor alles waarbij een screenshot en een actie komen kijken — tikken, typen, scrollen, navigeren door een app of website, gegevens uit een UI extraheren — is UI-Venus 2.9B de enige van de twee die de taak aanpakt. Het heeft de training, de verificatiemachinerie, de gerapporteerde veiligheidscijfers en voldoende tooling om het vandaag op vLLM op te zetten. Niets aan MiniCPM-V 4.7 suggereert dat het daar concurreert, en zonder een modelkaart kun je niet eens controleren of het coördinaten uitzendt.
Voor algemeen multimodaal werk — het beschrijven van afbeeldingen, het lezen van documenten, langcontextanalyse van beeldrijk materiaal — is de vergelijking nog niet te beslechten, omdat één kant geen gepubliceerd kwaliteitsbewijs heeft. Als je dat vandaag nodig hebt, is UI-Venus 2.9B ten minste meetbaar, hoewel het is afgestemd op interfaces in plaats van op documentredenering en ook geen voor de hand liggende eerste keuze voor die taak is.
Het patroon is in beide gevallen hetzelfde: een zelfgehost model dat het routinewerk afhandelt, en een gehost frontier-model voor de moeilijke gevallen die het doorgeeft. Die overdracht is waar een router zijn plaats verdient — één sleutel voor meer dan 200 gehoste modellen, elk doorgegeven tegen de lijstprijs van de provider, zonder enige markup van onze kant, met automatische failover wanneer een provider verslechtert. Noch UI-Venus 2.9B noch MiniCPM-V 4.7 wordt gehost op OrcaRouter; beide zijn gewichten die je zelf draait. De router is waar je agent mee praat wanneer die besluit dat het lokale model niet volstaat.
Wat dit voor jou betekent
Dit is geen moeilijke afweging, en de reden daarvoor is structureel in plaats van een oordeel over kwaliteit. UI-Venus 2.9B is een specialist met een rapport, een licentie, benchmarktabellen, een veiligheidsevaluatie en een servingrecept. MiniCPM-V 4.7 is een generalist met een configuratiebestand. Een van beide is een product en de andere is een belofte, en de enige verantwoorde manier om ze te vergelijken is dat te zeggen. Houd de repository in de gaten: als OpenBMB een kaart publiceert die interface-grounding en actie-output toont, dan wordt een sparse MoE met 256K-context tegen een gedistilleerde 9B-agent een werkelijk interessante vraag. Tot dan is het antwoord op "welke moet ik gebruiken" degene die bestaat.
