
MiniCPM-V 4.7 vs. UI-Venus 2.9B: Ein allgemeines Vision-Modell gegen einen zweckgebauten GUI-Agenten
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
MiniCPM-V 4.7 und UI-Venus 2.9B sind beide Vision-Language-Modelle, die sich einen Screenshot ansehen und Text erzeugen, und dort endet die Ähnlichkeit – denn eines von ihnen wurde genau für diese Aufgabe gebaut. UI-Venus 2.9B ist ein Allzweck-GUI-Agent von inclusionAI, veröffentlicht am 26. August 2026, dessen gesamtes Design darauf ausgerichtet ist, eine Oberfläche zu beobachten, über den Zustand der Aufgabe zu schließen, eine Aktion auszugeben und das daraus resultierende Feedback einzubeziehen; es wird mit einem technischen Bericht, Benchmark-Tabellen für GUI-Grounding-, Mobile-, Web-, Computer-Use- und CAPTCHA-Aufgaben sowie einer expliziten Bewertung geliefert, wie oft es zu einer gefährlichen Aktion überredet werden kann. MiniCPM-V 4.7 ist ein von OpenBMB am 6. Oktober 2026 hochgeladener Sparse-Mixture-of-Experts-Checkpoint mit 35,2 Milliarden Parametern, ohne Modellkarte, ohne Lizenz und ohne Benchmark. Einen Spezialisten mit einem nicht vermessenen Generalisten zu vergleichen, ist ein etwas ungewöhnliches Unterfangen, und diese Seite macht ausdrücklich klar, wo der Vergleich trägt und wo nicht.
Zwei sehr unterschiedliche Arten von Release
UI-Venus 2.9B ist inclusionAI/UI-Venus-2-9B, ein Modell mit 9B Parametern, initialisiert aus Qwen3.5-9B und speziell als GUI-Agent nachtrainiert. Die Karte beschreibt einen geschlossenen Kreislauf – die Schnittstelle beobachten, den Aufgabenstatus analysieren, eine Aktion ausführen, das Feedback in die nächste Entscheidung einfließen lassen – trainiert über drei Phasen: multimodales Mid-Training auf groß angelegten simulierten Mobil-, Web- und Desktop-Trajektorien; Offline-Reinforcement-Learning aufgeteilt auf fünf Aufgabenfamilien; und Multi-Teacher-On-Policy-Distillation, die domänenspezialisierte Lehrer in einer einzigen Policy zusammenführt. Es wird auf GUI-Grounding-, Mobil-, Web-, Computer-Use- und CAPTCHA-Benchmarks evaluiert und separat auf die Sicherheit folgenschwerer Aktionen: Die Karte berichtet eine Angriffserfolgsrate von 11,3 % bei OSHarm und 48,8 % bei OSBlind gegenüber 25,3 % und 79,4 % für die Qwen3.5-9B-Basis. OpenBMBs eigenes Schwesterprojekt, nebenbei bemerkt, betrachtete ähnliches Terrain: Die MiniCPM-Organisation hat ein AgentCPM-GUI-Projekt von Januar 2026, also ist dies eine Spur, in die beide Labore eingestiegen sind.
MiniCPM-V 4.7openbpm/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 BF16-Parameter verteilt auf 70,4 GB und sechzehn Shards, 6. Oktober 2026.

Sparse-MoE-Text-Backbone mit dem Tag qwen3_5_moe_text — 256 Experten, 8 pro Token — über 40 Schichten mit einem Attention-Muster aus drei linearen und einer vollständigen Attention, ein hauseigener Vision-Tower mit 27 Schichten, 16-fachem Downsampling und bis zu neun Bildausschnitten sowie ein 256K-Kontextfenster. Kein README, daher keine Lizenz und keine Benchmarks. Drei Likes, null Downloads, leere Diskussionen.
Der Vergleich, mit den offen gelassenen Lücken
• Zweck — UI-Venus 2.9B: ein GUI-Agent, der End-to-End für Interface-Interaktion trainiert wurde. MiniCPM-V 4.7: ein allgemeines Vision-Language-Modell; wofür es optimiert ist, wird nicht angegeben.
• Parameter — UI-Venus 2.9B: 9,41B, dicht. MiniCPM-V 4.7: 35,2B insgesamt, dünn besetzt, 8 von 256 Experten pro Token.
• Basismodell — UI-Venus 2.9B: initialisiert aus Qwen3.5-9B, einem dichten Qwen-Textstack. MiniCPM-V 4.7: ein von Qwen3.5 abgeleiteter MoE-Textstack, Klasse qwen3_5_moe_text. Unterschiedliche Zweige desselben Stammbaums.
• Interface-Grounding — UI-Venus 2.9B: die Kernkompetenz, mit dedizierten Grounding- und CAPTCHA-Aufgabenfamilien im Training und einem keypoint-basierten Verifikationssystem mit Multi-Modell-Voting. MiniCPM-V 4.7: keine grounding-spezifische Angabe und kein dokumentiertes Koordinaten-Ausgabeformat.
• Sicherheitsbewertung — UI-Venus 2.9B: meldet eine ASR von 11,3 % bei OSHarm und 48,8 % bei OSBlind. MiniCPM-V 4.7: keine.
• Belege — UI-Venus 2.9B: ein technischer Bericht auf arXiv, eine Projektseite, ein GitHub-Repo und Benchmark-Tabellen. MiniCPM-V 4.7: eine Konfigurationsdatei.
• Tooling — UI-Venus 2.9B: vLLM-Schnellstart mit einem Reasoning-Parser-Flag, plus GGUF-Konvertierungen aus der Community. MiniCPM-V 4.7: noch nichts.

Warum ein GUI-Agent nicht einfach „ein VLM ist, der auf Bildschirme schaut“
Die Kluft zwischen diesen beiden Modellen dreht sich nicht hauptsächlich um die Parameterzahl, und es lohnt sich, das ausdrücklich zu sagen, denn genau das macht das Duell interessant statt bloß einseitig.
Eine Screenshot-Aufgabe hat eine Eigenschaft, die die meisten Vision-Benchmarks nicht haben: Die Ausgabe muss ausführbar sein. Wenn UI-Venus 2.9B aufgefordert wird, auf eine Schaltfläche zu tippen, muss es eine Koordinate oder eine strukturierte Aktion ausgeben, die die Umgebung tatsächlich anwenden kann, und ein kleiner Fehler beim Grounding ist keine falsche Antwort in einem Leaderboard, sondern eine fehlgeschlagene Aufgabe und ein beschädigter Zustand. Deshalb verwendet die UI-Venus 2-Karte so viel ihrer Länge auf Verifikation: Die Aufgabenerfüllung wird anhand aufgabenrelevanter visueller Keypoints beurteilt statt anhand eines ganzheitlichen Blicks auf den letzten Bildschirm, und heterogene Richter stimmen ab, um den Bias einzelner Richter zu verringern. Der Zweck dieser Maschinerie ist es, das Belohnungssignal des Reinforcement Learnings robust gegen Reward-Hacking zu machen — ein Modell, das lernt, einen faulen Verifier zufriedenzustellen, statt die Aufgabe zu erfüllen.
Es erklärt auch den Sicherheitsabschnitt.

Ein Agent, der ein Telefon oder einen Desktop bedienen kann, hat eine Angriffsfläche, die ein Captioning-Modell nicht hat, und die Angabe einer Angriffserfolgsrate ist das Mindeste, was ein Labor beim Ausliefern eines solchen Agenten tun sollte. UI-Venus 2.9B meldet 11,3 % auf OSHarm und 48,8 % auf OSBlind – die zweite Zahl ist in absoluten Zahlen hoch, und die Darstellung auf der Karte ist ein Vergleich mit seinem Basismodell und keine absolute Robustheitsaussage. Lesen Sie es als „deutlich besser als der Ausgangspunkt“, nicht als „sicher“.
Die Architektur von MiniCPM-V 4.7 hat zu all dem nichts zu sagen. Lineare Attention über einen langen Kontext würde einem Agenten helfen, der sich an eine lange Interaktionshistorie erinnern muss, und das sparse MoE würde den Durchsatz erhöhen, wenn man viele Episoden ausführt. Aber eine Architektur, die für einen Agenten nützlich wäre, ist kein Agent, und kein Teil des veröffentlichten Artefakts dokumentiert Aktionsausgaben, Grounding-Genauigkeit oder Sicherheitsverhalten.
Die ehrliche Einschätzung der MiniCPM-Seite
Es ist verlockend, diesen Abschnitt mit den Zahlen von 4.6 zu füllen. Widerstehen Sie der Versuchung. MiniCPM-V 4.6 ist ein dichtes 1,3B-Modell auf einem Qwen3.5-0.8B-Backbone mit einem umschaltbaren 4x/16x-Visual-Compression-Schema, und seine beworbenen Ergebnisse – ein Wert von 13 im Artificial Analysis Intelligence Index, vom Anbieter gemeldet, zu einem Bruchteil der Token-Kosten vergleichbarer kleiner Modelle – beschreiben dieses Modell. MiniCPM-V 4.7 ändert das Backbone, ändert das Attention-Muster und ändert die standardmäßige visuelle Kompression. Keine der Messungen von 4.6 lässt sich übertragen, und keine davon beschreibt überhaupt einen GUI-Agenten.
Was sich ehrlicherweise über MiniCPM-V 4.7 sagen lässt, ist begrenzt und sachlich: Die Gewichte existieren, der Zuschnitt ist für die Familie ungewöhnlich, das Kontextfenster ist lang, und die Veröffentlichung ist unvollständig. Das Fehlen einer Lizenz ist das praktische Hindernis; das Fehlen von Benchmarks das bewertungsbezogene. Und es gibt einen bescheidenen Grund für Interesse statt Gleichgültigkeit – OpenBMB entwickelt GUI-Tooling, darunter AgentCPM-GUI, weshalb ein Sparse-MoE-Vision-Modell mit langem Kontext aus diesem Labor als künftiges Agent-Backbone nicht unplausibel ist. Das ist eine Hypothese über die Absicht, und das Repository bestätigt sie nicht.
Was du wählen würdest, und wann
Für alles, was einen Screenshot und eine Aktion umfasst – Tippen, Eingeben, Scrollen, Navigieren in einer App oder auf einer Website, Extrahieren von Daten aus einer UI – ist UI-Venus 2.9B der einzige der beiden, der diese Aufgabe adressiert. Es hat das Training, die Verifizierungsmechanik, die gemeldeten Sicherheitszahlen und genügend Tooling, um es heute auf vLLM aufzusetzen. Nichts an MiniCPM-V 4.7 deutet darauf hin, dass es dort konkurriert, und ohne eine Modellkarte kann man nicht einmal prüfen, ob es Koordinaten ausgibt.
Für allgemeine multimodale Arbeit – das Beschreiben von Bildern, das Lesen von Dokumenten, Langkontextanalysen über bildlastigem Material – ist der Vergleich noch nicht entscheidbar, weil für eine Seite keine veröffentlichten Qualitätsbelege vorliegen. Wenn Sie das heute brauchen, ist UI-Venus 2.9B zumindest messbar, obwohl es eher für Schnittstellen als für das Schlussfolgern über Dokumente abgestimmt wurde und für diese Aufgabe auch keine naheliegende erste Wahl ist.
Das Muster ist in beiden Fällen dasselbe: ein selbst gehostetes Modell, das die Routinearbeit erledigt, und ein gehostetes Frontier-Modell für die schwierigen Fälle, die es weitergibt. Genau bei dieser Übergabe verdient sich ein Router seinen Platz — ein Schlüssel für über 200 gehostete Modelle, jedes zum Listenpreis des Anbieters ohne Aufschlag unsererseits durchgereicht, mit automatischem Failover, wenn ein Anbieter schlechter wird. Weder UI-Venus 2.9B noch MiniCPM-V 4.7 wird auf OrcaRouter gehostet; beides sind Gewichte, die Sie selbst ausführen. Der Router ist das, womit Ihr Agent spricht, wenn er entscheidet, dass das lokale Modell nicht ausreicht.
Wo dich das hinstellt
Das ist keine knappe Entscheidung, und der Grund dafür ist struktureller Natur und kein Urteil über die Qualität. UI-Venus 2.9B ist ein Spezialist mit einem Bericht, einer Lizenz, Benchmark-Tabellen, Sicherheitsbewertung und einem Serving-Rezept. MiniCPM-V 4.7 ist ein Generalist mit einer Konfigurationsdatei. Eines davon ist ein Produkt und das andere ist ein Versprechen, und die einzige verantwortungsvolle Art, sie zu vergleichen, ist, das zu sagen. Beobachte das Repository: wenn OpenBMB eine Modellkarte veröffentlicht, die Interface-Grounding und Aktionsausgabe zeigt, dann wird ein 256K-Kontext-Sparse-MoE gegen einen destillierten 9B-Agenten zu einer wirklich interessanten Frage. Bis dahin ist die Antwort auf „Welches sollte ich verwenden?“ diejenige, die existiert.
