Hero-Karte mit dem Kicker „TWO DIFFERENT JOBS" und der Schlagzeile „DSpark vs UI-Venus 2.9B", untertitelt mit „Ein 279,5-facher Geschwindigkeitsmultiplikator gegen einen 9B-GUI-Agenten – der Vergleich ergibt erst dann Sinn, wenn man aufhört, sie als Substitute zu betrachten." Drei Karten lesen „279,5M Drafter – Macht LFM2.5-VL-3B schneller; erzeugt allein nichts", „9B GUI-Agent – inclusionAI von Ant Group; klickt, tippt, navigiert" und „Keine Substitute – Das eine ist eine Laufzeitoptimierung, das andere die Policy". Eine Fußzeile liest „Geschwindigkeitswerte vom Anbieter Liquid AI gemessen; Agenten-Scores vom Anbieter Ant Group gemeldet. Keines von beidem wurde unabhängig reproduziert." Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Engineering & Research

LFM2.5-VL-3B-DSpark vs. UI-Venus 2.9B: Ein Geschwindigkeitsmultiplikator gegen einen GUI-Agenten

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

LFM2.5-VL-3B-DSpark und UI-Venus 2.9B werden unter derselben schwammigen Überschrift abgelegt – kleine Vision-Modelle – und dann miteinander verglichen. Das ist ein Kategorienfehler, den man besser behebt, bevor er jemanden eine Woche Integration kostet. LFM2.5-VL-3B-DSpark ist ein Draft-Modell mit 279,5 Millionen Parametern, das Liquid AIs LFM2.5-VL-3B beschleunigt. UI-Venus 2.9B aus dem inclusionAI-Lab von Ant Group ist ein 9B-GUI-Agent, der Screenshots liest, eine Aktion festlegt und sie in mobilen, Web- und Desktop-Umgebungen ausführt. Das eine macht ein vorhandenes Modell schneller. Das andere ist das, was die Arbeit erledigt. Wenn Sie einen GUI-Agenten brauchen, ist der Drafter keine günstigere Option – er ist überhaupt keine Option.

Der nützliche Vergleich ist nicht, welches besser ist, sondern welches Problem jedes einzelne löst und was jedes einen im Prozess kostet. Beide sind zudem Neuankömmlinge, mit denen das breitere Ökosystem noch nicht Schritt gehalten hat, und die Lücke zwischen dem, was ihre Repositories behaupten, und dem, was sonst jemand verifiziert hat, ist bei einem von ihnen größer als beim anderen.

Was jedes Einzelne genau ist

Beginne mit den Formen, denn sie erklären den Großteil des Rests.

• Was es ist: LFM2.5-VL-3B-DSpark ist ein Speculative-Decoding-Drafter; UI-Venus 2.9B ist eine universell einsetzbare GUI-Policy

• Parameter — 279,5 Mio. BF16 für den Drafter, gegenüber 9B für UI-Venus 2.9B, initialisiert aus Qwen3.5-9B

• Eigenständige Fähigkeit — der Drafter erzeugt allein nichts Nutzbares und kann nicht isoliert einem Benchmark unterzogen werden; UI-Venus 2.9B läuft als vollständiger Agent

• Eingaben — der Drafter sieht das Bild selbst nie, nur die verborgenen Zustände des Zielmodells; UI-Venus 2.9B verarbeitet Screenshots direkt und ist vollständig darauf ausgelegt

• Ausgaben — der Drafter schlägt Token zur Verifikation vor; UI-Venus 2.9B gibt verankerte Aktionen mit Bounding Boxes gegenüber einer Live-Oberfläche aus

• Basis — der Drafter ist in seinen eigenen Metadaten an LiquidAI/LFM2.5-VL-3B gebunden; UI-Venus 2.9B baut auf Qwen3.5-9B auf

• Kontext — der Drafter erbt, was auch immer das Ziel bereitstellt; UI-Venus 2.9B wird mit einem Maximum von 262.144 Token im eigenen vLLM-Rezept des Anbieters bereitgestellt

• Lizenz — beide sind auf unterschiedliche Weise ungeklärt; Liquid wird unter der LFM1.0-Lizenz vertrieben, und die Karte von UI-Venus 2.9B gibt unumwunden an, dass seine Lizenz für die Gewichte noch auf die endgültige Bestätigung wartet

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

Der letzte Aufzählungspunkt ist der, bei dem man langsamer machen sollte. Unsere eigene Berichterstattung zu UI-Venus-2-9B Ende August beschrieb das Release als Apache-2.0, weil die Materialien des Projekts damals genau das auswiesen. Die Modellkarte sagt heute etwas anderes und Stärkeres: dass die Lizenz für die Modellgewichte noch auf ihre endgültige Bestätigung wartet und vor der öffentlichen Veröffentlichung ergänzt wird und dass eine Apache-2.0-Erklärung absichtlich nicht übernommen wurde, weil die aktuellen Upstream-Materialien widersprüchliche Lizenzangaben enthalten. Wenn Sie einen kommerziellen Einsatz von UI-Venus 2.9B planen, ist die Lizenzfrage nach eigenem Eingeständnis des Anbieters offen, und das ist ein wesentliches Risiko und nicht bloß eine Fußnote.

Die Zahlen, die jede Seite tatsächlich veröffentlicht hat

Die beiden Repositories messen unterschiedliche Dinge – und genau darum geht es. Liquid veröffentlicht den Durchsatz; Ant Group veröffentlicht den Task-Erfolg.

Für den Drafter, gemäß Liquids eigenem Harness: bis zu 2,66× Decode-Beschleunigung auf einer einzelnen H100 80GB in BF16 über SGLang, bis zu 3,13× mit MLX-VLM auf einem Apple M5 Max und bis zu 2,14× mit llama.cpp auf einem M3 Ultra. End-to-End liegen dieselben Läufe je nach Stack und Aufgabe zwischen 1,30× und 2,62×. Die Draft-Akzeptanz liegt bei etwa 3,2 bis 4,5 Tokens pro Verifikationsdurchlauf. All diese Werte sind vom Hersteller gemessen, ohne externe Reproduktion.

Für UI-Venus 2.9B melden die eigenen Tabellen der Karte 80,2 auf AndroidWorld, 65,8 auf MobileWorld bei einem Budget von 50 Schritten, 70,8 auf OSWorld-Verified, 48,0 auf DeskCraft, 90,8 auf WebVoyager über den aktualisierten 595-Aufgaben-Split, 74,0 auf Online-Mind2Web, 73,0 auf ScreenSpot-Pro und 77,1 auf VenusBench-GD. Bei CAPTCHA meldet sie 78,1 auf VenusBench-CAPTCHA und 75,7 auf MCA-Bench. Auf der Sicherheitsseite meldet sie eine Angriffserfolgsrate von 11,3 % auf OSHarm gegenüber 25,3 % für ihre Qwen3.5-9B-Basis. All dies ist vom Anbieter gemeldet, einige Baselines tragen ein Sternchen, was bedeutet, dass die UI-Venus-Autoren sie unter dem angegebenen Protokoll bewertet haben, und die Karte selbst warnt, dass OSWorld-Verified-Vergleiche modellspezifische Action-Scaffolds verwenden und als Referenzen auf Benchmark-Ebene statt als kontrollierte Ablationen gelesen werden sollten.

Beachten Sie, was in beiden Listen fehlt: alles, was von Dritter Seite gemessen wurde. Beim Drafter liegt das daran, dass der Checkpoint mehrere Tage alt ist. Bei UI-Venus 2.9B liegt es daran, dass GUI-Agent-Benchmarks teuer zu reproduzieren sind und sich die Ergebnisse der Live-Umgebung mit dem Zustand der Umgebung am Bewertungstag ändern — eine Einschränkung, die die Modellkarte freiwillig angibt.

Wo die beiden tatsächlich aufeinandertreffen

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

Es gibt eine echte Überschneidung, und sie ist enger, als die Kategoriebezeichnung vermuten lässt. Beide sind relevant, wenn man einen visuellen Agenten für On-Device- oder Edge-Einsatz entwickelt, und beide befassen sich mit den Kosten dafür, Pixel durch ein Modell zu bekommen. Sie gehen es von entgegengesetzten Enden an.

UI-Venus 2.9B geht das mit Training an: eine dreistufige Pipeline aus multimodalem Mid-Training über simulierte Mobil-, Web- und OS-Umgebungen, domänenspezifischem Offline-RL und anschließend Multi-Teacher-On-Policy-Distillation in eine einzige Policy. Die veröffentlichte Fähigkeit ist das Ergebnis. Das Modell hat 9B, was für einen GUI-Agenten klein und für ein Edge-Gerät groß ist, und die vorgesehene Serving-Konfiguration der Model Card ist ein vLLM-Deployment – dieselbe Dokumentation merkt an, dass diese Konfiguration im Rahmen des Model-Card-Updates nicht live-canary-validiert wurde, und rät Ihnen, vor dem Deployment Ihre vLLM-Version für Qwen3.5 zu pinnen und zu verifizieren.

LFM2.5-VL-3B-DSpark geht es mit Laufzeit an: Es lässt die Gewichte des Zielmodells unangetastet und erkauft sich Geschwindigkeit durch das Entwerfen und Verifizieren von Tokens. Auf einem Gerät der Telefonklasse ist der Handel einseitig zugunsten des Drafters, weil die Ausgabe nachweislich vom Zielmodell stammt und der zusätzliche Speicher unter einem Zehntel eines Modells liegt.

Die Konsequenz für jeden, der wählt: Eine Agentenschleife löst viele Modellaufrufe pro Aufgabe aus, und jeder Aufruf bezahlt den Prefill für einen neuen Screenshot. Vision-Encoding und Prefill sind genau die Phasen, die spekulative Dekodierung nicht beschleunigt — Liquids eigene Ankündigung führt dieses Argument gegen eine uneingeschränkte Lesart seiner Schlagzeilenzahlen an. Der Vorteil des Drafters schrumpft also genau in der Arbeitslast, in der UI-Venus 2.9B lebt. Umgekehrt ist der Vorteil von UI-Venus 2.9B — die Aufgabe tatsächlich abzuschließen — nichts, was ein Drafter mit noch so hoher Geschwindigkeit bietet.

Die beiden ausführen

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

Keines von beiden ist ein gehosteter Endpoint auf OrcaRouter. LFM2.5-VL-3B-DSpark und UI-Venus 2.9B erfordern beide, dass Sie die Gewichte herunterladen und sie selbst hosten, und ihre Serving-Storys sind von ihren sehr unterschiedlichen Rollen geprägt. Der Drafter benötigt SGLang v0.5.19 oder neuer mit einem Flag für den spekulativen DSPARK-Algorithmus und einer Blockgröße von 9, oder MLX-VLM v0.7.2 oder neuer, wobei der Drafter als Draft-Modell übergeben und die Temperatur auf null erzwungen wird, oder llama.cpp mit einer 567 MB großen F16-GGUF, die mit einem quantisierten Target gepaart wird. UI-Venus 2.9B benötigt einen vLLM-Server, der groß genug für ein 9B-Modell mit einer maximalen Länge von 262.144 Token ist, plus die Referenz-Prompts und Action-Parser aus dem Code-Repository des Projekts — die Modellkarte stellt ausdrücklich klar, dass das alleinige Starten des Servers keinen funktionierenden Closed-Loop-GUI-Agenten liefert.

Beide hinterlassen außerdem dieselbe Lücke an den Rändern dessen, was sie leisten können. Ein kleines Vision-Language-Modell, kombiniert mit einem Drafter, filtert weiterhin Anfragen und übernimmt Aufgaben, die es nicht bewältigen kann, und ein GUI-Agent scheitert weiterhin in Umgebungen außerhalb seiner Trainingsverteilung. Die Anfragen, die durchfallen, landen irgendwo, und in den meisten Produktionsdesigns ist das ein größeres Allzweckmodell. Diese über einen einzigen Endpunkt, der 200+ Modelle zum Listenpreis des jeweiligen Anbieters abdeckt, mit automatischem Failover bei Leistungseinbußen eines Anbieters zu leiten, hält den Fallback-Pfad von der Liste der kritischen Integrationen fern, statt ihn in ein zweites Bereitstellungsprojekt mit eigenen Schlüsseln und Verträgen zu verwandeln.

Wie man in einer Minute entscheidet

Wenn Sie Software benötigen, die eine Benutzeroberfläche bedient – Klicken, Tippen, Navigieren in einer App, die sie noch nie gesehen hat –, dann kaufen Sie eine Policy, und das ist UI-Venus 2.9B. Planen Sie ein Budget für ein 9B-vLLM-Deployment ein, lesen Sie die offene Lizenzfrage, bevor Sie sich kommerziell festlegen, und behandeln Sie die Benchmark-Tabelle des Anbieters als starke Ausgangshypothese statt als gesichertes Ergebnis, insbesondere die OSWorld-Verified-Vergleiche, die die Karte selbst als scaffold-abhängig kennzeichnet.

Wenn Sie bereits LFM2.5-VL-3B ausführen und es auf Ihrer eigenen Hardware schneller haben möchten, dann kaufen Sie eine Laufzeitoptimierung, und zwar LFM2.5-VL-3B-DSpark. Prüfen Sie zuerst drei Dinge: dass Ihre Workloads Decode-lastig statt Prefill-lastig sind, dass Sie mit 16 Bit statt mit einem 4-Bit-Export ausliefern und dass Ihre Laufzeit die Versionsuntergrenzen erfüllt. Wenn alle drei zutreffen, liegen die Speicherkosten bei 8,9 % und die Ausgabe ist konstruktionsbedingt unverändert.

Das Einzige, was den Kontakt mit keinem der beiden Repositories übersteht, ist, sie als Ersatz füreinander zu behandeln. Sie sind ein Geschwindigkeitsmultiplikator und ein Agent, und das einzige Szenario, in dem sie konkurrieren, ist das, in dem du bereits entschieden hast, was du baust, und nach einem Grund suchst, stattdessen etwas Billigeres zu bauen.

OrcaRouter erreicht über einen einzigen Schlüssel 200+ Modelle zum Listenpreis des Anbieters mit 0 % Aufschlag, mit Routing-Richtlinie und automatischem Failover für die Anfragen, die ein Edge-Modell oder ein Agent nicht übernehmen sollte. eine API für den Fallback-Pfad Keines der Modelle auf dieser Seite wird dort gehostet – beide werden aus Ihren eigenen Gewichten bereitgestellt –, aber der Fallback-Pfad ist der Teil, den Sie nicht selbst bauen müssen.