Karta główna z nadtytułem „DWA RÓŻNE ZADANIA" i nagłówkiem „DSpark vs UI-Venus 2.9B", z podtytułem „Mnożnik prędkości 279,5M kontra agent GUI 9B — porównanie ma sens tylko wtedy, gdy przestaniesz traktować je jako zamienniki". Trzy karty głoszą: „Model draftujący 279,5M — przyspiesza LFM2.5-VL-3B; samodzielnie nic nie generuje", „Agent GUI 9B — inclusionAI od Ant Group; klika, wpisuje tekst, nawiguje" oraz „To nie zamienniki — jedno to optymalizacja czasu działania, drugie to polityka". W stopce czytamy: „Wskaźniki prędkości zmierzone przez dostawcę, Liquid AI; wyniki agenta raportowane przez dostawcę, Ant Group. Żadnych z nich nie odtworzono niezależnie". Logo OrcaRouter jest wkomponowane w prawym dolnym narożniku.
Engineering & Research

LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B: mnożnik szybkości w starciu z agentem GUI

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

LFM2.5-VL-3B-DSpark i UI-Venus 2.9B trafiają pod ten sam nieprecyzyjny nagłówek — małe modele wizyjne — a następnie są porównywane ze sobą, co jest błędem kategorii, który warto naprawić, zanim zacznie kosztować kogoś tydzień integracji. LFM2.5-VL-3B-DSpark to model szkicujący o 279,5 mln parametrów, który przyspiesza LFM2.5-VL-3B od Liquid AI. UI-Venus 2.9B z laboratorium inclusionAI należącego do Ant Group to agent GUI 9B, który czyta zrzuty ekranu, decyduje o działaniu i wykonuje je w środowiskach mobilnych, webowych i desktopowych. Jeden przyspiesza istniejący model. Drugi wykonuje właściwą pracę. Jeśli potrzebujesz agenta GUI, model szkicujący nie jest tańszą opcją — nie jest żadną opcją.

Użyteczne porównanie nie polega na tym, które z nich jest lepsze, ale na tym, jaki problem rozwiązuje każde z nich i ile cię to kosztuje w tym procesie. Oba są także nowymi rozwiązaniami, za którymi szerszy ekosystem jeszcze nie nadążył, a rozbieżność między tym, co deklarują ich repozytoria, a tym, co zostało zweryfikowane przez kogokolwiek innego, jest większa w przypadku jednego z nich niż drugiego.

Czym dokładnie jest każdy z nich

Zacznij od kształtów, ponieważ wyjaśniają one większość pozostałych rzeczy.

• Co to jest — LFM2.5-VL-3B-DSpark to drafter dekodowania spekulatywnego; UI-Venus 2.9B to polityka agenta GUI ogólnego przeznaczenia

• Parametry — 279,5 mln BF16 dla modelu draftującego, w porównaniu z 9 mld dla UI-Venus 2.9B zainicjalizowanego z Qwen3.5-9B

• Możliwość samodzielna — model szkicujący sam nie generuje niczego użytecznego i nie można go benchmarkować w izolacji; UI-Venus 2.9B działa jako kompletny agent

• Wejścia — drafter nigdy nie widzi samego obrazu, tylko ukryte stany modelu docelowego; UI-Venus 2.9B przetwarza zrzuty ekranu bezpośrednio i jest w całości zbudowany wokół nich

• Wyjścia — model szkicujący proponuje tokeny do weryfikacji; UI-Venus 2.9B emituje ugruntowane akcje z ramkami ograniczającymi wobec działającego interfejsu

• Base — model draftujący jest powiązany z LiquidAI/LFM2.5-VL-3B w swoich własnych metadanych; UI-Venus 2.9B bazuje na Qwen3.5-9B

• Kontekst — drafter dziedziczy to, co zapewnia target; UI-Venus 2.9B jest obsługiwany z maksymalnym rozmiarem 262 144 tokenów we własnej recepturze vLLM dostawcy

• Licencja — oba przypadki pozostają nierozwiązane, każdy na inny sposób; Liquid jest udostępniany na licencji LFM1.0, a karta UI-Venus 2.9B wprost stwierdza, że licencja na jego wagi wciąż oczekuje na ostateczne potwierdzenie

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

Ten ostatni punkt to ten, nad którym warto się zatrzymać. Nasze własne omówienie UI-Venus-2-9B z końca sierpnia opisywało to wydanie jako Apache-2.0, ponieważ właśnie taką informację zawierały wówczas materiały projektu. Dzisiejsza karta modelu mówi coś innego i mocniejszego: że licencja na wagi modelu oczekuje na ostateczne potwierdzenie i zostanie dodana przed publicznym wydaniem, a deklaracja Apache-2.0 celowo nie została przeniesiona, ponieważ obecne materiały źródłowe zawierają sprzeczne oświadczenia licencyjne. Jeśli planujesz komercyjne wdrożenie UI-Venus 2.9B, kwestia licencji pozostaje otwarta według samego dostawcy, a to istotne ryzyko, a nie przypis.

Liczby, które każda ze stron faktycznie opublikowała

Te dwa repozytoria mierzą różne rzeczy i o to właśnie chodzi. Liquid publikuje przepustowość; Ant Group publikuje skuteczność realizacji zadań.

W przypadku modelu draftującego, według własnego środowiska testowego Liquid: w najlepszym razie 2,66× przyspieszenia dekodowania na pojedynczym H100 80GB w BF16 przez SGLang, w najlepszym razie 3,13× z MLX-VLM na Apple M5 Max i w najlepszym razie 2,14× z llama.cpp na M3 Ultra. End-to-end te same przebiegi mieszczą się między 1,30× a 2,62× w zależności od stosu i zadania. Akceptacja draftu kształtuje się na poziomie około 3,2 do 4,5 tokena na przebieg weryfikacji. Każdy z tych wyników pochodzi z pomiarów dostawcy i nie został odtworzony zewnętrznie.

W przypadku UI-Venus 2.9B tabele zamieszczone w samej karcie podają 80,2 na AndroidWorld, 65,8 na MobileWorld przy budżecie 50 kroków, 70,8 na OSWorld-Verified, 48,0 na DeskCraft, 90,8 na WebVoyager w odświeżonym podziale 595 zadań, 74,0 na Online-Mind2Web, 73,0 na ScreenSpot-Pro i 77,1 na VenusBench-GD. W przypadku CAPTCHA podaje 78,1 na VenusBench-CAPTCHA i 75,7 na MCA-Bench. Jeśli chodzi o bezpieczeństwo, podaje wskaźnik skuteczności ataków na poziomie 11,3% na OSHarm w porównaniu z 25,3% dla swojej bazy Qwen3.5-9B. Wszystkie te dane są raportowane przez dostawcę, niektóre wartości bazowe mają gwiazdkę, co oznacza, że autorzy UI-Venus oceniali je zgodnie z podanym protokołem, a sama karta ostrzega, że porównania OSWorld-Verified wykorzystują szkielety działań specyficzne dla modelu i należy je odczytywać jako odniesienia na poziomie benchmarku, a nie kontrolowane ablacje.

Zauważ, czego brakuje na obu listach: czegokolwiek mierzonego przez stronę trzecią. W przypadku modelu draftującego dzieje się tak, ponieważ checkpoint ma już kilka dni. W przypadku UI-Venus 2.9B dzieje się tak, ponieważ benchmarki agentów GUI są kosztowne do odtworzenia, a wyniki w środowisku na żywo zmieniają się wraz ze stanem środowiska w dniu oceny — zastrzeżenie, które karta dobrowolnie ujawnia.

Gdzie te dwa faktycznie się spotykają

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

Istnieje rzeczywiste nakładanie się, które jest węższe, niż sugeruje etykieta kategorii. Oba są istotne, jeśli budujesz agenta wizualnego działającego na urządzeniu lub na brzegu, i oba dotyczą kosztu przepuszczania pikseli przez model. Atakują ten problem z przeciwnych stron.

UI-Venus 2.9B atakuje to treningiem: trzystopniowy potok wielomodalnego treningu pośredniego na symulowanych środowiskach mobilnych, webowych i systemowych, następnie offline'owe RL dla poszczególnych domen, a potem destylacja on-policy z wielu nauczycieli do jednej polityki. Opublikowana zdolność jest wynikiem. Model ma 9B, co jest małe jak na agenta GUI, a duże jak na urządzenie brzegowe, a docelową konfiguracją serwowania według karty jest wdrożenie vLLM — ta sama dokumentacja zauważa, że konfiguracja nie została zweryfikowana w kanaryjnym wdrożeniu na żywo w ramach aktualizacji karty, i zaleca przypięcie i zweryfikowanie wersji vLLM dla Qwen3.5 przed wdrożeniem.

LFM2.5-VL-3B-DSpark atakuje ten problem za pomocą runtime: pozostawia wagi modelu docelowego nietknięte, a szybkość zyskuje dzięki szkicowaniu i weryfikowaniu tokenów. W urządzeniu klasy telefonicznej ten kompromis jest jednostronnie korzystny dla draftującego, ponieważ wynik dowodliwie pochodzi z modelu docelowego, a dodatkowa pamięć to mniej niż jedna dziesiąta modelu.

Konsekwencja dla każdego, kto dokonuje wyboru: pętla agentowa wykonuje wiele wywołań modelu na zadanie, a każde wywołanie płaci prefill za świeży zrzut ekranu. Kodowanie wizyjne i prefill to dokładnie te etapy, których dekodowanie spekulatywne nie przyspiesza — własne ogłoszenie Liquid przedstawia ten argument przeciwko nieograniczonej interpretacji swoich nagłówkowych liczb. Zatem przewaga draftera maleje dokładnie w tym obciążeniu, w którym żyje UI-Venus 2.9B. I odwrotnie, przewaga UI-Venus 2.9B — faktyczne ukończenie zadania — nie jest czymś, co drafter zapewnia przy dowolnej prędkości.

Uruchamianie tych dwóch

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

Żaden z nich nie jest hostowanym endpointem na OrcaRouter. LFM2.5-VL-3B-DSpark i UI-Venus 2.9B wymagają pobrania wag i samodzielnego ich serwowania, a ich sposoby serwowania są kształtowane przez ich bardzo różne role. Drafter potrzebuje SGLang v0.5.19 lub nowszego z flagą algorytmu spekulacyjnego DSPARK i rozmiarem bloku 9, albo MLX-VLM v0.7.2 lub nowszego z drafterem przekazanym jako model szkicowy i temperaturą wymuszoną na zero, albo llama.cpp z 567 MB F16 GGUF sparowanym ze skwantyzowanym modelem docelowym. UI-Venus 2.9B potrzebuje serwera vLLM wystarczająco dużego dla modelu 9B przy maksymalnej długości 262 144 tokenów, plus referencyjnych promptów i parserów akcji z repozytorium kodu projektu — karta wyraźnie stwierdza, że samo uruchomienie serwera nie daje działającego agenta GUI w zamkniętej pętli.

Oba pozostawiają też tę samą lukę na granicach tego, co potrafią. Mały model wizyjno-językowy połączony z drafterem wciąż napotyka ekrany i zadania, którym nie potrafi podołać, a agent GUI wciąż zawodzi w środowiskach poza rozkładem swoich danych treningowych. Zapytania, które przepadają, gdzieś trafiają, a w większości produkcyjnych rozwiązań jest to większy model ogólnego przeznaczenia. Kierowanie ich przez pojedynczy endpoint obejmujący ponad 200 modeli w cenie katalogowej każdego dostawcy, z automatycznym przełączaniem awaryjnym, gdy dostawca zawodzi, pozwala trzymać ścieżkę zapasową poza krytyczną listą integracji, zamiast zamieniać ją w drugi projekt wdrożeniowy z własnymi kluczami i umowami.

Jak podjąć decyzję w ciągu jednej minuty

Jeśli potrzebujesz oprogramowania, które obsługuje interfejs użytkownika — klika, pisze, nawiguje po aplikacji, której nigdy nie widziało — kupujesz politykę, a tym właśnie jest UI-Venus 2.9B. Zaplanuj budżet na wdrożenie 9B vLLM, zapoznaj się z nierozstrzygniętą kwestią licencji, zanim zdecydujesz się na komercyjne wdrożenie, i traktuj tabelę benchmarków dostawcy jako silną hipotezę wyjściową, a nie ustalony wynik, szczególnie w przypadku porównań OSWorld-Verified, które sama karta oznacza jako zależne od scaffoldu.

Jeśli już używasz LFM2.5-VL-3B i chcesz, aby działał szybciej na sprzęcie, który posiadasz, kupujesz optymalizację środowiska uruchomieniowego — i tym właśnie jest LFM2.5-VL-3B-DSpark. Najpierw sprawdź trzy rzeczy: czy Twoje obciążenia są zdominowane przez dekodowanie, a nie przez prefill, czy obsługujesz je w wersji 16-bitowej, a nie w eksporcie 4-bitowym, oraz czy Twoje środowisko uruchomieniowe spełnia minimalne wymagania wersji. Jeśli wszystkie trzy warunki są spełnione, koszt pamięci wynosi 8,9%, a wynik pozostaje niezmieniony z założenia.

Jedyna rzecz, która nie przetrwa zetknięcia z którymkolwiek z tych repozytoriów, to traktowanie ich jako substytutów. One są mnożnikiem szybkości i agentem, a jedyny scenariusz, w którym ze sobą konkurują, to ten, w którym już zdecydowałeś, co budujesz, i szukasz powodu, by zbudować coś tańszego zamiast tego.

OrcaRouter zapewnia dostęp do ponad 200 modeli przez jeden klucz w cenie katalogowej dostawcy z 0% marży, z polityką routingu i automatycznym przełączaniem awaryjnym dla zapytań, których model brzegowy lub agent nie powinien podejmować. jedno API dla ścieżki zapasowej Żaden z modeli na tej stronie nie jest tam hostowany - oba działają na Twoich własnych wagach - ale ścieżka zapasowa to część, której nie musisz budować.