
LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B: mnożnik szybkości w starciu z agentem GUI
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 181 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
LFM2.5-VL-3B-DSpark i UI-Venus 2.9B trafiają pod ten sam nieprecyzyjny nagłówek — małe modele wizyjne — a następnie są porównywane ze sobą, co jest błędem kategorii, który warto naprawić, zanim zacznie kosztować kogoś tydzień integracji. LFM2.5-VL-3B-DSpark to model szkicujący o 279,5 mln parametrów, który przyspiesza LFM2.5-VL-3B od Liquid AI. UI-Venus 2.9B z laboratorium inclusionAI należącego do Ant Group to agent GUI 9B, który czyta zrzuty ekranu, decyduje o działaniu i wykonuje je w środowiskach mobilnych, webowych i desktopowych. Jeden przyspiesza istniejący model. Drugi wykonuje właściwą pracę. Jeśli potrzebujesz agenta GUI, model szkicujący nie jest tańszą opcją — nie jest żadną opcją.
Użyteczne porównanie nie polega na tym, które z nich jest lepsze, ale na tym, jaki problem rozwiązuje każde z nich i ile cię to kosztuje w tym procesie. Oba są także nowymi rozwiązaniami, za którymi szerszy ekosystem jeszcze nie nadążył, a rozbieżność między tym, co deklarują ich repozytoria, a tym, co zostało zweryfikowane przez kogokolwiek innego, jest większa w przypadku jednego z nich niż drugiego.
Czym dokładnie jest każdy z nich
Zacznij od kształtów, ponieważ wyjaśniają one większość pozostałych rzeczy.
• Co to jest — LFM2.5-VL-3B-DSpark to drafter dekodowania spekulatywnego; UI-Venus 2.9B to polityka agenta GUI ogólnego przeznaczenia
• Parametry — 279,5 mln BF16 dla modelu draftującego, w porównaniu z 9 mld dla UI-Venus 2.9B zainicjalizowanego z Qwen3.5-9B
• Możliwość samodzielna — model szkicujący sam nie generuje niczego użytecznego i nie można go benchmarkować w izolacji; UI-Venus 2.9B działa jako kompletny agent
• Wejścia — drafter nigdy nie widzi samego obrazu, tylko ukryte stany modelu docelowego; UI-Venus 2.9B przetwarza zrzuty ekranu bezpośrednio i jest w całości zbudowany wokół nich
• Wyjścia — model szkicujący proponuje tokeny do weryfikacji; UI-Venus 2.9B emituje ugruntowane akcje z ramkami ograniczającymi wobec działającego interfejsu
• Base — model draftujący jest powiązany z LiquidAI/LFM2.5-VL-3B w swoich własnych metadanych; UI-Venus 2.9B bazuje na Qwen3.5-9B
• Kontekst — drafter dziedziczy to, co zapewnia target; UI-Venus 2.9B jest obsługiwany z maksymalnym rozmiarem 262 144 tokenów we własnej recepturze vLLM dostawcy
• Licencja — oba przypadki pozostają nierozwiązane, każdy na inny sposób; Liquid jest udostępniany na licencji LFM1.0, a karta UI-Venus 2.9B wprost stwierdza, że licencja na jego wagi wciąż oczekuje na ostateczne potwierdzenie

Ten ostatni punkt to ten, nad którym warto się zatrzymać. Nasze własne omówienie UI-Venus-2-9B z końca sierpnia opisywało to wydanie jako Apache-2.0, ponieważ właśnie taką informację zawierały wówczas materiały projektu. Dzisiejsza karta modelu mówi coś innego i mocniejszego: że licencja na wagi modelu oczekuje na ostateczne potwierdzenie i zostanie dodana przed publicznym wydaniem, a deklaracja Apache-2.0 celowo nie została przeniesiona, ponieważ obecne materiały źródłowe zawierają sprzeczne oświadczenia licencyjne. Jeśli planujesz komercyjne wdrożenie UI-Venus 2.9B, kwestia licencji pozostaje otwarta według samego dostawcy, a to istotne ryzyko, a nie przypis.
Liczby, które każda ze stron faktycznie opublikowała
Te dwa repozytoria mierzą różne rzeczy i o to właśnie chodzi. Liquid publikuje przepustowość; Ant Group publikuje skuteczność realizacji zadań.
W przypadku modelu draftującego, według własnego środowiska testowego Liquid: w najlepszym razie 2,66× przyspieszenia dekodowania na pojedynczym H100 80GB w BF16 przez SGLang, w najlepszym razie 3,13× z MLX-VLM na Apple M5 Max i w najlepszym razie 2,14× z llama.cpp na M3 Ultra. End-to-end te same przebiegi mieszczą się między 1,30× a 2,62× w zależności od stosu i zadania. Akceptacja draftu kształtuje się na poziomie około 3,2 do 4,5 tokena na przebieg weryfikacji. Każdy z tych wyników pochodzi z pomiarów dostawcy i nie został odtworzony zewnętrznie.
W przypadku UI-Venus 2.9B tabele zamieszczone w samej karcie podają 80,2 na AndroidWorld, 65,8 na MobileWorld przy budżecie 50 kroków, 70,8 na OSWorld-Verified, 48,0 na DeskCraft, 90,8 na WebVoyager w odświeżonym podziale 595 zadań, 74,0 na Online-Mind2Web, 73,0 na ScreenSpot-Pro i 77,1 na VenusBench-GD. W przypadku CAPTCHA podaje 78,1 na VenusBench-CAPTCHA i 75,7 na MCA-Bench. Jeśli chodzi o bezpieczeństwo, podaje wskaźnik skuteczności ataków na poziomie 11,3% na OSHarm w porównaniu z 25,3% dla swojej bazy Qwen3.5-9B. Wszystkie te dane są raportowane przez dostawcę, niektóre wartości bazowe mają gwiazdkę, co oznacza, że autorzy UI-Venus oceniali je zgodnie z podanym protokołem, a sama karta ostrzega, że porównania OSWorld-Verified wykorzystują szkielety działań specyficzne dla modelu i należy je odczytywać jako odniesienia na poziomie benchmarku, a nie kontrolowane ablacje.
Zauważ, czego brakuje na obu listach: czegokolwiek mierzonego przez stronę trzecią. W przypadku modelu draftującego dzieje się tak, ponieważ checkpoint ma już kilka dni. W przypadku UI-Venus 2.9B dzieje się tak, ponieważ benchmarki agentów GUI są kosztowne do odtworzenia, a wyniki w środowisku na żywo zmieniają się wraz ze stanem środowiska w dniu oceny — zastrzeżenie, które karta dobrowolnie ujawnia.
Gdzie te dwa faktycznie się spotykają

Istnieje rzeczywiste nakładanie się, które jest węższe, niż sugeruje etykieta kategorii. Oba są istotne, jeśli budujesz agenta wizualnego działającego na urządzeniu lub na brzegu, i oba dotyczą kosztu przepuszczania pikseli przez model. Atakują ten problem z przeciwnych stron.
UI-Venus 2.9B atakuje to treningiem: trzystopniowy potok wielomodalnego treningu pośredniego na symulowanych środowiskach mobilnych, webowych i systemowych, następnie offline'owe RL dla poszczególnych domen, a potem destylacja on-policy z wielu nauczycieli do jednej polityki. Opublikowana zdolność jest wynikiem. Model ma 9B, co jest małe jak na agenta GUI, a duże jak na urządzenie brzegowe, a docelową konfiguracją serwowania według karty jest wdrożenie vLLM — ta sama dokumentacja zauważa, że konfiguracja nie została zweryfikowana w kanaryjnym wdrożeniu na żywo w ramach aktualizacji karty, i zaleca przypięcie i zweryfikowanie wersji vLLM dla Qwen3.5 przed wdrożeniem.
LFM2.5-VL-3B-DSpark atakuje ten problem za pomocą runtime: pozostawia wagi modelu docelowego nietknięte, a szybkość zyskuje dzięki szkicowaniu i weryfikowaniu tokenów. W urządzeniu klasy telefonicznej ten kompromis jest jednostronnie korzystny dla draftującego, ponieważ wynik dowodliwie pochodzi z modelu docelowego, a dodatkowa pamięć to mniej niż jedna dziesiąta modelu.
Konsekwencja dla każdego, kto dokonuje wyboru: pętla agentowa wykonuje wiele wywołań modelu na zadanie, a każde wywołanie płaci prefill za świeży zrzut ekranu. Kodowanie wizyjne i prefill to dokładnie te etapy, których dekodowanie spekulatywne nie przyspiesza — własne ogłoszenie Liquid przedstawia ten argument przeciwko nieograniczonej interpretacji swoich nagłówkowych liczb. Zatem przewaga draftera maleje dokładnie w tym obciążeniu, w którym żyje UI-Venus 2.9B. I odwrotnie, przewaga UI-Venus 2.9B — faktyczne ukończenie zadania — nie jest czymś, co drafter zapewnia przy dowolnej prędkości.
Uruchamianie tych dwóch

Żaden z nich nie jest hostowanym endpointem na OrcaRouter. LFM2.5-VL-3B-DSpark i UI-Venus 2.9B wymagają pobrania wag i samodzielnego ich serwowania, a ich sposoby serwowania są kształtowane przez ich bardzo różne role. Drafter potrzebuje SGLang v0.5.19 lub nowszego z flagą algorytmu spekulacyjnego DSPARK i rozmiarem bloku 9, albo MLX-VLM v0.7.2 lub nowszego z drafterem przekazanym jako model szkicowy i temperaturą wymuszoną na zero, albo llama.cpp z 567 MB F16 GGUF sparowanym ze skwantyzowanym modelem docelowym. UI-Venus 2.9B potrzebuje serwera vLLM wystarczająco dużego dla modelu 9B przy maksymalnej długości 262 144 tokenów, plus referencyjnych promptów i parserów akcji z repozytorium kodu projektu — karta wyraźnie stwierdza, że samo uruchomienie serwera nie daje działającego agenta GUI w zamkniętej pętli.
Oba pozostawiają też tę samą lukę na granicach tego, co potrafią. Mały model wizyjno-językowy połączony z drafterem wciąż napotyka ekrany i zadania, którym nie potrafi podołać, a agent GUI wciąż zawodzi w środowiskach poza rozkładem swoich danych treningowych. Zapytania, które przepadają, gdzieś trafiają, a w większości produkcyjnych rozwiązań jest to większy model ogólnego przeznaczenia. Kierowanie ich przez pojedynczy endpoint obejmujący ponad 200 modeli w cenie katalogowej każdego dostawcy, z automatycznym przełączaniem awaryjnym, gdy dostawca zawodzi, pozwala trzymać ścieżkę zapasową poza krytyczną listą integracji, zamiast zamieniać ją w drugi projekt wdrożeniowy z własnymi kluczami i umowami.
Jak podjąć decyzję w ciągu jednej minuty
Jeśli potrzebujesz oprogramowania, które obsługuje interfejs użytkownika — klika, pisze, nawiguje po aplikacji, której nigdy nie widziało — kupujesz politykę, a tym właśnie jest UI-Venus 2.9B. Zaplanuj budżet na wdrożenie 9B vLLM, zapoznaj się z nierozstrzygniętą kwestią licencji, zanim zdecydujesz się na komercyjne wdrożenie, i traktuj tabelę benchmarków dostawcy jako silną hipotezę wyjściową, a nie ustalony wynik, szczególnie w przypadku porównań OSWorld-Verified, które sama karta oznacza jako zależne od scaffoldu.
Jeśli już używasz LFM2.5-VL-3B i chcesz, aby działał szybciej na sprzęcie, który posiadasz, kupujesz optymalizację środowiska uruchomieniowego — i tym właśnie jest LFM2.5-VL-3B-DSpark. Najpierw sprawdź trzy rzeczy: czy Twoje obciążenia są zdominowane przez dekodowanie, a nie przez prefill, czy obsługujesz je w wersji 16-bitowej, a nie w eksporcie 4-bitowym, oraz czy Twoje środowisko uruchomieniowe spełnia minimalne wymagania wersji. Jeśli wszystkie trzy warunki są spełnione, koszt pamięci wynosi 8,9%, a wynik pozostaje niezmieniony z założenia.
Jedyna rzecz, która nie przetrwa zetknięcia z którymkolwiek z tych repozytoriów, to traktowanie ich jako substytutów. One są mnożnikiem szybkości i agentem, a jedyny scenariusz, w którym ze sobą konkurują, to ten, w którym już zdecydowałeś, co budujesz, i szukasz powodu, by zbudować coś tańszego zamiast tego.
OrcaRouter zapewnia dostęp do ponad 200 modeli przez jeden klucz w cenie katalogowej dostawcy z 0% marży, z polityką routingu i automatycznym przełączaniem awaryjnym dla zapytań, których model brzegowy lub agent nie powinien podejmować. jedno API dla ścieżki zapasowej Żaden z modeli na tej stronie nie jest tam hostowany - oba działają na Twoich własnych wagach - ale ścieżka zapasowa to część, której nie musisz budować.
