
LFM2.5-VL-3B-DSpark 대 UI-Venus 2.9B: GUI 에이전트에 맞서는 속도 증폭기
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
LFM2.5-VL-3B-DSpark와 UI-Venus 2.9B는 '소형 비전 모델'이라는 똑같이 모호한 항목으로 분류된 뒤 서로 비교되는데, 이는 누군가 통합에 일주일을 허비하기 전에 바로잡을 가치가 있는 범주 오류다. LFM2.5-VL-3B-DSpark는 Liquid AI의 LFM2.5-VL-3B를 가속하는 279.5M 매개변수 드래프트 모델이다. Ant Group의 inclusionAI 연구소에서 나온 UI-Venus 2.9B는 스크린샷을 읽고, 행동을 결정하고, 모바일·웹·데스크톱 환경 전반에서 이를 실행하는 9B GUI 에이전트다. 하나는 기존 모델을 더 빠르게 만들 뿐이다. 다른 하나는 실제 작업을 수행하는 모델이다. GUI 에이전트가 필요하다면, 드래프터는 더 저렴한 선택지가 아니다 — 아예 선택지가 아니다.
유용한 비교는 어느 쪽이 더 나은가가 아니라, 각각이 어떤 문제를 해결하는지, 그리고 그 과정에서 각각이 당신에게 무엇을 요구하는지다. 또한 둘 다 더 넓은 생태계가 아직 따라잡지 못한 최근의 등장인물이며, 그들의 저장소가 주장하는 내용과 다른 누구든 검증한 내용 사이의 격차는 둘 중 한쪽이 다른 쪽보다 더 크다.
각각이 무엇인지, 정확히
도형부터 시작하세요. 도형이 나머지 대부분을 설명해 주기 때문입니다.
• 정체 — LFM2.5-VL-3B-DSpark는 추측 디코딩 드래프터이고, UI-Venus 2.9B는 범용 GUI 에이전트 정책입니다
• 매개변수 — 드래프터는 279.5M BF16인 반면, Qwen3.5-9B에서 초기화된 UI-Venus 2.9B는 9B
• 독립 기능 — 드래프터는 단독으로는 유용한 것을 전혀 생성하지 못하며, 격리 상태에서 벤치마크할 수 없습니다; UI-Venus 2.9B는 완전한 에이전트로 실행됩니다.
• 입력 — 드래프터는 이미지 자체를 결코 보지 못하며, 오직 대상 모델의 은닉 상태만을 본다. UI-Venus 2.9B는 스크린샷을 직접 소비하며 전적으로 이를 중심으로 구축되었다
• 출력 — 드래프터는 검증용 토큰을 제안하고, UI-Venus 2.9B는 라이브 인터페이스를 대상으로 바운딩 박스를 포함한 그라운디드 액션을 출력합니다
• Base — 드래프터는 자체 메타데이터상 LiquidAI/LFM2.5-VL-3B에 묶여 있으며, UI-Venus 2.9B는 Qwen3.5-9B를 기반으로 합니다.
• 맥락 — 드래프터는 타깃이 제공하는 모든 것을 상속받습니다; UI-Venus 2.9B는 공급업체 자체의 vLLM 레시피에서 최대 262,144토큰으로 서빙됩니다.
• 라이선스 — 두 가지 모두 서로 다른 방식으로 미해결 상태입니다. Liquid는 LFM1.0 라이선스로 배포되며, UI-Venus 2.9B의 카드에는 해당 가중치 라이선스가 최종 확인을 기다리고 있다고 명시적으로 나와 있습니다.

마지막 항목은 잠시 속도를 늦춰 짚고 넘어가야 할 부분입니다. 우리 자체의 UI-Venus-2-9B 관련 보도는 8월 말에 이 릴리스를 Apache-2.0으로 설명했는데, 당시 프로젝트 자료에 그렇게 표기되어 있었기 때문입니다. 오늘의 모델 카드는 더 다르고 더 강한 내용을 말합니다. 즉 해당 모델의 라이선스는 최종 확인 대기 중이며 공개 릴리스 전에 추가될 예정이고, 현재 업스트림 자료에 서로 충돌하는 라이선스 진술이 포함되어 있기 때문에 Apache-2.0 선언이 의도적으로 승계되지 않았다는 것입니다. UI-Venus 2.9B의 상업적 배포를 계획하고 있다면, 라이선스 문제는 벤더 스스로 인정한 바에 따라 미해결 상태이며, 이는 각주가 아니라 중대한 위험입니다.
각 측이 실제로 발표한 수치
두 저장소는 서로 다른 것을 측정하며, 바로 그 점이 핵심이다. Liquid는 처리량을 공개하고, Ant Group은 태스크 성공을 공개한다.
드래프터의 경우, Liquid 자체 하네스에 따르면: 단일 H100 80GB에서 BF16으로 SGLang을 통해 최대 2.66× 디코드 속도 향상, Apple M5 Max에서 MLX-VLM으로 최대 3.13×, M3 Ultra에서 llama.cpp로 최대 2.14×를 기록한다. 엔드투엔드로는 동일한 실행이 스택과 작업에 따라 1.30×에서 2.62× 사이에 머문다. 드래프트 수용률은 검증 패스당 약 3.2~4.5 토큰이다. 이 모든 수치는 외부 재현 없이 공급업체가 측정한 것이다.
UI-Venus 2.9B의 경우, 카드 자체 표는 AndroidWorld에서 80.2, MobileWorld에서 50단계 예산으로 65.8, OSWorld-Verified에서 70.8, DeskCraft에서 48.0, 갱신된 595개 작업 분할 전체에서 WebVoyager에서 90.8, Online-Mind2Web에서 74.0, ScreenSpot-Pro에서 73.0, VenusBench-GD에서 77.1을 보고합니다. CAPTCHA에서는 VenusBench-CAPTCHA에서 78.1, MCA-Bench에서 75.7을 보고합니다. 안전성 측면에서는 OSHarm에서 11.3%의 공격 성공률을 보고했으며, 이는 Qwen3.5-9B 기반의 25.3%와 대비됩니다. 이 모든 수치는 공급업체가 보고한 것이며, 일부 기준선에는 별표가 붙어 있는데, 이는 UI-Venus 저자들이 명시된 프로토콜에 따라 평가했음을 의미하며, 카드 자체는 OSWorld-Verified 비교가 모델별 액션 스캐폴드를 사용하며 통제된 절제가 아닌 벤치마크 수준 참조로 읽어야 한다고 경고합니다.
두 목록 모두에서 빠진 것이 무엇인지 주목하세요: 제3자가 측정한 모든 항목입니다. drafter의 경우, 그 이유는 체크포인트가 며칠 지났기 때문입니다. UI-Venus 2.9B의 경우, 그 이유는 GUI 에이전트 벤치마크는 재현하기에 비용이 많이 들고, 실환경 결과는 평가 날짜의 환경 상태에 따라 달라지기 때문입니다 — 카드가 자발적으로 밝히는 주의 사항입니다.
두 가지가 실제로 만나는 지점

실제로 겹치는 부분이 있으며, 그 범위는 카테고리 라벨이 시사하는 것보다 좁습니다. 온디바이스 또는 엣지 비주얼 에이전트를 구축하고 있다면 둘 다 관련이 있고, 둘 다 픽셀을 모델을 통해 처리하는 비용에 관심이 있습니다. 이들은 서로 반대쪽 끝에서 그것을 공략합니다.
UI-Venus 2.9B는 훈련으로 이 문제를 공략합니다: 시뮬레이션된 모바일, 웹, OS 환경 전반에 걸친 멀티모달 중간 훈련, 도메인별 오프라인 RL, 그다음 단일 정책으로의 다중 교사 온폴리시 증류라는 3단계 파이프라인입니다. 공개된 성능이 그 결과입니다. 이 모델은 9B로, GUI 에이전트에는 작고 엣지 디바이스에는 큰 편이며, 이 카드의 의도된 서빙 구성은 vLLM 배포입니다 — 같은 문서는 해당 구성이 카드 업데이트의 일부로 라이브 카나리 검증되지 않았다고 언급하며, 배포 전에 Qwen3.5용 vLLM 버전을 고정하고 검증하라고 안내합니다.
LFM2.5-VL-3B-DSpark는 런타임으로 이를 공략한다. 대상 모델의 가중치는 그대로 두고, 토큰을 초안 작성하고 검증하는 방식으로 속도를 얻는다. 폰급 기기에서는 이 트레이드오프가 드래프터에게 일방적으로 유리한데, 출력이 증명 가능하게 대상 모델의 것이고 추가 메모리가 모델 하나의 10분의 1도 안 되기 때문이다.
선택하는 사람이 감수해야 할 결과: 에이전트 루프는 작업마다 수많은 모델 호출을 발생시키고, 모든 호출은 새로운 스크린샷에 대한 프리필 비용을 지불한다. 이미지 인코딩과 프리필은 바로 추측 디코딩(speculative decoding)이 가속하지 않는 단계다 — Liquid 자체의 발표도 헤드라인 수치를 무제한으로 해석하는 것에 반대하는 근거로 이 점을 든다. 따라서 드래프터의 이점은 UI-Venus 2.9B가 놓인 바로 그 워크로드에서 줄어든다. 반대로 UI-Venus 2.9B의 이점 — 실제로 작업을 완수하는 것 — 은 드래프터가 어떤 속도로도 제공하지 못하는 것이다.
두 개를 실행하는 것

둘 다 OrcaRouter의 호스팅 엔드포인트가 아니다. LFM2.5-VL-3B-DSpark와 UI-Venus 2.9B는 모두 가중치를 직접 내려받아 스스로 서빙해야 하며, 이들의 서빙 방식은 각기 매우 다른 역할에 따라 형성된다. 드래프터에는 DSPARK 추측 알고리즘 플래그와 블록 크기 9를 사용하는 SGLang v0.5.19 이상이 필요하거나, 드래프터를 드래프트 모델로 전달하고 temperature를 0으로 강제하는 MLX-VLM v0.7.2 이상, 또는 양자화된 타깃과 페어링된 567 MB F16 GGUF를 사용하는 llama.cpp가 필요하다. UI-Venus 2.9B에는 최대 길이 262,144토큰에서 9B 모델을 감당할 만큼 큰 vLLM 서버와, 프로젝트 코드 저장소의 참조 프롬프트 및 액션 파서가 필요하다 — 카드에는 서버를 시작하는 것만으로는 작동하는 폐루프 GUI 에이전트를 얻을 수 없다고 명시되어 있다.
두 방식 모두 역시 각자가 할 수 있는 일의 경계에서 같은 공백을 남깁니다. 드래프터와 결합된 소형 비전-언어 모델은 여전히 처리할 수 없는 화면과 작업을 만나고, GUI 에이전트는 훈련 분포 밖의 환경에서는 여전히 실패합니다. 빠져나간 쿼리는 어딘가에 자리 잡으며, 대부분의 프로덕션 설계에서는 그곳이 더 큰 범용 모델입니다. 그런 쿼리를 각 제공업체의 정가로 200개 이상의 모델을 포괄하며, 제공업체가 성능 저하를 보일 때 자동 장애 조치를 수행하는 단일 엔드포인트을 통해 라우팅하면, 폴백 경로를 핵심 통합 목록에서 제외해 주며, 자체 키와 계약을 가진 두 번째 배포 프로젝트로 전환하지 않도록 해줍니다.
1분 안에 결정하는 방법
사용자 인터페이스를 조작하는 소프트웨어 — 클릭하고, 입력하고, 한 번도 본 적 없는 앱을 탐색하는 — 가 필요하다면, 당신은 정책(policy)을 사는 것이며, 그것이 바로 UI-Venus 2.9B입니다. 9B vLLM 배포를 위한 예산을 책정하고, 상업적으로 도입하기 전에 계류 중인 라이선스 문제를 읽어 보며, 공급업체의 벤치마크 표를 확정된 결과라기보다 강력한 출발 가설로 취급하세요. 특히 카드 자체가 스캐폴드 의존적이라고 표시한 OSWorld-Verified 비교는 더욱 그렇습니다.
이미 LFM2.5-VL-3B를 실행 중이고 보유한 하드웨어에서 더 빠르게 만들고 싶다면, 이는 런타임 최적화를 구매하는 것이며, 그것이 바로 LFM2.5-VL-3B-DSpark입니다. 먼저 세 가지를 확인하세요: 워크로드가 프리필(prefill) 중심이 아니라 디코드(decode) 중심인지, 4비트 내보내기가 아니라 16비트로 서빙하고 있는지, 그리고 런타임이 최소 버전 요구 사항을 충족하는지. 세 가지 모두 충족되면, 메모리 비용은 8.9%이고 출력은 설계상 변경되지 않습니다.
두 리포지토리 중 어느 쪽과 맞닥뜨려도 살아남지 못하는 단 하나는, 그것들을 대체재로 취급하는 것이다. 그것들은 하나는 속도를 몇 배로 높여 주는 도구이고 다른 하나는 에이전트이며, 그것들이 경쟁하는 유일한 시나리오는 이미 무엇을 만들지 정해 놓고 대신 더 저렴한 것을 만들 이유를 찾고 있는 경우뿐이다.
OrcaRouter는 하나의 키로 200개 이상의 모델에 접근할 수 있으며, 공급자 정가에 0% 마크업으로 제공되고, 엣지 모델이나 에이전트가 감당해서는 안 되는 쿼리를 위한 라우팅 정책과 자동 장애 조치를 갖추고 있습니다. 폴백 경로를 위한 하나의 API 이 페이지의 어느 모델도 그곳에서 호스팅되지 않습니다. 둘 다 여러분 자신의 가중치에서 서빙됩니다. 하지만 폴백 경로는 여러분이 직접 구축하지 않아도 되는 부분입니다.
