
LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B: Um Multiplicador de Velocidade Contra um Agente de GUI
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
LFM2.5-VL-3B-DSpark e UI-Venus 2.9B são classificados sob o mesmo título vago — modelos de visão pequenos — e depois comparados entre si, o que é um erro de categoria que vale a pena corrigir antes que custe a alguém uma semana de integração. LFM2.5-VL-3B-DSpark é um modelo draft de 279,5M de parâmetros que acelera o LFM2.5-VL-3B da Liquid AI. UI-Venus 2.9B, do laboratório inclusionAI do Ant Group, é um agente GUI de 9B que lê capturas de tela, decide uma ação e a executa em ambientes móveis, web e desktop. Um torna um modelo existente mais rápido. O outro é quem faz o trabalho. Se o que você precisa é de um agente GUI, o drafter não é uma opção mais barata — não é opção nenhuma.
A comparação útil não é qual é melhor, mas qual problema cada um resolve, e quanto cada um custa a você no processo. Ambos também são adições recentes que o ecossistema mais amplo ainda não acompanhou, e a diferença entre o que seus repositórios afirmam e o que qualquer outra pessoa verificou é maior para um deles do que para o outro.
O que cada um é, precisamente
Comece pelas formas, porque elas explicam a maior parte do resto.
• O que é — LFM2.5-VL-3B-DSpark é um modelo de rascunho de decodificação especulativa; UI-Venus 2.9B é uma política de agente GUI de propósito geral
• Parâmetros — 279,5M BF16 para o modelo rascunho, em contraste com 9B do UI-Venus 2.9B inicializado a partir do Qwen3.5-9B
• Capacidade autônoma — o gerador de rascunhos não produz nada utilizável sozinho e não pode ser avaliado isoladamente; o UI-Venus 2.9B funciona como um agente completo
• Entradas — o rascunhador nunca vê a imagem em si, apenas os estados ocultos do modelo alvo; o UI-Venus 2.9B consome capturas de tela diretamente e é construído inteiramente em torno delas
• Saídas — o rascunhador propõe tokens para verificação; o UI-Venus 2.9B emite ações fundamentadas com caixas delimitadoras em uma interface ao vivo
• Base — o drafter está vinculado ao LiquidAI/LFM2.5-VL-3B em seus próprios metadados; o UI-Venus 2.9B é construído sobre o Qwen3.5-9B
• Contexto — o modelo de rascunho herda tudo o que o modelo-alvo fornece; UI-Venus 2.9B é servido com um máximo de 262.144 tokens na receita vLLM do próprio fornecedor
• Licença — ambas permanecem indefinidas de maneiras diferentes; o Liquid é distribuído sob a licença LFM1.0, e a ficha do UI-Venus 2.9B declara explicitamente que a licença de seus pesos está pendente de confirmação final

Esse último ponto é aquele em que vale a pena ir com calma. Nossa própria cobertura do UI-Venus-2-9B no final de agosto descreveu o lançamento como Apache-2.0, porque era o que os materiais do projeto traziam na época. O model card atual diz algo diferente e mais contundente: que a licença dos pesos do modelo está pendente de confirmação final e será adicionada antes do lançamento público, e que uma declaração de Apache-2.0 não foi intencionalmente mantida porque os materiais upstream atuais contêm declarações de licença conflitantes. Se você está planejando uma implantação comercial do UI-Venus 2.9B, a questão da licença está em aberto por admissão do próprio fornecedor, e isso é um risco material, e não uma nota de rodapé.
Os números que cada lado realmente publicou
Os dois repositórios medem coisas diferentes, e é justamente esse o ponto. A Liquid publica throughput; o Ant Group publica sucesso de tarefas.
Para o drafter, segundo o próprio harness da Liquid: ganho de velocidade de decodificação de até 2,66× em uma única H100 80GB em BF16 por meio do SGLang, até 3,13× com o MLX-VLM em um Apple M5 Max e até 2,14× com o llama.cpp em um M3 Ultra. Ponta a ponta, essas mesmas execuções ficam entre 1,30× e 2,62×, dependendo da stack e da tarefa. A aceitação do draft fica em torno de 3,2 a 4,5 tokens por passagem de verificação. Todas essas medições são feitas pelos fornecedores, sem reprodução externa.
Para o UI-Venus 2.9B, as próprias tabelas da ficha reportam 80,2 no AndroidWorld, 65,8 no MobileWorld com um orçamento de 50 etapas, 70,8 no OSWorld-Verified, 48,0 no DeskCraft, 90,8 no WebVoyager na divisão atualizada de 595 tarefas, 74,0 no Online-Mind2Web, 73,0 no ScreenSpot-Pro e 77,1 no VenusBench-GD. Em CAPTCHA, o UI-Venus reporta 78,1 no VenusBench-CAPTCHA e 75,7 no MCA-Bench. No lado da segurança, o UI-Venus reporta uma taxa de sucesso de ataque de 11,3% no OSHarm, contra 25,3% da sua base Qwen3.5-9B. Todos esses dados são informados pelo fornecedor, algumas baselines trazem um asterisco, o que significa que os autores do UI-Venus as avaliaram sob o protocolo declarado, e a própria ficha adverte que as comparações no OSWorld-Verified usam scaffolds de ação específicos do modelo e devem ser lidas como referências no nível de benchmark, e não como ablações controladas.
Observe o que está ausente de ambas as listas: qualquer coisa medida por terceiros. Para o drafter, isso se deve ao fato de o checkpoint ter alguns dias. Para o UI-Venus 2.9B, isso se deve ao fato de os benchmarks de agentes de GUI serem caros de reproduzir e os resultados em ambiente ao vivo variarem com o estado do ambiente na data da avaliação — uma ressalva que o card oferece por iniciativa própria.
Onde os dois realmente se encontram

Há uma sobreposição real, e ela é mais estreita do que o rótulo da categoria sugere. Ambos são relevantes se você estiver construindo um agente visual no dispositivo ou na borda, e ambos se preocupam com o custo de fazer os pixels passarem por um modelo. Eles atacam isso por extremos opostos.
O UI-Venus 2.9B aborda isso com treinamento: um pipeline de três estágios de mid-training multimodal sobre ambientes simulados de celular, web e SO, RL offline por domínio e, em seguida, destilação on-policy com múltiplos professores para uma única política. A capacidade publicada é o resultado. O modelo tem 9B, o que é pequeno para um agente de GUI e grande para um dispositivo de borda, e a configuração de serviço pretendida do cartão é uma implantação vLLM — a mesma documentação observa que essa configuração não foi validada por live-canary como parte da atualização do cartão e orienta você a fixar e verificar sua versão do vLLM para o Qwen3.5 antes de implantar.
O LFM2.5-VL-3B-DSpark ataca isso com runtime: deixa os pesos do modelo alvo intactos e ganha velocidade ao rascunhar e verificar tokens. Num dispositivo da classe de telefone, a troca é unilateral em favor do rascunhador, porque a saída é comprovadamente a do alvo e a memória extra é inferior a um décimo de um modelo.
A consequência para quem escolhe: um loop de agente faz muitas chamadas ao modelo por tarefa, e cada chamada paga prefill por uma captura de tela nova. A codificação de visão e o prefill são justamente os estágios que a decodificação especulativa não acelera — o próprio anúncio da Liquid apresenta esse argumento contra uma leitura ilimitada de seus números de destaque. Assim, a vantagem do drafter encolhe exatamente na carga de trabalho em que o UI-Venus 2.9B vive. Por outro lado, a vantagem do UI-Venus 2.9B — de fato concluir a tarefa — não é algo que um drafter proporcione em velocidade alguma.
Executando os dois

Nenhum dos dois é um endpoint hospedado no OrcaRouter. LFM2.5-VL-3B-DSpark e UI-Venus 2.9B exigem que você baixe os pesos e os sirva por conta própria, e suas abordagens de serving são moldadas por seus papéis muito diferentes. O drafter precisa do SGLang v0.5.19 ou mais recente com uma flag de algoritmo especulativo DSPARK e um block size de 9, ou do MLX-VLM v0.7.2 ou mais recente com o drafter passado como modelo draft e forçado a zero, ou do llama.cpp com um GGUF F16 de 567 MB emparelhado a um alvo quantizado. UI-Venus 2.9B precisa de um servidor vLLM grande o suficiente para um modelo de 9B com um comprimento máximo de 262.144 tokens, além dos prompts de referência e parsers de ação do repositório de código do projeto — o card é explícito que apenas iniciar o servidor não fornece um agente GUI de loop fechado funcional.
Ambos também deixam a mesma lacuna nos limites daquilo que conseguem fazer. Um pequeno modelo de visão e linguagem combinado com um modelo de rascunho ainda esbarra em telas e tarefas que não consegue lidar, e um agente de GUI ainda falha em ambientes fora de sua distribuição de treinamento. As consultas que escapam acabam em algum lugar e, na maioria dos projetos de produção, esse lugar é um modelo maior de uso geral. O encaminhamento dessas consultas por meio de um único endpoint que cobre mais de 200 modelos pelo preço de tabela de cada provedor, com failover automático quando um provedor apresenta degradação mantém o caminho de fallback fora da lista de integrações críticas, em vez de transformá-lo em um segundo projeto de implantação com suas próprias chaves e contratos.
Como decidir em um minuto
Se você precisa de software que opera uma interface de usuário — clicando, digitando, navegando em um aplicativo que nunca viu —, você está comprando uma política, e essa é a UI-Venus 2.9B. Orce para uma implantação de vLLM de 9B, leia a questão de licença pendente antes de se comprometer comercialmente e trate a tabela de benchmarks do fornecedor como uma forte hipótese inicial, e não como um resultado consolidado, especialmente as comparações do OSWorld-Verified que o próprio card sinaliza como dependentes de scaffold.
Se você já executa o LFM2.5-VL-3B e quer que ele seja mais rápido no hardware que você possui, você está comprando uma otimização de runtime, e essa é a LFM2.5-VL-3B-DSpark. Verifique três coisas primeiro: se suas cargas de trabalho têm uso intenso de decode em vez de prefill, se você está servindo em 16 bits em vez de uma exportação de 4 bits, e se seu runtime atende às versões mínimas exigidas. Se as três condições forem atendidas, o custo de memória é de 8,9% e a saída permanece inalterada por construção.
A única coisa que não sobrevive ao contato com qualquer um dos dois repositórios é tratá-los como substitutos. Eles são um multiplicador de velocidade e um agente, e o único cenário em que competem é aquele em que você já decidiu o que está construindo e está procurando um motivo para construir algo mais barato.
O OrcaRouter alcança mais de 200 modelos através de uma única chave ao preço de tabela do provedor, com 0% de markup, com política de roteamento e failover automático para as consultas que um modelo de borda ou um agente não deve atender. uma API para o caminho de fallbackNenhum dos modelos nesta página está hospedado lá — ambos são servidos a partir dos seus próprios pesos —, mas o caminho de fallback é a parte que você não precisa construir.
