Um cartão de título principal para a comparação LFM2.5-8B-A1B-DSpark vs Qwen3-8B, com o subtítulo 'O rascunho que acelera um modelo, contra o 8B que todos já executam', mostrando à esquerda uma caixa 'Draft 327M' enviando chips de token para um cartão MoE 'LFM2.5-8B-A1B' em blocos empilhados, com o ponteiro do velocímetro em alta sob um rótulo 'DECODIFICAÇÃO ESPECULATIVA', e à direita um cartão de balão de chat rotulado 'Qwen3-8B' com um ícone de faísca e um relógio sob um rótulo 'MODELO GENERALISTA', com uma etiqueta de data 'Agosto de 2026' e o logotipo do OrcaRouter composto no canto inferior direito.
Guides & Insights

LFM2.5-8B-A1B-DSpark vs Qwen3-8B: O Draft que Acelera um Modelo, Contra o 8B que Todo Mundo Já Roda

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Liquid AI lançou o checkpoint de rascunho LFM2.5-8B-A1B-DSpark em 20 de agosto de 2026 — um auxiliar de decodificação especulativa com 327.7M de parâmetros que faz o MoE de borda LFM2.5-8B-A1B gerar até 3.18× mais rápido em uma única H100. Antes que essa comparação possa ser honesta, um fato precisa estar sobre a mesa: o checkpoint DSpark não é um modelo que você possa chamar. Ele apenas acelera outro modelo. Então, a verdadeira questão de implantação que este lançamento alimenta é aquela que a maioria dos times vem ponderando o ano todo — LFM2.5-8B-A1B ou Qwen3-8B, dois modelos de peso aberto da classe 8B em momentos muito diferentes de suas vidas.

O enquadramento importa mais do que o normal aqui, porque os dois lados não são o mesmo tipo de coisa. Qwen3-8B é um modelo completo e implantável que você pode auto-hospedar ou comprar tokens hoje. LFM2.5-8B-A1B também é um modelo completo e implantável — o rascunho DSpark é um complemento a ele, não uma versão dele. Tudo o que o rascunho promete é medido pelo fornecedor e tem apenas um dia; tudo sobre os repositórios e formatos está simplesmente lá para ser verificado. Este artigo mantém essas duas categorias separadas.

Primeiro, a palavra "DSpark" não é o substantivo nesta frase.

A decodificação especulativa roda um modelo de rascunho barato à frente do modelo real: o rascunhador prevê os próximos poucos tokens, o alvo verifica o bloco inteiro em uma única passagem direta e mantém tudo aquilo com que concorda. Quando as previsões são boas, você avança vários tokens pelo preço de uma única passagem de carregamento de pesos, então a vazão aumenta sem tocar nos pesos do alvo — e, como o alvo verifica cada token proposto, a saída sob decodificação gulosa é idêntica à de executar o LFM2.5-8B-A1B sozinho. A Liquid chama isso de "sem perdas por construção", e é exatamente essa a razão pela qual é seguro acoplar um rascunho.

O LFM2.5-8B-A1B-DSpark da Liquid é um rascunhador deliberadamente pequeno: cinco camadas somente de atenção, um bloco de nove tokens propostos por etapa e uma cabeça Markov sobre o vocabulário de 128.000 tokens do alvo, treinado por 15 épocas em uma mistura de dados de chat, código e chamada de funções, com checkpoints selecionados pela taxa de aceitação em vez da perda. É um dos três rascunhos que o fornecedor lançou naquele dia, junto com LFM2.5-1.2B-Instruct e LFM2.5-2.6B, cada um em Safetensors e GGUF com suporte de primeira hora para SGLang e llama.cpp. Também é importante, para quem lê uma comparação com um modelo da classe 8B: ele não é servido por nenhum provedor de inferência e não tem preço por token. Ele vive apenas dentro da sua própria pilha de decodificação especulativa.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

Os dois modelos que realmente são implantados

Remova o rascunho e a comparação real é entre o modelo que ele acelera e o atual. Ambos são de pesos abertos e aproximadamente da classe 8B, e então as semelhanças terminam:

— {{1}}Arquitetura{{/1}} — {{2}}LFM2.5-8B-A1B{{/2}} é um MoE esparso com {{3}}8.3B{{/3}} de parâmetros totais, mas apenas ~{{4}}1.5B{{/4}} ativos por token; {{5}}Qwen3-8B{{/5}} é um modelo denso de {{6}}8.2B{{/6}} que ativa todos os parâmetros em cada token.

• Lançamento — LFM2.5-8B-A1B lançado em 28 de maio de 2026; Qwen3-8B lançado em abril de 2025, com mais de um ano de existência e já descontinuado em algumas plataformas de inferência.

• Contexto — O LFM2.5-8B-A1B oferece um contexto nativo de 128K com um vocabulário de 128K tokens; o Qwen3-8B oferece 32K nativos, extensíveis para cerca de 128K via YaRN.

• Raciocínio — LFM2.5-8B-A1B é um modelo de raciocínio que emite uma cadeia de pensamento explícita; Qwen3-8B alterna entre modos de pensamento e não-pensamento por solicitação.

• Inteligência — segundo a Artificial Analysis, o LFM2.5-8B-A1B obtém um Índice de Inteligência de 8 e o Qwen3-8B obtém de 8 a 8,3, ambos abaixo da mediana de 9 para modelos de peso aberto comparáveis; nenhum dos dois é um cérebro de fronteira, e ambos são honestos quanto a isso.

• Velocidade — segundo a Artificial Analysis, o LFM2.5-8B-A1B gera cerca de 340 tokens por segundo entre provedores; o Qwen3-8B fica em torno de 37–40 tokens por segundo, entre os mais lentos de sua classe.

• Licença — LFM2.5-8B-A1B está sob a Licença Aberta LFM v1.0 da Liquid; Qwen3-8B é Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

É na velocidade que isso deixa de ser próximo.

A maior razão pela qual a conversa sobre pesos abertos da classe 8B mudou é a velocidade por unidade de memória. Qwen3-8B é um modelo denso: cada token que ele produz transmite todos os 8,2B de pesos pelo barramento de memória, por isso é lento para o seu tamanho e por isso precisa de VRAM de verdade. O LFM2.5-8B-A1B roteia cada token por cerca de 1,5B de parâmetros ativos, o que é exatamente o ponto central do design — um MoE em dispositivo que se mantém rápido e compacto. As próprias afirmações da Liquid vão além: aproximadamente 253 tokens por segundo em uma CPU M5 Max com menos de 6GB de memória, reportado pelo fornecedor. Em throughput bruto para o modelo implantável, o rascunho nem importa para esta parte da história — o MoE já é várias vezes mais rápido do que o 8B denso antes de adicionar especulação.

Em termos de preço, ambos são de pesos abertos, então auto-hospedar qualquer um custa o quanto seu hardware custar. A comparação hospedada é desequilibrada em disponibilidade: Qwen3-8B é servido pela API da Alibaba por um preço de tabela de US$ 0,18 por milhão de tokens de entrada e US$ 2,10 por milhão de tokens de saída, e também por um amplo conjunto de hospedeiros de modelos abertos de terceiros; LFM2.5-8B-A1B não tem preço de tokens hospedado de primeira parte que valha nota, e o rascunho não tem nenhum. O que significa que a maneira prática pela qual a maioria das equipes executará o MoE de borda da Liquid hoje é auto-hospedado, em um laptop, uma caixa de borda ou uma GPU que possuem — e essa é exatamente a configuração em que o rascunho DSpark se torna a variável relevante.

O que o rascunho realmente muda para esta decisão

O rascunho altera apenas um eixo: a rapidez com que o LFM2.5-8B-A1B produz tokens em uma pilha de serviço que você controla. Ele não torna o modelo mais inteligente nem muda o que ele responde — a saída gulosa é bit a bit idêntica à do modelo sozinho. Onde ele ajuda é no serviço de GPU com throughput de requisição única: a Liquid mediu uma média de 2,54× em uma única H100 em cinco benchmarks (418 → 1.074 tokens por segundo), com o melhor caso de 3,18× no MATH500, em batch size 1 e temperatura 0. Onde ele quase não ajuda é no Apple silicon: o mesmo modelo alcançou uma média de apenas 1,18× em um M4 Max (90 → 106 tok/s), porque verificar um bloco de tokens de rascunho ativa mais especialistas no backend atual de Metal MoE do llama.cpp e movimenta mais tráfego de pesos — exatamente o custo que a decodificação especulativa visa amortizar. Todos esses são números do fornecedor do dia do lançamento, não reproduzidos de forma independente.

Essa divisão se traduz diretamente em uma regra de decisão. Se você servir LFM2.5-8B-A1B {{1}}em uma GPU própria{{/1}}, o draft é uma verdadeira alavanca de custo — {{2}}cerca de 2,5× mais tokens por segundo{{/2}} {{3}}do mesmo silício, com zero mudança na saída{{/3}}, e você só precisa de {{4}}um build com as integrações DSpark de 20 de agosto{{/4}}. Se você chamar o modelo {{5}}por uma API em vez disso{{/5}}, {{6}}o provedor fica com o ganho de velocidade{{/6}} e {{7}}o draft é irrelevante para você{{/7}}. E se o dispositivo for {{8}}um laptop ou um celular{{/8}}, {{9}}o draft para este modelo específico é praticamente um no-op hoje{{/9}}; {{10}}os drafts irmãos para os modelos densos LFM2.5-1.2B-Instruct e LFM2.5-2.6B são os que trazem os ganhos no dispositivo{{/10}}, {{11}}com 2,54× e 2,27× respectivamente{{/11}}. {{12}}Qwen3-8B, por sua vez, não precisa de draft algum{{/12}} — {{13}}é simplesmente um modelo mais lento e denso{{/13}} {{14}}que não exige decodificação especulativa para ser implantável{{/14}}.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

A escolha, um ano após o lançamento do Qwen3-8B

Qwen3-8B é o padrão chato e correto: maduro, Apache-2.0, 119 idiomas, modos de raciocínio e não-raciocínio, disponível em toda parte, e ainda um generalista perfeitamente bom para chat, código e texto estruturado. Seus problemas são idade e velocidade — um dense 8B de 16 meses que é lento para sua classe e já descontinuado em algumas plataformas, o que é um sinal de manutenção que vale a pena levar a sério se você está começando um projeto greenfield hoje.

LFM2.5-8B-A1B é a aposta mais nova e mais restrita: um MoE edge-first construído para chamada de ferramentas e seguimento de instruções em alta velocidade em hardware de consumo, com o draft DSpark como um impulso opcional de serving para o caso de auto-hospedagem em GPU. Não é um modelo mais inteligente — ambos ficam abaixo da mediana de pesos abertos na Artificial Analysis — mas é dramaticamente mais rápido, com uma fração da memória por token, o que é o trade-off que importa para agentes no dispositivo. Suas ressalvas são a imagem espelhada das do Qwen3-8B: um lançamento mais recente, sem preços de hospedagem de primeira parte, e uma história de decodificação especulativa cujos números ninguém fora do fornecedor reproduziu até agora.

A camada de roteamento subjacente permanece a mesma de qualquer forma. Nem LFM2.5-8B-A1B nem Qwen3-8B estão no catálogo hospedado da OrcaRouter hoje, então o enquadramento honesto é o que um roteador faz pela combinação: uma API para mais de 200 modelos hospedados com os preços de tabela dos provedores repassados com margem de 0%, de modo que um corte de preço do fornecedor entra em vigor na plataforma no mesmo dia em que é anunciado; failover automático, para que um novo modelo não comprovado seja algo que você experimenta com tráfego real, em vez de algo em que você aposta um caminho de produção; e uma DSL de roteamento que pode servir de frente para um modelo que você mesmo hospeda, que é como uma pilha LFM2.5-8B-A1B auto-hospedada coexiste com endpoints hospedados atrás de uma única chave.

Se você está desenvolvendo para um laptop ou um edge box e se importa com a velocidade de chamada de ferramentas, o LFM2.5-8B-A1B é a direção a testar, e o rascunho é um ganho gratuito de 2,5× no caminho de serviço de GPU quando chegar a hora. Se você quer um generalista que não exige mais pensar, o Qwen3-8B ainda funciona — só saiba que é um modelo do início de 2025 que o ecossistema está começando a descontinuar. A única coisa que nem o rascunho nem o alvo mudam é o estado honesto das evidências: tudo o que é rápido no lançamento do DSpark é uma medição de um único fornecedor em um único dia, e benchmarks independentes são o item em aberto que decide o quanto disso você realmente confia.