
Claude Haiku 5.5 vs Qwen3.8-Flash-Next: o modelo de pesos abertos não é o mais barato
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A intuição é que um modelo de pesos abertos da linha flash da Alibaba vai sair mais barato que um modelo pequeno fechado da Anthropic, e, nos dois números da etiqueta, isso se confirma: Qwen3.8-Flash-Next é oferecido a US$ 0,15 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída na própria API da Alibaba, contra US$ 0,10 e US$ 0,50 para Claude Haiku 5.5. Mas coloque os dois frente a frente com o mesmo conjunto de benchmarks e a ordem se inverte. A Artificial Analysis mede o Claude Haiku 5.5 em Max effort a US$ 0,21 por tarefa concluída do Intelligence Index; o Qwen3.8-Flash-Next custa US$ 0,37 na mesma medição, com uma pontuação três pontos mais baixa. O rótulo mais barato pertence ao modelo com a conta maior, e a razão é a mesma que decide a maioria dessas comparações: a tabela de preços não é o preço, e o modelo de pesos abertos se paga em algum outro lugar que não na fatura de uma API gerenciada. Esse "outro lugar" é o verdadeiro tema deste confronto.
O que cada um é
Os dois chegaram com seis semanas de diferença e não são o mesmo tipo de artefato.
• Claude Haiku 5.5 — um modelo de pesos fechados lançado em 7 de outubro de 2026, na Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform on AWS. Contexto de 1M de tokens, até 128.000 tokens de saída na API Messages síncrona, pensamento adaptativo com um controle de esforço de Baixo a Máximo e padrão médio, uma data de corte de conhecimento de junho de 2026, e uma tabela de preços que muda de faixa em 100.000 tokens.
• Qwen3.8-Flash-Next — um modelo de mistura de especialistas de pesos abertos lançado em 26 de agosto de 2026 sob a licença qwen-community-1.0, descrito pela Alibaba como uma prévia experimental da arquitetura que servirá de base para o Qwen4. Ele armazena 125B parâmetros do modelo principal mais uma tabela separada de embeddings n-gram de 51B — cerca de 176B antes de um módulo de previsão de múltiplos tokens de 4B — e ativa 6B por token, com 512 especialistas, roteamento top-10 e 48 camadas. Ele tem nativamente 262,144 tokens de contexto, extensível a 1M com YaRN, e aceita entrada de texto, imagem e vídeo.
• Qwen3.8-Flash — a contraparte comercial servida, também disponível desde 26 de agosto na QwenCloud da Alibaba por US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída, com um contexto padrão de 1M de tokens. Vale a pena mantê-la separada do Flash-Next: um é um checkpoint que você pode baixar e inspecionar, o outro é um endpoint gerenciado com preço definido.
A distinção entre os dois últimos é exatamente o que torna esta comparação interessante. Claude Haiku 5.5 e Qwen3.8-Flash-Next competem em pouquíssimos aspectos, porque apenas um deles pode ser executado no seu próprio hardware.
A conta medida, que aponta na direção oposta
Todos os números independentes a seguir são do Artificial Analysis, com base no Intelligence Index v4.3.2. As tabelas de preços da Anthropic e da Alibaba são os preços publicados pelos próprios fornecedores.
• Índice de Inteligência — Claude Haiku 5.5 em esforço Máximo 43, segundo de 182 modelos. Qwen3.8-Flash-Next 40, sexto de 117 na sua classe. Três pontos de diferença, a favor da Anthropic.
• Custo por tarefa — $0,21 contra $0,37. O modelo mais caro por token é 43% mais barato por tarefa concluída.
• Tokens de saída na execução do Index — 440 milhões para o Claude Haiku 5.5 e 240 milhões para o Qwen3.8-Flash-Next, ambos contra uma mediana de 100 milhões. O modelo Qwen é o escritor mais eficiente e, ainda assim, a tarefa mais cara, o que mostra que a diferença não está só no volume de tokens, mas na combinação de entrada e de valoração que o avaliador aplica.
• Velocidade de saída — 241,9 tokens por segundo contra 56,0. O Claude Haiku 5.5 é mais de quatro vezes mais rápido na mesma medição, e seu tempo de 295 segundos até o primeiro token nessa execução é um artefato de pensar com esforço máximo, e não um dado de rede; o tempo até o primeiro token do Qwen3.8-Flash-Next é de 2,53 segundos.
• Formato da tabela de preços — Claude Haiku 5.5 passa de $0,10 e $0,50 para $0,50 e $2,50 ao atingir 100.000 tokens. O Qwen3.8-Flash é fixo em $0,16 e $0,47 independentemente do comprimento, o que é uma vantagem genuína em prompts longos e o único ponto em que o argumento do preço de etiqueta sobrevive ao contato com um documento longo.
• Tokenizador — O Claude Haiku 5.5 usa o tokenizador mais recente, compartilhado com o Claude 4.7 e versões posteriores, de modo que o mesmo texto conta como cerca de 30% mais tokens do que no Haiku anterior. Isso infla os prompts em direção ao patamar de 100.000 tokens; consta na própria documentação da Anthropic e prejudica o modelo justamente no caso de prompts longos, em que a tarifa fixa do Qwen parece mais vantajosa.
Então, o formato da troca é este: pagar mais por token e obter uma resposta mais rápida e um pouco mais inteligente, que custa menos por tarefa concluída, com um salto de tarifa a observar em entradas longas. Ou pagar menos por token e obter um modelo mais lento, que custa mais por tarefa concluída, com uma tarifa fixa e uma janela nativa de 262.144 tokens.


Onde os pesos abertos realmente mudam a aritmética
Tudo o que está acima compara duas APIs gerenciadas, e essa é a comparação que o Qwen3.8-Flash-Next não foi projetado para vencer. O argumento dele é que não precisa ser alugado.
• Suporte de serving desde o dia zero. O SGLang lançou uma página de cookbook e uma imagem dedicada; o vLLM tem uma build para isso enquanto o pull request de suporte à arquitetura ainda está aberto. A NVIDIA validou ambos, além do TensorRT LLM, em um rack GB300 NVL72, e o NeMo cobre o fine-tuning.
• O piso de hardware é baixo para um modelo de 176B. A tabela de embeddings de n-gramas de 51B pode residir na memória do host em vez da VRAM, porque seus endereços de consulta são conhecidos de antemão e podem ser pré-carregados. É isso que permite que o modelo rode em clusters DGX Spark e em estações de trabalho com 4×RTX PRO 6000 e, com quantizações da comunidade no mesmo dia — builds de 1 bit que cabem em 75 GB de RAM com cerca de 80% da precisão total —, colocá-lo em hardware que uma equipe pequena possui.
• O ajuste fino está disponível. Não no sentido de uma API de ajuste hospedada: os pesos são seus, sob uma licença comunitária com as condições habituais, e a arquitetura está documentada num relatório técnico que publica as ablações e os resultados negativos.
• A janela é menor do que parece. 262.144 tokens nativamente, extensível a 1M com YaRN — contra 1M nativo no Claude Haiku 5.5, sem a ressalva de rope-scaling. Nas cargas de trabalho com documentos longos, em que a tarifa fixa do Qwen parece mais atraente, o modelo que de fato consegue comportar o documento é o outro.
• Os benchmarks são relatados pelo fornecedor. A própria tabela da Alibaba coloca o Flash-Next à frente do DeepSeek-V4-Flash-0731 no DeepSWE 1.1 (58,7 contra 54,4), no SWE-bench Pro (62,5 contra 56,0) e no GPQA Diamond (91,7 contra 90,8), e atrás dele no NL2Repo-Bench (48,1 contra 54,2) — geração de código em nível de repositório, a única dimensão agêntica em que o modelo menor não acompanha. Nada disso foi reproduzido por terceiros, e o modelo tem seis semanas.
Essa é a fronteira honesta entre os dois. Claude Haiku 5.5 é um serviço tarifado com teto de qualidade fixo e nenhuma superfície operacional. Qwen3.8-Flash-Next é um artefato cuja curva de custo se inclina para baixo na direção do preço da eletricidade e cujo teto de qualidade é o que você conseguir servir, além do risco de uma tabela de benchmark não reproduzida e de uma arquitetura ainda sendo absorvida pelos runtimes.
A maneira realista de decidir
Três perguntas resolvem isso, e apenas a primeira é sobre benchmarks.
Você tem, ou quer, GPUs? Se não, o cenário de auto-hospedagem é teórico e a comparação gerenciada acima é a história completa — e ela vai para o Claude Haiku 5.5 em custo por tarefa, velocidade e pontuação, com a ressalva de que seu passo de 100.000 tokens penaliza prompts longos. Se você tem aceleradores ociosos abaixo de uma meta de utilização, o Qwen3.8-Flash-Next é um dos poucos modelos abertos em que uma decodificação de 6B parâmetros ativos é genuinamente barata de rodar em volume, e a cifra de US$ 0,37 por tarefa deixa de ser o número relevante.
Qual é o comprimento médio do prompt? Este é o único ponto em que o argumento do preço de etiqueta se sustenta. Abaixo de 100.000 tokens — depois de um tokenizador que infla em cerca de 30% — o Claude Haiku 5.5 é mais barato em todas as métricas. Acima disso, os valores fixos de US$ 0,16 e US$ 0,47 são a melhor carta, e sua vantagem aumenta com o comprimento até a janela nativa de 262.144 tokens, além da qual a extensão YaRN é um problema de engenharia diferente.
Qual é a tolerância da carga de trabalho à variação de latência? 241,9 tokens de saída por segundo contra 56,0 é uma grande diferença, e uma implantação auto-hospedada adiciona enfileiramento a isso. Um agente de suporte ao vivo ou de condução de navegador — as cargas de trabalho que a Anthropic cita para este nível — vai sentir a diferença.
Para quem quer responder à segunda e à terceira perguntas em vez de raciocinar sobre elas, o instrumento mais barato é um endpoint compartilhado. O Qwen3.8-Flash-Next ainda não está no catálogo da OrcaRouter, e o Claude Haiku 5.5 também não; o irmão Qwen que roteamos é Qwen3.8-Flash, ao preço de tabela do provedor, com 0% de markup repassado, que é o equivalente servido mais próximo do modelo nesta comparação e a linha de base correta para um teste de custo com prompt longo. Do lado da Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 podem todos ser chamados a partir da mesma chave hoje, então um experimento de preço de duas gerações é uma configuração, e não um segundo contrato — e, como o preço é repassado em vez de combinado, um corte do fornecedor em qualquer uma das pernas aparece do nosso lado no mesmo dia em que é anunciado. O failover automático é o que torna o experimento seguro para rodar em tráfego real: um modelo em prévia ou uma tabela de benchmark não reproduzida é exatamente o caso para apontar uma rota para algo novo enquanto um modelo confiável fica atrás dela.
O que mudaria a resposta
Duas coisas, ambas verificáveis. A primeira é a avaliação independente do Qwen3.8-Flash-Next em um harness que também executa o Claude Haiku 5.5 — a tabela do fornecedor é contra o DeepSeek, e o 40 do painel independente é uma única colocação. Uma pontuação de codificação em nível de repositório é a linha a observar, porque o NL2Repo é onde já se demonstrou que o modelo fica atrás. A segunda é se o trabalho de runtime se concretiza: o suporte ao vLLM ainda está sendo mesclado por pull requests abertos e, até que isso aconteça, hospedar esta arquitetura por conta própria é um exercício para equipes que gostam desse tipo de coisa, e não um caminho com suporte.
Até lá, o resumo é curto. Qwen3.8-Flash-Next é o modelo mais interessante de possuir e o mais caro de alugar. Claude Haiku 5.5 é o endpoint gerenciado mais barato, mais rápido e com maior pontuação, com uma tabela de preços que pune qualquer coisa longa. Escolha conforme você esteja comprando tokens ou comprando um checkpoint — e, se estiver comprando tokens, observe que o modelo de pesos abertos não é o desconto que você supôs.

