Um cartão principal com o título 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next', mostrando Claude Haiku 5.5 a $0.10 de entrada e $0.50 de saída com contexto de 1M, contra Qwen3.8-Flash-Next a $0.15 de entrada e $0.47 de saída com contexto de 256K, uma linha central com 'combinação 3:1 $0.20 vs $0.23' e uma linha inferior com 'Index v4.3.2 - 43.40 vs 39.82 - $0.21 vs $0.37 por tarefa'.
Engineering & Research

Claude Haiku 5.5 vs. Qwen3.8-Flash-Next: Três centavos de diferença por token, setenta e oito de diferença por tarefa concluída

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque as duas tabelas de preços lado a lado e elas parecem ter saído da mesma reunião. Claude Haiku 5.5 custa US$ 0,10 de entrada e US$ 0,50 de saída. Qwen3.8-Flash-Next custa US$ 0,15 de entrada e US$ 0,47 de saída. O modelo do fornecedor é um terço mais barato na entrada e seis por cento mais caro na saída. Nenhum dos fornecedores criou esse formato por acidente, e nenhum publicou uma nota comparativa explicando o que pretendiam — mas a aritmética de uma carga de trabalho mista de 3:1 torna a intenção legível, e faz com que o par seja a correspondência de preços mais próxima em toda esta faixa.

É aí que termina a semelhança. Claude Haiku 5.5 é um modelo de API fechado lançado em 2026-10-07, com janela de um milhão de tokens e saída máxima de 128.000 tokens. Qwen3.8-Flash-Next é um modelo de pesos abertos com 180 bilhões de parâmetros e 6 bilhões de parâmetros ativos, pesos no Hugging Face sob a Qwen Community License 1.0, e uma janela de contexto publicada sobre a qual sua própria configuração de checkpoint e o painel independente não concordam totalmente. Lançado em 2026-08-26, não é novo nem exótico para quem constrói nessa faixa.

Os dois são precificados juntos de propósito. O que as tabelas de tarifas não podem lhe dizer é que eles são feitos para trabalhos diferentes, e que aquele que parece mais barato numa planilha é o mais caro de operar.

A aritmética que revela a precificação

Combine as duas tarifas numa proporção comum de 3:1 entre entrada e saída — a proporção em torno da qual a maior parte do tráfego de chat e assistência de código se concentra — e você obtém US$ 0,20 por milhão de tokens para o Claude Haiku 5.5 e US$ 0,23 por milhão para o Qwen3.8-Flash-Next. O modelo da Anthropic é cerca de 13% mais barato nessa combinação, o que representa uma diferença menor do que a coluna de entrada sugere e maior do que a coluna de saída sugere.

Inverta a proporção e a posição muda. Em 1:1, os dois custam $0,30 e $0,31 por milhão — um empate dentro de um erro de arredondamento. Em 1:3, com predominância de saída, o Claude Haiku 5.5 fica em $0,40 e o Qwen3.8-Flash-Next em $0,39, uma vitória de um centavo para o Qwen e a única proporção na qual o modelo da Anthropic não é o mais barato dos dois.

Portanto, não existe uma única resposta honesta para "qual é mais barato", e qualquer comparação que apresente uma está escolhendo uma proporção em nome do leitor. O que é defensável é isto: a tabela de preços do Claude Haiku 5.5 é ponderada para tráfego com uso intenso de entrada, a do Qwen3.8-Flash-Next é ponderada para tráfego com uso intenso de saída, e os três centavos por milhão de tokens que os separam na proporção de 3:1 são o mais perto que alguém chegou de igualar o número da Anthropic nesta faixa. Isso é um posicionamento deliberado, digam o que disserem os materiais de lançamento.

Nosso catálogo lista o Qwen3.8-Flash-Next a $0,15 de entrada e $0,47 de saída por milhão de tokens, com uma taxa de $0,0184 para entrada em cache. Os valores de $0,15 e $0,47 são os mesmos que a Artificial Analysis registra como preço de tabela do provedor, que é o que o acordo de repasse deveria produzir.

O que realmente custa um dia de volume real

Considere um pipeline que processa 10 milhões de tokens de entrada e 2 milhões de tokens de saída por dia. Essa é uma carga de trabalho de produção pequena, confortavelmente dentro da primeira faixa de preços em comprimentos de prompt típicos.

• Custo de entrada — US$ 1,00 por dia no Claude Haiku 5.5, US$ 1,50 por dia no Qwen3.8-Flash-Next.

• Custo de saída — US$ 1,00 por dia no Claude Haiku 5.5, US$ 0,94 por dia no Qwen3.8-Flash-Next.

• Total diário — $2,00 contra $2,44. Cerca de $160 por ano de diferença nessa escala, ou cerca de 3,7 centavos por milhão de tokens.

Agora aplique os dois ajustes que a tabela de tarifas omite, e a direção se inverte.

Primeiro, o Claude Haiku 5.5 usa o tokenizador mais recente compartilhado com o Claude 4.7 e versões posteriores, que, segundo a própria documentação da Anthropic, conta o mesmo texto como aproximadamente 30% mais tokens do que o modelo que ele substitui. Se sua entrada for prosa em inglês do tipo sobre o qual essas contagens de tokens foram medidas, a taxa efetiva de entrada não é US$ 0,10 — está mais próxima de US$ 0,13 por milhão de palavras de texto, o que a coloca a dois centavos do Qwen3.8-Flash-Next, em vez de um terço abaixo dele.

Segundo, e mais importante: o Claude Haiku 5.5 é verboso. A Artificial Analysis registrou 162.164 tokens de saída para ele ao rodar o Intelligence Index, contra 107.884 do Qwen3.8-Flash-Next. Se essa proporção se mantiver na sua carga de trabalho em vez da proporção abstrata de 3:1, a linha de saída acima deixa de ser US$ 1,00 contra US$ 0,94 e passa a ser algo mais próximo de US$ 1,50 contra US$ 0,94 — e o total diário inverte a favor do Qwen.

Nenhum dos ajustes é decisivo por si só. Juntos, eles são a diferença entre os dois modelos estarem separados por um erro de arredondamento e o Qwen3.8-Flash-Next ser significativamente mais barato de operar, e a única forma de saber qual se aplica é contar tokens no seu próprio tráfego, em vez de deduzir a partir da tabela de preços.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next - the scoreboard' with rows Index v4.3.2 43.40 against 39.82, cost per task $0.21 against $0.37, time per task 424.6s against 1,524.3s, Terminal Bench 4.0 0.3283 against 0.2525, AutomationBench 0.3541 against 0.5591 and context 1M tokens against 256K tokens, footed 'Board figures per Artificial Analysis v4.3.2; context and price per vendor documentation.'

Onde a tarifa fixa é plana

O preço do Claude Haiku 5.5 tem um degrau, e o do Qwen3.8-Flash-Next não.

• Preço — Claude Haiku 5.5 US$ 0,10 de entrada / US$ 0,50 de saída por milhão de tokens até 100.000 tokens de prompt, depois US$ 0,50 / US$ 2,50 acima; Qwen3.8-Flash-Next US$ 0,15 / US$ 0,47 fixo.

• Entrada em cache — $0,01 de leitura e $0,125 de gravação para Claude Haiku 5.5; $0,016 de leitura e $0,23 de gravação para Qwen3.8-Flash-Next.

• Contexto — um milhão de tokens para o Claude Haiku 5.5. Para o Qwen3.5-Flash-Next, o número depende de quem você pergunta: a Qwen publica uma janela de um milhão de tokens, a própria configuração do checkpoint limita os embeddings de posição a 262.144, e a Artificial Intelligence registra a configuração avaliada em 256.000.

• Saída máxima — 128.000 tokens para o Claude Haiku 5.5; 131.072 na nossa entrada de catálogo para o Qwen3.8-Flash-Next.

• Modalidade de entrada — texto e imagens para Claude Haiku 5.5; texto para Qwen3.8-Flash-Next.

• Lançamento — 2026-10-07 para Claude Haiku 5.5, 2026-08-26 para Qwen3.8-Flash-Next.

• Pesos — proprietários, somente via API para o Claude Haiku 5.5; pesos abertos sob a Licença Comunitária Qwen 1.0 para o Qwen3.8-Flash-Next.

Três dessas linhas puxam em direções opostas em relação ao preço principal, e o degrau do comprimento do prompt é o mais acentuado. Abaixo de 100.000 tokens de prompt, o Claude Haiku 5.5 é o modelo mais barato em ambas as linhas de tarifa. Acima disso, a tarifa de entrada da Anthropic quintuplica, e o Qwen3.8-Flash-Next mantém uma vantagem de 3,3× na entrada e de 5,3× na saída. O limiar coincide aproximadamente com o ponto em que as janelas de contexto divergem de qualquer forma — um milhão de tokens para um modelo, 262.144 para o outro —, então um pipeline que precisa da janela longa é também o pipeline que paga a tarifa de segundo nível para obtê-la.

Isso não é uma crítica à precificação; tarifas escalonadas atreladas ao comprimento do prompt são uma forma normal de cobrar por um modelo de contexto longo. É um alerta sobre a comparação. Um confronto direto que roda com prompts de 8.000 tokens está descrevendo um par de preços. Os mesmos dois modelos com prompts de 400.000 tokens são um par completamente diferente, e o mais barato no segundo caso era o mais caro no primeiro.

O que as tabelas de fornecedores dizem por baixo

Nenhum dos fornecedores executou a suíte de avaliação do outro, de modo que o panorama compartilhado se limita às linhas que a Artificial Analysis mediu em ambos.

• Índice de Inteligência v4.3.2 — 43,40 para Claude Haiku 5.5 (Max) contra 39,40 para Qwen3.8-Flash-Next. Uma vantagem de 3,57 pontos para a Anthropic, a maior diferença composta desta série.

• Custo por tarefa Index concluída — $0,21 contra $0,37 no mesmo quadro.

• Tempo de tarefa — 424,6 segundos contra 1.524,3 segundos.

• Terminal Bench 4.0 — 0,3283 contra 0,2525. Claude Haiku 5.5 por 7,6 pontos.

• SciCode — 0,5498 contra 0,5058. Claude Haiku 5.5 por 4,4 pontos.

• Humanity's Last Exam — 0,4439 contra 0,3804. Claude Haiku 5.5 por 6,4 pontos.

• AutomationBench, pontuação parcial — 0,3541 contra 0,5591. Qwen3.8-Flash-Next por 20,5 pontos.

Seis linhas para a Anthropic, algumas delas por uma margem ampla, e uma linha para a Qwen com uma margem de 20 pontos. O padrão é o mesmo que atravessa toda esta faixa de preço: o modelo pequeno da Anthropic é mais forte em raciocínio, ciência e no custo e na latência de se obter uma resposta, e mais fraco em conduzir uma tarefa de várias etapas até a conclusão. O Qwen3.8-Flash-Next é o oposto.

A diferença entre a linha composta e a linha agêntica é excepcionalmente ampla aqui — 3,57 pontos em uma direção, 20,5 na outra — o que faz deste o par menos ambíguo da faixa nesse eixo. Se o seu trabalho é uma única pergunta difícil respondida uma vez, o Claude Haiku 5.5 está à frente em todas as medidas que você vai notar. Se o seu trabalho é um agente que precisa terminar, o Qwen3.8-Flash-Next está à frente na única linha que prevê isso, e por um fator de cinco superior à diferença do composto.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

Os 180 bilhões de parâmetros que você pode segurar

A linha que decide essa comparação para muitas equipes não está de forma alguma na tabela de benchmark.

Qwen3.8-Flash-Next é um modelo esparso de mistura de especialistas, com 180 bilhões de parâmetros no total e 6 bilhões ativos — uma proporção que mantém modesta a computação gasta por token em relação à capacidade total do modelo. Ele é publicado sob a Qwen Community License 1.0, que a Artificial Analysis registra como uma licença comercial, e não como uma licença permissiva; vale a pena ler sobre essa distinção antes de fazer planos com base nela, porque uma licença comunitária não é a MIT e traz seus próprios termos sobre redistribuição e escala. Ele pode ser baixado, auto-hospedado, fixado em um checkpoint, quantizado e ajustado por fine-tuning, sujeito a esses termos.

Claude Haiku 5.5 não pode ser nenhuma dessas coisas. É proprietário, apenas via API, sem contagem de parâmetros publicada, sem licença e sem repositório. A Anthropic compromete-se a mantê-lo invocável até, no mínimo, 2027-10-07, o que é uma garantia real e específica — mas uma garantia sobre disponibilidade é um produto diferente dos próprios pesos.

A consequência prática vale nos dois sentidos, e vale a pena dizê-lo com franqueza, em vez de como argumento de venda para qualquer um dos lados. Equipes que precisam de inferência dentro do próprio tenancy, de um checkpoint fixo com o qual possam comparar diferenças, ou da capacidade de fazer ajuste fino com dados do domínio não estão escolhendo entre esses dois modelos com base em pontos de índice. Elas estão escolhendo o Qwen3.8-Flash-Next, porque a outra opção não oferece o que elas precisam a preço algum. Equipes que precisam de um endpoint gerenciado com um system card publicado, um conjunto de avaliação documentado e um compromisso de descontinuação estão escolhendo a outra direção, e os pesos não são um recurso que elas iriam usar.

Executando o lado da tarifa fixa

Uma nota sobre o nome. O painel independente cataloga este modelo como Qwen3.8-Flash-Next; o nosso próprio catálogo lista a mesma versão sob o nome de fornecedor mais curto Qwen3.8 Flash, com os mesmos $0.15 / $0.47 e uma taxa de entrada em cache de $0.0184, e aponta o seu repositório para os pesos do Hugging Face publicados em 2026-08-26. Quando os números abaixo vêm da Artificial Analysis, pertencem à entrada que ela chama de Qwen3.8-Flash-Next. Os dois são o mesmo modelo; o painel simplesmente usa o mais longo dos seus nomes.

O Qwen3.8-Flash-Next está no catálogo da OrcaRouter pelo preço de tabela do provedor, com 0% de markup, repassado em vez de misturado — então os US$ 0,15 e US$ 0,47 acima são as tarifas na fatura, e uma mudança do lado da Qwen repercute nos nossos preços no mesmo dia, em vez de uma reprecificação posterior. Claude Sonnet 5.5 e Claude Opus 5.5 também estão no catálogo, o que torna o caminho de escalonamento de um modelo pequeno para um nível intermediário da Anthropic uma configuração de roteamento, em vez de uma segunda integração. Uma API para mais de 200 modelos, uma chave, failover automático por baixo, e a DSL de roteamento quando o teto de custo pertence à rota, e não ao código da aplicação.

Claude Haiku 5.5 não está no catálogo. É acessível através da própria API da Anthropic, e a parte da Anthropic nesta comparação não é algo que oferecemos hoje — é melhor dizer isso do que deixar ambíguo.

A capture of the OrcaRouter model page for Qwen3.8 Flash under qwen/qwen3.8-flash, showing a maximum output of 131K, text, image and video input, benchmarks published by Qwen on 2026-08-26, and a price strip reading $0.15 input and $0.47 output per million tokens.

Qual dos dois, e com base em quê?

Se o seu tráfego for intenso em entrada, os seus prompts ficarem abaixo de 100.000 tokens e você estiver pagando por volume real, o Claude Haiku 5.5 é o modelo mais barato nas duas linhas de tarifas e o de maior pontuação em seis das sete medições compartilhadas — com a ressalva de que a diferença de 30% no tokenizador e a verbosidade da Anthropic consomem um desconto que parece maior na etiqueta do que é na fatura.

Se o seu tráfego for pesado em saída, ou se os seus prompts forem longos o suficiente para ultrapassar o limite da Anthropic, ou se você precisar da tarifa fixa para previsões, o Qwen3.8-Flash-Next é mais barato — às vezes por um fator de cinco na saída acima do patamar — e é o modelo que vence a linha de conclusão agêntica por 20 pontos.

Se você precisa dos pesos, a comparação não é nem de perto, e o preço nunca entra na equação.

Os dois cartões ficam a menos de três centavos por milhão de tokens de diferença um do outro numa mistura de 3:1, o que é próximo o bastante para que a tarifa não deva ser o que decide. O que decide é em qual daqueles três parágrafos você está, e isso é uma questão sobre o seu pipeline, e não sobre qualquer um dos dois modelos.