
Claude Haiku 5.5 vs Qwen3.8 27B: uma vitória limpa na API, e por que os pesos abertos ainda existem
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A maioria das comparações desta série resume-se a uma troca. Esta não, e a ausência de uma troca é, por si só, a conclusão. Claude Haiku 5.5, lançado em 7 de outubro de 2026, supera Qwen3.8 27B, o modelo denso de 27B de pesos abertos de 14 de agosto de 2026, na pontuação composta de inteligência, no custo por token, no custo por tarefa concluída, na janela de contexto, no teto de resposta, na codificação agêntica e nas linhas de raciocínio científico — e fá-lo a partir de uma única API proprietária que não exige hardware. A única linha que o Qwen3.8 27B vence de forma inequívoca é a entrada de vídeo, e a outra é a licença.
Isso não é motivo para descartar o modelo, porque uma licença Apache-2.0 e uma modalidade de vídeo não são prêmios de consolação. É um motivo para ser preciso sobre por que alguém escolheria o lado dos pesos abertos e para parar de fingir que o argumento é sobre benchmarks.
Os números com os quais ambos os modelos foram realmente executados
Por milhão de tokens em dólares. As tarifas do fornecedor vêm da própria documentação de preços; as medições compartilhadas são o Artificial Analysis Intelligence Index v4.3.2, lido em 2026-10-08, ambos na configuração de esforço mais alta publicada.

• Entrada — Input 5.5 $0,10 até 100.000 tokens e $0,50 acima; Qwen3.8 27B $0,50 com base na taxa de terceiros registrada pelo conselho.
• Saída — Claude Haiku 5.5 $0,50 até 100.000 tokens e $2,50 acima; Qwen3.8 27B $3,00.
• Entrada em cache — Claude Haiku 5.5 $0.01 e $0.05, um desconto de 90%; Qwen3.8 27B $0.10, um desconto de 80%.
• Pontuação independente — 43,40 para Claude Haiku 5.5 (Max) contra 33,70 para Qwen3.8 27B (Xhigh). Uma diferença de 9,70 pontos, a maior deste lote.
• Custo por tarefa concluída — US$ 0,21 contra US$ 1,01, na mesma execução de avaliação. Uma diferença de 4,7x, também a maior aqui.
• Contexto e saída — 1M de tokens e um limite de resposta de 128.000 tokens para o Claude Haiku 5.5; um contexto de 256K tokens para o Qwen3.8 27B.
• Modalidade — ambos aceitam texto e imagens e retornam texto. O Qwen3.8 27B adiciona entrada de vídeo; o Claude Haiku 5.5 não.
• Pesos — Qwen3.8 27B tem 27B parâmetros densos sob Apache 2.0, disponível para download. Claude Haiku 5.5 é proprietário e somente via API.

Por que a lacuna por tarefa é quatro vezes a lacuna por token
A tabela de preços já mostra uma diferença de 5x na entrada e de 6x na saída a favor do fornecedor, portanto a direção não está em questão. O que vale a pena ler é que o valor por tarefa é menor do que o valor por token, o que é o oposto do que aconteceu nos outros confrontos deste lote, e a razão é instrutiva.
Claude Haiku 5.5 emite 162.164 tokens de saída por tarefa do Intelligence Index — 129.047 de raciocínio e 33.118 de resposta. O Qwen3.8 27B emite 66.797, divididos em 47.711 de raciocínio e 19.087 de resposta. O modelo do fornecedor gasta 2,4 vezes mais tokens por tarefa, de modo que sua vantagem de 6x na taxa de saída se reduz a uma vantagem de 4,7x por tarefa. Ainda é enorme. Só não é o número que a tabela de tarifas anuncia.
A matemática da mistura é uma forma mais clara de ver o formato disso. Em uma mistura 7:2:1 com predominância de entrada — o peso que a maior parte do tráfego de produção realmente tem —, Claude Haiku 5.5 chega a US$ 0,077 por milhão de tokens, contra US$ 0,470 do Qwen3.8 27B. Em uma mistura equilibrada 1:1, é US$ 0,30 contra US$ 1,75. O penhasco de 100.000 tokens do fornecedor é a única coisa que consegue fechar essa diferença: depois dele, as tarifas da Claude Haiku 5.5 passam a US$ 0,50 e US$ 2,50 sobre a requisição inteira, e os dois modelos se encontram aproximadamente no mesmo preço — e aí você está pagando um prêmio de 9,7 pontos de pontuação por nada.
Onde o cartão do fornecedor e o conselho independente discordam
Este é o conjunto de linhas que merece uma pausa, porque a própria ficha do modelo do Qwen3.8 27B é consideravelmente mais forte do que as medições independentes indicam, e essa diferença é justamente o motivo pelo qual a alegação de um "modelo 27B que rivaliza com modelos muito maiores" precisa de uma segunda fonte.
Os próprios números publicados pelo fornecedor, conforme registrados na página do nosso catálogo para o modelo, incluem 90,3 no LiveCodeBench v6, 89,2 no GPQA Diamond, 84,3 no OSWorld-Verified e 79,0 no QwenSWEBench. Esses números são relatados pelo fornecedor e não reproduzidos, e descrevem um modelo que é competitivo bem acima de sua categoria de peso.
Na execução independente da Artificial Analysis, o Qwen3.8 27B obtém 0.0556 no Terminal-Bench 4.0, 0.4664 no SciCode, 0.3392 no Humanity's Last Exam e 1423.21 no GDPval-AA v2.1. Coloque o 0.0556 ao lado do 84.3 que a ficha do fornecedor informa no OSWorld e a forma da divergência fica clara: no trabalho agêntico de computador e terminal, o painel independente coloca este modelo mais ou menos onde um modelo denso de 27B deveria estar, e a ficha do fornecedor não.
Duas linhas cortam no sentido oposto, e vale a pena enunciá-las pelo mesmo motivo. O Qwen3.8 27B obtém 0,4824 no AutomationBench contra 0,3541 do Claude Haiku 5.5 — uma vitória independente de 12,8 pontos naquilo que mais se aproxima de um benchmark de automação de negócios em qualquer um dos dois rankings. Esse é um número real da mesma execução, na linha mais próxima daquilo para que as pessoas de fato implantam modelos pequenos.
A leitura honesta não é “o fornecedor inflou tudo”. É que um model card mede as tarefas que seus autores escolheram, o painel independente mede um conjunto fixo, e os pontos fortes do Qwen3.8 27B estão na lista do fornecedor e não na do painel.
A economia muda quando você é dono do hardware
Cada tarifa citada acima é um preço de API e, para o Qwen3.8 27B, esse é o enquadramento errado.
Este é um modelo denso de 27B sob Apache 2.0. Ele cabe em um único acelerador moderno na quantização que a maioria das equipes aceitaria, o que significa que o custo marginal de um token deixa de ser o medidor de um fornecedor e passa a ser a sua própria utilização. É por isso que o preço para chamá-lo difere por host de uma forma que nenhum dos modelos proprietários nesta comparação jamais poderia: o painel registra uma tarifa de terceiros de US$ 0,50 na entrada e US$ 3,00 na saída, e o catálogo do OrcaRouter o traz a US$ 0,33 na entrada e US$ 2,40 na saída, sem nenhuma linha de leitura de cache, porque executamos os pesos em nossa própria infraestrutura em vez de revender o endpoint de outra pessoa.
Para uma equipe que já paga por GPUs, a comparação não é US$ 0,21 contra US$ 1,01 por tarefa. É a tarifa cobrada pelo fornecedor em comparação com o custo incremental de uma requisição em hardware próprio, e esses são números diferentes. Esse é o argumento do lado dos pesos abertos, e é o único que sobrevive ao contato com a tabela de benchmarks.
Há uma segunda consequência, menos óbvia, de a licença ser Apache 2.0: o modelo pode ser embarcado dentro de um produto, ajustado com seus próprios dados de tráfego, fixado em uma revisão específica e auditado até os pesos. Nada disso está disponível a qualquer preço em um modelo proprietário somente de API, e, para cargas de trabalho regulamentadas, muitas vezes é a restrição decisiva, e não uma preferência.

Ligando para qualquer um deles
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
O Claude Haiku 5.5 não consta do catálogo. Está acessível diretamente através da API do fornecedor e através da AWS, Azure e das principais plataformas de cloud, e é essa a afirmação correta. O que o catálogo inclui da gama do fornecedor é Claude Sonnet 5.5 e Claude Opus 5.5, o que faz com que o caminho de escalonamento de um modelo pequeno auto-hospedado para um modelo agêntico alojado de gama média seja uma mudança de encaminhamento em vez de uma segunda integração — failover automático está subjacente de qualquer das formas.
O veredito, que é incomumente desequilibrado
Como uma chamada de API em texto ou imagens, Claude Haiku 5.5 vence esta comparação em todas as linhas que não são sobre licenciamento. Nove vírgula sete pontos de índice, 4,7x mais barato por tarefa concluída, quatro vezes a janela de contexto, duas vezes o teto de resposta, e um preço cinco a seis vezes menor no regime de prompt curto. Não há argumento de forma de carga de trabalho que salve o Qwen3.8 27B em termos de preço, porque a desvantagem do fornecedor — uso intenso de tokens de saída — vale muito menos que sua vantagem de preço.
O que o salva é tudo aquilo que o preço da API não captura: uma licença que permite redistribuição, pesos que podem ser mantidos e fixados, entrada de vídeo e um caminho auto-hospedado em que o custo por token é o seu próprio hardware, e não o cartão de um fornecedor. Se você está procurando a maneira mais barata de classificar, extrair, resumir e rotear texto, Claude Haiku 5.5 é a resposta, e a diferença não tem comparação. Se você está procurando um modelo que possa colocar dentro do seu próprio produto, no seu próprio metal, sob sua própria auditoria, então a diferença nos benchmarks deixou de ser a questão há vários parágrafos.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
