Um cartão de destaque intitulado 'Claude Haiku 5.5 vs Ling 3.1 Flash', encimado pela linha '560B parâmetros, sem pesos', com um contraste Index versus AutomationBench com leitura de 0,3541 contra 0,6174, uma linha de custo com leitura de $0,21 por tarefa contra $0,99 por tarefa e uma linha de tempo com leitura de 424,6s por tarefa contra 360,4s por tarefa.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.1 Flash: Um modelo de 560 bilhões de parâmetros que custa quatro vezes mais por resposta

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Seis dias os separam. A InclusionAI lançou o Ling 3.1 Flash em 1º de outubro de 2026; o fornecedor lançou o Claude Haiku 5.5 em 7 de outubro. Ambos são vendidos como modelos de nível flash, ambos trazem uma janela de contexto de um milhão de tokens e, nas linhas de raciocínio do único painel independente que testou os dois, eles estão tão próximos que a diferença está dentro do ruído. Aí você chega à linha que mede se um agente de fato conclui a tarefa, e eles estão a 26 pontos de distância — e à linha que mede quanto custa uma tarefa concluída, em que o modelo com 560 bilhões de parâmetros tem um preço quatro vezes e meia maior que o daquele cujo número de parâmetros ninguém publicou.

Nenhuma das tabelas de preços prevê isso. O Ling 3.1 Flash está listado a $0,30 por milhão de tokens de entrada e $0,90 por milhão de tokens de saída. O Claude Haiku 5.5 está listado a $0,10 e $0,50 para prompts de até 100.000 tokens, passando para $0,50 e $2,50 acima disso. Lido como preço por token, o Ling custa três vezes mais na entrada e um pouco menos que o dobro na saída, que é o tipo de diferença que encerra uma comparação em uma única linha.

Isso não encerra esta questão, porque a tabela de preços é precificada por token e a decisão é precificada por tarefa. Esses dois números saem desta comparação com sinais opostos, e a razão não é a verbosidade.

O que custa uma tarefa concluída, não o que custa um token

No Artificial Analysis Intelligence Index v4.3.2, o custo medido para concluir uma tarefa completa do índice é de US$ 0,21 para o Claude Haiku 5.5 e de US$ 0,99 para o Ling 3.1 Flash. Isso representa uma diferença de 4,6× — maior que a proporção de entrada de 3× e na mesma direção.

A explicação óbvia — de que o modelo caro está falando mais — está errada. O Ling 3.1 Flash gerou 100.671 tokens de saída por tarefa de indexação; o Claude Haiku 5.5 gerou 162.164. O modelo mais barato é o mais falador, em mais de 60%. Portanto, o dinheiro também não está indo para onde a tabela de preços sugere.

Divida o custo por tarefa e ele recai onde a metodologia do índice realmente o gasta. Dos US$ 0,21 do Claude Haiku 5.5, cerca de 62% estão do lado da entrada; dos US$ 0,99 do Ling 3.1 Flash, cerca de 91% estão. Essas são execuções de raciocínio com uso intenso de cache, e os dois fornecedores precificam um token de entrada em cache de maneiras muito diferentes: US$ 0,01 por milhão para o Claude Haiku 5.5 contra US$ 0,06 por milhão para o Ling 3.1 Flash — uma diferença de 6× na única linha que domina a fatura. A tabela de preços publicada compara US$ 0,10 a US$ 0,30. A linha que decide a fatura compara US$ 0,01 a US$ 0,06.

Nosso próprio catálogo repassa os preços de tabela dos provedores com 0% de margem, e é assim que você consegue distinguir as duas situações em uma fatura real, e não em uma simulada. O Ling 3.1 Flash não está no catálogo em nenhuma grafia do caminho do fornecedor que conseguimos resolver — nem em InclusionAI, nem em Ling, nem em qualquer uma das oito formas que tentamos —, portanto os $0.30 e $0.90 acima são as tarifas publicadas pelo próprio fornecedor e nada que possamos rotear para você hoje. O Claude Haiku 5.5 também não está no catálogo; ele roda pela própria API da Anthropic. O que o catálogo de fato oferece nas proximidades desta comparação é GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash e Gemini 3.8 Flash, cada um ao preço de tabela do provedor com 0% de margem, de modo que uma mudança de tarifa do fornecedor chega ao nosso lado no mesmo dia em que chega ao deles. Se a conclusão abaixo for que o perfil agêntico do Ling 3.1 Flash é o que sua carga de trabalho precisa, o próximo passo prático é um confronto direto com os modelos com capacidade agêntica que nós roteamos, em uma única chave com failover automático por baixo e a DSL de roteamento quando o teto de custo pertence à rota, e não ao código da aplicação.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

Sete linhas onde ambos foram medidos

O Artificial Analysis é o único painel que executou ambos os modelos, e a sobreposição é estreita, mas informativa. As linhas não concordam entre si, e a direção da discordância não é aleatória.

• Intelligence Index v4.3.2 — 43,40 para o Claude Haiku 5.5 (Max) contra 41,09 do Ling 3.1 Flash. Uma vantagem de 2,31 pontos para a Anthropic.

• Custo por tarefa Index concluída — US$ 0,21 contra US$ 0,99 no mesmo painel.

• Tempo por tarefa de Index — 424,6 segundos para Claude Haiku 5.5 contra 360,4 segundos para Ling 3.1 Flash. Esta é a linha em que a expectativa se rompe: o modelo de 560 bilhões de parâmetros é o mais rápido dos dois em todo o Index, em cerca de 15%.

• Terminal Bench 4.0 — 0,3283 contra 0,3333. O Ling 3.1 Flash está meio ponto à frente, o que, num benchmark citado por ambos os fornecedores, é um empate.

• SciCode — 0,5498 contra 0,5405. Claude Haiku 5.5 por 0,9 pontos. Também é um empate.

• Humanity's Last Exam, sem ferramentas — 0,4439 contra 0,3943. Claude Haiku 5.5 por 5 pontos, a primeira separação real.

• AutomationBench, pontuação parcial — 0,3541 contra 0,6174. Ling 3.1 Flash por 26 pontos, e por uma margem maior do que a soma de todas as outras diferenças desta lista.

Existem mais duas linhas fora desse conjunto compartilhado que vale a pena incluir, porque são as que os compradores mais notam. No GDPval-AA, que a Artificial Analysis executa em 44 ocupações, as duas são 1620,05 e 1621,75 — um empate estatístico. No AA-Briefcase v1.1, uma avaliação de trabalho profissional de formato longo com classificação Elo, o Claude Haiku 5.5 registra 1577,72 contra 1400,35 do Ling 3.1 Flash, uma diferença de 177 pontos a favor da Anthropic. Essa é a maior separação não agêntica entre eles em qualquer lugar do quadro.

A única linha que deveria decidir a maioria dessas conversas

Médias no nível do índice escondem para onde o tempo e o dinheiro realmente foram, e este par é o caso mais claro disso no lote. Os números por avaliação no Terminal Bench 4.0 não são próximos em nenhuma dimensão, exceto na pontuação.

• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 a $5,49 por tarefa e 1.283 segundos por tarefa.

• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 a $0.65 por tarefa e 908 segundos por tarefa.

Cinco milésimos de ponto na pontuação os separam. O custo é 8,4× e o tempo real é 1,4×. Uma equipe que lê a tabela de benchmark e escolhe o modelo que pontua 0,3333 optou, pelas próprias contas da Artificial Analysis, por pagar oito vezes mais para obter a mesma resposta um terço de minuto mais tarde.

Não se trata de um argumento de que a pontuação não tem sentido; trata-se de um argumento de que uma pontuação é uma razão entre o trabalho realizado e o trabalho tentado, e não diz nada sobre os recursos consumidos para se chegar lá. Benchmarks de conclusão agêntica são exatamente o cenário em que essa distinção pesa mais, porque um agente que tenta de novo é um agente que paga o preço integral em cada nova tentativa, e um modelo que custa oito vezes mais por tentativa transforma um ciclo de retentativas em uma linha de orçamento.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

Os 560 bilhões de parâmetros sem nada para baixar

Aqui está a parte da ficha técnica do Ling 3.1 Flash que é genuinamente incomum, e não é o tamanho.

Ling 3.1 Flash é um modelo esparso de mistura de especialistas — 560 bilhões de parâmetros no total, 25 bilhões ativos por token — e o Artificial Analysis o classifica como proprietário. Não há pesos, nem arquivo de licença, nem repositório. Um grande modelo esparso com esse formato normalmente seria lançado como uma versão aberta, porque é o que o resto dessa categoria faz: o GLM 5.3 Flash distribui pesos MIT com 320 bilhões no total e 18 bilhões ativos, e o DeepSeek V4.1 Flash distribui pesos MIT com 552 bilhões no total e 16 bilhões ativos. O Ling 3.1 Flash é da mesma classe de arquitetura, na mesma ordem de escala, publicado apenas como API.

Essa escolha tem uma consequência que as linhas do benchmark não mostram. Um modelo de 25 bilhões de parâmetros ativos precisa ser servido em algum lugar, e se você não pode manter o checkpoint, você não pode escolher onde ou com que margem — você aluga o serviço do fornecedor dele. O preço da tarefa de $5,49 do Terminal Bench acima não é principalmente um artefato da taxa de tokens; é o que custa alugar um modelo esparso grande da única parte que pode executá-lo. Os irmãos de pesos abertos neste nível dão a você a opção de alterar esse número você mesmo.

Isso também vale no sentido inverso, e a mesma honestidade se aplica. Um lançamento aberto não é automaticamente o melhor produto: você herda o ônus do serving, as escolhas de quantização e a esteira de atualizações junto com os pesos, e um arquivo de licença não é um contrato de suporte. A Anthropic publica, para o Claude Haiku 5.5, um compromisso de descontinuação não antes de 7 de outubro de 2027, em uma API própria com um system card. A escolha de qual desses dois arranjos você quer é uma questão sobre a sua equipe, não sobre nenhum dos dois modelos.

Para que serve o Ling 3.1 Flash

Leia o perfil na íntegra e ele descreve um produto coerente, e não um produto comprometido: um modelo grande, esparso e de contexto longo que conclui fluxos de trabalho autônomos de várias etapas melhor do que qualquer outra coisa medida nessa faixa de preço, não se destaca em raciocínio difícil de tentativa única, e faz isso a uma taxa fixa, sem um aumento abrupto conforme o comprimento do prompt. No AutomationBench, ele está 26 pontos à frente do Claude Haiku 5.5, e sua pontuação no AA-Briefcase é o único ponto nesta comparação em que ele fica atrás do meio do pelotão, e não na frente dele.

Essa é uma descrição defensável de um trabalhador agêntico em lote: aponte-o para uma fila de tarefas estruturadas que precisam ser concluídas individualmente, aceite que a tarefa é medida em minutos, mantenha o prompt longo o suficiente para que uma etapa de limiar seja punitiva, e valorize a confiabilidade na linha de chegada acima do custo de qualquer token individual. Aquilo para que ele não é bom é justamente aquilo para que os modelos de nível flash costumam ser comprados. Ele aceita apenas texto — nenhuma entrada de imagem, ao passo que Claude Haiku 5.5 aceita texto e imagens. O tempo da sua tarefa de indexação é menor, mas o tempo da sua tarefa no Terminal Bench é maior, e a US$ 0,99 por tarefa de indexação concluída, contra US$ 0,21, ele está gastando quatro vezes e meia mais para chegar a quase o mesmo resultado composto.

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

Qual dos dois, com base nas evidências que existem

Se o seu trabalho é texto que entra e texto que sai, com preço por token em volume, o Claude Haiku 5.5 vence esta comparação em cada linha que chega a uma fatura: menor custo de tarefa no índice, menor custo real de tarefa no benchmark que mais importa para agentes, pontuação composta mais alta, melhores pontuações em trabalho profissional de formato longo, melhor fidelidade e entrada de imagem que o outro modelo não oferece de forma alguma.

Se o seu trabalho é um agente não assistido que precisa concluir um fluxo de trabalho de várias etapas, o Ling 3.1 Flash está obtendo 26 pontos acima do Claude Haiku 5.5 no único benchmark compartilhado que mede exatamente isso, e vale a pena testá-lo em vez de descartá-lo pelo preço. Teste-o no seu próprio trace, não nesta tabela — e precifique o teste por trabalho concluído, porque esse é o número que muda quando um agente tenta novamente.

Se você precisa ter os pesos, nenhum desses dois é o seu modelo. O Ling 3.1 Flash é proprietário, com 560 bilhões de parâmetros; o Claude Haiku 5.5 é proprietário e não tem contagem publicada. Os lançamentos abertos nessa categoria estão em outra parte do quadro, e essa comparação parte de um conjunto de linhas completamente diferente.

O composto diz 2,31 pontos. O benchmark agêntico diz 26 no sentido oposto. A tabela de tarifas diz 3× na entrada; o custo de tarefa concluída diz 4,6× na mesma direção da tabela. Quatro números, duas direções — e é por isso que a única forma confiável de resolver isso é executar ambos contra um trace do seu próprio trabalho e ler o custo nos trabalhos concluídos, em vez de nos tokens.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente