
Claude Haiku 5.5 vs Ling 3.0 Flash: Um destes modelos já tem um sucessor
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Comece pelo fato curioso, porque é ele que deve moldar a decisão. Ling 3.0 Flash — o modelo de pesos abertos de 124 bilhões de parâmetros da Ant Group, lançado em agosto de 2026 sob licença MIT — agora está sinalizado como obsoleto, com o Ling 3.1 Flash apontado como seu substituto. Claude Haiku 5.5 chegou em 7 de outubro de 2026, dois dias antes da redação deste texto, e a Anthropic comprometeu-se a não aposentá-lo antes de outubro de 2027. Dois modelos na mesma faixa de preço, e um deles já está sendo direcionado ao seu próprio sucessor.
Essa assimetria não é um veredito sobre a qualidade. O Ling 3.0 Flash é um modelo genuinamente rápido, com pesos abertos e uma arquitetura incomum, e, em vários eixos, supera o nível da Anthropic de forma inequívoca. Mas isso significa que esta comparação tem prazo de validade, e qualquer texto que trate os dois como igualmente duráveis está vendendo a você a parte que expira.
Dois lançamentos, duas épocas muito diferentes
Os dados independentes aqui apresentados são do Analysis; as alegações específicas dos fornecedores são das fichas técnicas dos modelos e da documentação, e estão identificadas.
• Lançamento — Ling 3.0 Flash em 4 de agosto de 2026, com o repositório do Hugging Face datado de 2 de agosto. Claude Haiku 5.5 em 7 de outubro de 2026.
• Licença — MIT para o Ling 3.0 Flash, que é praticamente tão permissiva quanto os pesos abertos podem ser. O Claude Haiku 5.5 é proprietário, apenas via API.
• Status — Ling 3.0 Flash carrega um sinalizador de depreciação apontando para Ling 3.1 Flash. Claude Haiku 5.5 é o atual, com um compromisso de não aposentadoria até outubro de 2027.
• Adoção — o repositório do Ling 3.0 Flash acumulou 11.797 downloads e 427 curtidas. É uma presença real, ainda que modesta, e constitui um indicador razoável de quanto o ferramental de terceiros cresceu em torno do modelo.
A diferença de idade pesa mais do que as seis semanas sugerem. O Ling 3.0 Flash foi lançado num período em que a sua própria família já estava em movimento; o Claude Haiku 5.5 foi lançado como o membro mais recente de uma linha que não tem sucessor anunciado.
A arquitetura é a parte que vale a pena ler duas vezes.

Ling 3.0 Flash é um modelo de mistura de especialistas com 124 bilhões de parâmetros totais e 5,1 bilhões ativos por token. Essa proporção é todo o argumento econômico: você acomoda a pegada de memória de um modelo grande e paga o custo computacional de um modelo pequeno. A configuração publicada é específica, e não é uma mera repaginação de um transformer padrão:
• Camadas — 35 camadas KDA com 7 camadas Gated MLA numa proporção de 5:1, além de 2 camadas densas. A receita de treinamento publicada move a janela de contexto de 8K para 32K e para 256K em etapas, em vez de treinar a janela longa do zero.
• Especialistas — 512 especialistas roteados com um especialista compartilhado, 8 ativados por token, em um tamanho oculto de 2.560, um tamanho intermediário de especialista de 768 e um tamanho intermediário denso de 6.144. O vocabulário tem 157.184 tokens.
• Serviço — a implantação de referência do cartão usa SGLang com --context-length 262144, e relata que o HiCache com cache Mooncake reduz o tempo até o primeiro token em 60–80% ou mais em entradas longas. Esse é um número relatado pelo fornecedor e é apresentado como tal.
Nada disso é um truque. Uma pegada ativa de 5,1B é o motivo pelo qual o Ling 3.0 Flash pode ser servido com a vazão que alcança, e o trabalho de cache é o motivo pelo qual a latência do primeiro token em prompts longos continua utilizável. A abordagem do Claude Haiku 5.5 é o oposto: um único modelo denso e proprietário por trás de uma API, com uma janela de 1.000.000 de tokens e o pensamento adaptativo decidindo, a cada requisição, quanto trabalho realizar. Duas respostas coerentes para a mesma questão de custo.
Os números, lado a lado

• Pontuação independente — Claude Haiku 5.5 com 43 no Índice de Inteligência, segundo entre 182. Ling 3.0 Flash com 20, terceiro entre 65 em sua própria categoria.
• Preço de entrada por milhão de tokens — Claude Haiku 5.5: US$ 0,10 até 100.000 tokens, US$ 0,50 acima disso. Ling 3.0 Flash: US$ 0,075, com 80% de desconto em cache.
• Preço de saída por milhão de tokens — Claude Haiku 5.5 $0,50 até 100.000 tokens, $2,50 acima. Ling 3.0 Flash $0,22.
• Custo combinado — US$ 0,05 por milhão de tokens para o Ling 3.0 Flash, contra US$ 0,08 para o Claude Haiku 5.5 na combinação do próprio board.
• Velocidade — 333,6 tokens de saída por segundo para o Ling 3.0 Flash, primeiro de 65 em sua categoria, contra 240,4 do Claude Haiku 5.5. O tempo até o primeiro token é quase um empate: 2,50 segundos contra a medição do ranking para o modelo da Anthropic.
• Contexto — 262.000 tokens para o Ling 3.0 Flash; 1.000.000 para o Claude Haiku 5.5.
• Modalidade de entrada — apenas texto para Ling 3.0 Flash. Texto e imagens para Claude Haiku 5.5.
• Pesos — MIT e disponíveis para download para o Ling 3.0 Flash. Proprietários para o Claude Haiku 5.5.
O argumento de Ling é velocidade e preço, não profundidade
A diferença de 23 pontos no Índice entre 43 e 20 é a manchete, e aponta na mesma direção que em toda comparação desse tipo: Claude Haiku 5.5 é o modelo mais forte, e a diferença não é pequena. Mas a coluna Ling vence duas linhas de forma clara, e ambas são do tipo que aparece numa fatura ou num orçamento de latência.
Primeiro, a taxa de transferência. 333,6 tokens por segundo é a mais rápida da sua categoria no ranking, cerca de 39% à frente do Claude Haiku 5.5 e, combinada com um custo combinado menor, significa que a geração em massa — varreduras de classificação, rotulagem de dados, extração estruturada em alto volume — é mensuravelmente mais barata de executar no Ling 3.0 Flash. Quando a tarefa é bem especificada e o modo de falha é óbvio, um modelo 23 pontos de Index atrás ainda pode ser o certo.
Segundo, o desconto de 80% em cache. Para uma carga de trabalho com um prefixo grande e estável e uma cauda pequena e variável, a taxa efetiva de entrada no Ling 3.0 Flash cai bem abaixo do preço de tabela, e o design de cache da ficha técnica do modelo visa exatamente esse padrão. A taxa de leitura de cache do Claude Haiku 5.5, de US$ 0,01, é mais barata em termos absolutos, mas sua gravação de cache custa US$ 0,125, e o modelo tem um preço escalonado em 100.000 tokens de entrada que o Ling não possui.
O contrapeso é a verbosidade, e é o mesmo que se aplica ao modelo da Anthropic. A Artificial Analysis registrou 260 milhões de tokens de saída ao executar o Index no Ling 3.0 Flash, contra uma mediana de 100 milhões, e o classifica como verboso. Num modelo com preço por token, isso corrói a vantagem de preço — um preço de saída 2,3x mais barato, parcialmente consumido por um modelo que escreve mais tokens, é uma vantagem menor do que o card sugere.
O que os benchmarks dos fornecedores afirmam, e o que não afirmam
O próprio cartão do Ling 3.0 Flash reporta um conjunto forte: MathArena AIME 2026 em 93,2, HMMT Fevereiro 2026 em 87, SWE-Bench Pro em 56,6, SWE-Bench Multilingual Resolved em 72,4, e Humanity's Last Exam em 22,7. Cada um desses é reportado pelo fornecedor e nenhum foi reproduzido de forma independente aqui. Eles também não são medidos contra o Claude Haiku 5.5 no mesmo harness — Anthropic publica o seu próprio conjunto (GDPval-AA v2.1 em 1620, OSWorld 2.1 em 72,4%, Terminal-Bench 4.0 em 39,2%) e os dois fornecedores executaram suítes diferentes. A única medição compartilhada é o quadro independente, e aí a resposta é inequívoca.
Vale a pena destacar, junto às pontuações de matemática: esse valor de 22,7 no HLE fica bem abaixo dos 45,9 sem ferramentas que a Anthropic informa para o Claude Haiku 5.5. São harnesses diferentes, portanto não é uma comparação direta, mas também não é uma diferença que a escolha do harness explique.

O problema do sucessor
Esta é a parte que decide a comparação para quem planeja além do trimestre atual, e não tem nada a ver com benchmarks.
O Ling 3.0 Flash está obsoleto em favor do Ling 3.1 Flash. Isso não significa que ele pare de funcionar — pesos abertos não expiram, e licenças MIT não podem ser revogadas. Mas significa que o ecossistema ao seu redor vai se afastar: suporte de frameworks de inferência, lançamentos de quantização, correções de bugs e ferramentas da comunidade seguem todos o modelo atual, e um modelo obsoleto recebe a sobra dessa atenção. Se você está construindo sobre o Ling 3.0 Flash hoje, está construindo sobre pesos que estão congelados e finalizados, o que é bom para uma carga de trabalho estável e problemático para qualquer coisa que você espera que melhore.
O Claude Haiku 5.5 tem o conjunto espelhado de garantias: você não recebe os pesos, mas tem um fornecedor cujo interesse comercial é manter o modelo rápido, corrigido e em serviço, além de um compromisso de não descontinuação até outubro de 2027 e um caminho de migração publicado para quando isso terminar.
Ambos os lados desta rota, através de uma única chave
A linha honesta de disponibilidade: a OrcaRouter não disponibiliza o Ling 3.0 Flash, e também não disponibiliza o Claude Haiku 5.5. O Ling 3.0 Flash é servido pela distribuição própria do fornecedor e por várias plataformas de terceiros; o Claude Haiku 5.5 está na API da Anthropic e nas principais plataformas de nuvem.
O que isso deixa é a questão de roteamento que ambos os modelos levantam. O Claude Haiku 5.5 a 43 e com uma janela de 1M é um alvo natural de escalonamento; o Ling 3.0 Flash a 333 tokens por segundo é uma perna natural para volume. Uma rota que envia trabalho de alto volume e bem especificado para um nível rápido e escala para um nível mais forte qualquer coisa que falhe numa verificação de comprimento ou qualidade é exatamente o arranjo que um roteador compõe — no OrcaRouter, os Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 da Anthropic estão no catálogo hoje, ao lado de grandes opções de pesos abertos como o DeepSeek V4.1 Flash e o GLM 5.3 Flash, então as pernas de escalonamento e de volume podem ambas ser construídas e testadas sob carga agora. Uma chave, failover automático por baixo, preços de tabela dos fornecedores repassados com 0% de margem, para que uma mudança de preço entre em vigor no mesmo dia.
Qual dos dois, e por quanto tempo
Escolha o Claude Haiku 5.5 se o trabalho for em aberto, se precisar de imagens ou de uma janela de um milhão de tokens, se quiser um fornecedor responsável pelo tempo de atividade, ou se estiver planejando além do próximo trimestre. Está 23 pontos à frente no Index, é atual e não obsoleto, e a diferença de preço é pequena o suficiente para que a diferença na pontuação domine.
Escolha o Ling 3.0 Flash se a carga de trabalho for em massa, bem especificada e sensível à latência, se a licença MIT ou os pesos abertos forem o objetivo, ou se um desconto de cache de 80% sobre um prefixo estável for onde a sua fatura realmente está. É o modelo mais rápido e o mais barato por token, e é genuinamente bom nas tarefas que um modelo 20-Index consegue realizar. Apenas vá com a consciência de que está a adotar um modelo finalizado em vez de um modelo mantido, e que o sucessor para o qual ele aponta já existe.
