Cartão hero editorial gerado, intitulado "Ling-3.1-flash vs Qwen3.8-Flash", com o subtítulo "Duas respostas para a mesma pergunta: como se constrói uma camada rápida?" O painel esquerdo, intitulado "Escale e anuncie", traz a legenda "~560B no total · ~25B ativos · contexto de 1M" e uma tag com o texto "pesos: em breve". O painel direito, intitulado "Encolha e lance", traz "125B no total · 6B ativos · prévia do Qwen4" e uma tag com o texto "pesos: no Hugging Face".
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: Duas maneiras de construir uma camada rápida, e apenas uma delas é lançada

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois laboratórios chineses analisaram o mesmo problema neste outono — como construir um modelo barato e rápido que seja bom o suficiente para funcionar dentro de um loop de agente — e chegaram a respostas opostas. Ling-3.1-flash, anunciado pelo Ant Group em 30 de setembro de 2026, é um modelo de mistura de especialistas de aproximadamente 560 bilhões de parâmetros que ativa cerca de 25 bilhões de parâmetros por token, com uma janela de contexto declarada de até 1 milhão de tokens e a intenção declarada de abrir o código-fonte "em breve". Qwen3.8-Flash, lançado pela equipe Qwen da Alibaba em 26 de agosto de 2026, é um modelo multimodal de mistura de especialistas de 125 bilhões de parâmetros que ativa cerca de 6 bilhões de parâmetros por token, com pesos já disponíveis no Hugging Face sob o nome Qwen3.8-Flash-Next, um modelo de produção em operação na API QwenCloud a US$ 0,15 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída, e suporte desde o primeiro dia no SGLang. Um laboratório aumentou a escala e anunciou. O outro reduziu a escala e entregou. Essa diferença é mais instrutiva do que qualquer benchmark publicado por qualquer um dos laboratórios.

Também é por isso que esta comparação tem de ser lida com atenção. O Ling-3.1-flash não tem pesos, não tem licença, não tem model card, não tem preço de API e não tem avaliação independente; todo o registo publicado é um post de anúncio, um gráfico de benchmark do fornecedor e um espaço no próprio produto Ling Studio da Ant. O Qwen3.8-Flash tem todas essas coisas e uma vantagem de quatro semanas por já ser executado por pessoas que não trabalham na Alibaba. Comparar uma escolha de arquitetura é justo. Comparar capacidades ainda não é.

As duas decisões de design, e por que elas divergem

A aposta da Qwen é que a camada rápida deve ser estruturalmente diferente do modelo principal, e não apenas menor que ele. O Qwen3.8-Flash ativa 6 bilhões de seus 125 bilhões de parâmetros — cerca de 95% de esparsidade — e obtém sua capacidade de onde a computação é direcionada, e não de uma amplitude bruta. A Alibaba tem sido explícita de que a arquitetura subjacente, que combina Gated DeltaNet com Qwen Sparse Attention e uma tabela de embeddings N-gram, é uma prévia antecipada da geração Qwen4, publicada cedo de propósito para que motores de inferência, ferramentas de quantização e padrões de implantação possam amadurecer em torno dela antes que os modelos caros sejam construídos sobre ela. O resultado é um modelo que é barato por token por construção: cerca de 6 bilhões de parâmetros de trabalho em cada token, a um preço que a Alibaba definiu em US$ 0,15 de entrada e US$ 0,47 de saída por milhão.

A aposta da Ant, pelo que o anúncio revela, está mais próxima da escala convencional com um contexto muito longo. O Ling-3.1-flash mantém uma grande fração ativa — cerca de 25 bilhões de parâmetros por token, de um total de 560 bilhões, ou seja, aproximadamente um em cada vinte e dois — e anuncia uma janela de até 1 milhão de tokens, quatro vezes o que a geração anterior do Ling oferece. O aplicativo Ling Studio o descreve como criado para "agentes de propósito geral, busca, trabalho de escritório rotineiro e desenvolvimento de software/código", o que é um posicionamento de nível rápido, mas a economia de parâmetros é a de um modelo muito mais pesado. Em uma entrada idêntica, um token que passa por 25B parâmetros ativos custa aproximadamente quatro vezes a computação de um que passa por 6B, antes de qualquer decisão de preços entrar em jogo.

Nenhuma das abordagens está errada, e ambas são respostas defensáveis a "o que limita um modelo de baixo custo". Qwen está apostando que a esparsidade e uma nova pilha de atenção são o teto. Ant está apostando que o teto é o contexto e o conhecimento de mundo, e que pode arcar com a computação. O que as separa, para um leitor, não é a filosofia de projeto, mas a entrega: um projeto que você pode baixar e medir versus um projeto sobre o qual você só pode ler.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Quanto custa cada um para você, e o que isso significa na prática

A diferença de preço não é sutil e não é pequena. O Qwen3.8-Flash é publicado a US$ 0,15 por milhão de tokens de entrada, US$ 0,47 por milhão de saída e US$ 0,018 por milhão em leituras de cache — os mesmos números no anúncio da Alibaba, na ficha do modelo de produção do fornecedor e na página do modelo roteado que servimos, que é o que um repasse com 0% de markup parece quando você o confere em três fontes. A Ant não publicou nenhuma tarifa para o Ling-3.1-flash — nenhum preço de API, nenhum desconto de cache, nada comparável. O único número publicado para a linha Ling é o da geração anterior, que lista US$ 0,075 de entrada e US$ 0,22 de saída por milhão, aproximadamente metade da tarifa de entrada do Qwen e menos da metade da tarifa de saída do Qwen. Se o novo nível Ling tiver preço próximo de onde o antigo estava, ele ficaria abaixo do Qwen3.8-Flash no papel; se tiver preço em qualquer lugar próximo da computação que seus 25B parâmetros ativos implicam, não ficará. Isso é um palpite de qualquer forma, porque o número não existe.

O contexto é onde a alegação da Ling é genuinamente maior. A Ant cita até 1 milhão de tokens para o Ling-3.1-flash; o Qwen3.8-Flash vem com um contexto padrão de 1M tokens na API de produção e uma janela nativa de 262.144 tokens nos pesos abertos, extensível. Duas ressalvas pairam sobre o número da Ling, e nenhuma delas está resolvida. Primeiro, "até 1M" é uma especificação, não uma medição — ninguém publicou o comportamento de recuperação em contexto longo para um modelo que ninguém fora da Ant pode chamar. Segundo, a geração anterior da Ling tinha exatamente a mesma lacuna entre a janela anunciada e a história arquitetural por trás dela, e a resposta só veio quando os pesos, o formato e os limites de contexto foram finalmente publicados. O 1M destacado é uma promessa. O 1M no Qwen3.8-Flash é um padrão efetivamente servido que permite confrontar a alegação da Ant.

Por que "preview" é a palavra honesta de um lado disso

A própria forma como a Alibaba apresenta o Qwen3.8-Flash é a de que se trata de uma prévia de arquitetura lançada sob um nome de produção — os pesos abertos trazem o sufixo "Next" precisamente para que ninguém confunda o protótipo com o modelo de serviço ajustado. Essa caracterização foi validada por acontecimentos, e não por marketing: a SGLang disponibilizou suporte no dia zero para o Qwen3.8-Flash-Next no dia do lançamento, com o modelo também configurado para Transformers, vLLM e TokenSpeed, e os pesos foram desde então adotados por comunidades de quantização. As versões rapidamente se tornaram comuns, que é o aspeto de um modelo lançado.

O anúncio da Ant tem o mesmo formato, um passo antes: uma publicação de especificação antes do lançamento, com a declaração explícita de que o modelo será disponibilizado como código aberto em breve. Essa é uma forma legítima de lançar — o Ling-3.0-flash seguiu exatamente esse caminho em julho, e os pesos foram publicados sob a licença MIT em 7 de agosto, cerca de duas semanas depois. Mas o estado dos dois projetos hoje não é comparável, e nenhuma leitura de gráficos fecha a lacuna. Vale a pena ser específico sobre o que alguém de fora pode trazer para cada um.

O que é verificável de forma independente para o Ling-3.1-flash hoje: que o anúncio existe e está datado de 30 de setembro; que os números de parâmetros, parâmetros ativos e contexto são da própria Ant; que o modelo aparece no produto Ling Studio da Ant; e que nenhum peso, licença ou model card foi publicado. O que é verificável de forma independente para o Qwen3.8-Flash: que os pesos podem ser baixados em BF16 e FP8; que os termos da licença são legíveis; que o preço da API está publicado; e que as alegações de benchmark da Alibaba estão abertas à reprodução desde o final de agosto. A segunda lista é mais longa, e essa é toda a comparação em miniatura.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

Como os dois seriam realmente avaliados

A Ant publicou uma ficha de benchmark com o Ling-3.1-flash que o coloca frente a frente com GPT-5.6 Sol, Claude Opus 5, Kimi K3, duas variantes do GLM e DeepSeek-V4.1-Flash, com números de destaque de 1.673 Elo no GDPVal-AA v2.1, 75,16 no FrontierSWE e 65,35 no HealthBench Professional. Há dois problemas nessa ficha antes mesmo de alguém discutir os números. O primeiro é o conjunto de comparação: ambos os modelos de fronteira que a Ant escolheu estão uma geração atrás, já que Claude Opus 5.5 e GPT-6 Sol entraram no ar em 22 de setembro de 2026 e já são roteáveis agora, o que significa que a ficha avalia um modelo de outubro contra a fronteira de julho, e não contra a atual. O segundo é uma nota de rodapé na própria ficha, afirmando que o resultado no HealthBench Professional veio do "ambiente AQ" e que as capacidades de saúde do modelo atualmente só podem ser experimentadas no AQ — um ambiente que nenhuma documentação pública define. Uma pontuação de destaque cujo ambiente de avaliação não é nomeado não é reproduzível nem em princípio.

Em contrapartida, as alegações comparáveis do Qwen3.8-Flash foram feitas quando os pesos já haviam sido disponibilizados, e a Alibaba apostou seu posicionamento em uma alegação que qualquer pessoa pode testar: que a capacidade vem da taxa de esparsidade, não da contagem de parâmetros. Quatro semanas de uso não são um veredito, mas são tempo suficiente para que as alegações tenham deixado de ser incontestadas — o que é o estado útil para um modelo.

O que realmente fazer com isso, hoje

Para quem desenvolve, a divisão prática é simples. O Ling-3.1-flash não é um componente que você possa adotar esta semana: não há endpoint para chamar, nem pesos para hospedar, nem licença para verificar, nem preço para orçar. Qualquer que seja o modelo final, o movimento útil agora é definir um gatilho — pesos publicados, licença permissiva, uma pontuação independente no FrontierSWE que esteja em algum ponto próximo de 75.16 — e revisitar. A própria história da geração anterior mostra que os pesos podem chegar duas semanas após o anúncio, então esse gatilho pode disparar rapidamente.

O Qwen3.8-Flash já é um componente. Ele está disponível no nosso catálogo como um modelo roteado ao preço de tabela do provedor com markup zero — o card roteado traz $0,15 de entrada, $0,47 de saída e $0,018 por milhão de leituras de cache, os mesmos números que a Alibaba publica, o que é o que uma política de markup 0% significa na prática, e não num slide. Por trás de uma única chave ele fica ao lado de Claude Opus 5, GPT-5.6 Sol e DeepSeek-V4.1-Flash, então a comparação que a Ant está convidando — um candidato contra a fronteira atual — pode ser executada apontando uma config para duas rotas em vez de manter duas integrações, com failover automático cuidando do fim de semana em que um provedor oscila. Essa é a diferença entre uma discussão de arquitetura e um experimento.

O veredito, na medida em que se pode dar um: a Qwen fez a aposta arquitetural mais ousada e teve confiança para publicá-la cedo e deixar as pessoas destrinchá-la. A Ant fez a aposta mais pesada — mais parâmetros, mais computação ativa por token, mais contexto — e até agora publicou um gráfico em vez de um modelo. O gráfico parece bom. O gráfico também é a única coisa que se tem.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente