
Ling-3.1-flash vs Qwen3.8-Flash: Duas maneiras de construir uma camada rápida, e apenas uma delas é lançada
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 262 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Dois laboratórios chineses analisaram o mesmo problema neste outono — como construir um modelo barato e rápido que seja bom o suficiente para funcionar dentro de um loop de agente — e chegaram a respostas opostas. Ling-3.1-flash, anunciado pelo Ant Group em 30 de setembro de 2026, é um modelo de mistura de especialistas de aproximadamente 560 bilhões de parâmetros que ativa cerca de 25 bilhões de parâmetros por token, com uma janela de contexto declarada de até 1 milhão de tokens e a intenção declarada de abrir o código-fonte "em breve". Qwen3.8-Flash, lançado pela equipe Qwen da Alibaba em 26 de agosto de 2026, é um modelo multimodal de mistura de especialistas de 125 bilhões de parâmetros que ativa cerca de 6 bilhões de parâmetros por token, com pesos já disponíveis no Hugging Face sob o nome Qwen3.8-Flash-Next, um modelo de produção em operação na API QwenCloud a US$ 0,15 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída, e suporte desde o primeiro dia no SGLang. Um laboratório aumentou a escala e anunciou. O outro reduziu a escala e entregou. Essa diferença é mais instrutiva do que qualquer benchmark publicado por qualquer um dos laboratórios.
Também é por isso que esta comparação tem de ser lida com atenção. O Ling-3.1-flash não tem pesos, não tem licença, não tem model card, não tem preço de API e não tem avaliação independente; todo o registo publicado é um post de anúncio, um gráfico de benchmark do fornecedor e um espaço no próprio produto Ling Studio da Ant. O Qwen3.8-Flash tem todas essas coisas e uma vantagem de quatro semanas por já ser executado por pessoas que não trabalham na Alibaba. Comparar uma escolha de arquitetura é justo. Comparar capacidades ainda não é.
As duas decisões de design, e por que elas divergem
A aposta da Qwen é que a camada rápida deve ser estruturalmente diferente do modelo principal, e não apenas menor que ele. O Qwen3.8-Flash ativa 6 bilhões de seus 125 bilhões de parâmetros — cerca de 95% de esparsidade — e obtém sua capacidade de onde a computação é direcionada, e não de uma amplitude bruta. A Alibaba tem sido explícita de que a arquitetura subjacente, que combina Gated DeltaNet com Qwen Sparse Attention e uma tabela de embeddings N-gram, é uma prévia antecipada da geração Qwen4, publicada cedo de propósito para que motores de inferência, ferramentas de quantização e padrões de implantação possam amadurecer em torno dela antes que os modelos caros sejam construídos sobre ela. O resultado é um modelo que é barato por token por construção: cerca de 6 bilhões de parâmetros de trabalho em cada token, a um preço que a Alibaba definiu em US$ 0,15 de entrada e US$ 0,47 de saída por milhão.
A aposta da Ant, pelo que o anúncio revela, está mais próxima da escala convencional com um contexto muito longo. O Ling-3.1-flash mantém uma grande fração ativa — cerca de 25 bilhões de parâmetros por token, de um total de 560 bilhões, ou seja, aproximadamente um em cada vinte e dois — e anuncia uma janela de até 1 milhão de tokens, quatro vezes o que a geração anterior do Ling oferece. O aplicativo Ling Studio o descreve como criado para "agentes de propósito geral, busca, trabalho de escritório rotineiro e desenvolvimento de software/código", o que é um posicionamento de nível rápido, mas a economia de parâmetros é a de um modelo muito mais pesado. Em uma entrada idêntica, um token que passa por 25B parâmetros ativos custa aproximadamente quatro vezes a computação de um que passa por 6B, antes de qualquer decisão de preços entrar em jogo.
Nenhuma das abordagens está errada, e ambas são respostas defensáveis a "o que limita um modelo de baixo custo". Qwen está apostando que a esparsidade e uma nova pilha de atenção são o teto. Ant está apostando que o teto é o contexto e o conhecimento de mundo, e que pode arcar com a computação. O que as separa, para um leitor, não é a filosofia de projeto, mas a entrega: um projeto que você pode baixar e medir versus um projeto sobre o qual você só pode ler.

Quanto custa cada um para você, e o que isso significa na prática
A diferença de preço não é sutil e não é pequena. O Qwen3.8-Flash é publicado a US$ 0,15 por milhão de tokens de entrada, US$ 0,47 por milhão de saída e US$ 0,018 por milhão em leituras de cache — os mesmos números no anúncio da Alibaba, na ficha do modelo de produção do fornecedor e na página do modelo roteado que servimos, que é o que um repasse com 0% de markup parece quando você o confere em três fontes. A Ant não publicou nenhuma tarifa para o Ling-3.1-flash — nenhum preço de API, nenhum desconto de cache, nada comparável. O único número publicado para a linha Ling é o da geração anterior, que lista US$ 0,075 de entrada e US$ 0,22 de saída por milhão, aproximadamente metade da tarifa de entrada do Qwen e menos da metade da tarifa de saída do Qwen. Se o novo nível Ling tiver preço próximo de onde o antigo estava, ele ficaria abaixo do Qwen3.8-Flash no papel; se tiver preço em qualquer lugar próximo da computação que seus 25B parâmetros ativos implicam, não ficará. Isso é um palpite de qualquer forma, porque o número não existe.
O contexto é onde a alegação da Ling é genuinamente maior. A Ant cita até 1 milhão de tokens para o Ling-3.1-flash; o Qwen3.8-Flash vem com um contexto padrão de 1M tokens na API de produção e uma janela nativa de 262.144 tokens nos pesos abertos, extensível. Duas ressalvas pairam sobre o número da Ling, e nenhuma delas está resolvida. Primeiro, "até 1M" é uma especificação, não uma medição — ninguém publicou o comportamento de recuperação em contexto longo para um modelo que ninguém fora da Ant pode chamar. Segundo, a geração anterior da Ling tinha exatamente a mesma lacuna entre a janela anunciada e a história arquitetural por trás dela, e a resposta só veio quando os pesos, o formato e os limites de contexto foram finalmente publicados. O 1M destacado é uma promessa. O 1M no Qwen3.8-Flash é um padrão efetivamente servido que permite confrontar a alegação da Ant.
Por que "preview" é a palavra honesta de um lado disso
A própria forma como a Alibaba apresenta o Qwen3.8-Flash é a de que se trata de uma prévia de arquitetura lançada sob um nome de produção — os pesos abertos trazem o sufixo "Next" precisamente para que ninguém confunda o protótipo com o modelo de serviço ajustado. Essa caracterização foi validada por acontecimentos, e não por marketing: a SGLang disponibilizou suporte no dia zero para o Qwen3.8-Flash-Next no dia do lançamento, com o modelo também configurado para Transformers, vLLM e TokenSpeed, e os pesos foram desde então adotados por comunidades de quantização. As versões rapidamente se tornaram comuns, que é o aspeto de um modelo lançado.
O anúncio da Ant tem o mesmo formato, um passo antes: uma publicação de especificação antes do lançamento, com a declaração explícita de que o modelo será disponibilizado como código aberto em breve. Essa é uma forma legítima de lançar — o Ling-3.0-flash seguiu exatamente esse caminho em julho, e os pesos foram publicados sob a licença MIT em 7 de agosto, cerca de duas semanas depois. Mas o estado dos dois projetos hoje não é comparável, e nenhuma leitura de gráficos fecha a lacuna. Vale a pena ser específico sobre o que alguém de fora pode trazer para cada um.
O que é verificável de forma independente para o Ling-3.1-flash hoje: que o anúncio existe e está datado de 30 de setembro; que os números de parâmetros, parâmetros ativos e contexto são da própria Ant; que o modelo aparece no produto Ling Studio da Ant; e que nenhum peso, licença ou model card foi publicado. O que é verificável de forma independente para o Qwen3.8-Flash: que os pesos podem ser baixados em BF16 e FP8; que os termos da licença são legíveis; que o preço da API está publicado; e que as alegações de benchmark da Alibaba estão abertas à reprodução desde o final de agosto. A segunda lista é mais longa, e essa é toda a comparação em miniatura.

Como os dois seriam realmente avaliados
A Ant publicou uma ficha de benchmark com o Ling-3.1-flash que o coloca frente a frente com GPT-5.6 Sol, Claude Opus 5, Kimi K3, duas variantes do GLM e DeepSeek-V4.1-Flash, com números de destaque de 1.673 Elo no GDPVal-AA v2.1, 75,16 no FrontierSWE e 65,35 no HealthBench Professional. Há dois problemas nessa ficha antes mesmo de alguém discutir os números. O primeiro é o conjunto de comparação: ambos os modelos de fronteira que a Ant escolheu estão uma geração atrás, já que Claude Opus 5.5 e GPT-6 Sol entraram no ar em 22 de setembro de 2026 e já são roteáveis agora, o que significa que a ficha avalia um modelo de outubro contra a fronteira de julho, e não contra a atual. O segundo é uma nota de rodapé na própria ficha, afirmando que o resultado no HealthBench Professional veio do "ambiente AQ" e que as capacidades de saúde do modelo atualmente só podem ser experimentadas no AQ — um ambiente que nenhuma documentação pública define. Uma pontuação de destaque cujo ambiente de avaliação não é nomeado não é reproduzível nem em princípio.
Em contrapartida, as alegações comparáveis do Qwen3.8-Flash foram feitas quando os pesos já haviam sido disponibilizados, e a Alibaba apostou seu posicionamento em uma alegação que qualquer pessoa pode testar: que a capacidade vem da taxa de esparsidade, não da contagem de parâmetros. Quatro semanas de uso não são um veredito, mas são tempo suficiente para que as alegações tenham deixado de ser incontestadas — o que é o estado útil para um modelo.
O que realmente fazer com isso, hoje
Para quem desenvolve, a divisão prática é simples. O Ling-3.1-flash não é um componente que você possa adotar esta semana: não há endpoint para chamar, nem pesos para hospedar, nem licença para verificar, nem preço para orçar. Qualquer que seja o modelo final, o movimento útil agora é definir um gatilho — pesos publicados, licença permissiva, uma pontuação independente no FrontierSWE que esteja em algum ponto próximo de 75.16 — e revisitar. A própria história da geração anterior mostra que os pesos podem chegar duas semanas após o anúncio, então esse gatilho pode disparar rapidamente.
O Qwen3.8-Flash já é um componente. Ele está disponível no nosso catálogo como um modelo roteado ao preço de tabela do provedor com markup zero — o card roteado traz $0,15 de entrada, $0,47 de saída e $0,018 por milhão de leituras de cache, os mesmos números que a Alibaba publica, o que é o que uma política de markup 0% significa na prática, e não num slide. Por trás de uma única chave ele fica ao lado de Claude Opus 5, GPT-5.6 Sol e DeepSeek-V4.1-Flash, então a comparação que a Ant está convidando — um candidato contra a fronteira atual — pode ser executada apontando uma config para duas rotas em vez de manter duas integrações, com failover automático cuidando do fim de semana em que um provedor oscila. Essa é a diferença entre uma discussão de arquitetura e um experimento.
O veredito, na medida em que se pode dar um: a Qwen fez a aposta arquitetural mais ousada e teve confiança para publicá-la cedo e deixar as pessoas destrinchá-la. A Ant fez a aposta mais pesada — mais parâmetros, mais computação ativa por token, mais contexto — e até agora publicou um gráfico em vez de um modelo. O gráfico parece bom. O gráfico também é a única coisa que se tem.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
