Cartão de destaque editorial gerado com o título "Ling-3.1-flash vs Ling-3.0-flash" e o subtítulo "Um está disponível para download hoje. O outro é uma frase num post de imprensa." Duas colunas de comparação: "Ling-3.1-flash (anunciado)" lista "~560B no total / ~25B ativos", "contexto de até 1M tokens" e "sem pesos, sem licença"; "Ling-3.0-flash (lançado)" lista "124B no total / 5.1B ativos", "contexto servido de 262.144 tokens" e "pesos MIT no Hugging Face".
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash: o que uma janela de 1M tokens e 4,5x os parâmetros realmente mudam

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A família Ling, da Ant Group, ganhou uma nova camada rápida e, desta vez, sua existência se resume a uma frase. O Ling-3.1-flash foi anunciado em 30 de setembro de 2026 — cerca de 560 bilhões de parâmetros totais, aproximadamente 25 bilhões ativos por token, uma janela de contexto citada em até 1 milhão de tokens e uma frase de praxe anexada: "Pretendemos abrir o código do modelo em breve." O modelo que ele substitui no topo da linha rápida, o Ling-3.0-flash, é um animal diferente em todos os sentidos: 124 bilhões de parâmetros totais, 5,1 bilhões ativos por token, uma janela de contexto servida de 262.144 tokens, pesos licenciados sob MIT no Hugging Face desde 7 de agosto e um índice independente Artificial Analysis Intelligence Index de 20. Um desses modelos você pode baixar hoje. O outro você pode ler a respeito. Compará-los é genuinamente útil, mas só se a comparação começar por aí.

A aritmética das manchetes é fácil e um tanto enganosa. O Ling-3.1-flash tem cerca de 4,5× o número total de parâmetros do Ling-3.0-flash e cerca de 4,9× o número de parâmetros ativos — 25B contra 5,1B por token. Uma leitura casual diz "modelo muito maior, portanto modelo muito mais inteligente". A leitura mais atenta é que a Ant preservou aproximadamente a proporção de esparsidade enquanto escalava o corpo, e o que isso lhe proporciona é capacidade, não necessariamente profundidade de raciocínio por token: um modelo que roteia 25B dos seus 560B por cada token faz mais trabalho por token do que um que roteia 5,1B, mas também paga cerca de cinco vezes a computação por token para isso. Onde essa troca recai depende inteiramente de a arquitetura da Ant lidar com os parâmetros extras de forma eficiente — e essa é uma pergunta que o anúncio não responde.

Os dois modelos, lado a lado

Coloque os fatos publicados lado a lado e as gerações se separam nitidamente. Cada linha abaixo indica o que a Ant ou um avaliador independente tem; quando falta um número, é porque ninguém o publicou.

• Total de parâmetros — Ling-3.1-flash: ~560B (fornecedor). Ling-3.0-flash: 124B (ficha do modelo).

• Parâmetros ativos por token — Ling-3.1-flash: ~25B (fornecedor). Ling-3.0-flash: 5,1B (cartão do modelo).

• Janela de contexto — Ling-3.1-flash: até 1M de tokens (fornecedor). Ling-3.0-flash: 256K nativo, servido em 262.144 (ficha do modelo e receitas de inferência).

• Pesos e licença — Ling-3.1-flash: não publicados; sem repositório, sem licença (verificado em 30 de setembro e novamente em 1º de outubro de 2026). Ling-3.0-flash: MIT, no Hugging Face como inclusionAI/Ling-3.0-flash e no ModelScope desde 7 de agosto de 2026.

• Formatos de peso — Ling-3.1-flash: nenhum disponível. Ling-3.0-flash: BF16 (~255GB) e FP8 (~128GB) do laboratório, além de quants da comunidade.

• Proveniência do benchmark — Ling-3.1-flash: inteiramente relatado pelo fornecedor, sem harness público, sem pesos para reexecutar. Ling-3.0-flash: pontuado independentemente pela Artificial Analysis com um Intelligence Index de 20, com velocidade de saída medida e volume de geração de tokens publicados em conjunto.

• Disponibilidade — Ling-3.1-flash: apenas no produto Ling Studio da própria Ant. Ling-3.0-flash: auto-hospedável, além de poder ser chamado por meio da API para desenvolvedores da Ant.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

Para que serve provavelmente a capacidade extra

A própria descrição de uma linha da Ant sobre o Ling-3.1-flash é a coisa mais informativa no lançamento. O aplicativo Ling Studio o apresenta como "agentes de uso geral, busca, trabalho de escritório rotineiro e desenvolvimento de software/código" — um enquadramento de trabalho de escritório e agêntico, não um enquadramento de benchmark de raciocínio. Isso é consistente com a forma como a família está organizada: Ling é a linha de texto e ferramentas de uso geral, Ring é a linha de raciocínio, e Ming lida com multimodal. Ling-3.0-flash ocupava a mesma posição uma geração antes, e era explicitamente a camada rápida e barata, e não o carro-chefe.

Interprete o aumento de escala sob essa ótica e ele faz sentido. Cargas de trabalho agênticas e com chamadas de ferramentas são longas, repetitivas e famintas por contexto: um único loop de agente pode queimar dezenas de milhares de tokens de saída acumulada de ferramentas antes de tomar uma ação, por isso uma janela de 1M de tokens é um requisito funcional, e não um enfeite de ficha técnica. Aumentar a contagem total de parâmetros enquanto se mantém uma grande fração ativa é como se adiciona conhecimento de mundo e profundidade no seguimento de instruções a um modelo que ainda precisa ser rápido o suficiente para atuar dentro de um loop. A Ant não está construindo aqui um modelo principal mais lento e mais inteligente; está construindo uma camada rápida maior.

O contra-argumento é o custo, e é a mesma aritmética vindo da outra direção. A capacidade extra não é gratuita no momento da inferência — ela é paga em cada token, e a Ant não publicou nenhum preço para o Ling-3.1-flash: nenhuma tabela de preços de API, nenhum desconto de cache, nada comparável aos $0.075/$0.22 por milhão de tokens que a geração anterior lista. Esse é o número que falta que decidiria essa comparação, e ele está faltando.

Benchmarks, e quem os executou

O Ling-3.1-flash chega com três pontuações que parecem fortes isoladamente: 1.673 de Elo no GDPVal-AA v2.1, 75,16 no FrontierSWE e 65,35 no HealthBench Professional. Todas as três são da própria Ant, retiradas do anúncio, e nenhuma foi reproduzida por um laboratório externo. A consequência prática é que elas podem ser comparadas aos números de outros fornecedores, mas não a números independentes — e o Intelligence Index de 20 pontos da Artificial Analysis para o Ling-3.0-flash é um número independente numa escala diferente, pelo que colocá-los lado a lado seria comparar uma medição com uma alegação. Não existe uma página do Ling-3.1-flash na Artificial Analysis no momento em que escrevo.

Uma nota de rodapé no próprio gráfico da Ant merece ser destacada por si só. O cartão afirma que o resultado do HealthBench Professional foi avaliado no "ambiente AQ" e que as capacidades de saúde do Ling-3.1-flash atualmente só podem ser experimentadas no AQ. Nenhuma documentação pública explica o que é o AQ. Uma pontuação de destaque que carrega um qualificador de ambiente não nomeado não é algo que uma equipe externa consiga reproduzir, mesmo depois que os pesos existirem.

Qual deles usar realmente esta semana?

A questão geracional resolve-se de forma diferente consoante aquilo de que precisa hoje e, para quase todos, a resposta neste momento não é o modelo mais recente.

Se você precisa executar algo esta semana, o Ling-3.0-flash é o único dos dois que existe em uma forma utilizável: pesos MIT que você pode auto-hospedar, FP8 se quiser uma pegada menor, preços da API própria publicados e uma pontuação independente que mostra o que você está recebendo. É um modelo genuinamente bom em sua categoria — a avaliação independente o colocou na fronteira de Pareto de pesos abertos para inteligência em relação ao total de parâmetros, e avaliou sua velocidade como alta, com a ressalva de que ele é excepcionalmente prolixo e gerou cerca de 260M tokens durante a avaliação, contra uma mediana perto de 100M.

Se você está planejando os próximos seis meses, o Ling-3.1-flash é a direção a seguir e ainda não é um componente. Os pontos específicos a observar antes que ele se torne um: se os pesos realmente serão abertos e sob qual licença, se a janela servida é genuinamente de 1M ou uma extensão de um contexto nativo mais curto, quanto custa por milhão de tokens, e se um laboratório independente reproduz o 75,16 no FrontierSWE. Qualquer um desses pontos se concretizando seria motivo para refazer a comparação. Nenhum se concretizou.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Onde isso se encaixa em uma pilha de roteamento

Nenhum modelo Ling está no nosso catálogo hoje — Ling-3.0-flash, Ling-3.0-flash-VL e Ling-3.1-flash retornam todos not-found na API de modelos do OrcaRouter, então a resposta honesta a "posso chamá-lo através de vocês" é não, por enquanto. O que uma camada de roteamento realmente oferece de bom numa semana como esta é a outra metade do problema: os modelos com os quais você compararia um candidato. Claude Opus 5, GPT-5.6 Sol e DeepSeek-V4.1-Flash são todas rotas ativas ao preço de tabela do fornecedor, sem margem, e um roteador que os mantém atrás de uma única chave com failover automático é como você mantém um harness de avaliação apontado para um alvo em movimento sem manter quatro integrações. Quando os pesos do Ling-3.1-flash chegarem e a licença for legível, essa também é a forma da decisão: adicionar um endpoint, não reconstruir a stack.

O resumo geracional é curto. O Ling-3.0-flash é um modelo lançado, avaliado de forma independente e com licença permissiva, que se auto-hospeda hoje. O Ling-3.1-flash é uma promessa maior, de contexto mais longo e mais cara de executar, que a Ant ainda não entregou em nenhum formato que um desenvolvedor possa usar. Tratar o segundo como uma atualização do primeiro é o erro que este lançamento convida a cometer, e os números ainda não o sustentam.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".