Cartão de destaque editorial gerado com o título "Ling-3.1-flash: anunciado, mas não aberto" e o subtítulo "~560B de parâmetros totais · ~25B ativos por token · contexto de até 1M". Três cartões rotulados dizem "Pesos: ainda não disponibilizados", "Benchmarks: apenas reportados pelo fornecedor" e "Sem licença · sem model card · sem download".
Guides & Insights

Ling-3.1-flash é anunciado, mas não é aberto: ~560B parâmetros, um contexto de 1M tokens e um gráfico que só a Ant rodou

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A equipe Ling, do Ant Group, divulgou números do seu próximo modelo de camada rápida em 30 de setembro de 2026 e, na mesma frase, disse que você ainda não pode tê-lo. O Ling-3.1-flash é um modelo de mistura de especialistas com cerca de 560 bilhões de parâmetros, que ativa aproximadamente 25 bilhões de parâmetros por token e possui uma janela de contexto de até 1 milhão de tokens, de acordo com o anúncio do modelo que a Ant publicou em sua própria conta @AntLingAGI. A frase que define este lançamento é a que vem logo após as especificações: "Pretendemos tornar o modelo open-source em breve". Até hoje, não há repositório do Ling-3.1-flash no Hugging Face, nem licença, nem arquivo de pesos para download, nem avaliação de qualquer pessoa fora do Ant Group. O que existe é um gráfico de benchmark, uma superfície de produto ativa e uma promessa.

Essa distinção é a história inteira, e vale a pena ser franco sobre isso, porque o enquadramento que chega primeiro à maioria das pessoas — um lançamento de pesos abertos de classe 500B vindo da China que fica perto da fronteira — descreve algo que não aconteceu. O Ling-3.1-flash não é um lançamento aberto. É um lançamento anunciado. As duas coisas não são próximas, e a diferença entre elas é exatamente onde um leitor pode se queimar: se você planeja capacidade, orça um piloto ou escreve uma nota de aquisição em torno de pesos abertos que ainda não existem, você está planejando com base em um comunicado à imprensa.

O que o anúncio realmente contém

O post é curto e os números nele são específicos. A Ant declara uma contagem total de parâmetros de cerca de 560 bilhões contra aproximadamente 25 bilhões ativos por token, uma proporção próxima de 1 em 22, marginalmente mais densa do que a geração Ling-3.0-flash a que sucede — esse modelo opera com 124B no total contra 5,1B ativos, cerca de 1 em 24, em um corpo com menos de um quarto do tamanho. O contexto é citado como "até 1M tokens", quatro vezes a janela de 262.144 tokens que a família Ling-3.0-flash atende hoje. Três pontuações de destaque são anexadas: 1.673 Elo no GDPVal-AA v2.1, 75,16 no FrontierSWE e 65,35 no HealthBench Professional.

Todos esses números são informados pelo fornecedor, de origem primária e não publicados em nenhum formato que terceiros possam reexecutar. Não há estrutura de avaliação, nem conjunto de prompts, nem configuração de execução, nem seed — e, mais fundamentalmente, nem pesos para executá-los. Se os números da Ant estiverem certos, o modelo está no primeiro escalão dos lançamentos chineses de modelos abertos; atualmente, não há como descobrir se eles estão certos.

O gráfico, e a ressalva embutida nele

Ant Group's own Ling-3.1-flash benchmark card, published from the @AntLingAGI account on 30 September 2026. Multi-panel bar charts compare Ling-3.1-flash against GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3 and GLM 5.3 Flash, and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states that HealthBench Professional was evaluated in the AQ environment.

A Ant publicou o Ling-3.1-flash juntamente com um cartão de benchmark com vários painéis que o coloca num campo de modelos de fronteira e quase-fronteira: GPT-5.6 Sol, Claude Opus 5, Kimi K3, duas entradas da família GLM e DeepSeek-V4.1-Flash. Ao longo dos painéis, a barra do Ling situa-se no topo ou perto dele nas métricas agênticas e de codificação, e a meio da tabela nas de multi-turno e específicas de domínio. Leia-o pelo que é — a própria seleção de tarefas do fornecedor, retirada de um conjunto que inclui trabalho de agente de uso geral, codificação, tarefas do domínio bancário e saúde — e é um cartão com aparência credível.

Olhe, no entanto, quem está na ficha, e uma coisa salta à vista. Os pares de fronteira que a Ant escolheu são GPT-5.6 Sol e Claude Opus 5. Ambos esses modelos já estão uma geração atrás. Opus 5.5 e GPT-6 Sol entraram no ar em 22 de setembro de 2026, no mesmo dia, e ambos podem ser roteados hoje. Os modelos mais recentes que a Ant não colocou na ficha são exatamente aqueles com os quais um leitor gostaria de vê-lo medido, o que é a mesma reclamação que surgiu na primeira onda de comentários sobre o lançamento — o desejo de que um modelo que chega em outubro tivesse sido avaliado por benchmark contra a fronteira de outubro, e não a de julho. Isso não é uma crítica ao modelo, que pode muito bem se sustentar. É um motivo para tratar a ficha como uma afirmação indicativa, e não como um veredito, e para notar que a comparação que a Ant escolheu favorece o resultado menos do que o torna datado.

Onde você pode tocá-lo, e uma nota de rodapé inexplicada

Há exatamente um lugar onde o Ling-3.1-flash roda para um usuário hoje: o próprio produto da Ant. A interface do Ling Studio em ling.tbox.cn lista o Ling-3.1-flash em seu seletor de modelos, e a descrição do modelo feita pelo próprio app é mais ampla do que a ficha de benchmark — ela o posiciona para "agentes de uso geral, busca, trabalho de escritório rotineiro e desenvolvimento de software/código", que é o posicionamento familiar para esse nível: não o raciocinador mais profundo da família, mas aquele feito para ser chamado constantemente e a baixo custo.

Essa superfície também carrega o detalhe mais desconfortável do lançamento. A própria nota de rodapé do cartão do benchmark diz que o HealthBench Professional — o valor de 65,35, um dos três números no texto do anúncio — foi “avaliado no ambiente AQ”, e acrescenta que as capacidades de saúde do Ling-3.1-flash “atualmente só podem ser experimentadas no AQ”. Nada no cartão explica o que é AQ, e nenhuma documentação pública que conseguimos encontrar o define. Uma pontuação de manchete com um qualificador de ambiente anexado, em que o ambiente não tem nome, não é um resultado reproduzível; é uma demonstração de produto com um número ao lado.

O que é cognoscível, e o que não é

Classificar este lançamento nessas duas categorias é a coisa mais útil que um leitor pode fazer com ele hoje.

O que é possível saber agora: os parâmetros, a contagem de parâmetros ativos e a janela de contexto conforme declarados pelo fornecedor; os três benchmarks do fornecedor; a existência do modelo no próprio produto da Ant; o conjunto de comparação que a Ant selecionou; o fato de que não houve publicação de pesos, licença ou model card; e o fato de que a Artificial Analysis, que avaliou de forma independente a geração anterior, não tem uma página do Ling-3.1-flash. Até o momento em que escrevo, o pipeline independente de pontuação que tornou legível o valor de 20 pontos do Intelligence Index do Ling-3.0-flash não publicou absolutamente nada sobre o 3.1.

Não dá para saber agora: se os pesos serão realmente abertos, e sob qual licença; se a arquitetura é uma versão ampliada da pilha híbrida Ling-3.0 ou algo novo; quanto o modelo custa pela API da Ant, se é que tem um preço de API; como ele se comporta em contexto longo na prática, em oposição a como a janela é especificada; e se as lacunas de benchmark se sustentam quando alguém que não é da Ant executa as mesmas tarefas. Cada uma dessas é uma pergunta que um modelo lançado responde no primeiro dia e que um modelo anunciado responde em algum dia posterior que ainda não foi agendado.

Generated two-column information card. Left column headed "Knowable today" lists five cards: "~560B total / ~25B active (vendor)", "up to 1M-token context (vendor)", "1,673 Elo GDPval-AA v2.1 (vendor)", "available in Ant's Ling Studio only" and "no independent score exists". Right column headed "Not knowable" lists five cards: "whether the weights will open", "the licence terms", "API price per million tokens", "long-context behaviour in practice" and "whether the benchmark gaps hold".

Como ler um dia como este

O padrão agora é comum o bastante para receber um nome. Um laboratório chinês com um histórico sólido lança um model card e um gráfico de benchmark, os números chegam perto da fronteira, a comunidade reage aos números, e os pesos chegam — ou não — semanas depois. O Ling-3.0-flash executou exatamente essa jogada neste verão, e vale lembrar como isso se resolveu: a Ant o anunciou em 24 de julho de 2026 como um modelo apenas de API, sem declaração de licença e sem benchmark independente, e os pesos sob a licença MIT só apareceram no Hugging Face em 7 de agosto, duas semanas após o anúncio. O Ling-3.1-flash está no ponto equivalente dessa trajetória no primeiro dia, com a diferença adicional de que, desta vez, a promessa de código aberto é explícita no anúncio, em vez de inferida.

Nenhum dos modelos que a Ant escolheu como pontos de comparação está no nosso catálogo como assunto da matéria — Ling-3.1-flash, Ling-3.0-flash e Ling-3.0-flash-VL retornam todos not-found no catálogo OrcaRouter hoje, e não vamos fingir o contrário. Mas três dos pares naquele gráfico são roteáveis neste momento: Claude Opus 5, GPT-5.6 Sol e DeepSeek-V4.1-Flash estão todos atrás de uma única chave, pelo preço de tabela do provedor, sem nenhum acréscimo, com failover automático entre eles. Isso importa mais do que parece numa semana como esta, porque a maneira honesta de avaliar um modelo anunciado é fazer a comparação que a Ant está convidando a fazer — com os modelos que você realmente pode chamar — enquanto o objeto da comparação ainda é um gráfico.

Quando os pesos chegarem, a pergunta útil não será se o Ling-3.1-flash superou o Opus 5 em uma única pontuação Elo. Será se um MoE de ~560B com ~25B ativos consegue sustentar um contexto de 1M de tokens a um preço que faça a esparsidade valer a pena, e se a licença é permissiva o suficiente para auto-hospedagem. Essas são as duas perguntas que o anúncio não responde, e são as únicas que vão decidir se isto se torna um modelo sobre o qual as pessoas constroem ou um slide na próxima apresentação de alguém. Por enquanto: o nome é real, os números são só da Ant, e os pesos ainda são uma frase.

Generated horizontal timeline with four milestone nodes. "Jul 24, 2026 — Ling-3.0-flash announced, API-only, no weights, no licence"; "Aug 7, 2026 — MIT weights land on Hugging Face, 14 days later"; "Sep 30, 2026 — Ling-3.1-flash announced: ~560B, ~25B active, 1M context"; and a dashed open node reading "Weights: not yet — 'we plan to open-source soon'", captioned "the same point in the same arc, on day one".