Cartão de título principal para 'Ling-3.1-flash atinge 41 no AA Intelligence Index', com o subtítulo '560B no total / 25B ativos de MoE da Ant Group'. Um cartão arredondado grande traz o número '41' com o rótulo 'Artificial Analysis Intelligence Index v4.3.2'; abaixo dele, um segundo cartão pequeno exibe 'vs 20' com o rótulo 'Ling-3.0-flash'. Uma linha de rodapé diz 'Índice medido de forma independente pela Artificial Analysis; modelo lançado em 2026-10-01.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Ling-3.1-flash Atinge 41 no Artificial Analysis Intelligence Index: O MoE de 560B Dobra o Desempenho do seu Antecessor

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ling-3.1-flash, o mixture-of-experts de 560 bilhões de parâmetros da Ant Group, agora carrega um número que seu próprio laboratório não escreveu: 41 no Artificial Analysis Intelligence Index. O índice é executado pelo avaliador independente, em hardware controlado pelo avaliador, contra uma suíte fixa — e coloca o modelo 21 pontos acima de seu predecessor direto, Ling-3.0-flash, que ainda está em 20 no mesmo índice. A Ant anunciou o Ling-3.1-flash no final de setembro de 2026, a Artificial Analysis data o lançamento em 1º de outubro, e ele é três meses mais jovem que o modelo cuja pontuação ele dobra.

Essa lacuna é a história. Uma variação de 21 pontos em um índice composto alimentado por dez avaliações diferentes não é o tipo de coisa que um gráfico de fornecedor consegue falsificar, e não é o tipo de coisa sobre a qual este blog poderia ter escrito duas semanas atrás, quando a única medição existente de Ling-3.1-flash era o próprio cartão de benchmark da Ant: 1.673 Elo no GDPval-AA v2.1, 75,16 no FrontierSWE, 65,35 no HealthBench Professional. Esses números eram alegações reais de um laboratório real, mas não reproduzidos. O 41 é de outra natureza. É o primeiro número neste lançamento que um terceiro pode ser obrigado a comprovar.

O que o 41 realmente mede

O Artificial Analysis Intelligence Index v4.3.2 é um composto ponderado de dez avaliações: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Ler um composto isoladamente é um erro, então as linhas por avaliação importam mais do que o resultado principal:

• GDPval-AA — 1.621,75 para o Ling-3.1-flash, contra 948,35 para o Ling-3.0-flash. Este é o maior salto único do conjunto e aquele em que assenta a maior parte do movimento do índice.

• GDP.pdf — 0,100 de aprovação total, acima de 0,054. Ainda baixo em termos absolutos, mas quase o dobro.

• raciocínio de contexto longo do AA-LCR v1.1 — 0,83 contra 0,73 do antecessor, e em linha com DeepSeek V4.1 Flash (Max) a 0,84.

• SciCode — 0,541 contra 0,420. Um ganho em ciência de programação, não um ganho de qualidade de chat.

• Raciocínio de física do CritPt — 0,180, contra 0,017 antes. Dez vezes o antecessor em uma base pequena.

• AA-Omniscience — +2,22, contra −17,88 de Ling-3.0-flash. Este é discutido abaixo, porque contraria a manchete.

O Ling-3.0-flash não apenas perdeu para o Ling-3.1-flash nessas linhas; ele colapsou em duas delas. Obteve 0,032 no AutomationBench-AA e exatamente 0,000 no Terminal-Bench 4.0. É nesse contexto que o 41 deve ser lido — o antecessor era um modelo eficiente, barato e de pesos abertos que, essencialmente, não tinha nenhuma capacidade agêntica de terminal.

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

De onde veio o ganho: trabalho de agente, não conversa

Compare as contribuições de índice do Ling-3.1-flash com as dos dois modelos do nível Flash ao lado dos quais ele é mais frequentemente colocado, e surge um padrão que o agregado esconde. O DeepSeek V4.1 Flash (Max) registra 39 no mesmo índice e o GLM 5.3 Flash registra 42, então os três ficam dentro de uma faixa de três pontos. Mas chegam lá partindo de lugares diferentes.

• Trabalho agêntico no terminal — Ling-3.1-flash 0,333 no Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0,268, GLM 5.3 Flash 0,328.

• Trabalho agêntico no mundo real — Ling-3.1-flash 1.621,75 Elo no GDPval-AA, DeepSeek V4.1 Flash (Max) 1.600, GLM 5.3 Flash 1.646,86.

• AutomationBench-AA — Ling-3.1-flash 0,617, DeepSeek V4.1 Flash (Max) 0,689, GLM 5.3 Flash 0,604.

• Ciência da codificação — Ling-3.1-flash 0,541 no SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.

A leitura restrita é que o Ling-3.1-flash é competitivo em benchmarks agênticos e ligeiramente à frente no SciCode. A leitura útil é que ele é o mais forte dos três nas duas medidas de terminal agêntico que a maioria das pessoas quer dizer quando afirma "ele consegue conduzir um loop de ferramentas" — e está atrás dos dois na medida de confiabilidade de conhecimento. Essa é uma forma específica, não uma vitória geral, e vale a pena nomeá-la antes que alguém compre uma carga de trabalho apenas pelo número do índice.

A fatura que vem com um modelo maior

O Ling-3.0-flash tinha preço de US$ 0,07 por milhão de tokens de entrada e US$ 0,22 por milhão de tokens de saída na API própria da Ant, e era de pesos abertos sob a MIT. O Ling-3.1-flash ainda não é nenhuma dessas coisas. O Artificial Analysis registra seu custo de execução em US$ 0,30 por milhão de entrada e US$ 0,90 por milhão de saída — com uma taxa de acerto de cache de US$ 0,06, um desconto de 80% sobre a entrada — medido em relação à API própria da InclusionAI como provedora de serviço. Isso é aproximadamente um aumento de quatro vezes no preço de entrada em relação ao modelo que ele substitui, para um ganho de 21 pontos no índice.

Se essa troca é boa depende inteiramente da carga de trabalho; o próprio índice pode precificá-la: executar todos os dez Index contra o Ling-3.1-flash custa cerca de US$ 960 a essas tarifas, contra aproximadamente US$ 477 para o DeepSeek V4.1 Flash (Max) e US$ 280 para o GLM 5.3 Flash. O motivo não é apenas a tabela de preços. O Ling-3.1-flash é um raciocinador muito tagarela — ele consumiu 220 milhões de tokens de saída ao longo do índice, bem acima da mediana de sua faixa de preço, e suas execuções de avaliação levam em média cerca de 357 segundos por tarefa, contra 285 segundos do DeepSeek V4.1 Flash (Max) e 979 segundos do GLM 5.3 Flash. Por tarefa, o Ling-3.1-flash custa cerca de US$ 0,99, contra US$ 0,27 do DeepSeek e US$ 0,25 do GLM 5.3 Flash.

Nada disso é visível da 41, e tudo isso acaba na fatura. Um modelo pode ganhar um índice e perder um orçamento.

Os dois números que discordam da manchete

A primeira é a confiabilidade do conhecimento. O Ling-3.1-flash pontua +2,22 no AA-Omniscience, que mede se um modelo sabe o que sabe: respostas corretas ganham pontos, alucinações custam pontos e recusas não custam nada. Sua taxa de precisão é de 29,1% e sua taxa de alucinação é de 37,9%. Colocado ao lado de seus congêneres, esse é o perfil mais fraco do grupo — o GLM 5.3 Flash pontua +7,47 com uma taxa de alucinação de 27,6%, e o DeepSeek V4.1 Flash (Max) pontua −5,30 com uma taxa impressionante de 96,5% de alucinação entre as perguntas respondidas. A pontuação composta recompensa o Ling-3.1-flash pela capacidade que ele demonstra, não pela confiabilidade com que a demonstra, e um modelo que inventa um terço do que afirma precisa de mecanismos de recuperação ao seu redor em produção.

O segundo é o contexto. A Artificial Analysis lista o Ling-3.1-flash com uma janela de contexto de 1.000.000 de tokens. O próprio material de lançamento da Ant também cita 1M como a meta. Mas a documentação para desenvolvedores da Ant, que enumera as janelas da família modelo por modelo, atribui ao Ling-3.0-flash uma janela nativa de 256K extensível para 1M e ainda não traz nenhuma entrada para o Ling-3.1-flash. A linha distinta de contexto longo que de fato foi medida — AA-LCR em 0,83 — é uma pontuação de raciocínio sobre contexto longo, não uma medição da janela efetivamente servida. Trate 1M como o teto declarado e valide a janela entregue com sua própria solicitação de contexto longo antes de projetar com base nela.

Como se compara na ficha de especificações

O quadro dimensão por dimensão, primeiro o sujeito, em cada linha:

• Parâmetros totais — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.

• Parâmetros ativos por token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. O Ling-3.1-flash é o que mais ativa, e essa é uma das razões pelas quais seu custo de serving está onde está.

• Pesos e licença — Ling-3.1-flash não publicados (proprietário, sem texto de licença) vs. DeepSeek V4.1 Flash (Max) aberto sob MIT vs. GLM 5.3 Flash aberto sob MIT.

• Contexto declarado — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Todos os três alegam o mesmo teto; apenas dois deles têm um checkpoint baixável com o qual você poderia verificá-lo.

• Modalidade — Ling-3.1-flash com entrada de texto e saída de texto vs. DeepSeek V4.1 Flash (Max) com entrada de texto e imagem vs. GLM 5.3 Flash com entrada de texto, imagem e vídeo. Este é o único eixo em que o Ling-3.1-flash simplesmente fica atrás, e nenhuma linha de benchmark compensa isso.

• Preço na API do fornecedor — Ling-3.1-flash $0,30 / $0,90 por milhão de entrada / saída vs DeepSeek V4.1 Flash (Max) $0,30 / $1,20 vs GLM 5.3 Flash $0,15 / $0,50.

• Pontuação do índice — 41 vs 39 vs 38. Três pontos de variação em uma comparação tripla é um ranking; é um empate definido por qual avaliação a carga de trabalho do leitor por acaso se assemelha.

Onde você pode chamá-lo

O Ling-3.1-flash não está hoje no catálogo do OrcaRouter — uma consulta à nossa API pública de modelos para o modelo da InclusionAI retorna not-found, e não vamos insinuar o contrário. Atualmente, ele roda na própria API da Ant e em plataformas de terceiros que trazem o lançamento, que é a extensão honesta de sua disponibilidade. O que vale notar para quem compara os três modelos acima é que os outros dois são roteáveis agora mesmo: DeepSeek V4.1 Flash e GLM 5.3 Flash estão ambos no catálogo do OrcaRouter pelos preços de tabela de seus provedores com zero markup, atrás de uma única chave de API, com failover automático entre eles. Se a comparação acima indica que sua carga de trabalho se importa mais com a confiabilidade do conhecimento do que com trabalho de terminal agêntico, o GLM 5.3 Flash é o que vale experimentar — e você pode testá-lo contra o DeepSeek V4.1 Flash na mesma chave, sem um segundo contrato ou uma linha de código de cliente novo.

O que o 41 muda, e o que não muda

O que isto muda é a posição do lançamento. O Ling-3.1-flash já não é uma especificação com um gráfico de fornecedor anexado; é um modelo com uma posição medida de forma independente, e essa posição é um verdadeiro salto geracional em capacidade agêntica em relação ao Ling-3.0-flash — o tipo de salto que resulta de uma mudança de design e não de mais poder computacional na mesma receita. O que não muda é nada relacionado com a aquisição. Os pesos continuam fechados, a licença continua por escrever, a modalidade continua a ser apenas texto, e o preço é cerca de quatro vezes o do seu predecessor para um ganho que está concentrado em tarefas de agente e de terminal.

Se o seu trabalho envolve ciclos de agentes, acionamento de ferramentas e longas cadeias de ferramentas, o 41 é o número mais significativo divulgado sobre este modelo até agora e merece uma análise séria enquanto a disponibilidade ainda está a expandir-se. Se o seu trabalho é multimodal, ou resposta a perguntas críticas em termos de conhecimento, ou inferência de alto volume sensível ao orçamento, o 41 não chega ao seu problema — e o GLM 5.3 Flash, já roteável e já aberto sob a licença MIT a metade do preço de saída, é o modelo mais bem posicionado dos três. O índice diz-lhe onde o Ling-3.1-flash se situa. Não lhe diz se deve importar-se, e essa questão é respondida pelo que está a construir.

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente