Ling-3.0-flash: O Que Sabemos Agora Sobre o MoE Rápido de Peso Aberto do Ant Group
Guides & Insights

Ling-3.0-flash: O Que Sabemos Agora Sobre o MoE Rápido de Peso Aberto do Ant Group

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O laboratório InclusionAI do Ant Group lançou oficialmente o Ling-3.0-flash — anunciado em 24 de julho de 2026 e com código aberto sob a licença MIT em 7 de agosto — e o cenário mudou bastante desde a prévia que publicamos aqui em julho. É um modelo nativo de raciocínio híbrido com mistura de especialistas, com 124B de parâmetros totais e apenas 5.1B ativos por token, criado como o nível rápido e barato da família Ling. Os dois números que mudaram tudo: a Artificial Analysis agora o avalia em 38 no Índice de Inteligência (24 pontos acima da geração anterior de nível rápido, o Ling-2.6-flash) e o coloca na fronteira de Pareto de pesos abertos para inteligência versus parâmetros totais. Os pesos estão disponíveis no Hugging Face e no ModelScope.

Quando cobrimos este modelo pela primeira vez em 24 de julho, o resumo honesto era: apenas API, sem pesos, sem declaração de licença, sem benchmark independente. Todas essas quatro afirmações estão agora desatualizadas. A Ant disponibilizou os pesos sob licença MIT em 7 de agosto, e a Artificial Analysis publicou desde então uma avaliação independente completa. Esta atualização revisa o resumo original de acordo — os rótulos “não verificado” que dominaram o post de julho agora se aplicam a um conjunto muito mais restrito de afirmações, principalmente os números de velocidade máxima da Ant, em vez do modelo como um todo.

Resumo.O Ling-3.0-flash é o MoE de pesos abertos de nível rápido do Ant Group: 124B no total / 5,1B ativos, licença MIT, contexto nativo de 256K (262K conforme servido). A Artificial Analysis atribui a ele um Intelligence Index de 38 — 24 pontos acima do Ling-2.6-flash da geração anterior e na fronteira de Pareto de pesos abertos para inteligência versus parâmetros totais — com uma saída medida em cerca de 368 tokens/seg. Os pesos estão no Hugging Face e no ModelScope sob licença MIT. Ainda exclusivos do fornecedor: a alegação de pico de throughput de 1.100+ tokens/seg, o número de tempo para o primeiro token abaixo de 100ms e a tabela de benchmarks do model card. O preço da API de primeira parte é de US$ 0,075 na entrada / US$ 0,22 na saída por 1M de tokens (80% de desconto em cache hits); o nível gratuito de lançamento terminou em 3 de agosto.

Principais conclusões

• É o nível rápido/barato, não o carro-chefe. O carro-chefe de 1T de parâmetros da geração anterior continua sendo o maior modelo da InclusionAI; o Ling-3.0-flash é o irmão menor e mais rápido, voltado para texto de alto volume e chamadas de ferramentas.

• Os pesos agora estão abertos sob MIT. Os pesos foram publicados no Hugging Face (inclusionAI/Ling-3.0-flash) e no ModelScope em 7 de agosto sob a licença MIT — uma reversão do cenário de "somente API" de julho.

• Ele finalmente tem uma pontuação independente. A Artificial Analysis mede um Índice de Inteligência de 38, um aumento de 24 em relação ao Ling-2.6-flash, e coloca o modelo na fronteira de Pareto de pesos abertos para inteligência versus parâmetros totais.

• A velocidade agora é parcialmente medida.AA registra cerca de 368 tokens/seg de saída e um tempo para o primeiro token de ~1,98s; o valor de pico de 1.100+ tokens/seg divulgado pela Ant ainda é apenas informação do fornecedor.

• O preço está definido, e o lançamento gratuito terminou. A API de primeira parte lista US$ 0,075 de entrada / US$ 0,22 de saída por 1M de tokens, com 80% de desconto em cache-hit; o nível gratuito de lançamento terminou em 3 de agosto.

• É uma peça de uma família de três modelos.A InclusionAI divide sua linha em Ling (MoE de texto e ferramentas de propósito geral, este modelo), Ring (raciocínio) e Ming (multimodal).

Uma nota sobre como ler esta atualização:esta é uma revisão da prévia de 24 de julho, escrita depois que os pesos se tornaram públicos e as primeiras pontuações independentes surgiram. Cada especificação, benchmark e preço abaixo é rotulado por fonte. Onde a Ant Group é a única fonte — as alegações de velocidade máxima e a tabela de benchmarks do model card — dizemos isso claramente. Onde a Artificial Analysis mediu algo de forma independente, citamos isso.

O que realmente sabemos

A arquitetura agora está totalmente documentada no model card. O Ling-3.0-flash usa uma stack nativa de atenção híbrida-linear — Kimi Delta Attention (KDA) e camadas Gated MLA alternando em uma proporção de 5:1 (35 KDA + 7 MLA), com gating diagonal de granulação fina no KDA — no topo de um MoE esparso de 1/64 (512 especialistas roteados, 8 ativados por token). É assim que ele alcança 124B de parâmetros totais com apenas 5,1B ativos. A janela de contexto é de 256K nativamente, servida em 262.144 tokens nas receitas de inferência, e a Ant afirma que a arquitetura escala para 1M. O comprimento máximo de saída não é divulgado. O modelo é somente texto com suporte a chamada de ferramentas; a entrada multimodal reside na linha Ming separada.

Dois formatos de pesos são publicados pelo laboratório — BF16 (aproximadamente 255GB) e FP8 (aproximadamente 128GB) — e variantes quantizadas pela comunidade já estão vinculadas no cartão do modelo. As receitas de implantação do próprio laboratório visam SGLang e vLLM.

Disponibilidade: pesos abertos sob MIT

Em 7 de agosto, o time InclusionAI da Ant Group disponibilizou os pesos como código aberto sob a licença MIT no Hugging Face (inclusionAI/Ling-3.0-flash) e no ModelScope. Essa é uma licença permissiva e comercialmente utilizável — a mesma sob a qual Ling 2.0 e Ling 2.6 foram lançados — e significa que você mesmo pode auto-hospedar, fazer fine-tuning e implantar o Ling-3.0-flash, em vez de alugá-lo por meio de uma API. O modelo também pode ser chamado pela própria API de desenvolvedor da Ant e por diversas plataformas terceiras. Para um modelo de nível rápido a esse preço, a questão mais interessante é se vale a pena auto-hospedar (FP8 roda em aproximadamente 128 GB) ou permanecer em uma API.

Pontuações independentes: um Índice de Inteligência AA de 38

A maior mudança em relação ao post de julho é que agora existem números independentes. A Artificial Analysis tem uma página para o Ling-3.0-flash e o mede em 38 no Índice de Inteligência — 24 pontos acima da geração anterior de nível rápido, Ling-2.6-flash (14), e no mesmo nível de MiMo-V2.5 e Qwen 3.6 27B, ativando uma fração dos parâmetros deles. A Artificial Analysis também coloca o modelo na fronteira de Pareto de pesos abertos para inteligência versus parâmetros totais: nenhum modelo de pesos abertos com menos parâmetros totais obtém pontuação maior. O líder de pesos abertos do nível flash na AA, DeepSeek V4 Flash, ainda pontua mais alto (Índice 52 no esforço máximo de raciocínio).

Os resultados agentivos e de contexto longo também são direcionalmente fortes. Na suíte bancária τ3-Bench da AA, o Ling-3.0-flash obtém 27%, o segundo melhor entre os modelos open-weights da camada flash, atrás do DeepSeek V4 Flash (39%). No GDPval-AA v2, ele atinge um Elo de 1108, ante 545 do Ling-2.6-flash. A Ant treinou o modelo em mais de 10.000 ambientes interativos (segundo o fornecedor) e o apresenta como um nó de execução para fluxos de trabalho de agentes — rápido, barato e descartável, deixando o raciocínio pesado para um modelo principal maior.

Uma ressalva sobre a fonte: a tabela de benchmarks no cartão do modelo Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — é relatada pelo fornecedor e ainda não foi reproduzida de forma independente. Trate-a como as próprias afirmações do laboratório, na mesma categoria dos números de velocidade máxima abaixo.

Velocidade: medida, depois alegada.

A história da velocidade agora se divide em duas histórias diferentes. De forma independente, a Artificial Analysis mede aproximadamente 368 tokens/seg de saída e um tempo até o primeiro token de ~1,98s na API oficial — genuinamente rápido para um MoE com 5,1B ativos, e suficiente para classificar o modelo perto do topo da sua classe em velocidade. Separadamente, a Ant Group afirma uma taxa média de saída acima de 1.100 tokens/seg em configurações específicas de GPU e um tempo até o primeiro token abaixo de 100ms com uma camada de cache hierárquica em nível de cluster construída sobre SGLang HiCache e Mooncake. Esse segundo conjunto de números é exclusivo do fornecedor — medido em hardware e configurações de lote que a Ant Group controla, sem nenhuma re-execução independente publicada. Para planejamento, use o valor da AA; trate 1.100+ tok/s como um teto de marketing a ser verificado na sua própria carga de trabalho.

Preço: barato, e a promoção acabou.

A Artificial Analysis lista a API de primeira parte a US$ 0,075 por 1 milhão de tokens de entrada e US$ 0,22 por 1 milhão de saída, com acertos de cache a US$ 0,015 (−80%) — todos os preços definidos pelo fornecedor. O nível gratuito de lançamento (500 mil tokens gratuitos/dia, acesso gratuito à API) terminou em 3 de agosto, e a Ant realizou um período temporário com 75% de desconto em seu Ling Studio até 31 de agosto de 2026, após o qual os preços de tabela se aplicam. Mesmo com o preço de tabela cheio, US$ 0,075/US$ 0,22 coloca o Ling-3.0-flash firmemente na categoria barata para um modelo com um Index de 38.

Com preços tão baixos, o custo de troca importa mais do que o preço por token. A OrcaRouter existe para tornar essa troca barata: uma API para 200+ modelos, preços de tabela dos provedores repassados com margem de 0% e failover automático entre provedores — então, quando um modelo recém-aberto como este parece bom no papel, você pode testá-lo contra sua carga de trabalho real sem um segundo contrato, e voltar para um modelo diferente com a mesma chave se ele entregar abaixo do esperado em uma tarefa específica.

A família Ling / Ring / Ming

Ling-3.0-flash não existe isoladamente — a InclusionAI organiza seus lançamentos em três famílias nomeadas, cada uma voltada para uma função diferente. Ling é a linha MoE de propósito geral para geração de texto cotidiana e chamada de ferramentas, e o Ling-3.0-flash está em sua extremidade rápida/barata, um degrau abaixo do carro-chefe de 1T de parâmetros da geração anterior. Ring é a linha focada em raciocínio, construída para cadeia de pensamento de múltiplas etapas. Ming é a linha multimodal. Se a sua tarefa exige raciocínio mais pesado ou entrada de imagens, o modelo certo da InclusionAI provavelmente não é o Ling-3.0-flash — ele é feito para volume e velocidade dentro do segmento de texto e ferramentas.

Para quem é: três cenários

1. Pipelines de texto ou de chamada de ferramentas de alto volume e sensíveis à latência

Este é o território do modelo. Com um Índice independente de 38, licença MIT e cerca de 368 tok/s medidos, a aposta no nível rápido agora é testável, e não hipotética — você pode rodar seu próprio conjunto de avaliação nele, ou baixar os pesos e fazer self-hosting. Só não projete em torno do teto de 1.100+ tok/s do fornecedor até medir isso na sua carga de trabalho.

2. Equipes que desejam contexto longo com orçamento limitado

Um contexto nativo de 256K (262K servidos) com um caminho declarado para 1M, a $0,075/$0,22, é uma combinação atraente para trabalhos com grande recuperação de informações ou processamento de documentos. Os números de contexto longo no model card são informados pelo fornecedor, portanto, inclua-o na lista de opções em comparação com alternativas consolidadas de contexto longo e verifique-o em seu próprio corpus antes de se comprometer.

3. Observadores acompanhando o panorama de MoE da China e o roteiro da InclusionAI

A pergunta de julho — a InclusionAI continuaria aberta? — agora tem uma resposta: sim, MIT, e rápido. A Ling-3.0-flash chegando à fronteira de Pareto AA com 5,1B de parâmetros ativos é um dado relevante para quem acompanha como os laboratórios chineses estão competindo em eficiência, em vez de contagem bruta de parâmetros.

O que ainda não foi verificado

Uma lista curta, agora que as grandes lacunas foram fechadas. As alegações de velocidade de pico do fornecedor (1,100+ tok/s, TTFT abaixo de 100 ms) não têm medição independente. A tabela de benchmarks da ficha do modelo é fornecida pelo fornecedor. As variantes FP4/INT4 e o caminho de implantação com um único DGX-Spark são declarações do fornecedor. E no quesito conhecimento, o Omniscience Index da AA mostra que a melhoria em relação à geração anterior veio em grande parte por meio da abstenção — as alucinações caíram (97% → 44%) enquanto a precisão subiu apenas levemente (16% → 18%) — portanto, não confunda o salto do índice nas manchetes com um salto de conhecimento geral.

Quando não usá-lo

Pule o Ling-3.0-flash para trabalho multimodal — essa é a linha da Ming. Pule-o se você precisar de um carro-chefe de raciocínio pesado em vez de um executor rápido — essa é a área da Ring. Se você planeja auto-hospedar, reserve orçamento para o hardware real: BF16 é aproximadamente 255GB, FP8 aproximadamente 128GB. E se uma afirmação é importante para você, verifique-a — os números de velocidade de pico e de contexto longo são da Ant até que um laboratório independente os reexecute.

Perguntas Frequentes

O Ling-3.0-flash tem pesos abertos?

Sim. Os pesos foram disponibilizados como código aberto em 7 de agosto sob a licença MIT, no Hugging Face (inclusionAI/Ling-3.0-flash) e no ModelScope. Essa é uma licença permissiva e comercialmente utilizável — a mesma sob a qual o Ling 2.0 e o Ling 2.6 foram lançados.

Como o Ling-3.0-flash se sai em benchmarks?

Artificial Analysis mede um Índice de Inteligência de 38, 24 pontos acima do Ling-2.6-flash, e coloca o modelo na fronteira de Pareto de pesos abertos para inteligência versus parâmetros totais. A tabela de benchmarks na ficha do modelo da Ant (por exemplo, SWE-Bench Pro 56.6) é reportada pelo fornecedor e não foi reproduzida de forma independente.

Quão rápido é realmente?

Artificial Analysis mede aproximadamente 368 tokens/seg de saída, com um tempo até o primeiro token de ~1,98s na API proprietária. Ant afirma um throughput máximo de 1.100+ tokens/seg e TTFT abaixo de 100ms em configurações de GPU especificadas — esses são dados do fornecedor, sem uma nova medição independente.

Quanto custa o Ling-3.0-flash?

AA lista a API própria a $0.075 por 1M de tokens de entrada e $0.22 por 1M de saída, com um desconto de 80% em acertos de cache. A camada gratuita de lançamento terminou em 3 de agosto, e um período temporário de 75% de desconto no Ling Studio está em vigor até 31 de agosto de 2026.

Qual é o tamanho da janela de contexto?

256K nativamente, servido em 262.144 tokens; a Ant afirma que a arquitetura escala para 1M. O comprimento máximo de saída não é divulgado.

Qual é a diferença entre Ling, Ring e Ming?

Ling é a linha MoE de propósito geral para texto e chamada de ferramentas da InclusionAI, e Ling-3.0-flash fica em sua extremidade rápida/barata. Ring é a linha focada em raciocínio. Ming lida com tarefas multimodais. São famílias separadas para diferentes trabalhos, não níveis de um único modelo.

O Ling-3.0-flash é o mesmo que o carro-chefe 1T anterior?

Não. O Ling-3.0-flash é a versão mais nova e menor do nível rápido (124B total / 5.1B ativos). O carro-chefe de 1T de parâmetros da geração anterior continua sendo o modelo maior.

Devo usar o Ling-3.0-flash em produção hoje?

Mais defensável do que era em julho, agora que há uma pontuação independente e uma licença MIT. Execute seu próprio conjunto de avaliação primeiro, verifique as alegações de velocidade do fornecedor em relação à sua carga de trabalho e decida entre a API e o self-hosting (FP8 roda em aproximadamente 128GB). Os números restantes, exclusivos do fornecedor, são limitados o suficiente para planejar em torno deles.

Conclusão

O Ling-3.0-flash evoluiu de “ficha técnica e alegações do fornecedor” para “peso aberto e pontuação independente” em duas semanas. Um AA Intelligence Index de 38 com 5,1B de parâmetros ativos — na fronteira de Pareto de pesos abertos, licenciado sob MIT, a US$ 0,075/US$ 0,22 — faz dele um dos modelos de peso aberto mais eficientes disponíveis no momento, e um que você mesmo pode executar. As ressalvas são menores do que antes: os números de velocidade de pico e da ficha técnica do modelo ainda são da Ant, até que um laboratório independente os reproduza. Para texto de alto volume e chamada de ferramentas a esse preço, ele merece uma avaliação real.