
Ling-3.0-flash: O que realmente sabemos sobre o novo Fast-Tier MoE da Ant Group (e o que não sabemos)
- qwenNOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligência69Código
- qwenNOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 199 tok/s
- orcaNOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOVOAnthropic: Claude Opus 52026-07-2461Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligência77Código
- grokxAI: Grok 4.52026-07-0854Inteligência72Código
- tencentTencent: Hy32026-07-0641Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
- z-aiZ.ai: GLM 5.22026-06-1651Inteligência69Código60Matemática
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligência61Código61Matemática
Ant Group's laboratório InclusionAI lançou o Ling-3.0-flash em ou por volta de 23 de julho de 2026 — o que significa que tem apenas alguns dias a partir desta nota. É um modelo de linguagem mixture-of-experts (MoE) com 124B de parâmetros totais e aproximadamente 5,1B ativos por token (cerca de uma razão de esparsidade de 24:1), criado para geração de texto e chamada de ferramentas. Ele é posicionado como a camada rápida e barata da família Ling; o posto principal ainda pertence ao muito maior Ling-2.6-1T (1T total / 63B ativos). O acesso hoje é apenas via API — através do portal de desenvolvedor da Ant, pelo OpenRouter como inclusionai/ling-3.0-flash, e pelo ZenMux.
Esse é o quadro completo confirmado, e vale a pena ser franco sobre por que este resumo parece mais cauteloso do que um artigo típico de modelo. Não há pesos do Hugging Face, nenhum repositório no GitHub para o Ling-V3 e nenhuma declaração de licença clara — uma mudança real em relação ao Ling 2.0 e Ling 2.6, ambos lançados como pesos abertos sob MIT. Também não há dados independentes de benchmark de qualquer tipo: a Artificial Analysis, o avaliador terceirizado mais citado para essa classe de modelo, ainda não tem uma página para ele. Todo número de desempenho e velocidade em circulação no momento remonta ao próprio Ant Group.
TL;DR.Ling-3.0-flash é um modelo MoE de 124B/5.1B ativos da InclusionAI do Ant Group, lançado nos últimos dias, apenas API sem pesos do Hugging Face e licença não confirmada. As afirmações do fornecedor — pico de throughput de 1000 tokens/seg, tempo até o primeiro token inferior a 100ms — ainda não têm verificação independente, e não há pontuação do Artificial Analysis para este modelo específico. A geração anterior Ling-2.6-flash obteve um Artificial Analysis Intelligence Index de apenas 14 (Ling-2.6-1T obteve 26), o que é um contexto útil, mas não substitui a capacidade real do 3.0-flash. O preço (¥0.40 entrada / ¥1.20 saída por 1M tokens, atualmente gratuito durante a semana de lançamento com 500k tokens gratuitos/dia) é explicitamente promocional e provavelmente mudará. Trate tudo aqui como uma prévia, não um veredito.
Principais conclusões
• É o nível rápido/barato, não o carro-chefe.Ling-2.6-1T continua sendo o maior modelo da InclusionAI; Ling-3.0-flash é um irmão menor, mais barato e mais rápido, voltado para uso de alto volume.
• Ainda não existe nenhum benchmark independente. Artificial Analysis não tem uma página para Ling-3.0-flash. Os únicos números públicos são os do próprio Ant Group, e a documentação da Ant atualmente não mostra nenhuma tabela de benchmark para este modelo.
• Alegações de velocidade são exclusivas do fornecedor. Pico de 1000 tokens/s e tempo até o primeiro token inferior a 100ms vêm do Ant Group, sem nenhum teste de throughput de terceiros para confirmar qualquer um dos números.
• Sem pesos abertos, licença não confirmada. Não há repositório no Hugging Face e nenhum projeto Ling-V3 no GitHub. As gerações anteriores do Ling eram licenciadas sob MIT; se o 3.0-flash seguirá o mesmo é desconhecido.
• O preço é uma promoção da semana de lançamento.¥0,40/¥1,20 por 1 milhão de tokens na plataforma da Ant está atualmente dispensado, com 500 mil tokens grátis por dia e uma listagem gratuita no OpenRouter — nenhuma dessas condições deve ser considerada como garantida após o fim da promoção.
• É uma peça de uma família de três modelos.A InclusionAI divide sua linha em Ling (MoE de uso geral, este modelo), Ring (focado em raciocínio) e Ming (multimodal).
Uma nota sobre como ler este resumo:cada especificação, benchmark e preço abaixo é rotulado por fonte. Onde Ant Group é a única fonte, dizemos isso claramente e fazemos as devidas ressalvas. Onde modelos Ling de geração anterior têm pontuações independentes, nós os citamos como contexto — não como substituto para dados sobre o próprio Ling-3.0-flash, que ainda não existem. Isso provavelmente precisará de um acompanhamento assim que os testes independentes alcançarem.
O que realmente sabemos
Arquiteturalmente, o Ling-3.0-flash é um modelo MoE esparso: 124B parâmetros no total, com aproximadamente 5,1B ativos em qualquer token dado, o que o torna barato e rápido de executar em relação ao seu tamanho total. A janela de contexto é de 256K tokens de acordo com a própria documentação da Ant, com uma alegação do fornecedor de que pode ser estendida para 1M; a listagem do OpenRouter mostra 262.144 tokens, o que se alinha com o número de 256K. O comprimento máximo de saída não é divulgado em nenhum lugar que pudéssemos encontrar. O modelo suporta geração de texto padrão e chamada de ferramentas, mas nenhuma entrada ou saída multimodal foi mencionada — essa capacidade está na linha Ming separada.
Em termos de disponibilidade, o cenário é exclusivamente via API e consistente nas três rotas que encontramos: a própria plataforma de desenvolvedores da Ant Group, o OpenRouter (listado como inclusionai/ling-3.0-flash) e o ZenMux. Nenhuma delas expõe pesos baixáveis. Não há uma página de organização no GitHub para um projeto "Ling-V3", e a documentação da Ant não informa uma licença para este modelo específico — uma lacuna significativa, já que o Ling 2.0 e o Ling 2.6 foram ambos lançados como pesos abertos sob MIT. Até que a InclusionAI esclareça isso, não presuma que o Ling-3.0-flash será aberto, e não presuma que não será.

As lacunas: o que não está verificado
A maior lacuna são os benchmarks. No momento em que escrevo, a Artificial Analysis — a avaliadora independente mais comumente citada exatamente para essa classe de modelo — não possui página para o Ling-3.0-flash; o padrão de URL que normalmente a hospedaria retorna um 404. Isso significa que atualmente não há pontuação de raciocínio, codificação ou matemática de terceiros para este modelo, da Artificial Analysis ou de qualquer outra avaliadora independente que conseguimos localizar. A própria documentação da Ant agrava isso: ela não publica uma tabela de benchmarks para o 3.0-flash, seja do fornecedor ou de outras fontes, o que é incomum para um lançamento de modelo e merece ser destacado por si só.
Para contexto geral, os modelos anteriores da Ling possuem pontuações independentes. O Ling-2.6-flash obteve um Índice de Inteligência Artificial Analysis de 14, e o maior Ling-2.6-1T alcançou 26 — ambos muito atrás dos principais modelos de peso aberto monitorados pela Artificial Analysis na época. Os próprios valores fornecidos pela Ant para o Ling-2.6-flash afirmavam 61,2% no SWE-bench Verified e 73,85% no AIME2026. Nenhum desses números deve ser atribuído diretamente ao Ling-3.0-flash; uma nova geração com uma nova arquitetura pode se mover em qualquer direção, e até que um avaliador independente o teste de fato, qualquer afirmação de capacidade para o 3.0-flash é um palpite travestido de fato.
Alegações de velocidade do fornecedor: rápido no papel, não verificado na prática.
O principal argumento de desempenho do Ant Group para o Ling-3.0-flash não é a qualidade de raciocínio — é a velocidade bruta. O fornecedor alega uma taxa de transferência máxima de 1000 tokens por segundo e um tempo até o primeiro token abaixo de 100 milissegundos, ambos genuinamente rápidos se confirmados. Mas "se confirmados" está fazendo um trabalho real nessa frase: esses números vêm exclusivamente dos próprios materiais do Ant Group, medidos sob condições que o Ant controla e não divulgou totalmente (hardware, tamanho do lote, comprimento do prompt e carga movem os números de taxa de transferência substancialmente). Nenhum laboratório independente publicou uma nova medição. Até que alguém fora do Ant execute um teste comparável, trate 1000 tok/s e TTFT abaixo de 100ms como números de marketing que valem a pena verificar em sua própria carga de trabalho, não fatos estabelecidos.

Precificação, e por que é um alvo móvel
Na própria plataforma do Ant Group, o preço de tabela para o Ling-3.0-flash é ¥0,40 por 1M de tokens de entrada e ¥1,20 por 1M de tokens de saída — barato por design, consistente com seu posicionamento como a camada rápida/barata. Mas esse preço de tabela não é o que ninguém está pagando agora: a Ant está realizando uma promoção gratuita de lançamento na primeira semana e, separadamente, oferece 500 mil tokens gratuitos por dia em sua plataforma. A listagem do OpenRouter mostra uma variante ling-3.0-flash:free a $0/$0. Nada disso deve ser confundido com um preço estável. Promoções de lançamento expiram, camadas gratuitas têm limite, e os próprios valores de ¥0,40/¥1,20 podem mudar quando os dados reais de uso forem obtidos. Se você está planejando gastos de produção em torno deste modelo, faça o orçamento com base no preço de tabela, não no promocional, e verifique novamente antes de se comprometer.
A família Ling / Ring / Ming
Ling-3.0-flash não existe isoladamente — a InclusionAI organiza seus lançamentos em três famílias nomeadas, cada uma voltada para uma tarefa diferente. Ling é a linha MoE de propósito geral, cobrindo geração de texto cotidiana e chamada de ferramentas; Ling-3.0-flash fica no extremo rápido/barato dessa linha, com Ling-2.6-1T ainda sendo o principal modelo de maior porte. Ring é a linha focada em raciocínio da InclusionAI, construída para tarefas que dependem de cadeia de pensamento em várias etapas, em vez de rendimento bruto. Ming é a linha multimodal, lidando com imagens e outras modalidades não textuais que a própria Ling não abrange. Se sua tarefa exige raciocínio mais pesado ou entrada multimodal, o modelo InclusionAI certo provavelmente não é Ling-3.0-flash — ele foi criado para volume e velocidade dentro do domínio de texto e ferramentas, e não para se estender ao território das outras duas famílias.
Para quem é: três cenários.
1. Pipelines de texto ou chamadas de ferramentas de alto volume e sensíveis à latência — como um piloto, não um compromisso.
Se sua carga de trabalho é dominada por geração de texto ou chamadas de ferramentas sensíveis à taxa de transferência — chat, agentes leves, chamadas de API de alta frequência — o posicionamento do Ling-3.0-flash (baixa contagem de parâmetros ativos, TTFT reivindicado abaixo de 100ms, preço de lançamento quase gratuito) torna-o digno de um piloto. O problema é que "digno de um piloto" é diferente de "digno de migrar o tráfego de produção para ele". Sem dados de benchmark independentes, você é o benchmark agora: execute seu próprio conjunto de avaliação através dele antes de confiar em qualquer coisa voltada ao cliente, e não construa modelos de custo em torno do preço promocional atual.
2. Equipes que precisam de contexto longo com orçamento limitado
Uma janela de contexto de 256K (com alegação do fornecedor de extensibilidade para 1M) a um preço de tabela genuinamente baixo é uma combinação atraente para casos de uso com uso intensivo de recuperação ou processamento de documentos, desde que a qualidade real de raciocínio do modelo se mantenha nessa extensão de contexto — o que, novamente, nenhuma fonte independente testou. Este é um candidato razoável para ser pré-selecionado junto com opções estabelecidas de contexto longo e barato, mas deve ser avaliado lado a lado com elas, em vez de adotado apenas com base na ficha técnica da Ant.
3. Observadores acompanhando o panorama do MoE da China e o roteiro do InclusionAI
Para equipes que acompanham o cenário competitivo dos laboratórios de modelos abertos e semiabertos chineses, em vez de implantar um único modelo em produção, o Ling-3.0-flash é um ponto de dados útil: sinaliza que a InclusionAI está iterando rapidamente em sua camada rápida, possivelmente recuando dos pesos abertos (pelo menos por enquanto), e continuando a apostar em uma estrutura de três famílias (Ling/Ring/Ming) em vez de um modelo geral. Vale a pena salvar e revisitar quando chegarem clareza sobre benchmarks e licenças.
Quando não usá-lo
Evite o Ling-3.0-flash para qualquer tarefa em que precise citar uma afirmação verificada de capacidade — não há nenhum benchmark independente para referência, portanto qualquer declaração sobre seu raciocínio, codificação ou habilidade matemática é atualmente infalsificável. Evite-o se precisar de pesos abertos para auto-hospedagem, fine-tuning ou conformidade; não há nenhum disponível, e a licença para este modelo específico sequer foi declarada, muito menos confirmada como permissiva. Evite-o para tarefas multimodais — essa é a função da linha Ming, não da Ling. E tenha cuidado ao construir um modelo de custo em torno dos preços atuais: a semana de lançamento gratuita, os 500 mil tokens diários gratuitos e o nível gratuito do OpenRouter são todos promocionais, e o preço de tabela de ¥0,40/¥1,20 ao qual provavelmente reverterá ainda não foi testado em relação a padrões reais de uso.
Perguntas Frequentes
O Ling-3.0-flash tem pesos abertos?
Atualmente não. Não há repositório no Hugging Face e nem projeto Ling-V3 no GitHub até o momento desta escrita. As gerações anteriores do Ling (2.0 e 2.6) foram lançadas sob MIT como pesos abertos, mas nada confirma que o Ling-3.0-flash seguirá esse padrão — ou que não seguirá.
Como o Ling-3.0-flash se sai em benchmarks?
Ainda não há um benchmark independente para ele — o Artificial Analysis não tem uma página para este modelo. A própria documentação do Ant Group também não publica uma tabela de benchmark para ele. Para um contexto histórico aproximado, a geração anterior Ling-2.6-flash obteve um Índice de Inteligência Artificial Analysis de 14, e a Ling-2.6-1T obteve 26, mas nenhum desses números deve ser considerado como válido para esta nova geração.
Quão rápido é realmente?
Ant Group afirma pico de throughput de 1000 tokens/seg e tempo para o primeiro token abaixo de 100ms. Ambos são números exclusivos do fornecedor, sem medição independente publicada até o momento. Trate-os como afirmações a verificar em sua própria carga de trabalho, não como desempenho confirmado.
Quanto custa o Ling-3.0-flash?
O preço na plataforma da Ant é de ¥0,40 por 1M de tokens de entrada e ¥1,20 por 1M de tokens de saída, mas atualmente é gratuito durante uma promoção de lançamento de uma semana, com 500k tokens gratuitos/dia também disponíveis. O OpenRouter lista uma variante gratuita também. Espere que esses termos promocionais mudem.
Qual é o tamanho da janela de contexto?
256K tokens de acordo com a documentação da Ant, com uma afirmação do fornecedor de que é extensível para 1M. A listagem do OpenRouter mostra 262.144 tokens, consistente com o valor de 256K. O comprimento máximo de saída não é divulgado.
Qual é a diferença entre Ling, Ring e Ming?
Ling é a linha MoE de uso geral da InclusionAI para texto e chamada de ferramentas, e Ling-3.0-flash está em sua extremidade rápida/barata. Ring é a linha focada em raciocínio. Ming lida com tarefas multimodais. São famílias de modelos separadas, construídas para diferentes trabalhos, não níveis do mesmo modelo.
O Ling-3.0-flash é o mesmo que o Ling-2.6-1T?
Não. Ling-2.6-1T é o principal modelo maior da InclusionAI (1T total / 63B parâmetros ativos) e continua sendo um modelo separado e maior. Ling-3.0-flash (124B total / ~5.1B ativos) é o lançamento mais novo, menor e de nível mais rápido.
Devo usar o Ling-3.0-flash em produção hoje?
Somente após realizar sua própria avaliação. Com nenhum benchmark independente, uma licença não confirmada e preços que atualmente são promocionais, é razoável pilotar, mas prematuro comprometer cargas de trabalho críticas para produção ou sensíveis à conformidade a ele sem seus próprios testes e um plano para o que acontece quando os termos promocionais terminarem.
Conclusão
Ling-3.0-flash é um lançamento genuinamente novo que merece atenção — um modelo MoE de 124B/5,1B ativos, voltado diretamente para trabalho rápido, barato e de alto volume com texto e chamadas de ferramentas, de um laboratório que já lançou modelos críveis antes. Mas, neste momento, é uma ficha técnica e um conjunto de alegações de fornecedor, não um produto verificado: sem benchmark independente, sem pesos abertos, sem licença confirmada, e preços explicitamente promocionais. Isso não é motivo para descartá-lo — é motivo para testá-lo com cautela, verificar as alegações que importam para você diretamente, e revisitar este resumo assim que a Artificial Analysis ou outro avaliador independente publicar números reais.

