
Ling-3.1-flash vs Ling-3.0-flash: o que uma janela de 1M tokens e 4,5x os parâmetros realmente mudam
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 262 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
A família Ling, da Ant Group, ganhou uma nova camada rápida e, desta vez, sua existência se resume a uma frase. O Ling-3.1-flash foi anunciado em 30 de setembro de 2026 — cerca de 560 bilhões de parâmetros totais, aproximadamente 25 bilhões ativos por token, uma janela de contexto citada em até 1 milhão de tokens e uma frase de praxe anexada: "Pretendemos abrir o código do modelo em breve." O modelo que ele substitui no topo da linha rápida, o Ling-3.0-flash, é um animal diferente em todos os sentidos: 124 bilhões de parâmetros totais, 5,1 bilhões ativos por token, uma janela de contexto servida de 262.144 tokens, pesos licenciados sob MIT no Hugging Face desde 7 de agosto e um índice independente Artificial Analysis Intelligence Index de 20. Um desses modelos você pode baixar hoje. O outro você pode ler a respeito. Compará-los é genuinamente útil, mas só se a comparação começar por aí.
A aritmética das manchetes é fácil e um tanto enganosa. O Ling-3.1-flash tem cerca de 4,5× o número total de parâmetros do Ling-3.0-flash e cerca de 4,9× o número de parâmetros ativos — 25B contra 5,1B por token. Uma leitura casual diz "modelo muito maior, portanto modelo muito mais inteligente". A leitura mais atenta é que a Ant preservou aproximadamente a proporção de esparsidade enquanto escalava o corpo, e o que isso lhe proporciona é capacidade, não necessariamente profundidade de raciocínio por token: um modelo que roteia 25B dos seus 560B por cada token faz mais trabalho por token do que um que roteia 5,1B, mas também paga cerca de cinco vezes a computação por token para isso. Onde essa troca recai depende inteiramente de a arquitetura da Ant lidar com os parâmetros extras de forma eficiente — e essa é uma pergunta que o anúncio não responde.
Os dois modelos, lado a lado
Coloque os fatos publicados lado a lado e as gerações se separam nitidamente. Cada linha abaixo indica o que a Ant ou um avaliador independente tem; quando falta um número, é porque ninguém o publicou.
• Total de parâmetros — Ling-3.1-flash: ~560B (fornecedor). Ling-3.0-flash: 124B (ficha do modelo).
• Parâmetros ativos por token — Ling-3.1-flash: ~25B (fornecedor). Ling-3.0-flash: 5,1B (cartão do modelo).
• Janela de contexto — Ling-3.1-flash: até 1M de tokens (fornecedor). Ling-3.0-flash: 256K nativo, servido em 262.144 (ficha do modelo e receitas de inferência).
• Pesos e licença — Ling-3.1-flash: não publicados; sem repositório, sem licença (verificado em 30 de setembro e novamente em 1º de outubro de 2026). Ling-3.0-flash: MIT, no Hugging Face como inclusionAI/Ling-3.0-flash e no ModelScope desde 7 de agosto de 2026.
• Formatos de peso — Ling-3.1-flash: nenhum disponível. Ling-3.0-flash: BF16 (~255GB) e FP8 (~128GB) do laboratório, além de quants da comunidade.
• Proveniência do benchmark — Ling-3.1-flash: inteiramente relatado pelo fornecedor, sem harness público, sem pesos para reexecutar. Ling-3.0-flash: pontuado independentemente pela Artificial Analysis com um Intelligence Index de 20, com velocidade de saída medida e volume de geração de tokens publicados em conjunto.
• Disponibilidade — Ling-3.1-flash: apenas no produto Ling Studio da própria Ant. Ling-3.0-flash: auto-hospedável, além de poder ser chamado por meio da API para desenvolvedores da Ant.

Para que serve provavelmente a capacidade extra
A própria descrição de uma linha da Ant sobre o Ling-3.1-flash é a coisa mais informativa no lançamento. O aplicativo Ling Studio o apresenta como "agentes de uso geral, busca, trabalho de escritório rotineiro e desenvolvimento de software/código" — um enquadramento de trabalho de escritório e agêntico, não um enquadramento de benchmark de raciocínio. Isso é consistente com a forma como a família está organizada: Ling é a linha de texto e ferramentas de uso geral, Ring é a linha de raciocínio, e Ming lida com multimodal. Ling-3.0-flash ocupava a mesma posição uma geração antes, e era explicitamente a camada rápida e barata, e não o carro-chefe.
Interprete o aumento de escala sob essa ótica e ele faz sentido. Cargas de trabalho agênticas e com chamadas de ferramentas são longas, repetitivas e famintas por contexto: um único loop de agente pode queimar dezenas de milhares de tokens de saída acumulada de ferramentas antes de tomar uma ação, por isso uma janela de 1M de tokens é um requisito funcional, e não um enfeite de ficha técnica. Aumentar a contagem total de parâmetros enquanto se mantém uma grande fração ativa é como se adiciona conhecimento de mundo e profundidade no seguimento de instruções a um modelo que ainda precisa ser rápido o suficiente para atuar dentro de um loop. A Ant não está construindo aqui um modelo principal mais lento e mais inteligente; está construindo uma camada rápida maior.
O contra-argumento é o custo, e é a mesma aritmética vindo da outra direção. A capacidade extra não é gratuita no momento da inferência — ela é paga em cada token, e a Ant não publicou nenhum preço para o Ling-3.1-flash: nenhuma tabela de preços de API, nenhum desconto de cache, nada comparável aos $0.075/$0.22 por milhão de tokens que a geração anterior lista. Esse é o número que falta que decidiria essa comparação, e ele está faltando.
Benchmarks, e quem os executou
O Ling-3.1-flash chega com três pontuações que parecem fortes isoladamente: 1.673 de Elo no GDPVal-AA v2.1, 75,16 no FrontierSWE e 65,35 no HealthBench Professional. Todas as três são da própria Ant, retiradas do anúncio, e nenhuma foi reproduzida por um laboratório externo. A consequência prática é que elas podem ser comparadas aos números de outros fornecedores, mas não a números independentes — e o Intelligence Index de 20 pontos da Artificial Analysis para o Ling-3.0-flash é um número independente numa escala diferente, pelo que colocá-los lado a lado seria comparar uma medição com uma alegação. Não existe uma página do Ling-3.1-flash na Artificial Analysis no momento em que escrevo.
Uma nota de rodapé no próprio gráfico da Ant merece ser destacada por si só. O cartão afirma que o resultado do HealthBench Professional foi avaliado no "ambiente AQ" e que as capacidades de saúde do Ling-3.1-flash atualmente só podem ser experimentadas no AQ. Nenhuma documentação pública explica o que é o AQ. Uma pontuação de destaque que carrega um qualificador de ambiente não nomeado não é algo que uma equipe externa consiga reproduzir, mesmo depois que os pesos existirem.
Qual deles usar realmente esta semana?
A questão geracional resolve-se de forma diferente consoante aquilo de que precisa hoje e, para quase todos, a resposta neste momento não é o modelo mais recente.
Se você precisa executar algo esta semana, o Ling-3.0-flash é o único dos dois que existe em uma forma utilizável: pesos MIT que você pode auto-hospedar, FP8 se quiser uma pegada menor, preços da API própria publicados e uma pontuação independente que mostra o que você está recebendo. É um modelo genuinamente bom em sua categoria — a avaliação independente o colocou na fronteira de Pareto de pesos abertos para inteligência em relação ao total de parâmetros, e avaliou sua velocidade como alta, com a ressalva de que ele é excepcionalmente prolixo e gerou cerca de 260M tokens durante a avaliação, contra uma mediana perto de 100M.
Se você está planejando os próximos seis meses, o Ling-3.1-flash é a direção a seguir e ainda não é um componente. Os pontos específicos a observar antes que ele se torne um: se os pesos realmente serão abertos e sob qual licença, se a janela servida é genuinamente de 1M ou uma extensão de um contexto nativo mais curto, quanto custa por milhão de tokens, e se um laboratório independente reproduz o 75,16 no FrontierSWE. Qualquer um desses pontos se concretizando seria motivo para refazer a comparação. Nenhum se concretizou.

Onde isso se encaixa em uma pilha de roteamento
Nenhum modelo Ling está no nosso catálogo hoje — Ling-3.0-flash, Ling-3.0-flash-VL e Ling-3.1-flash retornam todos not-found na API de modelos do OrcaRouter, então a resposta honesta a "posso chamá-lo através de vocês" é não, por enquanto. O que uma camada de roteamento realmente oferece de bom numa semana como esta é a outra metade do problema: os modelos com os quais você compararia um candidato. Claude Opus 5, GPT-5.6 Sol e DeepSeek-V4.1-Flash são todas rotas ativas ao preço de tabela do fornecedor, sem margem, e um roteador que os mantém atrás de uma única chave com failover automático é como você mantém um harness de avaliação apontado para um alvo em movimento sem manter quatro integrações. Quando os pesos do Ling-3.1-flash chegarem e a licença for legível, essa também é a forma da decisão: adicionar um endpoint, não reconstruir a stack.
O resumo geracional é curto. O Ling-3.0-flash é um modelo lançado, avaliado de forma independente e com licença permissiva, que se auto-hospeda hoje. O Ling-3.1-flash é uma promessa maior, de contexto mais longo e mais cara de executar, que a Ant ainda não entregou em nenhum formato que um desenvolvedor possa usar. Tratar o segundo como uma atualização do primeiro é o erro que este lançamento convida a cometer, e os números ainda não o sustentam.

