
Ling-3.1-flash está no ar e é grátis por duas semanas: o que o MoE de 560B realmente entrega
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Ling-3.1-flash, o mixture-of-experts de aproximadamente 560 bilhões de parâmetros que o laboratório inclusionAI do Ant Group anunciou em 29 e 30 de setembro de 2026, deixou de ser um comunicado à imprensa esta semana: agora ele responde a requisições em uma API comercial ativa. O modelo está em um teste gratuito de duas semanas em um gateway de inferência de terceiros, e também aparece no produto Ling Studio da própria Ant — o que desloca a pergunta de "ele existe?" para "o que ele realmente entrega?". A resposta é mais estreita do que os números da manchete sugerem. O Ling-3.1-flash tem entrada de texto e saída de texto; atende a um contexto de 262.144 tokens (256K), embora o anúncio cite 1M como meta eventual; sua saída é limitada a 32.768 tokens; e ninguém publicou o preço que você pagará no décimo quinto dia, quando a janela gratuita fechar e os pesos deverem vir em seguida.
Essa lacuna entre o cartão de anúncio e o endpoint em produção é a coisa útil a que se agarrar, porque a maior parte da cobertura deste lançamento lê as especificações como se o modelo as estivesse lançando hoje. Não é o caso. O Ling-3.1-flash é o segundo modelo deste laboratório em três meses a chegar como aquilo que o rastreador independente LLM Releases classifica sem rodeios como "pesos não lançados", e a diferença entre o que a Ant diz que o modelo é e o que um desenvolvedor pode chamar agora é onde um orçamento ou um projeto-piloto pode dar errado silenciosamente.
O que mudou entre o anúncio e hoje?
O anúncio em si foi um post de especificação: ~560B parâmetros totais, ~25B ativos por token, até 1M tokens de contexto, três números de avaliação de destaque e uma promessa — "planejamos abrir o código do modelo em breve". Nada disso mudou. O que mudou foi a disponibilidade. Em até um dia após o anúncio, o modelo já estava acessível em uma edge comercial, e o teste gratuito expõe o mesmo endpoint real que uma versão paga exporia: mesma superfície de API, mesma modalidade somente texto, mesmo interruptor de modo de pensamento para trabalho de agente de longo horizonte.
Para quem está decidindo se vale a pena gastar tempo de engenharia nisso, o teste é a história completa desta semana, e funciona nos dois sentidos. Inferência gratuita por duas semanas é uma forma genuinamente barata de ver como o modelo se comporta com os seus próprios prompts — uma raridade para um modelo deste tamanho. Mas gratuito é um estado promocional, não um preço. Ainda não há nenhuma tabela de preços pós-teste publicada para o Ling-3.1-flash em lugar nenhum, então qualquer modelo de custos que você construir com base no nível gratuito é um espaço reservado até que a Ant e os seus provedores de hospedagem apresentem números.
A ficha técnica, e os três números que ainda são promessas
• Parâmetros — 560B no total, ~25B ativos por token. Informado pelo fornecedor, e aproximadamente quatro vezes o total de 124B / 5,1B ativos da geração anterior. A proporção de esparsidade se mantém perto de 1 em 22, então a ativação não é dramaticamente mais enxuta — o modelo é apenas muito maior do que aquele que ele sucede.
• Contexto — atualmente entrega 262.144 tokens. "Até 1M" é a meta quando a janela for habilitada; não é o que o endpoint de teste oferece, e é a interpretação equivocada mais comum deste lançamento.
• Saída — 32.768 tokens no máximo. Razoável para loops de agente, apertado se você pretende gerar documentos longos em uma única passagem.
• Modalidade — texto de entrada, texto de saída. Este é um modelo de texto. Visão, áudio e entrada de arquivos não fazem parte do lançamento, e nenhuma data foi dada para eles.
• Raciocínio — uma pilha híbrida com um interruptor explícito de modo de pensamento, o mesmo padrão usado pela geração anterior, voltada para trabalho agêntico e de chamada de ferramentas em várias etapas, em vez de chat de turno único.
• Pesos e licença — não publicados. Este é o número que mais importa e o que ainda não tem valor algum: não existe repositório no Hugging Face, nem texto de licença, nem checkpoint para download até hoje.

O cartão de referência, lido com o desconto de que necessita
A própria divulgação da Ant coloca o Ling-3.1-flash com um agregado de 81,0 em cinco benchmarks de agentes, com 40,4% no Terminal-Bench 4.0, 55,9% no SWE-Atlas e 65,35% no HealthBench Professional; a própria empresa acrescenta 1.673 Elo no GDPVal-AA v2.1 e 75,16 no FrontierSWE. Todos esses números são de origem própria. Não há harness, nem conjunto de prompts, nem pesos para que qualquer outra pessoa reexecute a suíte, o que é a ressalva padrão para um modelo nesta fase — e aqui vale dizer com todas as letras: uma pontuação de fornecedor não reproduzida é uma alegação sobre um modelo, não uma medição dele.
O card também é informativo de uma maneira que seus autores talvez não pretendessem. O resultado de 40,4% no Terminal-Bench 4.0 fica bem atrás do tier de fronteira; Claude Sonnet 5.5, um modelo de porte médio, e não um flagship, obtém 70,6% na mesma versão desse benchmark. A leitura honesta não é que o Ling-3.1-flash seja fraco — 40,4% é um número agêntico de terminal respeitável para um modelo posicionado em custo — mas sim que o enquadramento de "próximo da fronteira em benchmarks importantes" que circulou nas redes sociais no dia do anúncio não sobrevive ao contato com as linhas específicas. O benchmark em que o modelo parece mais forte, HealthBench Professional com 65,35, também é o que carrega a nota de rodapé incômoda: a Ant afirma que ele foi avaliado em um ambiente que chama de AQ e que a capacidade de saúde do modelo "só pode ser experimentada atualmente no AQ", sem definir o que é AQ em nenhum lugar público. Uma pontuação de manchete com um ambiente sem nome anexado é uma demo, não um resultado reproduzível.
Por que a chegada de um grande modelo como teste é a verdadeira notícia
A jogada mais interessante aqui é a sequência, não os parâmetros. O Ling-3.0-flash foi direto para pesos abertos. Este está estreando primeiro em teste, com pesos, licença e preços oficiais todos retidos, e um compromisso público de abrir o código-fonte só depois que o período gratuito terminar. Esse é um manual de lançamento comercial disfarçado de anúncio de modelo aberto, e é uma mudança real que vale a pena acompanhar: se os pesos chegarem sob uma licença permissiva, a comunidade ganha um modelo base de 560B para ajuste fino e destilação; se chegarem com amarras comerciais, o teste de duas semanas era o produto e a frase "open source" era marketing. De qualquer forma, a escolha acontece dentro da janela de teste, e é isso que deve ser observado, e não qualquer linha isolada de benchmark.
Onde ele roda, e o panorama honesto do roteamento
Por enquanto, o Ling-3.1-flash é acessível pela própria interface de produto do fornecedor e por plataformas de inferência de terceiros que estão executando o teste — e é só até aí. Ele não está no catálogo da OrcaRouter hoje; uma consulta à nossa API pública de modelos para o Ling-3.1-flash, o Ling-3.0-flash e a variante de visão do Ling-3.0 retorna não encontrado, e não vamos fingir o contrário. Quando um endpoint Ant chegar à disponibilidade geral com um preço de tabela publicado, o modelo de repasse que a OrcaRouter adota — preço de tabela do provedor repassado com zero de markup, de modo que um corte de preço do fornecedor entra em vigor do nosso lado no mesmo dia — é exatamente o arranjo adequado a um modelo cujo preço ainda não foi definido.
O que você pode fazer hoje, sem esperar pela decisão da licença, é executar a comparação que realmente importa para um modelo não comprovado: medi-lo em relação aos modelos da categoria Flash que você pode chamar agora mesmo. Gemini 3.8 Flash e DeepSeek-V4.1-Flash estão ambos no nosso catálogo pelos preços de tabela dos respectivos provedores, atrás de uma única chave de API, com failover automático entre eles. Para um modelo em teste gratuito cujos pesos e tabela de preços são ambos desconhecidos, essa é a maneira sensata de mantê-lo — mais um candidato para o qual você pode rotear enquanto o teste durar, e um caminho de produção que não depende do que acontece no décimo quinto dia.

O que fazer esta semana
Se o modelo for relevante para o seu trabalho, o período de teste é o motivo para agir agora em vez de esperar que a questão dos pesos abertos seja resolvida — duas semanas de inferência gratuita em um MoE de 560B é a avaliação mais barata que você vai conseguir, e a resposta para "ele se sustenta nos meus prompts" está disponível hoje, embora a resposta para "posso auto-hospedá-lo" não esteja. Três coisas a verificar enquanto a janela estiver aberta, na ordem:
• Execute sua própria carga de trabalho, não a ficha do benchmark. Os números publicados são a seleção de tarefas da Ant; seus prompts são os que decidem sua stack.
• Teste o contexto que você realmente vai usar. O endpoint fornece 262.144 tokens, não 1M. Se o seu design depende da janela maior, você está projetando com base em uma promessa.
Não monte um modelo de custos com base em “grátis”. Grátis é um estado que dura duas semanas. Até que uma tabela de preços seja publicada, planeje a volta ao modelo Flash-tier pago como padrão e trate o Ling-3.1-flash como capacidade adicional.
O anúncio é real e o modelo está em execução, o que já é mais do que se podia dizer há uma semana. Mas lançado-e-aberto e em execução-em-teste são estados diferentes, e este está firmemente no segundo — uma especificação de 560B, um endpoint de 256K, um cartão de benchmark exclusivo do fornecedor e um relógio de duas semanas que é o único prazo firme de todo o lançamento.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
