Um cartão de título hero gerado para Ling-3.0-flash-VL, com o subtítulo 'Ant abre um modelo multimodal na linha rápida Ling', mostrando três ícones de entrada rotulados Texto, Imagem e Vídeo curto, alimentando um chip que contém '124B MoE esparso · 5.5B ativos' em um ícone de saída de texto, com chips de rodapé 'pesos MIT', 'API ao vivo' e 'FP8', e a nota 'pesos publicados em 4 de setembro de 2026', além do logotipo OrcaRouter no canto inferior direito.
Guides & Insights

Ling-3.0-flash-VL: Ant lança modelo multimodal na linha rápida Ling

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 4 de setembro de 2026, o laboratório inclusionAI do Ant Group publicou pesos licenciados sob MIT para o Ling-3.0-flash-VL no Hugging Face e, no mesmo dia, atualizou a documentação para desenvolvedores da plataforma Ant Ling para acompanhar. O Ling-3.0-flash-VL é o primeiro checkpoint com capacidade de visão da família Ling-3.0-flash: o mesmo backbone esparso de mistura de especialistas com cerca de 124 bilhões de parâmetros que tornou o Ling-3.0-flash somente texto um dos modelos de raciocínio baratos mais comentados do fim do verão, agora lendo imagens e clipes de vídeo curtos além de texto. A quantização FP8 veio em seguida, em 8 de setembro, na manhã em que este texto está sendo escrito. Assim, em quatro dias, o lançamento adquiriu três superfícies sobre as quais um leitor pode agir — pesos abertos, uma API oficial na plataforma Ant Ling e uma pontuação reportada pelo fornecedor de 42 no protocolo Artificial Analysis Intelligence Index versão 4.1.1, quatro pontos acima do 38 medido de forma independente no irmão somente texto. O que ainda não adquiriu é um anúncio formal: a página do Hugging Face e o tutorial para desenvolvedores são o lançamento inteiro, e é por isso que este texto separa o que o fornecedor afirma do que um observador externo consegue verificar.

O lançamento é importante por causa do que ele faz ao mapa de produtos da Ant. Até meados de 2026, o trabalho multimodal no portfólio de modelos da Ant ficou na linha separada Ming, enquanto o Ling-3.0-flash foi posicionado — inclusive no explicador deste próprio blog para o modelo de texto — como o nível rápido, de texto e ferramentas para agentes, codificação e pesquisa aprofundada. O Ling-3.0-flash-VL elimina essa fronteira: ele traz informações visuais para um modelo de raciocínio construído em torno de uma pegada de parâmetros ativados excepcionalmente pequena e longas execuções agênticas, e entrega o resultado aos desenvolvedores de três maneiras de uma só vez. Isso o torna uma decisão genuinamente diferente das variantes anteriores ajustadas por domínio (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), que foram lançadas como APIs gratuitas sem pesos. Este é aberto, roda na plataforma paga da Ant e é novo o suficiente para que ninguém fora do fornecedor tenha publicado uma execução independente ainda. Esse último fato é o mais importante do texto.

O que foi lançado e quando

Cada data abaixo é verificável a partir dos repositórios e da documentação; nada disso se baseia em um comunicado de imprensa que não existe.

• 4 de setembro — o repositório Hugging Face inclusionAI/Ling-3.0-flash-VL foi criado às 15:24 UTC com 64 shards de pesos em bf16, uma pilha completa de código personalizado para a bailing_moe_v3_vl arquitetura, um modelo de chat com raciocínio habilitado por padrão e uma licença MIT. A contagem de downloads está na casa das dezenas no momento em que escrevo: este é um lançamento que apenas um observador de repositórios teria percebido no primeiro dia.

• 4 de setembro — O portal de desenvolvedores da plataforma Ling da Ant adicionou o tutorial de compreensão multimodal documentando o modelo na API oficial (o próprio selo de "última atualização" da página mostra 4 de setembro de 2026). A mídia chinesa de desenvolvedores noticiou o recurso no dia seguinte, descrevendo-o como compreensão de imagens e vídeos curtos para resposta a perguntas visuais e análise de conteúdo.

• A partir de 5 de setembro — o suporte a serving e implantação apareceu rapidamente: um cookbook de implantação SGLang para o modelo, um fork personalizado do vLLM mantido pela organização inclusionAI e uma listagem de biblioteca de implantação bring-your-own-weights com um endpoint de chat-completions pronto. Esses são runtimes e infraestrutura, não anúncios, mas mostram que o modelo foi construído para ser servido, não apenas publicado.

• 8 de setembro — a quantização FP8 do inclusionAI/Ling-3.0-flash-VL-fp8 foi disponibilizada (64 shards, ~126 GB), com a torre de visão deliberadamente mantida em precisão mais alta enquanto os pesos MoE são comprimidos para FP8 E4M3. Para self-hosting em menos GPUs ou GPUs menores, este é o checkpoint que a maioria das pessoas realmente irá baixar.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

O cartão acima é a coisa mais próxima que esta versão tem de um post de lançamento — descrição do modelo, arquitetura, links para as receitas do SGLang e do vLLM, e nenhum anúncio em qualquer outro lugar que possamos encontrar. Observe a incompatibilidade que vale a pena destacar logo de cara: o cartão do modelo diz "apenas 5,5B parâmetros ativados por token", enquanto o cookbook do SGLang escrito na mesma época do lançamento descreve um modelo "5,1B ativos". Em um checkpoint totalmente novo, a diferença provavelmente é questão de contabilidade da vision-tower, não de dois modelos diferentes, mas é exatamente o tipo de detalhe que deveria ser rotulado como não resolvido em vez de ser abafado.

Um modelo de 124B que ativa 5.5B — agora com olhos

O Ling-3.0-flash-VL mantém a receita híbrida de MoE esparso que definiu o irmão de texto. A ficha técnica descreve uma espinha dorsal de 42 camadas alternando camadas Kimi-Delta-Attention e Gated-MLA em uma proporção de 5:1 — o mesmo ritmo estrutural do Ling-3.0-flash — com parâmetros totais em torno de 124,8 bilhões e apenas uma pequena fração ativada por token. A novidade é a pilha de percepção: um codificador visual ViT alimentando um projetor MLP de duas camadas na espinha dorsal da linguagem, além do VideoRoPE para codificar posição espacial e temporal, de modo que os quadros de vídeo cheguem em uma ordem que o modelo possa raciocinar. A entrada é texto, imagem e vídeo; a saída é texto.

• Parâmetros — 124B no total, ~5.5B ativados por token de acordo com o cartão do fornecedor (veja a ressalva de contabilização acima).

• Contexto — anunciado como "até 1 milhão de tokens"; as receitas de implantação que existem hoje utilizam 256K via YaRN rope scaling, que é o número prático honesto em torno do qual se planejar até que alguém publique uma execução mais longa verificada.

• Pensamento — o raciocínio está ativado por padrão através do template de chat; tanto os exemplos oficiais da API quanto as receitas de implantação mostram um parâmetro por requisição enable_thinking: false para chamadas sensíveis à latência.

• Licença — MIT, ambos os formatos de precisão, sem adendos. Esta é a mesma licença limpa que tornou notável a abertura do código do modelo de texto em agosto, e é exatamente a razão pela qual a auto-hospedagem é uma opção realista em vez de uma área cinzenta.

A intenção de design importa tanto quanto a ficha técnica. A Ant posiciona o Ling-3.0-flash-VL como um modelo que "integra informações visuais ao processo completo de compreensão, raciocínio, ação e verificação" — que é a linguagem de cargas de trabalho agênticas, não de legendagem de imagens. Um modelo que pode assistir a uma gravação de tela de 30 segundos, manter uma longa sessão de chamada de ferramentas em contexto e manter seu custo ativado próximo a 5B parâmetros é direcionado diretamente a agentes de uso de computador e fundamentados em vídeos curtos. Esse é um produto diferente dos modelos de visão-linguagem otimizados para perguntas e respostas de imagem única, e é o referencial contra o qual todos os benchmarks abaixo devem ser lidos.

O que a API oficial realmente aceita

O tutorial da plataforma Ant Ling documenta o Ling-3.0-flash-VL em dois formatos de API: um endpoint compatível com OpenAI em api.ant-ling.com/v1/chat/completions e um compatível com Anthropic em api.ant-ling.com/anthropic/v1/messages. Vale a pena conhecer as restrições antes de você criar sua solução com base nela:

• Imagens — JPEG e PNG, somente base64, até 40 imagens por solicitação, cada imagem com até 16.384 × 784 pixels e cada string base64 com até 32 MB. O parâmetro compatível com OpenAI, image_url.detail, é ignorado; o mecanismo decide a resolução internamente.

• Vídeo — MP4, MOV ou WMV, um clipe por solicitação, limitado a 30 segundos, amostrado a uma taxa fixa de 2 quadros por segundo até 32 quadros, base64 até 32 MB. O vídeo funciona apenas no endpoint compatível com OpenAI; o endpoint compatível com Anthropic aceita texto e imagens, mas não vídeo.

• Identificador do modelo — os exemplos de curl do tutorial chamam o modelo Ling-3.0-flash-VL-rc1 em vez de Ling-3.0-flash-VL. Esse sufixo -rc1 é um marcador de release candidate e uma questão genuinamente em aberto: nada na documentação diz quais pesos a plataforma está servindo ou se o checkpoint da API corresponde à build de pesos abertos de 4 de setembro. Se você está avaliando a API em relação aos pesos abertos, essa é a primeira coisa a testar, não uma suposição a fazer.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

A página acima é onde as restrições de entrada estão descritas — formatos de imagem e vídeo, limites por requisição e os dois formatos de endpoint. É também onde se confirma que o modelo é uma oferta comercial de API ativa, em vez de um stub apenas de documentação.

Os números — e quem os reportou

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

O número de destaque no cartão é 42 no protocolo versão 4.1.1 do Artificial Analysis Intelligence Index, que a Ant afirma estar quatro pontos à frente da pontuação de 38 do Ling-3.0-flash, somente texto. A distinção nessa frase carrega peso. O 38 é uma medição da Artificial Analysis — executada de forma independente, publicada no leaderboard deles e citada com aprovação em toda a cobertura do setor sobre o modelo de texto. O 42 é uma alegação no próprio model card da Ant, feita sob um protocolo de índice da AA, mas ainda não listada pela Artificial Analysis, que não tinha página para o Ling-3.0-flash-VL até o momento em que este texto foi escrito. Ninguém fora da Ant executou esse checkpoint ainda. Trate o 42 como um número de fornecedor, vindo da mesma família que produziu o 38 genuíno do modelo de texto — um motivo para olhar, não um número para citar como fato estabelecido.

Todo o resto no comunicado é qualitativo ou metodológico. O cartão descreve o modelo em um gráfico de capacidades "entender, raciocinar, agir" e acena para uma avaliação agêntica do Terminal-Bench executada sob um protocolo estilo AA, mas não publica resultados numéricos de texto que possamos reproduzir aqui; o guia de implantação lista células de precisão (MMMU-Pro, GSM8K) atreladas a configurações de serving específicas que valem a leitura, mas são medições adjacentes à infraestrutura, não avaliações independentes. O resumo honesto é curto: um modelo de raciocínio plausível, barato de servir e com capacidade de visão, ainda sem um placar independente público.

Quanto custa, e o que o histórico familiar sugere

O tutorial multimodal da Ant não lista um preço por token para o Ling-3.0-flash-VL, então qualquer coisa aqui é inferência, claramente rotulada como tal. A âncora útil é o equivalente de texto na mesma plataforma: o preço de tabela oficial do Ling-3.0-flash é de cerca de US$ 0,075 por 1M de tokens de entrada e US$ 0,22 por 1M de saída, com leituras de cache aproximadamente 80% mais baratas, e o console chinês o precifica em renminbi (¥0,40 entrada / ¥1,20 saída por 1M de tokens) após uma promoção inicial com 75% de desconto que terminou em 31 de agosto. Um modelo multimodal 124B-A5.5B é mais caro de servir do que um modelo de texto 124B-A5.1B — a torre de visão é densa e é executada para cada token de imagem — portanto, um preço nessa faixa ou um pouco acima dela é o a priori razoável. O histórico da família também vai na outra direção: as variantes de domínio Fin e Sante foram lançadas como APIs gratuitas, então a Ant demonstrou que usará preço zero para semear a adoção de uma variante do Ling que quer no mercado. Se o VL segue a faixa do modelo de texto pago ou o padrão das variantes gratuitas, simplesmente ainda não é público.

Para o caminho de auto-hospedagem, os números são concretos porque os arquivos são públicos. A versão bf16 é um download de aproximadamente 250 GB distribuído em 64 shards — uma proposta multi-GPU em qualquer coisa que não sejam os maiores nós individuais — enquanto a versão FP8 (~126 GB, torre de visão mantida em bf16) cabe confortavelmente em um nó com 8 aceleradores da classe de 80 GB e é a versão que a maioria das equipes realmente executará. Existem alegações de throughput no serving cookbook, mas elas têm viés de fornecedor; espere a ressalva usual de que o token/s real depende do seu hardware e do seu lote.

Onde uma camada de roteamento se encaixa — honestamente

No lançamento, nenhum gateway importante de modelos de terceiros que verificamos lista o Ling-3.0-flash-VL, e o OrcaRouter — a plataforma de roteamento à qual este blog pertence — também não o serve. Nada neste texto deve ser lido como se o fizesse. Esse é o estado honesto de um modelo de quatro dias, e vale a pena dizer isso claramente porque as opções que um leitor realmente tem hoje são exatamente duas: chamar a API oficial da Ant ou hospedar por conta própria os pesos MIT. O âmbito do roteamento é o que vem a seguir. Quando um modelo como este passa a ser servido por terceiros, a economia de um roteador de repasse é a razão para preferi-lo na avaliação: o preço de tabela do provedor é repassado com margem de 0%, de modo que um corte de preço do fornecedor (ou um experimento de camada gratuita como os lançamentos Fin e Sante) entra em vigor no mesmo dia em que é anunciado, e o failover automático permite apontar uma carga de trabalho real para um modelo aberto de poucos dias sem apostar sua stack na disponibilidade de um único fornecedor ou no comportamento de um único checkpoint. Para uma família que já reajustou seus preços uma vez e se fragmentou em quatro variantes em seis semanas, isso não é uma hipótese — é a diferença entre retestar manualmente toda vez que a Ant se mexe e retestar uma única vez por meio de uma API.

O que assistir

Esta versão é recente o suficiente para que os sinais úteis sejam principalmente verificações que qualquer um pode executar. Primeiro, se a Artificial Analysis (ou outro laboratório independente) lista o Ling-3.0-flash-VL e confirma ou corrige o 42 — esse único dado separa "o melhor modelo da família" de "um número de outro fornecedor". Segundo, se o -rc1 identificador na API oficial resolve para os pesos abertos de 4 de setembro; se não resolver, a API e o caminho de auto-hospedagem são modelos diferentes, e toda comparação que você ler precisa dizer qual deles foi usado. Terceiro, preços: uma taxa VL publicada na plataforma Ling, e se ela segue a faixa paga do modelo de texto ou o manual da API gratuita da Fin/Sante. Quarto, se o checkpoint FP8 mantém a precisão da ficha em produção real — a torre de visão mantida em bf16 é um bom sinal, mas alegações de visão quantizada precisam de uma execução, não de uma configuração. E quinto, a questão do mapa de produto: com a visão agora dentro da linha Ling rápida, observe se a Ant mantém a Ming como uma marca multimodal separada ou deixa as duas convergirem.

Para um desenvolvedor, a resposta de curto prazo é breve. Se você quer construir sobre isso hoje, a API oficial é o caminho de infraestrutura zero e os pesos FP8 são o caminho de auto-hospedagem, e ambos são reais a partir desta semana. Se quer construir sobre o número 42, espere alguém de fora da Ant reproduzi-lo. Tudo o que é genuinamente útil sobre o Ling-3.0-flash-VL — pesos MIT, uma arquitetura plausível, um design agressivo de preço por ativação e uma pontuação de fornecedor que vale a pena levar a sério — está no lugar; tudo o que o tornaria um padrão seguro ainda está pendente.