
Ling-3.0-flash-VL: Modelo de Visão com 5,5B Ativos da Ant chega a 25 no Índice de Inteligência
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O Ling-3.0-flash-VL agora tem um número de benchmark que ninguém na Ant Group digitou, e é essa a notícia. O primeiro modelo nativamente multimodal do laboratório inclusionAI da Ant tem pontuação de 25 no Artificial Analysis Intelligence Index — uma execução independente, na atual escala v4.3, publicada juntamente com uma página do modelo que lista a sua velocidade, latência e preço. Chega três semanas depois de a ficha de modelo do próprio fornecedor ter alegado 42 no mesmo índice, e a coisa mais útil que um leitor pode fazer com esses dois números é compreender porque não são uma contradição: a Ant mediu segundo o protocolo Intelligence Index v4.1.1, a Artificial Analysis mediu segundo a v4.3, e essas são réguas diferentes construídas a partir de conjuntos de avaliação diferentes. O número do fornecedor não sobreviveu ao contacto com um terceiro, mas antes foi recolhido de novo numa escala que não existia quando foi escrito.
O modelo subjacente à pontuação é uma mistura esparsa de especialistas com 124 bilhões de parâmetros totais e cerca de 5,5 bilhões ativos por token, lançado sob a licença MIT com pesos BF16 e FP8, aceitando texto, imagens e vídeo e retornando texto. Esse número de parâmetros ativos é todo o argumento a favor da coisa. Com 5,5 bilhões ativos, o Ling-3.0-flash-VL está naquela que se tornou a curva mais interessante entre os modelos abertos — a fronteira da inteligência traçada em relação aos parâmetros ativados, e não ao tamanho total — e está lá porque faz uma quantidade razoável de trabalho por unidade de computação de inferência, não porque é enorme.
Este artigo aborda o que realmente foi lançado e quando, o que diz a execução independente, por que a alegação de Pareto se sustenta melhor do que a maioria, quanto custa o modelo e onde você pode realmente chamá-lo. A versão curta, para quem quer apenas isso: Ling-3.0-flash-VL é real, tem pesos abertos, é excepcionalmente barato de servir, mensuravelmente acima da média para sua classe de tamanho, e notavelmente mais prolixo e mais lento para ser lançado do que a pontuação bruta sugere. Os 42 alegados pelo fornecedor nunca foram reproduzidos de forma independente e não são comparáveis aos 25 agora no placar.
O que de fato foi entregue, e a linha do tempo que insiste em ser achatada
A cobertura deste lançamento tende a condensar vários eventos separados em uma única data de lançamento, e as datas importam porque explicam por que os primeiros textos descreviam um modelo que ninguém fora da Ant conseguia pontuar. O repositório do Hugging Face inclusionAI/Ling-3.0-flash-VL foi criado em 4 de setembro de 2026 — 64 shards de pesos BF16, uma licença MIT, uma pilha de código personalizado para a bailing_moe_v3_vl arquitetura e, durante alguns dias, quase ninguém o baixou. A quantização FP8 veio depois, em 8 de setembro, aproximadamente 126 GB em 64 shards, com a torre de visão mantida em precisão mais alta do que os pesos dos especialistas. A Artificial Analysis lista o lançamento como 10 de setembro de 2026, que é a data à qual a sua própria página se ancora, e a página do modelo que contém a pontuação foi ao ar mais ou menos nessa época.
Então, "lançado em setembro de 2026" é preciso, mas inútil. A sequência prática foi: os pesos no dia 4, um segundo formato de precisão no dia 8, e uma medição independente no dia 10. A razão pela qual isso importa é que um modelo com pesos em disco, mas sem endpoint hospedado e sem pontuação de terceiros, ainda não é, para a maioria das equipes, algo que você possa avaliar — é um download para o qual você precisa provisionar infraestrutura. O Ling-3.0-flash-VL cruzou essa linha quando a API e a pontuação independente passaram a existir.
O suporte de serving chegou junto com os pesos, e não depois deles. A Ant publicou um cookbook de implantação do SGLang e mantém um fork do vLLM ajustado ao Ling para a arquitetura, que é a parte de um lançamento aberto que costuma atrasar semanas. Aqui, não atrasou.
O número no quadro, e o que está no cartão
Esta é a visão independente da Artificial Analysis, que é a única medição de terceiros deste modelo que existe atualmente:
• Índice de Inteligência — 25 no v4.3, classificado em #2 de 64 em sua classe de tamanho, contra uma mediana da classe de 8br /> • Parâmetros totais — 124Bbr /> • Parâmetros ativos — 5,5B por tokenbr /> • Velocidade de saída — 142,9 tokens/segundo, #10 de 64, contra uma mediana entre pares de 105,1br /> • Tempo até o primeiro token — 2,21 segundos, contra uma mediana entre pares de 2,29br /> • Janela de contexto — 262K tokens, conforme medido pela Artificial Analysis, contra os 256K que a própria ficha do modelo declarabr /> • Licença — MIT, pesos abertos
E aqui está o número do fornecedor ao lado do qual ele é tantas vezes impresso: 42 no protocolo v4.1.1 do Índice de Inteligência da Artificial Analysis, quatro pontos acima da pontuação que o Ling-3.0-flash, apenas texto, obteve no mesmo protocolo. Essa afirmação está na ficha do modelo, não tem qualquer registro de avaliação publicado e não é o número que a Artificial Analysis reporta. Duas coisas são verdadeiras ao mesmo tempo: o 42 não foi reproduzido, e isso não é evidência de qualquer desonestidade, porque a v4.1.1 e a v4.3 não medem a mesma coisa. A Artificial Analysis reformulou seu índice em setembro de 2026 e reatribuiu pontuações a todo o seu painel; a v4.3 incorpora dez avaliações, incluindo AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 e Humanity's Last Exam. Qualquer artigo que ainda cite um 42 ao lado de um 25 sem nomear a versão está comparando dois testes diferentes e chamando isso de queda.

O detalhe que vale a pena destacar além da pontuação principal é a verbosidade. Artificial Analysis registra o Ling-3.0-flash-VL gastando 160M tokens de saída para completar o Intelligence Index, classificado em #8 de 64 contra uma mediana de 84M, e o rotula como "muito verboso". Para um modelo cujo apelo é inferência barata através de uma pequena contagem de parâmetros ativos, isso vai diretamente contra o apelo. Você paga por token, não por parâmetro. Um modelo que ativa 5,5B mas emite quase o dobro da contagem mediana de tokens para responder às mesmas perguntas devolve parte dessa vantagem estrutural no caixa — que é exatamente o tipo de interação que uma tabela de preços por token esconde e uma medição de custo por tarefa expõe.
A alegação de Pareto, sob um pouco de pressão
A alegação de que o Ling-3.0-flash-VL está na fronteira de Pareto entre inteligência e parâmetros ativos é, de modo incomum, uma que os dados independentes corroboram, e não apenas permitem. A mediana da classe neste índice é 8; o Ling-3.0-flash-VL obtém 25; e o faz ativando 5,5B de parâmetros por token. Para equipes cuja restrição vinculante é o throughput de atendimento — um único acelerador, um orçamento fixo de requisições, uma implantação na borda —, essa razão é toda a decisão, e é um desempenho genuinamente forte.
Duas ressalvas impedem que isso seja uma vitória limpa. A primeira é a discrepância na contagem de parâmetros: a ficha do modelo diz aproximadamente 5,5B ativos, enquanto o cookbook do SGLang descreve um modelo com 5,1B ativos. Ambos são documentos da Ant, a diferença é pequena e muda ligeiramente a forma da curva, e não a direção. A segunda é que “fronteira” é uma alegação relativa sobre um campo que se move semanalmente. Ser a melhor inteligência por parâmetro ativo em um determinado tamanho é uma posição que você mantém até o próximo modelo dessa faixa ser lançado, e essa faixa está lotada.
A própria demonstração de destaque do fornecedor — de que o Ling-3.0-flash-VL, competindo na Image-to-WebDev Arena sob o handle "linthium", marcou 1.441 contra GPT-5.4, que fez 1.440 — deve ser lida como um chamariz, e não como um resultado. Uma margem de um ponto está dentro do ruído de um Elo de arena, é relatada pelo fornecedor e não é o tipo de diferença que decide qualquer coisa. A alegação de capacidade por trás disso é mais interessante do que o número: o modelo foi construído para um ciclo de feedback visual no qual gera código de front-end a partir de um layout, renderiza a própria saída, olha para a renderização e corrige — observar, agir, verificar, corrigir, em vez de legendar uma vez e parar.

Quanto custa, o que é menos claro do que parece.
A página do Artificial Analysis lista o Ling-3.0-flash-VL a US$ 0,00 por 1 milhão de tokens de entrada e US$ 0,00 por 1 milhão de tokens de saída, contra medianas de US$ 0,14 e US$ 0,40 entre modelos comparáveis. Isso não é um preço. É a aparência de um. O Artificial Analysis precifica o endpoint que consegue ver, e o endpoint que consegue ver é gratuito — o modelo está rodando no Ling Studio da Ant como um teste gratuito, e é o acesso promocional gratuito que a listagem reflete. A própria documentação multimodal da Ant não publica preços por token para o modelo de visão, então não há tabela de preços do fornecedor para conferir o zero. Para dar uma noção de escala, o irmão somente texto Ling-3.0-flash tem sido listado em torno de US$ 0,075 por 1 milhão de entrada e US$ 0,22 por 1 milhão de saída, e as variantes Ling específicas de domínio da Ant também foram lançadas como APIs gratuitas.
Trate o zero como uma janela de testes, e não como uma tarifa. Camadas gratuitas em modelos recém-lançados são um instrumento de aquisição de clientes, e a suposição honesta de planejamento é que o Ling-3.0-flash-VL acabará tendo um preço em algum lugar próximo ao do seu equivalente de texto. Há também uma ambiguidade em aberto que a chegada de um endpoint pago não resolverá: os próprios exemplos de API da Ant usam o identificador de modelo Ling-3.0-flash-VL-rc1, um marcador de release candidate, e continua incerto se o checkpoint servido é idêntico byte a byte aos pesos abertos de 4 de setembro. Se você estiver fazendo benchmark dos seus próprios prompts na API hospedada e esperando que os resultados sejam transferidos para uma build BF16 auto-hospedada, essa é uma suposição que você deve testar antes de se basear nela.
O quadro de custos se inverte dependendo do lado em que você está. Para uma equipe que já tem aceleradores, a versão FP8 com cerca de 126 GB cabe em um nó de oito vias classe 80 GB, e a contagem de 5,5B parâmetros ativos significa que você está pagando o custo amortizado desse nó contra uma pegada de computação por token muito pequena — a versão mais barata possível deste modelo é aquela que você mesmo serve. Para uma equipe sem aceleradores, a questão é se um endpoint pago chega antes que o nível gratuito feche.
Onde você pode realmente chamar isso, incluindo a parte em que dizemos não
O Ling-3.0-flash-VL pode ser acessado pela própria plataforma da Ant — um endpoint compatível com OpenAI em api.ant-ling.com/v1/chat/completions e um compatível com Anthropic ao lado dele — além de acesso de teste gratuito no Ling Studio, e pesos abertos que você mesmo pode servir. Gateways independentes também começaram a listá-lo, e essa é genuinamente a maneira mais rápida de experimentá-lo sem provisionar nada.
O que vale a pena dizer claramente é que O OrcaRouter não roteia o Ling-3.0-flash-VL hoje. Ele não está no nosso catálogo de modelos, então qualquer coisa que você leia aqui sobre chamá-lo por nosso intermédio seria ficção, e preferimos que você soubesse disso desde o início. O que nós roteamos é o modelo de visão mais diretamente comparável a ele: DeepSeek V4 Flash Vision Exp, a versão experimental multimodal da DeepSeek, que está disponível em nosso catálogo com uma janela de contexto de 1M de tokens e um preço publicado. Se o seu requisito real é um modelo de visão capaz por trás de um endpoint compatível com OpenAI — com uma cadeia de fallback configurada para que um contratempo do provedor provoque uma nova tentativa antes de sua resposta começar, e com os preços de tabela do provedor repassados sem nada adicionado por cima, para que uma mudança de preço do fornecedor chegue até você no mesmo dia em que entra em vigor — esse é o modelo para testar primeiro enquanto o Ling-3.0-flash-VL permanece fora do catálogo.

O que observar a partir daqui
Três coisas decidirão se este lançamento parecerá significativo daqui a seis meses. A primeira é uma segunda execução independente: uma pontuação de um único avaliador é um ponto de dados, e a pergunta interessante é se o posicionamento do Ling-3.0-flash-VL na curva de inteligência versus parâmetros ativos sobrevive a uma estrutura de avaliação diferente. A segunda é a precificação real. Até que a Ant publique uma tabela de preços para o modelo de visão, toda comparação de custos que o envolva é uma estimativa vestida de número, e o nível gratuito está fazendo o trabalho que um preço faria de outra forma. A terceira é o delta de qualidade do FP8 — a torre de visão foi deliberadamente mantida em precisão mais alta do que os pesos dos especialistas naquela build, e saber se a versão quantizada se equipara ao BF16 em tarefas visuais de granulação fina é exatamente o tipo de questão que só aparece quando as pessoas passam a rodá-lo em produção em vez de fazer benchmark dele.
O veredito disponível hoje é mais restrito do que a cobertura de lançamento sugeria e mais útil do que a pontuação isolada. Ling-3.0-flash-VL é um modelo de visão real, licenciado pelo MIT e auto-hospedável, que ativa uma pequena fração de seus 124B parâmetros, obtém 25 em um índice independente atual contra uma mediana de classe de 8, e devolve parte dessa vantagem por meio da verbosidade. Esse é um bom modelo com um perfil honesto. O 42 no cartão é um número de uma régua que não existe mais.
