
Ling-3.0-flash-VL vs Ling 3.0 Flash: Um cérebro de 124B, agora com olhos
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
Ling-3.0-flash-VL e Ling 3.0 Flash não são rivais, e ler essa dupla como um duelo de modelos levará você à conclusão errada. Ling-3.0-flash-VL é o checkpoint de visão e linguagem que o laboratório inclusionAI do Ant Group lançou esta semana — os pesos estão no Hugging Face sob licença MIT desde 4 de setembro de 2026 — e é construído diretamente sobre o Ling 3.0 Flash, o modelo de texto open-weight de 124B parâmetros do laboratório, que sustenta seu nível rápido desde o final de julho. Os dois compartilham o mesmo design híbrido-linear de MoE, a mesma economia de ativação esparsa, a mesma receita de serviço com contexto de 256K e a mesma licença MIT. O que o checkpoint VL acrescenta é a única coisa que o modelo de texto nunca teve: entrada nativa de imagem e vídeo, conduzida por um codificador ViT, um projetor MLP de duas camadas e codificação temporal VideoRoPE. Portanto, a comparação se reduz a uma única questão prática — se sua carga de trabalho nunca olha para uma imagem, o modelo com olhos justifica a troca?
A razão pela qual a pergunta vale ser feita é que a inclusionAI não enquadra o Ling-3.0-flash-VL como uma linha de produtos separada. Sua ficha do modelo o chama de "nosso próximo modelo multimodal nativo", construído sobre o Ling-3.0-flash, herdando a capacidade de linguagem, raciocínio e contexto longo desse modelo e estendendo-a com visão que participa de todo o ciclo de compreensão, raciocínio, ação e verificação — e não visão como uma entrada acoplada. Para uma família de modelos cujo lançamento principal anterior era explicitamente apenas texto, isso é uma mudança real, e muda em qual checkpoint um time de texto e ferramentas deve se padronizar.
Dois checkpoints, um backbone
Ling 3.0 Flash, o oponente nesta comparação, é o mais maduro dos dois. Anunciado no final de julho de 2026 e com código aberto sob a licença MIT em 7 de agosto, é um modelo híbrido-linear de mistura de especialistas com 124B de parâmetros totais e cerca de 5,1B ativos por token — 35 camadas KDA e 7 camadas MLA com portas, empilhadas em uma proporção de 5:1, 512 especialistas roteados com 8 ativados, um contexto nativo de 256K servido em 262.144 tokens. É somente texto, com suporte a chamadas de ferramentas, raciocínio habilitado por padrão por meio do template de chat e um perfil de custo excepcionalmente baixo para seu tamanho. É também a metade documentada do par: a Artificial Analysis o lista em seu leaderboard ao vivo, onde ocupa o primeiro lugar entre os 63 modelos de sua classe, e mediu uma saída de aproximadamente 313 tokens por segundo na API do fornecedor.
O Ling-3.0-flash-VL mantém essa arquitetura e adiciona uma pilha visual por cima. O card descreve um codificador visual ViT cujas características são alinhadas ao espaço de texto por um projetor MLP de duas camadas, com o VideoRoPE codificando tanto a posição espacial quanto a ordem temporal, para que o modelo possa fazer localização de eventos e raciocínio de vídeos longos. O backbone é o mesmo híbrido 5:1 KDA-para-MLA, desta vez com 124B de parâmetros totais / 5.5B ativos por token, com um tronco de 42 camadas. As entradas são texto, imagem e vídeo; a saída é texto. O contexto é anunciado em até 1M de tokens, com a receita recomendada do SGLang servindo 256K via escalonamento YaRN. Assim como seu irmão de texto, ele vem com o modo de raciocínio ativado por padrão (desative por solicitação com chat_template_kwargs), e executa sob SGLang ou um fork customizado inclusionAI vLLM. A versão BF16 tem cerca de 250 GB em disco, distribuídos em 64 fragmentos safetensor — a mesma classe de um quarto de terabyte que os pesos do modelo de texto.
Quão recente é? No momento em que este texto foi escrito, o repositório VL tinha uma contagem de downloads na casa das dezenas, sua ficha do modelo ainda estava sendo atualizada, e o Artificial Analysis ainda não o havia listado. Tudo o que estiver abaixo e que não for explicitamente atribuído ao Artificial Analysis é informação da própria inclusionAI.

O placar
A assimetria aqui não é de qualidade — é de modalidade. Seis dimensões capturam a decisão:
• Inteligência (ficha do fornecedor, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, informado pelo fornecedor. Ling 3.0 Flash: 38, o valor do índice anterior que a ficha cita.
• AA live board hoje (v4.3) — Ling-3.0-flash-VL: ainda não listado. Ling 3.0 Flash: estimado em 25, classificado em 1º de 63 na sua classe.
• Entradas — Ling-3.0-flash-VL: texto, imagem e vídeo. Ling 3.0 Flash: somente texto.
• Contexto — ambos afirmam suportar até 1 milhão de tokens; na prática, ambos são atualmente servidos com 256K (262.144).
• Preço — Ling-3.0-flash-VL: sem preço de tabela ainda; apenas pesos abertos MIT. Ling 3.0 Flash: cerca de US$ 0,07 por 1M de entrada e US$ 0,22 por 1M de saída na API própria do fornecedor.
• Escolha-o para — Ling-3.0-flash-VL: documentos, capturas de tela, gráficos, vídeo e agentes que atuam em GUI. Ling 3.0 Flash: chamadas de ferramentas intensivas em texto e pipelines agênticos de longo horizonte.

O placar no qual o modelo de texto não pode entrar.
É aqui que os dois realmente divergem, e essa divergência é estrutural, não competitiva: em benchmarks de imagem e vídeo, o Ling 3.0 Flash, apenas de texto, não tem registro algum, porque não consegue aceitar esse tipo de entrada. O gráfico do próprio Ling-3.0-flash-VL — avaliação da inclusionAI, sem reprodução independente, conduzida em parte internamente e em parte contra as APIs dos concorrentes sob configurações de teste oficiais — traz números nas três categorias que a ficha técnica enfatiza. Na compreensão de imagens complexas, ele marca 79,0 no MMMU-Pro e 84,87 no MathVision, com um 19,88 bem mais baixo no Humanity's Last Exam-Multimodal, refletindo o quanto esse conjunto é difícil para todos. Em tarefas de documentos e gráficos, ele se sai bem: OmniDocBench1.5 com 91,35 e CharXiv_RQ com 81,30. E nas suítes agêntico-multimodais que tornam este lançamento interessante — ClawEval-MM com 59,9, WebVoyager com 90,83, Vision2Web com 57,69 — ele é solicitado a ler uma interface e agir sobre ela, exatamente a tarefa de agente de GUI que o modelo de texto não consegue executar.
Leia-os em contexto e emerge um quadro coerente: este não é um modelo ajustado para vencer trivialidades sobre imagens; é um modelo ajustado para transformar pixels em ação — ler o layout, seguir o gráfico, operar a página. No gráfico do próprio fornecedor, ele lidera o comparativo entre os três modelos (Qwen3.8-27B com alto esforço de raciocínio, Gemini 3.5 Flash-Lite e Kimi-K2.6) em OmniDocBench, WebVoyager e ClawEval-MM, e fica atrás em conjuntos difíceis de conhecimento e raciocínio, como MathVision e HLE-MM. Trate cada um desses números como alegação da inclusionAI até que um laboratório neutro os confirme — mas a direção do ajuste é clara e consistente.
O único número que vale a pena discutir: 42 vs 38
A alegação mais provável de levar uma equipe exclusivamente de texto a mudar é a manchete: a inclusionAI relata que o Ling-3.0-flash-VL obteve 42 no Artificial Analysis Intelligence Index (v4.1.1), quatro pontos acima dos 38 que atribui ao Ling 3.0 Flash na mesma versão do índice. Observe o que esse índice mede: seu composto v4.1.1 se baseia em suítes de texto e de agentes — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam e similares, nenhuma delas com tarefas de imagem. Portanto, o fornecedor está afirmando que adicionar treinamento visual ao backbone compartilhado melhorou a inteligência textual do modelo em quatro pontos, e não apenas que agora ele consegue descrever imagens. Essa é uma afirmação impressionante e totalmente plausível — o ajuste fino de instrução multimodal normalmente eleva a capacidade de texto.
Duas ressalvas sobre as fontes põem esse número em perspectiva. Em primeiro lugar, o 38 é um valor de uma geração anterior do índice: a Artificial Analysis, desde então, mudou seu painel ao vivo para uma versão mais nova do índice (v4.3), na qual o Ling 3.0 Flash aparece atualmente com uma pontuação estimada de 25, ainda em primeiro lugar entre os 63 modelos de sua classe. O par 42-vs-38 do fornecedor está na escala mais antiga e, portanto, não deve ser lido como "quatro pontos acima da pontuação que a AA atribui hoje ao modelo de texto". Em segundo lugar, o 42 é um valor da própria inclusionAI para um modelo ainda não listado pela Artificial Analysis, e a inclusionAI não publicou os resultados do checkpoint VL nas suítes de texto individuais (SWE-Bench, Terminal-Bench) que o gráfico de modelos de texto da própria empresa apresenta em separado. Quatro pontos é exatamente o tamanho do ganho que você gostaria de reproduzir antes de migrar um pipeline somente de texto com base nesse ganho.

Preço: um tem preço de tabela, o outro não.
A comparação de custos atualmente é uma comparação com apenas um preço nela. O Ling 3.0 Flash pode ser chamado hoje na API do próprio fornecedor por aproximadamente US$ 0,07 por 1M de entrada e US$ 0,22 por 1M de saída — preços definidos pelo fornecedor, confirmados na listagem do Artificial Analysis — com entrada em cache mais barata, e os descontos do período de lançamento já terminaram. O Ling-3.0-flash-VL não tem preço de API publicado em lugar nenhum; você ainda não pode pagar por token por ele. Se quiser usá-lo esta semana, você mesmo o hospeda: pesos MIT com aproximadamente 250 GB em BF16, na mesma classe de hardware que o modelo de texto já exige — 4 GPUs de 141 GB (H20-3e ou H200) ou um nó Blackwell de 4 GPUs com tensor-parallel 4, ou 8 GPUs H100/H800 de 80 GB com TP8.
Isso reformula a economia para uma equipe exclusivamente de texto. Se você está comprando tokens, o modelo de texto a $0.07/$0.22 é barato e comprovado. Se você já hospeda o modelo de texto 124B por conta própria, o checkpoint VL não é uma segunda compra de infraestrutura — são apenas mais ~250 GB de pesos na mesma classe de máquina, justificados apenas por cargas de trabalho que realmente consomem pixels. O modelo com olhos só se paga quando há olhos no circuito.
Quem deve escolher qual
• Somente texto e alto volume — fique no Ling 3.0 Flash. Você obtém um modelo comprovado, listado como AA, um preço real por token e chamadas de ferramentas maduras. O ganho de quatro pontos no índice do modelo VL não foi reproduzido e sua taxa de transferência no lado de texto não foi medida; ainda não há evidências de que ele seja o melhor modelo de texto, apenas uma afirmação de que é.
• A visão entra no loop — documentos, capturas de tela, gráficos, fotos, quadros de vídeo ou uma interface que seu agente precisa ler e clicar — Ling-3.0-flash-VL é a escolha óbvia, porque é a mesma base de raciocínio que você já conhece, com o stack de visão adicionado, em vez de um modelo multimodal separado que você precisa reavaliar do zero.
• Tráfego misto, sem decisão — a medida de baixo risco é manter ambos acessíveis e rotear por requisição, em vez de reestruturar a arquitetura em torno de um deles. Essa é a propriedade que um gateway de modelos existe para oferecer: uma única API para 200+ modelos, preços de tabela dos provedores repassados com 0% de margem e failover automático quando um provedor apresenta degradação. Nenhum dos checkpoints Ling está atrás de um endpoint do OrcaRouter ainda — o preço do modelo de texto é o do próprio fornecedor, e o modelo VL não tem nenhum preço hospedado — mas quando o VL ganhar um, mover um subconjunto do tráfego para ele e medir é uma mudança de configuração, não um projeto de integração.
O que ainda falta
• Uma execução independente do Ling-3.0-flash-VL em um Artificial Analysis Intelligence Index atual — o 42 é a palavra da inclusionAI sobre uma versão anterior do índice.
Qualquer preço de API hospedada para o modelo VL, que é o maior obstáculo à adoção casual.
• Publicamos splits somente de texto (SWE-Bench Pro, Terminal-Bench 2.1) para o checkpoint VL, para que uma equipe com foco em texto possa verificar que a pilha de visão não lhe custou nada.
• Uma métrica de latência ponta a ponta ou throughput para VL sob carga de imagem — a velocidade do modelo de texto é medida; a do modelo de visão não é.
Confirmação neutra do gráfico de benchmark de visão, partes do qual foram executadas no próprio harness da inclusionAI e pelo menos um benchmark interno está previsto para lançamento posterior.
O veredito
Não se trata de um concurso de qualidade de modelos; é uma decisão de modalidade com uma alegação de quatro pontos anexada. Se as suas entradas são texto, mantenha o Ling 3.0 Flash — é mais barato, classificado como AA e mensurável, e a vantagem do modelo VL sobre ele é, no momento, um número de fornecedor em uma escala de índice mais antiga. Se a sua carga de trabalho começa a partir de uma tela — uma página de documento, uma captura de tela, um gráfico, um quadro de vídeo, uma GUI que o seu agente precisa operar — o Ling-3.0-flash-VL é o mesmo cérebro de 124B que você já conhece, agora capaz de ver, e essa é uma opção genuinamente nova que não existia no nível rápido do Ling há uma semana. Adote-o onde a visão é real, valide o 42 antes de migrar qualquer coisa com base nisso e mantenha a escolha reversível na camada de roteamento até que uma pontuação independente e um preço de lista cheguem.
