Um cartão de título hero para a comparação 'Ling-3.0-flash-VL vs Ling 3.0 Flash' com o subtítulo 'Um cérebro de 124B, agora com olhos'. Acima da manchete há dois ícones de linha plana — um documento de texto à esquerda e um olho sobre uma moldura de foto à direita — e, abaixo do subtítulo, dois rótulos separados por um divisor fino: 'MESMO BACKBONE MOE HÍBRIDO-LINEAR' e 'UM ADICIONA ENTRADA NATIVA DE IMAGEM E VÍDEO'. Não aparecem números nem preços. O logotipo OrcaRouter fica composto no canto inferior direito.
Guides & Insights

Ling-3.0-flash-VL vs Ling 3.0 Flash: Um cérebro de 124B, agora com olhos

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ling-3.0-flash-VL e Ling 3.0 Flash não são rivais, e ler essa dupla como um duelo de modelos levará você à conclusão errada. Ling-3.0-flash-VL é o checkpoint de visão e linguagem que o laboratório inclusionAI do Ant Group lançou esta semana — os pesos estão no Hugging Face sob licença MIT desde 4 de setembro de 2026 — e é construído diretamente sobre o Ling 3.0 Flash, o modelo de texto open-weight de 124B parâmetros do laboratório, que sustenta seu nível rápido desde o final de julho. Os dois compartilham o mesmo design híbrido-linear de MoE, a mesma economia de ativação esparsa, a mesma receita de serviço com contexto de 256K e a mesma licença MIT. O que o checkpoint VL acrescenta é a única coisa que o modelo de texto nunca teve: entrada nativa de imagem e vídeo, conduzida por um codificador ViT, um projetor MLP de duas camadas e codificação temporal VideoRoPE. Portanto, a comparação se reduz a uma única questão prática — se sua carga de trabalho nunca olha para uma imagem, o modelo com olhos justifica a troca?

A razão pela qual a pergunta vale ser feita é que a inclusionAI não enquadra o Ling-3.0-flash-VL como uma linha de produtos separada. Sua ficha do modelo o chama de "nosso próximo modelo multimodal nativo", construído sobre o Ling-3.0-flash, herdando a capacidade de linguagem, raciocínio e contexto longo desse modelo e estendendo-a com visão que participa de todo o ciclo de compreensão, raciocínio, ação e verificação — e não visão como uma entrada acoplada. Para uma família de modelos cujo lançamento principal anterior era explicitamente apenas texto, isso é uma mudança real, e muda em qual checkpoint um time de texto e ferramentas deve se padronizar.

Dois checkpoints, um backbone

Ling 3.0 Flash, o oponente nesta comparação, é o mais maduro dos dois. Anunciado no final de julho de 2026 e com código aberto sob a licença MIT em 7 de agosto, é um modelo híbrido-linear de mistura de especialistas com 124B de parâmetros totais e cerca de 5,1B ativos por token — 35 camadas KDA e 7 camadas MLA com portas, empilhadas em uma proporção de 5:1, 512 especialistas roteados com 8 ativados, um contexto nativo de 256K servido em 262.144 tokens. É somente texto, com suporte a chamadas de ferramentas, raciocínio habilitado por padrão por meio do template de chat e um perfil de custo excepcionalmente baixo para seu tamanho. É também a metade documentada do par: a Artificial Analysis o lista em seu leaderboard ao vivo, onde ocupa o primeiro lugar entre os 63 modelos de sua classe, e mediu uma saída de aproximadamente 313 tokens por segundo na API do fornecedor.

O Ling-3.0-flash-VL mantém essa arquitetura e adiciona uma pilha visual por cima. O card descreve um codificador visual ViT cujas características são alinhadas ao espaço de texto por um projetor MLP de duas camadas, com o VideoRoPE codificando tanto a posição espacial quanto a ordem temporal, para que o modelo possa fazer localização de eventos e raciocínio de vídeos longos. O backbone é o mesmo híbrido 5:1 KDA-para-MLA, desta vez com 124B de parâmetros totais / 5.5B ativos por token, com um tronco de 42 camadas. As entradas são texto, imagem e vídeo; a saída é texto. O contexto é anunciado em até 1M de tokens, com a receita recomendada do SGLang servindo 256K via escalonamento YaRN. Assim como seu irmão de texto, ele vem com o modo de raciocínio ativado por padrão (desative por solicitação com chat_template_kwargs), e executa sob SGLang ou um fork customizado inclusionAI vLLM. A versão BF16 tem cerca de 250 GB em disco, distribuídos em 64 fragmentos safetensor — a mesma classe de um quarto de terabyte que os pesos do modelo de texto.

Quão recente é? No momento em que este texto foi escrito, o repositório VL tinha uma contagem de downloads na casa das dezenas, sua ficha do modelo ainda estava sendo atualizada, e o Artificial Analysis ainda não o havia listado. Tudo o que estiver abaixo e que não for explicitamente atribuído ao Artificial Analysis é informação da própria inclusionAI.

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

O placar

A assimetria aqui não é de qualidade — é de modalidade. Seis dimensões capturam a decisão:

Inteligência (ficha do fornecedor, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, informado pelo fornecedor. Ling 3.0 Flash: 38, o valor do índice anterior que a ficha cita.

AA live board hoje (v4.3) — Ling-3.0-flash-VL: ainda não listado. Ling 3.0 Flash: estimado em 25, classificado em 1º de 63 na sua classe.

Entradas — Ling-3.0-flash-VL: texto, imagem e vídeo. Ling 3.0 Flash: somente texto.

Contexto — ambos afirmam suportar até 1 milhão de tokens; na prática, ambos são atualmente servidos com 256K (262.144).

Preço — Ling-3.0-flash-VL: sem preço de tabela ainda; apenas pesos abertos MIT. Ling 3.0 Flash: cerca de US$ 0,07 por 1M de entrada e US$ 0,22 por 1M de saída na API própria do fornecedor.

Escolha-o para — Ling-3.0-flash-VL: documentos, capturas de tela, gráficos, vídeo e agentes que atuam em GUI. Ling 3.0 Flash: chamadas de ferramentas intensivas em texto e pipelines agênticos de longo horizonte.

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

O placar no qual o modelo de texto não pode entrar.

É aqui que os dois realmente divergem, e essa divergência é estrutural, não competitiva: em benchmarks de imagem e vídeo, o Ling 3.0 Flash, apenas de texto, não tem registro algum, porque não consegue aceitar esse tipo de entrada. O gráfico do próprio Ling-3.0-flash-VL — avaliação da inclusionAI, sem reprodução independente, conduzida em parte internamente e em parte contra as APIs dos concorrentes sob configurações de teste oficiais — traz números nas três categorias que a ficha técnica enfatiza. Na compreensão de imagens complexas, ele marca 79,0 no MMMU-Pro e 84,87 no MathVision, com um 19,88 bem mais baixo no Humanity's Last Exam-Multimodal, refletindo o quanto esse conjunto é difícil para todos. Em tarefas de documentos e gráficos, ele se sai bem: OmniDocBench1.5 com 91,35 e CharXiv_RQ com 81,30. E nas suítes agêntico-multimodais que tornam este lançamento interessante — ClawEval-MM com 59,9, WebVoyager com 90,83, Vision2Web com 57,69 — ele é solicitado a ler uma interface e agir sobre ela, exatamente a tarefa de agente de GUI que o modelo de texto não consegue executar.

Leia-os em contexto e emerge um quadro coerente: este não é um modelo ajustado para vencer trivialidades sobre imagens; é um modelo ajustado para transformar pixels em ação — ler o layout, seguir o gráfico, operar a página. No gráfico do próprio fornecedor, ele lidera o comparativo entre os três modelos (Qwen3.8-27B com alto esforço de raciocínio, Gemini 3.5 Flash-Lite e Kimi-K2.6) em OmniDocBench, WebVoyager e ClawEval-MM, e fica atrás em conjuntos difíceis de conhecimento e raciocínio, como MathVision e HLE-MM. Trate cada um desses números como alegação da inclusionAI até que um laboratório neutro os confirme — mas a direção do ajuste é clara e consistente.

O único número que vale a pena discutir: 42 vs 38

A alegação mais provável de levar uma equipe exclusivamente de texto a mudar é a manchete: a inclusionAI relata que o Ling-3.0-flash-VL obteve 42 no Artificial Analysis Intelligence Index (v4.1.1), quatro pontos acima dos 38 que atribui ao Ling 3.0 Flash na mesma versão do índice. Observe o que esse índice mede: seu composto v4.1.1 se baseia em suítes de texto e de agentes — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam e similares, nenhuma delas com tarefas de imagem. Portanto, o fornecedor está afirmando que adicionar treinamento visual ao backbone compartilhado melhorou a inteligência textual do modelo em quatro pontos, e não apenas que agora ele consegue descrever imagens. Essa é uma afirmação impressionante e totalmente plausível — o ajuste fino de instrução multimodal normalmente eleva a capacidade de texto.

Duas ressalvas sobre as fontes põem esse número em perspectiva. Em primeiro lugar, o 38 é um valor de uma geração anterior do índice: a Artificial Analysis, desde então, mudou seu painel ao vivo para uma versão mais nova do índice (v4.3), na qual o Ling 3.0 Flash aparece atualmente com uma pontuação estimada de 25, ainda em primeiro lugar entre os 63 modelos de sua classe. O par 42-vs-38 do fornecedor está na escala mais antiga e, portanto, não deve ser lido como "quatro pontos acima da pontuação que a AA atribui hoje ao modelo de texto". Em segundo lugar, o 42 é um valor da própria inclusionAI para um modelo ainda não listado pela Artificial Analysis, e a inclusionAI não publicou os resultados do checkpoint VL nas suítes de texto individuais (SWE-Bench, Terminal-Bench) que o gráfico de modelos de texto da própria empresa apresenta em separado. Quatro pontos é exatamente o tamanho do ganho que você gostaria de reproduzir antes de migrar um pipeline somente de texto com base nesse ganho.

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

Preço: um tem preço de tabela, o outro não.

A comparação de custos atualmente é uma comparação com apenas um preço nela. O Ling 3.0 Flash pode ser chamado hoje na API do próprio fornecedor por aproximadamente US$ 0,07 por 1M de entrada e US$ 0,22 por 1M de saída — preços definidos pelo fornecedor, confirmados na listagem do Artificial Analysis — com entrada em cache mais barata, e os descontos do período de lançamento já terminaram. O Ling-3.0-flash-VL não tem preço de API publicado em lugar nenhum; você ainda não pode pagar por token por ele. Se quiser usá-lo esta semana, você mesmo o hospeda: pesos MIT com aproximadamente 250 GB em BF16, na mesma classe de hardware que o modelo de texto já exige — 4 GPUs de 141 GB (H20-3e ou H200) ou um nó Blackwell de 4 GPUs com tensor-parallel 4, ou 8 GPUs H100/H800 de 80 GB com TP8.

Isso reformula a economia para uma equipe exclusivamente de texto. Se você está comprando tokens, o modelo de texto a $0.07/$0.22 é barato e comprovado. Se você já hospeda o modelo de texto 124B por conta própria, o checkpoint VL não é uma segunda compra de infraestrutura — são apenas mais ~250 GB de pesos na mesma classe de máquina, justificados apenas por cargas de trabalho que realmente consomem pixels. O modelo com olhos só se paga quando há olhos no circuito.

Quem deve escolher qual

Somente texto e alto volume — fique no Ling 3.0 Flash. Você obtém um modelo comprovado, listado como AA, um preço real por token e chamadas de ferramentas maduras. O ganho de quatro pontos no índice do modelo VL não foi reproduzido e sua taxa de transferência no lado de texto não foi medida; ainda não há evidências de que ele seja o melhor modelo de texto, apenas uma afirmação de que é.

A visão entra no loop — documentos, capturas de tela, gráficos, fotos, quadros de vídeo ou uma interface que seu agente precisa ler e clicar — Ling-3.0-flash-VL é a escolha óbvia, porque é a mesma base de raciocínio que você já conhece, com o stack de visão adicionado, em vez de um modelo multimodal separado que você precisa reavaliar do zero.

Tráfego misto, sem decisão — a medida de baixo risco é manter ambos acessíveis e rotear por requisição, em vez de reestruturar a arquitetura em torno de um deles. Essa é a propriedade que um gateway de modelos existe para oferecer: uma única API para 200+ modelos, preços de tabela dos provedores repassados com 0% de margem e failover automático quando um provedor apresenta degradação. Nenhum dos checkpoints Ling está atrás de um endpoint do OrcaRouter ainda — o preço do modelo de texto é o do próprio fornecedor, e o modelo VL não tem nenhum preço hospedado — mas quando o VL ganhar um, mover um subconjunto do tráfego para ele e medir é uma mudança de configuração, não um projeto de integração.

O que ainda falta

• Uma execução independente do Ling-3.0-flash-VL em um Artificial Analysis Intelligence Index atual — o 42 é a palavra da inclusionAI sobre uma versão anterior do índice.

Qualquer preço de API hospedada para o modelo VL, que é o maior obstáculo à adoção casual.

• Publicamos splits somente de texto (SWE-Bench Pro, Terminal-Bench 2.1) para o checkpoint VL, para que uma equipe com foco em texto possa verificar que a pilha de visão não lhe custou nada.

• Uma métrica de latência ponta a ponta ou throughput para VL sob carga de imagem — a velocidade do modelo de texto é medida; a do modelo de visão não é.

Confirmação neutra do gráfico de benchmark de visão, partes do qual foram executadas no próprio harness da inclusionAI e pelo menos um benchmark interno está previsto para lançamento posterior.

O veredito

Não se trata de um concurso de qualidade de modelos; é uma decisão de modalidade com uma alegação de quatro pontos anexada. Se as suas entradas são texto, mantenha o Ling 3.0 Flash — é mais barato, classificado como AA e mensurável, e a vantagem do modelo VL sobre ele é, no momento, um número de fornecedor em uma escala de índice mais antiga. Se a sua carga de trabalho começa a partir de uma tela — uma página de documento, uma captura de tela, um gráfico, um quadro de vídeo, uma GUI que o seu agente precisa operar — o Ling-3.0-flash-VL é o mesmo cérebro de 124B que você já conhece, agora capaz de ver, e essa é uma opção genuinamente nova que não existia no nível rápido do Ling há uma semana. Adote-o onde a visão é real, valide o 42 antes de migrar qualquer coisa com base nisso e mantenha a escolha reversível na camada de roteamento até que uma pontuação independente e um preço de lista cheguem.