
Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp: Duas Apostas na Visão Aberta
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Ling-3.0-flash-VL e DeepSeek V4 Flash Vision Exp são os dois modelos de visão de pesos abertos nesta faixa de peso que uma equipe pode realisticamente baixar e servir hoje, e foram construídos por pessoas que discordam sobre para que serve a visão. O Ling-3.0-flash-VL, do laboratório inclusionAI do Ant Group, ativa cerca de 5,5B dos seus 124B parâmetros por token e trata a visão como algo a ser aplicado dentro de um ciclo de retroalimentação — gerar, renderizar, olhar, corrigir — ao menor custo de inferência possível. O DeepSeek V4 Flash Vision Exp, a primeira construção multimodal da DeepSeek, combina uma janela de contexto de 1M tokens com 384K tokens de saída máxima e trata a visão como mais uma entrada que um agente lê no caminho para concluir um trabalho longo. Um é otimizado por quão pouco custa pensar. O outro é otimizado por quanto consegue conter enquanto o faz.
Essa diferença, e não um delta de benchmark, é o que deve orientar a escolha. Os dois modelos não têm um protocolo de avaliação compartilhado para comparar, e apenas um deles tem uma pontuação independente. O que segue é o formato honesto do confronto: as apostas arquiteturais, as especificações que de fato divergem, a situação dos benchmarks — incluindo por que ela é escassa —, quanto custa cada um e qual deles vence para qual tarefa — além da parte em que dizemos claramente qual dos dois está no nosso catálogo.
As duas apostas, declaradas com precisão
O lado Ling disto é uma aposta na esparsidade de ativação como a principal alavanca de custo. O Ling-3.0-flash-VL é um misto esparso de especialistas com 124B parâmetros totais — o card do modelo mostra cerca de 124,8B, e o cookbook do SGLang descreve 5,1B ativos onde o card diz aproximadamente 5,5B — rodando um tronco híbrido de 42 camadas que alterna Kimi Delta Attention com blocos MLA com gate numa proporção de 5:1. Um codificador de visão de resolução arbitrária e um projetor MLP de duas camadas alimentam esse tronco, com o VideoRoPE cuidando da posição espacial e temporal para que os quadros de vídeo cheguem numa ordem coerente. A consequência arquitetural é um modelo cujo custo de execução por token é uma pequena fração de um denso de 124B, que é exatamente o motivo pelo qual ele aparece na fronteira de inteligência versus parâmetros ativos.
O lado da DeepSeek é uma aposta no contexto e na resistência agêntica. O DeepSeek V4 Flash Vision Exp pega a arquitetura de texto do DeepSeek-V4-Flash e adiciona um codificador de visão e um alinhador, depois continua o treinamento — uma fonte estima o resultado em cerca de 305B parâmetros, o que a DeepSeek não confirmou em detalhes. Ele carrega uma janela de contexto de 1.048.576 tokens e 384.000 tokens de saída máxima, oferece suporte a saída JSON, chamadas de ferramentas, à Responses API, à Anthropic API e à continuação de prefixo de conversa, e a DeepSeek deixou explícito que este não é um modelo de perguntas e respostas visuais. É percepção para agentes: ler capturas de tela da web, interfaces de software e gráficos e, em seguida, continuar em chamadas de ferramentas. As imagens são convertidas em tokens e cobradas como tal, com limite de 384 tokens por imagem.
Leia os dois parágrafos em conjunto e a forma da decisão aparece. Se a sua carga de trabalho é “olhar para isto, decidir algo, agir, olhar de novo”, a contagem de parâmetros ativos do Ling é o que torna o ciclo viável em termos de custo, e o design de feedback visual dele visa exatamente isso. Se a sua carga de trabalho é “ler este documento de 400 páginas com figuras e continuar”, a janela de contexto do DeepSeek é o recurso, e nada do lado do Ling compete com ela.
Por que a comparação de benchmark é mais tênue do que parece
É esta a seção que a maioria das comparações ignora, e ignorá-la produz uma tabela de números que não significa nada. Aqui está o estado real das evidências.
O Ling-3.0-flash-VL tem uma medição independente: 25 no Artificial Analysis Intelligence Index v4.3, classificado em #2 de 64 na sua classe de tamanho, contra uma mediana de classe de 8. O cartão do fornecedor afirma separadamente 42 no protocolo Intelligence Index v4.1.1, que é uma escala aposentada e não comparável — trate o 42 como não reproduzido.
O DeepSeek V4 Flash Vision Exp não tem nenhuma página no Artificial Analysis. Todos os números publicados para ele são do próprio DeepSeek, do anúncio de lançamento, e vários deles são explicitamente relativos ao Opus-4.8, em vez de a um protocolo fixo. Isso não é uma crítica aos números; é uma afirmação sobre o que se pode fazer com eles. Não se pode colocar um modelo com pontuação independente e um modelo com pontuação apenas do fornecedor na mesma coluna e declarar um vencedor, e qualquer página que o faça está fabricando um resultado.
O que é legítimo é comparar cada modelo com o seu próprio registo comunicado, com a proveniência anexada:
• Ling-3.0-flash-VL, independente — Índice de Inteligência 25 na v4.3, nº 2 de 64 na classe, mediana da classe 8, segundo a Artificial Analysisbr /> • Ling-3.0-flash-VL, fornecedor — 42 no protocolo v4.1.1 descontinuado, e 1.441 contra 1.440 do GPT-5.4 na Image-to-WebDev Arena como "linthium"; ambos relatados pelo fornecedor e a margem da arena está dentro do ruído do Elobr /> • DeepSeek V4 Flash Vision Exp, fornecedor — Terminal Bench 2.1 83,9; DeepSWE 59,3 contra 58,0 do Opus-4.8; Agents' Last Exam 27,3 contra 25,7 do Opus-4.8; Toolathlon-Verified 75,9; Cybergym 75,3; Chartography 64,3; NL2Repo 57,7; DSBench-Hard 63,6; ZeroBench Pass@5 35,0; ApexBench Pass@1 36,5; AutomationBench 25,7br /> • DeepSeek V4 Flash Vision Exp, independente — nenhum publicado
Repare no que a lista da DeepSeek é composta em sua maior parte: avaliações agênticas e de engenharia de software, não avaliações de visão. A forma como a própria DeepSeek enquadra a questão é que, em tarefas de texto puro, o modelo de visão iguala o DeepSeek-V4-Flash oficial sem regressão, e que os ganhos estão em benchmarks agênticos multimodais — onde a DeepSeek descreve o resultado como se aproximando do Opus-4.8, em vez de superá-lo, e admite uma lacuna de aproximadamente dez pontos nas tarefas estruturadas de ciência de dados e código NL2Repo e DSBench-Hard. Esse é um conjunto de afirmações extraordinariamente cuidadoso, e mostra que o modelo está sendo vendido como uma atualização de percepção para uma pilha de agentes existente, e não como um novo teto.

As especificações que realmente divergem
A maior parte das duas fichas técnicas concorda: ambas são de pesos abertos sob a licença MIT, ambas recebem texto e imagens e retornam texto, ambas fornecem pesos BF16 com builds quantizadas, ambas têm receitas de serving publicadas e ambas lidam com vídeo de alguma forma. As divergências concentram-se em quatro pontos.
• Parâmetros — Ling-3.0-flash-VL tem 124B no total, com aproximadamente 5,5B ativos por token; DeepSeek V4 Flash Vision Exp é reportado em torno de 305B, sem número publicado de parâmetros ativosbr /> • Janela de contexto — Ling-3.0-flash-VL mede 262K tokens por Artificial Analysis, contra os 256K declarados em seu próprio model card; DeepSeek V4 Flash Vision Exp opera nativamente com 1.048.576 tokensbr /> • Saída máxima — Ling-3.0-flash-VL é bem menor, na casa das dezenas de milhares de tokens; DeepSeek V4 Flash Vision Exp chega a 384.000br /> • Tratamento de imagens — Ling-3.0-flash-VL aceita até 40 imagens por solicitação, com até 16.384 × 784 pixels cada, somente base64; DeepSeek V4 Flash Vision Exp aceita base64, URLs externas ou uma referência da Files API, e limita o custo de imagem a 384 tokens por imagembr /> • Parâmetros ativos — Ling-3.0-flash-VL ativa aproximadamente 5,5B por token; DeepSeek V4 Flash Vision Exp não publicou nenhum número de parâmetros ativos
A linha de tratamento de imagens é a que é subestimada. Um teto rígido de 384 tokens por imagem significa que um gráfico denso ou uma captura de tela de página inteira é comprimido para aproximadamente o mesmo orçamento de uma miniatura — barato, e com perdas de uma forma que importa para tarefas de leitura detalhada. A abordagem da Ling segue o caminho oposto: um orçamento de pixels por imagem muito grande, transporte somente base64 e, portanto, uma carga útil de solicitação muito mais pesada. Qual deles é melhor depende inteiramente de suas imagens serem fotografias de documentos que você precisa ler com precisão, ou capturas de tela de interface que você precisa entender aproximadamente.
A segunda linha subestimada é a saída máxima. O teto de dezenas de milhares de tokens do Ling-3.0-flash-VL é adequado para um loop de descrever e depois corrigir e restritivo para qualquer coisa que queira emitir um artefato grande — um arquivo gerado longo, uma reescrita completa de documento, um diff de vários milhares de linhas. A saída de 384K do DeepSeek existe justamente porque sua carga de trabalho pretendida termina em um grande resultado de chamada de ferramenta ou artefato gerado. Se o seu pipeline espera que o modelo devolva algo longo, essa única linha decide o confronto antes de qualquer benchmark.
Preço, e a diferença entre gratuito e sem preço
O DeepSeek V4 Flash Vision Exp tem um valor real no nosso catálogo: $0,24 por 1 milhão de tokens de entrada e $0,73 por 1 milhão de tokens de saída, com uma janela de contexto de 1.048.576 tokens e uma saída máxima de 384.000 tokens, acessível como deepseek/deepseek-v4-flash-vision-exp. Essa é uma tarifa publicada, cobrada da mesma forma que o V4-Flash de texto, com imagens convertidas em tokens em até 384 por imagem. É uma tarifa que você pode colocar em uma planilha.
O Ling-3.0-flash-VL não tem um. A página do Artificial Analysis o lista em $0,00 por 1M de entrada e $0,00 por 1M de saída em comparação com as medianas de concorrentes de $0,14 e $0,40 — mas isso reflete o teste gratuito em execução no Ling Studio da Ant, não uma tarifa. A documentação multimodal da Ant não publica nenhum preço por token para o modelo de visão, então não há nada com que comparar o zero. O modelo irmão apenas de texto, Ling-3.0-flash, tem sido listado em torno de $0,075 por 1M de entrada e $0,22 por 1M de saída, e os lançamentos Ling específicos de domínio da Ant foram lançados como APIs gratuitas, o que sugere um formato final semelhante — mas uma sugestão não é um preço.
Coloque esses lado a lado honestamente e a comparação de custos é: um modelo tem uma tarifa, o outro tem uma janela promocional e um palpite plausível. Qualquer pessoa que afirme que o Ling-3.0-flash-VL é mais barato que o DeepSeek V4 Flash Vision Exp está comparando um teste gratuito com um preço de tabela. A afirmação defensável é que o Ling-3.0-flash-VL é muito provavelmente mais barato por token quando tiver um preço definido, porque 5,5B de parâmetros ativos é uma vantagem estrutural que nenhuma mudança de tarifa apaga — com a ressalva de que a verbosidade do Ling-3.0-flash-VL corrói parte disso. O Artificial Analysis registra que ele queima 160M tokens de saída no Intelligence Index, classificado em #8 de 64 contra uma mediana de 84M e rotulado como "muito verboso". Você paga por token emitido, então um modelo que diz quase o dobro para chegar à mesma resposta devolve parte do que sua ativação esparsa ganha.
Qual deles, para quê?
A árvore de decisão honesta divide-se com base no contexto e no comprimento da saída antes de se dividir com base em qualquer outra coisa, porque são essas as dimensões em que os dois modelos não são substitutos.
Escolha DeepSeek V4 Flash Vision Exp quando seu trabalho é longo e termina em um artefato: documentos com várias centenas de páginas repletos de figuras, bases de código lidas de ponta a ponta, loops de agentes que precisam emitir um resultado grande, cargas de trabalho em que você quer entregar uma imagem por URL ou uma referência da Files API em vez de base64, e pipelines em que você precisa da Responses API, de continuação de prefixo ou de uma taxa publicada por token com a qual possa fazer orçamento. É também o único dos dois com um fornecedor que afirma paridade com seu próprio modelo de texto em tarefas de texto, o que importa se um modelo está substituindo dois na sua stack.
Escolha o Ling-3.0-flash-VL quando sua restrição vinculante é o custo por chamada e seu ciclo é curto: automação de GUI, inspeção repetida de capturas de tela, geração de front-end com um ciclo de renderizar e corrigir, verificações pontuais de documentos médicos ou financeiros em que você precisa de alta resolução por imagem e pode aceitar uma saída pequena. A contagem de 5,5B de parâmetros ativos é a razão para escolhê-lo, a licença MIT é a razão pela qual é seguro auto-hospedar, e o design do ciclo de feedback visual visa exatamente o padrão observar-agir-verificar-corrigir. Esteja ciente de que você está escolhendo um modelo sem preço definido, com um caminho de entrada gratuito e sem compromisso sobre o que vem depois.
E se o que você realmente precisa é de um modelo que leia imagens competentemente sem nenhum dos extremos — sem truque de esparsidade de 5,5B, sem janela de um milhão de tokens — então nenhum destes é a resposta interessante, e os modelos de visão intermediários comuns vão lhe servir melhor e mais barato do que qualquer um dos dois especialistas.
Executando-os, e onde nos encaixamos, honestamente.
O DeepSeek V4 Flash Vision Exp está no nosso catálogo. Pode chamá-lo através do endpoint compatível com OpenAI do OrcaRouter com a string de modelo deepseek/deepseek-v4-flash-vision-exp, na mesma chave que usa para tudo o resto, à tarifa publicada de $0,24/$0,73 sem nada acrescentado — o preço de tabela do fornecedor é repassado diretamente, por isso, se a DeepSeek reduzir a tarifa, esta chega até si no próprio dia, em vez de na próxima renovação de contrato. Se está a colocar um modelo de visão num percurso de produção pela primeira vez, este é o mais seguro dos dois para começar numa camada de encaminhamento, porque pode configurar uma cadeia de fallback para que um erro de um fornecedor seja repetido noutra rota antes de a sua resposta começar. Ninguém quer que a sua primeira chamada de visão em produção seja a que lhe ensina o que é a falha de um único fornecedor.

Ling-3.0-flash-VL não está no nosso catálogo, e não vamos sugerir o contrário. É possível acessá-lo por meio da própria plataforma da Ant, que publica um endpoint compatível com OpenAI e um compatível com Anthropic, por meio de acesso de teste gratuito no Ling Studio, e por meio dos pesos abertos no Hugging Face, que você mesmo pode servir com a receita publicada do SGLang ou com o fork próprio da Ant do vLLM. Uma coisa a verificar antes de investir nesse caminho: os exemplos de API da Ant usam o identificador Ling-3.0-flash-VL-rc1, um marcador de release candidate, e ainda não foi definido publicamente se o checkpoint servido corresponde aos pesos abertos. Se você fizer benchmark contra a API hospedada esperando que os números se transfiram para uma implantação BF16 auto-hospedada, teste essa suposição primeiro.

A síntese que resiste ao escrutínio: estas não são respostas rivais à mesma pergunta. DeepSeek V4 Flash Vision Exp é uma camada de percepção de contexto longo para agentes, com um preço publicado e uma ficha de benchmark relatada pelo fornecedor que se baseia em avaliações agênticas. Ling-3.0-flash-VL é um modelo de visão barato de servir, com uma pontuação independente genuína, um nível gratuito sem preço definido e um design voltado para curtos ciclos corretivos. Faça corresponder o formato da sua carga de trabalho ao formato do modelo, e o fato de apenas um deles ter uma pontuação independente no placar deve informar quanta importância você atribui ao marketing do outro.
A mesma chave alcança o resto do catálogo, e você pode navegar pelo catálogo completo de modelos para ver o que mais está por trás de um endpoint compatível com OpenAI.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
