Cartão de título principal para 'Ling-3.1-flash vs DeepSeek V4.1 Flash', com o subtítulo 'Dois pontos de índice, o triplo da fatura'. Dois cartões arredondados ficam lado a lado com um espaçamento nítido: o da esquerda, rotulado 'Ling-3.1-flash', exibe 'Índice AA: 41', 'Custo por tarefa: $0.99', 'Pesos: fechados'; o da direita, rotulado 'DeepSeek V4.1 Flash (Max)', exibe 'Índice AA: 39', 'Custo por tarefa: $0.27', 'Pesos: MIT'. Uma linha de rodapé diz 'Custos e valores de índice conforme a Artificial Analysis.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Ling-3.1-flash vs. DeepSeek V4.1 Flash: dois pontos no índice, três vezes a fatura

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ling-3.1-flash e DeepSeek V4.1 Flash (Max) estão a dois pontos de distância no Artificial Analysis Intelligence Index — 41 contra 39 — e não estão nem perto um do outro em preço. Execute as dez avaliações que compõem esse índice para cada modelo, e o Ling-3.1-flash custa cerca de US$ 0,99 por tarefa, contra US$ 0,27 do DeepSeek. Ambos são modelos mixture-of-experts de ~550 bilhões de parâmetros com um contexto declarado de 1M de tokens. Um deles é um modelo fechado, somente texto, do laboratório InclusionAI do Ant Group, lançado em 2026-10-01 e ainda sem pesos publicados ou licença. O outro está aberto sob a licença MIT desde 2026-09-10, aceita imagens e texto, roda em 23 provedores e é o modelo que a maioria das equipes já teria em um arquivo de configuração. A comparação não é nem de longe acirrada na maioria dos eixos. A pergunta interessante é por que esses dois pontos existem, afinal.

Onde o Ling-3.1-flash está genuinamente à frente

Ele está à frente nas avaliações que medem operar um terminal e escrever código que precisa rodar, e a margem merece ser declarada com precisão justamente porque o agregado a esconde.

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs DeepSeek V4.1 Flash (Max) 0.268. Ambos são números modestos em termos absolutos; a diferença é um quarto da pontuação do DeepSeek.

• SciCode — 0,541 vs 0,519.

• Raciocínio em física do CritPt — 0,180 vs 0,143.

• Trabalho agêntico do mundo real do GDPval-AA — 1.621,75 Elo vs. 1.600 Elo.

Dois desses quatro estão quase empatados, um é uma vitória apertada, e o Terminal-Bench 4.0 é a única linha em que a diferença sobreviveria a uma mudança de seed. Compare isso com os pontos em que o DeepSeek vence: trabalho de conhecimento agêntico do AA-Briefcase v1.1 com 1.420,47 Elo contra 1.400,35, AutomationBench-AA com 0,689 contra 0,617, raciocínio de contexto longo do AA-LCR com 0,84 contra 0,83 e — a linha que mais importa para produção — AA-Omniscience com −5,30 contra +2,22 do Ling-3.1-flash numa medida em que uma alucinação é pior do que uma recusa. A precisão do DeepSeek ali é de 46,4%, com uma taxa de alucinação de 96,5% entre as perguntas que ele responde; o Ling-3.1-flash responde corretamente a 29,1%, com uma taxa de alucinação de 37,9%. Nenhum dos dois é um modelo que se aponte para uma base de conhecimento sem retrieval à frente.

A diferença de preços é maior do que a diferença do índice, e não se trata apenas da tabela de tarifas.

As tarifas anunciadas parecem quase idênticas. A Artificial Analysis registra ambas em US$ 0,30 por milhão de tokens de entrada. Elas divergem acentuadamente nos outros dois números:

• Saída — Ling-3.1-flash $0,90 por milhão vs. DeepSeek V4.1 Flash (Max) $1,20 por milhão. Aqui, o Ling-3.1-flash é o modelo mais barato de forma absoluta, em 25%.

• Leitura de cache — Ling-3.1-flash US$ 0,06 por milhão vs. DeepSeek V4.1 Flash (Max) US$ 0,006 por milhão, um desconto de 98% contra um de 80%. É aqui que os dois modelos deixam de ser comparáveis.

A taxa combinada em uma mistura 7:2:1 de acertos de cache/entrada/saída fica em US$ 0,192 para o Ling-3.1-flash e US$ 0,184 para o DeepSeek V4.1 Flash (Max) — quase sem diferença. Mas a combinação é uma suposição sobre como você usa um modelo, e essa suposição tem um peso enorme. Qualquer carga de trabalho com reaproveitamento intenso de prompt — um prompt de sistema longo, um preâmbulo de recuperação, um loop de agente que reenvia o acumulado a cada turno — empurra a mistura efetiva na direção de leituras de cache, e aí a diferença de 10× no preço do cache passa a dominar. O volume de tokens intensifica isso da mesma forma: o Ling-3.1-flash é um raciocinador verboso, gerando 220 milhões de tokens de saída nas avaliações do índice, contra 250 milhões do DeepSeek, e com média de aproximadamente 357 segundos por tarefa de avaliação, contra 285 do DeepSeek. Ele pensa mais por resposta e leva mais tempo fazendo isso.

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Um exemplo prático: o mesmo loop de agente em ambos

Considere um agente que usa ferramentas e que executa 1M de tokens de entrada por tarefa, com 90% deles servidos pelo cache, e retorna 200.000 tokens de saída. No Ling-3.1-flash, com os valores acima: 900.000 tokens de entrada em cache a US$ 0,06 mais 100.000 tokens de entrada novos a US$ 0,30 mais 200.000 tokens de saída a US$ 0,90 chega a cerca de US$ 0,26 por tarefa. O mesmo loop no DeepSeek V4.1 Flash (Max) fica em cerca de US$ 0,14 — aproximadamente metade.

Agora aplique o cronograma da DeepSeek, porque é esta a parte que a maioria das comparações ignora. A tarifa fora de pico da DeepSeek é a que está acima, e o fora de pico abrange os fins de semana e a maior parte do dia; mas, durante duas janelas de dias úteis, 01:00–04:00 e 06:00–10:00 UTC, o preço de entrada e de cache dobra. Mova o mesmo loop para uma janela de pico e o custo da DeepSeek fica perto de US$ 0,28 — e, nesse ponto, a tabela de preços fixa e mais alta do Ling-3.1-flash é a opção mais barata para essa hora, e o desconto de cache de 10× foi neutralizado pelo relógio.

Toda a decisão está em um único par de números. Se o tráfego dos seus agentes for intensivo em cache e você puder agendá-lo, o DeepSeek V4.1 Flash (Max) custa aproximadamente metade do Ling-3.1-flash por uma diferença de dois pontos no índice. Se o seu tráfego for intensivo em cache e cair nas janelas de pico da DeepSeek, os dois modelos custam aproximadamente o mesmo, e a linha ligeiramente melhor do Ling-3.1-flash para agente de terminal se torna o critério de desempate.

Os eixos onde não há comparação a fazer

Três dimensões não são próximas, e são elas que tendem a decidir uma arquitetura antes que o preço seja discutido.

• Pesos e licença — o Ling-3.1-flash não publicou os pesos, não tem texto de licença, e a Artificial Analysis o classifica como proprietário. O DeepSeek V4.1 Flash (Max) tem pesos abertos sob a licença MIT, pode ser baixado do Hugging Face, com uso comercial permitido. Um deles pode ser auto-hospedado, ajustado com fine-tuning e isolado em air-gap; o outro não.

• Modalidade — Ling-3.1-flash é texto de entrada, texto de saída. DeepSeek V4.1 Flash (Max) aceita imagens junto com texto e é avaliado em benchmarks multimodais. Se qualquer parte do seu pipeline entregar ao modelo uma captura de tela, um gráfico ou uma digitalização, a comparação termina aí.

• Superfície de serviço — DeepSeek V4.1 Flash (Max) está disponível por meio de 23 provedores, incluindo OrcaRouter; Ling-3.1-flash é executado pela própria API do fornecedor e por plataformas de terceiros que veiculam seu lançamento. Para um caminho de produção, a contagem de provedores é uma propriedade de resiliência, não um concurso de popularidade.

Mais uma assimetria que não aparece em nenhuma dessas listas: o DeepSeek V4.1 Flash (Max) expõe 384.000 tokens de saída em uma única resposta. A Ant não publicou um comprimento máximo de saída para o Ling-3.1-flash, então uma carga de trabalho de geração longa ainda não pode ser dimensionada com base nele. A ausência de um limite publicado não é o mesmo que um limite pequeno, mas também não é um número com o qual se possa projetar.

Executando ambos, e como isso realmente se parece

O Ling-3.1-flash não está no catálogo do OrcaRouter hoje — uma consulta à nossa API pública de modelos retorna não encontrado para o modelo em InclusionAI, e este artigo não vai fingir o contrário. O DeepSeek V4.1 Flash pode ser roteado agora mesmo pelo preço de tabela do provedor com zero markup, então uma mudança de preço do fornecedor entra no ar do nosso lado no mesmo dia em que acontece, e ele fica atrás da mesma chave de API única que o restante do catálogo, com failover automático entre provedores upstream.

Essa assimetria tem uma forma prática. A maneira sensata de fazer uma comparação em que um modelo é fechado, custa cerca de quatro vezes o seu antecessor e é acessível através de um único fornecedor é manter o modelo aberto e amplamente servido como o caminho padrão e tratar o desafiante como algo que se testa, em vez de algo com que se compromete. O DeepSeek V4.1 Flash (Max) pode sustentar o loop de produção hoje — pesos abertos, entrada de imagem, saída de 384K, um desconto de cache de 98% — enquanto o Ling-3.1-flash fica com o trabalho específico de agente, onde as suas margens no Terminal-Bench e no SciCode realmente se aplicam. Como ambos falam o formato chat-completions compatível com OpenAI, essa divisão é uma decisão de roteamento, e não um projeto de integração: um endpoint, uma chave e uma regra que envia as tarefas nas quais cada modelo é mensuravelmente melhor.

O veredito

Com base nas evidências disponíveis, o DeepSeek V4.1 Flash (Max) vence este confronto, e vence principalmente por coisas que não têm nada a ver com dois pontos do Index: pesos abertos sob MIT, entrada de imagem, 384.000 tokens de saída, um desconto de cache de 98% e 23 provedores entre os quais fazer failover. O argumento do Ling-3.1-flash é mais restrito e real — ele é o melhor agente de terminal e ferramentas dos dois, e é o único do par que não publicou uma tabela de tarifas com um multiplicador de horário de pico embutido.

Duas coisas mudariam esta avaliação. Se a Ant publicar os pesos sob uma licença permissiva, a lacuna de abertura se fecha e a comparação se torna uma conversa direta sobre capacidade e custo. E se a janela de contexto longo servida da Ant for validada nos 1M de tokens que ambos os modelos declaram, a alegação de paridade de contexto deixa de ser uma alegação. Até lá, o resumo honesto é que um modelo pode ganhar uma linha de benchmark agêntico e ainda assim perder a avaliação — e que a diferença de dois pontos no índice entre estes modelos vale aproximadamente 3,6× o custo por tarefa, uma troca que só uma carga de trabalho específica deve fazer.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.