
Ling-3.1-flash vs Gemini 3.8 Flash: um modelo experimental de 256K contra um modelo ativo de 1M de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Coloque o Ling-3.1-flash e o Gemini 3.8 Flash lado a lado e a incompatibilidade não é sobre inteligência — é sobre estado. O Ling-3.1-flash, mixture-of-experts de ~560 bilhões de parâmetros do Ant Group anunciado em 29 e 30 de setembro de 2026, é um teste gratuito de duas semanas com contexto servido de 256K, limite de saída de 32.768 tokens, entrada somente de texto e sem pesos, licença ou preço publicados. O Gemini 3.8 Flash, modelo de raciocínio da linha Flash do Google lançado em 2 de setembro de 2026, é uma API de disponibilidade geral com uma janela completa de 1.048.576 tokens, saída de 65.536 tokens, entrada multimodal e uma tabela de preços pública. No papel, isso é uma comparação de dois modelos; na prática, é uma comparação entre um modelo no qual você pode construir hoje e outro que você só pode testar neste mês.
Isso não é razão para descartar o Ling-3.1-flash. Um MoE gratuito de 560B com uma veia agêntica vale duas semanas do tempo de avaliação de qualquer pessoa. Mas isso muda para que serve um confronto direto: não "qual devo adotar como padrão", mas "o modelo em teste é bom o suficiente para que eu deva me precaver quanto à resposta daqui a quinze dias?". Essas são perguntas diferentes, e elas têm respostas diferentes em cada eixo abaixo.
As três coisas que decidem isso antes de qualquer benchmark
A maioria das comparações começa com pontuações. Esta deveria começar com disponibilidade, porque a lacuna aí não é uma questão de grau.
• Preços — Ling-3.1-flash é gratuito durante toda a duração do seu período de teste e não tem nenhuma tabela de preços pós-teste publicada. Gemini 3.8 Flash está listado a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída durante o seu período promocional, revertendo para US$ 1,50 / US$ 7,50 em 1.º de janeiro de 2027. Preços de tabela informados pelo fornecedor; ambos estão sujeitos a alterações.
• Contexto — O Ling-3.1-flash oferece 262.144 tokens no teste, com 1.000.000 citados como meta final. O Gemini 3.8 Flash oferece a janela completa de 1.048.576 tokens hoje. Se sua carga de trabalho depende da janela de um milhão de tokens, apenas um desses dois a possui agora.
• Pesos — o Ling-3.1-flash não tem nenhum publicado: nenhum repositório, nenhuma licença, nenhum checkpoint, apenas a intenção declarada de abrir o código após o teste. O Gemini 3.8 Flash é fechado e sempre será, mas é uma API gerenciada que você pode chamar sem ambiguidade hoje.
Lidos em conjunto, esses três formam um único ponto: as vantagens de destaque do modelo Ling são ou promocionais (gratuitas) ou prospetivas (contexto de 1M, pesos abertos), enquanto as vantagens do modelo Gemini são contratuais. Essa assimetria atravessa tudo o que se segue.
Onde o modelo Ling realmente vence
Dois lugares, e ambos são reais.
O primeiro é o custo durante a avaliação. Um teste gratuito de duas semanas em um modelo desse porte não é um truque de marketing para descartar — é a forma mais barata de descobrir se uma mistura de especialistas de 560B lida com seus prompts. O Gemini 3.8 Flash, qualquer que seja o preço, não é gratuito, e uma avaliação séria ao longo de alguns milhares de chamadas custa dinheiro de verdade.
A segunda é a trajetória de abertura. O Ling-3.1-flash é o sucessor de um modelo que de fato lançou pesos com licença MIT, e a Ant declarou publicamente que pretende tornar este também open-source. Se isso se concretizar com uma licença permissiva, você ganha algo que o Gemini 3.8 Flash nunca poderá oferecer: a opção de auto-hospedar, fazer fine-tuning ou destilar um modelo base de 560B. O porém é justamente o que mais importa — você está apostando numa promessa, e a promessa da geração anterior foi cumprida com duas semanas de atraso, não como garantia.
Onde o Gemini 3.8 Flash não está nem perto de perder
Retire o julgamento e a questão da abertura e a comparação operacional fica desequilibrada em favor do Google.
• Entrada — Gemini 3.8 Flash aceita texto, imagem, vídeo, arquivo e áudio. Ling-3.1-flash aceita texto e retorna texto. Para fluxos de trabalho com documentos, capturas de tela ou vídeo, isto não é uma preferência, é um limite de capacidade.
• Teto de saída — 65.536 tokens versus 32.768. Relevante no momento em que você gera relatórios, arquivos de código ou saídas estruturadas longas em uma única passagem.
• Vazão — testes independentes colocam a velocidade mediana de saída do Gemini 3.8 Flash perto de 249 tokens por segundo, com a telemetria própria de sete dias da OrcaRouter medindo 552 tokens por segundo em um p50 de 4,95 segundos até o primeiro token. A hospedagem de teste do Ling-3.1-flash foi reportada em cerca de 63 tokens por segundo. O modelo Gemini está em uma classe de velocidade diferente.
• Profundidade de referência — o Gemini 3.8 Flash tem um conjunto de medições independentes que o respaldam; os números do Ling-3.1-flash são todos de origem própria, em um endpoint totalmente novo, sem que nenhum terceiro os tenha reexecutado até o momento.
• Agentes multimodais — qualquer coisa que precise ler uma captura de tela, um PDF ou uma chamada gravada é uma tarefa do Gemini por construção, não por qualidade.

Benchmarks, e por que os dois conjuntos não são realmente comparáveis
O caso reportado pelo fornecedor para o Ling-3.1-flash é um agregado de 81,0 em cinco benchmarks de agentes, com 40,4% no Terminal-Bench 4.0, 55,9% no SWE-Atlas e 65,35% no HealthBench Professional; o próprio relato da Ant acrescenta 1.673 de Elo no GDPVal-AA v2.1 e 75,16 no FrontierSWE. Cada um desses é uma medição da própria Ant. Não há nenhum harness publicado e, mais relevante ainda, não há pesos para que alguém possa executar novamente a suíte.
O quadro do Gemini 3.8 Flash é de natureza diferente. No build atual do Intelligence Index da Artificial Analysis (v4.3.2), ele alcança 40,9 com esforço de raciocínio alto, 39,8 com esforço médio e 33,5 com esforço baixo — e vale a pena assinalar que o índice foi revisto recentemente, pelo que os números publicados sobre este modelo no início do outono foram calculados com um build diferente e não são diretamente comparáveis a estes. As afirmações da própria Google para o modelo incluem 54,9 no HLE-Verified e fortes resultados no Terminal-Bench 2.1, na casa dos 80 altos. Números independentes e do fornecedor, lado a lado, ambos legítimos, nenhum intercambiável.
Há uma comparação cruzada clara que vale a pena fazer, porque ambos estão na mesma família de benchmarks. No Terminal-Bench 4.0, o valor divulgado pelo fornecedor para o Ling-3.1-flash é 40,4%. O Claude Sonnet 5.5 — um modelo de médio porte, não um modelo de ponta — obtém 70,6% nessa mesma versão. Essa única linha é o argumento mais forte contra interpretar a ficha da Ant como "próxima da fronteira": o modelo é competitivo nas medidas agênticas que a Ant escolheu destacar e claramente atrás na medida de codificação em terminal para a qual existe um número externo.

A forma prática da escolha
Se você precisa construir algo nas próximas duas semanas, a resposta não é nem de perto, e isso não é uma crítica ao Ling-3.1-flash. O Gemini 3.8 Flash é o único dos dois que oferece um endpoint estável, um preço publicado, uma janela completa de um milhão de tokens, entrada multimodal e uma licença que você pode ler. É um modelo de nível Flash para produção.
Ling-3.1-flash é um alvo de avaliação. Seu valor neste momento é que a avaliação é gratuita e o modelo é interessante: um MoE de 560B com ~25B ativos por token é uma aposta na esparsidade, e a Ant o posicionou exatamente para as cargas de trabalho de agente, busca e automação de escritório pelas quais os modelos de nível Flash competem. Executar seus próprios prompts nele durante a janela de teste vale a pena justamente porque ninguém fora da Ant fez isso ainda — você estaria entre os primeiros a ter uma opinião não externa.
A árvore de decisão que faz sentido este mês: direcione a produção para o Gemini 3.8 Flash, use o teste gratuito para rodar o Ling-3.1-flash com seus prompts mais difíceis, e mantenha a questão dos pesos abertos como a verdadeira bifurcação. Se os pesos chegarem permissivos e um preço ficar próximo do nível do Flash, o Ling-3.1-flash se torna uma segunda opção genuína — uma que você pode auto-hospedar, o que o Gemini nunca será. Se eles chegarem com restrições, o teste termina e a comparação também.
Executando ambos a partir de uma única chave, e sendo franco sobre o que está faltando
O Gemini 3.8 Flash está hoje no catálogo OrcaRouter sob o ID de modelo google/gemini-3.8-flash, ao preço de tabela do próprio Google, sem qualquer margem acrescida — por isso, quando a tarifa promocional reverter em janeiro, o preço que paga aqui acompanha-o automaticamente, sem precisar de um novo contrato. O DeepSeek-V4.1-Flash, o outro modelo barato de nível Flash que vale a pena medir na mesma experiência, encontra-se no mesmo catálogo ao preço de tabela do respetivo fornecedor, pelo que um teste triplo do modelo experimental contra opções de nível Flash já estabelecidas é executado através de uma única chave de API com failover automático entre eles.
Ling-3.1-flash não está no nosso catálogo, e uma consulta à nossa API pública de modelos retorna não encontrado tanto para ele quanto para a geração anterior — portanto, a formulação honesta é que o teste é executado onde for possível, por meio da própria interface do fornecedor e de plataformas de inferência de terceiros, e não reivindicamos hospedá-lo. Essa é a parte desta comparação que pode mudar mais rapidamente: um modelo em teste gratuito com preço não anunciado é exatamente o tipo de coisa que entra numa camada de roteamento no momento em que a Ant e seus provedores de hospedagem publicam uma tabela de preços, e a repassagem sem margem alguma significa que, no dia em que isso acontecer, o preço aqui será o preço lá.
Portanto, o veredito é mais restrito do que as contagens de parâmetros sugerem. O Ling-3.1-flash é o modelo mais ambicioso e o resultado de pesquisa mais interessante; o Gemini 3.8 Flash é aquele com o qual dá para lançar. Enquanto não houver uma licença e um preço, é essa toda a diferença — e não é uma que uma linha de benchmark resolverá.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
