Card hero editorial gerado, intitulado "Ling-3.1-flash vs Gemini 3.8 Flash", com o subtítulo "Um teste gratuito de 256K contra uma API de produção de 1M de tokens". Duas linhas de comparação trazem "Ling-3.1-flash: teste gratuito de duas semanas, contexto de 262.144 tokens, sem pesos publicados" e "Gemini 3.8 Flash: US$ 0,75 / US$ 3,75 por 1M de tokens, contexto de 1.048.576 tokens, entrada multimodal", acima de um rodapé que diz "Números da Ling informados pelo fornecedor; números da Gemini conforme OrcaRouter e Artificial Analysis."
Guides & Insights

Ling-3.1-flash vs Gemini 3.8 Flash: um modelo experimental de 256K contra um modelo ativo de 1M de tokens

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o Ling-3.1-flash e o Gemini 3.8 Flash lado a lado e a incompatibilidade não é sobre inteligência — é sobre estado. O Ling-3.1-flash, mixture-of-experts de ~560 bilhões de parâmetros do Ant Group anunciado em 29 e 30 de setembro de 2026, é um teste gratuito de duas semanas com contexto servido de 256K, limite de saída de 32.768 tokens, entrada somente de texto e sem pesos, licença ou preço publicados. O Gemini 3.8 Flash, modelo de raciocínio da linha Flash do Google lançado em 2 de setembro de 2026, é uma API de disponibilidade geral com uma janela completa de 1.048.576 tokens, saída de 65.536 tokens, entrada multimodal e uma tabela de preços pública. No papel, isso é uma comparação de dois modelos; na prática, é uma comparação entre um modelo no qual você pode construir hoje e outro que você só pode testar neste mês.

Isso não é razão para descartar o Ling-3.1-flash. Um MoE gratuito de 560B com uma veia agêntica vale duas semanas do tempo de avaliação de qualquer pessoa. Mas isso muda para que serve um confronto direto: não "qual devo adotar como padrão", mas "o modelo em teste é bom o suficiente para que eu deva me precaver quanto à resposta daqui a quinze dias?". Essas são perguntas diferentes, e elas têm respostas diferentes em cada eixo abaixo.

As três coisas que decidem isso antes de qualquer benchmark

A maioria das comparações começa com pontuações. Esta deveria começar com disponibilidade, porque a lacuna aí não é uma questão de grau.

• Preços — Ling-3.1-flash é gratuito durante toda a duração do seu período de teste e não tem nenhuma tabela de preços pós-teste publicada. Gemini 3.8 Flash está listado a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída durante o seu período promocional, revertendo para US$ 1,50 / US$ 7,50 em 1.º de janeiro de 2027. Preços de tabela informados pelo fornecedor; ambos estão sujeitos a alterações.

• Contexto — O Ling-3.1-flash oferece 262.144 tokens no teste, com 1.000.000 citados como meta final. O Gemini 3.8 Flash oferece a janela completa de 1.048.576 tokens hoje. Se sua carga de trabalho depende da janela de um milhão de tokens, apenas um desses dois a possui agora.

• Pesos — o Ling-3.1-flash não tem nenhum publicado: nenhum repositório, nenhuma licença, nenhum checkpoint, apenas a intenção declarada de abrir o código após o teste. O Gemini 3.8 Flash é fechado e sempre será, mas é uma API gerenciada que você pode chamar sem ambiguidade hoje.

Lidos em conjunto, esses três formam um único ponto: as vantagens de destaque do modelo Ling são ou promocionais (gratuitas) ou prospetivas (contexto de 1M, pesos abertos), enquanto as vantagens do modelo Gemini são contratuais. Essa assimetria atravessa tudo o que se segue.

Onde o modelo Ling realmente vence

Dois lugares, e ambos são reais.

O primeiro é o custo durante a avaliação. Um teste gratuito de duas semanas em um modelo desse porte não é um truque de marketing para descartar — é a forma mais barata de descobrir se uma mistura de especialistas de 560B lida com seus prompts. O Gemini 3.8 Flash, qualquer que seja o preço, não é gratuito, e uma avaliação séria ao longo de alguns milhares de chamadas custa dinheiro de verdade.

A segunda é a trajetória de abertura. O Ling-3.1-flash é o sucessor de um modelo que de fato lançou pesos com licença MIT, e a Ant declarou publicamente que pretende tornar este também open-source. Se isso se concretizar com uma licença permissiva, você ganha algo que o Gemini 3.8 Flash nunca poderá oferecer: a opção de auto-hospedar, fazer fine-tuning ou destilar um modelo base de 560B. O porém é justamente o que mais importa — você está apostando numa promessa, e a promessa da geração anterior foi cumprida com duas semanas de atraso, não como garantia.

Onde o Gemini 3.8 Flash não está nem perto de perder

Retire o julgamento e a questão da abertura e a comparação operacional fica desequilibrada em favor do Google.

• Entrada — Gemini 3.8 Flash aceita texto, imagem, vídeo, arquivo e áudio. Ling-3.1-flash aceita texto e retorna texto. Para fluxos de trabalho com documentos, capturas de tela ou vídeo, isto não é uma preferência, é um limite de capacidade.

• Teto de saída — 65.536 tokens versus 32.768. Relevante no momento em que você gera relatórios, arquivos de código ou saídas estruturadas longas em uma única passagem.

• Vazão — testes independentes colocam a velocidade mediana de saída do Gemini 3.8 Flash perto de 249 tokens por segundo, com a telemetria própria de sete dias da OrcaRouter medindo 552 tokens por segundo em um p50 de 4,95 segundos até o primeiro token. A hospedagem de teste do Ling-3.1-flash foi reportada em cerca de 63 tokens por segundo. O modelo Gemini está em uma classe de velocidade diferente.

• Profundidade de referência — o Gemini 3.8 Flash tem um conjunto de medições independentes que o respaldam; os números do Ling-3.1-flash são todos de origem própria, em um endpoint totalmente novo, sem que nenhum terceiro os tenha reexecutado até o momento.

• Agentes multimodais — qualquer coisa que precise ler uma captura de tela, um PDF ou uma chamada gravada é uma tarefa do Gemini por construção, não por qualidade.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Benchmarks, e por que os dois conjuntos não são realmente comparáveis

O caso reportado pelo fornecedor para o Ling-3.1-flash é um agregado de 81,0 em cinco benchmarks de agentes, com 40,4% no Terminal-Bench 4.0, 55,9% no SWE-Atlas e 65,35% no HealthBench Professional; o próprio relato da Ant acrescenta 1.673 de Elo no GDPVal-AA v2.1 e 75,16 no FrontierSWE. Cada um desses é uma medição da própria Ant. Não há nenhum harness publicado e, mais relevante ainda, não há pesos para que alguém possa executar novamente a suíte.

O quadro do Gemini 3.8 Flash é de natureza diferente. No build atual do Intelligence Index da Artificial Analysis (v4.3.2), ele alcança 40,9 com esforço de raciocínio alto, 39,8 com esforço médio e 33,5 com esforço baixo — e vale a pena assinalar que o índice foi revisto recentemente, pelo que os números publicados sobre este modelo no início do outono foram calculados com um build diferente e não são diretamente comparáveis a estes. As afirmações da própria Google para o modelo incluem 54,9 no HLE-Verified e fortes resultados no Terminal-Bench 2.1, na casa dos 80 altos. Números independentes e do fornecedor, lado a lado, ambos legítimos, nenhum intercambiável.

Há uma comparação cruzada clara que vale a pena fazer, porque ambos estão na mesma família de benchmarks. No Terminal-Bench 4.0, o valor divulgado pelo fornecedor para o Ling-3.1-flash é 40,4%. O Claude Sonnet 5.5 — um modelo de médio porte, não um modelo de ponta — obtém 70,6% nessa mesma versão. Essa única linha é o argumento mais forte contra interpretar a ficha da Ant como "próxima da fronteira": o modelo é competitivo nas medidas agênticas que a Ant escolheu destacar e claramente atrás na medida de codificação em terminal para a qual existe um número externo.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

A forma prática da escolha

Se você precisa construir algo nas próximas duas semanas, a resposta não é nem de perto, e isso não é uma crítica ao Ling-3.1-flash. O Gemini 3.8 Flash é o único dos dois que oferece um endpoint estável, um preço publicado, uma janela completa de um milhão de tokens, entrada multimodal e uma licença que você pode ler. É um modelo de nível Flash para produção.

Ling-3.1-flash é um alvo de avaliação. Seu valor neste momento é que a avaliação é gratuita e o modelo é interessante: um MoE de 560B com ~25B ativos por token é uma aposta na esparsidade, e a Ant o posicionou exatamente para as cargas de trabalho de agente, busca e automação de escritório pelas quais os modelos de nível Flash competem. Executar seus próprios prompts nele durante a janela de teste vale a pena justamente porque ninguém fora da Ant fez isso ainda — você estaria entre os primeiros a ter uma opinião não externa.

A árvore de decisão que faz sentido este mês: direcione a produção para o Gemini 3.8 Flash, use o teste gratuito para rodar o Ling-3.1-flash com seus prompts mais difíceis, e mantenha a questão dos pesos abertos como a verdadeira bifurcação. Se os pesos chegarem permissivos e um preço ficar próximo do nível do Flash, o Ling-3.1-flash se torna uma segunda opção genuína — uma que você pode auto-hospedar, o que o Gemini nunca será. Se eles chegarem com restrições, o teste termina e a comparação também.

Executando ambos a partir de uma única chave, e sendo franco sobre o que está faltando

O Gemini 3.8 Flash está hoje no catálogo OrcaRouter sob o ID de modelo google/gemini-3.8-flash, ao preço de tabela do próprio Google, sem qualquer margem acrescida — por isso, quando a tarifa promocional reverter em janeiro, o preço que paga aqui acompanha-o automaticamente, sem precisar de um novo contrato. O DeepSeek-V4.1-Flash, o outro modelo barato de nível Flash que vale a pena medir na mesma experiência, encontra-se no mesmo catálogo ao preço de tabela do respetivo fornecedor, pelo que um teste triplo do modelo experimental contra opções de nível Flash já estabelecidas é executado através de uma única chave de API com failover automático entre eles.

Ling-3.1-flash não está no nosso catálogo, e uma consulta à nossa API pública de modelos retorna não encontrado tanto para ele quanto para a geração anterior — portanto, a formulação honesta é que o teste é executado onde for possível, por meio da própria interface do fornecedor e de plataformas de inferência de terceiros, e não reivindicamos hospedá-lo. Essa é a parte desta comparação que pode mudar mais rapidamente: um modelo em teste gratuito com preço não anunciado é exatamente o tipo de coisa que entra numa camada de roteamento no momento em que a Ant e seus provedores de hospedagem publicam uma tabela de preços, e a repassagem sem margem alguma significa que, no dia em que isso acontecer, o preço aqui será o preço lá.

Portanto, o veredito é mais restrito do que as contagens de parâmetros sugerem. O Ling-3.1-flash é o modelo mais ambicioso e o resultado de pesquisa mais interessante; o Gemini 3.8 Flash é aquele com o qual dá para lançar. Enquanto não houver uma licença e um preço, é essa toda a diferença — e não é uma que uma linha de benchmark resolverá.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente