Cartão de título hero para 'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' com o subtítulo 'Grátis não é barato — o atual líder ainda é a aposta segura' e dois cartões de estatísticas: Ling 3.0 Tiny (AA Index 23, muito verboso, grátis até 14 de agosto) e Gemini 3.5 Flash-Lite (AA Index 36, ~490 tok/s, $0,30 / $2,50). Logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: Grátis Não É Barato, e o Atual Ainda É a Aposta Segura.

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

"Grátis" é a palavra mais cara do vocabulário do mercado de modelos, porque normalmente significa que alguém está prestes a cobrar algo além do preço de etiqueta. Essa é a armadilha escondida no confronto entre o Ling 3.0 Tiny, o novo modelo de raciocínio MoE de 7,9B parâmetros da Ant Group InclusionAI, e o Gemini 3.5 Flash-Lite, o nível Gemini atual mais barato e mais rápido do Google. O Ling 3.0 Tiny está com chamadas gratuitas agora e custa $0,06 / $0,18 por milhão de tokens após a promoção de 14 de agosto — mas a Artificial Analysis mediu que ele queima 210M de tokens de saída apenas para pontuar sua classe de 56 modelos, contra uma mediana de 63M, e o classificou como "muito verboso". O Gemini 3.5 Flash-Lite custa cinco vezes mais por token, a $0,30 / $2,50, porém carrega um Índice de Inteligência independente de 36 — 13 pontos acima do Ling 3.0 Tiny — e velocidade de saída em torno de 490 tokens por segundo. O preço mais barato, o falante mais rápido e a pontuação mais baixa são todos o mesmo modelo. Essa é toda a história desta comparação e toda a razão para pensar duas vezes antes de optar pelo novato apenas pelo preço.

Ambos os modelos estão na camada econômica, mas em pontos diferentes do seu ciclo de vida. O Gemini 3.5 Flash-Lite é o incumbente maduro: lançado em 21 de julho de 2026, reavaliado continuamente por terceiros e amplamente implantado como a camada padrão para trabalho agêntico de alto volume e sensível à latência. O Ling 3.0 Tiny tem uma semana de vida, preço pensado para atrair usuários e foi avaliado exatamente uma vez. Este artigo separa o que cada modelo realmente é, o que os números independentes dizem e por que o preço "grátis" é o número menos útil da comparação.

Ling 3.0 Tiny, a novata com um medidor

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, o atual

O Gemini 3.5 Flash-Lite é a resposta do Go​ogle à mesma pergunta, lançado um nível abaixo na linha Gemini 3.5. É nativamente multimodal na entrada — texto, imagens, vídeo, áudio e arquivos — com saída de texto, janela de contexto de 1M tokens, até 64K tokens de saída e esforço de raciocínio configurável (mínimo, baixo, alto), para que um pipeline possa ajustar a profundidade, e a conta, por solicitação. Sua pontuação independente é um salto geracional real: Artificial Analysis Intelligence Index 36, classificado em #12 entre 151 modelos rastreados, acima dos 25 do Gemini 3.1 Flash-Lite. Em velocidade, é o modelo mais rápido da série 3.5 — o Go​ogle citou 350 tokens de saída por segundo no lançamento, e a página ao vivo da AA mediu cerca de 490 tokens por segundo, classificado em #2 entre os modelos rastreados. Seus números agênticos relatados pelo fornecedor — 74,0% no OSWorld-Verified, 54% no Terminal-Bench 2.1, 72,2% em um teste de recuperação multi-agulha de 128K tokens — são do próprio Go​ogle e direcionais, não dogmas, e uma questão em aberto (computer-use listado como integrado no blog do Go​ogle, mas sem suporte na documentação da API) vale a pena conferir antes de depender disso.

Também não é barato, por token, para a sua categoria. O nome "Lite" descreve o lugar do modelo na linha, não um preço em queda: Gemini 2.5 Flash-Lite custava US$ 0,10 / US$ 0,40, 3.1 Flash-Lite custava US$ 0,25 / US$ 1,50, e 3.5 Flash-Lite custa US$ 0,30 / US$ 2,50 por milhão de tokens, com entrada em cache a US$ 0,03. O ganho de eficiência vem da velocidade e da economia de tokens, e as medições da própria Artificial Analysis mostram que o custo real por tarefa praticamente dobrou de geração para geração, mesmo com o tempo por tarefa reduzido pela metade.

O placar independente, lido no contexto

Coloque os dois modelos no mesmo índice e a diferença é gritante: Gemini 3.5 Flash-Lite com 36, Ling 3.0 Tiny com 23. Mas essa comparação de manchete é apenas metade do quadro, porque os dois modelos não são avaliados no mesmo campo. A AA coloca o Ling 3.0 Tiny em #6 de 56 em sua classe de modelos tiny, contra uma mediana de classe de 8 — bem acima da média para um modelo de seu tamanho. O Gemini 3.5 Flash-Lite está em #12 de 151 no conjunto monitorado mais amplo. Um é um modelo tiny excepcional; o outro é um modelo econômico sólido no pool aberto. Ambas as afirmações são verdadeiras e significam coisas diferentes. O Ling 3.0 Tiny oferece um melhor custo-benefício para sua classe de tamanho do que o Gemini 3.5 Flash-Lite para seu nível — e o Gemini 3.5 Flash-Lite ainda é o modelo mais capaz por uma ampla margem na mesma escala independente.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

As dimensões, uma linha cada:

• Pontuação independente — Ling 3.0 Tiny AA Index 23 (#6/56, mediana da classe 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• Preço — Ling 3.0 Tiny $0.06 / $0.18 por 1M após uma promoção gratuita vs Gemini 3.5 Flash-Lite $0.30 / $2.50 por 1M (entrada em cache $0.03).

• Verbosidade — Ling 3.0 Tiny 210M tokens de saída durante a execução do índice vs Gemini 3.5 Flash-Lite medido, mas não verboso por essa métrica.

• Modalidade — Ling 3.0 Tiny somente texto vs Gemini 3.5 Flash-Lite texto, imagem, vídeo, áudio e entrada de arquivos.

• Contexto — 256K no Ling 3.0 Tiny vs 1M no Gemini 3.5 Flash-Lite, com saída máxima de 64K em ambos.

• Velocidade — Ling 3.0 Tiny ~90–264 tokens/s nos endpoints que publicaram um número vs Gemini 3.5 Flash-Lite ~490 tokens/s na medição ao vivo da AA.

A linha de velocidade é a mais provável de mudar. A velocidade de saída do Ling 3.0 Tiny está genuinamente indefinida: a Artificial Analysis a lista como N/A, enquanto a Vercel anuncia 264 tokens/segundo. Os ~490 tokens/segundo do Gemini 3.5 Flash-Lite são uma medição AA ao vivo, feita bem depois que a volatilidade do lançamento se estabilizou. Para um nível sensível à latência, essa é a diferença entre uma quantidade conhecida e uma questão em aberto.

A economia da verbosidade: por que grátis não é barato

Aqui está a aritmética que normalmente decide essa disputa. Execute a mesma tarefa com uso intenso de raciocínio — digamos, 4.000 tokens de entrada, 2.000 tokens de saída — nos dois modelos depois que a promoção do Ling 3.0 Tiny terminar. O Ling 3.0 Tiny cobra (4.000 × $0,06 + 2.000 × $0,18) / 1.000.000, cerca de $0,0006. O Gemini 3.5 Flash-Lite cobra (4.000 × $0,30 + 2.000 × $2,50) / 1.000.000, cerca de $0,0062. Com contagens de tokens idênticas, o Ling 3.0 Tiny é 10x mais barato. Depois, acrescente a verbosidade: um modelo de raciocínio que emite tokens de pensamento como saída não produz contagens de tokens idênticas. Se a proporção de verbosidade de 210M contra 63M do Ling 3.0 Tiny se mantiver na sua carga de trabalho, o custo efetivo por tarefa praticamente triplica no lado da saída, e a vantagem de 10x encolhe para 3–4x. Ainda é mais barato — mas não é mais gratuito, e não está no mesmo nível que o número 210M faz parecer.

De forma honesta, os dois modelos não são substitutos com a mesma qualidade. O 23 do Ling 3.0 Tiny é uma pontuação excepcional para um modelo com 1,3B de parâmetros ativos; o 36 do Gemini 3.5 Flash-Lite está em outra liga de capacidade, além de visão, contexto de 1M e velocidade consolidada. Você paga por essa diferença — cinco vezes o preço por token, e mais por tarefa quando se consideram as diferenças de velocidade — mas é uma lacuna real de capacidade, não de marketing. Se sua carga de trabalho se contenta com a qualidade do modelo mais barato, o Ling 3.0 Tiny é o melhor custo-benefício. Se sua carga de trabalho precisa da capacidade, nenhuma vantagem de preço fecha a lacuna.

Onde um roteador mostra seu valor

Este é precisamente o tipo de carga de trabalho em que uma camada de roteamento supera o compromisso com um único modelo, e os fatos de hospedagem importam para como você a constrói. O Gemini 3.5 Flash-Lite está disponível no OrcaRouter ao preço de tabela do provedor — US$ 0,30 de entrada / US$ 2,50 de saída por 1M, repassado com margem de 0%, então o número na tabela de preços do Google é o número do nosso lado, e qualquer redução futura de preço entra em vigor no mesmo dia. Ele está por trás do mesmo endpoint compatível com OpenAI que outros 200+ modelos, com failover automático entre provedores para quando um provedor base degrada no meio da execução, e o DSL de roteamento pode enviar um prompt para vários modelos e manter a melhor resposta.

O Ling 3.0 Tiny não está no OrcaRouter; ele é servido por endpoints próprios e hoje está gratuito. Essa combinação, na verdade, fortalece a tese do roteamento em vez de enfraquecê-la. Aproveite a janela gratuita para avaliar o Ling 3.0 Tiny com o seu próprio tráfego antes que ele passe a custar dinheiro. Depois, construa o caminho de produção na camada hospedada — Gemini 3.5 Flash-Lite para as chamadas que precisam de visão, contexto longo ou um perfil de velocidade estável, com a camada de roteamento livre para escalar para um modelo mais caro na minoria difícil. Uma camada gratuita é um ótimo experimento e uma dependência frágil; a camada hospedada é a base sobre a qual você pode construir um produto. No OrcaRouter, você pode rodar os dois no mesmo grafo — Ling 3.0 Tiny por endpoint direto, Gemini 3.5 Flash-Lite por chave — e deixar o roteador decidir por requisição.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

Veredito

Se você está escolhendo entre esses dois e não os roteando juntos, a decisão é simples de afirmar e difícil de aceitar. Ling 3.0 Tiny é o melhor negócio e o modelo mais fraco: uma camada de raciocínio de apenas uma semana, somente texto, com excelente pontuação para seu tamanho, preço agressivo e um cenário não resolvido de velocidade e verbosidade, que vale uma avaliação imediata em teste gratuito e vale saber que será medido em 14 de agosto. Gemini 3.5 Flash-Lite é o padrão de produção mais seguro: pontuado de forma independente 13 pontos acima, multimodal, contexto de 1M, cinco vezes mais rápido por medição consolidada e precificado de acordo. Grátis não é barato quando o modelo fala três vezes mais para pensar em um teto de capacidade inferior — e o atual é a aposta segura por um motivo.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube