Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
NovoDestaque
VisãoÁudioFerramentasJSONRaciocínio
por Google · 2026-07-21

O Gemini 3.5 Flash-Lite é o modelo Gemini mais econômico do Google, projetado especificamente para cargas de trabalho de alto volume e sensíveis à latência, onde o custo por chamada domina. Apesar do seu preço, é nativamente multimodal — aceitando texto, imagens, vídeo, áudio e arquivos com saída de texto — e possui a mesma janela de contexto de 1M-token e até 64K tokens de saída que o nível Flash maior, mantendo documentos longos e entradas de mídia mista ao alcance. Com aproximadamente um quinto do preço do 3.6 Flash, é a ferramenta certa para classificação, extração, roteamento, sumarização, agentes leves, geração de dados sintéticos e qualquer pipeline executado milhões de vezes. Ele ainda suporta esforço de raciocínio configurável, chamada de ferramentas nativa e saídas estruturadas, e supera seu peso em benchmarks agentivos e de contexto longo para um modelo leve — por exemplo, 74.0% no OSWorld-Verified e 72.2% na recuperação multi-agulha de 128k, confortavelmente à frente do anterior 3.1 Flash-Lite. Ele suporta tanto o formato de chat-completions da OpenAI quanto a API generateContent nativa do Gemini, permitindo misturá-lo com modelos mais pesados em uma única integração — roteando tráfego fácil e de alto volume para o Flash-Lite e escalando tarefas difíceis para o 3.6 Flash ou um modelo Pro.

ctx1.05M tokens
Saída máx.65.5K
Entradatext + image + video + file + audio
Saídatext
p50 TTFT1.30 s
ENTRADA$0.30/ 1M tokens
SAÍDA$2.50/ 1M tokens
p50 TTFT1.30 s7 d
p95 TTFT10.00 s7 d
TRÁFEGO5.9Mtokens / 7 d

O Google Gemini 3.5 Flash-Lite é um modelo de linguagem multimodal desenvolvido pelo Google, oferecido por meio da API compatível com OpenAI da OrcaRouter. Ele aceita entradas de texto, imagem,…

O que é Google Gemini 3.5 Flash-Lite?

Para quem este modelo foi projetado?

Quais modalidades o modelo suporta?

Qual é o tamanho da janela de contexto e da saída máxima?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Preços

Entrada / 1M tokens$0.300
Saída / 1M tokens$2.50
Leitura de cache / 1M$0.030
MoedaUSD

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $9.60 · Com cache de prompt $8.66

Estimativa com base no preço de tabela

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.001254

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
1.30 s
Velocidade de saída
829 tok/s
p95 TTFT
10.00 s
Taxa de erro
5.0%

Benchmarks públicos

49.3
AA Coding
Melhor que 60% dos modelos comparados
nº 49 de 122
36.5
AA Intelligence
Melhor que 54% dos modelos comparados
nº 57 de 124
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Fonte: artificialanalysis.ai, deepmind.google

Comparativo

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrada $/M$0.30$2.00$4.00$0.50
Saída $/M$2.50$12.00$18.00$3.00
Contexto1.0M1.0M1.0M1.0M
Qualidade6/1010/1010/109/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Qual é o preço por token para Gemini 3.5 Flash-Lite no OrcaRouter?
O preço é de $0,30 por milhão de tokens de entrada e $2,50 por milhão de tokens de saída. Estas são as taxas do provedor com margem zero. Os tokens de entrada incluem todas as modalidades (texto, imagem, vídeo, áudio, arquivo). Os tokens de saída são texto gerado.
Qual é o tamanho da janela de contexto?
A janela de contexto é de 1.048.576 tokens (aproximadamente 1 milhão). O comprimento máximo de saída é de 65.536 tokens. Isso permite lidar com documentos, vídeos ou gravações de áudio muito longos em uma única solicitação de API.
Quais são os principais pontos fortes deste modelo?
Seus principais pontos fortes são: custo muito baixo por token, suporte a cinco modalidades de entrada (texto, imagem, vídeo, áudio, arquivo), uma janela de contexto massiva de 1M e capacidade de uso de ferramentas (pontuação CharXiv Reasoning 76.5 com ferramentas). Ele é projetado para pipelines de produção de alto throughput e sensíveis a custo.
Como ele se compara a modelos maiores como o Gemini 3.5 Pro?
Nenhuma comparação direta de benchmarks é fornecida. Como uma variante flash‑lite, este modelo prioriza eficiência e baixo custo em detrimento do desempenho bruto. Modelos maiores como o Gemini 3.5 Pro provavelmente alcançariam maior precisão em tarefas de raciocínio complexo, mas custariam significativamente mais por token. Use este modelo quando custo e taxa de transferência forem críticos.
O modelo armazena prompts em cache para reduzir custos?
A informação fornecida não menciona nenhum mecanismo de cache ou preço de token em cache com desconto. Você deve assumir que todos os tokens são cobrados pela taxa de entrada padrão. Se o cache for importante, verifique com a OrcaRouter ou Google se há descontos disponíveis.
Como acesso este modelo via uma API compatível com OpenAI?
Use a API do OrcaRouter na URL base https://api.orcarouter.ai/v1. Defina o parâmetro do modelo como "google/gemini-3.5-flash-lite". A API é totalmente compatível com o formato de chat completions do OpenAI, incluindo conteúdo multimodal e definições de ferramentas.
Que tratamento de dados e privacidade posso esperar?
O tratamento de dados é regido pelas políticas do Google (o provedor) e pelos termos da OrcaRouter. O modelo processa suas entradas e a saída é devolvida a você. Nenhuma certificação de privacidade específica para este modelo é fornecida. Para dados sensíveis, revise o acordo de processamento de dados do provedor.
Posso usar este modelo para aplicações em tempo real?
Os detalhes de latência não são especificados. O modelo pode retornar respostas em segundos para entradas curtas, mas o processamento de prompts muito longos (próximo de 1M tokens) pode levar dezenas de segundos. É adequado para aplicações quase em tempo real com tamanhos de entrada moderados. Para requisitos estritos de tempo real, teste com os comprimentos de entrada esperados.
Qual é a pontuação do benchmark CharXiv Reasoning?
O modelo alcançou uma pontuação de 76.5 no CharXiv Reasoning com ferramentas. Este benchmark testa a compreensão e raciocínio sobre gráficos. A pontuação indica desempenho moderado; o modelo pode interpretar gráficos e responder perguntas, mas não ao nível de modelos de raciocínio dedicados. Nenhuma outra pontuação de benchmark é fornecida.
Existe um custo mínimo ou compromisso para usar o OrcaRouter?
OrcaRouter não impõe um gasto mínimo mensal. Você é cobrado apenas pelos tokens que utiliza, com as taxas dos provedores sem margem de lucro. Não há taxa inicial ou contrato de longo prazo. Basta se inscrever para obter uma chave de API e começar a fazer solicitações.

Incorporar este selo

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite no OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Ficha do modelo como dados

GET /api/public/models/google/gemini-3.5-flash-liteAbrir
Legível por máquina:/llms.txt/llms-full.txt