O Gemini 3.5 Flash-Lite é o modelo Gemini mais econômico do Google, projetado especificamente para cargas de trabalho de alto volume e sensíveis à latência, onde o custo por chamada domina. Apesar do seu preço, é nativamente multimodal — aceitando texto, imagens, vídeo, áudio e arquivos com saída de texto — e possui a mesma janela de contexto de 1M-token e até 64K tokens de saída que o nível Flash maior, mantendo documentos longos e entradas de mídia mista ao alcance. Com aproximadamente um quinto do preço do 3.6 Flash, é a ferramenta certa para classificação, extração, roteamento, sumarização, agentes leves, geração de dados sintéticos e qualquer pipeline executado milhões de vezes. Ele ainda suporta esforço de raciocínio configurável, chamada de ferramentas nativa e saídas estruturadas, e supera seu peso em benchmarks agentivos e de contexto longo para um modelo leve — por exemplo, 74.0% no OSWorld-Verified e 72.2% na recuperação multi-agulha de 128k, confortavelmente à frente do anterior 3.1 Flash-Lite. Ele suporta tanto o formato de chat-completions da OpenAI quanto a API generateContent nativa do Gemini, permitindo misturá-lo com modelos mais pesados em uma única integração — roteando tráfego fácil e de alto volume para o Flash-Lite e escalando tarefas difíceis para o 3.6 Flash ou um modelo Pro.
O Google Gemini 3.5 Flash-Lite é um modelo de linguagem multimodal desenvolvido pelo Google, oferecido por meio da API compatível com OpenAI da OrcaRouter. Ele aceita entradas de texto, imagem,…
O Gemini 3.5 Flash-Lite é capaz de realizar uma ampla gama de tarefas graças ao seu suporte a entrada multimodal e uso de ferramentas. Ele lida com tarefas exclusivamente textuais, como sumarização, respostas a perguntas e geração de código. Com imagens, pode descrever cenas, extrair texto de documentos ou interpretar diagramas. Entradas de vídeo permitem reconhecimento de atividades, legendagem e raciocínio temporal. Entradas de áudio facilitam transcrição, identificação de idiomas e análise baseada em fala. O modelo também suporta chamadas de ferramentas, como evidenciado por sua pontuação CharXiv Reasoning de 76,5 (com ferramentas). Isso significa que pode ser integrado a fluxos de trabalho agentivos, onde chama APIs ou bancos de dados externos. No entanto, não é projetado para escrita criativa, raciocínio altamente abstrato ou tarefas que exijam profundo conhecimento de domínio. Seu ponto forte está na velocidade, no custo e na amplitude do suporte a modalidades, em vez do desempenho bruto.
Você deve escolher o Gemini 3.5 Flash-Lite quando custo e taxa de transferência são as principais preocupações e a tarefa se encaixa em sua capacidade. Ele se destaca em pipelines de alto volume, como indexar milhares de documentos, transcrever horas de áudio ou executar classificação em tempo real em streams de imagem. Sua grande janela de contexto (1 milhão de tokens) o torna ideal para tarefas que exigem uma compreensão global de entradas longas, como análise de processos judiciais ou refatoração de código-fonte. Modelos maiores (por exemplo, Gemini 3.5 Pro) podem alcançar maior precisão em benchmarks complexos, mas vêm com custos por token significativamente maiores e menor taxa de transferência. Se sua aplicação pode tolerar pequenas compensações de qualidade para uma redução de custo de 10 a 100 vezes, este modelo é uma boa escolha. Por outro lado, para tarefas que exigem precisão factual, geração criativa ou raciocínio de última geração, recomenda-se um modelo maior.
Sim, o modelo aceita nativamente entradas de vídeo e áudio juntamente com texto, imagens e arquivos. A entrada de vídeo pode ser fornecida como uma sequência de quadros ou um arquivo de vídeo; o modelo processa quadros visuais e qualquer faixa de áudio associada. A entrada de áudio funciona com formatos comuns como WAV, MP3 ou FLAC. A grande janela de contexto permite que gravações longas sejam processadas em uma única solicitação – por exemplo, uma transcrição de áudio de uma hora em alto detalhe pode consumir cerca de 10.000 tokens. Isso é útil para sumarização de reuniões, análise de podcasts ou suporte ao cliente baseado em voz. Observe que o modelo não gera saída de áudio ou vídeo; as respostas são sempre texto. A qualidade da compreensão multimodal corresponde ao nível flash‑lite do modelo: adequada para extração e classificação, mas pode perder detalhes sutis em comparação com modelos multimodais maiores.
Gemini 3.5 Flash-Lite suporta chamada de ferramentas, conforme indicado pelo seu desempenho no benchmark CharXiv Reasoning with tools (pontuação 76.5). Isso significa que você pode definir funções ou APIs que o modelo pode invocar durante a geração de respostas. Casos de uso típicos incluem consultas a bancos de dados, pesquisas na web ou operações aritméticas. O modelo escolhe quando chamar uma ferramenta com base na instrução do usuário e no contexto. O uso de ferramentas pode melhorar a precisão factual e permitir raciocínio complexo de múltiplas etapas. No entanto, como o modelo é uma variante flash‑lite, sua confiabilidade na chamada de ferramentas pode ser menor do que a de um modelo especializado maior. Se sua aplicação depende muito de uma orquestração impecável de ferramentas, talvez seja necessário adicionar camadas de validação ou lógica de fallback. O OrcaRouter passa definições de ferramentas no mesmo formato da API da OpenAI, tornando a integração simples.
O modelo obteve uma pontuação de 76,5 no benchmark CharXiv Reasoning quando avaliado com ferramentas. CharXiv testa a capacidade de realizar raciocínio sobre dados visuais baseados em gráficos, exigindo que o modelo interprete uma imagem de gráfico e responda a perguntas sobre ela. A condição “com ferramentas” significa que o modelo podia chamar funções externas (por exemplo, uma calculadora) para auxiliar. Essa pontuação indica um desempenho moderado – ele é capaz de raciocínio relacionado a gráficos, mas não no nível de modelos especialistas. Nenhuma outra pontuação de benchmark foi fornecida para este modelo. Para comparação, modelos maiores como o Gemini 3.5 Pro provavelmente obteriam uma pontuação mais alta nessa tarefa. O valor é útil como ponto de referência: você pode esperar uma interpretação razoável de gráficos, mas deve testar minuciosamente se sua aplicação exigir alta precisão em tarefas de raciocínio visual.
Apenas a pontuação do CharXiv Reasoning (com ferramentas) foi fornecida: 76,5. Nenhum dado adicional de benchmark – como MMLU, HumanEval ou pontuações de recuperação de contexto longo – está disponível para o Gemini 3.5 Flash‑Lite nas informações fornecidas. Isso significa que generalizar seu desempenho para outras tarefas requer testes empíricos com seus próprios dados. Dada a natureza flash‑lite do modelo, espera-se que ele tenha desempenho inferior aos modelos de tamanho completo na maioria dos benchmarks padronizados. No entanto, sua eficiência e baixo custo geralmente superam essas deficiências em ambientes de produção. Se você precisar de desempenho verificado em um benchmark específico (por exemplo, geração de código ou compreensão multilíngue), deve realizar sua própria avaliação. O OrcaRouter não hospeda resultados de benchmark separados; os números citados aqui vêm diretamente do fornecedor.
Os detalhes de latência não são especificados nos dados fornecidos. Como regra geral, os modelos flash‑lite são projetados para baixa latência em comparação com seus equivalentes maiores, mas o tempo real de resposta depende de muitos fatores: comprimento da entrada, comprimento da saída, carga de solicitações concorrentes e o hardware subjacente. Com uma janela de contexto de 1M, o processamento de prompts muito longos pode aumentar substancialmente a latência devido ao escalonamento quadrático da atenção. Para entradas curtas (por exemplo, algumas centenas de tokens), você pode esperar respostas em menos de um segundo. Para entradas próximas ao limite de 1M tokens, a latência pode chegar a dezenas de segundos. O OrcaRouter não garante SLAs de latência específicos para este modelo. Se a baixa latência for crítica, considere usar um contexto menor (por exemplo, via truncamento) ou um endpoint dedicado. Você pode monitorar os tempos de resposta através do painel do OrcaRouter.
Gemini 3.5 Flash-Lite não foi projetado para precisão de ponta. Seus pontos fortes são velocidade, custo e contexto grande. As limitações incluem desempenho inferior em benchmarks de raciocínio complexo, menor recall factual em comparação com modelos maiores e uma tendência a "alucinar" em entradas ambíguas. O modelo pode ter dificuldades com tarefas que exigem conhecimento profundo de domínio (por exemplo, raciocínio jurídico, diagnóstico médico) ou trabalho criativo sutil. Sua capacidade de uso de ferramentas, embora funcional, pode não ser tão confiável quanto a de um modelo agêntico dedicado. Além disso, como apenas uma pontuação de benchmark é fornecida (CharXiv Reasoning 76.5 with tools), você não pode assumir um bom desempenho em outros domínios sem testar. Para aplicações críticas, sempre faça benchmark com seus próprios dados e considere usar um fallback para um modelo mais capaz quando a confiança for baixa.
Preço de $0,30 por 1 milhão de tokens de entrada e $2,50 por 1 milhão de tokens de saída. Essas tarifas são as tarifas do provedor cobradas sem qualquer margem de lucro pela OrcaRouter. Os tokens de entrada incluem todos os tokens no prompt (texto, tokens de imagem, quadros de vídeo, amostras de áudio, conteúdo de arquivos), independentemente da modalidade. Os tokens de saída são os tokens de texto gerados. Para uma consulta típica de contexto longo que consome 100.000 tokens de entrada e 1.000 tokens de saída, o custo seria aproximadamente ($0,30 * 0,1) + ($2,50 * 0,001) = $0,030 + $0,0025 = $0,0325 por solicitação. Em escala, este modelo pode processar milhões de consultas por algumas centenas de dólares. Compare isso com modelos maiores que frequentemente custam 10‑50x mais por token. O baixo preço de saída é particularmente benéfico para aplicações que geram respostas longas (por exemplo, resumos completos de documentos).
As informações fornecidas não especificam nenhum mecanismo de cache ou preço com desconto para tokens em cache. Portanto, você deve assumir que cada token enviado ao modelo é cobrado pela taxa de entrada padrão de US$ 0,30 por milhão de tokens, independentemente da repetição. Alguns provedores oferecem cache automático de prompts, onde prefixos repetidos são cobrados com uma taxa mais baixa (por exemplo, 50% de desconto). Para este modelo, não foi anunciado nenhum desconto desse tipo. Se você reenviar frequentemente o mesmo contexto (por exemplo, um prompt de sistema grande), talvez queira investigar se o OrcaRouter ou o Google implementam cache transparente. Na ausência de informações explícitas, o mais seguro é orçar o custo total por token para todas as entradas. Otimizar aparando conteúdo reutilizado pode reduzir sua fatura efetiva.
Margem zero significa que a OrcaRouter cobra exatamente a taxa do provedor sem adicionar nenhuma margem extra. Para o Gemini 3.5 Flash-Lite, o preço de entrada é $0.30/1M tokens e o preço de saída é $2.50/1M tokens – isso é o que o Google cobra, e a OrcaRouter repassa sem aumento. Você não está pagando nenhuma taxa de plataforma adicional por token. Isso é incomum entre gateways de API, que normalmente adicionam 10‑20% ou mais. A ausência de margem torna este modelo ainda mais econômico quando acessado via OrcaRouter. Você ainda paga pela largura de banda e infraestrutura de API, mas esses custos estão incluídos na taxa do provedor; a OrcaRouter não os detalha separadamente. Este modelo de precificação é transparente: o custo mostrado no seu painel de uso é o custo final.
Você o chama usando a API compatível com OpenAI do OrcaRouter na URL base https://api.orcarouter.ai/v1. Defina o parâmetro model como "google/gemini-3.5-flash-lite". Tanto as conclusões de chat (POST /v1/chat/completions) quanto os embeddings (se suportados) funcionam. Para entradas multimodais, você estrutura as mensagens com um array de roles e objetos de conteúdo que podem incluir campos text, image_url ou file_url. Exemplo de solicitação cURL: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Você deve usar uma chave de API do OrcaRouter, não uma chave de API do Google.
O modelo suporta parâmetros padrão compatíveis com OpenAI: model, messages, max_tokens (até o limite de 65.536 do modelo), temperature, top_p, stop, frequency_penalty, presence_penalty e tools (para chamada de funções). Parâmetros adicionais específicos do Google (como safety_settings) podem não ser expostos diretamente; se precisar deles, consulte a documentação do OrcaRouter para equivalentes. O modelo respeitará o limite de max_tokens. Para entrada multimodal, o campo type em content suporta: text, image_url, video_url (se OrcaRouter o expuser), audio_url e file_url. O tipo file pode aceitar PDFs, CSVs, etc. Observe que arquivos de mídia grandes podem precisar ser pré‑codificados como data URIs ou hospedados publicamente. O OrcaRouter pode também exigir que o arquivo esteja abaixo de um determinado tamanho. Consulte sempre a documentação mais recente da API para suporte exato de parâmetros.
Para migrar de outro provedor de API (por exemplo, Google AI Studio, Vertex AI ou outros gateways) para o OrcaRouter, substitua a URL base por https://api.orcarouter.ai/v1 e defina o ID do modelo como "google/gemini-3.5-flash-lite". Se seu código existente usa o cliente Python do OpenAI, passe base_url e api_key. Exemplo: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) Talvez seja necessário ajustar a formatação de mensagens multimodais se seu provedor anterior usava um esquema diferente (por exemplo, Anthropic). O OrcaRouter espera o formato OpenAI. Os arrays de conteúdo do usuário podem incluir várias partes. As definições de ferramentas também seguem o estilo OpenAI. Não há taxa adicional de migração; você paga apenas por token conforme descrito.
Nenhum dado de comparação direta é fornecido, mas podemos raciocinar qualitativamente. Gemini 2.0 Flash (se existir) provavelmente seria um modelo flash de geração anterior. Gemini 3.5 Flash‑Lite é uma variante mais nova e leve, com uma janela de contexto maior (1M vs. provavelmente 128K) e preço mais baixo. O custo por token para Gemini 3.5 Flash‑Lite é $0.30/$2.50 por milhão de tokens, o que é muito baixo. Modelos flash mais antigos podem ter custos por token mais altos e janelas de contexto mais curtas. No entanto, o Gemini 2.0 Flash pode ter melhor precisão bruta se for um modelo flash completo, em vez de uma variante leve. Se sua tarefa exigir a mais alta qualidade e você puder arcar com um custo maior, o modelo flash completo mais antigo pode ser melhor. Se você precisar de um contexto grande e baixo custo, o 3.5 Flash‑Lite é a escolha lógica.
O GPT-4o mini da OpenAI é um modelo multimodal de baixo custo semelhante. Ele tem uma janela de contexto de 128K tokens (significativamente menor que 1M) e é precificado em $0,15 por milhão de tokens de entrada e $0,60 por milhão de tokens de saída (a partir do início de 2025; os preços podem ter mudado). O Gemini 3.5 Flash‑Lite oferece uma janela de contexto 8x maior com o dobro do preço de entrada e 4x o preço de saída. Portanto, o Gemini é mais caro por token, mas oferece capacidade de contexto muito maior. Para tarefas onde o contexto completo de 1M é necessário (por exemplo, processamento de livros inteiros), o Gemini Flash‑Lite é mais econômico do que tentar dividir a entrada em várias chamadas do GPT‑4o mini. Se o contexto for curto, o GPT‑4o mini é mais barato e pode ter melhor desempenho em benchmarks. Nenhuma das pontuações de benchmark é diretamente comparável sem dados.
Não são fornecidas comparações de benchmark. O Llama 3.2 90B (supondo que este modelo exista) é um modelo grande de pesos abertos com uma janela de contexto menor (tipicamente 128K tokens) e maior custo por token quando executado via API. O Gemini 3.5 Flash‑Lite é um modelo proprietário com uma janela de contexto muito maior e preços muito baixos – um dos modelos multimodais mais baratos por token disponíveis. O Llama 3.2 90B pode alcançar maior precisão em muitos benchmarks de PLN devido ao seu tamanho, mas não é multimodal e possui um limite de contexto mais restrito. Se sua tarefa for apenas texto e você precisar da maior precisão, o Llama 90B (se acessível via OrcaRouter) pode ser melhor. Para cenários multimodais, de contexto longo ou de alta taxa de transferência, o Gemini Flash‑Lite tem vantagens claras. A escolha depende dos requisitos específicos da sua aplicação.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrada / 1M tokens | $0.300 |
| Saída / 1M tokens | $2.50 |
| Leitura de cache / 1M | $0.030 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/google/gemini-3.5-flash-liteAbrir @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite