Gemini 2.5 Flash Lite

google/gemini-2.5-flash-lite
VisãoÁudioFerramentasJSONRaciocínio
por Google · 2025-07-22

Gemini 2.5 Flash-Lite é um modelo de raciocínio leve da família Gemini 2.5, otimizado para latência ultrabaixa e eficiência de custo. Ele oferece throughput melhorado, geração de tokens mais rápida e melhor desempenho...

ctx1M tokens
Saída máx.65K
Entradatext + image + file + audio + video
Saídatext
p50 TTFT1.34 s
ENTRADA$0.10/ 1M tokens
SAÍDA$0.40/ 1M tokens
p50 TTFT1.34 s7 d
p95 TTFT8.52 s7 d
TRÁFEGO11.3Mtokens / 7 d

O Google Gemini 2.5 Flash Lite é uma variante menor, mais rápida e mais acessível do modelo Gemini 2.5 Flash da Google. Ele foi projetado para lidar com uma ampla gama de entradas multimodais —…

O que é Google Gemini 2.5 Flash Lite?

Quem deve usar este modelo?

Quais modalidades de entrada ele suporta?

Como isso se compara a outros modelos do Google?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • include_reasoning
  • max_tokens
  • reasoning
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Preços

Entrada / 1M tokens$0.100
Saída / 1M tokens$0.400
Leitura de cache / 1M$0.010
MoedaUSD

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $1.90 · Com cache de prompt $1.59

Estimativa com base no preço de tabela

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.000202

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
1.34 s
Velocidade de saída
541 tok/s
p95 TTFT
8.52 s
Taxa de erro
0.44%

Benchmarks públicos

7.4
AA Coding
Melhor que 1% dos modelos comparados
nº 125 de 126
6.7
AA Intelligence
Melhor que 3% dos modelos comparados
nº 122 de 128
35.3
AA Math
Melhor que 12% dos modelos comparados
nº 71 de 81
AIME
50.0
AIME 2025
35.3
GPQA Diamond
47.4
Humanity's Last Exam
3.7
IFBench
31.5
LiveCodeBench
40.0
Long-Context Recall
32.0
MATH-500
92.6
MMLU-Pro
72.4
SciCode
17.7
TerminalBench Hard
2.3
τ²-Bench
19.0
Fonte: artificialanalysis.ai

Atividade da comunidade

Do que os desenvolvedores estão falando esta semana

Hacker News0 menções · 7 d1 a menos que na semana anterior

Comparativo

Gemini 2.5 Flash LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrada $/M$0.10$2.00$4.00$0.50
Saída $/M$0.40$12.00$18.00$3.00
Contexto1.0M1.0M1.0M1.0M
Qualidade2/1010/1010/109/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Qual é o custo por token do Gemini 2.5 Flash Lite no OrcaRouter?
Tokens de entrada custam $0.10 por 1 milhão de tokens, tokens de saída custam $0.40 por 1 milhão de tokens. A OrcaRouter fatura à taxa do provedor com margem zero.
Qual é o tamanho da janela de contexto?
A janela de contexto é de 1,048,576 tokens (1 milhão de tokens), e a saída máxima é de 65,536 tokens.
Quais são os principais pontos fortes do modelo?
Os pontos fortes incluem baixo custo, alta velocidade, raciocínio matemático forte (92,6 no MATH-500), uma janela de contexto muito grande e suporte multimodal para texto, imagens, arquivos, áudio e vídeo.
Como isso se compara ao Gemini 2.5 Flash?
Gemini 2.5 Flash Lite é mais barato e mais rápido, mas provavelmente tem um desempenho ligeiramente inferior em raciocínio complexo, escrita criativa e geração de código em comparação com o modelo Flash completo.
O OrcaRouter armazena ou compartilha meus dados ao usar este modelo?
Os fatos fornecidos não especificam as políticas de tratamento de dados da OrcaRouter. Normalmente, os provedores de API podem processar dados apenas para atender às solicitações. Verifique a política de privacidade da OrcaRouter para obter detalhes.
Como faço para chamar este modelo por meio de uma API compatível com OpenAI?
Use a base URL https://api.orcarouter.ai/v1 com o ID do modelo "google/gemini-2.5-flash-lite" em sua biblioteca cliente OpenAI. Inclua sua chave de API OrcaRouter no cabeçalho Authorization.
Posso usar entradas multimodais como imagens e áudio?
Sim, o modelo aceita entradas de texto, imagem, arquivo, áudio e vídeo. Você pode incluí-las como partes de conteúdo na mensagem do usuário usando o formato multimodal padrão da OpenAI.
Qual é a latência esperada?
O modelo é projetado para baixa latência, especialmente em comparação com modelos maiores. Os tempos exatos dependem do comprimento da entrada/saída e da carga do servidor. Nenhum valor específico de latência é fornecido.
Quais linguagens de programação e frameworks são suportados?
Qualquer linguagem que suporte requisições HTTP e o formato da API OpenAI (Python, JavaScript, Go, Java, etc.) pode ser usada. A biblioteca oficial OpenAI Python funciona perfeitamente.
O OrcaRouter oferece algum cache ou descontos para alto volume?
Nenhuma informação sobre cache ou desconto por volume foi fornecida. O preço é por token às taxas do provedor, sem margem. Entre em contato com a OrcaRouter para consultas empresariais.

Incorporar este selo

Google: Gemini 2.5 Flash Lite$0.10/M in1337ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-2.5-flash-lite.svg" alt="Google: Gemini 2.5 Flash Lite no OrcaRouter" /> </a>
Markdown [![Google: Gemini 2.5 Flash Lite](https://www.orcarouter.ai/embed/google/gemini-2.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite)

Ficha do modelo como dados

GET /api/public/models/google/gemini-2.5-flash-liteAbrir
Legível por máquina:/llms.txt/llms-full.txt