Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
NuevoDestacado
VisiónAudioHerramientasJSONRazonamiento
por Google · 2026-07-21

Gemini 3.5 Flash-Lite es el modelo Gemini más rentable de Google, diseñado específicamente para cargas de trabajo de alto volumen y sensibles a la latencia donde el costo por llamada es dominante. A pesar de su precio, es multimodal de forma nativa — acepta texto, imágenes, video, audio y archivos con salida de texto — y cuenta con la misma ventana de contexto de 1M-token y hasta 64K tokens de salida que el nivel Flash más grande, por lo que los documentos largos y las entradas de medios mixtos siguen siendo accesibles. A aproximadamente una quinta parte del precio de 3.6 Flash, es la herramienta adecuada para clasificación, extracción, enrutamiento, resumen, agentes ligeros, generación de datos sintéticos y cualquier pipeline que se ejecute millones de veces. Todavía admite esfuerzo de razonamiento configurable, llamada nativa a herramientas y salidas estructuradas, y rinde más de lo esperado en benchmarks agentivos y de contexto largo para un modelo ligero — por ejemplo, 74.0% en OSWorld-Verified y 72.2% en recuperación multi-aguja de 128k, cómodamente por delante del anterior 3.1 Flash-Lite. Habla tanto el formato de completaciones de chat de OpenAI como la API generateContent nativa de Gemini, por lo que puedes combinarlo con modelos más pesados detrás de una sola integración — enrutando tráfico fácil y de alto volumen a Flash-Lite y escalando tareas difíciles a 3.6 Flash o un modelo Pro.

ctx1.05M tokens
Salida máx.65.5K
Entradatext + image + video + file + audio
Salidatext
p50 TTFT1.30 s
ENTRADA$0.30/ 1M tokens
SALIDA$2.50/ 1M tokens
p50 TTFT1.30 s7 d
p95 TTFT10.00 s7 d
TRÁFICO5.9Mtokens / 7 d

Google Gemini 3.5 Flash-Lite es un modelo de lenguaje multimodal desarrollado por Google, ofrecido a través de la API compatible con OpenAI de OrcaRouter. Acepta entradas de texto, imagen, video,…

¿Qué es Google Gemini 3.5 Flash-Lite?

¿Para quién está diseñado este modelo?

¿Qué modalidades admite el modelo?

¿Qué tan grande es la ventana de contexto y la salida máxima?

Ejemplos de código

Llama desde cualquier SDK

Compatible con OpenAI: conserva tu SDK actual

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parámetros admitidos

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Precios

Entrada / 1M tokens$0.300
Salida / 1M tokens$2.50
Lectura caché / 1M$0.030
MonedaUSD

Calculadora de costes

Tokens / mes10MM
Proporción de entrada70%%
Estimado / mes $9.60 · Con caché de prompts $8.66

Estimación según precio de lista

Estimador de tokens y coste

Tokens de entrada: 18Coste por solicitud: $0.001255

Solo una estimación: el número real de tokens depende del tokenizador del proveedor.

Rendimiento

p50 TTFT
1.30 s
Velocidad de salida
829 tok/s
p95 TTFT
10.00 s
Tasa de error
5.0%

Pruebas de referencia públicas

49.3
AA Coding
Mejor que el 60 % de los modelos comparados
n.º 49 de 122
36.5
AA Intelligence
Mejor que el 54 % de los modelos comparados
n.º 57 de 124
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Fuente: artificialanalysis.ai, deepmind.google

Comparativa

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrada $/M$0.30$2.00$4.00$0.50
Salida $/M$2.50$12.00$18.00$3.00
Contexto1.0M1.0M1.0M1.0M
Calidad6/1010/1010/109/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

Preguntas frecuentes

¿Cuál es el precio por token de Gemini 3.5 Flash-Lite en OrcaRouter?
El precio es $0.30 por millón de tokens de entrada y $2.50 por millón de tokens de salida. Estas son las tarifas del proveedor con margen cero. Los tokens de entrada incluyen todas las modalidades (texto, imagen, video, audio, archivo). Los tokens de salida son texto generado.
¿Cuál es el tamaño de la ventana de contexto?
La ventana de contexto es de 1,048,576 tokens (aproximadamente 1 millón). La longitud máxima de salida es de 65,536 tokens. Esto permite manejar documentos, videos o grabaciones de audio muy largos en una sola solicitud de API.
¿Cuáles son las fortalezas clave de este modelo?
Sus principales fortalezas son: costo muy bajo por token, soporte para cinco modalidades de entrada (text, image, video, audio, file), una ventana de contexto masiva de 1M, y capacidad de uso de herramientas (CharXiv Reasoning score 76.5 with tools). Está diseñado para pipelines de producción de alto rendimiento y sensibles al costo.
¿Cómo se compara con modelos más grandes como Gemini 3.5 Pro?
No se proporcionan comparaciones directas de referencia. Como variante flash‑lite, este modelo prioriza la eficiencia y el bajo costo sobre el rendimiento bruto. Modelos más grandes como Gemini 3.5 Pro probablemente lograrían una mayor precisión en tareas de razonamiento complejo, pero costarían significativamente más por token. Use este modelo cuando el costo y el rendimiento sean críticos.
¿El modelo almacena en caché las indicaciones para reducir costos?
La información proporcionada no menciona ningún mecanismo de caché ni tarifas con descuento para tokens cacheados. Debe asumir que todos los tokens se facturan a la tarifa de entrada estándar. Si el almacenamiento en caché es importante, consulte con OrcaRouter o Google para obtener posibles descuentos.
¿Cómo accedo a este modelo a través de una API compatible con OpenAI?
Utilice la API de OrcaRouter en la URL base https://api.orcarouter.ai/v1. Establezca el parámetro del modelo en "google/gemini-3.5-flash-lite". La API es totalmente compatible con el formato de finalizaciones de chat de OpenAI, incluido contenido multimodal y definiciones de herramientas.
¿Qué tratamiento de datos y privacidad puedo esperar?
El manejo de datos se rige por las políticas de Google (el proveedor) y los términos de OrcaRouter. El modelo procesa sus entradas, y la salida se le devuelve. No se proporcionan certificaciones de privacidad específicas para este modelo. Para datos sensibles, revise el acuerdo de procesamiento de datos del proveedor.
¿Puedo usar este modelo para aplicaciones en tiempo real?
No se especifican los detalles de latencia. El modelo puede devolver respuestas en segundos para entradas cortas, pero procesar prompts muy largos (cerca de 1M de tokens) puede tomar decenas de segundos. Es adecuado para aplicaciones de tiempo casi real con tamaños de entrada moderados. Para requisitos estrictos de tiempo real, pruebe con las longitudes de entrada esperadas.
¿Cuál es la puntuación del CharXiv Reasoning benchmark?
El modelo obtuvo una puntuación de 76.5 en CharXiv Reasoning with tools. Este benchmark evalúa la comprensión de gráficos y el razonamiento. La puntuación indica un rendimiento moderado; el modelo puede interpretar gráficos y responder preguntas, pero no al nivel de modelos de razonamiento especializados. No se proporcionan otras puntuaciones de benchmark.
¿Hay un costo mínimo o compromiso para usar OrcaRouter?
OrcaRouter no impone un gasto mensual mínimo. Solo se le cobra por los tokens que utiliza a las tarifas del proveedor sin margen. No hay tarifa inicial ni contrato a largo plazo. Simplemente regístrese para obtener una clave API y comience a hacer solicitudes.

Insertar esta insignia

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50vía OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite en OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Ficha del modelo como datos

GET /api/public/models/google/gemini-3.5-flash-liteAbrir
Legible por máquina:/llms.txt/llms-full.txt