Gemini 3.5 Flash-Lite es el modelo Gemini más rentable de Google, diseñado específicamente para cargas de trabajo de alto volumen y sensibles a la latencia donde el costo por llamada es dominante. A pesar de su precio, es multimodal de forma nativa — acepta texto, imágenes, video, audio y archivos con salida de texto — y cuenta con la misma ventana de contexto de 1M-token y hasta 64K tokens de salida que el nivel Flash más grande, por lo que los documentos largos y las entradas de medios mixtos siguen siendo accesibles. A aproximadamente una quinta parte del precio de 3.6 Flash, es la herramienta adecuada para clasificación, extracción, enrutamiento, resumen, agentes ligeros, generación de datos sintéticos y cualquier pipeline que se ejecute millones de veces. Todavía admite esfuerzo de razonamiento configurable, llamada nativa a herramientas y salidas estructuradas, y rinde más de lo esperado en benchmarks agentivos y de contexto largo para un modelo ligero — por ejemplo, 74.0% en OSWorld-Verified y 72.2% en recuperación multi-aguja de 128k, cómodamente por delante del anterior 3.1 Flash-Lite. Habla tanto el formato de completaciones de chat de OpenAI como la API generateContent nativa de Gemini, por lo que puedes combinarlo con modelos más pesados detrás de una sola integración — enrutando tráfico fácil y de alto volumen a Flash-Lite y escalando tareas difíciles a 3.6 Flash o un modelo Pro.
Google Gemini 3.5 Flash-Lite es un modelo de lenguaje multimodal desarrollado por Google, ofrecido a través de la API compatible con OpenAI de OrcaRouter. Acepta entradas de texto, imagen, video,…
Gemini 3.5 Flash-Lite es capaz de realizar una amplia variedad de tareas gracias a su entrada multimodal y soporte para uso de herramientas. Maneja tareas solo de texto como resumen, respuesta a preguntas y generación de código. Con imágenes, puede describir escenas, extraer texto de documentos o interpretar diagramas. Las entradas de video permiten reconocimiento de actividades, subtitulado y razonamiento temporal. Las entradas de audio facilitan la transcripción, identificación de idioma y análisis basado en voz. El modelo también admite llamada a herramientas, como lo demuestra su puntuación de razonamiento CharXiv de 76.5 (con herramientas). Esto significa que se puede integrar en flujos de trabajo agentivos donde llama a API externas o bases de datos. Sin embargo, no está diseñado para escritura creativa, razonamiento altamente abstracto o tareas que requieren un profundo conocimiento del dominio. Su fortaleza radica en la velocidad, el costo y la amplitud del soporte de modalidades, más que en el rendimiento bruto.
Deberías elegir Gemini 3.5 Flash-Lite cuando el costo y el rendimiento sean las principales preocupaciones y la tarea encaje dentro de su ámbito de capacidades. Se destaca en pipelines de alto volumen, como indexar miles de documentos, transcribir horas de audio o ejecutar clasificación en tiempo real en flujos de imágenes. Su amplia ventana de contexto (1M tokens) lo hace ideal para tareas que requieren una comprensión global de entradas extensas, como el análisis de casos judiciales o la refactorización de bases de código. Los modelos más grandes (por ejemplo, Gemini 3.5 Pro) pueden lograr una mayor precisión en benchmarks complejos, pero conllevan costos por token significativamente más altos y un rendimiento menor. Si tu aplicación puede tolerar pequeños sacrificios de calidad a cambio de una reducción de costos de 10 a 100 veces, este modelo es una opción adecuada. Por el contrario, para tareas que requieren precisión factual, generación creativa o razonamiento de vanguardia, se recomienda un modelo más grande.
Sí, el modelo acepta de forma nativa entradas de video y audio junto con texto, imágenes y archivos. La entrada de video puede proporcionarse como una secuencia de fotogramas o un archivo de video; el modelo procesa los fotogramas visuales y cualquier pista de audio asociada. La entrada de audio funciona con formatos comunes como WAV, MP3 o FLAC. La amplia ventana de contexto permite procesar grabaciones largas en una sola solicitud – por ejemplo, una transcripción de audio de una hora con alto detalle podría consumir alrededor de 10,000 tokens. Esto es útil para resúmenes de reuniones, análisis de podcasts o atención al cliente basada en voz. Tenga en cuenta que el modelo no genera salida de audio o video; las respuestas siempre son texto. La calidad de la comprensión multimodal corresponde al nivel flash‑lite del modelo: adecuada para extracción y clasificación, pero puede pasar por alto detalles sutiles en comparación con modelos multimodales más grandes.
Gemini 3.5 Flash-Lite admite el uso de herramientas (tool calling), como lo indica su rendimiento de referencia en CharXiv Reasoning with tools (puntuación 76.5). Esto significa que puedes definir funciones o APIs que el modelo puede invocar durante la generación de respuestas. Los casos de uso típicos incluyen consultas a bases de datos, búsquedas web u operaciones aritméticas. El modelo decide cuándo usar una herramienta según la instrucción del usuario y el contexto. El uso de herramientas puede mejorar la precisión factual y permitir un razonamiento complejo de múltiples pasos. Sin embargo, al tratarse de una variante flash-lite, su fiabilidad en la invocación de herramientas puede ser menor que la de un modelo especializado más grande. Si tu aplicación depende en gran medida de una orquestación impecable de herramientas, es posible que necesites añadir capas de validación o lógica de respaldo. OrcaRouter pasa las definiciones de herramientas en el mismo formato que la API de OpenAI, lo que facilita la integración.
El modelo obtuvo una puntuación de 76.5 en el benchmark CharXiv Reasoning cuando se evaluó con herramientas. CharXiv evalúa la capacidad de realizar razonamiento sobre datos visuales basados en gráficos, requiriendo que el modelo interprete una imagen de gráfico y responda preguntas al respecto. La condición “con herramientas” significa que el modelo podía llamar funciones externas (por ejemplo, una calculadora) para asistencia. Esta puntuación indica un rendimiento moderado: es capaz de razonamiento relacionado con gráficos, pero no al nivel de modelos especialistas. No se han proporcionado otras puntuaciones de benchmarks para este modelo. A modo de comparación, modelos más grandes como Gemini 3.5 Pro probablemente obtendrían una puntuación más alta en esta tarea. El valor es útil como punto de referencia: se puede esperar una interpretación razonable de gráficos, pero se debe probar a fondo si su aplicación requiere alta precisión en tareas de razonamiento visual.
Solo se ha proporcionado la puntuación de CharXiv Reasoning (con herramientas): 76.5. No hay datos adicionales de referencia – como MMLU, HumanEval o puntuaciones de recuperación de contexto largo – disponibles para Gemini 3.5 Flash‑Lite en la información proporcionada. Esto significa que generalizar su rendimiento a otras tareas requiere pruebas empíricas con sus propios datos. Dada la naturaleza flash‑lite del modelo, se espera que tenga un rendimiento inferior al de los modelos de tamaño completo en la mayoría de los puntos de referencia estandarizados. Sin embargo, su eficiencia y bajo costo a menudo superan estas deficiencias en entornos de producción. Si necesita un rendimiento verificado en un punto de referencia específico (por ejemplo, generación de código o comprensión multilingüe), debe realizar su propia evaluación. OrcaRouter no aloja resultados de referencia separados; los números citados aquí provienen directamente del proveedor.
Los detalles de latencia no están especificados en los datos proporcionados. Como regla general, los modelos flash‑lite están diseñados para baja latencia en comparación con sus hermanos más grandes, pero el tiempo de respuesta real depende de muchos factores: la longitud de entrada, la longitud de salida, la carga de solicitudes concurrentes y el hardware subyacente. Con una ventana de contexto de 1M, procesar indicaciones muy largas puede aumentar la latencia sustancialmente debido al escalado cuadrático de la atención. Para entradas cortas (por ejemplo, unos cientos de tokens), puede esperar respuestas inferiores a un segundo. Para entradas cercanas al límite de 1M tokens, la latencia podría alcanzar decenas de segundos. OrcaRouter no garantiza SLA específicos de latencia para este modelo. Si la baja latencia es crítica, considere usar un contexto más pequeño (por ejemplo, mediante truncamiento) o un endpoint dedicado. Puede monitorear los tiempos de respuesta a través del panel de OrcaRouter.
Gemini 3.5 Flash-Lite no está diseñado para una precisión de última generación. Sus puntos fuertes son la velocidad, el costo y el contexto grande. Las limitaciones incluyen un rendimiento inferior en benchmarks de razonamiento complejo, una recuperación factual reducida en comparación con modelos más grandes y una tendencia a "alucinar" en entradas ambiguas. El modelo puede tener dificultades con tareas que requieren una profunda experiencia en un dominio (por ejemplo, razonamiento legal, diagnóstico médico) o trabajo creativo matizado. Su capacidad de uso de herramientas, aunque funcional, puede no ser tan fiable como la de un modelo agéntico dedicado. Además, dado que solo se proporciona una puntuación de benchmark (CharXiv Reasoning 76.5 con herramientas), no se puede asumir un buen rendimiento en otros dominios sin pruebas. Para aplicaciones críticas, realice siempre un benchmark con sus propios datos y considere usar un fallback a un modelo más capaz cuando la confianza sea baja.
El precio es de $0.30 por 1 millón de tokens de entrada y $2.50 por 1 millón de tokens de salida. Estas tarifas son las tarifas del proveedor facturadas sin ningún margen por parte de OrcaRouter. Los tokens de entrada incluyen todos los tokens en el prompt (texto, tokens de imagen, fotogramas de video, muestras de audio, contenido de archivos) independientemente de la modalidad. Los tokens de salida son los tokens de texto generados. Para una consulta típica de contexto largo que consume 100,000 tokens de entrada y 1,000 tokens de salida, el costo sería aproximadamente ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 por solicitud. A escala, este modelo puede procesar millones de consultas por unos pocos cientos de dólares. Compare esto con modelos más grandes que a menudo cuestan 10‑50x más por token. El bajo precio de salida es particularmente beneficioso para aplicaciones que generan respuestas extensas (por ejemplo, resúmenes de documentos completos).
La información proporcionada no especifica ningún mecanismo de almacenamiento en caché ni precios con descuento para tokens almacenados en caché. Por lo tanto, debe asumir que cada token enviado al modelo se factura a la tasa de entrada estándar de $0.30 por millón de tokens, independientemente de la repetición. Algunos proveedores ofrecen almacenamiento en caché automático de prompts donde los prefijos repetidos se facturan a una tarifa más baja (p. ej., 50% de descuento). Para este modelo, no se ha anunciado ningún descuento de este tipo por caché. Si reenvía con frecuencia el mismo contexto (p. ej., un prompt de sistema grande), es posible que desee investigar si OrcaRouter o Google implementan el almacenamiento en caché transparente. En ausencia de información explícita, lo más seguro es presupuestar el costo completo por token para todas las entradas. Optimizar recortando el contenido reutilizado puede reducir su factura efectiva.
Marco cero significa que OrcaRouter cobra exactamente la tarifa del proveedor sin añadir ningún margen adicional. Para Gemini 3.5 Flash-Lite, el precio de entrada es de $0.30/1M de tokens y el precio de salida es de $2.50/1M de tokens – eso es lo que Google cobra, y OrcaRouter lo transmite sin incremento. No estás pagando ninguna tarifa adicional de plataforma por token. Esto es inusual entre las puertas de enlace de API, que normalmente añaden un 10‑20% o más. La ausencia de margen hace que este modelo sea aún más rentable cuando se accede a través de OrcaRouter. Sigues pagando por el ancho de banda y la infraestructura de la API, pero esos costos están incluidos en la tarifa del proveedor; OrcaRouter no los detalla por separado. Este modelo de precios es transparente: el costo que se muestra en tu panel de uso es el costo final.
Lo usas mediante la API compatible con OpenAI de OrcaRouter en la URL base https://api.orcarouter.ai/v1. Establece el parámetro model como "google/gemini-3.5-flash-lite". Funcionan tanto las finalizaciones de chat (POST /v1/chat/completions) como los embeddings (si son compatibles). Para entradas multimodales, estructuras los mensajes con un arreglo de roles y objetos de contenido que pueden incluir campos text, image_url o file_url. Ejemplo de solicitud cURL: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Debes usar una clave de API de OrcaRouter, no una clave de API de Google.
El modelo admite parámetros estándar compatibles con OpenAI: model, messages, max_tokens (hasta el límite de 65,536 del modelo), temperature, top_p, stop, frequency_penalty, presence_penalty y tools (para llamadas a funciones). Los parámetros adicionales específicos de Google (como safety_settings) pueden no estar expuestos directamente; si los necesita, consulte la documentación de OrcaRouter para conocer los equivalentes. El modelo respetará el límite de max_tokens. Para entrada multimodal, el campo type en content admite: text, image_url, video_url (si OrcaRouter lo expone), audio_url y file_url. El tipo file puede aceptar PDFs, CSVs, etc. Tenga en cuenta que los archivos multimedia grandes pueden necesitar ser precodificados como data URIs o alojados públicamente. OrcaRouter también puede requerir que el archivo tenga un tamaño inferior a cierto límite. Consulte siempre la documentación más reciente de la API para conocer el soporte exacto de parámetros.
Para migrar desde otro proveedor de API (p. ej., Google AI Studio, Vertex AI u otras puertas de enlace) a OrcaRouter, reemplace la URL base por https://api.orcarouter.ai/v1 y establezca el ID del modelo en "google/gemini-3.5-flash-lite". Si su código existente utiliza el cliente de OpenAI para Python, pase base_url y api_key. Ejemplo: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) Es posible que necesite ajustar el formato de mensajes multimodales si su proveedor anterior usaba un esquema diferente (p. ej., Anthropic). OrcaRouter espera el formato de OpenAI. Los arreglos de contenido de usuario pueden incluir múltiples partes. Las definiciones de herramientas también están en estilo OpenAI. No hay tarifa adicional de migración; solo paga por token según lo descrito.
No se proporcionan datos de comparación directa, pero podemos razonar cualitativamente. Gemini 2.0 Flash (si existe) probablemente sería un modelo flash de generación anterior. Gemini 3.5 Flash‑Lite es una variante ligera más nueva, con una ventana de contexto más grande (1M frente a probablemente 128K) y un precio más bajo. El costo por token de Gemini 3.5 Flash‑Lite es de $0.30/$2.50 por millón de tokens, que es muy bajo. Los modelos flash más antiguos pueden tener costos por token más altos y ventanas de contexto más cortas. Sin embargo, Gemini 2.0 Flash podría tener una precisión bruta mejor si es un modelo flash completo en lugar de una variante ligera. Si tu tarea requiere la máxima calidad y puedes permitirte un costo mayor, el modelo flash completo más antiguo podría ser mejor. Si necesitas un contexto grande y un costo bajo, el 3.5 Flash‑Lite es la opción lógica.
GPT-4o mini de OpenAI es un modelo multimodal de bajo costo similar. Tiene una ventana de contexto de 128K tokens (significativamente más pequeña que 1M) y tiene un precio de $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida (a principios de 2025; los precios pueden haber cambiado). Gemini 3.5 Flash‑Lite ofrece una ventana de contexto 8 veces mayor a 2 veces el precio de entrada y 4 veces el precio de salida. Por lo tanto, Gemini es más caro por token pero proporciona una capacidad de contexto mucho mayor. Para tareas donde se necesita el contexto completo de 1M (por ejemplo, procesar libros enteros), Gemini Flash‑Lite es más rentable que intentar dividir la entrada en múltiples llamadas de GPT‑4o mini. Si el contexto es corto, GPT‑4o mini es más barato y puede tener un mejor rendimiento en benchmarks. Ninguna de las puntuaciones de benchmark es directamente comparable sin datos.
No se proporcionan comparaciones de benchmarks. Llama 3.2 90B (asumiendo que este modelo existe) es un modelo grande de pesos abiertos con una ventana de contexto más pequeña (típicamente 128K tokens) y un costo por token más alto cuando se ejecuta a través de una API. Gemini 3.5 Flash‑Lite es un modelo propietario con una ventana de contexto mucho más grande y un precio muy bajo – uno de los modelos multimodales más baratos por token disponibles. Llama 3.2 90B podría lograr una mayor precisión en muchos benchmarks de PNL debido a su tamaño, pero no es multimodal y tiene un límite de contexto más estricto. Si tu tarea es solo de texto y necesitas la mayor precisión, Llama 90B (si es accesible a través de OrcaRouter) podría ser mejor. Para escenarios multimodales, de contexto largo o de alto rendimiento, Gemini Flash‑Lite tiene ventajas claras. La elección depende de los requisitos específicos de tu aplicación.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrada / 1M tokens | $0.300 |
| Salida / 1M tokens | $2.50 |
| Lectura caché / 1M | $0.030 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/google/gemini-3.5-flash-liteAbrir @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite