Gemini 3.6 Flash

google/gemini-3.6-flash
Destacado
VisiónAudioHerramientasJSONRazonamiento
por Google · 2026-07-21

Gemini 3.6 Flash es el último modelo rápido y rentable de Google en la familia Gemini 3: un modelo nativamente multimodal que lee texto, imágenes, video, audio y archivos y responde en texto, con una ventana de contexto de 1 millón de tokens y hasta 64 000 tokens de salida. Está diseñado para equipos que necesitan calidad cercana a la frontera a la velocidad y el precio de Flash, y es un valor predeterminado sólido en agentes de codificación, comprensión de documentos y medios, generación aumentada por recuperación y automatización de alto rendimiento. Frente al anterior 3.5 Flash, es notablemente más eficiente en tokens y menos verboso: alcanza la misma o mejor calidad emitiendo menos tokens de salida, lo que reduce directamente el costo y la latencia en ejecuciones largas de agentes. Admite esfuerzo de razonamiento configurable (para que los llamantes ajusten la profundidad frente a la velocidad por solicitud), llamada nativa a herramientas y salidas estructuradas, y se mantiene sólido en evaluaciones de contexto largo y codificación agéntica para su nivel, incluyendo un 91.8 % en recuperación multi-aguja de 128k promedio y puntuaciones competitivas en SWE-Bench Pro, Terminal-Bench y OSWorld. Gemini 3.6 Flash habla tanto el formato de chat-completions de OpenAI como la API nativa generateContent de Gemini, lo que la convierte en una actualización directa para integraciones existentes compatibles con Gemini y OpenAI. Úsala como caballo de batalla diario cuando quieras la mayor parte de la inteligencia de un modelo de frontera sin pagar precios de frontera.

ctx1M tokens
Salida máx.65K
Entradatext + image + video + file + audio
Salidatext
p50 TTFT10.00 s
ENTRADA$0.75/ 1M tokens
SALIDA$3.75/ 1M tokens
p50 TTFT10.00 s7 d
p95 TTFT10.00 s7 d
TRÁFICO3.1Mtokens / 7 d

Google Gemini 3.6 Flash es un modelo multimodal grande desarrollado por Google, ofrecido a través de la API de OrcaRouter con precios transparentes (sin margen). Acepta entradas de texto, imagen,…

¿Qué es Google Gemini 3.6 Flash y para quién es?

¿En qué se diferencia la variante Flash de otros modelos Gemini?

¿Qué modalidades de entrada admite Gemini 3.6 Flash?

Ejemplos de código

Llama desde cualquier SDK

Compatible con OpenAI: conserva tu SDK actual

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parámetros admitidos

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Precios

Entrada / 1M tokens$0.750
Salida / 1M tokens$3.75
Lectura caché / 1M$0.075
MonedaUSD

Calculadora de costes

Tokens / mes10MM
Proporción de entrada70%%
Estimado / mes $16.50 · Con caché de prompts $14.14

Estimación según precio de lista

Estimador de tokens y coste

Tokens de entrada: 18Coste por solicitud: $0.001888

Solo una estimación: el número real de tokens depende del tokenizador del proveedor.

Rendimiento

p50 TTFT
10.00 s
Velocidad de salida
2764 tok/s
p95 TTFT
10.00 s
Tasa de error
77.8%

Pruebas de referencia públicas

69.2
AA Coding
Mejor que el 80 % de los modelos comparados
n.º 27 de 138
40.3
AA Intelligence
Mejor que el 71 % de los modelos comparados
n.º 40 de 140
CharXiv Reasoning (no tools)
85.2
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
49.0
GDM-MRCR v2 8-needle (128k avg)
91.8
GDM-MRCR v2 8-needle (1M pointwise)
54.0
GPQA Diamond
92.8
Humanity's Last Exam
40.8
Long-Context Recall
80.0
MLE-Bench
63.9
OSWorld-Verified
83.0
SciCode
53.4
SWE-Bench Pro (Public)
58.7
tau_banking
29.9
Terminal-bench 2.1 (Terminus-2)
78.0
terminalbench_v2_1
77.5
Fuente: artificialanalysis.ai, deepmind.google

Actividad de la comunidad

De qué hablan los desarrolladores esta semana

Hacker News0 menciones · 7 d

Comparativa

Gemini 3.6 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrada $/M$0.75$2.00$4.00$0.50
Salida $/M$3.75$12.00$18.00$3.00
Contexto1.0M1.0M1.0M1.0M
Calidad8/1010/1010/109/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

Preguntas frecuentes

¿Cuál es el costo de usar Gemini 3.6 Flash a través de OrcaRouter?
El precio es de $1.50 por cada millón de tokens de entrada y $7.50 por cada millón de tokens de salida. OrcaRouter factura a la tarifa del proveedor sin margen adicional. No hay tarifas adicionales.
¿Cuál es la ventana de contexto de Gemini 3.6 Flash?
La ventana de contexto es de 1,048,576 tokens (aproximadamente 1 millón de tokens). El máximo de salida es de 65,536 tokens. El contexto incluye todas las modalidades de entrada (texto, imagen, video, archivo, audio).
¿Cuáles son las fortalezas clave de este modelo?
Gemini 3.6 Flash ofrece una ventana de contexto muy grande, admite cinco modalidades de entrada (texto, imagen, video, archivo, audio) y logra una puntuación sólida de referencia de 91.8 en GDM-MRCR v2 8-needle (promedio 128k). También es rentable como variante Flash.
¿Cómo se compara Gemini 3.6 Flash con GPT-4o o Claude 3.5 Sonnet?
Tiene una ventana de contexto más grande (1M vs 128K/200K) y un precio más bajo por token ($1.50/$7.50 vs ~$2.50/$10 o $3/$15). Las puntuaciones de referencia no son directamente comparables, pero Gemini Flash está optimizado para la recuperación de contexto largo. GPT-4o y Claude pueden ofrecer mayor precisión de razonamiento en algunas tareas.
¿Cómo maneja OrcaRouter mis datos cuando uso este modelo?
OrcaRouter reenvía tus solicitudes a los servidores de inferencia de Google. OrcaRouter no entrena con tus datos ni almacena indicaciones más allá de lo necesario para el procesamiento y la facturación. Se aplican las políticas de privacidad de datos de Google. Puedes encontrar los detalles en la política de privacidad de OrcaRouter.
¿Puedo llamar a Gemini 3.6 Flash usando el OpenAI Python SDK?
Sí. Establece la URL base en https://api.orcarouter.ai/v1 y el ID del modelo en "google/gemini-3.6-flash". Usa la librería Python de OpenAI con tu clave API de OrcaRouter. Ejemplo: client = OpenAI(api_key="your_key", base_url="https://api.orcarouter.ai/v1") luego client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...]).
¿El modelo admite streaming y function calling?
A través de OrcaRouter, sí. Puede establecer stream=true e incluir herramientas en la solicitud. La API traduce el formato de OpenAI a la API de Google. Pruebe con su caso de uso para confirmar la compatibilidad total.
¿Cuál es el significado de la puntuación de referencia 91.8 en GDM-MRCR v2 8-needle?
Mide la precisión del modelo al recuperar múltiples piezas específicas de información de un contexto largo (promedio de 128K tokens). Una puntuación del 91.8% significa que el modelo respondió correctamente en el 91.8% de los escenarios de recuperación evaluados. Esto indica un rendimiento sólido en tareas de contexto largo.

Insertar esta insignia

Google: Gemini 3.6 Flash$0.75/M in10000ms p50vía OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.6-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg" alt="Google: Gemini 3.6 Flash en OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.6 Flash](https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.6-flash)

Ficha del modelo como datos

GET /api/public/models/google/gemini-3.6-flashAbrir
Legible por máquina:/llms.txt/llms-full.txt