Gemini 2.5 Flash Image, también conocido como "Nano Banana", ya está disponible de forma general. Es un modelo de generación de imágenes de última generación con comprensión contextual. Es capaz de generar imágenes,...
Google: Nano Banana (Gemini 2.5 Flash Image) es un modelo de lenguaje multimodal desarrollado por Google, parte de la serie Gemini 2.5 Flash. Acepta tanto imágenes como texto como entrada y genera…
Las capacidades principales se centran en comprender y razonar sobre el contenido visual presentado como imágenes. Dada una imagen y un mensaje de texto, el modelo puede describir la escena, identificar objetos, responder preguntas sobre el contenido, extraer texto (OCR) y realizar razonamiento visual básico (por ejemplo, relaciones espaciales, colores, acciones). También puede procesar texto que acompaña a la imagen, como instrucciones o contexto. Debido a que utiliza una arquitectura de nivel flash, está optimizado para baja latencia y alto rendimiento, lo que lo hace adecuado para aplicaciones en tiempo real o de alto volumen. Sin embargo, puede no igualar la profundidad de razonamiento o la precisión de modelos más grandes y costosos como Gemini 2.5 Pro en tareas visuales complejas que requieren análisis detallados o cadenas extensas de razonamiento. El modelo no está diseñado para tareas como generación de imágenes, análisis de video o conversaciones de múltiples turnos que requieran un contexto largo más allá de 32K tokens.
Si su aplicación no requiere entrada de imágenes en absoluto, usar un modelo solo de texto (por ejemplo, una variante más pequeña de Gemini o un modelo de código abierto) sería más rentable. De manera similar, si su tarea implica solo razonamiento basado en texto sin componente visual, la sobrecarga del procesamiento de imágenes es innecesaria. Para escenarios donde la longitud de salida es larga, como generar informes detallados o historias a partir de una imagen, los $30 por millón de tokens de salida pueden resultar costosos. En tales casos, considere modelos con precios de salida más bajos, o use este modelo para generar un breve resumen y luego expandirlo con un modelo de solo texto más barato. Además, si necesita procesar múltiples imágenes por solicitud o manejar imágenes muy grandes, los modelos con ventanas de contexto más grandes o soporte específico de resolución de imagen pueden ser más apropiados.
Las implementaciones de alto volumen se benefician del bajo costo de entrada de este modelo ($0.30 por millón de tokens) y su inferencia rápida. Los casos de uso ideales incluyen el etiquetado automático de imágenes para grandes bibliotecas fotográficas, la generación de texto alternativo para miles de imágenes de productos, la realización de OCR en lotes de documentos escaneados y la moderación de contenido en tiempo real de imágenes subidas por usuarios. Debido al alto costo de salida, la respuesta debe mantenerse breve—a menudo una sola palabra, etiqueta u oración. Por ejemplo, clasificar una imagen en categorías predefinidas, extraer algunos campos clave de un formulario o responder una pregunta de sí/no sobre una imagen. El procesamiento por lotes puede realizarse a través de la API de OrcaRouter con solicitudes concurrentes. La latencia del modelo es generalmente baja, pero el rendimiento real depende del tamaño y la complejidad de la imagen. No hay un límite de tasa separado en OrcaRouter aparte del uso general de la API.
La limitación principal es el alto costo de tokens de salida en relación con el costo de entrada, lo que hace que la generación de texto largo sea costosa. La ventana de contexto de 32,768 tokens limita la cantidad de texto y el tamaño de una imagen (en términos de tokens) que se pueden procesar en una sola solicitud. El modelo no está diseñado para tareas que requieren razonamiento multimodal profundo, detalles visuales intrincados o el manejo de varias imágenes a la vez (cada imagen adicional consume contexto). Además, como modelo de nivel flash, puede mostrar una precisión inferior en tareas visuales especializadas como análisis de imágenes médicas, detección de objetos detallados o reconocimiento de objetos raros en comparación con modelos más capaces pero más lentos o costosos. Los datos de entrenamiento del modelo y el rendimiento específico en evaluaciones comparativas no se divulgan en los hechos proporcionados; los usuarios deben evaluar con sus propios conjuntos de datos. Finalmente, solo admite entrada de imágenes y texto, no video ni audio.
Los hechos proporcionados no incluyen puntuaciones de referencia específicas para Google: Nano Banana (Gemini 2.5 Flash Image). Forma parte de la serie Gemini 2.5 Flash de Google, que generalmente busca eficiencia en lugar de precisión de primer nivel. Ante la ausencia de cifras, los usuarios deben esperar un rendimiento comparable al de otros modelos multimodales de nivel flash en tareas estándar de visión y lenguaje como VQAv2, COCO Captions y OCR. Sin embargo, no se proporcionan puntuaciones exactas. Recomendamos evaluar el modelo en su propio conjunto de datos representativo para determinar si sus capacidades cumplen con sus requisitos. OrcaRouter no proporciona puntos de referencia internos más allá de lo que está disponible públicamente por parte de Google. Si necesita métricas de precisión precisas, consulte la documentación oficial de Google para la serie Gemini 2.5 Flash, pero tenga en cuenta que este identificador de modelo específico puede tener su propio ajuste fino.
Los datos proporcionados no incluyen mediciones de latencia para este modelo. Como parte de la familia Gemini 2.5 Flash, está diseñado para baja latencia y alto rendimiento. Por lo general, los modelos de nivel flash de Google sacrifican algo de calidad de razonamiento por velocidad, lo que los hace adecuados para aplicaciones casi en tiempo real. La latencia real depende de factores como el tamaño y la resolución de la imagen de entrada, la longitud del mensaje de texto, la cantidad de tokens de salida solicitados y la carga actual de la API. En general, las tareas simples de descripción de imágenes pueden completarse en unos pocos cientos de milisegundos hasta un par de segundos, mientras que los mensajes más complejos que requieren una salida más larga tardarán más. Para obtener los mejores resultados, mantenga una resolución de imagen razonable y limite la longitud de la salida. La API de OrcaRouter no añade sobrecarga adicional al tiempo de respuesta del proveedor.
Fortalezas: El modelo se destaca en tareas donde se necesita una respuesta rápida y rentable a partir de una sola imagen. Puede identificar rápidamente objetos comunes, leer texto en imágenes y responder preguntas directas sobre contenido visual. El bajo costo de entrada lo hace viable para procesar grandes volúmenes de imágenes. Limitaciones: Puede tener dificultades en tareas que requieren alta precisión, como contar objetos pequeños, distinguir texturas muy similares o comprender diagramas complejos. La comprensión del modelo se limita a lo que se puede inferir de los datos de píxeles y la instrucción de texto; no tiene acceso a conocimiento externo más allá de sus datos de entrenamiento (fecha de corte desconocida). Además, debido a que el costo de salida es alto, generar respuestas detalladas para cada imagen puede volverse costoso rápidamente. Para tareas que requieren un análisis extenso y detallado, sería más adecuado un modelo más capaz (y generalmente más costoso). El rendimiento en casos extremos como imágenes oscuras y borrosas o ángulos inusuales puede ser inferior.
El precio es sencillo: $0.30 por 1 millón de tokens de entrada y $30.00 por 1 millón de tokens de salida. Los tokens de entrada incluyen los tokens tanto del mensaje de texto como de la imagen (la imagen es tokenizada por el modelo). Los tokens de salida son los tokens generados como respuesta. No hay tarifa de configuración, ni mínimo mensual, y OrcaRouter no añade ningún margen: pagas exactamente la tarifa del proveedor. Los tokens son contados por el sistema de OrcaRouter. La facturación generalmente se basa en el uso, y los cargos se generan a medida que envías solicitudes. Puedes monitorear el uso a través del panel de OrcaRouter. Debido a que los tokens de entrada son mucho más baratos que los de salida, el costo total de una solicitud típica (salida corta) está dominado por el lado de entrada, especialmente si incluyes una imagen grande. Por ejemplo, una imagen de 1024x1024 puede consumir varios miles de tokens de entrada.
En comparación con los modelos solo de texto (por ejemplo, Gemini 1.5 Flash solo texto a $0.075/M por entrada, $0.30/M por salida), el costo de entrada de este modelo es 4 veces mayor y el costo de salida 100 veces mayor, lo que refleja la complejidad añadida de la visión. Para tareas que no requieren análisis de imágenes, esos modelos solo de texto son mucho más baratos. En comparación con modelos multimodales más grandes como Gemini 2.5 Pro (que tiene costos por token más altos pero mejor razonamiento), este modelo es más barato en entrada pero similar o más alto en salida dependiendo del nivel Pro específico. La compensación del nivel flash es una menor precisión a cambio de un menor costo de entrada. Si su aplicación necesita alta precisión y puede tolerar un mayor costo de entrada, un modelo Pro puede ser mejor. Si la longitud de salida es grande, el costo de salida de este modelo se vuelve prohibitivo, por lo que considere modelos con precios de salida más bajos, como Gemini 1.5 Flash (texto+visión) que puede tener tarifas diferentes.
Los hechos proporcionados no mencionan ningún mecanismo de almacenamiento en caché ni descuentos por volumen para este modelo en OrcaRouter. OrcaRouter transmite los precios del proveedor sin margen adicional, por lo que cualquier descuento tendría que provenir de los acuerdos de facturación directa de Google. Hasta ahora, no hay almacenamiento en caché automático de incrustaciones de imágenes o indicaciones en la información publicada de OrcaRouter. Los usuarios deben asumir que cada solicitud se factura según los tokens de entrada y salida utilizados. Para usuarios de alto volumen, puede valer la pena contactar a OrcaRouter para preguntar sobre posibles acuerdos empresariales, pero el precio estándar de pago por uso es de $0.30/M por entrada y $30.00/M por salida. Para minimizar costos, reutilice los resultados generados anteriormente cuando sea posible y limite la cantidad de tokens en cada solicitud (por ejemplo, redimensionando imágenes o usando indicaciones breves).
Para usar Google: Nano Banana (Gemini 2.5 Flash Image) a través de OrcaRouter, envíe una solicitud POST a https://api.orcarouter.ai/v1/chat/completions con el parámetro model establecido en "google/gemini-2.5-flash-image". La API sigue el formato de finalizaciones de chat de OpenAI. Incluya su clave de API de OrcaRouter en el encabezado Authorization como "Bearer YOUR_API_KEY". En el cuerpo de la solicitud, proporcione un arreglo messages con un mensaje de usuario que contenga tanto imagen como texto. Para imágenes, incluya una parte de contenido de tipo "image_url" con la URL o datos en base64. Ejemplo: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. La respuesta será una finalización de chat estándar con la respuesta del modelo.
La API de OrcaRouter admite muchos de los mismos parámetros que la API de OpenAI. Parámetros esenciales: model (obligatorio, establecido en "google/gemini-2.5-flash-image"), messages (obligatorio, array de objetos de mensaje), max_tokens (entero, tokens máximos a generar), temperature (float, por defecto 1.0, controla la aleatoriedad), top_p (float, por defecto 1.0), presence_penalty y frequency_penalty (floats), stop (cadena o array de cadenas, hasta 4 secuencias) y stream (booleano, para respuestas en streaming). Para la entrada de imágenes, los mensajes deben incluir al menos un mensaje de usuario con contenido que sea un array de partes, cada parte con un campo type ("text" o "image_url"). La parte image_url debe tener un objeto "image_url" con una cadena "url" (ya sea una URL accesible públicamente o una URL de datos con base64). No hay ajuste fino ni parámetros adicionales específicos del modelo expuestos. La ventana de contexto es de 32,768 tokens, por lo que asegúrate de que prompt_token_count + image_token_count + max_tokens <= 32768.
Migrar a OrcaRouter requiere cambios mínimos en el código si ya usas una API compatible con OpenAI. Simplemente cambia la URL base de tu endpoint anterior a https://api.orcarouter.ai/v1. Actualiza tu clave de API a tu clave de OrcaRouter. Al llamar al modelo, establece el parámetro model en "google/gemini-2.5-flash-image" (o el modelo que desees). Ajusta los IDs de modelo existentes en consecuencia. Para entrada de imágenes, asegúrate de que el formato de tu solicitud coincida con la convención de OpenAI (por ejemplo, usando un arreglo content con image_url). Normalmente no se necesitan otros cambios de código. Si usabas un formato de API diferente (por ejemplo, endpoints en la nube), es posible que debas reescribir la estructura de la solicitud. OrcaRouter proporciona documentación para SDKs comunes. Prueba con un pequeño número de solicitudes para verificar los conteos de tokens y los precios. Ten en cuenta que OrcaRouter factura las tarifas del proveedor sin margen, por lo que el precio puede diferir de tu proveedor anterior.
En comparación con el modelo solo de texto Gemini 2.5 Flash (si está disponible en OrcaRouter), este modelo añade capacidades de entrada de imágenes, pero a un costo de entrada más alto. La versión solo de texto suele costar menos por token de entrada y tiene un costo de salida significativamente menor, lo que la hace preferible para tareas puramente textuales. En comparación con los modelos Gemini 2.5 Pro, este modelo de nivel flash es más barato en la entrada, pero puede tener menor precisión y profundidad de razonamiento. Los modelos Pro tienen una ventana de contexto más grande (a menudo 1 millón de tokens) y mejor rendimiento en tareas complejas de múltiples pasos. El costo de salida de los modelos Pro puede ser similar o mayor. Para tareas que requieren comprensión de imágenes junto con texto, este modelo ofrece un punto de entrada rentable. Sin embargo, si necesita procesar video, audio o múltiples imágenes simultáneamente, debe considerar un modelo que admita esas modalidades (por ejemplo, Gemini 2.5 Pro, que admite video y audio en algunas configuraciones).
Este modelo es una de las múltiples opciones multimodales disponibles a través de OrcaRouter. GPT-4o (OpenAI) suele tener una ventana de contexto más grande (128k) y puede ofrecer una mejor comprensión y razonamiento de imágenes en general, pero a un costo mayor de entrada y salida. Los modelos de visión de Claude (por ejemplo, Claude 3.5 Sonnet) también son competitivos, pero difieren en precio y longitud de contexto. La principal ventaja de Gemini 2.5 Flash Image es su bajo costo de entrada, lo que lo hace atractivo para tareas de alto volumen y salida corta. Sin embargo, para razonamiento visual complejo, imágenes médicas o análisis detallado de documentos, los modelos más avanzados pueden producir mejores resultados. La elección depende del equilibrio específico entre costo, precisión y latencia. OrcaRouter le permite cambiar fácilmente entre modelos cambiando el ID del modelo, por lo que es factible probar este modelo junto con alternativas para determinar la mejor opción.
Un modelo más caro—como Gemini 2.5 Pro, GPT-4o o Claude 3.5 Sonnet—se justifica cuando la tarea exige mayor precisión, contexto más largo o razonamiento que requiere más pasos. Si su aplicación produce resultados incorrectos o incompletos con este modelo, el ahorro de costos se desperdicia si necesita posprocesamiento o corrección humana. Para tareas como analizar imágenes médicas, interpretar documentos legales o manejar contenido sensible de cumplimiento normativo, la confiabilidad de un modelo premium puede justificar el costo más elevado. Además, si necesita generar salidas largas (por ejemplo, descripciones de páginas completas) o procesar imágenes muy grandes, los modelos con ventanas de contexto más grandes y costos de token de salida más bajos podrían ser más rentables en general. La naturaleza de nivel flash de este modelo significa que está diseñado para velocidad y rendimiento, no para profundidad. Úselo donde una comprensión aproximada sea suficiente; actualice cuando la precisión sea importante.
La privacidad y el manejo de datos dependen de las políticas de Google para los modelos Gemini. Como con cualquier API en la nube, los datos de entrada (imágenes y texto) se envían a los servidores de Google para su procesamiento. Google puede utilizar los datos para mejorar sus modelos, a menos que optes por no participar o utilices cuentas de nivel empresarial que prohíban dicho uso. Los hechos proporcionados no especifican los detalles de manejo de datos para este modelo en particular. Al utilizar OrcaRouter como puerta de enlace, los datos pasan a través de la infraestructura de OrcaRouter, pero finalmente son procesados por Google. OrcaRouter no almacena tus datos ni los utiliza para entrenamiento. Los usuarios deben revisar los términos de procesamiento de datos de Google para las APIs de Gemini y considerar el cifrado de extremo a extremo si es necesario. Para datos sensibles, algunas organizaciones prefieren modelos alojados en su propia infraestructura (por ejemplo, a través de Vertex AI con residencia de datos) en lugar de una puerta de enlace de terceros. Sin embargo, OrcaRouter proporciona una clave de API y facturación unificadas, lo que puede simplificar el acceso si las preocupaciones sobre el manejo de datos son aceptables.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Entrada / 1M tokens | $0.300 |
| Salida / 1M tokens | $30.00 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/google/gemini-2.5-flash-imageAbrir @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image