Gemini 2.5 Flash Image, a.k.a. "Nano Banana," agora está disponível de forma geral. É um modelo de geração de imagens de última geração com compreensão contextual. É capaz de gerar imagens,...
Google: Nano Banana (Gemini 2.5 Flash Image) é um modelo de linguagem multimodal desenvolvido pelo Google, parte da série Gemini 2.5 Flash. Ele aceita tanto imagem quanto texto como entrada e gera…
As capacidades principais se concentram em entender e raciocinar sobre conteúdo visual apresentado como imagens. Dada uma imagem e um prompt de texto, o modelo pode descrever a cena, identificar objetos, responder perguntas sobre o conteúdo, extrair texto (OCR) e realizar raciocínio visual básico (por exemplo, relações espaciais, cores, ações). Ele também pode processar texto que acompanha a imagem, como instruções ou contexto. Por usar uma arquitetura de nível flash, é otimizado para baixa latência e alta taxa de transferência, sendo adequado para aplicações em tempo real ou de alto volume. No entanto, pode não igualar a profundidade de raciocínio ou precisão de modelos maiores e mais caros, como o Gemini 2.5 Pro, em tarefas visuais complexas que exigem análise detalhada ou cadeias de raciocínio longas. O modelo não foi projetado para tarefas como geração de imagens, análise de vídeo ou conversas de múltiplas interações que exigem contexto longo além de 32K tokens.
Se a sua aplicação não exigir nenhuma entrada de imagem, usar um modelo apenas de texto (por exemplo, uma variante menor do Gemini ou um modelo de código aberto) seria mais econômico. Da mesma forma, se a sua tarefa envolver apenas raciocínio baseado em texto, sem componente visual, a sobrecarga de processamento de imagem é desnecessária. Para cenários onde o comprimento da saída é longo — como gerar relatórios detalhados ou histórias a partir de uma imagem — os $30 por milhão de tokens de saída podem se tornar caros. Nesses casos, considere modelos com preço de saída mais baixo, ou use este modelo para gerar um resumo breve e depois expandi-lo com um modelo mais barato apenas de texto. Além disso, se você precisar processar várias imagens por solicitação ou lidar com imagens muito grandes, modelos com janelas de contexto maiores ou suporte específico a resolução de imagem podem ser mais adequados.
Implantações de alto volume se beneficiam do baixo custo de entrada deste modelo ($0,30 por milhão de tokens) e inferência rápida. Casos de uso ideais incluem marcação automática de imagens para grandes bibliotecas de fotos, geração de texto alternativo para milhares de imagens de produtos, realização de OCR em lotes de documentos digitalizados e moderação de conteúdo em tempo real de imagens enviadas por usuários. Como o custo de saída é alto, a resposta deve ser mantida curta — geralmente uma única palavra, rótulo ou frase. Por exemplo, classificar uma imagem em categorias predefinidas, extrair alguns campos-chave de um formulário ou responder a uma pergunta de sim/não sobre uma imagem. O processamento em lote pode ser feito via API do OrcaRouter com solicitações simultâneas. A latência do modelo é geralmente baixa, mas a taxa de transferência real depende do tamanho e da complexidade da imagem. Não há limite de taxa separado no OrcaRouter além do uso geral da API.
A principal limitação é o alto custo de token de saída em relação ao custo de entrada, o que torna a geração de textos longos cara. A janela de contexto de 32.768 tokens limita a quantidade de texto e o tamanho de uma imagem (em termos de tokens) que podem ser processados em uma única requisição. O modelo não foi projetado para tarefas que exigem raciocínio multimodal profundo, detalhes visuais intrincados ou o processamento de várias imagens ao mesmo tempo (cada imagem adicional consome contexto). Além disso, como um modelo de nível flash, pode apresentar menor precisão em tarefas visuais especializadas, como análise de imagens médicas, detecção de objetos em nível fino ou reconhecimento de objetos raros, em comparação com modelos mais capazes, porém mais lentos ou caros. Os dados de treinamento do modelo e seu desempenho específico em benchmarks não são divulgados nos fatos fornecidos; os usuários devem avaliar em seus próprios conjuntos de dados. Por fim, o modelo suporta apenas entrada de imagem e texto, não de vídeo ou áudio.
Os fatos fornecidos não incluem nenhuma pontuação de benchmark específica para o Google: Nano Banana (Gemini 2.5 Flash Image). Ele faz parte da série Gemini 2.5 Flash do Google, que geralmente prioriza eficiência em vez de precisão de alto nível. Na ausência de números, os usuários devem esperar um desempenho comparável a outros modelos multimodais da categoria flash em tarefas padrão de visão e linguagem, como VQAv2, COCO Captions e OCR. No entanto, pontuações exatas não são fornecidas. Recomendamos avaliar o modelo em seu próprio conjunto de dados representativo para determinar se suas capacidades atendem aos seus requisitos. O OrcaRouter não fornece benchmarks internos além do que está disponível publicamente pelo Google. Se você precisar de métricas de precisão precisas, consulte a documentação oficial do Google para a série Gemini 2.5 Flash, mas note que este identificador de modelo específico pode ter seu próprio fine-tuning.
Os fatos fornecidos não incluem medições de latência para este modelo. Como parte da família Gemini 2.5 Flash, ele é projetado para baixa latência e alta taxa de transferência. Normalmente, os modelos de nível flash do Google trocam alguma qualidade de raciocínio por velocidade, tornando-os adequados para aplicações quase em tempo real. A latência real depende de fatores como o tamanho e a resolução da imagem de entrada, o comprimento do prompt de texto, o número de tokens de saída solicitados e a carga atual na API. Em geral, tarefas simples de legendagem de imagens podem ser concluídas em algumas centenas de milissegundos a alguns segundos, enquanto prompts mais complexos que exigem saída mais longa levarão mais tempo. Para melhores resultados, mantenha a resolução da imagem razoável e limite o comprimento da saída. A API do OrcaRouter não possui sobrecarga adicional além do tempo de resposta do provedor.
Forças: O modelo se destaca em tarefas onde uma resposta rápida e de baixo custo é necessária a partir de uma única imagem. Ele consegue identificar rapidamente objetos comuns, ler texto em imagens e responder a perguntas diretas sobre o conteúdo visual. O baixo custo de entrada torna viável o processamento de grandes volumes de imagens. Limitações: Pode ter dificuldades em tarefas que exigem alta precisão, como contar objetos pequenos, distinguir texturas muito semelhantes ou entender diagramas complexos. A compreensão do modelo se limita ao que pode ser inferido a partir dos dados dos pixels e do prompt de texto; ele não tem acesso a conhecimento externo além de seus dados de treinamento (data de corte desconhecida). Além disso, como o custo de saída é alto, gerar respostas detalhadas para cada imagem pode rapidamente se tornar caro. Para tarefas que exigem análise longa e detalhada, um modelo mais capaz (e tipicamente mais caro) seria mais adequado. O desempenho em casos extremos, como imagens escuras e borradas ou ângulos incomuns, pode ser inferior.
O preço é direto: $0.30 por 1 milhão de tokens de entrada e $30.00 por 1 milhão de tokens de saída. Os tokens de entrada incluem os tokens tanto do prompt de texto quanto da imagem (a imagem é tokenizada pelo modelo). Os tokens de saída são os tokens gerados como resposta. Não há taxa de configuração, nem mínimo mensal, e a OrcaRouter não adiciona nenhum markup—você paga exatamente a taxa do provedor. Os tokens são contados pelo sistema da OrcaRouter. A cobrança é tipicamente baseada no uso, com encargos incorridos à medida que você envia requisições. Você pode monitorar o uso através do painel da OrcaRouter. Como os tokens de entrada são muito mais baratos que os tokens de saída, o custo total para uma requisição típica (saída curta) é dominado pelo lado da entrada, especialmente se você incluir uma imagem grande. Por exemplo, uma imagem de 1024x1024 pode consumir vários milhares de tokens de entrada.
Comparado a modelos apenas de texto (por exemplo, Gemini 1.5 Flash apenas de texto a $0.075/M de entrada, $0.30/M de saída), o custo de entrada deste modelo é 4x maior e o custo de saída é 100x maior, refletindo a complexidade adicional da visão. Para tarefas que não exigem análise de imagem, esses modelos apenas de texto são muito mais baratos. Comparado a modelos multimodais maiores como o Gemini 2.5 Pro (que tem custos por token mais altos, mas melhor raciocínio), este modelo é mais barato na entrada, mas semelhante ou mais caro na saída dependendo do nível Pro específico. A compensação do flash-tier é menor precisão para menor custo de entrada. Se sua aplicação precisa de alta precisão e pode tolerar um custo de entrada mais alto, um modelo Pro pode ser melhor. Se o comprimento da saída for grande, o custo de saída deste modelo se torna proibitivo, então considere modelos com preços de saída mais baixos, como o Gemini 1.5 Flash (texto+visão) que pode ter taxas diferentes.
Os fatos fornecidos não mencionam nenhum mecanismo de cache ou descontos por volume para este modelo no OrcaRouter. O OrcaRouter repassa o preço do provedor sem margem de lucro, portanto, quaisquer descontos teriam que vir dos acordos de faturamento direto da Google. Até o momento, não há cache automático de embeddings de imagem ou prompts nas informações publicadas do OrcaRouter. Os usuários devem assumir que cada solicitação é faturada com base nos tokens de entrada e saída utilizados. Para usuários de alto volume, pode valer a pena entrar em contato com o OrcaRouter para perguntar sobre possíveis acordos corporativos, mas o preço padrão de pagamento por uso é de US$ 0,30/M por entrada e US$ 30,00/M por saída. Para minimizar custos, reutilize saídas geradas anteriormente sempre que possível e limite o número de tokens em cada solicitação (por exemplo, redimensionando imagens ou usando prompts breves).
Para usar o Google: Nano Banana (Gemini 2.5 Flash Image) via OrcaRouter, envie uma solicitação POST para https://api.orcarouter.ai/v1/chat/completions com o parâmetro model definido como "google/gemini-2.5-flash-image". A API segue o formato de conclusões de chat do OpenAI. Inclua sua chave de API do OrcaRouter no cabeçalho Authorization como "Bearer YOUR_API_KEY". No corpo da solicitação, forneça um array messages com uma mensagem de usuário que contenha tanto imagem quanto texto. Para imagens, inclua uma parte de conteúdo do tipo "image_url" com a URL ou dados em base64. Exemplo: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. A resposta será uma conclusão de chat padrão com a resposta do modelo.
A API OrcaRouter suporta muitos dos mesmos parâmetros que a API OpenAI. Parâmetros essenciais: model (obrigatório, definido como "google/gemini-2.5-flash-image"), messages (obrigatório, array de objetos de mensagem), max_tokens (inteiro, máximo de tokens a gerar), temperature (float, padrão 1.0, controla a aleatoriedade), top_p (float, padrão 1.0), presence_penalty e frequency_penalty (floats), stop (string ou array de strings, até 4 sequências), e stream (booleano, para respostas em streaming). Para entrada de imagem, as mensagens devem incluir pelo menos uma mensagem de usuário com conteúdo que é um array de partes, cada parte com um campo type ("text" ou "image_url"). A parte image_url deve ter um objeto "image_url" com uma string "url" (ou uma URL publicamente acessível ou uma URL de dados com base64). Não há fine-tuning ou parâmetros adicionais específicos do modelo expostos. A janela de contexto é de 32.768 tokens, portanto, garanta que prompt_token_count + image_token_count + max_tokens <= 32768.
Migrar para o OrcaRouter requer alterações mínimas de código se você já usa uma API compatível com OpenAI. Basta alterar a URL base do seu endpoint anterior para https://api.orcarouter.ai/v1. Atualize sua chave de API para a sua chave do OrcaRouter. Ao chamar o modelo, defina o parâmetro model como "google/gemini-2.5-flash-image" (ou o modelo desejado). Ajuste quaisquer IDs de modelo existentes de acordo. Para entrada de imagem, certifique-se de que o formato da sua solicitação corresponda à convenção da OpenAI (por exemplo, usando array content com image_url). Normalmente, nenhuma outra alteração de código é necessária. Se você estava usando um formato de API diferente (por exemplo, endpoints de nuvem), pode ser necessário reescrever a estrutura da solicitação. O OrcaRouter fornece documentação para SDKs comuns. Teste com um pequeno número de solicitações para verificar contagens de tokens e preços. Observe que o OrcaRouter cobra as taxas do provedor sem margem de lucro, portanto, os preços podem diferir do seu provedor anterior.
Em comparação com o Gemini 2.5 Flash apenas texto (se disponível no OrcaRouter), este modelo adiciona capacidades de entrada de imagem, mas a um custo de entrada mais alto. A versão apenas texto geralmente custa menos por token de entrada e tem um custo de saída significativamente menor, tornando-a preferível para tarefas puramente textuais. Em comparação com os modelos Gemini 2.5 Pro, este modelo de nível flash é mais barato na entrada, mas pode ter menor precisão e profundidade de raciocínio. Os modelos Pro têm uma janela de contexto maior (geralmente 1 milhão de tokens) e melhor desempenho em tarefas complexas de várias etapas. O custo de saída para modelos Pro pode ser semelhante ou maior. Para tarefas que exigem compreensão de imagens juntamente com texto, este modelo oferece um ponto de entrada econômico. No entanto, se você precisar processar vídeo, áudio ou várias imagens simultaneamente, considere um modelo que suporte essas modalidades (por exemplo, Gemini 2.5 Pro, que suporta vídeo e áudio em algumas configurações).
Este modelo é uma das muitas opções multimodais disponíveis através do OrcaRouter. O GPT-4o (OpenAI) normalmente tem uma janela de contexto maior (128k) e pode oferecer uma melhor compreensão e raciocínio geral de imagem, mas a custos de entrada e saída mais altos. Os modelos de visão do Claude (por exemplo, Claude 3.5 Sonnet) também são competitivos, mas diferem em preço e comprimento de contexto. A principal vantagem do Gemini 2.5 Flash Image é seu baixo custo de entrada, tornando-o atraente para tarefas de alto volume e saída curta. No entanto, para raciocínio visual complexo, imagens médicas ou análise detalhada de documentos, modelos mais avançados podem produzir melhores resultados. A escolha depende da troca específica entre custo, precisão e latência. O OrcaRouter permite que você alterne facilmente entre modelos alterando o ID do modelo, então é viável testar este modelo junto com alternativas para determinar o melhor ajuste.
Um modelo mais caro—como Gemini 2.5 Pro, GPT-4o ou Claude 3.5 Sonnet—torna-se justificável quando a tarefa exige maior precisão, contexto mais longo ou raciocínio que demande mais etapas. Se sua aplicação produzir resultados incorretos ou incompletos com esse modelo, a economia de custos é desperdiçada se você precisar de pós-processamento ou correção humana. Para tarefas como análise de imagens médicas, interpretação de documentos legais ou manipulação de conteúdo sensível de conformidade, a confiabilidade de um modelo premium pode justificar o custo mais alto. Além disso, se você precisar gerar saídas longas (por exemplo, descrições de páginas inteiras) ou processar imagens muito grandes, modelos com janelas de contexto maiores e custos menores por token de saída podem ser mais econômicos no geral. A natureza flash-tier deste modelo significa que ele foi projetado para velocidade e taxa de transferência, não para profundidade. Use-o quando uma compreensão aproximada for suficiente; faça upgrade quando a precisão for importante.
A privacidade e o tratamento de dados dependem das políticas do Google para os modelos Gemini. Como em qualquer API de nuvem, os dados de entrada (imagens e texto) são enviados para os servidores do Google para processamento. O Google pode usar os dados para melhoria do modelo, a menos que você opte por não participar ou use contas de nível empresarial que proíbam esse uso. Os fatos fornecidos não especificam detalhes de tratamento de dados para este modelo específico. Ao usar o OrcaRouter como gateway, os dados passam pela infraestrutura do OrcaRouter, mas são processados pelo Google. O OrcaRouter não armazena seus dados nem os utiliza para treinamento. Os usuários devem revisar os termos de processamento de dados do Google para APIs Gemini e considerar criptografia de ponta a ponta, se necessário. Para dados confidenciais, algumas organizações preferem modelos hospedados em sua própria infraestrutura (por exemplo, via Vertex AI com residência de dados) em vez de um gateway de terceiros. No entanto, o OrcaRouter fornece uma chave de API e faturamento unificados, o que pode simplificar o acesso se as preocupações com o tratamento de dados forem aceitáveis.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Entrada / 1M tokens | $0.300 |
| Saída / 1M tokens | $30.00 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/google/gemini-2.5-flash-imageAbrir @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image