Gemini 2.5 Flash Image, a.k.a. "Nano Banana", ist jetzt allgemein verfügbar. Es handelt sich um ein hochmodernes Bildgenerierungsmodell mit kontextuellem Verständnis. Es ist in der Lage, Bilder zu generieren,...
Google: Nano Banana (Gemini 2.5 Flash Image) ist ein multimodales Sprachmodell, das von Google entwickelt wurde und Teil der Gemini 2.5 Flash-Serie ist. Es akzeptiert sowohl Bild- als auch…
Die Kernfunktionen konzentrieren sich auf das Verständnis und die logische Analyse visueller Inhalte, die als Bilder dargestellt werden. Bei einem Bild und einer Textaufforderung kann das Modell die Szene beschreiben, Objekte identifizieren, Fragen zum Inhalt beantworten, Text extrahieren (OCR) und grundlegende visuelle Schlussfolgerungen ziehen (z. B. räumliche Beziehungen, Farben, Aktionen). Es kann auch Begleittexte wie Anweisungen oder Kontext verarbeiten. Da es eine Flash-Tier-Architektur verwendet, ist es für niedrige Latenz und hohen Durchsatz optimiert, was es für Echtzeit- oder Anwendungen mit hohem Volumen geeignet macht. Allerdings erreicht es möglicherweise nicht die Tiefe der logischen Analyse oder Genauigkeit teurerer, größerer Modelle wie Gemini 2.5 Pro bei komplexen visuellen Aufgaben, die eine detaillierte Analyse oder lange Argumentationsketten erfordern. Das Modell ist nicht für Aufgaben wie Bildgenerierung, Videoanalyse oder mehrstufige Gespräche ausgelegt, die einen langen Kontext über 32K Token hinaus erfordern.
Wenn Ihre Anwendung überhaupt keine Bildeingabe erfordert, ist die Verwendung eines reinen Textmodells (z. B. einer kleineren Gemini-Variante oder eines Open-Source-Modells) kostengünstiger. Wenn Ihre Aufgabe nur textbasierte Überlegungen ohne visuelle Komponente umfasst, ist der Bildverarbeitungsaufwand ebenfalls unnötig. In Szenarien mit langer Ausgabelänge – wie der Erstellung detaillierter Berichte oder Geschichten aus einem Bild – können die Kosten von 30 $ pro Million Ausgabe-Tokens teuer werden. In solchen Fällen sollten Sie Modelle mit niedrigeren Ausgabepreisen in Betracht ziehen oder dieses Modell verwenden, um eine kurze Zusammenfassung zu erstellen und diese dann mit einem günstigeren reinen Textmodell zu erweitern. Wenn Sie mehrere Bilder pro Anfrage verarbeiten oder sehr große Bilder handhaben müssen, sind Modelle mit größeren Kontextfenstern oder spezifischer Bildauflösungsunterstützung möglicherweise besser geeignet.
Bereitstellungen mit hohem Volumen profitieren von den niedrigen Eingabekosten dieses Modells ($0,30 pro Million Tokens) und der schnellen Inferenz. Ideale Anwendungsfälle umfassen die automatische Bildmarkierung für große Fotobibliotheken, die Generierung von Alt-Text für Tausende von Produktbildern, die Durchführung von OCR an Stapeln gescannter Dokumente und die Echtzeit-Inhaltsmoderation von hochgeladenen Benutzerbildern. Da die Ausgabekosten hoch sind, sollte die Antwort kurz gehalten werden – oft ein einzelnes Wort, eine Bezeichnung oder ein Satz. Beispielsweise die Klassifizierung eines Bildes in vordefinierte Kategorien, das Extrahieren einiger Schlüsselfelder aus einem Formular oder die Beantwortung einer Ja/Nein-Frage zu einem Bild. Die Stapelverarbeitung kann über die API von OrcaRouter mit gleichzeitigen Anforderungen erfolgen. Die Latenz des Modells ist im Allgemeinen niedrig, aber der tatsächliche Durchsatz hängt von der Bildgröße und -komplexität ab. Es gibt in OrcaRouter keine separate Ratenbegrenzung außer der allgemeinen API-Nutzung.
Die Haupteinschränkung sind die hohen Kosten für Ausgabetokens im Vergleich zu Eingabetokens, was die Generierung langer Texte teuer macht. Das Kontextfenster von 32,768 Tokens begrenzt, wie viel Text und wie groß ein Bild (in Token gerechnet) in einer einzigen Anfrage verarbeitet werden kann. Das Modell ist nicht für Aufgaben ausgelegt, die tiefes multimodales Denken, komplexe visuelle Details oder die gleichzeitige Verarbeitung mehrerer Bilder erfordern (jedes zusätzliche Bild verbraucht Kontext). Darüber hinaus kann es als Flash-Modell eine geringere Genauigkeit bei spezialisierten visuellen Aufgaben wie medizinischer Bildanalyse, feinkörniger Objekterkennung oder Erkennung seltener Objekte aufweisen, im Vergleich zu leistungsfähigeren, aber langsameren oder teureren Modellen. Die Trainingsdaten des Modells und die spezifische Leistung bei Benchmarks werden in den bereitgestellten Fakten nicht offengelegt; Benutzer sollten anhand eigener Datensätze evaluieren. Schließlich unterstützt es nur Bild- und Texteingaben, keine Videos oder Audios.
Die bereitgestellten Fakten enthalten keine spezifischen Benchmark-Ergebnisse für Google: Nano Banana (Gemini 2.5 Flash Image). Es ist Teil der Gemini 2.5 Flash Serie von Google, die allgemein auf Effizienz statt auf höchste Genauigkeit abzielt. In Ermangelung von Zahlen sollten Benutzer eine Leistung erwarten, die mit anderen Flash-Klasse Multimodalmodellen bei Standard-Vision-Language-Aufgaben wie VQAv2, COCO Captions und OCR vergleichbar ist. Allerdings werden keine genauen Punktzahlen angegeben. Wir empfehlen, das Modell anhand Ihres eigenen repräsentativen Datensatzes zu evaluieren, um festzustellen, ob seine Fähigkeiten Ihren Anforderungen entsprechen. OrcaRouter stellt keine internen Benchmarks über das hinaus zur Verfügung, was öffentlich von Google verfügbar ist. Wenn Sie präzise Genauigkeitskennzahlen benötigen, konsultieren Sie die offizielle Dokumentation von Google für die Gemini 2.5 Flash Serie, aber beachten Sie, dass dieser spezifische Modell-Identifier möglicherweise ein eigenes Fine-Tuning hat.
Die bereitgestellten Fakten enthalten keine Latenzmessungen für dieses Modell. Als Teil der Gemini 2.5 Flash-Familie ist es für niedrige Latenz und hohen Durchsatz ausgelegt. Typischerweise opfern Flash-Modelle von Google etwas an Reasoning-Qualität zugunsten der Geschwindigkeit, wodurch sie sich für nahezu Echtzeitanwendungen eignen. Die tatsächliche Latenz hängt von Faktoren wie der Größe und Auflösung des eingegebenen Bildes, der Länge des Text-Prompts, der Anzahl der angeforderten Ausgabetokens und der aktuellen Auslastung der API ab. Im Allgemeinen können einfache Bildbeschreibungsaufgaben in wenigen hundert Millisekunden bis zu einigen Sekunden abgeschlossen werden, während komplexere Prompts mit längerer Ausgabe entsprechend länger dauern. Für beste Ergebnisse sollte die Bildauflösung angemessen gehalten und die Ausgabelänge begrenzt werden. Die API von OrcaRouter hat keinen zusätzlichen Overhead über die Antwortzeit des Anbieters hinaus.
Stärken: Das Modell zeichnet sich bei Aufgaben aus, bei denen eine schnelle, kosteneffiziente Antwort aus einem einzigen Bild benötigt wird. Es kann schnell alltägliche Objekte identifizieren, Text aus Bildern lesen und direkte Fragen zu visuellen Inhalten beantworten. Die niedrigen Inputkosten machen es praktikabel, große Mengen an Bildern zu verarbeiten. Einschränkungen: Es könnte bei Aufgaben mit hohem Präzisionsbedarf Schwierigkeiten haben, wie dem Zählen kleiner Objekte, dem Unterscheiden sehr ähnlicher Texturen oder dem Verstehen komplexer Diagramme. Das Verständnis des Modells ist auf das beschränkt, was aus den Pixeldaten und der Textaufforderung abgeleitet werden kann; es hat keinen Zugang zu externem Wissen über seine Trainingsdaten hinaus (Cut-off unbekannt). Zudem kann das Erzeugen ausführlicher Antworten für jedes Bild schnell teuer werden, da die Outputkosten hoch sind. Für Aufgaben, die eine lange, detaillierte Analyse erfordern, wäre ein leistungsfähigeres (und in der Regel teureres) Modell angemessener. Die Leistung bei Randfällen wie dunklen, unscharfen Bildern oder ungewöhnlichen Blickwinkeln kann geringer sein.
Die Preisgestaltung ist unkompliziert: $0,30 pro 1 Million Input-Tokens und $30,00 pro 1 Million Output-Tokens. Input-Tokens umfassen die Tokens sowohl des Text-Prompts als auch des Bildes (das Bild wird vom Modell tokenisiert). Output-Tokens sind die als Antwort generierten Tokens. Es gibt keine Einrichtungsgebühr, kein monatliches Minimum und OrcaRouter erhebt keinen Aufschlag – Sie zahlen genau den Anbieterpreis. Die Token werden vom System von OrcaRouter gezählt. Die Abrechnung erfolgt in der Regel nutzungsbasiert, wobei Gebühren beim Senden von Anfragen anfallen. Sie können die Nutzung über das OrcaRouter-Dashboard überwachen. Da Input-Tokens viel günstiger sind als Output-Tokens, dominieren die Input-Kosten die Gesamtkosten einer typischen Anfrage (kurze Ausgabe), insbesondere wenn Sie ein großes Bild einfügen. Beispielsweise kann ein 1024x1024 Bild mehrere tausend Input-Tokens verbrauchen.
Im Vergleich zu reinen Textmodellen (z. B. Gemini 1.5 Flash nur Text für $0,075/M Input, $0,30/M Output) sind die Inputkosten dieses Modells viermal höher und die Outputkosten 100-mal höher, was die zusätzliche Komplexität der Bildverarbeitung widerspiegelt. Für Aufgaben, die keine Bildanalyse erfordern, sind diese reinen Textmodelle deutlich günstiger. Im Vergleich zu größeren multimodalen Modellen wie Gemini 2.5 Pro (das höhere Kosten pro Token, aber besseres logisches Denken bietet) ist dieses Modell beim Input günstiger, beim Output jedoch je nach spezifischer Pro-Stufe ähnlich oder teurer. Der Kompromiss der Flash-Stufe liegt in einer geringeren Genauigkeit bei niedrigeren Inputkosten. Wenn Ihre Anwendung hohe Genauigkeit erfordert und höhere Inputkosten tolerieren kann, ist ein Pro-Modell möglicherweise besser. Bei großen Outputlängen werden die Outputkosten dieses Modells prohibitiv. Erwägen Sie daher Modelle mit niedrigeren Outputpreisen, wie z. B. Gemini 1.5 Flash (Text + Vision), das möglicherweise andere Tarife hat.
Die bereitgestellten Fakten erwähnen keine Caching-Mechanismen oder Mengenrabatte für dieses Modell auf OrcaRouter. OrcaRouter gibt die Preise des Anbieters ohne Aufschlag weiter, daher müssten etwaige Rabatte von Googles direkten Abrechnungsvereinbarungen kommen. Zum jetzigen Zeitpunkt gibt es in den veröffentlichten Informationen von OrcaRouter kein automatisches Caching von Bild-Einbettungen oder Prompts. Benutzer sollten davon ausgehen, dass jede Anfrage auf Basis der verwendeten Eingabe- und Ausgabetoken abgerechnet wird. Für Nutzer mit hohem Volumen könnte es sich lohnen, OrcaRouter zu kontaktieren, um nach möglichen Unternehmensvereinbarungen zu fragen, aber die standardmäßige Pay-as-you-go-Preisgestaltung beträgt $0.30/M Eingabe und $30.00/M Ausgabe. Um die Kosten zu minimieren, sollten nach Möglichkeit zuvor generierte Ausgaben wiederverwendet und die Anzahl der Token in jeder Anfrage begrenzt werden (z.B. durch Verkleinern von Bildern oder Verwenden kurzer Prompts).
Um Google: Nano Banana (Gemini 2.5 Flash Image) über OrcaRouter zu nutzen, senden Sie eine POST-Anfrage an https://api.orcarouter.ai/v1/chat/completions mit dem Modellparameter "google/gemini-2.5-flash-image". Die API verwendet das OpenAI-Chat-Completion-Format. Fügen Sie Ihren OrcaRouter-API-Schlüssel im Authorization-Header als "Bearer YOUR_API_KEY" ein. Stellen Sie im Anfragetext ein messages-Array mit einer Benutzernachricht bereit, die sowohl Bild als auch Text enthält. Fügen Sie für Bilder einen content-Teil vom Typ "image_url" mit der URL oder den base64-Daten hinzu. Beispiel: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"Was ist auf diesem Bild?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. Die Antwort ist eine standardmäßige Chat-Completion mit der Antwort des Modells.
Die OrcaRouter-API unterstützt viele derselben Parameter wie die OpenAI-API. Wesentliche Parameter: model (erforderlich, auf "google/gemini-2.5-flash-image" gesetzt), messages (erforderlich, Array von Nachrichtenobjekten), max_tokens (Ganzzahl, maximale Anzahl zu generierender Tokens), temperature (Gleitkommazahl, standardmäßig 1,0, steuert Zufälligkeit), top_p (Gleitkommazahl, standardmäßig 1,0), presence_penalty und frequency_penalty (Gleitkommazahlen), stop (Zeichenkette oder Array von Zeichenketten, bis zu 4 Sequenzen) und stream (boolescher Wert, für Streaming-Antworten). Für Bildeingabe müssen die Nachrichten mindestens eine Benutzernachricht enthalten, deren Inhalt ein Array von Teilen ist, wobei jeder Teil ein type-Feld ("text" oder "image_url") hat. Der image_url-Teil muss ein "image_url"-Objekt mit einer "url"-Zeichenkette enthalten (entweder eine öffentlich zugängliche URL oder eine Data-URL mit Base64). Es gibt kein Fine-Tuning oder zusätzliche modellspezifische Parameter. Das Kontextfenster beträgt 32.768 Tokens, daher stellen Sie sicher, dass prompt_token_count + image_token_count + max_tokens <= 32768.
Die Migration zu OrcaRouter erfordert nur minimale Codeänderungen, wenn Sie bereits eine OpenAI-kompatible API verwenden. Ändern Sie einfach die Basis-URL von Ihrem vorherigen Endpunkt zu https://api.orcarouter.ai/v1. Aktualisieren Sie Ihren API-Schlüssel auf Ihren OrcaRouter-Schlüssel. Setzen Sie beim Aufrufen des Modells den Modellparameter auf "google/gemini-2.5-flash-image" (oder Ihr gewünschtes Modell). Passen Sie vorhandene Modell-IDs entsprechend an. Stellen Sie bei Bildeingabe sicher, dass Ihr Anfrageformat der OpenAI-Konvention entspricht (z. B. Verwendung eines Content-Arrays mit image_url). In der Regel sind keine weiteren Codeänderungen erforderlich. Wenn Sie ein anderes API-Format verwendet haben (z. B. Cloud-Endpunkte), müssen Sie möglicherweise die Anfragestruktur umschreiben. OrcaRouter bietet Dokumentation für gängige SDKs. Testen Sie mit einer kleinen Anzahl von Anfragen, um Token-Zahlen und Preise zu überprüfen. Beachten Sie, dass OrcaRouter Anbieterraten ohne Aufschlag berechnet, daher können die Preise von Ihrem vorherigen Anbieter abweichen.
Im Vergleich zum rein textbasierten Gemini 2.5 Flash (sofern auf OrcaRouter verfügbar) bietet dieses Modell Bildeingabefunktionen, jedoch zu höheren Eingabekosten. Die textbasierte Version kostet in der Regel weniger pro Eingabe-Token und hat deutlich niedrigere Ausgabekosten, was sie für reine Textaufgaben vorzuziehen macht. Im Vergleich zu Gemini 2.5 Pro-Modellen ist dieses Flash-Modell bei der Eingabe günstiger, kann jedoch eine geringere Genauigkeit und Argumentationstiefe aufweisen. Pro-Modelle haben ein größeres Kontextfenster (oft 1 Million Token) und eine bessere Leistung bei komplexen mehrschrittigen Aufgaben. Die Ausgabekosten für Pro-Modelle können ähnlich oder höher sein. Für Aufgaben, die das Verständnis von Bildern neben Text erfordern, bietet dieses Modell einen kostengünstigen Einstiegspunkt. Wenn Sie jedoch Video, Audio oder mehrere Bilder gleichzeitig verarbeiten müssen, sollten Sie ein Modell in Betracht ziehen, das diese Modalitäten unterstützt (z. B. Gemini 2.5 Pro, der in einigen Konfigurationen Video und Audio unterstützt).
Dieses Modell ist eine von vielen multimodalen Optionen, die über OrcaRouter verfügbar sind. GPT-4o (OpenAI) hat typischerweise ein größeres Kontextfenster (128k) und bietet möglicherweise ein besseres Gesamtverständnis von Bildern und logische Schlussfolgerungen, jedoch zu höheren Eingabe- und Ausgabekosten. Die Vision-Modelle von Claude (z. B. Claude 3.5 Sonnet) sind ebenfalls konkurrenzfähig, unterscheiden sich jedoch im Preis und in der Kontextlänge. Der Hauptvorteil von Gemini 2.5 Flash Image sind die niedrigen Eingabekosten, was es für Aufgaben mit hohem Volumen und kurzen Ausgaben attraktiv macht. Bei komplexer visueller Argumentation, medizinischer Bildgebung oder detaillierter Dokumentenanalyse können jedoch fortgeschrittenere Modelle bessere Ergebnisse liefern. Die Wahl hängt vom spezifischen Kompromiss zwischen Kosten, Genauigkeit und Latenz ab. OrcaRouter ermöglicht es Ihnen, einfach zwischen Modellen zu wechseln, indem Sie die Modell-ID ändern, sodass es praktikabel ist, dieses Modell zusammen mit Alternativen zu testen, um die beste Lösung zu ermitteln.
Ein teureres Modell – wie Gemini 2.5 Pro, GPT-4o oder Claude 3.5 Sonnet – ist dann gerechtfertigt, wenn die Aufgabe höhere Genauigkeit, längere Kontexte oder mehrschrittige Überlegungen erfordert. Falls Ihre Anwendung mit diesem Modell falsche oder unvollständige Ergebnisse liefert, sind die Kosteneinsparungen verschwendet, wenn Sie Nachbearbeitung oder menschliche Korrekturen benötigen. Bei Aufgaben wie der Analyse medizinischer Bilder, der Auslegung juristischer Dokumente oder der Verarbeitung sensibler Compliance-Inhalte kann die Zuverlässigkeit eines Premium-Modells die höheren Kosten rechtfertigen. Wenn Sie zudem lange Ausgaben (z. B. vollständige Seitenbeschreibungen) generieren oder sehr große Bilder verarbeiten müssen, könnten Modelle mit größeren Kontextfenstern und niedrigeren Ausgabetoken-Kosten insgesamt kosteneffizienter sein. Die Flash-Stufe dieses Modells bedeutet, dass es für Geschwindigkeit und Durchsatz konzipiert ist, nicht für Tiefe. Verwenden Sie es dort, wo ein annäherndes Verständnis ausreicht; wechseln Sie auf ein höheres Modell, wenn es auf Präzision ankommt.
Datenschutz und Datenverarbeitung hängen von Googles Richtlinien für Gemini-Modelle ab. Wie bei jeder Cloud-API werden Eingabedaten (Bilder und Text) zur Verarbeitung an Googles Server gesendet. Google kann die Daten zur Modellverbesserung verwenden, es sei denn, Sie widersprechen oder verwenden Unternehmenskonten, die eine solche Nutzung untersagen. Die bereitgestellten Fakten enthalten keine Angaben zur Datenverarbeitung für dieses spezifische Modell. Bei Verwendung von OrcaRouter als Gateway durchlaufen die Daten die Infrastruktur von OrcaRouter, werden aber letztendlich von Google verarbeitet. OrcaRouter speichert Ihre Daten nicht und verwendet sie nicht für das Training. Benutzer sollten Googles Datenverarbeitungsbedingungen für Gemini-APIs prüfen und bei Bedarf eine Ende-zu-Ende-Verschlüsselung in Betracht ziehen. Für sensible Daten bevorzugen einige Organisationen Modelle, die auf ihrer eigenen Infrastruktur gehostet werden (z. B. über Vertex AI mit Datenresidenz), anstatt eines Drittanbieter-Gateways. OrcaRouter bietet jedoch einen einheitlichen API-Schlüssel und eine einheitliche Abrechnung, was den Zugriff vereinfachen kann, wenn die Bedenken hinsichtlich der Datenverarbeitung akzeptabel sind.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Eingabe / 1M Tokens | $0.300 |
| Ausgabe / 1M Tokens | $30.00 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/google/gemini-2.5-flash-imageÖffnen @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image