Hero-Titelkarte für „Gemini Nano Banana 2.1 vs Qwen Image 3.0“ mit dem Untertitel „Ein Gleichstand bei 1K, eine Aufteilung bei 2K“. Eine linke Karte mit der Überschrift „Gemini Nano Banana 2.1“ listet ihr GA-Datum, ihre Preise für 1K, 2K und 4K sowie die Angabe, dass sie noch nicht in der Arena bewertet wurde; eine rechte Karte mit der Überschrift „Qwen Image 3.0“ listet ihr Veröffentlichungsdatum, ihre Preise für 1K und 2K, dass 4K nicht angeboten wird, und ihr Arena-Elo auf, mit einem kleinen „vs“-Trenner dazwischen. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Gemini Nano Banana 2.1 vs. Qwen Image 3.0: Gleichstand bei 1K, geteiltes Ergebnis bei 2K

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Setzt man Gem​ini Nano Banana 2.1 und Qw​en Image 3.0 auf eine Preisliste, ist die erste Zahl amüsant: Ein 1K-Bild vom neuesten Gem​ini-Bildmodell kostet $0.0336, und eine 1K-Generierung mit Qw​en Image 3.0 auf Model Studio kostet $0.03438. Sieben Hundertstel Cent auseinander. Zwei Labore auf gegenüberliegenden Seiten der Welt, die in unterschiedlichen Währungen für unterschiedliche Plattformen veröffentlichen, landeten beim selben Preis für das, was die meisten Leute tatsächlich kaufen. Der Gleichstand endet in dem Moment, in dem man zu 2K übergeht – $0.0504 gegen $0.0688, eine 36-%-Lücke zu Gem​inis Gunsten – und er endet wieder anders, sobald man bemerkt, dass Qw​en Bildeingabe und Bearbeitungseingabe als separate Abrechnungsposten berechnet, während Nano Banana 2.1 das nicht tut. Welche dieser beiden Tatsachen ausschlaggebend für deinen Build ist, hängt völlig davon ab, wie oft deine Pipeline ein Bild anfasst, bevor sie eines ausliefert.

Sie unterscheiden sich zudem stärker, als der Preis vermuten lässt. Nano Banana 2.1 wurde am 6. Oktober 2026 als gehostetes API-Modell allgemein verfügbar, mit einer 23-tägigen Migrationsfrist für seinen Vorgänger. Qwen Image 3.0 wurde am 5. August 2026 auf Alibabas Qwen-AI-Plattform eingeführt, mit Standard- und Pro-Tarifen sowie gleichzeitig verfügbaren APIs, und erreicht internationale Entwickler über Qwen Cloud und Alibaba Cloud Model Studio. Das eine ist ein Modell eines westlichen Frontier-Labors, das pro Bild-Token abgerechnet wird; das andere ist ein chinesisches Plattformmodell, das pro Bild abgerechnet wird, mit einem veröffentlichten Parallelitätsbudget und einer inländischen und einer internationalen Preisliste, die nicht miteinander übereinstimmen.

Die beiden Tarifkarten, Zeile für Zeile

Nano Banana 2.1 wird in Tokens abgerechnet, wobei eine Umrechnung pro Bild daneben veröffentlicht wird. Die Ausgabe kostet 30 $ pro Million Bild-Tokens, was Google zu 0,0336 $, 0,0504 $ bzw. 0,0756 $ für 1K, 2K und 4K auflöst, wobei die Tokenanzahl pro Bild mit 1.120, 1.680 und 2.520 angegeben wird. Die Eingabe kostet 1,50 $ pro Million Tokens für Text, Bild und Video. Die Batch-Ausgabe kostet die Hälfte: 0,0168 $, 0,0252 $ und 0,0378 $. Es gibt keinen separaten Zähler dafür, ein Bild erneut einzuspeisen – ein Bild, das Sie als Eingabe übergeben, wird einmal zum Eingabe-Token-Tarif gezählt.

Qwen Image 3.0 kommt in zwei Stufen auf einer chinesischen Cloud-Preisliste. Standard kostet RMB 0,18 pro Bild sowohl bei 1K als auch bei 2K, wobei Bildeingabe RMB 0,02 und Bearbeitungseingabe RMB 0,02 pro Bild kostet. Pro kostet RMB 0,25 bei 1K und RMB 0,50 bei 2K. Auf Qwen Cloud international kostet die Standard-Stufe $0,003 Eingabe und $0,03 Ausgabe pro Bild. Auf Alibaba Cloud Model Studio in USD sind die veröffentlichten Zahlen $0,00275 pro 1K Eingabe, $0,03438 pro 1K-Generierung, $0,068761 pro 2K-Generierung, $0,04 pro 1K Ausgabe und $0,075 pro 2K Ausgabe. Der Durchsatz ist ebenfalls veröffentlicht: 10 gleichzeitige Anfragen, eine asynchrone Warteschlange mit 200 Anfragen und 20 Anfragen pro Minute.

• 1K-Generierung – Gemini Nano Banana 2.1 $0.0336; Qwen Image 3.0 Standard $0.03438 auf Model Studio. Effektiv ein Gleichstand.

• 2K-Generierung — Nano Banana 2.1 0,0504 $; Qwen Image 3.0 Standard 0,068761 $. Google ist 36 % günstiger.

• 4K — Nano Banana 2.1 0,0756 $ und es ist eine dokumentierte Stufe; der Model-Studio-Eintrag von Qwen Image 3.0 begrenzt die Gesamtpixelzahl auf 2048×2048, sodass es keine 4K-Zeile zum Vergleich gibt.

• Bildeingabe — Nano Banana 2.1 zählt sie zum Eingabetarif von 1,50 $ pro Million; Qwen Image 3.0 rechnet sie separat mit 0,00275 $ pro 1K Eingabe ab, wobei Bearbeitungseingaben im Inland mit 0,02 RMB berechnet werden.

• Batch — Nano Banana 2.1 halbiert alles über die Batch-API bei bis zu 24 Stunden Bearbeitungszeit; der veröffentlichte Hebel von Qwen Image 3.0 ist eine asynchrone Warteschlange von 200 statt einer Rabattstufe.

• Durchsatz — Qwen Image 3.0 veröffentlicht 10 gleichzeitige Anfragen, 200 in der Warteschlange, 20 RPM; Google veröffentlicht nichts davon für Nano Banana 2.1.

• Im Inland — Qwen Image 3.0 Standard kostet RMB 0,18 pro Bild auf der chinesischen Preisliste; Nano Banana 2.1 hat keine chinesische Inlandsstufe, weil Google keine anbietet.

Zwei dieser Zeilen sind wichtiger als der Rest. Die 4K-Zeile ist eher eine Funktions- als eine Preislücke – wenn Sie 4K-Ausgabe benötigen, kommt der Model-Studio-Eintrag von Qwen Image 3.0 überhaupt nicht infrage. Und die Zeile für die Bild-Eingabe ist der Punkt, an dem die beiden Abrechnungsphilosophien stark auseinandergehen, was einen eigenen Abschnitt verdient, denn das ist der Teil, der in einem Schlagzeilenpreis nicht auftaucht.

Warum der zweite Durchgang die Mathematik verändert

Eine Single-Shot-Generierung ist der einfache Fall, und bei einem einzelnen Shot sind diese beiden preislich austauschbar. Echte Bildarbeit ist selten Single-Shot. Ein typischer Bearbeitungsworkflow generiert einen Kandidaten, führt ein Referenzbild für eine Korrektur wieder ein, führt das korrigierte Bild erneut für einen Stildurchlauf wieder ein und liefert erst dann aus. Jede dieser Rückführungen ist eine Bildeingabe.

Bei Nano Banana 2.1 wird diese Eingabe zum allgemeinen Eingabetarif zusammen mit dem Text-Prompt abgerechnet, und die dialogorientierte Bearbeitung des Modells ist ausdrücklich dafür ausgelegt – mehrstufige Bearbeitung über eine vorherige Interaktion ist eine dokumentierte Funktion, und der Thinking-Modus trägt die Konversation. Bei Qwen Image 3.0 wird dieselbe Schleife auf einer eigenen Abrechnungsposition abgerechnet, die der Anbieter veröffentlicht: Bildeingabe zu 0,00275 $ pro 1K auf Model Studio, 0,02 RMB pro Bild als Bearbeitungseingabe im Inland. Keines von beiden ist pro Aufruf teuer. Der Unterschied besteht darin, dass Qwens Abrechnung die Iterationskosten als eigene Position sichtbar macht, während Googles sie in die Eingabe-Tokens einfließen lässt, und ein Team, das ausgehend von der beworbenen Pro-Bild-Zahl budgetiert, wird den Drei-Pass-Workflow auf beiden Plattformen unterschätzen.

Rechne ehrlich nach, und die praktische Empfehlung ist langweilig, aber real. Beim 1K-Preis sind sie gleich, der Preis ist also kein Grund, sich für eines von beiden zu entscheiden. Bei 2K ist Nano Banana 2.1 pro Generierung deutlich günstiger und bietet zusätzlich eine Batch-Stufe, die den Preis noch einmal halbiert. Wenn du 4K brauchst, gibt es nichts zu vergleichen. Wenn du ein veröffentlichtes Parallelitätsbudget brauchst, auf dessen Grundlage du eine Warteschlange planen kannst, veröffentlicht Qwen Image 3.0 eines, Nano Banana 2.1 nicht. Das ist die Form der Entscheidung: Es geht vor allem um die Auflösung und die Durchsatzgarantie, die du brauchst, nicht um den Preis in der Stufe, die alle nennen.

Was wird gemessen, und für wen

Die Evidenzasymmetrie verläuft hier entgegengesetzt zu dem, was man erwarten könnte. Qwen Image 3.0 hat eine unabhängige Platzierung, und Nano Banana 2.1, gerade einen Tag alt, hat sie nicht. Auf dem Text-to-Image-Board von Artificial Analysis, basierend auf im Juli 2026 gesammelten Stichproben, liegt Qwen-Image-3.0 mit Elo 1.077 auf dem sechzehnten Platz von 5.816 Stichproben und Qwen-Image-3.0-Pro mit 1.088 auf dem vierzehnten von 6.077 – im Mittelfeld, mit guter Stichprobenbasis und ungefähr dort, wo eher ein starkes Plattformmodell als ein Frontier-Modell landet. Alibabas eigener Startanspruch, dass das Modell den ersten Platz in China auf der Text-to-Image-Bestenliste von Arena.ai belegte, ist eine vom Anbieter gemeldete Zahl auf einem anderen Board mit einer anderen Wählerschaft; sie widerspricht nicht der Platzierung bei Artificial Analysis, sie misst nur etwas anderes.

Die Habenseite von Nano Banana 2.1 sieht so aus. In den öffentlichen Aufzeichnungen mit Stand vom 7. Oktober 2026 gibt es kein Elo, keine Stimmenzahl und kein Third-Party-Render. Was existiert, ist Googles Changelog-Sprache – „signifikante Verbesserungen“ bei visueller Qualität, Prompt-Treue, Charakterkonsistenz über mehrere Turns hinweg und Textrendering – sowie die dokumentierten Funktionsänderungen: 1K-, 2K- und 4K-Ausgabe ohne 512-px-Stufe, bis zu 14 Referenzbilder, aufgeteilt in zehn Objekte und vier Charaktere, standardmäßig aktivierter Thinking-Modus und Google Image Search Grounding mit Web Search. Wenn Sie diese beiden heute hinsichtlich der Qualität vergleichen möchten, vergleichen Sie den gemessenen Mittelfeldwert des einen Modells mit der Herstellerangabe des anderen Modells, und dabei handelt es sich nicht um dieselbe Art von Zahl.

A two-column comparison scoreboard titled 'Gemini Nano Banana 2.1 vs Qwen Image 3.0 — the scoreboard', contrasting GA date, 1K/2K/4K image prices, maximum output resolution and arena placement for the two models, with a footer citing Google's pricing page, Alibaba Cloud Model Studio and Artificial Analysis. The OrcaRouter logo is composited in the bottom-right corner.

Wo Sie jeden von ihnen anrufen können

Keines der beiden Modelle ist auf OrcaRouter verfügbar, und es lohnt sich, das unverblümt zu sagen, statt etwas anderes anzudeuten. Gemini Nano Banana 2.1 ist über die eigene API des Anbieters und über mehrere Drittanbieter-Plattformen erhältlich; Qwen Image 3.0 ist über seine eigene Plattform und mehrere Drittanbieter-Plattformen erhältlich. Unser Katalog führt jedoch andere Bildmodelle — OpenAIs openai/gpt-image-2 und google/gemini-3.1-flash-image-preview darunter — und insgesamt 207 Modelle hinter einem OpenAI-kompatiblen Endpunkt.

Das ist für diesen Vergleich aus einem ganz bestimmten Grund wichtig: Beide dieser Anbieter ändern ihre Zahlen. Google hat die gesamte Tarifstruktur des Vorgängers von Nano Banana 2.1 umgestellt und am selben Tag eine Abschaltung angekündigt; Alibaba veröffentlicht eine Preisliste in RMB für die inländische Plattform, eine zweite in USD für Model Studio und eine dritte Zahlenreihe für die internationale Qwen Cloud. Wenn der Preis eines Anbieters ein bewegliches Ziel ist, liegt der Wert des Kaufs über eine Ebene, die den Listenpreis des Anbieters mit 0 % Aufschlag weitergibt, darin, dass sich die Zahl auf Ihrer Seite am selben Tag ändert, an dem sie sich bei ihm ändert – ohne Marge zwischen Ihnen und der veröffentlichten Zahl und ohne separaten Vertrag, der neu verhandelt werden müsste. Auf dieser Disziplin ist das Routing von OrcaRouter aufgebaut, und das ist der Grund, warum ein Preislistenvergleich wie dieser auch einen Monat später noch stimmt, statt abzudriften.

Screenshot of Alibaba Cloud Model Studio documentation, in English, captured October 7, 2026, listing the Qwen-Image model family: the qwen-image-3.0-pro entry marked Recommended, described as the Qwen image generation and editing 3.0 series supporting image-to-image and image editing with an output range from 912x512 to 2048x2048 in PNG format, above the qwen-image-2.0-pro, qwen-image-2.0, qwen-image-max and qwen-image-plus entries.

Welchen sollte man tatsächlich nehmen?

Wählen Sie Gemini Nano Banana 2.1, wenn Sie 4K-Ausgabe benötigen, wenn Sie eine Batch-Stufe möchten, die die Kosten pro Bild für große Referenzdurchläufe halbiert, wenn promptbasiertes Editieren mit bis zu 14 Referenzbildern der Workflow ist oder wenn Sie Google Search Grounding innerhalb der Generierung wünschen. Die Migrationsfrist für den Vorgänger ist eher ein Grund, zu ihr zu wechseln, als ein Grund, sie zu vermeiden, und der Preisrückgang gegenüber Nano Banana 2 beträgt bei jeder Auflösung ungefähr eine Halbierung. Die offenen Fragen sind das Fehlen jeglicher unabhängiger Qualitätsmessung und die nicht veröffentlichten Durchsatzgrenzen, weshalb ein Produktionspfad darauf vorbereitet sein sollte, ein Failover durchzuführen, anstatt anzunehmen, dass der Endpunkt verfügbar bleibt.

Wählen Sie Qwen Image 3.0, wenn die Ausgabe bei oder unter 2048×2048 bleibt, wenn ein veröffentlichtes Parallelitätsbudget relevant ist, weil Sie Arbeit in eine Warteschlange einreihen, wenn die chinesische Preisliste mit RMB 0,18 pro Bild die kommerziell relevante Zahl ist, oder wenn der höhere Preis der Pro-Stufe Ihnen etwas bringt, das Ihre Evaluierung nachweisen kann. Die unabhängige Platzierung im Mittelfeld ist für diesen Einsatzzweck keine Schwäche – sie ist die verlässlichste einzelne Tatsache in diesem Vergleich, denn sie ist die einzige Zahl hier, die keiner der beiden Anbieter erzeugt hat.

Wenn Sie den Luxus eines Bake-offs haben, führen Sie ihn entlang der Dimension durch, die sich tatsächlich unterscheidet: der Multi-Pass-Bearbeitung. Generieren Sie einen Kandidaten, führen Sie dann bei jedem Modell drei aufeinanderfolgende Korrekturen durch und zählen Sie die Gesamtkosten des akzeptierten Bildes statt der Kosten des ersten Renderings. Das ist der Vergleich, den keine Preisliste eines Anbieters für Sie durchführt, und es ist derjenige, der entscheidet, ob ein „Unentschieden“ bei 1K wirklich ein Unentschieden ist.

Screenshot of Google's Gemini API pricing page, in English, captured October 7, 2026, showing the Gemini Nano Banana 2.1 row: model code gemini-nano-banana-2.1, described as an update to Nano Banana 2 built for high-efficiency image generation and conversational editing with improved visual quality, multi-turn character consistency, accurate text rendering and search-grounded generation across 1K, 2K and 4K resolutions, with output priced at $30.00 per 1M image tokens, equivalent to $0.0336 per 1K image, $0.0504 per 2K image and $0.0756 per 4K image, and the footnote that output images at 1K consume 1,120 tokens.