
Qwen-Image-2.1 vs. Nano Banana 2 Lite: 340 US-Dollar für zehntausend Bilder oder 13 Stunden GPU
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Zehntausend 1024-Pixel-Bilder auf Nano Banana 2 Lite kosten etwa 340 US-Dollar. Zehntausend Bilder von Qwen-Image-2.1 kosten ungefähr dreizehn Stunden einer 24-GB-GPU und eine Lizenz, die Ihnen verbietet, eines davon zu verkaufen. Das ist der Tausch in einer Zeile, und es ist der einzige Vergleich in dieser Familie, bei dem die beiden Modelle tatsächlich im selben Moment dieselbe Aufgabe erledigen. Qwen-Image-2.1 wurde am 20. September 2026 als Open-Weights-Modell veröffentlicht. Nano Banana 2 Lite – die Modell-ID des Anbieters google/gemini-3.1-flash-lite-image, offiziell Gemini 3.1 Flash-Lite Image – wurde am 30. Juni 2026 veröffentlicht und ist der günstigste Standbildgenerator in der Nano-Banana-Reihe.
Die beiden Kandidaten, ehrlich bepreist
Nano Banana 2 Lite erzeugt ein 1K-Bild in etwa vier Sekunden, rund 2,7× schneller als Gemini 3.1 Flash Image, und berechnet pauschal 0,034 $ pro 1K-Bild. Die Google-Token-Preise hinter dieser Zahl liegen bei 0,25 $ pro 1 Mio. Eingabe-Tokens und 30 $ pro 1 Mio. Bild-Ausgabe-Tokens, was bei 1K etwa 0,0336 $ ergibt; der Batch-Modus halbiert das auf rund 0,0168 $. Es gibt keine kostenlose Tarifstufe, und jede Ausgabe trägt ein unsichtbares SynthID-Wasserzeichen.
Qwen-Image-2.1 hat keinen Preis, denn es gibt nichts zu kaufen. Es ist ein etwa 33 GB großer Download – ein 7B-32-Schichten-Single-Stream-Diffusion-Transformer in Kombination mit einem Qwen3-VL-8B-Textencoder –, den Sie selbst hosten. Am nächsten an eine Preisliste kommt die von SGLang-Diffusion gemessene Latenz: 4,74 Sekunden für den Denoising-Durchlauf auf einer RTX 4090 mit 24 GB unter Verwendung von Cache-DiT und INT8-Kernels, 8,23 Sekunden für eine vollständige 1024×1024-Generierung mit 40 Schritten auf einer RTX PRO 6000 Blackwell bei einem Spitzen-Speicherbedarf von 40,1 GiB und 2,748 Sekunden auf einer einzelnen B200. Das sind Latenzen für einzelne Anfragen einschließlich der genannten Komponenten, keine Durchsatzwerte; betrachten Sie daher 13 Stunden für zehntausend Bilder als Größenordnung und nicht als Benchmark.
Setzt man sie nebeneinander, lautet die Rechnung nicht „$340 gegenüber kostenlos“. Sie lautet $340 gegenüber dreizehn Stunden einer Karte, die Sie entweder bereits besitzen oder mieten, plus der Engineering-Zeit, um einen Serving-Stack aufzusetzen. Das Crossover-Volumen ist weit niedriger, als die meisten Teams annehmen – aber nur, wenn die Karte den Rest des Monats nicht ungenutzt herumliegt, und nur, wenn die Ausgabe etwas ist, das Sie erzeugen dürfen.
Drei Workloads und welches Modell welche übernimmt
Das Volumen ist für sich genommen die falsche Achse. Die Art der Arbeit entscheidet das schneller.
• Hochvolumige On-Screen-Assets — Social-Zuschnitte, Thumbnails, A/B-Varianten. Nano Banana 2 Lite gewinnt bei fast jeder Komponente. Vier Sekunden pro Bild, vierzehn Seitenverhältnisse einschließlich 1:4 und 8:1, ein pauschaler Preis pro Bild, den Sie auf den Cent genau prognostizieren können, Batch-Modus zum halben Preis. Nichts an dieser Arbeitslast benötigt Alpha oder 2K, und die wasserzeichenversehene kommerzielle Lizenz ist genau das, was Sie wollen, wenn die Ausgabe ausgeliefert wird.
• Druck, großformatiges Compositing oder alles, was Sie stark zuschneiden werden. Qwen-Image-2.1, und das nicht knapp. Native 2048×2048 bei 40 Schritten gegenüber einem Modell, das fest auf rund 1 Megapixel gedeckelt ist, ohne 2K-Modus, ohne Upscaling und ohne API-Parameter, um es zu erhöhen — Google leitet 2K- und 4K-Arbeiten stattdessen an Nano Banana 2 oder Nano Banana Pro weiter. Wenn Sie ein Drittel des Bildes wegschneiden müssen und trotzdem ein brauchbares Asset haben wollen, kann Lite Sie nicht dorthin bringen.
• Transparente Freisteller, Icons, Sprites, Ebenen-Komposite. Qwen-Image-2.1. Der Alphakanal ist eine Komponente des 64-Kanal-RGBA-Latent-Raums, in dem der Sampler Denoising betreibt, sodass es keinen Segmentierungsdurchlauf und keinen Matting-Durchlauf gibt; das Modell kann außerdem ein Motiv aus einem gewöhnlichen Foto in eine transparente Ebene herauslösen. Nano Banana 2 Lite hat keine dokumentierte Ausgabe mit transparentem Hintergrund.
• Alles, was kommerziell lizenziert werden muss. Nano Banana 2 Lite, ohne Einschränkung. Qwen-Image-2.1 wird unter der Qwen Research License Agreement vom 20. September 2026 bereitgestellt und erlaubt ausschließlich nicht-kommerzielle Forschung und Evaluierung; der kommerzielle Einsatz erfordert eine separate Lizenz von Hangzhou Tongyi Laboratory Technology, und es gibt weder einen veröffentlichten Preis noch ein Term Sheet dafür.
Eine weitere Zeile gehört in diese Liste, und sie spricht gegen das offene Modell. Nano Banana 2 Lite weiß Dinge – es kommt mit einem Wissens-Cutoff von Januar 2025 und einem Profil zur Prompt-Treue, das auf dem Backbone Gemini 3.1 Flash Lite aufbaut, mit starker Textwiedergabe im Bild, einschließlich Chinesisch, Japanisch und Koreanisch. Die unabhängige Beweislage zu Qwen-Image-2.1 bei der Befolgung von Anweisungen ist dünn und gemischt. Ein Vergleich in einer AI-Judge-Arena, in dem Nano Banana 2 Lite gegen ein Qwen-Bildmodell antrat – der Eintrag legt keine Version fest, lesen Sie ihn also als Signal über die Familie und nicht speziell über 2.1 –, ging bei den seltsamen räumlichen Prompts („Astronaut reitet auf einem Pferd“, „Capybara-Taxifahrer“) und bei der Textwiedergabe an Lite, wo die Qwen-Ausgabe den Titel einer Halloween-Einladung als „Hallofarty Invitation“ wiedergab. Lites eigene dokumentierte Schwachstellen sind kleine Gesichter, feine Textdetails, dichte Infografiken und komplexe maskierte Bearbeitungen. Keines der beiden Modelle ist zuverlässig besser darin, einer seltsamen Anweisung zu folgen; sie scheitern an unterschiedlichen Stellen.

Die Referenzbildfrage, ungeklärt
Multi-Bild-Bearbeitung ist der Punkt, an dem eine Volumen-Pipeline nicht mehr in der Lage ist, ein Modell durch das andere zu ersetzen, und sie ist zugleich die Zeile, in der die öffentlichen Informationen einander widersprechen.
Qwen-Image-2.1 akzeptiert bis zu 10 Referenzbilder und unterstützt darüber hinaus virtuelles Anprobieren, Gruppenporträts und Outfit-Komposition. Bei Nano Banana 2 Lite gehen die Quellen stark auseinander: Die Modellseite eines Anbieters gibt an, dass bis zu 14 Referenzbilder für Stiltransfer und Bearbeitung mit mehreren Referenzen unterstützt werden, während ein Vergleichsartikel das Gegenteil behauptet – dass Lite ein einzelnes Bild zur Bearbeitung akzeptiert und dass die Fähigkeit mit 14 Referenzen zum vollwertigen Nano Banana 2 gehört, mit maximal fünf Personen plus sechs Objekten. Angesichts dieses Widerspruchs ist die vertretbare Position, dass Lite Bildeingabe und Komposition aus mehreren Bildern unterstützt, seine Referenzkapazität jedoch das Unterscheidungsmerkmal ist, mit dem Google es von Nano Banana 2 abgrenzt. Wenn Ihr Workflow von sechs konsistenten Charakteren über eine Serie hinweg abhängt, prüfen Sie das Limit anhand von Googles eigener Modellkarte, bevor Sie darauf aufbauen.
Hier werden die Modelle auch im weiteren Sinne nicht mehr austauschbar. Google positioniert Nano Banana 2 Lite und Gemini Omni Flash als Paar – das Standbildmodell und das Videomodell, dafür ausgelegt, verkettet zu werden. Qwen-Image-2.1 hat kein Video-Pendant, und sein Animationstrick ist eine verkettete Abfolge lokaler Bereichsbearbeitungen, die eine einfache Bild-für-Bild-Schleife erzeugt, kein Videomodell.
Wo sich eine Routing-Schicht ihren Platz verdient
Keines dieser Modelle ist auf OrcaRouter verfügbar. Wir routen kein Qwen-Image-Modell irgendeiner Version, Qwen-Image-2.1 ist also entweder selbst gehostet oder gar nicht verfügbar. Nano Banana 2 Lite – die gemini-3.1-flash-lite-image-Kennung – ist ebenfalls nicht in unserem Katalog; die Google-Bild-Routen, die wir tatsächlich anbieten, sind google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview sowie die drei Imagen-4-Stufen, dazu OpenAIs GPT-Image-2, GPT-Image-1.5 und GPT-Image-1-mini und xAIs Grok-Imagine-Bild-Endpunkt.
Was das einer gemischten Pipeline bringt, ist genau das, worauf dieser Vergleich immer wieder stößt: eine Entscheidung, die sich pro Asset ändert. Volumen-Assets gehen an eine günstige gehostete Route, transparente Freisteller gehen auf deine eigene Karte, und eine Preisänderung eines Anbieters auf der gehosteten Seite schlägt am selben Tag durch, weil wir den Listenpreis des Anbieters ohne Aufschlag durchreichen, statt ihn selbst zu bepreisen. Füge automatisches Failover über Anbieter hinweg hinzu, eine Routing-DSL zum Zusammensetzen von Fallbacks und Modell-Fusion für Panel-artige Aufrufe, und die gehostete Hälfte hört auf, eine Anbieterbeziehung zu sein, die du pro Modell verwalten musst — 200+ Modelle, ein OpenAI-kompatibler Endpunkt, ein Schlüssel. Die selbst gehostete Hälfte bleibt dein Problem, was die ehrlichen Kosten dafür sind, einen forschungslizenzierten Checkpoint auf Hardware zu betreiben, die dir gehört.
Welche man wählen sollte und die Bedingung, die das umschlagen lässt
Wenn Sie On-Screen-Assets in großem Umfang für die kommerzielle Nutzung produzieren, ist Nano Banana 2 Lite die Lösung, und die Lizenzfrage stellt sich gar nicht: 0,034 $ pro Bild, vier Sekunden, kalkulierbar, verkaufbar. Wenn Sie 2K, native Transparenz oder zehn Referenzbilder benötigen, ist Qwen-Image-2.1 der einzige der beiden, der irgendetwas davon bietet, und das bezahlen Sie mit Hardware, Entwicklungszeit und einer nicht-kommerziellen Lizenz, die es zu einem Forschungsinstrument statt zu einer Produktionsabhängigkeit macht.
Eine einzige Tatsache würde die Lücke schließen. Ein veröffentlichtes kommerzielles Term Sheet für Qwen-Image-2.1 — mit einem Preis und Bedingungen, die man tatsächlich unterschreiben kann — verwandelt einen 13-stündigen GPU-Job in einen Einzelposten, der mit 340 US-Dollar konkurriert, und ab diesem Punkt beginnen die Auflösungs- und Alpha-Vorteile, Workloads für sich zu gewinnen, die derzeit standardmäßig an Lite gehen. Bis es das gibt, ist die Aufteilung klar: Lite für alles, was ausgeliefert wird, Qwen-Image-2.1 für alles, was im Haus bleibt, und einen Serving-Stack für Letzteres, den Sie selbst betreiben.


