
Bernini-Diffusers-v2 vs. Qwen Image 3.0: Gewichte, die Ihnen gehören, vs. eine API, die Text rendert
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Zwei chinesische Labore brachten im Abstand von drei Wochen bildfähige Modelle heraus und landeten auf entgegengesetzten Seiten der größten Kluft in dieser Kategorie. Qwen-Image-3.0wurde am 21. Juli 2026 von Alibabas Team veröffentlicht und am 4. August für eine internationale API geöffnet; es ist ein Bildmodell mit geschlossenen Gewichten, das Sie über HTTP aufrufen. Bernini-Diffusers-v2, das ByteDance am 13. August 2026 ohne Ankündigung auf Hugging Face veröffentlichte, ist Apache-2.0-Open-Weights, die Sie herunterladen und ausführen können. Gleiche grobe Aufgabenbeschreibung – Bilderzeugung und -bearbeitung – und gegensätzliche Antworten auf die Frage, wer das Modell kontrolliert. Das meiste, was folgt, ist die Konsequenz dieser einen Entscheidung, also ist es der Ausgangspunkt dieses Vergleichs und nicht sein Ende.
Die Gewichte dividieren
• Qwen-Image-3.0 — geschlossene Gewichte. Zum jetzigen Zeitpunkt hat Alibaba weder die Gewichte noch einen technischen Bericht dazu veröffentlicht; man nutzt es über die API auf Alibaba Cloud Bailian oder der Qwen-Plattform. Die Ausgaben tragen ein AIGC-Provenienzlabel. Was man kauft, ist Fähigkeit ohne Verfügungsgewalt: kein Self-Hosting, kein Fine-Tuning, keine Offline-Nutzung, kein Blick unter die Haube.
• Bernini-Diffusers-v2 — offene Gewichte. Apache-2.0, ein eigenständiges diffusers-Verzeichnis auf Hugging Face und lokale Inferenz-Skripte im Repository bytedance/Bernini. Sie können es feinabstimmen, es ohne Internetverbindung ausführen, Ihre Daten auf Ihrer eigenen Hardware behalten und nicht mehr pro Bild bezahlen. Der Preis für die Datenhoheit ist der Betrieb: Das README empfiehlt GPUs der Hopper-Klasse und einen Stack mit Python 3.11.2 und PyTorch 2.7.1+cu126.
Für ein Team, dessen Bilder vertrauliches Material enthalten oder dessen Compliance-Richtlinien das Senden von Daten an eine Drittanbieter-API verbieten, entscheidet diese Trennung die Frage von selbst.
Text- und Layouttreue
Worin Qwen-Image-3.0 wirklich heraussticht, ist der Text. Seine Kennzahlen aus den Veröffentlichungsmaterialien von Alibaba:
• Prompt-Fenster — bis zu 4.500 Token an Eingabe, ein 4,5-facher Sprung gegenüber der vorherigen Generation, wodurch es kompakte Briefings wie Zeitungs-Titelseiten oder ein Neun-Panel-Wissensraster in einem einzigen Aufruf verarbeiten kannbr />• Kleiner Text — lesbare Darstellung bis hinunter zu etwa 10px, einschließlich mathematischer Notation, tiefgestellter und hochgestellter Zeichen sowie mehrzeiliger Formelnbr />• Sprachen — native Darstellung in 12 Sprachen mit über 20 Schriftarten und über 100 künstlerischen Stilen sowie Vertrautheit mit gängigen Web-, Spiel- und Software-Oberflächen
Bernini-Diffusers-v2 erhebt auf seiner Modellkarte keinen vergleichbaren Anspruch in Bezug auf Text und Layout. Seine Stärken liegen woanders — planungsbasiertes semantisches Editieren und eine Videopipeline — und bei einem Briefing, das in erster Linie „diese Infografik genau wiedergeben“ lautet, ist Qwen-Image-3.0 die bewährte Wahl und Bernini die unbewährte.
Bearbeitungstiefe
• Qwen-Image-3.0 — Generation plus Bearbeitung, mit einem Portfolio spezialisierter Tricks: Restaurierung antiker Gemälde, Panorama-Generierung, Skizze-zu-PPT und Multi-Shot-Storyboarding. Der Anspruch ist Produktionstauglichkeit — Layouts, die halten, Details, die echt wirken — statt einer bestimmten Bearbeitungsarchitektur.
• Bernini-Diffusers-v2 — Bearbeitung über einen semantischen Planer. Ein Qwen2.5-VL-Planer zerlegt die Anweisung in einen Plan dessen, was sich ändern soll, und ein auf Wan2.2 basierender Renderer zeichnet es. Das ist ein überzeugendes Design für komplexe, mehrstufige Bearbeitungen – „Jahreszeit ändern, Auto ersetzen, Bildausschnitt beibehalten“ – und es erstreckt sich auf Videoaufgaben (t2v, v2v, rv2v), die kein Konkurrent abdeckt. All dies stammt vom Anbieter und ist öffentlich nicht verifiziert.


Kosten
• Qwen-Image-3.0 — etwa $0.025 pro 1K Bild bei der internationalen API (etwa 0,18 Yuan), mit einer Ausgabe von bis zu 2048×2048 und bis zu sechs Bildern pro Aufruf. Der Preis ist darauf ausgelegt, hart mit dem Rest des API-Bildmarkts zu konkurrieren — ein Bruchteil dessen, was gehostete Premium-Bildmodelle vor einem Jahr kosteten.
• Bernini-Diffusers-v2 — freie Gewichte, keine Gebühr pro Bild, sondern eine Hardware-Rechnung. Mit dem Volumen kehrt sich die Kostenlogik um: Selbsthosting lohnt sich für gelegentliche Bilder kaum, aber umso mehr, je mehr man generiert, denn die Grenzkosten für ein weiteres Bild tendieren gegen Null.
Es gibt einen dritten Kostenfaktor, der die Seite der offenen Gewichte begünstigt und leicht zu unterschätzen ist: die Wechselkosten. Ein geschlossenes API-Modell bindet Sie an seine Preisgestaltung, seine Ratenlimits und seine Roadmap; ein Modell, das Ihnen gehört, kann ausgetauscht, gepatcht oder feinabgestimmt werden, ohne dass Sie irgendetwas neu verhandeln müssen.
Welche ist die API, auf der du aufbaust?
Qwen-Image-3.0 ist nur über eine API verfügbar. Wenn Sie darauf aufbauen, verpflichten Sie sich zu einer Abrechnung pro Bild auf der Infrastruktur eines anderen – und genau hier kommt der Pass-through von OrcaRouter ins Spiel. Der Preis, den Sie bei uns sehen, ist Alibabas Listenpreis ohne Aufschlag, und eine Preissenkung des Anbieters wird noch am selben Tag übernommen. Die Ökonomie pro Bild ist also die des Anbieters, nicht ein Aufschlag eines Wiederverkäufers obendrauf. Automatisches Failover über Anbieter hinweg ist die andere Hälfte des Arguments: Eine Bild-API, die mitten in einer Kampagne ausfällt, verliert ihre Bedeutung, wenn Ihre Aufrufe um sie herum geleitet werden. Wenn Sie stattdessen den Weg der offenen Gewichte mit Bernini-Diffusers-v2 wählen, akzeptieren Sie heute die Betriebslast im Austausch für null Gebühren pro Bild – und wenn ein gehosteter Anbieter die Gewichte schließlich übernimmt, gilt derselbe Pass-through für das, was dieser Anbieter verlangt.

Das Urteil
Auf dem Papier ist Qwen-Image-3.0 das stärkere reine Bildmodell: bewährte Textdarstellung, ein riesiges Prompt-Fenster, mehrsprachige Layout-Treue und ein wettbewerbsfähiger API-Preis. Es ist die sichere Wahl für die Bildgenerierung in der Produktion, wenn das Briefing textlastig ist und der Workflow API-basiert ist. Bernini-Diffusers-v2 ist das Modell, das man tatsächlich besitzen kann – Apache-2.0-Gewichte, selbst gehostet, feinjustierbar, videofähig – um den Preis, es selbst zu betreiben und einer Benchmark-Tabelle zu vertrauen, die niemand reproduziert hat. Wählen Sie Qwen-Image-3.0 für Genauigkeit und null Infrastruktur; wählen Sie Bernini-Diffusers-v2 für Besitz und Kontrolle. Die Entscheidungsregel in einem Satz: Möchten Sie die Fähigkeit mieten oder das Modell besitzen?
