Hero-Card für den Vergleich Bernini-Diffusers-v2 gegen Qwen Image 3.0: zeigt Apache-2.0-Gewichte, die du selbst hostest, gegenüber einer geschlossenen API, die Text bis zu ~10 px rendert, unter dem Slogan: Gleiche Aufgabenbeschreibung, gegensätzliche Antworten in puncto Kontrolle.
Guides & Insights

Bernini-Diffusers-v2 vs. Qwen Image 3.0: Gewichte, die Ihnen gehören, vs. eine API, die Text rendert

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei chinesische Labore brachten im Abstand von drei Wochen bildfähige Modelle heraus und landeten auf entgegengesetzten Seiten der größten Kluft in dieser Kategorie. Qwen-Image-3.0wurde am 21. Juli 2026 von Alibabas Team veröffentlicht und am 4. August für eine internationale API geöffnet; es ist ein Bildmodell mit geschlossenen Gewichten, das Sie über HTTP aufrufen. Bernini-Diffusers-v2, das ByteDance am 13. August 2026 ohne Ankündigung auf Hugging Face veröffentlichte, ist Apache-2.0-Open-Weights, die Sie herunterladen und ausführen können. Gleiche grobe Aufgabenbeschreibung – Bilderzeugung und -bearbeitung – und gegensätzliche Antworten auf die Frage, wer das Modell kontrolliert. Das meiste, was folgt, ist die Konsequenz dieser einen Entscheidung, also ist es der Ausgangspunkt dieses Vergleichs und nicht sein Ende.

Die Gewichte dividieren

Qwen-Image-3.0 — geschlossene Gewichte. Zum jetzigen Zeitpunkt hat Alibaba weder die Gewichte noch einen technischen Bericht dazu veröffentlicht; man nutzt es über die API auf Alibaba Cloud Bailian oder der Qwen-Plattform. Die Ausgaben tragen ein AIGC-Provenienzlabel. Was man kauft, ist Fähigkeit ohne Verfügungsgewalt: kein Self-Hosting, kein Fine-Tuning, keine Offline-Nutzung, kein Blick unter die Haube.

Bernini-Diffusers-v2 — offene Gewichte. Apache-2.0, ein eigenständiges diffusers-Verzeichnis auf Hugging Face und lokale Inferenz-Skripte im Repository bytedance/Bernini. Sie können es feinabstimmen, es ohne Internetverbindung ausführen, Ihre Daten auf Ihrer eigenen Hardware behalten und nicht mehr pro Bild bezahlen. Der Preis für die Datenhoheit ist der Betrieb: Das README empfiehlt GPUs der Hopper-Klasse und einen Stack mit Python 3.11.2 und PyTorch 2.7.1+cu126.

Für ein Team, dessen Bilder vertrauliches Material enthalten oder dessen Compliance-Richtlinien das Senden von Daten an eine Drittanbieter-API verbieten, entscheidet diese Trennung die Frage von selbst.

Text- und Layouttreue

Worin Qwen-Image-3.0 wirklich heraussticht, ist der Text. Seine Kennzahlen aus den Veröffentlichungsmaterialien von Alibaba:

• Prompt-Fenster — bis zu 4.500 Token an Eingabe, ein 4,5-facher Sprung gegenüber der vorherigen Generation, wodurch es kompakte Briefings wie Zeitungs-Titelseiten oder ein Neun-Panel-Wissensraster in einem einzigen Aufruf verarbeiten kannbr />• Kleiner Text — lesbare Darstellung bis hinunter zu etwa 10px, einschließlich mathematischer Notation, tiefgestellter und hochgestellter Zeichen sowie mehrzeiliger Formelnbr />• Sprachen — native Darstellung in 12 Sprachen mit über 20 Schriftarten und über 100 künstlerischen Stilen sowie Vertrautheit mit gängigen Web-, Spiel- und Software-Oberflächen

Bernini-Diffusers-v2 erhebt auf seiner Modellkarte keinen vergleichbaren Anspruch in Bezug auf Text und Layout. Seine Stärken liegen woanders — planungsbasiertes semantisches Editieren und eine Videopipeline — und bei einem Briefing, das in erster Linie „diese Infografik genau wiedergeben“ lautet, ist Qwen-Image-3.0 die bewährte Wahl und Bernini die unbewährte.

Bearbeitungstiefe

Qwen-Image-3.0 — Generation plus Bearbeitung, mit einem Portfolio spezialisierter Tricks: Restaurierung antiker Gemälde, Panorama-Generierung, Skizze-zu-PPT und Multi-Shot-Storyboarding. Der Anspruch ist Produktionstauglichkeit — Layouts, die halten, Details, die echt wirken — statt einer bestimmten Bearbeitungsarchitektur.

Bernini-Diffusers-v2 — Bearbeitung über einen semantischen Planer. Ein Qwen2.5-VL-Planer zerlegt die Anweisung in einen Plan dessen, was sich ändern soll, und ein auf Wan2.2 basierender Renderer zeichnet es. Das ist ein überzeugendes Design für komplexe, mehrstufige Bearbeitungen – „Jahreszeit ändern, Auto ersetzen, Bildausschnitt beibehalten“ – und es erstreckt sich auf Videoaufgaben (t2v, v2v, rv2v), die kein Konkurrent abdeckt. All dies stammt vom Anbieter und ist öffentlich nicht verifiziert.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

Kosten

Qwen-Image-3.0 — etwa $0.025 pro 1K Bild bei der internationalen API (etwa 0,18 Yuan), mit einer Ausgabe von bis zu 2048×2048 und bis zu sechs Bildern pro Aufruf. Der Preis ist darauf ausgelegt, hart mit dem Rest des API-Bildmarkts zu konkurrieren — ein Bruchteil dessen, was gehostete Premium-Bildmodelle vor einem Jahr kosteten.

Bernini-Diffusers-v2 — freie Gewichte, keine Gebühr pro Bild, sondern eine Hardware-Rechnung. Mit dem Volumen kehrt sich die Kostenlogik um: Selbsthosting lohnt sich für gelegentliche Bilder kaum, aber umso mehr, je mehr man generiert, denn die Grenzkosten für ein weiteres Bild tendieren gegen Null.

Es gibt einen dritten Kostenfaktor, der die Seite der offenen Gewichte begünstigt und leicht zu unterschätzen ist: die Wechselkosten. Ein geschlossenes API-Modell bindet Sie an seine Preisgestaltung, seine Ratenlimits und seine Roadmap; ein Modell, das Ihnen gehört, kann ausgetauscht, gepatcht oder feinabgestimmt werden, ohne dass Sie irgendetwas neu verhandeln müssen.

Welche ist die API, auf der du aufbaust?

Qwen-Image-3.0 ist nur über eine API verfügbar. Wenn Sie darauf aufbauen, verpflichten Sie sich zu einer Abrechnung pro Bild auf der Infrastruktur eines anderen – und genau hier kommt der Pass-through von OrcaRouter ins Spiel. Der Preis, den Sie bei uns sehen, ist Alibabas Listenpreis ohne Aufschlag, und eine Preissenkung des Anbieters wird noch am selben Tag übernommen. Die Ökonomie pro Bild ist also die des Anbieters, nicht ein Aufschlag eines Wiederverkäufers obendrauf. Automatisches Failover über Anbieter hinweg ist die andere Hälfte des Arguments: Eine Bild-API, die mitten in einer Kampagne ausfällt, verliert ihre Bedeutung, wenn Ihre Aufrufe um sie herum geleitet werden. Wenn Sie stattdessen den Weg der offenen Gewichte mit Bernini-Diffusers-v2 wählen, akzeptieren Sie heute die Betriebslast im Austausch für null Gebühren pro Bild – und wenn ein gehosteter Anbieter die Gewichte schließlich übernimmt, gilt derselbe Pass-through für das, was dieser Anbieter verlangt.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

Das Urteil

Auf dem Papier ist Qwen-Image-3.0 das stärkere reine Bildmodell: bewährte Textdarstellung, ein riesiges Prompt-Fenster, mehrsprachige Layout-Treue und ein wettbewerbsfähiger API-Preis. Es ist die sichere Wahl für die Bildgenerierung in der Produktion, wenn das Briefing textlastig ist und der Workflow API-basiert ist. Bernini-Diffusers-v2 ist das Modell, das man tatsächlich besitzen kann – Apache-2.0-Gewichte, selbst gehostet, feinjustierbar, videofähig – um den Preis, es selbst zu betreiben und einer Benchmark-Tabelle zu vertrauen, die niemand reproduziert hat. Wählen Sie Qwen-Image-3.0 für Genauigkeit und null Infrastruktur; wählen Sie Bernini-Diffusers-v2 für Besitz und Kontrolle. Die Entscheidungsregel in einem Satz: Möchten Sie die Fähigkeit mieten oder das Modell besitzen?

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube