
FLUX 3 Image vs. Bernini-Diffusers-v2: Ein kostenpflichtiger Endpunkt gegen ein herunterladbares Repo
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
FLUX 3 Image und Bernini-Diffusers-v2 sind beide Bildmodelle, die Sie heute vollständig erhalten können, und keines von ihnen ist ein Produkt, das Sie mieten können. FLUX 3 Image ging am 1. Oktober 2026 live unter api.bfl.ai/v1/flux-3-image mit einer veröffentlichten Preistabelle und ohne veröffentlichten Score. Bernini-Diffusers-v2 erschien am 13. August 2026 auf Hugging Face unter Apache-2.0 mit veröffentlichten Scores und keiner Möglichkeit, es aufzurufen, außer auf Ihren eigenen GPUs. Das eine kommt mit einer Rechnung. Das andere kommt mit einem Python-Versions-Pin.
Diese Aufteilung ist der ganze Vergleich, und es lohnt sich, präzise zu sein, denn die übliche Gegenüberstellung „gehostet vs. offene Gewichte“ passt hier nicht. Bernini ist kein Open-Weights-Modell, das man einfach in einen bestehenden Inferenz-Stack fallen lassen kann. Es ist ein zweistufiges System – ein Qwen2.5-VL-7B-Planer vor einem Wan2.2-T2V-A14B-Diffusionsdecoder – und seine v2-Veröffentlichung ist eine Trainingsplan-Korrektur, keine neue Fähigkeitsstufe. FLUX 3 Image ist ein einzelner Endpunkt mit einer ungewöhnlich großen Menge an Steuerungsoberfläche, die daran angeschraubt ist: räumliche Verankerung, ein Koordinatengitter von 0–1000 und box-begrenzte Bearbeitung, bei der man benennt, welche Regionen erhalten bleiben. Verschiedene Arten von Dingen.
Was jedes einzelne tatsächlich ist
• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.
• Bernini-Diffusers-v2 — ByteDances Planner-plus-Renderer-Stack, am 13. August 2026 ohne begleitende Ankündigung auf Hugging Face veröffentlicht. Das Repository trägt das Tag image-text-to-video und hängt von diffusers ab. Aufgeführte Aufgaben: Text-zu-Bild, Bild-zu-Bild, Text-zu-Video, Video-zu-Video, Referenz-zu-Video und Referenz-zu-Bild. Es gibt keine gehostete Inferenz und keine Preisliste — der Einstieg erfolgt über hf download und eine Gradio-App.
• Die Verteilungslücke — FLUX 3 Image ist ein nach Verbrauch abgerechneter Dienst, den man aufruft. Bernini ist ein Repository, das man deployt. Bevor es sich lohnt, irgendeine Qualitätsfrage zu stellen: Eines davon erfordert eine GPU der Hopper-Klasse, das andere eine Kreditkarte.
Lizenzierung ist der Punkt, an dem diese beiden am stärksten auseinandergehen
Bernini-Diffusers-v2 ist auf Repository-Ebene Apache-2.0. Für eine selbst gehostete Pipeline ist das von enormer Bedeutung: kein Zähler pro Bild, keine ausgehandelte kommerzielle Vereinbarung, keine Nutzungsberichterstattung. Sie zahlen für Strom und Scheduler-Zeit, und die Grenzkosten des zehntausendsten Bildes sind dieselben wie die des ersten.
FLUX 3 Image ist nicht Open-Weights, und Black Forest Labs stellt ausdrücklich klar, dass dies vorübergehend ist. Kommerzielle Gewichte sind heute im Rahmen einer ausgehandelten BFL-Lizenz verfügbar, und die öffentliche Open-Weights-Veröffentlichung soll in den folgenden Wochen erfolgen. Das ist ein Versprechen mit einer Form, aber ohne Datum, und es ist die mit Abstand wichtigste Sache auf dieser Seite, die man überprüfen und nicht einfach annehmen sollte. Wenn Sie für die nächsten zwei Jahre einen Image-Stack auswählen, wiegt die Lizenzfrage wahrscheinlich schwerer als die Elo-Frage – aber nur, wenn Sie bereit sind, selbst einen zweistufigen video-nativen Diffusions-Stack zu betreiben.
Steueroberfläche: Bounding-Boxen versus Prompt-Verbesserung
Das ist der Teil des Duells, der wirklich interessant ist, denn die beiden Modelle lösen „es genau dorthin zu bringen“ auf völlig unterschiedliche Weise.
FLUX 3 Image nimmt ein JSON-Array entgegen, das an den Prompt angehängt wird. Koordinaten laufen auf beiden Achsen auf einem 0–1000-Raster, und jede Box wird als [oben, links, unten, rechts] geschrieben. Sie geben eine Tabelle von Elementen an, jedes mit einer id, einer bbox und einer desc, plus eine globale Bildbeschreibung, die diese ids namentlich nennt. In BFLs eigenem Beispiel lesen sich die ids wie animal_1 und silhouette_1; die Bildbeschreibung verweist direkt auf sie. Oberhalb des Generierungsaufrufs gibt es grounding, standardmäßig aktiviert, das vor der Generierung eine Web- und Bildsuche ausführt.
FLUX 3 Image erweitert dann dasselbe Koordinatensystem auf die Bearbeitung. Anstatt eine Maske zu senden, senden Sie eine Reihe boxbezogener Operationen: Behalten (Quellbox zur selben Box, bezogen aus ref_image_0), Verschieben (Quellbox zu einer neuen Zielbox), Neu (keine Quelle, Zielbox aus einer Beschreibung generiert — hinzufügen, ersetzen oder umfärben) und Entfernen (Quellbox zu einem Null-Ziel). Mehrere Operationen werden in einer Anfrage gesendet.
Der Vorbehalt ist wichtig. In der Dokumentation von BFL heißt es, Pixel außerhalb der bearbeiteten Boxen „bleiben normalerweise identisch“. Normalerweise. Es ist eine Erhaltungsbehauptung mit einer in die Formulierung eingebauten Absicherung – die ehrliche Art, so etwas auszuliefern, und zugleich der Grund, warum du es mit deinen eigenen Frames testen solltest, statt einer Demo zu vertrauen.
Bernini hat keine vergleichbare benutzerseitige Koordinatensprache. Berninis referenzgestützte Bearbeitung wurde in v2 aufgrund einer Trainingsänderung verbessert – das Connector-Modul wird über Tausende Schritte aufgewärmt, bevor das Co-Training beginnt – und ByteDance berichtet, dass sich diese Änderung in besserer referenzgestützter Bearbeitung und besserer OpenS2V-Leistung niederschlägt. Es handelt sich um eine Qualitätskorrektur innerhalb einer bestehenden Architektur, nicht um eine neue Steuerungsschnittstelle. Wenn Ihr Workflow davon abhängt, dem Modell mitzuteilen, welches Rechteck es unberührt lassen soll, beantwortet nur eine dieser beiden Optionen die Frage.

Was die Zahlen belegen und was nicht
Die Seite von Bernini-Diffusers-v2 enthält eine Tabelle mit sieben Metriken, die v2 mit v1 vergleicht, und jeder Wert darin ist eine Herstellerangabe. Die Richtung ist gemischt, was man ruhig offen sagen sollte:
• Höher — OpenS2V 63.83 (von 62.30), VBench 84.46 (von 84.37), Bernini-rv2v 3.55 (von 3.48).
• Flat — EditVerse 8.02, unverändert, und Bernini-v2v 3.49, unverändert.
• Down — OpenVE 3.96, von 4.03.
Die Seite gibt außerdem an, dass v2 in einer internen verblindeten menschlichen Pairwise-Arena in der ersten Kategorie unter führenden kommerziellen Closed-Source-Modellen rangiert. Das ist von außerhalb von ByteDance nicht überprüfbar und sollte als Marketingaussage gelesen werden, nicht als Messung. Die drei tatsächlichen Veränderungen sind die oben aufgeführten, und sie sind selbst berichtet gegenüber dem eigenen v1 desselben Labs.
Für FLUX 3 Image gibt es noch überhaupt keine Zahlen. Das Text-zu-Bild-Board von Artificial Analysis und dessen Editing-Board wurden sowohl am 1. Oktober als auch am 2026-10-02 überprüft und enthalten keine Zeile für FLUX 3 Image — die BFL-Einträge auf diesen Boards enden bei der FLUX.2-Zeile, wo FLUX.2 [max] mit 1021 Elo im Generierungs-Board und 996 im Editing-Board steht. FLUX.2 [dev] verankert beide Boards bei genau 1000. Die ehrliche Aussage zur Qualität von FLUX 3 Image ist also derzeit, dass niemand außerhalb von Black Forest Labs eine Bewertung dafür veröffentlicht hat, und der nächstgelegene verfügbare Referenzpunkt ist die Generation davor.
Diese Asymmetrie ist die praktische Falle in diesem Vergleich. Berninis Zahlen werden vom Anbieter erhoben, aber sie existieren, und sie sind richtungsweisend. Bei FLUX 3 Image fehlen sie. Fehlende Zahlen sind kein Versagen – das Modell ist einen Tag alt –, aber sie bedeuten, dass der einzige Beleg für die Behauptung von FLUX 3 Image zur Bildbearbeitung derzeit von dem Unternehmen stammt, das es verkauft.
Die Preisseite, die überhaupt nicht symmetrisch ist
FLUX 3 Image wird pro Bild nach Auflösungsstufe berechnet, und die Preisliste des Anbieters führt fünf davon auf:
• 768sq — Listenpreis 0,041 $, 0,0205 $ während des Einführungszeitraums.
• 1K (der Standard) — 0,048 $ Listenpreis, 0,024 $ im Angebot.
• 1,5K — $0,07 Listenpreis, $0,035 im Angebot.
• 2K — $0,10 Listenpreis, $0,05 im Angebot.
• 4K — 0,607 $ Listenpreis, 0,3035 $ im Angebot.

Referenzbilder und Prompt-Länge sind ohne Aufpreis enthalten, und abgelehnte, fehlgeschlagene oder moderierte Anfragen werden nicht berechnet – was hier mehr als sonst zählt, denn ein 4K-Aufruf ist langsam und die Versuchung, eine Anfrage abzubrechen, ist real. Die Einführungspreise gelten vom 1. Oktober um 15:00 UTC bis zum 8. Oktober um 15:00 UTC. Der Listenpreis-Sprung von 2K auf 4K beträgt den Faktor 6,07, weit steiler als das Pixelanzahl-Verhältnis, daher ist die von Ihnen gewählte Auflösungsstufe die wichtigste Kostenentscheidung in der gesamten API.
Die Stufen richten sich nach einem Pixelbudget statt nach einem festen Frame. BFLs Beispielausgabe ist 5456 × 3072, rund 16,8 Megapixel, gegenüber UHD 2160p mit 8,3 Megapixeln – „4K“ steht hier also für ein Budget, und die Ausgabedimensionen werden auf Vielfache von 16 gerundet, wobei die tatsächliche Zahl zurückgegeben wird als output_mp.
Berninis Preis beträgt null pro Bild und nicht null pro Stunde. Acht GPUs für sequenzparallele Inferenz, Silizium der Hopper-Klasse empfohlen, Python 3.11.2 mit PyTorch 2.7.1 und CUDA 12.6. Der Break-even gegenüber 0,048 $ pro Bild bei 1K liegt irgendwo im Bereich von Tausenden Bildern pro Monat, hängt aber vollständig davon ab, was Sie für Compute bezahlen – und es ist eine reale Zahl, keine rhetorische. Wenn Sie bereits Inferenzinfrastruktur betreiben, ist Berninis marginales Bild nahezu kostenlos. Wenn nicht, ist der FLUX 3 Image Endpoint dramatisch günstiger als das Aufsetzen eines zweistufigen Diffusions-Stacks.
Routing: Keines von beiden ist in unserem Katalog.
Es lohnt sich, das klar zu sagen, denn es ist die Art von Aussage, die schnell veraltet. OrcaRouter routet FLUX 3 Image nicht, und es routet Bernini-Diffusers-v2 nicht. FLUX 3 Image aufzurufen bedeutet, Black Forest Labs direkt an deren eigenem Endpunkt aufzurufen. Bernini aufzurufen bedeutet, es selbst zu deployen.
Wofür ein OpenAI-kompatibler Router in einer Pipeline wie dieser tatsächlich gut ist, ist alles auf beiden Seiten des Bildaufrufs. Ein Captioning- oder Prompt-Rewriting-Durchlauf, ein Vision-Modell, das das Render gegen das Briefing prüft, ein Videomodell, das das freigegebene Standbild animiert, ein kleines Textmodell, das die Ausgabe klassifiziert — das sind die Schritte, bei denen die Möglichkeit, einen Anbieter mit einem einzigen String und einem einzigen Key auszutauschen und Anfragen automatisch ein Failover durchführen zu lassen, wenn einer beeinträchtigt ist, eine ganze Menge Wartungsarbeit einspart. OrcaRouter gibt die Listenpreise der Anbieter ohne Aufschlag weiter, sodass die Änderung, wenn ein Anbieter einen Tarif senkt, noch am selben Tag live ist, statt darauf zu warten, dass ein Reseller neu kalkuliert, und die Routing-DSL es Ihnen erlaubt, ein bestimmtes Modell festzulegen oder eine Fallback-Reihenfolge zu definieren, ohne den Anwendungscode anzufassen. Nichts davon macht FLUX 3 Image routingfähig. Es bedeutet nur, dass sich der Rest der Pipeline nicht darum kümmern muss, welches Modell das Standbild erzeugt hat.
![Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board](https://cms.orcarouter.ai/api/media/file/4-1497.png)
Auf welches aufbauen?
Drei Fragen trennen diese eindeutig, und sie haben keine gemeinsame Antwort.
Müssen Sie steuern, wohin die Dinge gehen? FLUX 3 Image ist das einzige der beiden mit einer Koordinatensprache, und seine auf Boxen begrenzten Bearbeitungsvorgänge – Behalten, Verschieben, Hinzufügen, Entfernen – sind eine wirklich andere Schnittstelle als die Bearbeitung per Textanweisung. Wenn es bei Ihrer Arbeit um Compositing, Layout oder Produktbilder geht, bei denen Bereiche erhalten bleiben müssen, ist das entscheidend, und die Relativierung in „normalerweise identisch bleiben“ ist etwas, das man testet, statt es anzunehmen.
Müssen Sie wissen, wie gut es ist, bevor Sie sich festlegen? Bernini hat Zahlen, alle vom Anbieter gemeldet, und eine gemischte Entwicklungsrichtung. FLUX 3 Image hat keine. Wenn Sie keine eigene Bewertung durchführen können, wählen Sie zwischen einem gemessenen Modell und einem ungemessenen, und das gemessene ist die ältere Architektur.
Können Sie einen zweistufigen Diffusions-Stack betreiben? Das ist die eigentliche Hürde bei Bernini. Ein Qwen2.5-VL-7B-Planer, der einen Wan2.2-T2V-A14B-Decoder speist, auf Hopper-GPUs, mit einem Prompt-Enhancer-Hook, der auf einen OpenAI-kompatiblen Endpunkt verweist. Die Lizenz ist permissiv, und die Rechnung für die Rechenleistung ist es nicht. Wenn Sie das nicht können, ist die Frage hinfällig, und 0,048 $ pro Bild ist die Antwort.
Das Einzige, was diese Seite am schnellsten verändern würde, wäre, dass BFL die Gewichte von FLUX 3 Image freigibt, was laut dem Unternehmen nur noch Wochen entfernt ist. Das verwandelt die Lizenz-Asymmetrie von entscheidend zu mild und lässt den Unterschied bei der Steuerungsoberfläche als den eigentlichen Vergleich übrig. Bis dahin lautet die zutreffende Zusammenfassung, dass es sich um zwei gute Modelle mit entgegengesetzten Vertriebsmodellen handelt und die Entscheidung anhand von Lizenzierung und Kontrolle getroffen wird, lange bevor sie anhand der Qualität getroffen wird.
