Titelkarte für FLUX 3 Image vs. FLUX 3 mit einer Zeitleiste: 23. Juli 2026 für die Ankündigung des vereinheitlichten FLUX 3 und 1. Oktober 2026 für den FLUX 3 Image-Endpunkt, mit dem Hinweis, dass nur die Bild-Stufe Bounding Boxes akzeptiert. Das OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

FLUX 3 Image vs. FLUX 3: Zwei Namen, zwei Produkte, neun Wochen Abstand

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Seit dem 1. Oktober 2026 bedeutet „FLUX 3“ zwei verschiedene Dinge, und die zweite Bedeutung ist die mit einer Preisliste. FLUX 3 Image ist die Bild-Stufe, die an diesem Tag unter api.bfl.ai/v1/flux-3-image, pro Bild ab 0,041 $ abgerechnet. FLUX 3 ist das größere Ganze, zu dem es gehört – das vereinheitlichte multimodale Modell, das Black Forest Labs am 23. Juli 2026 angekündigt hat und seitdem in Teilen ausgeliefert hat, von denen Video und ein Robotik-Aktionskopf die Teile sind, die bereits in Produktion laufen. Dies ist kein Vergleich zwischen einem Flaggschiff und seinem kleineren Geschwister. Es ist ein Vergleich zwischen einer ganzen Familie und einem ihrer drei funktionierenden Teile.

Diese Unterscheidung kann leicht verloren gehen, und BFLs eigene Namensgebung hilft nicht gerade: Die Familienseite, die Videodokumentation, die Lizenzbedingungen und die API-Referenz nennen alle FLUX 3 an Stellen, an denen sie etwas Engeres meinen. Wenn Sie ein Datenblatt zu FLUX 3 gelesen haben und danach unsicher sind, ob es ein Bildmodell, ein Videomodell oder ein Forschungsprogramm beschreibt, dann sind Sie nicht unachtsam gewesen. Beide Namen sind für sich überschneidende Teilmengen derselben Veröffentlichung aktiv in Gebrauch.

Die beiden Daten, die zählen

• 23. Juli 2026 — FLUX 3 wurde unter dem Early-Access-Banner angekündigt. Eine Self-Flow-Architektur, die Bilder-, Video- und Audiogenerierung sowie Aktionsvorhersage abdeckt. Der interessante Teil ist die Offenlegung der Rechenleistung: Mehr als 95 % der Trainingsrechenleistung flossen in Video, und weniger als 0,5 % der Tokens wurden Audio zugewiesen.

• 1. Oktober 2026 — die Bild-Stufe startet als nutzungsbasierter Endpunkt. Damit bleibt eine Lücke von rund zehn Wochen zwischen der Ankündigung und dem Eintreffen der Modalität, auf die sich „FLUX 3“ nach allgemeiner Annahme bezog.

Wenn man diese Compute-Aufteilung liest, verrät sie einem, worin Black Forest Labs das schwierige Problem sah. Eine Modellfamilie, die fast ihr gesamtes Trainingsbudget für Video aufwendet, optimiert nicht für Standbilder und behandelt Bewegung als Erweiterung. Es ist umgekehrt, und die Bildstufe erbte, was das Video-First-Training hervorgebracht hat.

Screenshot of Black Forest Labs' FLUX 3 Image page showing the model heading and its control features, captured from bfl.ai on October 2, 2026

Was jede Stufe umfasst und was sie kostet

Drei der vier im Juli angekündigten Modalitäten sind erschienen. Die Bild-Stufe ist die neueste und die einzige, die sich wie eine herkömmliche kostenpflichtige API verhält.

• FLUX 3 Image — ein POST, ein x-key-Header und eine Polling-URL zurück. Der Preis wird pro Bild nach Auflösungsstufe berechnet: 0,041 $ bei 768², 0,048 $ bei 1K (der Standard), 0,07 $ bei 1,5K, 0,10 $ bei 2K und 0,607 $ bei 4K. Ein Einführungsrabatt von 50 % gilt bis zum 8. Oktober um 15:00 UTC. Referenzen und Prompt-Länge sind inbegriffen; fehlgeschlagene und moderierte Anfragen werden nicht berechnet. Es akzeptiert bis zu zehn Referenzbilder mit jeweils zwischen 256×256 Pixeln und 16 Megapixeln.

• FLUX 3 Video — allgemein verfügbar und sekundenweise statt pro Bild abgerechnet. Text-zu-Video und Bild-zu-Video kosten 0,06 $/s in Draft HD, 0,17 $/s HD, 0,29 $/s FHD, 0,40 $/s QHD und 0,80 $/s UHD, wobei Video-zu-Video durchweg teurer ist. Clips laufen bis zu 20 Sekunden mit nativem synchronisiertem Audio, und die Modi umfassen Keyframe-zu-Video und Fortsetzung. Der Draft-Modus ist nur in HD verfügbar. QHD- und UHD-Ausgabe kamen am 10. September 2026 hinzu.

• FLUX 3 Action — ein 7B-Welt-Aktionsmodell und der einzige Teil von FLUX 3, dessen Parameter sich herunterladen lassen. Am 22. September 2026 erschienen drei Checkpoints auf Hugging Face: ein Basis-Checkpoint, eine SO-101-Armvariante und eine DROID-Variante. Der Zugang ist partnerbeschränkt statt offen, wobei die robotische Manipulation als demonstrierter Anwendungsfall dient.

• Was noch nicht veröffentlicht wurde — ein FLUX 3 Open-Weight-Backbone. BFLs Self-Hosting-Tarife decken weiterhin nur FLUX.2 [klein] und FLUX.2 [dev] ab. Für die Bild-Stufe speziell existieren kommerzielle Gewichte unter einer ausgehandelten Lizenz, und öffentliche Open Weights werden als noch Wochen entfernt beschrieben.

Der Kostenvergleich, den niemand anstellt

Screenshot of Black Forest Labs' FLUX 3 Video model page captured October 2, 2026, showing the model heading and its video generation modes

Preise pro Bild und pro Sekunde wirken unvergleichbar – genau deshalb lohnt es sich, die Rechnung einmal aufzumachen.

Fünf Sekunden Text-zu-Video in Standard-HD kosten 0,85 $. Fünf Sekunden in UHD kosten 4,00 $. Ein einzelnes 4K-Standbild aus der Bildstufe kostet laut Liste 0,607 $ oder 0,3035 $ innerhalb des Launch-Fensters — und obwohl das „4K“ der Bildstufe ein Pixelbudget statt eines festen Frames bezeichnet (die Beispielausgabe von BFL ist 5456 × 3072, etwa 16,8 Megapixel, gegenüber 8,3 bei UHD 2160p), ist es dieselbe Auflösungsgrößenordnung, die die Videostufe pro Sekunde berechnet, um sie zu bewegen.

Die Folge ist, dass das Generieren eines UHD-Keyframes nur einen Bruchteil dessen kostet, was das Generieren einer Sekunde UHD-Video kostet, und der Keyframe ist das, was man beim Iterieren wiederholt generieren würde. Wenn Ihre Pipeline „das Einzelbild richtig hinbekommen, es dann animieren“ lautet, ist die Bildstufe die günstige Hälfte – um mehr als eine Größenordnung –, und sie ist die Hälfte, die erst seit kürzester Zeit verfügbar ist.

Auf der Bildseite gibt es eine Einschränkung, die die Videoseite nicht hat. Ein 4K-Bildaufruf kann mehrere Minuten dauern, und das zurückgegebene Sample ist eine Stunde lang herunterladbar. Langsam und eine Stunde lang abrufbar zu sein, ist eine andere operative Form als ein Video-Job, und es ist die Art von Detail, die entscheidet, ob eine Batch-Pipeline eine Warteschlange braucht.

Bounding Boxes existieren unter einem dieser beiden Namen.

Die Bedienoberflächen werden nicht über die Stufen hinweg gemeinsam genutzt, und dies ist der deutlichste praktische Unterschied zwischen dem Namen und der Familie.

Die Bild-Stufe nimmt ein JSON-Array entgegen, das an den Prompt angehängt wird, mit Koordinaten auf einem 0–1000-Raster auf beiden Achsen, und jede Box wird geschrieben als [oben, links, unten, rechts]. Sie übergeben eine Tabelle von Elementen mit einer id, einer bbox und einer desc sowie einer globalen Caption, die diese IDs zitiert — BFLs Beispiele verwenden Namen wie animal_1. Dasselbe Koordinatensystem steuert die Bearbeitung: eine Region behalten, eine Region verschieben, eine neue in eine Ziel-Box generieren oder eine Quell-Box entfernen. Mehrere Operationen kommen in eine einzige Anfrage, wobei ref_image_0 den ersten Eintrag in der Referenzliste benennt. Pixel außerhalb der bearbeiteten Boxen bleiben, so die Dokumentation, „normalerweise identisch“ — eine Absicherung, die man wörtlich nehmen sollte.

Grounding ist im Image-Tier standardmäßig aktiviert: Vor der Generierung wird eine Web- und Bildsuche ausgeführt. Ausgabedimensionen werden auf Vielfache von 16 gerundet, und der tatsächlich realisierte Wert wird als output_mp.

Nichts davon erscheint in den Parametern der Video-Stufe. FLUX 3 Video hat sein eigenes Steuerungskonzept – Keyframes, Fortsetzung, Konditionierung des ersten und letzten Frames –, aber keine Koordinatensprache. Die Teile haben eine gemeinsame Architektur, aber keine Schnittstelle.

Die eigenen Vergleiche des Anbieters sorgfältig lesen

Black Forest Labs hat Präferenzergebnisse für FLUX 3 Video veröffentlicht, und sie sind es wert, mit Angabe ihrer Herkunft zitiert zu werden. Die Durchläufe wurden vom Anbieter durchgeführt, sind vorläufig und werden als Siegquoten für 10-Sekunden-720p-Ausgaben bewertet:

• Gegen Luma Ray 3.2 — 93 % Präferenz für FLUX 3 Video.

• Gegen Runway Gen-4.5 — 77 %.

• Gegen Grok Imagine Video — 69 %.

• Gegen Kling v3 Pro — 60 %.

• Gegen Happy Horse v1 und v1.1 — 59 % und 57 %.

• Gegen Seedance 2.0 und Gemini Omni Flash — jeweils rund 52 %, was in der Sache ein statistisches Unentschieden ist, auch wenn die Zahl über der Hälfte liegt.

Die Spanne von 93 % bis hinunter auf 52 % über diese Liste hinweg ist aussagekräftiger als jede einzelne Zeile. Niemand außerhalb von BFL hat diese Vergleiche durchgeführt, und die Ergebnisse unter 55 % am unteren Ende sind diejenigen, die dir zeigen, wo das Modell tatsächlich angefochten wird.

Für FLUX 3 Image gibt es überhaupt keine vergleichbaren Zahlen. Die Text-zu-Bild- und Editing-Boards von Artificial Analysis wurden am 1. Oktober und erneut am 2. Oktober 2026 überprüft, und keines von beiden enthält einen Eintrag für FLUX 3 Image. Die FLUX.2-Reihe ist nach wie vor der Punkt, an dem die von BFL veröffentlichten Werte enden: FLUX.2 [max] bei 1021 Elo auf dem Generierungs-Board und 996 auf dem Editing-Board, wobei FLUX.2 [dev] auf beiden als Ankerwert von 1000 fixiert ist. Die Bild-Stufe ist einen Tag alt und nicht gemessen.

Screenshot of the Artificial Analysis text-to-image leaderboard captured October 2, 2026, listing FLUX.2 [max], FLUX.2 [flex] and FLUX.2 [dev] as the 1000-point anchor, with no FLUX 3 Image row present

Auswahl zwischen den Namen

Die Entscheidung dreht sich weniger darum, welches Modell besser ist, als darum, in welcher der drei ausgelieferten Stufen dein Problem angesiedelt ist.

Wenn Sie Standbilder mit räumlicher Kontrolle benötigen, ist FLUX 3 Image die einzige Stufe mit einer Koordinatensprache, und mit 0,048 $ pro Bild bei 1K ist es günstig genug, um es richtig zu bewerten, statt darüber zu streiten. Beginnen Sie dort, testen Sie die Behauptung „bleiben normalerweise identisch“ an Ihren eigenen Bildern, und beobachten Sie den Sprung der 2K-zu-4K-Preisliste um 6,07×, wenn Sie Ihre Batch-Größen festlegen.

Wenn Sie Bewegung benötigen, ist FLUX 3 Video ein ausgereiftes, nutzungsabhängig abgerechnetes Produkt mit Auflösungsstufen bis UHD und 20-Sekunden-Clips mit synchronisiertem Audio. Vergleichen Sie es mit den Modellen, die es verdrängen soll, statt mit der Bildstufe – sie sind keine Alternativen zueinander.

Wenn Sie Modellgewichte benötigen, lautet die Antwort heute FLUX 3 Action im Rahmen einer Partnervereinbarung und andernfalls FLUX.2. Weder die Video- noch die Bildstufe ist herunterladbar, und die offene Veröffentlichung der Bildstufe ist eine erklärte Absicht ohne Datum.

Weder FLUX 3 noch FLUX 3 Image steht im Katalog von OrcaRouter, wer also eines von beiden aufrufen will, muss direkt zu Black Forest Labs gehen. Was ein anbieterneutraler Router in einer Pipeline einbringt, die um diese Familie herum gebaut ist, ist die Schicht rund um den Generierungsaufruf: der Durchlauf zur Prompt-Umschreibung, die Vision-Prüfung, die ein Rendering mit dem Briefing vergleicht, der Klassifikator, der Ausgaben in Annehmen-und-Ablehnen-Kategorien einsortiert. Diese Schritte ändern sich weit häufiger als das Bildmodell, und einen Anbieter hinter einem einzigen OpenAI-kompatiblen Endpunkt auszutauschen — mit unverändert durchgereichten Listenpreisen der Anbieter, automatischem Failover, wenn ein Backend schlechter wird, und einer Routing-DSL, wenn man bewusst festlegen oder zurückfallen möchte — ist der Unterschied zwischen einer Pipeline, die den Markt mitverfolgt, und einer, die jedes Mal neu deployt werden muss, wenn ein Modell abgekündigt wird.

Das ehrliche Fazit ist eine Namenskonvention. Wenn jemand FLUX 3 sagt und Ihnen eine Preisliste übergibt, meint er damit den Bild-Endpunkt. Wenn dieselbe Person es sagt und Ihnen ein Datenblatt über Audio-Token-Zuweisung übergibt, meint sie damit die Juli-Ankündigung. Die Lücke zwischen diesen beiden Dokumenten beträgt neun Wochen und drei ausgelieferte Stufen, und sie wird noch immer größer.