Karta tytułowa dla FLUX 3 Image vs FLUX 3, pokazująca os czasu: 23 lipca 2026 r. – ogłoszenie ujednoliconego FLUX 3, a 1 października 2026 r. – punkt końcowy FLUX 3 Image, z adnotacją, że tylko poziom obrazu akceptuje ramki ograniczające. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

FLUX 3 Image vs FLUX 3: dwie nazwy, dwa produkty, dziewięć tygodni odstępu

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Od 1 października 2026 r. „FLUX 3” oznacza dwie różne rzeczy, a druga z nich ma cennik. FLUX 3 Image to poziom obrazowy, który został uruchomiony tego dnia pod adresem api.bfl.ai/v1/flux-3-image, rozliczany za obraz od 0,041 USD. FLUX 3 to większa całość, do której należy — ujednolicony model multimodalny, który Black Forest Labs ogłosił 23 lipca 2026 r. i od tego czasu udostępnia go we fragmentach; wideo oraz głowica akcji robotycznych to części już działające w produkcji. To nie jest porównanie flagowca z jego mniejszym bratem. To porównanie całej rodziny z jedną z jej trzech działających części.

Tę różnicę łatwo zatrzeć, a nazewnictwo samego BFL nie pomaga: strona rodziny, dokumentacja wideo, warunki licencji i dokumentacja API mówią FLUX 3 w miejscach, w których mają na myśli coś węższego. Jeśli przeczytałeś kartę specyfikacji FLUX 3 i wychodzisz z niepewnością, czy opisuje ona model obrazu, model wideo czy program badawczy, to nie oznacza, że jesteś nieuważny. Obie nazwy są w aktywnym użyciu w odniesieniu do nakładających się podzbiorów tego samego wydania.

Dwie daty, które mają znaczenie

• 23 lipca 2026 — FLUX 3 ogłoszono w ramach Early Access. Jedna architektura Self-Flow obejmująca generowanie obrazu, wideo i dźwięku oraz przewidywanie działań. Najciekawszy jest ujawniony podział mocy obliczeniowej: ponad 95% obliczeń treningowych przeznaczono na wideo, a na dźwięk przydzielono mniej niż 0,5% tokenów.

• 1 października 2026 — warstwa obrazowa otwiera się jako endpoint rozliczany za użycie. To pozostawia lukę wynoszącą około dziesięciu tygodni między ogłoszeniem a pojawieniem się modalności, do której — jak sądziła większość — odnosił się „FLUX 3”.

Odczyt tego podziału nakładów obliczeniowych mówi ci, co Black Forest Labs uważało za trudny problem. Rodzina modeli, która niemal cały swój budżet szkoleniowy przeznacza na wideo, nie optymalizuje pod kątem nieruchomych obrazów ani nie traktuje ruchu jako rozszerzenia. Jest odwrotnie, a warstwa obrazowa odziedziczyła cokolwiek wytworzył trening zorientowany najpierw na wideo.

Screenshot of Black Forest Labs' FLUX 3 Image page showing the model heading and its control features, captured from bfl.ai on October 2, 2026

Czym jest każdy poziom i ile kosztuje

Trzy z czterech modalności ogłoszonych w lipcu zostały już udostępnione. Warstwa obrazowa jest najnowsza i jako jedyna zachowuje się jak konwencjonalne płatne API.

• FLUX 3 Image — jeden POST, nagłówek x-key i zwrotny adres URL do odpytywania. Cena za obraz według progu rozdzielczości: 0,041 USD przy 768sq, 0,048 USD przy 1K (domyślnie), 0,07 USD przy 1,5K, 0,10 USD przy 2K i 0,607 USD przy 4K. Zniżka premierowa 50% obowiązuje do 15:00 UTC 8 października. Obrazy referencyjne i długość promptu są wliczone; nieudane i moderowane żądania nie są rozliczane. Przyjmuje maksymalnie dziesięć obrazów referencyjnych o rozmiarze od 256×256 pikseli do 16 megapikseli każdy.

• FLUX 3 Video — ogólnie dostępny i rozliczany za sekundę, a nie za obraz. Tekst-na-wideo i obraz-na-wideo kosztują 0,06 USD/s w trybie Draft HD, 0,17 USD/s w HD, 0,29 USD/s w FHD, 0,40 USD/s w QHD i 0,80 USD/s w UHD, a wideo-na-wideo jest droższe we wszystkich wariantach. Klipy trwają do 20 sekund z natywnym zsynchronizowanym dźwiękiem, a tryby obejmują od klatki kluczowej do wideo i kontynuację. Tryb Draft jest dostępny tylko w HD. Wyjście QHD i UHD pojawiło się 10 września 2026 r.

• FLUX 3 Action — model typu world-action o 7B parametrach i jedyna część FLUX 3, której parametry można pobrać. 22 września 2026 r. na Hugging Face pojawiły się trzy checkpointy: checkpoint bazowy, wariant ramienia SO-101 i wariant DROID. Dostęp jest ograniczony do partnerów, a nie otwarty, a zademonstrowanym zastosowaniem jest manipulacja robotyczna.

• Co nie zostało wydane — model bazowy FLUX 3 z otwartymi wagami. Poziomy samodzielnego hostowania BFL nadal obejmują wyłącznie FLUX.2 [klein] i FLUX.2 [dev]. Jeśli chodzi konkretnie o poziom obrazowy, komercyjne wagi są dostępne na podstawie wynegocjowanej licencji, a publiczne otwarte wagi mają pojawić się dopiero za kilka tygodni.

Porównanie kosztów, którego nikt nie robi

Screenshot of Black Forest Labs' FLUX 3 Video model page captured October 2, 2026, showing the model heading and its video generation modes

Ceny za obraz i za sekundę wydają się nieporównywalne, i właśnie dlatego warto raz przeprowadzić te obliczenia.

Pięć sekund standardowego HD w trybie tekst-na-wideo kosztuje 0,85 USD. Pięć sekund w UHD to 4,00 USD. Pojedyncza nieruchoma klatka 4K z poziomu obrazów to 0,607 USD według ceny katalogowej lub 0,3035 USD w oknie premiery — a choć „4K” w poziomie obrazów oznacza budżet pikselowy, a nie stałą klatkę (przykładowy wynik BFL to 5456 × 3072, około 16,8 megapiksela, wobec 8,3 w UHD 2160p), to jest to ten sam rząd wielkości rozdzielczości, za którego przetwarzanie poziom wideo pobiera opłatę za sekundę.

Konsekwencją jest to, że wygenerowanie jednej klatki kluczowej UHD kosztuje ułamek kosztu wygenerowania jednej sekundy wideo UHD, a klatka kluczowa to właśnie ta rzecz, którą generowałbyś wielokrotnie podczas iterowania. Jeśli Twój potok działa według zasady „dopracuj klatkę, a potem ją animuj”, warstwa obrazu jest tą tańszą połową o więcej niż rząd wielkości i to ona jest dostępna najkrócej.

Po stronie obrazów występuje zastrzeżenie, którego nie ma po stronie wideo. Wywołanie obrazu 4K może zająć kilka minut, a zwróconą próbkę można pobierać przez godzinę. Wolne i dostępne do pobrania przez godzinę to inny kształt operacyjny niż zadanie wideo, a właśnie tego rodzaju szczegół decyduje o tym, czy potok przetwarzania wsadowego potrzebuje kolejki.

Pola ograniczające występują pod jedną z tych dwóch nazw

Powierzchnie sterujące nie są współdzielone między poziomami, a to najostrzejsza praktyczna różnica między nazwą a rodziną.

Poziom obrazu przyjmuje tablicę JSON dołączoną do promptu, ze współrzędnymi w siatce 0–1000 na obu osiach, a każde pole zapisuje się jako [top, left, bottom, right]. Przekazujesz tabelę elementów zawierających id, bbox i desc, oraz globalny podpis, który cytuje te identyfikatory — przykłady BFL używają nazw takich jak animal_1. Ten sam układ współrzędnych steruje edycją: zachowaj region, przenieś region, wygeneruj nowy do docelowego pola lub usuń pole źródłowe. Wiele operacji trafia do jednego żądania, przy czym ref_image_0 oznacza pierwszy wpis na liście referencyjnej. Piksele poza edytowanymi polami, jak mówi dokumentacja, „zwykle pozostają identyczne” — zastrzeżenie warte dosłownego odczytania.

Grounding jest domyślnie włączony w warstwie obrazów: wyszukiwanie w internecie i w obrazach odbywa się przed generowaniem. Wymiary wyjściowe są zaokrąglane do wielokrotności 16, a rzeczywista wartość jest zwracana jako output_mp.

Nic z tego nie pojawia się w parametrach poziomu wideo. FLUX 3 Video ma własną historię sterowania — klatki kluczowe, kontynuację, warunkowanie pierwszej i ostatniej klatki — ale nie język współrzędnych. Te części dzielą architekturę, a nie interfejs.

Uważne czytanie własnych porównań dostawcy

Black Forest Labs opublikowało wyniki preferencji dla FLUX 3 Video i warto je przytoczyć wraz z podaniem ich pochodzenia. Testy są przeprowadzane przez dostawcę, mają charakter wstępny i są oceniane jako wskaźniki wygranych na 10-sekundowym wyjściu 720p:

• W porównaniu z Luma Ray 3.2 — 93% preferencji dla FLUX 3 Video.

• Przeciwko Runway Gen-4.5 — 77%.

• Przeciwko Grok Imagine Video — 69%.

• Przeciwko Kling v3 Pro — 60%.

• Przeciwko Happy Horse v1 i v1.1 — 59% i 57%.

• Przeciwko Seedance 2.0 i Gemini Omni Flash — po około 52% każdy, co w istocie jest statystycznym remisem, nawet jeśli liczba przekracza połowę.

Rozpiętość od 93% aż do 52% na całej tej liście mówi więcej niż jakikolwiek pojedynczy wiersz. Nikt poza BFL nie przeprowadził tych porównań, a wyniki poniżej 55% na dole to właśnie te, które mówią, gdzie model jest faktycznie sporny.

Dla FLUX 3 Image nie ma w ogóle żadnych równoważnych liczb. Tablice text-to-image i edycji Artificial Analysis sprawdzono 1 października i ponownie 2 października 2026 r.; żadna z nich nie zawiera wpisu FLUX 3 Image. Linia FLUX.2 to wciąż miejsce, w którym kończą się opublikowane wyniki BFL: FLUX.2 [max] z 1021 Elo na tablicy generowania i 996 na tablicy edycji, a FLUX.2 [dev] jest ustalony jako punkt odniesienia 1000 na obu. Poziom obrazu ma jeden dzień i jest niezmierzony.

Screenshot of the Artificial Analysis text-to-image leaderboard captured October 2, 2026, listing FLUX.2 [max], FLUX.2 [flex] and FLUX.2 [dev] as the 1000-point anchor, with no FLUX 3 Image row present

Wybór między nazwami

Wybór nie tyle dotyczy tego, który model jest lepszy, ile tego, w którym z trzech udostępnianych poziomów mieści się twój problem.

Jeśli potrzebujesz statycznych ujęć z kontrolą przestrzenną, FLUX 3 Image to jedyny poziom z językiem współrzędnych, a w cenie $0.048 za obraz w 1K jest wystarczająco tani, by rzetelnie go ocenić, zamiast się o to spierać. Zacznij od niego, przetestuj twierdzenie „zwykle pozostają identyczne” na własnych ujęciach i obserwuj skok cennika z 2K do 4K o 6,07×, gdy będziesz planować rozmiary partii.

Jeśli potrzebujesz ruchu, FLUX 3 Video to dojrzały produkt rozliczany za użycie z poziomami rozdzielczości aż do UHD i 20-sekundowymi klipami z zsynchronizowanym dźwiękiem. Porównuj go z modelami, które ma zastąpić, a nie z poziomem obrazu — nie są one dla siebie alternatywami.

Jeśli potrzebujesz wag, odpowiedzią dzisiaj jest FLUX 3 Action w ramach umowy partnerskiej, a w przeciwnym razie FLUX.2. Ani poziom wideo, ani poziom obrazowy nie są dostępne do pobrania, a otwarte wydanie poziomu obrazowego to zadeklarowany zamiar bez daty.

Ani FLUX 3, ani FLUX 3 Image nie znajduje się w katalogu OrcaRouter, więc wywołanie któregokolwiek z nich oznacza bezpośrednie przejście do Black Forest Labs. To, co router neutralny wobec dostawców wnosi do pipeline'u zbudowanego wokół tej rodziny, to warstwa wokół wywołania generowania: przebieg przepisywania promptu, kontrola wizyjna porównująca render z briefem, klasyfikator sortujący wyniki do kategorii akceptowanych i odrzucanych. Te kroki zmieniają się znacznie częściej niż sam model obrazu, a podmiana dostawcy za jednym endpointem zgodnym z OpenAI — z cenami katalogowymi dostawców przekazywanymi bez narzutu marży, automatycznym przełączaniem awaryjnym, gdy backend zaczyna działać gorzej, oraz DSL routingu, gdy chcesz celowo przypiąć dostawcę lub zastosować fallback — to różnica między pipeline'em, który nadąża za rynkiem, a takim, który trzeba wdrażać od nowa za każdym razem, gdy model zostaje wycofany.

Uczciwa konkluzja to konwencja nazewnictwa. Kiedy ktoś mówi FLUX 3 i wręcza ci cennik, ma na myśli endpoint obrazu. Kiedy mówi to samo i wręcza ci specyfikację dotyczącą alokacji tokenów audio, ma na myśli lipcowe ogłoszenie. Odstęp między tymi dwoma dokumentami to dziewięć tygodni i trzy wydane poziomy, a wciąż się powiększa.