
FLUX 3 Image vs Bernini-Diffusers-v2: Płatny endpoint kontra repozytorium do pobrania
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
FLUX 3 Image i Bernini-Diffusers-v2 to oba modele obrazowe, które możesz dziś uzyskać w pełnej wersji, i żaden z nich nie jest produktem, który można wynająć. FLUX 3 Image zadebiutował 1 października 2026 pod adresem api.bfl.ai/v1/flux-3-image z opublikowanym cennikiem i bez opublikowanej oceny. Bernini-Diffusers-v2 pojawił się na Hugging Face 13 sierpnia 2026 na licencji Apache-2.0 z opublikowanymi wynikami i bez możliwości wywołania go inaczej niż na własnych GPU. Jeden przychodzi z fakturą. Drugi przychodzi z przypiętą wersją Pythona.
Ten podział to całe porównanie i warto być co do niego precyzyjnym, ponieważ zwykłe ujęcie „hostowane kontra otwarte wagi” nie pasuje tutaj. Bernini nie jest modelem z otwartymi wagami, który można wrzucić do istniejącego stosu inferencji. To system dwuetapowy — moduł planujący Qwen2.5-VL-7B przed dekoderem dyfuzyjnym Wan2.2-T2V-A14B — a jego wydanie v2 to poprawka harmonogramu treningu, a nie nowy poziom możliwości. FLUX 3 Image to pojedynczy endpoint z nietypowo rozbudowaną warstwą sterowania: grounding przestrzenny, siatka współrzędnych 0–1000 oraz edycja ograniczona do ramek, w której wskazujesz, które regiony mają przetrwać. To zupełnie inne rodzaje rzeczy.
Czym każdy z nich właściwie jest
• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.
• Bernini-Diffusers-v2 — stos technologii planner-plus-renderer firmy ByteDance, opublikowany na Hugging Face 13 sierpnia 2026 r. bez towarzyszącego ogłoszenia. Repozytorium jest oznaczone tagiem image-text-to-video i wymaga diffusers. Wymienione zadania: text-to-image, image-to-image, text-to-video, video-to-video, reference-to-video oraz reference-to-image. Nie ma hostowanej inferencji ani cennika — ścieżka rozpoczęcia pracy to hf download i aplikacja Gradio.
• Luka w dystrybucji — FLUX 3 Image to usługa rozliczana za użycie, którą wywołujesz. Bernini to repozytorium, które wdrażasz. Zanim warto zadać jakiekolwiek pytanie o jakość, jedno z nich wymaga GPU klasy Hopper, a drugie – karty kredytowej.
Licencjonowanie to punkt, w którym te dwa najbardziej się rozchodzą.
Bernini-Diffusers-v2 jest objęty licencją Apache-2.0 na poziomie repozytorium. W przypadku samodzielnie hostowanego potoku ma to ogromne znaczenie: brak licznika opłat za każdy obraz, brak wynegocjowanej umowy komercyjnej, brak raportowania użycia. Płacisz za energię elektryczną i czas pracy modułu szeregującego, a koszt krańcowy dziesięciotysięcznego obrazu jest taki sam jak w przypadku pierwszego.
FLUX 3 Image nie ma otwartych wag, a Black Forest Labs wyraźnie stwierdza, że jest to tymczasowe. Komercyjne wagi są dostępne już dziś na podstawie wynegocjowanej licencji BFL, a publiczna premiera otwartych wag jest opisana jako mająca nastąpić w kolejnych tygodniach. To obietnica, która ma kształt, ale nie ma daty, i jest to najważniejsza rzecz na tej stronie, którą należy ponownie sprawdzić, a nie zakładać. Jeśli wybierasz stos do generowania obrazów na najbliższe dwa lata, kwestia licencji prawdopodobnie przeważa nad kwestią Elo — ale tylko wtedy, gdy sam jesteś gotów obsługiwać dwuetapowy stos dyfuzyjny natywny dla wideo.
Panel sterowania: prostokąty ograniczające kontra ulepszanie podpowiedzi
To jest ta część pojedynku, która jest naprawdę interesująca, ponieważ oba modele rozwiązują kwestię „sprawić, by trafiło dokładnie tam” na zupełnie różne sposoby.
FLUX 3 Image przyjmuje tablicę JSON dołączoną do promptu. Współrzędne działają na siatce 0–1000 na obu osiach, a każde pole zapisuje się jako [top, left, bottom, right]. Podajesz tabelę elementów, z których każdy ma id, bboxi desc, a także globalny podpis, który przywołuje te identyfikatory po nazwie. W samym przykładzie BFL identyfikatory wyglądają tak: animal_1 i silhouette_1; podpis odwołuje się do nich bezpośrednio. Nad wywołaniem generowania znajduje się grounding, domyślnie włączona, która przed generowaniem uruchamia wyszukiwanie internetowe i wyszukiwanie obrazów.
FLUX 3 Image następnie rozszerza ten sam układ współrzędnych na edycję. Zamiast wysyłać maskę, wysyłasz zestaw operacji ograniczonych do obszarów: Zachowaj (obszar źródłowy do tego samego obszaru, pochodzący z ref_image_0), Przenieś (obszar źródłowy do nowego obszaru docelowego), Nowy (brak źródła, obszar docelowy generowany z opisu — dodaj, zastąp lub zmień kolor) i Usuń (obszar źródłowy do pustego celu). Wiele operacji umieszcza się w jednym żądaniu.
Zastrzeżenie ma znaczenie. Dokumentacja BFL mówi, że piksele poza edytowanymi obszarami „zwykle pozostają identyczne”. Zwykle. To twierdzenie o zachowaniu ma wbudowane w swoje sformułowanie zastrzeżenie, co jest uczciwym sposobem na jego dostarczenie, a także powodem, dla którego powinieneś przetestować je na własnych klatkach, zamiast ufać demu.
Bernini nie ma równoważnego języka współrzędnych widocznego dla użytkownika. Jego edycja sterowana odniesieniami poprawiła się w wersji v2 dzięki zmianie w treningu — moduł łączący jest rozgrzewany przez tysiące kroków, zanim rozpocznie się wspólne trenowanie — a ByteDance podaje, że zmiana ta przekłada się na lepszą edycję sterowaną odniesieniami i wydajność OpenS2V. To poprawka jakościowa wewnątrz istniejącej architektury, a nie nowy interfejs sterujący. Jeśli Twój przepływ pracy zależy od wskazania modelowi, który prostokąt pozostawić bez zmian, tylko jedna z tych dwóch odpowiedzi odpowiada na to pytanie.

Co liczby potwierdzają, a czego nie potwierdzają
Strona Bernini-Diffusers-v2 zawiera tabelę siedmiu metryk porównującą v2 z v1, a każda liczba na niej pochodzi od dostawcy. Kierunek jest mieszany, co warto powiedzieć wprost:
• Wzrost — OpenS2V 63.83 (z 62.30), VBench 84.46 (z 84.37), Bernini-rv2v 3.55 (z 3.48).
• Płaski — EditVerse 8.02, bez zmian, oraz Bernini-v2v 3.49, bez zmian.
• Niedostępny — OpenVE 3.96, od 4.03.
Strona podaje również, że v2 plasuje się w pierwszej lidze wśród wiodących komercyjnych modeli o zamkniętym kodzie w wewnętrznej, zaślepionej arencie porównań parami prowadzonych przez ludzi. Nie da się tego zweryfikować spoza ByteDance i należy to odczytywać jako twierdzenie marketingowe, a nie pomiar. Trzy rzeczywiste zmiany to te wymienione powyżej i są one raportowane przez samo laboratorium w odniesieniu do jego własnego v1.
FLUX 3 Image nie ma jeszcze żadnych liczb. Ranking tekst-na-obraz Artificial Analysis i jego ranking edycji zostały sprawdzone zarówno 1 października, jak i 2026-10-02 i nie zawierają wiersza FLUX 3 Image — wpisy BFL na tych rankingach kończą się na pozycji FLUX.2, gdzie FLUX.2 [max] znajduje się na poziomie 1021 Elo w rankingu generowania i 996 w rankingu edycji. FLUX.2 [dev] kotwiczy oba rankingi dokładnie na 1000. Zatem uczciwym stwierdzeniem o jakości FLUX 3 Image w tej chwili jest to, że nikt spoza Black Forest Labs nie opublikował dla niego wyniku, a najbliższym dostępnym punktem odniesienia jest poprzednia generacja.
Ta asymetria to praktyczna pułapka w tym porównaniu. Liczby Berniniego pochodzą od dostawcy, ale istnieją i wskazują kierunek. W przypadku FLUX 3 Image ich brak. Brak nie oznacza porażki — model ma zaledwie dzień — ale oznacza to, że jedynym dowodem na twierdzenie FLUX 3 Image o edycji są obecnie dane od firmy, która go sprzedaje.
Strona cenowa, która wcale nie jest symetryczna
FLUX 3 Image jest wyceniany za obraz według poziomu rozdzielczości, a cennik dostawcy wymienia pięć z nich:
• 768sq — $0,041 cena katalogowa, $0,0205 w okresie premiery.
• 1K (domyślnie) — cena katalogowa $0.048, $0.024 w promocji.
• 1,5 tys. — cena katalogowa $0,07, w promocji $0,035.
• 2K — $0.10 cena katalogowa, $0.05 w ofercie.
• 4K — cena katalogowa $0.607, w promocji $0.3035.

Obrazy referencyjne i długość promptu są wliczone bez dodatkowych opłat, a odrzucone, nieudane lub moderowane żądania nie są rozliczane — co ma tu większe znaczenie niż zwykle, ponieważ wywołanie 4K jest wolne, a pokusa porzucenia żądania jest realna. Cennik startowy obowiązuje od 15:00 UTC 1 października do 15:00 UTC 8 października. Skok ceny katalogowej z 2K do 4K to współczynnik 6,07, znacznie większy niż stosunek liczby pikseli, więc wybrany poziom rozdzielczości to główna decyzja kosztowa w całym API.
Poziomy śledzą budżet pikselowy, a nie stałą ramkę. Przykładowy wynik BFL to 5456 × 3072, około 16,8 megapiksela, w porównaniu z UHD 2160p o rozdzielczości 8,3 megapiksela — więc „4K” oznacza tutaj budżet, a wymiary wyjściowe są zaokrąglane do wielokrotności 16, przy czym rzeczywista wartość jest zwracana jako output_mp.
Cena Berniniego wynosi zero za obraz i jest niezerowa za godzinę. Osiem GPU do wnioskowania z równoległością sekwencyjną, zalecany krzem klasy Hopper, Python 3.11.2 z PyTorch 2.7.1 i CUDA 12.6. Próg rentowności względem 0,048 USD za obraz przy 1K pojawia się gdzieś w okolicach tysięcy obrazów miesięcznie, zależnie wyłącznie od tego, ile płacisz za moc obliczeniową — i jest to realna liczba, a nie retoryczna. Jeśli już prowadzisz infrastrukturę wnioskowania, krańcowy obraz w Berninim jest niemal darmowy. Jeśli nie, endpoint FLUX 3 Image jest dramatycznie tańszy niż postawienie dwuetapowego stosu dyfuzyjnego.
Routing: żadnego z nich nie ma w naszym katalogu
Warto powiedzieć to wprost, bo to rodzaj twierdzenia, które szybko się dezaktualizuje. OrcaRouter nie routuje FLUX 3 Image ani nie routuje Bernini-Diffusers-v2. Wywołanie FLUX 3 Image oznacza bezpośrednie wywołanie Black Forest Labs pod ich własnym endpointem. Wywołanie Bernini oznacza samodzielne wdrożenie go.
W pipeline takim jak ten router zgodny z OpenAI odpowiada właściwie za wszystko po obu stronach wywołania generowania obrazu. Przebieg tworzenia podpisów lub przepisywania promptów, model wizyjny sprawdzający render względem briefu, model wideo animujący zatwierdzoną stopklatkę, mały model tekstowy klasyfikujący wynik — to właśnie te kroki, w których to, że można podmienić dostawcę jednym ciągiem znaków, na jednym kluczu, i że żądania są automatycznie przełączane awaryjnie, gdy jeden z nich działa w trybie zdegradowanym, eliminuje sporą część prac utrzymaniowych. OrcaRouter przekazuje cenę katalogową dostawcy bez marży, więc gdy dostawca obniża stawkę, zmiana obowiązuje tego samego dnia, zamiast czekać, aż reseller zmieni cennik, a DSL routingu pozwala przypiąć konkretny model lub zdefiniować kolejność fallbacków bez dotykania kodu aplikacji. Nic z tego nie sprawia, że FLUX 3 Image da się routować. Oznacza to po prostu, że reszta pipeline'u nie musi się przejmować, który model wygenerował stopklatkę.
![Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board](https://cms.orcarouter.ai/api/media/file/4-1497.png)
Na którym budować?
Trzy pytania wyraźnie je rozdzielają i nie mają wspólnej odpowiedzi.
Czy potrzebujesz kontrolować, gdzie trafiają poszczególne elementy? FLUX 3 Image jest jedynym z tych dwóch z językiem współrzędnych, a jego operacje edycyjne ograniczone do ramek — zachowaj, przenieś, dodaj, usuń — to naprawdę odmienny interfejs od edycji za pomocą instrukcji tekstowych. Jeśli Twoja praca polega na komponowaniu, układzie lub obrazach produktowych, w których regiony muszą przetrwać, to jest rozstrzygające, a zastrzeżenie w „zwykle pozostają identyczne” to coś, co się testuje, a nie zakłada.
Czy musisz wiedzieć, jak dobry jest, zanim się zdecydujesz? Bernini ma liczby, wszystkie raportowane przez dostawcę, a trendy są mieszane. FLUX 3 Image nie ma żadnych. Jeśli nie możesz przeprowadzić własnej oceny, wybierasz między modelem zmierzonym a niezmierzonym, a ten zmierzony to starsza architektura.
Czy potrafisz obsługiwać dwuetapowy stack dyfuzyjny? To jest prawdziwy warunek w przypadku Bernini. Planer Qwen2.5-VL-7B zasilający dekoder Wan2.2-T2V-A14B, na GPU Hopper, z hookiem wzmacniającym prompt, który wskazuje na endpoint zgodny z OpenAI. Licencja jest permisywna, ale rachunek za obliczenia już nie. Jeśli nie potrafisz, pytanie jest bezprzedmiotowe, a odpowiedzią jest 0,048 USD za obraz.
Jedyną rzeczą, która najszybciej zmieniłaby tę stronę, jest udostępnienie wag FLUX 3 Image przez BFL, co według firmy ma nastąpić za kilka tygodni. To zmienia asymetrię licencyjną z rozstrzygającej na łagodną i pozostawia różnicę w możliwościach kontroli jako właściwe porównanie. Do tego czasu trafnym podsumowaniem jest to, że są to dwa dobre modele o przeciwnych modelach dystrybucji, a wybór zapada na podstawie licencjonowania i kontroli na długo przed tym, zanim zapada na podstawie jakości.
