Kartu judul untuk FLUX 3 Image vs Bernini-Diffusers-v2, yang mempertentangkan 'FLUX 3 Image - aktif 1 Oktober 2026, $0,048 per gambar pada 1K, di api.bfl.ai' dengan 'Bernini-Diffusers-v2 - bobot Apache-2.0, hanya self-host, tanpa API terhosting' dan mencatat bahwa OrcaRouter tidak merutekan salah satu pun dari keduanya. Logo OrcaRouter berada di kanan bawah.
Guides & Insights

FLUX 3 Image vs Bernini-Diffusers-v2: Endpoint Berbayar versus Repo yang Dapat Diunduh

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

FLUX 3 Image dan Bernini-Diffusers-v2 keduanya adalah model gambar yang dapat Anda peroleh secara penuh hari ini, dan tidak satu pun dari keduanya adalah produk yang dapat Anda sewa. FLUX 3 Image mulai aktif pada 1 Oktober 2026 di api.bfl.ai/v1/flux-3-image dengan daftar tarif yang diterbitkan dan tanpa skor yang dipublikasikan. Bernini-Diffusers-v2 hadir di Hugging Face pada 13 Agustus 2026 di bawah Apache-2.0 dengan skor yang dipublikasikan dan tidak ada cara untuk memanggilnya selain GPU Anda sendiri. Salah satunya hadir dengan faktur. Yang lain hadir dengan pin versi Python.

Pemisahan itulah keseluruhan perbandingannya, dan penting untuk tepat soal itu, karena kerangka "hosted vs open weights" yang biasa tidak cocok di sini. Bernini bukan model open-weights yang bisa Anda masukkan begitu saja ke stack inferensi yang sudah ada. Ini adalah sistem dua tahap — sebuah planner Qwen2.5-VL-7B di depan decoder difusi Wan2.2-T2V-A14B — dan rilis v2-nya adalah perbaikan jadwal pelatihan, bukan tingkat kemampuan baru. FLUX 3 Image adalah satu endpoint dengan permukaan kendali dalam jumlah tidak lazim yang terpasang padanya: grounding spasial, kisi koordinat 0–1000, dan pengeditan berlingkup kotak di mana Anda menentukan wilayah mana yang bertahan. Dua hal yang bentuknya berbeda.

Apa sebenarnya masing-masing itu

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — Stack planner-plus-renderer milik ByteDance, diunggah ke Hugging Face pada 13 Agustus 2026 tanpa pengumuman yang menyertainya. Repositori ini diberi tag image-text-to-video dan bergantung pada diffusers. Tugas yang tercantum: teks-ke-gambar, gambar-ke-gambar, teks-ke-video, video-ke-video, referensi-ke-video, dan referensi-ke-gambar. Tidak ada inferensi yang dihosting dan tidak ada daftar harga — jalur untuk memulai adalah hf download dan aplikasi Gradio.

• Kesenjangan distribusi — FLUX 3 Image adalah layanan berbasis pemakaian yang Anda panggil. Bernini adalah repositori yang Anda deploy. Sebelum pertanyaan kualitas apa pun layak diajukan, salah satunya membutuhkan GPU kelas Hopper dan yang lainnya membutuhkan kartu kredit.

Pelesenan adalah titik di mana keduanya paling berbeda.

Bernini-Diffusers-v2 berlisensi Apache-2.0 di tingkat repositori. Untuk pipeline yang dihosting sendiri, hal itu sangat penting: tidak ada penghitung per gambar, tidak ada perjanjian komersial yang dinegosiasikan, tidak ada pelaporan penggunaan. Anda membayar listrik dan waktu scheduler, dan biaya marjinal untuk gambar kesepuluh ribu sama dengan gambar pertama.

FLUX 3 Image bukanlah berbobot terbuka, dan Black Forest Labs menegaskan bahwa ini bersifat sementara. Bobot komersial tersedia hari ini di bawah lisensi BFL yang dinegosiasikan, dan rilis bobot terbuka untuk publik dijelaskan akan datang dalam beberapa minggu berikutnya. Itu adalah janji yang punya bentuk tetapi tanpa tanggal, dan itu adalah hal paling penting di halaman ini untuk diperiksa ulang alih-alih diasumsikan. Jika Anda memilih stack gambar untuk dua tahun ke depan, pertanyaan lisensi mungkin lebih penting daripada pertanyaan Elo — tetapi hanya jika Anda siap mengoperasikan sendiri stack difusi native video dua tahap.

Permukaan kontrol: kotak pembatas versus peningkatan prompt

Inilah bagian dari pertandingan ini yang benar-benar menarik, karena kedua model menyelesaikan "membuatnya pergi tepat ke sana" dengan cara yang sepenuhnya berbeda.

FLUX 3 Image menerima array JSON yang ditambahkan ke prompt. Koordinat berjalan pada grid 0–1000 di kedua sumbu, dan setiap kotak ditulis sebagai [top, left, bottom, right]. Anda menyediakan tabel elemen, masing-masing dengan id, sebuah bbox dan sebuah desc, serta keterangan global yang menyebut id-id tersebut dengan namanya. Dalam contoh BFL sendiri, id-nya seperti animal_1 dan silhouette_1; keterangan tersebut merujuknya secara langsung. Di atas panggilan generasi terdapat grounding, aktif secara default, yang menjalankan penelusuran web dan gambar sebelum menghasilkan.

FLUX 3 Image kemudian memperluas sistem koordinat yang sama ke dalam pengeditan. Alih-alih mengirim mask, Anda mengirim serangkaian operasi dengan cakupan kotak: Pertahankan (kotak sumber ke kotak yang sama, bersumber dari ref_image_0), Pindahkan (kotak sumber ke kotak target baru), Baru (tanpa sumber, kotak target dihasilkan dari deskripsi — tambahkan, ganti, atau warnai ulang) dan Hapus (kotak sumber ke target null). Beberapa operasi masuk dalam satu permintaan.

Kualifikasi itu penting. Dokumentasi BFL menyatakan bahwa piksel di luar kotak yang diedit "biasanya tetap identik." Biasanya. Ini adalah klaim preservasi dengan unsur kehati-hatian yang tertanam dalam kata-katanya, yang merupakan cara jujur untuk merilis klaim semacam itu dan juga alasan Anda harus menguji pada frame Anda sendiri daripada memercayai demo.

Bernini tidak memiliki bahasa koordinat yang setara untuk pengguna. Penyuntingan terpandu referensinya meningkat di v2 karena perubahan pelatihan — modul konektor dipanaskan selama ribuan langkah sebelum pelatihan bersama dimulai — dan ByteDance melaporkan bahwa perubahan itu tampak sebagai penyuntingan terpandu referensi dan performa OpenS2V yang lebih baik. Ini adalah perbaikan kualitas di dalam arsitektur yang sudah ada, bukan antarmuka kontrol baru. Jika alur kerja Anda bergantung pada memberi tahu model persegi mana yang harus dibiarkan, hanya satu dari dua jawaban ini yang menjawab pertanyaan tersebut.

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

Apa yang dapat dan tidak dapat didukung oleh angka-angka tersebut

Halaman Bernini-Diffusers-v2 memuat tabel tujuh metrik yang membandingkan v2 dengan v1, dan setiap angka di dalamnya dilaporkan oleh vendor. Arahnya campur aduk, dan itu layak dikatakan secara terbuka:

• Naik — OpenS2V 63.83 (dari 62.30), VBench 84.46 (dari 84.37), Bernini-rv2v 3.55 (dari 3.48).

• Flat — EditVerse 8.02, tidak berubah, dan Bernini-v2v 3.49, tidak berubah.

• Turun — OpenVE 3.96, dari 4.03.

Halaman itu juga menyatakan bahwa v2 berada di tier pertama di antara model komersial sumber tertutup terkemuka dalam arena internal uji berpasangan manusia secara buta. Itu tidak dapat diverifikasi dari luar ByteDance dan harus dibaca sebagai klaim pemasaran, bukan pengukuran. Tiga pergerakan nyata adalah yang tercantum di atas, dan semuanya dilaporkan sendiri terhadap v1 milik lab yang sama.

FLUX 3 Image sama sekali belum memiliki angka. Papan text-to-image Artificial Analysis dan papan penyuntingannya keduanya diperiksa pada 1 Oktober dan 2026-10-02 serta tidak memuat baris FLUX 3 Image — entri BFL di papan-papan tersebut berhenti pada lini FLUX.2, tempat FLUX.2 [max] berada di 1021 Elo pada papan generasi dan 996 pada papan penyuntingan. FLUX.2 [dev] menambatkan kedua papan tepat di 1000. Jadi pernyataan jujur tentang kualitas FLUX 3 Image saat ini adalah bahwa tidak ada pihak di luar Black Forest Labs yang telah menerbitkan skor untuknya, dan titik referensi terdekat yang tersedia adalah generasi sebelumnya.

Asimetri itu adalah jebakan praktis dalam perbandingan ini. Angka-angka Bernini dijalankan oleh vendor, tetapi angka-angka itu ada dan memberi arah. Angka-angka FLUX 3 Image tidak ada. Ketidakhadiran bukanlah kegagalan — model ini baru berumur sehari — tetapi itu berarti satu-satunya bukti untuk klaim penyuntingan FLUX 3 Image saat ini berasal dari perusahaan yang menjualnya.

Sisi harga, yang sama sekali tidak simetris

FLUX 3 Image diberi harga per gambar berdasarkan tingkat resolusi, dan daftar tarif vendor mencantumkan lima di antaranya:

• 768sq — $0.041 harga daftar, $0.0205 selama periode peluncuran.

• 1K (default) — harga daftar $0,048, harga penawaran $0,024.

• 1.5K — $0.07 harga normal, $0.035 saat promo.

• 2K — $0.10 harga daftar, $0.05 sedang promo.

• 4K — $0.607 harga daftar, $0.3035 saat promo.

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

Gambar referensi dan panjang prompt sudah termasuk tanpa biaya tambahan, dan permintaan yang ditolak, gagal, atau dimoderasi tidak ditagih — yang di sini lebih penting daripada biasanya, karena panggilan 4K itu lambat dan godaan untuk membatalkan permintaan sungguh nyata. Harga peluncuran berlaku dari 15:00 UTC pada 1 Oktober hingga 15:00 UTC pada 8 Oktober. Lonjakan harga daftar dari 2K ke 4K adalah faktor 6,07, jauh lebih tajam daripada rasio jumlah piksel, jadi tingkat resolusi yang Anda pilih adalah keputusan biaya utama di seluruh API ini.

Tingkatan ini melacak anggaran piksel, bukan bingkai tetap. Contoh keluaran BFL adalah 5456 × 3072, sekitar 16,8 megapiksel, dibandingkan dengan UHD 2160p pada 8,3 megapiksel — jadi "4K" di sini menamai sebuah anggaran, dan dimensi keluaran dibulatkan ke kelipatan 16 dengan angka sebenarnya dikembalikan sebagai output_mp.

Harga Bernini adalah nol per gambar dan non-nol per jam. Delapan GPU untuk inferensi paralel-sekuens, disarankan silikon kelas Hopper, Python 3.11.2 dengan PyTorch 2.7.1 dan CUDA 12.6. Titik impas terhadap $0,048 per gambar pada 1K tercapai di suatu tempat dalam kisaran ribuan gambar per bulan, sepenuhnya bergantung pada berapa biaya komputasi yang Anda keluarkan — dan itu angka nyata, bukan retoris. Jika Anda sudah menjalankan infrastruktur inferensi, gambar marginal Bernini hampir gratis. Jika tidak, endpoint FLUX 3 Image jauh lebih murah daripada menyiapkan stack difusi dua tahap.

Perutean: tidak satu pun dari ini ada di katalog kami

Patut dikatakan secara gamblang, karena ini jenis klaim yang cepat usang. OrcaRouter tidak merutekan FLUX 3 Image, dan tidak merutekan Bernini-Diffusers-v2. Memanggil FLUX 3 Image berarti memanggil Black Forest Labs secara langsung di endpoint mereka sendiri. Memanggil Bernini berarti men-deploy-nya sendiri.

Fungsi sebenarnya dari router yang kompatibel dengan OpenAI, dalam pipeline seperti ini, adalah segala hal di kedua sisi pemanggilan gambar. Tahap pembuatan caption atau penulisan ulang prompt, model visi yang memeriksa hasil render terhadap brief, model video yang menganimasikan still yang disetujui, model teks kecil yang mengklasifikasikan output — itulah langkah-langkah di mana kemampuan menukar penyedia dengan satu string, pada satu key, dan membuat permintaan dialihkan secara otomatis saat salah satunya mengalami degradasi, menghilangkan beban pemeliharaan yang nyata. OrcaRouter meneruskan harga daftar penyedia tanpa markup, jadi ketika vendor memangkas tarif, perubahan itu langsung berlaku pada hari yang sama alih-alih menunggu reseller menetapkan harga ulang, dan DSL routing memungkinkan Anda menyematkan model tertentu atau menentukan urutan fallback tanpa menyentuh kode aplikasi. Tidak ada dari semua itu yang membuat FLUX 3 Image dapat dirutekan. Itu hanya berarti bagian lain dari pipeline tidak perlu peduli model mana yang menghasilkan still tersebut.

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

Yang mana yang akan dijadikan dasar

Tiga pertanyaan memisahkan ini dengan jelas, dan ketiganya tidak memiliki jawaban yang sama.

Apakah Anda perlu mengontrol ke mana segala sesuatu pergi? FLUX 3 Image adalah satu-satunya dari keduanya yang memiliki bahasa koordinat, dan operasi edit dengan cakupan kotak — pertahankan, pindahkan, tambah, hapus — adalah antarmuka yang benar-benar berbeda dari pengeditan dengan instruksi teks. Jika pekerjaan Anda adalah pengomposisian, tata letak, atau citra produk di mana wilayah harus tetap bertahan, itu menentukan dan sikap berhati-hati dalam "biasanya tetap identik" adalah sesuatu yang Anda uji, bukan asumsikan.

Apakah Anda perlu tahu seberapa bagus kualitasnya sebelum Anda berkomitmen? Bernini memiliki angka, semuanya dilaporkan oleh vendor, dan arah perkembangannya beragam. FLUX 3 Image tidak memilikinya. Jika Anda tidak dapat menjalankan evaluasi Anda sendiri, Anda sedang memilih antara model yang terukur dan model yang tidak terukur, dan yang terukur adalah arsitektur yang lebih tua.

Bisakah Anda mengoperasikan stack difusi dua tahap? Itulah gerbang sesungguhnya pada Bernini. Perencana Qwen2.5-VL-7B yang memberi masukan ke dekoder Wan2.2-T2V-A14B, di GPU Hopper, dengan hook peningkat prompt yang mengarah ke endpoint yang kompatibel dengan OpenAI. Lisensinya permisif dan tagihan komputasinya tidak. Jika Anda tidak bisa, pertanyaannya menjadi tidak relevan dan $0,048 per gambar adalah jawabannya.

Hal yang paling cepat mengubah halaman ini adalah jika BFL membuka bobot FLUX 3 Image, yang menurut perusahaan tinggal beberapa minggu lagi. Itu mengubah asimetri lisensi dari menentukan menjadi ringan dan menyisakan perbedaan permukaan kendali sebagai perbandingan yang sebenarnya. Hingga saat itu, ringkasan yang akurat adalah bahwa ini adalah dua model bagus dengan model distribusi yang berlawanan, dan pilihan dibuat berdasarkan lisensi dan kontrol jauh sebelum dibuat berdasarkan kualitas.