FLUX 3 Image 対 Bernini-Diffusers-v2 のタイトルカード。「FLUX 3 Image - 2026年10月1日提供開始、1Kで画像1枚あたり$0.048、api.bfl.aiにて」と「Bernini-Diffusers-v2 - Apache-2.0の重み、セルフホスト専用、ホスト型APIなし」を対比し、OrcaRouterはどちらもルーティングしないことに言及。OrcaRouterのロゴは右下に配置。
Guides & Insights

FLUX 3 Image 対 Bernini-Diffusers-v2:有料エンドポイントか、ダウンロード可能なリポジトリか

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

FLUX 3 ImageとBernini-Diffusers-v2はどちらも、今日完全な形で入手できる画像モデルであり、どちらもレンタルできる製品ではない。FLUX 3 Imageは2026年10月1日、api.bfl.ai/v1/flux-3-imageで公開され、料金表は公表されているがスコアは公表されていない。Bernini-Diffusers-v2は2026年8月13日にApache-2.0の下でHugging Faceに登場し、スコアは公表されているが、自前のGPU以外に呼び出す方法はない。一方には請求書が付いてくる。もう一方にはPythonのバージョンピンが付いてくる。

その分岐こそが比較のすべてであり、ここでは正確を期す価値がある。なぜなら、よくある「ホスト型 vs オープンウェイト」という枠組みはここには当てはまらないからだ。Bernini は、既存の推論スタックにそのまま組み込めるオープンウェイトモデルではない。それは二段階構成のシステムだ — Wan2.2-T2V-A14B 拡散デコーダーの前段に Qwen2.5-VL-7B プランナーを置いたもの — であり、その v2 リリースは学習スケジュールの修正であって、新たな能力階層ではない。FLUX 3 Image は単一のエンドポイントで、そこには異例なほどの制御面が取り付けられている。空間グラウンディング、0~1000 の座標グリッド、そしてどの領域を残すかを指定するボックススコープ編集だ。まったく別の形のものだ。

それぞれが実際に何なのか

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — ByteDanceのプランナーとレンダラーからなるスタックで、2026年8月13日にHugging Faceへ公開されたが、付随する告知はなかった。リポジトリにはimage-text-to-videoというタグが付いており、依存先はdiffusers。記載されているタスク:テキストから画像、画像から画像、テキストから動画、動画から動画、参照から動画、参照から画像。ホスト型推論も価格表もない — 開始するにはhf downloadとGradioアプリを使う。

• 配布のギャップ — FLUX 3 Image は呼び出して使う従量課金サービス。Bernini は自分でデプロイするリポジトリ。品質を云々する前に、一方には Hopper クラスの GPU が必要で、もう一方にはクレジットカードが必要だ。

ライセンス供与は、この2つが最も大きく乖離する領域だ。

Bernini-Diffusers-v2はリポジトリレベルでApache-2.0です。セルフホスト型パイプラインにとって、これは極めて重要です。画像ごとの従量課金はなく、商業契約の交渉もなく、使用状況の報告もありません。電気代とスケジューラ時間を支払うだけで、1万枚目の画像の限界費用は最初の1枚と同じです。

FLUX 3 Imageはオープンウェイトではなく、Black Forest Labsはこれが一時的なものであると明言している。商用ウェイトは現在、交渉によるBFLライセンスの下で利用可能であり、公開オープンウェイト版のリリースは今後数週間で行われると説明されている。それは形はあるが日付のない約束であり、このページで前提とするのではなく再確認すべき最も重要な点である。今後2年間の画像スタックを選ぶなら、ライセンスの問題はおそらくEloの問題を上回る——ただし、2段階の動画ネイティブ拡散スタックを自分で運用する用意がある場合に限る。

コントロールサーフェス:バウンディングボックス 対 プロンプト拡張

ここがこの対決で本当に興味深いところだ。というのも、2つのモデルは「それを正確にそこへ行かせる」という課題をまったく異なる方法で解いているからだ。

FLUX 3 Image は、プロンプトに追加された JSON 配列を受け取ります。座標は両軸とも 0–1000 のグリッド上で動作し、各ボックスは次のように記述されます:[top, left, bottom, right]。要素のテーブルを指定します。各要素には id、bbox、desc があり、さらにそれらの id を名前で参照するグローバルキャプションを指定します。BFL 自身の例では、id は animal_1 や silhouette_1 のようになっており、キャプションはそれらを直接参照しています。生成呼び出しの上には groundingがあり、デフォルトで有効で、生成前にウェブ検索と画像検索を実行します。

FLUX 3 Image は次に、同じ座標系を編集へと拡張します。マスクを送る代わりに、ボックス単位の操作セットを送信します:Keep(ソースボックスを同じボックスへ、ref_image_0から取得)、Move(ソースボックスを新しいターゲットボックスへ)、New(ソースなし、説明からターゲットボックスを生成 — 追加、置換、または色変更)およびRemove(ソースボックスを null ターゲットへ)。複数の操作は 1 つのリクエストにまとめます。

その限定は重要だ。BFLのドキュメントには、編集されたボックスの外側のピクセルは「通常は同一のままである」と記されている。通常は。これは文言にヘッジが組み込まれた保持の主張であり、そう出荷するのが誠実なやり方であると同時に、デモを信用するのではなく自分のフレームでテストすべき理由でもある。

Bernini には、ユーザー向けの同等の座標言語が存在しない。その参照ガイド付き編集は v2 で改善した。理由はトレーニングの変更——共学習が始まる前にコネクタモジュールが数千ステップにわたってウォームアップされる——であり、ByteDance はその変更が参照ガイド付き編集と OpenS2V の性能向上として現れていると報告している。これは既存アーキテクチャ内の品質修正であり、新しい制御インターフェースではない。ワークフローが、どの矩形をそのままにしておくべきかをモデルに伝えることに依存しているなら、この2つのうち問いに答えるのは片方だけだ。

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

数字が支持することと支持しないこと

Bernini-Diffusers-v2のページには、v2をv1と比較する7指標の表が掲載されており、そこに載っている数値はすべてベンダー報告です。方向性はまちまちで、これは明言しておく価値があります:

• 上昇 — OpenS2V 63.83(従来 62.30)、VBench 84.46(従来 84.37)、Bernini-rv2v 3.55(従来 3.48)。

• フラット — EditVerse 8.02 は変更なし、Bernini-v2v 3.49 も変更なし。

• ダウン — OpenVE 3.96、4.03 から

このページはまた、v2が社内のブラインド人間ペアワイズアリーナにおいて、主要なクローズドソース商用モデルの中で最上位層に位置すると述べている。これはByteDanceの外部からは検証できず、測定結果ではなくマーケティング上の主張として読むべきである。実際の3つの動きとは上記に挙げられたものであり、それらは同じラボ自身のv1に対して自己申告されたものである。

FLUX 3 Image にはまだ数値が一切ありません。Artificial Analysis のテキストto画像ボードとその編集ボードはどちらも10月1日と2026-10-02に確認されましたが、FLUX 3 Image の行はなく、これらのボード上の BFL の項目は FLUX.2 の行で止まっています。そこでは FLUX.2 [max] が生成ボードで 1021 Elo、編集ボードで 996 に位置しています。FLUX.2 [dev] は両ボードをちょうど 1000 でアンカーしています。したがって、現時点で FLUX 3 Image の品質について正直に言えるのは、Black Forest Labs の外部では誰もそのスコアを公表しておらず、利用可能な最も近い参照点はその1つ前の世代だということです。

その非対称性こそが、この比較における実用的な落とし穴だ。Berniniの数値はベンダー側が実施したものだが、存在しており、方向性を示している。FLUX 3 Imageの数値は存在しない。存在しないことは失敗ではない——このモデルは登場からまだ1日しか経っていない——しかし、それゆえにFLUX 3 Imageの編集能力に関する主張を現在裏付ける唯一の証拠は、それを販売している企業から出ているものだということになる。

価格面は、まったく対称的ではない

FLUX 3 Imageは解像度ティアごとに画像1枚あたりの価格が設定されており、ベンダーの料金表には5つのティアが記載されています:

• 768sq — 定価 $0.041、ローンチ期間中は $0.0205。

• 1K(デフォルト) — 定価 $0.048、オファー価格 $0.024。

• 1.5K — 定価 $0.07、提供価格 $0.035。

• 2K — 定価 $0.10、特別価格 $0.05。

• 4K — 定価 $0.607、提供価格 $0.3035。

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

参照画像とプロンプト長は追加料金なしで含まれており、拒否、失敗、モデレーションされたリクエストには課金されません。これはここでは通常以上に重要です。なぜなら、4K呼び出しは遅く、リクエストを断念したくなる誘惑が現実にあるからです。ローンチ記念価格は10月1日15:00 UTCから10月8日15:00 UTCまでです。2Kから4Kへの定価の上昇は6.07倍で、画素数比よりはるかに急峻です。そのため、選ぶ解像度ティアがAPI全体で最大のコスト判断となります。

ティアは固定フレームではなくピクセル予算を追跡します。BFLの出力例は5456 × 3072で、およそ16.8メガピクセルであり、8.3メガピクセルのUHD 2160pと対比されます — つまり、ここでの「4K」は予算を指し、また、出力寸法は16の倍数に丸められ、実際の数値は次のとおり返されます: output_mp.

Berniniの料金は画像1枚あたりゼロで、1時間あたりは非ゼロです。シーケンス並列推論用に8基のGPU、Hopperクラスのシリコンを推奨、Python 3.11.2とPyTorch 2.7.1およびCUDA 12.6。1Kでの画像1枚あたり$0.048に対する損益分岐点は、月あたり数千枚のどこかで訪れ、それは完全にコンピュートにいくら支払うかによって決まります — そしてそれは実際の数値であり、修辞的なものではありません。すでに推論インフラを運用しているなら、Berniniで追加の画像を1枚生成するコストはほぼ無料です。そうでなければ、FLUX 3 Imageエンドポイントは、2段階の拡散スタックを立ち上げるよりも劇的に安価です。

ルーティング:これらはいずれも当社のカタログには掲載されていません

はっきり言っておく価値がある。というのも、これはすぐに古びてしまう類の主張だからだ。OrcaRouter は FLUX 3 Image をルーティングしないし、Bernini-Diffusers-v2 もルーティングしない。FLUX 3 Image を呼ぶというのは、Black Forest Labs の自前のエンドポイントに直接呼び出すことを意味する。Bernini を呼ぶというのは、自分でデプロイすることを意味する。

こうしたパイプラインにおいて、OpenAI互換ルーターが実際に担うのは、画像呼び出しの両側にあるすべての処理です。キャプション生成やプロンプト書き換えの工程、レンダリング結果が指示内容に合っているかを確認するビジョンモデル、承認されたスチルをアニメーション化する動画モデル、出力を分類する小さなテキストモデル——こうした工程で、1つの文字列、1つのキーでプロバイダーを差し替えられること、そしてどれか1つが劣化したときにリクエストが自動的にフェイルオーバーすることは、実際にかなりの運用負荷を取り除いてくれます。OrcaRouterはプロバイダーの定価をマークアップなしでそのまま通すため、ベンダーが料金を値下げすれば、リセラーが価格を付け直すのを待つことなくその日のうちに反映されます。また、ルーティングDSLを使えば、アプリケーションコードに一切触れることなく、特定のモデルを固定したりフォールバック順序を定義したりできます。とはいえ、それによってFLUX 3 Imageがルーティング可能になるわけではありません。ただ、パイプラインの残りの部分が、そのスチルを生成したのがどのモデルなのかを気にしなくて済むようになるだけです。

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

どれを基に構築するか

3つの問いがこれらを明確に区別するが、それらに共通する答えはない。

物の配置を制御する必要がありますか? FLUX 3 Image は、2つの中で唯一、座標指定の言語を備えており、そのボックス範囲に限定された編集操作 — 保持、移動、追加、削除 — は、テキスト指示による編集とは根本的に異なるインターフェースです。合成、レイアウト、または領域が保持されなければならない製品画像を扱う仕事なら、それは決定的であり、「通常は同一のまま」という留保は、前提とするのではなく検証するものです。

コミットする前に、それがどれほど優れているかを知る必要がありますか?Berniniには数値があり、それらはすべてベンダーによる報告で、進む方向はまちまちです。FLUX 3 Imageには何もありません。自分で評価を実行できないのであれば、あなたは測定済みのモデルと未測定のモデルのどちらかを選んでいることになり、測定済みのほうが古いアーキテクチャなのです。

2段階の拡散スタックを運用できますか? それがBerniniにおける本当の関門です。Qwen2.5-VL-7BプランナーがWan2.2-T2V-A14Bデコーダーに供給し、Hopper GPU上で動作し、OpenAI互換エンドポイントを指すプロンプトエンハンサーフックを備えています。ライセンスは寛容ですが、計算コストはそうではありません。できないなら、その問いは無意味であり、1画像あたり$0.048が答えです。

このページを最も速く変える唯一のことは、BFLがFLUX 3 Imageの重みを公開することであり、同社はそれが数週間後だと述べている。それにより、ライセンスの非対称性は決定的なものから軽微なものへと変わり、実際の比較対象として残るのはコントロールサーフェスの違いになる。それまでは、正確な要約はこうだ。これらは正反対の配布モデルを持つ2つの優れたモデルであり、その選択は品質によってなされるよりもずっと前に、ライセンスとコントロールによってなされる。