FLUX 3 Image 對比 Bernini-Diffusers-v2 的標題卡,將「FLUX 3 Image——2026 年 10 月 1 日上線,1K 每張圖片 $0.048,於 api.bfl.ai」與「Bernini-Diffusers-v2——Apache-2.0 權重,僅限自架,無託管 API」對比,並註明 OrcaRouter 兩者皆不提供路由。OrcaRouter 標誌位於右下角。
Guides & Insights

FLUX 3 Image 對比 Bernini-Diffusers-v2:付費端點對上可下載的儲存庫

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

FLUX 3 Image與Bernini-Diffusers-v2都是你今天就能完整取得的圖像模型,而且兩者都不是可以租用的產品。FLUX 3 Image 於 2026 年 10 月 1 日在 api.bfl.ai/v1/flux-3-image上線,有公開的費率表,卻沒有公開的評分。Bernini-Diffusers-v2 於 2026 年 8 月 13 日以 Apache-2.0 授權在 Hugging Face 上發布,有公開的評分,但除了用你自己的 GPU 之外,別無呼叫方式。一個附帶帳單,另一個附帶 Python 版本鎖定。

那個分野就是這整組比較的核心,而它值得被精確看待,因為常見的「託管式對比開放權重」框架並不適用於此。Bernini 並不是那種可以丟進現有推論堆疊裡的開放權重模型。它是一套兩階段系統——由一個 Qwen2.5-VL-7B 規劃器置於 Wan2.2-T2V-A14B 擴散解碼器之前——而它的 v2 版本發布是訓練排程的修正,並非新的能力層級。FLUX 3 Image 則是單一端點,卻上面拴著異常大量的控制介面:空間接地、0–1000 的座標網格,以及以框界定範圍的編輯,讓你能指名哪些區域要保留。兩者是不同形態的東西。

每一個實際上是什麼

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — ByteDance 的規劃器加渲染器堆疊,於 2026 年 8 月 13 日推上 Hugging Face,並未附帶任何公告。該儲存庫標記為 image-text-to-video,並依賴 diffusers。列出的任務:文字轉圖像、圖像轉圖像、文字轉影片、影片轉影片、參考轉影片與參考轉圖像。沒有託管推論,也沒有價目表——入門路徑是 hf download 和一個 Gradio 應用程式。

• 分發落差——FLUX 3 Image 是你呼叫的計量式服務。Bernini 則是你自行部署的儲存庫。在還值得追問任何品質問題之前,這兩者一個需要 Hopper 等級的 GPU,另一個只需要一張信用卡。

授權正是這兩者分歧最劇烈的地方

Bernini-Diffusers-v2 在儲存庫層級是 Apache-2.0。對自架式管線來說,這一點至關重要:沒有逐張圖片的計量、沒有需要協商的商業協議、沒有使用量回報。你只需支付電費和排程器時間,而第一萬張圖的邊際成本與第一張完全相同。

FLUX 3 Image 並非開放權重,而 Black Forest Labs 明確表示這只是暫時的。商業權重目前可透過協商取得的 BFL 授權提供,而公開開放權重的發布則被描述為會在接下來幾週內到來。那是一個有輪廓但沒有日期的承諾,而且是這頁上最該重新確認、而非逕自假設的一件事。如果你正在為未來兩年挑選影像堆疊,授權問題的重要性大概會超過 Elo 問題——但前提是你準備好自行操作一套兩階段、影片原生的擴散堆疊。

控制介面:邊界框與提示詞增強

這是這場對決中真正有趣的部分,因為這兩個模型以截然不同的方式解決「讓它精確地去到那裡」這個問題。

FLUX 3 Image 會接收附加在提示詞後方的 JSON 陣列。座標在兩個軸上皆採用 0–1000 的網格,每個框都寫成 [top, left, bottom, right]。你需要提供一張元素表,每個元素都有 id、bbox 和 desc,另外還有一個全域說明文字,會以名稱引用這些 id。在 BFL 自己的範例中,這些 id 讀起來像 animal_1 和 silhouette_1;說明文字會直接引用它們。在生成呼叫上方有 grounding,預設為開啟,會在生成前執行網路與圖片搜尋。

FLUX 3 Image 接著將同一套座標系統延伸至編輯功能。你不必傳送遮罩,而是傳送一組以框為範圍的操作:保留(來源框至同一個框,來源取自 ref_image_0),移動(來源框至新的目標框),新增(無來源,目標框由描述生成——可新增、替換或重新上色),以及 移除(來源框至空目標)。多個操作可放在同一個請求中。

這個但書很重要。BFL 的文件說,編輯框之外的像素「通常會保持不變」。通常。這是一項帶有但書的保留性宣稱,而這正是誠實發布這類聲明的方式,也正是你應該拿自己的畫格來測試、而不是信任示範影片的原因。

Bernini 沒有對等的使用者面向座標語言。它的參考引導編輯在 v2 中有所改善,原因是訓練方式的改變——在共同訓練開始之前,connector 模組會先進行數千步的暖身——而 ByteDance 表示這項改變體現為更好的參考引導編輯與 OpenS2V 效能。這是既有架構內部的品質修正,不是新的控制介面。如果你的工作流程取決於告訴模型哪個矩形不要動,那麼這兩者之中只有一個能回答這個問題。

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

這些數字支持什麼,不支持什麼

Bernini-Diffusers-v2 的頁面帶有一張七項指標的表格,將 v2 與 v1 相比,而表上每個數字都是廠商自行提報的。方向並不一致,這點值得明說:

• 上升 — OpenS2V 63.83(從 62.30)、VBench 84.46(從 84.37)、Bernini-rv2v 3.55(從 3.48)。

• 持平 — EditVerse 8.02,維持不變;Bernini-v2v 3.49,維持不變。

• 離線 — OpenVE 3.96,從 4.03 起。

該頁面也指出,v2 在內部盲測人類兩兩對戰競技場中,位居領先閉源商用模型的第一梯隊。這件事在字節跳動外部無法驗證,應視為行銷宣稱,而非實測結果。真正的三項進展就是上面列出的那些,而且它們是相對於同一實驗室自家的 v1 自我回報的。

FLUX 3 Image 目前完全沒有任何數字。Artificial Analysis 的文生圖排行榜和編輯排行榜在 10 月 1 日與 2026-10-02 都查過,兩者都沒有 FLUX 3 Image 這一列——那些排行榜上的 BFL 條目止於 FLUX.2 系列,其中 FLUX.2 [max] 在生成排行榜以 1021 Elo 位居,在編輯排行榜則是 996。FLUX.2 [dev] 則讓兩個排行榜都正好以 1000 為基準。所以,目前關於 FLUX 3 Image 品質最誠實的說法是:Black Forest Labs 以外沒有人發表過它的分數,而現有最接近的參考點就是它之前的世代。

這種不對稱正是這個比較中實際存在的陷阱。Bernini 的數據雖然由廠商自行提供,但至少確實存在,而且能看出趨勢方向。FLUX 3 Image 則完全沒有數據。沒有數據並不代表失敗——這個模型才問世一天——但這確實意味著,目前支持 FLUX 3 Image 編輯功能說法的唯一證據,來自販售它的公司。

價格那一側,完全不對稱。

FLUX 3 Image 依解析度等級按張計價,而供應商的價目表列出了其中五個等級:

• 768sq — 定價 $0.041,上市期間 $0.0205。

• 1K(預設)— 定價 $0.048,優惠價 $0.024。

• 1.5K — 定價 $0.07,優惠價 $0.035。

• 2K — 定價 $0.10,特價 $0.05。

• 4K — 定價 $0.607,優惠價 $0.3035。

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

參考圖片與提示詞長度都不另收費,而遭到拒絕、失敗或受審核的請求也不會計費——這點在這裡比平時更重要,因為 4K 呼叫很慢,而放棄請求的念頭確實很誘人。上線優惠價期間為 10 月 1 日 15:00 UTC 至 10 月 8 日 15:00 UTC。從 2K 到 4K 的定價跳升幅度為 6.07 倍,遠比像素數量比例陡峭,因此你選擇的解析度等級是整個 API 中最主要的成本決策。

這些等級追蹤的是像素預算,而非固定影格。BFL 的範例輸出為 5456 × 3072,約 1680 萬像素,對比 UHD 2160p 的 830 萬像素——所以這裡的「4K」指的是預算,而輸出尺寸會四捨五入至 16 的倍數,實際數字則以 output_mp 回傳。

Bernini 的價格是每張圖片零元、每小時非零元。用於序列平行推論的八張 GPU,建議採用 Hopper 等級的晶片,Python 3.11.2 搭配 PyTorch 2.7.1 與 CUDA 12.6。相對於 1K 解析度下每張 0.048 美元,損益兩平點會落在每月數千張圖片的某處,完全取決於你為運算支付多少費用——而這是真實的數字,不是修辞性的說法。如果你已經在運行推論基礎設施,Bernini 的邊際圖片成本幾乎為零。如果你沒有,FLUX 3 Image 端點會比架設兩階段的擴散堆疊便宜得多。

路由:這兩者都不在我們的目錄中

值得直說,因為這類說法很快就會過時。OrcaRouter 並不路由 FLUX 3 Image,也不路由 Bernini-Diffusers-v2。呼叫 FLUX 3 Image,就是直接呼叫 Black Forest Labs 自家的端點。呼叫 Bernini,則代表你得自行部署。

在像這樣的管線中,OpenAI 相容路由器真正的用途,是處理影像呼叫前後的所有環節。圖說生成或提示改寫的階段、用視覺模型對照需求簡報檢查渲染結果、用影片模型讓已核准的靜態畫面動起來、用小型文字模型將輸出分類——在這些步驟中,只要能改一個字串、用同一把金鑰就更換供應商,並且在某一方效能降級時讓請求自動故障轉移,就能省下相當可觀的維護工作。OrcaRouter 以供應商定價直接轉供,不加收任何加成,因此當廠商調降費率時,變更當天就會生效,而不必等經銷商重新定價;路由 DSL 也讓你能固定使用特定模型,或定義備援順序,而不必更動應用程式碼。這些都無法讓 FLUX 3 Image 變得可路由。這只表示管線其餘部分不必在意那張靜態畫面是由哪個模型產生的。

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

該以哪一個為基礎

三個問題能清楚地將這些區分開來,而它們並沒有共同的答案。

你需要控制東西要放在哪裡嗎? FLUX 3 Image 是兩者中唯一具備座標語言的,而其以方框為範圍的編輯操作——保留、移動、新增、移除——與文字指令編輯是真正截然不同的介面。如果你的工作是合成、版面配置或產品影像,且其中各區域必須保留下來,這點就是決定性的,而「通常會保持相同」這種模糊說法,是你該實際測試、而非直接假設的事。

在你投入之前,需要先知道它有多好嗎?Bernini 有數據,全都由廠商自行提報,而且走向不一。FLUX 3 Image 則完全沒有。如果你無法自行進行評估,你就是在一個有實測數據的模型和一個沒有實測數據的模型之間做選擇,而那個有實測數據的,是較舊的架構。

你能操作兩階段擴散堆疊嗎? 這才是 Bernini 的真正門檻。一個 Qwen2.5-VL-7B 規劃器饋入 Wan2.2-T2V-A14B 解碼器,在 Hopper GPU 上運行,並帶有一個指向 OpenAI 相容端點的提示增強器鉤子。授權條款很寬鬆,但運算帳單可不寬鬆。如果你做不到,這個問題就沒有意義,而答案就是每張圖 0.048 美元。

最能迅速改變這一頁的,就是 BFL 開放 FLUX 3 Image 的權重,而該公司表示這還要幾週。那會讓授權上的不對稱從決定性轉為輕微,並讓控制介面的差異成為真正的比較重點。在那之前,準確的總結是:這是兩個好模型,卻有著相反的發佈模式,而選擇早在品質之前,就已取決於授權與控制。