
FLUX 3 Image 與 FLUX 3:兩個名稱,兩款產品,相隔九週
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
自 2026 年 10 月 1 日起,「FLUX 3」代表了兩種不同的事物,而第二種含義才是附有價目表的那一個。FLUX 3 Image是當天上線的圖像層級,位於api.bfl.ai/v1/flux-3-image,按每張圖片計費,起價 $0.041。FLUX 3則是它所屬的更大整體——Black Forest Labs 於 2026 年 7 月 23 日發表的統一多模態模型,此後分階段推出,其中影片與機器人動作頭是已在正式環境中運作的部分。這不是旗艦與其較小同類產品之間的比較。這是整個家族與其三個運作部分之一之間的比較。
這種區別很容易被忽略,而 BFL 自家的命名方式也幫不上忙:家族頁面、影片文件、授權條款和 API 參考資料,都在一些其實指涉更狹義事物的段落裡寫著 FLUX 3。如果你讀過一份 FLUX 3 規格表,卻仍不確定它描述的是圖像模型、影片模型,還是一項研究計畫,那並不是你粗心。這兩個名稱都仍在活躍使用中,用來指涉同一發行版本中相互重疊的子集。
兩個重要的日期
• 2026年7月23日 — FLUX 3 以 Early Access 名義宣布推出。單一 Self-Flow 架構橫跨圖像、影片與音訊生成,以及動作預測。算力揭露才是耐人尋味的部分:超過 95% 的訓練算力用於影片,而分配給音訊的 token 不到 0.5%。
• 2026 年 10 月 1 日——圖像層級以計量端點的形式開放。這使得從公告到大多數人以為「FLUX 3」所指的模態真正到來之間,留下大約十週的差距。
解讀那樣的算力分配,就能看出 Black Forest Labs 認為真正的難題是什麼。一個把幾乎所有訓練預算都花在影片上的模型家族,並不是在為靜態圖像做最佳化,再把動態視為附加延伸。情況正好相反,而圖像層級繼承了影片優先訓練所產出的一切。

每個層級是什麼,以及費用是多少
七月宣布的四種模態中,已有三種推出。圖像層級是最新的,也是唯一像傳統付費 API 那樣運作的。
• FLUX 3 Image — 只要一次 POST、一個 x-key 標頭,就會回傳一個可輪詢的 URL。依解析度級距按每張圖片計價:768 平方為 $0.041,1K(預設值)為 $0.048,1.5K 為 $0.07,2K 為 $0.10,4K 為 $0.607。上市優惠 5 折,持續至 10 月 8 日 15:00 UTC。參考圖像與提示詞長度皆已計入;失敗及遭審核擋下的請求不會計費。每張參考圖像須介於 256×256 像素至 1600 萬像素之間,最多可接受十張。
• FLUX 3 Video — 已正式推出,並按秒計費而非按圖片計費。文字轉影片與圖片轉影片的價格為 Draft HD 每秒 $0.06、HD 每秒 $0.17、FHD 每秒 $0.29、QHD 每秒 $0.40、UHD 每秒 $0.80,而影片轉影片的價格整體更高。片段長度可達 20 秒,並具備原生同步音訊,模式包括關鍵影格轉影片與續接。Draft 模式僅支援 HD。QHD 與 UHD 輸出已於 2026 年 9 月 10 日推出。
• FLUX 3 Action——一個 7B 的世界動作模型,也是 FLUX 3 中唯一你能下載參數的部分。2026 年 9 月 22 日,Hugging Face 上出現了三個檢查點:一個基礎檢查點、一個 SO-101 機械臂變體,以及一個 DROID 變體。存取權限採合作夥伴限定而非開放,並以機器人操作作為展示用途。
• 尚未推出的內容—— FLUX 3 開放權重主幹模型。BFL 的自架設層級仍僅涵蓋 FLUX.2 [klein] 與 FLUX.2 [dev]。就圖像層級而言,商業權重需經協商授權取得,而公開開放權重則據稱還需數週才會推出。
沒有人做的成本比較

每張圖片與每秒的定價看似無從比較,這正是值得算一次的原因。
標準 HD 文字轉影片五秒為 $0.85。UHD 五秒為 $4.00。圖像層級的單張 4K 靜態影像定價為 $0.607,或在首發期間內為 $0.3035——而雖然圖像層級的「4K」指的是像素預算而非固定畫面(BFL 的範例輸出為 5456 × 3072,約 16.8 百萬像素,對比 UHD 2160p 的 8.3),它與影片層級按秒計費所移動的解析度屬於同一個數量級。
結果是,產生一個 UHD 關鍵影格的成本,只是產生一秒 UHD 影片的一小部分,而關鍵影格正是你在反覆迭代時會不斷產生的東西。如果你的流程是「先把畫面弄對,再讓它動起來」,那麼圖像層級就是便宜的那一半,差距超過一個數量級,而且它也是問世時間最短的那一半。
圖像端有一個影片端沒有的注意事項。一次 4K 圖像呼叫可能需要數分鐘,而回傳的樣本可在一小時內下載。緩慢且可在一小時內取回,與影片工作相比是截然不同的運作形態,而這正是決定批次管線是否需要佇列的那種細節。
邊界框會以這兩個名稱中的其中一個存在
控制介面並未在各層級之間共用,而這是名稱與系列之間最鮮明的實務差異。
圖像層會接收附加在提示詞後的 JSON 陣列,兩個軸上的座標皆採用 0–1000 的網格,而每個方框寫成 [上, 左, 下, 右]。你傳入一張元素表,其中每個元素帶有 id、一個 bbox 和一個 desc,以及一個會引用這些 id 的全域說明文字——BFL 的範例使用像 animal_1。同一套座標系統也用於驅動編輯:保留某個區域、移動某個區域、在目標方框中生成一個新區域,或移除來源方框。多個操作可放在單一請求中,並以 ref_image_0 命名參考清單中的第一個項目。文件表示,編輯方框之外的像素「通常會保持不變」——這是個值得照字面解讀的模糊說法。
在圖像層級中,Grounding 預設為開啟:生成前會先執行網頁與圖像搜尋。輸出尺寸會四捨五入至 16 的倍數,而實際數值會回報為output_mp。
這些都不會出現在影片層級的參數中。FLUX 3 Video 有自己的一套控制方式——關鍵影格、續接、首尾影格條件控制——但沒有座標語言。這些部分共享的是架構,而不是介面。
仔細閱讀供應商的比較
Black Forest Labs 發佈了 FLUX 3 Video 的偏好結果,這些結果值得引用並附上其來源出處。這些測試由廠商執行、屬初步性質,並以 10 秒 720p 輸出的勝率計分:
• 對比 Luma Ray 3.2 — 有 93% 偏好 FLUX 3 Video。
• 對比 Runway Gen-4.5 — 77%。
• 對比 Grok Imagine Video — 69%。
• Kling v3 Pro — 60%。
• 相較於 Happy Horse v1 與 v1.1—— 59% 與 57%。
• 對上 Seedance 2.0 與 Gemini Omni Flash——兩者各約 52%,即使數字高於一半,實質上仍屬統計上的平手。
那份清單中從 93% 到 52% 的分布範圍,比任何單一列都更具資訊量。BFL 以外沒有人做過這些比較,而底部那些低於 55% 的結果,才真正告訴你這個模型在哪些地方確實受到挑戰。
FLUX 3 Image 完全沒有對應的數字。Artificial Analysis 的文字轉圖像與編輯排行榜曾於 2026 年 10 月 1 日查核,並於 10 月 2 日再次查核,兩者都沒有列出 FLUX 3 Image。BFL 公布的分數仍止於 FLUX.2 系列:FLUX.2 [max] 在生成排行榜上為 1021 Elo,在編輯排行榜上為 996,而 FLUX.2 [dev] 則在兩者上固定為 1000 的基準。這個圖像層級才推出一天,尚未經過測量。
![Screenshot of the Artificial Analysis text-to-image leaderboard captured October 2, 2026, listing FLUX.2 [max], FLUX.2 [flex] and FLUX.2 [dev] as the 1000-point anchor, with no FLUX 3 Image row present](https://cms.orcarouter.ai/api/media/file/4-1496.png)
在這些名稱之間做選擇
這個選擇與其說關乎哪個模型更優,不如說關乎你的問題落在三個已推出層級中的哪一層。
如果你需要具備空間控制能力的靜態影像,FLUX 3 Image 是唯一具備座標語言的層級,而且在 1K 解析度下每張影像只要 $0.048,便宜到足以好好評估,而不是為此爭論。就從那裡開始,在你自己的畫面上測試「通常會保持完全相同」的說法,並在調整批次大小時,留意 2K 到 4K 的價目躍升 6.07×。
如果你需要動態影像,FLUX 3 Video 是成熟的計量制產品,解析度等級最高達 UHD,並能生成 20 秒、附帶同步音訊的片段。請將它與它旨在取代的模型互相比較,而不是與圖像等級相比——兩者並非彼此的替代方案。
如果你需要權重,目前的答案是在合作夥伴協議下使用 FLUX 3 Action,否則就是 FLUX.2。影片與圖像層級皆無法下載,而圖像層級的開放發布是已表明的意向,但沒有日期。
FLUX 3 與 FLUX 3 Image 都不在 OrcaRouter 的型錄上,因此要呼叫其中任何一個,都得直接找 Black Forest Labs。在以這個模型家族為核心打造的流程中,供應商中立的路由器真正帶來的價值,在於生成呼叫周邊的那一層:提示詞改寫的處理、拿渲染結果與需求簡報比對的視覺檢查,以及把輸出分類為接受與拒絕兩類的分類器。這些步驟的變動頻率遠高於圖像模型本身,而在單一 OpenAI 相容端點背後更換供應商——搭配 未加價、原價傳遞的供應商定價、後端效能劣化時自動容錯移轉,以及 當你想刻意鎖定或退回特定供應商時可用的路由 DSL——正是「能緊跟市場的流程」與「每次有模型被淘汰就得重新部署的流程」之間的差別。
最誠實的結語是:這是一套命名慣例。當有人說 FLUX 3,並遞給你一張價目表時,他們指的是圖像端點。當他們說出同樣的名字,卻遞給你一份關於音訊 token 分配的規格表時,他們指的是七月的公告。這兩份文件之間的落差是九週與三個已推出的層級,而且還在持續擴大。
