為文章「Qwen-Image 2.1 vs FLUX 3」生成的主視覺卡片,呈現雙欄對決圖像,兩張圓角模型卡片之間有一個鎖頭圖示,卡片分別標示為「Qwen-Image 2.1」與「FLUX 3」,並有一條寫著「一個你能跑,卻不能賣;一個你能賣,卻不能跑」的緞帶。
Guides & Insights

Qwen-Image 2.1 對決 FLUX 3:兩款你無法真正派上用場的圖像模型

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen-Image 2.1FLUX 3是 2026 下半年最受矚目的兩款圖像發布,而兩者都無法直接投入使用。Qwen-Image 團隊於 2026 年 9 月 20 日開源的 Qwen-Image 2.1,是一款 70 億參數的統一生成與編輯模型,你今天下午就能下載,卻無法合法地用於商業產品。Black Forest Labs 於 2026 年 7 月 23 日發表的 FLUX 3,則是一款統一的多模態基礎模型,其圖像層級——也就是你真正會拿來比較的部分——在發表兩個月後,依然沒有公開端點、沒有模型 ID、沒有價格,也沒有基準測試數據。因此,這項比較並非「哪一款更好」,而是這兩道阻礙之中,你能繞過哪一道。

兩種不同的無法使用

很容易把這兩者都歸進「還沒準備好」這一類,然後就此打住。但這麼做會掩蓋唯一真正要緊的那個決定,因為這兩個卡點的形状恰好相反。

Qwen-Image 2.1 的阻礙是法律問題,而且它就藏在你下載任何東西之前就能讀到的一份檔案裡的一行文字。權重已放在 Hugging Face 和 ModelScope 上,模型卡也寫好了,推論程式碼已發布,而且四個不同的服務框架都在發布當日或之前合併了支援。技術上,沒有任何東西阻礙你讓模型跑起來。擋在你和正式推出它之間的,是日期標為 2026 年 9 月 20 日的 Qwen Research License Agreement;其權利授予條款允許「僅限非商業用途」的使用,並指示任何想要取得商業權利的人向供應商另行申請授權。

FLUX 3 的阻礙是物理性的。沒有可供呼叫的圖像端點,沒有可傳入的模型識別碼,也沒有可據以編列預算的價格卡。BFL 自家的定價頁面涵蓋 FLUX 3 Video 的各個方案層級,以及較舊的 FLUX.2 圖像產品線;它並未涵蓋 FLUX 3 圖像層級,因為根本沒有東西可以定價。取用該圖像模型是僅限申請,而非透過「開始使用」按鈕:BFL 自家的 FLUX 3 頁面將圖像層級列為「即將推出」,而帶有搶先體驗標籤的是 action 層級。

所以,其中一個是你今晚就能跑、卻不能賣的模型,另一個則是你賣得出去、卻跑不起來的模型。哪一個對你更有用,完全取決於你站在那句話的哪一邊——內部研究團隊和商業產品團隊,應該會從同樣這兩個事實得出相反的結論。

逐維度的解讀

狀態 — Qwen-Image 2.1 的權重、授權條款與模型卡已於 2026 年 9 月 20 日發布,廠商同日也刊出了部落格文章。FLUX 3 於 2026 年 7 月 23 日宣布;目前僅影片層級已出貨,並於 2026 年 8 月 4 日全面上市。

目前實際能呼叫的服務 — Qwen-Image 2.1 可透過 Diffusers、ComfyUI、vLLM-Omni、SGLang 與 LightX2V 在本機執行,也可透過供應商自家的 API 及數個第三方平台使用。FLUX 3 的圖像層級標示為「即將推出」,沒有可呼叫的端點,而其影片端點則已定價並正式推出。

架構 — Qwen-Image 2.1 是一款 32 層的單流 DiT,其視覺生成元件具備 7B 參數,搭配 Qwen3-VL 8B 文字編碼器,以及一個在 16× 空間壓縮下運作的 64 通道 RGBA VAE。FLUX 3 則是單一統一流模型,以圖像、影片與音訊聯合訓練而成,建構於 BFL 稱之為 Self-Flow 的自監督流匹配方法之上,並搭配與 Mimic Robotics 共同開發的動作預測層級。

原生透明 — Qwen-Image 2.1 可生成與編輯 RGBA 影像、編輯透明圖層內的文字,並能從 RGB 照片中擷取主體至透明圖層,同時納入阿里巴巴於 2025 年 12 月以 Qwen-Image-Layered 名義另行推出的能力。BFL 並未針對 FLUX 3 Image 發布任何透明度的相關宣告。

參考圖像 — Qwen-Image 2.1 最多可接受 10 個輸入參考,並可透過圈選、手繪標註或獨立遮罩進行局部編輯。FLUX 3 Image 目前尚無已公布的數據。

解析度——Qwen-Image 2.1 原生支援 2K,在 40 個推論步數下預設為 2048×2048,並提供七種有文件記載的長寬比預設。FLUX 3 Image 的解析度在公告中僅被描述為「廣泛」,並未公布任何具體資訊。

價格——兩者皆未公布價格。截稿時,Qwen-Image 2.1 並未列出託管費率;FLUX 3 Image 因為沒有端點,所以沒有價格卡。目前唯一存在的 FLUX 3 定價是影片,草稿每秒 $0.06、HD 每秒 $0.17、FHD 每秒 $0.29。

授權 — Qwen 研究授權協議,僅限非商業用途,商業使用須另行提出申請。FLUX 3 的圖像層級授權條款則完全尚未公布。

有一項不對稱值得獨立成行,因為它正是這場對比中的陷阱。FLUX 3 確實有已公布的基準測試數字——文字轉影片的內部 Elo 為 1,135,以及相對於 Grok Imagine Video、Seedance 2.0、Gemini Omni Flash、Runway Gen-4.5 與 Luma Ray 3.2 所回報的人類偏好勝率。這些數字所描述的,全都是影片層級。它們沒有一項能套用到圖像生成上,而 BFL 本身也未公布任何圖像基準測試或勝率。拿 FLUX 3 的影片 Elo 當作 FLUX 3 圖像品質的佐證,是這場比較中最容易犯下的錯誤。

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs FLUX 3 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Status: released 20 Sep 2026; Callable today: local, five frameworks; Architecture: 7B, 32-layer DiT; Transparency: native RGBA; Reference images: up to 10; Price: none published; Licence: research, non-commercial. Right column 'FLUX 3': rows reading Status: announced 23 Jul 2026; Callable today: video only; Architecture: unified flow model; Transparency: none claimed; Reference images: not published; Price: video $0.06-$0.29 per second; Licence: not published for image. Footer reads 'Qwen-Image 2.1 figures per the vendor model card, unaudited; FLUX 3 image tier has published no figures at all.'

每一方實際上能展示什麼

把證據並列對照,不對稱性就會與前一節相反。

FLUX 3 已有出貨、定價且正式上市的產品——只是不是本文標題所指的那個。FLUX 3 Video 可在單次生成中製作長達 20 秒、具同步音訊的短片,支援文字轉影片、圖像轉影片、影片轉影片、關鍵影格轉影片與生成式續接,且 Canva、Burda、Magnific、Krea 與 Picsart 已在測試中。那是一個真實、已部署的系統,並有真實的客戶名單。圖像層級才是尚未推出的部分,而 BFL 最初表示它會在「未來幾週內」跟進的指引,如今已過了整整兩個月,仍沒有公開端點。

Qwen-Image 2.1 的情況正好相反。它的品質宣稱來自供應商自家的 Qwen-Image-Bench 比較圖表,且沒有任何第三方重現過這些結果。但這個東西本身就在你手上:33 GB 的權重、一套 Apache 風格的儲存庫結構,附帶一份誠實表明僅供研究用途的授權檔案,以及橫跨五個框架、首日即可使用的推論服務路徑。另外還有一篇搶先體驗的實測評論,來自一位測試者,他透過 ModelScope Studio 介面執行最終權重,並回報文字生圖約需 10–15 秒、編輯則約需 18–23 秒,在相機預設與多角色角色指派方面表現強勁,而多參考一致性則在約三張輸入圖片之後開始劣化。只有一位評論者、沒有計時器、沒有公開的提示集。方向上有參考價值,但尚未經正式驗證。

對證據的誠實總結:Qwen-Image 2.1 有一個可執行的模型,卻沒有獨立的品質資料;FLUX 3 Image 有廠商宣稱,卻既沒有可執行的模型,也完全沒有任何影像資料。如果你的問題是「我該以這兩者中的哪一個來規劃管線」,那麼今天的答案是兩者皆非,而且原因各不相同。

A screenshot of the Black Forest Labs FLUX 3 model page, captured September 20 2026, showing the FLUX 3 family overview with the Video tier marked as generally available and the Image tier listed as coming soon, alongside the FLUX 3 Video per-second pricing tiers.

因應措施實際上在哪裡

對商業團隊而言,Qwen-Image 2.1 的阻礙有著可讓你事先規劃因應的輪廓。授權條款明確,商業授權的聯絡人也在儲存庫中具名列出,而模型夠小——生成元件為 7B——因此在自家硬體上評估它的成本,是以一個下午而非一季來衡量。先評估,再談判,並在此期間讓研究版建置避開任何面向客戶的路徑。這是正常的採購問題。

FLUX 3 Image 的卡關問題並不是採購問題,因為根本沒有東西可採購。你可以加入早期存取候補名單,也可以留意端點何時出現,這就是所有能採取的行動。如果你今天就需要在正式環境中使用 FLUX 系列的影像生成,可呼叫的選項是較舊的 FLUX.2 與 FLUX Pro/Dev 系列,這些已有定價且可供使用,而且它們與本文所談的模型屬於不同世代。

對於想同時測試兩個候選項目、又不願讓其中任何一個進入正式生產路徑的團隊來說,這正是路由層存在的意義。OrcaRouter 將 200 多個模型置於單一與 OpenAI 相容的端點之後,以供應商定價提供、零加成,並具備跨供應商的自動容錯移轉,因此一個未經證實或尚未發布的模型,可以與你已經信任的模型並列於同一條路由之後,而非取而代之——而且由於定價是直接透傳的,被路由模型若有任何供應商價格變動,當天就會生效。截至撰稿時,Qwen-Image 2.1 與 FLUX 3 Image 都無法透過路由使用,我們也不打算佯裝不是如此;我們實際路由的是圍繞它們的圖像產品線,包括 OpenAIGPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。這些才是能在這兩者釐清自身狀況期間承載工作負載的模型。

還有一件在 Qwen 這邊特別值得關注的事。阿里巴巴先以 Apache-2.0 開放權重推出 Qwen-Image 1.0 和 2.0,接著在 2026 年 7 月推出 Qwen-Image 3.0,作為完全封閉的託管模型,沒有權重、沒有授權條款,也沒有技術報告,然後在 9 月以僅限研究用途的授權條款開放權重推出 Qwen-Image 2.1。其發展方向並非直線,而下一次發布的授權條款確實是個未解的問題,而不是無論朝哪個方向都能安全做出的假設。

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

判決,不過如此

如果你是一名研究人員或內部評估團隊,Qwen-Image 2.1 是目前兩者中更有用的那個,而且領先幅度很大——它可下載、有文件、受框架支援,並且對其條款坦誠。如果你是一個商業團隊,兩者都受到阻礙,但這些阻礙並不等同:一個是你可以開始洽談的合約,另一個則是尚未存在的產品。

如果你必須在這個月就推出圖像生成功能,這兩者都不是答案;真正有用的問題是,你呼叫的模型中,哪一個最接近你的需求。那是一項基準測試練習,值得用你自己的提示詞來做,而不是用任何人的發布圖表——包括廠商的,也包括這一份。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新