Qwen-Image 2.1(可依研究授權下載的開放權重)與 Meta Muse Image(可透過 Meta 自家 API 取用、每張圖片一律一美分的代理式模型)兩者比較的主視覺卡片
Guides & Insights

Qwen-Image 2.1 vs Meta Muse Image:你能呼叫的模型 vs 你能留存的模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這個比較有一個版本是關於影像品質的,而且它現在還寫不出來——無法誠實地寫出來。Qwen-Image 2.1由 Qwen-Image 團隊於 2026 年 9 月 20 日發布,至今沒有任何一種獨立評分。Meta Muse Image則是 Meta Superintelligence Labs 於 2026 年 7 月 7 日推出、Meta 首個自研的影像模型,它已被實測——在 Artificial Analysis 的影像編輯排行榜上名列第三,Elo 約為 1,105,在文字生成影像項目中位居前五,並以每千張影像 10 美元的價格落在品質與價格的帕雷托前沿上。但關於這兩者,更有用的問題並不是哪一個更好,而是你被允許用它們各自做什麼,而這兩個答案幾乎完全相反。

存取與可檢驗性是兩回事,而且沒有人同時提供兩者

Meta Muse Image 就是你可以呼叫的模型。自 2026 年 8 月起,它可以透過 Meta 自家的 Model API,在一個與 OpenAI 相容的端點上,以每張圖片 0.01 美元的固定費率(約每千張 10 美元)存取,這與該模型在 7 月推出時的描述相比是一個真正的改變——當時完全沒有開發者途徑可以使用它。這種固定費率在一個幾乎所有其他服務都按 token 計費的類別中並不尋常,而且它讓成本預測變得輕而易舉:一千張圖片就是十美元,無論它們是簡單還是複雜。

Qwen-Image 2.1 是你可以保留的那一款。它是一個權重下載檔——在擴散 Transformer、文字編碼器與 VAE 之間總計約 33 GB——依 2026 年 9 月 20 日的 Qwen Research License Agreement 發布,該協議授予的權利「僅限非商業用途」,且商業使用須另行取得授權。沒有託管端點。沒有固定費率。也沒有任何隱藏內容:你可以閱讀架構、閱讀用於改寫提示詞的系統提示、對它進行差異比對、覆寫它,並在自己的硬體上執行整套系統。

所以,這不是品質與品質之間的取捨。這是拿一個按用量計費、受衡量、商業授權、而你並不擁有的模型,去對上一個免費、不受衡量、非商業、而你完全擁有的模型。很少有團隊能站在其中任何一邊,而不放棄某些東西。

為什麼 Muse 不完全是通常意義上的擴散模型

Meta Muse Image 與眾不同之處在於,它不只是生成。它會執行一個循環:能搜尋網路、撰寫並執行程式碼,並在回傳影像前檢視自己的輸出。這是 Meta 自己的描述,也是這個模型之所以有趣、而不只是具有競爭力的原因——代理式步驟正是在這裡化解提示詞的模糊之處,也是在這裡,像「幫我做一張今年數據的圖表」這樣的請求,能夠被真正回答,而不只是近似處理。

這也是它的行為更難推斷的原因。傳統圖像模型是從提示到像素的函數。具備代理能力的模型則有一條軌跡,而這條軌跡並非你能從模型卡上讀到的東西。廠商回報的數字——94% 的多圖角色一致性、最多 10 張參考圖、輸出長邊最高 1600 像素——描述的是範圍,而非迴圈。

Qwen-Image 2.1 以相反的方式解決同樣的模糊性問題:明確地,且公開地。除了影像模型之外,這次發布還附帶了兩個提示改寫檢查點——Qwen/Qwen-Image-2.1-PE-T2IQwen/Qwen-Image-2.1-PE-I2I,各自是微調過的 Qwen3.5-VL 9B,約 18.8 GB——它們會接收模糊的指令,並在擴散模型看到之前將其改寫成精確的指示。I2I 變體一定會有輸入影像,因此它永遠是編輯任務。而關鍵在於,改寫器的行為規範於隨儲存庫附上的system_prompt.txt中,這表示決定你的提示代表什麼意思的那個步驟,是你讀得到、也改得動的東西。

Meta 的代理迴圈與阿里巴巴的提示詞改寫器,都是對「模型並不知道你的意思」這個問題的解答。一個是替你作決定的服務,另一個則是你可以直接編輯的檔案。

當只有一邊有數字時,數字看起來會是什麼樣子

Meta Muse Image 同時登上 Artificial Analysis 的兩份影像排行榜。它在影像編輯項目排名第三,Elo 約 1,105,落後於 Elo 1,122 的 MAI-Image-2.6 與 1,117 的 GPT Image 2(high);在文生圖項目則以約 Elo 1,116 擠進前五名。以每千張圖片 10 美元的價位來說,它位於品質與價格的帕雷托前沿上,而這正是最實用的位置:它不是榜上最強的模型,卻是少數幾個多花錢就能換到可量測效益的模型之一。

Qwen-Image 2.1 完全沒有這些。它有的是一篇廠商部落格文章,內含一張 Qwen-Image-Bench 圖表,而沒有任何第三方重現過;還有一份實測報告——Qwen Ambassador 計畫中一位早期試用測試者,透過 ModelScope Studio 介面執行最終權重,回報文字轉圖像約需 10–15 秒、編輯約需 18–23 秒,且多參考一致性從大約三張輸入圖像起開始劣化。只有一位評測者,沒有計時器,也沒有提示集。這是有用的訊號,但並非基準測試;誠實看待它的方式,是把它當作模型可能達到什麼水準的提示,而不是它目前實際水準的證據。

Qwen-Image 2.1 真正具體領先之處不在於品質,而在於像素層級的能力:預設即原生 2K 輸出、2048×2048、40 個推論步驟、七種長寬比預設、最多 10 張參考圖片、透過圈選、塗繪標註或獨立遮罩進行局部編輯,以及支援透明圖層編輯與從 RGB 照片擷取主體的 RGBA 生成。Meta 的模型上限為 1600 像素,且其透明功能的相關說明並未公開。如果你需要開箱即用的真正 alpha 通道,那這個決定已經替你做好了。

Two-column scoreboard for Qwen-Image 2.1 and Meta Muse Image: Qwen-Image 2.1 rows read Access open weights download, self-host / Licence research-only, non-commercial / Editing score none / Output 2048x2048 native with RGBA / Prompt handling inspectable rewrite checkpoint / Price your own GPU time; Meta Muse Image rows read Access Meta Model API, OpenAI-compatible / Licence commercial, via Meta / Editing score AA #3, Elo about 1,105 / Output up to 1600px / Prompt handling agentic loop, searches and self-reviews / Price flat $0.01 per image; footer reads 'Meta figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

固定費率才是值得思考的部分。

每張圖片一律收一分錢是定價決策,不是技術決策,而且它改變了模型的用途。按 Token 計量的圖片定價會懲罰複雜度:附帶數張參考圖片的長指令,成本會高於簡短指令,這表示圖片的成本與其生成難度綁在一起。在固定費率下,這種綁定就消失了,理性行為也隨之改變——你不再為了長度而最佳化提示詞,而是開始以模型原本被設計的方式來使用它,讓代理式迴圈和參考圖片各司其職。

這也是只有提供自家模型服務的公司才能給出的定價類型,在選擇供應商時值得特別一提。OrcaRouter 以供應商定價、零加成,將 200 多個模型置於單一 OpenAI 相容端點之後,並具備跨供應商的自動容錯移轉,以及能將多個模型組合成單次呼叫的路由 DSL。這裡的關鍵特性是直通:因為我們收取的是供應商定價,而非加價後的價格,供應商的定價變更——例如出現固定費率、token 費率調降——會在我們這邊當天生效,而不必等待合約。Meta Muse Image 和 Qwen-Image 2.1 目前都不在我們路由的模型之列,本文也不會暗示並非如此;我們確實有提供的圖像模型包括 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各層級與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。

這個比較中真正重要的對比在於,這兩個模型之中有一個竟然是有價格的。Meta Muse Image 每張圖片收費 $0.01,價格公開,而且放在一個你今天下午就能呼叫的 API 上。Qwen-Image 2.1 的代價則是下載 33 GB、一台你已經擁有的 GPU,以及對一份寫著「僅限非商業用途」的授權條款進行法律審查。

它們意外地交會之處

兩個模型都接受最多 10 張參考圖像。這與其說是巧合,不如說是整個產業逐漸敲定的一個答案:十張足以涵蓋角色設定圖、產品組圖或風格參考包,而超過這個數量後,條件控制就不再有所幫助,反而開始互相衝突。Meta 為旗下模型公布了 94% 的多圖角色一致性數據;阿里巴巴則未公布對等數據,而唯一一份獨立實測報告顯示,一致性大約在第三張參考圖像左右開始下滑。兩個模型宣稱相同的規格範圍,背後支撐的證據卻天差地遠,這正是整場比較的縮影。

它們也同樣收斂到一個雙方都尚未解決的問題:兩者都無法讓你兩者兼得。Meta Muse Image 無法下載、無法檢視,也無法在你自己的硬體上執行,而且它的代理式迴圈在本質上就是黑箱。Qwen-Image 2.1 無法販售、無法呼叫,也還無法拿來與任何東西進行評比。如果你的限制是截止期限,其中一個今天就能用。如果你的限制是合規審查,或需要確切了解你的管線到底在做什麼,那就是另一個。

Screenshot of the Artificial Analysis image-editing leaderboard captured September 9 2026, showing Meta Muse Image ranked third at Elo 1,105 behind MAI-Image-2.6 and GPT Image 2 (high), listed at $10.0 per 1,000 images on the quality-versus-price Pareto frontier, with no Qwen-Image 2.1 entry on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

依你接下來必須做的事來選擇,而不是依哪個比較好。

如果你需要在這一季以商業授權推出影像生成功能,而且背後要有個可量測的模型,Meta Muse Image 就是答案,而每張影像 0.01 美元是個你能編進預算的數字。如果你需要從頭到尾徹底理解一個影像模型——注意力遮罩、提示改寫器、VAE、授權條款——Qwen-Image 2.1 是這兩者中唯一能讓你辦到的,而它只要採用研究授權,就無法用於其他任何用途。這兩種選擇都不是在品質上妥協,因為品質這個問題在其中一方仍未有定論。當足夠多的人在公開場合執行 Qwen-Image 2.1,把它送上排行榜,這個問題就會有答案,而早期試用者被要求在 9 月 29 日前公布結果。那一天,才是這項比較真正成立的日子。