
Qwen-Image 2.1 vs Meta Muse Image:你能呼叫的模型 vs 你能留存的模型
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
這個比較有一個版本是關於影像品質的,而且它現在還寫不出來——無法誠實地寫出來。Qwen-Image 2.1由 Qwen-Image 團隊於 2026 年 9 月 20 日發布,至今沒有任何一種獨立評分。Meta Muse Image則是 Meta Superintelligence Labs 於 2026 年 7 月 7 日推出、Meta 首個自研的影像模型,它已被實測——在 Artificial Analysis 的影像編輯排行榜上名列第三,Elo 約為 1,105,在文字生成影像項目中位居前五,並以每千張影像 10 美元的價格落在品質與價格的帕雷托前沿上。但關於這兩者,更有用的問題並不是哪一個更好,而是你被允許用它們各自做什麼,而這兩個答案幾乎完全相反。
存取與可檢驗性是兩回事,而且沒有人同時提供兩者
Meta Muse Image 就是你可以呼叫的模型。自 2026 年 8 月起,它可以透過 Meta 自家的 Model API,在一個與 OpenAI 相容的端點上,以每張圖片 0.01 美元的固定費率(約每千張 10 美元)存取,這與該模型在 7 月推出時的描述相比是一個真正的改變——當時完全沒有開發者途徑可以使用它。這種固定費率在一個幾乎所有其他服務都按 token 計費的類別中並不尋常,而且它讓成本預測變得輕而易舉:一千張圖片就是十美元,無論它們是簡單還是複雜。
Qwen-Image 2.1 是你可以保留的那一款。它是一個權重下載檔——在擴散 Transformer、文字編碼器與 VAE 之間總計約 33 GB——依 2026 年 9 月 20 日的 Qwen Research License Agreement 發布,該協議授予的權利「僅限非商業用途」,且商業使用須另行取得授權。沒有託管端點。沒有固定費率。也沒有任何隱藏內容:你可以閱讀架構、閱讀用於改寫提示詞的系統提示、對它進行差異比對、覆寫它,並在自己的硬體上執行整套系統。
所以,這不是品質與品質之間的取捨。這是拿一個按用量計費、受衡量、商業授權、而你並不擁有的模型,去對上一個免費、不受衡量、非商業、而你完全擁有的模型。很少有團隊能站在其中任何一邊,而不放棄某些東西。
為什麼 Muse 不完全是通常意義上的擴散模型
Meta Muse Image 與眾不同之處在於,它不只是生成。它會執行一個循環:能搜尋網路、撰寫並執行程式碼,並在回傳影像前檢視自己的輸出。這是 Meta 自己的描述,也是這個模型之所以有趣、而不只是具有競爭力的原因——代理式步驟正是在這裡化解提示詞的模糊之處,也是在這裡,像「幫我做一張今年數據的圖表」這樣的請求,能夠被真正回答,而不只是近似處理。
這也是它的行為更難推斷的原因。傳統圖像模型是從提示到像素的函數。具備代理能力的模型則有一條軌跡,而這條軌跡並非你能從模型卡上讀到的東西。廠商回報的數字——94% 的多圖角色一致性、最多 10 張參考圖、輸出長邊最高 1600 像素——描述的是範圍,而非迴圈。
Qwen-Image 2.1 以相反的方式解決同樣的模糊性問題:明確地,且公開地。除了影像模型之外,這次發布還附帶了兩個提示改寫檢查點——Qwen/Qwen-Image-2.1-PE-T2I 和 Qwen/Qwen-Image-2.1-PE-I2I,各自是微調過的 Qwen3.5-VL 9B,約 18.8 GB——它們會接收模糊的指令,並在擴散模型看到之前將其改寫成精確的指示。I2I 變體一定會有輸入影像,因此它永遠是編輯任務。而關鍵在於,改寫器的行為規範於隨儲存庫附上的system_prompt.txt中,這表示決定你的提示代表什麼意思的那個步驟,是你讀得到、也改得動的東西。
Meta 的代理迴圈與阿里巴巴的提示詞改寫器,都是對「模型並不知道你的意思」這個問題的解答。一個是替你作決定的服務,另一個則是你可以直接編輯的檔案。
當只有一邊有數字時,數字看起來會是什麼樣子
Meta Muse Image 同時登上 Artificial Analysis 的兩份影像排行榜。它在影像編輯項目排名第三,Elo 約 1,105,落後於 Elo 1,122 的 MAI-Image-2.6 與 1,117 的 GPT Image 2(high);在文生圖項目則以約 Elo 1,116 擠進前五名。以每千張圖片 10 美元的價位來說,它位於品質與價格的帕雷托前沿上,而這正是最實用的位置:它不是榜上最強的模型,卻是少數幾個多花錢就能換到可量測效益的模型之一。
Qwen-Image 2.1 完全沒有這些。它有的是一篇廠商部落格文章,內含一張 Qwen-Image-Bench 圖表,而沒有任何第三方重現過;還有一份實測報告——Qwen Ambassador 計畫中一位早期試用測試者,透過 ModelScope Studio 介面執行最終權重,回報文字轉圖像約需 10–15 秒、編輯約需 18–23 秒,且多參考一致性從大約三張輸入圖像起開始劣化。只有一位評測者,沒有計時器,也沒有提示集。這是有用的訊號,但並非基準測試;誠實看待它的方式,是把它當作模型可能達到什麼水準的提示,而不是它目前實際水準的證據。
Qwen-Image 2.1 真正具體領先之處不在於品質,而在於像素層級的能力:預設即原生 2K 輸出、2048×2048、40 個推論步驟、七種長寬比預設、最多 10 張參考圖片、透過圈選、塗繪標註或獨立遮罩進行局部編輯,以及支援透明圖層編輯與從 RGB 照片擷取主體的 RGBA 生成。Meta 的模型上限為 1600 像素,且其透明功能的相關說明並未公開。如果你需要開箱即用的真正 alpha 通道,那這個決定已經替你做好了。

固定費率才是值得思考的部分。
每張圖片一律收一分錢是定價決策,不是技術決策,而且它改變了模型的用途。按 Token 計量的圖片定價會懲罰複雜度:附帶數張參考圖片的長指令,成本會高於簡短指令,這表示圖片的成本與其生成難度綁在一起。在固定費率下,這種綁定就消失了,理性行為也隨之改變——你不再為了長度而最佳化提示詞,而是開始以模型原本被設計的方式來使用它,讓代理式迴圈和參考圖片各司其職。
這也是只有提供自家模型服務的公司才能給出的定價類型,在選擇供應商時值得特別一提。OrcaRouter 以供應商定價、零加成,將 200 多個模型置於單一 OpenAI 相容端點之後,並具備跨供應商的自動容錯移轉,以及能將多個模型組合成單次呼叫的路由 DSL。這裡的關鍵特性是直通:因為我們收取的是供應商定價,而非加價後的價格,供應商的定價變更——例如出現固定費率、token 費率調降——會在我們這邊當天生效,而不必等待合約。Meta Muse Image 和 Qwen-Image 2.1 目前都不在我們路由的模型之列,本文也不會暗示並非如此;我們確實有提供的圖像模型包括 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各層級與 Gemini 圖像預覽版,以及 xAI 的 Grok Imagine 圖像端點。
這個比較中真正重要的對比在於,這兩個模型之中有一個竟然是有價格的。Meta Muse Image 每張圖片收費 $0.01,價格公開,而且放在一個你今天下午就能呼叫的 API 上。Qwen-Image 2.1 的代價則是下載 33 GB、一台你已經擁有的 GPU,以及對一份寫著「僅限非商業用途」的授權條款進行法律審查。
它們意外地交會之處
兩個模型都接受最多 10 張參考圖像。這與其說是巧合,不如說是整個產業逐漸敲定的一個答案:十張足以涵蓋角色設定圖、產品組圖或風格參考包,而超過這個數量後,條件控制就不再有所幫助,反而開始互相衝突。Meta 為旗下模型公布了 94% 的多圖角色一致性數據;阿里巴巴則未公布對等數據,而唯一一份獨立實測報告顯示,一致性大約在第三張參考圖像左右開始下滑。兩個模型宣稱相同的規格範圍,背後支撐的證據卻天差地遠,這正是整場比較的縮影。
它們也同樣收斂到一個雙方都尚未解決的問題:兩者都無法讓你兩者兼得。Meta Muse Image 無法下載、無法檢視,也無法在你自己的硬體上執行,而且它的代理式迴圈在本質上就是黑箱。Qwen-Image 2.1 無法販售、無法呼叫,也還無法拿來與任何東西進行評比。如果你的限制是截止期限,其中一個今天就能用。如果你的限制是合規審查,或需要確切了解你的管線到底在做什麼,那就是另一個。


依你接下來必須做的事來選擇,而不是依哪個比較好。
如果你需要在這一季以商業授權推出影像生成功能,而且背後要有個可量測的模型,Meta Muse Image 就是答案,而每張影像 0.01 美元是個你能編進預算的數字。如果你需要從頭到尾徹底理解一個影像模型——注意力遮罩、提示改寫器、VAE、授權條款——Qwen-Image 2.1 是這兩者中唯一能讓你辦到的,而它只要採用研究授權,就無法用於其他任何用途。這兩種選擇都不是在品質上妥協,因為品質這個問題在其中一方仍未有定論。當足夠多的人在公開場合執行 Qwen-Image 2.1,把它送上排行榜,這個問題就會有答案,而早期試用者被要求在 9 月 29 日前公布結果。那一天,才是這項比較真正成立的日子。
