
Qwen-Image-2.1 對比 Grok Imagine Image 2.0:免費權重對抗付費環境
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
這兩者之中,一個每張圖片不花你一毛錢,但附帶的授權禁止轉售成品。另一個則依你購買的通路不同,每張圖片要價二到六美分,沒有這類限制,而且在你可以實際查得到的排行榜上都榜上有名。Qwen-Image-2.1於 2026 年 9 月 20 日以研究授權的開放權重形式公開發布。Grok Imagine Image 2.0則是該廠商的付費圖像端點,透過自家 API 及多家第三方供應商散布。兩者之間的取捨不在於品質,而在於你想擁有模型本身,還是租用圍繞著它的整套環境——而這套環境實際承擔的工作,比價格標籤所暗示的還要多。
一張圖片在各邊的成本是多少
Qwen-Image-2.1 的價格是每張圖片為零,而一次性費用則不為零。你需要下載大約 33 GB——一個 7B、32 層的單流擴散 Transformer 約佔 14 GB,再加上佔去其餘大部分空間的 Qwen3-VL 8B 文字編碼器——而在那之後,一張圖片的邊際成本就是運行它所耗的電力。在效能受限的顯示卡上,模型卡建議透過 pipe.enable_model_cpu_offload() 進行 CPU 卸載,這是標準的變通做法,代價是速度而非金錢。
Grok Imagine Image 2.0 的價格則是相反的情況。xAI 自家的文件將這款旗艦模型列為每張輸出影像 0.04 美元,基礎的 Grok Imagine 影像端點為 0.02 美元,品質等級則為 0.05 美元。第三方供應商也落在相近的區間,並各自有其分級方式——有一家列出文字轉影像一律 0.05 美元、編輯一律 0.06 美元,不論解析度或品質設定為何;另一家則表示其品質等級在 1K 與 2K 下皆為均一價 0.045 美元;還有一家標榜文字轉影像或參考編輯為 0.025 美元,可接受最多五張輸入影像。整體市場大致落在每張影像 0.02 至 0.06 美元之間,而消費者端的取用則綁定在 X Premium 與 SuperGrok 之中,而非按張計費。
• 成本模型 — Qwen-Image-2.1 是固定的硬體與下載成本,每張圖片的邊際成本為零;Grok Imagine Image 2.0 則純粹是邊際成本,隨著用量永遠呈線性成長。
• 損益兩平點 — 交叉點是可以計算的用量問題,而且每當供應商調整費率時就會變動。在每月幾千張圖片時,託管路線遠比購買 GPU 便宜;在長期高用量下,本機路線在成本上勝出,卻在其他每個面向都落敗。
• 在本機端買不到的東西 — 速率限制、正常運作時間,以及別人的營運團隊。而在託管端買不到的,是模型權重。
排行榜說了什麼,以及它們沒說什麼
Grok Imagine Image 2.0 有公開的排名宣稱。xAI 的發表資料指出,截至 2026 年 8 月 7 日,它在 Text-to-Image 與 Image Edit Arena 兩個榜單的整體排名均位居第二,僅次於 GPT Image 2——這是廠商引用、帶有時間戳記的單一時間點快照,也應以此視之。在其後數週內,第三方追蹤機構則將其置於影像編輯約第二、文字生圖第三的位置,同樣落後於 GPT Image 2,Elo 分數落在 1,300 出頭,而某些追蹤網站回報的數字則更接近 1,173–1,175。這些數字之間的落差本身就是一堂課:這個類別的排行榜名次每週都在變動,而沒有附上日期的排名,算不上是資訊。
Qwen-Image-2.1 完全沒有任何排名。在撰寫本文時,它並未出現在任何獨立圖像排行榜上。它唯一的品質數據是廠商自家的 Qwen-Image-Bench 圖表,其中它顯示為 60.28,對比 Nano Banana 2.0 的 59.82 與 GPT Image 1.5 的 59.65——這是廠商資料,未經任何第三方重現。唯一真正獨立的數據點,是隨 SGLang 整合工作一併發佈的功能驗證:透明 PNG 輸出通過,alpha 在完整的 0–255 範圍內皆獲保留,而 RGBA PSNR 在單一樣本中測得 60.69 dB,作者明確將該樣本描述為正確性檢查,而非品質保證。
所以,誠實的計分板是:一個模型有會變動的公開排名,還附帶一項廠商宣稱;另一個則有廠商評分卡和一項通過的整合測試。那根本不是比較,而任何聲稱相反的文章,都沒有實際跑過這兩者。

Alpha,以及為何它是唯一的技術不對稱
Qwen-Image-2.1 的透明度是內建於模型之中的。具備 16× 空間壓縮的 64 通道 RGBA VAE 意味著 alpha 通道屬於被去噪的潛在空間的一部分,這讓你從單一機制獲得三件事:生成帶有透明度的影像、在已經具有透明度的影像內部進行編輯而無需先將其平面化,以及從一般 RGB 照片中擷取主體並傳回 alpha 而非硬式遮罩。不需要去背節點、不需要摳像模型、不需要邊緣清理——這是供應商的說法,而 SGLang 功能驗證是唯一獨立證據,證明該通道是真實存在而非名義上的。
Grok Imagine Image 2.0 沒有已記載的對等方案。其公開的功能範圍是文字生圖與以參考圖為基礎的編輯,並提供解析度與品質等級,部分供應商最多可接受五張輸入影像。如果你的素材需要一個去背主體,且要有乾淨的半透明邊緣——例如頭髮、玻璃、煙霧——你就是在 Grok 這邊多了一道去背(matting)步驟,而 Qwen 那邊則不用。這道步驟的成本是否高於另一邊的授權麻煩,才是真正的工程問題,而這取決於你的題材內容。
編輯環境與檢查點的對比
這兩套系統對於編輯智慧應該存在於何處看法不一。
Grok Imagine Image 2.0 把這件事放進服務裡處理。你送出一張參考圖片和一段指示,由供應商決定那是什麼意思,而解析度與品質等級則依每次請求來選擇。沒有東西要讀、沒有東西要調校,也沒有東西會壞掉——對於不想自己擁有 diffusers 管線的團隊來說,這是貨真價實的優勢。這也是為什麼名義上是同一個模型,價格卻會因供應商而異:你買的是一套環境,而不只是權重。
Qwen-Image-2.1 把它放在你能檢視的檢查點裡。除了影像模型之外,它還隨附兩個提示詞改寫模型——PE-T2I 與 PE-I2I,各自是微調過的 Qwen3.5-VL 9B、約 18.8 GB——改寫程式碼放在 prompt_rewrite/ 資料夾中,並附上一份 system_prompt.txt,其中明白寫出(除了其他事項之外)渲染文字的語言是如何選定的。這是任何託管式影像 API 都提供不了的檢視層級。但這也代表在模型之外還得多扛 37.6 GB 的改寫器,對於多數流程都會視為選用元件的部分而言,這是磁碟空間與載入時間上的真實成本。
• 編輯介面 — Qwen-Image-2.1 支援以圈選、塗繪標註或獨立遮罩進行局部編輯,另支援透明圖層編輯與主體擷取;Grok Imagine Image 2.0 有明文記載的編輯方式則是以參考影像驅動。
• 參考輸入 — Qwen-Image-2.1 最多接受 10 張參考影像,有一位搶先體驗的評測者回報,多參考一致性大約從三張影像起便開始下滑;數家 Grok 供應商則記載最多可輸入五張影像。
• 原生解析度 — Qwen-Image-2.1 原生以 2K 輸出,在 40 步、七種長寬比預設下,預設為 2048×2048;Grok Imagine Image 2.0 的解析度則是依供應商計價的逐次請求選項。
散布與授權條款
這正是兩者分歧最為劇烈之處,而這根本不是技術上的差異。
Grok Imagine Image 2.0 可透過 xAI 的 API,以及多家獨立的第三方供應商取得,這代表存在價格競爭,也就代表你支付的費率是市場行情價,而非定價表上的價格。無須下載、無須 GPU、沒有授權檔案要讀取,而且除了供應商自身的條款之外,商業使用並無任何限制。
Qwen-Image-2.1 只有一種取得方式:下載。它依 2026 年 9 月 20 日的《Qwen 研究授權協議》發布,該協議僅授予非商業用途的權利,並載明商業使用須另外向供應商申請授權。相較於更早的 Qwen-Image 系列採用 Apache 2.0 發布,這是一大緊縮,而正是這項事實決定了這兩者之間多數的實際抉擇。一間以輸出品質來比較兩者的工作室,問錯了問題;而一間無法將 Qwen-Image-2.1 用於客戶專案的工作室,根本不是在比較這兩者。
OrcaRouter 就是這套安排中租用那一側的所在。我們將200 多個模型路由到單一與 OpenAI 相容的端點之後,以供應商定價提供、零加成,並具備跨供應商的自動容錯移轉、路由 DSL 以及模型融合 —— 因此一條圖像路由可以指定主要與備援,而不必把賭注押在某一家供應商某個下午的表現上。我們有路由 xAI 的 Grok Imagine 圖像端點,但請注意版本:我們的目錄收錄的是 grok/grok-imagine-image,而不是 Grok Imagine Image 2.0,所以較新的模型我們目前無法為你提供。我們也沒有路由任何版本的 Qwen-Image 模型,因此 Qwen-Image-2.1 僅限本地端。我們確實有路由的圖像產品線是 OpenAI 的 GPT-Image 系列、Google 的 Imagen 4 各級版本與 Gemini 圖像預覽,以及那個較舊的 Grok Imagine 圖像端點;由於定價是直接轉嫁而非加成,其中任何一家廠商降價都會在同一天生效。

什麼會改變這個答案?
三件事,而這三件事都有可能在一季內發生。
• Qwen-Image-2.1 的商業授權。如果供應商以工作室願意支付的價格公布條款,那麼透明度優勢與零邊際成本兩者都能用於商業工作,而這項比較的面貌就會徹底改變。如今既沒有已公布的價格,也沒有載明的條款。
• Qwen-Image-2.1 的獨立基準測試。第三方若重現供應商的 Qwen-Image-Bench 數據,或將該模型放上公開的圖像評測排行榜,就會把僅存的最後一個未解問題——它實際上到底好不好——變成已有定論的事。
• Grok 陣營的價格動作。供應商競爭已經讓名義上相同的模型出現從 $0.02 到 $0.06 的價差。一次持久的降價,會讓代管路線在比目前更多的用量區間中成為預設選擇。
直到其中一項成真之前,決定勝負的既不是品質,也不是價格。而是:你是需要 alpha,而且能接受非商業授權——那麼你就把它下載下來,並以硬體付出代價;還是你需要出貨,並希望由別人來執行這個模型——那麼你就按每張影像付費,從此再也不必想到 VAE。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
