
Qwen-Image-2.1 與 Hy Image3.5:各家獨立排行榜的排名正好相反
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
把Qwen-Image-2.1與Hy Image3.5放在兩個 Artificial Analysis 圖像排行榜上正面對決,結果兩個排行榜對哪一款更好卻各執一詞。在文生圖方面,Qwen-Image-2.1 領先 Hy Image3.5 整整 59 Elo——1,034 對 975,排名第 18 對第 66。在圖像編輯方面,同樣這兩款模型卻互換了位置:Hy Image3.5以 1,088 Elo 位居第 14 名,Qwen-Image-2.1則以 1,074 排在第 18 名。差距反過來是 14 分。這兩款模型相隔兩天公開亮相——Qwen-Image-2.1 於 2026 年 9 月 20 日以開放權重發布,Hy Image3.5 於 2026 年 9 月 22 日進入公開預覽——而這也是兩者首次在同一套評測工具上取得分數,正因如此,這項分歧才值得細讀,而不是只照著數字報導。
顯而易見的做法是說編輯板很吵,然後繼續前進。這只對了一半。另一半是,這兩列並不是同樣紮實,其中一列的價格不是另一列的價格,而且這些模型中有一個擁有權重的權利,另一個則永遠不會有。
兩個看板,兩筆訂單
Artificial Analysis 進行盲測成對比較——將同一個提示詞交給兩個模型,由投票者選出勝者,Elo 隨之累積——並為每個任務發布各自的排行榜。文字轉圖像排行榜有 166 列;圖像編輯排行榜有 97 列。兩個模型的這兩列都來自同一供應商的快照,因此這不是版本不符。
• 文字轉圖像 — Qwen-Image-2.1 以 1,034 Elo(區間 1,024 至 1,044),基於 5,286 次比較,在 166 個項目中排名第 18。Hy Image3.5 以 975 Elo(區間 966 至 984),基於 5,334 次比較,在 166 個項目中排名第 66。這兩個區間並未重疊。在規模相近的樣本上出現 59 分的差距,是真實的排序,而非四捨五入造成的假象。
• 圖像編輯 — Hy Image3.5 以 1,088 Elo (區間 1,079 至 1,097) 在 5,550 次比較中,於 97 個中排名第 14。Qwen-Image-2.1 以 1,074 Elo (區間 1,065 至 1,083) 在 5,536 次比較中,於 97 個中排名第 18。這些區間在 1,079 至 1,083 的四點範圍內重疊。此排序僅具方向性,尚未確立。
• 兩個排行榜上的樣本數都很接近——文字轉圖像為 5,286 對 5,334,編輯為 5,536 對 5,550——因此,信心差異並非某個模型票數偏少所造成的。
• 排行榜對這些模型的標示方式不同,而這點很重要:Qwen-Image-2.1 的列帶有 Open Weights 標記,Hy Image3.5 的列則沒有。
所以誠實的解讀是不對稱的。文生圖:Qwen-Image-2.1 明顯勝出。編輯:Hy Image3.5 大概領先,但領先幅度落在量測雜訊之內。
不對稱從何而來
Hy Image3.5 的編輯實力並不令人意外,只要看看騰訊為它配備了什麼就明白了。這款預覽版公開發布時,每次請求最多支援五張參考圖、在同一個模型中同時提供文生圖與圖生圖,以及多輪編輯——編輯這個面向在發表時就獲得了重點強調。Qwen-Image-2.1 則以統一的生成與編輯架構打造,同樣能處理參考圖,但其排行榜上的列顯示,編輯方面的成績比阿里巴巴自家的 Qwen-Image-3.0-Pro 低了兩個 Elo,這個結果比發表時的說法所暗示的還要狹窄。
騰訊自己的說法,也不是排行榜所顯示的內容。這家廠商引述預覽版在盲測中對上 Hy Image3.0 約有 30% 的勝率。這個數字從未在騰訊以外被任何人重現,而獨立排行榜在文生圖方面也無法佐證——Hy Image3.5 預覽版以 975 分低於開放權重的 HunyuanImage 3.0 Instruct 的 995 分,差距 20 Elo。在編輯方面,同樣的比較則對廠商有利:Hy Image3.5 預覽版以 1,088 分,高出 HunyuanImage 3.0 Instruct 的 1,066 分 22 Elo。騰訊自家的世代更迭,在一個排行榜上進步了一代,在另一個上卻退了一步。

價格軸,兩者在這裡完全無法相提並論
Hy Image3.5 preview 是計量付費的 API。騰訊雲在中國大陸節點對一張 2K 圖片收費 ¥0.15,國際節點則為 US$0.024,且僅就 API 實際回傳的圖片計費。Artificial Analysis 的價格欄位記錄的是每 1,000 張圖片 $24.00,換算成該排行榜所用單位後數字相同——而對照文生圖排行榜榜首在同一千張圖片上所列的 $210.70,這個價格不到它的九分之一。
Qwen-Image-2.1 沒有價格列,因為它沒有端點。它的兩列榜單資料都帶有明確的無可用 API註記。你買不到這個模型;你是下載它,而以 GPU 時數以及下方的授權問題來付出代價。它那幾列上的 5,286 票與 5,536 票,來自自行執行權重的人。這個事實也為排名帶來一項值得保留的但書:針對僅限自架的模型所做的獨立 Elo,衡量的是與任何人都能呼叫的模型之 Elo 不同的一群母體。
如果計畫是要把這兩者之一放進產品裡,實務上的取捨現在已經很清楚了,而這正是價格所暗示的同一種取捨:編輯分數較好的那個模型,是你租來用的那一個;文字生圖分數較好的那個模型,則是你自己跑的那一個。OrcaRouter 就是這件事裡「租用」的那一端——一個 API 涵蓋 200 多個模型,供應商標價原樣轉嫁、零加成,跨供應商自動容錯移轉,還有一套路由 DSL,能把多個模型組合成一次呼叫。我們並未將 Hy Image3.5 preview 或 Qwen-Image-2.1 納入路由;平台上圖片相關的產品線是 Google 的 Imagen 各級方案與 Gemini 圖片預覽、xAI 的 Grok Imagine 圖片端點,以及 OpenAI 的 GPT-Image 系列。單憑排行榜上的一列成績,這兩者都不會是那份清單中的首選,而這正是為什麼下面那個授權問題才是決定性的關鍵。
這個軸,兩塊板都沒有對應的欄位。

Qwen-Image-2.1 係依據《Qwen 研究授權協議》(日期為 2026 年 9 月 20 日)發布,該協議僅授予非商業用途之權利,商業使用須向供應商另行取得授權。基於此原因,Hugging Face 的儲存庫將授權標示為其他——它並非 OSI 授權,亦不應被解讀為 OSI 授權。兩列表格上的「開放權重」標記準確無誤,且對此並未傳達任何訊息。
Hy Image3.5 預覽版沒有可供授權的權重。Tencent 尚未發布這些權重;此預覽版由 Tencent 自家平台提供服務,而且這一代並沒有可下載的版本。你得到的是一份價目表、參考圖片限制,以及一項可隨時啟用與停用的服務。沒有東西可稽核,沒有東西可託管,沒有東西可協商——而且如果 Tencent 調整價格或終止此預覽版,你也什麼都留不住。
真正能解決開放權重這個問題的比較對象,是騰訊自家的前代模型,而不是 Qwen 的模型。HunyuanImage 3.0 Instruct在兩個排行榜上都帶有開放權重標記——編輯項目 1,066 分,文生圖 995 分。Qwen-Image-2.1 在兩項上都勝過它。因此,如果需求是「可下載、能在自己硬體上執行的權重」,這場對決中最佳選擇是阿里巴巴的模型,無論看哪個排行榜皆然,而且其授權條款仍禁止販售產出結果。
這件事沒有任何版本能讓紙上作業自行解決。你可以選擇編輯分數較好,但沒有權重、採按用量計費;或者選擇文字轉圖像分數較好,但權重可能不得商業化。挑一個你能接受的限制,然後用你自己的提示詞去把兩者都測一遍——它們之間的編輯差距在重疊區間內有四點寬,而這種差距正是單一組留出提示就能抹掉的邊際。
