為 Qwen-Image-2.1 對比 Hy Image3.5 的文章所生成的 hero 卡片,主標題為 Qwen-Image-2.1 vs Hy Image3.5,副標題為各家排行榜的排名正好相反,標籤寫著「編輯:Hy Image3.5 以 1,088 比 1,074 領先」與「文字生圖:Qwen-Image-2.1 以 1,034 比 975 領先」,頁尾則為「兩款模型皆由 Artificial Analysis 評分,2026 年 9 月」,並將 OrcaRouter 標誌合成於右下角
Guides & Insights

Qwen-Image-2.1 與 Hy Image3.5:各家獨立排行榜的排名正好相反

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把Qwen-Image-2.1與Hy Image3.5放在兩個 Artificial Analysis 圖像排行榜上正面對決,結果兩個排行榜對哪一款更好卻各執一詞。在文生圖方面,Qwen-Image-2.1 領先 Hy Image3.5 整整 59 Elo——1,034 對 975,排名第 18 對第 66。在圖像編輯方面,同樣這兩款模型卻互換了位置:Hy Image3.5以 1,088 Elo 位居第 14 名,Qwen-Image-2.1則以 1,074 排在第 18 名。差距反過來是 14 分。這兩款模型相隔兩天公開亮相——Qwen-Image-2.1 於 2026 年 9 月 20 日以開放權重發布,Hy Image3.5 於 2026 年 9 月 22 日進入公開預覽——而這也是兩者首次在同一套評測工具上取得分數,正因如此,這項分歧才值得細讀,而不是只照著數字報導。

顯而易見的做法是說編輯板很吵,然後繼續前進。這只對了一半。另一半是,這兩列並不是同樣紮實,其中一列的價格不是另一列的價格,而且這些模型中有一個擁有權重的權利,另一個則永遠不會有。

兩個看板,兩筆訂單

Artificial Analysis 進行盲測成對比較——將同一個提示詞交給兩個模型,由投票者選出勝者,Elo 隨之累積——並為每個任務發布各自的排行榜。文字轉圖像排行榜有 166 列;圖像編輯排行榜有 97 列。兩個模型的這兩列都來自同一供應商的快照,因此這不是版本不符。

• 文字轉圖像 — Qwen-Image-2.1 以 1,034 Elo(區間 1,024 至 1,044),基於 5,286 次比較,在 166 個項目中排名第 18。Hy Image3.5 以 975 Elo(區間 966 至 984),基於 5,334 次比較,在 166 個項目中排名第 66。這兩個區間並未重疊。在規模相近的樣本上出現 59 分的差距,是真實的排序,而非四捨五入造成的假象。

• 圖像編輯 — Hy Image3.5 以 1,088 Elo (區間 1,079 至 1,097) 在 5,550 次比較中,於 97 個中排名第 14。Qwen-Image-2.1 以 1,074 Elo (區間 1,065 至 1,083) 在 5,536 次比較中,於 97 個中排名第 18。這些區間在 1,079 至 1,083 的四點範圍內重疊。此排序僅具方向性,尚未確立。

• 兩個排行榜上的樣本數都很接近——文字轉圖像為 5,286 對 5,334,編輯為 5,536 對 5,550——因此,信心差異並非某個模型票數偏少所造成的。

• 排行榜對這些模型的標示方式不同,而這點很重要:Qwen-Image-2.1 的列帶有 Open Weights 標記,Hy Image3.5 的列則沒有。

所以誠實的解讀是不對稱的。文生圖:Qwen-Image-2.1 明顯勝出。編輯:Hy Image3.5 大概領先,但領先幅度落在量測雜訊之內。

不對稱從何而來

Hy Image3.5 的編輯實力並不令人意外,只要看看騰訊為它配備了什麼就明白了。這款預覽版公開發布時,每次請求最多支援五張參考圖、在同一個模型中同時提供文生圖與圖生圖,以及多輪編輯——編輯這個面向在發表時就獲得了重點強調。Qwen-Image-2.1 則以統一的生成與編輯架構打造,同樣能處理參考圖,但其排行榜上的列顯示,編輯方面的成績比阿里巴巴自家的 Qwen-Image-3.0-Pro 低了兩個 Elo,這個結果比發表時的說法所暗示的還要狹窄。

騰訊自己的說法,也不是排行榜所顯示的內容。這家廠商引述預覽版在盲測中對上 Hy Image3.0 約有 30% 的勝率。這個數字從未在騰訊以外被任何人重現,而獨立排行榜在文生圖方面也無法佐證——Hy Image3.5 預覽版以 975 分低於開放權重的 HunyuanImage 3.0 Instruct 的 995 分,差距 20 Elo。在編輯方面,同樣的比較則對廠商有利:Hy Image3.5 預覽版以 1,088 分,高出 HunyuanImage 3.0 Instruct 的 1,066 分 22 Elo。騰訊自家的世代更迭,在一個排行榜上進步了一代,在另一個上卻退了一步。

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

價格軸,兩者在這裡完全無法相提並論

Hy Image3.5 preview 是計量付費的 API。騰訊雲在中國大陸節點對一張 2K 圖片收費 ¥0.15,國際節點則為 US$0.024,且僅就 API 實際回傳的圖片計費。Artificial Analysis 的價格欄位記錄的是每 1,000 張圖片 $24.00,換算成該排行榜所用單位後數字相同——而對照文生圖排行榜榜首在同一千張圖片上所列的 $210.70,這個價格不到它的九分之一。

Qwen-Image-2.1 沒有價格列,因為它沒有端點。它的兩列榜單資料都帶有明確的無可用 API註記。你買不到這個模型;你是下載它,而以 GPU 時數以及下方的授權問題來付出代價。它那幾列上的 5,286 票與 5,536 票,來自自行執行權重的人。這個事實也為排名帶來一項值得保留的但書:針對僅限自架的模型所做的獨立 Elo,衡量的是與任何人都能呼叫的模型之 Elo 不同的一群母體。

如果計畫是要把這兩者之一放進產品裡,實務上的取捨現在已經很清楚了,而這正是價格所暗示的同一種取捨:編輯分數較好的那個模型,是你租來用的那一個;文字生圖分數較好的那個模型,則是你自己跑的那一個。OrcaRouter 就是這件事裡「租用」的那一端——一個 API 涵蓋 200 多個模型,供應商標價原樣轉嫁、零加成,跨供應商自動容錯移轉,還有一套路由 DSL,能把多個模型組合成一次呼叫。我們並未將 Hy Image3.5 preview 或 Qwen-Image-2.1 納入路由;平台上圖片相關的產品線是 Google 的 Imagen 各級方案與 Gemini 圖片預覽、xAI 的 Grok Imagine 圖片端點,以及 OpenAI 的 GPT-Image 系列。單憑排行榜上的一列成績,這兩者都不會是那份清單中的首選,而這正是為什麼下面那個授權問題才是決定性的關鍵。

這個軸,兩塊板都沒有對應的欄位。

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1 係依據《Qwen 研究授權協議》(日期為 2026 年 9 月 20 日)發布,該協議僅授予非商業用途之權利,商業使用須向供應商另行取得授權。基於此原因,Hugging Face 的儲存庫將授權標示為其他——它並非 OSI 授權,亦不應被解讀為 OSI 授權。兩列表格上的「開放權重」標記準確無誤,且對此並未傳達任何訊息。

Hy Image3.5 預覽版沒有可供授權的權重。Tencent 尚未發布這些權重;此預覽版由 Tencent 自家平台提供服務,而且這一代並沒有可下載的版本。你得到的是一份價目表、參考圖片限制,以及一項可隨時啟用與停用的服務。沒有東西可稽核,沒有東西可託管,沒有東西可協商——而且如果 Tencent 調整價格或終止此預覽版,你也什麼都留不住。

真正能解決開放權重這個問題的比較對象,是騰訊自家的前代模型,而不是 Qwen 的模型。HunyuanImage 3.0 Instruct在兩個排行榜上都帶有開放權重標記——編輯項目 1,066 分,文生圖 995 分。Qwen-Image-2.1 在兩項上都勝過它。因此,如果需求是「可下載、能在自己硬體上執行的權重」,這場對決中最佳選擇是阿里巴巴的模型,無論看哪個排行榜皆然,而且其授權條款仍禁止販售產出結果。

這件事沒有任何版本能讓紙上作業自行解決。你可以選擇編輯分數較好,但沒有權重、採按用量計費;或者選擇文字轉圖像分數較好,但權重可能不得商業化。挑一個你能接受的限制,然後用你自己的提示詞去把兩者都測一遍——它們之間的編輯差距在重疊區間內有四點寬,而這種差距正是單一組留出提示就能抹掉的邊際。