
Grok Imagine Image 2.0:在 Artificial Analysis 排名第 4,價格僅需三分之一
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Imagine Image 2.0 已在 Artificial Analysis 的文字轉圖像排行榜上登上第 4 名,而真正重要的數字不是名次——而是緊接在它旁邊的那個價格。該模型以 1,153.66 Elo 位居其後,落後於三個項目:GPT Image 2.5 Flare(max)、GPT Image 2.5 Sunburst(max)與 GPT Image 2(high)。它領先其他所有實驗室的模型,包括微軟的 MAI-Image-2.6 與 Nano Banana 2 模型。這使得該模型成為那三人組之外排名最高的圖像生成器,而且以相當大的差距成為前四名中最便宜的一款:Artificial Analysis 將其定價為每 1,000 張圖像 60 美元,而排在它前面的三個項目則約為 211 美元。這個模型本身出自 2026 年 8 月 7 日——改變的是這個獨立排行榜把它放在哪裡,以及這對製造商在發表時所使用的「世界第二」說法造成了什麼影響。
#4 版位實際衡量的究竟是什麼
Artificial Analysis 的 Text to Image Leaderboard 是一個盲測的人類偏好競技場:投票者會看到相同提示詞的輸出,但沒有模型標籤,並從中選出較好的一個,而所得的 Elo 分數會獨立於任何廠商公布。Grok Imagine Image 2.0 的條目顯示第 4 名,Elo 為 1,153.66,95% 信賴區間為 1,141.66 至 1,165.66。這個數字完全不是來自 xAI。(當你查看排行榜時,有一個值得知道的小細節:Artificial Analysis 將該模型的創作者列為 SpaceXAI。)
故事中關於價格的那一半,是更有趣的一半。同一頁把品質對價格作圖,並以 Pareto 線標出每美元能換回最多 Elo 的模型;而根據該排行榜自己公布的數據,Grok Imagine Image 2.0 是每 1,000 張圖片定價低於 $100 的模型中得分最高者。在品質上比它更高的下一個模型 GPT Image 2 (high),每 1,000 張要價 $211——價格大約是它的三倍半,換來多約 17 Elo。這是關於價格效能的主張,而不是關於它是最佳模型的主張;而這正是獨立資料實際支持的故事版本。
前沿地位確實存在,但領先幅度不大,而這點值得直說。微軟的 MAI-Image-2.6 排名低一位,價格為每 1,000 張 38.90 美元;Meta 的 Muse Image 則是每 1,000 張 10 美元,Elo 為 1,111。這個排行榜上的 Elo 區間約為 ±12 分,因此第 4 名和第 5 名——相差 6.5 Elo——落在彼此的誤差範圍內。請把這個名次視為「前五名」,而不是已成定局的席次。
這 14 名的攀升,正是與 Grok Imagine Image 2.0 所取代的層級之間的差距。xAI 先前的品質層級 grok-imagine-image-quality,在同一排行榜上以 1,043.21 Elo 位居第 18 名,而最初的 grok-imagine-image 則以 1,017.86 排在第 29 名。這表示 xAI 現在列為其影像預設的模型,與它所取代的模型之間,大約相差 110 Elo 與 14 個排名名次。
「世界第二」的說法目前狀況如何
在發布時,xAI 引用了在文字轉圖像與圖像編輯 Arena 排行榜上均名列第 2 的成績,Elo 約為 1,320,並標註為「初步」(Preliminary)。這些數字是 xAI 在自己的公告中強調的——並非其委託的獨立評估——而且之後已經變動:8 月 10 日的快照顯示該模型以 1,316 Elo 位居第 3,落後於 MAI-Image-2.6 與 GPT Image 2。圖像編輯項目第 2 名的說法,仍僅是 xAI 自己的引用。
Artificial Analysis 是一個不同的排行榜,採用不同的方法,以及不同的投票者群體,它現在將該模型排在 #4。這兩者實際上並不矛盾——它們以不同方式取樣人類偏好,而且兩者都是每週變動的排行榜的快照。對六週獨立排名的誠實總結是,Grok Imagine Image 2.0 始終位列前五,但從未完全達到 xAI 所宣佈的 #2。
Grok Imagine Image 2.0 實際推出的內容是什麼
xAI 將 Grok Imagine Image 2.0 定位為一套編輯環境,而非另一款一次性的生成器。其功能組合如下:
• Magic Wand — 區域級編輯,不影響畫面其餘部分
• 分割 — 精確的區域選擇,可用於色彩分級、替換或調整
• 背景移除 — 匯出透明背景主體
• 多圖輸入 — 每次編輯最多可使用五張來源圖片;xAI 的文件現在列出五張,高於 API 推出時上限的三張
• Smart Resize — 將一張影像重新構圖為 9 種長寬比(從 1:2 直立到 2:1 橫幅),創造新的畫面內容而非裁切
• 模板 — 適用於產品攝影、人像照、電商商品頁、遊戲素材與行銷海報的預設工作流程
API 提供了消費者應用程式未揭露的控制項:長寬比——包括 21:9 與 5:2,兩者皆為 2.0 新增——解析度(預設 1K,可選 2K),以及可取低、中或自動的品質參數。在消費者端,該模型是 grok.com/imagine、iOS 與 Android 上的預設 Quality Mode,且自 8 月 13 日起也已在 Runway 平台上架,加入 Runway 既有的圖像與影片模型行列。該上架資訊屬於供應商與合作夥伴的聲明,而非獨立評估,但它是發布後第三方散布的首個跡象。
在標題文字渲染方面,xAI 表示該模型「會像設計師一樣規劃排版與佈局」,能夠完整保留密集的多部分編排,並清晰渲染小字體文字。它還能在多輪迭代編輯中保持主體的身分與設定不變。
首次獨立測試發現了什麼
一項以六個提示、單一種子、不挑選結果的方式與 gpt-image-2 進行的比較,發現了明顯的分歧;而新的排行榜名次並未推翻這一點。
Grok 勝出:照片級真實感與身份保留。人像手部解剖結構正確,毛孔級皮膚細節、次表面散射、自然眼神光與輪廓光皆表現到位。在 45 度幾何旋轉任務中,Grok 將面部身份保持在 ArcFace 0.5 閾值以上,而 gpt-image-2 則偏移更大。
Grok 失敗:生產關鍵領域。要求簡體中文電影海報標題,卻輸出繁體中文字元——被稱為本地化與出版管線的「硬性不合格」。要求水彩風格融合,卻回傳近乎真實的影像,僅有輕微的繪畫質感處理——屬於「類別級不合格」。在地編輯完成所有三項請求,但未能保留窗景,且高光的錨點錯置。
摘要:Grok Imagine Image 2.0 在照片寫實度與身分一致性上領先,在編輯可靠性、多語言文字與真正的風格轉換上則落後。排行榜平均了數千次盲測比較的偏好;它無法告訴你該模型能否正確處理你的中文標題。六個提示詞的測試同樣也不算是一組證據——但在兩者之間,對一個正在交付在地化素材的團隊來說,那個具體的失敗是更具可操作性的訊號。
API 與定價計算
開發者方面的情況自推出以來已經改變。grok-imagine-image-2.0 現在是 xAI 為圖像生成、單圖編輯與多圖編輯所記錄的模型,也是 xAI 自家模型頁面針對圖像所推薦的模型。推出時期的「開發者 API 存取即將推出」字句,已從該供應商的模型與定價頁面上消失。
• grok-imagine-image-2.0:每張圖片 $0.04 起,依實際提供之品質計費
• grok-imagine-image (1.0):每張圖片 $0.02,不受下方變更影響
• grok-imagine-image-quality:每張圖片 $0.05,將於 2026 年 11 月 2 日停止服務
品質是控制成本的槓桿。Auto——省略參數時的預設值——目前生成時採用 low、編輯時採用 medium,因此生成請求以 low 費率計費,編輯則以 medium 費率計費。將費率固定為 low 或 medium,能讓帳單可預測,而不必取決於服務選擇哪條路徑。
最後那一點帶有一個截止期限。xAI 的遷移指南指出,grok-imagine-image-quality 這個 slug 將於 2026 年 11 月 2 日退場,此前自 9 月 2 日起有 60 天的通知期。自該日起,該 slug 仍會繼續解析,但請求會由 grok-imagine-image-2.0 提供服務,並將 quality 設為 low——這是相容性重新導向,而非硬性關閉。由於在每個解析度下,low 層級每張圖片都比舊的 quality 層級便宜 0.01 美元,因此完全不改動的團隊會看到價格下降,以及輸出品質的無聲變化。刻意遷移——明確指定 grok-imagine-image-2.0,並在輸出穩定性重要的地方固定 quality——才是你想要的做法。那個日期與重新導向行為均出自 xAI 自家的文件——由廠商所述,未經獨立測試。
相較於 OpenAI 的選項,這既是價格差異,也同樣是定價模式差異。gpt-image-2 採用以 token 計價的方式——依 OpenAI 公布的費率,每百萬個影像輸入 token 為 8 美元,每百萬個影像輸出 token 為 30 美元——因此每張影像的成本會隨解析度與細節而波動。Artificial Analysis 提出的代表性數字——GPT Image 2(high)每 1,000 張影像 211 美元,對比 Grok 的 60 美元——正是這種波動化為單一數字的體現。固定每張影像的定價在規模化時遠更容易預測,而這正是排名第四的模型之所以值得一看的主要原因。
在不押上整條 pipeline 的情況下試用它
對 Grok Imagine Image 2.0 的合理反應仍然是「先試用,還不要正式投入」。它的定位落在相互重疊的信賴區間內,一項獨立測試對其在地化文字與風格轉移標出了實際弱點,而 xAI 將在 11 月淘汰其底下的一個 slug。這正是應該採取路由,而非直接串接整合的情況。
在 OrcaRouter 上,grok-imagine-image —— xAI 在我們目錄中的影像模型 —— 與 gpt-image-2 位於同一個 OpenAI 相容端點上,因此在 xAI 與 OpenAI 影像模型之間切換只是變更模型字串:不需第二份合約,也不用新的 SDK。OrcaRouter 以不加價的方式直接轉嫁供應商的定價,因此廠商降價當天這裡就會生效,而自動容錯移轉可以將錯誤、速率限制或拒絕導向備援模型,而不是送進你的正式環境路徑。一個誠實的但書,與原始評論相同:xAI 最新的品質層級與我們目錄中既有的 Grok 影像模型是分開的項目,因此請檢查目前的模型清單,不要假設某個特定的 Grok 變體今天就能被路由。
接下來要看什麼
1. 11 月 2 日的遷移。團隊究竟是明確移轉到 grok-imagine-image-2.0,還是順著重新導向而落到其低品質的預設值,是 xAI 在這款模型上最可能出錯的一件大事——而除非你檢視回應中的模型欄位,否則這個重新導向會讓錯誤完全隱形。
2. 第 4 名是否守得住。與 MAI-Image-2.6 的差距為 6.5 Elo,區間為 ±12 點,因此再多幾千票就可能讓排行榜朝任一方向重新排序。相較前一層級的 110 Elo 提升看來相當穩固;確切排名則不然。
3. 消費者端介面有多少部分能觸及 API。生成、編輯與多圖編輯都已載入文件。範本與具名的 Smart Resize 工作流程仍屬應用程式本身的功能,而這個落差正是剩下那項「僅限消費者端」但書的所在。
結論:Grok Imagine Image 2.0 是一個真正、具備實力的模型,如今已在獨立評測中占有一席之地——在 Artificial Analysis 的文字轉圖像排行榜上排名第 4,是該榜上非 OpenAI 的最佳作品,Elo 分數比它所取代的層級高出約 110 分,並且位於該排行榜的價格品質前沿:每 1,000 張圖像 60 美元,相較之下,排名直接在其之上的 OpenAI 模型約為 211 美元。「世界第 2」的說法一直是 xAI 發布時的瞬間寫照,而獨立排行榜從未完全這麼說。它最明顯的兩項獨立弱點——簡體中文遵循度與風格轉移可靠性——正好落在團隊最常需要圖像 API 提供的功能上。若是寫實、保留身分特徵的工作,立即試用它;若是會輸出本地化文字或風格化資產的流程,則先等等;而如果你已經在呼叫即將退役的 quality slug,請在 11 月 2 日前遷移。
