適用於 Grok Imagine Image 2.0 對決 Flux 3 的英雄標題卡,文案為「Grok Imagine Image 2.0 對決 Flux 3」,副標題為「一個已於 Arena 即時排名第 2。另一個仍在路上。」並搭配一幅扁平插圖:一個畫框一分為二,一半是完成編輯的成品,一半是未完成的草稿線稿,旁附一個小型 VS 徽章。
Guides & Insights

Grok Imagine Image 2.0 對比 Flux 3:已發布的編輯器 vs 多模態的承諾

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這是一場正面對決,但實際上只有一方可以被呼叫使用;這個標題最誠實的版本,就是這場比較本身。Grok Imagine Image 2.0xAI 以編輯為優先的影像模型,於 2026 年 8 月 7 日隨 Grok 應用程式推出——同週它進入公開的 Text-to-Image Arena,以 Elo 1,320(初步成績)位居第二,僅次於 GPT Image 2 的 1,380。Flux 3,Black Forest Labs 於 7 月 23 日發表的統一多模態基礎模型,以同一組權重同時訓練影像、影片、音訊與機器人動作預測——但其影像層級至今(8 月 8 日)仍沒有公開端點、沒有定價、也沒有釋出任何示範。一個是今天下午就能呼叫使用的模型;另一個則是自 7 月底以來眾人矚目、卻至今無人能執行的影像版本。這種不對稱就是整個故事的重點,也決定了什麼才算是一場公平的比較。

Two-column comparison scoreboard for Grok Imagine Image 2.0 and Flux 3: availability 'live now, Aug 7 2026' vs 'announced, not shipped'; Text-to-Image Arena '#2, Elo 1,320 (preliminary)' vs 'no ranking yet'; editing 'Magic Wand + segmentation, shipped' vs 'promised across styles & ratios'; in-image text 'designer-planned typography' vs 'multilingual text promised'; price '$0.02-$0.05 per image' vs 'unpriced'; API 'open; 2.0 model ID unconfirmed' vs 'no endpoint yet'. Footer reads 'Grok figures per arena.ai + xAI docs; Flux 3 status per BFL docs, August 2026.'

計分板

就這組配對實際取決的面向而言,以下是雙方目前的態勢。Grok Imagine Image 2.0 的數據來自公開的 Arena 排行榜與 xAI 自身的文件;Flux 3 的影像狀態則依 Black Forest Labs 7 月 23 日的公告及現行 BFL 文件為準,而 Flux 3 方面每一項路線圖宣稱皆為廠商自行回報,在端點實際存在之前均未經驗證。

• 可用性 — Grok Imagine Image 2.0 自 8 月 7 日起已在 G​rok 應用程式(網頁、iOS、Android)上線,相較之下 Flux 3 影像層級雖於 7 月 23 日宣布,至今仍未推出。

• Text-to-Image Arena — Grok Imagine Image 2.0 以 Elo 1,320 位居第 2,標記為初步結果,列於公開排行榜;而 Flux 3 image 則無排名且未入榜。

• 編輯 — Grok Imagine Image 2.0 搭載 Magic Wand、分割、背景移除與多參考輸入功能;而 Flux 3 影像則承諾「跨風格與長寬比」的編輯能力,但尚未釋出示範。

• 圖片內文字 — Grok Imagine Image 2.0 宣稱提供設計師規劃的字體排版與更清晰的小字,而 Flux 3 影像則承諾在圖片內呈現多語言文字。

• 價格 — Grok Imagine Image 2.0 在 xAI 的 API 上每張影像 $0.02–$0.05,而 Flux 3 影像則未定價;目前僅影片層級($0.06–$0.54/秒)收費。

• API — Grok Imagine Image 2.0 開發者 API 已開放,但 Image 2.0 模型 ID 尚未確認;而 Flux 3 影像則不存在任何端點。

為什麼這場對決不能只是一場普通的槍戰?

一般的影像模型比較,會把相同的提示詞送到兩個端點,再比對輸出結果的差異。但你無法在這裡這樣做,因為這裡只有一個端點。Grok Imagine Image 2.0 可透過 xAI 自家的應用程式與開發者 API 呼叫——開發者 API 自三月推出基礎影像模型時起就已上線,而 Image 2.0 專用的 API 模型 ID 尚未確認,這點對任何打算圍繞它進行規劃的人來說都很重要。Flux 3 影像目前無法在任何地方呼叫:BFL 自家的文件目前只顯示{{1}}「影片與同步音訊,現已上線」,{{/1}}並附註說明{{2}}「更多模態會以相同的請求格式陸續推出」。{{/2}}因此,這場誠實的正面對決,比的是雙方各自已推出什麼、承諾了什麼,以及你今天能在此基礎上開發什麼。這是真正的比較;只是並非基準測試。

Screenshot of Black Forest Labs' FLUX 3 documentation as of August 2026, showing the heading 'FLUX 3 — one model, multiple modalities,' the line that FLUX 3 generates video with synchronized audio and that more modalities ship on the same request shape as they land, specs of up to 20 seconds at FHD 24 fps, and a left navigation that still lists FLUX.2 Image Editing and FLUX.2 Text to Image under image tools.

Image 2.0 的領先之處在於其編輯工具集。

Grok Imagine Image 2.0 將編輯功能作為首要功能推出,而非事後補充。Magic Wand 僅編輯您選取的區域,其餘畫面保持不變;分割功能可讓您重新著色或替換精確區域,精細至單一物件的材質;背景移除可將主體匯出至透明畫布,以便在其他地方重複使用;多參考輸入在單次生成中最多接受五張影像,因此合成多個主體無需手動剪貼。Smart Resize 可在九種長寬比之間重新構圖,從 1:2 的高型橫幅到 2:1 的寬型橫幅,在尺寸變更時自動填滿畫面。它專門針對攝影、平面設計和插畫進行訓練,並隨附預建的產品拍攝、人像照、電商商品頁、遊戲素材和行銷海報範本——其定位直接瞄準可交付成果的商業工作流程。

Flux 3 的影像方案,根據 BFL 的發布資料,承諾提供「跨風格與長寬比」的編輯功能,以及一個同時處理靜態影像與動態影像的單一模型。目前沒有已發布的示範、沒有範例圖庫,也沒有可供測試的端點。在編輯這個層面上,目前還差得遠:一個是已出貨且可衡量的,另一個只是路線圖上的宣稱。

兩者都在追逐同一個弱點:圖片中的文字

{{1}}影像中清晰可讀的文字是影像生成領域最棘手的未解問題,而兩家廠商恰好都在同一兩週內瞄準了它。{{/1}} {{2}}{{KEEP}}x​AI{{/KEEP}} 表示,Grok Imagine Image 2.0 計畫以「設計師的方式」規劃版面與排版,在密集圖形中呈現更清晰的小字,並減少亂碼的文字、標誌與標籤。{{/2}} {{3}}BFL 針對 Flux 3 影像層級公布的改進內容,包括「影像內的多語言文字渲染」——這是對同一失敗模式的直接回應,也是七月公告中少數具體的宣稱之一。{{/3}} {{4}}這兩項能力都尚未經過獨立基準測試,目前皆屬廠商宣稱。實際差別在於,Image 2.0 的宣稱今天就能用你自己的提示詞來測試,而 Flux 3 則完全無法測試。{{/4}}

價格,當只有一方有價格時

Grok Imagine Image 2.0 在 xAI 的 API 上按張計費:grok-imagine-image 每張 0.02 美元,grok-imagine-image-quality 每張 0.05 美元,速率限制為每秒 5 個請求,而編輯功能會同時針對輸入圖片與產出的圖片收費。在消費端應用程式中,它位於每月 30 美元的 SuperGrok 訂閱方案之後,免費方案已於今年稍早移除——這正是為什麼對任何以此為基礎進行開發的人來說,價格錨點是 API 而非應用程式。

Screenshot of xAI's official grok-imagine-image model documentation showing the pricing card at $0.02 per generated image, the note that you are charged for each image generated and also when an image is used as input, the alias grok-imagine-image-2026-03-02 for the March 2026 base model, and a 5 requests-per-second rate limit.

Flux 3 的圖片層級沒有價格,因為它沒有端點。BFL 唯一公佈的數字是影片層級的定價——草稿每秒 0.06 美元、HD 每秒 0.17 美元、FHD 每秒 0.29 美元(適用於文字轉影片和圖片轉影片),而影片轉影片則大約是兩倍價格——這至少表明 BFL 正將 Flux 3 系列定位於市場的高階區間。當圖片層級推出時,單張圖片價格若遠高於 x​AI 的 0.02 美元底價,並不令人意外,但這僅是推論,而非事實;準確的說法是,BFL 根本沒有公佈任何圖片定價。

Flux 3 帶來了哪些 Image 2.0 做不到的功能?

Flux 3 的立論基礎從來不在於當今的靜態影像。BFL 針對影像、影片、音訊與機器人動作訓練了同一組權重,因此所謂的「影像模型」,正是日後用來生成同步語音與特效、將提供的關鍵影格動畫化成 20 秒片段,以及——從更長遠的布局來看——預測機器人行為的同一模型。如果你的工作流程需要主體的身分從一張靜態照片延續到動態作品,或者希望以單一請求形式涵蓋所有模態,那麼像 Grok Imagine Image 2.0 這種純粹處理靜態影像與編輯的產品,並未下注在這樣的架構之上。

抗衡點在於,Grok Imagine Image 2.0 是貨真價實的產品,今天在 Arena 上已有實際排名——即便尚屬初步;而 Flux 3 影像則仍只是個承諾,其同級產品早已上市:FLUX 3 Video 已於 8 月 4 日至 5 日正式推出,影像版則仍停留在「未來數週內」。多模態雄心並非終點。

該由誰來選擇哪一個

如果你本季需要生產級影像編輯——背景去除、區域編輯、多重參照合成——Grok Imagine Image 2.0 是兩者中唯一你實際上能採用的,而且它每張影像 $0.02–$0.05 的價格,讓你系統性地測試自己的提示詞,成本低到直接跑就行。如果你正在規劃一條從單一模型涵蓋靜態影像、動態影像與音訊的管線,而且你等得起,Flux 3 image 是更有意思的賭注——但那是個尚未出貨的賭注,除了「未來幾週」之外沒有承諾的日期,也沒有價格。

兩個模型目前都不在 OrcaRouter 上:x​AI 透過自家應用程式和開發者 API 分發 Image 2.0,BFL 則透過自家 API 提供,兩者皆尚未登上第三方主機。等它們上線後,這兩個模型都值得透過單一路由層來運行——針對你自己的提示詞進行逐張圖像的 A/B 測試、在任一模型尚未成熟時自動容錯移轉至經過驗證的生成器,以及 0% 加價轉傳,讓你看到的價格表就是供應商的列表價格,任何折扣都會在當日入帳。如此一來,你既能採用一個剛推出兩天的模型,也能採用一個尚未發佈的模型,而不必把生產路徑押注在任一個上。

最重要的是

Grok Imagine Image 2.0 與 Flux 3 目前稱不上是一場勢均力敵的競賽,因為這根本不是一場競賽——只有一位競爭者在賽道上。Image 2.0 以每張圖片的價格推出了一套功能完善的編輯工具組,其 Arena 排名真實但屬初步性質,編輯排名則由 xAI 引用,並非獨立驗證。Flux 3 的影像功能是更具野心的架構,尚未出貨,沒有價格,也沒有展示。如果你現在就需要生成圖片,選擇不言自明。如果你押注的是影像生成的未來方向,請留意 Flux 3 的影像層級——並在終點存在之前,將所有路線圖宣稱視為未經證實。