Grok Imagine Image 2.0 与 Flux 3 的主视觉标题卡,标题显示为 'Grok Imagine Image 2.0 vs Flux 3',副标题为 '一款已上线,在 Arena 上排名第 2;另一款仍在路上。',并配有一幅扁平化插画:一个相框,一半是完成后的成品,一半是未完成的线稿,旁边有一个小小的 VS 徽章。
Guides & Insights

Grok Imagine Image 2.0 对比 Flux 3:已发布的编辑器 vs 多模态的承诺

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这是一场只有一方真正可调用的正面对决,而这个标题最诚实的版本,就是这场对比本身。Grok Imagine Image 2.0xAI 编辑优先的图像模型,于 2026 年 8 月 7 日在 Grok 应用中上线——同周它进入公开的 Text-to-Image Arena,以 Elo 1,320(初步)位列第二,仅次于 GPT Image 2 的 1,380。Flux 3,Black Forest Labs 于 7 月 23 日发布的统一多模态基础模型,用同一套权重训练图像、视频、音频和机器人动作预测——但截至今天(8 月 8 日),其图像层级仍没有公开端点、没有定价,也没有发布演示。一个模型今天下午就能调用;另一个则是自 7 月底以来所有人都在紧盯、却至今无人能运行的图像发布。这种不对称性就是整件事的核心,也决定了怎样才算一场公平对比。

Two-column comparison scoreboard for Grok Imagine Image 2.0 and Flux 3: availability 'live now, Aug 7 2026' vs 'announced, not shipped'; Text-to-Image Arena '#2, Elo 1,320 (preliminary)' vs 'no ranking yet'; editing 'Magic Wand + segmentation, shipped' vs 'promised across styles & ratios'; in-image text 'designer-planned typography' vs 'multilingual text promised'; price '$0.02-$0.05 per image' vs 'unpriced'; API 'open; 2.0 model ID unconfirmed' vs 'no endpoint yet'. Footer reads 'Grok figures per arena.ai + xAI docs; Flux 3 status per BFL docs, August 2026.'

记分牌

在配对实际起作用的维度上,以下是双方目前的状况。Grok Imagine Image 2.0 的数据来自公开的 Arena 排行榜和 xAI 自己的文档;Flux 3 图像状态以 Black Forest Labs 7月23日的公告和当前的 BFL 文档为准,而且 Flux 3 方面每一条路线图声明都是供应商自行报告的,在端点存在之前均未经核实。

• 可用性 — Grok Imagine Image 2.0 自 8 月 7 日起已在 Grok 应用(网页、iOS、Android)中上线,而 Flux 3 图像层级于 7 月 23 日公布,至今仍未推出。

• 文生图竞技场 — Grok Imagine Image 2.0 以 Elo 1,320 排名第二,标记为初步结果,位列公开榜单;而 Flux 3 image 则无排名且未入榜。

• 编辑 — Grok Imagine Image 2.0 提供了 Magic Wand、分割、背景移除和多参考输入;而 Flux 3 图像则承诺“跨风格和宽高比”的编辑功能,但目前尚未发布演示。

• 图像内文字 — Grok Imagine Image 2.0 声称拥有设计师规划的排版和更清晰的小号文字,而 Flux 3 图像则承诺支持图像内的多语言文本渲染。

• 价格 — Grok Imagine Image 2.0 在 xAI 的 API 上每张图像 $0.02–$0.05,而 Flux 3 图像未定价;目前仅视频层($0.06–$0.54/秒)按此计费。

• API — Grok Imagine Image 2.0 开发者 API 已开放,只是 Image 2.0 的模型 ID 仍未确认;而 Flux 3 图像则没有端点存在。

为什么这次对决不能是普通的点球大战

一个普通的图像模型对比会在两个端点上发送相同提示词,然后对输出进行差异比较。但在这里你无法这样做,因为只存在一个端点。Grok Imagine Image 2.0 可以通过 x​AI 自己的应用和开发者 API 调用——开发者 API 自基础图像模型的 3 月版本起就已上线,而 Image 2.0 的专用 API 模型 ID 仍未确认,这对任何围绕它做规划的人来说都很重要。Flux 3 图像目前无法在任何地方调用:BFL 自己的文档目前只显示“同步音频的视频,现已上线”,并附注“更多模态将在上线时以相同的请求格式提供”。因此,诚实的正面比较应该是关于双方已经发布了什么、承诺了什么,以及你今天能基于什么进行构建。那才是真正的对比;只不过不是基准测试式的对比。

Screenshot of Black Forest Labs' FLUX 3 documentation as of August 2026, showing the heading 'FLUX 3 — one model, multiple modalities,' the line that FLUX 3 generates video with synchronized audio and that more modalities ship on the same request shape as they land, specs of up to 20 seconds at FHD 24 fps, and a left navigation that still lists FLUX.2 Image Editing and FLUX.2 Text to Image under image tools.

编辑工具集正是 Image 2.0 已经领先的领域。

Grok Imagine Image 2.0 将编辑作为一项核心功能推出,而非后续补充。Magic Wand 仅编辑你选中的区域,保持画面其他部分不变;分割功能可让你对精确区域进行重新着色或替换,精细到单个物体的材质;背景移除可将主体导出到透明画布上,供其他场景复用;多参考输入支持在一次生成中接收最多五张图像,因此合成多个主体无需手动裁剪粘贴。Smart Resize 可在九种宽高比之间重新构图,从 1:2 的竖版横幅到 2:1 的宽幅,并在尺寸变化时自动填充画面。它专门针对摄影、平面设计和插画进行了训练,并内置了产品图、头像、电商商品图、游戏资产和营销海报的预制模板——这一产品定位直接瞄准了以交付物为导向的商业工作流程。

根据BFL的发布材料,Flux 3的图像层级承诺提供“跨风格和宽高比”的编辑能力,以及一个同时处理静态图像和动态影像的单一模型。目前没有已发布的演示、没有示例图库,也没有可供测试的端点。在编辑这一维度上,眼下还远谈不上接近:一个已经交付且可衡量,另一个只是路线图上的承诺。

两者都在追逐同一个弱点:图像中的文本

{{1}}图像中清晰可读的文字是图像生成领域最棘手的未解难题,两家供应商在同一个两周内都瞄准了这一目标。{{/1}}x​AI表示,Grok Imagine Image 2.0计划以“设计师的方式”规划布局和排版,在密集图形中呈现更清晰的小字号文字,并减少乱码单词、徽标和标签。{{2}}BFL所声称的Flux 3图像层级改进包括“图像内多语言文字渲染”{{/2}}——{{3}}这是对同一失败模式的直接回应,也是7月公告中为数不多的具体声明之一。{{/3}}{{4}}这两项能力均尚未经过独立基准测试;两者都只是供应商的声明。{{/4}}实际区别在于,Image 2.0的声明如今可以在你自己的提示词上测试,而Flux 3的则完全无法测试。

价格,当只有一侧有价格时

Grok Imagine Image 2.0 在 xAI 的 API 上按图像计费:grok-imagine-image 每张 0.02 美元,grok-imagine-image-quality 每张 0.05 美元,速率限制为每秒 5 次请求,且编辑操作对输入图像和生成的输出均计费。在消费类应用中,它位于每月 30 美元的 SuperGrok 订阅之后,免费层级已于今年早些时候被移除——这正是 API(而非应用)成为任何基于其进行开发者的价格锚点的原因。

Screenshot of xAI's official grok-imagine-image model documentation showing the pricing card at $0.02 per generated image, the note that you are charged for each image generated and also when an image is used as input, the alias grok-imagine-image-2026-03-02 for the March 2026 base model, and a 5 requests-per-second rate limit.

Flux 3 的图像层级没有定价,因为它没有端点。BFL 公布的数字仅限视频层级——草稿每秒 $0.06,高清每秒 $0.17,全高清每秒 $0.29,适用于文生视频和图生视频,视频转视频则约为两倍——这至少表明 BFL 将 Flux 3 系列定价在高端市场。当图像层级上线时,单张图像价格远高于 xAI 的 $0.02 底价并不令人意外,但这是推断而非事实;准确的说法是:BFL 根本没有给出任何图像定价。

Flux 3 带来了 Image 2.0 无法提供的东西。

Flux 3 之所以重要,从来都不是因为当下的静态图像。BFL 用一套权重跨图像、视频、音频和机器人动作进行训练,因此这个“图像模型”与后来生成同步语音和特效、将提供的关键帧动画化为20秒片段、以及——从更长远来看——预测机器人行为的模型是同一个模型。如果你的工作流需要让主体的身份从一张静态图像延续到动态作品中,或者希望用一种请求形态覆盖所有模态,那么像 Grok Imagine Image 2.0 这样只做静态图像与编辑的产品,并没有做出这种架构上的押注。

其制衡之处在于,Grok Imagine Image 2.0 是真实存在的产品,今天在 Arena 中拥有真实的排名(尽管尚属初步);而 Flux 3 图像版本则是一个承诺,其同门产品已经上线:FLUX 3 Video 已于 8 月 4 日至 5 日全面开放,而图像版本仍处于“即将推出”状态。多模态的雄心并非终点。

谁应该选哪个

如果你本季度就需要生产级图像编辑——背景移除、区域编辑、多参考合成——Grok Imagine Image 2.0 是这两者中唯一能实际采用的,而且它每张图0.02至0.05美元的价格,让你对自己的提示词做系统性测试也便宜到直接跑就行。如果你计划构建一个基于单一模型、涵盖静帧、动态画面和音频的流水线,而且等得起,那么 Flux 3 image 是更有意思的赌注——但它只是个尚未交付的赌注,除了“未来几周”之外没有确定的发布日期,也没有定价。

目前这两个模型都还没有上线 OrcaRouter:xAI 通过自家应用和开发者 API 分发 Image 2.0,BFL 则通过自家 API 交付,两者也都尚未登陆第三方托管平台。等它们上线后,这两者值得放在同一个路由层中来运行——基于你自己的提示词对每张图像进行 A/B 测试,在任一模型尚不成熟时自动故障切换到一个久经验证的生成器,并采用 0% 加价直通模式,这样你看到的价格表就是提供商的标价,任何折扣都会在当天到账。这就是在不把生产路径押注于两者中任何一个的前提下,采用一个发布仅两天的模型和一个尚未发布的模型的做法。

底线

Grok Imagine Image 2.0 与 Flux 3 目前并不是一场势均力敌的比赛,因为根本算不上比赛——只有一位参赛者在赛道上。Image 2.0 以每张图片的价格提供了一套功能强大的编辑工具包,其 Arena 排名真实但只是初步的,编辑排名由 xAI 引用,未经独立确认。Flux 3 图像则是更具雄心的架构,尚未发布,没有价格也没有演示。如果你今天就需要图像,选择不言自明。如果你押注的是图像生成的未来方向,请关注 Flux 3 的图像模型——在端点存在之前,把所有路线图声明都视为未经验证。