
Grok Imagine Image 2.0:在 Artificial Analysis 上排名第4,价格仅为其三分之一
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Imagine Image 2.0 已登上 Artificial Analysis 文生图排行榜(Text to Image Leaderboard)第 4 名,而真正重要的数字不是排名——而是它旁边标注的价格。该模型以 1,153.66 Elo 排在三个条目之后:GPT Image 2.5 Flare (max)、GPT Image 2.5 Sunburst (max) 和 GPT Image 2 (high)。它领先于其他所有实验室的模型,包括微软的 MAI-Image-2.6 和 Nano Banana 2 模型。这使得该模型成为那三者之外排名最高的图像生成器,并且在前四名中价格最低,且优势明显:Artificial Analysis 对其定价为每 1,000 张图像 60 美元,而其上方三个条目的价格约为 211 美元。该模型本身出自 2026 年 8 月 7 日——变化的是这个独立榜单把它放在什么位置,以及这对开发者在发布时所用的“世界第二”定位意味着什么。
#4 位置实际衡量的是什么
Artificial Analysis 的文本生成图像排行榜是一个盲测的人类偏好竞技场:投票者看到同一提示词生成的输出,但没有模型标签,然后选出更好的那个;由此得出的 Elo 分数独立于任何厂商对外发布。Grok Imagine Image 2.0 位列第 4,Elo 为 1,153.66,95% 置信区间为 1,141.66 至 1,165.66。这个数字没有任何部分来自 xAI。(读榜单时有一个值得了解的细节:Artificial Analysis 将该模型的创造者列为 SpaceXAI。)
故事中关于价格的那一半更有意思。同一个页面将质量与价格作图,并用一条帕累托线标出每美元能带来最高 Elo 的模型,而根据该榜单自己公布的数据,Grok Imagine Image 2.0 是每 1,000 张图像定价低于 100 美元的模型中得分最高的。质量上排在它之上的下一个模型 GPT Image 2 (high),价格为每 1,000 张 211 美元——大约花三倍半的钱,换来约多 17 Elo。这是一个性价比主张,而不是关于最佳模型的主张,而且这才是独立数据实际支持的那种说法。
前沿地位确实存在,但优势很窄,这一点值得坦率说明。微软的 MAI-Image-2.6 以每 1,000 次 38.90 美元位居其后一名,而 Meta 的 Muse Image 为每 1,000 次 10 美元,Elo 为 1,111。该榜单上的 Elo 区间约为 ±12 分,因此第 4 名和第 5 名——相差 6.5 Elo——彼此都落在对方的误差范围内。应把这个位次视为"前五名",而不是一个已经坐稳的位置。
这14位的攀升,正是它与 Grok Imagine Image 2.0 所取代的那一档之间的差距。xAI 此前的质量档位 grok-imagine-image-quality 以 1,043.21 Elo 位列同一榜单第 18 名,而最初的 grok-imagine-image 以 1,017.86 排在第 29 名。也就是说,在 xAI 目前标注为图像默认模型的这款模型与其所取代的模型之间,大约相差 110 Elo 和 14 个排名位次。
“世界第二”的说法目前处于什么状况
发布时,xAI 引用了其在文生图和图像编辑 Arena 榜单上均排名第 2 的成绩,Elo 约为 1,320,并标注为 Preliminary(初步)。这些数据是 xAI 在自己的公告中重点强调的——并非其委托进行的独立评估——而且此后已发生变化:8 月 10 日的快照显示,该模型以 1,316 Elo 位列第 3,落后于 MAI-Image-2.6 和 GPT Image 2。图像编辑排名第 2 的说法,则仍然只是 xAI 自己的引述。
Artificial Analysis 是一个不同的榜单,采用不同的方法,聚集着不同的投票群体,如今它将这款模型排在第 4 位。两者其实并不矛盾——它们以不同方式采样人类偏好,而且都只是逐周变动的榜单快照。对六周独立排名的诚实总结是:Grok Imagine Image 2.0 始终稳居前五,却从未真正达到 xAI 所宣称的第 2 名。
Grok Imagine Image 2.0 实际交付的功能
xAI 将 Grok Imagine Image 2.0 定位为一个编辑环境,而非又一个一次性生成器。其功能集包括:
• 魔棒 —— 区域级编辑,不影响帧的其余部分
• 分割 — 精确选择区域,用于调色、替换或调整
• 背景移除 — 导出透明背景主体
• 多图输入 — 每次编辑最多支持五张源图像;xAI 的文档现已列出五张,高于 API 发布时上限的三张
• Smart Resize——将一张图像重新构图为9种宽高比(从1:2竖屏到2:1横屏),生成新的画面内容而非裁剪
• 模板——用于产品摄影、人物头像、电商商品图、游戏资产和营销海报的预设工作流
API 提供了消费级应用未展示的控制项:宽高比——包括 21:9 和 5:2,二者均为 2.0 新增——分辨率(默认 1K,可选 2K),以及一个可取 low、medium 或 auto 的质量参数。在消费者端,该模型作为 grok.com/imagine、iOS 和 Android 上的默认 Quality Mode 提供,并且自 8 月 13 日起,它也被上架到 Runway 的平台上,加入了 Runway 已托管的图像和视频模型。那次上架是供应商与合作伙伴的声明,而非独立评估,但它是发布后第三方分发的首个迹象。
在标题文本渲染方面,xAI表示,该模型“像设计师一样规划排版和布局”,保持密集的多部分构图完整,并清晰地渲染小号文本。它还能在多轮迭代编辑中保持主体的身份和设置。
首次独立测试发现了什么
一项针对 gpt-image-2 的六提示词、单种子、未经挑选的对比发现了一条清晰的分野,而新版排行榜中的位次安排也无法推翻这一点。
Grok 获胜:照片级真实感与身份保持。肖像手部解剖结构正确,带有毛孔级皮肤细节、次表面散射以及自然的眼神光和轮廓光。在 45 度几何旋转任务中,Grok 将面部身份保持在 ArcFace 0.5 阈值之上,而 gpt-image-2 漂移更明显。
Grok 失败:生产关键领域。要求生成简体中文电影海报标题时,它却渲染出繁体中文——这被称为本地化和出版流程的“硬性淘汰项”。水彩风格融合请求返回的是照片级写实图像,仅带有轻度的绘画质感处理——属于“类别级淘汰”。本地编辑虽完成了全部三项请求,但未能保留窗外的景色,且错误地锚定了高光。
摘要:Grok Imagine Image 2.0“在照片级真实感和身份一致性上领先,但在编辑可靠性、多语言文本和真正的风格迁移方面落后。”排行榜只是对数千次盲测偏好取平均值;它无法告诉你这个模型能否正确处理你的中文标题。一次六条提示词的测试同样算不上充分的证据——但在这两者之间,对于正在交付本地化素材的团队而言,具体的失败才是更具可操作性的信号。
API 与定价计算
自发布以来,开发者方面的说法已经发生了变化。grok-imagine-image-2.0 现在是 xAI 文档中用于图像生成、单图编辑和多图编辑的模型,也是 xAI 自家模型页面针对图像所推荐的模型。发布时那句“开发者 API 访问即将推出”已从厂商的模型和定价页面上消失。
• grok-imagine-image-2.0:每张图像 $0.04 起,按实际提供的质量计费
grok-imagine-image (1.0):每张图片 0.02 美元,不受下方变更影响
• grok-imagine-image-quality:每张图像 $0.05,将于 2026 年 11 月 2 日停用
质量是控制成本的杠杆。Auto——参数省略时的默认值——目前生成时提供 low,编辑时提供 medium,因此生成请求按 low 费率计费,编辑请求按 medium 费率计费。固定为 low 或 medium 可使账单可预测,而不必取决于服务选择哪条路径。
最后一条附带一个截止日期。xAI 的迁移指南称,grok-imagine-image-quality 这个 slug 将于 2026 年 11 月 2 日停用,此前自 9 月 2 日起有 60 天的通知期。从该日期起,该 slug 仍会继续解析,但请求将由 grok-imagine-image-2.0 处理,且 quality 被设为 low——这是一种兼容性重定向,而非硬性关停。由于在所有分辨率下,low 档每张图片都比原先的 quality 档便宜 0.01 美元,因此什么都不改的团队会看到价格下降,同时输出质量发生无声变化。有意识地迁移,即显式指定 grok-imagine-image-2.0,并在输出稳定性重要的场景下固定 quality,才是你真正想要的版本。该日期和重定向行为均出自 xAI 自己的文档——由厂商所述,而非经过独立测试。
与 OpenAI 的各选项相比,这既是价格差异,也是定价模式差异。gpt-image-2 按 token 计价——按 OpenAI 公布的价格,每百万图像输入 token 为 8 美元,每百万图像输出 token 为 30 美元——因此每张图像的成本会随分辨率和细节而波动。Artificial Analysis 给出的代表性数字是 GPT Image 2(高)每 1,000 张图像 211 美元,而 Grok 为 60 美元,这正是这种波动以一个单一数字呈现出来的结果。固定按张计价在大规模下更容易预测,这也是为什么一个排名第四的模型值得一看的主要原因。
在不押上整个流水线的情况下尝试它
对 Grok Imagine Image 2.0,合理的反应依然是"先试试,别急着押注"。它的位置仍落在相互重叠的置信区间之内,一项独立测试指出了它在本地化文本和风格迁移上的真实短板,而且 xAI 将在 11 月停用其底层的某个 slug。这正是应当走路由、而不是直接硬接集成的典型情形。
在 OrcaRouter 上,grok-imagine-image——我们目录中的 xAI 图像模型——与 gpt-image-2 位于同一个 OpenAI 兼容端点,因此在 xAI 与 OpenAI 的图像模型之间切换只是改一下模型字符串:无需第二份合同,也无需新的 SDK。OrcaRouter 按供应商的目录价格原价透传,不加任何加价,因此厂商降价当天这里就会同步生效;自动故障转移可以把报错、速率限制或拒答转交给备用模型,而不是让它们进入你的生产链路。有一点必须坦诚说明,与最初那篇评测一致:xAI 最新的质量档位与我们目录中已有的 Grok 图像模型是两个不同的条目,所以请查看当前的模型列表,而不要想当然地认为某个 Grok 变体今天就可以路由。
接下来看什么
1. 11月2日的迁移。团队究竟是明确迁移到 grok-imagine-image-2.0,还是不知不觉滑向重定向及其低质量默认选项,这是 xAI 在这个模型上仍可能犯的最大错误——而重定向会让这个错误变得不可见,除非你查看响应中的 model 字段。
2. 第 4 名的位置能否保住。与 MAI-Image-2.6 的差距为 6.5 Elo,区间为 ±12 分,因此再多几千张投票,榜单排名就可能朝任一方向重排。相比上一层级提升的 110 Elo 看起来是稳固的;但具体名次并非如此。
3. 有多少面向消费者的功能界面能通过 API 实现。生成、编辑和多图编辑均已纳入文档。模板以及被命名的 Smart Resize 工作流仍属于应用功能,而这一差距正是剩余“仅限消费端”注意事项所在。
归根结底:Grok Imagine Image 2.0 是一个真实且能力出色的模型,如今已被独立评定——在 Artificial Analysis 的 Text to Image Leaderboard 上位列第 4,是那里最好的非 OpenAI 上榜者,比它所取代的层级高出约 110 Elo,并且处在榜单的价格-质量前沿:每 1,000 张图像 60 美元,而直接排在其上的 OpenAI 模型约为 211 美元。“世界第 2”的说法始终是 xAI 发布时的快照,独立榜单从未完全这么说。它两个最明显的独立弱点——简体中文合规性和风格迁移可靠性——正落在团队最常需要图像 API 提供的功能上。对于照片级写实、保持身份一致性的工作,可立即试用;对于交付本地化文本或风格化素材的流水线,则应暂缓;如果你已经在调用即将退役的 quality slug,请在 11 月 2 日前迁移。
