
MAI-Image-2.5-Pro vs Qwen-Image 3.0:四倍价格,另一种文字
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
把 MAI-Image-2.5-Pro 和 Qwen-Image 3.0 放在一起,首先注意到的就是价格:大约 每1,000张图像108.50美元 对应微软高级套餐,而大约 每1,000张25–30美元 对应阿里巴巴的Qwen-Image 3.0——阿里巴巴自己给出的费率接近25美元,而 Artificial Analysis 的排行榜则列为30美元。无论按哪个数字计算,价格都相差三倍以上。这个溢价实际上买到的是不同类型的文本处理能力。Qwen-Image 3.0 由阿里巴巴的Qwen团队于2026年7月21日发布,并于8月4日开放国际API,其定价定位是批量文本渲染器——在十二种语言中可清晰识别至约10px,并拥有4,500 token的提示词窗口,适合处理信息密集的提示词。MAI-Image-2.5-Pro 自7月23日起在 Microsoft Foundry 上公开预览,是独立排行榜上评价最高的编辑模型,拥有厂商声称的文本渲染精度,但输出分辨率有约1百万像素的硬性上限。两者都是API图像模型,其卖点都在于文本处理;它们竞争的是单次任务的价格,而不是单一的质量分数。
两个文本故事,均未完全核实
文本之战是这两个模型存在的原因,也是证据最薄弱的地方——本节中的每一个数字都来自供应商报告,没有一个是经过独立复现的。
• Qwen-Image 3.0——阿里巴巴的发布材料声称,可读渲染可低至约10px,原生支持12种语言,拥有20多种字体和100多种艺术风格,支持数学符号、下标、上标和多行公式,还熟悉常见的网页、游戏和软件界面。提示窗口最多可接受4,500个token的输入,是上一代产品的4.5倍,这使它能够一次性处理报纸头版或九宫格知识图谱等密集型简报。
• MAI-Image-2.5-Pro——微软声称,96.8%的文本渲染准确率覆盖中文、英文、日文、韩文和西班牙文,一项27%更好的提示遵循度,相比GPT-Image-1.5在内部评测中,以及94%的多图像角色一致性。输入规格在纸面上更宽裕——最多32,000个文本输入令牌,搭配131k上下文窗口——输出上限为1,048,576像素,相当于1024×1024。
截至撰写本文时,这两项声明均未被复现。两者的区别在于声明的形式:Qwen的声明涉及跨文字体系的字量与可读性,微软的声明则涉及明确指定的五种语言的准确性与一致性。两家厂商都没有发布可供其他实验室运行和核查的基准测试。
Editing is where the premium lives
两者的区别在于编辑能力,而这是唯一有独立证据支撑的维度。MAI-Image-2.5-Pro 在 Artificial Analysis 图像编辑竞技场中以 Elo 1,272 的分数排名第一(约 6,100 次盲测投票),领先于 Reve 2.1、MAI-Image-2.5 和 GPT Image 2。在同一排行榜上,较新的 Qwen-Image-3.0-Pro 得分为 1,249——这是一个颇具竞争力的分数,落后 23 个 Elo 点,而且对于一款本月才上线国际 API 的模型来说,尤其值得一提。
除基础模型之外,阿里巴巴的编辑产品组合是一套专项技巧,而非某一项单一的王牌功能:古画修复、全景图生成、草图转PPT、多镜头分镜。微软的押注则更窄而深——精确、外科手术式的编辑,让画面其余部分保持一致(对象替换、布局调整、图像内文字更新、模糊清理),这类编辑在旧模型中往往会把整个场景重新生成,导致主体丢失。对于“拿现有素材,改一处,直接交付”的工作流,Pro版在独立评测中的第一名是更强的信号;而对于五花八门的创意编辑格式,Qwen的清单则更为广泛。

规格对比
• 价格 — 约 108.50 美元/1k 张图像(1024×1024,AA 转换)对比约 25–30 美元/1k 张图像(阿里巴巴报价对比 AA 列示价格)br />• 发布 — 2026年7月23日(公开预览,Foundry)对比 2026年7月21日,国际 API 8月4日br />• 文本输入 — 32,000 个 token,131k 上下文对比 4,500 个 token 的提示窗口br />• 输出上限 — 约 1,048,576 像素(约 1K)对比最高 2048×2048br />• 每次调用图像数 — 每次请求单个输出对比每次调用最多六张图像br />• 编辑排名 — 第 1 名,Elo 1,272(AA)对比同一榜单上 Qwen-Image-3.0-Pro 的 1,249br />• 来源 — Microsoft “不蒸馏第三方模型”的声明对比输出上的 AIGC 来源标签br />• 权重 — 封闭,仅 API 对比封闭,仅 API
输出上限和单次调用数量比表面上看起来更重要。Qwen-Image 3.0 可以渲染 2048×2048 的图像,并且每次调用最多可返回六张图像,这是一个批量经济性特性;而 Pro 层级最高接近 1K,且每次请求只返回一个输出。如果你的需求是“给我一组六张产品图”,那么阿里巴巴的模型就是为此设计的,而微软的模型则不是。

当保费自偿时
决策规则是关于图像的用途,而不是哪个模型"更好"。
• 为 MAI-Image-2.5-Pro 支付溢价。当输出是主视觉素材——产品视觉图、海报、关键帧,或一张将投入营销活动且不会被反复生成五十次的图片——时,当编辑必须一次做对时,排名第一的编辑能力和角色一致性承诺最为重要。
• 使用 Qwen-Image 3.0 进行批量购买,当输出是一次性的或数量繁多时——本地化广告变体、占位图、草图转 PPT 演示文稿、故事板帧,任何你会重新生成而非细化的内容。按每 1k 25–30 美元计算,一次失败的生成成本不过是四舍五入的误差;按每 1k 108.50 美元计算,就不是这样了。
有一个值得指出的中间地带:对于图像中密集的多语言文本工作——比如含日语和西班牙语文案的落地页原型、带公式的信息图——Qwen 的{{1}}10像素可读性和十二种语言支持在纸面上更胜一筹{{/1}},而价格仅为四分之一。微软模型的反驳论据是其{{2}}在五种语言上96.8%准确率的声明{{/2}},但该声明未经证实,在两个未经证实的文本声明之间做选择的买家,或许应该更看重价格。

路由层(在适用的情况下)
目前这两个模型都还不能通过 OrcaRouter 访问——Qwen-Image 3.0 托管在阿里自己的 API 上(阿里云百炼和 Qwen 平台)以及多个第三方平台,而 MAI-Image-2.5-Pro 在 Microsoft Foundry 上——所以诚实的比较只能直说:两者今天都不在我们这边。当其中任何一个通过可调用的托管服务商提供时,直传经济模式即适用:在服务商标价之上 0% 加价,你支付的就是供应商的费率卡价格,发布折扣或降价会在公布当天就体现在你的账单上。故障转移论点是另一半:Qwen-Image 3.0 是一个上线仅数周的国际 API,属于那种你把一部分流量路由过去、让经过验证的备用模型吸收边缘情况的模型——这正是路由层所为之设计的场景。
裁决
Qwen-Image 3.0 和 MAI-Image-2.5-Pro 并非同一产品以不同价格出售;它们是恰好定价不同的两款不同产品。微软的模型摘得编辑桂冠,上下文窗口更大,并声称在五种语言上具有未经证实的准确性——对于主视觉素材和精细化编辑场景,这一溢价是合理的。阿里的模型能更清晰地呈现更多文字系统,按自己的方式接受每次生成更密集的需求说明,输出尺寸更大且每批六张,成本仅为四分之一——对于批量化和多语言图内文字工作,这是经济上理性的选择。当图像本身是产品时,为溢价买单;当图像只是库存时,为批量买单。
