主标题卡文字为"Ming-Image-0.1-Design 对比 Gemini Omni 1.1 Flash",副标题为"一个能返回分层设计,另一个连静态图都无法返回",并配有两张极简图标卡片。OrcaRouter 标志合成在右下角。
Guides & Insights

Ming-Image-0.1-Design 对比 Gemini Omni 1.1 Flash:设计交付成果需要两半俱全

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ming-Image-0.1-Design请求视频,得到的却是一张静态图;而向Gemini Omni 1.1 Flash请求静态图,得到的却是错误——它自己的文档就把图像生成、图像编辑以及图文交错输出列为该模型不支持的能力。因此,把这两者放进两栏对比的页面,就像拿渲染器去比投影仪。真正值得比较的,是设计团队总是搞错的那件事:一个已交付的成果通常既需要屏幕上的画面,也需要会动的素材,而这两个模型各自只占了其中一半,中间还隔着一次会悄无声息毁掉工作的交接。

Ming-Image-0.1-Design 是 inclusionAI 的 6B 文本到图像模型,以 MIT 许可证发布,权重于 2026 年 9 月 17 日公布,专为文字密集的平面设计而打造。Gemini Omni 1.1 Flash 是 Google 的生产级视频模型,自 2026 年 8 月 27 日起正式可用,专为带同步音频的短视频动态内容而打造。两者都无法替代对方,而真正有趣的问题是:它们之间会发生什么。

两半,直白地说

从每一个物理上返回的东西开始,因为其他一切都会随之而来。

输出 — Ming-Image-0.1-Design 返回静态图像,在 12 个采样步数和 CFG 1.0 下最高可达 2048 x 2048,若追求速度则为 1024 x 1024;Gemini Omni 1.1 Flash 返回视频,最长 40 秒,由 10 秒的生成与扩展调用拼接而成

• 透明度——当提示词以文档化的透明度短语开头时,Ming-Image-0.1-Design 会输出原生 RGBA,因此 alpha 直接来自采样器;Gemini Omni 1.1 Flash 没有透明输出,而且整个流程中也不存在透明视频格式

• 结构 — Ming-Image-0.1-Design 的配套 Layer 模型可将扁平化设计分解为 2–9 个独立的 RGBA PNG,这些 PNG 可重新合成为原始图像;Gemini Omni 1.1 Flash 则返回单个扁平化的视频片段

• 参考输入 — Ming-Image-0.1-Design 仅凭提示词即可生成,无需参考图像;Gemini Omni 1.1 Flash 每条提示词最多接受 10 张图像,以及最多三个 3 秒的参考视频片段,并且在扩展场景时最多可读取 10 秒的先前素材

• 分辨率上限 — Ming-Image-0.1-Design 原生为 2048;Gemini Omni 1.1 Flash 以 720p 原生渲染,并可上采样至 1080p 和 4K,还提供 360p 草稿档。

• 成本 — Ming-Image-0.1-Design 没有托管价格,因为没有托管端点,所以成本就是你自己在一张 80 GiB 显卡上消耗的 GPU 时间;Gemini Omni 1.1 Flash 在 720p 下按每秒 $0.10 计费,而 360p 草稿档约为每秒 $0.03

• 许可证 — Ming-Image-0.1-Design 采用 MIT 许可,允许商业使用;Gemini Omni 1.1 Flash 的商业 API,其输出带有 SynthID 水印

A rendered two-column scoreboard headed 'Two halves', titled 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash'. The Ming-Image-0.1-Design column reads: returns a still to 2048 x 2048; 12 steps, CFG 1.0; transparency native RGBA; structure 2-9 editable RGBA layers; cost your own 80 GiB GPU; independent placement #1 open weights in the UI/UX slice. The Gemini Omni 1.1 Flash column reads: returns video to 40 seconds; 10-second calls with 10s lookback; transparency none and no alpha video; structure one flattened clip; cost $0.10 per second at 720p; independent placement top of the video arenas with no audio.

交接在哪里失效

如果你正在构建一条同时产出这两者的设计流水线,方向只有一个:Ming-Image-0.1-Design 生成画面,Gemini Omni 1.1 Flash 将其制作成动画。反向并不存在。而它们之间的接缝,正是设计工作丢失的地方。

第一个牺牲品是 alpha 通道。用透明背景生成的 UI 素材,正是当初选用输出 RGBA 的采样器的理由——它能直接落到既有版式上,无需再做一次抠图。可一旦把这一帧送进视频路径,透明度就没了,因为视频输出根本无法承载它。透明度只能活在合成器里,在片段回传之后再套用,而不在模型链路中。那些在片段还不存在时就规划合成的团队,最后只能返工重做。

第二个牺牲品是分辨率。Ming-Image-0.1-Design 原生以 2048 渲染。Gemini Omni 1.1 Flash 原生以 720p 渲染,并向上放大。将 2048 像素的设计帧送入 720p 渲染路径,大部分细节都会被丢弃,而随后的放大是厂商侧的步骤,你无法控制。

第三点是文本。Ming-Image-0.1-Design 的全部前提,就是渲染出的文字在其实际被阅读的字号下依然清晰可读——这正是它在 Artificial Analysis UI/UX Design 分项中取得 1,084 Elo 所衡量的维度。让视频模型为这一帧制作动画,并不会重新渲染文字;它只是搬运已经给定的像素。任何改变画面透视、尺度或光照的运动,都会连带移动文字排印,而那些在静帧中清晰可读的小号字,无法在变换中存留下来。

这些都不是任一模型的缺陷。当一个交付物被拆分到两个从未设计为彼此交接的系统中时,就会发生这种情况,而解决办法是生产决策,而不是模型选择:决定这个交付物的哪一层可以被扁平化,并有意识地将其扁平化。

每一半实际上擅长什么

Ming-Image-0.1-Design 的证据来自第三方竞技场。在 Artificial Analysis Text to Image 排行榜上,它以 21,342 票、Elo 995 位列 104 名中的第 45 名,并在该榜单的 UI/UX Design 细分领域中,以细分领域内 2,100 票、1,084 Elo 位居开放权重模型第一。这两个数字之间的差距,才是对这款模型最诚实的描述:一个经过实测的专才,而非通才。其 Layer 配套模型的数字——在 Crello 测试集上、1024 分辨率下的 RGB L1 误差 0.0574 和 alpha soft IoU 0.8923——由厂商报告且未经复现,应如此标注。

Gemini Omni 1.1 Flash 的证据同样独立,但来自不同的榜单。在 Artificial Analysis 上,截至 2026 年 9 月 2 日,它在无音频类别中同时占据文生视频和图生视频两个竞技榜的榜首,Elo 分别为 1,324 和 1,364。启用音频后,它分别降至 1,237 和 1,180——排名第二和第四。这个音频差距是规格表会掩盖、排行榜会暴露的细节;在你围绕一项榜首宣称来为营销活动做预算之前,这一点值得了解。

这两个评审组并不重叠,这正是关键所在。并不存在一个让设计静帧与十秒短片同台比拼的赛场,任何暗示并非如此的报道,都是在凭空捏造一块记分牌。

Screenshot of Google's Gemini API models documentation at ai.google.dev/gemini-api/docs/models, captured 24 September 2026 in English. The left navigation lists Gemini 3, Nano Banana, Veo, Gemini Omni Flash, Lyria 3.5 & Lyria Clip, Text-to-speech, Transcribe and other model families. The body shows the Models guide heading, a Gemini 3 section with Gemini 3.8 Flash, Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking cards marked New and Stable, and a Generative media models entry in the on-this-page rail.

分裂每次尝试的代价

这两部分的经济情况不具有可比性,不应将其平均后并入同一条预算科目。

在静态图像方面,只要硬件到位,Ming-Image-0.1-Design 每张图片就不产生任何费用。这让迭代在真正重要的意义上变得免费:你可以在一个下午生成二十个仪表盘变体,然后扔掉十九个。在动态视频方面,在 Gemini Omni 1.1 Flash 上,一段 10 秒的 720p 片段收费约 $1.00;同样的 10 秒在 360p 草稿档位约为 $0.30;一段完整的 40 秒 720p 场景——一次生成加三次扩展调用——接近 $4.00。Google 尚未公布 1080p 和 4K 档位的每秒费率,而经销商列出的每秒 $0.15 和 $0.30 报价属于市场估算,而非厂商定价,因此任何高分辨率制作预算都仍是暂定的。

实际后果是,这两部分需要相反的工作方式。在静态图上迭代,因为重试是免费的。在视频上一次性定稿,因为每一次重试都要计费。在视频这一半反复迭代的团队,就是会被账单吓到的团队——因为第一帧不花钱,而重拍却要花掉一切。

路由层在这里的定位,比宣传话术所暗示的要窄,值得精确说明一下。Ming-Image-0.1-Design 是 MIT 下载——OrcaRouter 不路由任何 inclusionAI 模型,所以它要么在你自己的硬件上跑,要么根本跑不了。Gemini Omni 1.1 Flash 是厂商 API,有自己的密钥和自己的按秒计费,我们同样不路由它;Google 尚未把 Omni 视频 API 开放给第三方路由。我们在动态影像这一侧承载的是 Kling 的视频产品线,包括 kling-v3kling-v3-omnikling-video-o1,外加 MiniMax H3——所以如果一份交付物中的动画部分需要托管路由,而不是再签一份厂商合同,我们这边就有。在图像这一侧,我们承载 OpenAI GPT-Image 系列、Google Imagen 4 各档位和 Gemini 图像预览版,以及 xAI 的 Grok Imagine 图像端点。因为厂商目录价按 0% 加价率透传而非加价,所以其中任何一家的厂商降价,当天就会在我们这边生效。

A rendered summary card headed 'The handoff', titled 'What a still loses on the way to motion', listing four losses: the alpha channel (Ming-Image-0.1-Design emits it from the sampler, Gemini Omni 1.1 Flash has no transparent video output); resolution (2048 x 2048 in against a path that renders natively at 720p and upscales); typography (the video model moves the pixels it is given and does not re-render the copy); and working style (stills iterate for free, video bills about $1.00 per 10 seconds at 720p and about $0.30 at the 360p draft tier).

决定,一气呵成

• 你需要可编辑的设计素材——Ming-Image-0.1-Design,而图层分解正是关键所在。透明抠图、图标、精灵图与分层合成,正是能输出 RGBA 的采样器从流程中省去整整一个环节的场景。

• 你需要可衡量的动态表现——Gemini Omni 1.1 Flash。它是两者中唯一在排行榜上拥有独立竞技场顶尖成绩的,也是唯一拥有可纳入预测的已公布每秒价格的。

• 你两者都需要——按每次尝试而非每个素材来为视频这一半做预算,不要假定 alpha 通道会保留下来,并且要在片段返回之后再规划合成。

• 你需要把产出卖出去——Gemini Omni 1.1 Flash 毫无疑问是更安全的那一半,因为 MIT 覆盖了 Ming-Image-0.1-Design 权重,而 Google 的 API 条款覆盖了视频。水印就是代价:每个 Omni 片段都带有 SynthID,而 Ming-Image-0.1-Design 的任何输出都不带。

接下来真正值得关注的,不是又一场正面对决,而是两件事:inclusionAI 是否会为 {{KEEP}}Ming-Image-0.1-Design{{/KEEP}} 挂上一个托管端点——这将消除 80 GiB 的入门成本,并彻底改变这场比较的格局——以及 Google 是否会在 {{KEEP}}Omni{{/KEEP}} 视频榜单上补上音频这块短板。决定一份设计交付物中哪一半能拿到预算的,是这两个事实,而不是又一张记分牌。