用于对比“InternLumina-U2 vs Gemini Omni 1.1 Flash”的 Hero 标题卡片,副标题为“你还无法运行的模型 vs 按秒计费的那款”,并配有三个统计标签:“InternLumina-U2:仅限代码,权重即将发布”、“Gemini Omni 1.1 Flash:GA,2026 年 8 月 27 日”、“视频每秒 $0.03–$0.30”,右下角带有 OrcaRouter 标识。
Guides & Insights

InternLumina-U2 对比 Gemini Omni 1.1 Flash:你尚无法运行的模型 vs 按秒付费的模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

如果你的截止日期就在本周,那么这篇对比可以用一句话回答。Gemini Omni 1.1 Flash 是谷歌普遍可用的视频生成模型——你通过 API 调用它,它返回一段带同步音频的片段,按输出秒数付费。InternLumina-U2 是上海人工智能实验室悄然发布的 Apache-2.0 研究模型——你可以下载其推理代码,但下载不了权重,实验室仍将其标注为"即将推出"。一个是现在就能买到的产品;另一个是形同论文、根本无法运行的押注。有趣的问题在于,为什么有人会先把它们放在同一个句子里比较,以及到了 2026 年末,它们各自又说明了开放多模态工作正走向何方。

以下内容全部按来源标注。InternLumina-U2 的详细信息源自该实验室于2026年9月1日发布的 GitHub 仓库与项目页面——当天同时出现了空的 Hugging Face 占位条目——其每一项基准数字均为供应商自行报告、属于初步结果且未被复现。Gemini Omni 1.1 Flash 的详细信息则来自 Google 自身的发布材料及该模型的定价页面,该模型于2026年8月27日全面正式上线。

同一个"多模态"问题的两个答案

这两款模型都笼统地打着“一个模型,多种模态”的旗号,而正是这个共享标签,才让它们被放到一起比较。在这一标签之下,二者几乎毫无共同之处。Gemini Omni 1.1 Flash 是一项封闭、托管的视频优先生成服务:输入文本、图像、短视频参考片段或音频,它就能生成最长十秒、带语音、音乐和音效的 720p 视频,且可按十秒为单位续接,直至四十秒的场景长度。它会对现有片段进行推理——扩展过程目前能检查最长十秒的先前上下文,而非之前的一秒——同时支持首帧/末帧控制,这样你可以固定镜头的起始和结束画面,让模型填充中间部分。这是一款制作动态影像的工具,按秒出售。

InternLumina-U2 是一个反向押注:一个单一的稀疏混合专家模型,总参数 16B、其中 1B 激活,声称能理解图像、视频和 3D 资产,并能通过一个共享的离散标记接口生成和编辑图像。它的视觉侧完全离散——来自实验室称之为 AToken 的分词器的八个互补码本,因此每个视觉位置由八个码而非一个码描述——而语言侧则是实验室从 LLaDA-2.0 扩展而来的扩散主干。其卖点是,理解与生成应在同一组权重中相互增强,而不是由多个专门模型拼接而成。这一点目前无法回答:该模型在任何地方都无法运行,因为权重并未公开存在。

记分牌,也就这样了。

这对组合的诚实记分牌必须在每一行都标明出处,因为一列是在售产品、有公开定价,另一列则是未发布的研究声明、完全没有价格。

• 它是什么 —— Gemini Omni 1.1 Flash:一款托管的视频生成与编辑模型(模型 ID:gemini-omni-1.1-flash),于 2026 年 8 月 27 日正式发布(GA)。InternLumina-U2:一款面向全方位视觉理解、图像生成与编辑的开放科学扩散大语言模型,代码于 2026 年 9 月 1 日发布。

• 权重 — Gemini Omni 1.1 Flash:无,封闭且仅限托管。InternLumina-U2:目前也还没有,但采用 Apache-2.0 许可,并明确标注“即将推出”。

• 你获得的输出 — Gemini Omni 1.1 Flash:带音频的10秒720p片段,可延长至40秒;可放大至1080p和4K;并附带文本。InternLumina-U2:暂无 — 只有推理代码和路线图。

• 输入内容 — Gemini Omni 1.1 Flash:文本、图像、视频(每个提示最多约 131K 输入 token;三个 10 秒片段)、音频。InternLumina-U2:称可处理文本、自然图像、密集图表、超过 64 个采样帧的视频,以及渲染为 64 个彩色和深度视图的 GLB/GLTF 3D 素材。

• 如何运行 — Gemini Omni 1.1 Flash:通过有状态的 Interactions API 使用 Google 的 Gemini API;AI Plus、Pro 和 Ultra 订阅用户可通过 Google Flow 获得消费者访问权限。InternLumina-U2:仅支持自托管,且仅在权重发布之后;代码需要拆分检查点目录、AToken 分词器权重、FlashAttention,以及用于 3D 路径的 Blender 4.5。

• 费用 — Gemini Omni 1.1 Flash:360p 草稿为 $0.03/秒,720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒;token 计价为输入每百万 $1.50、文本输出每百万 $9.00。InternLumina-U2:一旦问世,费用取决于你自己 GPU 的成本。

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

这两列度量的并非同一轴。Gemini这一侧已定价、已提供服务并能即刻投入使用;而InternLumina这一侧只是尚未成为模型的模型规格说明。

实际当前的部分:Gemini Omni 1.1 Flash 的 GA

本周 Gemini Omni 1.1 Flash 之所以重要,是因为谷歌的 Omni 视频产品线就此不再是预览版。早期 Gemini Omni Flash 预览端点计划于2026年9月30日关闭,这个 GA 模型正是开发人员被迁移到的替代品。升级列表十分具体:四十秒场景扩展基于十秒增量构建;关键帧控制可让你指定首帧和末帧,让模型生成中间的连接画面;最长三秒的参考片段可保持角色或场景一致;还有360p草稿档位,价格为720p的三分之一,运行速度最高提升60%,适合在昂贵的最终渲染前迭代提示词。如果你构建视频处理管线,价格表——720p每秒0.10美元,十秒片段1.01美元,通过四次扩展调用生成的四十秒720p场景约4美元——就是改变你成本模型的数字。

这些都不足以让它在任何操作层面成为 InternLumina-U2 的竞争对手。Gemini Omni 1.1 Flash 可以生成运动画面;而 InternLumina-U2——如果其说法在与权重接触后依然成立——则会理解运动并生成静态画面。一个本季度需要产品视频的团队不会在这两者之间做选择:Gemini 模型是两者中唯一能够实际调用的,并且可通过 Google 自己的 API 和多个第三方平台获取。

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

Google AI 开发者网站上 Gemini API 的“Models”文档,截图于 2026 年 9 月 2 日——该页面列出了当前的 Gemini 系列模型,侧边栏导航中显示有 Gemini Omni 系列。

完全不是当前的部分:InternLumina-U2

InternLumina-U2在9月1日的发布是悄无声息的那一种:三次对GitHub仓库的提交、一个项目页面、一个28字节的Hugging Face占位文件(其全部内容仅是一段Apache-2.0许可证头),以及没有任何公告。真正公开的是推理框架和架构,而它们之所以值得仔细阅读,恰恰是因为还没有人能够测试模型本身。该仓库展示了一个驱动程序,每个任务对应一个入口点——文本、最高1024×1024的文本生成图像、对自然图像和密集图表的图像理解、带可选双CFG模式的基于指令的图像编辑、对64个采样帧的视频理解,以及对Blender渲染的GLB/GLTF视图的3D理解。其设计赌注在于:一个多码本的离散视觉词表能让单一骨干网络完成以上所有任务,而无需增加序列长度——这与驱动codec原生视频模型的“视觉token应携带更多信息”的理念一脉相承,只不过被应用到了一个统一的理解与生成界面上。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

2026年9月2日抓取的 InternLM/InternLumina-U2 GitHub 仓库——Apache-2.0 仓库主页,包含 "Multi-Codebook Diffusion Large Language Model" 描述、三个提交,以及目前整个公开版本所包含的按任务划分的推理脚本。

项目页面上的基准测试表被实验室自己标注为“初步、不完整的结果”,而表中的数字利弊兼有:亮眼的图表与文档得分(ChartQA 86.52、CharXiv-DQ 83.65,均为供应商报告)旁边,是 GenEval 的 0.81——低于实验室声称能超越的至少一个模型的 0.89。由于根本没有可供评估的模型,也就不存在独立的评估。在 safetensors 文件出现在那个空白的 Hugging Face 占位仓库之前,关于实际质量的一切都仍然只是宣称。

当只有一侧存在时,路由层会做什么

这是那种路由角度真正关乎时间而非选择的对比之一。我们不会假装 OrcaRouter 能服务 InternLumina-U2——没人能做到,权重尚未发布——Gemini Omni 1.1 Flash 也不在我们的目录中;你需要通过 Google 自己的 API 来访问它。在这一空白期,路由层的真正作用是保持你的选项开放,而不必把流水线重建两次。穿透模式就是这种机制:当某个托管的供应商模型真的进入目录时,供应商标价以 0% 加价穿透传递,因此供应商公布的每秒费率就是你所支付的每秒费率,只需一个密钥,而无需与每家供应商分别签合同。而当像 InternLumina-U2 这样的 Apache-2.0 权重发布终于到来时,理性的做法不是拆掉你正在工作的视频栈,而是把新模型架设在自动故障转移后面的测试路径上,这样,一旦未经证实的扩散模型第一次出问题,调用就会回退到你已经信任的模型,而无需更改代码。在不会伤到你的地方尝试新东西;把付账单的业务路由到可靠之处。

裁决

如果你这个月就需要视频能力,决定已经替你做好了:Gemini Omni 1.1 Flash 是真实存在的,已定价并全面开放,而 InternLumina-U2 目前谁都无法调用。如果你关注的是开放多模态研究的走向,InternLumina-U2 才是更有意思的产物——这是出自大型实验室的罕见押注,采用全离散、多码本架构,基于 Apache-2.0 许可,架构已经公开,权重估计也很快会发布。把该仓库视为研究方向的前瞻预览,把 GA 视频模型视为你今天就能在其上构建的工具,不要因为两者共享“多模态”这个标签,就认为它们在竞争同一项任务。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube