
InternLumina-U2 对比 Gemini Omni 1.1 Flash:你尚无法运行的模型 vs 按秒付费的模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
如果你的截止日期就在本周,那么这篇对比可以用一句话回答。Gemini Omni 1.1 Flash 是谷歌普遍可用的视频生成模型——你通过 API 调用它,它返回一段带同步音频的片段,按输出秒数付费。InternLumina-U2 是上海人工智能实验室悄然发布的 Apache-2.0 研究模型——你可以下载其推理代码,但下载不了权重,实验室仍将其标注为"即将推出"。一个是现在就能买到的产品;另一个是形同论文、根本无法运行的押注。有趣的问题在于,为什么有人会先把它们放在同一个句子里比较,以及到了 2026 年末,它们各自又说明了开放多模态工作正走向何方。
以下内容全部按来源标注。InternLumina-U2 的详细信息源自该实验室于2026年9月1日发布的 GitHub 仓库与项目页面——当天同时出现了空的 Hugging Face 占位条目——其每一项基准数字均为供应商自行报告、属于初步结果且未被复现。Gemini Omni 1.1 Flash 的详细信息则来自 Google 自身的发布材料及该模型的定价页面,该模型于2026年8月27日全面正式上线。
同一个"多模态"问题的两个答案
这两款模型都笼统地打着“一个模型,多种模态”的旗号,而正是这个共享标签,才让它们被放到一起比较。在这一标签之下,二者几乎毫无共同之处。Gemini Omni 1.1 Flash 是一项封闭、托管的视频优先生成服务:输入文本、图像、短视频参考片段或音频,它就能生成最长十秒、带语音、音乐和音效的 720p 视频,且可按十秒为单位续接,直至四十秒的场景长度。它会对现有片段进行推理——扩展过程目前能检查最长十秒的先前上下文,而非之前的一秒——同时支持首帧/末帧控制,这样你可以固定镜头的起始和结束画面,让模型填充中间部分。这是一款制作动态影像的工具,按秒出售。
InternLumina-U2 是一个反向押注:一个单一的稀疏混合专家模型,总参数 16B、其中 1B 激活,声称能理解图像、视频和 3D 资产,并能通过一个共享的离散标记接口生成和编辑图像。它的视觉侧完全离散——来自实验室称之为 AToken 的分词器的八个互补码本,因此每个视觉位置由八个码而非一个码描述——而语言侧则是实验室从 LLaDA-2.0 扩展而来的扩散主干。其卖点是,理解与生成应在同一组权重中相互增强,而不是由多个专门模型拼接而成。这一点目前无法回答:该模型在任何地方都无法运行,因为权重并未公开存在。
记分牌,也就这样了。
这对组合的诚实记分牌必须在每一行都标明出处,因为一列是在售产品、有公开定价,另一列则是未发布的研究声明、完全没有价格。
• 它是什么 —— Gemini Omni 1.1 Flash:一款托管的视频生成与编辑模型(模型 ID:gemini-omni-1.1-flash),于 2026 年 8 月 27 日正式发布(GA)。InternLumina-U2:一款面向全方位视觉理解、图像生成与编辑的开放科学扩散大语言模型,代码于 2026 年 9 月 1 日发布。
• 权重 — Gemini Omni 1.1 Flash:无,封闭且仅限托管。InternLumina-U2:目前也还没有,但采用 Apache-2.0 许可,并明确标注“即将推出”。
• 你获得的输出 — Gemini Omni 1.1 Flash:带音频的10秒720p片段,可延长至40秒;可放大至1080p和4K;并附带文本。InternLumina-U2:暂无 — 只有推理代码和路线图。
• 输入内容 — Gemini Omni 1.1 Flash:文本、图像、视频(每个提示最多约 131K 输入 token;三个 10 秒片段)、音频。InternLumina-U2:称可处理文本、自然图像、密集图表、超过 64 个采样帧的视频,以及渲染为 64 个彩色和深度视图的 GLB/GLTF 3D 素材。
• 如何运行 — Gemini Omni 1.1 Flash:通过有状态的 Interactions API 使用 Google 的 Gemini API;AI Plus、Pro 和 Ultra 订阅用户可通过 Google Flow 获得消费者访问权限。InternLumina-U2:仅支持自托管,且仅在权重发布之后;代码需要拆分检查点目录、AToken 分词器权重、FlashAttention,以及用于 3D 路径的 Blender 4.5。
• 费用 — Gemini Omni 1.1 Flash:360p 草稿为 $0.03/秒,720p 为 $0.10/秒,1080p 为 $0.15/秒,4K 为 $0.30/秒;token 计价为输入每百万 $1.50、文本输出每百万 $9.00。InternLumina-U2:一旦问世,费用取决于你自己 GPU 的成本。

这两列度量的并非同一轴。Gemini这一侧已定价、已提供服务并能即刻投入使用;而InternLumina这一侧只是尚未成为模型的模型规格说明。
实际当前的部分:Gemini Omni 1.1 Flash 的 GA
本周 Gemini Omni 1.1 Flash 之所以重要,是因为谷歌的 Omni 视频产品线就此不再是预览版。早期 Gemini Omni Flash 预览端点计划于2026年9月30日关闭,这个 GA 模型正是开发人员被迁移到的替代品。升级列表十分具体:四十秒场景扩展基于十秒增量构建;关键帧控制可让你指定首帧和末帧,让模型生成中间的连接画面;最长三秒的参考片段可保持角色或场景一致;还有360p草稿档位,价格为720p的三分之一,运行速度最高提升60%,适合在昂贵的最终渲染前迭代提示词。如果你构建视频处理管线,价格表——720p每秒0.10美元,十秒片段1.01美元,通过四次扩展调用生成的四十秒720p场景约4美元——就是改变你成本模型的数字。
这些都不足以让它在任何操作层面成为 InternLumina-U2 的竞争对手。Gemini Omni 1.1 Flash 可以生成运动画面;而 InternLumina-U2——如果其说法在与权重接触后依然成立——则会理解运动并生成静态画面。一个本季度需要产品视频的团队不会在这两者之间做选择:Gemini 模型是两者中唯一能够实际调用的,并且可通过 Google 自己的 API 和多个第三方平台获取。

Google AI 开发者网站上 Gemini API 的“Models”文档,截图于 2026 年 9 月 2 日——该页面列出了当前的 Gemini 系列模型,侧边栏导航中显示有 Gemini Omni 系列。
完全不是当前的部分:InternLumina-U2
InternLumina-U2在9月1日的发布是悄无声息的那一种:三次对GitHub仓库的提交、一个项目页面、一个28字节的Hugging Face占位文件(其全部内容仅是一段Apache-2.0许可证头),以及没有任何公告。真正公开的是推理框架和架构,而它们之所以值得仔细阅读,恰恰是因为还没有人能够测试模型本身。该仓库展示了一个驱动程序,每个任务对应一个入口点——文本、最高1024×1024的文本生成图像、对自然图像和密集图表的图像理解、带可选双CFG模式的基于指令的图像编辑、对64个采样帧的视频理解,以及对Blender渲染的GLB/GLTF视图的3D理解。其设计赌注在于:一个多码本的离散视觉词表能让单一骨干网络完成以上所有任务,而无需增加序列长度——这与驱动codec原生视频模型的“视觉token应携带更多信息”的理念一脉相承,只不过被应用到了一个统一的理解与生成界面上。

2026年9月2日抓取的 InternLM/InternLumina-U2 GitHub 仓库——Apache-2.0 仓库主页,包含 "Multi-Codebook Diffusion Large Language Model" 描述、三个提交,以及目前整个公开版本所包含的按任务划分的推理脚本。
项目页面上的基准测试表被实验室自己标注为“初步、不完整的结果”,而表中的数字利弊兼有:亮眼的图表与文档得分(ChartQA 86.52、CharXiv-DQ 83.65,均为供应商报告)旁边,是 GenEval 的 0.81——低于实验室声称能超越的至少一个模型的 0.89。由于根本没有可供评估的模型,也就不存在独立的评估。在 safetensors 文件出现在那个空白的 Hugging Face 占位仓库之前,关于实际质量的一切都仍然只是宣称。
当只有一侧存在时,路由层会做什么
这是那种路由角度真正关乎时间而非选择的对比之一。我们不会假装 OrcaRouter 能服务 InternLumina-U2——没人能做到,权重尚未发布——Gemini Omni 1.1 Flash 也不在我们的目录中;你需要通过 Google 自己的 API 来访问它。在这一空白期,路由层的真正作用是保持你的选项开放,而不必把流水线重建两次。穿透模式就是这种机制:当某个托管的供应商模型真的进入目录时,供应商标价以 0% 加价穿透传递,因此供应商公布的每秒费率就是你所支付的每秒费率,只需一个密钥,而无需与每家供应商分别签合同。而当像 InternLumina-U2 这样的 Apache-2.0 权重发布终于到来时,理性的做法不是拆掉你正在工作的视频栈,而是把新模型架设在自动故障转移后面的测试路径上,这样,一旦未经证实的扩散模型第一次出问题,调用就会回退到你已经信任的模型,而无需更改代码。在不会伤到你的地方尝试新东西;把付账单的业务路由到可靠之处。
裁决
如果你这个月就需要视频能力,决定已经替你做好了:Gemini Omni 1.1 Flash 是真实存在的,已定价并全面开放,而 InternLumina-U2 目前谁都无法调用。如果你关注的是开放多模态研究的走向,InternLumina-U2 才是更有意思的产物——这是出自大型实验室的罕见押注,采用全离散、多码本架构,基于 Apache-2.0 许可,架构已经公开,权重估计也很快会发布。把该仓库视为研究方向的前瞻预览,把 GA 视频模型视为你今天就能在其上构建的工具,不要因为两者共享“多模态”这个标签,就认为它们在竞争同一项任务。
