一张用于对比“InternLumina-U2 vs Qwen2.5 Omni”的 Hero 标题卡片,副标题为“阿里巴巴已交付的全能模型 vs 仍然只停留在承诺中的那一个”,并带有三个统计标签——“Qwen2.5 Omni:已上线 17 个月”“InternLumina-U2:一天的代码量”“双方均为 Apache-2.0”——右下角带有 OrcaRouter 标志。
Guides & Insights

InternLumina-U2 对比 Qwen2.5 Omni:阿里巴巴已交付的 Omni 模型 vs 上海人工智能实验室仍被寄予厚望的那一款

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

InternLumina-U2 和 Qwen2.5 Omni 是对同一个愿景的两种回答——用单一模型处理所有模态,而非一群各司其职的专用模型——但两者相隔了两代。Qwen2.5 Omni 是真正落地发布的那一个:一个 2025 年 3 月发布的 70 亿参数开放权重模型,截至本文撰写时已问世十七个月,可接收文本、图像、音频和视频输入,并以文本或自然的流式语音作答。InternLumina-U2 是上海人工智能实验室给出的答案,于 2026 年 9 月 1 日以推理代码形式发布:一个 160 亿参数的稀疏扩散模型,声称能够感知图像、视频和 3D 内容,并通过一个共享的离散词元接口生成与编辑图像。全模态理念的这一代产品已投入生产应用一年半;另一代则刚满一天,而且因为其权重尚不存在,任何人都无法运行它。两者之间的差距,就是兑现的承诺与许下的承诺之间的区别。

已发布的 Omni:Qwen2.5 Omni

Qwen2.5 Omni作为基线模型值得认真对待,因为它是少有的真正兑现了"感知一切,以任意形式作答"承诺的开源模型。其Thinker-Talker架构将文本思考器与负责渲染语音的说话器配对,采用时间对齐的多模态位置编码,使音频和视频保持同步;输入涵盖文本、图像、音频和视频,输出可在同一轮次中生成文本加语音,并内置四种语音。其限制与能力一样有明确记录:上下文为32K token,不支持函数调用,也没有结构化输出,它是一个全能型对话者,而非智能体。它不能做什么,对本次对比而言值得强调——它能感知图像、音频和视频,但无法生成它们。Qwen2.5 Omni中的"Omni"指的是全模态感知,外加输出端的语音合成;像素输入,文字输出。

这份履历是实打实的。该模型已被下载数十万次,通过开发者自己的平台和多个第三方平台提供托管 API,并在十七个月里积累了量化版本、社区工具和明确的价格——聚合平台列表显示,文本输入约每百万 token 0.09 美元,输出约每百万 token 0.34 美元,音频另行计费。十七个月久到足以让它的优势和局限都被摸清。这就是成熟所带来的:不是完美,而是可预测性。

应许的全能者:InternLumina-U2

InternLumina-U2正试图比Qwen2.5 Omni再进一步,而这恰恰是难点所在。其设计理念是:感知与生成应共享同一个离散词元接口——不再是"一个语言模型负责感知视频、另一个独立的扩散模型负责绘制"的组合,而是一个稀疏MoE扩散骨干(总参数16B,激活参数1B),既能读取图像、图表、视频或3D资产,也能生成新图像或执行编辑。它采用完全离散的八码本视觉词表,使每个视觉位置都携带足够的信息来支撑两个方向的任务。这比Qwen2.5 Omni的主张实质性强得多。将所有输入模态路由到文本和语音是一回事;让同一组权重生成像素时能像推理像素一样流畅,则完全是另一回事。

目前,这也是一个无法验证的说法。该实验室发布了推理代码、一个带有“初步、不完整”基准测试表的项目页面,以及一个空的 Hugging Face 占位仓库;权重、训练代码、技术报告和 Ascend-NPU 技术栈均被标记为“即将推出”。目前不存在任何独立评估,因为没有任何可评估的内容。Qwen2.5 Omni 的架构在发布当周即可核查,因为权重随之一同发布;InternLumina-U2 的架构如今已可查看,但其质量仍只是厂商的承诺。

记分牌

由于其中一个模型有十七个月的历史,而另一个只有一天的代码,因此这些行承载着各自的来源,而不是假装各列是对称的。

• 年龄 — Qwen2.5 Omni:2025年3月发布,已在真实环境中运行17个月,下载量达数十万次。InternLumina-U2:推理代码于2026年9月1日发布,下载量为零,独立运行为零。

• 形态 — Qwen2.5 Omni:约7B参数的端到端模型,采用Thinker-Talker架构,具备时间对齐的多模态位置编码。InternLumina-U2:总参数16B/激活参数1B的稀疏MoE扩散大语言模型,配有八码本离散视觉分词器。

• 输入——两者都支持文本和图像;Qwen2.5 Omni 还额外支持音频和视频,用于全模态对话;InternLumina-U2 还宣称支持对 64 个采样帧的视频理解,以及对 Blender 渲染的 GLB/GLTF 视图的 3D 理解。

• 输出 — Qwen2.5 Omni:文本与流式语音(四种音色)。InternLumina-U2:宣称支持文本、最高 1024×1024 的文生图,以及基于指令的图像编辑。

• 生成前沿 — Qwen2.5 Omni:生成文字和语音,而非像素。InternLumina-U2:尝试在读取文本所用的同一离散标记模型中进行像素生成与编辑。

• 权重与许可证 — 两者原则上均为 Apache-2.0 开放权重;Qwen2.5 Omni 的权重今天即可下载,InternLumina-U2 的权重尚未公开。

• 部署服务 — Qwen2.5 Omni:提供托管 API,并支持自托管(全精度部署,体量较大);已知上下文长度为 32K,不支持函数调用。InternLumina-U2:无法提供服务——已发布的驱动所依赖的检查点不存在。

• 重点数字 — Qwen2.5 Omni:长期在 OmniBench 排行榜占有一席之地(当前榜单得分约为 0.561);InternLumina-U2:ChartQA 86.52、MathVision 33.22、GenEval 0.81——均为厂商报告,属初步且部分的数据。

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

为什么代沟才是真正的问题

先把发布时间放到一边,实质的差别在于每个模型各自止步的能力边界。Qwen2.5 Omni 选择了一个容易落地的全模态版本:感知覆盖面广,用语言或语音来回答,而把图像与视频生成交给技术栈里其他专门的生成模型。这种分工方式正是 2026 年几乎所有生产级多模态系统的构建方式,也正是 Qwen2.5 Omni 能在 2025 年发布并到 2026 年仍不失其价值的原因——它把自己的分内事做好,并能与其余部分顺畅组合。InternLumina-U2 押注的是:分工本身就是问题所在——一个被迫在同一个共享离散词表中表征一切的模型,即既表征感知也表征生成,会比一个只需要描述视觉的模型学到更深层的视觉理解。这笔押注若是对了,那将是更重要的成果;若是不对,InternLumina-U2 到头来不过是更慢、更耗资源、还硬把图像生成器塞进同一套权重的 Qwen2.5 Omni。整场较量——而且这是已落地的设计与一个尚未证实的假说之间的较量,不是两个可运行模型之间的较量——说到底就在于:更艰难的架构本身,是否站得住脚。

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

Qwen/Qwen2.5-Omni-7B 的 Hugging Face 模型卡,截取于 2026 年 8 月 27 日——展示了 Thinker-Talker 概览、Apache-2.0 许可证,以及模型的文本、图像、音频和视频模态标签。

一年半的下载量实际上能买到什么

成熟不是一种氛围,而是一份你所知道的事情清单。用 Qwen2.5 Omni,你知道 32K 上下文是硬性约束,也能在工程上绕着它做设计。你知道没有函数调用这条路径,也不会假装有。你大致知道一次部署要花多少钱——无论是通过托管 API,还是用你自己的 GPU 跑——因为这个模型已经被足够多的人定价、运行过,数字已经沉淀下来。你知道 OmniBench 上的表现是实实在在的,因为独立排行榜已经追踪它一年多。而对 InternLumina-U2 来说,上面这些“知道”一个都不成立——你不知道,也不可能知道,因为还不存在实际产物。当一个模型才一天大、还没有分量的时候,关于它的每句话都只是意向声明。这种不对称并不是在贬低科学;对任何正在选择以什么为基础来构建的人来说,这才是正确的认识论立场。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

于2026年9月2日抓取的 InternLM/InternLumina-U2 GitHub 仓库——公开其架构的仓库落地页——包含描述、许可证和推理脚本,而权重本身不在文件树中。

如实呈现的路由决策

我们将直截了当地说明可用性:OrcaRouter 并不托管 InternLumina-U2,因为根本没有权重可供任何人托管;我们目前也没有接入 Qwen2.5 Omni——它通过开发者自己的 API 和第三方平台运行。所以这里的路由教训在于姿态,而不是今天就能用一个密钥调用这两个模型。真正持久的模式,是每一场“成熟模型对阵后来者”的抉择最终都会遇到的:把久经检验的模型留在主路径上——在那里,一个 API 覆盖 200+ 模型、0% 加价直通,意味着你只需按服务商标价付费,仅此而已;把未经验证的新模型指向带自动故障转移的测试路径,这样当它第一次卡顿、偏离或返回胡言乱语时,调用就会自动回退到那个拥有十七个月稳定记录的模型上。这样一来,当 InternLumina-U2 这样雄心勃勃的新架构权重发布的那一天,你就能去评估它——而不必拿你已经依赖的生产路径去冒险。

裁决

Qwen2.5 Omni 是你现在就可以基于其构建的全能模型:已交付、可下载、有文档、局限已知、价格已定。InternLumina-U2 则是值得关注的全能模型:它在架构上真正迈出了从感知迈向创造的一步,采用 Apache-2.0 许可,代码已公开,权重待发布。如果该实验室的多码本押注能经得起独立测试的检验,InternLumina-U2 与其说是 Qwen2.5 Omni 的对手,不如说是同一理念的下一代。如果不能,那么那个真正发布、已有十七个月之久的通用模型仍会在那里,一如既往地履行职责。敬请关注 Hugging Face 上的占位页面;最终结论要看 safetensors 文件,而不是这篇文章。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube