一张生成的主视觉卡片,标题为“Qwen3.8-Omni-Flash vs InternLumina U2”,上方眉题为“租来的感官 vs 自有的权重”,副标题为“一个封闭的长媒体 API,对比一个可下载的 16B 扩散模型。”,并带有四个标签:“权重:闭源 vs Apache 2.0”“生成图像:仅一方支持”“上下文:1M vs 未披露”“此处可路由:皆否”。OrcaRouter 的 logo 合成于右下角。
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2:租用的感知 vs 自有权重

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

更有用的比较方式,是比较 Qwen3.8-Omni-FlashInternLumina U2,而不是看基准测试表中相同的行,因为它们并不出现在相同的基准上。而是看谁被允许运行它们。供应商的 Qwen3.8-Omni-Flash自 2026 年 9 月 18 日起向 API 客户开放,是供应商自有平台上的闭源模型:一百万 token 的上下文,每次调用最多一小时的连续音频和视频,仅文本输出,且不提供权重。上海人工智能实验室的 InternLumina U2是一个在 Apache 2.0 下发布的 16B-A1B 混合专家扩散模型,其 Ascend 检查点现在就可以从 Hugging Face 下载,而 NVIDIA 检查点和技术报告仍列为即将推出。一个是按 token 租用的服务。另一个是你可以持有的文件,但附带一个关于它目前运行在何种硬件上的限制条件。这一差异比任何一家供应商表格中的任何分数都更能决定实际部署。

InternLumina U2 实际上是什么

架构才是真正有趣的部分,而且它确实非同寻常。InternLumina U2是一个稀疏 MoE,总参数量为 160 亿,激活参数为 10 亿;它是扩散语言模型,而不是自回归模型——它并行地精炼整个序列,而不是从左到右逐个输出 token。它的视觉表示是完全离散的:基于 Apple 的 AToken 构建的八个视觉 token 码本,这正是让同一个模型既能读取图像又能生成图像、而无需在末端外挂一个独立解码器的原因。文本问答、文生图、图像理解、图像编辑、视频理解和 3D 理解,全都是同一个模型在同一个词表上做同一种工作。

• 规模与形态 — InternLumina U2 总参数量为 16B,激活参数 1B,采用稀疏 MoE 架构;Qwen3.8-Omni-Flash 的参数规模未公开。

• 生成 — InternLumina U2 可生成和编辑图像,并处理 3D 理解;Qwen3.8-Omni-Flash 完全无法生成任何媒体,仅返回文本。

• 解码 — InternLumina U2 是一个并行解码的扩散 LLM;Qwen3.8-Omni-Flash 是自回归的。

• 上下文与时长 — Qwen3.8-Omni-Flash 拥有 100 万 token 的窗口,单次调用可处理长达一小时的连续音视频;InternLumina U2 的公开资料对此只字未提,长音频也不在其列出的能力之中。

• 权重 — InternLumina U2 采用 Apache 2.0 许可,Ascend 检查点已发布,NVIDIA 检查点待发布;Qwen3.8-Omni-Flash 没有权重,也没有公布任何相关计划。

• 获取方式——InternLumina U2 可从 Hugging Face 下载,推理代码在 GitHub 上;Qwen3.8-Omni-Flash 则通过调用阿里云 Model Studio 或千问平台的 API 来使用。

• 独立评分——两者均无。InternLumina U2 自己的模型卡将其基准测试表标为“初步、部分结果”;Qwen 的评分则全部是与其自身前代对比,且未经复现。

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

自预览报道以来,权重问题已经发生了变化

如果你读过我们早前关于InternLumina U2代码首次出现时的介绍,那么情况在一个方向上已经改变,在另一个方向上则保持不变,而这两部分都很重要。Hugging Face 仓库不再是一个空壳:ascend/ 文件夹现在包含七个 safetensors 分片,以及配置、分词器和建模代码,这意味着任何拥有合适硬件的人都能真正下载并运行该模型。nvidia/ 文件夹仍被标记为“即将推出”,技术报告仍未发布,而且仓库自己的基准测试部分仍写着“初步、部分结果”。所以今天准确的说法不是“权重已发布”或“权重缺失”——而是某一个硬件堆栈的检查点已公布,另一个则没有,这对任何集群使用 NVIDIA 的人来说都是一个实际限制。

还有两件事悄然发生了变化。GitHub 仓库在最初 9 月 1 日发布之后很久仍在持续收到提交,因此已发布的代码是在被维护,而不是被搁置。而 Hugging Face 仓库上的下载计数器仍然显示为零,这与其说说明了模型本身,不如说说明了受众:一个带有优先适配昇腾的检查点的 16B-A1B 扩散模型,面向的是实验室,而不是本季度想要托管端点的产品团队。

两者真正重叠之处,以及并不重叠之处

图像理解是二者的交集,而它比看上去要窄。两个模型都能看着一张图片并回答关于它的问题,而这正是 Qwen3.8-Omni-Flash的全部工作,却只是 InternLumina U2六项工作中的一项。再往后,两者便迅速分道扬镳。InternLumina U2 接着可以在同一个模型里编辑那张图片,或依据提示词生成一张新图,并且沿用它在读图时所用的同一套视觉词汇。Qwen3.8-Omni-Flash 连一个像素都产不出来,但它能在一次调用中接收长达一小时的音频和视频,并告诉你谁在何时说了话、决定了什么——而这正是 InternLumina U2 已公开的材料完全没有声称能做到的事。

那种比人们想象中更不重要的重叠,是视频。两者都被描述为能处理视频,但它们对视频所做的是不同的事:一个把一段长录像当作文档来理解,另一个则把视频作为一种与 3D 并列的视觉模态来处理。需要把一小时素材做摘要的团队,得不到后者的帮助;而需要生成一帧画面的团队,也得不到前者的帮助。

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

成本、控制权,以及你真正购买的是什么

两者的定价根本不在同一个维度上。Qwen3.8-Omni-Flash按 token 计费——国际价目表为每百万输入 $0.15、缓存 $0.016、输出 $0.47,另有一份不可比的中国大陆价目表——而其发布时的头条宣传是厂商自报的、一小时音频输入成本降低超过 98%,算法是把一段两分钟的样本计价再乘以三十,视频采样为 720p、每秒一帧。InternLumina U2则分文不取,因为根本无可计费:成本就是你的硬件和你的时间,而该模型自己的模型卡也没有公布任何吞吐量数字,好让你把它换算成每 token 的价格。

这就是一句话概括的权衡。API 提供你无法自托管的能力,以及随使用量扩展的按小时成本;开放权重则给你固定成本和对数据路径的完全控制,代价是你必须自行构建推理栈,以及目前意味着 Ascend 硬件的检查点集合。对于媒体不能离开所在场所的受监管工作负载,后者不是一种偏好——而是本页面上唯一的选择。对于本月就需要长音频分析的团队,前者是本页面上唯一的选择。

OrcaRouter 目前并不托管这两款模型,我们宁愿把这一点直说,也不愿暗示一条并不存在的路由路径:Qwen3.8-Omni-Flash只在阿里自家的平台上运行,而InternLumina U2是一个可下载的模型,而非一个端点。我们实际运行的是 Qwen3.8 系列的其余部分——Qwen3.8-FlashQwen3.8-Max——通过一个 API,按供应商标价、0% 加价提供,这是在开源权重一侧仍在理清其 NVIDIA 检查点之际,为本次对比中的闭源模型一侧保住一个可用基线的务实做法。

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

你究竟该选哪一个

选择 InternLumina U2,前提是你需要一款能读取、生成和编辑图像的模型,并且愿意自行承担推理栈——同时你的加速器是昇腾,或者你能等待 NVIDIA 检查点。在这两款模型中,它是唯一能创建图像的,也是唯一无需将数据发送给厂商即可运行的。在技术报告发布之前,请将其基准测试数据视为未经证实,因为模型卡上正是这么写的。

选择 Qwen3.8-Omni-Flash如果你的问题是数小时的音频和视频,而不是像素输出——会议智能、长录音分析、以中英文为主的音频密集型智能体工作——并且你能接受单一来源依赖和纯文本输出,那就选它。它在输入音频时长方面的成本表现很有优势,但在总账单上要弱得多;它的基准测试由厂商自报且未经复现;而首批出现的第三方测试结果显示,其在推理上处于第28百分位,且样本量之小,应当促使你先做一次测试,而不是直接做决定。

如果你两者都需要,它们是互补的,而不是替代方案:一个是你自己托管的开放权重图像模型,另一个是你调用 API 的闭源长媒体模型。目前,这两者都无法经由我们路由。一方面值得关注的是 NVIDIA 的检查点与技术报告;另一方面则是首次独立评测——它至今尚不存在,而这也是迄今为止Qwen3.8-Omni-Flash的所有文字中最大的单一空白。