一张标题卡,将采用 MIT 许可、独立 Intelligence Index 为 25 且具备 NVIDIA CUDA 服务路径的 124B 参数、5.5B 激活视觉语言模型 Ling-3.0-flash-VL,与采用 Apache-2.0 许可、其唯一已发布检查点在 Ascend 上训练的 16B 参数、1B 激活多码本扩散模型 InternLumina U2 进行对比,涵盖理解以及生成、编辑和 3D。
Guides & Insights

Ling-3.0-flash-VL 与 InternLumina U2:均已发布,芯片不同

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这两个模型现在都已真实存在、可运行且可下载,而两周前还并非如此——它们之间的差异几乎与基准测试无关。Ling-3.0-flash-VL,来自蚂蚁集团 inclusionAI 实验室,于2026年9月4日至8日间将 BF16 和 FP8 权重发布到 Hugging Face,并随权重发布了 SGLang 和 vLLM 服务配方,在 Artificial Analysis Intelligence Index v4.3 上获得了25分的独立评分。InternLumina U2,来自上海人工智能实验室 InternLM 团队,先发布了推理代码,随后于9月10日将其 在昇腾上训练的模型权重发布到 Hugging Face——七个 safetensors 分片位于一个 ascend/子文件夹中,使该仓库最终共有十六个文件。

问题在于这两次权重发布究竟是为谁打造的。Ling-3.0-flash-VL 公布的路径是人人都有的 CUDA 那条:一台八加速器节点运行 FP8 版本,而服务栈就是你已经在跑的那些。InternLumina U2 公布的检查点是昇腾版本,README 明确说明你要根据自己计划如何运行推理来下载对应的检查点——而 NVIDIA 训练的检查点仍被列为即将推出。同一周发布的两个模型,却只有一个能跑在大多数团队正面对的硬件上。

这样一改,就把比较放到了更有用的框架里。这不再是一篇已发布产品对雾件的文章,任何仍把 InternLumina U2 说成权重待发布的人,依据的都是一周前的 README。它讲的是两种截然不同的统一视觉设计,它们分别出现在两个不同的芯片生态中,并且讨论每次发布中究竟哪些部分真正完成了。

每个版本现在包含的内容

Ling-3.0-flash-VL 是一个 1240 亿参数的稀疏混合专家模型,每个 token 激活约 55 亿参数,其 42 层混合主干以 5:1 的比例交替使用 Kimi Delta Attention 与门控 MLA 模块。一个任意分辨率的视觉编码器和两层 MLP 投影器为该主干提供输入,由 VideoRoPE 负责处理空间与时间位置。它接受文本、图像和视频输入,并返回文本。BF16(64 个分片)与 FP8(约 126 GB,视觉塔被刻意保持在高于专家权重的精度)均以 MIT 许可证公开发布,而且此次发布的完整程度足以让独立基准评测社区对其打分——在 Intelligence Index v4.3 上得 25 分,在其规模类别中位列 64 个模型中的第 2 名,而该类别的中位数为 8。它没有公布的,是视觉模型的每 token 价格;其 API 示例带有一个-rc1标识符,这使得实际提供服务的检查点是否与开放权重一致仍悬而未决。

InternLumina U2 是一个 16B 参数的稀疏混合专家模型,激活参数约 1B,基于 LLaDA-2.0 MoE 扩散语言模型骨干构建,将六类任务族集于一个模型之中:文本问答、文生图、图像理解、图像编辑、视频理解和 3D 理解。上述全部任务的推理代码已在main 上公开。昇腾训练的检查点现已在 Hugging Face 上公开。根据该仓库自身的路线图,仍未完成的是:NVIDIA 训练的检查点、训练代码(另一个独立仓库)以及技术报告。路线图勾选了四项,留下两项未完成——推理代码、昇腾权重以及昇腾训练与推理栈已完成;训练代码和技术报告尚未完成。

有一个实际细节横在这两段之间。要运行 U2 的视觉路径,需要位于 atoken_inference/checkpoints/atoken-sod.pt 的 AToken 分词器权重,而发布的驱动程序期望一个拆分式检查点目录,并将模型资源保持在一起。代码是真实可用的,可基于 Python 3.11、PyTorch 2.6.0 安装,而在 CUDA 路径上还需要 flash-attn 2.7.2。Ascend 支持位于单独的 ascend-npu-support 分支上,需要 CANN 以及与之匹配的 torch_npu 构建来替代 CUDA 工具链。这些都没有藏起来;全都有文档记录。它只是比 pip install 再加上一个模型字符串要走的路更长一些。

关于“什么是视觉 token”这个问题的两个回答

这些架构在比参数数量更深层的某处产生了分歧,而这种分歧正是把二者并置比较时最有趣的地方。

Ling-3.0-flash-VL 沿用标准契约。图像经视觉编码器和投影器变为一串 token,这些 token 进入 Transformer 主干,一切均以自回归方式运行。新颖之处不在于视觉如何表示,而在于主干运行得多么廉价——124B 总参数中每个 token 仅激活 5.5B 参数,这正是该模型出现在智能与激活参数前沿上的全部原因。VideoRoPE 为空间和时间位置提供了一致的编码,因此视频无需单独的机制。

InternLumina U2 改变的是表示本身。它使用 Apple 的 AToken 分词器,其中每个视觉位置由八个互补码本来描述——局部纹理、内嵌文本、几何结构与高频细节分别作为独立流,而不是一个坍缩后的向量。每个码本在输入端保留自己的嵌入,而每个位置的八个嵌入会被拼接起来,并投影降维为单个主干 token。在输出端,预测采用团队所称的空间并行、码本深度自回归:扩散主干一次对许多被掩码的空间位置去噪,然后一个多码本自回归头按顺序预测每个位置的八个码。理解与生成通过同一套机制运行——这才是真正的主张。团队的观点是,单一码本限制了单个视觉 token 能承载多少信息,而离散-连续混合方案把理解与生成拆分到不同的表示和解码路径上,因此采用多个码本实现完全离散,才能得到真正统一的模型,而不是两套被硬拼在一起的堆栈。

这两种立场都自洽,但代价正好相反。多码本表示能够承载更精细的视觉细节;但它们也会按码本数量成倍抬高每张图像的 token 预算,并使解码变得相当复杂,这大概正是 16B-A1B 这一规模被选中的部分原因。Ling 的稀疏性换来了低廉的逐 token 推理成本;这也意味着每次前向传播的激活容量更小,而智能指数上 8 这一同类中位数正悄然体现了这种取舍——Ling-3.0-flash-VL 以 25 轻松超过该中位数,但在原始推理能力上,它并未与稠密的前沿模型正面竞争。

任务界面仅部分重叠

把两者都归入“多模态模型”,夸大了它们的重叠程度。知道重叠在哪里结束,能避免很多糟糕的对比选择。

• 输入 — Ling-3.0-flash-VL 接收文本、图像和视频,每次请求最多 40 张图像,并返回文本;InternLumina U2 接收文本、图像、视频和 3D 资产,并返回文本、生成的图像或编辑后的图像br /> • 图像生成 — Ling-3.0-flash-VL 完全无法生成或编辑图像;InternLumina U2 的核心主张是二者皆能,最高支持 1024×1024,且出自读取图像的同一套权重br /> • 3D — Ling-3.0-flash-VL 没有 3D 路径;InternLumina U2 搭载了一条基于 Blender 的流水线,可将 GLB 和 GLTF 资产渲染为 64 组配对的彩色与深度视图,供模型进行推理br /> • 视频 — Ling-3.0-flash-VL 通过 VideoRoPE 时间编码处理视频;InternLumina U2 采样 64 帧br /> • 上下文与输出 — Ling-3.0-flash-VL 实测上下文窗口为 262K token,而其模型卡标明为 256K,且最大输出相对较短;InternLumina U2 两项数据均未公布br /> • 活跃参数 — Ling-3.0-flash-VL 每个 token 激活约 5.5B;InternLumina U2 激活约 1B,仅为前者的五分之一

读完那份清单,结论是:这两者恰好只在一个任务上互为替代品——读取图像并回答关于图像的问题——而在几乎所有其他方面都是互补关系。如果你需要一个能生成或编辑图像的模型,Ling-3.0-flash-VL 不是候选者,任何基准测试都改变不了这一点。如果你需要一个能读取图表、生成变体并对 3D 资产进行推理的模型,InternLumina U2 正是为此而设,而 Ling-3.0-flash-VL 并不涉及这一领域。

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

基准测试:一个独立分数,对比一整页厂商数据

证据质量相差并不小,与其断言谁胜谁负,不如精确说明其中的原因。

Ling-3.0-flash-VL 在 Intelligence Index v4.3 上的 25 分,是基于已发布协议的第三方运行结果;作为背景,同类中位数为 8;实测吞吐量为每秒 142.9 个输出 token,而同类中位数为 105.1,首 token 时间为 2.21 秒。其厂商卡片另行声称 42 分,依据的是已退役的 v4.1.1协议,但这是不同的量表,不能与 25 分并列,仿佛该模型退步了;该指数于 2026 年 9 月被重新表述,并进行了全面重新评分。厂商还报告称,以 "linthium" 为代号,在 Image-to-WebDev Arena 中以 1,441 比 1,440 战胜 GPT-5.4——一分之差处于 Elo 噪声范围内,且为厂商自报。

InternLumina U2 的数值来自该实验室自己,被标注为初步且不完整,完整的对比表和技术报告仍待发布。它们现在位于代码仓库 README 的一个表格中,而不是在基准排行榜上,而且由于尚无第三方发布运行结果,它们还无法被独立验证。按该实验室的表述如下:

• 理解 — ChartQA 86.52,CharXiv-DQ 83.65,HallusionBench 62.15,MMMU-Pro 36.13,MathVision 33.22,DynaMath 56.37br /> • 视频 — Video-MME 51.26,MVBench 59.74,MLVU 57.03br /> • 生成与编辑 — GenEval 0.81,DPG 87.10,TIIF Short 84.60,TIIF Long 85.95,ImgEdit 3.83br /> • 来源 — InternLumina U2 的每一项数据均由厂商提供且为初步数据;Ling-3.0-flash-VL 的每一项数据均由厂商提供,但 Intelligence Index 除外,该数据来自 Artificial Analysis

其中两项值得标出。根据该实验室自己的表格,GenEval 0.81 落后于一家具名竞争对手的 0.89——这是厂商罕见地公布一项劣势的实例,也让人稍微更有理由信任表格的其余部分。而 ImgEdit 的 3.83 若没有随附表格就毫无意义,而随附表格正是待发布技术报告将包含的内容之一。请把 InternLumina U2 清单视为该实验室有意为之辩护的结果,而不是你可以据此行动的结果。另请注意,其理解分数与 Ling-3.0-flash-VL 的指数得分并非可比的量:前者是一组任务特定的厂商数字,后者是第三方综合指数。

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

许可证、硬件,以及对二者分别下注实际需要付出多少成本

Ling-3.0-flash-VL 在两种精度格式下均采用 MIT 许可,这几乎已是开放权重所能达到的最干净状态——没有附加条款,没有使用领域限制,商业部署也不存在任何模糊之处。FP8 构建版本约 126 GB,可放入一个配备八块 80GB 级加速器的节点;BF16 则大约是其两倍。SGLang 和蚂蚁维护的 vLLM 分支已提供服务支持。剩余风险是商业性的,而非法律性的:蚂蚁没有公布该视觉模型的每 token 费率,Ling Studio 上的免费访问是促销性质而非正式价目,Artificial Analysis 将其列为输入和输出均为每 100 万 token 0.00 美元,仅仅是因为它能看到的端点是免费的那个。

InternLumina U2 主仓库采用 Apache-2.0 许可,但有两处例外值得一读:捆绑的 VeOmni/ 目录保留其上游 Apache-2.0 许可证,而 atoken_inference/则源自 Apple 的 ml-atoken,并按照 Apple 的原始条款重新分发。关于基础设施的说法是认真的——它同时面向 NVIDIA GPU 和华为昇腾 NPU,并在两个后端之间实现算子级数值对齐;团队称已在千卡昇腾集群上完成端到端训练,借助融合算子、调优的 HSDP 分片和梯度检查点,训练效率提升了 1.85×。这是实打实的工程。但它与模型本身好不好无关:在昇腾上的训练效率说明不了输出质量,而目前存在的那个检查点,正是面向这一技术栈的。

所以,实际的不对称并不在于开源与闭源。两者都是开放的,都采用宽松许可证,而且如今都可下载。问题在于,一个版本假定你大概率已拥有的硬件,另一个则假定你大概率并不拥有的硬件。如果你的集群是NVIDIA,Ling-3.0-flash-VL一个下午就能搞定,而InternLumina U2则要等。如果你的集群是Ascend——在这个模型所面向的中国市场越来越常见——这个等式就完全颠倒过来,InternLumina U2是那条已铺好的路,而Ling-3.0-flash-VL的方案则假定使用CUDA。

关于这种搭配,人们实际会问的问题

InternLumina U2 的权重现在可以下载了吗?

是的,经过昇腾训练的 checkpoint 是——ascend/发布在 Hugging Face 上,共七个 safetensors 分片,同时还包含配置、分词器和建模文件。NVIDIA 训练的 checkpoint 位于单独的子文件夹中,目前仍标注为即将推出,训练代码和技术报告也尚未发布。

Ling-3.0-flash-VL 是否因为拥有独立评分而严格更优?

不——它的证据更充分,在常见硬件上也更容易运行,这属于另一种论断。Ling-3.0-flash-VL 无法生成或编辑图像,无法处理 3D 资产,也没有公布价格。如果你的任务是图像生成、图像编辑或 3D 理解,InternLumina U2 能够处理,而 Ling-3.0-flash-VL 则完全无法处理,无论 Ling 模型有多少项基准测试成绩。

Ling-3.0-flash-VL 的模型卡上的 42 与 Artificial Analysis 的 25 相矛盾吗?

不是直接可比。42 分是按照 Intelligence Index 协议 v4.1.1 测得的,25 分则是按照 v4.3 测得的;该指数于 2026 年 9 月被重新表述,并进行了全面重新评分,而且这两个版本基于不同的评估集构建。可以说的是,42 分从未被独立复现,而 25 分则已被独立得出。

在可以调用其中任意一个的地方

Ling-3.0-flash-VL 和 InternLumina U2 都不在我们的模型目录,若说不是这样,那就是读者十秒内就能核实的主张。Ling-3.0-flash-VL 可通过 Ant 自己的平台访问,该平台发布一个兼容 OpenAI 的端点和一个兼容 Anthropic 的端点,也可通过 Ling Studio 上的免费试用访问,如果你自行部署开放权重,还可通过开放权重访问。InternLumina U2 可通过 Hugging Face 检查点和该仓库的推理驱动访问,运行在该检查点所面向的硬件上。

我们实际路由的,是这一组合在实践中最常被拿来对比的视觉模型:DeepSeek V4 Flash Vision Exp,它已在目录中上线,具备 1M token 上下文窗口和已公布的费率,并与目录中其他模型共用同一个 OpenAI 兼容端点。当实验室发布开放权重时,路由层通常无需等待实验室自有的托管服务稳定下来,就能提供该模型——这正是模型“可被报价”与“可被调用”之间的实际差别。这一差别对 Ling-3.0-flash-VL 已经生效;而在目前,对 InternLumina U2 而言还只是理论上的,因为它的发布路径关乎硬件,而非托管问题。

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

结论确实存在分歧,而且分歧在于硬件和任务,而非质量。Ling-3.0-flash-VL 是一个完整的发布:MIT 许可、两种精度格式、第三方评分、CUDA 优先,且仅限于理解。InternLumina U2 是更具雄心的设计,也是完成度更低的发布:只发布了一个硬件栈的检查点,一个统一覆盖六项任务的界面,包括生成和 3D,而技术报告仍待补上。如果你这周需要在 NVIDIA 硬件上用一个视觉模型,选择不言自明。如果你感兴趣的是 InternLumina U2 的多码本设计,那么要关注的就是 NVIDIA 检查点——而在那之前,诚实的立场是:它的基准测试表,包括它输掉的那一行,所描述的是一个后半部分尚未发布的模型。