Ling-3.0-flash-VL — MITライセンスの124Bパラメータ・5.5Bアクティブの視覚言語モデルで、独立したIntelligence Indexは25、NVIDIA CUDAのサービングパスを備える — と、InternLumina U2 — Apache-2.0ライセンスの16Bパラメータ・1Bアクティブのマルチコードブック拡散モデルで、公開されている唯一のチェックポイントがAscendでトレーニングされており、理解に加えて生成、編集、3Dをカバーする — を対比させるタイトルカード。
Guides & Insights

Ling-3.0-flash-VL 対 InternLumina U2:どちらも出荷済み、異なるシリコン

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これらのモデルはどちらも今や実在し、実行可能で、ダウンロードも可能です。これは2週間前には当てはまりませんでした — そして両者の違いは、ベンチマークとはほとんど関係がありません。Ling-3.0-flash-VLは、Ant GroupのinclusionAIラボによるもので、2026年9月4日から8日にかけてBF16とFP8の重みをHugging Faceに公開し、あわせてSGLangとvLLMのサービングレシピも公開、さらにArtificial Analysis Intelligence Index v4.3で独立したスコア25を獲得しました。InternLumina U2は、上海AIラボ(Shanghai AI Laboratory)のInternLMチームによるもので、推論コードを先に公開し、その後Ascendで学習されたモデルの重みを9月10日にHugging Faceへ公開しました — 7つのsafetensorsシャードがascend/サブフォルダに収められ、リポジトリは合計16ファイルとなっています。

肝心なのは、それら2つの重み公開が何向けに作られたかだ。Ling-3.0-flash-VLの公開されている道筋は、誰もがすでに持っているCUDA向けだ。8アクセラレータノードでFP8ビルドを実行し、サービングスタックもすでに動かしているものを使う。InternLumina U2の公開チェックポイントはAscend向けで、READMEには、推論をどう実行する予定かに合ったチェックポイントをダウンロードするよう明記されている——NVIDIAで学習されたチェックポイントは依然として近日公開と記載されている。同じ週にリリースされた2つのモデルで、ほとんどのチームが目の前にしているハードウェアで動くのは、そのうち片方だけだ。

それはこの比較を有益な形で捉え直させる。これはもはや、リリース済み対ベイパーウェアの記事ではない。そして、InternLumina U2 をいまだに weights-pending(重み未公開)と表現している人は、一週間前の README に基づいて作業している。これは、二つの異なるシリコンエコシステムに登場した、大きく異なる二つの統合ビジュアル設計についての記事であり、それぞれのリリースのどの部分が実際に完成しているかについての記事だ。

各リリースに現在含まれる内容

Ling-3.0-flash-VLは、124BパラメータのスパースなMixture-of-Experts(MoE)で、トークンあたり約5.5Bのパラメータを活性化し、42層のハイブリッドトランク上でKimi Delta Attentionとゲート付きMLAブロックを5:1の比率で交互に配置している。任意解像度のビジョンエンコーダと2層のMLPプロジェクタがそのトランクに供給し、VideoRoPEが空間位置と時間位置を処理する。テキスト、画像、動画を入力として受け取り、テキストを返す。BF16(64シャード)とFP8(約126GB、ビジョンタワーはエキスパート重みよりも高い精度に意図的に保持されている)はいずれもMITライセンスの下で公開されており、このリリースは独立したベンチマークコミュニティが採点したほど完全である——Intelligence Index v4.3で25、同サイズクラス64中2位、クラス中央値は8。公開していないのは、ビジョンモデルのトークンあたりの価格であり、そのAPI例には-rc1という識別子が含まれており、提供されるチェックポイントがオープンウェイトと一致するかどうかは未解決のままである。

InternLumina U2は、約1Bのアクティブパラメータを持つ16BパラメータのスパースなMixture-of-Expertsであり、LLaDA-2.0 MoE拡散言語モデルのバックボーン上に構築されており、1つのモデルで6つのタスクファミリーをカバーします。テキストQA、テキストから画像の生成、画像理解、画像編集、動画理解、3D理解です。これらすべての推論コードはmainで公開されています。Ascendでトレーニングされたチェックポイントも現在Hugging Faceで公開されています。リポジトリ自身のロードマップによれば、まだ未対応なのは、NVIDIAでトレーニングされたチェックポイント、トレーニングコード(別リポジトリ)、および技術レポートです。ロードマップでは4つの項目にチェックが入り、2つが未チェックのままです — 推論コード、Ascendの重み、Ascendのトレーニングと推論スタックは完了、トレーニングコードと技術レポートは未完了です。

その2つの段落の間には、実用的な詳細が1つあります。U2 のビジョンパスを実行するには、AToken トークナイザーの重みがatoken_inference/checkpoints/atoken-sod.ptに必要であり、リリースされたドライバーはモデル資産をまとめて保持する分割チェックポイントディレクトリを前提としています。コードは実在し、Python 3.11、PyTorch 2.6.0、および CUDA パスでは flash-attn 2.7.2 向けにインストールされます。Ascend サポートは別のascend-npu-supportブランチにあり、CANN と、対応するtorch_npuビルドが、CUDA ツールチェーンの代わりに必要です。そのどれも隠されていません。すべて文書化されています。それは単に、以下よりも長い道のりです:pip installとモデル文字列。

「視覚トークンとは何か」という問いへの2つの答え

これら2つのアーキテクチャは、パラメータ数よりも深いところで食い違っており、その食い違いこそが、これらを並べて比較する上で最も興味深い点だ。

Ling-3.0-flash-VL は標準的な契約を維持している。画像はビジョンエンコーダーとプロジェクターを通じてトークン列になり、それらのトークンはトランスフォーマーのトランクに入り、すべてが自己回帰的に動作する。新規性は視覚がどのように表現されるかではなく、トランクがいかに安価に動作するかにある——総パラメータ124Bのうち、トークンあたり5.5Bのアクティブパラメータであり、これこそがこのモデルが知能対アクティブパラメータのフロンティアに現れる理由そのものである。VideoRoPE は空間的位置と時間的位置に一貫したエンコーディングを与えるため、動画に別個の仕組みは不要である。

InternLumina U2は表現そのものを変える。AppleのATokenトークナイザーを採用しており、そこでは各視覚位置が次のものによって記述される:8つの相補的コードブック — ローカルテクスチャ、埋め込みテキスト、ジオメトリ、高周波の細部を、1つの潰れたベクトルではなく別々のストリームとして扱う。各コードブックは入力時に独自の埋め込みを保持し、位置ごとの8つの埋め込みは連結されて単一のバックボーントークンに射影される。出力時には、チームが空間並列・コードブック深さ方向自己回帰と呼ぶ予測が行われる:拡散バックボーンがマスクされた多数の空間位置を一度にノイズ除去し、その後マルチコードブック自己回帰ヘッドが各位置の8つのコードを順に予測する。理解と生成は同じ機構を通って実行される — これが実際の主張である。チームの論点は、単一のコードブックでは1つの視覚トークンが運べる情報量に上限ができる一方、離散・連続ハイブリッドは理解と生成を異なる表現と復号経路に分割してしまうこと、そして複数コードブックで完全に離散化することが、2つのスタックをボルトで留めただけではない真に統合されたモデルを得る方法だということである。

どちらも一貫した立場であり、それぞれ逆のコストを伴います。マルチコードブック表現は、より細かい視覚的詳細を保持できます。また、画像あたりのトークン予算をコードブックの数だけ増やし、デコードをかなり複雑にします。おそらくこれが、16B-A1B が選ばれたスケールである理由の一部なのでしょう。Ling のスパース性は、安価なトークン単位推論を可能にします。同時に、フォワードパスあたりのアクティブ容量がより小さくなることも意味します。これが、インテリジェンス指数におけるクラス中央値8が静かに示しているトレードオフです — Ling-3.0-flash-VL は25でそれを余裕をもって上回りますが、生の推論では密なフロンティアモデルと競合しているわけではありません。

タスクの表面は部分的にしか重なっていない

両方を「マルチモーダルモデル」という同じ枠にまとめてしまうのは、重なりの程度を過大評価している。その重なりがどこまでなのかを知っておけば、見当違いの比較検討をずいぶん防げる。

• 入力 — Ling-3.0-flash-VLはテキスト、画像、動画を入力として受け付け、1リクエストあたり最大40枚の画像を処理でき、テキストを返します。InternLumina U2はテキスト、画像、動画、3Dアセットを入力として受け付け、テキスト、生成画像、または編集済み画像を返しますbr /> • 画像生成 — Ling-3.0-flash-VLは画像の生成も編集も一切できません。InternLumina U2の中心的な主張は、画像を読み取るのと同じ重みから、最大1024×1024の画像生成と編集の両方を行うというものですbr /> • 3D — Ling-3.0-flash-VLには3Dの処理経路がありません。InternLumina U2はBlenderベースのパイプラインを提供しており、GLBおよびGLTFアセットを64組のカラー・深度ビューにレンダリングし、モデルがそれらを推論できるようにしますbr /> • 動画 — Ling-3.0-flash-VLはVideoRoPEの時間エンコーディングを通じて動画を処理します。InternLumina U2は64フレームをサンプリングしますbr /> • コンテキストと出力 — Ling-3.0-flash-VLは262Kトークンのコンテキストウィンドウを計測していますが、モデルカードには256Kと記載されており、最大出力も比較的短くなっています。InternLumina U2はどちらの数値も公開していませんbr /> • アクティブパラメータ — Ling-3.0-flash-VLはトークンあたり約5.5Bをアクティブ化します。InternLumina U2は約1Bで、これはその5分の1です

そのリストを読めば、結論はこうだ。これら二つは、ちょうど一つの仕事――画像を読み、それについて質問に答えること――においてのみ代替関係にあり、それ以外のほぼすべての領域では補完関係にある。画像を生成または編集するモデルが必要なら、Ling-3.0-flash-VL は候補ではなく、どのベンチマークもそのことを変えない。チャートを読み、バリアントを生成し、3Dアセットについて推論する単一のモデルが必要なら、InternLumina U2 はまさにそれを狙っており、Ling-3.0-flash-VL はそれに対応していない。

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

ベンチマーク:1ページ分のベンダー数値に対して、たった1つの独立したスコア

証拠の質は互角とはほど遠く、勝者を断言するよりも、なぜそうなのかを正確に述べる価値がある。

Ling-3.0-flash-VLのIntelligence Index v4.3における25は、公開されたプロトコルでの第三者による実行であり、文脈としてクラス中央値は8、さらに測定されたスループットは毎秒142.9出力トークンで、ピア中央値105.1に対して、最初のトークンまでの時間は2.21秒です。そのベンダーカードは別途、42を廃止されたv4.1.1プロトコルで主張しており、これは異なる尺度であり、モデルが低下したかのように25の横に並べることはできません。この指標は2026年9月に再表明され、全面的に再スコアリングされました。ベンダーはまた、ハンドル名「linthium」でGPT-5.4に対するImage-to-WebDev Arenaでの1,441対1,440の勝利を報告しています——Eloノイズ内の1ポイント差であり、ベンダー報告です。

InternLumina U2 の数値はラボ自身によるもので、暫定的かつ部分的と明記されており、完全な比較表と技術レポートはまだ保留中です。それらは現在、ベンチマークのリーダーボード上ではなく、リポジトリの README にある表に掲載されています。また、第三者が実行結果を公表していないため、まだ独立に検証することはできません。ラボが述べているとおりに記すと、次のとおりです:

• 理解 — ChartQA 86.52、CharXiv-DQ 83.65、HallusionBench 62.15、MMMU-Pro 36.13、MathVision 33.22、DynaMath 56.37br /> • 動画 — Video-MME 51.26、MVBench 59.74、MLVU 57.03br /> • 生成と編集 — GenEval 0.81、DPG 87.10、TIIF Short 84.60、TIIF Long 85.95、ImgEdit 3.83br /> • 出典 — InternLumina U2 の数値はすべてベンダー報告による暫定値です。Ling-3.0-flash-VL の数値は Intelligence Index を除きすべてベンダー報告であり、Intelligence Index は Artificial Analysis によるものです。

そのうち2つはフラグを立てるに値する。GenEvalの0.81は、ラボ自身の表によれば、名指しされた競合の0.89に後れを取っている——ベンダーが負けを公表する稀な例であり、残りの表を少しだけ信頼する理由にもなる。そしてImgEditの3.83は、付随する表なしでは意味をなさない。その表は、保留中の技術レポートが掲載する内容の一部である。InternLumina U2のリストは、ラボが擁護するつもりの結果として扱うべきであり、あなたが行動に移せる結果として扱うべきではない。また、その理解スコアとLing-3.0-flash-VLのインデックススコアは比較可能な量ではないことにも注意せよ。一方はタスク固有のベンダー数値の集合であり、他方は第三者による複合インデックスである。

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

ライセンス、ハードウェア、そしてそれぞれに賭けることの実際のコスト

Ling-3.0-flash-VLは両方の精度形式を通じてMITであり、これはオープンウェイトとしてほぼこれ以上なくクリーンな状態だ——付帯条件も、用途分野の制限も、商用展開に関する曖昧さもない。約126 GBのFP8ビルドは、80GBクラスのアクセラレータ8基で構成される1ノード内に収まる。BF16はおよそその2倍だ。サービング対応はすでにSGLangと、AntがメンテナンスするvLLMフォークに存在する。残るリスクは法的なものではなく商業的なものだ。Antはこのビジョンモデルについてトークンあたりの料金を公表しておらず、Ling Studioでの無料アクセスは料金表ではなく販促的なものであり、Artificial Analysisが入力・出力ともに100万トークンあたり$0.00と掲載しているのは、同社に見えるエンドポイントが無料のものだけだからにすぎない。

InternLumina U2はメインリポジトリでApache-2.0であり、読む価値のある2つの例外があります:バンドルされたVeOmni/ディレクトリは上流のApache-2.0ライセンスを保持し、atoken_inference/はAppleのml-atokenから派生し、Appleの元の条件で再配布されています。インフラストラクチャに関する主張は本格的です — それはNVIDIA GPUとHuawei Ascend NPUの両方を対象とし、バックエンド間の演算子レベルの数値的整合性を備え、チームは1000枚のAscendクラスタでエンドツーエンドのトレーニングを報告しており、融合演算子、調整されたHSDPシャーディング、勾配チェックポイントにより1.85倍のトレーニング効率の改善を達成しています。それは本物のエンジニアリングです。また、モデルが良いかどうかとは直交します:Ascendでのトレーニング効率は出力品質について何も語りませんし、今日存在するチェックポイントはそのスタックを対象としたものです。

つまり実用的な非対称性は、オープン対クローズドではない。両方ともオープンで、両方とも寛容なライセンスで提供され、今日すぐダウンロードできる。違いは、一方のリリースはおそらくあなたが持っているハードウェアを前提とし、他方はおそらくあなたが持っていないハードウェアを前提としていることだ。もしあなたの環境がNVIDIAなら、Ling-3.0-flash-VLは半日仕事で、InternLumina U2は待ちになる。もしあなたの環境がAscendなら——このモデルが作られた中国市場でますます一般的になっている——その関係は完全に逆転し、完成した道筋が用意されているのはInternLumina U2であり、一方でLing-3.0-flash-VLの手順はCUDAを前提としている。

この組み合わせについて、人が実際に尋ねる質問

InternLumina U2の重みはもうダウンロードできますか?

はい、Ascendでトレーニングされたチェックポイントは、Hugging Faceのascend/以下に公開された7つのsafetensorsシャードです。設定ファイル、トークナイザー、モデリングファイルも併せて公開されています。NVIDIAでトレーニングされたチェックポイントは別のサブフォルダーにあり、依然是として「近日公開」と記載されています。また、トレーニングコードと技術レポートは未公開のままです。

Ling-3.0-flash-VLは、独立したスコアを持っているという理由で、厳密により優れているのでしょうか?

いいえ——それはより証拠に裏付けられており、一般的なハードウェアでより簡単に実行できるという話であり、これは別の主張です。Ling-3.0-flash-VLは画像を生成したり編集したりできず、3Dアセットを処理できず、価格も公表されていません。もしあなたのタスクが画像生成、画像編集、または3D理解であれば、InternLumina U2はそれに対応しており、Ling-3.0-flash-VLはまったく対応していません。Lingモデルがどれほど多くのベンチマークを持っていようと。

Ling-3.0-flash-VL のモデルカードにある 42 は、Artificial Analysis の 25 と矛盾しますか?

直接の比較ではありません。42 は Intelligence Index プロトコル v4.1.1 に対して測定され、25 は v4.3 に対して測定されました。この指数は 2026年9月に再定義され、全面的に再スコアリングされており、この2つのバージョンは異なる評価セットから構築されています。言えるのは、42 はこれまで独立に再現されたことがなく、25 は独立に算出されたことがある、ということです。

これらのいずれかを呼び出せる場所

Ling-3.0-flash-VLもInternLumina U2も当社のモデルカタログには掲載されていません。そうでないと言うのは、読者が10秒で確認できる主張になるでしょう。Ling-3.0-flash-VLには、Ant自身のプラットフォーム(OpenAI互換エンドポイントとAnthropic互換エンドポイントを公開しています)経由、Ling Studioでの無料トライアルアクセス経由、そして自分でホストする場合のオープンウェイト経由でアクセスできます。InternLumina U2には、Hugging Faceのチェックポイントと、そのチェックポイントが対象とするハードウェア上でリポジトリの推論ドライバーを使うことでアクセスできます。

私たちがルーティングしているのは、この組み合わせが実際に最も頻繁に比較されるビジョンモデルです:DeepSeek V4 Flash Vision Expは、1Mトークンのコンテキストウィンドウと公開された料金でカタログ上に稼働しており、カタログの他のモデルと同じOpenAI互換エンドポイント上にあります。ラボがオープンウェイトを公開すると、ルーティングレイヤーは通常、ラボ自身のホスト型サービスが安定するのを待たずにそのモデルを提供できます——これが、モデルが「引用可能」であることと「呼び出し可能」であることの実務上の違いです。この違いはLing-3.0-flash-VLでは現実のものとなっており、現時点ではInternLumina U2にとっては理論上のものです。そのリリースの経緯は、ホスティングの問題ではなくハードウェアの道筋だからです。

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

評価は本当に二分されている。そしてその分かれ目は品質ではなく、ハードウェアとタスクにある。Ling-3.0-flash-VLは完成されたリリースだ。MIT、両方の精度形式、第三者によるスコアリング、CUDAファースト、そして理解に限定されている。InternLumina U2はより野心的な設計で、より未完成なリリースだ。あるハードウェアスタックのチェックポイントが公開され、生成と3Dを含む統合された6タスクのサーフェスを持ち、技術レポートはまだ提供されていない。今週NVIDIAハードウェア上でビジョンモデルが必要なら、選択はおのずと決まる。InternLumina U2のマルチコードブック設計に興味があるなら、注目すべきはNVIDIAチェックポイントだ。そしてそれまでの正直な立場は、それが負けている行を含むベンチマーク表が、後半がまだ出荷されていないモデルを記述しているということだ。