「Qwen3.8-Omni-Flash vs InternLumina U2」と題された生成ヒーローカード。アイブロウ見出しは「借り物の感覚 vs 所有する重み」、サブタイトルは「クローズドなロングメディアAPI 対 ダウンロード可能な16B拡散モデル」、そして4つのチップ:「重み:クローズド vs Apache 2.0」「画像生成:片側のみ」「コンテキスト:1M vs 非公開」「ここでルーティング可能:どちらも不可」。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2:借り物の感覚か、自前の重みか

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

を比較するのに有用な方法はQwen3.8-Omni-FlashInternLumina U2、ベンチマークの行によるものではない。なぜなら両者が同じベンチマークに載っているわけではないからだ。有用なのは、誰がそれらを実行することを許されているかを問うことだ。ベンダーのQwen3.8-Omni-Flashは、2026年9月18日からAPI顧客に開放されているが、ベンダー自身のプラットフォーム上ではクローズドモデルである。100万トークンのコンテキスト、1回の呼び出しにつき最大1時間の連続音声と映像、テキストのみの出力、そして重みはない。Shanghai AI LaboratoryのInternLumina U2は、Apache 2.0ライセンスの下で提供される16B-A1BのMixture-of-Experts拡散モデルであり、そのAscendチェックポイントは今すぐHugging Faceからダウンロード可能で、NVIDIAチェックポイントと技術レポートはまだ提供予定として記載されている。一方はトークン単位で借りるサービスである。もう一方は手元に置けるファイルであり、現在どのハードウェアで動くかという注意点がある。その違いは、どちらのベンダーの表のどのスコアよりも、より多くの実際のデプロイを左右する。

InternLumina U2とは実際に何なのか

興味深いのはアーキテクチャの部分であり、それは本当に珍しい。InternLumina U2は、総パラメータ数160億、アクティブ10億のスパースMoEであり、自己回帰型ではなく拡散言語モデルだ――トークンを左から右へ生成するのではなく、シーケンス全体を並列に洗練させる。その視覚表現は完全に離散的である。AppleのAToken上に構築された視覚トークンの8つのコードブックがそれで、これにより1つのモデルが、末尾に別個のデコーダを取り付けることなく画像を読み、また生成することができる。テキスト質問応答、テキストからの画像生成、画像理解、画像編集、動画理解、3D理解は、すべて同じモデルが同じ語彙上で同じ種類の作業を行っている。

• サイズと形状 — InternLumina U2 は総パラメータ数16B、アクティブ1BのスパースMoE、Qwen3.8-Omni-Flash のパラメータ数は非公開。

• 生成 — InternLumina U2は画像を生成・編集し、3D理解を処理します。Qwen3.8-Omni-Flashはメディアを一切生成せず、テキストを返します。

• デコーディング — InternLumina U2 は拡散LLMで並列にデコーディングするのに対し、Qwen3.8-Omni-Flash は自己回帰型です。

• コンテキストと継続時間 — Qwen3.8-Omni-Flash は 1Mトークンのウィンドウと、1回の呼び出しで最大1時間の連続した音声・映像を扱える。InternLumina U2 の公開資料にはそのいずれも記載されておらず、長時間音声はその記載された機能の中にも含まれていない。

• 重み — InternLumina U2 は Apache 2.0 で、Ascend チェックポイントは公開済み、NVIDIA チェックポイントは保留中です。Qwen3.8-Omni-Flash には重みがなく、その計画も一切発表されていません。

• 入手方法 — InternLumina U2 は Hugging Face からのダウンロードで、推論コードは GitHub にあります。Qwen3.8-Omni-Flash は Alibaba Cloud Model Studio または Qianwen プラットフォームへの API 呼び出しです。

• 独立したスコア——どちらにも存在しない。InternLumina U2自身のカードは、そのベンチマーク表を「暫定的、部分的な結果」と表示している。Qwenのものはすべて自社の前身モデルに対するもので、再現されていない。

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

重みに関する問いは、プレビュー報道以降、移り変わってきている

私たちの以前の記事を読んだならInternLumina U2コードが最初に登場したとき、状況は一方で変化し、もう一方ではそのままだったが、どちらの半面も重要だ。Hugging Faceのリポジトリはもはやスタブではない:ascend/フォルダには今、7つのsafetensorsシャードと構成、トークナイザー、モデリングコードが含まれており、つまり適切なハードウェアがあれば誰でもモデルを本当にダウンロードして実行できるということです。そのnvidia/フォルダはまだ「近日公開」と表示されており、技術レポートはまだ公開されておらず、リポジトリ自体のベンチマークセクションにはまだ「暫定的な部分的な結果」と書かれています。したがって、今日の正確な表現は「重みが公開された」でも「重みが欠けている」でもありません。一方のハードウェアスタックのチェックポイントは公開されていますが、もう一方は公開されていないということであり、これはクラスターがNVIDIAである人にとっては実際の制約となります。

静かに動いた点がもう2つある。GitHubリポジトリは、9月1日の最初の公開をはるかに過ぎた今もコミットを受け続けており、公開されたコードは放置されるのではなくメンテナンスされている。そして、Hugging Faceリポジトリのダウンロードカウンターは依然としてゼロを示している。これはモデルそのものよりも、むしろ対象読者について語っている。Ascendを優先したチェックポイントを備えた16B-A1B拡散モデルは、研究室を狙ったものであり、今四半期にホスト型エンドポイントを求めているプロダクトチーム向けではないのだ。

両者が本当に重なり合うところ、そして重なり合わないところ

画像理解は共通部分であり、見た目よりも狭い。両モデルは画像を見てそれについて質問に答えることができ、これはQwen3.8-Omni-Flashにとっては仕事のすべてであり、InternLumina U2にとっては6つの仕事のうちの1つである。そこから先は大きく異なる。InternLumina U2はその後、同じモデル内で、その画像を読むのに使ったのと同じ視覚語彙を使って、その画像を編集したり、プロンプトから新しい画像を生成したりできる。Qwen3.8-Omni-Flashはピクセルを1つも生成できないが、1回の呼び出しで1時間の音声と映像を受け取り、誰がいつ話し、何が決められたかを教えてくれる——それはInternLumina U2の公開資料がまったく主張していないことだ。

人が思うほど重要ではない重なり、それが動画だ。どちらも動画を扱うと説明されているが、動画に対してやっていることは違う。一方は長い録画をドキュメントとして理解することであり、もう一方は動画を3Dと並ぶ視覚モダリティとして扱うことだ。1時間の映像を要約する必要があるチームに2つ目は応えられず、1フレームを生成する必要があるチームに1つ目は応えられない。

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

コスト、コントロール、そして実際に何を買っているのか

価格の比較は同種のものではない。Qwen3.8-Omni-Flashはトークン単位で課金される——国際価格表では入力100万トークンあたり0.15ドル、キャッシュ利用時0.016ドル、出力0.47ドルで、比較対象にならない別個の中国本土価格表もあり——そしてそのローンチ時の見出しは、1時間の音声入力のコストを98%超削減したというベンダー報告だった。これは2分間のサンプルに価格を付け、それを30倍することで算出されており、動画は720p・毎秒1フレームでサンプリングされていた。InternLumina U2は一切課金しない。課金対象が何もないからだ。コストはあなたのハードウェアとあなたの時間であり、モデル自身のカードには、それをトークンあたりの数値に変換できるスループット値が公開されていない。

それが、このトレードオフを一行で表したものだ。APIは、自社ではホストできない能力と、利用量に応じて増える時間単位のコストを提供する。オープンウェイトは、固定コストとデータ経路の完全な制御をもたらすが、その代償として、自分で構築しなければならない推論スタックと、現時点ではAscendハードウェアを意味するチェックポイントセットを受け入れる必要がある。メディアを建物の外に出せない規制対象のワークロードでは、後者は好みの問題ではない — このページで唯一の選択肢だ。今月、長時間音声の解析を必要とするチームにとって、前者がこのページで唯一の選択肢だ。

OrcaRouterは現在どちらのモデルもホストしておらず、存在しないルーティング経路をほのめかすよりも、そのことをはっきりとお伝えしたいと思います:Qwen3.8-Omni-FlashはAlibaba自身のプラットフォーム上でのみ動作し、InternLumina U2はエンドポイントではなくダウンロードです。当社が実際に運用しているのはQwen3.8シリーズの残りの部分、すなわちQwen3.8-FlashQwen3.8-Maxを、単一のAPIを通じてプロバイダーの定価、マークアップ0%で提供することであり、これが、オープンウェイト側がまだNVIDIAチェックポイントを整備している間に、この比較のクローズドモデル側について動作するベースラインを確保するための現実的な方法です。

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

実際にどれを選ぶべきか

選んでくださいInternLumina U2画像を読み込み、生成し、編集する単一のモデルが必要で、推論スタックを自分で所有することをいとわない場合 — そして、アクセラレータがAscendであるか、NVIDIAのチェックポイントを待てる場合に。これは2つのうち画像を作成できる唯一のモデルであり、ベンダーにデータを送信せずに実行できる唯一のモデルです。技術レポートが公開されるまでは、そのベンチマーク数値を未検証として扱ってください。モデルカードがまさにそう述べているからです。

選ぶならQwen3.8-Omni-Flashを、あなたの問題がピクセルの出力ではなく何時間にも及ぶ音声と動画——会議インテリジェンス、長時間録画の分析、中国語と英語での音声主体のエージェント作業——であり、単一ソースへの依存とテキストのみの出力を受け入れられる場合に。そのコストの話は入力音声の時間数においては強力だが、総請求額においてははるかに弱く、ベンチマークはベンダーによる報告で再現されておらず、最初に現れた第三者による実行結果では推論において28パーセンタイルに位置づけられているが、そのサンプルは意思決定ではなくテストを促すほど小さい。

両方が必要なら、それらは代替ではなく補完関係にある。自分でホストするオープンウェイトの画像モデルと、呼び出して使うクローズドなロングメディアモデルだ。現時点でどちらも当社を通じてルーティングすることはできない。一方で注目すべきはNVIDIAのチェックポイントと技術レポートであり、もう一方で注目すべきは最初の独立評価だ。それはまだ存在せず、これまでQwen3.8-Omni-Flashについて書かれたすべての中で最大の空白となっている。