「InternLumina-U2 vs Qwen2.5 Omni」の比較用ヒーロータイトルカードで、サブタイトルは「Alibabaが提供済みのオムニモデル vs いまだ約束されただけのモデル」、統計チップは3つ — 「Qwen2.5 Omni: 本番稼働17か月」「InternLumina-U2: コード作成1日」「両者ともApache-2.0」— を備え、右下隅にOrcaRouterのロゴが配置される。
Guides & Insights

InternLumina-U2 vs Qwen2.5 Omni:Alibabaが送り出したオムニモデル vs 上海AI研究所が未だに実現を約束するだけのモデル

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

{{1}}InternLumina-U2とQwen2.5 Omniは、どちらも同じ野心——特化モデルの寄せ集めに代わる、あらゆるモダリティを処理する単一のモデルの実現——への答えであり、しかも世代が二つ隔たった答えだ。{{/1}}実際に世に出た答えはQwen2.5 Omniだ。{{2}}2025年3月に公開された70億パラメータのオープンウェイトモデルで、本稿執筆時点で公開から17か月が経過している。テキスト、画像、音声、動画を入力として受け付け、テキストまたは自然なストリーミング音声で応答する。{{/2}}InternLumina-U2はShanghai AI Laboratoryによる答えであり、2026年9月1日に推論コードとして公開された。{{3}}160億パラメータのスパース拡散モデルで、画像・動画・3Dを知覚し、共有された単一の離散トークンインターフェースを通じて画像を生成・編集できると主張している。{{/3}}{{4}}オムニという構想の一方の世代は、1年半にわたって実運用されてきた。もう一方の世代は、生まれてからまだ1日しか経っておらず、重みがまだ存在しないため、誰も実行できない。{{/4}}{{5}}両者の隔たりは、果たされた約束と、交わされただけの約束の違いである。{{/5}}

出荷されたオムニ:Qwen2.5 Omni

Qwen2.5 Omni は、「すべてを知覚し、あらゆる形式で答える」という売り文句を実際に実現した、稀有なオープンモデルであるため、ベースラインとして真剣に受け止める価値がある。その Thinker-Talker アーキテクチャは、テキストを扱う思考器と、音声を生成するトーカーを組み合わせ、時間整合されたマルチモーダル位置エンコーディングを用いることで音声と映像の同期を保つ。入力はテキスト、画像、音声、映像にわたり、出力は同じターン内でテキストと音声を併用でき、内蔵音声は4つ用意されている。制約は能力と同様に明文化されている。コンテキストは32Kトークンで、関数呼び出しや構造化出力はなく、これはエージェントというよりは万能の対話モデルである。この比較で強調すべきは、それが行わないことだ。画像、音声、映像を知覚するが、それらを生成はしない。Qwen2.5 Omni の「オムニ」とは、出力側に音声合成を伴うオムニ知覚のことであり、ピクセルが入り、言葉が出てくる。

実績は本物だ。このモデルは数十万回ダウンロードされ、開発者自身のプラットフォームと複数のサードパーティプラットフォームを通じてホスト型APIを提供している。また、量子化、コミュニティツール、既知の価格を蓄積するのに17ヶ月を費やしてきた。アグリゲーターのリストによると、テキストは入力トークン100万あたり約0.09ドル、出力トークン100万あたり約0.34ドルで、音声は別途請求される。17ヶ月は、その強みと限界の両方が十分に把握されるには十分な期間だ。それが成熟がもたらすものだ。完璧さではなく、予測可能性を。

約束されしオムニ:InternLumina-U2

InternLumina-U2は、Qwen2.5 Omniよりもさらに一歩先へ進もうとしているが、その一歩こそがまさに難所である。その設計思想は、知覚と生成が単一の離散トークン・インターフェースを共有すべきだというものだ。つまり、映像を知覚する言語モデルと描画を行う独立した拡散モデルを別々に用意するのではなく、単一のスパースMoE拡散バックボーン(総パラメータ16B、アクティブ1B)が、画像・チャート・映像・3Dアセットを読み取り、新しい画像や編集結果を書き出す。この際、完全に離散化された8コードブックの視覚語彙を用いることで、各視覚位置が双方向の処理を支えるのに十分な情報を保持できるようにする。これは、Qwen2.5 Omniの主張よりもはるかに大きな主張である。あらゆる入力モダリティをテキストと音声にルーティングするのとは話が違う。写真1枚の重みセットが、画素を生成する際にも、画素について推論するのと同じくらい流暢に処理を行うことを意味するからだ。

それはまた、現時点では検証不能な主張でもある。そのラボは推論コードと、「予備的・部分的な」ベンチマーク表を掲載したプロジェクトページ、そして空のHugging Faceスタブを公開した。ウェイト、学習コード、テクニカルレポート、Ascend-NPUスタックはすべて「近日公開」とされている。評価すべきものが何もないため、独立した評価は存在しない。Qwen2.5 Omniのアーキテクチャは、ウェイトが同梱されていたおかげで、リリースされた週に検証可能だった。InternLumina-U2のアーキテクチャは今日読むことができるが、その品質は依然としてベンダーの約束事である。

スコアボード

一方のモデルには十七か月の履歴があり、もう一方には一日分のコードしかないため、行は列が対称であるかのように見せかけるのではなく、来歴を示している。

• 経過期間 — Qwen2.5 Omni: 2025年3月リリース、実稼働から17か月、ダウンロード数は数十万件。InternLumina-U2: 推論コードは2026年9月1日公開、ダウンロード数はゼロ、独立実行実績もゼロ。

• 形状 — Qwen2.5 Omni: エンドツーエンドの約7B、時間同期型マルチモーダル位置エンコーディングを備えたThinker-Talker。InternLumina-U2: 合計16B / アクティブ1BのスパースMoE拡散LLMで、8コードブックによる離散ビジュアルトークナイザーを搭載。

• 入力 — 両方ともテキストと画像を受け付ける。Qwen2.5 Omni はさらにオムニチャット用に音声と動画を受け付ける。InternLumina-U2 はさらに、64サンプリングフレームにわたる動画理解と、BlenderレンダリングのGLB/GLTFビューにわたる3D理解を主張している。

出力 — Qwen2.5 Omni: テキストとストリーミング音声、4種類の音声。InternLumina-U2: テキスト、テキストから最大1024×1024までの画像生成、および指示に基づく画像編集を謳う。

• 生成のフロンティア — Qwen2.5 Omni: 単語と音声を生成し、ピクセルは生成しない。InternLumina-U2: 読み取りを行うのと同じ離散トークンモデル内でピクセル生成と編集を試みる。

• 重みとライセンス — 原則として両方ともApache-2.0オープンウェイト。Qwen2.5 Omniの重みは本日ダウンロード可能だが、InternLumina-U2の重みはまだ公開されていない。

• サービス提供 — Qwen2.5 Omni: ホストされたAPIとセルフホスト(高負荷なフルプレシジョンデプロイ); 既知の32Kコンテキスト、関数呼び出しなし。InternLumina-U2: サービス不可 — リリースされたドライバーは存在しないチェックポイントを期待している。

• 主要数値 — Qwen2.5 Omni:OmniBenchリーダーボードに長く掲載(現在のボードでは約0.561のスコア);InternLumina-U2:ChartQA 86.52、MathVision 33.22、GenEval 0.81 — すべてベンダー報告による予備的・部分的な数字。

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

世代間ギャップこそが本当の主役である理由

モデルの新旧はさておき、本質的な違いは、各モデルがどこで立ち止まるかという境界にある。Qwen2.5 Omniは、実現可能なオムニの形を選んだ。すなわち、広く知覚し、言語または音声で応答し、画像・映像の合成はスタック内の専用生成モデルに委ねる、という形だ。その分業こそが、2026年の事実上すべての本番マルチモーダルシステムが構築される方法であり、Qwen2.5 Omniが2025年にリリースでき、2026年でも有用であり続ける理由でもある。自分の担当領域をうまくこなし、残りのモジュールと組み合わさって機能するからだ。InternLumina-U2は、その分業こそが問題だという賭けに出ている。すなわち、知覚と生成のすべてをひとつの共有された離散語彙で表現することを強いられたモデルは、それを記述するだけでよいモデルよりも、視覚についてより深い理解を得るだろう、という賭けだ。その賭けが当たれば、それがより重要な成果になる。外れれば、InternLumina-U2は、画像生成器を同じ重みに不格好にねじ込んだ、より遅くよりリソースを喰うQwen2.5 Omniに成り果てる。この対決全体——そしてこれは、実行可能な二つのモデル間の対決ではなく、出荷済みの設計と仮説との間の対決なのだが——の帰趨は、より困難なアーキテクチャがそれ自体を正当化できるかどうかにかかっている。

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

2026年8月27日に取得したQwen/Qwen2.5-Omni-7BのHugging Faceカード — Thinker-Talker概要、Apache-2.0ライセンス、および同モデルのテキスト・画像・音声・動画モダリティタグ。

1年半のダウンロードが実際に買えるもの

成熟とは雰囲気ではなく、知っていることのリストである。Qwen2.5 Omniなら、32Kコンテキストが厳格な制約だと分かっており、その上でエンジニアリングできる。関数呼び出し経路が存在しないことも分かっており、あるかのように装うこともない。ホスト型API経由でも自前のGPUでも、デプロイに大体どれだけ費用がかかるか分かっている。というのも、このモデルは十分な数の人々に価格設定・実行されてきて、数字が落ち着いているからだ。OmniBenchでの順位が本物だと分かっている。独立系リーダーボードが1年以上追跡してきたからだ。InternLumina-U2には、そうした動詞はどれも当てはまらない——知らない、知ることもできない、成果物が存在しないからだ。モデルが生まれて1日で、重みを持たないとき、そのモデルに関するあらゆる主張は意図の表明にすぎない。その非対称性は科学へのけなしではなく、何かを土台に築くかを選ぶすべての人にとっての正しい認識論的スタンスである。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

2026年9月2日にキャプチャされたInternLM/InternLumina-U2 GitHubリポジトリ — アーキテクチャを公開するリポジトリのランディングページ — 説明、ライセンス、推論スクリプト — 一方、重み自体はツリーには含まれていない。

正直に表現されたルーティングの決定

可用性について、率直に述べます。OrcaRouterはInternLumina-U2をホストしていません。ホストするためのウェイトが存在しないからです。Qwen2.5 Omniも現時点では取り扱っていません。こちらは開発者自身のAPIとサードパーティのプラットフォーム経由で動作します。したがって、ここでのルーティングの教訓は姿勢に関するものであり、この2つを今日1つのキーで呼び出すことではありません。 永続的なパターンとは、成熟したモデルか新興モデルかを選ぶ意思決定が最終的に必ず直面するものです。実証済みのモデルをメイン経路に置き続けます。そこでは、200以上のモデルを1つのAPIでカバーし、0%マークアップの通過により、支払うのはプロバイダーの定価だけで、それ以上はかかりません。実証されていない新興モデルは、自動フェイルオーバー付きのテスト経路に向けます。そうすれば、最初に停止したり、逸脱したり、無意味な応答を返したりした時点で、呼び出しは17か月の実績があるモデルへフォールバックします。これこそが、InternLumina-U2のような野心的な新アーキテクチャを、ウェイトが公開されたその日に評価する方法です。すでに依存している本番経路を賭けに出すことなく。

評決

Qwen2.5 Omniは、今日すぐに構築に使えるオムニモデルです。すでに提供され、ダウンロード可能で、ドキュメントも整い、既知の制限と確定した価格が示されています。InternLumina-U2は注目すべきオムニモデルです。知覚を超えて創造へ向かう真のアーキテクチャ上の一歩であり、Apache-2.0でコードは公開済み、ウェイトは公開待ちです。このラボのマルチコードブック戦略が独立した検証に耐えれば、InternLumina-U2はQwen2.5 Omniの競合というより、同じアイデアの次世代となるでしょう。もし耐えられなければ、実際にリリースされた17か月前の汎用モデルが、これまで果たしてきた役割を引き続き担い続けるでしょう。Hugging Faceのスタブに注目してください。結論を決めるのは、この記事ではなくsafetensorsファイルなのです。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube