用於「InternLumina-U2 vs Qwen2.5 Omni」比較的主視覺標題卡片,副標題為「阿里巴巴已交付的 Omni 模型 vs 仍在承諾中的那個」,並設有三個統計標籤——「Qwen2.5 Omni:已投入生產 17 個月」、「InternLumina-U2:程式碼僅一天」、「兩者皆為 Apache-2.0」——右下角帶有 OrcaRouter 標誌。
Guides & Insights

InternLumina-U2 對決 Qwen2.5 Omni:阿里巴巴已交付的全模態模型,對上上海人工智能實驗室仍備受期待的那一款

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

InternLumina-U2 與 Qwen2.5 Omni 都是同一個野心的答案——用單一模型處理所有模態,而非眾多專家模型的組合——但兩者相差了兩個世代。Qwen2.5 Omni 是真正落地的那個答案:一個 70 億參數的開放權重模型,於 2025 年 3 月發布,撰寫本文時已十七個月大;它能接收文字、圖像、音訊與影片輸入,並以文字或自然串流語音回覆。InternLumina-U2 是上海人工智能實驗室的答案,於 2026 年 9 月 1 日以推論程式碼形式發表:一個 160 億參數的稀疏擴散模型,聲稱能感知圖像、影片與 3D,並透過統一的離散 token 介面生成及編輯圖像。這個 omni 構想的其中一代已投入生產一年半;另一個則才剛誕生一天,而且因為其權重尚未存在,目前沒有任何人能執行它。兩者之間的差距,正是「承諾已兌現」與「承諾已許下」之間的距離。

已發布的全能模型:Qwen2.5 Omni

Qwen2.5 Omni 之所以值得認真看待並作為一個基準,是因為它是少數真正實現了「感知一切,以任何形式作答」承諾的開放模型。其 Thinker-Talker 架構將文字思考器與負責生成語音的說話器配對,並使用時間對齊的多模態位置編碼,使音訊和影片保持同步;輸入涵蓋文字、圖片、音訊與影片,輸出則可在同一回合中同時包含文字和語音,並內建四種語音。其限制與能力同樣有清楚記載:上下文為 32K token、不支援函式呼叫與結構化輸出,而且它是全方位的對話者而非代理程式。就本次比較而言,有一點特別值得強調:它能感知圖片、音訊與影片,但不會生成這些內容。Qwen2.5 Omni 中的「Omni」指的是全方位感知,並在輸出端搭配語音合成;像素輸入,文字輸出。

這些實際記錄是真實的。該模型已被下載數十萬次,可透過開發者自己的平台及多個第三方平台使用託管 API,並花了十七個月累積量化版本、社群工具,以及一個廣為人知的價格——彙整平台列出文字部分約為每百萬輸入 tokens 0.09 美元、每百萬輸出 tokens 0.34 美元,音訊則另行計費。十七個月的時間已足夠讓它的優勢與局限都被充分摸清。這就是成熟所帶來的:不是完美,而是可預測性。

應許的 Omni:InternLumina-U2

InternLumina-U2 試圖比 Qwen2.5 Omni 更進一步,而這一步恰好落在難處所在。其設計主張是:感知與生成應該共享同一套離散 token 介面——不是由一個語言模型感知影片、再由另一個擴散模型負責繪製,而是由單一的稀疏 MoE 擴散主幹——總計 16B、活躍 1B——同時讀取影像、圖表、影片或 3D 資產,並產出新的影像或編輯結果,使用一套完全離散、由八個 codebook 組成的視覺詞彙,讓每個視覺位置都承載足夠的資訊,足以支援雙向的運作。這比起 Qwen2.5 Omni 的主張是實質上更大的宣稱。將每一種輸入模態都導入文字與語音是一回事;讓同一組權重在生成像素時,能像在推理像素時一樣流暢,又是另一回事。

就目前而言,這也是一個無法查證的說法。該實驗室發布了推論程式碼、一個帶有「初步、部分」基準測試表的專案頁面,以及一個空的 Hugging Face 佔位頁面;權重、訓練程式碼、技術報告與 Ascend-NPU 技術棧全都標示為「即將推出」。因為沒有可評估的內容,所以也不存在任何獨立評估。Qwen2.5 Omni 的架構在發布當週即可查驗,因為權重隨之一起發布;InternLumina-U2 的架構如今已可查閱,但其品質仍然是廠商的承諾。

計分板

由於其中一個模型擁有十七個月的歷史,而另一個僅有一天的程式碼,因此各列承載了來源脈絡,而非假設各欄位是對稱的。

• 年齡 — Qwen2.5 Omni:2025年3月發布,上線十七個月,數十萬次下載。InternLumina-U2:推論程式碼於2026年9月1日發布,零次下載,零次獨立運行。

• 形狀 — Qwen2.5 Omni:約7B端對端,採用時間對齊多模態位置編碼的Thinker-Talker。InternLumina-U2:總計16B / 1B活躍的稀疏MoE擴散LLM,配備八碼本離散視覺標記器。

• 輸入——兩者皆接受文字與圖片;Qwen2.5 Omni 額外接受音訊與影片以支援全方位對話;InternLumina-U2 另宣稱支援對 64 個取樣幀的影片理解,以及對 Blender 渲染之 GLB/GLTF 視圖的 3D 理解。

• 輸出 — Qwen2.5 Omni:文字與串流語音,四種聲音。InternLumina-U2:宣稱支援文字、最高 1024×1024 的文字轉圖片,以及指令式圖片編輯。

• 生成前沿 — Qwen2.5 Omni:生成文字和語音,而非像素。InternLumina-U2:嘗試在與閱讀相同的離散標記模型中進行像素生成和編輯。

• 權重與授權 — 兩者原則上均為 Apache-2.0 開放權重;Qwen2.5 Omni 現已可下載,InternLumina-U2 的則尚未公開。

「• 服務提供 —— Qwen2.5 Omni:可使用託管 API 或自行架設方式部署(資源需求較高的全精度部署);已知支援 32K 上下文,不支援函式呼叫。InternLumina-U2:無法提供服務 —— 其發布的驅動程式所預期的檢查點並不存在。」

• 重點數字 — {{1}}Qwen2.5 Omni:長期位居 OmniBench 排行榜(在目前榜單上分數約為 0.561){{/1}};{{2}}InternLumina-U2:ChartQA 86.52、MathVision 33.22、GenEval 0.81{{/2}} — {{3}}皆為廠商回報,屬初步且不完整的資料{{/3}}。

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

為何代溝才是真正的重點

撇開年齡差距,實質差異在於每個模型各自止步的能力邊界。Qwen2.5 Omni 選擇了一條務實可行的全能路徑:廣泛感知、用語言或語音回應,而把影像與影片合成交給堆疊中其他專門的生成模型。這種分工正是 2026 年幾乎所有量產多模態系統的建構方式,也是 Qwen2.5 Omni 能在 2025 年出貨、到 2026 年依然實用的原因——它把自己的職責做好,並能與其他部分組合協作。InternLumina-U2 押注的則是「分工本身才是問題」:一個被迫用共享的離散詞彙去表徵一切——感知與生成皆然——的模型,會比一個只需要描述視覺的模型,學到更深刻的視覺理解。這注若押對了,會是更重要的結果;若押錯了,InternLumina-U2 最終不過是變成一個更慢、更耗資源的 Qwen2.5 Omni,外加一個被彆扭地硬塞進同一組權重裡的影像生成器。整場競賽——而且這是「一項已出貨的設計」對上「一個假說」的競賽,不是兩個可執行模型之間的對決——要看那條更困難的架構路線能否證明自己。

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

Qwen/Qwen2.5-Omni-7B 的 Hugging Face 模型卡,擷取於 2026 年 8 月 27 日——Thinker-Talker 概覽、Apache-2.0 授權,以及該模型的文字、影像、音訊與影片模態標籤。

一年半的下載,究竟買到了什麼?

成熟不是一種氛圍,而是一份你已知事物的清單。有了 Qwen2.5 Omni,你知道 32K 的上下文是一道硬性限制,而且能繞著它做工程設計。你知道沒有函式呼叫路徑,也不會假裝有。你大致知道一次部署要花多少成本——無論是透過託管 API,還是跑在自己的 GPU 上——因為已經有夠多人替這個模型定價並運行過它,數字早已塵埃落定。你知道 OmniBench 上的名次是真的,因為獨立排行榜追蹤它已經超過一年。而 InternLumina-U2 完全不適用這些動詞——你不知道,也不可能知道,因為根本沒有任何成品。當一個模型才出世一天、且沒有任何分量時,所有關於它的宣稱都只是意圖的聲明。這種不對稱並不是在貶低背後的科學;而是任何在選擇要建構於什麼之上的人,所應抱持的正確認識論立場。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

The InternLM/InternLumina-U2 GitHub 儲存庫,於 2026 年 9 月 2 日擷取——該儲存庫的登陸頁面公開了架構——包含說明、授權條款與推理腳本,然而權重本身並未出現在樹狀目錄中。

路由決策,誠實呈現

我們直接說明可用性:OrcaRouter 不託管 InternLumina-U2,因為目前根本沒有權重可供任何人託管;我們現在也不提供 Qwen2.5 Omni——它運行在開發者自己的 API 與第三方平台上。所以這裡的路由課題關乎姿態,而不是今天就能用同一把金鑰呼叫這兩個模型。真正長久的模式,是每一場「成熟模型 vs. 新手模型」的決策最終都會遇到的:把已驗證的模型放在主路徑上,而一條 API 涵蓋 200+ 種模型、0% 加價轉發,代表你只支付供應商列表價、沒有其他費用;把未經驗證的新手導向具備自動故障轉移的測試路徑,這樣一旦它停滯、偏離或回傳無意義內容,呼叫就會自動落到擁有十七個月實績的模型上。這就是你如何在 InternLumina-U2 權重發布當天就能評估這種野心勃勃的新架構——同時不必拿你已經依賴的生產路徑來下注。

裁決

Qwen2.5 Omni 是您今日即可建置的全能模型:已交付、可下載、有文件,限制已知且價格已定。InternLumina-U2 則是值得關注的全能模型:在架構上真正從感知邁向創造,採用 Apache-2.0,程式碼公開,權重尚未釋出。若該實驗室的多碼本(multi-codebook)賭注能經得起獨立測試,InternLumina-U2 與其說是 Qwen2.5 Omni 的對手,不如說是同一理念的下一代。若未能如此,那個已實際出貨、問世十七個月的通用模型仍會在那裡,繼續扮演它一直以來所扮演的角色。請關注 Hugging Face 的佔位頁面;最終評斷取決於 safetensors 檔案,而非本文。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube