
InternLumina-U2 對決 Qwen2.5 Omni:阿里巴巴已交付的全模態模型,對上上海人工智能實驗室仍備受期待的那一款
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
InternLumina-U2 與 Qwen2.5 Omni 都是同一個野心的答案——用單一模型處理所有模態,而非眾多專家模型的組合——但兩者相差了兩個世代。Qwen2.5 Omni 是真正落地的那個答案:一個 70 億參數的開放權重模型,於 2025 年 3 月發布,撰寫本文時已十七個月大;它能接收文字、圖像、音訊與影片輸入,並以文字或自然串流語音回覆。InternLumina-U2 是上海人工智能實驗室的答案,於 2026 年 9 月 1 日以推論程式碼形式發表:一個 160 億參數的稀疏擴散模型,聲稱能感知圖像、影片與 3D,並透過統一的離散 token 介面生成及編輯圖像。這個 omni 構想的其中一代已投入生產一年半;另一個則才剛誕生一天,而且因為其權重尚未存在,目前沒有任何人能執行它。兩者之間的差距,正是「承諾已兌現」與「承諾已許下」之間的距離。
已發布的全能模型:Qwen2.5 Omni
Qwen2.5 Omni 之所以值得認真看待並作為一個基準,是因為它是少數真正實現了「感知一切,以任何形式作答」承諾的開放模型。其 Thinker-Talker 架構將文字思考器與負責生成語音的說話器配對,並使用時間對齊的多模態位置編碼,使音訊和影片保持同步;輸入涵蓋文字、圖片、音訊與影片,輸出則可在同一回合中同時包含文字和語音,並內建四種語音。其限制與能力同樣有清楚記載:上下文為 32K token、不支援函式呼叫與結構化輸出,而且它是全方位的對話者而非代理程式。就本次比較而言,有一點特別值得強調:它能感知圖片、音訊與影片,但不會生成這些內容。Qwen2.5 Omni 中的「Omni」指的是全方位感知,並在輸出端搭配語音合成;像素輸入,文字輸出。
這些實際記錄是真實的。該模型已被下載數十萬次,可透過開發者自己的平台及多個第三方平台使用託管 API,並花了十七個月累積量化版本、社群工具,以及一個廣為人知的價格——彙整平台列出文字部分約為每百萬輸入 tokens 0.09 美元、每百萬輸出 tokens 0.34 美元,音訊則另行計費。十七個月的時間已足夠讓它的優勢與局限都被充分摸清。這就是成熟所帶來的:不是完美,而是可預測性。
應許的 Omni:InternLumina-U2
InternLumina-U2 試圖比 Qwen2.5 Omni 更進一步,而這一步恰好落在難處所在。其設計主張是:感知與生成應該共享同一套離散 token 介面——不是由一個語言模型感知影片、再由另一個擴散模型負責繪製,而是由單一的稀疏 MoE 擴散主幹——總計 16B、活躍 1B——同時讀取影像、圖表、影片或 3D 資產,並產出新的影像或編輯結果,使用一套完全離散、由八個 codebook 組成的視覺詞彙,讓每個視覺位置都承載足夠的資訊,足以支援雙向的運作。這比起 Qwen2.5 Omni 的主張是實質上更大的宣稱。將每一種輸入模態都導入文字與語音是一回事;讓同一組權重在生成像素時,能像在推理像素時一樣流暢,又是另一回事。
就目前而言,這也是一個無法查證的說法。該實驗室發布了推論程式碼、一個帶有「初步、部分」基準測試表的專案頁面,以及一個空的 Hugging Face 佔位頁面;權重、訓練程式碼、技術報告與 Ascend-NPU 技術棧全都標示為「即將推出」。因為沒有可評估的內容,所以也不存在任何獨立評估。Qwen2.5 Omni 的架構在發布當週即可查驗,因為權重隨之一起發布;InternLumina-U2 的架構如今已可查閱,但其品質仍然是廠商的承諾。
計分板
由於其中一個模型擁有十七個月的歷史,而另一個僅有一天的程式碼,因此各列承載了來源脈絡,而非假設各欄位是對稱的。
• 年齡 — Qwen2.5 Omni:2025年3月發布,上線十七個月,數十萬次下載。InternLumina-U2:推論程式碼於2026年9月1日發布,零次下載,零次獨立運行。
• 形狀 — Qwen2.5 Omni:約7B端對端,採用時間對齊多模態位置編碼的Thinker-Talker。InternLumina-U2:總計16B / 1B活躍的稀疏MoE擴散LLM,配備八碼本離散視覺標記器。
• 輸入——兩者皆接受文字與圖片;Qwen2.5 Omni 額外接受音訊與影片以支援全方位對話;InternLumina-U2 另宣稱支援對 64 個取樣幀的影片理解,以及對 Blender 渲染之 GLB/GLTF 視圖的 3D 理解。
• 輸出 — Qwen2.5 Omni:文字與串流語音,四種聲音。InternLumina-U2:宣稱支援文字、最高 1024×1024 的文字轉圖片,以及指令式圖片編輯。
• 生成前沿 — Qwen2.5 Omni:生成文字和語音,而非像素。InternLumina-U2:嘗試在與閱讀相同的離散標記模型中進行像素生成和編輯。
• 權重與授權 — 兩者原則上均為 Apache-2.0 開放權重;Qwen2.5 Omni 現已可下載,InternLumina-U2 的則尚未公開。
「• 服務提供 —— Qwen2.5 Omni:可使用託管 API 或自行架設方式部署(資源需求較高的全精度部署);已知支援 32K 上下文,不支援函式呼叫。InternLumina-U2:無法提供服務 —— 其發布的驅動程式所預期的檢查點並不存在。」
• 重點數字 — {{1}}Qwen2.5 Omni:長期位居 OmniBench 排行榜(在目前榜單上分數約為 0.561){{/1}};{{2}}InternLumina-U2:ChartQA 86.52、MathVision 33.22、GenEval 0.81{{/2}} — {{3}}皆為廠商回報,屬初步且不完整的資料{{/3}}。

為何代溝才是真正的重點
撇開年齡差距,實質差異在於每個模型各自止步的能力邊界。Qwen2.5 Omni 選擇了一條務實可行的全能路徑:廣泛感知、用語言或語音回應,而把影像與影片合成交給堆疊中其他專門的生成模型。這種分工正是 2026 年幾乎所有量產多模態系統的建構方式,也是 Qwen2.5 Omni 能在 2025 年出貨、到 2026 年依然實用的原因——它把自己的職責做好,並能與其他部分組合協作。InternLumina-U2 押注的則是「分工本身才是問題」:一個被迫用共享的離散詞彙去表徵一切——感知與生成皆然——的模型,會比一個只需要描述視覺的模型,學到更深刻的視覺理解。這注若押對了,會是更重要的結果;若押錯了,InternLumina-U2 最終不過是變成一個更慢、更耗資源的 Qwen2.5 Omni,外加一個被彆扭地硬塞進同一組權重裡的影像生成器。整場競賽——而且這是「一項已出貨的設計」對上「一個假說」的競賽,不是兩個可執行模型之間的對決——要看那條更困難的架構路線能否證明自己。

Qwen/Qwen2.5-Omni-7B 的 Hugging Face 模型卡,擷取於 2026 年 8 月 27 日——Thinker-Talker 概覽、Apache-2.0 授權,以及該模型的文字、影像、音訊與影片模態標籤。
一年半的下載,究竟買到了什麼?
成熟不是一種氛圍,而是一份你已知事物的清單。有了 Qwen2.5 Omni,你知道 32K 的上下文是一道硬性限制,而且能繞著它做工程設計。你知道沒有函式呼叫路徑,也不會假裝有。你大致知道一次部署要花多少成本——無論是透過託管 API,還是跑在自己的 GPU 上——因為已經有夠多人替這個模型定價並運行過它,數字早已塵埃落定。你知道 OmniBench 上的名次是真的,因為獨立排行榜追蹤它已經超過一年。而 InternLumina-U2 完全不適用這些動詞——你不知道,也不可能知道,因為根本沒有任何成品。當一個模型才出世一天、且沒有任何分量時,所有關於它的宣稱都只是意圖的聲明。這種不對稱並不是在貶低背後的科學;而是任何在選擇要建構於什麼之上的人,所應抱持的正確認識論立場。

The InternLM/InternLumina-U2 GitHub 儲存庫,於 2026 年 9 月 2 日擷取——該儲存庫的登陸頁面公開了架構——包含說明、授權條款與推理腳本,然而權重本身並未出現在樹狀目錄中。
路由決策,誠實呈現
我們直接說明可用性:OrcaRouter 不託管 InternLumina-U2,因為目前根本沒有權重可供任何人託管;我們現在也不提供 Qwen2.5 Omni——它運行在開發者自己的 API 與第三方平台上。所以這裡的路由課題關乎姿態,而不是今天就能用同一把金鑰呼叫這兩個模型。真正長久的模式,是每一場「成熟模型 vs. 新手模型」的決策最終都會遇到的:把已驗證的模型放在主路徑上,而一條 API 涵蓋 200+ 種模型、0% 加價轉發,代表你只支付供應商列表價、沒有其他費用;把未經驗證的新手導向具備自動故障轉移的測試路徑,這樣一旦它停滯、偏離或回傳無意義內容,呼叫就會自動落到擁有十七個月實績的模型上。這就是你如何在 InternLumina-U2 權重發布當天就能評估這種野心勃勃的新架構——同時不必拿你已經依賴的生產路徑來下注。
裁決
Qwen2.5 Omni 是您今日即可建置的全能模型:已交付、可下載、有文件,限制已知且價格已定。InternLumina-U2 則是值得關注的全能模型:在架構上真正從感知邁向創造,採用 Apache-2.0,程式碼公開,權重尚未釋出。若該實驗室的多碼本(multi-codebook)賭注能經得起獨立測試,InternLumina-U2 與其說是 Qwen2.5 Omni 的對手,不如說是同一理念的下一代。若未能如此,那個已實際出貨、問世十七個月的通用模型仍會在那裡,繼續扮演它一直以來所扮演的角色。請關注 Hugging Face 的佔位頁面;最終評斷取決於 safetensors 檔案,而非本文。
