
Qwen3.8-Omni-Flash vs InternLumina U2:租來的感官 vs 自有的權重
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
比較Qwen3.8-Omni-Flash與InternLumina U2的實用方式,不是看基準測試的排名,因為它們並不出現在相同的榜單上。而是問誰被允許執行它們。該供應商的Qwen3.8-Omni-Flash自 2026 年 9 月 18 日起開放給 API 客戶,是在該供應商自家平台上的封閉模型:一百萬個 token 的上下文、每次呼叫最多一小時的連續音訊與視訊、僅文字輸出,且沒有權重。上海人工智慧實驗室的InternLumina U2是一個 16B-A1B 專家混合擴散模型,採用 Apache 2.0 授權,其 Ascend 檢查點現在就可從 Hugging Face 下載,而 NVIDIA 檢查點與技術報告仍列為即將推出。一個是你按 token 租用的服務。另一個是你握在手中的檔案,但附帶一項關於它目前執行於何種硬體的但書。這個差異所決定的實際部署,比任一家廠商表格中的任何分數都多。
InternLumina U2 究竟是什麼
架構才是真正有趣的部分,而且它確實很不尋常。InternLumina U2 是一個稀疏 MoE,總參數量為 160 億、啟用參數為 10 億,而且它是擴散語言模型,而非自迴歸模型——它會平行地精煉整個序列,而不是由左至右逐個輸出 token。它的視覺表徵完全是離散的:以 Apple 的 AToken 為基礎所建構的八個視覺 token 碼本,這讓單一模型既能讀取影像,也能生成影像,而不必在末端外掛一個獨立的解碼器。文字問答、文字生圖、影像理解、影像編輯、影片理解與 3D 理解,全都是同一個模型在同一套詞彙表上做同一類工作。
• 規模與架構 — InternLumina U2 總計 16B、活躍 1B,為稀疏 MoE;Qwen3.8-Omni-Flash 的參數量未公開。
• 生成 — InternLumina U2 能生成與編輯圖像,並具備 3D 理解能力;Qwen3.8-Omni-Flash 完全不生成任何媒體,僅回傳文字。
• 解碼 — InternLumina U2 是擴散式 LLM,以平行方式解碼;Qwen3.8-Omni-Flash 則為自迴歸式。
• 上下文與時長 —— Qwen3.8-Omni-Flash 搭載 100 萬 token 的上下文視窗,單次呼叫即可處理長達一小時的連續影音;InternLumina U2 的公開資料完全未提及這些,而長音訊也不在其列出的能力之中。
• 權重 — InternLumina U2 採用 Apache 2.0,Ascend 檢查點已發布,NVIDIA 檢查點則尚未發布;Qwen3.8-Omni-Flash 並未釋出權重,也未宣布任何相關計畫。
• 如何取得 — InternLumina U2 可從 Hugging Face 下載,推論程式碼在 GitHub 上;Qwen3.8-Omni-Flash 則是呼叫阿里雲 Model Studio 或千問平台的 API。
• 獨立評分——兩者皆無。InternLumina U2 自家的模型卡將其基準測試表標為「初步、部分結果」;Qwen 的則全是與自家前代比較,且未經重現。

權重問題自預覽報導以來已有所變化
如果你讀過我們先前關於InternLumina U2在程式碼首次出現時的那篇報導,情況已在某個方向上出現變化,在另一個方向上則維持不變,而這兩部分都很重要。Hugging Face 儲存庫已不再是空殼:ascend/ 資料夾現在裝有七個 safetensors 分片,以及設定、tokenizer 與模型程式碼,這表示只要擁有合適硬體,任何人都能真正下載並執行該模型。nvidia/ 資料夾仍標示為「即將推出」,技術報告仍待發布,而該儲存庫自己的基準測試區段仍寫著「初步、部分結果」。所以今天準確的說法不是「權重已釋出」或「權重缺失」,而是某一硬體堆疊的檢查點已發布,另一個則尚未發布;對任何使用 NVIDIA 叢集的人來說,這是一項實際限制。
另外兩件事也悄然有了變化。GitHub 儲存庫在最初 9 月 1 日發布之後仍持續收到提交,且遠超當初的發布時點,因此釋出的程式碼是被維護著,而非被擱置。而 Hugging Face 儲存庫上的下載計數器仍顯示為零,這與其說反映了模型本身,不如說反映了受眾:一個搭載 Ascend 優先檢查點的 16B-A1B 擴散模型,瞄準的是實驗室,而不是本季正在尋找代管端點的產品團隊。
兩者真正重疊之處,以及未重疊之處
圖像理解是交集,而且它比看起來更狹窄。兩個模型都能看著一張圖片並回答相關問題,這對Qwen3.8-Omni-Flash來說是全部工作,而對InternLumina U2來說則是六項工作中的其中一項。此後的一切就大相逕庭。InternLumina U2 接著可以編輯那張圖像,或根據提示生成新的圖像,而且是在同一個模型中,使用它讀取圖像時所用的同一套視覺詞彙。Qwen3.8-Omni-Flash 無法產生任何像素,但它能在一次呼叫中接受一小時的音訊和視訊,並告訴你誰在何時發言,以及做出了什麼決定——而 InternLumina U2 的公開資料完全沒有聲稱能做到這件事。
影片這項重疊,並不像人們以為的那麼重要。兩者都被描述為能處理影片,但它們對影片的處理方式不同:一個是把一段長錄影當作文件來理解,另一個則是把影片視為與 3D 並列的視覺模態來處理。需要將一小時素材摘要出來的團隊,無法靠後者滿足需求;而需要生成單一影格的團隊,也無法靠前者滿足需求。

成本、控制,以及你實際上在買什麼
這樣的定價比較根本不是同類相比。Qwen3.8-Omni-Flash按 token 計費——國際價目表為每百萬輸入 token 0.15 美元、快取 0.016 美元、輸出 0.47 美元,另有另一份無法相提並論的中國大陸價目表——而其發布時的主打說法是廠商宣稱每小時音訊輸入成本削減超過 98%,這個數字是把一段兩分鐘的樣本定價後乘以三十算出來的,影片則以 720p、每秒一格取樣。InternLumina U2則完全不收費,因為根本沒有東西可計費:成本在於你的硬體與你的時間,而且該模型自己的規格卡並未公布吞吐量數字,讓你無法把它換算成每 token 的價格。
這就是權衡取捨的一句話總結。API 提供你無法自行託管的能力,以及隨使用量而變動的每小時成本;開放權重則提供固定成本,以及對資料路徑的完全掌控,代價是你必須自行建構的推論堆疊,以及目前意味著 Ascend 硬體的檢查點集。對於媒體不能離開建築的受監管工作負載而言,第二個選項不是偏好——而是這頁面上唯一的選項。對於這個月就需要長音訊分析的團隊而言,第一個選項是這頁面上唯一的選項。
OrcaRouter 目前並未託管這兩個模型中的任何一個,而我們寧可坦白說明,也不願暗示一條並不存在的路由路徑:Qwen3.8-Omni-Flash僅在阿里巴巴自家平台上運行,而InternLumina U2是可下載的檔案,而非端點。我們實際運行的是 Qwen3.8 系列的其他型號——Qwen3.8-Flash與Qwen3.8-Max——透過單一 API,以供應商定價、0% 加成提供,這是在這項比較中,為封閉模型陣營維持可用基準的實際做法,而開放權重陣營仍在整備其 NVIDIA 檢查點。

你實際上應該選哪一個?
選擇InternLumina U2,如果你需要一個能讀取、生成與編輯影像的模型,而且願意自行承擔整套推論堆疊——以及如果你的加速器是 Ascend,或是你可以等待 NVIDIA 的檢查點。它是這兩者中唯一能生成影像的模型,也是唯一一個不必把資料送給廠商就能執行的模型。在技術報告出爐之前,請把它的基準測試數字視為未經證實,因為模型卡上正是這麼寫的。
選擇 Qwen3.8-Omni-Flash如果你的問題是數小時的音訊與影片,而不是輸出像素——會議智慧、長時錄音分析、以音訊為重的中英文代理式工作——而且你能接受單一來源依賴與純文字輸出。它在輸入音訊時數上的成本表現很強,但在總帳單上就弱得多;它的基準測試由廠商自行提報且未經重現,而首批出現的第三方實測把它放在推理能力的第 28 百分位,其樣本小到應該促使你去做一次測試,而不是直接下決定。
如果你兩者都需要,它們是互補的,而非替代方案:一個是你自行託管的開放權重圖像模型,另一個是你呼叫的封閉式長媒體模型。目前這兩者都無法透過我們進行路由。一邊值得留意的是 NVIDIA 的檢查點與技術報告;另一邊則是首次獨立評估,而它目前尚不存在,也是Qwen3.8-Omni-Flash迄今為止
