
InternLumina-U2 vs Gemini Omni 1.1 Flash:尚無法運行的模型 vs 按秒付費的模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
如果你的期限就在這一週,那這個比較的答案一句話就能講完。Gemini Omni 1.1 Flash 是 Google 已全面開放使用的影片生成模型——你透過 API 呼叫它,它會回傳一段音訊同步的短片,並按輸出秒數計費。InternLumina-U2 則是上海人工智慧實驗室低調發表的 Apache-2.0 研究模型——你可以下載它的推論程式碼,但拿不到權重,實驗室仍將權重標示為「即將推出」。一個是你現在就能花錢買到的產品;另一個是論文形態、你根本無法執行的賭注。真正有意思的是,為什麼有人會把這兩者放在同一個句子裡比較,以及它們各自說明了 2026 年底開放多模態研究將走向何方。
以下所有內容皆依來源標示。InternLumina-U2 的詳細資訊來自該實驗室於 2026 年 9 月 1 日發布的 GitHub 儲存庫與專案頁面——當天同一個空的 Hugging Face 佔位頁面也出現——其所有基準測試數據皆為廠商自行報告、初步且未經重現的結果。Gemini Omni 1.1 Flash 的詳細資訊則來自 Google 自家的發布資料與定價頁面,該模型於 2026 年 8 月 27 日正式全面開放。
同一個「多模態」問題的兩個答案
這兩種模型都籠統地掛在「一個模型、多種模態」的旗幟下,而這個共同的標籤正是它們會被拿來比較的唯一理由。但在這層標籤之下,它們幾乎毫無共通之處。Gemini Omni 1.1 Flash 是封閉式、託管且以影片為優先的生成服務:只要輸入文字、圖片、簡短的參考片段或音訊,它就能產出最多十秒的 720p 影片,連同語音、音樂與音效一起處理好;還能以十秒為單位延展,組成一段四十秒的場景。它會針對你已提供的片段進行推理——延伸過程現在會檢視最多十秒的先前內容(先前則否)——並支援首/末幀控制,所以你可以固定鏡頭的起點與終點,讓模型填滿中間的部分。它以秒計費,本質上是製作動態影像的工具。
InternLumina-U2 是另一個方向的賭注:一個單一的稀疏混合專家模型,總參數 160 億、活躍參數 10 億,號稱能透過單一共享的離散 token 介面理解影像、影片與 3D 資產,並生成和編輯影像。它的視覺端完全是離散的——來自實驗室稱為 AToken 的分詞器,配備八個互補碼本,因此每個視覺位置由八個碼描述,而非一個——而語言端則是實驗室從 LLaDA-2.0 延伸而來的擴散骨幹。其主張是:理解與生成應在單一權重集中互相增強,而不是由專業模型拼接而成。這種做法是否可行,目前無法回答:該模型在任何地方都無法運行,因為其權重並未公開存在。
那個記分板,也就那樣吧。
這個配對的誠實記分板必須在每一行都承載溯源資訊,因為其中一欄是價格已公開的上市產品,另一欄則是完全没有價格的未發布研究宣稱。
• 這是什麼 — Gemini Omni 1.1 Flash:一個託管式影片生成與編輯模型(模型 ID:gemini-omni-1.1-flash),2026 年 8 月 27 日全面上市(GA)。InternLumina-U2:一個開放科學的擴散式 LLM,用於全方位視覺理解、圖片生成與編輯,程式碼於 2026 年 9 月 1 日發布。
• 權重 — Gemini Omni 1.1 Flash:無,封閉且僅限代管。InternLumina-U2:同樣也還沒有,但採用 Apache-2.0 授權,並明確標示為「即將推出」。
• 你獲得的輸出 — Gemini Omni 1.1 Flash:10秒720p附音訊片段,可延長至40秒;1080p和4K升頻;同時提供文字。InternLumina-U2:目前還沒有任何內容 — 推論程式碼和路線圖。
• 它所接受的輸入 — Gemini Omni 1.1 Flash:文字、圖像、影片(每個提示最多約 131K 個輸入 token;三個各 10 秒的片段)、音訊。InternLumina-U2:宣稱支援文字、自然圖像、密集圖表、超過 64 個取樣幀的影片,以及渲染成 64 個色彩與深度視圖的 GLB/GLTF 3D 資產。
• 如何執行 — Gemini Omni 1.1 Flash:透過有狀態的 Interactions API 使用 Google 的 Gemini API;消費者可透過 Google Flow 使用,適用於 AI Plus、Pro 與 Ultra 訂閱者。InternLumina-U2:僅限自行託管,且必須等待權重釋出後才能使用;程式碼預期使用分割的檢查點目錄、AToken tokenizer 權重、FlashAttention,以及用於 3D 路徑的 Blender 4.5。
• 費用 — Gemini Omni 1.1 Flash:360p 草稿模式每秒 $0.03,720p 每秒 $0.10,1080p 每秒 $0.15,4K 每秒 $0.30。Token 費率為每百萬個輸入 Token 收費 $1.50,每百萬個文字輸出 Token 收費 $9.00。InternLumina-U2:一旦問世,費用就是你自己 GPU 的成本。

這兩個欄位所衡量的軸線並不相同。Gemini 那一側是已定價、已提供服務且能立即發揮效用;而 InternLumina 那一側則只是一個尚未成為模型的模型規格。
目前實際最新的部分:Gemini Omni 1.1 Flash 的正式發布版(GA)
{{1}}Gemini Omni 1.1 Flash 本週本身就值得關注,因為此刻正是 Google 的 Omni 影片產品線告別預覽階段的時刻。{{/1}} {{2}}先前的 Gemini Omni Flash 預覽端點排定於 2026 年 9 月 30 日關閉,而這個 GA 模型正是開發人員即將轉移到的替代方案。{{/2}} 這份升級清單非常具體:{{3}}以十秒增量構成、最多四十秒的場景延伸{{/3}};{{4}}關鍵影格控制,可指定首幀與末幀,讓模型生成中間的銜接畫面{{/4}};{{5}}最長三秒的參考片段,可維持角色或場景設定的一致性{{/5}};還有{{6}}360p 草稿方案,定價是 720p 的三分之一,執行速度最高快 60%,便於在昂貴的最終渲染前迭代提示詞{{/6}}。如果你在建置影片管線,這張價格表——{{7}}720p 每秒 0.10 美元、十秒片段每段 1.01 美元、以四次延伸呼叫組成的四十秒 720p 場景約 4 美元{{/7}}——正是會改變你成本模型的關鍵數字。
這些都不足以讓它在任何實際運作意義上成為 InternLumina-U2 的競爭對手。Gemini Omni 1.1 Flash 能生成動態畫面;而 InternLumina-U2,若其宣稱經得起實際權重的考驗,則能理解動態並生成靜態影像。本季需要產品影片的團隊不會在兩者之間做選擇——Gemini 模型是兩者中唯一實際可呼叫的,而且可透過 Google 自家的 API 及多個第三方平台取得。

位於 Google AI 開發者網站上的 Gemini API「Models」文件,於 2026 年 9 月 2 日擷取——該頁面列出了目前的 Gemini 系列,側邊欄導覽中包含 Gemini Omni 產品線。
完全不當前的部分:InternLumina-U2
InternLumina-U2 於 9 月 1 日的發布,是最低調的那種:三個提交到 GitHub 儲存庫的 commit、一個專案頁面、一個 28 位元組的 Hugging Face 佔位檔案,其全部內容僅為 Apache-2.0 授權標頭,以及沒有任何公告。真正公開的,是推論框架與架構本身,而它們之所以值得仔細閱讀,正是因為至今仍無人能實際測試該模型。儲存庫展示了一個驅動程式,每個任務對應一個入口:文字、最高 1024×1024 的文字轉影像、自然影像與密集圖表的影像理解、具備可選雙 CFG 模式的指令式影像編輯、對 64 個取樣幀的影片理解,以及對 Blender 渲染之 GLB/GLTF 視圖的 3D 理解。其設計賭注在於,一個多重碼本的離散視覺詞彙表,能讓單一骨幹網路完成所有任務,而不需膨脹序列長度——這正是驅動 codec 原生影片模型的「視覺 token 應承載更多資訊」直覺,如今被應用於統一的理解與生成介面。

InternLM/InternLumina-U2 GitHub 儲存庫,擷取於 2026 年 9 月 2 日——Apache-2.0 儲存庫的登陸頁面,包含「Multi-Codebook Diffusion Large Language Model」描述、三個提交,以及各任務推論腳本;這些腳本就是迄今為止該公開版本釋出的全部內容。
專案頁面上的基準測試表本身就被實驗室標記為「初步、部分結果」,而表上的數字也是利弊互見:亮眼的圖表與文件成績(ChartQA 86.52、CharXiv-DQ 83.65,皆為廠商自行回報)旁邊,是僅 0.81 的 GenEval,落後於實驗室聲稱超越的至少一個模型所取得的 0.89。由於沒有任何模型可供評估,自然也不存在獨立評測。在 safetensors 檔案出現在那個空洞的 Hugging Face 佔位頁面之前,一切關於實際品質的說法都只是宣稱。
當只有一端存在時,路由層會做什麼?
這是那種路由層面的比較,重點其實在時間,而非選擇。我們不會假裝 OrcaRouter 提供 InternLumina-U2——沒有人能辦到,權重尚未釋出——而 Gemini Omni 1.1 Flash 也不在我們的目錄中;你要透過 Google 自家的 API 才能取用。路由層在這種空窗期真正的作用,是讓你的選項保持開放,而不必把管線重建兩次。直通模式就是機制:當某個託管的廠商模型真正進入目錄時,供應商列表定價以 0% 加成直通,因此廠商公布的每秒費率,就是你透過單一金鑰支付的每秒費率,毋須逐一簽訂各供應商合約。而當像 InternLumina-U2 這種 Apache-2.0 權重釋出終於到來時,理性的做法不是拆掉你正在運作的影片技術棧——而是在自動容錯移轉後方,把新模型架設到一條測試路徑上;這樣一來,當這個未經驗證的擴散模型第一次出錯時,呼叫就會在無須變更程式碼的情況下,回退到你已經信任的模型。在傷不到你的地方嘗試新事物;把會付帳單的流量路由出去。
裁決
If you need video this month, the decision is made for you: Gemini Omni 1.1 Flash is real, priced and generally available, and InternLumina-U2 cannot be called by anyone. If you are watching where open multimodal research goes, InternLumina-U2 is the more interesting artifact — a rare fully-discrete, multi-codebook bet from a major lab, Apache-2.0, with the architecture already public and the weights probably not far behind. Treat the repo as a preview of a research direction, treat the GA video model as a tool you can build on today, and do not let the shared "multimodal" label convince you they are competing for the same job.
