用於比較「InternLumina-U2 vs Gemini Omni 1.1 Flash」的英雄標題卡片,副標題為「你目前還無法執行的模型 vs 按秒計費的那一個」,並附有三個統計標籤——「InternLumina-U2:僅限程式碼,權重即將推出」、「Gemini Omni 1.1 Flash:GA 2026年8月27日」、「影片每秒 $0.03–$0.30」——右下角有 OrcaRouter 標誌。
Guides & Insights

InternLumina-U2 vs Gemini Omni 1.1 Flash:尚無法運行的模型 vs 按秒付費的模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

如果你的期限就在這一週,那這個比較的答案一句話就能講完。Gemini Omni 1.1 Flash 是 Google 已全面開放使用的影片生成模型——你透過 API 呼叫它,它會回傳一段音訊同步的短片,並按輸出秒數計費。InternLumina-U2 則是上海人工智慧實驗室低調發表的 Apache-2.0 研究模型——你可以下載它的推論程式碼,但拿不到權重,實驗室仍將權重標示為「即將推出」。一個是你現在就能花錢買到的產品;另一個是論文形態、你根本無法執行的賭注。真正有意思的是,為什麼有人會把這兩者放在同一個句子裡比較,以及它們各自說明了 2026 年底開放多模態研究將走向何方。

以下所有內容皆依來源標示。InternLumina-U2 的詳細資訊來自該實驗室於 2026 年 9 月 1 日發布的 GitHub 儲存庫與專案頁面——當天同一個空的 Hugging Face 佔位頁面也出現——其所有基準測試數據皆為廠商自行報告、初步且未經重現的結果。Gemini Omni 1.1 Flash 的詳細資訊則來自 Google 自家的發布資料與定價頁面,該模型於 2026 年 8 月 27 日正式全面開放。

同一個「多模態」問題的兩個答案

這兩種模型都籠統地掛在「一個模型、多種模態」的旗幟下,而這個共同的標籤正是它們會被拿來比較的唯一理由。但在這層標籤之下,它們幾乎毫無共通之處。Gemini Omni 1.1 Flash 是封閉式、託管且以影片為優先的生成服務:只要輸入文字、圖片、簡短的參考片段或音訊,它就能產出最多十秒的 720p 影片,連同語音、音樂與音效一起處理好;還能以十秒為單位延展,組成一段四十秒的場景。它會針對你已提供的片段進行推理——延伸過程現在會檢視最多十秒的先前內容(先前則否)——並支援首/末幀控制,所以你可以固定鏡頭的起點與終點,讓模型填滿中間的部分。它以秒計費,本質上是製作動態影像的工具。

InternLumina-U2 是另一個方向的賭注:一個單一的稀疏混合專家模型,總參數 160 億、活躍參數 10 億,號稱能透過單一共享的離散 token 介面理解影像、影片與 3D 資產,並生成和編輯影像。它的視覺端完全是離散的——來自實驗室稱為 AToken 的分詞器,配備八個互補碼本,因此每個視覺位置由八個碼描述,而非一個——而語言端則是實驗室從 LLaDA-2.0 延伸而來的擴散骨幹。其主張是:理解與生成應在單一權重集中互相增強,而不是由專業模型拼接而成。這種做法是否可行,目前無法回答:該模型在任何地方都無法運行,因為其權重並未公開存在。

那個記分板,也就那樣吧。

這個配對的誠實記分板必須在每一行都承載溯源資訊,因為其中一欄是價格已公開的上市產品,另一欄則是完全没有價格的未發布研究宣稱。

• 這是什麼 — Gemini Omni 1.1 Flash:一個託管式影片生成與編輯模型(模型 ID:gemini-omni-1.1-flash),2026 年 8 月 27 日全面上市(GA)。InternLumina-U2:一個開放科學的擴散式 LLM,用於全方位視覺理解、圖片生成與編輯,程式碼於 2026 年 9 月 1 日發布。

• 權重 — Gemini Omni 1.1 Flash:無,封閉且僅限代管。InternLumina-U2:同樣也還沒有,但採用 Apache-2.0 授權,並明確標示為「即將推出」。

• 你獲得的輸出 — Gemini Omni 1.1 Flash:10秒720p附音訊片段,可延長至40秒;1080p和4K升頻;同時提供文字。InternLumina-U2:目前還沒有任何內容 — 推論程式碼和路線圖。

• 它所接受的輸入 — Gemini Omni 1.1 Flash:文字、圖像、影片(每個提示最多約 131K 個輸入 token;三個各 10 秒的片段)、音訊。InternLumina-U2:宣稱支援文字、自然圖像、密集圖表、超過 64 個取樣幀的影片,以及渲染成 64 個色彩與深度視圖的 GLB/GLTF 3D 資產。

• 如何執行 — Gemini Omni 1.1 Flash:透過有狀態的 Interactions API 使用 Google 的 Gemini API;消費者可透過 Google Flow 使用,適用於 AI Plus、Pro 與 Ultra 訂閱者。InternLumina-U2:僅限自行託管,且必須等待權重釋出後才能使用;程式碼預期使用分割的檢查點目錄、AToken tokenizer 權重、FlashAttention,以及用於 3D 路徑的 Blender 4.5。

• 費用 — Gemini Omni 1.1 Flash:360p 草稿模式每秒 $0.03,720p 每秒 $0.10,1080p 每秒 $0.15,4K 每秒 $0.30。Token 費率為每百萬個輸入 Token 收費 $1.50,每百萬個文字輸出 Token 收費 $9.00。InternLumina-U2:一旦問世,費用就是你自己 GPU 的成本。

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

這兩個欄位所衡量的軸線並不相同。Gemini 那一側是已定價、已提供服務且能立即發揮效用;而 InternLumina 那一側則只是一個尚未成為模型的模型規格。

目前實際最新的部分:Gemini Omni 1.1 Flash 的正式發布版(GA)

{{1}}Gemini Omni 1.1 Flash 本週本身就值得關注,因為此刻正是 Google 的 Omni 影片產品線告別預覽階段的時刻。{{/1}} {{2}}先前的 Gemini Omni Flash 預覽端點排定於 2026 年 9 月 30 日關閉,而這個 GA 模型正是開發人員即將轉移到的替代方案。{{/2}} 這份升級清單非常具體:{{3}}以十秒增量構成、最多四十秒的場景延伸{{/3}};{{4}}關鍵影格控制,可指定首幀與末幀,讓模型生成中間的銜接畫面{{/4}};{{5}}最長三秒的參考片段,可維持角色或場景設定的一致性{{/5}};還有{{6}}360p 草稿方案,定價是 720p 的三分之一,執行速度最高快 60%,便於在昂貴的最終渲染前迭代提示詞{{/6}}。如果你在建置影片管線,這張價格表——{{7}}720p 每秒 0.10 美元、十秒片段每段 1.01 美元、以四次延伸呼叫組成的四十秒 720p 場景約 4 美元{{/7}}——正是會改變你成本模型的關鍵數字。

這些都不足以讓它在任何實際運作意義上成為 InternLumina-U2 的競爭對手。Gemini Omni 1.1 Flash 能生成動態畫面;而 InternLumina-U2,若其宣稱經得起實際權重的考驗,則能理解動態並生成靜態影像。本季需要產品影片的團隊不會在兩者之間做選擇——Gemini 模型是兩者中唯一實際可呼叫的,而且可透過 Google 自家的 API 及多個第三方平台取得。

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

位於 Google AI 開發者網站上的 Gemini API「Models」文件,於 2026 年 9 月 2 日擷取——該頁面列出了目前的 Gemini 系列,側邊欄導覽中包含 Gemini Omni 產品線。

完全不當前的部分:InternLumina-U2

InternLumina-U2 於 9 月 1 日的發布,是最低調的那種:三個提交到 GitHub 儲存庫的 commit、一個專案頁面、一個 28 位元組的 Hugging Face 佔位檔案,其全部內容僅為 Apache-2.0 授權標頭,以及沒有任何公告。真正公開的,是推論框架與架構本身,而它們之所以值得仔細閱讀,正是因為至今仍無人能實際測試該模型。儲存庫展示了一個驅動程式,每個任務對應一個入口:文字、最高 1024×1024 的文字轉影像、自然影像與密集圖表的影像理解、具備可選雙 CFG 模式的指令式影像編輯、對 64 個取樣幀的影片理解,以及對 Blender 渲染之 GLB/GLTF 視圖的 3D 理解。其設計賭注在於,一個多重碼本的離散視覺詞彙表,能讓單一骨幹網路完成所有任務,而不需膨脹序列長度——這正是驅動 codec 原生影片模型的「視覺 token 應承載更多資訊」直覺,如今被應用於統一的理解與生成介面。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

InternLM/InternLumina-U2 GitHub 儲存庫,擷取於 2026 年 9 月 2 日——Apache-2.0 儲存庫的登陸頁面,包含「Multi-Codebook Diffusion Large Language Model」描述、三個提交,以及各任務推論腳本;這些腳本就是迄今為止該公開版本釋出的全部內容。

專案頁面上的基準測試表本身就被實驗室標記為「初步、部分結果」,而表上的數字也是利弊互見:亮眼的圖表與文件成績(ChartQA 86.52、CharXiv-DQ 83.65,皆為廠商自行回報)旁邊,是僅 0.81 的 GenEval,落後於實驗室聲稱超越的至少一個模型所取得的 0.89。由於沒有任何模型可供評估,自然也不存在獨立評測。在 safetensors 檔案出現在那個空洞的 Hugging Face 佔位頁面之前,一切關於實際品質的說法都只是宣稱。

當只有一端存在時,路由層會做什麼?

這是那種路由層面的比較,重點其實在時間,而非選擇。我們不會假裝 OrcaRouter 提供 InternLumina-U2——沒有人能辦到,權重尚未釋出——而 Gemini Omni 1.1 Flash 也不在我們的目錄中;你要透過 Google 自家的 API 才能取用。路由層在這種空窗期真正的作用,是讓你的選項保持開放,而不必把管線重建兩次。直通模式就是機制:當某個託管的廠商模型真正進入目錄時,供應商列表定價以 0% 加成直通,因此廠商公布的每秒費率,就是你透過單一金鑰支付的每秒費率,毋須逐一簽訂各供應商合約。而當像 InternLumina-U2 這種 Apache-2.0 權重釋出終於到來時,理性的做法不是拆掉你正在運作的影片技術棧——而是在自動容錯移轉後方,把新模型架設到一條測試路徑上;這樣一來,當這個未經驗證的擴散模型第一次出錯時,呼叫就會在無須變更程式碼的情況下,回退到你已經信任的模型。在傷不到你的地方嘗試新事物;把會付帳單的流量路由出去。

裁決

If you need video this month, the decision is made for you: Gemini Omni 1.1 Flash is real, priced and generally available, and InternLumina-U2 cannot be called by anyone. If you are watching where open multimodal research goes, InternLumina-U2 is the more interesting artifact — a rare fully-discrete, multi-codebook bet from a major lab, Apache-2.0, with the architecture already public and the weights probably not far behind. Treat the repo as a preview of a research direction, treat the GA video model as a tool you can build on today, and do not let the shared "multimodal" label convince you they are competing for the same job.

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube