Thẻ tiêu đề chính cho phần so sánh 'InternLumina-U2 vs Gemini Omni 1.1 Flash' với phụ đề 'Mô hình bạn chưa thể chạy được so với mô hình bạn phải trả phí từng giây' và ba chip dữ liệu — 'InternLumina-U2: chỉ có mã, bộ trọng số sắp ra mắt', 'Gemini Omni 1.1 Flash: GA 27/08/2026', '$0,03–$0,30 mỗi giây video' — với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

InternLumina-U2 vs Gemini Omni 1.1 Flash: Mô hình bạn chưa thể chạy được so với mô hình bạn trả phí theo từng giây

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nếu hạn chót của bạn là trong tuần này, sự so sánh này có câu trả lời chỉ gói gọn trong một câu. {{1}}Gemini Omni 1.1 Flash là mô hình tạo video được Google phát hành rộng rãi — bạn gọi nó qua API, nó trả về một clip có âm thanh đồng bộ và bạn trả phí theo từng giây đầu ra.{{/1}} {{2}}InternLumina-U2 là mô hình nghiên cứu Apache-2.0 do Phòng thí nghiệm AI Thượng Hải âm thầm công bố — bạn có thể tải mã suy luận của nó, nhưng không thể tải trọng số, thứ mà phòng thí nghiệm vẫn gắn nhãn "sắp ra mắt".{{/2}} {{3}}Một bên là sản phẩm bạn có thể mua ngay bây giờ; bên còn lại là một canh bạc mang hình dáng bài nghiên cứu mà bạn không thể chạy được chút nào.{{/3}} {{4}}Câu hỏi thú vị là vì sao ngay từ đầu lại có người đặt chúng vào cùng một câu,{{/4}} {{5}}và mỗi bên cho bạn biết điều gì về hướng đi của các công trình đa phương thức mở vào cuối năm 2026.{{/5}}

Mọi thông tin bên dưới đều được ghi rõ nguồn. Chi tiết về InternLumina-U2 được lấy từ kho lưu trữ GitHub và trang dự án mà phòng thí nghiệm đã công bố vào ngày 1 tháng 9 năm 2026 — cùng ngày bản stub trống trên Hugging Face xuất hiện — và mọi số liệu benchmark của mô hình này đều do nhà cung cấp báo cáo, chỉ mang tính sơ bộ và chưa được tái lập. Chi tiết về Gemini Omni 1.1 Flash được lấy từ tài liệu phát hành và trang giá của chính Google dành cho mô hình được phát hành rộng rãi vào ngày 27 tháng 8 năm 2026.

Hai câu trả lời cho cùng một câu hỏi "đa phương thức"

Cả hai mô hình đều nằm dưới biểu ngữ lỏng lẻo "một mô hình, nhiều phương thức", và cái nhãn dùng chung đó là lý do duy nhất khiến chúng bị đem ra so sánh. Đằng sau biểu ngữ ấy, chúng gần như chẳng có gì chung. Gemini Omni 1.1 Flash là một dịch vụ tạo sinh mã nguồn đóng, được lưu trữ từ xa, lấy video làm trung tâm: đưa cho nó văn bản, một hình ảnh, một đoạn clip tham chiếu ngắn hoặc âm thanh, nó sẽ tạo ra tối đa mười giây video 720p với lời thoại, âm nhạc và hiệu ứng âm thanh được tích hợp sẵn, có thể kéo dài thêm theo từng nấc mười giây cho tới một cảnh dài bốn mươi giây. Nó suy luận dựa trên đoạn clip bạn đang có — lượt kéo dài giờ đây xem xét tối đa mười giây bối cảnh phía trước thay vì chỉ một giây như trước — và hỗ trợ điều khiển khung hình đầu/cuối để bạn có thể ghim điểm bắt đầu và điểm kết thúc của một cảnh quay, để mô hình tự điền vào phần giữa. Đây là một công cụ tạo ra những thước phim chuyển động, được bán theo từng giây.

InternLumina-U2 là một canh bạc theo hướng ngược lại: một mô hình hỗn hợp chuyên gia thưa duy nhất, tổng cộng 16B tham số với 1B tham số hoạt động, tự nhận có khả năng hiểu hình ảnh, video và tài sản 3D, đồng thời tạo và chỉnh sửa hình ảnh thông qua một giao diện token rời rạc dùng chung. Phía thị giác của nó hoàn toàn rời rạc — tám bảng mã bổ sung từ một bộ token hóa mà phòng thí nghiệm gọi là AToken, do đó mỗi vị trí thị giác được mô tả bằng tám mã thay vì một — và phía ngôn ngữ của nó là một xương sống khuếch tán mà phòng thí nghiệm mở rộng từ LLaDA-2.0. Luận điểm là khả năng hiểu và khả năng tạo sinh nên củng cố lẫn nhau trong một bộ trọng số duy nhất thay vì được ghép nối từ các mô hình chuyên biệt. Liệu điều đó có hiệu quả hay không hiện vẫn chưa thể trả lời: mô hình hiện không thể chạy ở bất kỳ đâu, vì các trọng số không tồn tại công khai.

Bảng tỷ số, dù sao cũng chỉ có thế thôi.

Bảng điểm trung thực cho cặp này phải mang thông tin nguồn gốc trên mỗi hàng, vì một cột là sản phẩm đã phát hành với giá niêm yết công khai, còn cột kia là một tuyên bố nghiên cứu chưa được công bố và hoàn toàn không có giá.

• Đây là gì — Gemini Omni 1.1 Flash: mô hình tạo và chỉnh sửa video được lưu trữ trên nền tảng đám mây (model ID: gemini-omni-1.1-flash), GA ngày 27 tháng 8 năm 2026. InternLumina-U2: một LLM khuếch tán khoa học mở dành cho hiểu thị giác toàn diện, tạo và chỉnh sửa hình ảnh, mã nguồn được phát hành ngày 1 tháng 9 năm 2026.

• Trọng số — Gemini Omni 1.1 Flash: không có, đóng và chỉ lưu trữ. InternLumina-U2: cũng chưa có, nhưng được cấp phép theo Apache-2.0 và được đánh dấu rõ ràng là "sắp ra mắt".

• Đầu ra bạn nhận được — Gemini Omni 1.1 Flash: các đoạn clip 720p dài 10 giây có âm thanh, có thể kéo dài đến 40 giây; nâng cấp độ phân giải 1080p và 4K; có văn bản đi kèm. InternLumina-U2: chưa có gì — mã suy luận và lộ trình.

• Đầu vào hỗ trợ — Gemini Omni 1.1 Flash: văn bản, hình ảnh, video (tối đa ~131K token đầu vào; ba clip 10 giây mỗi lượt nhắc), âm thanh. InternLumina-U2: hỗ trợ văn bản, hình ảnh tự nhiên, biểu đồ dày đặc, video trên 64 khung hình được lấy mẫu, và tài sản 3D GLB/GLTF được dựng thành 64 khung nhìn màu và độ sâu.

• Cách chạy — Gemini Omni 1.1 Flash: sử dụng API Gemini của Google thông qua Interactions API có trạng thái; người dùng truy cập thông qua Google Flow dành cho người đăng ký AI Plus, Pro và Ultra. InternLumina-U2: chỉ tự lưu trữ và chỉ sau khi các bộ trọng số được phát hành; mã nguồn yêu cầu thư mục checkpoint được phân tách, trọng số tokenizer AToken, FlashAttention và Blender 4.5 cho đường dẫn 3D.

• Chi phí là bao nhiêu — Gemini Omni 1.1 Flash: 0,03 USD/giây ở bản nháp 360p, 0,10 USD/giây ở 720p, 0,15 USD/giây ở 1080p, 0,30 USD/giây ở 4K, với bảng giá token là 1,50 USD mỗi triệu token đầu vào và 9,00 USD mỗi triệu văn bản đầu ra. InternLumina-U2: bất cứ chi phí GPU của bạn là bao nhiêu, khi nó ra đời.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

Hai cột này không đo cùng một trục. Phía Gemini đã được định giá, vận hành và hữu ích ngay lập tức; còn phía InternLumina chỉ là đặc tả của một mô hình chưa thực sự là mô hình.

Phần thực sự hiện hành: bản GA của Gemini Omni 1.1 Flash

Tuần này, Gemini Omni 1.1 Flash tự nó đã tạo nên dấu ấn, vì đây là thời điểm dòng video omni của Google không còn là bản xem trước. Endpoint preview Gemini Omni Flash trước đó dự kiến sẽ bị tắt vào ngày 30 tháng 9 năm 2026, và mô hình GA này chính là sản phẩm thay thế mà các nhà phát triển đang được chuyển sang. Danh sách nâng cấp rất cụ thể: mở rộng cảnh quay bốn mươi giây được dựng từ các bước tăng mười giây, điều khiển keyframe cho phép bạn chỉ định khung hình đầu và khung hình cuối để mô hình tự tạo phần cảnh quay kết nối, clip tham chiếu dài tối đa ba giây nhằm giữ nhất quán nhân vật hoặc bối cảnh, và gói bản nháp 360p có giá bằng một phần ba so với 720p nhưng chạy nhanh hơn tới 60% để lặp ý tưởng trước khi rendering cuối cùng tốn kém. Nếu bạn xây dựng pipeline video, bảng giá — $0,10 cho một giây 720p, $1,01 cho một clip mười giây, khoảng $4 cho một cảnh 720p bốn mươi giây dựng từ bốn lần gọi mở rộng — chính là con số làm thay đổi mô hình chi phí của bạn.

Không điều nào trong số đó khiến nó trở thành đối thủ cạnh tranh của InternLumina-U2 về mặt vận hành. Gemini Omni 1.1 Flash tạo ra chuyển động; InternLumina-U2, nếu những tuyên bố của nó trụ vững khi tiếp xúc với weights, sẽ hiểu chuyển động và tạo ra ảnh tĩnh. Một nhóm cần video sản phẩm trong quý này sẽ không lựa chọn giữa hai mô hình đó — mô hình Gemini là mô hình duy nhất trong cặp có thể được gọi đến, và nó có sẵn thông qua API của chính Google cùng một số nền tảng bên thứ ba.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

Tài liệu "Models" của Gemini API trên trang web dành cho nhà phát triển AI của Google, chụp ngày 2 tháng 9 năm 2026 — trang liệt kê dòng Gemini hiện tại, với dòng Gemini Omni trong thanh điều hướng bên.

Phần không hề hiện hành: InternLumina-U2

Bản phát hành ngày 1 tháng 9 của InternLumina-U2 thuộc loại yên lặng nhất: ba commit vào một kho lưu trữ GitHub, một trang dự án, một stub Hugging Face 28 byte mà toàn bộ nội dung chỉ là phần tiêu đề giấy phép Apache-2.0, và không một lời thông báo. Thứ thực sự được công khai là bộ khung suy luận (inference harness) và kiến trúc, và chúng đáng được đọc kỹ chính xác vì chưa ai có thể thử nghiệm được chính mô hình. Kho mã cho thấy một trình điều khiển với một điểm vào cho mỗi tác vụ — văn bản, sinh ảnh từ văn bản lên tới 1024×1024, hiểu hình ảnh trên ảnh tự nhiên và biểu đồ dày đặc, chỉnh sửa ảnh theo chỉ dẫn với chế độ dual-CFG tùy chọn, hiểu video qua 64 khung hình được lấy mẫu, và hiểu 3D qua các khung nhìn GLB/GLTF được kết xuất bằng Blender. Thiết kế này đặt cược rằng một từ vựng thị giác rời rạc đa codebook cho phép một backbone duy nhất đảm nhiệm tất cả mà không làm độ dài chuỗi bị phình ra — cùng trực giác "token thị giác nên mang nhiều thông tin hơn" vốn thúc đẩy các mô hình video codec-native, được áp dụng vào một giao diện hiểu-và-sinh hợp nhất.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

Kho lưu trữ GitHub InternLM/InternLumina-U2, bản chụp ngày 2 tháng 9 năm 2026 — trang đích của kho lưu trữ Apache-2.0 có mô tả “Multi-Codebook Diffusion Large Language Model”, ba commit và các tập lệnh suy luận theo từng tác vụ, vốn là toàn bộ bản phát hành công khai cho đến nay.

Bảng benchmark trên trang dự án được chính phòng thí nghiệm dán nhãn là “kết quả sơ bộ, chưa đầy đủ”, và các con số trong đó là con dao hai lưỡi: bên cạnh những điểm số ấn tượng ở mảng biểu đồ và tài liệu (ChartQA 86.52, CharXiv-DQ 83.65, do chính phòng thí nghiệm báo cáo) là điểm GenEval 0.81, thấp hơn mức 0.89 của ít nhất một mô hình mà phòng thí nghiệm tuyên bố đã vượt qua. Không có đánh giá độc lập, vì không có mô hình nào để đánh giá. Mọi khẳng định về chất lượng thực tế vẫn chỉ là lời tuyên bố cho đến khi các tệp safetensors xuất hiện trong kho lưu trữ Hugging Face trống rỗng (stub) kia.

Lớp định tuyến làm gì khi chỉ có một phía tồn tại

Đây là một trong những bài so sánh mà khía cạnh định tuyến thực sự chỉ là chuyện thời gian, không phải chuyện lựa chọn. Chúng tôi sẽ không giả vờ rằng OrcaRouter phục vụ InternLumina-U2 — không ai có thể, vì trọng số của mô hình chưa được phát hành — và Gemini Omni 1.1 Flash cũng không có trong danh mục của chúng tôi; bạn truy cập nó thông qua API của chính Google. Thứ mà một lớp định tuyến thực sự dùng để làm trong khoảng trống này là giữ các lựa chọn của bạn luôn mở mà không phải xây dựng lại pipeline hai lần. Mô hình chuyển thẳng (pass-through) chính là cơ chế: khi một mô hình do nhà cung cấp lưu trú xuất hiện trong danh mục, giá niêm yết của nhà cung cấp được chuyển thẳng qua mà không cộng thêm phần trăm chênh lệch nào, nên mức phí mỗi giây mà nhà cung cấp công bố chính là mức phí mỗi giây bạn bỏ ra chỉ với một khóa duy nhất thay vì phải ký hợp đồng với từng nhà cung cấp. Và khi một bộ trọng số Apache-2.0 như InternLumina-U2 cuối cùng được ra mắt, nước đi hợp lý không phải là xé bỏ ngăn xếp video đang hoạt động tốt của bạn — mà là đưa mô hình mới vào một đường dẫn thử nghiệm phía sau cơ chế chuyển đổi dự phòng tự động, để ngay lần đầu tiên mô hình khuếch tán chưa được kiểm chứng này có hành vi sai lệch, cuộc gọi sẽ tự động rơi về mô hình bạn vốn đã tin cậy mà không cần thay đổi mã nguồn. Hãy thử thứ mới ở nơi nó không thể làm hại bạn; hãy định tuyến thứ đang kiếm ra tiền.

Bản án

Nếu bạn cần video trong tháng này, quyết định đã được đưa ra: Gemini Omni 1.1 Flash là có thật, đã có giá bán và phát hành rộng rãi, còn InternLumina-U2 thì chưa ai có thể gọi. Nếu bạn đang theo dõi hướng đi của nghiên cứu đa phương thức mở, InternLumina-U2 mới là thứ đáng chú ý hơn — một ván cược hiếm hoi theo hướng fully-discrete, multi-codebook từ một phòng thí nghiệm lớn, dưới giấy phép Apache-2.0, với kiến trúc đã được công khai và bộ trọng số có lẽ cũng sắp được ra mắt. Hãy coi repo như bản xem trước của một hướng nghiên cứu, coi mô hình video GA như một công cụ bạn có thể xây dựng ngay hôm nay, và đừng để cái nhãn "đa phương thức" dùng chung khiến bạn tin rằng chúng đang cạnh tranh cho cùng một vai trò.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube