
InternLumina-U2 so với Qwen2.5 Omni: Mô hình Omni mà Alibaba đã phát hành so với mô hình mà Shanghai AI Lab vẫn đang hứa hẹn
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
InternLumina-U2 và Qwen2.5 Omni đều là câu trả lời cho cùng một tham vọng — một mô hình duy nhất xử lý mọi phương thức thay vì một vườn thú các chuyên gia — nhưng đến từ hai thế hệ cách nhau. Qwen2.5 Omni là câu trả lời thực sự được phát hành: một mô hình trọng số mở 7 tỷ tham số ra mắt vào tháng 3 năm 2025, đã mười bảy tháng tuổi tại thời điểm bài viết, nhận đầu vào là văn bản, hình ảnh, âm thanh và video, rồi phản hồi bằng văn bản hoặc giọng nói tự nhiên phát trực tiếp. InternLumina-U2 là câu trả lời của Phòng thí nghiệm Trí tuệ nhân tạo Thượng Hải, được công bố dưới dạng mã suy luận vào ngày 1 tháng 9 năm 2026: một mô hình khuếch tán thưa 16 tỷ tham số, được tuyên bố có thể nhận biết hình ảnh, video và 3D, đồng thời tạo mới và chỉnh sửa hình ảnh thông qua một giao diện token rời rạc dùng chung. Một thế hệ của ý tưởng omni đã được vận hành suốt một năm rưỡi; thế hệ còn lại mới một ngày tuổi và không ai có thể chạy được, vì trọng số của nó vẫn chưa tồn tại. Khoảng cách giữa chúng chính là sự khác biệt giữa một lời hứa đã được giữ và một lời hứa vừa mới được đưa ra.
Omni đã ra mắt: Qwen2.5 Omni
Qwen2.5 Omni đáng được coi trọng như một baseline vì đây là mô hình mở hiếm hoi thực sự mang lại đúng lời hứa "nhận biết mọi thứ, trả lời dưới mọi hình thức". Kiến trúc Thinker-Talker của nó kết hợp một bộ phận tư duy văn bản với một bộ phận phát ngôn tạo ra giọng nói, sử dụng mã hóa vị trí đa phương thức đồng bộ theo thời gian để âm thanh và video luôn khớp nhau; đầu vào bao gồm văn bản, hình ảnh, âm thanh và video, còn đầu ra có thể là văn bản kèm giọng nói trong cùng một lượt, với bốn giọng nói tích hợp sẵn. Các hạn chế cũng được ghi nhận rõ ràng như các khả năng: ngữ cảnh 32K token, không có gọi hàm, không có đầu ra có cấu trúc, và nó là một nhà hội thoại toàn năng chứ không phải một tác nhân. Điều nó không làm được cũng cần được nhấn mạnh trong sự so sánh này — nó nhận biết hình ảnh, âm thanh và video, nhưng không tạo ra chúng. Chữ "Omni" trong Qwen2.5 Omni nghĩa là nhận biết toàn diện với tổng hợp giọng nói ở phía đầu ra; pixel đi vào, và từ ngữ đi ra.
Thành tích thực tế đã chứng minh điều đó. Mô hình đã được tải xuống hàng trăm nghìn lần, có API lưu trữ thông qua nền tảng riêng của nhà phát triển cùng một số nền tảng bên thứ ba, và đã dành mười bảy tháng để tích lũy các bản lượng tử hóa, công cụ cộng đồng và một mức giá đã được biết đến — danh sách tổng hợp đặt giá văn bản vào khoảng $0,09 cho mỗi triệu token đầu vào và $0,34 cho mỗi triệu token đầu ra, với âm thanh được tính phí riêng. Mười bảy tháng là đủ dài để cả điểm mạnh lẫn giới hạn của nó đều được lập bản đồ rõ ràng. Đó là thứ mà sự trưởng thành mang lại: không phải sự hoàn hảo, mà là khả năng dự đoán.
Omni được hứa hẹn: InternLumina-U2
InternLumina-U2 đang cố tiến xa hơn Qwen2.5 Omni một bước, và bước tiến đó nằm đúng ngay tại nơi khó khăn nhất. Luận điểm thiết kế của nó là nhận thức và tạo sinh phải dùng chung một giao diện token rời rạc duy nhất: thay vì một mô hình ngôn ngữ nhận thức video cùng một mô hình khuếch tán riêng đảm nhiệm việc vẽ, một backbone khuếch tán MoE thưa — 16B tổng tham số, 1B kích hoạt — sẽ vừa đọc được một hình ảnh, một biểu đồ, một video hay một tài sản 3D, vừa viết ra một hình ảnh mới hoặc một bản chỉnh sửa, dùng một từ vựng thị giác tám codebook hoàn toàn rời rạc để mỗi vị trí thị giác mang đủ thông tin phục vụ cho cả hai hướng. Về thực chất, đó là một tuyên bố lớn hơn hẳn tuyên bố của Qwen2.5 Omni. Một chuyện là dồn mọi phương thức đầu vào thành văn bản và lời nói; một chuyện khác là làm cho một bộ trọng số tạo ra pixel trôi chảy như chính cách nó suy luận về chúng.
Hiện tại, đây cũng là một tuyên bố không thể kiểm chứng. Phòng thí nghiệm đã công bố mã suy luận, một trang dự án với bảng điểm chuẩn "sơ bộ, một phần", và một bản nháp Hugging Face trống; các trọng số, mã huấn luyện, báo cáo kỹ thuật và bộ công nghệ Ascend-NPU đều được đánh dấu là sắp ra mắt. Không có đánh giá độc lập nào tồn tại vì không có gì để đánh giá. Kiến trúc của Qwen2.5 Omni có thể kiểm chứng ngay trong tuần nó ra mắt vì các trọng số đi kèm với nó; kiến trúc của InternLumina-U2 có thể đọc được ngay hôm nay nhưng chất lượng của nó vẫn chỉ là lời hứa từ nhà cung cấp.
Bảng tỷ số
Do một trong các mô hình này có mười bảy tháng lịch sử trong khi mô hình kia chỉ mới có một ngày mã, các hàng mang nguồn gốc xuất xứ thay vì giả vờ rằng các cột là đối xứng.
• Tuổi đời — Qwen2.5 Omni: phát hành tháng 3 năm 2025, mười bảy tháng được sử dụng rộng rãi, hàng trăm nghìn lượt tải xuống. InternLumina-U2: mã nguồn suy luận được công bố ngày 1 tháng 9 năm 2026, không lượt tải xuống nào, không lần chạy độc lập nào.
• Hình dạng — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker với mã hóa vị trí đa phương thức căn chỉnh theo thời gian. InternLumina-U2: LLM khuếch tán MoE thưa với tổng 16B tham số / 1B tham số hoạt động, dùng bộ tokenizer thị giác rời rạc tám codebook.
• Đầu vào — cả hai đều nhận văn bản và hình ảnh; Qwen2.5 Omni còn nhận thêm âm thanh và video cho trò chuyện omni; InternLumina-U2 còn tuyên bố hiểu video qua 64 khung hình được lấy mẫu và hiểu 3D qua các góc nhìn GLB/GLTF được dựng bằng Blender.
Đầu ra — Qwen2.5 Omni: văn bản và giọng nói phát trực tuyến, bốn giọng. InternLumina-U2: hỗ trợ văn bản, tạo ảnh từ văn bản lên đến 1024×1024 và chỉnh sửa ảnh theo hướng dẫn.
• Ranh giới tạo sinh — Qwen2.5 Omni: tạo ra lời nói và giọng nói, không phải điểm ảnh. InternLumina-U2: thử nghiệm tạo và chỉnh sửa điểm ảnh trong cùng một mô hình token rời rạc vốn dùng để đọc hiểu.
• Trọng số và giấy phép — về nguyên tắc, cả hai đều là trọng số mở Apache-2.0; trọng số của Qwen2.5 Omni đã có thể tải xuống ngay hôm nay, còn của InternLumina-U2 thì chưa được công khai.
• Phục vụ — Qwen2.5 Omni: API lưu trữ kèm tự triển khai (một bản triển khai full-precision nặng); ngữ cảnh 32K đã biết, không có chức năng gọi hàm. InternLumina-U2: không thể đưa vào phục vụ — driver được phát hành cần các checkpoint không tồn tại.
• Các con số nổi bật — Qwen2.5 Omni: từ lâu đã có mặt trên bảng xếp hạng OmniBench (điểm khoảng 0,561 trên các bảng hiện tại); InternLumina-U2: ChartQA 86,52, MathVision 33,22, GenEval 0,81 — tất cả đều do nhà cung cấp báo cáo, mang tính sơ bộ và chưa đầy đủ.

Vì sao khoảng cách thế hệ mới là câu chuyện thực sự
{{1}}Tạm gác vấn đề thời đại sang một bên, khác biệt thực chất nằm ở ranh giới mà mỗi mô hình dừng lại.{{/1}} Qwen2.5 Omni chọn một phiên bản omni khả thi: nhận thức rộng, trả lời bằng ngôn ngữ hoặc giọng nói, và để việc tổng hợp hình ảnh, video cho các mô hình sinh chuyên dụng ở nơi khác trong hệ thống. Sự phân công lao động đó chính là cách mà về cơ bản mọi hệ thống đa phương thức sản xuất trong năm 2026 được xây dựng, và đó là lý do Qwen2.5 Omni có thể ra mắt vào năm 2025 và vẫn hữu ích trong năm 2026 — nó hoàn thành tốt phần việc của mình và kết hợp tốt với phần còn lại. InternLumina-U2 đặt cược rằng {{2}}chính sự phân công lao động mới là vấn đề{{/2}}: rằng một mô hình buộc phải biểu diễn mọi thứ — nhận thức và sinh — trong một từ vựng rời rạc dùng chung sẽ học được sự hiểu biết sâu sắc hơn về thị giác so với một mô hình chỉ cần mô tả nó. Nếu cược đó thắng, {{3}}đó sẽ là kết quả quan trọng hơn{{/3}}. Nếu không, InternLumina-U2 sẽ trở thành {{4}}một Qwen2.5 Omni chậm hơn, ngốn tài nguyên hơn, với bộ sinh hình ảnh bị gắn một cách vụng về vào cùng một bộ trọng số.{{/4}} Toàn bộ cuộc cạnh tranh — và đây là cuộc cạnh tranh giữa một thiết kế đã phát hành và một giả thuyết, không phải giữa hai mô hình có thể chạy được — {{5}}chính là liệu kiến trúc khó hơn có tự chứng minh được giá trị của nó hay không.{{/5}}

Thẻ Hugging Face của Qwen/Qwen2.5-Omni-7B, chụp ngày 27 tháng 8 năm 2026 — tổng quan Thinker-Talker, giấy phép Apache-2.0, và các thẻ phương thức văn bản, hình ảnh, âm thanh và video của mô hình.
Một năm rưỡi tải xuống thực sự mua được những gì
Sự trưởng thành không phải là một kiểu rung cảm; nó là một danh sách những điều bạn biết. Với Qwen2.5 Omni, bạn biết ngữ cảnh 32K là một ràng buộc cứng và có thể thiết kế xoay quanh nó. Bạn biết không có cơ chế gọi hàm (function calling) nào và sẽ không giả vờ rằng có. Bạn biết đại khái chi phí triển khai là bao nhiêu, cả qua API được lưu trữ lẫn trên GPU của chính bạn, vì mô hình đã được định giá và vận hành bởi đủ nhiều người nên các con số đã ổn định. Bạn biết thứ hạng trên OmniBench là thật vì các bảng xếp hạng độc lập đã theo dõi nó hơn một năm. Với InternLumina-U2, những động từ đó đều không áp dụng được — bạn không biết, bạn không thể biết, vì không có artifact nào. Khi một mô hình mới chỉ một ngày tuổi và không có trọng lượng, mọi tuyên bố về nó đều là một tuyên bố về ý định. Sự bất đối xứng đó không phải là lời chê bai khoa học; nó là lập trường nhận thức luận đúng đắn cho bất kỳ ai đang chọn nền tảng để xây dựng.

Kho lưu trữ GitHub InternLM/InternLumina-U2, được ghi nhận vào ngày 2 tháng 9 năm 2026 — trang đích của kho lưu trữ công bố kiến trúc — mô tả, giấy phép và các tập lệnh suy luận — trong khi bản thân các trọng số không có trong cây thư mục.
Quyết định định tuyến, được trình bày một cách trung thực
Chúng tôi sẽ nói rõ về tình trạng sẵn có: OrcaRouter không lưu trữ InternLumina-U2, vì không có bộ trọng số nào để bất kỳ ai lưu trữ, và hiện chúng tôi cũng không mang Qwen2.5 Omni — mô hình này chạy qua API riêng của nhà phát triển và các nền tảng bên thứ ba. Vì vậy, bài học về định tuyến ở đây nằm ở cách tiếp cận, chứ không phải ở việc gọi hai mô hình này qua một chìa khóa hôm nay. Khuôn mẫu bền vững là khuôn mẫu mà mọi quyết định giữa mô hình trưởng thành và mô hình mới cuối cùng đều chạm tới: giữ mô hình đã được kiểm chứng trên lộ trình chính, nơi một API trên hơn 200 mô hình và truyền thẳng 0% phụ phí có nghĩa là bạn trả đúng giá niêm yết của nhà cung cấp, không hơn không kém; đưa mô hình mới chưa được kiểm chứng vào một lộ trình thử nghiệm với cơ chế chuyển đổi dự phòng tự động, để ngay lần đầu nó dừng lại, đi lệch hoặc trả về kết quả vô nghĩa, cuộc gọi sẽ rơi xuống mô hình có thành tích suốt mười bảy tháng. Đó là cách bạn có thể đánh giá một kiến trúc mới đầy tham vọng như InternLumina-U2 ngay ngày bộ trọng số của nó được tung ra — mà không phải đặt cược vào lộ trình sản xuất mà bạn đã phụ thuộc.
Bản án
Qwen2.5 Omni là mô hình omni mà bạn có thể xây dựng ngay hôm nay: đã ra mắt, có thể tải xuống, có tài liệu đầy đủ, với các giới hạn đã được biết rõ và mức giá ổn định. InternLumina-U2 là mô hình omni đáng theo dõi: một bước tiến thực sự về kiến trúc, vượt qua khả năng nhận thức để tiến tới sáng tạo, được cấp phép Apache-2.0, với mã nguồn công khai và trọng số đang chờ công bố. Nếu cú đặt cược vào kiến trúc multi-codebook của phòng thí nghiệm đứng vững qua các thử nghiệm độc lập, InternLumina-U2 sẽ không chỉ là đối thủ của Qwen2.5 Omni mà còn là thế hệ tiếp theo của cùng một ý tưởng. Nếu không, mô hình đa năng ra mắt từ mười bảy tháng trước vẫn sẽ ở đó, tiếp tục làm công việc mà nó vẫn luôn đảm nhiệm. Hãy theo dõi bản nháp trên Hugging Face; phán quyết cuối cùng nằm ở các tệp safetensors, chứ không phải ở bài viết này.
