Một thẻ tiêu đề hero được tạo cho InternLumina-U2, có huy hiệu dạng viên thuốc PREVIEW, tiêu đề 'InternLumina-U2', phụ đề 'Một mô hình khuếch tán 16B cho hình ảnh, video và 3D', dòng giới thiệu nêu Phòng thí nghiệm Trí tuệ Nhân tạo Thượng Hải, LLM khuếch tán đa codebook, mã nguồn được phát hành ngày 2026-09-01 và trọng số sắp ra mắt, các chip Hình ảnh, Video và 3D, các khối hình trừu tượng Hiểu-Tạo-Chỉnh sửa màu xanh dương, xanh lơ và hổ phách ở bên phải, cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

InternLumina-U2 Preview: Một mô hình khuếch tán 16B cho Hình ảnh, Video và 3D — Trọng số vẫn sắp được phát hành

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào lúc 04:03 UTC ngày 1 tháng 9 năm 2026, Phòng thí nghiệm AI Thượng Hải đã tạo kho lưu trữ GitHub InternLumina-U2. Mười ba phút sau, cùng tổ chức này đã đăng ký một kho lưu trữ cùng tên trên Hugging Face. Không có bài đăng ra mắt, không có model card và cũng không có bất kỳ thông báo nào — chỉ có mã suy luận cho InternLumina-U2, một mô hình mixture-of-experts có 16 tỷ tham số (1 tỷ tham số hoạt động) mà phòng thí nghiệm giới thiệu như một mô hình duy nhất bao quát khả năng hiểu hình ảnh, tạo ảnh từ văn bản, chỉnh sửa hình ảnh, hiểu video và hiểu 3D thông qua một giao diện token rời rạc duy nhất. Mã nguồn là thật và công khai; còn bản thân mô hình thì chưa — nhưng sắp có. Các trọng số được gắn nhãn "sắp ra mắt", kho lưu trữ trên Hugging Face chỉ là một chỗ trống, và bản báo cáo kỹ thuật đã hứa vẫn chưa xuất hiện. Dù vậy, những gì âm thầm được phát hành vào ngày 1 tháng 9 vẫn là bức tranh công khai đầy đủ nhất về mô hình này hiện có ở bất kỳ đâu.

Nếu đây là lần đầu tiên bạn nghe đến InternLumina-U2, thì đó là điều có chủ đích. Không có gì về bản phát hành được công bố, và hiện vẫn chưa có bài đưa tin độc lập nào — những bài phân tích tín hiệu sớm chính là nơi một mô hình như thế này xuất hiện đầu tiên, trước bài đăng ra mắt và đôi khi trước cả bộ trọng số. Mọi thông tin dưới đây đều được lấy từ kho lưu trữ GitHub, trang dự án và trang stub Hugging Face mà chính phòng nghiên cứu đã công bố vào ngày 1 tháng 9, còn bất cứ điều gì ngoài các nguồn đó đều được gắn nhãn rõ ràng là suy luận.

Những gì thực sự được phát hành vào ngày 1 tháng 9

Kho lưu trữ GitHub InternLM/InternLumina-U2được tạo vào ngày 1 tháng 9 năm 2026 và có ba commit trong ngày hôm đó — commit khởi tạo, một lượt sửa đổi đánh dấu liên kết mô hình là “sắp ra mắt” và kết quả benchmark là “sơ bộ”, cùng một bản sửa điều hướng. Kho lưu trữ này được cấp phép Apache-2.0 và có README với tựa đề “Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing”, gồm một bản tiếng Anh và một bản tiếng Trung, một bộ khung suy luận hoàn chỉnh và một lộ trình phát triển. Một điểm đáng chú ý: mục tin tức của chính kho lưu trữ được đóng dấu “[2026-08]”, nhưng commit khởi tạo và cả hai mốc thời gian của kho lưu trữ đều ghi ngày 1 tháng 9 năm 2026 — hãy coi đầu tháng 9 là ngày phát hành thực tế, không phải tháng 8. Kho lưu trữ bên dưới là toàn bộ bản phát hành công khai: mọi tệp hiển thị trong cây thư mục đều thuộc phần đã xuất bản và hiện không còn gì khác tồn tại ở bất kỳ đâu.

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2, được tạo ngày 01-09-2026 theo giấy phép Apache-2.0, bao gồm mã suy luận cho văn bản, chuyển văn bản thành hình ảnh, hiểu hình ảnh, chỉnh sửa hình ảnh, hiểu video và hiểu 3D.

Hugging Faceinternlm/InternLumina-U2, được tạo ngày 01/09/2026, hiện chỉ chứa một tệp .gitattributes và một README dài 28 byte, với toàn bộ nội dung là phần tiêu đề giấy phép Apache-2.0. Không có trọng số, không có cấu hình, không có tệp tokenizer.

Trang dự án — internlm.github.io/InternLumina-U2, bao gồm các sơ đồ kiến trúc, một bảng benchmark sơ bộ và các bản demo tạm; báo cáo kỹ thuật được đánh dấu "sắp ra mắt".

Mã suy luận được tổ chức thành một tập lệnh điều khiển chính, với một phần dành cho từng nhiệm vụ: sinh văn bản thuần; chuyển văn bản thành hình ảnh ở độ phân giải lên tới 1024×1024 với CFG và số bước thời gian có thể cấu hình; hiểu hình ảnh trên ảnh tự nhiên và biểu đồ dày đặc; chỉnh sửa hình ảnh theo hướng dẫn với chế độ dual-CFG tùy chọn; hiểu video trên 64 khung hình được lấy mẫu; và hiểu không gian 3D trên các tệp GLB/GLTF được kết xuất thành 64 khung nhìn màu và độ sâu thông qua một pipeline Blender được đóng gói trước khi mã hóa token. Sự rộng lớn đó của các nhiệm vụ chính là luận điểm thiết kế toàn bộ của mô hình, và đáng để dừng lại suy ngẫm trước khi đi sâu vào kiến trúc.

Một mô hình, sáu tác vụ, một bộ từ vựng token

InternLumina-U2 thuộc một hướng nghiên cứu đang chạy đua nhanh, đặt cược rằng ngôn ngữ và thị giác nên chia sẻ một giao diện token rời rạc duy nhất thay vì nằm trong các ngăn xếp hiểu và sinh riêng biệt. Các công trình trước đó của chính phòng thí nghiệm theo hướng này — Lumina-DiMOO, mô hình khuếch tán rời rạc thống nhất được trình diễn tại WAIC 2025 — được trích dẫn cùng với LLaDA2.0-Uni, Show-o2 và MMaDA như những hệ thống tiên phong mà InternLumina-U2 kế thừa và tuyên bố sẽ vượt qua. Điểm đặt cược cụ thể của InternLumina-U2 là nút thắt của các mô hình thống nhất này không nằm ở kiến trúc mà nằm ở từ vựng thị giác: một codebook duy nhất giới hạn lượng thông tin mà một token thị giác có thể mang, trong khi các mô hình lai rời rạc–liên tục tách hiểu và sinh qua các biểu diễn khác nhau lại buộc mô hình phải duy trì hai ngăn xếp.

Câu trả lời của InternLumina-U2 là mô hình hóa đa codebook hoàn toàn rời rạc. Về phía thị giác, mô hình sử dụng tokenizer AToken của Apple để mô tả mỗi vị trí thị giác bằng tám codebook bổ sung cho nhau — một nỗ lực nhằm giữ lại kết cấu cục bộ, văn bản nhúng, hình học và các chi tiết tần số cao mà không làm tăng độ dài chuỗi. Về phía đầu vào, mỗi codebook trong tám codebook có embedding riêng, và tám embedding tại mỗi vị trí được nối lại rồi chiếu thành một token backbone duy nhất. Về phía đầu ra, dự đoán song song về mặt không gian, nhưng tự hồi quy theo chiều sâu codebook: backbone khuếch tán khử nhiễu song song nhiều vị trí không gian bị che, sau đó một đầu tự hồi quy đa codebook sẽ dự đoán tám mã của từng vị trí theo đúng thứ tự.

Scale — tổng 16B tham số, 1B tham số hoạt động (16B-A1B), một MoE thưa.

Xương sống ngôn ngữ — mô hình ngôn ngữ khuếch tán LLaDA-2.0 MoE, có mục tiêu khuếch tán khối được mở rộng sang các tác vụ thị giác thông qua huấn luyện đa nhiệm chung (mô tả của nhà cung cấp).

Biểu diễn trực quan — các token hoàn toàn rời rạc với 8 codebook từ tokenizer AToken của Apple.

Phần cứng — tương thích với cả GPU NVIDIA và NPU Huawei Ascend trong huấn luyện, đánh giá và suy luận, với khả năng căn chỉnh số học ở cấp độ toán tử giữa các backend.

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

Điều đó thực sự mang lại gì trong thực tế, nếu những tuyên bố trên đứng vững, chính là giấc mơ lâu đời nhất của lĩnh vực đa phương thức: một bộ trọng số duy nhất có thể đọc hình ảnh, chỉnh sửa nó, vẽ một hình mới từ văn bản, trả lời câu hỏi về một video và mô tả một tài sản 3D — với khả năng hiểu và tạo sinh củng cố lẫn nhau qua cùng một giao diện thay vì bị ghép nối từ các mô hình chuyên dụng. Đó cũng là tuyên bố đáng phải soi xét nhất, bởi vì nó là điều khó biến thành hiện thực nhất.

Những con số, dù chúng có như thế nào đi nữa.

Mọi benchmark mà InternLumina-U2 có đều do nhà cung cấp báo cáo, sơ bộ và chưa đầy đủ. README và trang dự án tự nói rõ: "Kết quả sơ bộ, chưa đầy đủ. Bảng so sánh đầy đủ sẽ xuất hiện trong báo cáo kỹ thuật sắp tới." Không có đánh giá độc lập nào tồn tại, vì các trọng số không được công khai. Hãy coi các số liệu dưới đây là tuyên bố của riêng phòng thí nghiệm, không phải điểm số đã được xác minh.

Hiểu biểu đồ / tài liệu — ChartQA 86.52, CharXiv-DQ 83.65 (do nhà cung cấp báo cáo).

Suy luận toán học trực quan — MathVision 33.22, DynaMath 56.37; phòng thí nghiệm cho biết mô hình này vượt trội hơn InternVL3-8B chỉ hiểu trên cả hai.

Khả năng chống ảo giác — HallusionBench 62.15.

Hiểu video — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (trang dự án).

Hiểu 3D — 3D MM-Vet 41.8.

Text-to-image — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (project page).

Chỉnh sửa hình ảnh — ImgEdit 3.83.

Chính ở phần so sánh, người đọc trung thực nên đọc chậm lại. Tệp README khẳng định InternLumina-U2 vượt trội các mô hình hợp nhất như InternVL-U, LLaDA2.0-Uni, Show-o2 và Lumina-DiMOO ở các benchmark về hiểu chi tiết và sinh nội dung — nhưng chính bảng số liệu trên trang dự án lại cho thấy InternLumina-U2 đạt GenEval 0.81 trong khi LLaDA2.0-Uni đạt 0.89, nên mô hình này vẫn thua ít nhất một đối thủ ở ít nhất một chỉ số sinh nội dung chủ chốt. Việc chọn ra vài con số có lợi từ một bảng số liệu chưa đầy đủ đúng là điều mà lời lưu ý “bảng so sánh đầy đủ nằm trong báo cáo kỹ thuật” được tạo ra để làm dịu đi. Các con số chỉ là tín hiệu định hướng từ phòng nghiên cứu, không hơn.

Điều gì là thực tế so với điều gì được hứa hẹn

Phạm vi phát hành được trình bày rõ ràng một cách khác thường, và điều đó rất quan trọng với bất kỳ ai đang cân nhắc liệu họ có thể dùng thử ngay hôm nay hay không. Đã phát hành: mã nguồn suy luận. Chưa phát hành: trọng số, mã nguồn huấn luyện (được hứa sẽ nằm trong một kho lưu trữ riêng), bộ công cụ huấn luyện và suy luận Ascend, cùng báo cáo kỹ thuật. Kho lưu trữ Hugging Face mà sau này sẽ lưu mô hình hiện mới chỉ là một bản sơ khai — ảnh chụp màn hình bên dưới cho thấy toàn bộ nội dung hiện tại của trang mà người đọc sẽ đến khi nhấp vào liên kết "Model (coming soon)" trong README.

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

Ngay cả mã nguồn đã phát hành cũng chưa thể tạo ra đầu ra. Trình điều khiển suy luận yêu cầu một thư mục checkpoint Hugging Face dạng tách và trọng số tokenizer AToken tại một đường dẫn cụ thể — {{1}}cả hai đều không nằm trong kho lưu trữ{{/1}} — nên thứ tải về được hôm nay chỉ là {{2}}bản đặc tả cách mô hình sẽ chạy, chứ không phải một mô hình đang chạy thực sự{{/2}}. Và khi trọng số thực sự được cập bến, việc tự lưu trữ (self-hosting) sẽ không phải chuyện cài pip là xong. Mô hình dùng {{3}}API tạo sinh block-diffusion{{/3}} thay vì {{4}}giao diện tạo sinh Transformers chuẩn{{/4}}, tokenizer AToken cần {{5}}FlashAttention{{/5}}, mã nguồn đòi hỏi một {{6}}GPU khả dụng tại thời điểm import{{/6}}, trình điều khiển gốc chỉ chạy một tiến trình, còn {{7}}pipeline 3D{{/7}} yêu cầu Blender 4.5 để mã hóa tài nguyên. Đó là {{8}}một dự án triển khai thực thụ, không phải một thử nghiệm cuối tuần{{/8}} — chính là thứ ma sát mà {{9}}lớp định tuyến{{/9}} tồn tại để hấp thụ cho hầu hết các đội ngũ.

Khi các trọng số được tải về, hãy coi nó như một mô hình chưa được kiểm chứng đúng như bản chất của nó.

Hiện tại, không ai có thể chạy InternLumina-U2 và không nhà cung cấp nào có thể phục vụ mô hình này, vì bộ trọng số không tồn tại công khai. Điều đó sẽ thay đổi vào một lúc nào đó — giấy phép Apache-2.0 và xu hướng mã nguồn mở mạnh mẽ của lab trong năm 2026 (chiến dịch “mở mọi thứ” của ArchSpace, InternVL3.5, các mô hình khoa học Intern-S2) khiến việc phát hành bộ trọng số trở nên gần như chắc chắn chứ không còn là giả thuyết. Khi điều đó xảy ra, bước đi hợp lý đầu tiên không phải là đặt cược cả đường ống sản xuất vào một mô hình khuếch tán vừa ra mắt ngày đầu với yêu cầu phục vụ khác thường và chưa có một đánh giá độc lập nào. Mà là chạy nó song song với mô hình bạn đã tin cậy, trên một tuyến thử nghiệm, với cơ chế chuyển đổi dự phòng tự động về mô hình đã được kiểm chứng ngay khi mô hình mới có hành vi bất thường. Đó là tình huống mà một lớp định tuyến được xây dựng để giải quyết: một API cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được truyền thẳng với mức phụ phí 0%, và cơ chế chuyển đổi dự phòng biến việc “dùng thử cái mới” thành một quy tắc định tuyến thay vì một cuộc di dời. OrcaRouter được thiết lập theo cách đó — và để nói rõ: chúng tôi không định tuyến InternLumina-U2 và cũng không thể, vì bộ trọng số chưa được phát hành. Phần này nói về quy trình khi chúng được phát hành, chứ không phải là lời khẳng định rằng mô hình hiện đang có sẵn ở bất kỳ nơi nào.

Xem gì tiếp theo

Bốn sự kiện sẽ đưa InternLumina-U2 từ bản xem trước thành hiện thực, theo thứ tự gần đúng về khả năng xảy ra. Thứ nhất, kho lưu trữ Hugging Face được điền đầy: khi các tệp safetensors, một tệp cấu hình và trọng số tokenizer AToken xuất hiện trong kho trống đó, đó là thời điểm mô hình thực sự tồn tại. Thứ hai, báo cáo kỹ thuật – thứ được kỳ vọng sẽ chứa các bảng so sánh đầy đủ và biến những con số một phần từ nhà cung cấp ở trên thành thứ có thể kiểm chứng. Thứ ba, kho mã huấn luyện và ngăn xếp Ascend, những thứ quan trọng với bất kỳ ai muốn tinh chỉnh hoặc chạy mô hình này trên phần cứng không phải của NVIDIA. Thứ tư, một đánh giá độc lập đầu tiên – một Elo đấu trường, một lượt chạy ChartQA hoặc GenEval được tái hiện – nhằm kiểm tra lời hứa "một mô hình, sáu việc" mà không bị thiên kiến chọn lọc của phòng thí nghiệm. Việc mã nguồn được công khai vào ngày 1 tháng 9 có nghĩa là kiến trúc đã có thể biết được; việc trọng số vắng bóng có nghĩa là mọi điều về chất lượng thực tế vẫn chỉ là tuyên bố. Hãy theo dõi kho mô hình thay vì kênh thông báo – những phần thú vị đã công khai rồi, và bản thân mô hình có lẽ cũng không còn xa phía sau.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube