Thẻ hero được tạo có tiêu đề 'Qwen3.8-Omni-Flash vs InternLumina U2' nằm dưới dòng eyebrow 'Giác quan thuê ngoài so với trọng số sở hữu', với phụ đề 'Một API phương tiện dài đóng kín đối đầu với mô hình khuếch tán 16B mà bạn có thể tải xuống.' và bốn chip: 'Trọng số: đóng vs Apache 2.0', 'Tạo ảnh: chỉ một bên', 'Ngữ cảnh: 1M vs không tiết lộ', 'Có thể định tuyến tại đây: không bên nào'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2: Giác quan đi thuê vs Trọng số sở hữu

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách hữu ích để so sánh Qwen3.8-Omni-FlashInternLumina U2 không phải là dựa trên hàng benchmark, vì chúng không xuất hiện trên cùng những hàng đó. Mà là bằng cách hỏi ai được phép chạy chúng. Về phía nhà cung cấp, Qwen3.8-Omni-Flash, mở cho khách hàng API từ ngày 18 tháng 9 năm 2026, là một mô hình đóng trên chính các nền tảng của nhà cung cấp: một triệu token ngữ cảnh, tối đa một giờ âm thanh và video liên tục mỗi lần gọi, đầu ra chỉ văn bản và không có trọng số. Về phía Shanghai AI Laboratory, InternLumina U2 là một mô hình khuếch tán mixture-of-experts 16B-A1B theo Apache 2.0, mà các checkpoint Ascend của nó hiện có thể tải xuống từ Hugging Face, trong khi các checkpoint NVIDIA và báo cáo kỹ thuật vẫn được liệt kê là sắp ra mắt. Một cái là dịch vụ bạn thuê theo token. Cái còn lại là một tệp bạn có thể giữ, với một lưu ý về việc nó hiện chạy trên phần cứng nào. Sự khác biệt đó quyết định nhiều triển khai thực tế hơn bất kỳ điểm số nào trong bảng của cả hai nhà cung cấp.

InternLumina U2 thực chất là gì

Kiến trúc là phần thú vị và nó thực sự khác thường. InternLumina U2 là một MoE thưa với tổng cộng 16 tỷ tham số và 1 tỷ tham số hoạt động, và nó là một mô hình ngôn ngữ khuếch tán chứ không phải mô hình tự hồi quy — nó tinh chỉnh toàn bộ một chuỗi song song thay vì phát ra token từ trái sang phải. Biểu diễn thị giác của nó hoàn toàn rời rạc: tám codebook token thị giác được xây dựng trên AToken của Apple, điều này cho phép một mô hình vừa đọc được ảnh vừa tạo ra ảnh mà không cần một bộ giải mã riêng gắn thêm vào cuối. Hỏi đáp văn bản, tạo ảnh từ văn bản, hiểu ảnh, chỉnh sửa ảnh, hiểu video và hiểu 3D đều là cùng một mô hình thực hiện cùng một loại công việc trên cùng một từ vựng.

• Kích thước và hình dạng — InternLumina U2 có tổng 16B, 1B hoạt động, MoE thưa; số lượng tham số của Qwen3.8-Omni-Flash không được tiết lộ.

• Tạo sinh — InternLumina U2 tạo và chỉnh sửa hình ảnh, đồng thời xử lý việc hiểu nội dung 3D; Qwen3.8-Omni-Flash không tạo ra bất kỳ phương tiện truyền thông nào và chỉ trả về văn bản.

• Giải mã — InternLumina U2 là một LLM khuếch tán, giải mã song song; Qwen3.8-Omni-Flash thì tự hồi quy.

• Bối cảnh và thời lượng — Qwen3.8-Omni-Flash có cửa sổ 1 triệu token và tối đa một giờ âm thanh-video liên tục trong một lần gọi; tài liệu công bố của InternLumina U2 không mô tả bất kỳ điều nào trong số đó, và âm thanh dạng dài không nằm trong các khả năng được liệt kê của nó.

• Trọng số — InternLumina U2 dùng Apache 2.0, với các checkpoint Ascend đã được công bố và checkpoint NVIDIA đang chờ; Qwen3.8-Omni-Flash không có trọng số và cũng không công bố kế hoạch nào cho bất kỳ trọng số nào.

• Cách bạn có được nó — InternLumina U2 là bản tải xuống từ Hugging Face với mã suy luận trên GitHub; Qwen3.8-Omni-Flash là một lệnh gọi API tới Alibaba Cloud Model Studio hoặc nền tảng Qianwen.

• Điểm số độc lập — không có cho bên nào. Thẻ của chính InternLumina U2 ghi bảng đánh giá chuẩn của nó là “kết quả sơ bộ, một phần”; còn của Qwen thì đều chỉ so với phiên bản tiền nhiệm của chính nó và chưa được tái lập.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

Câu hỏi về trọng số đã thay đổi kể từ khi có đưa tin xem trước.

Nếu bạn đã đọc bài viết trước đây của chúng tôi về InternLumina U2 khi mã nguồn lần đầu xuất hiện, thì cục diện đã thay đổi theo một hướng và giữ nguyên ở hướng khác, và cả hai phần đều quan trọng. Kho lưu trữ Hugging Face không còn chỉ là một khung rỗng nữa: thư mục ascend/ giờ đây chứa bảy phân đoạn safetensors cùng với tệp cấu hình, tokenizer và mã mô hình, nghĩa là mô hình thực sự có thể tải xuống và chạy được bởi bất kỳ ai có phần cứng phù hợp. Thư mục nvidia/ vẫn được đánh dấu là sắp ra mắt, báo cáo kỹ thuật vẫn đang chờ công bố, và mục benchmark của chính kho lưu trữ vẫn ghi "kết quả sơ bộ, chưa đầy đủ". Vậy nên phát biểu chính xác vào thời điểm hiện tại không phải là "trọng số đã được phát hành" hay "trọng số vẫn còn thiếu" — mà là checkpoint của một nền tảng phần cứng đã được công bố còn nền tảng kia thì chưa, và đó là một hạn chế thực sự đối với bất kỳ ai có cluster là NVIDIA.

Hai điều khác đã thay đổi một cách lặng lẽ. Kho GitHub vẫn tiếp tục nhận được các commit kéo dài qua hẳn đợt phát hành ngày 1 tháng 9 ban đầu, nên mã đã phát hành đang được duy trì thay vì bị bỏ xó. Và bộ đếm lượt tải trên kho Hugging Face vẫn hiển thị số không, điều này nói ít về mô hình hơn là về đối tượng người dùng: một mô hình diffusion 16B-A1B với các checkpoint ưu tiên Ascend là nhắm đến phòng thí nghiệm, chứ không phải một nhóm sản phẩm đang tìm kiếm endpoint được host trong quý này.

Nơi hai điều đó thực sự trùng nhau, và nơi chúng không trùng nhau

Hiểu hình ảnh chính là điểm giao nhau, và nó hẹp hơn vẻ bề ngoài. Cả hai mô hình đều có thể nhìn vào một bức ảnh và trả lời các câu hỏi về nó, đó là toàn bộ công việc của Qwen3.8-Omni-Flash và là một trong sáu công việc của InternLumina U2. Mọi thứ vượt ra ngoài phạm vi đó đều rẽ hướng mạnh mẽ. InternLumina U2 sau đó có thể chỉnh sửa bức ảnh đó hoặc tạo ra một bức ảnh mới từ câu lệnh, ngay trong cùng một mô hình, bằng chính vốn từ vựng thị giác mà nó đã dùng để đọc bức ảnh. Qwen3.8-Omni-Flash không thể tạo ra nổi một pixel, nhưng nó sẽ nhận một giờ âm thanh và video trong một lần gọi duy nhất và cho bạn biết ai đã nói, nói khi nào, và điều gì đã được quyết định — điều mà các tài liệu công bố của InternLumina U2 hoàn toàn không tuyên bố có thể làm được.

Điểm chồng lấn ít quan trọng hơn mức người ta tưởng là video. Cả hai đều được mô tả là xử lý video, nhưng chúng làm những việc khác nhau với nó: một cái hiểu một đoạn ghi dài như một tài liệu, cái kia xử lý video như một dạng thức thị giác song hành cùng 3D. Một nhóm cần tóm tắt một giờ cảnh quay thì cái thứ hai không đáp ứng được, và một nhóm cần tạo ra một khung hình thì cái thứ nhất không đáp ứng được.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Chi phí, kiểm soát và những gì bạn thực sự đang mua

So sánh về giá không hề cùng loại. Qwen3.8-Omni-Flashtính phí theo từng token — 0,15 USD cho mỗi triệu token đầu vào, 0,016 USD cho token đã cache, 0,47 USD cho đầu ra trên bảng giá quốc tế, kèm một bảng giá riêng cho Trung Quốc đại lục vốn không thể so sánh được — và tiêu đề khi ra mắt của nó là mức cắt giảm hơn 98% chi phí cho một giờ âm thanh đầu vào do nhà cung cấp tự báo cáo, được tính bằng cách định giá một mẫu hai phút rồi nhân với ba mươi, với video được lấy mẫu ở 720p và một khung hình mỗi giây. InternLumina U2không tính phí gì cả, bởi chẳng có gì để tính phí: chi phí chính là phần cứng và thời gian của bạn, và thẻ mô hình của chính nó không công bố con số thông lượng nào cho phép bạn quy đổi điều đó thành số tiền trên mỗi token.

Đó là sự đánh đổi trong một dòng. API mang đến cho bạn năng lực mà bạn không thể tự vận hành và mức chi phí theo giờ tăng theo mức sử dụng; trọng số mở mang đến cho bạn chi phí cố định và toàn quyền kiểm soát luồng dữ liệu, đổi lại là một ngăn xếp suy luận bạn phải tự xây dựng và một bộ checkpoint hiện tại đồng nghĩa với phần cứng Ascend. Đối với các khối lượng công việc chịu quy định, nơi dữ liệu media không thể rời khỏi nội bộ, lựa chọn thứ hai không phải là sở thích — đó là lựa chọn duy nhất trên trang này. Với một nhóm cần phân tích âm thanh dài trong tháng này, lựa chọn thứ nhất là lựa chọn duy nhất trên trang này.

Hôm nay OrcaRouter không host cả hai mô hình này, và chúng tôi thà nói thẳng điều đó còn hơn ngụ ý về một đường định tuyến không tồn tại: Qwen3.8-Omni-Flash chỉ chạy trên các nền tảng của chính Alibaba, và InternLumina U2 là một bản tải về chứ không phải một endpoint. Thứ chúng tôi thực sự vận hành là phần còn lại của dòng Qwen3.8 — Qwen3.8-FlashQwen3.8-Max — thông qua một API ở mức giá niêm yết của nhà cung cấp với markup 0%, đây là cách thiết thực để duy trì một baseline đang hoạt động cho phía mô hình đóng trong so sánh này trong khi phía trọng số mở vẫn đang sắp xếp các checkpoint NVIDIA của mình cho ổn thỏa.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Bạn thực sự nên chọn cái nào

Chọn InternLumina U2 nếu bạn cần một mô hình đọc, tạo và chỉnh sửa hình ảnh và bạn sẵn sàng tự vận hành ngăn xếp suy luận — và nếu bộ tăng tốc của bạn là Ascend, hoặc bạn có thể chờ các checkpoint NVIDIA. Đây là mô hình duy nhất trong hai mô hình có thể tạo hình ảnh và là mô hình duy nhất bạn có thể chạy mà không gửi dữ liệu cho nhà cung cấp. Hãy coi các con số đánh giá của nó là chưa được kiểm chứng cho đến khi báo cáo kỹ thuật được công bố, vì thẻ mô hình nói chính xác như vậy.

Chọn Qwen3.8-Omni-Flash nếu vấn đề của bạn là hàng giờ âm thanh và video thay vì đầu ra điểm ảnh — phân tích thông minh cuộc họp, phân tích bản ghi dài, công việc agentic nặng về âm thanh bằng tiếng Trung và tiếng Anh — và nếu bạn có thể chấp nhận phụ thuộc một nguồn duy nhất và đầu ra chỉ văn bản. Câu chuyện chi phí của nó mạnh ở số giờ âm thanh đầu vào và yếu hơn nhiều ở tổng hóa đơn, các benchmark của nó do nhà cung cấp báo cáo và chưa được tái lập, và những lần chạy của bên thứ ba đầu tiên xuất hiện xếp nó vào phân vị thứ 28 về suy luận, trên một mẫu đủ nhỏ để đáng ra phải thúc đẩy một cuộc kiểm tra hơn là một quyết định.

Nếu bạn cần cả hai, chúng bổ trợ cho nhau chứ không phải những lựa chọn thay thế: một mô hình hình ảnh trọng số mở do bạn tự vận hành và một mô hình đa phương tiện dài đóng mà bạn gọi qua API. Hiện nay, cả hai đều không thể định tuyến qua chúng tôi. Điều cần theo dõi ở một phía là checkpoint của NVIDIA và báo cáo kỹ thuật; ở phía kia là đánh giá độc lập đầu tiên, thứ chưa hề tồn tại và là khoảng trống lớn nhất trong mọi bài viết về Qwen3.8-Omni-Flash cho đến nay.