Một thẻ tiêu đề cho bài viết 'MAGI-2-preview sắp có mặt trên SGLang' với phụ đề 'Điều mà PR phục vụ mới hé lộ', thể hiện họa tiết dải phim chuyển hóa thành các nút máy chủ và mạng gọn gàng trên nền trắng với điểm nhấn gradient xanh dương-xanh lơ, cùng logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

MAGI-2-preview đang hướng tới SGLang: những gì PR phục vụ mới tiết lộ

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MAGI-2-preview, mô hình tạo video mixture-of-experts 114 tỷ tham số của Sand.ai, đã trở thành mã nguồn mở vào ngày 5 tháng 8 năm 2026 — và mười một ngày sau, dấu hiệu đầu tiên cho thấy nó sắp có hạ tầng phục vụ đạt chuẩn sản xuất đã xuất hiện. Vào ngày 16 tháng 8, một pull request đã được mở trong kho lưu trữ SGLang với tiêu đề [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), và tiêu đề này chính xác: nó tích hợp hỗ trợ serving gốc cho mô hình vào ngăn xếp diffusion của SGLang. Tính đến thời điểm viết bài này, nó vẫn còn là một pull request — đang mở, chờ đánh giá từ code-owner, với các kiểm tra CI đang thất bại. Chưa có gì được merge, vì vậy chưa có gì có thể phục vụ được. Nhưng đối với bất kỳ ai đang cân nhắc liệu MAGI-2-preview có thể rời bỏ thiết lập Docker-and-torchrun tham chiếu của Sand.ai để chuyển sang một runtime phục vụ phổ biến hay không, thì PR này chính là một lộ trình chi tiết.

Vì vậy, hãy coi đây là một bài viết tổng hợp những gì chúng ta biết cho đến nay, không phải là ghi chú phát hành. Mô hình là có thật và đã được phát hành — việc đó diễn ra vào ngày 5 tháng 8, với trọng số trên Hugging Face và mã nguồn trên GitHub theo giấy phép Apache-2.0. Điều chưa được xác minh là phần công việc phục vụ: tích hợp SGLang mới chỉ là một pull request đang mở, các chi tiết của nó có thể thay đổi trong quá trình đánh giá, và cho đến khi được hợp nhất, SGLang vẫn chưa thể thực sự chạy MAGI-2-preview. Giá trị nằm ở những gì PR tiết lộ về mô hình và về con đường đưa nó chạy trong một runtime thực tế.

Mô hình mà PR đề cập đến, trong một đoạn văn

MAGI-2-preview là nỗ lực của Sand.ai nhằm mở rộng quy mô tạo video theo cách mà các mô hình ngôn ngữ đã mở rộng — với hỗn hợp các chuyên gia (mixture of experts), và là sự kế thừa của MAGI-1 mã nguồn mở (một mô hình video tự hồi quy 24B từ tháng 4 năm 2025). Mô hình mới có tổng cộng khoảng 114B tham số nhưng chỉ kích hoạt khoảng 6B cho mỗi token, sử dụng MoE đa đầu cực mịn: trạng thái ẩn 3.072 chiều được chia thành mười hai đầu 256 chiều, mỗi đầu định tuyến đến sáu trong số 256 chuyên gia, tương đương 3.072 đơn vị chuyên gia trên mỗi lớp MoE và 72 chuyên gia được kích hoạt cho mỗi token trên 36 lớp. Đây là mô hình âm thanh-video một luồng thống nhất — văn bản, video và âm thanh đi qua cùng một transformer và trao đổi thông tin qua cơ chế tự chú ý (self-attention) ở mọi lớp, thay vì qua một đường ống chú ý chéo riêng biệt. Mô hình hỗ trợ chuyển văn bản thành video và hình ảnh thành video, đồng thời tạo ra các đoạn clip dài 10 giây — thời lượng duy nhất được hỗ trợ — với nhạc nền stereo đồng bộ được tạo trong cùng quỹ đạo khử nhiễu và được trộn vào tệp đầu ra.

Quá trình tạo sinh diễn ra qua hai giai đoạn. Một magi2_preview là giai đoạn khử nhiễu ở 512×896, rồi một magi2_refiner là giai đoạn tăng cường lên 1088×1920. Bản phát hành cơ sở sử dụng 100 bước khử nhiễu preview và 5 bước refiner; Sand.ai cho biết một phiên bản chưng cất với số bước ít hơn nhiều sắp ra mắt. Bộ checkpoint là một kho Hugging Face duy nhất khoảng 307 GB: giai đoạn preview 228 GB, bộ mã hóa văn bản Qwen3.5-27B, refiner 14 GB, audio VAE 5 GB, video VAE mượn từ Wan2.2-TI2V-5B, và một bộ giải mã turbo VAE chưng cất được dùng mặc định. Yêu cầu phần cứng là tám GPU NVIDIA Hopper (lớp H100), với trình khởi chạy tham chiếu cho phép bạn chuyển bộ mã hóa văn bản, preview, refiner và VAE giữa CPU và GPU qua các giai đoạn.

Về hiệu năng, những con số đang được lan truyền chỉ là số liệu được công bố chứ chưa được kiểm chứng độc lập. Các tuyên bố — điểm VBench 86,54%, vượt qua Sora 2 (84,37%) và Kling 2.0 (84,20%) trong cùng các bài đưa tin của báo chí Trung Quốc, cùng vị trí thứ 6 trên bảng xếp hạng image-to-video của Artificial Analysis với Elo khoảng 1106 — đều đến từ nhà cung cấp và các bài truyền thông khi ra mắt, và chưa có bên thứ ba độc lập nào chạy thử trong mười một ngày kể từ khi phát hành. Sand.ai cũng đưa ra chi phí suy luận khoảng 0,5 nhân dân tệ (xấp xỉ 0,07 USD) cho mỗi clip 1080p dài 10 giây trên tám GPU H100, tức khoảng một phần mười so với các mô hình video chủ đạo. Hãy coi tất cả chỉ là số liệu do nhà cung cấp và báo chí công bố cho đến khi có ai đó thực sự đo đạc.

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

Tại sao một pull request serving mới là tin tức thực sự

Cho đến nay, chỉ có đúng một cách được hỗ trợ để chạy MAGI-2-preview: bộ stack tham chiếu của riêng Sand.ai, một Docker image cộng với torchrun, trên {{1}}tám con NVIDIA Hopper H100s{{/1}}. Đó là một hướng khả thi nhưng mang tính đặc thù — bạn phải dùng bộ khởi chạy của Sand.ai, chấp nhận các quyết định offload của họ, và lối sắp xếp riêng của họ cho text encoder, preview, refiner, và VAE giữa các tầng bộ nhớ. Một pull request thêm mô hình vào SGLang có ý nghĩa quan trọng vì {{2}}SGLang là serving runtime mà phần lớn thế giới AI tạo sinh tự lưu trữ thực sự triển khai trong sản xuất.{{/2}} Hỗ trợ hạng nhất có nghĩa là MAGI-2-preview có thể chạy được trong một runtime phổ thông với bộ máy của SGLang phía sau — {{3}}Ulysses sequence parallelism, expert parallelism, activation offload, VAE, scheduler, và hạ tầng pipeline-stage.{{/3}} Đó chính là sự khác biệt giữa {{4}}"Tôi có thể chạy nó trên stack của họ" và "Tôi có thể chạy nó trên stack mà nhóm của tôi đã vận hành sẵn."{{/4}}

Những gì PR thực sự xây dựng

{{1}}Tích hợp này được xây dựng dựa trên cơ chế SGLang hiện có thay vì dựa trên đường dẫn torchrun tham chiếu.{{/1}} {{2}}PR bổ sung một lớp MoE đa đầu, hạ tầng attention-sink, attention cục bộ kiểu block-window cho giai đoạn refiner, và các kết nối hyper-connection đa luồng{{/2}} {{3}}— những mảnh kiến trúc của MagiMoE mà các lớp tổng quát chưa thể hiện được.{{/3}} {{4}}Xung quanh chúng, PR tái sử dụng các thành phần song song hóa chuỗi Ulysses, song song hóa expert, offload, VAE, bộ lập lịch và pipeline-stage hiện có của SGLang.{{/4}} {{5}}PR cũng đi kèm tài liệu (một trang cookbook MAGI-2 trong tài liệu diffusion của SGLang){{/5}} {{6}}và 47 bài kiểm thử đơn vị không cần GPU,{{/6}} {{7}}đây là dấu hiệu tốt cho thấy phần lớn hành vi của mô hình có thể được kiểm chứng mà không cần thuê tám chiếc H100.{{/7}}

PR cũng làm cho các ràng buộc của mô hình trở nên tường minh:

• Phần cứng — tám NVIDIA Hopper H100, với các chế độ offload cpu / gpu / roundtrip của stack tham chiếu ánh xạ tới vị trí đặt bộ mã hóa văn bản, bản xem trước, bộ tinh chỉnh và VAE giữa các giai đoạn.

• Tính song song — --num-gpus phải chia hết mọi trục head, trong khi --tp-size, --ring-degree, và --enable-cfg-parallel bị từ chối. Đây là mô hình có nhiều chiều định tuyến, và bố cục song song phải khớp với chúng.

• Đầu ra — chỉ chấp nhận các độ phân giải 1920×1088 và 896×512, và chỉ các clip dài 10 giây; torch.compile không được hỗ trợ.

Tập cuối cùng đó đáng đọc hai lần nếu bạn đang lên kế hoạch triển khai: đây là một mô hình mà, ít nhất trong tích hợp ban đầu này, bị giới hạn ở hai độ phân giải và một thời lượng.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

Điều gì vẫn chưa được xác minh

Về công việc serving. PR đang mở, chờ đánh giá từ code owner, và các kiểm tra CI đã thất bại tính đến ngày 16 tháng 8. Một pull request ở quy mô này có thể nằm trong vòng đánh giá nhiều ngày hoặc nhiều tuần; không có trạng thái đã merge, không có bản phát hành, và không có thông báo nào từ SGLang. Và các tuyên bố phía mô hình — điểm VBench, thứ hạng Artificial Analysis, con số chi phí 0,5 nhân dân tệ — chỉ do nhà cung cấp và báo chí đưa tin, chưa được tái lập một cách độc lập. Nếu bạn xây dựng một quy trình làm việc dựa trên PR này ngay hôm nay, bạn đang xây dựng trên một lộ trình, không phải một runtime.

Điều này có ý nghĩa gì đối với phép tính chi phí

Lý do MAGI-2-preview thu hút sự chú ý nằm ở tính kinh tế của nó. Một mô hình kích hoạt 6B tham số mỗi token trong khi mang dung lượng 114B thì chi phí vận hành mỗi clip rất rẻ — Sand.ai ước tính con số khoảng 0,5 nhân dân tệ mỗi clip 1080p 10 giây trên tám chiếc H100 — và đó là loại con số quyết định liệu các đội nhóm nhỏ có đủ khả năng chi trả cho việc tạo video hay không. Nhưng con số 0,5 nhân dân tệ giả định ngăn xếp tham chiếu, cụm H100 và không có chi phí phục vụ. Cách thông thường để một mô hình mở như thế này trở nên được sử dụng rộng rãi là thông qua một API được quản lý: ai đó lưu trữ nó, định giá mỗi clip, và bạn không cần thuê tám chiếc H100.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

Khi một route được lưu trữ tồn tại, góc độ định tuyến trở nên có ý nghĩa. Trên một nền tảng định tuyến, bất kể giá niêm yết mà nhà cung cấp đặt cho {{1}}MAGI-2-preview clip{{/1}} là bao nhiêu, bạn trả đúng số đó — {{2}}OrcaRouter{{/2}} chuyển tiếp giá niêm yết của nhà cung cấp với biên lợi nhuận bằng không, vì vậy khi nhà cung cấp giảm giá, phía chúng tôi áp dụng ngay trong ngày nó được phát hành mà không cần đàm phán lại. Và một {{3}}checkpoint open-weight mười một ngày tuổi{{/3}} không có điểm chuẩn độc lập chính là loại mô hình bạn muốn đặt phía sau cơ chế tự động chuyển đổi dự phòng: trỏ một route vào nó để đánh giá, giữ một {{4}}phương án dự phòng đã được kiểm chứng{{/4}} trên cùng một endpoint, và ngay khi checkpoint ban đầu bị treo hoặc tạo ra thứ gì đó không dùng được, cuộc gọi sẽ chuyển đổi dự phòng thay vì pipeline của bạn. Đó là cách bạn thử một mô hình chưa được kiểm chứng mà không đặt cược một đường production vào nó.

Những gì chúng tôi đang xem ngay bây giờ

• Liệu PR có được merge hay không, và có những thay đổi gì trong quá trình review. Danh sách ràng buộc — hai độ phân giải, một khoảng thời gian, không torch.compile — có thể chưa phải là cuối cùng.

• Checkpoint đã chưng cất. Sand.ai cho biết các bộ trọng số ít bước hơn sắp được ra mắt; đó chính là điều biến con số 0,5 nhân dân tệ từ một phép đo trong phòng thí nghiệm thành chi phí thực tế cho mỗi clip.

• Các điểm chuẩn độc lập đầu tiên. Các số liệu VBench và bảng xếp hạng là do nhà cung cấp và báo chí công bố; một lần chạy thử bởi bên thứ ba sẽ làm rõ liệu tuyên bố 6B-active có đứng vững hay không.

• Liệu các runtime khác có theo sau hay không. SGLang là runtime phục vụ lớn đầu tiên áp dụng MAGI-2-preview; vLLM và các runtime khác có thể sẽ sớm theo sau.

• Liệu một API được quản lý có xuất hiện hay không. Toàn bộ điểm bán hàng của mô hình là chi phí thấp ở quy mô lớn; ngay khi tồn tại một route được lưu trữ, phép tính giá chuyển qua ở trên sẽ có hiệu lực.

Tóm tắt thẳng thắn: MAGI-2-preview là một mô hình mở mới được mười một ngày tuổi với cơ cấu chi phí có thể đáng quan tâm, và PR SGLang là tín hiệu rõ ràng nhất cho đến nay cho thấy hệ sinh thái đang thực sự coi trọng nó. Nhưng hỗ trợ phục vụ mới chỉ là một pull request mở, chưa phải là khả năng đã được phát hành chính thức. Hãy coi lộ trình là có thật còn runtime là chưa sẵn sàng — và khi mô hình thực sự được triển khai sau một API thực thụ, cách tiếp cận ưu tiên chuyển đổi dự phòng chính là cách bạn áp dụng nó mà không đặt cược đường vận hành sản xuất vào một checkpoint chưa được ai đánh giá độc lập.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube