Thẻ tiêu đề hero: 'Muse Glimmer — 230 Token/s trên một RTX 5090 — SGLang Day-0', với các chip thống kê hiển thị: dense 30B trọng số mở, Apache 2.0 và hỗ trợ SGLang Day-0.
Guides & Insights

Muse Glimmer đạt 230 token/giây trên một chiếc RTX 5090: Hỗ trợ SGLang ngay ngày đầu mới là câu chuyện ra mắt thực sự

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai trăm ba mươi token mỗi giây là một con số nhanh đối với bất kỳ mô hình nào. Đối với Muse Glimmer — bản phát hành dense 30B, open-weight của Meta từ Meta Superintelligence Labs, ra mắt ngày 10 tháng 8 năm 2026 theo giấy phép Apache 2.0 — đây là con số tạo nên ranh giới giữa một mô hình "chạy được trên GPU của tôi" và một mô hình "phục vụ được một agent thực thụ". SGLang đã công bố hỗ trợ ngay ngày đầu (day-0) cho Muse Glimmer vào đúng ngày bộ trọng số được đăng tải, và số đo công bố của họ trên một GeForce RTX 5090 duy nhất là 236,4 token mỗi giây cho mỗi người dùng ở batch 1, với lượng tử hóa NVFP4 và bộ drafter giải mã dự đoán DFlash của Meta đều được bật.

Con số đó đã kể hầu hết câu chuyện của bản phát hành này, nhưng vẫn đáng để chậm lại xem xét phần còn lại, vì điều thú vị không nằm ở tốc độ gây chú ý. Điều thú vị là mô hình cũng chạy được ngay trên RTX PRO 6000, trên NVIDIA DGX Spark, và trên Apple silicon thông qua MLX — và SGLang gọi công trình này là sự hợp tác với Meta Superintelligence Labs chứ không phải là một phần bổ sung muộn màng từ cộng đồng. Đây là mô hình Meta tiệm cận tiên phong đầu tiên sau một thời gian dài được thiết kế xoay quanh hạ tầng phục vụ, chứ không chỉ xoay quanh trọng số.

Ý nghĩa thực sự của "day-0 support" ở đây

Hỗ trợ Day-0 trong SGLang v0.5.17 có nghĩa là mô hình không bị gắn thêm sau khi mọi thứ đã hoàn tất: công việc runtime được triển khai trong cùng cửa sổ phát hành với các trọng số, với một đường dẫn được thiết kế riêng cho phần cứng mà Meta thực sự nhắm đến. Backend SM120 của SGLang bao phủ dòng Blackwell-desktop và workstation — RTX 5090, RTX PRO 6000 và DGX Spark đều chạy cùng một đường dẫn tối ưu — trong khi Apple silicon có backend MLX gốc thay vì một bản port chậm chạp.

{{1}}Bộ công nghệ mà SGLang và Meta tinh chỉnh là khá đặc thù.{{/1}} {{2}}Mô hình chạy dưới dạng checkpoint NVFP4 18GB đi kèm với bộ dự thảo DFlash BF16 5GB, vốn là mô hình đồng hành giải mã suy đoán mà Meta đã huấn luyện cho Muse Glimmer. Sự kết hợp này nằm gọn trong một card 32GB mà vẫn còn dư chỗ, và toàn bộ đường lượng tử hóa hỗn hợp NVFP4 cộng MXFP8 chiếm khoảng 19,5GB bộ nhớ thường trú.{{/2}} {{3}}Về phía SGLang, ghi chú phát hành nêu ba cơ chế độ tin cậy như một phần của cùng một câu chuyện: giải mã suy đoán DFlash, RadixAttention để lưu bộ nhớ đệm tiền tố, và đồ thị CUDA có thể ngắt.{{/3}}

Con số, và nó là gì và không phải là gì

Các con số RTX 5090 mà SGLang công bố—tất cả đều với NVFP4 và đường dẫn SM120—được chia ra như sau:

• Giải mã một người dùng (batch 1) — 63,9 token/giây tiêu chuẩn, 236,4 token/giây với giải mã suy đoán DFlash. Mức tăng 3,7 lần đó là con số tương tác, con số quyết định liệu một tác nhân cục bộ có cảm giác như một cuộc trò chuyện hay như một hàng đợi.

Thông lượng tổng hợp (batch 8) — 501 token/giây thông thường, 1.452 token/giây với DFlash. Đây là con số thông lượng của máy chủ cục bộ khi xử lý nhiều yêu cầu cùng lúc.

• Để so sánh, một GGUF q4_k_m trên cùng GPU — con đường mà hầu hết mọi người sẽ dùng với các runtime kiểu llama.cpp — đạt 72.6 tokens/s chuẩn và 140.7 tokens/s với DFlash. Đường dẫn NVFP4 vượt trội hơn đáng kể.

{{1}}Đây là các số liệu do SGLang và Meta công bố trong ngày ra mắt, không phải kết quả tái tạo độc lập — nhãn trung thực là do nhà cung cấp và framework báo cáo, và việc xác minh của cộng đồng sẽ đến trong những tuần tới.{{/1}} {{2}}Nhưng xu hướng giữa hai hệ thống công bố số liệu là nhất quán.{{/2}} {{3}}Trong llama.cpp, Meta báo cáo 74.9 đến 233.4 token/giây trên RTX 5090 với DFlash, cải thiện gấp 3.1 lần; M5 Max tăng từ 26.6 lên 50.2; M4 Max từ 23.7 lên 37.8.{{/3}} {{4}}Hai runtime khác nhau, hai phong cách đo lường khác nhau, nhưng cùng chung một mức: một mô hình 30B giải mã ở hơn 200 token mỗi giây trên một GPU tiêu dùng duy nhất, và DFlash tăng thông lượng gấp khoảng ba lần trên mọi cấu hình Nvidia đã công bố số liệu.{{/4}}

Tại sao "serves" lại quan trọng hơn "runs"

Blog phần cứng của Meta đưa ra khẳng định mạnh mẽ hơn các con số trên desktop. Trên NVIDIA Blackwell Ultra — thế hệ dành cho trung tâm dữ liệu, không phải card desktop — blog trích dẫn hơn 20.000 token mỗi giây trên mỗi GPU ở BF16/NVF4, với cả SGLang và vLLM đều được nêu tên là các bộ công cụ mã nguồn mở được hỗ trợ. Đó là một đẳng cấp khác hẳn, và đó chính là dấu hiệu cho thấy Meta thực sự đang xây dựng điều gì: cùng một bộ trọng số được thiết kế để chạy ở mọi nơi, từ laptop đến rack máy chủ GPU, và các framework serving được đối xử như công dân hạng nhất ngay từ ngày đầu thay vì là các bản port phải viết sau.

Phần độ tin cậy của câu chuyện cũng quan trọng không kém phần tốc độ. Một tác nhân cục bộ chết giữa chừng vì lớp phục vụ bị trục trặc cũng chẳng khá hơn là bao so với một tác nhân đám mây bị giới hạn tốc độ. Các cơ chế trong ngăn xếp ngày-0 — giải mã dự đoán có thể ngắt, bộ nhớ đệm tiền tố giúp tái truy cập các ngữ cảnh tác nhân dài với chi phí thấp, và bộ soạn thảo được tinh chỉnh theo mô hình gốc — chính là những thành phần giúp các tác nhân cục bộ luôn hoạt động có thể sống sót. Đây chính là "tốc độ và độ tin cậy" mà buổi ra mắt đang hướng tới, và đó là một lập trường kỹ thuật thực sự, không phải một khẩu hiệu tiếp thị.

A single-model speed board for Muse Glimmer: batch-1 decode 63.9 to 236.4 tok/s with DFlash, batch-8 output 501 to 1,452 tok/s, GGUF q4_k_m 72.6 to 140.7 tok/s, 128K context window, 18GB checkpoint plus 5GB drafter, runs on RTX 5090, RTX PRO 6000, DGX Spark and Mac. Footer: SGLang/NVIDIA-reported, launch day.

Những gì bạn thực sự có thể làm với nó

Muse Glimmer là một mô hình đa phương thức dense 30B — nhận đầu vào văn bản và hình ảnh thông qua bộ mã hóa nhận thức đóng băng, đầu ra dạng văn bản — được huấn luyện trên hơn 100 ngôn ngữ, với cửa sổ ngữ cảnh 131.072 token và thời điểm cắt kiến thức ngày 4 tháng 1 năm 2026. Sứ mệnh của nó là những tác vụ agent ít hào nhoáng: gọi hàm, sử dụng công cụ, quản lý lịch trình và tệp tin, đánh giá LLM-as-a-judge, và các tác vụ nhiều bước có khả năng phục hồi sau lỗi — khi một lệnh gọi công cụ thất bại, mô hình được huấn luyện để chẩn đoán và thử lại thay vì dừng lại. Nó cung cấp các mức nỗ lực suy luận (từ low đến xhigh) mà bạn thiết lập trong system prompt, đó là cách bạn đánh đổi độ trễ lấy độ sâu trên cùng một bộ trọng số.

Con số 230 token mỗi giây là điều khiến tất cả những điều đó có thể dùng được trên một máy. Dưới khoảng 50 token/giây, một tác nhân tương tác có cảm giác như một phiên gỡ lỗi từ xa; ở mức 200 trở lên, nó có cảm giác như một công cụ cục bộ. Đó là toàn bộ luận cứ cho mô hình chỉ trong một con số, và đó là lý do danh sách phần cứng — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — đọc giống như một cẩm nang mua sắm cho kỷ nguyên tác nhân cục bộ hơn là một chú thích tương thích.

Chi phí là bao nhiêu

Bản thân Muse Glimmer là miễn phí — trọng số Apache 2.0 trên Hugging Face tại meta-models/Muse-Glimmer-30B, với các lượng tử hóa GGUF đã được công bố cho các môi trường chạy kiểu llama.cpp và không có API Meta công khai. Chi phí thực sự nằm ở phần cứng bên dưới: một checkpoint NVFP4 18GB cộng với drafter 5GB có nghĩa là bạn cần một card 24GB hoặc 32GB, hoặc một máy Mac dòng M cao cấp. Nếu bạn đã có sẵn thứ đó, chi phí cận biên của một agent cục bộ luôn bật chỉ là tiền điện. Nếu không, GPU chính là khoản chi phí lớn, và đó là cách trung thực để so sánh "mô hình miễn phí" với một API lưu trữ.

Khi bạn thực hiện so sánh đó, hãy tính giá cả hai bên một cách trung thực. Tại OrcaRouter, mức giá bạn thấy cho bất kỳ mô hình nào trong số hơn 200 mô hình lưu trữ là giá niêm yết của nhà cung cấp được truyền thẳng với mức chênh lệch 0%, vì vậy một đợt nhà cung cấp giảm giá sẽ có hiệu lực tại đây ngay trong cùng ngày — điều này giúp phép so sánh giữa cục bộ và lưu trữ luôn trung thực. Bản thân Muse Glimmer hiện chưa có trên OrcaRouter, vì chưa có nhà cung cấp suy luận nào phục vụ nó; nó được phân phối dưới dạng bản tải xuống. Ngay khi một nhà cung cấp bắt đầu phục vụ nó, cùng một khóa truy cập dành cho phần còn lại của danh mục cũng sẽ dùng được cho nó, và chuyển đổi dự phòng tự động là cơ chế giúp việc hướng lưu lượng sản xuất vào một mô hình hoàn toàn mới do nhà cung cấp công bố trở nên an toàn, ngay cả trước khi mô hình đó có thành tích hoạt động độc lập.

Screenshot of the NVIDIA Developer blog 'Run Local AI Agentic Workflows with Meta's Muse Glimmer', describing the 30B open-weight dense model with a 120K+ context window and quoting 20K tokens/sec on a single GPU for always-on local agents.

Câu chuyện lớn hơn đằng sau tốc độ

Hãy coi việc hỗ trợ SGLang ngay từ ngày 0 như một tín hiệu, và bản phát hành này không còn chỉ là một mô hình đơn lẻ. Muse Glimmer là phiên bản chưng cất từ mô hình chủ lực độc quyền Muse Spark 1.2 của Meta, và Meta đã tuyên bố trọng số của mô hình giáo viên sẽ được công bố "trong vài tuần tới." Một agent cục bộ 30B với bộ công cụ phục vụ được tinh chỉnh, một mô hình giáo viên sắp được mở mã nguồn, cùng một quỹ cộng đồng trị giá 1 tỷ đô la được công bố song song — đó không phải là một bản phát hành nhỏ lẻ. Đó là khởi đầu của một dòng sản phẩm open-weight nhắm thẳng vào thị trường agent cục bộ, và việc hỗ trợ framework ngay từ ngày đầu chính là chi tiết cho thấy Meta muốn người dùng thực sự chạy nó, chứ không chỉ tải về.

Điều cần lưu ý: mọi con số tốc độ và benchmark gắn với đợt ra mắt này cho đến nay đều do nhà cung cấp hoặc framework báo cáo. Các con số thông lượng nhất quán trên hai hệ thống độc lập, điều này đáng tin cậy, nhưng việc benchmark độc lập, một mục trên Artificial Analysis, và các bản tái hiện thực tế mới là thứ sẽ xác nhận câu chuyện 230 token mỗi giây — và chúng thường xuất hiện trong vòng vài tuần sau một bản phát hành như thế này.

Cần theo dõi điều gì, theo thứ tự tốc độ gần đúng: bản phát hành open-weights Muse Spark 1.2 (cách đọc chiến lược về việc "Meta đã trở lại" phụ thuộc vào điều này); những bản tái tạo thông lượng độc lập đầu tiên trên phần cứng không phải của Nvidia, nơi mà đường dẫn MLX là thứ đáng chú ý; và nhà cung cấp suy luận đầu tiên dựng lên một endpoint Glimmer — đó là thời điểm mà các lập luận "mô hình địa phương miễn phí" và "API lưu trữ" không còn là giả thuyết và trở thành một lựa chọn bạn có thể thực hiện chỉ bằng một phím bấm.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the model's purpose-built local-agentic description.
© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube