Một thẻ tiêu đề cho bảng so sánh 'Qwen3.8-27B vs Meta Muse Glimmer' hiển thị hai cột với huy hiệu VS: bên trái được gắn nhãn Qwen3.8-27B với huy hiệu 'đang chờ trọng số', bên phải được gắn nhãn Meta Muse Glimmer với huy hiệu 'khả dụng ngay'.
Guides & Insights

Qwen3.8-27B vs Meta Muse Glimmer: Cuộc đua Agent cục bộ, một bên đã có mặt

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Me​ta Muse Glimmer được phát hành vào ngày 10 tháng 8 năm 2026 — Apache 2.0, khoảng 30 tỷ tham số, nhắm thẳng vào các khối lượng công việc tác tử cục bộ — và mô hình gần như chắc chắn sẽ là đối thủ cạnh tranh sát sao nhất của nó vẫn chưa ra mắt. Alibaba đã công bố Qwe​n3.8-27B vào ngày 3 tháng 8 như một thành viên tự lưu trữ của thế hệ Qwe​n3.8, hứa hẹn trọng số mở của nó cho tuần của ngày 10 tháng 8, và tính đến thời điểm viết bài này, kho lưu trữ chính thức vẫn chưa xuất hiện. Điều đó khiến sự so sánh này cố tình chênh lệch: một bên là thật và có thể tải xuống ngay hôm nay, bên kia vẫn chưa được xác minh. Đó chính là lý do tại sao nó đáng để viết ngay bây giờ — Me​ta đã dựng bảng điểm chuẩn của riêng Glimmer để so với phiên bản tiền nhiệm của 27B, vì vậy cuộc chiến đã được định hình trước khi 27B ra đời.

Tổng quan về trận đấu

Cả hai mô hình đều đang nhắm đến cùng một người mua: người muốn có khả năng agentic và lập trình gần như cao cấp trên phần cứng họ tự sở hữu, chứ không phải qua API. Các tiêu chí được xếp như sau, trong đó phía Qwe​n được đánh dấu là chưa xác minh ở bất kỳ điểm nào mà kho lưu trữ chưa xác nhận:

Tình trạng — Meta Muse Glimmer hiện đã có sẵn so với Qwen3.8-27B đã được công bố, trọng số đang chờ.

• Kích thước — Glimmer có tổng cộng ~29.6B (27.9B bộ giải mã văn bản + 1.9B bộ mã hóa thị giác) so với ~27B của bản 27B, kiến trúc chưa được xác nhận.

• Giấy phép — Apache 2.0, bao gồm trọng số, các bản lượng tử hóa, bộ dự thảo và bộ mã hóa, so với việc chưa được công bố, với điều khoản Tongyi Qianwen 100M-MAU là một khả năng thực sự.

• Ngữ cảnh — Glimmer hỗ trợ cửa sổ 128K token so với ngữ cảnh của 27B, chưa được xác nhận.

• Phương thức — Glimmer nhận đầu vào văn bản và hình ảnh qua bộ mã hóa nhận thức so với 27B, có khả năng văn bản được ưu tiên trước, chưa được xác nhận.

• Dấu chân cục bộ — Glimmer chạy với ~17 GB ở cài đặt 4-bit K-Quant-17GB so với mức dự kiến ~17 GB với Q4_K_M cho bản 27B.

• Công nghệ tốc độ — Glimmer được trang bị giải mã suy đoán DFlash (Meta báo cáo từ 74.9 đến 233.4 token/giây trên RTX 5090, tăng 3.1×), trong khi bản 27B chưa có tuyên bố tương tự nào.

Tại sao Me​ta lại nhắm đến đây

Muse Glimmer là phiên bản được chưng cất và lượng tử hóa của Muse Spark 1.2, mô hình hàng đầu đóng của Me​ta, do Me​ta Superintelligence Labs phát hành và được tinh chỉnh đặc biệt cho các tác nhân on-device luôn hoạt động: gọi công cụ, lập luận đa bước, phục hồi và thử lại khi lỗi, hiểu văn bản và hình ảnh xen kẽ, cùng hơn 100 ngôn ngữ. Các con số của chính Me​ta cho thấy nó vượt trội hơn gia đình Ge​mma 4 và Qwen3.6-27B trong một số bài kiểm tra tác nhân — MCP Atlas 75.5, DeepSearch QA 74.6, SWE-Bench Pro 51.2 — và chỉ kém một chút trong một vài bài khác. Tất cả những con số đó do nhà cung cấp báo cáo và chưa được kiểm chứng độc lập, và cần nói thẳng: trên các điểm chuẩn tác nhân mà Me​ta chọn, Glimmer dẫn trước thế hệ Qwe​n trước đó, còn trên những bài mà họ không chọn, Qwe​n vẫn dẫn đầu.

Điều khiến Glimmer trở nên đáng chú ý vượt xa điểm số là hai yếu tố. Thứ nhất, giấy phép: Apache 2.0, không có điều khoản MAU, không có ngưỡng thương mại hóa — thứ hào phóng nhất mà {{1}}Me​ta{{/1}} phát hành trong một thời gian dài, và bài luận kèm theo của Zuckerberg đã thể hiện rõ ràng lựa chọn chiến lược này. Thứ hai, bộ công cụ ngay từ ngày đầu: llama.cpp, Hugging Face Transformers, Ollama, LM Studio và SGLang đều hỗ trợ ngay tại hoặc gần thời điểm ra mắt, điều mà một mô hình cục bộ cần để {{2}}khả dụng thay vì chỉ có thể tải về{{/2}}.

A two-column scoreboard comparing Qwen3.8-27B (status weights pending, ~27B, license TBD, context TBD, ~17GB projected 4-bit VRAM, no speed tech yet) with Meta Muse Glimmer (available now, ~29.6B, Apache 2.0, 128K context, ~17GB 4-bit VRAM, DFlash speculative decoding), footered as projections for Qwen and vendor-reported for Glimmer.

Meta đã chọn đối thủ rồi

Trong bản phát hành của Glimmer, điều hữu ích nhất cho bài so sánh này là việc Me​ta đã benchmark với mô hình nào: Qwen3.6-27B, phiên bản tiền nhiệm trực tiếp của Qwen3.8-27B. Trên chính bảng của Me​ta, Glimmer nhỉnh hơn Qwe​n 27B ở SWE-Bench Pro (51.2 so với 50.2) nhưng thua nó ở SWE-Bench Verified (76.0 so với 77.2), còn Qwe​n dẫn đầu ở OSWorld-Verified, Terminal-Bench 2.1 và hầu hết các benchmark đa phương thức. Nói cách khác, hai gia đình mô hình đang so kè nhau ở quy mô local 27–30B, và thế hệ 3.8 của phía Qwe​n chính là phiên bản kế tiếp của đúng mô hình mà Me​ta dùng làm điểm tham chiếu. Đó mới là điểm nhấn thực sự của cuộc đối đầu này: bản 27B không phải là đối thủ giả định của Glimmer, mà là phiên bản kế tiếp của mô hình đương nhiệm, và Me​ta đã cho chúng ta biết baseline sát đến mức nào.

Điều gì vẫn chưa được xác minh ở phía Qwen?

Cho đến khi kho lưu trữ được ra mắt, cột Qwen3.8-27B chủ yếu là dấu hỏi: liệu nó là mô hình dense hay MoE, cửa sổ ngữ cảnh của nó, liệu nó có đa phương thức hay không, và quan trọng là giấy phép của nó. Câu hỏi về giấy phép chính là yếu tố có thể tự nó quyết định sự so sánh này — một mô hình được cấp phép theo Tongyi Qianwen là một quyết định mua sắm khác với mô hình theo Apache 2.0, đặc biệt đối với các sản phẩm thương mại vượt ngưỡng MAU. Hiện vẫn chưa có điểm benchmark nào của 27B, và các con số do nhà cung cấp công bố cho thế hệ 3.8 nói chung thuộc về Max, chứ không phải 27B.

Artificial Analysis profile page for Qwen3.8 Max, showing an Intelligence Index of 58, an output speed of 48.4 tokens per second, $2.00/$6.00 per-million-token pricing, a 1M-token context window, and a summary describing it as leading in intelligence but slow and verbose.

Chọn cái nào?

Nếu bạn cần một mô hình agent cục bộ hoạt động được ngay hôm nay, quyết định tự nó đã hiển nhiên: Me​ta Muse Glimmer đã có mặt, chạy trên card 24 GB, có hỗ trợ runtime ngay từ ngày đầu, và được cấp phép Apache 2.0. Qwen3.8-27B chỉ là một lời hứa. Nếu bạn đã chuẩn hóa trên hệ sinh thái Qwe​n, hoặc yêu cầu của bạn là một benchmark cụ thể mà thế hệ 3.8 được kỳ vọng sẽ cải thiện, thì bản 27B đáng để chờ đợi — nhưng việc chờ đợi có một chi phí cơ hội thực sự, và giấy phép có thể thay đổi câu trả lời của bạn sau khi nó ra mắt.

Các đội ngũ không muốn chờ đợi cũng không muốn bị ràng buộc (lock-in) có một con đường trung gian. OrcaRouter định tuyến hơn 200 mô hình qua một API duy nhất với đúng giá niêm yết của nhà cung cấp, không đội giá và có cơ chế failover tự động — Qwen3.8 Max hiện đã có trên đó với giá $2.00/$6.00 cho mỗi triệu token, và dòng Muse Spark mã nguồn đóng của chính Me​ta cũng truy cập được bằng cùng một khóa. Khi mô hình 27B ra mắt và tạo được niềm tin trên các benchmark độc lập, failover là cách để thử nghiệm nó với tải sản xuất thực tế mà không phải đặt cược toàn bộ vào một mô hình chưa được kiểm chứng: chuyển một phần lưu lượng truy cập sang nó, giữ phần còn lại trên mô hình hiện tại, và để việc sử dụng thực tế quyết định.

OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

Chưa bên nào được kiểm toán độc lập cả — số liệu của Glimmer là của Me​ta, còn bản 27B thì chẳng có số liệu nào. Đánh giá trung thực sau tuần đầu tiên: Glimmer là mô hình bạn thực sự có thể chạy, bản 27B là mô hình bạn sẽ so sánh với nó trong một tháng nữa, và file giấy phép — chứ không phải bảng benchmark — mới là thứ có khả năng lật ngược quyết định của một đội nhóm nhất.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube