Đã tạo thẻ hero có tiêu đề Claude Sonnet 5.5 vs Muse Glimmer, phụ đề là mô hình 30B chạy trên laptop đối đầu với Sonnet mới, cùng ba thẻ số liệu: Chỉ số Thông minh 56 vs 17, cửa sổ ngữ cảnh 1M vs 131K token, và trọng số đóng vs Apache 2.0, với phần chân trang ghi Chỉ số theo Artificial Analysis v4.3.2; thông số kỹ thuật của Muse Glimmer theo Meta.
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer: Một mô hình laptop 30B đối đầu với Sonnet mới

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Câu hỏi định khung cho trang này là liệu sự so sánh có thực sự chính đáng hay không, và câu trả lời trung thực là Claude Sonnet 5.5 và Muse Glimmer không phải là đối thủ theo nghĩa thông thường. Trên Chỉ số Intelligence Index của Artificial Analysis, bản sửa đổi v4.3.2, Claude Sonnet 5.5 đạt 56 điểm và Muse Glimmer đạt 17 điểm, và khoảng cách đó không phải là nhiễu — nó gần bằng khoảng cách giữa một mô hình đa dụng tiên phong và một mô hình nhỏ rất tốt. Điều khiến cặp đôi này vẫn đáng để đọc là Muse Glimmer có một đặc tính mà mô hình kia không thể mua bằng bất cứ giá nào: nó là một mô hình trọng số mở 30 tỷ tham số, được Meta công bố vào ngày 10 tháng 8 năm 2026 theo Apache 2.0, được lượng tử hóa xuống 4-bit để vừa dưới 20 GB VRAM, và được thiết kế để chạy khi mạng bị ngắt kết nối. Claude Sonnet 5.5 ra mắt vào ngày 28 tháng 9 năm 2026 với tư cách là Sonnet nhanh nhất và thông minh nhất của nhà cung cấp, có giá 2,00 USD cho mỗi triệu token đầu vào và 10,00 USD cho mỗi triệu token đầu ra, và chỉ có thể truy cập qua mạng. Quyết định thực sự không phải là mô hình nào tốt hơn. Mà là bạn muốn các token chạy ở đâu.

Hai mô hình, hai định nghĩa về công việc

Muse Glimmer ra đời từ Meta Superintelligence Labs dưới dạng mô hình 30 tỷ tham số được huấn luyện bằng chưng cất logit từ mô hình giáo viên Muse Spark lớn hơn của Meta, sau đó được tinh chỉnh trên dữ liệu tác tử ngữ cảnh dài và tăng cường cho việc sử dụng công cụ. Meta phát hành nó ở dạng đã lượng tử hóa sẵn: 4-bit giảm dung lượng bộ nhớ từ hơn 55 GB ở độ chính xác đầy đủ xuống dưới 20 GB, và đó chính là điều đưa nó vào giới hạn của GPU tiêu dùng 24 GB hoặc 32 GB. Meta đã thử nghiệm nó trên Nvidia RTX 5090 và trên silicon Apple M4 Max và M5 Max. Nó nhận đầu vào văn bản và hình ảnh, trả về văn bản, chạy cửa sổ ngữ cảnh 131.072 token mà Meta nói có thể mở rộng lên 262.144, và mang mốc kiến thức tháng 1 năm 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 là mô hình thứ hai trong thế hệ 5.5 của Anthropic và là mô hình mà công ty định vị là sự kết hợp tốt nhất giữa tốc độ và trí tuệ trong danh mục sản phẩm của mình. Nó chạy cửa sổ 1.000.000 token, tối đa 128.000 token đầu ra đồng bộ và 300.000 trên API Message Batches khi dùng output-300k-2026-03-24 làm tiêu đề, chấp nhận văn bản, hình ảnh và tệp, cung cấp khả năng tư duy thích ứng ở mức nỗ lực có thể chọn với thời điểm cắt kiến thức tháng 6 năm 2026, và có sẵn với chính sách không lưu giữ dữ liệu ngay từ khi ra mắt. Lưu trữ có giá $0,20 mỗi triệu token khi đọc bộ nhớ đệm và $2,50 mỗi triệu khi ghi bộ nhớ đệm. Anthropic cho biết mô hình chạy nhanh hơn 30% so với Claude Sonnet 5 và tốn ít hơn tới 30% mỗi tác vụ ở mức giá không đổi — tuyên bố của nhà cung cấp, chưa được tái lập độc lập.

Sự tương phản về thông số kỹ thuật đáng để xem qua một lượt, bởi vì gần như mỗi dòng là một kiểu thứ khác nhau chứ không phải là một thứ tốt hơn hay tệ hơn:

• Trọng số — Muse Glimmer Apache 2.0, có thể tải xuống, được lượng tử hóa xuống 4-bit so với Claude Sonnet 5.5 đóng

• Nơi nó chạy — Muse Glimmer trên GPU của riêng bạn, ngoại tuyến so với Claude Sonnet 5.5 trên hạ tầng A​nthropic

• Tham số — Muse Glimmer 30B tổng, dưới 20 GB ở 4-bit so với Claude Sonnet 5.5 không được tiết lộ

• Ngữ cảnh — Muse Glimmer 131.072 token, có thể mở rộng lên 262.144 so với Claude Sonnet 5.5 1.000.000 token

• Giá mỗi triệu token — Muse Glimmer không tính phí theo token, phần cứng của bạn so với Claude Sonnet 5.5 $2.00 đầu vào / $10.00 đầu ra

• Chỉ số Trí tuệ v4.3.2 — Muse Glimmer 17 so với Claude Sonnet 5.5 56

• Chi phí cho mỗi tác vụ Index như được đo lường — Muse Glimmer $0.06 so với Claude Sonnet 5.5 $7.60

Hai con số trong danh sách đó đáng được mổ xẻ, vì cả hai đều là cạm bẫy. Đầu tiên là con số 0,06 USD cho mỗi tác vụ: đó là số tiền Artificial Analysis đã chi để gọi Muse Glimmer (high) qua một endpoint được host, với mức 0,325 USD mỗi triệu token đầu vào và 1,35 USD mỗi triệu token đầu ra, nên nó đo lường tính kinh tế của việc thuê mô hình này, chứ không phải của việc chạy nó. Khi tự vận hành, chi phí biên trên mỗi token biến mất và được thay bằng một GPU mà bạn đã sở hữu hoặc phải mua. Thứ hai là chính khoảng cách Index — một mô hình 30B được lượng tử hóa xuống 20 GB lại đang được chấm điểm bằng cùng một thước đo với các mô hình tiên phong, và bảng xếp hạng cũng nói đúng như vậy khi xếp Muse Glimmer vào nhóm số ít mô hình trọng số mở hàng đầu, đồng thời lưu ý rằng nó đắt đỏ so với kích cỡ của mình.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Nơi Muse Glimmer thực sự xuất sắc, và nơi mọi chuyện bắt đầu sụp đổ

Điểm tổng hợp quá thô để có thể là toàn bộ câu trả lời, bởi vì Muse Glimmer không đồng nhất ở mức mười bảy. Nó nhanh — Artificial Analysis đo được 143,8 token đầu ra mỗi giây, cao hơn 138,7 của Claude Sonnet 5.5 — và nó súc tích, tạo ra 59M token trong toàn bộ đánh giá Index so với 410M của Claude Sonnet 5.5. Và ở một đánh giá, nó tiệm cận mức tiên tiến nhất: truy hồi ngữ cảnh dài, nơi nó đạt 83,3% so với 82,7% của Claude Sonnet 5.5. Một mô hình 30B sánh ngang với một Sonnet tiên tiến mới toanh ở khả năng truy xuất ngữ cảnh dài là dòng gây ngạc nhiên nhất trên trang này, và điều đó nhất quán với cách Meta huấn luyện nó — dữ liệu tác tử ngữ cảnh dài, chưng cất từ một mô hình giáo viên lớn hơn nhiều.

Kết quả agentic là nơi trần năng lực của mô hình lộ rõ và bảng xếp hạng không còn tâng bốc nữa. Trên Terminal-Bench 4.0, Muse Glimmer đạt 0,5%, so với 63,6% của Claude Sonnet 5.5. Điểm benchmark tự động hóa của nó là 0,068 so với 0,713. Humanity's Last Exam: 22,0% so với 55,0%. Đầu ra chỉ ở quy mô nhỏ như vậy trên một benchmark thực thi nghĩa là mô hình không hoàn thành các tác vụ, và khoản tiết kiệm nhờ tự vận hành cục bộ khiến một tác vụ không bao giờ kết thúc trở nên rẻ hơn.

Các tài liệu nghiên cứu cũng nói thẳng về điều này, và điều đó đáng được nói ra hơn là chôn vùi: một nghiên cứu điều phối đa tác nhân đã qua bình duyệt, trong đó Muse-Glimmer-30B là một trong những mô hình được thử nghiệm, đã phát hiện ra rằng nó không khôi phục được ứng viên nào của mình. Bảng đánh giá chuẩn của chính Meta dành cho mô hình này là một tài liệu của nhà cung cấp và được ghi nhãn như vậy ở đây; các số liệu Artificial Analysis ở trên là những đo lường độc lập, và chúng là những số liệu mà bài viết này dựa vào.

Vậy nên sự phân định là rõ ràng. Muse Glimmer mạnh so với kích thước của nó ở khả năng đọc một đầu vào dài và trả lời về nội dung đó, nhanh, chi phí chạy thấp, và vừa vặn trong một GPU cấp laptop. Nó không phải là mô hình mà bạn giao một tác vụ phần mềm nhiều bước rồi bỏ đi. Đó là ranh giới trung thực, và một bài so sánh chỉ viết xoay quanh điểm tổng hợp sẽ che giấu điều đó.

Điều bạn thực sự đang mua ở mức giá tiên phong

Gói trả phí của Claude Sonnet 5.5 mua năng lực trước tiên, và khoảng cách mười bảy điểm trên Index chính là hình thức nổi bật nhất của điều đó. Nhưng có ba thứ khác đi kèm với mức giá đầu ra $10.00 mà không hề xuất hiện trên bất kỳ bảng xếp hạng nào.

Đầu tiên là cửa sổ ngữ cảnh. Một triệu token xấp xỉ gấp bảy lần rưỡi 131.072 của Muse Glimmer, và Anthropic tính mức giá tiêu chuẩn trên toàn bộ số đó, với giá đọc bộ nhớ đệm bằng một phần mười giá đầu vào, khiến việc duy trì một ngữ cảnh lớn xuyên suốt nhiều lần gọi trở nên khả thi về chi phí thay vì chỉ mang tính lý thuyết. Một prompt quy mô kho mã nguồn hoàn toàn không vừa với cửa sổ nhỏ hơn, nên đây là khác biệt về năng lực chứ không phải sở thích.

Thứ hai là độ trung thực của công cụ. Năm hành vi đã thay đổi giữa Claude Sonnet 5 và Claude Sonnet 5.5, và cả năm đều liên quan đến việc dùng công cụ và suy luận: các tham số lấy mẫu không mặc định giờ trả về lỗi 400, thinking: {"type": "disabled"} giờ trả về lỗi 400 và trở thành between_tools, việc ép chọn công cụ "any" hoặc một công cụ có tên bị từ chối nên các vòng lặp phải chuyển sang auto với strict tool use, công cụ computer_20251124 cũ hơn bị từ chối trên Claude API và Goo​gle Cloud, và các khối thinking giờ bị ràng buộc với mô hình và tài khoản đã tạo ra chúng. Thay đổi thứ sáu không làm hỏng gì nhưng lại âm thầm: văn bản giữa các lần gọi công cụ được trả về bên trong các khối thinking, nên một ứng dụng streaming sẽ ngừng hiển thị đầu ra cho đến khi nó đặt một giá trị hiển thị hoặc tắt thinking từ đầu. Đó là một ngày công việc di trú đối với bất kỳ ai đang dùng Sonnet 5, và đó là cái giá để được nhận vào sự ổn định hướng tác nhân mà các hàng benchmark ở trên đang đo lường.

Thứ ba là nguồn gốc xuất xứ và xử lý dữ liệu. Tính năng không lưu trữ dữ liệu (zero data retention) đã có sẵn ngay từ khi ra mắt, A​nthropic công bố mốc ngừng hỗ trợ sớm nhất là ngày 28 tháng 9 năm 2027, và mô hình này có mặt trên Claude API, Bedrock, Goo​gle Cloud và Microsoft Foundry. Đối với một người mua trong ngành chịu sự quản lý, đó là những dữ kiện mua sắm quyết định thương vụ trước cả khi các bài đo chuẩn làm được điều đó.

Ngoại tuyến là một yêu cầu bắt buộc, không phải là cách để tiết kiệm chi phí.

Lý do sự kết hợp này thuộc về cùng một trang là ở chỗ, đối với một nhóm triển khai cụ thể, Muse Glimmer không phải là một lựa chọn rẻ hơn — nó là lựa chọn duy nhất. Một yêu cầu không thể rời khỏi thiết bị, một xưởng sản xuất hay một địa điểm thực địa không có kết nối, một môi trường cách ly hoàn toàn nơi một lời gọi API là hành vi vi phạm tuân thủ, hay một ngân sách độ trễ mà chỉ một vòng khứ hồi thôi đã là quá nhiều: không vấn đề nào trong số đó được giải quyết bằng một mô hình tốt hơn nằm sau một mạng lưới. Trọng số Apache 2.0 gọn dưới 20 GB và chạy ngoại tuyến chính là toàn bộ câu trả lời, còn Claude Sonnet 5.5 dù ở bất kỳ mức giá nào cũng không tham gia vào câu hỏi này.

Bài kiểm thử đã công bố của M​eta trên chip RTX 5090 và Apple M4 Max và M5 Max là tham chiếu thực tiễn cho ý nghĩa của "chạy cục bộ" ở đây, và lượng tử hóa 4-bit chính là yếu tố khiến những mục tiêu đó có thể đạt tới — kích thước full-precision là hơn 55 GB. Bất kỳ ai đang lên kế hoạch triển khai nên coi các số liệu phần cứng là của M​eta chứ không phải được đo tại đây.

Đối với tất cả những người khác, hai mô hình này bổ trợ cho nhau chứ không thay thế nhau, và phần khó xử về mặt vận hành là việc nắm giữ một mô hình API của Anthro​pic cùng một mô hình M​eta tự lưu trữ thường có nghĩa là hai ngăn xếp hoàn toàn tách biệt. OrcaRouter đặt hơn 200 mô hình phía sau một endpoint tương thích Open​AI, với giá niêm yết của nhà cung cấp được chuyển nguyên và không cộng thêm markup, tự động chuyển đổi dự phòng giữa các nhà cung cấp thượng nguồn và một DSL định tuyến để tổ hợp các lệnh gọi — vốn bao trùm nửa phần được lưu trữ của cách bố trí đó, và mô hình teacher Muse Spark 1.2 lớn hơn của M​eta có thể định tuyến tại đây dưới dạng meta/muse-spark-1.2 với giá $1.25 đầu vào và $4.25 đầu ra trên mỗi triệu token trong cửa sổ 1.048.576 token, cùng $0.15 cho lượt đọc cache. Nó đang xử lý 42,8 triệu token lưu lượng mỗi tuần qua danh mục này, đó là phần hữu ích của cách bố trí: teacher được lưu trữ nằm trên cùng khóa với mọi thứ khác, và mô hình bạn chạy cục bộ không bao giờ phải chạm vào mạng.

Ba lưu ý về tính trung thực, vì chúng rất dễ bị hiểu sai. Bản thân Muse Glimmer không phải là một trong các route của chúng tôi — model card không tồn tại trong danh mục của chúng tôi, và trang này nói rõ điều đó thay vì ngụ ý điều ngược lại. Ảnh chụp bên dưới là trang dành cho model thực sự tồn tại, Muse Spark 1.2, đây là checkpoint mà Muse Glimmer được chưng cất ra từ đó chứ không phải chính Muse Glimmer. Claude Sonnet 5.5 cũng không có trong danh mục của chúng tôi, một ngày sau khi ra mắt; route dẫn đến nó là API riêng của A​nthropic, và Claude Sonnet 5 đã có thể định tuyến tại đây kể từ ngày 30 tháng 6 với mức $2.00 và $10.00 dành cho bất kỳ ai muốn dùng mục tiêu staging.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Cách quyết định

Hãy bắt đầu từ ràng buộc, không phải từ điểm số. Nếu yêu cầu không thể rời khỏi một máy hoặc một mạng, Muse Glimmer là câu trả lời và khoảng cách Index là không liên quan — một mô hình 30B Apache 2.0 chạy ngoại tuyến và sánh ngang với một mô hình tiên tiến về khả năng ghi nhớ ngữ cảnh dài, đối với công việc đó, chính là thứ tốt nhất hiện có. Nếu yêu cầu phải hoàn thành một tác vụ phần mềm gồm nhiều bước, một mô hình 30B chỉ đạt nửa phần trăm trên Terminal-Bench thì không nằm trong cuộc đua, bất kể phần cứng bạn đã sở hữu.

Giữa hai thái cực đó, yếu tố phân định là đo lường chứ không phải ý kiến: token trên mỗi tác vụ hoàn thành trên chính khối lượng công việc của bạn, được định giá hai lần — một lần theo mức $2.00 và $10.00 của Claude Sonnet 5.5, và một lần theo chi phí phân bổ của GPU. Con số duy nhất định hình lại toàn bộ so sánh, $0.06 mỗi tác vụ Index so với $7.60, là một con số thuê máy chủ cho một mô hình mà hầu hết mọi người sẽ tự chạy, và trích dẫn nó như thể đó là một khoản tiết kiệm tương đương sẽ là sai lầm dễ mắc mà trang này tồn tại để tránh.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày