Thẻ hero được tạo với tiêu đề 'Step 5 Preview vs Muse Glimmer - API và chiếc laptop'. Thẻ bên trái 'Step 5 Preview' ghi: Chỉ số AA 44 so với trung vị của nhóm là 26, StepFun, công bố ngày 20 tháng 9 năm 2026, khoảng 600B tổng / 27B hoạt động, ngữ cảnh 1M token, $1.00 đầu vào / $2.70 đầu ra trên mỗi 1M token, chạy trên máy chủ của nhà cung cấp. Thẻ bên phải 'Muse Glimmer' ghi: Chỉ số AA 17, Meta Superintelligence Labs, phát hành ngày 10 tháng 8 năm 2026, 30B tham số ở 4-bit dưới 20 GB, ngữ cảnh 131K token có thể mở rộng lên 262K, Apache 2.0, chạy ngoại tuyến trên GPU của riêng bạn. Phần chân trang ghi 'Số liệu chỉ số theo Artificial Analysis; thông số kỹ thuật của Muse Glimmer theo Meta.'
Guides & Insights

Step 5 Preview so với Muse Glimmer: Frontier API và Mô hình Laptop

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trên một bảng xếp hạng, Step 5 Preview và Muse Glimmer không hề gần nhau: 44 so với 17 trên Artificial Analysis Intelligence Index — khoảng cách hai mươi bảy điểm trên một thang điểm mà mô hình dẫn đầu hiện tại đang ở mức cao trong khoảng năm mươi — không một lượng tinh chỉnh nào có thể thu hẹp được. Ở câu hỏi mà một đội thực sự phải trả lời — token của tôi chạy ở đâu — chúng là đối thủ trực tiếp của nhau. Step 5 Preview là mô hình chủ lực của StepFun, công bố ngày 20 tháng 9 năm 2026, khoảng 600 tỷ tham số tổng cộng với 27 tỷ tham số hoạt động, ngữ cảnh 1M token, có giá $1.00 cho mỗi triệu token đầu vào và $2.70 cho mỗi triệu token đầu ra, và chỉ có thể truy cập qua mạng. Muse Glimmer là mô hình tác tử trọng số mở 30 tỷ tham số của Meta Superintelligence Labs, phát hành ngày 10 tháng 8 năm 2026 theo Apache 2.0, được xuất xưởng với lượng tử hóa 4-bit để vừa dưới 20 GB bộ nhớ và chạy trên một GPU tiêu dùng khi mạng bị ngắt kết nối. Cách đúng để đọc cặp này không phải là "cái nào thông minh hơn". Mà là "ràng buộc nào trong hai ràng buộc — năng lực hay chu vi — là cái mà khối lượng công việc của bạn không thể thay đổi."

Phép so sánh cũng là một biện pháp điều chỉnh hữu ích đối với một thói quen mà thị trường này đã hình thành: coi điểm chỉ số tổng hợp là toàn bộ giá trị của một mô hình. Khoảng cách hai mươi bảy điểm là có thật và nó không phải là con số duy nhất trong hồ sơ. Về truy xuất ngữ cảnh dài, cùng hội đồng đánh giá độc lập đó đặt Muse Glimmer trong vòng nửa điểm so với các mô hình trọng số mở thuộc hạng cân lớn hơn nhiều, và các bài kiểm chuẩn tác tử của chính Meta là đáng nể đối với một mô hình chạy trên laptop. Trong khi đó, điểm yếu được nhắc đến nhiều nhất của Step 5 Preview hoàn toàn không phải là năng lực mà là tính dài dòng, và nó vẫn đóng cho đến khi các trọng số được hứa hẹn của nó xuất hiện vào ngày 15 tháng 10.

Hai mô hình, hai đối tượng hoàn toàn khác nhau

Step 5 Preview là một hệ thống mixture-of-experts được vận hành trên hạ tầng của StepFun: khoảng 600B tổng tham số, 27B hoạt động mỗi token, đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1M token, và điểm Intelligence Index độc lập là 44 so với trung vị 26 của mô hình tương đương. Đầu ra của nó chạy ở 87 token mỗi giây so với mức trung bình 78 theo đo lường của cùng bảng xếp hạng đó, và nó đã tạo ra khoảng 160 triệu token đầu ra trên toàn bộ bộ tác vụ của chỉ số, trong khi mô hình trung vị phát ra khoảng 82 triệu — gần gấp đôi lượng văn bản trên mỗi đơn vị công việc, được tính phí ở mức $2.70 mỗi triệu. Các trọng số BF16 đã được hứa cho ngày 15 tháng 10 năm 2026 và vẫn chưa có trong kho lưu trữ, vì vậy hiện tại, mô hình chỉ tồn tại với bạn dưới dạng API.

Muse Glimmer là đối tượng ngược lại. Nó là một mô hình 30 tỷ tham số được huấn luyện bằng chưng cất logit từ giáo viên Muse Spark lớn hơn của Meta, sau đó được tinh chỉnh trên dữ liệu agentic ngữ cảnh dài và được tăng cường cho việc sử dụng công cụ. Meta phát hành nó ở dạng lượng tử hóa 4-bit, giúp đưa bộ nhớ từ hơn 55 GB ở độ chính xác đầy đủ xuống dưới 20 GB — nằm trong giới hạn VRAM 24 GB hoặc 32 GB — và nó đã được Meta thử nghiệm trên Nvidia RTX 5090 cũng như trên chip Apple M4 Max và M5 Max. Nó nhận đầu vào văn bản và hình ảnh bằng hơn một trăm ngôn ngữ, hỗ trợ ngữ cảnh 131.072 token có thể mở rộng lên 262.144, và được xây dựng để nhận một mục tiêu, chia nó thành các bước, gọi công cụ và thử lại một lệnh gọi thất bại thay vì dừng lại. Nó là Apache 2.0, và nó chạy ngoại tuyến.

• Điểm số độc lập — Step 5 Preview: 44 so với mức trung vị là 26 trong cùng phân khúc, so với Muse Glimmer: 17 trên cùng chỉ số ở cấu hình cao của nó.

• Quy mô — Bản xem trước Step 5: khoảng 600B tổng, 27B hoạt động mỗi StepFun so với Muse Glimmer: 30B tổng, lượng tử hóa xuống 4-bit dưới 20 GB.

• Cửa sổ ngữ cảnh — Step 5 Preview: 1 triệu token so với Muse Glimmer: 131.072, có thể mở rộng lên 262.144, theo Meta.

• Giá — Bản xem trước Step 5: 1,00 USD vào / 2,70 USD ra mỗi triệu token, được công bố so với Muse Glimmer: không tính phí theo token; bạn tự cung cấp GPU.

• Nơi nó chạy — Xem trước Bước 5: máy chủ của nhà cung cấp, qua HTTP so với Muse Glimmer: phần cứng của riêng bạn, ngoại tuyến.

• Giấy phép — Step 5 Preview: bản xem trước đóng, trọng số được hứa cung cấp vào ngày 15 tháng 10 năm 2026 so với Muse Glimmer: Apache 2.0, có thể tải xuống ngay.

• Truy xuất ngữ cảnh dài — Muse Glimmer đạt 80.0 điểm trong bài đánh giá suy luận ngữ cảnh dài của index board, chỉ kém nửa điểm so với các mô hình có mức giá cao gấp nhiều lần và đủ gần với kết quả của Step 5 Preview đến mức khác biệt đó không mang tính quyết định đối với công việc tìm dữ kiện.

Hai mươi bảy điểm, và những gì chúng không đo lường

Một mô hình 30B được chưng cất để chạy trong 20 GB bộ nhớ sẽ thua một mô hình chủ lực 600B trên một chỉ số trí tuệ tổng quát, và tài liệu của chính Meta cũng không tuyên bố điều nào khác — một trong những cách diễn đạt của họ thẳng thắn rằng Glimmer không được thiết kế để sánh ngang với sức mạnh suy luận thô của các mô hình đám mây quy mô đầy đủ. Vậy nên điểm số 17 không phải là một phán xét về mặt kỹ thuật; đó là kết quả được mong đợi của việc cân nhắc một mục tiêu khác. Câu hỏi đúng là khoảng cách đó thực sự bao phủ những tác vụ nào của bạn.

Đọc ngữ cảnh dài là nơi hai mô hình tiến sát nhau nhất và cũng là nơi trực giác không còn đứng vững. Muse Glimmer đạt 80,0 trong bài đánh giá suy luận ngữ cảnh dài của bảng xếp hạng — một điểm số sẽ chẳng có gì đáng chú ý với một mô hình tiên phong và lại đáng chú ý với một mô hình chạy trên GPU tiêu dùng. Nếu khối lượng công việc của bạn là truy xuất, tóm tắt hoặc trích xuất trên các tài liệu dài, một mô hình cục bộ ở mức đó không hẳn là công cụ sai, và việc yêu cầu không bao giờ rời khỏi máy của bạn là một tính năng mà bạn không thể mua từ API với bất kỳ mức giá nào.

Rồi còn có phần so sánh mà các con số của Meta không hề thể hiện. Một nghiên cứu đã qua bình duyệt về điều phối đa tác nhân đã thử nghiệm Muse-Glimmer-30B trong một thiết lập có kiểm soát — cùng nhiệm vụ, cùng harness, cùng các chuyên gia tư vấn — và phát hiện rằng nó không khôi phục được ứng viên nào trong số những ứng viên do các mô hình biên lớn hơn tạo ra, thất bại cả ba lần thử ở mỗi thiết lập. Đó chỉ là một nghiên cứu duy nhất về một cấu hình, và đó là kiểu bằng chứng mà một trang mô hình không bao giờ đưa ra. Đối với các pipeline tác nhân, nơi một bộ điều phối yếu hơn phải khôi phục sau thất bại của một mô hình mạnh hơn, đây là kết quả liên quan nhất đến quyết định trong bài viết này, và đáng để đọc trước bất kỳ benchmark nào do nhà cung cấp Meta báo cáo.

Những benchmark đó, cho đầy đủ, là của chính Meta và chưa được tái lập: 76,0% trên SWE-Bench Verified, 51,2% trên SWE-Bench Pro, 51,7% trên TerminalBench 2.1, 65,9% trên OSWorld-Verified, 83,5% trên GPQA Diamond, 22% trên Humanity's Last Exam và 75,5 trên MCP-Atlas. Chúng được đo so với các mô hình trong cùng phân khúc kích thước của nó, và chúng mô tả một tác nhân cục bộ có năng lực chứ không phải một bộ suy luận tiên tiến.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

Ranh giới thực sự nằm ở đâu

Lợi thế cấu trúc của Step 5 Preview nằm ở chỗ nó làm được những việc mà bạn không thể làm cục bộ. Ngữ cảnh 1M token, đầu vào hình ảnh, một điểm số đo được ở mức tiệm cận hàng đầu và 87 token đầu ra mỗi giây mà không cần mua phần cứng: đối với việc phác thảo, lập kế hoạch, đánh giá mã trên một kho lưu trữ lớn, hay bất cứ việc gì mà giới hạn trần của mô hình chính là nút thắt, API thắng và hai mươi bảy điểm chính là toàn bộ lý lẽ. Cái giá của điều đó thì ngược lại với Muse Glimmer: các prompt rời khỏi ranh giới của bạn, mức giá được áp lại trên từng token, và tính dài dòng của mô hình khiến các tác vụ có đầu ra dài trở nên đắt đỏ hơn mức mà mức giá $2.70 gợi ý.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

Lợi thế của Muse Glimmer là nó làm công việc không thể rời đi. Nếu dữ liệu được quản lý, nếu ngân sách độ trễ chỉ vài mili giây, nếu máy móc ngoại tuyến, hoặc nếu chi phí biên của yêu cầu thứ một triệu phải bằng không, thì không có API nào là ứng viên — không phải cái này, không phải bất kỳ cái nào. Cái giá phải trả là năng lực: bạn đang chọn một 17 trong khi có một 44 tồn tại, và trong điều phối tác nhân, bạn có thể đang chọn một điều phối viên không thể khắc phục sai lầm của một mô hình mạnh hơn.

Với hầu hết các nhóm, câu trả lời không phải là một lựa chọn mà là sự chia tách, và sự chia tách đó cần một nơi để tồn tại. OrcaRouter định tuyến hơn 200 mô hình đằng sau một khóa API và một hóa đơn với mức markup 0% cùng giá niêm yết của nhà cung cấp được chuyển nguyên, cùng với chuyển đổi dự phòng tự động và một DSL định tuyến để gửi lưu lượng theo tác vụ, chi phí hoặc độ trễ. Cả Step 5 Preview lẫn Muse Glimmer đều không có trong danh mục đó — mô hình chủ lực của StepFun không được chúng tôi định tuyến và Glimmer là bản tải xuống cục bộ — nên giá trị được đưa ra không phải là quyền truy cập vào một trong hai mô hình. Đó là bộ mô hình mà bạn sẽ dùng làm chuẩn để đánh giá chúng, có thể gọi bằng một khóa ngay hôm nay, để quyết định giữa cục bộ và từ xa được định đoạt bởi phân bố tác vụ của chính bạn thay vì bởi trang của nhà cung cấp nào mà bạn đọc sau cùng.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Cách quyết định

Chọn Step 5 Preview khi mức trần là ràng buộc. Nếu các tác vụ của bạn là mở, đa phương thức, ngữ cảnh dài hoặc mang tính tác tử theo nghĩa cần một bộ lập kế hoạch đủ năng lực, thì mô hình API là mô hình duy nhất trong hai mô hình có thể làm được chúng, và giá của nó đủ thấp so với phân khúc của nó đến mức việc thí điểm nó là một khoản mục ngân sách chứ không phải một dự án. Hãy dự trù ngân sách cho độ dài dòng, chuẩn bị cho khả năng mốc trọng số ngày 15 tháng 10 bị trượt, và giữ những khối lượng công việc không được rời khỏi nội bộ ra khỏi phạm vi đó.

Hãy chọn Muse Glimmer khi vành đai mạng là ràng buộc. Nếu dữ liệu của bạn không thể được gửi đi, nếu bạn cần chạy trên máy bay hoặc trong nhà máy, hoặc nếu khối lượng của bạn khiến giá theo token trở nên vô lý, thì một mô hình 30B Apache-2.0 vừa trong 20 GB là lựa chọn thực tế, và kết quả truy xuất ngữ cảnh dài của nó đủ tốt để khoảng cách năng lực sẽ không thể hiện trong mọi khối lượng công việc. Hãy kiểm thử nó trong điều phối trước khi bạn tin tưởng nó ở đó, vì đó là nơi bằng chứng độc lập yếu nhất.

Nếu cả hai ràng buộc cùng lúc phát huy tác dụng, hãy chạy cả hai: cục bộ cho dữ liệu không thể di chuyển, API cho những tác vụ cần mô hình lớn hơn, và hãy để quyết định định tuyến là một thay đổi cấu hình thay vì phải di dời. Phép so sánh đáng lưu tâm không phải là 44 so với 17. Mà là yêu cầu nào của bạn có thể chấp nhận rời khỏi máy, và đó là câu hỏi mà chỉ lưu lượng của chính bạn mới trả lời được.