
Step 5 Preview so với Muse Glimmer: Frontier API và Mô hình Laptop
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Trên một bảng xếp hạng, Step 5 Preview và Muse Glimmer không hề gần nhau: 44 so với 17 trên Artificial Analysis Intelligence Index — khoảng cách hai mươi bảy điểm trên một thang điểm mà mô hình dẫn đầu hiện tại đang ở mức cao trong khoảng năm mươi — không một lượng tinh chỉnh nào có thể thu hẹp được. Ở câu hỏi mà một đội thực sự phải trả lời — token của tôi chạy ở đâu — chúng là đối thủ trực tiếp của nhau. Step 5 Preview là mô hình chủ lực của StepFun, công bố ngày 20 tháng 9 năm 2026, khoảng 600 tỷ tham số tổng cộng với 27 tỷ tham số hoạt động, ngữ cảnh 1M token, có giá $1.00 cho mỗi triệu token đầu vào và $2.70 cho mỗi triệu token đầu ra, và chỉ có thể truy cập qua mạng. Muse Glimmer là mô hình tác tử trọng số mở 30 tỷ tham số của Meta Superintelligence Labs, phát hành ngày 10 tháng 8 năm 2026 theo Apache 2.0, được xuất xưởng với lượng tử hóa 4-bit để vừa dưới 20 GB bộ nhớ và chạy trên một GPU tiêu dùng khi mạng bị ngắt kết nối. Cách đúng để đọc cặp này không phải là "cái nào thông minh hơn". Mà là "ràng buộc nào trong hai ràng buộc — năng lực hay chu vi — là cái mà khối lượng công việc của bạn không thể thay đổi."
Phép so sánh cũng là một biện pháp điều chỉnh hữu ích đối với một thói quen mà thị trường này đã hình thành: coi điểm chỉ số tổng hợp là toàn bộ giá trị của một mô hình. Khoảng cách hai mươi bảy điểm là có thật và nó không phải là con số duy nhất trong hồ sơ. Về truy xuất ngữ cảnh dài, cùng hội đồng đánh giá độc lập đó đặt Muse Glimmer trong vòng nửa điểm so với các mô hình trọng số mở thuộc hạng cân lớn hơn nhiều, và các bài kiểm chuẩn tác tử của chính Meta là đáng nể đối với một mô hình chạy trên laptop. Trong khi đó, điểm yếu được nhắc đến nhiều nhất của Step 5 Preview hoàn toàn không phải là năng lực mà là tính dài dòng, và nó vẫn đóng cho đến khi các trọng số được hứa hẹn của nó xuất hiện vào ngày 15 tháng 10.
Hai mô hình, hai đối tượng hoàn toàn khác nhau
Step 5 Preview là một hệ thống mixture-of-experts được vận hành trên hạ tầng của StepFun: khoảng 600B tổng tham số, 27B hoạt động mỗi token, đầu vào văn bản và hình ảnh, cửa sổ ngữ cảnh 1M token, và điểm Intelligence Index độc lập là 44 so với trung vị 26 của mô hình tương đương. Đầu ra của nó chạy ở 87 token mỗi giây so với mức trung bình 78 theo đo lường của cùng bảng xếp hạng đó, và nó đã tạo ra khoảng 160 triệu token đầu ra trên toàn bộ bộ tác vụ của chỉ số, trong khi mô hình trung vị phát ra khoảng 82 triệu — gần gấp đôi lượng văn bản trên mỗi đơn vị công việc, được tính phí ở mức $2.70 mỗi triệu. Các trọng số BF16 đã được hứa cho ngày 15 tháng 10 năm 2026 và vẫn chưa có trong kho lưu trữ, vì vậy hiện tại, mô hình chỉ tồn tại với bạn dưới dạng API.
Muse Glimmer là đối tượng ngược lại. Nó là một mô hình 30 tỷ tham số được huấn luyện bằng chưng cất logit từ giáo viên Muse Spark lớn hơn của Meta, sau đó được tinh chỉnh trên dữ liệu agentic ngữ cảnh dài và được tăng cường cho việc sử dụng công cụ. Meta phát hành nó ở dạng lượng tử hóa 4-bit, giúp đưa bộ nhớ từ hơn 55 GB ở độ chính xác đầy đủ xuống dưới 20 GB — nằm trong giới hạn VRAM 24 GB hoặc 32 GB — và nó đã được Meta thử nghiệm trên Nvidia RTX 5090 cũng như trên chip Apple M4 Max và M5 Max. Nó nhận đầu vào văn bản và hình ảnh bằng hơn một trăm ngôn ngữ, hỗ trợ ngữ cảnh 131.072 token có thể mở rộng lên 262.144, và được xây dựng để nhận một mục tiêu, chia nó thành các bước, gọi công cụ và thử lại một lệnh gọi thất bại thay vì dừng lại. Nó là Apache 2.0, và nó chạy ngoại tuyến.
• Điểm số độc lập — Step 5 Preview: 44 so với mức trung vị là 26 trong cùng phân khúc, so với Muse Glimmer: 17 trên cùng chỉ số ở cấu hình cao của nó.
• Quy mô — Bản xem trước Step 5: khoảng 600B tổng, 27B hoạt động mỗi StepFun so với Muse Glimmer: 30B tổng, lượng tử hóa xuống 4-bit dưới 20 GB.
• Cửa sổ ngữ cảnh — Step 5 Preview: 1 triệu token so với Muse Glimmer: 131.072, có thể mở rộng lên 262.144, theo Meta.
• Giá — Bản xem trước Step 5: 1,00 USD vào / 2,70 USD ra mỗi triệu token, được công bố so với Muse Glimmer: không tính phí theo token; bạn tự cung cấp GPU.
• Nơi nó chạy — Xem trước Bước 5: máy chủ của nhà cung cấp, qua HTTP so với Muse Glimmer: phần cứng của riêng bạn, ngoại tuyến.
• Giấy phép — Step 5 Preview: bản xem trước đóng, trọng số được hứa cung cấp vào ngày 15 tháng 10 năm 2026 so với Muse Glimmer: Apache 2.0, có thể tải xuống ngay.
• Truy xuất ngữ cảnh dài — Muse Glimmer đạt 80.0 điểm trong bài đánh giá suy luận ngữ cảnh dài của index board, chỉ kém nửa điểm so với các mô hình có mức giá cao gấp nhiều lần và đủ gần với kết quả của Step 5 Preview đến mức khác biệt đó không mang tính quyết định đối với công việc tìm dữ kiện.
Hai mươi bảy điểm, và những gì chúng không đo lường
Một mô hình 30B được chưng cất để chạy trong 20 GB bộ nhớ sẽ thua một mô hình chủ lực 600B trên một chỉ số trí tuệ tổng quát, và tài liệu của chính Meta cũng không tuyên bố điều nào khác — một trong những cách diễn đạt của họ thẳng thắn rằng Glimmer không được thiết kế để sánh ngang với sức mạnh suy luận thô của các mô hình đám mây quy mô đầy đủ. Vậy nên điểm số 17 không phải là một phán xét về mặt kỹ thuật; đó là kết quả được mong đợi của việc cân nhắc một mục tiêu khác. Câu hỏi đúng là khoảng cách đó thực sự bao phủ những tác vụ nào của bạn.
Đọc ngữ cảnh dài là nơi hai mô hình tiến sát nhau nhất và cũng là nơi trực giác không còn đứng vững. Muse Glimmer đạt 80,0 trong bài đánh giá suy luận ngữ cảnh dài của bảng xếp hạng — một điểm số sẽ chẳng có gì đáng chú ý với một mô hình tiên phong và lại đáng chú ý với một mô hình chạy trên GPU tiêu dùng. Nếu khối lượng công việc của bạn là truy xuất, tóm tắt hoặc trích xuất trên các tài liệu dài, một mô hình cục bộ ở mức đó không hẳn là công cụ sai, và việc yêu cầu không bao giờ rời khỏi máy của bạn là một tính năng mà bạn không thể mua từ API với bất kỳ mức giá nào.
Rồi còn có phần so sánh mà các con số của Meta không hề thể hiện. Một nghiên cứu đã qua bình duyệt về điều phối đa tác nhân đã thử nghiệm Muse-Glimmer-30B trong một thiết lập có kiểm soát — cùng nhiệm vụ, cùng harness, cùng các chuyên gia tư vấn — và phát hiện rằng nó không khôi phục được ứng viên nào trong số những ứng viên do các mô hình biên lớn hơn tạo ra, thất bại cả ba lần thử ở mỗi thiết lập. Đó chỉ là một nghiên cứu duy nhất về một cấu hình, và đó là kiểu bằng chứng mà một trang mô hình không bao giờ đưa ra. Đối với các pipeline tác nhân, nơi một bộ điều phối yếu hơn phải khôi phục sau thất bại của một mô hình mạnh hơn, đây là kết quả liên quan nhất đến quyết định trong bài viết này, và đáng để đọc trước bất kỳ benchmark nào do nhà cung cấp Meta báo cáo.
Những benchmark đó, cho đầy đủ, là của chính Meta và chưa được tái lập: 76,0% trên SWE-Bench Verified, 51,2% trên SWE-Bench Pro, 51,7% trên TerminalBench 2.1, 65,9% trên OSWorld-Verified, 83,5% trên GPQA Diamond, 22% trên Humanity's Last Exam và 75,5 trên MCP-Atlas. Chúng được đo so với các mô hình trong cùng phân khúc kích thước của nó, và chúng mô tả một tác nhân cục bộ có năng lực chứ không phải một bộ suy luận tiên tiến.

Ranh giới thực sự nằm ở đâu
Lợi thế cấu trúc của Step 5 Preview nằm ở chỗ nó làm được những việc mà bạn không thể làm cục bộ. Ngữ cảnh 1M token, đầu vào hình ảnh, một điểm số đo được ở mức tiệm cận hàng đầu và 87 token đầu ra mỗi giây mà không cần mua phần cứng: đối với việc phác thảo, lập kế hoạch, đánh giá mã trên một kho lưu trữ lớn, hay bất cứ việc gì mà giới hạn trần của mô hình chính là nút thắt, API thắng và hai mươi bảy điểm chính là toàn bộ lý lẽ. Cái giá của điều đó thì ngược lại với Muse Glimmer: các prompt rời khỏi ranh giới của bạn, mức giá được áp lại trên từng token, và tính dài dòng của mô hình khiến các tác vụ có đầu ra dài trở nên đắt đỏ hơn mức mà mức giá $2.70 gợi ý.

Lợi thế của Muse Glimmer là nó làm công việc không thể rời đi. Nếu dữ liệu được quản lý, nếu ngân sách độ trễ chỉ vài mili giây, nếu máy móc ngoại tuyến, hoặc nếu chi phí biên của yêu cầu thứ một triệu phải bằng không, thì không có API nào là ứng viên — không phải cái này, không phải bất kỳ cái nào. Cái giá phải trả là năng lực: bạn đang chọn một 17 trong khi có một 44 tồn tại, và trong điều phối tác nhân, bạn có thể đang chọn một điều phối viên không thể khắc phục sai lầm của một mô hình mạnh hơn.
Với hầu hết các nhóm, câu trả lời không phải là một lựa chọn mà là sự chia tách, và sự chia tách đó cần một nơi để tồn tại. OrcaRouter định tuyến hơn 200 mô hình đằng sau một khóa API và một hóa đơn với mức markup 0% cùng giá niêm yết của nhà cung cấp được chuyển nguyên, cùng với chuyển đổi dự phòng tự động và một DSL định tuyến để gửi lưu lượng theo tác vụ, chi phí hoặc độ trễ. Cả Step 5 Preview lẫn Muse Glimmer đều không có trong danh mục đó — mô hình chủ lực của StepFun không được chúng tôi định tuyến và Glimmer là bản tải xuống cục bộ — nên giá trị được đưa ra không phải là quyền truy cập vào một trong hai mô hình. Đó là bộ mô hình mà bạn sẽ dùng làm chuẩn để đánh giá chúng, có thể gọi bằng một khóa ngay hôm nay, để quyết định giữa cục bộ và từ xa được định đoạt bởi phân bố tác vụ của chính bạn thay vì bởi trang của nhà cung cấp nào mà bạn đọc sau cùng.

Cách quyết định
Chọn Step 5 Preview khi mức trần là ràng buộc. Nếu các tác vụ của bạn là mở, đa phương thức, ngữ cảnh dài hoặc mang tính tác tử theo nghĩa cần một bộ lập kế hoạch đủ năng lực, thì mô hình API là mô hình duy nhất trong hai mô hình có thể làm được chúng, và giá của nó đủ thấp so với phân khúc của nó đến mức việc thí điểm nó là một khoản mục ngân sách chứ không phải một dự án. Hãy dự trù ngân sách cho độ dài dòng, chuẩn bị cho khả năng mốc trọng số ngày 15 tháng 10 bị trượt, và giữ những khối lượng công việc không được rời khỏi nội bộ ra khỏi phạm vi đó.
Hãy chọn Muse Glimmer khi vành đai mạng là ràng buộc. Nếu dữ liệu của bạn không thể được gửi đi, nếu bạn cần chạy trên máy bay hoặc trong nhà máy, hoặc nếu khối lượng của bạn khiến giá theo token trở nên vô lý, thì một mô hình 30B Apache-2.0 vừa trong 20 GB là lựa chọn thực tế, và kết quả truy xuất ngữ cảnh dài của nó đủ tốt để khoảng cách năng lực sẽ không thể hiện trong mọi khối lượng công việc. Hãy kiểm thử nó trong điều phối trước khi bạn tin tưởng nó ở đó, vì đó là nơi bằng chứng độc lập yếu nhất.
Nếu cả hai ràng buộc cùng lúc phát huy tác dụng, hãy chạy cả hai: cục bộ cho dữ liệu không thể di chuyển, API cho những tác vụ cần mô hình lớn hơn, và hãy để quyết định định tuyến là một thay đổi cấu hình thay vì phải di dời. Phép so sánh đáng lưu tâm không phải là 44 so với 17. Mà là yêu cầu nào của bạn có thể chấp nhận rời khỏi máy, và đó là câu hỏi mà chỉ lưu lượng của chính bạn mới trả lời được.
