
Step 5 Preview vs GLM-5.3: Chênh nhau một điểm, và chỉ một trong hai có tệp giấy phép
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Trên bảng xếp hạng độc lập, Step 5 Preview và GLM-5.3 chỉ cách nhau một điểm: 44 so với 45 trên Artificial Analysis Intelligence Index v4.3.2, trong đó GLM-5.3 được chấm điểm với tên GLM-5.3 (max) còn Step 5 Preview hoàn toàn không có nhãn mức nỗ lực nào. Đó là khoảng cách sít sao nhất trong loạt bài này, và cũng là con số ít hữu ích nhất trong phép so sánh. Con số mang tính quyết định là việc GLM-5.3 có trọng số mà bạn có thể tải về ngay hôm nay — do Z.ai công bố theo một giấy phép tùy chỉnh, không phải MIT — trong khi Step 5 Preview, được StepFun công bố vào ngày 20 tháng 9 năm 2026, chỉ có một kho lưu trữ trên Hugging Face chứa duy nhất một .gitattributes cùng ngày phát hành được nêu rõ là 15 tháng 10 cho checkpoint BF16. Tài liệu ra mắt của StepFun mô tả mô hình này là một kết quả mã nguồn mở nằm trong top ba. Nó vẫn chưa phải mã nguồn mở. GLM-5.3 thì đúng là như vậy, và giấy phép của nó chính là thứ cần đọc trước khi bạn lên kế hoạch dựa vào nó.
Một điểm chỉ số thực sự mua được gì
Cả hai mô hình đều được cùng một phòng thí nghiệm chạy qua cùng mười đánh giá, điều này khiến cho việc so sánh trở nên rõ ràng một cách bất thường, đồng thời cũng không hữu ích một cách bất thường.
• Chỉ số Trí tuệ — Step 5 Preview 44 so với GLM-5.3 45
• Vị trí của nó — GLM-5.3 cao hơn Step 5 Preview một điểm; Step 5 Preview ngang bằng với Kimi K3
• Tham số — Step 5 Preview 600B tổng / 27B hoạt động so với GLM-5.3 753B tổng / 40B hoạt động
• Tốc độ đầu ra — Step 5 Preview 99,8 token/giây so với GLM-5.3 72,1 token/giây
• Thời gian đến token đầu tiên — Step 5 Preview 2,96s so với GLM-5.3 2,99s
• Giá mỗi 1 triệu token — Step 5 Preview $1.00 đầu vào / $2.70 đầu ra so với GLM-5.3 $1.40 đầu vào / $4.40 đầu ra
• Giảm giá bộ nhớ đệm — Step 5 Preview 95% so với GLM-5.3 81%
• Chi phí cho mỗi tác vụ Intelligence Index — Step 5 Preview 0,71 USD so với GLM-5.3 2,01 USD
• Ngữ cảnh — cả hai đều 1M token; danh mục của chúng tôi liệt kê GLM-5.3 với giới hạn đầu ra 131,1K, StepFun chưa công bố con số này
• Trọng số — Step 5 Preview đã đóng, checkpoint BF16 dự kiến vào ngày 15 tháng 10; GLM-5.3 được phát hành theo giấy phép Z.ai tùy chỉnh
Đọc các hàng đó cùng nhau và khoảng cách một điểm không còn là điểm đáng chú ý nhất nữa. Step 5 Preview rẻ hơn 29% ở đầu vào, rẻ hơn 39% ở đầu ra, sinh token nhanh hơn 38%, và có mức chiết khấu bộ nhớ đệm sâu hơn 14 điểm — còn chỉ số chi phí trên mỗi tác vụ lập chỉ mục, vốn gộp độ dài diễn đạt và hành vi bộ nhớ đệm vào một con số duy nhất, thì thấp hơn 2,8 lần. Nó làm được điều đó với tổng 600B so với 753B của GLM-5.3, với 27B hoạt động so với 40B. Trên trục hiệu quả, đây không phải là một cuộc so tài sát nút; về năng lực, nó sát nút đến mức bảng xếp hạng có thể có.
Hàng duy nhất mà Step 5 Preview không thắng lại chính là hàng khó khắc phục nhất: GLM-5.3 có tệp giấy phép còn Step 5 Preview thì không.
Giấy phép là toàn bộ sự khác biệt, và nó không phải là MIT
Thật dễ để mặc định rằng mô hình chủ lực mở của một phòng thí nghiệm Trung Quốc được phát hành theo giấy phép MIT, bởi vì một số nơi làm như vậy. Cả GLM-5.2 và GLM-5.3-Flash của chính Z.ai đều mang giấy phép MIT. Mô hình chủ lực GLM-5.3 thì không — nó được phát hành theo giấy phép tùy chỉnh "glm-5.3", vốn cho phép sử dụng thương mại nhưng phải tuân theo một loạt hạn chế. Đó là một văn bản khác biệt về bản chất so với các điều khoản MIT mà mô hình đàn em nhỏ hơn của nó mang theo, và đối với một công ty mà đội ngũ pháp lý đọc giấy phép trước cả README, đó là một cuộc trao đổi chứ không phải một thủ tục hình thức.
Step 5 Preview hiện vẫn chưa có giấy phép nào, đó là một vấn đề khác và không hẳn là vấn đề nhỏ hơn. Một giấy phép hạn chế cho bạn biết bạn được phép làm gì và để bạn tự quyết định xem các điều khoản có chấp nhận được hay không. Không có giấy phép thì chẳng cho bạn biết gì cả: không có sự cho phép dùng cho mục đích thương mại, không có quyền phân phối lại, không có sự cho phép tinh chỉnh, và không có cách nào để đánh giá liệu checkpoint ngày 15 tháng 10 có dùng được cho sản phẩm của bạn hay không cho tới khi nó xuất hiện. Tên kho lưu trữ mà StepFun đã giữ chỗ — stepfun-ai/Step-5-Preview-BF16 — chỉ ra định dạng bfloat16, tức là thứ bạn dùng để tinh chỉnh và lượng tử hoá chứ không phải thứ bạn đem ra phục vụ. Điều đó cho bạn biết hình hài của bản phát hành. Nó không cho bạn biết các điều khoản của bản phát hành.
Vậy nên, so sánh trung thực là giữa một giấy phép mà bạn có thể đọc và không đồng ý, và một giấy phép không tồn tại. Đối với một nhóm cần tinh chỉnh, tự lưu trữ trong môi trường được kiểm soát, hoặc phát hành một sản phẩm phái sinh, GLM-5.3 là cái duy nhất trong hai cái này có câu trả lời, và câu trả lời là một cuộc rà soát pháp lý chứ không phải là đèn xanh.
Khoảng cách hiệu quả là phần vẫn đứng vững
Những tuyên bố về hiệu quả đáng bị hoài nghi hơn so với những tuyên bố về điểm chuẩn, bởi vì chúng dễ đưa ra hơn và khó kiểm chứng hơn. Hai điều này trụ vững tốt hơn hầu hết, và cơ chế có thể thấy được trong kiến trúc.
Các mô hình mixture-of-experts thưa chỉ dành tính toán cho các chuyên gia mà một token định tuyến đến, vì vậy con số được kích hoạt chi phối hành vi sản xuất trong khi tổng số chủ yếu là vấn đề bộ nhớ. Với 27B được kích hoạt so với 40B của GLM-5.3, Step 5 Preview đang thực hiện ít hơn khoảng một phần ba công việc trên mỗi token, và các phép đo đi kèm: 99,8 token đầu ra mỗi giây so với 72,1, và chi phí cho mỗi tác vụ lập chỉ mục là $0,71 so với $2,01. Đó là cùng một câu chuyện được kể theo ba cách, và đó là điều khiến nó đáng tin cậy thay vì chỉ là một con số tô hồng duy nhất.
Chiết khấu bộ nhớ đệm là dòng quan trọng nhất đối với khối lượng công việc mà cả hai mô hình được bán để phục vụ. Một vòng lặp agent gửi lại cùng một system prompt và ngữ cảnh kho lưu trữ ở mỗi lượt gần như nằm hoàn toàn bên trong mức chiết khấu đó, nên 95% so với 81% sẽ tích lũy qua một phiên dài theo cách mà giá niêm yết không thể làm được. Với tỷ lệ pha trộn 7:2:1 giữa cache-hit / input / output, mức giá pha trộn của Step 5 Preview rơi vào khoảng 0,51 USD mỗi triệu token, so với mức pha trộn cao hơn đáng kể của GLM-5.3 — và khoảng cách càng nới rộng khi vòng lặp chạy càng lâu.
Điều chưa thể kiểm chứng là liệu hiệu quả đó có trụ vững ở quy mô lớn hay không. API của Step 5 Preview đã mở ngay trong ngày ra mắt, trên một endpoint duy nhất. GLM-5.3 đã gánh lưu lượng production từ giữa tháng Tám qua nhiều bên gọi độc lập, và một mô hình đã có năm tuần chịu tải thực tế đằng sau sẽ có những dạng lỗi được một lượng người dùng đủ lớn biết đến đến mức chúng lộ ra công khai. Một endpoint mới vài ngày thì không có bất kỳ điều nào như vậy. Các con số hiệu quả là cách đọc thuận lợi hơn; thành tích vận hành mới là thứ hữu ích hơn.

Những gì bạn có thể dựa vào ở mỗi bên hôm nay
Đây là một điểm duy nhất trong so sánh mà hai bên không đối xứng, và cần phải nói chính xác về điều đó thay vì quy tròn thành "cả hai đều khả dụng".
GLM-5.3 đã có mặt trên OrcaRouter tại trang mô hìnhz-ai/glm-5.3 với giá $1.26 cho đầu vào và $3.96 cho đầu ra, so với mức $1.40 và $4.40 mà Z.ai niêm yết ngay trên trang mô hình đó — được chuyển tiếp nguyên vẹn, không cộng thêm chút nào, nên con số bạn thấy chính là mức giá hiện hành của nhà cung cấp chứ không phải mức do chúng tôi tự đặt ra. Trọng số mở nằm trên Hugging Face, nên cùng một mô hình có thể được truy cập theo ba cách: endpoint của chúng tôi, API riêng của Z.ai, hoặc phần cứng của chính bạn.
Step 5 Preview không nằm trong danh mục của chúng tôi và chúng tôi không định tuyến nó. Nó chạy trên API và Studio riêng của StepFun, và đó là nơi duy nhất nó chạy cho đến khi trọng số được công bố. Thứ nằm bên cạnh nó ở phía chúng tôi là tập hợp các mô hình mà nó đang được đo lường so với, đằng sau một khóa duy nhất cho hơn 200 mô hình: GLM-5.3 ở mức giá ưu đãi nêu trên, DeepSeek V4 Pro ở mức $0.66 và $1.98, cùng Claude Opus 5 ở mức $5.00 và $25.00. Đó chính là điều khiến bốn tuần tới trở nên khả thi thay vì bị chặn đứng — bạn có thể đánh giá thử bản preview so với một mô hình production trên cùng một khóa, với tính năng chuyển đổi dự phòng tự động giữa các nhà cung cấp duy trì đường production trong khi đường cong năng lực của bản preview vẫn chưa được biết, và DSL định tuyến kết hợp nhánh production thành một lệnh gọi duy nhất thay vì phải tích hợp thêm lần nữa.

Lựa chọn giữa một vị trí dẫn đầu và một thành tích đã được chứng minh
Nếu bạn đang tinh chỉnh, tự vận hành hoặc xây dựng một sản phẩm phái sinh, GLM-5.3 là câu trả lời và không có gì sánh bằng — không phải vì nó đạt điểm cao hơn một điểm, mà vì nó là cái duy nhất trong hai cái có giấy phép để đọc và có checkpoint để tải về. Hãy dự trù cho việc rà soát pháp lý, vì các điều khoản tùy chỉnh không phải là MIT và sự khác biệt ấy là loại xuất hiện trong một cuộc kiểm toán mua sắm chứ không phải trong một bài đánh giá chuẩn.
Nếu bạn đang gọi một mô hình qua API và khối lượng công việc của bạn là văn bản agentic ở quy mô lớn, Step 5 Preview vượt trội ở mọi thứ mà hóa đơn và đồng hồ quan tâm: rẻ hơn trên mỗi token, rẻ hơn trên mỗi tác vụ, tạo nhanh hơn và chiết khấu cache sâu hơn cho mẫu tiền tố lặp lại vốn lấp đầy một vòng lặp agent. So với một endpoint đơn nguồn mới vài ngày tuổi, không công bố giới hạn đầu ra và không có giấy phép, lý lẽ để đặt nó làm mặc định của bạn là lý lẽ về một benchmark, chứ không phải về một hợp đồng.
Điều sẽ thay đổi câu trả lời là checkpoint ngày 15 tháng 10. Một giấy phép cấp phép rộng rãi sẽ biến lợi thế về hiệu quả thành thứ bạn có thể sở hữu thay vì thuê, và khi đó, việc kém hơn một điểm không còn quan trọng nữa — một mô hình rẻ hơn 2,8 lần cho mỗi tác vụ chỉ mục và nhanh hơn 38% khi sinh không cần phải thắng ở chỉ số tổng hợp. Một giấy phép hạn chế để GLM-5.3 là mô hình duy nhất trong cặp mà bạn có thể xây dựng sản phẩm dựa trên nó, và khoảng cách một điểm trở thành chuyện vặt về hai mô hình mà dù sao bạn cũng sẽ dùng theo cách khác nhau.
Thông số duy nhất đáng để ý chính là giới hạn đầu ra. Cả hai nhà cung cấp đều quảng cáo ngữ cảnh 1 triệu token. Danh mục của chúng tôi liệt kê GLM-5.3 với đầu ra tối đa 131,1K; thông báo của StepFun nêu ngữ cảnh 1 triệu và không có giới hạn đầu ra, còn một cấu hình bên thứ ba riêng biệt được lan truyền trong vụ rò rỉ lại liệt kê ngữ cảnh 350.000 với đầu ra tối đa 64.000. Đối với một cặp mô hình được bán dựa trên khả năng làm việc tác tử theo chân trời dài, con số đó quyết định những gì bạn thực sự có thể xây dựng, và hiện tại chỉ có một bên đã trả lời được điều đó.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
