
Qwen 4 Max vs GLM-5.3: trọng số mở, giấy phép tùy chỉnh và hạng thực sự được phát hành
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max đã được giới thiệu trước tại hội nghị Yunqi ở Hàng Châu vào ngày 22 tháng 9 năm 2026 với tư cách là mẫu chủ lực của một dòng gồm bốn mô hình, cũng bao gồm Qwen 4 Flash, Qwen 4 Plus và một phiên bản Qwen 4 27B trọng số mở. GLM-5.3 của Z.ai đã được niêm yết từ ngày 18 tháng 8 năm 2026, chỉ hỗ trợ văn bản, với cửa sổ ngữ cảnh 1 triệu token và giới hạn đầu ra 128.000 token, ở mức 1,26 USD mỗi triệu token đầu vào và 3,96 USD mỗi triệu token đầu ra trên danh mục của chúng tôi, so với mức giá niêm yết 1,40 USD và 4,40 USD mà Z.ai công bố. Cả hai phòng thí nghiệm đều xuất phát từ truyền thống trọng số mở và hiện đều bán các mô hình tầm cỡ tiên phong qua API do mình vận hành, nên cách diễn giải thông thường kiểu đóng so với mở không áp dụng ở đây. Trục thực sự áp dụng là trục mà không ai đưa vào bảng so sánh: giấy phép thực sự cho phép điều gì, và phiên bản nào trong mỗi dòng sản phẩm là phiên bản bạn được phép làm bất cứ điều gì thú vị.
Hai phòng thí nghiệm, hai câu trả lời cho cùng một câu hỏi
Alibaba và Z.ai là hai đơn vị phát hành trọng số mở nhất quán nhất trong số các phòng thí nghiệm cận tiên phong, và họ đã có những lập trường khác nhau về việc mức độ cởi mở đó còn giữ được đến phân khúc chủ lực là bao nhiêu.
Thế hệ Qwen 3.8 của Alibaba đã công bố trọng số cho mô hình lớn nhất của mình — Qwen3.8-2.4T-A95B, ở định dạng BF16 và FP8 — vào ngày 12 tháng 8 năm 2026. Hãng đã công bố chúng theo một giấy phép Qwen tùy chỉnh, không phải Apache 2.0. Sự khác biệt đó chính là điểm mấu chốt: các trọng số tồn tại, nghĩa là việc tinh chỉnh, lượng tử hóa và tự vận hành là khả thi theo cách mà chúng sẽ không bao giờ có thể đối với một mô hình đóng, nhưng các điều khoản là của riêng Alibaba và chúng không phải là mặc định cấp phép rộng rãi mà cụm từ "trọng số mở" thường ngụ ý.
Dòng GLM của Z.ai đến từ một phòng thí nghiệm có truyền thống trọng số mở, và mẫu chủ lực không còn là ngoại lệ đối với điều đó. Trọng số của chính GLM-5.3 đã được công bố vào ngày 28 tháng 8 năm 2026 — mẫu chủ lực 743 tỷ tham số, trong 141 phân mảnh safetensors — theo một giấy phép tùy chỉnh do Z.ai viết riêng cho nó thay vì theo MIT. Các điều khoản gần như là một cấp phép kiểu MIT kèm theo một điều kiện rà soát bảo mật dành cho các doanh nghiệp cung cấp mô hình dưới dạng dịch vụ có doanh thu vượt một ngưỡng lớn. Hãy lưu ý điều đó có ý nghĩa gì đối với dòng sản phẩm này: GLM-5.2 và GLM-5.3-Flash mang giấy phép MIT, còn mẫu chủ lực thì không.
Như đã liệt kê, GLM-5.3 là một mô hình chỉ xử lý văn bản với cửa sổ ngữ cảnh được công bố, giới hạn đầu ra được công bố cùng khả năng sử dụng công cụ, chế độ JSON và suy luận đã được ghi nhận.
Đặt hai thứ cạnh nhau và sự tương phản thực tế là thế này:
• Trọng số chủ lực — Qwen 3.8 chủ lực được phát hành theo giấy phép Qwen tùy chỉnh so với trọng số GLM-5.3 được phát hành ngày 28 tháng 8 năm 2026 theo giấy phép Z.ai tùy chỉnh
• Giá đầu vào — Qwen3.8-Max 2,00 USD mỗi 1 triệu token so với GLM-5.3 1,26 USD mỗi 1 triệu token trong danh mục của chúng tôi, 1,40 USD trên bảng giá của chính Z.ai
• Giá đầu ra — Qwen3.8-Max 6,00 USD cho mỗi 1 triệu token so với GLM-5.3 3,96 USD cho mỗi 1 triệu token trong danh mục của chúng tôi, 4,40 USD trên bảng giá của chính Z.ai
• Ngữ cảnh — Qwen3.8-Max 1M token so với GLM-5.3 1M token
• Giới hạn đầu ra — Qwen3.8-Max 128K token so với GLM-5.3 128K token
• Dạng đầu vào — Qwen3.8-Max nhận văn bản, hình ảnh và video, so với GLM-5.3 chỉ nhận văn bản, được ghi nhận như vậy
• Thẻ năng lực — Qwen3.8-Max thị giác, công cụ, JSON và suy luận so với GLM-5.3 công cụ, JSON và suy luận
• Qwen 4 Max — công bố ngày 22 tháng 9 năm 2026, không có giá, không có ngữ cảnh, không có trọng số, không có ngày, trong khi GLM-5.3 đã phát hành và đang phục vụ lưu lượng
Dòng đa phương thức chính là thứ trả giá cho khoảng cách giá. Mô hình chủ lực của Qwen nhận đầu vào hình ảnh và video và tính phí $2,00 cho đầu vào và $6,00 cho đầu ra; GLM-5.3 nhận văn bản và tính phí $1,26 và $3,96. Nếu khối lượng công việc của bạn là văn bản, bạn đang phải trả khoản phụ trội cho bộ mã hóa thị giác mà bạn không bao giờ dùng đến, và đó là lý do cụ thể nhất khiến một mô hình chuyên biệt chỉ văn bản đánh bại một mô hình chủ lực đa phương thức về chi phí cho công việc văn bản.

Phân khúc 27B chính là thứ quyết định điều này
Qwen 4 Max là tâm điểm, còn phân khúc 27B mới là câu chuyện đáng chú ý. Mỗi thế hệ Qwen đều phát hành phân khúc nhỏ mở của mình theo các điều khoản cho phép mọi người làm những việc họ muốn, và bằng chứng từ hạ nguồn là không thể chối cãi: trong vòng vài ngày sau khi trọng số Qwen 3.8 27B ra mắt, hệ sinh thái đã tạo ra các bản chuyển đổi MLX, các bản lượng tử hóa NVFP4 và các bản fine-tune không kiểm duyệt, không bản nào trong số đó cần sự cho phép của bất kỳ ai. Đó là những gì một bản phát hành mô hình nhỏ với giấy phép dễ dãi mang lại, và đó là một hình thức phân phối mà không API được host nào có thể sánh bằng.
Hạng flagship lại là một câu chuyện khác. Một mô hình 2,4 nghìn tỷ tham số được phát hành theo giấy phép tùy chỉnh thì mở theo nghĩa các byte có thể tải xuống được, và đóng theo nghĩa những gì bạn được phép làm với chúng do nhà phát hành quy định. Cả hai điều đều đúng cùng một lúc, và thông báo về Qwen 4 không thay đổi điều nào trong hai điều đó. Nếu hạng 27B của Qwen 4 đi theo mô hình của các phiên bản tiền nhiệm, thì đây sẽ là bản phát hành có ý nghĩa với số lượng người lớn nhất, và cũng là bản phát hành có ngày ra mắt dễ dự đoán nhất, vì các hạng mở nhỏ là thứ dễ hoàn thành nhất trên lộ trình.
Điều đó đưa sự so sánh trở lại với một thứ có thể dùng được. GLM-5.3 là một mô hình được host với mức giá được công bố cùng bộ năng lực đã được tài liệu hóa, và hiện đã có sẵn. Qwen 4 Max chỉ là tên một hạng. Nếu bạn muốn lập luận về tính mở trở nên cụ thể thay vì mang tính triết lý, mô hình đáng để chờ là bản 27B, không phải bản Max.
Lớp định tuyến là nơi vấn đề giấy phép không còn quan trọng nữa
Có một phiên bản của quyết định này tránh hoàn toàn câu hỏi về giấy phép, và cần phải thành thật rằng đó là một lựa chọn thực sự chứ không phải một giải pháp thỏa hiệp. Nếu yêu cầu của bạn là gọi một mô hình chứ không phải sở hữu nó, thì giấy phép trên các trọng số là không liên quan và các điều khoản quan trọng là giá, độ trễ và hành vi khi lỗi.
OrcaRouter cung cấp GLM-5.3 với tên z-ai/glm-5.3 ở mức 1,26 đô-la cho đầu vào và 3,96 đô-la cho đầu ra trên mỗi triệu token — thấp hơn mức 1,40 đô-la và 4,40 đô-la mà Z.ai công bố, với trang mô hình hiển thị các mức giá niêm yết đó bên cạnh mức giá chúng tôi tính, và không cộng thêm phụ phí nào lên trên khoản chúng tôi trả cho nhà cung cấp. Cùng endpoint tương thích OpenAI đó cũng cung cấp dòng Qwen 3.8, Qwen3.8-Max, Qwen3.8-Flash và Qwen3.8-27B, cùng với gần 200 mô hình khác, với khả năng tự động chuyển đổi dự phòng khi một đường dẫn nhà cung cấp suy giảm và một DSL định tuyến cho phép bạn diễn đạt chính sách thay thế một cách tường minh thay vì sửa chuỗi mô hình trong mã ứng dụng. Khi một nhà cung cấp thay đổi mức giá, thay đổi đó sẽ áp dụng cho khóa của bạn ngay trong cùng ngày, vì không có tầng biên lợi nhuận nào để nó bị kẹt phía sau.
Điều mà OrcaRouter không cung cấp là Qwen 4 Max hay bất kỳ hạng Qwen 4 nào. Danh mục không có mục nào cho dòng này, và đó là trạng thái đúng cho một mô hình đã được công bố trên sân khấu nhưng chưa được phát hành. Qwen 4 Max sẽ có thể truy cập được, khi nó thực sự có thể truy cập, thông qua API của chính nhà cung cấp và một số nền tảng bên thứ ba. Cho đến lúc đó, mô hình Qwen trong so sánh này mà bạn thực sự có thể gọi là Qwen3.8-Max, và nó nằm trong cùng danh mục với GLM-5.3 — điều này khiến phiên bản trực tiếp của cuộc so tài này trở thành một quyết định về chính sách định tuyến thay vì một quyết định mua sắm.

Điều mà câu hỏi về giấy phép thực sự quyết định
GLM-5.3 rẻ hơn trên cả hai phương diện, cửa sổ ngữ cảnh và trần đầu ra của nó ngang bằng với mô hình chủ lực của Qwen, các giới hạn phương thức của nó được ghi lại rõ ràng thay vì để người ta suy đoán, và nó đang phục vụ lưu lượng ngay hôm nay. Qwen 4 Max có một suất tại hội nghị và một tên phân hạng, và phần duy nhất của lộ trình Qwen 4 có thời điểm cung cấp dự đoán được là hạng 27B.
Quyết định còn trụ lại sau ngày ra mắt không phải là mô hình nào tốt hơn. Mà là liệu bạn có cần sở hữu chính thứ đó hay không. Nếu bạn cần tự vận hành, tinh chỉnh hay sửa đổi, thì trọng số của các mô hình chủ lực từ cả hai phòng lab đều đi kèm những điều khoản mà bạn nên đọc trước khi xây dựng doanh nghiệp dựa trên chúng, và phân khúc mở quy mô nhỏ vốn là nơi các lựa chọn cấp phép thoáng từ trước đến nay vẫn tồn tại. Nếu bạn cần gọi một mô hình, GLM-5.3 là câu trả lời rẻ hơn hiện nay cho công việc văn bản, Qwen3.8-Max là câu trả lời nếu bạn cần đầu vào hình ảnh hoặc video, và cả hai chỉ cách bạn một endpoint cùng một hóa đơn. Hãy xem lại câu hỏi về mô hình chủ lực khi Alibaba công bố model card, và hãy đọc giấy phép trước khi đọc bảng benchmark.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
