
GPT-6 so với GLM 5.3: Một trong hai cái này bạn có thể tải xuống, và khoảng cách về giá nhỏ hơn khoảng cách về chỉ số
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Lý do để đặt GPT-6 đối đầu với GLM 5.3 không phải là bảng điểm chuẩn. Đó là vì GLM 5.3 là mô hình duy nhất trong phân khúc giá này mà bạn có thể mang trọng số về nhà, còn GPT-6 là một thế hệ đóng với ba thành viên chỉ có thể truy cập qua API. Sự khác biệt đó quyết định nhiều câu hỏi mua sắm hơn bất kỳ mức chênh lệch chỉ số nào, và đó cũng là lý do hai điểm số không thể so sánh trực tiếp — đây là phần mà hầu hết các so sánh đã công bố về cặp đôi này làm sai.
Chính xác là hai mặt.
GLM 5.3 là mô hình chủ lực của Z.ai, ra mắt ngày 18 tháng 8 năm 2026, với trọng số được công bố khoảng một tuần sau đó. Đây là mô hình chỉ văn bản — không có đầu vào hình ảnh — với cửa sổ ngữ cảnh 1.000.000 token và giới hạn đầu ra 128.000 token, được Z.ai niêm yết ở mức 1,40 USD cho mỗi triệu token đầu vào và 4,40 USD cho mỗi triệu token đầu ra, với mức giá đầu vào được lưu đệm là 0,234 USD mỗi triệu. Mô hình được cung cấp dưới id mô hình z-ai/glm-5.3.
GPT-6 là một thế hệ chứ không phải một mô hình. GPT-6 Astra, GPT-6 Sol và GPT-6 Luna là ba id ở ba mức giá, tất cả đều ra mắt ngày 22 tháng 9 năm 2026, tất cả đều đa phương thức ở phía đầu vào (văn bản, hình ảnh và tệp), tất cả đều có cửa sổ ngữ cảnh gần 1.050.000 token và giới hạn đầu ra 128.000 token. Không có openai/gpt-6 endpoint. Khi ai đó nói "GPT-6" trong một cuộc trò chuyện về giá, họ hầu như luôn muốn nói đến GPT-6 Sol, hạng trung với $2.00 / $10.00 — vì vậy đó là thành viên mà so sánh này sử dụng mỗi khi cần một id duy nhất.
• Trọng số — GLM 5.3 mở, có thể tải xuống và tự lưu trữ; GPT-6 đóng, chỉ dùng qua API
• Phương thức đầu vào — GLM 5.3 chỉ nhận văn bản; cả ba phiên bản GPT-6 đều nhận văn bản, hình ảnh và tệp
• Giá đầu vào — GLM 5.3 $1.40 mỗi triệu so với GPT-6 Sol $2.00 mỗi triệu
• Giá đầu ra — GLM 5.3 $4.40 mỗi triệu so với GPT-6 Sol $10.00 mỗi triệu
• Đầu vào được lưu đệm — GLM 5.3 $0.234 mỗi triệu so với GPT-6 Sol $0.20 mỗi triệu
• Ngữ cảnh — GLM 5.3 1.000.000 token so với GPT-6 Sol 1.050.000 token
• Bậc xử lý yêu cầu dài — GLM 5.3 không có mục nào như vậy trên bảng công bố; GPT-6 Sol tính lại giá cho toàn bộ yêu cầu khi vượt 272.000 token đầu vào thành $4.00 / $15.00
• Giấy phép — GLM 5.3 được phát hành theo giấy phép mở riêng của Z.ai; GPT-6 không có tệp giấy phép vì không có gì để cấp phép
Lưu ý đến cảnh báo ở dòng giá, vì đây là cảnh báo có thật và blog này từng vấp phải trước đây: một trang model của OrcaRouter không phải lúc nào cũng khớp với bảng giá riêng của nhà cung cấp, và riêng với GLM 5.3, danh mục của chúng tôi ghi $1.26 / $3.96 trong khi mức công bố của Z.ai là $1.40 / $4.40. Khi hai bên không khớp, hãy dẫn số của nhà cung cấp trong phần văn xuôi — như các gạch đầu dòng ở trên đang làm — và coi con số trên trang là giá trị riêng của trang đó. Cả hai đều hợp lệ; chỉ là chúng không phải cùng một con số.
Tại sao việc so sánh chỉ số cần một nhãn cảnh báo
Đây là cái bẫy. Trên Artificial Analysis Intelligence Index, GLM 5.3 đạt 44.8 và GPT-6 Sol đạt 47.6 — cách nhau 2.8 điểm. Điều đó trông như một sự gần hòa giữa một mô hình đóng và một mô hình mở với mức giá đầu ra chỉ bằng khoảng một phần năm, và đó là câu mà hầu hết các so sánh về cặp này dừng lại.
Đó không phải là một phép trừ hợp lệ. Artificial Analysis chỉ xếp hạng các mô hình trọng số mở với các mô hình trọng số mở khác cùng lớp kích thước, và xếp hạng các mô hình độc quyền trong một dải độc quyền bằng cách dùng tỷ lệ giá đầu vào trên đầu ra pha trộn theo tỷ lệ 3:1. Điểm 44,8 của GLM 5.3 là điểm trọng số mở. Điểm 47,6 của GPT-6 Sol là điểm thuộc dải độc quyền. Chúng nằm trên các thang đo khác nhau, và khoảng cách giữa chúng không phải là một phép đo năng lực. Lưu ý tương tự cũng áp dụng cho hai con số trên các mục danh mục OrcaRouter, vốn là nguồn của cả hai con số ở trên.
Điều bạn có thể so sánh xuyên suốt dòng đó là kế toán chi phí và các bảng giá, và thứ yếu là các hàng vốn là cùng một lần đánh giá được chạy theo cùng một cách. Hãy đọc trên cả hai trang:
• AA Coding Index — GLM 5.3 74.8 so với GPT-6 Sol 60.0
• GPQA Diamond — GLM 5.3 91.7
• Humanity's Last Exam — GLM 5.3 42.3 so với GPT-6 Sol 47.9
• Terminal-Bench 2.1 — GLM 5.3 83.9
• Terminal-Bench 4.0 — GLM 5.3 41.9 so với GPT-6 Sol 43.9
• τ-bench ngân hàng — GLM 5.3 50.3
• SciCode — GLM 5.3 59.0 so với GPT-6 Sol 57.6
• Khả năng ghi nhớ ngữ cảnh dài — GLM 5.3 79.7 so với GPT-6 Sol 83.7
Hãy đọc nó như một hình dạng thay vì một khác biệt điểm số: GLM 5.3 mạnh ở các đánh giá agentic và lập trình — τ-bench banking và SciCode đều nghiêng về nó, và Coding Index của nó cao hơn của Sol rất nhiều — trong khi GPT-6 Sol giữ các hạng mục long-context recall và Humanity's Last Exam. Cả hai cách đọc đó đều không phải là một phán quyết. Chúng là hai tập hợp điểm mạnh khác nhau, được một bên thứ ba đo lường, trên một mô hình bạn có thể tải về và một mô hình bạn không thể.
Open weights thực sự đáng giá bao nhiêu ở đây
Lý do để quan tâm đến giấy phép của GLM 5.3 không phải là hệ tư tưởng. Mà là vì ba điều cụ thể không còn là quyết định của nhà cung cấp một khi trọng số thuộc về bạn.
Đầu tiên là vị trí lưu trú dữ liệu. GLM 5.3 tự lưu trữ chạy ở nơi bạn đặt nó, và không có thỏa thuận xử lý dữ liệu nào điều chỉnh những gì rời khỏi mạng của bạn. GPT-6 không có lựa chọn tương đương — cách duy nhất để gọi nó là thông qua API, và dữ liệu đi đến nơi bạn không kiểm soát. Đối với một khối lượng công việc chịu quản lý chặt chẽ, đây thường là toàn bộ quyết định, và đó là một quyết định mà chỉ số này không bao giờ nắm bắt được.
Thứ hai là đường cong giá. Bảng giá API là con số của nhà cung cấp mà nhà cung cấp có thể thay đổi; mức giá GPT-6 đã công bố được nhà cung cấp tuyên bố là vĩnh viễn thay vì mang tính khuyến mãi, nhưng đó là tuyên bố về ý định, không phải một hợp đồng. Trọng số tự sở hữu có một chi phí cố định không còn tăng theo token, và điểm giao nhau là một hàm của khối lượng của bạn chứ không phải quyết định định giá của bất kỳ ai. Đó là lý do bảng giá $1.40 / $4.40 thực sự không phải là phép so sánh — phép so sánh là $1.40 / $4.40 so với phần cứng của chính bạn được phân bổ khấu hao trên lưu lượng của chính bạn.
Điểm thứ ba là kiểu lỗi. Một mô hình được lưu trữ có thể bị ngừng hỗ trợ, bị giới hạn tần suất, hoặc bị suy giảm do một thay đổi trong khâu phục vụ. GLM 5.3 đã có thể gọi được kể từ ngày 18 tháng 8, với một checkpoint công khai đứng sau nó; nếu Z.ai thay đổi điều gì đó mà bạn không đồng ý, checkpoint mà bạn đã dùng để xác thực vẫn còn trên đĩa.
Chi phí của sự tự do đó cũng là thật, và đáng để nói thẳng ra. GLM 5 chỉ thuần văn bản, nên một khối lượng công việc đưa ảnh chụp màn hình hay PDF vào mô hình hoàn toàn không có đường đi ở phía trọng số mở của phép so sánh này. Tự mình xử lý ngữ cảnh 1.000.000 token không phải là bài tập trên laptop. Và mô hình bạn tải về chính là mô hình bạn phải chịu trách nhiệm — đánh giá, lọc an toàn, thời gian hoạt động và nâng cấp đều trở thành việc của bạn, đó là một ngân sách kỹ thuật thực sự mà mức giá API không hề bao gồm.
Nơi GPT-6 xứng đáng với mức giá cao cấp
Ngược lại, lập luận dành cho phía đóng thì hẹp hơn mức mà giá của nó gợi ý, nhưng không phải là không có gì.
Đầu vào đa phương thức là điểm cụ thể. Cả ba hạng của GPT-6 đều chấp nhận hình ảnh và tệp một cách gốc, còn GLM 5.3 không chấp nhận cả hai. Một pipeline đọc biểu đồ, ảnh chụp màn hình hoặc tài liệu quét và suy luận trên đó trong cùng một lệnh gọi thì không thể được xây dựng trên GLM 5.3 như đã công bố.
Khả năng gợi nhớ ngữ cảnh dài là mục thứ hai. GPT-6 Sol dẫn trước GLM 5.3 ở dòng đó bốn điểm, và đây là dòng quyết định liệu một ngữ cảnh rất lớn có thực sự dùng được hay chỉ được chấp nhận. Một cửa sổ 1.000.000 token đánh mất phần giữa của tài liệu vẫn là một cửa sổ lớn hơn một cửa sổ 100.000 token không như vậy.
Và thế hệ này có nhiều hơn một mức giá. Mức $2,00 / $10,00 của Sol là mức thường được đem so với GLM 5.3, nhưng GPT-6 Luna chỉ nằm ở $0,10 / $0,50 — thấp hơn mức giá đầu vào của GLM 5.3 một bậc độ lớn và thấp hơn mức giá đầu ra của nó gần chín lần — còn GPT-6.1 Sol, ra mắt ngày 29 tháng 9, đạt 51,8 điểm trên cùng chỉ số đó với mức giá của Sol. Nếu câu hỏi thuần túy là “token đủ tốt với giá rẻ nhất”, thì thế hệ GPT-6 có câu trả lời mà GLM 5.3 không có.

Chạy chúng cùng nhau, đó là câu trả lời mà hầu hết các đội đều chọn.
Kết luận thực tế của sự so sánh này là nó không mang tính loại trừ. GLM 5.3 đã thu hút một lượng rất lớn — danh mục OrcaRouter ghi nhận khoảng 1,9 tỷ token được định tuyến đến nó trong cửa sổ bảy ngày, so với khoảng 2,1 triệu của GPT-6 Sol — đó là dáng vẻ của một mô hình mở trọng số với mức giá đầu ra rẻ khi các đội ngũ đặt khối lượng công việc lớn lên nó. Lưu lượng của GPT-6 trong cùng cửa sổ tập trung vào các bậc cao hơn, nơi công việc thuộc loại cần đầu vào đa phương thức hoặc mô hình cao cấp.
Cả hai đều là các tuyến đang hoạt động trong cùng một danh mục trên OrcaRouter: một API đứng trước hơn 200 mô hình, được gọi qua một endpoint tương thích OpenAI, với giá niêm yết của nhà cung cấp được chuyển thẳng qua ở mức markup 0%, nên khi nhà cung cấp thay đổi giá thì phía chúng tôi sẽ cập nhật ngay trong cùng ngày thay vì đợi đến kỳ thanh toán tiếp theo của bạn. Điều đó càng quan trọng hơn mức thông thường trong so sánh cụ thể này, bởi vì toàn bộ câu hỏi về giá GLM 5.3 có một phần đang thay đổi — con số trong danh mục và con số của nhà cung cấp vốn đã lệch nhau khoảng 10% — và một tuyến chuyển thẳng qua nghĩa là bạn được tính theo con số của nhà cung cấp thay vì theo một khoản markup che giấu con số đó.
DSL định tuyến chính là thứ khiến sự phân tách trở nên tường minh: gửi phần lớn lưu lượng phân loại và trích xuất chỉ dùng văn bản đến GLM 5.3, còn công việc đa phương thức hoặc truy hồi dài đến một tầng GPT-6, theo từng yêu cầu thay vì theo từng quý, và để cho chuyển đổi dự phòng tự động bao phủ cả hai phía. Câu hỏi trọng số mở so với API không còn là một cam kết kiến trúc kiểu được ăn cả ngã về không nữa, mà trở thành một quy tắc định tuyến mà bạn có thể thay đổi ngay tuần sau.

Phán quyết, vốn là một câu hỏi về các ràng buộc của bạn.
Nếu bạn có thể tự host, cần thông lượng chỉ văn bản ở quy mô lớn, hoặc có yêu cầu về nơi lưu trú dữ liệu mà một API không thể đáp ứng, thì GLM 5.3 là câu trả lời và mức chênh lệch giá đủ lớn để tài trợ cho công việc phục vụ. Nếu bạn cần đầu vào hình ảnh và tệp, nếu khả năng nhớ ngữ cảnh dài là yếu tố then chốt, hoặc nếu bạn không muốn tự vận hành một mô hình, thì GPT-6 là câu trả lời và khoản phí cao hơn mua được một thứ cụ thể chứ không phải một thương hiệu.
Điều mà cả hai câu trả lời đều không phải là: "GPT-6 đạt điểm cao hơn 2,8 điểm". Không thể thực hiện phép trừ đó, bởi vì hai con số đến từ các nhóm ngang hàng khác nhau trên cùng một bảng — và một phép so sánh dựa trên đó sẽ là trích dẫn một con số như thể nó đo lường một thứ mà nó không đo lường. Các bảng giá thì có thể so sánh được. Vị thế giấy phép thì có thể so sánh được, theo nghĩa rằng nó khác biệt rõ rệt. Còn các hàng chỉ số thì không.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
