
GPT-6.1 Sol vs GLM-5.3: Trọng số đã phát hành, còn hóa đơn thì không nhúc nhích
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
OpenAI đã phát hành GPT-6.1 Sol vào ngày 29 tháng 9 năm 2026 tại bài phát biểu chính DevDay, và Z.ai đã phát hành GLM-5.3 sớm hơn sáu tuần, vào ngày 18 tháng 8 năm 2026, rồi giữ checkpoint lại một tuần. Việc giữ đó đã kết thúc: zai-org/GLM-5.3 đã có trên Hugging Face từ ngày 25 tháng 8, một checkpoint BF16/FP8 với khoảng 753 tỷ tham số, trong đó khoảng 40 tỷ tham số hoạt động trên mỗi token, và kể từ đó nó đã vượt qua 1,4 triệu lượt tải xuống. Vậy câu hỏi mà hầu hết các so sánh đã đặt ra từ tháng 8 — đây là một mô hình mở hay một dạng cho thuê? — đã có câu trả lời, và câu trả lời không làm thay đổi phép tính. Trên bảng xếp hạng độc lập, GPT-6.1 Sol đạt 51,8 điểm và tốn 0,72 đô la cho mỗi tác vụ index hoàn thành; GLM-5.3 đạt 44,8 điểm và tốn 2,01 đô la. Giờ bạn có thể sở hữu mô hình rẻ hơn tính theo token mà vẫn phải trả gần gấp ba lần cho mỗi công việc hoàn thành.
Mỗi mô hình thực sự là gì
GPT-6.1 Sol là mô hình GPT-6 tầm trung của OpenAI, thấp hơn một bậc so với mô hình chủ lực GPT-6 Astra và cao hơn GPT-6 Luna tiết kiệm. Nó có cửa sổ ngữ cảnh 1.050.000 token với giới hạn đầu ra 128.000 token và ngày cắt kiến thức 30 tháng 4 năm 2026, và nó chấp nhận văn bản, hình ảnh và tệp làm đầu vào. Suy luận chạy từ low đến max với mặc định là medium; none và minimal mà GPT-6 Sol từng chấp nhận giờ trả về lỗi, và hướng dẫn di trú của chính OpenAI giải quyết vấn đề này bằng cách yêu cầu nhà phát triển thay thế bằng low. Nó có giá $2.00 cho mỗi triệu token đầu vào và $10.00 cho mỗi triệu token đầu ra, với đầu vào được lưu đệm ở mức $0.10.
GLM-5.3 là mẫu flagship hiện tại của Z.ai cho kỹ thuật phần mềm và các tác vụ agent chạy dài hạn, được xây dựng trên cùng nền tảng mixture-of-experts như GLM-5.2, với những cải thiện đến từ post-training thay vì từ một mô hình lớn hơn. Đây là mô hình text-in, text-out — không có thị giác, ở bất kỳ mức giá nào — với cửa sổ 1M token, giới hạn đầu ra 128.000 token và chế độ suy nghĩ luôn được bật vĩnh viễn. Không có chế độ không suy luận, đây là một ràng buộc cứng đối với một lệnh gọi nhạy cảm với độ trễ. Z.ai niêm yết nó ở mức $1.40 cho đầu vào và $4.40 cho đầu ra mỗi triệu token, với đầu vào được cache ở mức $0.26; danh mục của chúng tôi ghi nhận ở mức $1.26 và $3.96 với giá đọc cache là $0.234, vì vậy bảng giá của nhà cung cấp là con số thận trọng hơn và là con số để lập luận.
Bảng giá, và dòng đảo ngược nó
Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:
• Đầu vào — GPT-6.1 Sol 2,00 USD mỗi 1 triệu so với GLM-5.3 1,40 USD mỗi 1 triệu; GLM rẻ hơn 30%
• Đầu ra — GPT-6.1 Sol 10,00 USD mỗi 1 triệu so với GLM-5.3 4,40 USD mỗi 1 triệu; GLM rẻ hơn 56%
• Đầu vào được lưu đệm — GPT-6.1 Sol 0,10 USD mỗi 1 triệu so với GLM-5.3 0,26 USD mỗi 1 triệu; thứ tự đảo ngược, Sol rẻ hơn 2,6×
• Điều khoản ngữ cảnh dài — GPT-6.1 Sol tính lại giá cho toàn bộ yêu cầu khi vượt 272.000 token đầu vào, ở mức 2× cho đầu vào và bộ đệm cùng 1,5× cho đầu ra, so với GLM-5.3 không có điều khoản tương đương trên bảng giá công bố
• Ngữ cảnh và đầu ra — 1.050.000 vào / 128.000 ra so với 1 triệu vào / 128.000 ra; chênh lệch 5%, không đáng kể
• Dạng thức — nhận văn bản, hình ảnh và tệp, xuất văn bản so với chỉ văn bản
• Mức sàn suy luận — GPT-6.1 Sol thấp, trung bình (mặc định), cao, xcao, tối đa so với GLM-5.3 luôn bật, không có mức sàn nào để hạ xuống
• Trọng số — đóng, chỉ có API so với mở, có thể tải xuống, FP8
• Điểm độc lập, Artificial Analysis v4.3.2 ở mức nỗ lực tối đa — 51,8 so với 44,8
• Chi phí độc lập cho mỗi tác vụ chỉ mục — 0,72 USD so với 2,01 USD
• Token đầu ra cho lần chạy chỉ mục — 67 triệu so với 210 triệu
img src="2.png" alt="Bảng điểm so sánh hai cột được tạo tự động, có tiêu đề 'GPT-6.1 Sol vs GLM-5.3 - bảng điểm'. Cột bên trái 'GPT-6.1 Sol': các hàng ghi 'Chỉ số trí tuệ: 51.8', 'Chi phí mỗi tác vụ chỉ số: $0.72', 'Giá đầu vào: $2.00 mỗi 1M', 'Giá đầu ra: $10.00 mỗi 1M', 'Token đầu ra trong lần chạy chỉ số: 67M', 'Trọng số: đóng'. Cột bên phải 'GLM-5.3': các hàng ghi 'Chỉ số trí tuệ: 44.8', 'Chi phí mỗi tác vụ chỉ số: $2.01', 'Giá đầu vào: $1.40 mỗi 1M', 'Giá đầu ra: $4.40 mỗi 1M', 'Token đầu ra trong lần chạy chỉ số: 210M', 'Trọng số: mở trên Hugging Face'. Phần chân trang ghi 'Các số liệu độc lập theo Artificial Analysis v4.3.2 ở mức nỗ lực tối đa; giá niêm yết của nhà cung cấp.' Logo OrcaRouter nằm ở góc dưới cùng bên phải." /> Cặp cuối cùng đó chính là nơi trận đối đầu này được định đoạt, và đây không phải là một hiệu ứng nhỏ nhặt.

Vấn đề {{1}}210{{/1}}
Artificial Analysis chạy cùng một bộ mười đánh giá đối với mọi mô hình trên bảng và công bố số lượng token đằng sau mỗi điểm số. GLM-5.3 đã tạo ra khoảng 210 triệu token đầu ra khi hoàn thành lượt chạy. GPT-6.1 Sol tạo ra 67 triệu. Khi đối chiếu với nhóm so sánh riêng của từng mô hình trên bảng, con số 210 triệu của GLM-5.3 nằm trên mức trung vị của nhóm là khoảng 140 triệu, trong khi 67 triệu của Sol nằm thấp hơn hẳn mức trung vị khoảng 81 triệu của lớp flagship mà nó được chấm điểm. Vì đầu ra là phần đắt đỏ trong mọi bảng giá, mức giảm giá 56% được quảng bá của GLM-5.3 trên dòng đầu ra không đứng vững khi đối chiếu với phép đo: nó phát ra lượng token gấp 3,1 lần với mức giá bằng 0,44 lần, và 3,1 × 0,44 là 1,37 — GLM-5.3 là mô hình đắt hơn cho khối lượng công việc này bất chấp bảng giá rẻ hơn đáng kể.
Con số chi phí trên mỗi tác vụ của chính hội đồng đã xác nhận hướng đi và độ lớn tương đối. $2,01 so với $0,72 là 2,8 lần, cao hơn mức mà chỉ riêng tỷ lệ token hàm ý, bởi vì GLM-5.3 cũng trả nhiều hơn cho các khoản input và cache trên mỗi tác vụ. Cần nói chính xác điều này chứng minh được gì và không chứng minh được gì: lần chạy index là mười bài đánh giá cố định, và mức độ dài dòng trên chúng không giống với mức độ dài dòng trên lưu lượng của bạn. Nhưng với người mua, token chính là thứ được xuất hoá đơn, và hình dạng của sự khác biệt vẫn như vậy trên bất kỳ bộ tác vụ nào mà mô hình buộc phải tạo ra câu trả lời dài.
Phần bù đắp một phần nằm ở dòng đầu vào được lưu trong bộ nhớ đệm. Mức đọc bộ nhớ đệm của GLM-5.3 là $0,26 so với mức cơ sở $1,40, còn của GPT-6.1 Sol là $0,10 so với mức cơ sở $2,00 — Sol thắng với hệ số 2,6 ở một mức giá chi phối mọi khối lượng công việc có tiền tố ổn định. Nếu lưu lượng của bạn là một kho ngữ liệu cố định lớn với câu trả lời dài một đoạn, thì GLM-5.3 rõ ràng là lựa chọn rẻ hơn và bạn nên chọn nó. Nếu lưu lượng của bạn giống với kiểu lưu lượng mà cả hai mô hình này được xây dựng để phục vụ — vòng lặp agent, chỉnh sửa ở quy mô repo, đầu ra được tạo dài — thì lợi thế đầu vào được lưu trong bộ nhớ đệm thu hẹp lại thành nhiễu so với tỷ lệ token 3×.
Nơi các số nhà cung cấp được đặt
Các con số công bố khi ra mắt của Z.ai rất mạnh và, như mọi khi, không tái lập được. Terminal-Bench 2.1 ở mức 88,2, DeepSWE v1.1 ở mức 66,9, CyberGym ở mức 84,5, ExploitBench ở mức 54,4, AutomationBench ở mức 48,2, GDPval-AA v2 ở mức 1769 Elo. Con số duy nhất đáng đọc lại lần thứ hai là Terminal-Bench 3.0 ở mức 28,3 — bộ đánh giá kế nhiệm, và là sự đính chính cho con số 88,2 trên bộ đánh giá cũ hơn. Một mô hình có thể xuất sắc trên bộ đánh giá mà quá trình hậu huấn luyện của nó nhắm tới, nhưng lại chỉ ở mức bình thường trên thế hệ kế tiếp của chính bộ đánh giá đó.
Số liệu ra mắt của OpenAI cho GPT-6.1 Sol hoàn toàn được trình bày xoay quanh chi phí cho mỗi tác vụ hoàn thành thay vì điểm số thô: DeepSWE v1.1 vượt qua kết quả tốt nhất của GPT-6 Sol 6,4 điểm phần trăm ở mức nỗ lực suy luận thấp hơn, AutomationBench 1.0.6 cao hơn Claude Opus 5.5 2,2 điểm ở mức nỗ lực trung bình, OSWorld 2.0 tăng bảy điểm so với GPT-6 Sol ở mức nỗ lực tối đa, Terminal-Bench Science 0.1 hơn gấp đôi GPT-6 Sol với chi phí cho mỗi tác vụ chưa bằng một nửa. Lưu ý rằng đây là của OpenAIbộ khungcủa OpenAIvới các cài đặtcủa OpenAI, và rằng không có cái nào trong số chúng được tái lập độc lập trên bộ benchmark được chọn
Sự chồng lấn giữa các bộ đã công bố của hai nhà cung cấp rất mỏng, và phép so sánh trực tiếp duy nhất hiện có nằm trên cùng một benchmark: Z.ai báo cáo 66,9 trên DeepSWE v1.1, OpenAI báo cáo 68,8 cho GPT-6 Sol — mẫu mà 6.1 thay thế — và mức cải thiện 6,4 điểm của 6.1 Sol so với chính phiên bản tiền nhiệm của nó. Cách nhau hai điểm trong so sánh do nhà cung cấp báo cáo, và cách nhau khoảng sáu điểm trong mức chênh lệch của chính OpenAI. Đó gần như là một so sánh có đối chứng, và nó nói lên điều mà hội đồng độc lập nói: gần tương đương về năng lực, nhưng khoảng cách lớn về chi phí để hoàn thành công việc.
Một API, hay hai hợp đồng
Cả hai mô hình đều nằm trên OrcaRouter, và đây chính là điểm bất thường của sự kết hợp này. GPT-6.1 Sol đã có mặt trong danh mục với đúng giá niêm yết của chính OpenAI vào ngày ra mắt — $2.00 và $10.00 mỗi triệu token, input đã cache $0.10, với bậc 272.000 token lên $4.00 và $15.00 được chuyển nguyên đúng như nhà cung cấp niêm yết — còn GLM-5.3 nằm bên cạnh ở mức $1.26 và $3.96 với chi phí đọc cache là $0.234. Không có gì được cộng thêm lên trên cả hai: nền tảng chuyển nguyên giá niêm yết của nhà cung cấp mà không thay đổi, đó là lý do việc nhà cung cấp giảm giá xuất hiện ở phía chúng tôi ngay trong cùng ngày thay vì sau khi một nhà bán lại đàm phán lại.

Điều đó quan trọng hơn với cặp cụ thể này so với hầu hết các trường hợp khác. Quyết định giữa hai lựa chọn này không phải là “cái nào tốt hơn” — mà là một ngưỡng dựa trên độ dài đầu ra của chính bạn, và ngưỡng đó sẽ dịch chuyển ngay lần đầu Z.ai tinh chỉnh bảng giá của mình hoặc OpenAI thay đổi ranh giới phân hạng của hạng 6.1. Việc giữ cả hai phía sau một khóa duy nhất, với cơ chế chuyển đổi dự phòng tự động giữa chúng và một quy tắc định tuyến mà bạn thay đổi trong cấu hình thay vì trong một lần triển khai, chính là điều cho phép bạn kiểm thử ngưỡng đó trên lưu lượng thực tế thay vì tranh cãi về nó. Nếu dòng giá cache của Sol thắng trong khối lượng công việc của bạn, hãy định tuyến theo nó; nếu độ dài câu trả lời của bạn vẫn ngắn và bảng giá phẳng không có vách ngăn ngữ cảnh của GLM-5.3 thắng phân khúc đó, hãy định tuyến theo cái đó thay thế — cùng một khóa, không có hợp đồng thứ hai, không có hóa đơn thứ hai.

Nếu hôm nay bạn phải chọn thì chọn cái nào?
• Đầu ra được tạo dài, vòng lặp tác tử, công việc nặng về đầu ra — GPT-6.1 Sol, và mức chênh lệch gần gấp ba lần khi áp dụng số lượng token. Đây là chỗ bảng giá nói dối còn phép đo thì không.
• Tiền tố ổn định, câu trả lời ngắn — GLM-5.3. Mức giá cho đầu vào được cache và đầu vào của nó thực sự tốt hơn, và tính dài dòng không bao giờ có cơ hội gây hại.
• Mọi yêu cầu trên 272.000 token đầu vào — GLM-5.3, vì GPT-6.1 Sol định giá lại toàn bộ yêu cầu tại ranh giới đó còn bảng giá của GLM-5.3 không có bậc tương đương.
• Bất cứ thứ gì có hình ảnh hoặc tài liệu làm đầu vào thị giác — GPT-6.1 Sol. GLM-5.3 chỉ xử lý văn bản và khoảng cách này không hề nhỏ.
• Suy luận trong ranh giới của chính bạn, hoặc một biện pháp phòng ngừa trước việc điều khoản của nhà cung cấp thay đổi — GLM-5.3, và giờ bản tải về đã tồn tại thay vì chỉ được hứa hẹn. Hãy dự trù ngân sách cho phần cứng: checkpoint là một tệp FP8 lớn và tự vận hành là một quyết định về vốn, không phải về API.
• Các cuộc gọi nhạy cảm với độ trễ — không bên nào nếu không cẩn thận. GLM-5.3 không có cách nào tắt suy luận; GPT-6.1 Sol có mức sàn ở thấp, và thời gian đến token đầu tiên của chính nó trên bảng độc lập đo được 332 giây so với trung vị của bảng là 3,7.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
