Thẻ tiêu đề hero được tạo tự động ghi 'GPT-6 Luna vs GLM-5.3', với phụ đề 'Tám điểm chỉ số đổi lấy chi phí mỗi tác vụ gấp mười lần, và trọng số vẫn chưa được công bố.', cùng các chip hiển thị Luna ở mức $0.10/$0.50 trên mỗi 1M với chỉ số 37, GLM-5.3 ở mức $1.40/$4.40 trên mỗi 1M với chỉ số 45, và chi phí mỗi tác vụ chỉ số là $0.07 so với $0.68, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-6 Luna vs GLM-5.3: Mô hình trọng số mở mà bạn vẫn không thể tải xuống

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GLM-5.3 là mô hình tốt hơn. Nó đạt 45 trên Chỉ số Trí tuệ Artificial Analysis ở mức nỗ lực tối đa so với GPT-6 Luna (37 điểm), nó ngang bằng với Mythos 5 trên một số đánh giá an ninh mạng được chọn lọc theo Z.ai, và nó là mô hình trọng số mở hàng đầu trên một số bảng tổng hợp. Hiện tại, nó cũng là một API bạn thuê chứ không phải một mô hình bạn sở hữu: Z.ai đã trì hoãn việc phát hành trọng số khoảng hai tuần vì lo ngại an ninh mạng, và bản tải xuống được cho là toàn bộ mục đích của một mô hình trọng số mở hàng đầu vẫn chưa có.

Độ trễ đó chính là câu chuyện của màn đối đầu này, và nó thay đổi phép tính theo cách mà các bảng giá bỏ sót. GPT-6 Luna ra mắt ngày 22 tháng 9 năm 2026 với mức $0.10 mỗi triệu token đầu vào và $0.50 mỗi triệu token đầu ra, sẵn có rộng rãi, không ràng buộc gì. GLM-5.3 ra mắt ngày 18 tháng 8 năm 2026 với mức $1.40 và $4.40 — gấp mười bốn lần mức giá đầu vào của Luna và gần chín lần mức giá đầu ra — trong khi trọng số của nó bị giữ lại. Vì thế, so sánh ở đây không phải là mô hình mở đối đầu mô hình đóng. Đó là một mô hình đóng mà bạn có thể gọi hôm nay với một phần mười chi phí, đối đầu với một mô hình mở mà bạn chỉ có thể gọi hôm nay, được định giá như thể bạn đang mua thứ mà bạn chưa thể có.

Hai mô hình, cách nhau một tháng, hai thương vụ rất khác biệt

GPT-6 Luna là phân khúc nhỏ trong thế hệ GPT-6 của OpenAI, ra mắt cùng với GPT-6 Sol ở mức $2.00/$10.00 và nằm dưới mẫu flagship GPT-6 Astra ở mức $10.00/$50.00. Mô hình có cửa sổ ngữ cảnh 1.050.000 token, giới hạn đầu ra 128.000 token, hỗ trợ đầu vào văn bản và hình ảnh, cùng một thang suy luận chạy từ none qua low, medium, high, xhigh và max — với medium là mặc định. OpenAI gọi đây là mô hình hiệu quả nhất trong dòng cho công việc tập trung, khối lượng lớn, và bảng giá cũng xác nhận điều đó: đầu vào được lưu đệm ở mức $0.01 mỗi triệu token chỉ bằng một phần mười mức giá chưa lưu đệm vốn đã thấp.

GLM-5.3 là mẫu flagship hiện tại của Z.ai dành cho kỹ thuật phần mềm phức tạp và công việc tác tử theo tầm dài hạn, được phát hành ngày 18 tháng 8 năm 2026. Đây là mô hình nhận văn bản vào, trả văn bản ra, sở hữu cửa sổ ngữ cảnh 1M token với giới hạn đầu ra 128.000 token, và luôn bật suy luận — không có chế độ không suy luận. Z.ai mô tả mức cải thiện khoảng 50% về trải nghiệm lập trình so với GLM-5.2 và định vị mẫu này cho lập trình quy mô kho mã và kỹ thuật tự hành đa bước. Trọng số, khi được công bố, sẽ là tính năng gây chú ý nhất; hiện tại API mới là thứ đang hoạt động.

Hai bảng giá thực sự ghi gì

Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:

• Đầu vào mỗi 1M — GPT-6 Luna $0.10 so với GLM-5.3 $1.40

• Đầu ra trên 1M — GPT-6 Luna $0.50 so với GLM-5.3 $4.40

• Đầu vào được lưu trong bộ nhớ đệm — GPT-6 Luna $0.01 mỗi 1M so với GLM-5.3 $0.26 mỗi 1M, giảm giá 81% trên mức giá đầu vào của chính nó

• AA Intelligence Index — GPT-6 Luna 37 ở mức nỗ lực tối đa so với GLM-5.3 45 ở mức nỗ lực tối đa

• Điểm số ở mức nỗ lực mặc định — GPT-6 Luna 29 ở mức mặc định trung bình so với GLM-5.3 suy luận luôn bật, được đo ở mức tối đa

• Token đầu ra trong lần chạy chỉ mục — GPT-6 Luna 150M so với GLM-5.3 210M, so với mức trung vị của bảng là 140M

• Chi phí chạy chỉ mục — GPT-6 Luna $122.39 so với GLM-5.3 $2,503.48

• Chi phí cho mỗi tác vụ lập chỉ mục — GPT-6 Luna khoảng 0,07 USD so với GLM-5.3 khoảng 0,68 USD

• Ngữ cảnh và đầu ra — GPT-6 Luna 1.050.000 đầu vào / 128.000 đầu ra so với GLM-5.3 1 triệu đầu vào / 128.000 đầu ra

• Điều khoản ngữ cảnh dài — GPT-6 Luna: đầu vào và bộ nhớ đệm gấp 2 lần, đầu ra gấp 1,5 lần trên 272K đầu vào, toàn bộ yêu cầu, so với GLM-5.3 vốn không có điều khoản tương đương trên card đã công bố

• Công tắc tắt suy luận — GPT-6 Luna từ không đến tối đa so với GLM-5.3 luôn bật, không có chế độ không suy luận

• Trọng số — GPT-6 Luna đóng, chỉ có API so với GLM-5.3 mở theo cam kết, phát hành bị trì hoãn

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

Thuế dài dòng chính là con số quyết định điều này

Khoảng cách chỉ số tám điểm là có thật và khoảng cách về giá còn lớn hơn, và cả hai đều không phải là con số quan trọng nhất. Con số quan trọng là token đầu ra trên mỗi tác vụ đã hoàn thành, vì đó là nơi lợi thế năng lực tám điểm hoặc tự bù đắp được chi phí, hoặc không.

Lần chạy chỉ số của Artificial Analysis là phép so sánh có kiểm soát sạch sẽ nhất hiện có: cùng một bộ kiểm thử, cùng một harness, chạy trên cả hai mô hình. GLM-5.3 đã tạo ra 210 triệu token đầu ra để hoàn thành nó. GPT-6 Luna tạo ra 150 triệu. So với mức trung vị trên bảng là 140 triệu, cả hai đều nói nhiều — GLM-5.3 cao hơn trung vị gấp rưỡi, GPT-6 Luna cao hơn khoảng một phần mười. Nhưng hướng của sự khác biệt đó lại cộng dồn bất lợi cho mô hình của Z.ai về giá: nó phát ra nhiều hơn 40% token và tính giá cao gấp 8,8 lần cho mỗi token.

Ghép hai thứ lại với nhau, chi phí cho mỗi tác vụ index đã hoàn thành rơi vào khoảng $0.68 đối với GLM-5.3 so với khoảng $0.07 đối với GPT-6 Luna — chênh lệch khoảng gấp mười lần, lớn hơn tỷ lệ trên bảng giá gốc, bởi vì mô hình đắt hơn cũng là mô hình dài dòng hơn. Đó chính là hình dạng trung thực của sự kết hợp này. GLM-5.3 đổi lấy cho bạn tám điểm index với số tiền gấp mười lần cho mỗi công việc hoàn thành, và liệu đó có phải là một thương vụ tốt hay không phụ thuộc hoàn toàn vào việc khối lượng công việc của bạn có phải là loại mà tám điểm chính là khác biệt giữa chạy được và không chạy được hay không.

Đối với rất nhiều lưu lượng production thì không phải vậy. Đối với một coding agent đang làm việc trên một repo ở sát giới hạn khả năng của model, thì thường là có, và không mức lợi thế giá nào có thể bù đắp được khoảng cách năng lực trong một tác vụ thất bại.

Vì sao trọng số mở thay đổi câu trả lời, và vì sao độ trễ khiến nó đổi trở lại

Lập luận tiêu chuẩn cho một mô hình chủ lực trọng số mở là giá trên mỗi token chỉ là tạm thời. Bạn thuê cho đến khi sản lượng của bạn đủ để việc mua trở nên hợp lý, rồi sau đó bạn tải mô hình về và chi phí biên của một token trở thành tiền điện. Theo lập luận đó, mức $1.40/$4.40 của GLM-5.3 thực ra không phải gấp mười bốn lần mức $0.10 của GPT-6 Luna — nó là một mức giá bắc cầu trên con đường tiến tới 0, còn mức giá rẻ hơn của mô hình đóng là một dạng thuê không có lối thoát.

Lập luận đó là đúng, và hiện tại nó đang bị tạm ngưng. Z.ai đã giữ các trọng số lại khoảng hai tuần vì những phát hiện về an ninh mạng, nghĩa là lối thoát vốn biện minh cho mức giá cao hơn vẫn chưa tồn tại. Cho đến khi nó tồn tại, GLM-5.3 là một API tính phí theo mức sử dụng với chi phí mỗi tác vụ cao gấp mười lần so với một mô hình kém nó bốn điểm chỉ số trên bảng tổng quát và kém một điểm trên bảng lập trình — và người mua đang trả mức giá của trọng số mở để được truy cập trọng số đóng.

Có một điểm ở tầng thứ hai đáng để gọi tên. Sự trì hoãn không phải là một vụ bê bối; đó là việc một nhà cung cấp đang coi trọng một phát hiện về năng lực, và một mô hình phát hiện lỗ hổng giỏi đúng là kiểu mô hình mà một phòng thí nghiệm nên cẩn trọng khi phát hành dưới dạng tệp có thể tải xuống. Nhưng điều đó thực sự có nghĩa là ngày phát hành trọng số giờ đây là ngày quan trọng nhất trong so sánh này, và nó không được công bố. Một nhóm chọn giữa hai mô hình này trong khung thời gian mười hai tháng là đang chọn giữa một mô hình mà các điều khoản có thể thay đổi vào tháng sau và một mô hình mà các điều khoản không thể thay đổi — và chỉ một trong số đó được định giá tương xứng.

Phạm vi migration nhỏ

Cả hai mô hình đều dùng giao diện chat completions tương thích OpenAI, đều có cửa sổ ngữ cảnh cỡ 1M, và đều giới hạn đầu ra ở 128.000 token, nên việc chuyển đổi giữa chúng gần giống với một thay đổi cấu hình hơn là viết lại. Những khác biệt thực sự sẽ gây ảnh hưởng nằm ở hành vi chứ không phải cấu trúc.

Điều khoản ngữ cảnh dài của GPT-6 Luna là điều khoản đắt đỏ: các yêu cầu trên 272.000 token đầu vào bị tính gấp đôi mức giá đầu vào và cache cùng gấp 1,5 lần mức giá đầu ra cho toàn bộ yêu cầu, nên một lệnh gọi 300.000 token tốn gấp đôi so với cùng công việc đó khi chia làm hai. Thẻ công bố của GLM-5.3 không có điều khoản tương đương, điều này với những yêu cầu đơn lẻ thực sự lớn sẽ thu hẹp đáng kể khoảng cách giá và có thể đảo ngược nó trong một tác vụ nặng về đầu ra.

Cấu hình suy luận lại tạo ra tác động ngược lại. GLM-5.3 luôn bật suy luận và không cho bạn cách nào tắt nó đi, đây là một ràng buộc cứng đối với bất kỳ thứ gì nhạy cảm với độ trễ — một bộ phân loại hay bộ định tuyến không thể dùng nó. GPT-6 Luna cung cấp none, low, medium, high, xhigh và max, và mặc định là medium, ở đó nó đạt 29 thay vì 37. Chính tham số đó là khác biệt giữa việc GPT-6 Luna kém mô hình của Z.ai tám điểm chỉ số và kém mười sáu điểm, và một nhóm chuyển đổi mà không thiết lập nó một cách rõ ràng thì đang chạy cấu hình thứ hai trong khi tưởng rằng mình đã mua cấu hình thứ nhất.

GLM-5.3 có trên OrcaRouter ở mức giá niêm yết của Z.ai, theo cơ chế định giá chuyển tiếp, giúp thay đổi tỷ giá từ nhà cung cấp được áp dụng ngay trong cùng ngày thay vì phải chờ một nhà bán lại đàm phán lại — điều này càng quan trọng hơn mức thông thường đối với một mô hình mà con số chủ đạo được dự kiến sẽ thay đổi khi trọng số được phát hành. GPT-6 Luna hiện chưa có trong danh mục của chúng tôi tại thời điểm viết bài này và được truy cập qua API riêng của OpenAI. Một đội ngũ vận hành cả hai, vốn là thiết lập hợp lý ở đây xét đến mức độ khác biệt của hai mô hình tại các giới hạn, sẽ dùng một khóa cho GLM-5.3 song song với bất cứ thứ gì họ đã dùng cho OpenAI, và chuyển lưu lượng giữa một bộ phân loại năm xu và một tác nhân viết mã quy mô kho bằng cách thay đổi tuyến đường thay vì triển khai.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Cuộc gọi

Hãy dùng GPT-6 Luna cho mọi tác vụ được chương trình tiêu thụ và có khối lượng lớn. Phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một agent. Ở mức $0.10/$0.50, với đầu vào được lưu đệm ở mức một xu và Batch ở một nửa giá tiêu chuẩn, nó rẻ hơn một bậc độ lớn cho mỗi tác vụ hoàn thành so với GLM-5.3 và khoảng cách chỉ số tám điểm sẽ không hiển thị trong bài đánh giá của bạn. Hãy đặt tham số effort một cách rõ ràng và giữ các lệnh gọi dài của bạn dưới 272,000 token.

Hãy chọn GLM-5.3 khi tác vụ là bài toán khó và câu trả lời quan trọng hơn hóa đơn. Kỹ thuật phần mềm ở quy mô repo, công việc tự chủ gồm nhiều bước, bất cứ thứ gì mà tám điểm chỉ số là khác biệt giữa một tác vụ hoàn thành và một tác vụ thất bại. Độ dài dòng là một khoản thuế thật sự và chi phí tác vụ gấp mười lần cũng là thật, nhưng một mô hình hoàn thành được thì rẻ hơn một mô hình phải thử lại.

Và hãy để ý đến trọng số. Ngày mà Z.ai công bố bản tải xuống GLM-5.3 cũng chính là ngày sự thật cốt lõi của so sánh này thay đổi, và đó là mốc thời gian duy nhất trên trang này vẫn chưa có trên lịch.

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày