Đã tạo thẻ tiêu đề hero có tiêu đề chính là 'GPT-6 Luna vs Grok 4.6' với phụ đề 'Giá gấp hai mươi lần, và một vực thẳm ở 200.000 token', phần chân trang ghi 'Giá theo OpenAI và xAI; số liệu chỉ số theo Artificial Analysis.', và logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

GPT-6 Luna vs Grok 4.6: Khoảng cách giá gấp hai mươi lần và cửa sổ ngữ cảnh mới là khác biệt thực sự

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt GPT-6 LunaGrok 4.6 trên cùng một trang và so sánh đầu tiên tự viết ra. Luna niêm yết ở mức $0.10 mỗi triệu token đầu vào và $0.50 mỗi triệu token đầu ra. Grok 4.6 niêm yết ở mức $2.00 và $6.00 với $0.50 cho đọc từ bộ nhớ đệm. Gấp hai mươi lần về đầu vào, gấp mười hai lần về đầu ra, và mức giá đầu vào được lưu trong bộ nhớ đệm cao gấp năm mươi lần trên mô hình của nhà cung cấp. Đó là giá niêm yết, và trên giá niêm yết, câu trả lời không hề gần.

Lý do vẫn đáng để viết phần còn lại của bài này là ở chỗ hai mô hình bất đồng về một điều mang tính cấu trúc hơn cả giá. Grok 4.6 sở hữu cửa sổ ngữ cảnh 500.000 token và tính lại giá cho toàn bộ yêu cầu một khi prompt vượt qua 200.000 token. GPT-6 Luna mang 1.050.000 token và tính lại giá ở mốc 272.000. Cả hai ngưỡng đều là vách đá chứ không phải mức biên — vượt qua một ngưỡng, toàn bộ yêu cầu sẽ được tính theo mức cao hơn, chứ không chỉ phần vượt đường ranh. Vị trí của hai vách đá đó, và điều gì xảy ra với một khối lượng công việc ngữ cảnh dài nằm ở phía sai của mỗi vách, quyết định phần lớn hơn trong so sánh này so với con số gấp hai mươi lần được nêu ở tiêu đề.

Hai mô hình, hai tư thế rất khác biệt

Grok 4.6 là mô hình của xAI từ ngày 12 tháng 8 năm 2026, và đây là một bản phát hành tiên phong đa dụng: đầu vào văn bản, đầu ra văn bản, cửa sổ 500.000 token, chi phí được công bố cho mỗi tác vụ là 1,86 USD trên bảng độc lập ở mức nỗ lực cao, và tốc độ đo được là 57,7 token đầu ra mỗi giây. Đây là kiểu mô hình mà một nhóm sẽ chọn dùng vì nó giỏi nhiều thứ và nhà cung cấp đang tung ra sản phẩm rất nhanh.

GPT-6 Luna mang tư thế ngược lại. OpenAI phát hành nó vào ngày 22 tháng 9 năm 2026 với vai trò là tầng khối lượng lớn của dòng GPT-6, nằm dưới GPT-6 Sol ở mức $2.00/$10.00 và mô hình chủ lực GPT-6 Astra ở mức $10.00/$50.00. Đầu vào là văn bản và hình ảnh, đầu ra là văn bản, cửa sổ 1.050.000 token với đầu vào tối đa 922.000 token, giới hạn đầu ra 128.000 token, và thang suy luận chạy từ none qua low, medium, high, xhigh và max với medium là mặc định. Đây không phải là mô hình mà người ta chọn vì độ rộng năng lực của nó. Đây là mô hình bạn đặt làm nền cho một khối lượng công việc.

Vậy nên cách đặt vấn đề trung thực không phải là "cái nào trong số này tốt hơn". Mà là "cái nào trong số này được định giá cho hình thái công việc bạn có", và hai hình thái đó thực sự khác nhau.

Các thẻ, từng dòng một

Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:

• Đầu vào mỗi 1M — GPT-6 Luna $0.10 so với Grok 4.6 $2.00

• Đầu ra mỗi 1M — GPT-6 Luna $0.50 so với Grok 4.6 $6.00

• Input đã lưu trong bộ nhớ đệm trên mỗi 1M — GPT-6 Luna $0.01 so với Grok 4.6 $0.50, bằng một phần mười mức giá đầu vào của chính nó, so với một phần tư của xAI

• Ngưỡng ngữ cảnh dài — GPT-6 Luna 272.000 token đầu vào so với Grok 4.6 200.000 token lời nhắc

• Giá cho ngữ cảnh dài — GPT-6 Luna định giá lại toàn bộ yêu cầu thành $0.20 đầu vào, $0.75 đầu ra, $0.02 bộ nhớ đệm so với Grok 4.6 định giá lại toàn bộ yêu cầu thành $4.00 đầu vào, $12.00 đầu ra, $1.00 bộ nhớ đệm

• Cửa sổ ngữ cảnh — GPT-6 Luna 1,050,000 token so với Grok 4.6 500,000 token

• Đầu ra tối đa — GPT-6 Luna 128.000 token so với Grok 4.6 không được công bố như một giới hạn riêng trên thẻ

• Chỉ số Trí tuệ, độc lập — GPT-6 Luna 37 ở mức nỗ lực tối đa so với Grok 4.6 44 ở mức nỗ lực cao trên bản sửa đổi chỉ số v4.3.2

• Điểm số ở mức nỗ lực mặc định — GPT-6 Luna 29 ở mức trung bình mặc định của nó so với Grok 4.6 43 ở mức trung bình, nơi bảng xếp hạng cũng đo lường điểm này

• Chi phí cho mỗi tác vụ Index, độc lập — GPT-6 Luna khoảng $0,07 so với Grok 4.6 $1,86 ở mức nỗ lực cao

• Token đầu ra trong lần chạy chỉ mục — GPT-6 Luna 150M so với Grok 4.6 94M, so với mức trung vị của bảng là 88M

• Tốc độ đầu ra, độc lập — GPT-6 Luna 153.9 token/giây so với Grok 4.6 57.7 token/giây ở mức cao

• Thời gian tới token đầu tiên, độc lập — Grok 4.6 38,63 giây, từ đầu đến cuối 47,31 giây; GPT-6 Luna trả về token đầu tiên trong khoảng thời gian cho phép người dùng chờ đợi

• Năng lực mạng, độc lập — Grok 4.6 đạt 57 điểm trong đánh giá về mạng của bảng xếp hạng; chưa có số liệu tương đương nào cho GPT-6 Luna được công bố

• Trên OrcaRouter — GPT-6 Luna không có trong danh mục của chúng tôi so với Grok 4.6 có thể định tuyến ở mức giá niêm yết của xAI

Generated two-column scoreboard titled 'GPT-6 Luna vs Grok 4.6 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, Long-context threshold 272,000, Context 1,050,000, AA Index 37 at max effort, Cost per index task $0.07. Right column Grok 4.6 rows: Price in/out $2.00 / $6.00, Cached input $0.50, Long-context threshold 200,000, Context 500,000, AA Index 44 at high effort, Cost per index task $1.86. Footer: 'Prices per OpenAI and xAI; index figures per Artificial Analysis.'

200.000 so với 272.000 là toàn bộ lập luận

Đọc hai ngưỡng bên cạnh hai cửa sổ và phép so sánh tự sắp xếp lại.

Điểm gãy của Grok 4.6 nằm ở 200.000 token trong cửa sổ 500.000 token — tức 40% chặng đường. Còn của GPT-6 Luna nằm ở 272.000 trong 1.050.000 — tức 26% chặng đường. Vậy nên mô hình rẻ hơn không chỉ bắt đầu đổi giá muộn hơn, mà còn có dư địa sau ngưỡng nhiều hơn gấp đôi trước khi cạn kiệt cửa sổ hoàn toàn.

Cụ thể: một yêu cầu 450.000 token vừa vặn trong cả hai mô hình. Trên GPT-6 Luna, nó được tính theo bậc ngữ cảnh dài với mức $0,20 và $0,75. Trên Grok 4.6, nó được tính với mức $4,00 và $12,00. Đó là gấp hai mươi lần về đầu vào và gấp mười sáu lần về đầu ra cho cùng một prompt — và đây là yêu cầu mà Grok 4.6 có thể phục vụ, nên lựa chọn là thật chứ không phải lý thuyết.

Trường hợp ngược lại mới là trường hợp khiến người ta bị bất ngờ. Một yêu cầu 190.000 token nằm dưới cả hai ngưỡng và được tính theo mức giá tiêu chuẩn ở cả hai: 0,10 USD/0,50 USD so với 2,00 USD/6,00 USD, gấp đúng hai mươi lần và mười hai lần. Một yêu cầu 210.000 token nằm trên mốc của Grok 4.6 và dưới mốc của GPT-6 Luna. Nó được tính 4,00 USD/12,00 USD trên Grok 4.6 và 0,10 USD/0,50 USD trên Luna — khoảng cách gấp bốn mươi lần và hai mươi tư lần được tạo ra hoàn toàn bởi sự chênh lệch 20.000 token trong độ dài prompt, dù không có thay đổi nào ở cả hai mô hình.

Đó không phải là lý do để tránh Grok 4.6. Đó là lý do để biết các prompt của bạn thực sự rơi vào đâu, bởi vì một khối lượng công việc trung bình 180.000 token và đôi khi tăng vọt lên 220.000 đang phải trả theo hai biểu giá khác nhau và sẽ trông giống như một lỗi thanh toán trong tháng đầu tiên nó xảy ra.

Chênh lệch giá mua được gì trên hội đồng độc lập

Grok 4.6 đạt 44 điểm trên Chỉ số Trí tuệ Artificial Analysis ở mức nỗ lực cao. GPT-6 Luna đạt 37 điểm ở mức nỗ lực tối đa. Bảy điểm, trên một chỉ số tổng hợp mà một điểm đơn lẻ vẫn nằm trong độ nhiễu của một lần chạy lại — và hai mô hình cách nhau khoảng hai mươi sáu lần về chi phí cho mỗi tác vụ hoàn thành, 1,86 USD so với khoảng 0,07 USD.

Có hai điều về cặp số đó đáng để tách ra riêng.

Điều đầu tiên là mặc định về mức nỗ lực. Con số 37 của GPT-6 Luna là điểm ở mức nỗ lực tối đa, và mặc định của nó là trung bình, tại đó nó đạt 29 điểm. Con số 44 của Grok 4.6 là điểm ở mức nỗ lực cao, và bảng xếp hạng cũng đo nó ở mức trung bình, tại đó nó đạt 43 điểm. Vậy nên so sánh cùng điều kiện ở cài đặt mặc định là 29 so với 43 — mười bốn điểm, không phải bảy điểm, và phiên bản mười bốn điểm mới là phiên bản mà một nhóm triển khai cả hai và không thay đổi gì sẽ thực sự trải nghiệm. Grok 4.6 mất một điểm khi chuyển từ cao xuống trung bình. GPT-6 Luna mất tám điểm. Núm điều chỉnh nỗ lực khiến mô hình rẻ mất nhiều hơn hẳn so với mô hình đắt, và sự bất đối xứng đó không hề thấy được trong các con số chỉ số nổi bật.

Điều thứ hai là sự dài dòng, và ở đây hướng lại ngược với điều mà tỷ lệ giá gợi ý. GPT-6 Luna đã tạo ra 150 triệu token đầu ra để hoàn thành chỉ mục; Grok 4.6 tạo ra 94 triệu. Mô hình có chi phí cho mỗi token đầu ra chỉ bằng một phần mười hai đã dùng nhiều hơn 60% token để đạt điểm thấp hơn. Trên bảng giá tính theo token đầu ra, đó là sự khác biệt giữa khoảng cách chi phí trên mỗi tác vụ gấp hai mươi sáu lần và một khoảng cách nhỏ hơn, và đó là lý do bất kỳ so sánh nào chỉ dựa trên giá niêm yết sẽ phóng đại lợi thế của phân khúc rẻ.

Grok 4.6 cũng công bố điểm năng lực an ninh mạng là 57 trên cùng bảng đánh giá. Không có con số tương đương nào cho GPT-6 Luna, nên chiều đó chỉ có một phía — nhưng đây là kiểu thông số quan trọng nếu khối lượng công việc của bạn liên quan đến công cụ bảo mật, và việc nó thiếu ở mô hình rẻ hơn là thông tin, chứ không phải một khoảng trống cần được lấp đầy bằng giả định.

Độ trễ, trong trường hợp hai giá trị không gần nhau và không cùng hướng

Các số liệu độ trễ độc lập của Grok 4.6 là 38,63 giây đến token đầu tiên và 47,31 giây tính từ đầu đến cuối ở mức nỗ lực cao. Đó là con số của một mô hình đang suy luận nghiêm túc trước khi đưa ra câu trả lời, và nó không tương thích với một người ngồi nhìn con trỏ. Trang niêm yết của chúng tôi cho mô hình này ghi nhận p50 thời gian đến token đầu tiên là 6,71 giây và p95 là 10,00 giây trong khoảng thời gian bảy ngày, vốn đo một thời điểm khác trong phản hồi và không thể so sánh với con số độc lập — hai con số không mâu thuẫn với nhau, chúng đang trả lời những câu hỏi khác nhau.

GPT-6 Luna chạy ở tốc độ 153,9 token đầu ra mỗi giây và trả về token đầu tiên đủ nhanh để phục vụ một bề mặt tương tác. Nó đạt thông lượng gần gấp ba lần Grok 4.6 ở mức nỗ lực cao. Với một tác vụ theo lô, khác biệt đó chỉ là sự tiện lợi về thời gian thực thi. Với bất cứ thứ gì người dùng đang chờ, đó là khác biệt giữa một sản phẩm và một nguyên mẫu.

Sự kết hợp này thật bất thường và đáng được gọi tên thẳng thắn: mô hình rẻ là mô hình nhanh, mô hình đắt là mô hình chậm, và mô hình đắt dẫn trước bảy điểm trên điểm tổng hợp khi so ở cùng mức nỗ lực. Đó là chân dung của một mô hình được xây để suy nghĩ kỹ một lần, và một mô hình được xây để trả lời nhanh rất nhiều lần. Nếu khối lượng công việc của bạn là một lượt gọi cho mỗi tác vụ, độ trễ của Grok 4.6 là chấp nhận được. Nếu là một nghìn lượt gọi cho mỗi tác vụ, thì không.

Điều bạn thực sự đang mua ở phía xAI

Grok 4.6 tốn chi phí cho mỗi tác vụ hoàn thành cao gấp khoảng hai mươi sáu lần so với GPT-6 Luna và dẫn trước bảy điểm chỉ số ở cùng mức nỗ lực. Đó là một tỷ lệ đánh đổi kém cho khối lượng công việc đa dụng, và là một tỷ lệ hợp lý cho một loại công việc cụ thể.

Ba điều biện minh cho điều đó. Điểm cyber 57 là một năng lực mà GPT-6 Luna không công bố đối tác tương đương. Lần chạy chỉ mục 94 triệu token so với 150 triệu của Luna là một lợi thế súc tích thực sự trên bất kỳ tác vụ nào mà đầu ra được con người đọc thay vì trình phân tích cú pháp. Và mô hình đã được đưa vào sản xuất từ ngày 12 tháng 8, lâu hơn sáu tuần so với toàn bộ thời gian tồn tại của GPT-6 Luna — đó không phải là một benchmark, nhưng là một thành tích thực tế, và với một đội đã xây dựng dựa trên nó, chi phí chuyển đổi khi rời đi là một phần cái giá của việc rời đi.

Đối lại, trường hợp của GPT-6 Luna không chủ yếu nằm ở mức giá gấp hai mươi lần. Đó là ngưỡng 272.000 token bên trong cửa sổ một triệu token, khả năng được yêu cầu dừng suy luận hoàn toàn, mức giá đầu vào được lưu đệm một xu một triệu token, và một chỉ số thông lượng khiến nó có thể dùng như một thành phần thay vì một điểm cuối. Đó là những thuộc tính cấu trúc của hạng rẻ, và lợi thế chỉ số ở phía đối diện có lớn đến đâu cũng không thay thế được chúng.

Chạy một trong hai, hoặc cả hai

Grok 4.6 đã có trên OrcaRouter ở mức giá niêm yết của xAI, theo cơ chế định giá chuyển tiếp, giúp thay đổi giá từ nhà cung cấp được áp dụng ngay trong ngày ở phía chúng tôi thay vì phải chờ một đại lý đàm phán lại. Tự động chuyển đổi dự phòng là phần chứng minh giá trị của nó riêng với mô hình này: cửa sổ 500.000 token với ngưỡng cắt 200.000 token là một khối lượng công việc mà đôi khi một yêu cầu rơi nhầm sang phía bên kia ranh giới, và một tuyến chuyển đổi giữa các upstream mà không cần triển khai thì đáng giá hơn một phần nhỏ của một xu mỗi token.

Tính đến thời điểm viết bài này, GPT-6 Luna không nằm trong danh mục của chúng tôi và được truy cập thông qua API riêng của OpenAI. Vì vậy, một nhóm muốn dùng cả hai sẽ chạy một khóa cho Grok 4.6 song song với bất cứ thứ gì họ đã dùng cho OpenAI. DSL định tuyến chính là mảnh ghép phù hợp với sự kết hợp này: một quy tắc gửi những prompt vượt ngưỡng token đến mô hình mà chúng đã vượt qua được mức giá tăng vọt, và gửi mọi thứ dưới ngưỡng đó đến mô hình có giá chỉ bằng một phần mười hai, có thể được diễn đạt dưới dạng cấu hình thay vì một nhánh rẽ trong ứng dụng của bạn — điều này rất quan trọng khi các ngưỡng nằm gần với kích thước prompt phổ biến như hai mô hình này.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Cái nào, và khi nào

Hãy dùng GPT-6 Luna nếu khối lượng công việc của bạn có lưu lượng lớn, được tiêu thụ bởi chương trình và ngắn. Phân loại, trích xuất, định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một agent. Ở mức $0.10/$0.50 với một lần đọc được lưu trong bộ nhớ đệm giá một xu, so với một mô hình có chi phí gấp hai mươi sáu lần cho mỗi tác vụ hoàn thành để đạt bảy điểm chỉ số khi nỗ lực tương đương, thì phép tính không hề sát nút. Hãy đặt tham số nỗ lực một cách tường minh — mặc định là medium và con số 37 được quảng cáo là con số ở mức nỗ lực tối đa — và giữ các lệnh gọi dài của bạn dưới 272.000 token.

Hãy chọn Grok 4.6 nếu bạn cần năng lực cyber, nếu đầu ra của bạn được một con người đọc và sự ngắn gọn của nó đáng để trả tiền, hoặc nếu bạn có khối lượng công việc 300.000–500.000 token mà GPT-6 Luna có thể phục vụ nhưng bạn không muốn là đội đầu tiên khám phá xem nó hành xử thế nào ở độ dài đó. Hãy dự trù ngân sách một cách rõ ràng cho ngưỡng vực 200.000 token, và đừng đặt nó phía sau một bề mặt tương tác ở mức nỗ lực cao — 38 giây đến token đầu tiên không phải là một con số độ trễ, mà là một tuyên bố về việc mô hình này được sinh ra để làm gì.

Sai lầm mà cách so sánh này dễ khiến người ta mắc phải là coi mức gấp hai mươi lần là yếu tố quyết định. Đó là yếu tố quyết định đối với một dạng khối lượng công việc. Với dạng còn lại, quyết định được đưa ra ở mốc 200.000 và 272.000 token, còn tỷ lệ giá chỉ là chi tiết bạn đọc sau đó.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the xAI vendor label, list pricing of $2.00 input and $6.00 output per 1M tokens, a 500,000-token context window, recorded latency statistics, an uptime chart, and the provider routing section.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày