
GPT-6 vs GPT-6 Luna: Một xu cho một triệu token, và gói đáp lại gói miễn phí
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Có một phiên bản của so sánh này mà câu trả lời chỉ gói gọn trong một dòng: bạn không thể gọi GPT-6, và bạn có thể gọi GPT-6 Luna với giá mười xu cho mỗi triệu token đầu vào. Nhưng phiên bản hữu ích hơn là phiên bản giải thích vì sao Luna giờ đây là mô hình mà hầu hết mọi người thực sự đã dùng — OpenAI đặt nó phía sau các gói Free và Go của ChatGPT vào ngày 8 tháng 10 năm 2026, khiến nó trở thành gói rẻ nhất trong thế hệ này và, xét theo số người dùng, là gói đông người dùng nhất. Phần tiếp theo sẽ giải thích thang bậc các gói một lần, rồi sau đó là mười xu cho mỗi triệu thực sự mua được gì.
Gia đình, và vị trí của Luna trong đó
OpenAI phát hành thế hệ GPT-6 dưới dạng ba model id ra mắt vào ngày 22 tháng 9 năm 2026, không có openai/gpt-6 endpoint nào đứng sau tên dòng mô hình:
• GPT-6 Astra — mẫu chủ lực, 10,00 USD đầu vào / 50,00 USD đầu ra cho mỗi triệu token, được liệt kê trên bảng giá của OpenAI ở vị trí đứng đầu thế hệ
• GPT-6 Sol — phân khúc trung, 2,00 / 10,00 USD, và là mẫu OpenAI chỉ định cho trò chuyện trên các gói ChatGPT trả phí
• GPT-6 Luna — phân khúc giá rẻ, 0,10 / 0,50 USD, và là mẫu OpenAI chỉ định cho các gói Free và Go
Dòng cuối cùng đó chính là phần đáng để xác định rõ, bởi vì đó là lý do lưu lượng của Luna lấn át mọi thứ khác trong gia đình này. Thông báo của chính OpenAI cho đợt triển khai ngày 7–8 tháng 10 nêu rằng “GPT-6 trong ChatGPT được vận hành bởi GPT-6 Sol cho các gói Plus, Pro, Business và Enterprise, và GPT-6 Luna cho các gói Free và Go.” Một mô hình ở mức $0.10 / $0.50 phục vụ gói miễn phí là một mô hình trả lời nhiều câu hỏi mỗi ngày hơn bất kỳ gói cao cấp nào, và nó chính là cùng một checkpoint mà bạn có thể gọi qua API. Bề mặt người tiêu dùng là một kênh phân phối, không phải một SKU riêng.
Một lưu ý phải được nhắc lại ở đây vì blog này đã từng đăng về nó: cùng một thông báo nói rằng Free và Go được dùng GPT-6 Luna, trong khi trang trung tâm trợ giúp của OpenAI về GPT-6 trong ChatGPT lại mô tả Free và Go đang chạy GPT-5.6 Luna vào ngày trang đó được đọc. Đó là những tuyên bố không tương thích về cùng một gói, OpenAI chưa nói cái nào là hiện hành, và nếu công việc của bạn phụ thuộc vào việc mô hình rẻ nào nằm sau gói miễn phí, hãy coi mục trong trung tâm trợ giúp là trang cụ thể hơn và kiểm tra lại trước khi bạn xây dựng dựa trên một trong hai.
Mười xu cho mỗi triệu thực sự mua được gì
Con số trên tiêu đề là con số kém thú vị nhất trên thẻ của Luna. Đây là toàn bộ thẻ, cùng bước hạng ở bên dưới nó:
• Ngữ cảnh ngắn, tối đa 272.000 token đầu vào — $0,10 mỗi triệu đầu vào, $0,50 mỗi triệu đầu ra
• Trên 272.000 token đầu vào — $0,20 mỗi triệu đầu vào, $0,75 mỗi triệu đầu ra, áp dụng cho toàn bộ yêu cầu
• Đầu vào được lưu đệm — $0,01 mỗi triệu ở mức ngắn, giảm giá 90%; $0,02 trên ngưỡng đó
• Ghi bộ đệm — $0,125 mỗi triệu ở mức ngắn, $0,25 ở mức trên
• Ngữ cảnh và đầu ra — 1.050.000 token đầu vào, 128.000 token đầu ra
• Các phương thức đầu vào — văn bản, hình ảnh và tệp, cùng kiểu đầu vào đa phương thức như Sol và Astra
• Suy luận — tham số nỗ lực có thể cấu hình, cùng với các công cụ, đầu ra JSON và lấy mẫu có seed
Có hai điều suy ra. Điều thứ nhất là đây không phải một mô hình bị cắt gọt. Nó nhận hình ảnh và tệp, nó cung cấp bề mặt gọi công cụ và đầu ra có cấu trúc y hệt hai mô hình anh em đắt tiền hơn của nó, và điều duy nhất tách nó khỏi Sol trên bảng thông số là chiều sâu chứ không phải năng lực. Điều thứ hai là bậc tăng. Một prompt trên 272.000 token sẽ tăng gấp đôi mức giá đầu vào của Luna và tăng mức giá đầu ra của nó, áp dụng cho toàn bộ yêu cầu chứ không chỉ phần vượt ngưỡng. Đó là một bậc tăng nhẹ nhàng ở mức giá này — một yêu cầu 300.000 token tốn khoảng sáu xu tiền đầu vào thay vì ba xu — nên điều khoản ngữ cảnh dài vốn chi phối việc lập ngân sách cho Astra và quan trọng với Sol gần như không đáng kể ở đây.
Con số thực sự tác động đến chi phí ở quy mô lớn là lượt đọc được lưu trong bộ đệm. Ở mức một xu cho mỗi triệu, một khối lượng công việc gửi lại cùng một ngữ cảnh lớn trong mỗi lượt gần như không phải trả gì cho phần lặp lại. Trên một pipeline trích xuất hoặc phân loại khối lượng lớn với system prompt ổn định và một tài liệu ổn định, đó là sự khác biệt giữa một mô hình rẻ và một mô hình gần như miễn phí, và đó chính là lý do chi phí thực tế cho mỗi câu trả lời hoàn chỉnh của Luna thấp hơn nhiều so với mức mà bảng giá gợi ý.
Nó khiến bạn phải trả giá như thế nào về mặt năng lực
Luna là hạng rẻ nhất vì nó là hạng kém năng lực nhất, và bảng đánh giá độc lập không hề mập mờ về mức độ kém hơn là bao nhiêu. Hãy đọc từ Artificial Analysis qua mục danh mục OrcaRouter cho từng mô hình vào ngày 8 tháng 10 năm 2026:
• Chỉ số AA Intelligence — GPT-6 Sol 47.6, xếp hạng 14; GPT-6 Luna 38.1, xếp hạng 37
• Humanity's Last Exam — GPT-6 Sol 47.9 so với GPT-6 Luna 38.5
• SciCode — GPT-6 Sol 57.6 so với GPT-6 Luna 54.6
• Khả năng ghi nhớ ngữ cảnh dài — GPT-6 Sol 83.7 so với GPT-6 Luna 83.3
• Terminal-Bench 4.0 — GPT-6 Sol 43.9 so với GPT-6 Luna 12.6
• Lưu lượng trong bảy ngày — GPT-6 Luna khoảng 574 triệu token; GPT-6 Sol khoảng 2,1 triệu
• Thời gian trung vị đến token đầu tiên — GPT-6 Luna 1.494 ms so với GPT-6 Sol 6.785 ms
• Tốc độ xuất trung vị — GPT-6 Luna 132,9 token/giây so với GPT-6 Sol 179,6 token/giây
Hình dạng của nó mang nhiều thông tin hơn là khoảng cách trên tiêu đề. Luna kém Sol 9,5 điểm chỉ số, và mức thua kém không trải đều: khả năng truy hồi ngữ cảnh dài là thế hòa 0,4 điểm, còn SciCode — hiểu mã nguồn chứ không phải viết mã — chỉ cách nhau 3 điểm. Điều sụp đổ là khả năng thực thi đa bước mang tính tác tử: Terminal-Bench 4.0 đạt 12,6 so với 43,9 của Sol. Một mô hình có thể truy hồi từ tài liệu hàng triệu token gần ngang ngửa người anh em lớn hơn của nó, và viết được một câu trả lời một phát đàng hoàng, là một công cụ khác hẳn với mô hình có thể điều khiển một vòng lặp công cụ cho đến khi hoàn tất.
Hai lưu ý. Các số liệu chỉ số đến từ Artificial Analysis, không phải từ OpenAI, và đơn vị đánh giá đó không đảm bảo rằng hai trang mô hình được hiển thị dựa trên cùng một bản sửa đổi chỉ số trong cùng một ngày — hãy coi những khác biệt dưới một điểm là hướng đi, chứ không phải độ chính xác. Và các số liệu phục vụ là những đo lường định tuyến của chính chúng tôi trong một cửa sổ bảy ngày luân chuyển; chúng dao động giữa các lần đọc và hữu ích để cho thấy hình dạng của sự khác biệt hơn là như một cam kết ở cấp độ dịch vụ.
Có một con số về phục vụ đáng để dừng lại. Thời gian trung vị đến token đầu tiên của Luna là 1,494 ms so với 6,785 ms của Sol — nhanh hơn khoảng 4,5 lần để có token đầu tiên — và thông lượng của nó lại thấp hơn đáng kể một khi quá trình streaming bắt đầu. Với một giao diện trò chuyện mà người dùng đang chờ đợi câu mở đầu, sự đảo ngược đó chính là toàn bộ ý nghĩa của gói này, và đó là lý do vì sao gói miễn phí có thể cho cảm giác nhanh trong khi lại đang chạy mô hình rẻ nhất trong dòng sản phẩm.
Cuộc cạnh tranh mới mẻ trong gia đình
Lợi thế về giá của Luna trong cùng thế hệ đã thu hẹp kể từ khi ra mắt. GPT-6.1 Solra mắt vào ngày 29 tháng 9 với mức giá $2.00 / $10.00 của Sol cùng chỉ số 51.8, và đã cắt giảm mức giá đầu vào được lưu đệm xuống còn $0.10 mỗi triệu token. Điều đó không đụng đến mức giá ngữ cảnh ngắn của Luna — mười xu vào và năm mươi xu ra vẫn rẻ hơn hai mươi lần về chi phí đầu vào so với bất kỳ Sol nào — nhưng nó có nghĩa là tầng phía trên Luna đã trở nên rẻ hơn khi chạy trên lưu lượng được lưu đệm, đúng loại khối lượng công việc mà lợi thế của Luna là lớn nhất. Khoảng cách vẫn còn lớn. Nhưng nó không còn lớn như bảng giá tự nó hàm ý.

Ranh giới phân tầng nằm ở đâu trong thực tế
Chia công việc theo nhu cầu của nhiệm vụ, không phải theo mô hình nào đạt điểm cao hơn.
Luna là lựa chọn đúng đắn cho chat khối lượng lớn, phân loại, trích xuất, kiểm duyệt và tóm tắt trên một tài liệu dài — dòng mà nó ngang bằng với người anh em lớn hơn của mình về truy xuất chính là dòng quyết định liệu một ngữ cảnh lớn có dùng được hay không. Độ trễ token đầu tiên của nó khiến nó trở thành lựa chọn tốt hơn cho bất cứ thứ gì tương tác mà không nặng về suy luận. Và với một xu cho mỗi triệu token được lưu đệm, một pipeline ngữ cảnh ổn định gần như miễn phí ở phần lặp lại.
Sol, hay giờ đây là GPT-6.1 Sol, là lựa chọn đúng đắn ngay khi tác vụ yêu cầu một vòng lặp công cụ, một kế hoạch dài hạn, hoặc một chuỗi bước phải hoàn thành. Khoảng cách trên Terminal-Bench — 43.9 so với 12.6 — là tín hiệu rõ ràng nhất trong so sánh này, và nó tương ứng với kiểu thất bại thực tế: một mô hình rẻ trả lời tốt bước đầu rồi mất mạch. Tham số effort nghĩa là bạn có thể yêu cầu Luna suy luận nhiều hơn, nhưng effort làm tăng số token chứ không nâng trần; nó không biến 12.6 thành 43.9.
Và Astra vẫn là câu trả lời cho những công việc mà chỉ mẫu flagship mới làm được — với mức $10.00 cho đầu vào và $50.00 cho đầu ra, so với mười xu của Luna, đó là một quyết định mà bạn nên có thể biện minh theo từng cuộc gọi thay vì theo từng nhóm.
Phiên bản one-API của lựa chọn này
Điều khó xử của một dòng ba tầng là ranh giới giữa các tầng dịch chuyển theo từng tính năng, và nó dịch chuyển theo từng yêu cầu — cùng một ứng dụng thường muốn dùng Luna cho endpoint này và Sol cho endpoint kế tiếp. Đó là bài toán định tuyến chứ không phải bài toán mua sắm. Cả ba tầng của GPT-6 đều nằm trong cùng một danh mục OrcaRouter, được gọi qua một API tương thích OpenAI đứng trước hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức 0% markup, nên mọi thay đổi giá từ nhà cung cấp ở bất kỳ tầng nào đều có hiệu lực tại đây ngay trong ngày chứ không phải đợi đến kỳ đối chiếu tiếp theo. DSL định tuyến kết hợp việc phân chia một cách tường minh — theo kích thước yêu cầu, theo endpoint, hoặc theo tỷ lệ chia — để luồng phân loại có thể chạy Luna trong khi luồng agentic chạy Sol, và chuyển đổi dự phòng tự động giữa các nhà cung cấp sẽ xử lý một tuyến bị suy giảm thay vì để bạn tự phát hiện điều đó từ một lần chạy thất bại.
Một điều mà điều này không làm được là mang đến cho bạn một Luna hành xử như Sol. Các bậc tồn tại vì các mô hình khác nhau, và những con số ở trên chính là độ lớn của sự khác biệt đó. Thứ mà một khóa duy nhất và một quy tắc định tuyến mang lại cho bạn là khả năng đặt từng yêu cầu vào bậc thực sự phù hợp với nó, thay vì đặt mọi thứ vào bậc đắt đỏ nhất để an toàn hoặc mọi thứ vào bậc rẻ nhất để tiết kiệm ngân sách.

Câu trả lời, theo câu hỏi duy nhất đáng quan tâm
Nếu tác vụ là truy xuất-rồi-trả lời trên một tài liệu lớn, chat hoặc xử lý văn bản hàng loạt, thì GPT-6 Luna chính là hạng phù hợp và thẻ mười xu không phải là một thỏa hiệp — hàng đánh giá khả năng gợi nhớ ngữ cảnh dài nói rằng nó truy xuất tốt ngang với mô hình có giá cao gấp hai mươi lần. Nếu tác vụ cần một agent đa bước để hoàn thành, Luna là sai hạng và lựa chọn trung thực là GPT-6 Sol hoặc GPT-6.1 Sol, nơi giá vẫn thấp về mặt tuyệt đối và các bài đánh giá agentic không còn sụp đổ nữa.
“GPT-6” tự nó, một lần nữa, không phải là thứ bạn có thể gọi. Nó là một tên dòng bao trùm ba ID ở ba mức giá và ba mức trần năng lực khác nhau, và Luna là mẫu nằm ở dưới cùng — rẻ nhất, đạt token đầu tiên nhanh nhất, mẫu đảm nhận gói miễn phí, và là mẫu mà trần của nó lộ ra ngay khi một tác vụ cần nhiều hơn một câu trả lời tự tin duy nhất.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
