
Giá GPT-5.6 Sau Khi Cắt Giảm: Luna vs Terra vs Sol, và Nên Dùng Gói Nào
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMỚIMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2275 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
Sau đợt giảm giá ngày 30 tháng 7 năm 2026 của OpenAI, dòng GPT-5.6 — gồm GPT-5.6 Luna, GPT-5.6 Terra và GPT-5.6 Sol — chưa bao giờ rẻ hơn để vận hành ở quy mô lớn. Một tuần sau, vào ngày 6 tháng 8, OpenAI đã đưa các tầng tương tự vào chính ChatGPT: GPT-5.6 Luna đang trở thành mô hình mặc định cho các tài khoản miễn phí và Go với hội thoại văn bản không giới hạn, trong khi GPT-5.6 Sol đã được cập nhật cho Plus và Pro. Nhưng ba tầng này có mức giá rất khác nhau, và việc chọn đúng tầng (cộng với việc sử dụng caching, batch và routing tốt) chính là đòn bẩy lớn nhất trên hóa đơn API của bạn. Hướng dẫn này trình bày toàn bộ mức giá sau cắt giảm, các ví dụ chi phí cụ thể, cách từng tầng so sánh với đối thủ cạnh tranh, và cách định tuyến giữa chúng qua một endpoint.
Giá được tính theo triệu token (đầu vào / đầu ra), phản ánh biểu giá sau khi cắt giảm như đã công bố và các trang mô hình chuyển tiếp của OrcaRouter; giá theo bậc và giá cache lấy từ các trang mô hình của OrcaRouter, còn số liệu của đối thủ cạnh tranh được ghi rõ nguồn. Chi tiết triển khai ChatGPT trong bài này là theo công bố của OpenAI vào ngày 6 tháng 8 năm 2026 — do nhà cung cấp báo cáo, không được đo lường độc lập. Giá có thể thay đổi — hãy xác minh trước khi xây dựng.
Tóm tắt: Dài quá, không đọc
GPT-5.6 Luna ($0.20 / $1.20) là con ngựa thồ xử lý khối lượng lớn; Terra ($2 / $12) là lựa chọn trung gian cân bằng; Sol ($5 / $30) là sản phẩm chủ lực dành cho những tác vụ suy luận khó nhất và lập trình tác nhân. Cả ba đều dùng chung ngữ cảnh ~1.05M token và đầu ra tối đa 128K. Prompt caching và tùy chọn xử lý theo lô giúp cắt giảm chi phí hơn nữa, còn các đầu vào rất dài sẽ đưa bạn lên một tầng cao hơn. Về phía người dùng phổ thông, vào ngày 6 tháng 8, OpenAI đã công bố rằng GPT-5.6 Luna sẽ trở thành mặc định cho các tài khoản ChatGPT Free và Go với trò chuyện chỉ văn bản không giới hạn, và một phiên bản GPT-5.6 Sol được cập nhật đang được triển khai dần cho Plus và Pro. Hãy dùng Luna cho đa số tác vụ dễ, Terra khi bạn cần nhiều hơn, và chỉ dùng Sol ở nơi nó xứng đáng với chi phí bỏ ra — đồng thời định tuyến theo độ khó qua một endpoint tương thích OpenAI để giảm thiểu chi phí.
Những điểm chính rút ra
• Luna: $0.20 / $1.20 mỗi 1M token — nhanh, rẻ, phù hợp cho công việc khối lượng lớn, nhạy cảm với độ trễ.
• Terra: $2 / $12 — tầm trung cân bằng cho các tác vụ khó hơn không cần đến flagship.
• Sol: $5 / $30 — sản phẩm hàng đầu cho suy luận sâu, lập trình quy mô lớn và các tác nhân tầm xa.
• Bộ nhớ đệm và xử lý theo lô giúp giảm chi phí hơn nữa; đầu vào dài sẽ đưa bạn đến một mức giá đắt hơn cho ngữ cảnh dài.
• ChatGPT (OpenAI công bố, ngày 6 tháng 8): Luna trở thành mặc định cho gói miễn phí/Go với số lượng trò chuyện văn bản không giới hạn; Sol nhận được bản cập nhật về độ tin cậy cho Plus/Pro.
• Đòn bẩy tiết kiệm lớn nhất: phân luồng theo độ khó — đừng trả giá Sol cho việc Luna có thể làm.
Giá cơ bản mới của GPT-5.6
Đây là mức giá cơ bản sau cắt giảm trên mỗi triệu token đầu vào/đầu ra: Luna $0,20 / $1,20 (giảm từ $1 / $6), Terra $2 / $12 (giảm từ $2,50 / $15) và Sol $5 / $30 (không đổi). Hai mức giá rẻ hơn đã được cắt giảm vào ngày 30 tháng 7 năm 2026; mức cao nhất vẫn được giữ nguyên. Nói một cách đơn giản, các mức giá thấp hiện được định giá cho việc mở rộng quy mô, trong khi mức cao nhất vẫn thuộc phân khúc cao cấp.

Giá theo bậc, lưu trữ và theo lô
Tỷ lệ cơ bản chỉ là điểm khởi đầu. Giá của GPT-5.6 có ba yếu tố điều chỉnh làm thay đổi đáng kể chi phí thực tế của bạn:
• Các mức giá theo ngữ cảnh dài. Giá tăng dần cho các đầu vào rất dài. Trên các trang chuyển tiếp của OrcaRouter, Luna có giá $0.20 / $1.20 cho đến mức ngữ cảnh lớn và $0.40 / $1.80 vượt trên mức đó; Sol có giá $5 / $30 ở mức cơ bản và $10 / $45 ở mức lớn nhất. Mức giá được chọn dựa trên số lượng token đầu vào của mỗi yêu cầu, vì vậy một vài lời nhắc khổng lồ có thể âm thầm tăng giá trung bình của bạn.
• Bộ nhớ đệm lời nhắc. Ngữ cảnh được tái sử dụng được tính phí với mức chiết khấu lớn — phí đọc bộ nhớ đệm của Luna là khoảng $0,02 mỗi triệu token (so với $0,20 khi mới), phí ghi bộ nhớ đệm khoảng $0,25; phí đọc bộ nhớ đệm của Sol là khoảng $0,50 (so với $5 khi mới). Đối với tác nhân và trò chuyện có lời nhắc hệ thống ổn định, bộ nhớ đệm thường là khoản tiết kiệm lớn nhất.
{{1}}Hàng loạt.{{/1}} {{2}}Các tác vụ không khẩn cấp chạy không đồng bộ với mức chiết khấu — lý tưởng cho phân loại khối lượng lớn, đánh giá và tạo nội dung ngoại tuyến khi độ trễ không quan trọng.{{/2}}
Các ví dụ tính toán: chi phí thực tế là bao nhiêu
Các con số cụ thể làm cho các mức giá trở nên thực tế. Lấy ví dụ 10 triệu token mỗi tháng với tỷ lệ 70% đầu vào / 30% đầu ra (một sự kết hợp điển hình cho chat/agent):
• Luna: khoảng $5 mỗi tháng (khoảng $4.37 với bộ nhớ đệm prompt).
• Terra: khoảng 50 đô la mỗi tháng.
• Sol: khoảng 125 đô la mỗi tháng (khoảng 109 đô la với bộ nhớ đệm).
Đó là mức chênh 25 lần giữa Luna và Sol cho cùng một khối lượng — chính vì vậy việc khớp từng yêu cầu với bậc rẻ nhất đủ khả năng đáp ứng lại quan trọng hơn bất kỳ mức giá đơn lẻ nào. (Các con số này khớp với máy tính chi phí trên trang của OrcaRouter, vốn ước tính từ giá niêm yết; con số thực tế của bạn phụ thuộc vào bộ nhớ đệm và tỷ lệ đầu vào/đầu ra của bạn.)
Mỗi cấp thực sự dùng để làm gì
GPT-5.6 Luna — con ngựa thồ khối lượng lớn
Luna là tầng dịch vụ nhanh, tiết kiệm chi phí, được tối ưu cho các khối lượng công việc lớn, nhạy cảm với độ trễ: chat, phân loại, trích xuất, định tuyến và các tác vụ agentic nhẹ, với thời gian đến token đầu tiên ở phân vị p50 khoảng 1,65 giây. Sau mức cắt giảm, ở mức giá $0,20 / $1,20, nó được định giá để cạnh tranh trực tiếp với các mô hình mở giá rẻ — lựa chọn mặc định cho phần lớn các cuộc gọi đơn giản. Đây cũng là tầng dịch vụ mà OpenAI đang hướng ChatGPT tiêu dùng đến: theo thông báo ngày 6 tháng 8, GPT-5.6 Luna đang trở thành mô hình mặc định cho các tài khoản Free và Go, với chat chỉ văn bản được mở không giới hạn và một nút Think mới cho khả năng suy luận cao hơn trên các câu hỏi khó sẽ ra mắt vào tuần sau (giới hạn về tệp, hình ảnh và giọng nói vẫn được giữ nguyên). OpenAI cho biết Luna giảm 62% lỗi thực tế so với GPT-5.5 Instant mà nó thay thế — một con số do nhà cung cấp công bố, nhưng là tín hiệu rõ ràng rằng tầng khối lượng lớn chính là nơi công ty đang hướng phần lớn lưu lượng truy cập của mình.
GPT-5.6 Terra — trung gian cân bằng
Terra nằm giữa phân khúc phổ thông và cao cấp: mạnh hơn Luna cho các tác vụ suy luận và lập trình phức tạp hơn, nhưng rẻ hơn nhiều so với Sol. Với mức giá $2 / $12, đây là lựa chọn mặc định hợp lý khi Luna chưa đủ mạnh nhưng bạn không cần đến bản cao cấp — các tác vụ trích xuất, soạn thảo và đa bước ở mức độ phức tạp trung bình mà vẫn chạy được ở quy mô lớn.
GPT-5.6 Sol — sản phẩm chủ lực
Sol được xây dựng cho những công việc khó khăn nhất: suy luận đa bước sâu, phát triển phần mềm quy mô lớn và quy trình tác tử dài hạn, duy trì sự mạch lạc xuyên suốt ngữ cảnh ~1,05 triệu token và đầu ra lên tới 128K. Với mức giá $5 / $30 (gói cơ bản), đây là lựa chọn cao cấp — hãy dành nó cho những tác vụ thực sự cần đến, như lập trình đa tệp phức tạp hoặc các phiên chạy tác tử dài. Vào ngày 6 tháng 8, OpenAI cũng đã cập nhật GPT-5.6 Sol trong ChatGPT cho người dùng Plus và Pro: công ty cho biết phiên bản trò chuyện đáng tin cậy hơn về mặt sự kiện — giảm 68% lỗi sai sự thật, theo OpenAI — và đưa ra câu trả lời tập trung hơn, cùng thanh trượt mới để kiểm soát mức độ nỗ lực suy luận được áp dụng. Bản cập nhật chỉ áp dụng cho phiên bản trò chuyện (bản Sol chạy cho Work và Codex vẫn không thay đổi), và mức giá API vẫn giữ nguyên $5 / $30.
Lưu ý về token suy luận
GPT-5.6 là các mô hình suy luận, vì vậy chi phí đầu ra thực tế có thể vượt quá ước tính đơn giản: khi bật suy luận, các token suy luận nội bộ được tính phí như đầu ra. Đối với các prompt khó với mức suy luận cao, điều đó có thể chiếm ưu thế trong hóa đơn của bạn. Điều chỉnh mức suy luận theo tác vụ (thấp hoặc tắt đối với các lời gọi đơn giản), giới hạn token đầu ra nếu có thể, và đo lường mức sử dụng thực tế. Mức giá mỗi token rẻ hơn giúp ích; tạo ra ít token hơn giúp ích nhiều hơn.
Cách mỗi cấp độ so sánh với các đối thủ cạnh tranh
Việc cắt giảm đã tái định vị GPT-5.6 so với các đối thủ trên thị trường. Theo báo cáo, mức $0,20 / $1,20 của Luna hiện thấp hơn Claude Haiku 4.5 khoảng 5 lần về đầu vào và 4 lần về đầu ra, còn mức $2 / $12 của Terra thấp hơn giá tiêu chuẩn của Claude Sonnet 5 (được báo cáo ở mức $3 / $15). So với các mô hình trọng số mở, Luna nằm gần mức sàn do dòng V4 của DeepSeek và GLM-5.2 của Zhipu thiết lập (khoảng $1,20 / $4,10), với các phân khúc Qwen và Gemini Flash ở gần đó. Điểm mấu chốt: đối với công việc nhạy cảm về chi phí, Luna hiện có sức cạnh tranh với những mô hình có năng lực rẻ nhất thay vì là lựa chọn cao cấp thay thế chúng — trong khi Sol vẫn là phân khúc cao cấp thực sự dành cho năng lực mà bạn không thể có được với giá rẻ.
Đòn bẩy tiết kiệm thực sự: định tuyến theo độ khó
Gói rẻ nhất không phải là một bậc giá duy nhất — mà là khớp từng yêu cầu với mô hình ít tốn kém nhất có thể xử lý được. Trong thực tế: gửi các lệnh gọi dễ, khối lượng lớn đến Luna (hoặc một mô hình mở giá rẻ), nâng cấp lên Terra cho các tác vụ khó hơn, và chỉ dùng Sol cho phần thiểu số thực sự khó. Kết hợp với bộ nhớ đệm và xử lý theo lô, cách này thường giúp cắt giảm chi phí nhiều hơn hẳn bất kỳ thay đổi giá đơn lẻ nào. Điểm hạn chế nằm ở vận hành: bạn không muốn tích hợp lại ba bậc OpenAI cộng với các lựa chọn mô hình mở một cách riêng lẻ.
Truy cập cả ba (và các đối thủ rẻ hơn) qua một điểm cuối
Đây là lúc một bộ định tuyến trung lập với nhà cung cấp phát huy tác dụng. OrcaRouter cung cấp GPT-5.6 Luna, Terra và Sol — với cùng mức giá sau cắt giảm, 0% phụ phí — thông qua một endpoint tương thích OpenAI, cùng với các mô hình mở rẻ hơn như DeepSeek V4 Pro, GLM-5.2 và Qwen. Việc chuyển đổi bậc (hoặc thử nghiệm A/B Luna với một mô hình mở) chỉ là một thay đổi cấu hình, không phải tích hợp lại, và bạn có thể định tuyến từng yêu cầu đến lựa chọn nào rẻ nhất.

Bảng giá Luna sau khi cắt giảm được hiển thị trên trang mô hình của chính OrcaRouter với giá niêm yết — $0.20 / $1.20 cho mỗi triệu token — vì bộ định tuyến chuyển thẳng giá của nhà cung cấp với mức tăng 0%, kèm theo máy tính chi phí ngay trên trang cho hóa đơn hàng tháng điển hình. Ngoài ra còn có gói miễn phí và trang Offers để tiết kiệm thêm.

Câu hỏi thường gặp
Giá của GPT-5.6 sau khi cắt giảm là bao nhiêu?
Luna $0.20 / $1.20, Terra $2 / $12, và Sol $5 / $30 trên mỗi triệu token đầu vào/đầu ra. Luna và Terra đã được giảm giá vào ngày 30 tháng 7 năm 2026; Sol không thay đổi.
Tôi nên sử dụng gói GPT-5.6 nào?
Luna cho khối lượng lớn, công việc nhạy cảm với độ trễ; Terra cho các tác vụ khó hơn nhưng không cần mô hình hàng đầu; Sol cho suy luận khó nhất và lập trình agentic. Định tuyến theo độ khó để tối thiểu hóa chi phí.
GPT-5.6 Luna có miễn phí trên ChatGPT không?
OpenAI đã thông báo vào ngày 6 tháng 8 rằng GPT-5.6 Luna sẽ trở thành mô hình mặc định cho các tài khoản ChatGPT miễn phí và Go, với các cuộc trò chuyện chỉ văn bản không giới hạn; vẫn có giới hạn đối với tải tệp, hình ảnh và công cụ giọng nói, và một nút Think cho suy luận cao hơn đang được triển khai riêng. Đây là các kế hoạch do OpenAI công bố, chưa được xác minh độc lập.
GPT-5.6 có giá bao nhiêu mỗi tháng?
Với 10M token/tháng (70% input): khoảng $5 trên Luna, $50 trên Terra và $125 trên Sol — chênh lệch 25 lần, trước khi caching. Chi phí thực tế của bạn phụ thuộc vào caching và tỷ lệ input/output của bạn.
Cả ba gói có cùng cửa sổ ngữ cảnh không?
Vâng — khoảng ngữ cảnh 1.05M token và tối đa 128K token đầu ra, với hỗ trợ thị giác, công cụ, JSON và suy luận.
Bộ nhớ đệm prompt ảnh hưởng đến chi phí như thế nào?
Bộ nhớ đệm giúp giảm mạnh chi phí cho các ngữ cảnh lặp lại — chi phí đọc bộ nhớ đệm của Luna khoảng 0,02 USD mỗi triệu token so với 0,20 USD cho dữ liệu mới — vì vậy hãy tái sử dụng các prompt đã được lưu trong bộ nhớ đệm bất cứ khi nào có thể. Ngược lại, đầu vào dài có thể đưa bạn lên một mức giá đắt hơn cho ngữ cảnh dài.
Các bậc này so sánh như thế nào với các mô hình của Anthropic hoặc các mô hình mở?
Theo báo cáo, Luna rẻ hơn Claude Haiku 4.5 (khoảng 5x đầu vào / 4x đầu ra) và Terra thấp hơn Claude Sonnet 5 ($3 / $15). Luna cũng gần mức giá sàn của các mô hình mở giá rẻ (DeepSeek, GLM-5.2 ~$1.20/$4.10).
Tôi có thể sử dụng cả ba cấp độ cùng nhau ở đâu?
Thông qua endpoint duy nhất tương thích OpenAI của OrcaRouter với mức phụ phí 0%, cùng với các mô hình mở rẻ hơn để định tuyến dựa trên độ khó.
Kết luận
Sau đợt cắt giảm giá, GPT-5.6 Luna ($0.20 / $1.20) và Terra ($2 / $12) là lựa chọn hấp dẫn cho công việc khối lượng lớn và tầm trung, trong khi Sol ($5 / $30) vẫn là flagship cao cấp — mức chênh lệch chi phí 25 lần, phần thưởng xứng đáng cho việc định tuyến thông minh. Việc triển khai cho người dùng phổ thông càng củng cố sự phân hóa: OpenAI đang biến Luna thành lựa chọn mặc định miễn phí, trong khi giữ bản cập nhật độ tin cậy của Sol cho các gói trả phí — đối với các nhà phát triển API, đây chính là một lý do nữa để định tuyến lưu lượng đơn giản đến Luna. Khoản tiết kiệm lớn nhất đến từ việc định tuyến theo độ khó, tận dụng bộ nhớ đệm và xử lý theo lô, cũng như kiểm soát token suy luận thay vì mặc định chọn một cấp độ duy nhất. Làm được điều đó dễ dàng nhất qua một endpoint duy nhất với mức chênh lệch giá 0% như OrcaRouter, nơi cả ba cấp độ (với mức giá mới) nằm cạnh các mô hình mở rẻ hơn mà bạn sẽ muốn so sánh.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
