
Định giá API GPT-5.6: Các gói Sol, Terra và Luna, Chi phí thực tế và Cách gọi từng gói
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleMỚIGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleMỚIGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMỚIMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
- anthropicAnthropic: Claude Fable 52026-06-0960Trí tuệ77Lập trình
- qwenQwen: Qwen3.7 Plus2026-06-0139Trí tuệ56Lập trình59Toán
GPT-5.6 là dòng sản phẩm chủ lực của OpenAI ra mắt vào tháng 7 năm 2026, và điều quan trọng đối với các nhà phát triển là nó không có một mức giá duy nhất. Sản phẩm có ba cấp độ—Sol, Terra và Luna. Trên OpenAI API, Sol có giá 5 đô la cho mỗi triệu token đầu vào và 30 đô la cho mỗi triệu token đầu ra, Terra có giá 2,50 đô la và 15 đô la, còn Luna có giá 1 đô la và 6 đô la. Mỗi cấp độ đều có giảm giá cho đầu vào đã lưu trong bộ nhớ đệm, cả ba đều chấp nhận đầu vào hình ảnh cũng như văn bản, và cửa sổ ngữ cảnh khoảng 1,05 triệu token với đầu ra lên tới 128K token.
Giá niêm yết chỉ là khởi đầu của chi phí thực tế. Bạn thực sự cần tier nào, bạn cache bao nhiêu, mô hình tạo ra bao nhiêu đầu ra, cùng với một vài quy tắc định giá mà hầu hết các hướng dẫn bỏ qua—prompt trên 272K token, phụ phí cư trú dữ liệu và các bậc dịch vụ—quyết định hóa đơn nhiều hơn nhiều so với mức giá chính thức. Hướng dẫn này phân tích giá của từng tier, nó dùng để làm gì, cách chấm điểm, cách di chuyển từ GPT-5.5, cách gọi nó, và cách so sánh với Claude, GLM, Gemini, DeepSeek và Grok.
Câu trả lời nhanh: tổng quan về giá GPT-5.6
- Ba mức (trên triệu token, đầu vào / đầu ra): Sol $5 / $30, Terra $2.50 / $15, Luna $1 / $6.
- Đầu vào được lưu trong bộ nhớ đệm: $0.50 (Sol), $0.25 (Terra), $0.10 (Luna) cho mỗi triệu token; chi phí ghi vào bộ nhớ đệm bằng 1,25 lần tỷ lệ đầu vào không được lưu trong bộ nhớ đệm.
- Định vị: Sol dành cho công việc lý luận khó nhất và tác nhân, Terra là lựa chọn mặc định cân bằng, Luna dành cho các tác vụ khối lượng lớn, nhạy cảm về chi phí.
- Phương thức: đa phương thức—GPT-5.6 chấp nhận đầu vào hình ảnh cùng với văn bản. Ngữ cảnh ~1.05M token, đầu ra tối đa 128K.
- Hai quy tắc định giá cần lưu ý: các prompt vượt quá 272K token đầu vào được tính phí gấp 2 lần đầu vào và 1.5 lần đầu ra cho toàn bộ yêu cầu, và các endpoint lưu trữ dữ liệu trong khu vực (data-residency) sẽ thêm mức tăng 10%.
- Cách trả ít hơn: Gói giảm 50% so với tiêu chuẩn, bộ nhớ đệm cắt giảm đầu vào lặp lại xuống còn một phần mười, và định tuyến công việc thường lệ xuống bậc thấp hơn giúp tránh đầu ra 30 đô la của Sol.
- Trí tuệ: Artificial Analysis đặt GPT-5.6 Sol gần đầu Bảng chỉ số Trí tuệ (điểm 59).
Giá API GPT-5.6, theo từng bậc

OpenAI định giá GPT-5.6 trên mỗi triệu token, và đầu ra đắt hơn nhiều so với đầu vào ở mọi cấp độ. Các mức giá hiện tại được công bố là:
- GPT-5.6 Sol: $5.00 đầu vào, $0.50 đầu vào đã lưu trong bộ nhớ đệm, $30.00 đầu ra (ghi vào bộ nhớ đệm $6.25).
- GPT-5.6 Terra: $2.50 đầu vào, $0.25 đầu vào đã lưu trong bộ nhớ đệm, $15.00 đầu ra.
- GPT-5.6 Luna: $1.00 đầu vào, $0.10 đầu vào đã lưu cache, $6.00 đầu ra.
Hai chi tiết quan trọng trước khi bạn lên kế hoạch ngân sách. Thứ nhất, tỷ lệ đầu ra chiếm ưu thế trong hầu hết các hóa đơn thực tế, đặc biệt là đối với công việc suy luận và tác nhân (agentic work) nơi mô hình tạo ra các dấu vết dài, lời gọi công cụ và các bản sửa đổi trước khi đưa ra câu trả lời cuối cùng. Thứ hai, không có dòng giá "Sol Ultra" riêng biệt trên trang giá; "Sol Ultra" là một cấu hình suy luận cao hơn của Sol (một thiết lập đa tác nhân), không phải là một cấp độ độc lập—hãy lập ngân sách dựa trên Sol, Terra và Luna.
Mỗi cấp thực sự dùng để làm gì
Luna: khối lượng lớn và nhạy cảm về chi phí
Luna là gói kinh tế với $1 đầu vào và $6 đầu ra. Đây là lựa chọn mặc định phù hợp cho phân loại, trích xuất, định tuyến, tóm tắt, soạn thảo và khối lượng lớn công việc thường nhật, nơi một khác biệt nhỏ về chất lượng không làm thay đổi kết quả. Với giá sáu đô la mỗi triệu token đầu ra, nó đủ rẻ để vận hành ở quy mô lớn và lấy mẫu nhiều lần.
Terra: chế độ mặc định cân bằng
Terra nằm ở mức trung bình với giá $2.50 và $15. Đối với hầu hết các công việc ứng dụng và lập trình, đây là điểm khởi đầu hợp lý: mạnh hơn đáng kể so với Luna trong các tác vụ khó hơn, nhưng với giá đầu ra chỉ bằng một nửa so với Sol. Hãy bắt đầu từ đây, sau đó chỉ chuyển tác vụ lên Sol khi Terra thất bại rõ ràng.
Sol: công việc suy luận và tác nhân khó nhất
Sol là sản phẩm chủ lực ở mức $5 và $30, và Artificial Analysis xếp nó gần đầu trong Chỉ số Trí tuệ của mình. Hãy dành nó cho các kiến trúc khó, gỡ lỗi phức tạp, tác nhân tầm xa và các phân tích có rủi ro cao, nơi một lỗi tránh được đáng giá với mức phí bảo hiểm. Sử dụng Sol cho công việc thường ngày là cách phổ biến nhất để chi tiêu quá mức cho GPT-5.6.
Đến từ GPT-5.5? Gói nào tiết kiệm nhất?
GPT-5.6 Sol có giá giống hệt GPT-5.5 ở mức $5 cho đầu vào và $30 cho đầu ra, vì vậy việc chuyển trực tiếp khối lượng công việc từ GPT-5.5 sang Sol hầu như không thay đổi hóa đơn. Khoản tiết kiệm nằm ở hai bậc giá thấp hơn mới. Terra mang lại chất lượng tương đương GPT-5.5 trên hầu hết các tác vụ với chỉ một nửa giá, do đó cách di chuyển đơn giản nhất là gửi toàn bộ lưu lượng GPT-5.5 hiện tại sang Terra và chỉ nâng cấp các tác vụ bị giảm hiệu suất lên Sol.
Kế hoạch di chuyển thực tế gồm ba bước: chuyển hướng các lệnh gọi GPT-5.5 sang Terra, chạy bộ đánh giá của bạn, và chỉ leo thang các lỗi lên Sol trong khi đẩy các công việc thường ngày rõ ràng xuống Luna. Hầu hết các khối lượng công việc của GPT-5.5 trở nên rẻ hơn theo cách này mà không bị giảm chất lượng có thể đo lường được.
Cách các bậc thực sự ghi điểm


Giá cả chỉ có ý nghĩa khi đặt cạnh năng lực. Trên các số liệu Terminal-Bench 2.1 của riêng OpenAI, các bậc phân chia gần như bạn mong đợi: Sol 88.8%, Sol Ultra 91.9%, Terra 87.4% và Luna 84.7%. Để có bối cảnh, trong cùng bảng đó, GPT-5.5 đạt 85.6%, Claude Opus 4.8 là 78.9%, Claude Fable 5 là 83.1%, và Gemini 3.1 Pro (bản xem trước) là 70.7%. Artificial Analysis riêng biệt cho Sol chỉ số Intelligence Index là 59, gần đỉnh bảng xếp hạng của nó.
Đọc những điều này như những báo cáo từ nhà cung cấp và mang tính định hướng. OpenAI đã công bố một bộ đánh giá hạn chế cho GPT-5.6 và tại thời điểm viết bài, chưa có các điểm chuẩn về lập trình và suy luận truyền thống như SWE-bench Verified hay GPQA, vì vậy hãy sử dụng các điểm số này để quyết định thử nghiệm trên khối lượng công việc của riêng bạn thay vì coi đó là phán quyết cuối cùng.

Tốc độ đọc đầu vào đã lưu trong bộ nhớ đệm của mỗi bậc bằng một phần mười tốc độ đầu vào tươi: $0.50 trên Sol, $0.25 trên Terra, $0.10 trên Luna. Tuy nhiên, việc ghi vào bộ nhớ đệm có chi phí gấp 1,25 lần tốc độ đầu vào không được lưu đệm (khoảng $6,25 trên một triệu token trên Sol), do đó, lưu đệm chỉ có lợi khi một tiền tố ổn định được tái sử dụng đủ lần để thu hồi chi phí ghi—như hướng dẫn hệ thống, một tài liệu lớn, quy tắc kho lưu trữ hoặc phân loại sản phẩm. Hãy đặt nội dung ổn định ở đầu lời nhắc và câu hỏi thay đổi ở cuối, đồng thời tránh chèn dấu thời gian hoặc mã nhận dạng ngẫu nhiên trước ngữ cảnh có thể tái sử dụng.
Bộ nhớ đệm làm giảm chi phí đầu vào lặp lại; nhưng không làm gì cho đầu ra. Bởi vì đầu ra là mặt đắt nhất ở mọi cấp độ, hai đòn bẩy chủ yếu tác động đến hóa đơn GPT-5.6 nhất là lưu trữ tiền tố ổn định và kiểm soát lượng mô hình viết.
Bạn nên chọn cấp độ nào?

Đừng chọn bậc theo danh tiếng. Hãy chọn nó bằng thử nghiệm. Xây dựng một tập nhỏ các nhiệm vụ đại diện với tiêu chí chấp nhận rõ ràng, chạy chúng trên Luna trước, và chỉ nâng cấp những nhiệm vụ thất bại lên Terra, sau đó lên Sol. Đo chi phí trên mỗi nhiệm vụ được chấp nhận, không phải giá token trung bình, bởi vì một bậc rẻ hơn cần ba lần thử có thể tốn kém hơn một bậc mạnh hơn chỉ thành công một lần.
Một thói quen vận hành tiết kiệm tiền thật: ghim chính xác ID mô hình cấp trong mỗi cuộc gọi thay vì dựa vào một bí danh trần trụi, để một yêu cầu thông thường không bao giờ chạy ngầm trên cấp đắt nhất. Khối lượng công việc hỗn hợp thường phân giải thành Luna cho việc chuyển đổi và soạn thảo thông thường, Terra cho việc triển khai và phân tích hàng ngày, và Sol được dành cho thiểu số khó khăn—hầu hết các yêu cầu không bao giờ cần đến hàng đầu cả.
GPT-5.6 so với các đối thủ về giá
GPT-5.6 không tồn tại độc lập. So sánh với thị trường hiện tại (trên một triệu token, đầu vào / đầu ra, giữa năm 2026): Claude Opus 4.8 là $5 / $25, Claude Fable 5—mô hình công khai mạnh nhất của Anthropic—là $10 / $50, GLM 5.2 là $1.40 / $4.40 trên Z.AI (các nhà cung cấp bên thứ ba có thể rẻ hơn), Grok 4.5 là $2 / $6, của Google Gemini 3.5 Flash là khoảng $1.50 / $9, và DeepSeek V4-Pro là khoảng $0.44 / $0.87. Hãy xác nhận từng mức trên trang của nhà cung cấp, vì các mức giá này thay đổi.
Các điểm chính rất cụ thể. GPT-5.6 Sol tương đương Opus 4.8 về đầu vào nhưng đắt hơn về đầu ra ($30 so với $25), vì vậy đối với công việc đại lý nặng về đầu ra, Opus rẻ hơn một chút cho mỗi token trong khi Sol dẫn đầu Chỉ số Thông minh. Terra rẻ hơn cả hai flagship và là lựa chọn giá trị trong gia đình OpenAI. Luna cạnh tranh với các mô hình rẻ hơn về giá, mặc dù Grok 4.5, GLM 5.2, và đặc biệt là DeepSeek còn thấp hơn nữa. Không một cấp độ hay nhà cung cấp nào thắng tất cả, đó chính xác là lý do tại sao định tuyến theo độ khó tốt hơn là cam kết với một mô hình.
Hóa đơn tháng đã được lập

Hãy đặt số liệu vào đó. Đối với một tháng tương đối nặng với 50 triệu token đầu vào và 10 triệu token đầu ra, theo giá niêm yết trước khi lưu bộ nhớ đệm và sử dụng công cụ, phí mô hình sẽ vào khoảng:
- GPT-5.6 Luna: khoảng 110 đô la.
- GPT-5.6 Terra: khoảng $275.
- GPT-5.6 Sol: khoảng $550.
- Để so sánh: GLM 5.2 khoảng $114, Grok 4.5 khoảng $160, Claude Opus 4.8 khoảng $500, Claude Fable 5 khoảng $1,000.
Các tác vụ giống nhau được định tuyến thông minh—Luna và Terra cho phần lớn, Sol cho phần nhỏ khó—đạt mức gần với khoảng $110–$275 hơn là mức phẳng $550 của Sol cho mọi thứ. Khoảng cách đó, nhân lên trong một năm, là toàn bộ lý do cho việc định tuyến dựa trên bậc.
Chi phí ẩn cần lên kế hoạch
Một số quy tắc định giá không xuất hiện trong mức lãi suất cơ bản và gây bất ngờ cho các đội sau đó:
- Các prompt dài: một yêu cầu có hơn 272K token đầu vào sẽ được tính phí gấp 2 lần đầu vào và 1.5 lần đầu ra cho toàn bộ yêu cầu, vì vậy các cuộc gọi ngữ cảnh lớn và big-RAG có thể tăng hơn gấp đôi chi phí.
- Khối lượng đầu ra: đầu ra có thể lên đến sáu lần tốc độ đầu vào, vì vậy đầu ra không giới hạn hoặc có lý luận cao là rủi ro chi tiêu quá mức hàng đầu.
- Tầng dịch vụ: Xử lý ưu tiên có giá gấp đôi so với mức tiêu chuẩn (khoảng $10 đầu vào / $60 đầu ra trên Sol); Flex và Batch rẻ hơn. Chọn tầng dịch vụ một cách chủ động bằng cài đặt service_tier.
- Cư trú dữ liệu: các điểm cuối xử lý khu vực thêm mức tăng 10% cho các mô hình được phát hành vào hoặc sau ngày 5 tháng 3 năm 2026, bao gồm GPT-5.6.
- Vòng lặp và thử lại của tác nhân: hướng dẫn, công cụ và lịch sử được gửi lại mỗi lượt, và một yêu cầu dài thất bại sẽ lãng phí đầu vào mà bạn đã trả tiền.
- Trôi bậc: để mọi thứ trên Sol "cho an toàn" là thói quen đắt đỏ nhất.
Các cách để thanh toán ít hơn
Ba đòn bẩy cắt giảm hóa đơn GPT-5.6 mà không thay đổi những gì bạn xây dựng. Batch: các yêu cầu không đồng bộ qua Batch tier được giảm 50% so với giá tiêu chuẩn, lý tưởng cho khối lượng lớn công việc Luna không nhạy cảm với độ trễ. Caching: tái sử dụng một tiền tố ổn định đủ lần để vượt qua mức phí viết thêm 1.25x và đầu vào lặp lại giảm xuống còn một phần mười. Routing: gửi công việc thông thường đến Luna hoặc Terra và chỉ leo thang phần nhỏ khó đến Sol, và giữ prompt dưới ngưỡng 272K khi có thể.
Cách gọi GPT-5.6
GPT-5.6 có sẵn thông qua OpenAI API và thông qua các cổng tương thích với OpenAI, do đó tích hợp vẫn ổn định khi bạn thay đổi mô hình hoặc bậc dịch vụ đằng sau nó. Sau đây là một mẫu chuẩn tương thích với OpenAI; hãy xác nhận ID mô hình hiện tại trước khi sử dụng trong sản xuất, và cố định bậc dịch vụ chính xác thay vì một bí danh trần.
from openai import OpenAI
client = OpenAI(base_url="https://www.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(
model="openai/gpt-5.6-terra",
messages=[{"role": "user", "content": "Tái cấu trúc mô-đun này và giải thích các rủi ro."}],
)
print(response.choices[0].message.content)
Chuyển đổi bậc là một thay đổi một dòng trong trường model, điều này làm cho việc định tuyến dựa trên độ khó trở nên thực tế: gửi các cuộc gọi thông thường đến Luna hoặc Terra và chỉ chuyển các cuộc gọi khó lên Sol.
Thử nghiệm GPT-5.6 thông qua OrcaRouter
Một gateway giúp GPT-5.6 dễ áp dụng hơn vì hai lý do. Thứ nhất, cùng một client tương thích với OpenAI có thể gọi cả ba tầng và các mô hình so sánh như Claude Opus 4.8, GLM 5.2 và Grok 4.5, vì vậy bạn có thể chạy một bộ đánh giá trên tất cả mà không cần viết lại mã tích hợp và đo chi phí thực tế cho mỗi tác vụ được chấp nhận—bao gồm phí công cụ, các lần thử lại và phụ phí 272K. Thứ hai, một gateway có thể chuyển đổi dự phòng giữa các nhà cung cấp và áp dụng giới hạn ngân sách, vì vậy một vấn đề về dung lượng tạm thời hoặc một cuộc gọi Sol lạc sẽ không phá hỏng cả tháng. Xác nhận đường dẫn GPT-5.6 trực tiếp và ID tầng hiện tại trước khi bạn xây dựng ngân sách dựa trên chúng.

Bước tiếp theo: Đăng ký OrcaRouter và chạy so sánh các cấp độ GPT-5.6 của riêng bạn qua một điểm cuối API.
Câu hỏi thường gặp
Sự khác biệt giữa GPT-5.6 Sol, Terra và Luna là gì?
Chúng là ba cấp độ của cùng một dòng sản phẩm với mức giá và khả năng khác nhau. Sol là sản phẩm chủ lực cho công việc khó nhất ($5/$30), Terra là lựa chọn mặc định cân bằng ($2.50/$15), và Luna là cấp độ kinh tế cho các tác vụ khối lượng lớn ($1/$6). Hãy chọn cấp thấp nhất vượt qua bài kiểm tra của bạn.
Có gói giá GPT-5.6 Sol Ultra không?
Không. "Sol Ultra" là một cấu hình lý luận cao hơn, đa tác nhân của Sol, không phải là một dòng riêng trên trang giá. Nó sử dụng nhiều token hơn và tốn kém hơn cho mỗi tác vụ, nhưng bạn ngân sách nó như Sol với nỗ lực cao hơn.
Tại sao hóa đơn GPT-5.6 của tôi lại vượt quá mức ước tính đơn giản?
Thông thường các token đầu ra, phí phụ trội cho prompt dài 272K (2x đầu vào, 1.5x đầu ra), bậc dịch vụ Priority, phí nâng cấp cư trú dữ liệu, hoặc các lần thử lại. Ghi lại toàn bộ chuỗi yêu cầu và đo lường chi phí cho mỗi tác vụ được chấp nhận thay vì cho mỗi prompt.
Tôi có thể tinh chỉnh GPT-5.6 không, và có gói miễn phí không?
Không cho cả hai. GPT-5.6 không hỗ trợ tinh chỉnh, và API không có gói miễn phí—việc thanh toán bắt đầu từ token đầu tiên. Quyền truy cập miễn phí chỉ tồn tại trong một số gói ChatGPT, đó là một sản phẩm riêng biệt với API.
Gói ChatGPT nào có thể sử dụng cấp độ nào?
Nó khác nhau tùy theo sản phẩm. Trong ChatGPT Work và Codex, Free và Go có thể sử dụng Terra trong khi Plus trở lên có thể chọn giữa Sol, Terra và Luna; cài đặt ultra cao nhất bị giới hạn cho Pro và Enterprise. Hãy xem các gói API và ChatGPT là riêng biệt—một khóa API không kế thừa quyền truy cập của đăng ký.
Điểm mấu chốt
Câu chuyện về giá của GPT-5.6 là sự phân cấp. Sol ở mức $5/$30 dẫn đầu bảng xếp hạng trí thông minh, Terra ở mức $2.50/$15 là lựa chọn mặc định về giá trị và là nơi tự nhiên cho lưu lượng truy cập từ GPT-5.5 trước đây, còn Luna ở mức $1/$6 xử lý khối lượng lớn. Bộ nhớ đệm giảm đầu vào lặp lại xuống một phần mười (sau phí phụ thu ghi 1.25 lần), Batch có giá một nửa, nhưng đầu ra lại là mặt đắt đỏ ở mọi cấp và các lời nhắc dài trên 272K phải chịu phụ phí.
Xử lý ba cấp độ như một bài toán định tuyến, không phải một giao dịch mua đơn lẻ: mặc định mức thấp, leo thang khi thất bại, lưu đệm ngữ cảnh ổn định, sử dụng Batch nếu độ trễ cho phép, và duy trì một mô hình so sánh có thể truy cập qua cùng một điểm cuối. Điều đó tạo ra chi phí mỗi tác vụ được chấp nhận thấp hơn nhiều so với việc trả giá cao cấp cho công việc thông thường.
