
OpenAI cắt giảm giá API GPT-5.6: Điều gì đã thay đổi, tại sao và cách nhận nó
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Vào ngày 30 tháng 7 năm 2026, OpenAI đã cắt giảm giá API của hai mẫu GPT-5.6 có chi phí thấp hơn — giảm mạnh mức giá rẻ nhất và cắt giảm mức giá trung bình. Ba tuần sau, họ chuyển sang mẫu chủ lực: vào ngày 21 tháng 8 năm 2026, OpenAI thông báo rằng giá API GPT-5.6 Sol sẽ giảm hơn 20% trong ba tháng tới khi công ty nỗ lực vận hành mô hình hiệu quả hơn. Bài viết này giải thích chính xác những gì đã thay đổi trong cả hai đợt, kỹ thuật đằng sau chúng, cách các mức giá mới so với đối thủ cạnh tranh, các chi phí ẩn cần lưu ý, cách cắt giảm hóa đơn của bạn hơn nữa — và các mức giá thấp hơn đã có hiệu lực trên OrcaRouter với mức tăng giá 0%.
Mọi số liệu dưới đây đều được ghi rõ nguồn. Giá được tính trên mỗi triệu token (đầu vào / đầu ra). Mức giá Luna và Terra phản ánh bảng giá ngày 30 tháng 7 năm 2026 của OpenAI theo các nguồn tin bao gồm Unite.AI; mức giảm giá Sol phản ánh thông báo ngày 21 tháng 8 năm 2026 của OpenAI, với giá trên mỗi token theo các nguồn tin bao gồm Runtimewire và Reuters. Các trang mô hình chuyển tiếp (pass-through) của OrcaRouter hiển thị cùng các con số; số liệu của đối thủ cạnh tranh được ghi rõ nguồn. Giá có thể thay đổi — hãy kiểm tra trước khi xây dựng.
TL;DR. OpenAI đã hạ giá GPT-5.6 Luna xuống còn 0,20 USD / 1,20 USD (từ 1 USD / 6 USD, giảm ~80%) và GPT-5.6 Terra xuống còn 2 USD / 12 USD (từ 2,50 USD / 15 USD, giảm ~20%) vào ngày 30/7. Ngày 21/8, hãng mở rộng ưu đãi sang dòng chủ lực: giá API GPT-5.6 Sol giảm hơn 20% trong ba tháng tới — xuống còn 4 USD / 20 USD mỗi triệu token từ mức 5 USD / 30 USD, theo OpenAI — đồng thời tín dụng Codex và ChatGPT Work tính theo token mua được nhiều hơn, còn hạn mức sử dụng thuê bao không đổi. Hai cải tiến hiệu quả đã bù đắp cho đợt giảm giá tháng 7: nhân GPU được viết lại (giảm ~20% chi phí phục vụ) và mô hình nháp giải mã suy đoán được thiết kế lại (tạo token nhanh hơn 15%+). Nếu bạn định tuyến qua điểm cuối trung lập về nhà cung cấp, markup 0% như OrcaRouter, mức giá mới đã có hiệu lực — cùng giá, một API tương thích OpenAI, với mọi mô hình đối thủ bên cạnh để so sánh và định tuyến.
Những điểm chính cần ghi nhớ
• GPT-5.6 Luna: hiện là $0,20 / $1,20 cho mỗi 1 triệu token, giảm từ $1 / $6 — giảm khoảng 80%.
• GPT-5.6 Terra: hiện $2 / $12, giảm từ $2.50 / $15 — mức giảm khoảng 20%.
• GPT-5.6 Sol (bản cao cấp): hiện là $4 / $20 trong ba tháng tới, giảm từ $5 / $30 — mức giảm >20% được công bố vào ngày 21 tháng 8 năm 2026.
• Tín dụng theo token của Codex & ChatGPT Work có giá trị hơn: input của Sol giảm xuống còn 100 tín dụng và output xuống còn 500 tín dụng cho mỗi 1 triệu token (từ 125 / 750).
• Gói đăng ký không thay đổi: Plus, Pro và Business vẫn bao gồm hạn mức sử dụng, giới hạn năm giờ/tuần và tỷ lệ tín dụng kế thừa đều không bị ảnh hưởng.
• Tại sao: OpenAI mô tả cả hai vòng như những khoản lợi từ hiệu quả — các kernel GPU sản xuất được viết lại (giảm ~20% chi phí phục vụ) cùng với thiết kế lại mô hình nháp giải mã suy đoán (hiệu quả tạo token tăng 15%+), theo bài đăng kỹ thuật ngày 29 tháng 7 của OpenAI.
Cách lấy: mức chiết khấu đã được phản ánh trên OrcaRouter (0% phụ phí) — Luna ở $0.20 / $1.20, Sol ở $4 / $20 — thông qua một endpoint tương thích OpenAI.
Chính xác thì điều gì đã thay đổi?
Họ mô hình GPT-5.6 của OpenAI được vận hành theo bậc thang phân tầng: {{1}}Luna (nhanh, rẻ nhất), Terra (trung cấp) và Sol (cao cấp){{/1}}. Đợt cắt giảm ngày 30 tháng 7 đã ảnh hưởng đến hai phân khúc rẻ hơn. Theo bảng giá được công bố, GPT-5.6 Luna đã giảm từ $1 / $6 xuống $0,20 / $1,20 cho mỗi triệu token đầu vào/đầu ra — {{2}}tức giảm khoảng 80% cho cả đầu vào lẫn đầu ra{{/2}} — và GPT-5.6 Terra giảm từ $2,50 / $15 xuống $2 / $12, {{3}}khoảng 20%{{/3}}. GPT-5.6 Sol, mô hình cao cấp được xây dựng cho các tác vụ suy luận khó nhất và lập trình tác nhân (agentic coding), {{4}}không bị ảnh hưởng trong ngày hôm đó{{/4}} — nhưng vào ngày 21 tháng 8 năm 2026, OpenAI đã công bố đợt cắt giảm tạm thời cho mô hình này: {{5}}giá API giảm hơn 20% trong ba tháng tới{{/5}}, xuống còn $4 cho mỗi triệu token đầu vào và $20 cho mỗi triệu token đầu ra, {{6}}với đầu vào được lưu trong bộ nhớ đệm (cached input) giảm từ $0,50 xuống $0,40{{/6}}. Thông báo tương tự cũng cho biết {{7}}số tín dụng (credits) bạn mua sẽ dùng được nhiều hơn trong Codex ở các gói tính theo token{{/7}}, và {{8}}mức sử dụng bao gồm trong đăng ký của bạn vẫn giữ nguyên{{/8}}.
Mức giá cơ bản trên mỗi token không phải là toàn bộ câu chuyện. Định giá GPT-5.6 cũng có các mức theo độ dài đầu vào (ngữ cảnh rất dài chuyển sang mức giá cao hơn), chiết khấu bộ nhớ đệm prompt (đầu vào được lưu cache rẻ hơn nhiều so với đầu vào mới) và tùy chọn batch (các tác vụ không đồng bộ được giảm giá). Cả ba yếu tố này đều áp dụng trong đợt cắt giảm, nên giá thực tế cho khối lượng công việc nặng về cache hoặc batch có thể còn thấp hơn nữa. Hãy lưu ý mức ngữ cảnh dài theo hướng ngược lại: đưa vào các prompt khổng lồ có thể đẩy bạn lên một mức cao hơn.

Hai tối ưu hóa đằng sau phần cắt
Đây không phải là một động thái bán lỗ để thu hút khách hàng — OpenAI coi đó là một khoản cổ tức từ hiệu quả. Trong một bài đăng kỹ thuật ngày 29 tháng 7 năm 2026, các thành viên đội ngũ kỹ thuật của OpenAI đã mô tả các tối ưu hóa trong suy luận và khung tác nhân (agent harness) đằng sau Codex và ChatGPT Work. Hai điểm nổi bật. Thứ nhất, việc viết lại các nhân GPU (GPU kernel) trên toàn bộ hạ tầng sản xuất — với Sol, chạy bên trong Codex, được dùng để viết lại chính các nhân của công ty — mà OpenAI cho biết đã cắt giảm chi phí phục vụ từ đầu đến cuối khoảng 20%. Thứ hai, một mô hình dự thảo giải mã theo dự đoán (speculative-decoding) được thiết kế lại, được báo cáo là đã cải thiện hiệu quả tạo token hơn 15%. Chi phí phục vụ thấp hơn, được chuyển tới khách hàng dưới dạng giá thấp hơn ở các gói dung lượng cao, là câu chuyện chính — và đó là cái nhìn thoáng qua về một vòng phản hồi mà toàn ngành đang theo đuổi: sử dụng các mô hình tiên tiến (frontier models) để tối ưu hóa chính hạ tầng phục vụ chúng.
Đợt cắt giảm Sol được công bố vào ngày 21 tháng 8 cũng được trình bày theo cùng một cách. Theo OpenAI, mức giảm — hơn 20% trong ba tháng tới — được đưa ra khi công ty làm cho mô hình vận hành hiệu quả hơn, và rõ ràng đây là biện pháp tạm thời chứ không phải là một đợt điều chỉnh giá vĩnh viễn.
Các mức giá mới so sánh như thế nào
Đợt cắt giảm này nhắm thẳng vào đối thủ cạnh tranh. Theo báo cáo của Unite.AI, mức giá mới $0,20 / $1,20 của Luna rẻ hơn khoảng 5 lần ở đầu vào và khoảng 4 lần ở đầu ra so với Haiku 4.5 của Anthropic, còn mức giá mới $2 / $12 của Terra nằm dưới mức giá tiêu chuẩn của Claude Sonnet 5 (được báo cáo ở mức $3 / $15, có hiệu lực sau ngày 31/8/2026). So với các mô hình trọng số mở, Luna hiện nằm sát mức sàn suy luận giá rẻ do dòng V4 của DeepSeek và GLM-5.2 của Zhipu thiết lập (khoảng $1,20 / $4,10), còn các bậc giá của Qwen (Alibaba) và Gemini Flash (Google) cũng ở cùng khu vực. Việc cắt giảm tạm thời của Sol xuống $4 / $20 giữ mô hình đầu bảng ở vị trí cao hơn hẳn các bậc dung lượng riêng nhưng thu hẹp phần phí cao cấp — và mức giảm một phần ba trên token đầu ra có ý nghĩa lớn nhất đối với các tác vụ agent nặng về đầu ra. Truyền thông đưa tin về động thái này cho thấy nó diễn ra trong bối cảnh OpenAI ngày càng chịu sức ép cạnh tranh từ Anthropic và các mô hình AI Trung Quốc.
Inference ngày càng rẻ hơn
Phóng tầm nhìn ra, đợt cắt giảm này nằm trong một xu hướng kéo dài nhiều năm: chi phí cho một mức năng lực nhất định đã giảm mạnh qua từng thế hệ, khi các phòng thí nghiệm khai thác được nhiều thông lượng hơn từ cùng một phần cứng. Các gói cũ hơn của chính OpenAI minh họa xu hướng giảm dần theo thời gian, và mỗi đột phá về hiệu quả — kernel tốt hơn, giải mã suy đoán, attention rẻ hơn — thường thể hiện thành đợt giảm giá chỉ sau vài tháng. Với người mua, hàm ý thực tiễn là hãy thiết kế hệ thống cho một thế giới nơi chi phí suy luận ngày càng rẻ theo một chu kỳ đều đặn: đừng ràng buộc quá mức vào giá của một mô hình, và giữ cho việc chuyển đổi luôn có chi phí thấp.
Chi phí ẩn cần theo dõi: token suy luận
{{1}}Các mô hình GPT-5.6 là mô hình suy luận, và điều đó định hình chi tiêu thực tế.{{/1}} {{2}}Khi suy luận được bật, mô hình tạo ra các token suy luận nội bộ được tính phí như output{{/2}} — {{3}}nên chi phí output hiệu quả của bạn có thể cao hơn so với ước tính ngây thơ "số từ trong câu trả lời",{{/3}} đặc biệt trên các prompt khó với mức nỗ lực suy luận cao. {{4}}Giải pháp là điều chỉnh mức nỗ lực suy luận cho phù hợp với từng tác vụ{{/4}} {{5}}(thấp hoặc tắt cho các lời gọi đơn giản),{{/5}} {{6}}giới hạn output khi có thể, và đo lượng token thực tế sử dụng thay vì giả định.{{/6}} {{7}}Mức giá rẻ hơn trên mỗi token có ích, nhưng kiểm soát số token bạn tạo ra còn hữu ích hơn.{{/7}}
Điều đó có ý nghĩa gì đối với các nhà phát triển
Nếu bạn dùng GPT-5.6 Luna hoặc Terra cho công việc khối lượng lớn — phân loại, trích xuất, định tuyến, agent nhẹ, chat — hóa đơn của bạn vừa giảm xuống, trong một số trường hợp mức giảm chiếm phần lớn giá trị, mà không cần thay đổi mã nguồn. Điều này khiến các gói dung lượng càng trở nên hấp dẫn hơn đối với các khối lượng công việc nhạy cảm về chi phí và thu hẹp khoảng cách giá so với các mô hình mở rẻ. Cách tính phí của dòng flagship cũng đã thay đổi, ít nhất là ở thời điểm hiện tại: Sol với giá $4 / $20 trong ba tháng tới giúp giảm chi phí cho các tác vụ suy luận nặng và công việc agent ở tầng cao nhất, đồng thời các khoản tín dụng Codex và ChatGPT Work tính theo token cũng dùng được lâu hơn. Đây vẫn là lựa chọn cao cấp cho những tác vụ khó nhất — chỉ là rẻ hơn trước. Công thức thành công vẫn như cũ: định tuyến theo độ khó — các gói rẻ (hoặc mô hình mở rẻ) cho 80% việc dễ, còn flagship chỉ dùng ở nơi nó xứng đáng với chi phí bỏ ra.
Cách cắt giảm hóa đơn của bạn hơn nữa
Việc giảm giá là nền tảng để xây dựng, không phải vạch đích. Các đòn bẩy bổ sung lớn nhất: bộ đệm lời nhắc (tái sử dụng lời nhắc hệ thống ổn định hoặc ngữ cảnh dài và trả mức giá đầu vào được lưu trong bộ đệm thấp hơn nhiều); tùy chọn xử lý theo lô (chạy các tác vụ không khẩn cấp không đồng bộ để được chiết khấu); định tuyến theo cấp độ và mô hình (gửi mỗi yêu cầu đến mô hình rẻ nhất có thể xử lý được, bao gồm cả các mô hình mở); và kiểm soát suy luận (đừng trả tiền cho suy luận sâu ở các lệnh gọi đơn giản). Khi xếp chồng lại với nhau, các yếu tố này thường giúp giảm hóa đơn thực tế nhiều hơn bất kỳ thay đổi giá đơn lẻ nào. Lấy một mốc cụ thể: với 10 triệu token mỗi tháng và 70% là đầu vào, mức giá mới của Luna ra khoảng 5 đô la mỗi tháng (khoảng 4,37 đô la với bộ đệm); cùng khối lượng đó trên Sol là khoảng 125 đô la mỗi tháng — lập luận rõ ràng nhất cho việc định tuyến theo độ khó.
Làm thế nào để nắm bắt ngay mức giá thấp hơn
Đây chính là phần kết nối tất cả lại với nhau. OrcaRouter tính phí chênh lệch 0% và chuyển thẳng giá nhà cung cấp, nên các mức giảm giá của OpenAI đã được áp dụng ngay trên OrcaRouter: GPT-5.6 Luna hiển thị $0.20 / $1.20, Terra $2 / $12, còn GPT-5.6 Sol hiển thị $4 / $20 trên trang mô hình ngay lúc này — cùng mức giá như trên bảng giá của chính OpenAI, truy cập được qua một endpoint tương thích OpenAI duy nhất cùng với hơn 185 mô hình khác. Bạn được hưởng mức giá mới mà không cần migration, và có thể so sánh giá Sol, Luna, Terra với DeepSeek, GLM, Qwen, Gemini và Claude ngay tại một nơi, sau đó định tuyến từng yêu cầu đến lựa chọn rẻ nhất cho công việc. Ngoài ra còn có gói miễn phí và trang Offers để tiết kiệm thêm.

Các mức giá đã được cập nhật ngay trên OrcaRouter: {{1}}GPT-5.6 Luna ở mức $0.20 / $1.20{{/1}} và {{2}}GPT-5.6 Sol ở mức $4 / $20{{/2}} {{3}}trên 1M token{{/3}}, {{4}}truyền thẳng với mức phụ phí 0%{{/4}}.
Sắp xếp theo độ khó để tiết kiệm hơn nữa
Hóa đơn rẻ nhất không phải là một mô hình duy nhất — mà là mô hình phù hợp cho từng yêu cầu. Vì OrcaRouter mở ra toàn bộ danh mục mô hình qua một endpoint duy nhất, bạn có thể gửi các lời gọi dễ, khối lượng lớn đến Luna hoặc một mô hình mở rẻ tiền và dành Sol hoặc một flagship khác cho những yêu cầu khó, chỉ cần thay đổi cấu hình chứ không phải tích hợp lại. Việc giảm giá Luna khiến chiến lược định tuyến theo độ khó đó càng rẻ hơn, và mức chiết khấu tạm thời cho Sol cũng hạ chi phí cho các lời gọi khó — mà bạn không cần điều chỉnh lại gì cả.

FAQ
OpenAI đã cắt giảm giá GPT-5.6 bao nhiêu?
GPT-5.6 Luna đã giảm từ $1 / $6 xuống $0,20 / $1,20 mỗi triệu token (khoảng 80%), và GPT-5.6 Terra từ $2,50 / $15 xuống $2 / $12 (khoảng 20%). Vào ngày 21 tháng 8 năm 2026, OpenAI cũng đã cắt giảm GPT-5.6 Sol từ $5 / $30 xuống $4 / $20 trong ba tháng tới.
Khi nào việc giảm giá có hiệu lực?
Các mức cắt giảm Luna và Terra có hiệu lực từ ngày 30 tháng 7 năm 2026, áp dụng trực tiếp trên bảng giá đã công bố. OpenAI đã thông báo mức giảm tạm thời đối với Sol vào ngày 21 tháng 8 năm 2026, kéo dài trong ba tháng tiếp theo.
Tại sao OpenAI lại giảm giá?
OpenAI cho rằng đợt cắt giảm vào tháng 7 là nhờ các tối ưu hóa suy luận — các kernel GPU sản xuất được viết lại (giảm khoảng 20% chi phí phục vụ) và một mô hình draft giải mã suy đoán được thiết kế lại (hiệu quả tạo token tăng hơn 15%) — theo một bài đăng kỹ thuật ngày 29 tháng 7 năm 2026. Họ cũng giải thích việc cắt giảm Sol theo cách tương tự, như một bước đi được thực hiện trong khi mô hình trở nên rẻ hơn để vận hành, trong một thị trường có sự cạnh tranh ngày càng tăng.
Sản phẩm chủ lực (Sol) có rẻ hơn không?
Có — tạm thời. Việc cắt giảm ngày 30/7 đưa GPT-5.6 Sol về $5 / $30, nhưng vào ngày 21/8/2026, OpenAI đã công bố mức giảm giá hơn 20% trong ba tháng tiếp theo, xuống còn $4 / $20 cho mỗi triệu token. Tín dụng dựa trên token của Codex và ChatGPT Work cũng mua được nhiều hơn, trong khi gói đăng ký không thay đổi.
Giá mới so với Anthropic và các mô hình mở như thế nào?
Theo báo cáo, Luna hiện rẻ hơn Haiku 4.5 của Anthropic khoảng 5 lần về đầu vào / 4 lần về đầu ra, và Terra thấp hơn mức giá tiêu chuẩn của Claude Sonnet 5 ($3 / $15). Luna cũng nằm gần mức giá sàn rẻ của các mô hình mở do DeepSeek và GLM-5.2 thiết lập.
Có gì không ổn với reasoning tokens?
GPT-5.6 là các mô hình suy luận; token suy luận nội bộ được tính phí như đầu ra, vì vậy chi phí đầu ra thực tế có thể vượt quá ước tính đơn giản. Hãy điều chỉnh mức độ suy luận và giới hạn đầu ra để kiểm soát điều đó.
Làm thế nào để tôi có được mức giá mới thấp hơn?
Chúng đã có mặt trên API của OpenAI và, với mức chênh lệch 0%, trên OrcaRouter — nơi GPT-5.6 Luna hiển thị $0.20 / $1.20 và GPT-5.6 Sol $4 / $20 — thông qua một endpoint tương thích OpenAI, không cần thay đổi mã.
Điểm mấu chốt
Đợt giảm giá ngày 30 tháng 7 của OpenAI đã khiến GPT-5.6 Luna và Terra rẻ hơn đáng kể cho khối lượng công việc lớn, và thông báo ngày 21 tháng 8 mở rộng câu chuyện sang mô hình hàng đầu: GPT-5.6 Sol giảm xuống còn $4 / $20 trong ba tháng tới, trong khi tín dụng token Codex mua được nhiều hơn và mức sử dụng đăng ký không đổi. Cả hai đợt này đều là cổ tức từ hiệu quả — một mặt là viết lại kernel và cải thiện giải mã dự đoán, mặt khác là vận hành phục vụ rẻ hơn — và là phản ứng rõ ràng trước một cuộc chiến giá thực sự. Hãy định tuyến theo độ khó, tận dụng caching và batching, và kiểm soát token suy luận để tiết kiệm tối đa. Và vì OrcaRouter chuyển giá nhà cung cấp với mức phụ phí 0%, các mức giá thấp hơn đã có hiệu lực ngay tại đó — Luna ở $0.20 / $1.20, Sol ở $4 / $20 — cùng mức giá, một điểm cuối tương thích OpenAI, toàn bộ các mô hình trong một nơi duy nhất. Nắm bắt các khoản giảm giá mà không cần thay đổi một dòng mã nào, và để mỗi yêu cầu chọn mô hình rẻ nhất có thể hoàn thành công việc.
