
OpenAI cắt giảm giá API GPT-5.6: Điều gì đã thay đổi, tại sao và cách nhận nó
- qwenMỚIQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 trên 1 triệu token · 55 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3150Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 206 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleMỚIGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleMỚIGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
Vào ngày 30 tháng 7 năm 2026, OpenAI đã cắt giảm giá API của hai mẫu GPT-5.6 chi phí thấp hơn — giảm mạnh phân khúc rẻ nhất và điều chỉnh giảm phân khúc trung bình, trong khi vẫn giữ nguyên dòng sản phẩm cao cấp. Đây là một động thái đáng chú ý trong cuộc chiến giá cả đang ngày càng gay gắt, và nó đã được áp dụng ngay lập tức trên bảng giá công bố. Bài viết này giải thích chính xác những gì đã thay đổi, kỹ thuật đằng sau nó, giá mới so với các đối thủ cạnh tranh như thế nào, các chi phí ẩn cần lưu ý, cách cắt giảm hóa đơn của bạn hơn nữa — và cách các mức giá thấp hơn đã có hiệu lực trên OrcaRouter với mức chênh lệch 0%.
Mỗi con số bên dưới đều được ghi rõ nguồn. Giá được tính theo triệu token (đầu vào / đầu ra) và phản ánh biểu giá ngày 30 tháng 7 năm 2026 của OpenAI theo báo cáo từ các trang tin bao gồm Unite.AI, cùng với các trang mô hình pass-through của OrcaRouter; số liệu của đối thủ cạnh tranh được chú thích nguồn. Giá có thể thay đổi — hãy xác minh trước khi xây dựng.
TL;DR. OpenAI đã hạ giá GPT-5.6 Luna xuống còn 0,20 USD / 1,20 USD (từ 1 USD / 6 USD, giảm ~80%) và GPT-5.6 Terra xuống còn 2 USD / 12 USD (từ 2,50 USD / 15 USD, giảm ~20%), trong khi GPT-5.6 Sol vẫn giữ nguyên ở mức 5 USD / 30 USD. Hai cải tiến về hiệu suất đã bù đắp cho đợt giảm giá này: các kernel GPU được viết lại (chi phí phục vụ giảm khoảng 20%) và mô hình draft speculative-decoding được thiết kế lại (tốc độ sinh token nhanh hơn 15%+). Đợt cắt giảm này đưa Luna xuống dưới mức Haiku 4.5 của Anthropic và tiến gần đến mức sàn giá rẻ của các mô hình mở do DeepSeek và GLM thiết lập. Nếu bạn định tuyến qua một endpoint trung lập về nhà cung cấp, không tính phí chênh lệch (0% markup) như OrcaRouter, các mức giá mới đã có hiệu lực ngay — cùng một mức giá, một API tương thích OpenAI duy nhất, với mọi mô hình đối thủ nằm ngay bên cạnh để bạn so sánh và định tuyến.
Những điểm chính rút ra
• GPT-5.6 Luna: hiện là $0,20 / $1,20 cho mỗi 1 triệu token, giảm từ $1 / $6 — giảm khoảng 80%.
• GPT-5.6 Terra: hiện $2 / $12, giảm từ $2.50 / $15 — mức giảm khoảng 20%.
• GPT-5.6 Sol (flagship): giữ nguyên ở mức $5 / $30.
• Lý do: các kernel GPU sản xuất được viết lại (giảm ~20% chi phí phục vụ) cùng với việc thiết kế lại mô hình nháp giải mã suy đoán (hiệu quả tạo token tăng 15%+), theo bài đăng kỹ thuật ngày 29 tháng 7 của OpenAI.
• Cách nhận: mức chiết khấu đã được phản ánh trên OrcaRouter (0% phí cộng) — Luna ở mức $0.20 / $1.20 — thông qua một endpoint tương thích OpenAI.
Chính xác thì điều gì đã thay đổi?
Gia đình GPT-5.6 của OpenAI hoạt động như một bậc thang: Luna (nhanh, rẻ nhất), Terra (trung bình) và Sol (cao cấp). Đợt cắt giảm ngày 30 tháng 7 đã ảnh hưởng đến hai bậc rẻ hơn. Theo bảng giá được báo cáo, GPT-5.6 Luna giảm từ $1 / $6 xuống $0.20 / $1.20 cho mỗi triệu token đầu vào / đầu ra — giảm khoảng 80% cho cả đầu vào và đầu ra — và GPT-5.6 Terra giảm từ $2.50 / $15 xuống $2 / $12, khoảng 20%. GPT-5.6 Sol, bậc cao cấp được xây dựng cho các tác vụ suy luận khó nhất và lập trình đại lý (agentic coding), giữ nguyên ở mức $5 / $30. Các bậc khối lượng đã trở nên rẻ hơn đáng kể; bậc cao nhất không thay đổi.
Mức giá cơ bản trên mỗi token không phải là toàn bộ câu chuyện. Định giá GPT-5.6 cũng có các mức theo độ dài đầu vào (ngữ cảnh rất dài chuyển sang mức giá cao hơn), chiết khấu bộ nhớ đệm prompt (đầu vào được lưu cache rẻ hơn nhiều so với đầu vào mới) và tùy chọn batch (các tác vụ không đồng bộ được giảm giá). Cả ba yếu tố này đều áp dụng trong đợt cắt giảm, nên giá thực tế cho khối lượng công việc nặng về cache hoặc batch có thể còn thấp hơn nữa. Hãy lưu ý mức ngữ cảnh dài theo hướng ngược lại: đưa vào các prompt khổng lồ có thể đẩy bạn lên một mức cao hơn.

Hai tối ưu hóa đằng sau phần cắt
Đây không phải là một động thái bán lỗ để thu hút khách hàng — OpenAI coi đó là một khoản cổ tức từ hiệu quả. Trong một bài đăng kỹ thuật ngày 29 tháng 7 năm 2026, các thành viên đội ngũ kỹ thuật của OpenAI đã mô tả các tối ưu hóa trong suy luận và khung tác nhân (agent harness) đằng sau Codex và ChatGPT Work. Hai điểm nổi bật. Thứ nhất, việc viết lại các nhân GPU (GPU kernel) trên toàn bộ hạ tầng sản xuất — với Sol, chạy bên trong Codex, được dùng để viết lại chính các nhân của công ty — mà OpenAI cho biết đã cắt giảm chi phí phục vụ từ đầu đến cuối khoảng 20%. Thứ hai, một mô hình dự thảo giải mã theo dự đoán (speculative-decoding) được thiết kế lại, được báo cáo là đã cải thiện hiệu quả tạo token hơn 15%. Chi phí phục vụ thấp hơn, được chuyển tới khách hàng dưới dạng giá thấp hơn ở các gói dung lượng cao, là câu chuyện chính — và đó là cái nhìn thoáng qua về một vòng phản hồi mà toàn ngành đang theo đuổi: sử dụng các mô hình tiên tiến (frontier models) để tối ưu hóa chính hạ tầng phục vụ chúng.
Các mức giá mới so sánh như thế nào
Đợt cắt giảm này nhắm thẳng vào các đối thủ cạnh tranh. Theo báo cáo của Unite.AI, mức giá mới $0,20 / $1,20 của Luna rẻ hơn khoảng 5 lần về đầu vào và khoảng 4 lần về đầu ra so với Haiku 4.5 của Anthropic, còn mức giá mới $2 / $12 của Terra nằm dưới giá tiêu chuẩn của Claude Sonnet 5 (được báo cáo ở mức $3 / $15, có hiệu lực sau ngày 31 tháng 8 năm 2026). So với nhóm mô hình trọng số mở, Luna hiện nằm gần mức giá suy luận rẻ nhất được thiết lập bởi dòng DeepSeek V4 và GLM-5.2 của Zhipu (khoảng $1,20 / $4,10), với các bậc giá của Qwen (Alibaba) và Gemini Flash (Google) trong cùng khu vực. Nói cách khác, OpenAI đã đưa các bậc giá theo khối lượng xuống đúng nơi mà các mô hình có năng lực rẻ nhất đang tồn tại — thu hẹp khoản phụ phí khi chọn mô hình độc quyền thay vì mô hình mở.
Inference ngày càng rẻ hơn
Phóng tầm nhìn ra, đợt cắt giảm này nằm trong một xu hướng kéo dài nhiều năm: chi phí cho một mức năng lực nhất định đã giảm mạnh qua từng thế hệ, khi các phòng thí nghiệm khai thác được nhiều thông lượng hơn từ cùng một phần cứng. Các gói cũ hơn của chính OpenAI minh họa xu hướng giảm dần theo thời gian, và mỗi đột phá về hiệu quả — kernel tốt hơn, giải mã suy đoán, attention rẻ hơn — thường thể hiện thành đợt giảm giá chỉ sau vài tháng. Với người mua, hàm ý thực tiễn là hãy thiết kế hệ thống cho một thế giới nơi chi phí suy luận ngày càng rẻ theo một chu kỳ đều đặn: đừng ràng buộc quá mức vào giá của một mô hình, và giữ cho việc chuyển đổi luôn có chi phí thấp.
Chi phí ẩn cần theo dõi: token suy luận
{{1}}Các mô hình GPT-5.6 là mô hình suy luận, và điều đó định hình chi tiêu thực tế.{{/1}} {{2}}Khi suy luận được bật, mô hình tạo ra các token suy luận nội bộ được tính phí như output{{/2}} — {{3}}nên chi phí output hiệu quả của bạn có thể cao hơn so với ước tính ngây thơ "số từ trong câu trả lời",{{/3}} đặc biệt trên các prompt khó với mức nỗ lực suy luận cao. {{4}}Giải pháp là điều chỉnh mức nỗ lực suy luận cho phù hợp với từng tác vụ{{/4}} {{5}}(thấp hoặc tắt cho các lời gọi đơn giản),{{/5}} {{6}}giới hạn output khi có thể, và đo lượng token thực tế sử dụng thay vì giả định.{{/6}} {{7}}Mức giá rẻ hơn trên mỗi token có ích, nhưng kiểm soát số token bạn tạo ra còn hữu ích hơn.{{/7}}
Điều đó có ý nghĩa gì đối với các nhà phát triển
Nếu bạn dùng GPT-5.6 Luna hoặc Terra cho khối lượng công việc lớn — phân loại, trích xuất, định tuyến, agent nhẹ, chat — hóa đơn của bạn vừa giảm, trong một số trường hợp là giảm phần lớn giá trị, mà không cần thay đổi mã nguồn. Điều này khiến các tầng khối lượng càng hấp dẫn hơn cho các tác vụ nhạy cảm chi phí và thu hẹp khoảng cách giá so với các mô hình nguồn mở giá rẻ. Bài toán giá của mô hình chủ lực không đổi: Sol ở mức $5/$30 vẫn là lựa chọn cao cấp cho các tác vụ khó nhất. Công thức chiến thắng là định tuyến theo độ khó — tầng giá rẻ (hoặc mô hình nguồn mở giá rẻ) cho 80% tác vụ dễ, còn mô hình chủ lực chỉ dùng khi nó xứng đáng với chi phí.
Cách cắt giảm hóa đơn của bạn hơn nữa
Việc giảm giá là nền tảng để xây dựng, không phải vạch đích. Các đòn bẩy bổ sung lớn nhất: bộ đệm lời nhắc (tái sử dụng lời nhắc hệ thống ổn định hoặc ngữ cảnh dài và trả mức giá đầu vào được lưu trong bộ đệm thấp hơn nhiều); tùy chọn xử lý theo lô (chạy các tác vụ không khẩn cấp không đồng bộ để được chiết khấu); định tuyến theo cấp độ và mô hình (gửi mỗi yêu cầu đến mô hình rẻ nhất có thể xử lý được, bao gồm cả các mô hình mở); và kiểm soát suy luận (đừng trả tiền cho suy luận sâu ở các lệnh gọi đơn giản). Khi xếp chồng lại với nhau, các yếu tố này thường giúp giảm hóa đơn thực tế nhiều hơn bất kỳ thay đổi giá đơn lẻ nào. Lấy một mốc cụ thể: với 10 triệu token mỗi tháng và 70% là đầu vào, mức giá mới của Luna ra khoảng 5 đô la mỗi tháng (khoảng 4,37 đô la với bộ đệm); cùng khối lượng đó trên Sol là khoảng 125 đô la mỗi tháng — lập luận rõ ràng nhất cho việc định tuyến theo độ khó.
Làm thế nào để nắm bắt ngay mức giá thấp hơn
Đây là phần kết nối tất cả lại với nhau. a href="https://www.orcarouter.ai/">OrcaRouter/a> tính phí chênh lệch 0% và chuyển thẳng giá của nhà cung cấp, vì vậy mức giá của OpenAI đã có sẵn trên OrcaRouter: GPT-5.6 Luna hiển thị $0.20 / $1.20 và Terra $2 / $12 trên các trang mô hình ngay bây giờ — cùng mức giá với bảng giá của chính OpenAI, có thể truy cập thông qua một endpoint tương thích OpenAI duy nhất cùng với 185+ mô hình khác. Bạn có được mức giá này mà không cần migration, và bạn có thể so sánh giá Luna và Terra với DeepSeek, GLM, Qwen, Gemini và Claude ngay tại một nơi, sau đó định tuyến từng yêu cầu đến mô hình rẻ nhất phù hợp với công việc. Ngoài ra còn có gói miễn phí và trang Offers để tiết kiệm thêm.

Đợt giảm giá đã có hiệu lực trên OrcaRouter: GPT-5.6 Luna ở mức $0,20 / $1,20 cho mỗi 1 triệu token, được chuyển tiếp với mức phụ giá 0%.
Sắp xếp theo độ khó để tiết kiệm hơn nữa
Hóa đơn thấp nhất không đến từ một mô hình duy nhất — mà đến từ việc chọn đúng mô hình cho từng yêu cầu. Vì OrcaRouter cho phép truy cập toàn bộ các mô hình qua một endpoint duy nhất, bạn có thể gửi các yêu cầu đơn giản, khối lượng lớn đến Luna hoặc một mô hình mã nguồn mở rẻ và dành Sol hoặc một flagship khác cho các yêu cầu khó, chỉ cần thay đổi cấu hình chứ không phải tích hợp lại. Việc giảm giá Luna khiến chiến lược định tuyến theo độ khó đó càng rẻ hơn nữa, mà bạn không cần kết nối lại bất kỳ điều gì.

Câu hỏi thường gặp
OpenAI đã cắt giảm giá GPT-5.6 bao nhiêu?
GPT-5.6 Luna giảm từ $1 / $6 xuống $0.20 / $1.20 mỗi triệu token (khoảng 80%), và GPT-5.6 Terra từ $2.50 / $15 xuống $2 / $12 (khoảng 20%). GPT-5.6 Sol giữ nguyên ở $5 / $30.
Khi nào việc giảm giá có hiệu lực?
Ngày 30 tháng 7 năm 2026, được ghi nhận trong nhật ký thay đổi API của OpenAI và có hiệu lực trên bảng giá đã công bố.
Tại sao OpenAI lại giảm giá?
OpenAI giải thích điều này là nhờ các tối ưu hóa suy luận — các kernel GPU sản xuất được viết lại (giảm khoảng 20% chi phí phục vụ) và mô hình dự thảo giải mã suy đoán được thiết kế lại (hiệu quả tạo token tăng trên 15%) — theo một bài viết kỹ thuật ngày 29 tháng 7 năm 2026.
Sản phẩm chủ lực (Sol) có rẻ hơn không?
Không. GPT-5.6 Sol vẫn ở mức $5 / $30 mỗi triệu token. Chỉ có hai hạng rẻ hơn, Luna và Terra, bị loại bỏ.
Giá mới so với Anthropic và các mô hình mở như thế nào?
Theo báo cáo, Luna hiện rẻ hơn Haiku 4.5 của Anthropic khoảng 5 lần về đầu vào / 4 lần về đầu ra, và Terra thấp hơn mức giá tiêu chuẩn của Claude Sonnet 5 ($3 / $15). Luna cũng nằm gần mức giá sàn rẻ của các mô hình mở do DeepSeek và GLM-5.2 thiết lập.
Có gì không ổn với reasoning tokens?
GPT-5.6 là các mô hình suy luận; token suy luận nội bộ được tính phí như đầu ra, vì vậy chi phí đầu ra thực tế có thể vượt quá ước tính đơn giản. Hãy điều chỉnh mức độ suy luận và giới hạn đầu ra để kiểm soát điều đó.
Làm thế nào để tôi có được mức giá mới thấp hơn?
Chúng đã có mặt trên API của OpenAI và, với mức chênh lệch 0%, trên OrcaRouter — nơi GPT-5.6 Luna hiển thị $0.20 / $1.20 — thông qua một endpoint tương thích OpenAI, không cần thay đổi mã nguồn.
Kết luận
Đợt giảm giá ngày 30 tháng 7 của OpenAI khiến GPT-5.6 Luna và Terra rẻ hơn đáng kể cho khối lượng công việc lớn — một khoản lợi từ hiệu quả nhờ việc viết lại kernel và những cải thiện về giải mã suy đoán, đồng thời là phản ứng rõ ràng trước một cuộc chiến giá thực sự hiện đang rẻ hơn cả các bậc giá thấp của Anthropic và tiến sát mức sàn của mô hình mở. Mô hình chủ lực Sol vẫn không thay đổi, vì vậy hãy định tuyến theo độ khó, tận dụng bộ nhớ đệm và xử lý theo lô, đồng thời kiểm soát token suy luận để tiết kiệm tối đa. Và vì OrcaRouter chuyển thẳng giá nhà cung cấp với mức chênh lệch 0%, các mức giá thấp hơn đã có hiệu lực ngay tại đó — cùng một mức giá, một endpoint tương thích OpenAI, toàn bộ hệ sinh thái mô hình trong một nơi duy nhất. Hãy tận dụng khoản giảm giá mà không cần thay đổi một dòng mã nào, và để mỗi yêu cầu tự chọn mô hình rẻ nhất đủ khả năng hoàn thành công việc.
