Giá GPT-5.6 Sau Khi Cắt Giảm: Luna vs Terra vs Sol, và Nên Dùng Gói Nào
Guides & Insights

Giá GPT-5.6 Sau Khi Cắt Giảm: Luna vs Terra vs Sol, và Nên Dùng Gói Nào

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Sau đợt giảm giá ngày 30 tháng 7 năm 2026 của O​penAI, dòng GP​T-5.​6 — GPT-5.6 Luna, GPT-5.6 Terra và GPT-5.6 Sol — chưa bao giờ rẻ hơn để vận hành ở quy mô lớn. Một tuần sau, vào ngày 6 tháng 8, O​penAI đưa các tầng tương tự vào chính ChatGPT: GPT-5.6 Luna đang trở thành mô hình mặc định cho các tài khoản miễn phí và Go với các cuộc trò chuyện văn bản không giới hạn, còn GPT-5.6 Sol được cập nhật cho Plus và Pro. Vào ngày 19 tháng 8, O​penAI và Replit công bố rằng Chế độ miễn phí mới của Replit cho người đăng ký Core và Pro chạy trên GPT-5.6 Luna — cược bên thứ ba lớn nhất cho đến nay vào tầng dung lượng. Và vào cuối tháng 8, O​penAI bắt đầu triển khai phương án dự phòng cho người dùng cá nhân sử dụng nhiều: hạn mức “Luna Reserve” cho phép một số tài khoản ChatGPT Plus và Pro được chọn dùng GPT-5.6 Luna ở mức giới hạn trong Codex và ChatGPT Work khi hạn mức sử dụng thông thường của họ đã cạn. Nhưng ba tầng có mức giá rất khác nhau, và việc chọn đúng tầng (cùng với việc dùng tốt bộ nhớ đệm, xử lý theo lô và định tuyến) là đòn bẩy lớn nhất trên hóa đơn API của bạn. Hướng dẫn này trình bày toàn bộ bảng giá sau khi giảm, các ví dụ chi phí được tính cụ thể, cách từng tầng so sánh với đối thủ, và cách định tuyến giữa chúng thông qua một endpoint duy nhất.

Giá được tính theo triệu token ({{1}}đầu vào / đầu ra{{/1}}), phản ánh {{2}}biểu giá sau cắt giảm như được báo cáo và các trang mô hình chuyển tiếp của OrcaRouter{{/2}}; mức giá theo bậc và bộ nhớ đệm đến từ {{3}}các trang mô hình của OrcaRouter, còn số liệu của đối thủ cạnh tranh được ghi rõ nguồn{{/3}}. Chi tiết triển khai ChatGPT trong bài này là theo {{4}}công bố của O​penAI vào ngày 6 tháng 8 năm 2026, còn chi tiết Chế độ Miễn phí của Replit là theo công bố của O​penAI và Replit vào ngày 19 tháng 8 năm 2026{{/4}} — do nhà cung cấp báo cáo, không được đo lường độc lập. Chi tiết về Luna Reserve là theo {{5}}tài liệu O​penAI ghi trong trung tâm trợ giúp và báo cáo của nhân viên O​penAI cùng người dùng đầu tiên vào cuối tháng 8 năm 2026{{/5}} — thông tin từ nhà cung cấp và cộng đồng, chưa được xác minh độc lập. Giá có thể thay đổi — hãy kiểm tra trước khi xây dựng.

Tóm tắt: Dài quá, không đọc

GPT-5.6 Luna ($0.20 / $1.20) là con ngựa thồ xử lý khối lượng lớn; Terra ($2 / $12) là lựa chọn tầm trung cân bằng; Sol ($5 / $30) là sản phẩm chủ lực cho những tác vụ suy luận khó nhất và lập trình tác nhân. Cả ba đều có ngữ cảnh khoảng 1,05 triệu token và đầu ra tối đa 128K. Bộ nhớ đệm prompt và tùy chọn batch giúp cắt giảm thêm chi phí, trong khi đầu vào rất dài sẽ đưa bạn lên gói cao hơn. Về phía người dùng thông thường, O​penAI đã công bố vào ngày 6 tháng 8 rằng GPT-5.6 Luna sẽ trở thành mặc định cho các tài khoản ChatGPT Free và Go, với trò chuyện chỉ văn bản không giới hạn, và phiên bản GPT-5.6 Sol được cập nhật đang được triển khai cho Plus và Pro. Vào ngày 19 tháng 8, Replit đã ra mắt Free Mode trên GPT-5.6 Luna cho người đăng ký Core và Pro, tự động chuyển các tác vụ khó hơn lên GPT-5.6 Sol khi cần. Cuối tháng 8, O​penAI cũng bắt đầu triển khai cơ chế dự phòng “Luna Reserve”, cho phép một số tài khoản ChatGPT Plus và Pro dùng hạn chế GPT-5.6 Luna trong Codex và ChatGPT Work sau khi hết hạn mức thông thường — được O​penAI ghi nhận chính thức, và việc triển khai đến các tài khoản được chọn được người dùng báo cáo. Hãy dùng Luna cho phần lớn tác vụ dễ, Terra khi bạn cần nhiều hơn, và chỉ dùng Sol khi nó xứng đáng với chi phí — và định tuyến theo độ khó qua một endpoint tương thích với O​penAI để giảm thiểu chi phí.

Những điểm chính cần ghi nhớ

• Luna: $0.20 / $1.20 mỗi 1M token — nhanh, rẻ, phù hợp cho công việc khối lượng lớn, nhạy cảm với độ trễ.

• Terra: $2 / $12 — tầm trung cân bằng cho các tác vụ khó hơn không cần đến flagship.

• Sol: $5 / $30 — sản phẩm hàng đầu cho suy luận sâu, lập trình quy mô lớn và các tác nhân tầm xa.

• Bộ nhớ đệm và xử lý theo lô giúp giảm chi phí hơn nữa; đầu vào dài sẽ đưa bạn đến một mức giá đắt hơn cho ngữ cảnh dài.

• ChatGPT (OpenAI công bố, ngày 6 tháng 8): Luna trở thành mặc định cho gói miễn phí/Go với số lượng trò chuyện văn bản không giới hạn; Sol nhận được bản cập nhật về độ tin cậy cho Plus/Pro.

• Replit (công bố ngày 19/8): Chế độ Miễn phí cho Core/Pro chạy trên GPT-5.6 Luna — sử dụng nhiều hơn tới 30 lần cho mỗi Replit, với các tác vụ khó hơn được chuyển lên GPT-5.6 Sol. Theo tuyên bố của Replit, chưa được xác minh độc lập.

• Luna Reserve (cuối tháng 8, được O​penAI ghi nhận trong tài liệu): một khoản dự phòng có giới hạn cho phép một số tài khoản ChatGPT Plus và Pro được chọn tiếp tục sử dụng GPT-5.6 Luna trong Codex và ChatGPT Work sau khi các giới hạn thông thường đã cạn — không phải là không giới hạn, và không khả dụng trong các không gian làm việc Business hoặc Enterprise.

• Đòn bẩy tiết kiệm lớn nhất: phân luồng theo độ khó — đừng trả giá Sol cho việc Luna có thể làm.

Mức giá cơ bản mới của GP​T-5.​6

Đây là mức giá cơ bản sau cắt giảm trên mỗi triệu token đầu vào/đầu ra: Luna $0,20 / $1,20 (giảm từ $1 / $6), Terra $2 / $12 (giảm từ $2,50 / $15) và Sol $5 / $30 (không đổi). Hai mức giá rẻ hơn đã được cắt giảm vào ngày 30 tháng 7 năm 2026; mức cao nhất vẫn được giữ nguyên. Nói một cách đơn giản, các mức giá thấp hiện được định giá cho việc mở rộng quy mô, trong khi mức cao nhất vẫn thuộc phân khúc cao cấp.

Giá theo bậc, lưu trữ và theo lô

Mức giá cơ bản chỉ là điểm khởi đầu. Mức giá của GP​T-5.​6 có ba yếu tố điều chỉnh có thể làm thay đổi đáng kể chi phí thực tế của bạn:

• Các mức giá theo ngữ cảnh dài. Giá tăng dần cho các đầu vào rất dài. Trên các trang chuyển tiếp của OrcaRouter, Luna có giá $0.20 / $1.20 cho đến mức ngữ cảnh lớn và $0.40 / $1.80 vượt trên mức đó; Sol có giá $5 / $30 ở mức cơ bản và $10 / $45 ở mức lớn nhất. Mức giá được chọn dựa trên số lượng token đầu vào của mỗi yêu cầu, vì vậy một vài lời nhắc khổng lồ có thể âm thầm tăng giá trung bình của bạn.

• Bộ nhớ đệm lời nhắc. Ngữ cảnh được tái sử dụng được tính phí với mức chiết khấu lớn — phí đọc bộ nhớ đệm của Luna là khoảng $0,02 mỗi triệu token (so với $0,20 khi mới), phí ghi bộ nhớ đệm khoảng $0,25; phí đọc bộ nhớ đệm của Sol là khoảng $0,50 (so với $5 khi mới). Đối với tác nhân và trò chuyện có lời nhắc hệ thống ổn định, bộ nhớ đệm thường là khoản tiết kiệm lớn nhất.

{{1}}Hàng loạt.{{/1}} {{2}}Các tác vụ không khẩn cấp chạy không đồng bộ với mức chiết khấu — lý tưởng cho phân loại khối lượng lớn, đánh giá và tạo nội dung ngoại tuyến khi độ trễ không quan trọng.{{/2}}

Các ví dụ tính toán: chi phí thực tế là bao nhiêu

Các con số cụ thể làm cho các mức giá trở nên thực tế. Lấy ví dụ 10 triệu token mỗi tháng với tỷ lệ 70% đầu vào / 30% đầu ra (một sự kết hợp điển hình cho chat/agent):

• Luna: khoảng $5 mỗi tháng (khoảng $4.37 với bộ nhớ đệm prompt).

• Terra: khoảng 50 đô la mỗi tháng.

• Sol: khoảng 125 đô la mỗi tháng (khoảng 109 đô la với bộ nhớ đệm).

Đó là mức chênh 25 lần giữa Luna và Sol cho cùng một khối lượng — chính vì vậy việc khớp từng yêu cầu với bậc rẻ nhất đủ khả năng đáp ứng lại quan trọng hơn bất kỳ mức giá đơn lẻ nào. (Các con số này khớp với máy tính chi phí trên trang của OrcaRouter, vốn ước tính từ giá niêm yết; con số thực tế của bạn phụ thuộc vào bộ nhớ đệm và tỷ lệ đầu vào/đầu ra của bạn.)

Mỗi cấp thực sự dùng để làm gì

GPT-5.6 Luna — con ngựa thồ khối lượng lớn

Luna là tầng dịch vụ nhanh, tiết kiệm chi phí, được tối ưu cho các khối lượng công việc lớn, nhạy cảm với độ trễ: chat, phân loại, trích xuất, định tuyến và các tác vụ agentic nhẹ, với thời gian đến token đầu tiên ở phân vị p50 khoảng 1,65 giây. Sau mức cắt giảm, ở mức giá $0,20 / $1,20, nó được định giá để cạnh tranh trực tiếp với các mô hình mở giá rẻ — lựa chọn mặc định cho phần lớn các cuộc gọi đơn giản. Đây cũng là tầng dịch vụ mà O​penAI đang hướng ChatGPT tiêu dùng đến: theo thông báo ngày 6 tháng 8, GPT-5.6 Luna đang trở thành mô hình mặc định cho các tài khoản Free và Go, với chat chỉ văn bản được mở không giới hạn và một nút Think mới cho khả năng suy luận cao hơn trên các câu hỏi khó sẽ ra mắt vào tuần sau (giới hạn về tệp, hình ảnh và giọng nói vẫn được giữ nguyên). O​penAI cho biết Luna giảm 62% lỗi thực tế so với GPT-5.5 Instant mà nó thay thế — một con số do nhà cung cấp công bố, nhưng là tín hiệu rõ ràng rằng tầng khối lượng lớn chính là nơi công ty đang hướng phần lớn lưu lượng truy cập của mình.

Vào ngày 19 tháng 8 năm 2026, Replit đã đưa GPT-5.6 Luna làm động cơ cho Chế độ Miễn phí mới của mình — trải nghiệm mặc định cho người đăng ký Core và Pro. Các tác vụ trò chuyện hàng ngày, lên ý tưởng và lập trình đơn giản chạy trên Luna mà không tiêu tốn ngân sách tín dụng AI trả phí của người dùng; Replit cho biết người dùng Core hiện có thể tạo ra nội dung nhiều hơn tới 30 lần mỗi tháng, bao gồm tối đa 30 giờ trò chuyện. Khi một tác vụ cần suy luận sâu hơn, Agent của Replit sẽ chuyển yêu cầu đến một mô hình lớn hơn cho phần đó — các chế độ Power/Max hoặc GPT-5.6 Sol — rồi quay lại dùng Luna. Đây là những chi tiết do Replit và OpenAI công bố, chưa được xác minh độc lập — nhưng hướng đi này khớp với việc cắt giảm giá: Luna rẻ hơn 80% là yếu tố giúp gói dịch vụ luôn bật và được bao gồm mặc định trở nên khả thi.

Một điểm mới phía người tiêu dùng xuất hiện vào cuối tháng 8 năm 2026: Luna Reserve. Như O​penAI ghi lại trong trung tâm trợ giúp của mình, một số tài khoản ChatGPT Plus và Pro có thể nhận một hạn mức sử dụng giới hạn GPT-5.6 Luna trong Codex và ChatGPT Work như một phương án dự phòng khi hạn mức sử dụng thông thường của họ đã cạn kiệt — một thông báo hoặc chỉ báo mặt trăng xuất hiện ở mức trần, và bạn có thể tiếp tục làm việc trên Luna trong khi nguồn dự phòng còn. Đây không phải là một phần mở rộng không giới hạn: nguồn dự phòng tách biệt với hạn mức thông thường và bản thân nó cũng có giới hạn, nó chỉ phục vụ GPT-5.6 Luna (không bao giờ là Terra hoặc Sol), không khả dụng trong các không gian làm việc Business hoặc Enterprise, và việc chạm trần hạn mức thông thường không đảm bảo quyền truy cập. Đội ngũ O​penAI đã xác nhận sự tồn tại của nguồn dự phòng vào ngày 27 tháng 8, và các báo cáo ban đầu từ người dùng mô tả nó được triển khai cho một số tài khoản được chọn — theo tuyên bố của nhà cung cấp và cộng đồng, chưa được xác minh độc lập. Một số báo cáo ban đầu từ cộng đồng cũng lưu ý rằng nguồn dự phòng chạy phía trình duyệt nhẹ (browser-light) của GPT-5.6 Luna, vì vậy các tác vụ kiểm tra web trực tiếp có thể không hoạt động khi đang dùng nguồn dự phòng.

GPT-5.6 Terra — trung gian cân bằng

Terra nằm giữa phân khúc phổ thông và cao cấp: mạnh hơn Luna cho các tác vụ suy luận và lập trình phức tạp hơn, nhưng rẻ hơn nhiều so với Sol. Với mức giá $2 / $12, đây là lựa chọn mặc định hợp lý khi Luna chưa đủ mạnh nhưng bạn không cần đến bản cao cấp — các tác vụ trích xuất, soạn thảo và đa bước ở mức độ phức tạp trung bình mà vẫn chạy được ở quy mô lớn.

GPT-5.6 Sol — sản phẩm chủ lực

Sol được xây dựng cho những công việc khó khăn nhất: suy luận đa bước sâu, phát triển phần mềm quy mô lớn và quy trình tác tử dài hạn, duy trì sự mạch lạc xuyên suốt ngữ cảnh ~1,05 triệu token và đầu ra lên tới 128K. Với mức giá $5 / $30 (gói cơ bản), đây là lựa chọn cao cấp — hãy dành nó cho những tác vụ thực sự cần đến, như lập trình đa tệp phức tạp hoặc các phiên chạy tác tử dài. Vào ngày 6 tháng 8, OpenAI cũng đã cập nhật GPT-5.6 Sol trong ChatGPT cho người dùng Plus và Pro: công ty cho biết phiên bản trò chuyện đáng tin cậy hơn về mặt sự kiện — giảm 68% lỗi sai sự thật, theo OpenAI — và đưa ra câu trả lời tập trung hơn, cùng thanh trượt mới để kiểm soát mức độ nỗ lực suy luận được áp dụng. Bản cập nhật chỉ áp dụng cho phiên bản trò chuyện (bản Sol chạy cho Work và Codex vẫn không thay đổi), và mức giá API vẫn giữ nguyên $5 / $30.

Lưu ý về token suy luận

GP​T-5.​6 là các mô hình suy luận, do đó chi phí đầu ra thực tế có thể vượt quá ước tính đơn giản: khi bật suy luận, các token suy luận nội bộ được tính phí như đầu ra. Với những prompt khó và mức suy luận cao, chi phí đó có thể chiếm phần lớn hóa đơn của bạn. Hãy điều chỉnh mức suy luận cho phù hợp với tác vụ (thấp hoặc tắt đối với các lệnh gọi đơn giản), giới hạn token đầu ra ở mức có thể, và đo lường mức sử dụng thực tế. Giá mỗi token rẻ hơn sẽ giúp ích; tạo ra ít token hơn còn giúp nhiều hơn.

Cách mỗi cấp độ so sánh với các đối thủ cạnh tranh

{{1}}Đợt cắt giảm đã định vị lại GP​T-5.​6 so với các đối thủ trên thị trường.{{/1}} {{2}}Theo báo cáo, mức giá $0.20 / $1.20 của Luna hiện rẻ hơn Claude Haiku 4.5 khoảng 5 lần ở đầu vào và 4 lần ở đầu ra, còn mức $2 / $12 của Terra thấp hơn giá tiêu chuẩn của Claude Sonnet 5 (được báo cáo là $3 / $15).{{/2}} {{3}}So với các mô hình open-weight, Luna nằm gần mức sàn do dòng V4 của Deep​Seek và GLM-5.2 của Zhi​pu thiết lập (khoảng $1.20 / $4.10), với các phân khúc Qw​en và Gem​ini Flash ngay bên cạnh.{{/3}} {{4}}Điểm mấu chốt: với các tác vụ nhạy cảm về chi phí, Luna giờ đây cạnh tranh được với các mô hình có năng lực rẻ nhất thay vì là một lựa chọn cao cấp so với chúng — trong khi Sol vẫn là một phân khúc cao cấp đích thực cho năng lực mà bạn không thể có được với giá rẻ.{{/4}}

Đòn bẩy tiết kiệm thực sự: định tuyến theo độ khó

Gói rẻ nhất không phải là một bậc giá duy nhất — mà là khớp từng yêu cầu với mô hình ít tốn kém nhất có thể xử lý được. Trong thực tế: gửi các lệnh gọi dễ, khối lượng lớn đến Luna (hoặc một mô hình mở giá rẻ), nâng cấp lên Terra cho các tác vụ khó hơn, và chỉ dùng Sol cho phần thiểu số thực sự khó. Kết hợp với bộ nhớ đệm và xử lý theo lô, cách này thường giúp cắt giảm chi phí nhiều hơn hẳn bất kỳ thay đổi giá đơn lẻ nào. Điểm hạn chế nằm ở vận hành: bạn không muốn tích hợp lại ba bậc O​penAI cộng với các lựa chọn mô hình mở một cách riêng lẻ.

Truy cập cả ba (và các đối thủ rẻ hơn) qua một điểm cuối

Đây là lúc một bộ định tuyến trung lập với nhà cung cấp phát huy tác dụng. OrcaRouter cung cấp GPT-5.6 Luna, Terra và Sol — ở cùng mức giá sau cắt giảm, 0% phụ phí — qua một endpoint tương thích O​penAI, cùng với các mô hình mở rẻ hơn như DeepSeek V4 Pro, GLM-5.2 và Qw​en. Việc chuyển đổi tầng dịch vụ (hoặc A/B test Luna với một mô hình mở) chỉ là thay đổi cấu hình, không phải tích hợp lại, và bạn có thể định tuyến từng yêu cầu đến lựa chọn rẻ nhất. Luna Reserve là phiên bản phía người tiêu dùng của cùng ý tưởng đó — một cơ chế dự phòng tích hợp sẵn giúp giữ một số người dùng nhất định ở lại GPT-5.6 Luna sau khi hạn mức thông thường của họ đã dùng hết — và tương đương ở phía API là tự động chuyển đổi dự phòng (failover), việc mà OrcaRouter xử lý khi nhà cung cấp giới hạn tốc độ hoặc báo lỗi trên một yêu cầu.

Bảng giá Luna sau khi cắt giảm được hiển thị trên trang mô hình của chính OrcaRouter với giá niêm yết — $0.20 / $1.20 cho mỗi triệu token — vì bộ định tuyến chuyển thẳng giá của nhà cung cấp với mức tăng 0%, kèm theo máy tính chi phí ngay trên trang cho hóa đơn hàng tháng điển hình. Ngoài ra còn có gói miễn phí và trang Offers để tiết kiệm thêm.

FAQ

Giá của GP​T-5.​6 sau khi cắt giảm là bao nhiêu?

Luna $0.20 / $1.20, Terra $2 / $12, và Sol $5 / $30 trên mỗi triệu token đầu vào/đầu ra. Luna và Terra đã được giảm giá vào ngày 30 tháng 7 năm 2026; Sol không thay đổi.

Tôi nên sử dụng gói GP​T-5.​6 nào?

Luna cho khối lượng lớn, công việc nhạy cảm với độ trễ; Terra cho các tác vụ khó hơn nhưng không cần mô hình hàng đầu; Sol cho suy luận khó nhất và lập trình agentic. Định tuyến theo độ khó để tối thiểu hóa chi phí.

GPT-5.6 Luna có miễn phí trên ChatGPT không?

O​penAI đã thông báo vào ngày 6 tháng 8 rằng GPT-5.6 Luna sẽ trở thành mô hình mặc định cho các tài khoản ChatGPT miễn phí và Go, với các cuộc trò chuyện chỉ văn bản không giới hạn; vẫn có giới hạn đối với tải tệp, hình ảnh và công cụ giọng nói, và một nút Think cho suy luận cao hơn đang được triển khai riêng. Đây là các kế hoạch do O​penAI công bố, chưa được xác minh độc lập.

Tại sao Replit lại sử dụng GPT-5.6 Luna cho Chế độ Miễn phí?

Free Mode của Replit, được công bố vào ngày 19 tháng 8 năm 2026, mặc định chạy trò chuyện thường ngày, lên ý tưởng và lập trình đơn giản trên GPT-5.6 Luna cho người đăng ký gói Core và Pro, đồng thời chuyển các tác vụ khó hơn lên mô hình lớn hơn — các chế độ Power/Max hoặc GPT-5.6 Sol — khi cần thiết. Replit cho rằng đợt giảm giá API Luna vào ngày 30 tháng 7, khoảng 80%, là yếu tố giúp mô hình kinh tế này trở nên khả thi. Đây là những kế hoạch do nhà cung cấp công bố, chưa được xác minh độc lập.

Luna Reserve là gì?

Một hạn mức dự phòng mà O​penAI ghi nhận cho Codex và ChatGPT Work: các tài khoản ChatGPT Plus và Pro được chọn sẽ nhận được một lượng sử dụng GPT-5.6 Luna có giới hạn khi hạn mức sử dụng thông thường của họ đã cạn kiệt, để họ tiếp tục hoạt động thay vì bị cắt dịch vụ. Nó chỉ phục vụ GPT-5.6 Luna — không bao giờ là Terra hoặc Sol — có giới hạn riêng, tách biệt với mức sử dụng thông thường, và không khả dụng trong các không gian làm việc Business hoặc Enterprise. Sự tồn tại của nó được O​penAI xác nhận (nhân viên đã xác nhận điều này vào ngày 27 tháng 8); việc triển khai đến các tài khoản được chọn là do cộng đồng báo cáo, chưa được xác minh độc lập.

GP​T-5.​6 có giá bao nhiêu mỗi tháng?

Với 10M token/tháng (70% input): khoảng $5 trên Luna, $50 trên Terra và $125 trên Sol — chênh lệch 25 lần, trước khi caching. Chi phí thực tế của bạn phụ thuộc vào caching và tỷ lệ input/output của bạn.

Cả ba gói có cùng cửa sổ ngữ cảnh không?

Vâng — khoảng ngữ cảnh 1.05M token và tối đa 128K token đầu ra, với hỗ trợ thị giác, công cụ, JSON và suy luận.

Bộ nhớ đệm prompt ảnh hưởng đến chi phí như thế nào?

Bộ nhớ đệm giúp giảm mạnh chi phí cho các ngữ cảnh lặp lại — chi phí đọc bộ nhớ đệm của Luna khoảng 0,02 USD mỗi triệu token so với 0,20 USD cho dữ liệu mới — vì vậy hãy tái sử dụng các prompt đã được lưu trong bộ nhớ đệm bất cứ khi nào có thể. Ngược lại, đầu vào dài có thể đưa bạn lên một mức giá đắt hơn cho ngữ cảnh dài.

Các bậc này so sánh như thế nào với các mô hình của Anthropic hoặc các mô hình mở?

Theo báo cáo, Luna rẻ hơn Claude Haiku 4.5 (khoảng 5x đầu vào / 4x đầu ra) và Terra thấp hơn Claude Sonnet 5 ($3 / $15). Luna cũng gần mức giá sàn của các mô hình mở giá rẻ (Deep​Seek, GLM-5.2 ~$1.20/$4.10).

Tôi có thể sử dụng cả ba cấp độ cùng nhau ở đâu?

Thông qua endpoint duy nhất tương thích O​penAI của OrcaRouter với mức phụ phí 0%, cùng với các mô hình mở rẻ hơn để định tuyến dựa trên độ khó.

Điểm mấu chốt

Sau đợt cắt giảm giá, GPT-5.6 Luna ($0.20 / $1.20) và Terra ($2 / $12) trở nên hấp dẫn cho các tác vụ khối lượng lớn và tầm trung, trong khi Sol ($5 / $30) vẫn là sản phẩm cao cấp hàng đầu — mức chênh lệch chi phí 25 lần khuyến khích định tuyến thông minh. Việc triển khai cho người tiêu dùng củng cố thêm sự phân chia: O​penAI đang biến Luna thành lựa chọn miễn phí mặc định trong khi dành bản cập nhật độ tin cậy của Sol cho các gói trả phí, và Chế độ Miễn phí ngày 19 tháng 8 của Replit — xây dựng trên GPT-5.6 Luna, với các tác vụ khó hơn được định tuyến lên GPT-5.6 Sol — cho thấy các sản phẩm có lưu lượng truy cập lớn cũng chọn cùng tầng này, và cơ chế dự phòng Luna Reserve cuối tháng 8 tiếp tục mở rộng xu hướng bằng cách giữ một số người dùng Plus và Pro chọn lọc ở lại GPT-5.6 Luna ngay cả sau khi hạn mức thông thường của họ đã hết. Đối với các nhà phát triển API, đó là một lý do nữa để định tuyến lưu lượng dễ sang Luna. Khoản tiết kiệm lớn nhất đến từ việc định tuyến theo độ khó, tận dụng bộ nhớ đệm và xử lý theo lô, cũng như kiểm soát token suy luận thay vì mặc định dùng một tầng duy nhất. Việc đó dễ thực hiện nhất qua một endpoint duy nhất có mức phụ phí 0% như OrcaRouter, nơi cả ba tầng (với giá mới) nằm cạnh các mô hình mở rẻ hơn mà bạn sẽ muốn so sánh.