
GPT-5.6 Luna Max: Cách các nhà phát triển thực sự sử dụng nó trong Codex — và nơi nó gặp sự cố
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 221 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Vào ngày 1 tháng 8, một tệp cấu hình bốn dòng bắt đầu lan truyền trên X. Nó tạo ra một tác nhân Codex tên là luna_worker, đặt mô hình của nó thành gpt-5.6-luna, đặt mức độ suy luận thành max, và giao cho nó nửa phần công việc nhàm chán của bạn trong khi GPT-5.6 Sol giữ kế hoạch. Chỉ trong vài ngày, cùng một công thức đã được đăng lại bằng tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Tây Ban Nha và tiếng Ả Rập, và một plugin được xây dựng dựa trên cùng ý tưởng đã vượt 1.300 sao GitHub trong bốn ngày. Đây cũng là cách kết nối sai, gần như đúng vào ngày nó lan truyền: tác giả của plugin đó đã công khai gỡ GPT-5.6 Luna khỏi chính dự án của mình trong vòng 48 giờ, vì một người đồng nghiệp nói với anh ta rằng nó không hoạt động như một tác nhân phụ của Codex — rồi hai ngày sau đưa nó trở lại, được kết nối theo một cách hoàn toàn khác.
Toàn bộ diễn biến đó xảy ra trong vòng một tuần, và đó là thứ hữu ích nhất mà bất kỳ ai từng công bố về mô hình này. Nó cho bạn biết mô hình nhân công chi phí thấp là có thật, rằng cách kết nối hiển nhiên lại là cách sai, và rằng sự khác biệt giữa hai cách đó chính là phần lớn giá trị. Mọi điều trong bài viết này liên quan đến kỹ thuật đều đến từ các chuyên gia thực hành đăng tải kết quả của chính họ trong khoảng từ 30 tháng 7 đến 5 tháng 8 năm 2026 — không phải từ tài liệu của công ty, vốn mô tả GPT-5.6 Luna là mô hình cho "khối lượng công việc lớn, nhạy cảm về chi phí" và không nói gì về bất kỳ điều nào ở trên. Khi một con số được đo bởi bên thứ ba độc lập, chúng tôi nói rõ điều đó; khi nó là nhật ký phiên làm việc của một nhà phát triển nào đó, chúng tôi cũng nói rõ, kể cả khi chúng mâu thuẫn với nhau. Chúng mâu thuẫn rất nhiều.
"Luna Max" là gì, và vì sao hầu hết mọi người không bao giờ nhìn thấy nó
Không có mô hình nào tên là Luna Max. Có hai núm điều chỉnh, và Luna Max là một tổ hợp của chúng: bậc rẻ nhất của dòng GPT-5.6, chạy ở cài đặt suy luận sâu nhất. Núm bậc chọn giữa GPT-5.6 Sol, GPT-5.6 Terra và GPT-5.6 Luna. Núm nỗ lực có sáu vị trí — không, thấp, trung bình, cao, rất cao và tối đa — và nó quyết định mô hình suy nghĩ bao nhiêu trước khi trả lời.
Gần như không ai kết hợp gói rẻ với chế độ sâu, vì một lý do tầm thường: max bị ẩn theo mặc định. Trong ứng dụng desktop ChatGPT/Codex, nó nằm trong Settings → Configuration → Available reasoning efforts, nơi danh sách đi kèm với tùy chọn đầu tiên không được chọn. Sáu nhà phát triển khác nhau đã đăng cùng một cách khắc phục bằng ba cú nhấp chuột trong tuần đầu tiên của tháng 8, đó là một dấu hiệu tốt cho thấy có bao nhiêu người đã chạy Luna ở độ sâu mặc định và đánh giá mô hình dựa trên đó. Về phía API, không có công tắc nào để tìm: bạn truyền id mô hình gpt-5.6-luna và đặt mức độ suy luận thành max trong phần thân yêu cầu, và đó là toàn bộ thay đổi.
Một hệ quả đáng ghi nhớ trước khi bạn đọc bất kỳ điểm chuẩn nào: khi Artificial Analysis công bố điểm trí tuệ cho mô hình này, trang được đặt tên là GPT-5.6 Luna (max). Con số độc lập mà mọi người trích dẫn cho Luna là cấu hình nỗ lực tối đa. Nếu bạn đang chạy bản mặc định và thắc mắc tại sao trải nghiệm của mình không khớp với bảng xếp hạng, đó chính là lý do.
Cái nút xoay mà không ai giải thích: effort thay đổi số lượng token, không phải giá token
Việc tăng mức nỗ lực suy luận không đưa bạn lên mức giá đắt hơn. GPT-5.6 Luna có giá $0.20 cho mỗi triệu token đầu vào và $1.20 cho mỗi triệu token đầu ra ở mọi mức nỗ lực. Điều thay đổi là số token mà mô hình dùng để đi đến câu trả lời — và ở mức tối đa, nó dùng rất nhiều.
Artificial Analysis đã đo lường điều này trong quá trình chạy Intelligence Index của mình, và những con số này là sự xác nhận độc lập rõ ràng nhất cho những gì mà các nhà thực hành đã phàn nàn:
• Score — 51 trên Artificial Analysis Intelligence Index, so với mức trung vị là 17 đối với các mô hình mà nó đánh giá trong cùng phân khúc.
• Độ dài dòng — 130 triệu token đầu ra được tạo ra trong lần chạy chỉ số, so với mức trung vị 61 triệu. Artificial Analysis đánh dấu mô hình là "rất dài dòng."
• Tốc độ thô — 182.5 token đầu ra mỗi giây, đứng thứ 16 trong số 163 mô hình. Mỗi token đều nhanh.
• Thời gian đến token đầu tiên — khoảng 136 giây ở mức nỗ lực tối đa, mà Artificial Analysis lưu ý là ở mức cao ngay cả đối với các mô hình suy luận trong phân khúc giá đó.
• Tổng chi tiêu — $174.06 để đánh giá mô hình trên toàn bộ chỉ mục.
Hãy đọc dòng thứ ba và thứ tư cùng nhau, bởi vì cặp đó là toàn bộ trải nghiệm người dùng. Luna ở mức tối đa truyền token nhanh chóng nhưng mất vài phút để khởi động, và sau đó tạo ra số token gần như gấp đôi so với một mô hình thông thường làm cùng một công việc. Đó là lý do tại sao phàn nàn phổ biến nhất trong các báo cáo thực tế không phải là "nó sai" mà là "nó chậm" — và lý do tại sao giá rẻ không chuyển thành một phiên làm việc rẻ tương ứng. Bạn đang mua một mức giá thấp trên một số lượng token cao.
Để đối chiếu: trên trang mô hình GPT-5.6 Luna của chúng tôi, thời gian trung vị quan sát được đến token đầu tiên qua bảy ngày lưu lượng thực tế là 1.78 giây, với bách phân vị thứ 95 là 9.26 giây. Điều đó không mâu thuẫn với con số 136 giây — cùng một mô hình đó được đo trên nhiều mức cài đặt effort khác nhau, hầu hết không phải ở mức tối đa. Độ trễ bạn nhận được là thuộc tính của mức bạn đặt, chứ không phải của endpoint bạn gọi.

Luna Max có thực sự là "Sol Medium với chi phí chỉ bằng một phần sáu" không?
{{1}}Đây là tuyên bố đã khiến mô hình này lan truyền mạnh mẽ, và nó bắt nguồn từ Dan McAteer, người đã nhận định rằng Luna ở mức suy luận tối đa đạt khoảng GPT-5.6{{/1}} Sol ở mức trung bình, hoặc Claude Opus 5 ở mức trung bình, với chi phí chỉ khoảng một phần sáu. {{2}}Tuyên bố này đã được nhiều tài khoản lặp lại, đôi khi bị lược bỏ sự dè dặt, và đáng để tách bạch những gì được đo lường với những gì chỉ là cảm nhận.{{/2}}
Bảng xếp hạng độc lập ủng hộ mạnh mẽ nửa tuyên bố về chi phí nhưng chỉ ủng hộ một phần nửa về khả năng. Khi chạy cùng bộ benchmark ở mức tối đa qua các phân khúc, Artificial Analysis ghi nhận Luna đạt chỉ số 51 với $174, Terra đạt 55 với $1.403, Kimi K3 đạt 57 với $2.437, và Sol đạt 59 với $2.824. Luna kém Sol tám điểm chỉ số và chỉ tốn khoảng một phần mười sáu chi phí để thực hiện cùng một khối lượng công việc.

Bảng xếp hạng độc lập trở nên sắc bén hơn vào ngày 13 tháng 8, khi DeepSWE phát hành v1.1 — một bản sửa đổi của chuẩn đánh giá kỹ thuật tầm xa vốn giữ nguyên 113 tác vụ gốc từ 91 kho lưu trữ trên năm ngôn ngữ, nhưng giờ đây chấm điểm từng bản vá bằng cách chạy bản diff đã commit trong một container biệt lập, điều này khiến việc gian lận khó hơn. Trên bảng cập nhật, cả ba bậc GPT-5.6 ở mức nỗ lực tối đa đều đạt đúng vị trí như bài viết tháng 7: Luna Max đạt 67,2% pass@1 với 0,61 USD mỗi tác vụ, Terra Max khoảng 70%, Sol Max đạt 73% với 8,39 USD — tăng sáu điểm tỷ lệ thành công với chi phí gấp khoảng mười bốn lần.
Phép so sánh đáng xem xét lại nằm dưới Luna, không phải bên trên nó. Claude Sonnet 5 Max đạt 54% trên cùng 113 tác vụ — kém Luna Max khoảng 13 điểm — với mức $26,40 mỗi tác vụ, tức là gấp khoảng 44 lần chi phí Luna phải trả cho cùng một lời giải. Luna Max cũng vượt qua Gemini 3.7 Flash (65% với cấu hình nỗ lực cao trên cùng bảng xếp hạng); bài đăng cộng đồng nêu bật vòng này cho thấy khoảng cách với Gemini 3.7 Flash Medium là khoảng 1,7 điểm. DeepSWE là bộ đánh giá độc lập của Datacurve, không phải đánh giá của công ty — tuyên bố của chính công ty rằng dòng GPT-5.6 đạt được kết quả tiên tiến nhất trên Terminal-Bench 2.1 và DeepSWE vẫn là một khẳng định riêng do nhà cung cấp báo cáo.
Sau đó là bằng chứng thực địa, vốn thực sự bị chia rẽ. Pawel Huryn đã chạy benchmark sửa lỗi của riêng mình — 105 lỗi cố tình cài vào hai cơ sở mã thực tế, đánh giá mù, mỗi mô hình một vòng — và báo cáo rằng Luna ở mức nỗ lực tối đa sửa được 33 lỗi với 1,80 đô la, so với 24 lỗi của Claude Fable 5 với 68 đô la. Theo hướng ngược lại, Diego Haz đã dành hai ngày chạy các phiên đối sánh và đi ngược lại xu hướng: Luna trung bình 1,20 đô la mỗi phiên trong khi Sol trung bình 29 đô la, nhưng anh phải làm lại hầu hết đầu ra của Luna và không có gì có thể phát hành cho các trường hợp sử dụng của mình, điều này biến khoản tiết kiệm thành ảo tưởng chứ không phải chiết khấu. Một nhà phát triển khác chạy cùng một khung thử nghiệm cho biết Sol ở mức trung bình tạo ra kết quả rõ ràng tốt hơn Luna ở mức tối đa trong khoảng một nửa thời gian. Một cuộc so tài bằng tiếng Trung trên một tác vụ cảnh 3D duy nhất đã định lượng hóa hình dạng đó: Sol Medium hoàn thành trong 21 phút 30 giây với xếp hạng chất lượng cao nhất và số token ít nhất; Luna Max mất 40 phút 55 giây, tiêu tốn khoảng 130 nghìn token, đạt chất lượng thấp nhất và sử dụng một nửa hạn mức đăng ký hàng tuần.
Bản tóm tắt trung thực về quan điểm của cộng đồng sau một tuần: Luna Max không phải là Sol Medium. Nó rẻ hơn Sol Medium đáng kể nhưng chất lượng kém hơn, và việc đánh đổi đó có tốt hay không hoàn toàn phụ thuộc vào việc nhiệm vụ có được xác định đủ chặt chẽ để "kém hơn" không còn quan trọng hay không. Đó chính xác là mục đích của các mẫu đấu dây bên dưới.
Mô hình sống sót sau khi tiếp xúc: Sol lập kế hoạch, Luna triển khai, một Sol mới rà soát
Không ai tiếp tục sử dụng Luna Max như một tác nhân viết mã mục đích chung. Cấu hình hiệu quả mà giới thực hành đã hội tụ trong mọi phiên bản có bốn vai trò:
• Orchestrator — GPT-5.6 Sol ở mức nỗ lực cao, luôn nằm trong luồng chính. Nó chịu trách nhiệm về yêu cầu, kiến trúc, phân rã tác vụ và nghiệm thu cuối cùng. Nó không viết mã.
• Người triển khai thường quy — GPT-5.6 Luna ở mức nỗ lực tối đa, cho các công việc có phạm vi giới hạn và được xác định đầy đủ: tái cấu trúc cơ học, viết kiểm thử, phân tích mô-đun, các lượt rà soát tài liệu — loại nhiệm vụ mà đích đến là rõ ràng không thể nhầm lẫn.
• Trình triển khai mạnh mẽ — GPT-5.6 Terra ở mức nỗ lực tối đa, dành cho các bản dựng nặng về ngữ cảnh, nơi độ trôi lệnh của Luna trở nên tốn kém.
• Người đánh giá — một phiên bản GPT-5.6 Sol mới, chỉ đọc, chỉ thấy diff cuối cùng và không gì khác. Điểm cốt lõi của "mới" là người đánh giá mang theo ngữ cảnh triển khai có xu hướng tán thành lập luận của chính mình.
Bản triển khai tham chiếu là sol-advisor, một plugin Codex được cấp phép MIT của Dan McAteer, đạt khoảng 1.400 sao trong tuần đầu tiên. Bạn cài đặt nó thông qua chợ plugin Codex bằng cách thêm DannyMac180/sol-advisor làm kho lưu trữ và sau đó thêm sol-advisor plugin. Cấu hình hiện tại của nó rất đáng tham khảo: luồng gốc chỉ định một trình triển khai Terra/High, theo sau là một trình đánh giá Sol/High mới, trong khi Luna ở mức tối đa là một luồng chọn tham gia tường minh, chạy như một tác vụ riêng biệt mà người dùng nhìn thấy được, với phiên Sol chính xem xét và chấp nhận trực tiếp kết quả của nó thay vì chuyển nó qua trình đánh giá gốc.
Nếu bạn không muốn cài đặt gì thêm, phiên bản tối giản được sao chép rộng rãi là một định nghĩa agent tùy chỉnh tại ~/.codex/agents/luna-worker.toml mang hai thiết lập — model = "gpt-5.6-luna" và model_reasoning_effort = "max" — cùng với phần mô tả và hướng dẫn giới hạn nó chỉ làm các công việc được ủy quyền với ranh giới rõ ràng, cấm nó thay đổi mục tiêu tổng thể hoặc mở rộng phạm vi của chính nó, đồng thời gửi các quyết định kiến trúc và yêu cầu mơ hồ về agent chính. Lời khuyên được lan truyền là hãy để Sol viết tệp này cho bạn, xác thực nó với phiên bản Codex bạn đã cài đặt, và hiển thị diff trước khi bạn chấp nhận — điều này là hợp lý dù bạn có tin vào công thức đó hay không.
Cái bẫy subagent, và giải pháp mà cộng đồng đã thống nhất
Đây là điểm mà phiên bản lan truyền của mẫu này và phiên bản hoạt động được bắt đầu rẽ nhánh.
Hệ thống subagent gốc của Codex không coi GPT-5.6 Luna là công dân hạng nhất. McAteer vấp phải một rào cản cứng — Luna không được phép làm subagent — và đã xử lý bằng cách khai báo nó như một custom agent thay vào đó, rồi công khai nêu lên cái giá phải trả của cách xử lý đó: một custom agent không chia sẻ ngữ cảnh với agent chính theo cách mà một subagent gốc làm. Nhiều ngày sau, anh ấy đã gỡ bỏ lane Luna khỏi sol-advisor hoàn toàn, với lý do trích dẫn phát hiện của một nhà phát triển chuyên về Codex khác rằng Luna hoạt động kém trong vai trò subagent, cùng với giả định rằng nó chưa được post-training cho giao thức multi-agent v2. Diego Haz độc lập mô tả cùng một bức tường từ phía ngược lại: Sol không thể tạo Luna như một subagent, nên Luna phải nằm ở một thread cấp cao nhất, khiến việc phối hợp trở nên rối rắm.
Giải pháp, hiện là quan điểm của đa số, là ngừng chống lại nó:
• Hãy cấp cho Luna Max một thread riêng, không phải một slot trong đồ thị subagent. Hãy chỉ đạo bộ điều phối Sol khởi chạy một tác vụ Codex cấp cao nhất riêng trên Luna, theo dõi nó và kéo kết quả về. Đây là điều mà McAteer đã thêm lại vào sol-advisor vào ngày 4 tháng 8, và cũng là điều mà một số người khác đã độc lập đi đến.
• Chấp nhận cô lập ngữ cảnh như một cái giá phải trả. Một luồng riêng biệt nghĩa là một lịch sử riêng biệt. Đó là khoản phí bạn phải trả, và đó cũng là lý do vì sao việc chuyển giao dưới đây quan trọng hơn ở đây so với trong một thiết lập subagent gốc.
• Nếu bạn buộc phải đưa nó vào multi-agent v2, thì danh mục chính là lý do khiến nó bị lọc ra. Một nhà phát triển đã truy ra nguyên nhân loại trừ là do danh mục model mặc định đánh dấu Luna là v1, và đã báo cáo một cách giải quyết: sao chép ~/.codex/models_cache.json, đặt cho Luna multi_agent_version thành v2, trỏ model_catalog_json vào bản sao của bạn, khởi động lại Codex, sau đó yêu cầu bộ điều phối (orchestrator) tạo Luna ở mức tối đa với tầng dịch vụ nhanh và tắt forking. Hãy coi đây là một thủ thuật không chính thức của một người dùng trên một tệp nội bộ — chính xác là thứ mà một bản cập nhật Codex có thể phá vỡ.
Gói bàn giao: năm câu hỏi giải quyết phàn nàn phổ biến nhất
Lỗi được báo cáo nhiều nhất của Luna Max là nó không tuân theo chỉ dẫn một cách chặt chẽ, đặc biệt là khi bạn giao cho nó một quy trình làm việc cụ thể hoặc một vòng lặp lặp lại để chạy. Lời phàn nàn đó xuất hiện từ cả những nhà phát triển thích mô hình lẫn những nhà phát triển đã từ bỏ nó. Biện pháp giảm thiểu mà các học viên liên tục hướng tới không phải là một lời nhắc tốt hơn theo nghĩa phong cách viết; mà là một hợp đồng chặt chẽ hơn. Trước khi chuỗi Luna bắt đầu, hãy trả lời năm điều:
• Chính xác thì agent này cần hoàn thành nhiệm vụ gì?Không phải là lĩnh vực công việc — mà là trạng thái hoàn thành.
• Tệp, tài liệu hoặc hệ thống nào nằm trong phạm vi? Được liệt kê rõ ràng, không suy diễn ngầm.
• Điều gì mà nó không được thay đổi? Các giao diện, migration, cấu hình và hợp đồng công khai không được phép thay đổi.
• Bằng chứng nào chứng minh việc hoàn thành? Một bài kiểm tra được đặt tên, kết quả đầu ra của một lệnh cụ thể, một bản diff chỉ ảnh hưởng đến các tệp được liệt kê.
• Còn thiếu quyết định nào để nó dừng lại?Cơ chế kích hoạt để quay lại thay vì đoán mò — đây chính là thứ ngăn một mô hình rẻ tiền quá hăng hái tự bịa ra một kiến trúc.
Đây cũng là nơi đáng để đưa vào hướng dẫn prompting của chính công ty, với đúng cái nhãn mà nó xứng đáng: công ty báo cáo rằng trong các đánh giá nội bộ về coding-agent, các system prompt gọn nhẹ hơn đã cải thiện điểm đánh giá từ 10–15%, đồng thời cắt giảm tổng token 41–66% và chi phí 33–67%; và công ty khuyên nên kiểm tra các prompt kế thừa từ GPT-5.5 hoặc GPT-5.4 thay vì mang chúng sang nguyên xi. Đó là những con số do nhà cung cấp công bố. Nhưng hướng đi này khớp với những gì ngành đã nhận thấy: hãy mô tả chính xác điểm đến và lược bỏ lời tường thuật về từng bước chân. Lưu ý sự đối lập với đoạn trên — sự chính xác về phạm vi và ràng buộc không đồng nghĩa với sự dài dòng, và sự đồng thuận của cộng đồng là Luna Max cần nhiều hơn điều trước và ít hơn điều sau.
Các chế độ hư hỏng cần lập kế hoạch ứng phó
• Lệch hướng dẫn. Được nhiều nhà phát triển xác nhận: nó bỏ qua các phần của bản tóm tắt ban đầu, và tệ nhất là khi bản tóm tắt là một quy trình cần tuân theo thay vì một kết quả cần đạt được.
• Chậm theo thời gian thực tế. Đã được báo cáo nhiều lần và khớp với thời gian nhận token đầu tiên ~136 giây mà Artificial Analysis đo được ở mức nỗ lực tối đa. Phù hợp cho công việc bạn có thể để chạy nền; nhưng gây khó chịu trong vòng lặp tương tác.
• Đốt ngữ cảnh. Một nhà phát triển báo cáo rằng Luna Max tiêu thụ một cửa sổ luồng Codex 258k nhanh đến mức đáng báo động, và nghi ngờ rằng mức tiêu thụ hạn mức tăng vọt khi Codex bắt đầu nén gần giới hạn. Phần nén là cảm nhận của anh ấy, không phải kết quả đo được — nhưng tốc độ đốt là hệ quả tất yếu của độ dài dòng mà Artificial Analysis đã đo một cách độc lập. Về phía API, hãy chú ý đến mốc ngữ cảnh dài: biểu giá chuyển tiếp cho mô hình này chuyển từ $0.20/$1.20 sang $0.40/$1.80 khi một yêu cầu vượt quá khoảng 272k token, vì vậy một luồng ngày càng phát triển sẽ đắt hơn trên mỗi token, chứ không chỉ đắt hơn về tổng chi phí.
• Bất cứ thứ gì mang tính thị giác. Đây là ranh giới rõ rệt nhất trong các báo cáo thực tế. Một chuyên gia được nhiều người đọc, hủy đăng ký coding Kimi K3 để chuyển sang Luna Max, đánh giá nó tốt ngang cái anh ta đang bỏ đi và rẻ hơn nhiều — với một ngoại lệ rõ ràng dành riêng cho frontend. Một người khác còn thẳng thắn hơn: đừng dùng Luna để làm thiết kế, đồ họa, định dạng hoặc slide; sự phân chia lập kế hoạch bằng Sol và thực hiện bằng Luna dành cho các nhiệm vụ hướng dẫn từng bước, không phải các nhiệm vụ thẩm mỹ.
• Danh mục subagent. Đã đề cập ở trên — nếu Luna âm thầm không bao giờ được chọn trong một lần chạy đa tác nhân, thì nó đang bị lọc, không phải đang gặp lỗi.
• Tiết kiệm ảo. Kiểu thất bại duy nhất không xuất hiện trong bất kỳ bài kiểm tra chuẩn nào: một phiên làm việc tốn 1,20 đô la thay vì 29 đô la nhưng tạo ra công việc bạn phải viết lại bằng tay, khiến bạn mất 1,20 đô la cộng với cả buổi chiều của mình.
Khi nào không nên dùng max
Max không phải là bản nâng cấp miễn phí, và lời khuyên vẫn còn nguyên giá trị là một cái thang chứ không phải một thiết lập:
• Các phép chuyển đổi rõ ràng — đổi tên trường, trích xuất máy móc, một lượt định dạng. Tốn ít hoặc trung bình công sức trên Luna. Chặn cho đến khi một bài kiểm tra cụ thể vượt qua.
• Triển khai thông thường — high hoặc xhigh. Mặc định của cộng đồng cho một Luna worker là xhigh, không phải max, chính vì max tốn thời gian và token cho những tác vụ chưa bao giờ khó.
• Bị ràng buộc nhưng thực sự khó — đây là công việc thực sự của max. Gói bài toán phải vừa khó vừa được đặc tả chặt chẽ để suy luận thêm có thể chuyển hóa thành kết quả tốt hơn.
• Điều tra mơ hồ — hãy đổi cấp độ, không phải vặn núm. Nếu mô hình đánh giá sai thay vì lập kế hoạch thiếu, thì suy nghĩ nhiều hơn trên một mô hình rẻ hơn sẽ không khắc phục được; đó là việc của Sol.
• Bản yêu cầu mơ hồ — hãy sửa hợp đồng, không phải mô hình. Không có cài đặt nỗ lực nào bù đắp được cho một tiêu chí chấp nhận không được nêu rõ.
Một cảnh báo cụ thể về gói đăng ký, từ một hướng dẫn của bên thứ ba và dễ bị hiểu sai: mức tín dụng Codex tính cho mỗi mô hình không có cùng tỷ lệ với giá niêm yết API, vì vậy bạn không thể lấy một tỷ lệ giá API rồi dùng nó làm quy tắc định tuyến gói đăng ký của mình. Hạn mức tin nhắn trong năm giờ được báo cáo ở gói Plus minh họa rõ điểm này — khoảng 15–90 tin nhắn cục bộ trên Sol, 20–110 trên Terra, 50–280 trên Luna, với phạm vi rộng như vậy vì một "tin nhắn" không phải là một đơn vị công việc cố định. Nếu quyết định định tuyến của bạn bị chi phối bởi hạn mức đăng ký thay vì hóa đơn, hãy đo lường theo hạn mức.
Ngoài Codex: mọi người còn đang nhắm nó vào điều gì?
Sự kết hợp giữa suy luận sâu và chi phí thấp hóa ra lại hữu ích ngoài các tác nhân viết mã, và đây là những ứng dụng có bằng chứng cụ thể:
• Tác tử trình duyệt. Một nhà phát triển đã chạy một bộ công cụ tự động hóa trình duyệt trên GPT-5.6 Luna để mở 15 bài đăng hàng đầu trên Hacker News, đọc mọi trang được liên kết và viết báo cáo — tổng chi phí, 3 xu. Nhiệm vụ dài hạn, rủi ro thấp, tiêu thụ token cao: chính xác là kiểu công việc mà mô hình này được định giá để xử lý.
• Chuỗi kỹ năng. Hai người thực hành độc lập đã báo cáo rằng họ vận hành một quy trình hai kỹ năng — tạo hình ảnh rồi đưa vào bộ chuyển đổi ảnh-sang-Three.js — từ một mục tiêu Luna Max duy nhất để có được một vật thể 3D low-poly tương tác; cả hai đều ghi nhận rằng việc này hầu như không làm nhúc nhích bộ đếm sử dụng hàng tuần của họ. Đáng để đọc cùng với cảnh báo "đừng dùng Luna cho công việc hình ảnh": Luna chỉ điều phối các công cụ làm công việc hình ảnh, chứ không tự đánh giá thẩm mỹ.
• Giữ một phiên luôn nóng.Đầu vào được lưu cache trên mô hình này có giá 0,02 USD mỗi triệu token, so với 0,20 USD cho đầu vào chưa lưu cache — mức giảm 90% mà Artificial Analysis liệt kê trên bảng giá của họ — và cửa sổ cache khoảng 30 phút. Ý nghĩa thực tiễn mà một số hướng dẫn độc lập đều đi đến: một phiên chạy lâu dài liên tục đọc lại cùng một mã nguồn sẽ rẻ hơn đáng kể so với việc mở phiên mới cho từng tác vụ.
• Khai thác chênh lệch hạn mức. Đây là tuyên bố táo bạo nhất trong toàn bộ danh sách, và được dán nhãn rõ ràng là một tuyên bố: một nhà phát triển cho biết rằng vì mức nỗ lực gần như miễn phí trong khi hệ số nhân theo bậc rất lớn, việc chạy ở mức nỗ lực tối đa trên gói rẻ đã giúp anh ta xử lý 4,9 tỷ token trong ba tuần với gói 200 đô la — giá trị sáu con số nếu tính theo giá API — và anh ta giữ các mô hình Kimi K3, Grok và DeepSeek trong cùng một bộ chọn phía sau một router nội bộ để việc chạm trần của một nhà cung cấp không làm gián đoạn công việc. Chưa ai độc lập tái lập được con số token đó. Tuy nhiên, thói quen định tuyến đằng sau nó mới là phần đáng để học theo.
Chạy cùng một split mà không có đăng ký Codex
Mọi thứ ở trên là một câu chuyện theo mô hình thuê bao: lý do mọi người quan tâm đến Luna Max là vì nó nới rộng giới hạn tuần. Về phía API, cùng kiến trúc đó đơn giản hơn để xây dựng và dễ suy luận hơn, bởi vì bạn đang thanh toán một hóa đơn thay vì quản lý một hạn mức — và sự phân tách orchestrator/worker không còn là một plugin nữa mà trở thành định tuyến thông thường.
GPT-5.6 Luna hiện có sẵn qua OrcaRouter với giá 0,20 USD cho mỗi triệu token đầu vào và 1,20 USD cho mỗi triệu token đầu ra — giá niêm yết của nhà cung cấp, được chuyển qua với mức phụ phí 0%, đó là lý do vì sao đợt giảm giá ngày 30/7 đã được áp dụng ở phía chúng tôi ngay trong ngày công ty công bố thay vì phải chờ đến một chu kỳ thanh toán sau. Dịch vụ này được phục vụ qua một API tương thích tại /v1/chat/completions và /v1/responses, do đó trường reasoning-effort được gửi kèm trong thân yêu cầu giống hệt như khi gọi trực tiếp, và mã mô hình là openai/gpt-5.6-luna. GPT-5.6 Sol và GPT-5.6 Terra cùng nằm sau một khóa API — đây chính là điểm mấu chốt của mẫu tích hợp này: một orchestrator ở một tầng và một worker ở một tầng khác chỉ là hai mã mô hình trong cùng một tích hợp, chứ không phải hai hợp đồng với nhà cung cấp riêng biệt. DSL định tuyến cho phép bạn thể hiện sự phân tách đó bằng một lần gọi thay vì phải tự tay ghép nối các luồng xử lý lại với nhau, và cơ chế tự động chuyển đổi dự phòng (failover) bao trùm trường hợp mà những người làm arbitrage hạn mức thường giải quyết bằng một bộ định tuyến cục bộ — khi một nhà cung cấp bị suy giảm hiệu năng, yêu cầu sẽ được chuyển đến một nơi khác thay vì dừng lại.

Hai lời cảnh báo thẳng thắn. Bộ máy dành riêng cho Codex — đồ thị tác tử con, chợ plugin, danh mục mô hình, hạn mức hằng tuần — là tài sản của công ty, và không thứ nào trong số đó đi kèm với một khóa API; nếu mẫu hình bạn muốn là sol-advisor bên trong ứng dụng Codex, thì bạn cần một gói đăng ký Codex. Và các kiểu lỗi nêu trên là thuộc tính của mô hình, không phải của đường truyền: định tuyến thay đổi chi phí của một lần gọi và điều gì xảy ra khi nhà cung cấp gặp sự cố, chứ không phải việc Luna có tuân theo hướng dẫn của bạn hay không.
Ai nên sao chép cái này, và ai không nên?
Nếu công việc của bạn có khối lượng lớn và có thể đặc tả một cách máy móc — tái cấu trúc, khung kiểm thử, trích xuất, tài liệu, các lượt phân tích trên một kho mã lớn — hãy bật chế độ tối đa, đặt Luna trong một luồng riêng với bàn giao năm câu hỏi, giữ một phiên bản Sol phía trước để lập kế hoạch và phía sau để rà soát, rồi kỳ vọng tốn ít hơn một bậc độ lớn. Những người báo cáo kết quả tốt nhất đều đang làm một phiên bản nào đó của cách này, và các số liệu chi phí độc lập ủng hộ hướng đi đó ngay cả khi chúng không ủng hộ cách diễn giải "tốt ngang Sol".
Nếu công việc của bạn mang tính thăm dò, thẩm mỹ, hoặc đến dưới dạng một bản tóm tắt mơ hồ và dần rõ ràng hơn khi bạn tiến hành, {{1}}các báo cáo thực địa nói rõ rằng{{/1}} {{2}}bạn sẽ tiêu số tiền tiết kiệm được gấp đôi{{/2}} {{3}}để làm lại đầu ra.{{/3}} Và nếu bạn làm việc theo kiểu tương tác — {{4}}ngồi nhìn nó chạy{{/4}} — {{5}}thì hai phút khởi động nguội ở mức nỗ lực tối đa{{/5}} {{6}}sẽ khiến bạn khó chịu hơn{{/6}} {{7}}mức giá làm bạn hài lòng.{{/7}}
Điều cần theo dõi: liệu công ty có huấn luyện bổ sung Luna cho giao thức subagent v2 hay không. Mọi điểm rườm rà trong kịch bản hiện tại — luồng riêng biệt, mất ngữ cảnh dùng chung, thủ thuật catalog, toàn bộ quá trình thu hồi và kết nối lại — đều tồn tại vì chính khoảng trống đó. Lấp đầy nó và phiên bản tốt nhất của mẫu này sẽ trở nên đơn giản hơn nhiều bước.
Những câu hỏi xứng đáng với một câu trả lời thực sự
Mức độ suy luận tối đa có tốn chi phí trên mỗi token nhiều hơn mức mặc định không?
Không, và đây là sự hiểu lầm phổ biến nhất về cài đặt này. GPT-5.6 Luna tính phí $0,20 cho đầu vào và $1,20 cho đầu ra trên mỗi triệu token bất kể mức độ nỗ lực. Điều mà mức tối đa thay đổi là số token được sử dụng — mô hình lên kế hoạch nhiều hơn, tự kiểm tra và sửa lại trước khi trả lời. Artificial Analysis đã đo mô hình này tạo ra 130 triệu token đầu ra trên một bộ benchmark mà mô hình trung vị tạo ra 61 triệu. Vì vậy, một phiên ở mức nỗ lực tối đa tốn kém hơn một phiên ở mức trung bình cho cùng một tác vụ, hoàn toàn thông qua khối lượng token, và nó cũng mất nhiều thời gian hơn để tạo ra token đầu tiên. Nỗ lực là một núm điều chỉnh số lượng token đội lốt chất lượng.
GPT-5.6 Luna hiện có thể chạy như một subagent Codex gốc chưa?
Tính đến ngày 5 tháng 8 năm 2026, câu trả lời là không — và cộng đồng đã ngừng cố gắng. Đường dẫn subagent gốc của Codex không chấp nhận Luna; giải pháp thay thế custom-agent giúp nó chạy được nhưng lại mất ngữ cảnh dùng chung với agent chính; và nhà phát triển đứng sau plugin nổi tiếng nhất cho mô hình này đã gỡ Luna, rồi thêm lại nó như một tác vụ cấp cao nhất được khởi chạy riêng biệt mà bộ điều phối theo dõi. Nếu bạn thấy một phiên chạy đa agent mà Luna không bao giờ được chọn, rất có thể nó đang bị lọc vì danh mục mô hình tiêu chuẩn đánh dấu nó là v1 thay vì v2, và một nhà phát triển đã tự tay vá lỗi này với rủi ro của chính mình. Đây là điều có khả năng thay đổi nhất trong danh sách khi Codex được cập nhật, vì vậy hãy kiểm tra với phiên bản bạn đã cài đặt thay vì tin vào bất kỳ công thức nào, kể cả công thức này.
Liệu nó có đủ tốt để thay thế gói đăng ký lập trình Claude hay Kimi K3 không?
Một số nhà phát triển đã công khai hủy gói cước $200/tháng vì chính điều này. Bài đăng đưa câu hỏi ra ánh sáng đến từ một nhà miễn dịch học lập trình hằng ngày: ông ấy đã bỏ gói đăng ký lập trình Kimi K3 không phải vì nó tệ mà vì ông không thể biện minh cho việc giữ nó khi GPT-5.6 Luna, theo trải nghiệm của ông, tốt tương đương cho công việc của mình và rẻ hơn nhiều — ngoại trừ phần frontend. Các số liệu chi phí độc lập khiến lập luận này khó bác bỏ: trên cùng bộ benchmark, Kimi K3 ở mức nỗ lực tối đa đạt 57 điểm với $2,437, trong khi GPT-5.6 Luna ở mức tối đa đạt 51 điểm với $174. Nhưng hãy đọc ý kiến phản đối trước khi bạn hủy bất cứ thứ gì. Các nhà phát triển đo lường các phiên so khớp và nhận kết quả tiêu cực không phải đang thử một mô hình khác; họ đang thử một loại tác vụ khác — mở, trực quan hoặc được mô tả lỏng lẻo — và với loại tác vụ đó, mô hình rẻ hơn thua thảm hại đến mức xóa sạch khoản tiết kiệm. Câu trả lời hợp lý là Luna Max thay thế một phần lớn lập trình của bạn công việc, không nhất thiết là lập trình tốt nhất của bạn mô hình, và rằng những người thực hành tận dụng được nó nhiều nhất là những người giữ một gói frontier để lập kế hoạch và kiểm tra.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
