Thẻ tiêu đề hero cho GPT-6 Luna so với GPT-5.6 Luna với huy hiệu 'GA 22 tháng 9 năm 2026', tiêu đề chính 'GPT-6 Luna so với GPT-5.6 Luna', phụ đề 'Cùng tên, nửa giá, sản phẩm kém hơn', và ba thẻ số liệu ghi 'Đầu vào: $0.10 so với $0.20 mỗi MTok', 'Đầu ra: $0.50 so với $1.20 mỗi MTok' và 'Chỉ số AA: 37.26 so với 37.32', với logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

GPT-6 Luna so với GPT-5.6 Luna: Cùng tên, nửa giá, và một sản phẩm bàn giao tệ hơn

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình, chung một từ, và một điểm số độc lập thực tế giống hệt nhau. GPT-6 Luna đạt 37,26 trên Artificial Analysis Intelligence Index; GPT-5.6 Luna đạt 37,32. Chênh lệch 0,07 điểm không phải là một phép đo, mà là nhiễu, và đó là sự thật quan trọng nhất về cặp đôi này. Điều phân biệt hai mô hình không phải là năng lực — mà là $0,0681 cho mỗi tác vụ chỉ số đã hoàn thành so với $0,1783, cùng với một loạt sự thoái bộ trong công việc tri thức mà việc giảm giá không hề đề cập.

Các mốc thời gian rất quan trọng để hiểu các con số. GPT-5.6 Luna ra mắt vào ngày 9 tháng 7 năm 2026 với mức $0.20 cho mỗi triệu token đầu vào và $1.20 cho mỗi triệu token đầu ra. GPT-6 Luna ra mắt vào ngày 22 tháng 9 năm 2026 với mức $0.10 và $0.50 — đúng bằng một nửa giá đầu vào và giảm 58% so với giá đầu ra, điều mà OpenAI mô tả là vĩnh viễn chứ không phải mang tính khuyến mãi. Đó là một đợt giảm giá thực sự, và nó cũng chỉ là nửa nhỏ hơn của câu chuyện. Nửa lớn hơn là mô hình mới hơn là một mô hình khác, không phải cùng một mô hình được định giá lại.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Những gì một cuộc di cư thực sự mang lại, qua những con số

Khi đặt hai phương án cạnh nhau trên các khía cạnh quyết định việc di trú, cục diện không đồng đều. Một số hàng cải thiện, một số thụt lùi, và một hàng cải thiện đáng kể.

• Giá — GPT-6 Luna $0,10 cho đầu vào / $0,50 cho đầu ra mỗi triệu token, so với GPT-5.6 Luna $0,20 / $1,20. Giảm một nửa ở đầu vào, giảm 58% ở đầu ra.

• Đầu vào đã lưu vào bộ nhớ đệm — $0,01 mỗi triệu so với $0,02. Vẫn mức giảm 90% trên mức cơ sở đã giảm một nửa, vì vậy một tiền tố lặp lại chỉ tốn bằng một nửa so với chi phí hồi tháng 7.

• Chi phí cho mỗi tác vụ đã hoàn thành — $0.0681 so với $0.1783 trên cùng một bộ kiểm thử. Mức giảm 62%, lớn hơn mức cắt giảm giá token vì thành phần tác vụ không hoàn toàn giống nhau.

• Token đầu ra mỗi tác vụ — 50.537 so với 41.235. Mô hình mới dài dòng hơn 23% cho mỗi công việc đã hoàn thành, và 78% đầu ra của nó là phần suy luận không bao giờ xuất hiện trong phản hồi.

• Cửa sổ ngữ cảnh — 1.050.000 token so với 1.000.000. Cùng một giới hạn thực tế; cả hai đều giới hạn đầu ra ở 128.000 token.

• Từ chối trả lời — tỷ lệ ảo giác 76,7% trên AA-Omniscience so với 92,6%. Đây là mức cải thiện đơn lẻ lớn nhất trong bộ, và đây không phải là mức tăng kiến thức: độ chính xác chuyển từ 42,7% lên 43,8%, gần như không đổi. Mô hình mới hơn từ chối thay vì bịa ra, đây là thay đổi về hành vi chứ không phải về năng lực.

• Các sản phẩm bàn giao của công việc tri thức — AA-Briefcase v1.1 giảm từ 1.345,38 Elo xuống 1.299,23, và GDPval-AA v2.1 giảm từ 1.443,14 xuống 1.367,09. Cả hai đều giảm, khoảng 46 và 76 điểm.

Lập trình và công việc dài hạn — Terminal-Bench 4.0 tăng từ 11,6% lên 12,6% và SciCode từ 53,6% lên 54,6%, hai hàng ở đây tăng. Ngược lại, Coding Agent Index giảm từ 43 xuống 41 và các đánh giá tác nhân kiểu SWE cũng diễn biến tương tự.

• AutomationBench-AA — 53,2% so với 50,2%. Tăng, và tăng nhiều hơn bất kỳ thước đo tác tử nào khác trong bộ.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

Sự hồi quy nằm ở artefact, chứ không phải ở lập luận.

Quy luật trong hai hàng cuối đó đáng được gọi tên, vì nó chính là toàn bộ quyết định. Mô hình mới làm tốt hơn ở các hành động agentic một bước và kém hơn ở việc bàn giao một tài liệu hoàn chỉnh. Artificial Analysis cho rằng sự suy giảm trong công việc tri thức là do chất lượng trình bày và các sản phẩm bàn giao đã bỏ qua những yếu tố rubric bắt buộc, chứ không phải do lỗi về dữ kiện hay lập luận — đó chính xác là kiểu suy giảm có thể vượt qua một smoke test nhưng lại thất bại khi đánh giá.

Ghép hai sự kiện lại với nhau và việc chuyển đổi tách ra rõ ràng theo thứ tiêu thụ đầu ra. Nếu pipeline của bạn đọc đầu ra có cấu trúc — JSON, một phân loại, một trường được trích xuất, một quyết định định tuyến — thì sự suy giảm về trình bày không khiến bạn tốn gì, cải thiện về việc từ chối trả lời là lợi ích thực sự, và mức giảm 62% chi phí tác vụ được hưởng trọn vẹn. Nếu một người đọc sản phẩm bàn giao — một báo cáo, một bản ghi nhớ, một tài liệu hướng tới khách hàng — thì mô hình mới hơn kém hơn một cách đo lường được ở đúng thứ bạn đang trả tiền để có, và khoản tiết kiệm đang mua cho bạn một người kiểm duyệt.

Chỉ số từ chối trả lời cũng xứng đáng được xử lý theo cùng cách. Một mô hình chuyển từ chỗ bịa đặt đối với 93% những gì nó không biết sang bịa đặt đối với 77% là một đối tượng khác biệt đáng kể đối với một rào chắn an toàn, một bộ sàng lọc tuân thủ, hoặc bất kỳ quy trình nào mà ở đó một câu trả lời sai đầy tự tin lan truyền. Sự cải thiện đó là có thật, nó được đo lường độc lập, và đó là lập luận mạnh nhất cho việc chuyển công việc sang mô hình mới mà hoàn toàn không phụ thuộc vào giá cả.

Điều gì thay đổi trong mã của bạn, và điều gì không

Mức giảm ít hơn so với hàm ý của một đợt giảm giá có quy mô như vậy, và đó là tin tốt. Cửa sổ ngữ cảnh vẫn cùng hạng, đầu ra tối đa giống hệt ở 128.000 token, và điều khoản tái định giá cho ngữ cảnh dài của dòng sản phẩm vẫn không thay đổi: các yêu cầu trên 272.000 token đầu vào bị tính phí gấp 2 lần mức đầu vào và mức cache cùng 1,5 lần đầu ra, áp dụng cho toàn bộ yêu cầu chứ không phải chỉ phần vượt ngưỡng. Một yêu cầu từng tốn kém ở 300.000 token trên GPT-5.6 Luna thì cũng tốn kém trên GPT-6 Luna — một nửa mức giá, cùng ngưỡng chi phí tăng vọt, nên một khối lượng công việc lẽ ra phải được tách ra vào tháng Bảy thì nay vẫn nên tách ra.

Thang effort là nơi hành vi thay đổi chứ không phải chi phí. GPT-6 Luna cung cấp các mức none, low, medium (mặc định), high, xhigh và max, và mức mặc định rất quan trọng: một pipeline được tinh chỉnh theo mức effort mặc định của một mô hình sẽ không tự động được tinh chỉnh theo mức effort mặc định của mô hình khác. Các nhóm đã ghim cứng một cài đặt một cách rõ ràng thì không bị ảnh hưởng. Các nhóm đã dùng mặc định đang chạy một cấu hình khác so với hồi tháng 7, và triệu chứng nhìn thấy được sẽ là lượng token chứ không phải chất lượng.

Một cạm bẫy đáng được nhắc lại vì nó không biến mất cùng model mới. Trên endpoint Chat Completions, function calling chỉ hoạt động khi reasoning effort được đặt thành none; mọi mức effort khác, cũng như mọi công cụ tích hợp, đều yêu cầu Responses API. Một nhóm chuyển đổi vòng lặp gọi công cụ bằng cách chỉ thay chuỗi model sẽ thấy các công cụ của mình âm thầm không khả dụng ở mức medium mặc định, và cách khắc phục là viết lại bề mặt gọi chứ không phải đổi một tham số.

Những gì bạn có thể định tuyến ngày hôm nay và những gì bạn không thể

Đây là phần của quá trình chuyển đổi không liên quan gì đến các bài đo hiệu năng. GPT-5.6 Luna đã có mặt trên OrcaRouter với đúng giá niêm yết — 0,20 USD mỗi triệu token đầu vào, 1,20 USD mỗi triệu token đầu ra, cửa sổ ngữ cảnh 1.000.000 token, đầu ra tối đa 128.000 token, và p50 thời gian đến token đầu tiên là 1,60 giây, được đo trên lưu lượng thực tế tại trang model của chính chúng tôi. Chúng tôi chuyển nguyên giá niêm yết của nhà cung cấp mà không cộng thêm phụ phí, nên vào ngày OpenAI điều chỉnh giá cho dòng sản phẩm này, thay đổi đã được áp dụng ngay bên phía chúng tôi chứ không phải đợi đến kỳ thanh toán kế tiếp.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

GPT-6 Luna không thể định tuyến qua OrcaRouter tính đến ngày 23 tháng 9 năm 2026. Các lựa chọn sẵn có là API riêng của OpenAI và những danh mục đám mây có hỗ trợ dòng mô hình này, và chúng tôi không liệt kê một mô hình mà mình không thể phục vụ. Hệ quả thực tế là một nhóm đang lên kế hoạch cho quá trình di chuyển này có thể chuyển phần định giá ngay hôm nay nhưng không thể chuyển phần định tuyến ngay hôm nay — hai nửa của thay đổi sẽ diễn ra vào những ngày khác nhau.

Điều mà nó mở ra trong lúc này chính là cách bố trí mà hầu hết các đội rốt cuộc vẫn sẽ muốn. Hãy giữ GPT-5.6 Luna trên những luồng mà kết quả bàn giao chính là sản phẩm, chạy GPT-6 Luna ở bất cứ nơi nào code tiêu thụ đầu ra, và coi ranh giới đó như một tầng thay vì một lần viết lại. Vì những mô hình bạn có thể truy cập đều nằm sau một endpoint với hơn 200 mô hình dùng cùng một khóa và tự động chuyển đổi dự phòng giữa các nhà cung cấp, nên thêm hay bớt một tầng chỉ là một mục cấu hình chứ không phải một tích hợp thứ hai — và đường leo thang không còn phụ thuộc vào việc bất kỳ một mô hình đơn lẻ nào có sẵn.

Quyết định di cư, được nói một cách rõ ràng

Chuyển công việc đến nơi đầu ra được máy đọc và điều kiện thành công có thể kiểm chứng được. Phân loại, trích xuất, quyết định định tuyến, các lệnh gọi guardrail, các lượt biến đổi hàng loạt và các hành động tác nhân một bước đều đủ điều kiện: thành phần tổng hợp không thay đổi, hành vi từ chối được cải thiện đáng kể, và chi phí tác vụ giảm khoảng 62%. Với Batch ở mức một nửa so với giá tiêu chuẩn và đầu vào được lưu trữ ở mức một phần mười của mức cơ sở đã giảm một nửa, một pipeline từng ở mức cận biên vào tháng Bảy nay có thể trở nên đơn giản.

Đừng chuyển công việc ở những chỗ mà con người phải ký duyệt sản phẩm, và đừng chuyển các luồng dành cho coding agent một cách mù quáng. Mức giảm 46 điểm trên AA-Briefcase và mức giảm 76 điểm trên GDPval là những con số nhỏ nhưng cùng chỉ về một hướng với mức sụt hai điểm của Coding Agent Index, và kiểu thất bại mà Artificial Analysis mô tả — bỏ sót các yếu tố trong rubric, phần trình bày yếu hơn — thì không thể phát hiện được bằng kiểm tra tự động. Hãy giữ nguyên model trước đó ở những chỗ mà độ chỉn chu chính là sản phẩm bàn giao.

Và hãy coi mức ngang bằng chỉ số 0,07 điểm ấy đúng như nó là một phát hiện. Đây không phải là một mô hình thông minh hơn ở mức giá thấp hơn. Đó là một mô hình có hình dạng khác ở mức giá thấp hơn, và câu hỏi mà một kế hoạch chuyển đổi phải trả lời là hình dạng nào mà khối lượng công việc của bạn tiêu thụ — chứ không phải điểm số nào cao hơn, bởi vì trên bản ghi độc lập, hai điểm số đó là cùng một con số.