Thẻ tiêu đề hero ghi 'OpenAI's Decisions API', phụ đề 'GPT-6 Luna ngừng trò chuyện và chọn một câu trả lời', cùng ba thẻ bo tròn ghi 'Một câu trả lời từ danh sách bạn định nghĩa', 'Nhà cung cấp công bố ~150 ms' và 'Chưa có giá công bố', phần chân trang ghi 'Số liệu OpenAI do nhà cung cấp báo cáo; chưa có đo lường độc lập.', và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

API Decisions của OpenAI: GPT-6 Luna ngừng trò chuyện và chọn một câu trả lời

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GPT-6 Luna ra mắt ngày 22 tháng 9 năm 2026 với vai trò bậc thấp, rẻ nhất trong thang GPT-6 của OpenAI. Điều mới mẻ vào ngày 29 tháng 9 là một công việc dành cho nó chẳng liên quan gì đến hội thoại. Decisions API của OpenAI nhận một câu hỏi do bạn viết, một danh sách hữu hạn những câu trả lời bạn cho phép, và một mẩu ngữ cảnh — văn bản hoặc hình ảnh — rồi trả về một trong số những câu trả lời đó. Không phải văn xuôi. Không phải một đoạn văn để bạn phân tích rồi hy vọng. Mà là một lựa chọn duy nhất, để một phiếu hỗ trợ đi vào một trong năm hàng đợi, một hình ảnh rơi vào một hạng mục kiểm duyệt, hoặc một agent chọn nước đi tiếp theo từ một chính sách bạn đã định nghĩa. Nó được công bố tại DevDay 2026 và hiện đang ở giai đoạn xem trước giới hạn, với việc OpenAI cho biết kế hoạch phát hành rộng rãi trong những ngày tới.

Phần lớn những gì một nhóm cần trước khi xây dựng dựa trên tính năng này vẫn chưa được công bố. Không có giá cho mỗi lần gọi, không có giới hạn được nêu về số lượng câu trả lời ứng viên mà một yêu cầu có thể chứa, không có tuyên bố về việc liệu bạn có thể tinh chỉnh nó trên dữ liệu của riêng mình hay không, và — tính đến ngày 30 tháng 9 — không có mục nào về nó ở bất kỳ đâu trong chỉ mục tài liệu dành cho nhà phát triển, nhật ký thay đổi hay tài liệu tham chiếu API của chính OpenAI. Chúng tôi đã kiểm tra cả ba. Hiện tại, khả năng này chỉ tồn tại trong bản tóm tắt DevDay của OpenAI và trong những gì một phát ngôn viên của OpenAI nói với các phóng viên vào ngày ra mắt. Vì vậy, phần còn lại của bài viết này giữ ba tầng riêng biệt một cách rõ ràng: những gì OpenAI đã xác nhận, những gì một phép đo trong ngày ra mắt tuyên bố, và những gì chưa ai có thể biết.

Một quyết định bị ràng buộc thực sự là gì

Hai cách tiếp cận hiện có làm công việc này một cách tồi tệ, và Decisions API nhắm vào khoảng trống giữa chúng. Cách thứ nhất là gợi ý một mô hình trò chuyện: bạn viết một chỉ dẫn cẩn thận yêu cầu nó chọn từ một danh sách, nó viết cho bạn một câu, và nếu may mắn, bạn có thể đọc xác suất token từ phản hồi để có được thứ gì đó giống như điểm tin cậy. Nó hoạt động, nó đốt token, và con số tin cậy là một phỏng đoán thô. Cách thứ hai là huấn luyện một bộ phân loại nhỏ: nhanh, rẻ, và nó cần dữ liệu được gán nhãn cùng với một lần huấn luyện lại mỗi khi tập nhãn thay đổi.

Một mô hình quyết định nằm giữa những thứ đó. Nó chấp nhận các nhãn mới trong prompt — giống như một prompt vẫn làm — nhưng trả về một điểm số hoặc một lựa chọn mà lập trình viên có thể rẽ nhánh mà không cần phân tích cú pháp, đó là thuộc tính mà một bộ phân loại từng có và một mô hình trò chuyện chưa từng có. OpenAI không xa lạ với hình dạng này: API Moderation của họ đã trả về điểm số theo từng danh mục thay vì văn bản trong nhiều năm, với một khác biệt quan trọng ở đây. Các danh mục của Moderation là của OpenAI. Các danh mục của Decisions API là của bạn.

Ràng buộc chính là sản phẩm, và thật đáng để nói chính xác về những gì nó mang lại và không mang lại. Một không gian đầu ra hữu hạn nghĩa là mọi giá trị được phép đều được biết trước, vì vậy ứng dụng của bạn có thể từ chối một câu trả lời mà nó không định nghĩa, gán một mức quyền khác nhau cho mỗi nhánh, và chuyển sang con người khi độ tin cậy hoặc ngữ cảnh còn yếu. Nó cũng khiến việc đánh giá ngoại tuyến trở nên khả thi, bởi vì mỗi ca kiểm thử đều có một lớp mục tiêu và một chi phí đo lường được khi nó sai. Điều nó không mang lại là tính đúng đắn. Một mô hình bị ràng buộc vẫn có thể chọn câu trả lời hợp lệ nhưng sai, bị dẫn dắt bởi ngữ cảnh gây nhầm lẫn, hoặc thừa hưởng thiên kiến từ các danh mục bạn đã viết.

Tuyên bố về 150 mili giây, và con số mà OpenAI đã không công bố

OpenAI cho biết API Decisions đưa ra quyết định nhanh hơn khoảng mười lần so với GPT-6 Luna thông qua API thông thường — vào khoảng 150 mili-giây so với khoảng 1,6 giây. Con số đó do nhà cung cấp công bố và chưa được tái lập; không có phép đo độc lập nào về nó trong hai ngày kể từ khi ra mắt, và bản tóm tắt của chính OpenAI chỉ nói "ra quyết định theo thời gian thực". Không có phân bố độ trễ, không có khu vực, không có kích thước đầu vào, không có mức độ đồng thời và không có thỏa thuận mức dịch vụ nào đi kèm con số này.

Dữ liệu lưu lượng của chính chúng tôi không thay thế cho bài kiểm tra đó, nhưng nó giải thích vì sao phân phối còn thiếu lại quan trọng. Trong bảy ngày tính đến ngày 30 tháng 9, GPT-6 Luna được phục vụ qua tuyến chat-completions thông thường của OrcaRouter cho thấy trung vị là 699 mili giây và p95 là 7,6 giây trên 3,23 tỷ token thuộc khối lượng công việc hỗn hợp — mức chênh lệch hơn một bậc độ lớn giữa phần giữa và phần đuôi. Đó là một dạng yêu cầu khác với một quyết định có ràng buộc, nên đây không phải là so sánh với tuyên bố 150 ms. Đây là lý do một p50 duy nhất trên tiêu đề là con số sai để làm căn cứ thiết kế thời hạn. Nếu bạn kiểm thử bản xem trước, hãy ghi lại trung vị, p95 và p99 riêng biệt cho đầu vào văn bản và hình ảnh, bao gồm cả thời gian mạng và các lần thử lại, rồi đo thời hạn mà sản phẩm của bạn thực sự có — một quyết định định tuyến cho hàng đợi bất đồng bộ và một quyết định nằm giữa một cú nhấp chuột và một giao dịch thanh toán không dùng chung một ngân sách độ trễ.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Định giá: chi phí của mô hình nền tảng là bao nhiêu, và tại sao đó không phải là giá của API

OpenAI chưa công bố mức phí nào cho Decisions API. Cũng không thể mặc nhiên cho rằng mức giá theo token của Luna sẽ được áp dụng, bởi Decisions API là một gói riêng — một endpoint khác với các giới hạn khác — và OpenAI đã nói rằng họ sẽ chia sẻ thêm chi tiết "khi triển khai rộng rãi". Bất kỳ ai lúc này báo cho bạn mức chi phí cho mỗi quyết định thì đều chỉ đang suy đoán mà thôi.

Được công bố là bảng giá cho mô hình mà nó được xây dựng dựa trên, đọc từ trang giá của OpenAI vào ngày 30 tháng 9 năm 2026:

• Đầu vào — $0.10 mỗi triệu token, sẽ thành $0.20 khi vượt quá 272,000 token đầu vào
• Đầu ra — $0.50 mỗi triệu token, sẽ thành $0.75 khi vượt quá 272,000 token đầu vào
• Đầu vào được lưu trong bộ nhớ đệm — $0.01 mỗi triệu token; thao tác ghi vào bộ nhớ đệm được tính ở mức $0.125, cao hơn 25% so với mức giá không lưu trong bộ nhớ đệm
• Xử lý Batch và Flex — 50% mức giá tiêu chuẩn; chế độ Fast — gấp 2 lần mức giá áp dụng

Ranh giới ngữ cảnh dài chính là thứ khiến người ta bị bất ngờ, và nó hoạt động giống như trong toàn bộ dòng GPT-6: vượt qua 272.000 token đầu vào sẽ tính lại giá toàn bộ yêu cầu theo mức cao hơn, chứ không chỉ phần vượt ngưỡng. Một API quyết định đưa một tài liệu dài hoặc một tập ảnh lớn cho mô hình đúng là kiểu lời gọi có thể vượt qua ranh giới đó, và đây là một điểm nữa mà những giới hạn chưa được công bố của bản xem trước vẫn để ngỏ.

GPT-6 Luna theo cách của riêng nó

Bỏ API đi thì mô hình bên dưới là một mô hình suy luận ở bậc thấp nhất trong gia đình ba bậc — dưới GPT-6 Sol ở mức $2.00/$10.00 và GPT-6 Astra chủ lực ở mức $10.00/$50.00 — với cửa sổ ngữ cảnh 1.050.000 token, giới hạn đầu ra 128.000 token, thời điểm cắt kiến thức là ngày 18 tháng 5 năm 2026, và mức độ nỗ lực suy luận có thể đặt trên sáu giá trị từ none đến max. Nó nhận đầu vào văn bản và hình ảnh rồi trả về văn bản, và trên tài liệu dành cho nhà phát triển của chính OpenAI, mặc định nỗ lực là medium. Một lưu ý thực tế từ chính trang đó, không liên quan đến Decisions API nhưng hữu ích nếu bạn đang nối Luna vào như một phương án dự phòng: trên Chat Completions, gọi hàm chỉ hoạt động khi nỗ lực suy luận được đặt thành none. Các công cụ ở bất kỳ thiết lập nỗ lực nào khác đều cần Responses API.

Về chất lượng, con số độc lập là Chỉ số Thông minh của Artificial Analysis ở mức 37,3 đối với Luna khi chạy ở mức nỗ lực tối đa, so với 47,5 đối với GPT-6 Sol — một khoảng cách khoảng mười điểm, đó là cách trung thực để đọc mức chênh lệch giá gấp hai mươi lần ở đầu vào. Không con số nào trong hai con số đó là một phát biểu về Decisions API, vốn có tác vụ bị hạn chế là một phép đo hoàn toàn khác và không có điểm số được công bố.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya, và cách diễn đạt "system one"

Decisions API không hề xuất hiện trong một khoảng trống. Thuộc TypeSafe AI: Jev, ra mắt ngày 15 tháng 9 năm 2026 bởi Diogo Almeida và được phát hành rộng rãi từ ngày 21 tháng 9, là mô hình đã khiến hạng mục này trở nên dễ hiểu đối với các nhà phát triển: nó không tạo ra văn bản nào cả, mà thay vào đó trả về các câu trả lời có kiểu kèm giá trị độ tin cậy, với mức $0.042 cho mỗi triệu token đầu vào, còn đầu ra được tính phí bằng 0. Lần kiểm thử độc lập đầu tiên đối với Jev, do Every thực hiện, đã đưa ra 777 phán đoán trên 37 tài liệu trong chưa đầy 0,7 giây với chi phí khoảng một phần tư cent, và một thử nghiệm thứ hai ghi nhận thời gian trung vị là 0,35 giây mỗi đoạn so với 8,83 giây đối với Claude Fable 5.1 ở mức nỗ lực cao — nhanh hơn khoảng 25 lần với chi phí chỉ bằng khoảng 1/580, trong khi bắt được sáu trong bảy khiếm khuyết được cố ý cài vào, còn Fable 5 bắt được cả bảy. "Tốt nhưng chưa hoàn hảo" là phán quyết của Every, và đó là cách đọc đúng đắn chỉ trong một dòng. Laya là ứng viên thứ ba có cùng hình dạng, một mô hình quyết định trả lời mà không viết ra một token nào.

Việc OpenAI xây dựng Decisions API có phải vì Jev hay không chỉ là suy đoán. The New Stack, khi đưa tin vào ngày ra mắt, gọi phản ứng trước TypeSafe là "có khả năng" và lưu ý rằng OpenAI có lẽ đã vội công bố trước thềm DevDay; OpenAI chưa hề nói bất cứ điều gì như vậy, và thời điểm — Jev chính thức khả dụng phổ thông vào ngày 21 tháng 9, DevDay vào ngày 29 tháng 9 — tuy gợi mở nhưng không phải bằng chứng. Điều không phải suy đoán là hai bên hiện chưa thể so sánh được với nhau trên phương diện mà người mua quan tâm. Jev công bố mức giá, hình thức tính phí theo từng lượt gọi và ngày GA. Decisions API không công bố bất kỳ điều nào trong ba điều đó.

Nơi nó hoạt động, và những gì cần giữ ấm bên cạnh nó

Decisions API là gói do chính OpenAI đóng gói. Đây không phải là một mô hình trong danh mục của chúng tôi và chúng tôi không định tuyến nó, vì vậy nếu bạn muốn endpoint cụ thể này, OpenAI là nơi cung cấp nó. Mô hình mà nó được xây dựng dựa trên lại là chuyện khác: GPT-6 Luna là một tuyến đang hoạt động trên OrcaRouter theo giá niêm yết của OpenAI, không cộng thêm phụ phí nào — $0.10 cho đầu vào và $0.50 cho đầu ra mỗi triệu token, với bậc >272K được tính ở mức $0.20/$0.75 — và trong bảy ngày tính đến ngày 30 tháng 9, nó đã phục vụ 3,23 tỷ token qua chúng tôi với tỷ lệ lỗi 0,18%.

Điều đó quan trọng đối với cách bạn giảm thiểu rủi ro cho một bản xem trước. Cách hợp lý để thử nghiệm một endpoint quyết định có ràng buộc là giữ đường dẫn dựa trên prompt luôn sẵn sàng làm phương án dự phòng, bởi vì một bản xem trước có thể thay đổi giới hạn hoặc giá mà không báo trước, và một quyết định nằm trên đường dẫn quan trọng cần có nơi để đi. Giữ phương án dự phòng đó trên cùng khóa với các mô hình khác của bạn nghĩa là không cần hợp đồng thứ hai và không cần thay đổi mã cho đường dẫn dự phòng: một API cho hơn 200 mô hình, với chuyển đổi dự phòng tự động giữa các nhà cung cấp khi một bên gặp trục trặc. Và nếu quyết định của bạn là một bước trong chuỗi dài hơn, DSL định tuyến sẽ kết hợp các mô hình thành một lời gọi duy nhất, đúng chính là mẫu orchestrator-cộng-decider mà bài viết về Jev đã phổ biến — một mô hình lớn lập kế hoạch, một mô hình nhỏ chọn từng bước. Mẫu đó có thể được xây dựng ngay hôm nay từ các mô hình chúng tôi cung cấp; bản thân Decisions API sẽ nằm ngoài đó cho đến khi OpenAI mở nó ra.

Ai nên di chuyển, và ai nên chờ đợi

Nếu vấn đề của bạn là một tác vụ phân loại hoặc định tuyến khối lượng lớn, nơi rẽ nhầm là rẻ và có thể đảo ngược, thì bản xem trước đáng để bạn dành ra một dạng yêu cầu và một tập dữ liệu gán nhãn trong tuần này — năng lực là thật, ràng buộc là một cải thiện thực sự so với việc phân tích văn xuôi, và bản xem trước là thời điểm rẻ nhất có thể để biết chi phí lỗi của nó sẽ rơi vào đâu. Nếu quyết định của bạn cho phép chi tiền, nhắn tin cho khách hàng, hoặc nằm giữa người dùng và một khoản thanh toán, thì không có gì trong tuần này thay đổi cách bạn tính toán: không có mức giá được công bố để mô hình hóa, không có giới hạn được công bố để thiết kế xoay quanh, không có SLA, và không có thông tin nào về việc liệu bạn có thể tinh chỉnh thứ này trên dữ liệu của riêng mình hay không. Bốn khoảng trống đó là những gì mà “triển khai rộng rãi” phải lấp đầy, và cho đến khi OpenAI gọi tên chúng, cách đọc trung thực về Decisions API là một giao diện đầy hứa hẹn với một mốc thời gian nhanh do nhà cung cấp công bố và không kèm hóa đơn.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày