
Nơi API Decisions của OpenAI kết thúc và Jev bắt đầu: Khách hàng bên ngoài đầu tiên cho thấy điều gì
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Vào 23:05 UTC ngày 2026-10-06, một plugin có tên llm-openai-decisions đã xuất hiện trên PyPI, và README của chính nó chứa câu mà các bài đưa tin ra mắt chưa từng in: "Không giống Jev, mô hình quyết định gpt-6-luna mới hỗ trợ đầu vào hình ảnh ngoài văn bản." Tác giả là Simon Willison, người cũng đã viết ứng dụng khách đầu tiên cho mô hình quyết định của TypeSafe, và phép so sánh mà ông đưa ra là giữa GPT-6 Luna — mô hình đằng sau Decisions API của OpenAI — và Jev 1.13, mô hình System One chỉ hỗ trợ văn bản của TypeSafe. Cùng bài đăng blog đó lưu ý rằng chính plugin này được viết bởi GPT-6 Astra khi đọc tài liệu của OpenAI.
Đó là điều hữu ích ở việc một client phát hành một tuần sau một API: nó được viết dựa trên hình dạng request, chứ không phải bài keynote, nên nó làm nổi lên những khác biệt mà nội dung quảng cáo thường che lấp. Ở đây không có gì là rò rỉ và không có gì là chưa được xác nhận — mọi số liệu dưới đây đều đến từ một trang do OpenAI, TypeSafe hoặc chính repository của plugin công bố, tất cả được đọc vào ngày 2026-10-07. Điều vẫn còn thiếu là đo lường độc lập đối với chính endpoint, và khoảng trống đó được nêu ở cuối thay vì bị che lấp.
Ba bề mặt, được giữ tách biệt
Điều đầu tiên cần nắm cho rõ là đây là ba lớp khác nhau, và việc báo chí đưa tin làm mờ nhòe chúng.
• Các endpoint.Của OpenAI là POST /v1/decisions, một route chuyên dụng chứ không phải một chế độ trên Responses API. Của TypeSafe là POST /v1/systemone. Cả hai đều nhận một body bằng chứng cùng một danh sách câu hỏi có kiểu và trả về một câu trả lời cho mỗi câu hỏi, với khóa là tên bạn đã đặt cho câu hỏi đó.
• Các mô hình. API Decisions hiện chỉ chấp nhận đúng một mô hình, gpt-6-luna, đây cũng là bậc giá rẻ của dòng GPT-6 phổ thông của OpenAI và đã ra mắt vào 2026-09-22 như một mô hình văn bản và hình ảnh thông thường. Jev 1.13 là một mô hình ra quyết định từ đầu đến cuối — nó hoàn toàn không thể tạo ra văn bản tự do. TypeSafe đã phát hành nó vào 2026-09-15 và nó đã được cung cấp rộng rãi kể từ 2026-09-21.
• Các ứng dụng khách.Các SDK của chính OpenAI đã hỗ trợ endpoint này kể từ khi nó ra mắt bản beta công khai vào ngày 2026-10-06, vì vậy plugin không phải là cách đầu tiên để gọi nó. Đây là ứng dụng khách đầu tiên nằm ngoài các SDK của chính OpenAI mà chúng tôi có thể xác minh, và là ứng dụng đầu tiên được viết cho một công cụ dòng lệnh thay vì một thư viện ứng dụng.
Hai nhịp thơ, kề nhau
Đây là chỗ mà README của khách hàng có giá trị hơn bản thông báo, vì các con số nằm ngay cạnh câu chữ.
• Giá — API Decisions tính 0,10 đô la cho mỗi triệu token đầu vào, không tính phí đầu ra, không tính phí đọc bộ nhớ đệm và không tính phí ghi bộ nhớ đệm. Jev 1.13 tính 0,042 đô la cho mỗi triệu token đầu vào, với đầu ra miễn phí. Cả hai đều tính phí cho những gì bạn gửi và không tính gì cho những gì trả về, vì vậy một quyết định tốn một phần nhỏ của một xu ở cả hai mức giá và sự khác biệt giữa chúng là hệ số 2,4, chứ không phải một mô hình tính phí khác.
• Đầu vào — API Decisions tiếp nhận văn bản, hoặc tin nhắn của người dùng trộn lẫn văn bản với hình ảnh, và README của plugin nêu rõ rằng các tệp đính kèm PNG, JPEG, WebP và GIF được hỗ trợ với tối đa 128 hình ảnh trong một yêu cầu. Hình ảnh phải được đưa vào dưới dạng URL dữ liệu base64 nội tuyến; URL hình ảnh HTTP hoặc HTTPS được lưu trữ và đầu vào file_id không được endpoint chấp nhận, vì vậy plugin sẽ chuyển đổi URL hoặc đường dẫn cục bộ trước khi gửi. Tài liệu của Jev 1.13 thẳng thắn theo hướng ngược lại: "Không có đầu vào hình ảnh, âm thanh hay video", và các đầu vào phi văn bản nên được xử lý trước thành văn bản hoặc các trường có cấu trúc trước khi chúng đến được trạng thái.
• Các loại câu hỏi — OpenAI mô tả ba loại: predicate (xác suất từ 0 đến 1 rằng một điều kiện đã nêu là đúng), choice (một giá trị từ danh sách của bạn, cùng với một phân phối và một trường độ tin cậy riêng), và score (trung bình có trọng số xác suất trên các mức được sắp thứ tự). Ba loại của TypeSafe cũng là ba ý tưởng đó dưới những cái tên khác: noul cho có/không, choice, và score. "Noul" là viết tắt của Bernoulli, và cái tên này là một dấu hiệu công bằng về sự khác biệt văn hóa — một nhà cung cấp tung ra một danh từ tiếng Anh giản dị, nhà kia tung ra một câu đùa thống kê.
• Số học điểm số — hai bên khớp chính xác, đây là dấu hiệu mạnh nhất cho thấy đây là một loại sản phẩm chứ không phải hai. Tài liệu của OpenAI đưa vào ba mức độ nghiêm trọng với xác suất 0,1, 0,7 và 0,2 rồi trả về điểm số 1,1 — cố ý nằm giữa hai mức thay vì bám vào mức gần nhất. Các mức của TypeSafe được đánh chỉ số từ 0 theo cùng cách, và plugin cho Jev nhận từ hai đến mười mức có thứ tự. Trang của OpenAI không nêu mức trần nào; đó là một khoảng trống trong tài liệu của họ, chứ không phải một giới hạn mà chúng ta có thể khẳng định.
• Ngân sách — Jev ghi lại cửa sổ của mình một cách chính xác: khoảng 64.000 token mỗi yêu cầu, khoảng 32.000 trong số đó bao trùm trạng thái cộng với câu hỏi đơn dài nhất, so với ngữ cảnh 1.050.000 token mà danh mục của chính chúng tôi mang cho GPT-6 Luna như một mô hình tổng quát. Trang quyết định của OpenAI không công bố bất kỳ ngân sách token nào, chỉ có ghi chú rằng phụ phí xử lý theo khu vực và hệ số nhân đầu vào ngữ cảnh dài vẫn áp dụng cho mức giá.
Những gì khách hàng tiết lộ mà thông báo không tiết lộ.
Ba chi tiết trong plugin và README của nó đáng để rút ra, vì mỗi chi tiết đều thay đổi cách bạn kết nối endpoint.
Điều đầu tiên là một quyết định có thể trả về dưới dạng một lời từ chối. Tài liệu của OpenAI không bao giờ giải thích điều này bằng văn xuôi, nhưng mọi thư viện đều rẽ nhánh dựa trên nó — answer.type === "refusal" trong JavaScript, một OpenAI::Models::Decision::Answer::Refusal trong Ruby — và README của plugin nói rõ rằng một câu hỏi bị từ chối được lưu giữ dưới dạng {"name":"...","type":"refusal"}. Vì vậy, kiểu câu trả lời thực chất có bốn giá trị, chứ không phải ba, và bất kỳ vòng lặp nào trong môi trường sản xuất cũng phải xử lý một nhánh thứ tư mà không có thông báo nào đề cập đến.
Điều thứ hai là thứ còn thiếu ở plugin chứ không phải thứ hiện diện trong đó. Bài đăng của chính Willison mô tả công việc này như việc cho GPT-6 Astra đọc tài liệu mới và xây dựng client từ đó — từ tài liệu đến client, một lượt, không có hướng dẫn nào của con người. Đó giờ đây là một cách bình thường để một client được viết ra, và điều đó nghĩa là câu hỏi liệu tài liệu của một endpoint có đủ hoàn chỉnh để từ đó tạo ra một client hoạt động được hay không đã trở thành một câu hỏi thực tiễn thay vì một câu hỏi biên tập. Với endpoint này, câu trả lời phần lớn là có, với kiểu từ chối là mối nối lộ rõ.
Điều thứ ba là hình dạng của mảng câu hỏi. OpenAI cho phép bạn đặt các câu hỏi độc lập trong một yêu cầu dựa trên đầu vào chung — kiểm tra ảnh sản phẩm xem có hư hỏng không và phân loại danh mục của nó trong cùng một lệnh gọi — nhưng đòi hỏi các yêu cầu riêng biệt khi một câu hỏi sau phụ thuộc vào câu trả lời trước đó. Jev giữ quan điểm tương tự vì cùng lý do: các câu hỏi của nó được đánh giá song song dựa trên một trạng thái, vì vậy bất cứ thứ gì tuần tự đều phải trở thành hai lệnh gọi. Cả hai nhà cung cấp đều thiết kế cho fan-out, và cả hai đều đang nói với bạn cùng một điều về nơi ngân sách độ trễ được phân bổ.
Danh mục này hiện có ba thành viên, và hai trong số đó không phải là mô hình tổng quát.
Đáng để gọi tên cái thứ ba, bởi khung endpoint quyết định chỉ có ý nghĩa khi nhìn cả ba cùng lúc. Perplexity cung cấp một Decisions API của riêng mình, được phục vụ bởi pplx-decider-v1-27b — một mô hình quyết định 27 tỷ tham số, phát hành theo Apache 2.0 với trọng số trên Hugging Face vào ngày 2026-10-01. Điều đó mang lại cho hạng mục này một diện mạo thực sự khác biệt so với của OpenAI: Jev 1.13 là đóng và chỉ hỗ trợ văn bản, bộ quyết định của Perplexity thì mở trọng số và chấp nhận hình ảnh, còn sản phẩm của GPT-6 Luna là một bộ khung bao quanh một mô hình tổng quát chứ không phải một mô hình được xây dựng để ra quyết định.
Với một độc giả đang lựa chọn ngay hôm nay, sự phân chia thực tế hẹp hơn những gì hoạt động tiếp thị vẽ ra. Nếu bằng chứng của bạn là một câu hoặc một bản ghi và bạn muốn chi phí mỗi lần gọi rẻ nhất với mức biến thiên hành vi ít nhất, Jev 1.13 là lựa chọn chuyên dụng và mức 0,042 đô la của nó là mức thấp nhất trong ba mức giá đã công bố mà chúng tôi có thể xác minh. Nếu bằng chứng của bạn bao gồm một bức ảnh, hoặc bạn muốn một quyết định từ một mô hình mà bạn đã quen qua các tác vụ thông thường, Decisions API là lựa chọn duy nhất trong hai lựa chọn đóng chấp nhận hình ảnh. Lựa chọn trọng số mở trả lời một câu hỏi khác — kiểm soát và tự vận hành — và chúng tôi chưa kiểm thử nó.
Điều chúng ta thực sự có thể đo lường, và điều mà không ai có
Tuyên bố của OpenAI cho endpoint này là nó “đánh giá văn bản, hình ảnh hoặc cả hai và trả về câu trả lời có kiểu dữ liệu nhanh hơn khoảng 10 lần so với Responses API”. Đó là thông tin do nhà cung cấp công bố và chưa được tái lập: không có khu vực, không có kích thước đầu vào, không có mức đồng thời, không có thỏa thuận mức dịch vụ, và đường cơ sở là Responses API nói chung chứ không phải bất kỳ khối lượng công việc cụ thể nào. Một con số tăng tốc duy nhất là con số sai để lấy làm căn cứ đặt ra thời hạn.
Điều chúng tôi có thể đặt bên cạnh đó là cửa sổ phục vụ bảy ngày của riêng chúng tôi, kết thúc vào 2026-10-07, trên hai mô hình bên dưới, từ lưu lượng playground của chúng tôi — và điều quan trọng là phải nói rõ những con số đó không phải là gì. Chúng mô tả các yêu cầu tạo sinh thông thường, không phải các quyết định.
• GPT-6 Luna, mọi dạng yêu cầu: trung vị 1.448 ms và p95 4.912, tỷ lệ lỗi 1,31% trên 643.394.111 token trong bảy ngày, đó là hình ảnh của thông lượng khoảng 125 token đầu ra mỗi giây khi mô hình đang viết.
• Jev 1.13: trung vị là 149 ms và p95 là 245 ms, tỷ lệ lỗi 0,10% trên 110.193.080 token. Đó là một endpoint thực sự nhanh, và nó nhanh vì nó không tạo ra phản hồi — nó trả về các con số cho một trạng thái được nạp một lần.
Khi đặt cạnh nhau, hai hàng đó là một lời cảnh báo, chứ không phải một phép so sánh. Một yêu cầu quyết định chỉ phát ra một vài token, nên trên Decisions API, chỉ số thông lượng đầu ra vốn chi phối hồ sơ chung của Luna không còn là ràng buộc quyết định nữa, và con số bắt đầu trở nên quan trọng là thời gian mô hình cần để đọc bằng chứng. Chúng tôi chưa đo được điều đó trên endpoint decisions, và theo những gì chúng tôi biết thì chưa có ai ngoài OpenAI công bố nó.
Câu hỏi sâu hơn chưa được đo lường là hiệu chỉnh, và chính nó quyết định liệu bất kỳ phần nào trong số này có dùng được hay không. Một xác suất 0,92 cho hư hỏng nhìn thấy được chỉ đáng để định tuyến nếu, trên toàn bộ lưu lượng của bạn, những bức ảnh được cho điểm gần 0,92 thực sự bị hư hỏng khoảng 92% số lần. Tài liệu của OpenAI hướng dẫn bạn đặt ngưỡng từ các ví dụ đã gán nhãn và chọn chúng dựa trên chi phí của dương tính giả so với âm tính giả. Đó là lời khuyên đúng, và nó cũng là một sự thừa nhận rằng việc hiệu chỉnh những con số này là điều bạn phải tự thiết lập. Ở lần thử đầu tiên, hãy đo phân phối các xác suất được trả về trên một mẫu mà bạn đã biết câu trả lời. Nếu mọi thứ đều trả về 0,99 hoặc 0,01, thì ngưỡng này chẳng có tác dụng gì và endpoint chỉ là một giá trị boolean cực kỳ tốn kém.
Làm thế nào để dùng thử một trong hai mà đặt cược cả lộ trình sản xuất vào nó
Về nguồn, nói thẳng: hợp đồng endpoint, giá và các quy tắc hình ảnh trong bài này đến từ tài liệu Decisions API của chính OpenAI và README của plugin, cả hai được đọc vào ngày 2026-10-07; đặc tả Jev 1.13 đến từ tài liệu mô hình của chính TypeSafe; các số liệu serving là dữ liệu playground của chính chúng tôi trong cửa sổ bảy ngày kết thúc ngày 2026-10-07; dấu thời gian của gói đến từ PyPI và lịch sử Git của dự án. Tuyên bố tốc độ nhanh gấp 10 lần là của OpenAI và được ghi nhãn như vậy. Giấy phép và ngày phát hành của bộ quyết định trọng số mở đến từ kho mô hình của nó.
Bản thân Decisions API là sản phẩm đóng gói của chính OpenAI và chúng tôi không định tuyến nó; nếu bạn muốn điểm cuối cụ thể đó, OpenAI là nơi nó nằm. Các mô hình bên dưới lại là chuyện khác. GPT-6 Luna là một route đang hoạt động trên OrcaRouter với giá niêm yết của OpenAI và không cộng thêm bất kỳ khoản markup nào, và typesafe/jev-1.13 với giá niêm yết nằm trên cùng một key, khiến cho phần so sánh trong bài viết này trở thành thứ bạn có thể chạy thay vì chỉ đọc: cùng một trạng thái, cùng những câu hỏi, hai endpoint, một hợp đồng cần quản lý và không có hóa đơn thứ hai.
Đó cũng là cách hợp lý để áp dụng một bề mặt chưa được kiểm chứng. Hãy đặt quyết định phía sau một cơ chế dự phòng để việc bị từ chối, hết thời gian chờ, hoặc giới hạn beta thay đổi ngay dưới chân bạn sẽ thoái hóa thành một lệnh gọi dựa trên prompt thay vì một sự cố ngừng dịch vụ, và giữ cơ chế dự phòng đó trên cùng khóa với cái chính để không có gì phải đấu dây lại khi endpoint tiến tới trạng thái khả dụng chung. OpenAI nói rằng GA dự kiến sẽ có trong vài tuần tới và rằng gpt-6-luna là mô hình duy nhất hiện có trong lúc chờ đợi; cả hai điều đó đều là lý do để xây dựng theo hình dạng đó và trang bị đo lường ngay bây giờ, và không điều nào là lý do để đặt một ủy quyền thanh toán phía sau nó vào lúc này.

Xem gì tiếp theo
Ba điều sẽ giải quyết được những câu hỏi mà bài viết này không thể. Một ngân sách token được công bố cho endpoint decisions, để có thể định cỡ một yêu cầu thay vì đoán mò. Bất kỳ thông báo GA nào, tức thời điểm mà mức giá chỉ tính đầu vào không còn là một lời hứa beta. Và một phép đo độc lập về độ trễ cùng độ hiệu chuẩn trên chính endpoint đó — người đầu tiên đưa vài nghìn cặp đã gán nhãn chạy qua nó và công bố đường cong độ tin cậy sẽ làm được nhiều cho lĩnh vực này hơn bất cứ bài đăng ra mắt nào trong hai bài đó đã làm.
Cho đến lúc đó, bản tóm tắt trung thực thì hẹp và hữu ích: nếu thứ bạn cần quyết định là văn bản, Jev 1.13 rẻ hơn và nó trả về các con số trong khoảng 150 mili giây trong lưu lượng của chúng tôi. Nếu thứ bạn cần quyết định bao gồm một hình ảnh, OpenAI's Decisions API là cái sẽ xem xét nó, với mức giá gấp 2,4 lần giá đầu vào, cùng một nhãn beta trên hộp. Cả hai đều có thể được gọi từ dòng lệnh kể từ tuần này, và đó là một vị thế tốt hơn so với vị thế của mỗi cái cách đây bảy ngày.


