Thẻ tiêu đề hero cho bài viết 'Ngày Nền tảng tháng 9 của Ope​nAI', với phụ đề 'GPT-Live-1 lên API, Agents API mở bản beta', mang một huy hiệu ghi 'Cả hai thông báo đều đề ngày 10 tháng 9 năm 2026' cùng ba thẻ ghi 'GPT-Live-1 trong API: 0,05 đô-la mỗi phút thoại, endpoint Live Sessions, một ID mô hình', 'Agents API: bản beta công khai, harness Codex, sandbox lưu trữ sẵn hoặc tự mang theo của bạn' và 'Vì sao điều này quan trọng: mô hình trở thành một thành phần bạn chọn, harness trở thành một sản phẩm bạn thuê', phía trên một dải chân trang ghi 'Các số liệu về giọng nói do Ope​nAI báo cáo và chưa được tái lập; giá của Agents API là chuyển tiếp nguyên giá.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Ngày Nền tảng tháng 9 của OpenAI: GPT-Live-1 đã có mặt trên API khi Agents API mở bản Beta

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai thứ rời nền tảng của Ope​nAI vào ngày 10 tháng 9 năm 2026, và thứ ít ồn ào hơn lại có phạm vi ảnh hưởng lớn hơn. GPT-Live-1 — mô hình giọng nói song công toàn phần đã chạy bên trong ChatGPT từ ngày 8 tháng 7 — giờ đây có thể được các nhà phát triển gọi với giá 0,05 USD mỗi phút giọng nói. Cùng với đó, và được nhắc đến ít hơn nhiều trong các bài đưa tin, Agents API đã bước vào bản beta công khai: cùng bộ khung vận hành Codex, được cung cấp dưới dạng một sản phẩm host với các sandbox được quản lý. Một cái là giọng nói tốt hơn. Cái còn lại là việc Ope​nAI bán đi thứ từng là phần khó của việc xây dựng một agent.

Cả hai đều được lấy trực tiếp từ các nguồn sơ cấp cho bài viết này: thông báo API Agents của OpenAI, bài đăng trên cộng đồng nhà phát triển của hãng giới thiệu GPT-Live-1 trong API, và tài liệu dành cho nhà phát triển của cả hai. Ở những chỗ một con số đến từ OpenAI chứ không phải từ một bên đánh giá bên ngoài, nó được ghi nhãn như vậy ở dưới đây — và có một số liệu thực sự đến từ bên ngoài, điều này làm thay đổi câu chuyện đôi chút.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis bắt đầu công bố Speech to Speech Index trong năm nay, và GPT-Live-1 có một dòng trên đó: 69,8%, mức trung bình có trọng số trên các hạng mục suy luận giọng nói, hiệu suất agentic, arena preference và thành công nhiệm vụ. Điều đó đưa nó lên vị trí thứ bảy trong số mười một mô hình được chấm điểm — xếp sau GPT-Realtime-2.1 với 73,9%, mô hình mà nó thay thế, và sau Gr​ok Voice Think Fast 2.0 với 79,0%. Bảng điểm độc lập và bảng benchmark của chính Ope​nAI không kể cùng một câu chuyện, và cả hai đều đúng.

Những gì đã ra mắt, theo mức độ ảnh hưởng đến kiến trúc của bạn

• Giọng nói — GPT-Live-1 đã có mặt trong API với tên gpt-live-1, tính phí 0,05 đô la Mỹ mỗi phút thoại, tính theo từng giây, với mô hình suy luận backend được tính phí riêng theo mức giá của chính nó.

• Agents — Agents API đang ở bản beta công khai. OpenAI cho biết không có phụ phí cho chính API; bạn trả tiền cho token mô hình, công cụ và thời gian container sandbox được host.

• Sandbox — OpenAI hiện lưu trữ môi trường thực thi, tái sử dụng cùng cơ sở hạ tầng sandbox như Codex và ChatGPT, có thể cấu hình bằng tệp, gói, kỹ năng và plugin.

• Môi trường — ngoài sandbox của chính OpenAI, các đội ngũ có thể hướng agent tới hạ tầng của riêng họ hoặc tới các nhà cung cấp sandbox bên thứ ba trong danh sách đối tác bản beta.

Bản phát hành giọng nói là một câu chuyện về mô hình. Agents API là một câu chuyện nền tảng, và những câu chuyện nền tảng chính là thứ âm thầm định hướng lại một codebase.

Agents API: một agent chỉ trong một POST

Lời gọi cốt lõi là POST /v1/agents/sessions, được gửi với một Ope​nAI-Beta: agents=v1 header, và điểm nhấn là tác vụ, model, công cụ và môi trường là đủ để nhận lại một agent đang chạy. Các SDK hỗ trợ Python, TypeScript/JavaScript, Go, Java và Ruby.

Điều làm cho nó trở nên hơn cả một wrapper là việc Ope​nAI vận hành harness chứ không chỉ phát hành nó. Harness AgentKit là mã nguồn mở và có thể kiểm tra, nhưng bản đang chạy là của Ope​nAI — nén ngữ cảnh xuyên suốt các phiên dài, tìm kiếm công cụ, gọi công cụ theo chương trình, hỗ trợ MCP, hàm tùy chỉnh, tìm kiếm web tích hợp và điều phối tác nhân con với mức đồng thời có thể cấu hình. Các khả năng harness được đánh phiên bản ra mắt song hành cùng các đợt ra mắt mô hình, và đó chính là cam kết đáng chú ý: phần scaffolding chuyển động cùng nhịp độ với các mô hình.

Với bất kỳ ai đã dành cả một quý để duy trì một vòng lặp — logic thử lại, cắt tỉa ngữ cảnh, định tuyến công cụ, việc phân nhánh subagent mà luôn rò rỉ trạng thái — thì đó mới chính là sản phẩm thật sự. Không phải lệnh gọi mô hình. Mà là phần hạ tầng kết nối xung quanh nó mà bạn không còn phải viết nữa.

Sandbox được host là phần đi kèm hóa đơn.

Các agent thực thi mã cần một nơi để thực thi mã, và bản beta mang đến câu trả lời của chính Ope​nAI: một sandbox được quản lý, có thể chạy mã, làm việc với tệp và tạo ra các artifact, có thể cấu hình bằng các gói, kỹ năng và plugin. Những nhà phát triển đã có sẵn môi trường thực thi được tăng cường bảo mật không bị buộc phải dùng đến nó — mang theo hạ tầng của riêng bạn và một nhóm các đối tác sandbox được nêu tên đều có mặt trong bản beta.

Hai lưu ý vận hành đáng để ghi nhớ trước khi bạn xây dựng dựa trên nó. Data residency trong bản beta chỉ giới hạn ở Hoa Kỳ, và Zero Data Retention không được hỗ trợ. Với một khối lượng công việc chịu quy định, hai dòng đó quyết định đây là một thử nghiệm thí điểm hay một lộ trình sản xuất, và chúng là những chi tiết thường bị phát hiện muộn.

GPT-Live-1 trong API: tính phí cố định theo phút mới là thay đổi thực sự

Bản thân mô hình giọng nói không mới — nó đã thay thế Advanced Voice Mode bên trong ChatGPT vào ngày 8 tháng 7 — nhưng hình thái thương mại thì mới. Trong dòng Realtime, âm thanh được tính theo token, nghĩa là muốn dự báo một cuộc gọi phải mô hình hóa mức tiêu thụ âm thanh: một giây im lặng tốn bao nhiêu token, việc người gọi nói chồng lên agent làm thay đổi độ dài đầu ra như thế nào. Mức phí cố định $0.05 mỗi phút thoại thu gọn điều đó thành phép nhân. Một giờ đường dây mở liên tục là $3.00. Trung bình bốn phút cho một nghìn cuộc gọi mỗi ngày là khoảng $200 một ngày.

Các phiên chạy từ một endpoint Live Sessions với một model ID duy nhất và không có snapshot gắn ngày nào để ghim. Tài liệu bao gồm WebRTC, WebSockets và telephony/SIP như các đường kết nối, và quickstart được công bố sẽ xây dựng đường WebRTC. Việc tính phí có hai đồng hồ đo, và chỉ một trong số đó là thoại: mọi lệnh gọi suy luận được ủy thác, lệnh gọi công cụ và tìm kiếm web đều được tính theo mức giá thông thường của mô hình backend.

Kiến trúc ở đây là sự uỷ thác. GPT-Live-1 đảm nhiệm phần hội thoại — quyết định nhiều lần mỗi giây xem nên tiếp tục lắng nghe, tạm dừng, ngắt lời hay chuyển giao công việc — và chuyển mọi thứ cần suy luận thực sự qua một ranh giới bất đồng bộ tới một backend riêng, nơi vẫn tiếp tục làm việc trong khi cuộc hội thoại bằng giọng nói vẫn diễn ra. Tài liệu định nghĩa hai chế độ: uỷ thác Responses, trong đó Ope​nAI gọi một model Responses được hỗ trợ thay cho bạn và cung cấp ngữ cảnh hội thoại, và uỷ thác phía client, trong đó ứng dụng của chính bạn cung cấp backend và giữ quyền kiểm soát việc thực thi, ngữ cảnh cũng như việc kết quả nào sẽ đến được lớp giọng nói. Trong ví dụ Responses đã công bố, backend đó là GPT-5.6 Terra, được nêu tên trong một delegation object cùng với các chỉ dẫn và công cụ riêng của nó. Tại buổi ra mắt dành cho người tiêu dùng hồi tháng 7, đó là GPT-5.5; các bài viết từ cộng đồng kể từ đó đã chỉ ra GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Mọi con số tiêu đề cho lớp giọng nói đều là của chính Ope​nAI và, tại thời điểm viết bài, chưa được bất kỳ ai tái tạo độc lập: 80.1% về tính tương tác trên Full Duplex Bench v1.5 so với 45.4% của GPT-Realtime-2.1, độ trễ chuyển lượt là 0.798 giây so với 1.41 giây, tỷ lệ thành công khi gọi công cụ là 87%, và tỷ lệ vượt qua 32% trong một đánh giá hỗ trợ giọng nói ngân hàng so với 12.4% của mô hình mà nó thay thế. Cặp cuối cùng đó mới là con số trung thực — một sự cải thiện lớn, nhưng vẫn là một hệ thống thất bại với khoảng hai phần ba quy trình được quản lý. Bằng chứng từ khách hàng bên thứ ba có tồn tại nhưng mỏng manh và mang tính tự phục vụ: Yelp cho đặt chỗ qua điện thoại, EliseAI, và nền tảng học tập Speak báo cáo giảm gần 80% số lần ngắt lời so với hệ thống dựa trên lượt trước đây của nó.

Kết quả độc lập này kém phần tô hồng, và đáng được đặt bên cạnh danh sách ở trên hơn là đặt bên dưới nó. Trên Artificial Analysis Speech to Speech Index — một điểm tổng hợp gồm suy luận giọng nói, hiệu suất agent, mức độ ưa thích trên đấu trường và thành công tác vụ — GPT-Live-1 đứng ở 69,8%, thấp hơn 73,9% của GPT-Realtime-2.1 và thấp hơn hẳn 79,0% của Gr​ok Voice Think Fast 2.0. Đọc cả hai cùng nhau, hình hài của sản phẩm trở nên rõ ràng: Ope​nAI đã xây dựng cơ chế hội thoại tốt nhất hiện có nhưng không xây dựng được agent giọng nói tốt nhất, bởi vì phần suy luận được giao cho một mô hình mà chỉ số này chấm điểm riêng.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

Hai thông báo là một thông báo

Đọc cùng nhau, các bản phát hành mô tả cùng một cuộc tái tổ chức từ hai hướng. Agents API chuyển vòng lặp, sandbox và việc quản lý ngữ cảnh vào một sản phẩm được host. GPT-Live-1 chuyển bề mặt hội thoại vào một front end mỏng, thứ giao phó việc suy nghĩ của mình cho nơi khác. Ở cả hai, mô hình không còn là thứ bạn xây dựng xung quanh nữa mà trở thành một thành phần bạn lựa chọn — và ở cả hai, việc lựa chọn ấy là một dòng cấu hình thay vì một cam kết về kiến trúc.

Đó chính xác là mối nối mà một lớp định tuyến ngồi vào. OrcaRouter không đảm nhận gpt-live-1: endpoint Live Sessions là của riêng OpenAI, và chúng tôi không định tuyến phần nào của nó. Nửa phần ủy quyền lại là câu chuyện khác. Backend mà lớp thoại giao việc cho nói tiếng Responses API, và đó là một lệnh gọi model thông thường — model mà ví dụ của chính OpenAI nêu tên, GPT-5.6 Terra, có sẵn qua OrcaRouter ở mức giá niêm yết của OpenAI là 2,00 đô la mỗi triệu token đầu vào và 12,00 đô la mỗi triệu token đầu ra, với endpoint Responses được mở. Ủy quyền phía client còn đi xa hơn: nó cho phép ứng dụng của bạn tự cung cấp backend, nghĩa là model đứng sau giọng nói có thể là bất kỳ endpoint nào bạn kiểm soát. Điều tương tự cũng đúng với ô model của Agents API: harness là của OpenAI, nhưng model bên trong là lựa chọn bạn giữ, và khoảng 190 model từ mười một nhà cung cấp thượng nguồn nằm sau một key duy nhất ở giá niêm yết của nhà cung cấp, không thêm phụ phí nào.

Cụ thể, ba điều suy ra từ đó. Các backend có thể được thử A/B trên lưu lượng trực tiếp bằng cách sửa một dòng, đó là cách bạn biết liệu một reasoner giá rẻ có đủ tốt trước khi giao một đường dây điện thoại cho nó hay không. Chuyển đổi dự phòng có thể nằm bên dưới mô hình uỷ quyền, nhờ đó một buổi chiều tồi tệ ở thượng nguồn không kéo cuộc hội thoại sập theo. Và một tác vụ có thể được chạy với nhiều backend trong một lần gọi thông qua DSL định tuyến, hoặc được một hội đồng mô hình trả lời cùng lúc bằng model fusion — hữu ích ngay khi đầu ra của một agent phải được tin cậy chứ không chỉ được tạo ra.

Có gì không có trong cả hai bản phát hành?

• Không có đầu vào hình ảnh hoặc video trên GPT-Live-1 — bề mặt thoại đa phương thức mà các chế độ ChatGPT cũ sở hữu vẫn chưa được giải quyết.

• Không có đầu ra có cấu trúc trên lớp thoại, vì vậy các đối số công cụ được xác thực theo lược đồ phải được thực thi trong mô hình backend.

• Không có quyền truy cập theo gói miễn phí đối với GPT-Live-1, và giới hạn tốc độ được tính theo số phiên đồng thời — 25 ở Cấp 1, tăng lên 500 ở Cấp 5.

• Không có Zero Data Retention và không có data residency ngoài Hoa Kỳ trong bản beta của Agents API.

• Không có bất kỳ sự tái lập độc lập nào đối với bất kỳ con số benchmark nào của GPT-Live-1.

Canh bạc mà OpenAI đặt cược vào ngày 10 tháng 9 là các nhà phát triển muốn mua harness và chọn bộ não một cách riêng rẽ. Nửa đầu của điều đó giờ đây đã là một mục hàng. Nửa sau là nơi áp lực cạnh tranh của mười hai tháng tới sẽ đổ xuống — bởi vì một harness được host với khe mô hình có thể hoán đổi chỉ tốt ngang với những mô hình mà bạn có thể đặt vào đó, và hiện tại đó chính là phần duy nhất của stack mà OpenAI không thể kiểm soát một mình.

Phần uỷ quyền lại là câu chuyện khác — backend mà lớp giọng nói giao việc cho chỉ là một lệnh gọi mô hình thông thường, và GPT-5.6 Terra có sẵn thông qua OrcaRouter với mức giá niêm yết của OpenAI cùng endpoint Responses được mở ra.