
Ngày Nền tảng tháng 9 của OpenAI: GPT-Live-1 đã có mặt trên API khi Agents API mở bản Beta
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Hai thứ rời nền tảng của OpenAI vào ngày 10 tháng 9 năm 2026, và thứ ít ồn ào hơn lại có phạm vi ảnh hưởng lớn hơn. GPT-Live-1 — mô hình giọng nói song công toàn phần đã chạy bên trong ChatGPT từ ngày 8 tháng 7 — giờ đây có thể được các nhà phát triển gọi với giá 0,05 USD mỗi phút giọng nói. Cùng với đó, và được nhắc đến ít hơn nhiều trong các bài đưa tin, Agents API đã bước vào bản beta công khai: cùng bộ khung vận hành Codex, được cung cấp dưới dạng một sản phẩm host với các sandbox được quản lý. Một cái là giọng nói tốt hơn. Cái còn lại là việc OpenAI bán đi thứ từng là phần khó của việc xây dựng một agent.
Cả hai đều được lấy trực tiếp từ các nguồn sơ cấp cho bài viết này: thông báo API Agents của OpenAI, bài đăng trên cộng đồng nhà phát triển của hãng giới thiệu GPT-Live-1 trong API, và tài liệu dành cho nhà phát triển của cả hai. Ở những chỗ một con số đến từ OpenAI chứ không phải từ một bên đánh giá bên ngoài, nó được ghi nhãn như vậy ở dưới đây — và có một số liệu thực sự đến từ bên ngoài, điều này làm thay đổi câu chuyện đôi chút.

Artificial Analysis bắt đầu công bố Speech to Speech Index trong năm nay, và GPT-Live-1 có một dòng trên đó: 69,8%, mức trung bình có trọng số trên các hạng mục suy luận giọng nói, hiệu suất agentic, arena preference và thành công nhiệm vụ. Điều đó đưa nó lên vị trí thứ bảy trong số mười một mô hình được chấm điểm — xếp sau GPT-Realtime-2.1 với 73,9%, mô hình mà nó thay thế, và sau Grok Voice Think Fast 2.0 với 79,0%. Bảng điểm độc lập và bảng benchmark của chính OpenAI không kể cùng một câu chuyện, và cả hai đều đúng.
Những gì đã ra mắt, theo mức độ ảnh hưởng đến kiến trúc của bạn
• Giọng nói — GPT-Live-1 đã có mặt trong API với tên gpt-live-1, tính phí 0,05 đô la Mỹ mỗi phút thoại, tính theo từng giây, với mô hình suy luận backend được tính phí riêng theo mức giá của chính nó.
• Agents — Agents API đang ở bản beta công khai. OpenAI cho biết không có phụ phí cho chính API; bạn trả tiền cho token mô hình, công cụ và thời gian container sandbox được host.
• Sandbox — OpenAI hiện lưu trữ môi trường thực thi, tái sử dụng cùng cơ sở hạ tầng sandbox như Codex và ChatGPT, có thể cấu hình bằng tệp, gói, kỹ năng và plugin.
• Môi trường — ngoài sandbox của chính OpenAI, các đội ngũ có thể hướng agent tới hạ tầng của riêng họ hoặc tới các nhà cung cấp sandbox bên thứ ba trong danh sách đối tác bản beta.
Bản phát hành giọng nói là một câu chuyện về mô hình. Agents API là một câu chuyện nền tảng, và những câu chuyện nền tảng chính là thứ âm thầm định hướng lại một codebase.
Agents API: một agent chỉ trong một POST
Lời gọi cốt lõi là POST /v1/agents/sessions, được gửi với một OpenAI-Beta: agents=v1 header, và điểm nhấn là tác vụ, model, công cụ và môi trường là đủ để nhận lại một agent đang chạy. Các SDK hỗ trợ Python, TypeScript/JavaScript, Go, Java và Ruby.
Điều làm cho nó trở nên hơn cả một wrapper là việc OpenAI vận hành harness chứ không chỉ phát hành nó. Harness AgentKit là mã nguồn mở và có thể kiểm tra, nhưng bản đang chạy là của OpenAI — nén ngữ cảnh xuyên suốt các phiên dài, tìm kiếm công cụ, gọi công cụ theo chương trình, hỗ trợ MCP, hàm tùy chỉnh, tìm kiếm web tích hợp và điều phối tác nhân con với mức đồng thời có thể cấu hình. Các khả năng harness được đánh phiên bản ra mắt song hành cùng các đợt ra mắt mô hình, và đó chính là cam kết đáng chú ý: phần scaffolding chuyển động cùng nhịp độ với các mô hình.
Với bất kỳ ai đã dành cả một quý để duy trì một vòng lặp — logic thử lại, cắt tỉa ngữ cảnh, định tuyến công cụ, việc phân nhánh subagent mà luôn rò rỉ trạng thái — thì đó mới chính là sản phẩm thật sự. Không phải lệnh gọi mô hình. Mà là phần hạ tầng kết nối xung quanh nó mà bạn không còn phải viết nữa.
Sandbox được host là phần đi kèm hóa đơn.
Các agent thực thi mã cần một nơi để thực thi mã, và bản beta mang đến câu trả lời của chính OpenAI: một sandbox được quản lý, có thể chạy mã, làm việc với tệp và tạo ra các artifact, có thể cấu hình bằng các gói, kỹ năng và plugin. Những nhà phát triển đã có sẵn môi trường thực thi được tăng cường bảo mật không bị buộc phải dùng đến nó — mang theo hạ tầng của riêng bạn và một nhóm các đối tác sandbox được nêu tên đều có mặt trong bản beta.
Hai lưu ý vận hành đáng để ghi nhớ trước khi bạn xây dựng dựa trên nó. Data residency trong bản beta chỉ giới hạn ở Hoa Kỳ, và Zero Data Retention không được hỗ trợ. Với một khối lượng công việc chịu quy định, hai dòng đó quyết định đây là một thử nghiệm thí điểm hay một lộ trình sản xuất, và chúng là những chi tiết thường bị phát hiện muộn.
GPT-Live-1 trong API: tính phí cố định theo phút mới là thay đổi thực sự
Bản thân mô hình giọng nói không mới — nó đã thay thế Advanced Voice Mode bên trong ChatGPT vào ngày 8 tháng 7 — nhưng hình thái thương mại thì mới. Trong dòng Realtime, âm thanh được tính theo token, nghĩa là muốn dự báo một cuộc gọi phải mô hình hóa mức tiêu thụ âm thanh: một giây im lặng tốn bao nhiêu token, việc người gọi nói chồng lên agent làm thay đổi độ dài đầu ra như thế nào. Mức phí cố định $0.05 mỗi phút thoại thu gọn điều đó thành phép nhân. Một giờ đường dây mở liên tục là $3.00. Trung bình bốn phút cho một nghìn cuộc gọi mỗi ngày là khoảng $200 một ngày.
Các phiên chạy từ một endpoint Live Sessions với một model ID duy nhất và không có snapshot gắn ngày nào để ghim. Tài liệu bao gồm WebRTC, WebSockets và telephony/SIP như các đường kết nối, và quickstart được công bố sẽ xây dựng đường WebRTC. Việc tính phí có hai đồng hồ đo, và chỉ một trong số đó là thoại: mọi lệnh gọi suy luận được ủy thác, lệnh gọi công cụ và tìm kiếm web đều được tính theo mức giá thông thường của mô hình backend.
Kiến trúc ở đây là sự uỷ thác. GPT-Live-1 đảm nhiệm phần hội thoại — quyết định nhiều lần mỗi giây xem nên tiếp tục lắng nghe, tạm dừng, ngắt lời hay chuyển giao công việc — và chuyển mọi thứ cần suy luận thực sự qua một ranh giới bất đồng bộ tới một backend riêng, nơi vẫn tiếp tục làm việc trong khi cuộc hội thoại bằng giọng nói vẫn diễn ra. Tài liệu định nghĩa hai chế độ: uỷ thác Responses, trong đó OpenAI gọi một model Responses được hỗ trợ thay cho bạn và cung cấp ngữ cảnh hội thoại, và uỷ thác phía client, trong đó ứng dụng của chính bạn cung cấp backend và giữ quyền kiểm soát việc thực thi, ngữ cảnh cũng như việc kết quả nào sẽ đến được lớp giọng nói. Trong ví dụ Responses đã công bố, backend đó là GPT-5.6 Terra, được nêu tên trong một delegation object cùng với các chỉ dẫn và công cụ riêng của nó. Tại buổi ra mắt dành cho người tiêu dùng hồi tháng 7, đó là GPT-5.5; các bài viết từ cộng đồng kể từ đó đã chỉ ra GPT-6 Astra.

Mọi con số tiêu đề cho lớp giọng nói đều là của chính OpenAI và, tại thời điểm viết bài, chưa được bất kỳ ai tái tạo độc lập: 80.1% về tính tương tác trên Full Duplex Bench v1.5 so với 45.4% của GPT-Realtime-2.1, độ trễ chuyển lượt là 0.798 giây so với 1.41 giây, tỷ lệ thành công khi gọi công cụ là 87%, và tỷ lệ vượt qua 32% trong một đánh giá hỗ trợ giọng nói ngân hàng so với 12.4% của mô hình mà nó thay thế. Cặp cuối cùng đó mới là con số trung thực — một sự cải thiện lớn, nhưng vẫn là một hệ thống thất bại với khoảng hai phần ba quy trình được quản lý. Bằng chứng từ khách hàng bên thứ ba có tồn tại nhưng mỏng manh và mang tính tự phục vụ: Yelp cho đặt chỗ qua điện thoại, EliseAI, và nền tảng học tập Speak báo cáo giảm gần 80% số lần ngắt lời so với hệ thống dựa trên lượt trước đây của nó.
Kết quả độc lập này kém phần tô hồng, và đáng được đặt bên cạnh danh sách ở trên hơn là đặt bên dưới nó. Trên Artificial Analysis Speech to Speech Index — một điểm tổng hợp gồm suy luận giọng nói, hiệu suất agent, mức độ ưa thích trên đấu trường và thành công tác vụ — GPT-Live-1 đứng ở 69,8%, thấp hơn 73,9% của GPT-Realtime-2.1 và thấp hơn hẳn 79,0% của Grok Voice Think Fast 2.0. Đọc cả hai cùng nhau, hình hài của sản phẩm trở nên rõ ràng: OpenAI đã xây dựng cơ chế hội thoại tốt nhất hiện có nhưng không xây dựng được agent giọng nói tốt nhất, bởi vì phần suy luận được giao cho một mô hình mà chỉ số này chấm điểm riêng.

Hai thông báo là một thông báo
Đọc cùng nhau, các bản phát hành mô tả cùng một cuộc tái tổ chức từ hai hướng. Agents API chuyển vòng lặp, sandbox và việc quản lý ngữ cảnh vào một sản phẩm được host. GPT-Live-1 chuyển bề mặt hội thoại vào một front end mỏng, thứ giao phó việc suy nghĩ của mình cho nơi khác. Ở cả hai, mô hình không còn là thứ bạn xây dựng xung quanh nữa mà trở thành một thành phần bạn lựa chọn — và ở cả hai, việc lựa chọn ấy là một dòng cấu hình thay vì một cam kết về kiến trúc.
Đó chính xác là mối nối mà một lớp định tuyến ngồi vào. OrcaRouter không đảm nhận gpt-live-1: endpoint Live Sessions là của riêng OpenAI, và chúng tôi không định tuyến phần nào của nó. Nửa phần ủy quyền lại là câu chuyện khác. Backend mà lớp thoại giao việc cho nói tiếng Responses API, và đó là một lệnh gọi model thông thường — model mà ví dụ của chính OpenAI nêu tên, GPT-5.6 Terra, có sẵn qua OrcaRouter ở mức giá niêm yết của OpenAI là 2,00 đô la mỗi triệu token đầu vào và 12,00 đô la mỗi triệu token đầu ra, với endpoint Responses được mở. Ủy quyền phía client còn đi xa hơn: nó cho phép ứng dụng của bạn tự cung cấp backend, nghĩa là model đứng sau giọng nói có thể là bất kỳ endpoint nào bạn kiểm soát. Điều tương tự cũng đúng với ô model của Agents API: harness là của OpenAI, nhưng model bên trong là lựa chọn bạn giữ, và khoảng 190 model từ mười một nhà cung cấp thượng nguồn nằm sau một key duy nhất ở giá niêm yết của nhà cung cấp, không thêm phụ phí nào.
Cụ thể, ba điều suy ra từ đó. Các backend có thể được thử A/B trên lưu lượng trực tiếp bằng cách sửa một dòng, đó là cách bạn biết liệu một reasoner giá rẻ có đủ tốt trước khi giao một đường dây điện thoại cho nó hay không. Chuyển đổi dự phòng có thể nằm bên dưới mô hình uỷ quyền, nhờ đó một buổi chiều tồi tệ ở thượng nguồn không kéo cuộc hội thoại sập theo. Và một tác vụ có thể được chạy với nhiều backend trong một lần gọi thông qua DSL định tuyến, hoặc được một hội đồng mô hình trả lời cùng lúc bằng model fusion — hữu ích ngay khi đầu ra của một agent phải được tin cậy chứ không chỉ được tạo ra.
Có gì không có trong cả hai bản phát hành?
• Không có đầu vào hình ảnh hoặc video trên GPT-Live-1 — bề mặt thoại đa phương thức mà các chế độ ChatGPT cũ sở hữu vẫn chưa được giải quyết.
• Không có đầu ra có cấu trúc trên lớp thoại, vì vậy các đối số công cụ được xác thực theo lược đồ phải được thực thi trong mô hình backend.
• Không có quyền truy cập theo gói miễn phí đối với GPT-Live-1, và giới hạn tốc độ được tính theo số phiên đồng thời — 25 ở Cấp 1, tăng lên 500 ở Cấp 5.
• Không có Zero Data Retention và không có data residency ngoài Hoa Kỳ trong bản beta của Agents API.
• Không có bất kỳ sự tái lập độc lập nào đối với bất kỳ con số benchmark nào của GPT-Live-1.
Canh bạc mà OpenAI đặt cược vào ngày 10 tháng 9 là các nhà phát triển muốn mua harness và chọn bộ não một cách riêng rẽ. Nửa đầu của điều đó giờ đây đã là một mục hàng. Nửa sau là nơi áp lực cạnh tranh của mười hai tháng tới sẽ đổ xuống — bởi vì một harness được host với khe mô hình có thể hoán đổi chỉ tốt ngang với những mô hình mà bạn có thể đặt vào đó, và hiện tại đó chính là phần duy nhất của stack mà OpenAI không thể kiểm soát một mình.
Phần uỷ quyền lại là câu chuyện khác — backend mà lớp giọng nói giao việc cho chỉ là một lệnh gọi mô hình thông thường, và GPT-5.6 Terra có sẵn thông qua OrcaRouter với mức giá niêm yết của OpenAI cùng endpoint Responses được mở ra.
