
GPT-Live-1 Đã Có Mặt Trên API: Giọng Nói Song Công Với Giá 0,05 Đô La Mỗi Phút, Không Có Lộ Trình Thay Thế Trực Tiếp Từ GPT-Realtime-2.1
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
GPT-Live-1 đã có trong API kể từ ngày 10 tháng 9, và con số thực sự sẽ định hình lại ngân sách không phải là một benchmark — mà là đơn vị tính phí. Mô hình giọng nói song công toàn phần của OpenAI giờ đây tính phí cố định 0,05 USD mỗi phút thoại, được tính theo từng giây, trong khi mô hình mà nó đang được so sánh với, GPT-Realtime-2.1, được tính theo token âm thanh ở mức 32 USD mỗi triệu đầu vào và 64 USD mỗi triệu đầu ra. Bản thân mô hình không mới: GPT-Live-1 đã được phát hành bên trong ChatGPT vào ngày 8 tháng 7 năm 2026, để thay thế cho Advanced Voice Mode. Điều mới là các nhà phát triển cuối cùng đã có thể gọi nó — và việc gọi nó gần như chẳng giống chút nào với tích hợp Realtime mà hầu hết các nhóm đã có. Tài liệu của chính OpenAI kết hợp lớp giọng nói với một backend suy luận riêng, và trong ví dụ WebRTC được công bố, backend đó là GPT-5.6 Terra.
Điều gì đã được phát hành vào ngày 10 tháng 9, và điều gì thì không
Bề mặt API được thiết kế hẹp một cách có chủ đích. Chỉ có đúng một model ID, gpt-live-1, và nó cũng chính là snapshot mặc định của chính nó — không có các biến thể theo ngày để ghim. Chỉ có đúng một endpoint, endpoint Live Sessions tại v1/live/sessions. Mọi thứ khác trên nền tảng của OpenAI đều bị tắt đối với model này: không có Chat Completions, không có Responses, không có Realtime (bao gồm cả các biến thể dịch và phiên âm), không có Assistants, không có Batch, không có fine-tuning, không có embeddings, không có tạo hình ảnh hay video, không có các endpoint phát âm thanh hay phiên âm, không có moderation.
Đầu vào và đầu ra là âm thanh và văn bản. Phát trực tuyến và gọi hàm được hỗ trợ; đầu ra có cấu trúc, tinh chỉnh và đầu ra dự đoán thì không. Đầu vào hình ảnh và video được nêu rõ là không được hỗ trợ — vì vậy tính năng "thoại kèm video" mà OpenAI đã hé lộ không thuộc bản phát hành này. Gói miễn phí hoàn toàn không thể gọi nó, và giới hạn tốc độ được đo bằng số phiên đồng thời thay vì số yêu cầu mỗi phút: 25 ở Bậc 1, tăng lên 50, 200, 300 và 500 qua các Bậc 2 đến 5.

Cách định khung về tính đồng thời đó là manh mối đầu tiên cho thấy đây không phải là một bản thay thế cắm-là-chạy. Các giới hạn tốc độ được tính bằng số cuộc trò chuyện trực tiếp đồng thời cho bạn biết OpenAIOpenAI kỳ vọng đơn vị mở rộng quy mô là gì: một đường dây điện thoại, chứ không phải một yêu cầu.
Thay đổi về giá mới là câu chuyện âm thầm hơn nhưng lớn hơn.
Tính phí cố định theo phút thực sự là một sự thay đổi căn bản. Khi tính phí theo token, bạn phải mô hình hóa mức tiêu hao âm thanh — một giây im lặng tốn bao nhiêu token, việc một người gọi cứ nói chèn lên trợ lý làm thay đổi độ dài đầu ra như thế nào — trước khi bạn có thể dự báo dù chỉ một cuộc gọi. Với $0.05 một phút, phép tính thu gọn lại thành phép nhân:
• Một cuộc gọi hỗ trợ 5 phút — $0.25 cho thời lượng thoại
• Cuộc gọi 10 phút — $0.50
• Trung bình 4 phút cho 1.000 cuộc gọi mỗi ngày — 200 USD một ngày, khoảng 6.000 USD một tháng
• Một giờ đường dây mở liên tục — $3.00
Ba chi tiết làm rõ điều đó. Thứ nhất, thời lượng không được làm tròn lên đến phút nguyên tiếp theo, nên một cuộc gọi 40 giây tốn khoảng 3,3 xu thay vì trọn một nickel. Thứ hai, khởi tạo phiên tính trước 15 giây thời lượng thoại — nhưng số đó được trừ vào các khoản phí thời lượng sau này, chứ không cộng chồng lên trên, nên một cuộc gọi ngắn hơn 15 giây vẫn rơi vào mức giá 15 giây. Thứ ba, thoại chỉ chiếm một nửa hóa đơn. Mô hình suy luận ở backend, các lệnh gọi công cụ của nó, và bất kỳ tìm kiếm web nào đều được tính phí riêng theo mức giá thông thường của mô hình đó, nghĩa là một "mô hình thoại rẻ" vẫn có thể tạo ra một cuộc gọi đắt đỏ nếu bạn hướng việc ủy quyền sang một bộ suy luận tiên tiến và để nó tìm kiếm ở mọi lượt.
Cấu trúc cao hai mét đó chính là nơi định tuyến không còn là chuyện xa xỉ nữa. Trên OrcaRouter, nửa backend của một phiên GPT-Live-1 chỉ là một lệnh gọi model khác — khoảng 190 model từ mười một nhà cung cấp thượng nguồn nằm sau một key duy nhất, với giá niêm yết của nhà cung cấp được chuyển nguyên không thêm markup, và tự động chuyển dự phòng nếu backend bạn chọn gặp lỗi hoặc hết thời gian chờ. Bạn không thể định tuyến chính lớp thoại; endpoint Live Sessions là của riêng OpenAIOpeOpenAI. Bạn hoàn toàn có thể định tuyến mọi thứ mà lớp thoại ủy thác, tức là nửa phần lớn lên theo mức độ người gọi của bạn phải suy nghĩ.
Chỉ WebRTC — vì sao mã Realtime của bạn sẽ không thể port được
Đây là chi phí thực tế của việc chuyển đổi, và hầu hết các bài đưa tin về ra mắt đều bỏ qua điều đó. Các phiên GPT-Live-1 chạy qua WebRTC, không phải qua giao thức truyền tải WebSocket mà rất nhiều tích hợp Realtime hiện có được xây dựng dựa trên đó. Việc dò thử đường dẫn cũ hơn bằng một ID mô hình GPT-Live sẽ trả về lỗi nói thẳng rằng các phiên yêu cầu WebRTC.
Quá trình bắt tay (handshake), theo hướng dẫn WebRTC của OpenAI: trình duyệt của bạn mở một RTCPeerConnection, gắn các track micrô, mở một data channel và đăng ký các listener trước khi gửi offer, thiết lập local description, chờ ICE gathering, rồi gửi offer lên server của chính bạn. Server của bạn sau đó gọi POST /v1/live/sessions với cấu hình phiên cùng transport: { type: "webrtc", sdp: ... }. Nếu thành công, hệ thống trả về HTTP 201 kèm session.id và transport.sdp, và trình duyệt áp dụng nó làm remote description. Media truyền trên các track đã được thương lượng; data channel — có nhãn oai-events — chuyên chở bản ghi văn bản, các cập nhật phiên và công việc được ủy thác. Để kết thúc cuộc gọi, bạn gửi session.close và tiếp tục đọc cho đến khi session.closed xuất hiện.
Hai điều cần lưu ý đáng để dán lên màn hình. Bản thân lệnh gọi HTTP sẽ khởi động phiên, nên bạn cũng không được gửi session.start trên kênh dữ liệu. Và bạn không nên gắn thêm âm thanh đầu vào hoặc chờ các delta âm thanh đầu ra trên kênh đó — hãy để audio.format ra khỏi cấu hình và để SDP xử lý. Các ví dụ máy chủ giới hạn phần thân yêu cầu ở 64 KB, đặt thời gian chờ thu thập ICE là 10 giây và hoàn tất phiên là 15 giây.
Không có thứ nào trong đó là khó. Tất cả đều là code mới. Nếu sản phẩm của bạn là một agent thời gian thực theo lượt, việc chuyển sang GPT-Live-1 là một cuộc viết lại phần transport cộng với viết lại phần delegation, chứ không phải chỉ đổi ID model — đáng để dự trù như một sprint thay vì một buổi chiều.
Các benchmark, và ai đã chạy từng cái một trong số đó
Mọi số liệu dưới đây đều là của chính OpenAIOpenAI, được công bố cùng bản phát hành API và không được bất kỳ ai tái tạo độc lập vào thời điểm viết bài. Lưu ý đó ở đây quan trọng hơn mức thông thường, bởi vì các mức chênh lệch đủ lớn để chúng dễ bị trích dẫn như một sự thật đã ngã ngũ.

• Tương tác song công toàn phần — GPT-Live-1 80.1% so với 45.4% của GPT-Realtime-2.1
• Độ trễ chuyển lượt — 0,8 giây so với 1,4 giây
• Độ chính xác khi gọi công cụ — 87% so với 60%
• Chuẩn đối sánh hỗ trợ thoại ngân hàng, tỷ lệ đạt — 32% so với 12.4%
Hãy đọc dòng cuối cùng hai lần. Tỷ lệ đạt 32% là một cải thiện lớn so với 12,4% và vẫn có nghĩa là hệ thống đã thất bại với khoảng hai phần ba số nhiệm vụ trong đánh giá đó. Những bước nhảy vọt về tính tương tác và khả năng gọi công cụ mới là những điểm mô tả một sản phẩm thực sự khác biệt; còn con số về ngân hàng là con số trung thực về việc các tác nhân thoại còn cách việc xử lý một quy trình được quản lý chặt chẽ mà không có giám sát bao xa.
Bằng chứng từ khách hàng mỏng hơn bảng chuẩn đo lường và đều chỉ về cùng một hướng. Yelp đang dùng GPT-Live-1 cho dịch vụ đặt chỗ qua điện thoại, với CTO Alex Levy được trích dẫn về việc xử lý cuộc gọi được cải thiện. Nền tảng học ngôn ngữ Speak báo cáo số lần ngắt lời giảm gần 80% so với hệ thống theo lượt trước đây — một con số do chính công ty tự báo cáo, vốn có lợi ích liên quan đến kết quả, và vẫn là con số triển khai cụ thể nhất hiện có.
Lớp giọng nói là giao diện phía trước; bạn chọn bộ não
Đặt cược về mặt kiến trúc nằm ở việc uỷ thác, và đây chính là phần của bản phát hành này mà một lớp định tuyến khớp vào một cách tự nhiên. GPT-Live-1 không đảm nhận phần suy luận sâu. Khi người gọi hỏi điều gì đó cần suy luận, truy xuất hoặc một công cụ, mô hình sẽ chuyển tác vụ qua một ranh giới bất đồng bộ tới một backend riêng vẫn tiếp tục làm việc trong khi cuộc trò chuyện bằng giọng nói vẫn diễn ra, rồi ghép câu trả lời trở lại khi nó đã sẵn sàng.
Cấu hình được thể hiện tường minh, và thật đáng để đọc kỹ ví dụ trong tài liệu. Cùng với model: "gpt-live-1" và các chỉ dẫn, phiên làm việc mang theo một delegation thuộc loại responses, mà khối responses bên trong của nó nêu tên mô hình backend, các chỉ dẫn riêng của nó, các công cụ của nó — ví dụ sử dụng web_search — và một tool_choice. Trong ví dụ WebRTC đã công bố của OpenAIOpenAI, mô hình backend đó là GPT-5.6 Terra.

Đó chính là tuyên bố thực sự của thiết kế: thay backend và trải nghiệm giọng nói trở nên thông minh hơn mà không cần huấn luyện lại mô hình giọng nói. Điều đó cũng có nghĩa là backend uỷ quyền có thể di động theo cách mà lớp giọng nói không thể. OrcaRouter không cung cấp gpt-live-1 — endpoint Live Sessions chỉ dành riêng cho OpenAI, và chúng tôi không định tuyến phần nào của nó. Nhưng nửa phần uỷ quyền nói ngôn ngữ của Responses API, và nửa đó hoàn toàn thuộc quyền lựa chọn của bạn. GPT-5.6 Terra đang hoạt động trên OrcaRouter với mức giá niêm yết của OpenAIOpenAI — 2,00 đô la cho mỗi triệu token đầu vào và 12,00 đô la cho mỗi triệu token đầu ra, với endpoint Responses được hiển thị — nên chính xác mô hình trong ví dụ của OpenAIOpenAI chỉ cách một lệnh gọi, không cần hợp đồng hay SDK thứ hai.
Về mặt thực tế, điều đó biến việc chọn backend thành cấu hình. Bạn có thể A/B một mô hình suy luận giá rẻ với một mô hình suy luận tiên tiến trên lưu lượng cuộc gọi thực tế bằng cách sửa một dòng và theo dõi hóa đơn theo từng cuộc gọi, hoặc đặt mô hình ủy quyền phía sau cơ chế tự động chuyển đổi dự phòng để một buổi chiều tồi tệ ở phía thượng nguồn không làm sập luôn đường dây điện thoại của bạn. Lớp thoại mà bạn trả $0.05 một phút vẫn giữ nguyên tại chỗ; mọi thứ nó ủy quyền đều chạy qua một khóa duy nhất trên khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn, theo đúng giá niêm yết của nhà cung cấp và không cộng thêm markup nào.
Còn thiếu gì nữa?
• Không có đầu vào hình ảnh hoặc video — ảnh tĩnh và chia sẻ màn hình không có trong bản phát hành này, vì vậy giao diện thoại đa phương thức mà các chế độ ChatGPT cũ vẫn duy trì vẫn chưa được giải quyết
• Không có đầu ra có cấu trúc — nếu agent của bạn cần các đối số công cụ được xác thực theo lược đồ, thì việc xác thực đó phải nằm trong mô hình backend của bạn, chứ không phải ở lớp thoại
• Không có quyền truy cập gói Miễn phí và không có tinh chỉnh — cả chi phí lẫn khả năng tùy chỉnh đều bắt đầu từ các gói trả phí
• Không có đánh giá độc lập nào đối với bất kỳ con số nổi bật nào — mọi số liệu ở trên đều do nhà cung cấp tự thực hiện
• Mức trần đồng thời 25 phiên cùng lúc trên Tier 1 — hào phóng cho một dự án thí điểm, nhưng eo hẹp cho một tổng đài ngay ngày đầu tiên
Ai nên di chuyển, và ai nên chờ đợi
Hãy hành động ngay nếu bạn đang xây dựng giải pháp điện thoại — đường dây đặt chỗ, đặt lịch hẹn, hỗ trợ tuyến đầu — và ngăn xếp hiện tại của bạn là chuỗi ASR-to-LLM-to-TTS cổ điển. Độ trễ và khả năng xử lý ngắt lời chính là những gì pipeline đó đánh mất, giá theo phút thì đủ dễ dự báo để đưa vào bảng tính, và tài liệu của chính OpenAIOpenAI giờ đã có một ví dụ máy chủ kiểu Twilio để sao chép. Cũng hãy hành động ngay nếu bạn đã dùng mô hình Realtime và sản phẩm của bạn thực sự mang tính hội thoại chứ không phải theo lượt, bởi vì xử lý ngắt lời chính là phần mà GPT-Realtime-2.1 làm kém nhất.
Hãy chờ nếu tích hợp của bạn hoạt động theo lượt và đang chạy tốt. Việc viết lại lớp truyền tải là công việc thực sự, endpoint không hỗ trợ gì khác, và không có lộ trình chuyển đổi nào giữ nguyên mã WebSocket hiện có của bạn. Cũng hãy chờ nếu trường hợp sử dụng của bạn phụ thuộc vào đầu ra công cụ có cấu trúc hoặc đầu vào video, cả hai đều không có ở đây.
Những điều cần theo dõi trong vài tuần tới: lần tái lập độc lập đầu tiên của con số tương tác 80,1%, liệu mức $0.05 có phải là giá giới thiệu, liệu một mẫu GPT-Live-1 mini nhỏ hơn có đến được API giống như nó đã làm ở phía người tiêu dùng, và liệu đầu vào hình ảnh và màn hình có thu hẹp khoảng cách. Cho đến khi một phòng thí nghiệm bên ngoài chạy đánh giá đó, tóm tắt trung thực là đây là mô hình giọng nói có năng lực nhất mà bất kỳ ai đã tung ra cho nhà phát triển, với bằng chứng cho tuyên bố đó do chính những người đang bán nó viết ra.
