
GPT-Live-1 so với Grok Voice Think Fast 2.0: Hai API giọng nói đang đi theo hướng giá ngược chiều nhau
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Sự thật hữu ích nhất về cuộc đối đầu này là một hướng đi, chứ không phải một con số. Khi xAI phát hành Grok Voice Think Fast 2.0 vào cuối tháng 7 năm 2026, hãng đã tăng mức phí âm thanh mỗi phút thêm 60%, từ 0,05 USD mà Think Fast 1.0 tính lên 0,08 USD. Sáu tuần sau, vào ngày 10 tháng 9 năm 2026, OpenAI đưa GPT-Live-1 vào API dành cho nhà phát triển đúng ở mức giá mà xAI vừa mới từ bỏ. Điều đó tạo ra tình huống hiếm có khi hai API giọng nói song công toàn phần hàng đầu có thể được so sánh trực tiếp về giá, và khi bên mới tham gia lại là bên rẻ hơn — trong khi mô hình cũ hơn, đắt hơn lại là mô hình có điểm benchmark từ bên thứ ba đứng sau.
Sổ cái, trước bất kỳ chuẩn đối sánh nào
Cả hai đều là những mô hình chuyển giọng nói thành giọng nói được xây dựng cho những khối lượng công việc mang hình dạng cuộc gọi điện thoại: một cuộc trò chuyện trực tiếp với khách hàng, một sự ngắt lời, một lệnh gọi công cụ, và một hóa đơn tính bằng phút. Ngoài những điểm đó, chúng nhanh chóng rẽ theo những hướng khác nhau.
• Giá mỗi phút âm thanh — GPT-Live-1 0,05 USD so với Grok Voice Think Fast 2.0 0,08 USD
• Đơn vị tính phí — GPT-Live-1 tính phí theo giây, không làm tròn lên thành phút trọn vẹn tiếp theo; Grok Voice Think Fast 2.0 được tính giá theo mỗi phút âm thanh và tương đương khoảng 4,80 USD một giờ
• Phát hành — GPT-Live-1 đã ra mắt trong ChatGPT vào ngày 8 tháng 7 năm 2026 và có mặt trên API vào ngày 10 tháng 9 năm 2026; Grok Voice Think Fast 2.0 được công bố khoảng ngày 29–30 tháng 7 năm 2026, tức khoảng ba tháng sau Think Fast 1.0
• Điểm cuối — GPT-Live-1 chỉ có Live Sessions, tại v1/live/sessions, qua WebRTC; Grok Voice Think Fast 2.0 chạy trên API Speech-to-Speech của xAI qua cả WebSocket và WebRTC
• Bề mặt công cụ — GPT-Live-1 chuyển tiếp tới một mô hình suy luận backend thông qua Responses API; Grok Voice Think Fast 2.0 có tìm kiếm web, tìm kiếm X, tìm kiếm tệp, máy chủ MCP và các hàm phía máy khách có sẵn trong phiên
• Tính di động của giọng nói — GPT-Live-1 sử dụng bộ mười hai giọng nói được OpenAI làm lại; Grok Voice Think Fast 2.0 hỗ trợ giọng nói tích hợp sẵn và giọng nói tùy chỉnh
Dòng WebSocket nhỏ hơn vẻ ngoài của nó và quan trọng hơn mức nó nên có. Một phần lớn hạ tầng điện thoại — phần truyền tải luồng media bên trong hầu hết sản phẩm CPaaS — nói WebSocket, chứ không phải WebRTC. Grok Voice Think Fast 2.0 đáp ứng hạ tầng đó ngay tại vị trí hiện tại của nó; GPT-Live-1 thì không, và việc đi từ một đường gọi chỉ dùng WebSocket sang WebRTC là một phần kỹ thuật thực thụ chứ không phải một cờ cấu hình.

Sự bất đối xứng của benchmark mới là câu chuyện thực sự
Đây là chỗ mà việc so sánh không còn hòa nữa, và cũng là chỗ mà phần lớn các bài viết lại hiểu ngược, khi coi cả hai tập số liệu là cùng một loại bằng chứng.
Các điểm số nổi bật của Grok Voice Think Fast 2.0 đến từ Chỉ số Chất lượng Giọng nói sang Giọng nói của Artificial Analysis, một phép đo của bên thứ ba đặt mô hình ở mức 82,9%, tăng từ 75,7% ở phiên bản 1.0, vượt qua GPT-Realtime-2.1 ở mức 79,1% và Gemini 3.1 Flash ở mức 69,5%. xAI cũng báo cáo vị trí thứ nhất trên τ-voice Bench về hành vi tác tử ở mức 56,5%, vượt qua GPT-Realtime-2.1 ở mức 45,7%. Đó là những phép đo do bên ngoài thực hiện đối với mô hình của xAI.
Các điểm số nổi bật của GPT-Live-1 là do chính OpenAI đưa ra. Công ty báo cáo khả năng tương tác song công hoàn toàn đạt 80,1% so với 45,4% của GPT-Realtime-2.1, độ trễ chuyển lượt giảm từ 1,4 giây xuống 0,8 giây, và độ chính xác gọi công cụ tăng từ 60% lên 87%. Mỗi một con số trong đó đều do nhà cung cấp báo cáo, chưa được một phòng thí nghiệm độc lập tái lập, và so sánh mô hình mới của OpenAI với mô hình trước đó của chính OpenAI thay vì so với một đối thủ cạnh tranh.
Đó không phải là lý do để gạt bỏ những con số — hướng dịch chuyển này nhất quán với những gì các đơn vị triển khai sớm báo cáo — nhưng nó thực sự có nghĩa rằng so sánh xuyên nhà cung cấp duy nhất hiện có đang có lợi cho mô hình của xAI trên các bài kiểm tra do bên độc lập thực hiện, trong khi con số duy nhất hiện có về lợi thế độ trễ của OpenAI lại là của chính OpenAI. Đừng coi 0,8 giây và 0,70 giây là một cuộc so tài thực sự; chỉ một trong hai con số đó được đo bởi một bên không có lợi ích gì trong kết quả.

Cái bẫy bí danh, và vì sao đợt tăng giá khiến mọi người trở tay không kịp
Mức tăng 60% lẽ ra chỉ là một sai số làm tròn trong hầu hết các ghi chú phát hành, nếu xAI không đồng thời đẩy nó qua một alias. Các ứng dụng trỏ đến alias grok-voice-latest đã tự động kế thừa cả mô hình mới lẫn mức giá cao hơn vào ngày 5 tháng 8 năm 2026, trừ khi chúng đã ghim rõ ràng grok-voice-think-fast-1.0. Đó là một quyết định thiết kế đáng để hiểu hơn là để phàn nàn: alias nổi mang lại cho bạn các bản nâng cấp miễn phí, và chúng cũng thay đổi bài toán kinh tế đơn vị của bạn mà không hỏi.
Biện pháp khắc phục hiển nhiên yếu hơn vẻ ngoài của nó. Grok Voice Think Fast 1.0 — mô hình có giá $0.05 một phút, ra mắt ngày 23 tháng 4 năm 2026 — hiện đã bị đánh dấu là deprecated trên danh sách mô hình của chính xAI. Việc ghim nó bảo vệ bạn khỏi bản nâng cấp tự động, và nó chỉ mua thời gian chứ không phải một con đường rẻ hơn lâu dài, bởi vì một mô hình deprecated có ngày ngừng hoạt động ở đâu đó phía trước. Hãy lập kế hoạch di chuyển theo lịch trình của riêng bạn thay vì theo lịch của bí danh.
Bản thân phần thông tin giá cả cũng đáng để đọc kỹ trước khi bạn chốt một con số. Trang models của xAI liệt kê rõ ràng các mức giá theo phiên bản — grok-voice-think-fast-2.0 ở mức $0.08 mỗi phút âm thanh, $4.80 một giờ, cộng thêm $0.004 mỗi lượt nhập văn bản — trong khi thẻ Voice API riêng biệt trên cùng trang đó lại quảng cáo mức giá cho agent là "chỉ từ $0.05 một phút", vốn là điểm khởi đầu chứ không phải mức giá mà model 2.0 tính. Nếu bạn lập kế hoạch dung lượng dựa trên con số marketing đó, thì kế hoạch của bạn đang thiếu hụt khoảng 60%.
Mô hình của OpenAI không gặp vấn đề này ở cùng dạng, vì không có gì để trôi dạt tới. GPT-Live-1 chỉ có đúng một ID mô hình, gpt-live-1, cũng chính là snapshot mặc định của nó — không có các biến thể gắn ngày để ghim, và do đó không có bí danh nào có thể âm thầm thay đổi mô hình hoặc giá. Đánh đổi là bạn cũng không thể đóng băng một hành vi đã được biết là tốt và tiếp tục dùng nó trong khi thứ mới dần ổn định.
Cả hai mô hình đều tính phí lớp suy luận tách biệt với lớp giọng nói, và đây là chỗ mức giá được quảng cáo không còn là toàn bộ chi phí. Các cuộc gọi Responses được ủy quyền của GPT-Live-1 được tính theo mức giá trên mỗi token thông thường của mô hình backend đã cấu hình. xAI cộng thêm $0.004 cho mỗi đầu vào văn bản trong phiên thoại, cộng với các cuộc gọi công cụ, một số điện thoại được cấp phát với giá khoảng $0.01 một phút khi bạn cần, dịch vụ điện thoại và lưu trữ, trên mức giá âm thanh tính theo phút. Một tác nhân thoại chủ yếu lắng nghe và thỉnh thoảng tra cứu gì đó sẽ bám sát mức giá được quảng cáo; còn một tác nhân gọi công cụ ở mọi lượt thì sẽ không, và cả hai sẽ không lệch theo cùng một hướng, vì thiết kế backend được ủy quyền và thiết kế công cụ trong phiên đốt token ở những chỗ khác nhau.
Về phía chúng tôi, lý do những thay đổi giá theo phút đáng được theo dõi sát sao là OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp mà không cộng thêm lợi nhuận. Khi một nhà cung cấp thay đổi mức giá đã công bố, con số bên chúng tôi thay đổi ngay trong cùng ngày thay vì vào chu kỳ hợp đồng tiếp theo.

Việc phân chia ủy quyền khiến bạn phải trả giá như thế nào trong kỹ thuật
Nếu bạn đang lựa chọn giữa hai phương án này dựa trên kiến trúc chứ không phải giá cả, thì câu hỏi mang tính quyết định là ranh giới nằm ở đâu.
Mô hình của xAI giữ các công cụ bên trong phiên. Điều đó dễ suy luận hơn — một kết nối, một cuộc trò chuyện, một nơi diễn ra lệnh gọi hàm — và điều đó có nghĩa là mô hình có thể quyết định ngay giữa câu rằng nó cần tìm kiếm và tiếp tục nói trong khi chờ.
Mô hình của OpenAI đẩy phần việc đó ra ngoài. Lớp giọng nói giữ cho cuộc trò chuyện tiếp diễn và giao nhiệm vụ cho một mô hình suy luận riêng thông qua Responses API, nghĩa là các định nghĩa công cụ, khả năng truy xuất và logic nghiệp vụ của bạn nằm trong một tích hợp mô hình văn bản thông thường thay vì bên trong luồng sự kiện của phiên. Điều này đòi hỏi nhiều thành phần vận hành hơn, đồng thời cũng dễ di chuyển hơn: nửa được ủy quyền là một lệnh gọi API thông thường mà bạn có thể hoán đổi, định giá và chuyển đổi dự phòng độc lập với lớp giọng nói.
Điều đó quan trọng vì đúng một lý do. Cả GPT-Live-1 lẫn Grok Voice Think Fast 2.0 đều không được cung cấp bởi bất kỳ ai khác ngoài nhà cung cấp của chính nó — cả hai đều chỉ có một nguồn cung cấp duy nhất, và router không thể giúp bạn với phần âm thanh. Điều mà router có thể làm là hợp nhất phần mà bạn thực sự có thể chọn. GPT-5.6 Terra, backend trong ví dụ ủy quyền của chính OpenAI, có sẵn qua OrcaRouter với mức $2.00 cho mỗi triệu token đầu vào và $12.00 cho mỗi triệu token đầu ra với cả /v1/chat/completions và /v1/responses đều được cung cấp, cùng với khoảng 190 mô hình khác trên cùng một key. Nếu agent thoại của bạn gọi một mô hình suy luận mỗi lượt, thì đó chính là khoản mục có đòn bẩy định tuyến trong đó.
Phán quyết, phân theo khối lượng công việc
• Chọn GPT-Live-1 nếu giá mỗi phút là yếu tố ràng buộc, nếu đường gọi của bạn đã nói WebRTC, hoặc nếu bạn muốn bộ não lập luận đằng sau giọng nói là một mô hình văn bản có thể hoán đổi thay vì một phần cố định của phiên.
• Chọn Grok Voice Think Fast 2.0 nếu bạn cần chất lượng được xác minh độc lập có sẵn để cân nhắc trước khi bạn cam kết, nếu ngăn xếp viễn thông của bạn là WebSocket gốc, hoặc nếu các công cụ trong phiên — đặc biệt là tìm kiếm X — là cốt lõi của sản phẩm chứ không phải chỉ là yếu tố phụ.
• Để mắt đến alias nếu bạn đã đang dùng xAI. Ghim một ID model có phiên bản là thứ duy nhất đứng giữa bạn và lần thay đổi rate tự động tiếp theo, và kỷ luật tương tự cũng đáng được áp dụng ở bất cứ đâu một alias trôi nổi xuất hiện.
Tóm tắt gây khó chịu là: mô hình rẻ hơn lại là mô hình không có bằng chứng từ bên thứ ba chống lưng, còn mô hình được tài liệu hóa tốt hơn lại vừa trở nên đắt hơn 60%. Nếu bạn còn đủ sớm trong quá trình xây dựng đến mức cả hai tích hợp đều chưa bị chốt, thì nước đi ít rủi ro nhất là làm nguyên mẫu với cả hai — đường xử lý âm thanh dù chọn cách nào cũng chỉ vài trăm dòng — và để chất lượng bản chép lời của chính bạn quyết định, vì bằng chứng công khai hiện tại chưa đủ để ngã ngũ.
