
GPT-Live-1 Đứng đầu Chỉ số Speech to Speech với 81,5 điểm — nhưng Thứ hạng Thuộc về Backend của nó
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1, mô hình giọng nói song công hoàn toàn lần đầu được phát hành trong ChatGPT vào ngày 8 tháng 7 năm 2026, hiện đứng đầu trên Chỉ số Speech to Speech của Artificial Analysis với 81,5 — một dòng chỉ tồn tại vì mô hình được trỏ tới GPT-6 Astra để đảm nhiệm phần suy luận. Chạy cùng giao diện giọng nói đó với GPT-5.6 Sol làm backend được ủy quyền ở mức nỗ lực suy luận thấp và nó đạt 80,1, tức vị trí thứ ba. Vị trí thứ hai, với 81,3, thuộc về Grok Voice Think Fast 2.0 High.
Hai điều thành thật trước khi vào các con số. Mô hình này không mới: GPT-Live-1 đã có mặt trên API dành cho nhà phát triển vào ngày 10 tháng 9 năm 2026, sau hai tháng làm giọng nói mặc định của ChatGPT. Điều mới, tính đến ngày 15 tháng 9, là một đơn vị đánh giá bên ngoài đã chấm điểm nó — điều duy nhất còn thiếu trong mọi bài viết về mô hình này cho đến nay, kể cả bài của chính chúng tôi, nơi những con số duy nhất có được là những con số OpenAI tự công bố về chính mình. Và khoảng cách 0,2 điểm so với vị trí thứ hai còn nhỏ hơn khoảng cách 1,4 điểm giữa hai cấu hình của chính GPT-Live-1, và đây mới là con số hữu ích nhất trên bảng.
Vậy nên tiêu đề "GPT-Live-1 là mô hình giọng nói tốt nhất" không hẳn là điều mà bảng xếp hạng nói. Nó nói rằng GPT-Live-1 với GPT-6 Astra ở mức medium effort mới là như vậy, nhỉnh hơn đúng một phần năm điểm, và rằng việc chọn backend ảnh hưởng đến kết quả nhiều hơn bất kỳ mô hình đối thủ nào.
Chỉ số thực sự đo lường điều gì
Artificial Analysis xây dựng Chỉ số Speech to Speech như một tổng hợp có trọng số bằng nhau của bốn phần: Suy luận giọng nói, được đo bằng Big Bench Audio; Hiệu suất Agentic, được đo bằng τ-Voice; Ưu tiên Arena, một Elo ưu tiên con người theo cặp; và Tỷ lệ thành công nhiệm vụ. Chỉ những mô hình có đủ cả bốn thành phần mới nhận được giá trị chỉ số — mọi thứ khác hiển thị dấu gạch ngang, đó là lý do tại sao bảng có nhiều hàng hơn hẳn số điểm. Bản thân chỉ số này ra mắt vào ngày 23 tháng 6 năm 2026 và đã được sửa đổi hai lần kể từ đó, gần đây nhất là thay Động thái hội thoại bằng Thành công nhiệm vụ, vì vậy điểm số từ một phiên bản sửa đổi không thể so sánh chặt chẽ với điểm số từ một phiên bản khác.
Hai chi tiết phương pháp luận khác cũng quan trọng khi bạn đọc bảng xếp hạng. Arena Elo được đóng băng ở mức mà nó có khi một mô hình lần đầu trở nên có thể công bố, vì vậy thành phần sở thích thưởng cho việc đến sớm thay vì là tốt nhất hiện tại. Và chỉ số này đánh giá cả một hệ thống chứ không phải một mô hình đơn lẻ: đối với GPT-Live-1, con số bao gồm phần giao diện giọng nói đầu cuối cộng với bất kỳ mô hình backend nào mà nó chuyển công việc cho. Đó là một lựa chọn thiết kế có chủ đích, và đó là lý do cùng một mô hình xuất hiện hai lần với các điểm số khác nhau.
Vị trí dẫn đầu bảng, như đã công bố:
• GPT-Live-1 (Astra, medium) — chỉ số 81.5, đứng đầu
• Grok Voice Think Fast 2.0 High — chỉ số 81.3, thứ hai
• GPT-Live-1 (Sol, low) — chỉ số 80.1, thứ ba
• GPT-Realtime-2.1 High — chỉ số 73.9, thứ tư
• GPT-Realtime-2 High — chỉ số 73.6, thứ năm
• Grok Voice Think Fast 1.0 — chỉ số 72.3, thứ sáu
• Gemini 3.1 Flash Live High — chỉ số 71.5, thứ bảy

Để so sánh, mô hình mà GPT-Live-1 thay thế nằm thấp hơn nó 7,6 điểm. Đó là một khoảng cách thế hệ thực sự, và điều này không có gì phải tranh cãi.
Chiến thắng 0,2 điểm đến từ đúng một thành phần
Tách chỉ số tổng hợp ra, hai mô hình dẫn đầu không còn trông giống cùng một loại mô hình nữa. Xét trên các thành phần, theo Artificial Analysis:
• Hiệu năng agentic (τ-Voice) — GPT-Live-1 67.9% so với Grok Voice Think Fast 2.0 High 56.5%
• Suy luận giọng nói (Big Bench Audio) — 90% so với 97%
• Tỷ lệ thành công tác vụ — 87.4% so với 94.6%
• Elo Đấu trường — 1048 so với 1011
• Thời gian tới âm thanh đầu tiên — 1,34 giây so với 0,70 giây
• Chi phí mỗi giờ, đã bao gồm backend — 5,83 đô la so với 4,80 đô la

GPT-Live-1 thắng hai trong sáu dòng và thua bốn, vậy mà vẫn chiếm ngôi đầu trên chỉ số. Phép tính chẳng có gì bí ẩn: khoảng cách ở τ-Voice là 11,4 điểm, lớn hơn hẳn mọi khoảng chênh khác trong bảng, và với trọng số ngang nhau, nó kéo điểm tổng hợp vượt qua vạch. Nói một cách dễ hiểu, GPT-Live-1 là agent giỏi hơn, còn Grok Voice Think Fast 2.0 High là người nghe tốt hơn và cũng nhanh hơn — và chỉ số này tình cờ đánh trọng số cho đúng thứ GPT-Live-1 giỏi đủ nặng để đưa nó lên đầu.
Nếu sản phẩm của bạn là một tác nhân thoại có thể đặt lịch, giải quyết hoặc thực hiện giao dịch, thì mức dẫn trước 11,4 điểm trên τ-Voice chính là con số dự đoán trải nghiệm của bạn. Nếu sản phẩm của bạn là một cuộc trò chuyện phải mang lại cảm giác tức thì và không bao giờ nói chồng lên người dùng, thì thời gian 0,70 giây đến âm thanh đầu tiên chính là con số dự đoán trải nghiệm của bạn, và Grok thắng chỉ số này với lợi thế gấp khoảng hai lần. Về thực thi tác vụ có quy định, còn có một cảnh báo thứ hai: tỷ lệ thành công tác vụ 94,6% của Grok là cao nhất trong bảng hiển thị, còn 87,4% của GPT-Live-1 nghĩa là khoảng một trong tám tác vụ không hoàn thành. Cả hai đều là cải tiến so với thế hệ trước. Không cái nào là vấn đề đã được giải quyết.
Hàng số 1 là cấu hình định tuyến, không phải mô hình.
Đây là phần đáng được chú ý hơn vị trí trên bảng xếp hạng. GPT-Live-1 là một lớp thoại song công toàn phần, tự xử lý việc nghe, nói, ngắt lời và giành lượt, đồng thời giao việc suy luận, gọi công cụ và tìm kiếm cho một mô hình backend riêng trong khi cuộc hội thoại vẫn tiếp diễn. Artificial Analysis đã chấm điểm hai trong số các cặp kết hợp đó thành các mục riêng. Astra ở mức nỗ lực trung bình đạt 81,5. Sol ở mức nỗ lực thấp đạt 80,1.
Mức chênh lệch 1,4 điểm đó mới là câu chuyện. Khoảng cách giữa vị trí thứ nhất và thứ hai là 0,2 điểm. Khoảng cách giữa hai cấu hình được chấm điểm của GPT-Live-1 lớn gấp bảy lần. Không có gì ở mô hình giọng nói thay đổi giữa các dòng đó — chỉ có việc mô hình nào đang đảm nhiệm phần suy nghĩ, và ở mức nỗ lực nào. Một bảng xếp hạng các hệ thống đang nói với bạn, một cách chính xác, rằng cấu hình chính là sản phẩm.
Nó cũng điều chỉnh báo cáo của chính chúng tôi. Vào ngày 11 tháng 9 năm 2026, chúng tôi ghi nhận GPT-Live-1 ở mức 69,8% trên chỉ số này, xếp sau cả GPT-Realtime-2.1 và Grok. Đó là kết quả đo có sẵn vào thời điểm đó, và nó củng cố một kết luận hợp lý — rằng OpenAI đã xây dựng cơ chế hội thoại tốt nhất chứ không phải tác nhân thoại tốt nhất. Chỉ số hiện có hai cấu hình GPT-Live-1 được ủy quyền ở mức 81,5 và 80,1. Artificial Analysis không công bố nhật ký thay đổi, và đơn vị này đã sửa đổi các thành phần của chỉ số vào tháng 8, nên chúng tôi không thể nói chắc chắn liệu con số trước đó là một cấu hình chưa được chấm điểm hoặc được chấm điểm một phần, hay là một lần chạy theo trọng số cũ hơn; điều có thể quan sát được là các cặp được ủy quyền giờ xuất hiện dưới dạng các hàng hoàn chỉnh riêng của chúng, và rằng câu trả lời đã thay đổi khi chúng làm như vậy.
Hệ quả thực tế là "mô hình giọng nói nào" là câu hỏi sai, còn "mô hình giọng nói nào cộng với backend nào, ở mức nỗ lực nào" mới là câu hỏi đúng. Đó là một câu hỏi về định tuyến, và chính sản phẩm của chúng tôi tồn tại để trả lời câu hỏi đó. OrcaRouter cung cấp backend uỷ thác của GPT-Live-1, GPT-6 Astra, thông qua cùng endpoint tương thích OpenAI như hơn 200 mô hình khác, nên việc hoán đổi lớp suy luận chỉ là thay đổi ID mô hình chứ không phải một tích hợp. DSL định tuyến kết hợp nhiều mô hình vào một lệnh gọi duy nhất, và tính năng chuyển đổi dự phòng tự động nghĩa là một cặp kết hợp chưa được kiểm chứng không phải là một canh bạc trong môi trường production — nếu backend suy giảm, yêu cầu sẽ được đưa tới nơi khác thay vì thất bại. Nói chính xác về những gì chúng tôi không làm: bản thân GPT-Live-1 không nằm trong danh mục của chúng tôi và chúng tôi không phục vụ nó. Backend mà nó uỷ thác tới lại là chuyện khác.
Một giờ của thứ này tốn bao nhiêu
Phần front end của GPT-Live-1 được tính phí $0.05 mỗi phút thoại, tính theo giây, tức $3.00 cho một giờ đường truyền mở. Đó chưa phải toàn bộ hóa đơn: suy luận được ủy thác, lệnh gọi công cụ và tìm kiếm web được tính phí riêng theo mức mà mô hình backend tính. Artificial Analysis đã đo con số tổng hợp, đó là lý do cột chi phí của nó là cột cần dùng:
• GPT-Live-1 (Sol, low) — $4.47 mỗi giờ
• Grok Voice Think Fast 2.0 High — 4,80 USD mỗi giờ
• GPT-Live-1 (Astra, trung bình) — 5,83 đô la mỗi giờ
• GPT-Realtime-2.1 High — 10,75 USD mỗi giờ
Cấu hình đứng đầu bảng xếp hạng là lựa chọn đắt nhất trong ba phương án hiện có, và cấu hình đã thắng đắt hơn 30% mỗi giờ so với cấu hình đứng thứ ba. Đọc theo chiều ngược lại, cách phân tách này rất đáng chú ý: cứ mỗi giờ thì 3,00 đô-la thuộc về lớp giọng nói, còn phần còn lại — 1,47 đô-la trên Sol, 2,83 đô-la trên Astra — là token backend. Lớp suy luận chiếm khoảng từ một phần ba đến một nửa hóa đơn của bạn, một tỷ trọng lớn cho một thành phần mà bảng xếp hạng coi như chú thích.

Tuy nhiên, so với mô hình mà nó thay thế, cả dòng sản phẩm có giá chỉ bằng khoảng một nửa — mức 0,05 đô-la mỗi phút cho phần front end là mức cắt giảm thực sự, chứ không phải là đóng gói lại. Vì token backend được tính theo mức giá backend, chi phí của một triển khai GPT-Live-1 chủ yếu phụ thuộc vào việc bạn định tuyến đến mô hình suy luận nào, và backend có thể là mô hình của chính OpenAI hoặc của bên thứ ba. Trên OrcaRouter, các backend đó được chuyển tiếp theo giá niêm yết của nhà cung cấp với 0% markup, vì vậy thay đổi giá từ nhà cung cấp ở lớp suy luận sẽ có hiệu lực ngay trong cùng ngày thay vì vào chu kỳ thanh toán tiếp theo.
Điều mà chỉ số không giải quyết
Ba lưu ý, do chính nguồn nêu ra chứ không phải được suy diễn. Cả hai mục GPT-Live-1 lẫn Grok Voice Think Fast 2.0 High đều được gắn cờ là dựa trên một lần thử duy nhất, vốn quá mỏng cho một quyết định chênh lệch 0,2 điểm — chạy lại có thể đảo vị trí nhất và nhì mà không có gì thay đổi ở cả hai mô hình. Arena Elo, như đã nêu, đã bị đóng băng tại phép đo đầu tiên có thể công bố của mỗi mô hình. Và chỉ số này không có mục nào cho cách những hệ thống này hành xử trong một cuộc gọi dài: các thành phần vốn có tầm ngắn theo thiết kế, trong khi kiểu thất bại thực sự khiến các tác nhân thoại gục ngã trong môi trường sản xuất là sự trôi dạt qua một cuộc trò chuyện kéo dài hai mươi phút.
Riêng điều này, và lấy từ nhà cung cấp chứ không phải từ chỉ mục: API của GPT-Live-1 đã ra mắt mà không có đầu vào hình ảnh hay video, không có đầu ra có cấu trúc và không có gói miễn phí, và giới hạn tốc độ của nó được tính bằng phiên đồng thời chứ không phải số yêu cầu mỗi phút. Đó là những hạn chế trong ngày ra mắt có thể đã thay đổi; hãy kiểm tra chúng trước khi bạn thiết kế dựa trên chúng.
Làm gì với cái này
Nếu tuần này bạn đang chọn một kiến trúc thay vì một mô hình, chỉ số này thưởng cho mẫu delegated trong công việc agentic và mẫu cascade về độ trễ. GPT-Live-1 ở mức 81,5 là bằng chứng mạnh nhất cho đến nay rằng việc tách hội thoại khỏi suy luận là hình thái đúng cho các agent thoại hoàn thành nhiệm vụ. Grok Voice Think Fast 2.0 High ở mức 81,3, với 0,70 giây để có âm thanh đầu tiên và tỷ lệ thành công nhiệm vụ 94,6%, là bằng chứng mạnh nhất rằng hình thái delegated không phải là hình thái duy nhất hiệu quả — và rằng nó vẫn chưa phải là nhanh nhất.
Quyết định rút ra từ những con số này rẻ hơn vẻ ngoài của nó. Cả hai cấu hình của GPT-Live-1, cùng mô hình đã đánh bại nó ở bốn trong sáu thành phần, đều chỉ cách nhau 1,36 đô la một giờ. Với mức chênh lệch đó, nước đi đúng đắn là ngừng đọc các bảng xếp hạng và tự chạy bản ghi của bạn qua cả hai. Chỉ số này cho bạn biết hình dạng của sự đánh đổi; nó không thể cho bạn biết người dùng của bạn đang đứng ở phía nào.
Những câu hỏi mà con số gợi ra
GPT-Live-1 có phải là mô hình giọng nói tốt nhất hiện nay không?
Xét theo điểm tổng hợp, thì đúng — hơn 0,2 điểm và chỉ có một lần thử đứng sau. Xét theo từng thành phần, điều đó hoàn toàn phụ thuộc vào việc bạn đang xây dựng gì: nó dẫn đầu về hiệu năng agentic và mức độ được ưa thích trên arena, nhưng xếp sau về suy luận giọng nói, tỷ lệ thành công tác vụ và thời gian tới âm thanh đầu tiên. Một vị trí dẫn đầu 0,2 điểm ở điểm tổng hợp, dựa trên một lợi thế 11,4 điểm ở một thành phần, là vị trí thứ nhất có thể bảo vệ được, chứ không phải là vị trí mang tính quyết định.
Bạn có bắt buộc phải dùng GPT-6 Astra để đạt được 81.5 không?
Đối với đúng hàng đó, vâng — con số 81,5 thuộc về GPT-Live-1 được cấu hình với Astra ở mức nỗ lực suy luận trung bình. Sol ở mức nỗ lực thấp là một lựa chọn thay thế đã được ghi nhận ở mức 80,1 và rẻ hơn 1,36 đô la mỗi giờ, và OpenAI hỗ trợ việc đưa các mô hình bên thứ ba làm backend, nên các mục trên bảng xếp hạng chỉ là hai điểm trên một đường cong chứ không phải những lựa chọn duy nhất. Việc kết hợp nào là tốt nhất cho khối lượng công việc của bạn không phải là điều mà một chỉ mục công khai có thể trả lời thay bạn.
Tại sao cùng một mô hình lại đạt 69,8 điểm trong bài viết trước đây của chúng tôi và 81,5 điểm ở thời điểm hiện tại?
Hai con số này đề cập đến những thứ khác nhau. Lần đọc trước đây đặt GPT-Live-1 lên chỉ số như một mục duy nhất; bảng hiện tại chứa hai cấu hình được ủy quyền của nó dưới dạng các hàng riêng biệt, được chấm điểm đầy đủ, với cặp Astra ở mức 81,5 và cặp Sol ở mức 80,1. Artificial Analysis đã sửa đổi các thành phần của chỉ số vào tháng 8 và không công bố nhật ký thay đổi, vì vậy hãy coi phần chênh lệch là sự thay đổi ở những gì được đo lường chứ không phải là bằng chứng cho thấy mô hình đã cải thiện — và hãy coi bất kỳ điểm tổng hợp đơn lẻ nào cho một mô hình ủy quyền như một phát biểu về một cấu hình.
