Thẻ hero được tạo cho bài viết 'Muse Realtime Avatar vs GPT-Live-1', hiển thị hai thẻ bo tròn ở hai bên tiêu đề. Thẻ bên trái hiển thị 'Muse Realtime Avatar' phía trên một biểu tượng ảnh đại diện chân dung cùng các dòng 'video + giọng nói, một luồng' và 'không API, không giá, không ngày'; thẻ bên phải hiển thị 'GPT-Live-1' phía trên một biểu tượng bong bóng hội thoại cùng các dòng '$0,05 mỗi phút, tính phí theo từng giây' và 'các phiên đồng thời, WebRTC'. Dòng phụ đề ghi 'Một bên bán số phút. Bên kia bán sự hiện diện.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Muse Realtime Avatar so với GPT-Live-1: Sự hiện diện đối đầu với Hội thoại

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đơn vị tính phí cho bạn biết mỗi công ty nghĩ mình đang bán cái gì. GPT-Live-1, mô hình thoại song công toàn phần của Open​AI, tính mức phí cố định 0,05 đô la cho mỗi phút thoại, tính theo từng giây, và giới hạn tốc độ của nó được tính bằng số phiên đồng thời — 25 ở Tier 1, tăng lên 500 ở Tier 5. Đó là đơn vị của một đường dây điện thoại. Muse Realtime Avatar, được Meta công bố vào ngày 23 tháng 9 năm 2026, không có đơn vị tính phí, bởi vì không có gì để tính phí: không API, không endpoint, không giá, không ngày ra mắt. Đơn vị được công bố của nó thay vào đó là một con số phần cứng — 12 phiên thời gian thực đồng thời trên một NVIDIA GB200. Một công ty đang bán hội thoại theo phút. Công ty kia đang cho bạn thấy chi phí để kết xuất một khuôn mặt là bao nhiêu, và vẫn chưa quyết định bán nó.

Cả hai mô hình đều khá mới và không mô hình nào là một màn ra mắt theo nghĩa mà từ này thường mang. GPT-Live-1 đã ra mắt bên trong ChatGPT vào ngày 8 tháng 7 năm 2026 và chỉ đến được API dành cho nhà phát triển vào ngày 10 tháng 9 — hai tháng trong đó nó là giọng nói mặc định của một sản phẩm tiêu dùng và không dành cho bất kỳ ai đang xây dựng. Muse Realtime Avatar được công bố vào ngày 23 tháng 9 năm 2026 tại Meta Connect, được trình diễn trong bài đăng nghiên cứu của chính Meta, và vẫn là một năng lực của tác nhân Muse chứ không phải một sản phẩm. So sánh chúng là so sánh hai giai đoạn khác nhau của cùng một ý tưởng: điều gì xảy ra khi một mô hình hội thoại đủ giỏi đến mức câu hỏi tiếp theo là người dùng đang nhìn vào cái gì trong khi nó nói.

Những gì OpenAI đã xây dựng: một cuộc trò chuyện không bao giờ bị đình trệ

GPT-Live-1 có tính song công toàn phần theo nghĩa quan trọng trong vận hành — nó không chờ bạn nói xong trước khi bắt đầu hoạt động. Nó truy cập API dành cho nhà phát triển thông qua đúng một endpoint, endpoint Live Sessions, dưới đúng một ID mô hình, gpt-live-1, không có ảnh chụp nhanh theo ngày để ghim và không có endpoint cùng cấp nào được bật. Không có Chat Completions, không có Responses, không có Realtime, không có tinh chỉnh, không có endpoint phiên âm âm thanh hay giọng nói. Đầu vào hình ảnh và video được nêu rõ là không được hỗ trợ.

Quyết định thiết kế định hình mọi thứ phía sau là việc giao phó. GPT-Live-1 không tự mình thực hiện những bước suy luận khó. Tài liệu của OpenAI ghép lớp giọng nói với một backend suy luận riêng, và trong ví dụ WebRTC đã công bố, backend đó là GPT-5.6 Terra. Vì vậy, một phiên GPT-Live-1 là hai đồng hồ đo chạy cùng lúc: 0,05 đô la một phút cho giọng nói, cộng với mức giá token thông thường của mô hình backend cho mỗi lệnh gọi công cụ, tìm kiếm và bước suy luận mà nó chuyển giao. Trên Speech to Speech Index, tính cách tách đôi đó thể hiện ở việc cùng một mô hình ghi điểm hai lần — 81,5 với GPT-6 Astra đảm nhiệm việc suy nghĩ ở mức nỗ lực trung bình, 80,1 với GPT-5.6 Sol ở mức nỗ lực thấp. Khoảng cách 1,4 điểm giữa hai cấu hình đó lớn hơn mức chênh 0,2 điểm đưa cấu hình tốt nhất của GPT-Live-1 lên vị trí đầu tiên.

Đó là hình hài trung thực của mô hình. Front end giọng nói là cố định; trí tuệ là một tham số do bạn thiết lập, và nó làm thay đổi điểm số nhiều hơn bất kỳ mô hình cạnh tranh nào.

Những gì Meta đã tạo ra: một khuôn mặt chuyển động theo giọng nói

Muse Realtime Avatar giải quyết một vấn đề mà GPT-Live-1 không hề gặp phải — giữ cho video được tạo luôn đồng bộ chặt chẽ với giọng nói được tạo. Câu trả lời của Meta là biến chúng thành cùng một luồng: Muse Realtime Voice phát ra các token giọng nói mang cả nội dung lẫn ngữ điệu, còn avatar là một Diffusion Transformer được điều khiển bằng âm thanh, tiếp nhận chính những token đó, với điều kiện đầu vào là một ảnh tham chiếu và một cửa sổ trượt gồm các latent video gần đây. Không có gì được đồng bộ khẩu hình sau khi hoàn tất, bởi vì không hề có “sau khi hoàn tất” — giọng nói, miệng và biểu cảm đều cùng xuất phát từ một quy trình duy nhất.

Các số liệu được công bố là của chính Meta, được đo so với các đường cơ sở do Meta lựa chọn, và chưa có số liệu nào được tái lập bên ngoài công ty. 870 ms từ lúc kết thúc lượt của bạn đến byte đầu tiên của một phản hồi thoại và video đồng bộ. Video dọc 448×768 ở 25 khung hình mỗi giây, được gắn watermark bằng một lớp phủ trong suốt để người xem có thể nhận ra đây không phải là camera. Mười hai phiên đồng thời trên một GB200, mức tăng dung lượng gấp 8 lần so với đường cơ sở BF16 hai bước của chính Meta, nhờ huấn luyện nhận biết lượng tử hóa bốn bit, bộ đệm KV thường trú và gom lô động nhận biết độ trễ. Và một kết quả sở thích mà Meta báo cáo tăng từ 45% lên 55% so với đường cơ sở đó, cùng hai chiến thắng được công bố trước các hệ thống avatar thương mại — cộng với tiết lộ rằng về điệu bộ, kết quả đối với một trong số đó không thể phân biệt về mặt thống kê so với ngang bằng.

Không có thứ gì trong danh sách đó là một tỷ lệ, một điểm cuối hay một ngày.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

Hóa đơn hai mét, và nơi định tuyến khẳng định được vị trí của mình

Cấu trúc chi phí của GPT-Live-1 không phải là một con số duy nhất, và việc coi nó như một con số là cách một mô hình giọng nói nghe có vẻ rẻ lại tạo ra một tháng đắt đỏ. Giọng nói có giá 0,05 đô-la một phút, tính theo từng giây và không làm tròn lên, còn 15 giây đầu tiên của một phiên được tính trước nhưng sẽ được trừ vào thời lượng sau đó chứ không cộng chồng lên. Mọi thứ mà phiên đó giao phó — phần suy luận, các lệnh gọi công cụ, bất kỳ tìm kiếm nào — đều được tính riêng theo mức giá của chính mô hình backend. Hãy hướng việc giao phó sang một mô hình suy luận tiên tiến, để nó tìm kiếm ở mỗi lượt, và bạn đã dựng nên một đường dây mở với giá 3 đô-la một giờ cùng một mô hình cao cấp đằng sau nó.

Đồng hồ đo thứ hai đó là nửa có thể định tuyến. Trên OrcaRouter, backend của một phiên GPT-Live-1 chỉ là một lệnh gọi model khác: 196 model từ 15 nhà cung cấp phía sau một khóa duy nhất, ở mức giá niêm yết của nhà cung cấp được chuyển nguyên vẹn với mức markup bằng không, kèm tính năng chuyển đổi dự phòng tự động khi model bạn chọn gặp lỗi hoặc hết thời gian chờ. Bạn không thể định tuyến lớp thoại — Live Sessions chỉ là endpoint riêng của OpenAI — nhưng mọi thứ mà lớp thoại giao phó đều nằm trên một khóa duy nhất, nghĩa là phần hóa đơn tăng theo mức độ suy nghĩ của người gọi cũng chính là phần bạn có thể thay đổi mà không cần hợp đồng.

Ngược lại, Muse Realtime Avatar không có đồng hồ đo nào để định tuyến. Nó là một tính năng của một ứng dụng.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Hai đặt cược về mục đích của một trợ lý thoại

Bỏ thông số kỹ thuật đi thì hai công ty bất đồng về sản phẩm. Canh bạc của OpenAI là ở chỗ cuộc trò chuyện chính là sản phẩm — rằng một tác nhân thoại là một đường dây điện thoại, và công việc là làm cho nó có cảm giác như một đường dây điện thoại: không bao giờ bị khựng lại, giao việc suy nghĩ khó cho một mô hình phía sau nó, tính phí theo phút, mở rộng quy mô theo số cuộc gọi đồng thời. Mọi lựa chọn trong bề mặt API của GPT-Live-1 đều xuất phát từ đó. Giới hạn tốc độ dựa trên số lượng đồng thời, truyền tải chỉ dùng WebRTC, một endpoint đơn lẻ được thu hẹp có chủ đích, không có video vào hay ra.

Canh bạc của Meta là sự hiện diện chính là sản phẩm — rằng một người dùng có thể nhìn thấy tác nhân là một người dùng sẽ ở lại trong cuộc trò chuyện, và rằng phần kỹ thuật thú vị không phải là việc luân phiên lượt nói mà là giữ cho một nhân vật được kết xuất liền mạch trong suốt độ dài của một cuộc gọi. Những lựa chọn đó tạo ra một hệ thống được tối ưu hóa cho tốc độ khung hình và mật độ phiên trên GPU, hoàn toàn không có bề mặt thương mại nào.

Có một khả năng thực sự là cả hai đều đúng và hai thứ đó được kết hợp với nhau. Một sản phẩm có thể chạy hội thoại của nó trên một mô hình giọng nói song công toàn phần và lớp thị giác của nó trên một trình kết xuất avatar, và điều duy nhất cản trở điều đó ngày nay là trình kết xuất avatar không có endpoint. Điều không hợp lý là coi chúng như hai phiên bản của cùng một giao dịch mua.

Ai nên hành động, và ai nên chờ đợi

Nếu bạn đang xây dựng một sản phẩm thoại ngay lúc này, GPT-Live-1 có thể gọi được còn Muse Realtime Avatar thì không, và điều đó chấm dứt quyết định. Lựa chọn thú vị bên trong GPT-Live-1 là backend mà bạn giao phó, bởi vì đó chính là nơi cả điểm số lẫn hóa đơn thực sự thay đổi — và đó là phần duy nhất của stack mà bạn có thể định tuyến, hoán đổi và chuyển đổi dự phòng mà không cần đụng đến tích hợp giọng nói.

Nếu thứ bạn muốn là một avatar, thì chờ đợi không phải là thụ động. Những điều đáng để theo dõi thì rất cụ thể: liệu Meta có công bố bảng giá và một endpoint hay không, liệu một mốc ngày đã nêu có xuất hiện hay không, và liệu 870 ms có trụ được khi tiếp xúc với một chiếc điện thoại trên kết nối di động thay vì một bản demo tại Connect hay không. Bài đăng của chính Meta lưu ý rằng các bản demo của họ không phải đều phản ánh những avatar có sẵn trong ứng dụng Muse, và đó là câu cần nắm giữ.

Cho đến khi một trong những điều đó thay đổi, sự so sánh có câu trả lời chỉ một dòng. GPT-Live-1 là một đường dây điện thoại với bộ não do bạn chọn. Muse Realtime Avatar là một khuôn mặt không có số điện thoại.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.