
Tavus Griffin vs Muse Realtime Avatar: Hai gương mặt năm 2026, hai vấn đề khác nhau
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 223 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Cả Tavus Griffin và Muse Realtime Avatar đều tồn tại để giải quyết cùng một vấn đề đáng xấu hổ — một mô hình ngôn ngữ có thể nói nhưng không có gương mặt — và chúng tiếp cận vấn đề đó từ hai đầu đối lập. Griffin là một Mô hình Tương tác Con người từ video sang video, quan sát người tham gia qua camera và tạo ra phía bên kia của cuộc trò chuyện trong thời gian thực, và nó được Tavus công bố vào tháng 10 năm 2026 như một bản xem trước nghiên cứu dành cho những người thử nghiệm được chọn. Muse Realtime Avatar là lớp hiện thân của Meta cho tác nhân Muse của mình, được công bố tại Meta Connect vào ngày 23 tháng 9 năm 2026, và nó nhận âm thanh rồi biến đổi thành một chân dung biết nói được đồng bộ hóa. Cả hai đều không thể mua được. Sự khác biệt nằm ở điều mà mỗi bên đang cố làm cho đúng, và nó lộ ra ngay khi bạn hỏi mỗi mô hình thực sự đang nhận gì làm đầu vào.
Phiên bản ngắn
• Đầu vào của Griffin là người ở đầu dây bên kia — video và âm thanh của một người tham gia trực tiếp, thứ mà nó phải đọc, phản hồi và bị ngắt lời bởi.
• Đầu vào của Muse Realtime Avatar là giọng nói của chính tác nhân — một luồng token từ Muse Realtime Voice mà nó chuyển đổi thành khuôn mặt tương ứng.
• Tavus đo lường Griffin bằng việc liệu mọi người có tin nó hay không, và công bố con số 48% từ một cuộc gọi video dài một phút.
• Meta đánh giá Muse Realtime Avatar dựa trên việc liệu nó có theo kịp không, và công bố 870 mili giây từ cuối lượt đến byte đầu tiên.
• Cả hai đều không có API công khai, mức giá được công bố, hay ngày phát hành chính thức.
Đọc bốn hàng đó cùng nhau thì hình dạng của sự bất đồng là hiển nhiên. Tavus đang tối ưu hóa cho niềm tin của người kia. Meta đang tối ưu hóa cho đồng hồ.

Griffin: mô hình buộc phải được tin tưởng
Cách định khung của Tavus là Griffin chính là Mô hình Tương tác Con người đầu tiên, và kiến trúc đằng sau tuyên bố này là một hệ thống gồm hai phần, kết hợp Mô hình hóa Hội thoại Liên tục với Tạo sinh Âm thanh-Hình ảnh. Phần thứ nhất mang tính hành vi: nó quyết định nhân vật nên làm gì từ thời điểm này sang thời điểm kế tiếp, dựa trên những gì nó có thể nhìn và nghe thấy. Phần thứ hai là kết xuất, và Tavus lại chia phần đó thành tạo giọng nói dạng luồng và tạo video dạng luồng.
Những con số mà Tavus mở đầu không phải là con số thông lượng. Trong một nghiên cứu công ty thực hiện với Đại học Queen Mary London, 26 trong số 54 người tham gia — 48% — tin rằng Griffin là người thật sau một cuộc gọi video một phút, so với 1 trong 41 (2,4%) đối với bộ công nghệ trước đó gồm tạo khuôn mặt Phoenix-4.5, luân phiên lượt nói Sparrow-2 và thị giác Raven-1. Những người tham gia không bị lừa thường nghi ngờ trong vòng 20 giây đầu tiên. Trên bộ đánh giá VideoFDB của NVIDIA, được chấm vào tháng 9 năm 2026, Tavus báo cáo Griffin đứng đầu về AI mặt đối mặt với điểm tạo là 3,83 so với mức cơ sở mạnh nhất được báo cáo là 2,80 và tham chiếu con người là 3,92, cùng điểm nhận thức là 3,73 so với 3,44 cho mức cơ sở tốt nhất được báo cáo và tham chiếu con người là 4,20. Những số liệu đó do nhà cung cấp báo cáo và đặc thù theo bộ đánh giá, nhưng những điểm so sánh với con người mới là điều đáng chú ý.
Phần kỹ thuật đằng sau những con số đó là một codec tên Tavec và một transformer khuếch tán tự hồi quy. Tavec chạy ở 48 kHz với 40 giá trị mỗi khung hình ở 100 khung hình mỗi giây, không dùng codebook, bộ giải mã hoàn toàn nhân quả và các gói nhỏ tới 10 mili giây — được thiết kế để một khuôn mặt có thể bắt đầu chuyển động trước khi một câu nói kết thúc. Luồng video đẩy 720p theo các khối 320 mili giây, trong đó một latent bằng tám khung hình ở 25 fps, ba bước khuếch tán cho mỗi latent và mức nén thời gian 8× trong VAE. Một quy trình chưng cất ba giai đoạn (khớp phân phối, rồi tự hồi quy teacher-forcing, rồi self-forcing) là thứ cho phép nó chạy ba bước đó trong thời gian thực. Tuyên bố độ trễ nổi bật là trung bình 0,43 giây từ âm thanh sang video trên H100s, mà Tavus nói rằng chỉ bằng khoảng một nửa so với phương pháp nhanh thứ hai mà họ đo được. Nhân bản giọng nói cần khoảng một mẫu 10 giây.
Cái giá của tất cả những điều này là việc Tavus không thể phát hành nó. Griffin-Lite, bản xem trước nghiên cứu, chỉ khả dụng cho một nhóm nhỏ người thử nghiệm sớm được chọn lọc; khi viết về bản phát hành, công ty nói rõ rằng Griffin-Lite sẽ không khả dụng cho khách hàng sử dụng vào lúc này và rằng họ dự kiến phát hành Griffin rất sớm sau khi một số lo ngại về an toàn được giải quyết. Griffin hiện không có trên nền tảng Tavus và sẽ xuất hiện ở đó "một khi chúng tôi đã tìm ra cách phát hành nó một cách an toàn". Một mô hình thuyết phục được 48% thời gian trong một cuộc gọi một phút, xét từ góc độ triển khai, là một mô hình thuyết phục được 48% thời gian trong một cuộc gọi một phút.

Muse Realtime Avatar: mô hình phải theo kịp
Muse Realtime Avatar đã được công bố vào ngày 23 tháng 9 năm 2026 tại Meta Connect và được Meta Superintelligence Labs viết bài cùng ngày với tiêu đề “Đưa Muse của bạn vào cuộc sống”. Cách Meta định hình vấn đề hẹp hơn và mang tính máy móc hơn so với Tavus: agent Muse vốn đã có giọng nói, nhờ Muse Realtime Voice, và avatar chính là lớp mang lại cho giọng nói đó một cơ thể.
Con số được công bố là 870 mili giây từ lúc kết thúc lượt nói đến byte đầu tiên — nghĩa là, từ thời điểm người dùng ngừng nói đến thời điểm byte video đầu tiên của avatar sẵn sàng. Avatar kết xuất một ảnh chân dung 448×768 ở 25 khung hình/giây. Meta cho biết hệ thống thực hiện ít hơn khoảng 60 lần số phép đánh giá trên mỗi chunk so với đường cơ sở của nó, và rằng một NVIDIA GB200 duy nhất có thể đảm nhiệm 12 phiên thời gian thực đồng thời với mức tăng dung lượng 8× so với triển khai BF16 hai bước.
Sự khác biệt về kiến trúc so với Griffin nằm ở nguồn gốc thông tin. Muse Realtime Avatar mở rộng Muse Realtime Voice và chia sẻ luồng token giọng nói của nó — chính cùng một biểu diễn VQ mà mô hình giọng nói tạo ra là thứ điều khiển khuôn mặt, chứ không phải một cách hiểu thị giác riêng biệt về một người tham gia. Điều đó biến nó thành một lớp hiện thân DiT được điều khiển bằng âm thanh: hiệu quả, gắn kết chặt chẽ với mô hình giọng nói của chính nó, và hoàn toàn không cố gắng đọc con người ở đầu bên kia cuộc gọi. Nó là miệng và khuôn mặt cho một tác nhân, chứ không phải một đối tác đối thoại quan sát bạn.
Meta đã không công bố API nào, không có giá và không có ngày phát hành cho Muse Realtime Avatar. Bài đăng nghiên cứu là toàn bộ hồ sơ công khai.
Nơi hai thiết kế thực sự khác biệt
Cách rõ ràng nhất để thấy sự phân chia là hỏi điều gì xảy ra khi người dùng ngắt lời.
Griffin là full duplex và được thiết kế để có thể bị ngắt giữa lời nói — nó có thể vừa quan sát vừa lắng nghe trong khi đang nói, đó là lý do chiến dịch tiếp thị của Tavus dựa vào ý tưởng rằng Griffin học hành vi hội thoại thay vì video. Đó cũng là lý do bộ tiêu chuẩn đánh giá của nó được xây dựng xoay quanh nhận thức và phản ứng, và là lý do mức dẫn trước 37% so với hệ thống tốt nhất kế tiếp về khả năng phản ứng tức thời là một tuyên bố mà công ty thấy đáng để đưa ra.
Con số cuối lượt 870 mili giây của Muse Realtime Avatar lại kể cho bạn câu chuyện ngược lại: đó là một pipeline trong đó lượt kết thúc, các token âm thanh được phân giải xong, rồi sau đó khuôn mặt mới bắt kịp. Nó nhanh — 870 ms là một con số tốt cho một trình kết xuất chân dung — nhưng bản thân phép đo giả định rằng có tồn tại một ranh giới lượt, mà đó chính xác là giả định mà một mô hình song công được xây dựng để vứt bỏ.
Đó không phải là lời chỉ trích đối với thiết kế nào trong hai thiết kế. Meta đang xây dựng một khuôn mặt cho một tác nhân sống bên trong các bề mặt trợ lý của chính Meta, nơi ranh giới lượt rõ ràng là một mô hình hợp lý cho tương tác. Tavus đang xây dựng một thứ phải trụ được trước việc một người lạ quyết định, trong vòng hai mươi giây, liệu người trên màn hình có thật hay không.
Cả hai đều không có trong bảng giá — và chỉ một phần của Muse là có thể gọi được
Cả Tavus Griffin lẫn Muse Realtime Avatar đều không thể được đưa vào vận hành sản xuất ngay hôm nay. Griffin bị giới hạn cho một số người thử nghiệm được chọn; Muse Realtime Avatar không có API, không có giá và không có ngày ra mắt. Nếu bạn đang lập kế hoạch xây dựng, cả hai sự thật đó đều nên nằm trong kế hoạch.
Điều đáng lưu ý là phần của ngăn xếp Muse mà có thể truy cập được. Dòng Muse của Meta bao gồm Muse Spark, và một checkpoint của nó — meta/muse-spark-1.2 — đang có trên danh mục của chúng tôi với giá 1,25 USD cho mỗi triệu token đầu vào và 4,25 USD cho mỗi triệu token đầu ra với không cộng thêm phí trên giá niêm yết của Meta. Nó không phải là avatar: nó nhận đầu vào văn bản, hình ảnh, video, âm thanh và PDF và trả về văn bản, với cửa sổ ngữ cảnh 1 triệu token và mức độ suy luận có thể cấu hình. Nhưng nó là phần của dòng Muse mà bạn thực sự có thể gọi, và nếu bạn đang xây dựng agent mà một ngày nào đó sẽ ngồi sau một avatar, thì phần ngôn ngữ là phần bạn có thể bắt đầu. OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức phụ phí 0%, vì vậy thay đổi giá của Meta được phản ánh trên bảng giá của chúng tôi ngay trong ngày thay vì chu kỳ thanh toán tiếp theo, và một yêu cầu thất bại trên một nhà cung cấp sẽ được thử lại với một nhà cung cấp đang hoạt động tốt thay vì trả về lỗi hết thời gian chờ.

Logic tương tự cũng áp dụng cho mảng video. Chúng tôi không định tuyến Muse Realtime Avatar và chúng tôi không định tuyến Tavus Griffin, và chúng tôi sẽ không tuyên bố khác. Điều chúng tôi định tuyến là một danh mục gồm hơn hai trăm mô hình trên cùng các phương thức, nên một nguyên mẫu có thể hoán đổi giữa tác nhân văn bản, mô hình giọng nói và trình tạo video vẫn dùng chung một khóa trong khi hai mô hình trong bài viết này vẫn chưa được phát hành.
Cái nào xa hơn so với nơi giao hàng?
Theo thông tin công khai, Muse Realtime Avatar còn xa hơn. Nó có một bài đăng nghiên cứu và không có API, không có giá và không có ngày ra mắt. Griffin cũng không có API và không có giá, nhưng nó có ý định phát hành rõ ràng — “rất sớm sau khi các lo ngại về an toàn này được giải quyết” — một hạng xem trước có tên đã tồn tại ngay hôm nay dành cho những người thử nghiệm được chọn, và một loạt kết quả benchmark đã công bố từ một bộ kiểm thử độc lập. Đó là một vị thế tiên tiến hơn, dù đi kèm với sự thừa nhận rằng mô hình chưa đủ an toàn để giao cho khách hàng.
Cái bẫy khi so sánh chúng là coi con số 870 mili giây như thể có thể so sánh trực tiếp với con số 0,43 giây. Chúng đo những thứ khác nhau: Meta đo từ lúc kết thúc một lượt nói đến byte đầu tiên của một ảnh chân dung, còn Tavus đo độ trễ âm thanh-hình ảnh bên trong một luồng song công liên tục, nơi các lượt nói không phải là những sự kiện tách bạch. Cả hai con số đều là thật, nhưng chúng không phải cùng một phép đo, và bất kỳ ai trình bày chúng trong cùng một cột là đang làm người đọc chịu thiệt.
Điểm mấu chốt
Muse Realtime Avatar là một lớp hiện thân: âm thanh vào, chân dung ra, 870 mili-giây từ lúc kết thúc lượt nói đến byte đầu tiên, 448×768 ở 25 fps, không có API và không có ngày ra mắt. Tavus Griffin là một Mô hình Tương tác Con người song công: người tham gia vào, một khuôn mặt phản ứng ra, độ trễ trung bình từ âm thanh đến video là 0,43 giây trên H100, và một nhà cung cấp sẵn sàng công bố rằng 48% người nghĩ đó là người thật trong khi cũng tuyên bố rằng khách hàng không thể sử dụng nó. Meta đang xây dựng thứ gì đó theo kịp. Tavus đang xây dựng thứ gì đó vượt qua. Cả hai đều không thể mua được, nghĩa là quyết định duy nhất hiện có hôm nay là bắt đầu từ nửa nào của vấn đề — và với hầu hết các đội, nửa đó chính là mô hình ngôn ngữ bên dưới.
