
Muse Realtime Avatar: Meta trao cho Muse Agent của mình một gương mặt, với 870 mili giây mỗi lượt
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 180 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Con số mà Meta chọn để dẫn dắt là 870 mili giây. Đó là khoảng thời gian Muse Realtime Avatarmất, theo chính phép đo của Meta, từ lúc bạn ngừng nói đến lúc byte đầu tiên của phản hồi đồng bộ gồm giọng nói và video đến nơi. Đây là một con số thực sự táo bạo đối với một hệ thống phải tạo video, và nó đáng được đọc một cách chính xác — bởi vì gần như mọi điều thú vị về mô hình hiện thân mới của Meta đều nằm trong khoảng cách giữa những gì con số đó đo lường và những gì người ta sẽ tưởng rằng nó đo lường.
Muse Realtime Avatar đã được công bố vào ngày 23 tháng 9 năm 2026 tại Meta Connect và được Meta Superintelligence Labs viết bài cùng ngày trong một bài viết nghiên cứu có tiêu đề "Đưa Muse của bạn vào cuộc sống." Tính năng này mở rộng Muse Realtime Voice, lớp hội thoại bên trong tác nhân Muse của Meta, bằng cách trao cho nó một cơ thể. Đây không phải là một chatbot với avatar có sẵn: bạn đưa cho nó một hình ảnh tham chiếu — một bức ảnh, một hình minh họa toàn thân, một con vật, một đồ vật trong nhà — và nó kết xuất đối tượng đó đang nói, đang ra hiệu và đang thay đổi tư thế trong video liên tục suốt thời gian cuộc trò chuyện. Zuckerberg đã nói trên sân khấu rằng avatar gắn với Muse của chính ông ấy có tên là Jolly.
Một luồng token dùng chung, không phải một lượt đồng bộ khẩu hình
Kiến trúc là phần đáng để hiểu, vì nó giải thích tại sao Meta cứ nói "hiện thân" thay vì "hình đại diện". Muse Realtime Voice tạo ra một luồng token giọng nói — bài viết gọi chúng là VQs — mang cả nội dung của những gì đang được nói và ngữ điệu của nó: nhịp độ, sự nhấn mạnh, sự lên xuống. Muse Realtime Avatar tiêu thụ chính luồng đó. Nó là một Diffusion Transformer được điều khiển bằng âm thanh, được điều kiện hóa trên các token giọng nói đó, trên phương tiện tham chiếu bạn cung cấp, và trên một cửa sổ trượt của các latent video gần đây, và nó tạo ra video thành các đoạn nhân quả ngắn, đưa từng latent mới về phía trước làm ngữ cảnh chuyển động cho latent tiếp theo.
Chia sẻ một luồng token là điều giữ cho giọng nói, chuyển động môi và biểu cảm khóa chặt vào nhau. Giải pháp thay thế — tạo âm thanh, rồi chạy một mô hình đồng bộ môi riêng lên đó — là cách mà phần lớn ngành avatar vận hành, và đó là lý do vì sao rất nhiều avatar trong số đó trông như đang được lồng tiếng. Thiết kế của Meta loại bỏ đường nối đó ngay từ cấu trúc. Cửa sổ latent cuộn là nửa còn lại của ý tưởng: nếu không có nó, một bộ sinh dựa trên chunk sẽ bị trôi dạt, và đến phút thứ ba, nhân vật của bạn đã lặng lẽ trở thành một người khác.

Bốn con số đã được công bố, và mỗi con số thực sự đo lường điều gì
Meta đã công bố nhiều số liệu hơn mức thông thường đối với một bài nghiên cứu gắn với một tính năng tiêu dùng. Cả bốn số liệu dưới đây đều do công ty tự báo cáo, được Meta đo lường dựa trên các đường cơ sở do chính Meta lựa chọn; không có số liệu nào trong đó được tái lập bên ngoài công ty.
• 870 ms từ thời điểm kết thúc lượt nói đến byte đầu tiên. Đây là chỉ số khởi đầu phản hồi. Nó không phải là thời gian để có câu trả lời hoàn chỉnh, và cũng không phải độ trễ truyền tải liên tục cho phần còn lại của cuộc gọi. Một hệ thống có thể đạt 870 ms đến byte đầu tiên mà vẫn cảm thấy chậm chạp ở giây thứ mười hai. Bài đăng của Meta nói rõ rằng đây là phép đo byte đầu tiên; các bài đưa tin bỏ qua yếu tố định lượng này đang hiểu nó là khả năng đáp ứng đầu-cuối, trong khi thực tế không phải vậy.
• Video dọc 448×768 ở 25 khung hình mỗi giây. Đó là khung hình dọc kiểu điện thoại, không phải khung ngang, và 25 fps mang tính điện ảnh hơn là mượt mà — tốc độ khung hình chuẩn của phim, thấp hơn mức 30 hoặc 60 fps mà nguồn camera gốc sẽ cung cấp. Meta cho biết các bản demo được đóng dấu bằng lớp phủ trong suốt để người nhận có thể biết rằng họ không nhìn vào nguồn camera thông thường.
• Ít hơn 60× số lần đánh giá mô hình.Được trình bày đầy đủ bên dưới, vì đây là con số dễ bị hiểu sai nhất.
• 12 phiên thời gian thực đồng thời trên một NVIDIA GB200.Meta báo cáo rằng công việc phục vụ của mình — bộ đệm KV lâu dài, định tuyến nhận biết bộ đệm, gom lô động nhận biết độ trễ, huấn luyện nhận biết lượng tử hóa bốn bit, hợp nhất kernel và ghi lại CUDA Graph, được phát triển cùng NVIDIA — đã tăng công suất gấp 8 lần so với đường cơ sở BF16 hai bước của chính mình. Phép toán đằng sau rất rõ ràng: mỗi bước tạo sinh tạo ra tám khung hình, tức 320 ms phát lại, trong 20 ms thời gian mô hình, hay 2,5 ms mỗi khung hình. Cả con số 12 lẫn 8× đều so với đường cơ sở được Meta chỉ định, không phải so với phần cứng của nhà cung cấp khác.
Tại sao 60× không nhanh hơn 60 lần
Tuyên bố về nén là tuyên bố sẽ được nhắc lại nhiều nhất và hiểu ít nhất. Mô hình teacher của Meta là một mô hình khuếch tán 40 bước với classifier-free guidance ba nhánh — ba lượt mỗi bước, tức 120 lần đánh giá mô hình để tạo ra một đoạn video. Mô hình student là một mô hình nhân quả hai bước không hướng dẫn với bộ nhớ đệm KV độ dài cố định, được huấn luyện bằng chưng cất và self-forcing, và nó cần hai lần đánh giá cho cùng một đoạn. Đó là mức giảm 60 lần số lần đánh giá trên mỗi đoạn, với chất lượng gần bằng teacher, theo cách nói của Meta.
Đây là một sự giảm tính toán theo từng phân đoạn. Ít hơn sáu mươi lần số lần đánh giá không có nghĩa là người dùng chỉ phải chờ ngắn đi một phần sáu mươi, bởi vì độ trễ đã có những yếu tố đóng góp khác trước khi chưng cất và vẫn còn chúng sau đó. Biểu đồ trong bài đăng của chính Meta cho thấy sự giảm đó đã đổi lấy được gì về mặt chất lượng: mức độ ưa thích của con người tăng từ 45% lên 55%. Đó là phiên bản trung thực của câu chuyện — mục đích của việc chưng cất là tạo ra một hệ thống có thể chạy được trong thời gian thực, và cái giá về chất lượng được giữ ở khoảng mười điểm ưa thích thay vì bị loại bỏ hoàn toàn.
Việc đánh giá, bao gồm cả kết quả đã đi theo hướng ngược lại
Meta đã thử nghiệm so với hai hệ thống avatar thương mại, Runway Characters và HeyGen LiveAvatar, sử dụng các danh tính avatar được ghép tương ứng để những người đánh giá so sánh hoạt ảnh thay vì thiết kế nhân vật. Những người đánh giá đã có các cuộc trò chuyện trực tiếp kéo dài hai đến ba phút với từng hệ thống, sau đó so sánh chất lượng hình ảnh, khả năng đồng bộ, tính nhất quán của nhân vật và các điệu bộ, cử chỉ.
Meta báo cáo rằng mình được ưa thích hơn Runway Characters với tỷ lệ 78% so với 22% và hơn HeyGen LiveAvatar với tỷ lệ 88% so với 12%, đồng thời được ưa thích trên mọi khía cạnh được đánh giá. Sau đó, bài đăng làm điều mà hầu hết các đánh giá của nhà cung cấp không làm: tiết lộ rằng so sánh điệu bộ với Runway Characters không thể phân biệt được về mặt thống kê so với mức ngang bằng. Một thế hòa nằm trong một thắng lợi áp đảo là chuyện nhỏ, nhưng chính chi tiết đó cho bạn thấy thắng lợi áp đảo ấy đang được báo cáo một cách trung thực thay vì bị chọn lọc theo hướng có lợi.
Các giới hạn của bài kiểm tra quan trọng hơn kết quả hòa. Hai đến ba phút là một cuộc trò chuyện ngắn. Những người đánh giá đều thuộc Meta. Và chính bài đăng cũng cảnh báo rằng các phần trình diễn của nó “minh họa năng lực của mô hình và không phải tất cả đều phản ánh các avatar có sẵn trong ứng dụng Muse” — tức là một nhóm nghiên cứu đang nói thẳng rằng video bạn đã xem không nhất thiết là sản phẩm bạn sẽ nhận được.
Những gì bạn không thể làm với nó
Không có API cho Muse Realtime Avatar. Không có giá, không có bảng giá, không có danh sách chờ và không có ngày công bố. Meta không nói khi nào người dùng hoặc nhà phát triển sẽ có thể sử dụng nó. Ứng dụng Muse dành cho người từ 18 tuổi trở lên là nền tảng duy nhất mà nó hướng tới, và avatar này đang đến cùng với một loạt tính năng Muse khác — tùy chỉnh giọng nói, địa chỉ email Muse, điều khiển máy tính Mac, tích hợp kính — những tính năng có lộ trình riêng, một số được nêu là "vài tháng tới".
Phép so sánh đáng bàn ở đây không phải là với Runway hay HeyGen. Mà là với phần còn lại của hệ sinh thái Muse. Muse Spark, mô hình suy luận mà agent chạy trên đó, đã có sẵn cho các nhà phát triển kể từ khi Meta mở nó thông qua Meta Model API, và Muse Spark 1.2 được cung cấp qua OrcaRouter với định danh meta/muse-spark-1.2 ở mức 1,25 USD cho mỗi triệu token đầu vào và 4,25 USD cho mỗi triệu token đầu ra, theo giá niêm yết của nhà cung cấp, không có phụ phí, trong một cửa sổ ngữ cảnh một triệu token vốn đã tiếp nhận văn bản, hình ảnh, video, âm thanh và tệp. Đó là phần của Muse mà bạn có thể gọi ngay hôm nay. Còn gương mặt là phần bạn không thể.
Sự bất đối xứng đó đáng để ngẫm kỹ nếu bạn đang lên kế hoạch cho bất cứ điều gì. Một tác nhân suy luận qua cuộc gọi video và một tác nhân xuất hiện trong đó là những sản phẩm khác nhau với những ràng buộc khác nhau, và chỉ một trong hai nằm trên bảng giá.

Xem gì tiếp theo
Ba điều sẽ biến thứ này từ một thông báo thành một quyết định. Điều thứ nhất là ngày phát hành cho avatar bên trong Muse, bởi vì mọi thứ Meta công bố đều là về một mô hình, và không có gì họ công bố là về một sản phẩm mà bạn có thể dùng vào một ngày thứ Năm. Điều thứ hai là một phép đo độ trễ được thực hiện qua một cuộc trò chuyện dài thay vì ở byte đầu tiên — 870 ms chỉ là một phát súng xuất phát, và câu hỏi mà một cuộc gọi thực tế đặt ra là điều gì xảy ra ở phút thứ mười. Điều thứ ba là liệu hệ thống có giữ đúng nhân vật dưới những điều kiện đối kháng hay không: một người dùng cố tình đổi chủ đề, thay đổi nhanh, hoặc đưa cho nó một ảnh tham chiếu được thiết kế để trông giống như một người thật.
Cho đến lúc đó, bản tóm tắt trung thực chính là điều mà bài đăng nghiên cứu ngụ ý nhưng không nói ra. Muse Realtime Avatar là một công trình kỹ thuật thực thụ với một kết quả nén thực sự đằng sau, được trình diễn trong một thiết lập được kiểm soát, được đánh giá bởi chính công ty đã tạo ra nó, trong những cuộc trò chuyện kéo dài chẳng khác gì thời gian gọi một ly cà phê. Nó không phải là vaporware. Nó cũng không phải là thứ bạn có thể mua, định tuyến hay đo kiểm — và đó là những khẳng định khác nhau.

