
Muse Realtime Avatar: Meta đã xây dựng những gì, nó vận hành trên nền tảng nào, và vì sao bạn vẫn chưa thể gọi nó
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 1009 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Muse Realtime Avatar là công nghệ hiện thân của Meta. Nó nhận luồng giọng nói mà Muse Realtime Voice tạo ra và kết xuất màn trình diễn tương ứng: hướng nó vào một bức ảnh chân dung và khuôn mặt đáp lại bằng những thay đổi nhỏ trong biểu cảm; hướng nó vào một hình minh họa toàn thân và nhân vật ra hiệu, thay đổi tư thế trong khi nói. Meta AI Research đã giới thiệu nó vào ngày 23 tháng 9 năm 2026 trong một bài đăng có tiêu đề "Đưa Muse của bạn vào cuộc sống". Đây là một kết quả nghiên cứu chứ không phải sản phẩm — trang của chính Meta không cung cấp API, không có giá, không có danh sách chờ và không có ngày công bố cho nó — vì vậy câu trả lời trung thực cho câu hỏi "tôi có thể dùng nó ngay hôm nay không" là không. Mô hình Muse mà bạn có thể gọi ngày hôm nay là một mô hình khác, Meta Muse Spark 1.2.
Câu trả lời đó đáng được nêu ở đoạn đầu hơn là ở đoạn cuối, vì một độc giả tìm kiếm cái tên này thường đang cân nhắc xem có nên lên kế hoạch dựa trên nó hay không. Hãy lên kế hoạch dựa trên nghiên cứu, chứ không phải dựa trên một điểm cuối.
Một điều cần nói thẳng trước mọi thứ khác, bởi vì trang này phá vỡ một quy tắc mà lẽ ra nó phải thừa nhận. Blog này thường viết về các mô hình trong tuần chúng ra mắt. Muse Realtime Avatar được công bố một tuần trước khi trang này được đăng, nên nếu đọc nghiêm ngặt theo cửa sổ độ mới thì mục này sẽ bị bỏ qua. Đây không phải là một bài báo tin tức về một sự kiện đã cũ. Đây là trang tham chiếu cho một mô hình đang hiện diện trong cuộc trò chuyện về danh mục sản phẩm ngày nay: trang mà người đọc đến sau khi gõ chính tên của mô hình, với cơ sở biện minh là nhu cầu tìm kiếm thường trực do chính chúng tôi đo lường, chứ không phải độ mới của một lần ra mắt. Thông báo tháng Chín được nhắc đến ở đây như một sự thật giúp xác định thời điểm của mô hình, chứ không phải như một sự kiện để đưa tin, và không có gì bên dưới là một thông báo thứ hai. Bài đưa tin của chúng tôi về ngày hôm đó là một bài riêng và nó vẫn tách biệt.
Vị trí của nó trong dòng sản phẩm Muse
Meta nói rõ rằng đây là hai lớp của một hệ thống, chứ không phải hai sản phẩm. Theo cách diễn đạt của Meta, "Muse Realtime Voice và Muse Realtime Avatar tạo thành một hệ thống truyền phát duy nhất kết nối trí tuệ, giọng nói và hình hài." Lớp giọng nói cung cấp trí tuệ hội thoại và phát ra một luồng token lời nói — Meta gọi chúng là VQ — mang theo cả nội dung được nói lẫn cách thức truyền đạt. Một bộ giải mã âm thanh chuyển những token đó thành âm thanh, và lớp avatar tiêu thụ cùng luồng đó để tạo ra hình ảnh. Việc chia sẻ một luồng token duy nhất chính là điều giữ cho giọng nói, chuyển động môi và biểu cảm đồng bộ với nhau; không có bước khớp môi riêng biệt nào được gắn thêm vào sau đó.
Vậy: Muse Realtime Voice là lớp hội thoại. Muse Realtime Avatar là lớp hiện thân được xây dựng ở trên nó. Không cái nào trong hai là thứ mà bạn có thể gọi.
Hãy cẩn thận tương tự với một cái tên gần giống, vì nó là cái dễ bị nhầm với một trong hai nhất. Muse Voice Transcribe là một endpoint bản chép lời, và nó là một sản phẩm thực sự khác. Tài liệu dành cho nhà phát triển của Meta rõ ràng không mập mờ: “Nó chỉ chuyển giọng nói thành văn bản; nó không tổng hợp giọng nói hoặc cung cấp API hội thoại chuyển giọng nói thành giọng nói.” Nó trả về dấu thời gian ở cấp lượt thoại chứ không phải ở cấp từ, và Meta niêm yết nó ở mức $0.18 mỗi giờ trên trang đó. Đó là một endpoint thật, có tính phí. Nó không phải là một giọng nói, và chắc chắn không phải là một avatar.
Mô hình Muse thực sự có thể gọi được là Meta Muse Spark 1.2, mô hình suy luận mà Meta cung cấp với ngữ cảnh một triệu token và đầu vào văn bản, hình ảnh, video, tệp và âm thanh. Mô hình đó có thể định tuyến tại đây ngay hôm nay, theo giá niêm yết của nhà cung cấp, không cộng thêm phụ phí, trên cùng một khóa như mọi thứ khác trong danh mục, và thẻ trực tiếp của nó mang đầy đủ thông số kỹ thuật. Chúng tôi không cung cấp Muse Realtime Avatar. Chúng tôi đã kiểm tra lại danh sách mô hình trực tiếp trong lúc viết bài này và các mục Muse duy nhất trên đó là hai checkpoint Spark, 1.2 và phiên bản tiền nhiệm 1.1 của nó. Nói bất kỳ điều gì nhẹ nhàng hơn thế — rằng dòng mô hình này "có sẵn một phần" — sẽ ngụ ý rằng chúng tôi định tuyến một thứ mà chúng tôi không định tuyến.

Công nghệ, được diễn đạt theo ngôn từ của chính Meta
Mô tả của Meta về kiến trúc này đủ ngắn gọn để trích dẫn thay vì diễn giải. Muse Realtime Avatar là "một Diffusion Transformer lấy âm thanh làm đầu vào, được điều kiện hóa trên luồng token giọng nói, media tham chiếu và một cửa sổ trượt gồm các latent video gần đây", và nó "tạo video thành những đoạn nhân quả ngắn." Nửa sau của câu đó là phần chịu lực: khi mỗi đoạn hoàn tất, những latent mới được tạo ra của nó trở thành ngữ cảnh chuyển động cho đoạn kế tiếp. Lý do Meta đưa ra là tính liên tục — ngoại hình và điệu bộ của avatar được giữ tiếp qua các lượt trong khi tính toán vẫn bị giới hạn, và đó chính là điều cho phép việc tạo tiếp diễn lâu chừng nào cuộc trò chuyện còn tiếp diễn, thay vì bị trôi dạt hoặc cạn ngân sách.
Cơ chế truy xuất nguồn gốc thuộc về cùng một đoạn văn, bởi Meta trình bày nó như một phần của hệ thống chứ không phải như một ý nghĩ bổ sung sau đó: video được tạo ra mang một hình mờ bền vững, vô hình được áp dụng thông qua Meta Video Seal, mà theo Meta nói, không làm tăng độ trễ cho đường truyền thời gian thực.
Meta đã đo lường thứ này và công bố bốn con số cho nó. Những con số đó — cùng những lưu ý cụ thể mà mỗi con số cần, kể cả con số đọc lên như một sự tăng tốc nhưng lại không phải vậy — thuộc về bài viết công bố ra mắt, nơi trình bày chúng với ngữ cảnh còn nguyên vẹn. Ở đây chúng tôi sẽ không nhắc lại những con số trần trụi, bởi vì một con số trần trụi chính xác là thứ mà phiên bản có kèm lưu ý tồn tại để ngăn chặn.
Chúng tôi đã đưa tin về thông báo này ngay trong ngày hôm đó trong bài viết về buổi ra mắt Muse Realtime Avatar, và đây vẫn là nơi để đọc trọn vẹn những tuyên bố được cân nhắc kỹ càng.
Tên không phải là gì
Ba hàng xóm giả đáng để loại trừ từng người một, vì mỗi người trong số họ đều là một phỏng đoán hợp lý chỉ từ cái tên mà thôi.
Đây không phải là Muse Voice Transcribe. Điểm cuối đó chuyển giọng nói thành văn bản và, theo mô tả của chính Meta, không làm gì theo hướng ngược lại. Nếu thứ bạn cần là một bản chép lời, Meta có bán một cái và đó là một thứ khác biệt với một mức giá khác.
• Đây không phải là dịch vụ nhân bản giọng nói. Không có nội dung nào trên các trang của Meta mô tả việc tổng hợp giọng nói của một người cụ thể, bán một mô hình giọng nói, hoặc chấp nhận mẫu giọng nói từ người dùng. Lớp giọng nói được mô tả là tạo ra một luồng token; lớp avatar được mô tả là tiêu thụ một luồng như vậy. Dạng sản phẩm mà cụm từ đó thường ngụ ý — tải lên một mẫu, nhận được một bản sao — không phải là điều được mô tả ở đây, và tài liệu demo mà Meta thực sự công bố được trình bày như minh họa cho năng lực của mô hình.
• Đây không phải là avatar dành cho người tiêu dùng trong ứng dụng của chính Meta. Meta đi kèm các ví dụ của mình với một lưu ý dễ bị bỏ qua và đáng để ghi nhớ: các minh họa "thể hiện khả năng của mô hình và không phải tất cả đều phản ánh các avatar có sẵn trong ứng dụng Muse," và Muse dành cho người dùng từ 18 tuổi trở lên. Hãy đọc điều đó theo nghĩa đen. Một số điều mà bài đăng thể hiện là khả năng, không phải danh mục có sẵn.
Một cái tên thứ tư đáng được tách ra vì một lý do khác. Muse Realtime Avatar không phải là Muse Video, mô hình tạo video đã nằm trên một bảng xếp hạng công khai gần như suốt năm nay mà vẫn chưa phát hành. Trang của chính chúng tôi về tình huống đó — Muse Video: Ngày phát hành, Quyền truy cập API và Điều mà Meta Connect có thể thay đổi — mang một ràng buộc mà chúng tôi sẽ nhắc lại nguyên văn ở đây thay vì cải thiện nó: bất kỳ trang nào trích dẫn một ngày ra mắt cụ thể hoặc một mức giá cho Muse Video mà không có thông báo mới hơn từ Meta đều là đang suy đoán. Kỷ luật tương tự cũng áp dụng cho chủ đề của trang này, nên trang này không trích dẫn cả hai. Bài viết đó cũng cung cấp mốc ngày mà chúng tôi không được phép nhầm lẫn: Muse Video được xem trước vào ngày 7 tháng 7 năm 2026 và chưa được phát hành, đó là lý do vì sao khi tìm kiếm về dòng này lại hiện ra những ngày thuộc về một mô hình khác.

Trang này dùng để làm gì và điều gì sẽ thay đổi nó
Lý do một trang tham chiếu là đúng dạng ở đây có thể đo lường được. Trong 28 ngày tính đến ngày 25 tháng 9 năm 2026, cụm từ chính xác đã tạo ra 164 lượt hiển thị trên thuộc tính tìm kiếm của chúng ta và không có lượt nhấp nào, với vị trí tốt nhất là 9,3. Hơn năm mươi trang của chúng ta có nhắc đến đoạn đó ở đâu đó, và gần như toàn bộ lưu lượng đó đổ về một bài đăng thông báo. Một cụm từ có nhu cầu thật, bền vững, xếp hạng ngay dưới trang đầu và không chuyển đổi được ai, không phải là vấn đề nhu cầu hay vấn đề chất lượng — mà là vấn đề về trang. Không có trang nào lấy chính mô hình đó làm chủ đề. Đây chính là trang đó.
Lập trường này cũng là lý do không có gì ở đây được khoác áo tin tức. Một độc giả đến từ tìm kiếm tên muốn ba điều theo thứ tự: đây là gì, nó có sẵn không, và nó được xây dựng trên nền tảng nào. Chúng được trả lời ở phía trên, theo đúng thứ tự đó, không bịa ra ngày tháng nào và không nêu tên đối thủ cạnh tranh nào.

Điều có thể thay đổi trang này là một thông báo duy nhất. Nếu Meta công bố một endpoint, một mức giá, một danh sách chờ hay một ngày cụ thể cho Muse Realtime Avatar, phần về tính khả dụng sẽ không còn là một chữ "không" nữa mà trở thành một bản đặc tả, và trang này sẽ được viết lại chứ không phải chỉ thêm vào. Nếu Meta phát hành Muse Video, đoạn văn phía trên cũng thay đổi theo. Cho đến khi một trong hai điều đó xảy ra, nước đi hữu ích cho nhà phát triển lại là điều kém hào nhoáng: giữ nguyên giao diện bạn đang có và hướng nó tới mô hình mà bạn thực sự có thể truy cập. Mọi mô hình trong danh mục, bao gồm cả Meta Muse Spark 1.2, đều nằm sau một endpoint tương thích OpenAI và một khóa, nghĩa là việc thử phần đã tồn tại của dòng mô hình này chỉ tốn một thay đổi chuỗi mô hình chứ không phải một hợp đồng mới. Khi lớp hiện thân trở nên có thể gọi được, chi phí chuyển đổi cũng sẽ chỉ là một chuỗi.
