Một thẻ hero được tạo cho bài viết 'Muse Realtime Avatar vs Realtime-Venus', hiển thị hai thẻ bo tròn ở hai bên tiêu đề. Thẻ bên trái ghi 'Muse Realtime Avatar' phía trên một biểu tượng khung hình video gửi đi cùng các dòng 'tạo video' và '448x768 ở 25 fps, đóng'; thẻ bên phải ghi 'Realtime-Venus' phía trên một biểu tượng camera nhận vào cùng các dòng 'đọc video' và '2 x 9B, Apache-2.0, có thể tải xuống'. Một phụ đề ghi 'Một cái kết xuất một khuôn mặt. Cái kia quan sát một khuôn mặt.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Muse Realtime Avatar so với Realtime-Venus: Video Out đối đầu với Video In

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai hệ thống được công bố cách nhau chín ngày đều tự gọi mình là thời gian thực và đều gắn nhãn nghe-nhìn, và chúng chỉ theo hai hướng ngược nhau trên cùng một trục. Muse Realtime Avatar, được Meta công bố ngày 23 tháng 9 năm 2026, nhận một bức ảnh và tạo ra video về nó đang nói — video của nó là đầu ra, các khung hình chân dung 448×768 với tốc độ 25 khung mỗi giây, được tạo bởi một Diffusion Transformer điều khiển bằng âm thanh, dùng chung một luồng token với Muse Realtime Voice. Realtime-Venus, được Nhóm Venus thuộc Ant Group phối hợp với Đại học Thanh Hoa tải lên arXiv ngày 12 tháng 9 năm 2026, nhận vào video: checkpoint Realtime-Venus-Omni truyền các khung hình camera qua bộ mã hóa SigLIP2 và nói về những gì nó nhìn thấy, trong khi checkpoint Realtime-Venus-Audio là cùng một xương sống nhưng đã tắt phần thị giác khi tải. Một bên dựng lại một khuôn mặt. Bên kia quan sát một khuôn mặt. Cả hai đều không thể gọi được, và chỉ một trong số chúng có thể tải xuống — hóa ra đó mới là khác biệt hệ trọng hơn.

Sự đảo ngược về tính khả dụng đáng được nói thẳng ra trước bất cứ điều gì khác, bởi nó đi ngược lại mọi kỳ vọng về một sản phẩm của Meta và một bản phát hành của phòng nghiên cứu. Hệ thống của Meta thì đóng: được công bố tại Connect, được trình diễn trong một bài đăng nghiên cứu, được nhúng trong tác nhân Muse, không có API, không có trọng số, không có giá và không có ngày phát hành. Hệ thống của Ant Group thì mở: hai checkpoint 9B dưới dạng BF16 safetensors theo giấy phép Apache-2.0 tại inclusionAI/Realtime-Venus trên Hugging Face, kèm mã Transformers tùy chỉnh, một tệp requirements, một giọng mẫu tham chiếu, một trang dự án và một kho GitHub đồng hành. Công ty có sản phẩm dành cho người tiêu dùng lại chẳng phát hành thứ gì bạn có thể cầm nắm. Còn nhóm nghiên cứu thì phát hành toàn bộ.

Mỗi cái làm gì với một khung

Hướng của video chính là toàn bộ khác biệt mang tính kiến trúc, và đó không phải là chuyện nhấn mạnh.

Video — Muse Realtime Avatar tạo ra nó, dựa trên các token giọng nói, một ảnh tham chiếu và một cửa sổ trượt gồm các latent video gần đây; Realtime-Venus-Omni cảm nhận nó, với bộ mã hóa thị giác SigLIP2 truyền phát các khung hình vào mô hình song song với âm thanh.

Âm thanh — Muse Realtime Avatar điều khiển quá trình tạo sinh từ các token giọng nói của Muse Realtime Voice, vốn mang cả nội dung lẫn ngữ điệu; Realtime-Venus tạo ra giọng nói dưới dạng các token S3 rời rạc được giải mã bởi một bộ giải mã flow-matching dạng luồng, thay vì gắn thêm một mô hình chuyển văn bản thành giọng nói riêng biệt vào cuối.

Backbone — Kiến trúc của Meta là một Diffusion Transformer điều khiển bằng âm thanh với kích thước không được tiết lộ; Realtime-Venus được xây dựng trên backbone ngôn ngữ Qwen3-8B cùng bộ mã hóa âm thanh Whisper-Medium, và model card của nó cho biết checkpoint Omni được chuyển thể từ MiniCPM-o 4.5.

Trọng số — Muse Realtime Avatar không được công bố và không có dấu hiệu nào cho thấy chúng sẽ được công bố; Realtime-Venus phát hành hai checkpoint 9B, BF16, ngữ cảnh 40.960 token trên cả hai, theo giấy phép Apache-2.0.

Truy cập — Muse Realtime Avatar không có API và không có ngày; Realtime-Venus cũng không có API, và thẻ của nó ghi rõ rằng nó không được triển khai bởi bất kỳ nhà cung cấp suy luận nào.

Chạy ở đâu — Muse Realtime Avatar chạy bên trong ứng dụng Muse dành cho những người dùng mà Meta chưa liệt kê, theo các điều khoản 18+; Realtime-Venus chạy trên chính GPU của bạn, ngay hôm nay, nếu bạn có phần cứng và sự hứng thú.

Đọc hai dòng cuối cùng cùng nhau và sự khác biệt thực tế sẽ hiện ra. Cả hai hệ thống đều không thể được gọi. Một trong số chúng có thể được chạy.

Bản tải xuống 9B là có thật, và cái giá mà bạn phải trả cũng là thật.

Realtime-Venus không phải là một repository stub. Các trọng số có ở đó, mã tải tùy chỉnh có ở đó, và giấy phép ở cấp cao nhất là Apache-2.0. Có hai điều về nó đáng để biết trước khi bạn lập kế hoạch dựa vào nó.

Điều đầu tiên là thứ không nằm trong các trọng số. Runtime vòng lặp kép làm nên nét đặc trưng của kiến trúc — vòng lặp tương tác một giây cùng một bộ lập lịch nền mà bài báo gọi là Realtime-Venus-Harness, thứ thực thi các tác vụ được ủy thác dựa trên một ảnh chụp nhanh biệt lập của trạng thái hội thoại để một công việc chạy dài không thể bị hỏng bởi việc cuộc hội thoại tiếp diễn — nằm trong kho GitHub như một thành phần riêng. Thiết kế ủy thác, vốn là ý tưởng thực sự mới trong báo cáo, là phần bạn tự lắp ráp và tự mình tin tưởng.

Điều thứ hai là phả hệ. Thẻ cho biết checkpoint Omni được chuyển thể từ MiniCPM-o 4.5, mô hình omni-modal 9B mà OpenBMB đã mã nguồn mở hồi đầu năm 2026. Đó không phải là một chú thích nhỏ. Điều đó có nghĩa là đóng góp của Ant Group nằm ở phần hậu huấn luyện, runtime và thiết kế ủy quyền được xếp lớp lên trên xương sống streaming của người khác, một tuyên bố hẹp hơn và cụ thể hơn so với "một mô hình omni 9B mới" — và cũng hữu ích hơn, vì nó cho bạn biết cần tìm ở đâu nếu có gì đó trong bộ mã hóa thị giác hoạt động sai.

Những con số, và chính xác chúng thuộc về ai

Đây là chỗ hai hệ thống hội tụ theo một cách không hữu ích: không hệ thống nào có lấy một đánh giá độc lập. Bốn con số của Meta là do công ty tự báo cáo, dựa trên các baseline do Meta lựa chọn. Các con số của Realtime-Venus là do tác giả tự báo cáo trong một báo cáo kỹ thuật, không có bên thứ ba nào công bố một lần chạy và không có mục nào trên bảng xếp hạng để đối chiếu. Không có đo lường công khai nào về bất kỳ hệ thống nào trong hai hệ thống, bởi bất kỳ ai không phải là người xây dựng nó.

Bốn con số của Meta, như đã công bố: 870 ms từ khi kết thúc lượt của bạn đến byte đầu tiên của một phản hồi thoại và video được đồng bộ; video dọc 448×768 ở 25 khung hình mỗi giây; ít hơn 60 lần số lần đánh giá mô hình so với đường cơ sở của chính nó; và 12 phiên thời gian thực đồng thời trên một NVIDIA GB200, mức tăng dung lượng gấp 8 lần so với đường cơ sở BF16 hai bước của Meta. Meta cũng công bố kết quả về mức độ ưa thích so với hai hệ thống avatar thương mại, một trong số đó được hãng báo cáo là không thể phân biệt được về mặt thống kê so với mức ngang bằng ở khía cạnh điệu bộ — một tiết lộ đáng ghi nhận, vì đây là kiểu kết quả mà hầu hết các bài đăng ra mắt đều bỏ qua.

Của Ant Group, như đã công bố: điểm tốt nhất trên sáu trong tám benchmark video mà báo cáo sử dụng, bao gồm StreamingBench 70.2, OVO-Bench 64.7 và Daily-Omni 81.3 cho checkpoint Omni; và với checkpoint Audio, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 và điểm VoiceBench AlpacaEval 4.81 mà báo cáo mô tả là ngang bằng với chỉ số so sánh tốt nhất.

Một sự bất đối xứng trong bằng chứng đáng được gọi tên. Các số liệu của Ant Group là điểm benchmark với những bộ kiểm thử có tên — về nguyên tắc có thể tái lập, bởi bất kỳ ai sẵn sàng tải trọng số về và chạy bộ kiểm thử. Con số nổi bật của Meta là một phép đo độ trễ trên ngăn xếp phục vụ của chính Meta, thứ mà không ai ngoài Meta có thể tái lập vì không ai ngoài Meta có hệ thống đó. Nói cách khác, bản phát hành mở cũng là bản dễ kiểm chứng hơn.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Tại sao cả hai điều này lại là một vấn đề định tuyến trá hình

Không hệ thống nào là một agent hoàn chỉnh, và điều đó đúng theo cùng một cách với cả hai. Muse Realtime Avatar là một lớp render được gắn vào Muse Realtime Voice, vốn là lớp hội thoại của một agent có phần suy luận chạy trên Muse Spark. Realtime-Venus chuyển giao bất cứ thứ gì vượt quá khả năng xử lý nội tuyến của nó — truy xuất, gọi công cụ, suy luận khó — ra một harness thực thi công việc ở chế độ nền dựa trên một bản chụp cuộc hội thoại. Trong cả hai thiết kế, thứ mà người dùng nói chuyện cùng là một front end, còn việc suy nghĩ diễn ra trong một mô hình văn bản riêng biệt.

Mô hình văn bản riêng biệt đó chính là phần bạn có thể định tuyến. Trên OrcaRouter, nó là một endpoint duy nhất cho 196 mô hình từ 15 nhà cung cấp, với mức giá niêm yết của nhà cung cấp được chuyển nguyên, không thêm markup, cùng khả năng tự động chuyển đổi dự phòng khi một mô hình gặp lỗi hoặc hết thời gian chờ — điều này còn quan trọng hơn mức thông thường khi thứ ở phía bên kia là một checkpoint tự lưu trữ mà chưa ai đánh giá độc lập. Chúng tôi không lưu trữ Realtime-Venus: nó là một bản tải về, và chúng tôi không phục vụ nó. Chúng tôi cũng không lưu trữ Muse Realtime Avatar, vì chẳng ai làm thế. Thứ chúng tôi cung cấp là lớp mà cả hai kiến trúc giao phó phần việc khó nhằn của mình, để một thành phần chưa được kiểm chứng ở bất kỳ phía nào của cuộc trò chuyện chỉ còn là một dòng cấu hình thay vì một canh bạc trong môi trường sản xuất.

Cái nào trong số này thực sự tiến xa hơn?

Bản năng mách bảo ta nói là của Meta, vì Meta có sản phẩm và video demo. Bằng chứng lại cho thấy một điều thú vị hơn. Hệ thống của Meta có kỹ thuật vận hành sản xuất tốt hơn — 12 phiên đồng thời trên một GB200 là một kết quả phục vụ, và các bài kiểm tra sở thích được công bố so với những sản phẩm avatar đang được bán là những con số đối đầu trực tiếp duy nhất mà cả hai hệ thống có. Hệ thống của Ant Group có khả năng kiểm chứng tốt hơn: các benchmark được nêu tên, trọng số được công bố, giấy phép Apache-2.0, và một báo cáo mà bất kỳ ai cũng có thể thử tái lập.

Điều mà cả hai đều không có là cách để chi trả cho nó. Và thứ gần với việc có thể sử dụng được hơn không phải là thứ có ứng dụng dành cho người tiêu dùng — mà là thứ bạn có thể tải về ngay tối nay và tự mình tìm hiểu, trên phần cứng của chính bạn, với dữ liệu của chính bạn, và không cần thông báo nào.

Nếu bạn đang cân nhắc lựa chọn, vấn đề không phải là mẫu nào tốt hơn. Mà là bạn muốn một khuôn mặt bạn không thể gọi, hay một chiếc máy ảnh bạn có thể vận hành.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.