
Muse Realtime Avatar so với Realtime-Venus: Video Out đối đầu với Video In
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 180 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Hai hệ thống được công bố cách nhau chín ngày đều tự gọi mình là thời gian thực và đều gắn nhãn nghe-nhìn, và chúng chỉ theo hai hướng ngược nhau trên cùng một trục. Muse Realtime Avatar, được Meta công bố ngày 23 tháng 9 năm 2026, nhận một bức ảnh và tạo ra video về nó đang nói — video của nó là đầu ra, các khung hình chân dung 448×768 với tốc độ 25 khung mỗi giây, được tạo bởi một Diffusion Transformer điều khiển bằng âm thanh, dùng chung một luồng token với Muse Realtime Voice. Realtime-Venus, được Nhóm Venus thuộc Ant Group phối hợp với Đại học Thanh Hoa tải lên arXiv ngày 12 tháng 9 năm 2026, nhận vào video: checkpoint Realtime-Venus-Omni truyền các khung hình camera qua bộ mã hóa SigLIP2 và nói về những gì nó nhìn thấy, trong khi checkpoint Realtime-Venus-Audio là cùng một xương sống nhưng đã tắt phần thị giác khi tải. Một bên dựng lại một khuôn mặt. Bên kia quan sát một khuôn mặt. Cả hai đều không thể gọi được, và chỉ một trong số chúng có thể tải xuống — hóa ra đó mới là khác biệt hệ trọng hơn.
Sự đảo ngược về tính khả dụng đáng được nói thẳng ra trước bất cứ điều gì khác, bởi nó đi ngược lại mọi kỳ vọng về một sản phẩm của Meta và một bản phát hành của phòng nghiên cứu. Hệ thống của Meta thì đóng: được công bố tại Connect, được trình diễn trong một bài đăng nghiên cứu, được nhúng trong tác nhân Muse, không có API, không có trọng số, không có giá và không có ngày phát hành. Hệ thống của Ant Group thì mở: hai checkpoint 9B dưới dạng BF16 safetensors theo giấy phép Apache-2.0 tại inclusionAI/Realtime-Venus trên Hugging Face, kèm mã Transformers tùy chỉnh, một tệp requirements, một giọng mẫu tham chiếu, một trang dự án và một kho GitHub đồng hành. Công ty có sản phẩm dành cho người tiêu dùng lại chẳng phát hành thứ gì bạn có thể cầm nắm. Còn nhóm nghiên cứu thì phát hành toàn bộ.
Mỗi cái làm gì với một khung
Hướng của video chính là toàn bộ khác biệt mang tính kiến trúc, và đó không phải là chuyện nhấn mạnh.
• Video — Muse Realtime Avatar tạo ra nó, dựa trên các token giọng nói, một ảnh tham chiếu và một cửa sổ trượt gồm các latent video gần đây; Realtime-Venus-Omni cảm nhận nó, với bộ mã hóa thị giác SigLIP2 truyền phát các khung hình vào mô hình song song với âm thanh.
• Âm thanh — Muse Realtime Avatar điều khiển quá trình tạo sinh từ các token giọng nói của Muse Realtime Voice, vốn mang cả nội dung lẫn ngữ điệu; Realtime-Venus tạo ra giọng nói dưới dạng các token S3 rời rạc được giải mã bởi một bộ giải mã flow-matching dạng luồng, thay vì gắn thêm một mô hình chuyển văn bản thành giọng nói riêng biệt vào cuối.
• Backbone — Kiến trúc của Meta là một Diffusion Transformer điều khiển bằng âm thanh với kích thước không được tiết lộ; Realtime-Venus được xây dựng trên backbone ngôn ngữ Qwen3-8B cùng bộ mã hóa âm thanh Whisper-Medium, và model card của nó cho biết checkpoint Omni được chuyển thể từ MiniCPM-o 4.5.
• Trọng số — Muse Realtime Avatar không được công bố và không có dấu hiệu nào cho thấy chúng sẽ được công bố; Realtime-Venus phát hành hai checkpoint 9B, BF16, ngữ cảnh 40.960 token trên cả hai, theo giấy phép Apache-2.0.
• Truy cập — Muse Realtime Avatar không có API và không có ngày; Realtime-Venus cũng không có API, và thẻ của nó ghi rõ rằng nó không được triển khai bởi bất kỳ nhà cung cấp suy luận nào.
• Chạy ở đâu — Muse Realtime Avatar chạy bên trong ứng dụng Muse dành cho những người dùng mà Meta chưa liệt kê, theo các điều khoản 18+; Realtime-Venus chạy trên chính GPU của bạn, ngay hôm nay, nếu bạn có phần cứng và sự hứng thú.
Đọc hai dòng cuối cùng cùng nhau và sự khác biệt thực tế sẽ hiện ra. Cả hai hệ thống đều không thể được gọi. Một trong số chúng có thể được chạy.
Bản tải xuống 9B là có thật, và cái giá mà bạn phải trả cũng là thật.
Realtime-Venus không phải là một repository stub. Các trọng số có ở đó, mã tải tùy chỉnh có ở đó, và giấy phép ở cấp cao nhất là Apache-2.0. Có hai điều về nó đáng để biết trước khi bạn lập kế hoạch dựa vào nó.
Điều đầu tiên là thứ không nằm trong các trọng số. Runtime vòng lặp kép làm nên nét đặc trưng của kiến trúc — vòng lặp tương tác một giây cùng một bộ lập lịch nền mà bài báo gọi là Realtime-Venus-Harness, thứ thực thi các tác vụ được ủy thác dựa trên một ảnh chụp nhanh biệt lập của trạng thái hội thoại để một công việc chạy dài không thể bị hỏng bởi việc cuộc hội thoại tiếp diễn — nằm trong kho GitHub như một thành phần riêng. Thiết kế ủy thác, vốn là ý tưởng thực sự mới trong báo cáo, là phần bạn tự lắp ráp và tự mình tin tưởng.
Điều thứ hai là phả hệ. Thẻ cho biết checkpoint Omni được chuyển thể từ MiniCPM-o 4.5, mô hình omni-modal 9B mà OpenBMB đã mã nguồn mở hồi đầu năm 2026. Đó không phải là một chú thích nhỏ. Điều đó có nghĩa là đóng góp của Ant Group nằm ở phần hậu huấn luyện, runtime và thiết kế ủy quyền được xếp lớp lên trên xương sống streaming của người khác, một tuyên bố hẹp hơn và cụ thể hơn so với "một mô hình omni 9B mới" — và cũng hữu ích hơn, vì nó cho bạn biết cần tìm ở đâu nếu có gì đó trong bộ mã hóa thị giác hoạt động sai.
Những con số, và chính xác chúng thuộc về ai
Đây là chỗ hai hệ thống hội tụ theo một cách không hữu ích: không hệ thống nào có lấy một đánh giá độc lập. Bốn con số của Meta là do công ty tự báo cáo, dựa trên các baseline do Meta lựa chọn. Các con số của Realtime-Venus là do tác giả tự báo cáo trong một báo cáo kỹ thuật, không có bên thứ ba nào công bố một lần chạy và không có mục nào trên bảng xếp hạng để đối chiếu. Không có đo lường công khai nào về bất kỳ hệ thống nào trong hai hệ thống, bởi bất kỳ ai không phải là người xây dựng nó.
Bốn con số của Meta, như đã công bố: 870 ms từ khi kết thúc lượt của bạn đến byte đầu tiên của một phản hồi thoại và video được đồng bộ; video dọc 448×768 ở 25 khung hình mỗi giây; ít hơn 60 lần số lần đánh giá mô hình so với đường cơ sở của chính nó; và 12 phiên thời gian thực đồng thời trên một NVIDIA GB200, mức tăng dung lượng gấp 8 lần so với đường cơ sở BF16 hai bước của Meta. Meta cũng công bố kết quả về mức độ ưa thích so với hai hệ thống avatar thương mại, một trong số đó được hãng báo cáo là không thể phân biệt được về mặt thống kê so với mức ngang bằng ở khía cạnh điệu bộ — một tiết lộ đáng ghi nhận, vì đây là kiểu kết quả mà hầu hết các bài đăng ra mắt đều bỏ qua.
Của Ant Group, như đã công bố: điểm tốt nhất trên sáu trong tám benchmark video mà báo cáo sử dụng, bao gồm StreamingBench 70.2, OVO-Bench 64.7 và Daily-Omni 81.3 cho checkpoint Omni; và với checkpoint Audio, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 và điểm VoiceBench AlpacaEval 4.81 mà báo cáo mô tả là ngang bằng với chỉ số so sánh tốt nhất.
Một sự bất đối xứng trong bằng chứng đáng được gọi tên. Các số liệu của Ant Group là điểm benchmark với những bộ kiểm thử có tên — về nguyên tắc có thể tái lập, bởi bất kỳ ai sẵn sàng tải trọng số về và chạy bộ kiểm thử. Con số nổi bật của Meta là một phép đo độ trễ trên ngăn xếp phục vụ của chính Meta, thứ mà không ai ngoài Meta có thể tái lập vì không ai ngoài Meta có hệ thống đó. Nói cách khác, bản phát hành mở cũng là bản dễ kiểm chứng hơn.


Tại sao cả hai điều này lại là một vấn đề định tuyến trá hình
Không hệ thống nào là một agent hoàn chỉnh, và điều đó đúng theo cùng một cách với cả hai. Muse Realtime Avatar là một lớp render được gắn vào Muse Realtime Voice, vốn là lớp hội thoại của một agent có phần suy luận chạy trên Muse Spark. Realtime-Venus chuyển giao bất cứ thứ gì vượt quá khả năng xử lý nội tuyến của nó — truy xuất, gọi công cụ, suy luận khó — ra một harness thực thi công việc ở chế độ nền dựa trên một bản chụp cuộc hội thoại. Trong cả hai thiết kế, thứ mà người dùng nói chuyện cùng là một front end, còn việc suy nghĩ diễn ra trong một mô hình văn bản riêng biệt.
Mô hình văn bản riêng biệt đó chính là phần bạn có thể định tuyến. Trên OrcaRouter, nó là một endpoint duy nhất cho 196 mô hình từ 15 nhà cung cấp, với mức giá niêm yết của nhà cung cấp được chuyển nguyên, không thêm markup, cùng khả năng tự động chuyển đổi dự phòng khi một mô hình gặp lỗi hoặc hết thời gian chờ — điều này còn quan trọng hơn mức thông thường khi thứ ở phía bên kia là một checkpoint tự lưu trữ mà chưa ai đánh giá độc lập. Chúng tôi không lưu trữ Realtime-Venus: nó là một bản tải về, và chúng tôi không phục vụ nó. Chúng tôi cũng không lưu trữ Muse Realtime Avatar, vì chẳng ai làm thế. Thứ chúng tôi cung cấp là lớp mà cả hai kiến trúc giao phó phần việc khó nhằn của mình, để một thành phần chưa được kiểm chứng ở bất kỳ phía nào của cuộc trò chuyện chỉ còn là một dòng cấu hình thay vì một canh bạc trong môi trường sản xuất.
Cái nào trong số này thực sự tiến xa hơn?
Bản năng mách bảo ta nói là của Meta, vì Meta có sản phẩm và video demo. Bằng chứng lại cho thấy một điều thú vị hơn. Hệ thống của Meta có kỹ thuật vận hành sản xuất tốt hơn — 12 phiên đồng thời trên một GB200 là một kết quả phục vụ, và các bài kiểm tra sở thích được công bố so với những sản phẩm avatar đang được bán là những con số đối đầu trực tiếp duy nhất mà cả hai hệ thống có. Hệ thống của Ant Group có khả năng kiểm chứng tốt hơn: các benchmark được nêu tên, trọng số được công bố, giấy phép Apache-2.0, và một báo cáo mà bất kỳ ai cũng có thể thử tái lập.
Điều mà cả hai đều không có là cách để chi trả cho nó. Và thứ gần với việc có thể sử dụng được hơn không phải là thứ có ứng dụng dành cho người tiêu dùng — mà là thứ bạn có thể tải về ngay tối nay và tự mình tìm hiểu, trên phần cứng của chính bạn, với dữ liệu của chính bạn, và không cần thông báo nào.
Nếu bạn đang cân nhắc lựa chọn, vấn đề không phải là mẫu nào tốt hơn. Mà là bạn muốn một khuôn mặt bạn không thể gọi, hay một chiếc máy ảnh bạn có thể vận hành.

