
Muse Realtime Avatar vs SeedRealtime: Hai mô hình mà bạn chỉ có thể xem
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 180 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Cả hai đều không có bảng giá. Muse Realtime Avatar, được Meta công bố vào ngày 23 tháng 9 năm 2026 tại Meta Connect, không có API, không có endpoint, không có giá và không có ngày ra mắt — nó là một năng lực của agent Muse thuộc Meta, được trình diễn trong một bài viết nghiên cứu có tiêu đề "Bringing Your Muse to Life." SeedRealtime, được ByteDance Seed phát hành vào ngày 5 tháng 8 năm 2026, không có API, không có trọng số, không có báo cáo kỹ thuật và không có số lượng tham số — nó tồn tại bên trong ứng dụng Doubao của chính ByteDance, và bài đăng của ByteDance chỉ nói rằng nó đã được "triển khai toàn bộ." Hai trong số những công ty AI tiêu dùng lớn nhất thế giới đã tung ra các hệ thống thời gian thực âm thanh–hình ảnh chỉ cách nhau bảy tuần và cả hai đều không thể mua được. Đó là sự so sánh, và nó thú vị hơn cả một bảng đánh giá mà không ai có thể dựng nên.
Điều phân biệt chúng là hướng luồng video. SeedRealtime quan sát, lắng nghe và nói về những gì nó thấy — âm thanh, video và văn bản vào một mạng đầu-cuối, với việc luân phiên lượt nói được chuyển từ một bộ phát hiện hoạt động giọng nói bên ngoài vào chính mô hình. Muse Realtime Avatar tạo ra: bạn đưa cho nó một hình ảnh tham chiếu, một bức ảnh hay một hình minh họa hoặc một đối tượng, và nó kết xuất thứ đó đang nói và ra hiệu trong video liên tục trong suốt thời lượng cuộc trò chuyện. Video của SeedRealtime là đầu vào. Video của Muse Realtime Avatar là đầu ra. Cả hai đều được mô tả là song công, cả hai đều là nghe nhìn, và chúng đang thực hiện những nhiệm vụ trái ngược nhau dưới cùng một nhãn.
Mỗi thứ là gì và chúng nằm ở đâu
Sáu dòng, và hai dòng cuối mới là những dòng quyết định mọi thứ.
• Video — Muse Realtime Avatar tạo ra nó, ở độ phân giải dọc 448×768 và 25 khung hình mỗi giây, được gắn watermark bằng một lớp phủ trong suốt để người xem có thể nhận biết đây không phải là nguồn cấp từ camera; SeedRealtime cảm nhận nó, truyền các khung hình vào cùng mạng lưới xử lý âm thanh.
• Canh bạc kiến trúc — Muse Realtime Avatar chia sẻ một luồng token duy nhất giữa thoại và video, nên một Diffusion Transformer điều khiển bằng âm thanh tiêu thụ trực tiếp các token giọng nói của Muse Realtime Voice và không có gì được khớp khẩu hình sau đó; SeedRealtime gộp việc luân phiên lượt nói vào chính mô hình, nên ai nói và nói khi nào không còn là quyết định của một bộ phát hiện hoạt động giọng nói bên ngoài.
• Nơi nó hoạt động — Muse Realtime Avatar là một tính năng bên trong tác nhân Muse của Meta; SeedRealtime nằm trong ứng dụng Doubao của ByteDance.
• Quyền truy cập dành cho nhà phát triển — cả hai đều không có API. Cả hai đều không công bố trọng số. Không có tùy chọn serverless, không có endpoint lưu trữ sẵn, và cũng không có nền tảng bên thứ ba nào cung cấp một trong hai.
• Giá — chưa được công bố cho cả hai bên, vì không bên nào có đề nghị thương mại.
• Đánh giá độc lập — không có cho cả hai hệ thống. Mọi con số mà mỗi công ty công bố về mô hình của chính mình đều là dữ liệu nội bộ, và chưa có đơn vị đánh giá bên ngoài nào chạy thử cả hai.
Hai cơ sở bằng chứng, cả hai đều thuộc nguồn thứ nhất, và một trong hai mỏng hơn nhiều.
Ở đây, phép so sánh không còn đối xứng nữa. Meta đã công bố bốn con số cho Muse Realtime Avatar, tất cả đều do công ty tự báo cáo, được đo so với các đường cơ sở do Meta chọn, và không có con số nào được tái lập bên ngoài công ty: 870 ms từ lúc bạn kết thúc lượt nói đến byte đầu tiên của một phản hồi đồng bộ thoại-và-video; video dọc 448×768 ở 25 khung hình mỗi giây; số lượt đánh giá mô hình ít hơn 60 lần so với đường cơ sở của chính nó; và 12 phiên thời gian thực đồng thời trên một NVIDIA GB200, mức tăng năng lực gấp 8 lần so với đường cơ sở BF16 hai bước của Meta nhờ huấn luyện nhận biết lượng tử hóa bốn bit và gom lô động nhận biết độ trễ. Meta cũng công bố một so sánh mức độ ưa thích với hai hệ thống avatar thương mại — 78/22 với một hệ thống, 88/12 với hệ thống kia — và tiết lộ rằng ở khía cạnh điệu bộ, kết quả với một trong hai hệ thống đó không thể phân biệt về mặt thống kê so với ngang bằng. Sự tiết lộ đó có giá trị hơn cả những chiến thắng; đó là kiểu kết quả mà phần lớn các bài đăng ra mắt đều bỏ qua.
Bằng chứng đã công bố của SeedRealtime là một đánh giá con người từ đầu đến cuối. ByteDance nói rằng so với các hệ thống xếp tầng — một mô hình thị giác được nối với một mô hình ASR, rồi nối với một LLM, rồi nối với một giọng chuyển văn bản thành giọng nói — SeedRealtime giảm một nửa các vấn đề về nhịp độ hội thoại nghe-nhìn, với ít lần bị cắt hơn, ít kích hoạt nhầm hơn và các phản hồi chậm hơn, tự nhiên hơn. Điều ByteDance chưa công bố là kích thước mẫu, phương pháp luận, số lượng người chú thích, một con số độ trễ tính bằng mili giây, tên một chuẩn đánh giá, hay một điểm số. Một báo cáo thứ cấp trích dẫn mức tăng 12% về độ trôi chảy hội thoại so với các mô hình trước đó của nhóm. Đó là toàn bộ cơ sở bằng chứng công khai.
Vậy thứ hạng trung thực về khả năng kiểm chứng diễn ra như sau: cả hai đều không có một lần chạy độc lập; của Meta là một tập hợp các phép đo với các baseline được nêu rõ và một kết quả âm được công bố; của ByteDance là một tuyên bố ưu tiên duy nhất mà thiết kế không được mô tả. Cả hai đều không thể tái lập, nhưng chỉ một trong hai đủ cụ thể để tranh luận.

Nước đi mà mỗi người đã thực hiện
Cả hai hệ thống đều là những câu trả lời cho cùng một vấn đề, và thật đáng để nhận thấy rằng hai câu trả lời ấy khác nhau.
Đối với một hệ thống quan sát, phần khó là biết khi nào nên lên tiếng. Một mô hình liên tục nhận các khung hình camera và âm thanh phải quyết định, mà không cần một tín hiệu kích hoạt bên ngoài, liệu người ở trước mặt nó đã nói xong chưa, liệu có ai đang nói với nó hay không, và liệu vật thể vừa đi vào khung hình có liên quan hay không. Đó là bài toán mà SeedRealtime đã đưa vào bên trong mô hình, và ByteDance đã thực hiện bước chuyển này trên ba phương thức thay vì hai — một phiên bản khó hơn so với những gì Google, OpenAI và NVIDIA từng làm chỉ riêng cho âm thanh. Các hành vi trong bản demo bắt nguồn từ đó: gắn một giọng nói với một khuôn mặt trong cuộc trò chuyện nhóm, tự lên tiếng mà không được nhắc khi có thứ gì đó đi vào khung hình, hướng dẫn ai đó tham quan bảo tàng hoặc sửa chữa.
Đối với một hệ thống kết xuất, phần khó là giữ được tính mạch lạc. Việc tạo video thành những đoạn nhân quả ngắn nghĩa là mỗi đoạn được điều kiện hóa dựa trên đoạn trước, và kiểu thất bại là sự trôi dạt — đến phút thứ ba, nhân vật đã lặng lẽ trở thành một người khác. Cửa sổ trượt của Meta gồm các latent video gần đây là câu trả lời cho vấn đề đó, còn luồng token chia sẻ là câu trả lời cho một kiểu thất bại khác: vẻ ngoài bị lồng tiếng mà bạn nhận được khi âm thanh được tạo trước rồi sau đó một mô hình khớp khẩu hình được chạy chồng lên.
Cả hai nước đi đều không khả dụng trong hệ thống còn lại. SeedRealtime không có hình ảnh tham chiếu nào để giữ trung thành, vì nó không dựng hình bất kỳ ai. Muse Realtime Avatar không có thế giới bên ngoài nào để theo dõi, vì toàn bộ công việc của nó là tạo ra một khuôn mặt khớp với giọng nói.

Vì sao một mô hình không thể gọi được vẫn là một câu hỏi định tuyến
Cả hai hệ thống này đều ủy thác. Muse Realtime Avatar nằm trên Muse Realtime Voice, lớp hội thoại của một tác nhân có suy luận chạy trên Muse Spark — mô hình thực hiện việc kết xuất, không phải việc tư duy. Thiết kế của SeedRealtime duy trì cuộc hội thoại trong khi công việc nền diễn ra, nghĩa là công việc vượt quá khả năng xử lý trực tiếp sẽ được chuyển đến nơi khác và quay trở lại. Trong cả hai kiến trúc, thứ mà người dùng tương tác là một giao diện, và trí tuệ là một mô hình văn bản riêng biệt phía sau nó.
Mô hình văn bản riêng biệt đó là suy luận thông thường, và đó chính là phần của hệ thống mà bạn thực sự có thể mua. Trên OrcaRouter, nó là một endpoint bao trùm 196 mô hình từ 15 nhà cung cấp, với mức giá niêm yết của nhà cung cấp được chuyển nguyên vẹn không thêm phụ phí, cùng khả năng tự động chuyển đổi dự phòng khi mô hình bạn chọn gặp lỗi hoặc hết thời gian chờ. Chúng tôi không lưu trữ SeedRealtime — nó thuộc về ByteDance, nằm bên trong Doubao, và chẳng có gì để định tuyến cả. Chúng tôi cũng không lưu trữ Muse Realtime Avatar, và cũng không ai khác làm điều đó. Thứ chúng tôi cung cấp là tầng mà cả hai hệ thống giao phó phần việc nặng nhọc của chúng, tức là tầng thay đổi khi bạn muốn một mô hình khác đảm nhận phần suy nghĩ.
Điều gì sẽ làm thay đổi câu trả lời
Đối với SeedRealtime, mảnh ghép còn thiếu không phải là một tính năng — mà là bằng chứng. Một báo cáo kỹ thuật với số lượng tham số, một bộ benchmark và một đánh giá con người được mô tả sẽ đưa nó từ "một bản demo bên trong một ứng dụng" thành thứ mà một nhóm có thể suy luận. Bài đăng của ByteDance cũng liên kết đến các đích chung chung "Try Dola" và "Try in Playground" mà không công bố trọng số hay API được ghi tài liệu, đây là mô thức của một tính năng sản phẩm hơn là một bản phát hành mô hình.
Đối với Muse Realtime Avatar, mảnh ghép còn thiếu mang tính thương mại: một bảng giá, một điểm cuối, một ngày, cùng các điều khoản về khu vực và độ tuổi mà Meta chưa nêu rõ hoàn toàn. Bài đăng của Meta lưu ý rằng các bản demo của họ không phải đều phản ánh những avatar hiện có trong ứng dụng Muse, và đây chính là câu nên chi phối mọi kế hoạch được xây dựng quanh vấn đề này.
Cho đến khi một trong những điều đó thay đổi, sự so sánh này có một dạng thức ngắn một cách bất thường. Cả hai mô hình đều là nghe nhìn, cả hai đều song công toàn phần, cả hai đều là những thành tựu kỹ thuật thực sự ấn tượng, và không mô hình nào trong hai có thể được gọi từ terminal bởi bất kỳ ai đang đọc những dòng này. Sự khác biệt nằm ở việc bạn sẽ làm gì với chúng nếu có thể: một bên cho bạn một nhân vật biết nói, còn một bên cho bạn một hệ thống biết để ý.

