
Realtime-Venus vs SeedRealtime: Hai cách trái ngược để trở nên không khả dụng
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus và SeedRealtime là hai nửa của cùng một câu chuyện năm 2026, và chúng trượt ở hai bài kiểm tra trái ngược nhau. SeedRealtime là mô hình song công toàn phần nghe-nhìn gốc của ByteDance, được bật miễn phí trong ứng dụng Doubao vào ngày 5 tháng 8 năm 2026, tiếp cận một lượng người dùng mà nhà phát triển của nó mô tả là hàng trăm triệu — không có API, không có mã định danh mô hình, không có giá và không có mục tiêu độ trễ. Realtime-Venus là một cặp checkpoint 9B từ Nhóm Venus của Ant Group và Đại học Thanh Hoa, được công bố vào ngày 12 tháng 9 năm 2026 theo giấy phép Apache-2.0 kèm một báo cáo kỹ thuật và không có thông báo nào, nằm trong một kho mà bất kỳ kỹ sư nào cũng có thể tải về và gần như không ai có thể triển khai một cách thực tế. Một trong hai thì bạn không thể gọi được. Cái còn lại thì bạn có thể tải về rồi phát hiện ra mình chẳng có gì để gọi nó trên đó. Cả hai đều thực sự đang ở biên giới của cùng một năng lực, và không cái nào có một benchmark mà bất kỳ ai ngoài chính các tác giả của nó từng tái lập được.
Hai kiểu "bạn không thể có nó"
Thật đáng để nói cho chính xác, bởi vì cụm từ "không khả dụng" đang che giấu một sự khác biệt thực sự.
SeedRealtime không khả dụng theo cách một sản phẩm tiêu dùng không khả dụng: nó tồn tại, nó hoạt động, nó có người dùng, và cánh cửa chỉ đơn giản là đóng lại với các nhà phát triển. Không có API, không có bảng giá, không có cổng tài liệu, và không có mốc thời gian nào được nêu cho một cổng như vậy. Con đường ra thị trường của ByteDance là ứng dụng, và chỉ riêng ứng dụng đã là đủ. Điều bạn nhận được với tư cách một nhà phát triển là một bản demo mà bạn có thể trải nghiệm nhưng không thể tích hợp.
Realtime-Venus không khả dụng theo cách một sản phẩm nghiên cứu không khả dụng: trọng số được công khai, giấy phép thông thoáng, mã nguồn có sẵn, và không ai đang chạy nó. Kho lưu trữ không được bất kỳ nhà cung cấp suy luận nào triển khai, và lượt tải xuống hoàn toàn không được theo dõi, nên không có tín hiệu công khai nào về việc được chấp nhận theo bất kỳ hướng nào. Nó khả dụng theo nghĩa quan trọng đối với một nhà nghiên cứu và không khả dụng theo nghĩa quan trọng đối với một quản lý sản phẩm.
Kết hợp lại, chúng định hình câu hỏi mà toàn bộ nhóm này hiện đang mắc kẹt: những mô hình hoạt động được thì nằm sau các ứng dụng tiêu dùng, còn những mô hình bạn có thể chạy thì không xuất hiện trong môi trường vận hành ở bất cứ đâu.
Cả hai đều nằm ở phân khúc thực sự tạo nên sự khác biệt của năm 2026
Một cách hữu ích để tìm hiểu lĩnh vực thời gian thực là ở ba cấp độ. Cấp độ thứ nhất là thoại bán song công với thị giác được gắn thêm — các trợ lý theo lượt có thể nhìn nhưng vẫn phải luân phiên lượt. Cấp độ thứ hai là âm thanh song công toàn phần, vừa nghe vừa nói cùng lúc mà không cần camera: Seeduplex của chính ByteDance, GPT-Live của OpenAI, Grok Voice Think Fast 2.0 của xAI. Cấp độ thứ ba là song công toàn phần nghe-nhìn, nơi nhận thức và biểu đạt trải khắp video và âm thanh một cách liên tục.
SeedRealtime là mô hình đầu tiên ở tầng thứ ba đạt được triển khai thương mại quy mô lớn. Realtime-Venus là một mô hình trọng số mở tham gia ở cùng tầng — video qua bộ mã hóa SigLIP2, âm thanh qua Whisper-Medium, xương sống Qwen3-8B, và một vòng lặp tương tác một giây không bao giờ ngừng nhận thức. Thẻ mô hình của nó nêu rằng nó được chuyển thể từ MiniCPM-o 4.5, mô hình đa phương thức toàn diện của OpenBMB ra mắt hồi đầu năm 2026, điều này đặt đóng góp của Ant Group vào phần hậu huấn luyện và môi trường chạy thay vì kiến trúc cơ sở.
Điểm chung của chúng, và cũng là điều đưa chúng lên một tầm cao hơn so với các hệ thống chỉ có âm thanh, là cả hai đều không dừng lại để nhìn. Nhận thức thị giác liên tục trong khi nói là một năng lực thực sự khác biệt so với việc mô tả một khung hình đơn lẻ, và cả hai mô hình đều được xây dựng xoay quanh năng lực đó.
Những con số của mỗi cái đáng giá bao nhiêu

Cả hai mô hình đều không có đánh giá chuẩn từ bên thứ ba. Tuy nhiên, bằng chứng không tương đương, và sự khác biệt này rất quan trọng.
• SeedRealtime không công bố bất kỳ benchmark nào cả. Điều ByteDance đưa ra là một tuyên bố rằng các vấn đề về nhịp điệu hội thoại — nói lấn át người dùng, phản hồi muộn, bị kích hoạt bởi tiếng ồn của người lạ — giảm khoảng một nửa so với một hệ thống cascade, dựa trên các đánh giá end-to-end do con người thực hiện. Dữ liệu cơ sở không được công bố.
• Các con số của phiên bản tiền nhiệm cũng có cùng dạng. Seeduplex, mô hình chỉ âm thanh mà ByteDance đưa vào Doubao hồi tháng 4 năm 2026, được báo cáo là đã giảm một nửa tỷ lệ phản hồi sai và ngắt lời sai, cắt giảm độ trễ điểm cuối khoảng 250 mili giây, giảm 40% phản hồi sớm và nâng mức độ hài lòng khi gọi lên 8,34 điểm trong một thử nghiệm A/B quy mô lớn. Tất cả đều do nhà cung cấp báo cáo.
Realtime-Venus công bố một bảng. Báo cáo của nó tuyên bố đạt điểm tốt nhất trên sáu trong tám benchmark video, bao gồm StreamingBench 70.2, OVO-Bench 64.7 và Daily-Omni 81.3, đồng thời dẫn đầu ở MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8 và Speech CMMLU 67.8 đối với checkpoint âm thanh.
• Cả hai đều chưa được tái lập. Một bảng đã công bố mà không ai kiểm tra và một thử nghiệm A/B chưa công bố mà không ai có thể kiểm tra là những kiểu chưa được xác minh khác nhau. Cả hai đều không phải là bằng chứng mà bạn có thể dựa vào để đưa ra quyết định mua sắm.
Phép so sánh duy nhất đáng thực hiện trong các con số của Realtime-Venus là so với chính mô hình cơ sở của nó. MiniCPM-o 4.5 báo cáo 80,2 trên Daily-Omni; Realtime-Venus-Omni báo cáo 81,3. Mức tăng một điểm so với mô hình mà nó được chuyển thể từ đó, trên một benchmark mà mô hình đó vốn đã xử lý được, là một kết quả hợp lý cho một nỗ lực hậu huấn luyện và runtime — và là một tuyên bố nhỏ hơn nhiều so với cách "tốt nhất ở sáu trong tám" được hiểu khi đứng một mình.

Vấn đề luân phiên lượt lời, đó chính là nơi full-duplex tồn tại.
Full-duplex không phải là một tính năng về độ trễ. Nó là một tập hợp các hành vi: biết khi nào một khoảng dừng có nghĩa là “tôi đang suy nghĩ” chứ không phải “tôi đã nói xong”, phân biệt cuộc trò chuyện của người đứng ngoài với người đang nói với bạn, và giữ im lặng qua một tín hiệu hưởng ứng thay vì coi “mm-hm” là một sự ngắt lời.
Cách tiếp cận của SeedRealtime là mô hình hóa trạng thái hội thoại ngay trong mạng và loại bỏ hoàn toàn bộ phát hiện hoạt động giọng nói bên ngoài, nhờ đó việc luân phiên lượt lời là một hành vi được học bên trong mạng thay vì một ngưỡng được áp lên luồng âm thanh. Đó cũng chính là cam kết kiến trúc mà Realtime-Venus đưa ra, và cả hai đều được định vị đối lập với các hệ thống cascade vốn cần một thành phần riêng biệt để quyết định ai đang nói.
Điểm khác biệt của bằng chứng nằm ở chỗ: tuyên bố của SeedRealtime là về triển khai ở quy mô lớn — hàng trăm triệu người dùng, phòng thực, tiếng ồn thực — trong khi tuyên bố của Realtime-Venus là về một bài kiểm chuẩn. Kết quả Full-Duplex-Bench v1.5 dành cho Realtime-Venus-Audio — phản hồi 75% khi bị ngắt lời, tiếp tục 97% dưới backchannels, 88% dưới lời nói hướng đến người khác và 86% dưới tiếng nói nền, vượt Gemini 3.1 Live và GPT-4o về khả năng tiếp tục — là những con số liên quan trực tiếp nhất mà mỗi mô hình đã công bố cho vấn đề này. Chúng cũng hoàn toàn do tự báo cáo, và mức tiếp tục 97% dưới backchannels là một con số gây ấn tượng mạnh, đáng để có người thứ hai kiểm chứng trước khi bất kỳ ai trích dẫn nó như một sự thật.
Nơi mỗi cái để lại một người xây dựng
Khoảng cách thực tế không nằm ở chất lượng, mà nằm ở hình dạng của lời đề nghị.
• SeedRealtime — bạn có thể trải nghiệm nó miễn phí trong Doubao và không bao giờ tích hợp được nó. Không có con đường nào từ “điều này thật ấn tượng” đến “điều này nằm trong sản phẩm của tôi.”
• Realtime-Venus — bạn có thể tải xuống, tinh chỉnh, chạy trong môi trường air-gapped và kiểm tra từng lớp. Cái giá phải trả là hai checkpoint 9B ở định dạng BF16 với khoảng mười tám gigabyte trọng số mỗi cái, cộng với một vòng lặp truyền phát liên tục theo từng giây, nghĩa là một nút GPU vẫn tính phí dù có ai gọi hay không.
• Cả hai đều không có tùy chọn dịch vụ được lưu trữ sẵn. Cả hai đều không thể được dùng thử chỉ với một khóa và một buổi chiều.
Điểm cuối cùng đó là lý do hai mô hình hữu ích hơn khi đi cùng nhau như một cặp hơn là khi đối đầu với nhau. Giữa chúng, chúng cho thấy cả hai nửa của vấn đề đều đã được giải quyết — năng lực này hoạt động, và các trọng số có thể được công bố — đồng thời cho thấy chưa ai kết hợp chúng lại thành một thứ mà nhà phát triển thực sự có thể gọi tới.
Có một giải pháp tình thế mà rất nhiều đội nhóm sẽ tìm đến, và đáng để nói rõ nó bao phủ và không bao phủ những gì. Nếu bạn không thể có được lớp giọng nói, bạn vẫn có thể xây dựng phần biết suy nghĩ. Realtime-Venus giao phó công việc tốn kém của nó — truy xuất, lập luận khó, gọi API nghiệp vụ — cho một bộ khung chạy nền thông qua các điểm đánh dấu ủy nhiệm không đồng bộ, và chặng được ủy nhiệm đó chỉ là suy luận văn bản thông thường. OrcaRouter không cung cấp Realtime-Venus lẫn SeedRealtime; cả hai lớp song công đều nằm ngoài phạm vi chúng tôi phục vụ, và chúng tôi cũng không lưu trữ cái nào trong số đó. Gần 200 mô hình văn bản sau một khóa với giá niêm yết của nhà cung cấp, không tăng giá là nửa kiến trúc mà chúng tôi thực sự bao phủ, với chuyển đổi dự phòng tự động để một tác vụ nền không thất bại chỉ vì một upstream có một buổi chiều tồi tệ, một DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi, và hợp nhất mô hình khi phán đoán của một mô hình duy nhất là không đủ. Đó không phải là phần khó của những hệ thống này. Đó là phần thực sự có thể mua được.

Điều gì sẽ thay đổi sự so sánh này?
Ba bước phát triển sẽ giải quyết được điều đó, và chưa có bước nào trong số đó xảy ra. Một đánh giá chuẩn độc lập về Realtime-Venus, bởi vì một bảng không có người đọc thứ hai chỉ là lời tuyên bố chứ không phải kết quả. Một API cho SeedRealtime, bởi vì mô hình có bằng chứng triển khai mạnh nhất hiện lại là mô hình không ai có thể sử dụng. Và một con số độ trễ được công bố từ một trong hai — thời gian tới âm thanh đầu tiên là chỉ số mà loại sản phẩm này được mua dựa trên, và tính đến thời điểm viết bài, cả hai mô hình đều chưa đưa ra con số nào.
Cho đến lúc đó, tóm tắt trung thực là: SeedRealtime là bằng chứng rằng song công hoàn toàn nghe nhìn hoạt động ở quy mô tiêu dùng, còn Realtime-Venus là bằng chứng rằng các trọng số có thể được mở ra; và không sự thật nào trong hai điều đó giúp một nhà phát triển tiến gần hơn tới việc tung ra sản phẩm. Đó không phải là lời chỉ trích nhắm vào một trong hai phòng thí nghiệm. Đó là mô tả về một hạng mục đã giải quyết được bài toán nghiên cứu nhưng chưa giải quyết được bài toán phân phối.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
