
Realtime-Venus: Full-Duplex 9B của Ant Group được phát hành mà không có buổi ra mắt
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vào ngày 12 tháng 9 năm 2026, một báo cáo kỹ thuật đã xuất hiện trên arXiv mô tả Realtime-Venus, một hệ thống tương tác song công hoàn toàn được xây dựng từ hai mô hình 9B được huấn luyện riêng biệt — Realtime-Venus-Omni cho tương tác nghe nhìn và Realtime-Venus-Audio cho tương tác bằng giọng nói — được ghi công cho Nhóm Venus tại Ant Group phối hợp với Đại học Thanh Hoa. Trong vòng vài ngày, một repository Apache-2.0 thuộc inclusionAI/Realtime-Venus trên Hugging Face đã chứa cả hai checkpoint dưới dạng BF16 safetensors có thể tải xuống, cùng với một trang dự án và một repository GitHub đi kèm. Điều không xuất hiện chính là phần đáng chú ý: không có bài đăng ra mắt, không có trang sản phẩm, không có API, không có bảng giá, và không có gì trên các nền tảng riêng của Ant Group thông báo rằng bất kỳ phần nào trong đó tồn tại. Đây là một bản phát hành đã tung ra mọi thứ trừ thông báo, khiến việc tách biệt các dữ kiện đã được xác lập khỏi các tuyên bố trở thành toàn bộ công việc.
Thực sự có gì trên đĩa
Kho lưu trữ không phải là bản giả. Nó chứa hai thư mục mô hình, mỗi thư mục có trọng số safetensors được chia nhỏ, một tệp cấu hình, và mã Hugging Face Transformers tùy chỉnh mà thẻ hướng dẫn bạn tải bằng trust_remote_code=True. Có một tệp requirements, một thư mục assets chứa tài nguyên ánh xạ token sang dạng sóng và một giọng nói tham chiếu, cùng giấy phép Apache-2.0 ở cấp cao nhất. Thẻ tài liệu hướng dẫn cài đặt cho Python 3.10 với CUDA và FFmpeg, cùng cả bản sao ModelScope và đường dẫn tải xuống Hugging Face. Các trọng số là thật, mã nguồn có ở đó, và không có gì ngăn bạn tải xuống ngay hôm nay.

Hai sự thiếu vắng có sức thông tin ngang với nội dung. Thứ nhất là kho lưu trữ nói thẳng rằng nó không được triển khai bởi bất kỳ nhà cung cấp suy luận nào — không có endpoint được host, không có tùy chọn serverless, không có nền tảng bên thứ ba nào vận hành nó. Thứ hai là các lượt tải hoàn toàn không được theo dõi, nghĩa là không có tín hiệu công khai nào về việc bao nhiêu người đã tải nó về. Một mô hình có thể trông như được đón nhận hoặc bị phớt lờ trên Hugging Face; còn mô hình này thì không thể đọc được theo cách đó.
Hai điểm kiểm tra, và điều phân biệt chúng
Cả hai đều là 9B, đều dùng chung một xương sống streaming, và điểm khác biệt giữa chúng nằm ở những gì chúng có thể cảm nhận được.
• Realtime-Venus-Omni — checkpoint nghe-nhìn. Bộ mã hóa thị giác SigLIP2 cho các khung hình truyền trực tiếp, bộ mã hóa âm thanh Whisper-Medium, và mô hình lõi ngôn ngữ Qwen3-8B. Chấp nhận video hoặc hình ảnh, âm thanh và văn bản; trả về văn bản và, tùy chọn, dạng sóng giọng nói.
• Realtime-Venus-Audio — cùng một bộ khung nhưng đã tắt thị giác tại thời điểm tải. Âm thanh và văn bản vào, văn bản và giọng nói ra. Nó tồn tại cho trường hợp camera không liên quan và bạn muốn mức chiếm dụng bộ nhớ nhỏ hơn cùng lối xử lý đơn giản hơn.
• Thông số kỹ thuật chung — ngữ cảnh 40.960 token trên cả hai, trọng số BF16 trên cả hai, giọng nói được tạo dưới dạng các token S3 rời rạc được giải mã bởi một bộ giải mã flow-matching dạng luồng thay vì một mô hình chuyển văn bản thành giọng nói riêng biệt được gắn thêm vào cuối.
• Nguồn gốc — thẻ mô hình nêu rằng checkpoint Omni được phái sinh từ MiniCPM-o 4.5, mô hình omni-modal 9B mà OpenBMB đã mở nguồn vào đầu năm 2026. Đó không phải là một chú thích nhỏ. Điều đó có nghĩa đóng góp của Ant Group là quá trình hậu huấn luyện, runtime, và thiết kế ủy thác được chồng lớp lên backbone streaming của người khác — một tuyên bố khác và cụ thể hơn so với “một mô hình omni 9B mới”.
Ý tưởng thực sự mới mẻ duy nhất: ủy quyền như một sự kiện luồng hạng nhất
Mọi hệ thống song công toàn phần vào năm 2026 đều phải giải quyết cùng một mâu thuẫn. Việc điều khiển hội thoại diễn ra ở độ chi tiết từ mili giây đến một giây. Các lệnh gọi công cụ, truy xuất và suy luận khó mất từ vài giây đến hàng chục giây. Một mô hình dừng lại để suy nghĩ thì không còn là song công toàn phần nữa; một mô hình không bao giờ dừng lại thì không thể sử dụng công cụ.
Realtime-Venus trả lời bằng một runtime hai vòng lặp. Vòng lặp tương tác chạy theo các khối một giây cố định, liên tục tiếp nhận các đặc trưng âm thanh và video, cập nhật trạng thái hội thoại, và quyết định xem nên nghe hay nói, đồng thời truyền phát văn bản và giọng nói đã căn chỉnh. Nó không tạm dừng khi công việc nền đang diễn ra. Vòng lặp thứ hai là một bộ lập lịch mà bài báo gọi là Realtime-Venus-Harness: khi frontend quyết định một tác vụ vượt quá khả năng xử lý nội tuyến của nó, nó phát ra một sự ủy thác bất đồng bộ thông qua các dấu riêng được nhúng trong chuỗi ẩn của chính nó, và bộ harness thực thi tác vụ đó ở chế độ nền và tái tích hợp kết quả vào cuộc đối thoại đang diễn ra.
Chi tiết khiến thứ này vượt xa một bản sơ đồ là cái mà bài báo gọi là causal task capture — tác vụ được giao phó được thực thi trên một bản chụp cô lập của trạng thái hội thoại, nhờ đó một tác vụ chạy nền kéo dài không thể bị hỏng bởi việc cuộc hội thoại vẫn tiếp diễn trong lúc nó đang chạy. Đó chính là kiểu thất bại khiến hầu hết các thiết kế "giao việc rồi cứ tiếp tục trò chuyện" sụp đổ trên thực tế, và đó là điều thú vị nhất trong báo cáo.
Bộ khung không nằm trong trọng số. Nó sống trong kho GitHub như một thành phần riêng biệt, nghĩa là phần khiến kiến trúc trở nên đặc biệt lại chính là phần bạn sẽ phải tự lắp ráp và tự tin tưởng.
Những con số, và chính xác chúng thuộc về ai
Mọi số liệu dưới đây đều đến từ báo cáo kỹ thuật và thẻ mô hình. Không phần nào trong đó được tái lập bởi bất kỳ ai ngoài các tác giả, không bên thứ ba nào công bố đánh giá, và không có mục nào trên bảng xếp hạng để đối chiếu. Hãy xem chúng như những phép đo của chính các tác giả.
• Các benchmark video, Realtime-Venus-Omni — điểm số cao nhất trên sáu trong tám benchmark mà báo cáo sử dụng, bao gồm StreamingBench 70.2, OVO-Bench 64.7 và Daily-Omni 81.3.
• Các chỉ số đánh giá âm thanh, Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8, và điểm VoiceBench AlpacaEval là 4,81 mà báo cáo mô tả là ngang bằng với con số so sánh tốt nhất.
• Full-Duplex-Bench v1.5 — phản hồi 75% các trường hợp người dùng ngắt lời, với tỷ lệ tiếp tục đạt 97% khi có backchannel, 88% khi có lời nói hướng đến người khác và 86% khi có tiếng nói nền. Báo cáo cho biết mức này vượt Gemini 3.1 Live và GPT-4o trên cả ba chỉ số tiếp tục.
Số liệu Daily-Omni là thứ đáng để dừng lại suy ngẫm. MiniCPM-o 4.5, mô hình mà checkpoint này được chuyển thể từ đó, báo cáo 80,2 trên cùng một benchmark. Realtime-Venus-Omni báo cáo 81,3. Nếu cả hai con số này đều đứng vững, mức cải thiện từ một nỗ lực lớn về hậu huấn luyện và runtime là khoảng một điểm trên một benchmark mà mô hình cơ sở vốn đã mạnh — một kết quả thực tế cho loại công việc này và là một câu chuyện ít kịch tính hơn nhiều so với tiêu đề “tốt nhất ở sáu trong tám”.

Điều gì chưa được thiết lập
Danh sách những câu hỏi còn bỏ ngỏ dài hơn danh sách những câu đã được giải quyết, và đó là thực trạng trung thực của một mô hình mới chỉ sáu ngày tuổi.
• Không hề có đánh giá độc lập nào. Không phải một vị trí xếp hạng trên đấu trường, không phải một bản tái lập của bên thứ ba, không phải một nhóm bên ngoài nào từng công bố một con số.
• Không có con số độ trễ tính bằng mili giây. Báo cáo mô tả nhịp tương tác một giây và thẻ tài liệu ghi lại các lệnh gọi truyền phát theo từng giây, nhưng không có con số thời gian tới âm thanh đầu tiên nào được công bố, vốn là chỉ số mà người ta thực sự dựa vào để mua trong phân khúc này.
• Không có API và không có giá, và cũng không có tuyên bố nào rằng một trong hai sẽ xuất hiện. Liệu đây là một sản phẩm đang chờ ra mắt hay chỉ là một sản phẩm nghiên cứu sẽ mãi chỉ để tải về thì thực sự không ai biết.
• Không có tuyên bố ý định nào từ nhà cung cấp. Việc thiếu một thông báo không phải là bằng chứng cho một chiến lược ra mắt thầm lặng; nó cũng phù hợp với một kho lưu trữ được công bố cho một bài báo và không hơn thế.
• Không có bằng chứng từ môi trường production cho harness. Đây là thành phần chịu lực chính của kiến trúc và cũng là phần được ghi chép ít nhất.
Tại sao tuyến đường yên tĩnh vẫn tiếp diễn
Đây là lần thứ hai trong năm nay mà công trình mô hình của Ant Group đến với công chúng thông qua một kho lưu trữ thay vì một buổi ra mắt. UI-Venus-2-9B, tác nhân GUI của phòng thí nghiệm, đã xuất hiện trên Hugging Face vào cuối tháng 8 năm 2026 mà không có bài báo, không có trang dự án và không có thông báo — và kể từ đó đã được theo sau bởi một báo cáo. Realtime-Venus xuất hiện theo thứ tự ngược lại: báo cáo trước, kho lưu trữ đi kèm, thông báo vẫn bị giữ kín.
Kiểu mẫu này không chỉ riêng Ant Group. Đặc biệt, các phòng thí nghiệm Trung Quốc thường tung ra thế giới các sản phẩm nghiên cứu và triển khai cho người tiêu dùng, trong khi để thông báo hướng tới nhà phát triển lại sau, hoặc bỏ qua luôn. Với bất kỳ ai theo dõi lĩnh vực này, điều đó thật bất tiện, bởi tín hiệu thường thấy — một bài đăng ra mắt, một bảng giá, một trang tài liệu — lại đúng là phần đang bị thiếu. Giờ đây, chính sản phẩm là thông báo, và đọc kỹ nó là cách duy nhất để biết đã phát hành những gì.
Nếu bạn muốn chạy nó
Chiếc card này thiết thực lạ thường đối với một bản phát hành mới như vậy. Việc tải diễn ra theo chuẩn: AutoModel.from_pretrained trên thư mục checkpoint cục bộ với mã từ xa được tin cậy, attention SDPA và bfloat16. Streaming song công toàn phần được kích hoạt bằng một lệnh gọi duy nhất chuyển mô hình sang chế độ song công, sau đó vòng lặp được tài liệu hóa gồm một giây streaming_prefill rồi tiếp theo là streaming_generate, lặp lại. Bộ nhớ video dài được bật bằng tham số memory-minutes đặt thành bốn mươi và được mô tả là không cần huấn luyện, điều này đáng chú ý đối với một năng lực thường đòi hỏi tinh chỉnh. Hai lưu ý được ghi trong tài liệu thay vì để người dùng tự phát hiện: giới hạn khung hình âm thầm cắt ngắn video dài trừ khi một hằng số được tăng lên trước khi nhập các tiện ích, và yêu cầu phông chữ CJK cho phụ đề không phải Latinh được kết xuất vào video song công.
Điều mà card không cung cấp cho bạn là một mức sàn phần cứng. Một mô hình 9B ở BF16 có trọng số vào khoảng mười tám gigabyte trước khi tính đến bất kỳ bộ nhớ kích hoạt nào, điều này đặt suy luận song công thời gian thực lên một GPU mạnh và nằm ngoài tầm với của việc triển khai trên laptop mà dòng MiniCPM-o mà nó bắt nguồn từ đó vốn được thiết kế một phần để phục vụ.
Ở đây có một đường nối đáng được gọi tên, vì đó chính là chỗ một router thực sự khớp vào. Realtime-Venus giao phần việc nặng của nó — truy xuất, suy luận phức tạp, gọi API nghiệp vụ — ra cho một mô hình chạy nền. Chặng được ủy quyền đó là suy luận văn bản thông thường, và chính chặng này quyết định liệu giao diện hội thoại của bạn hữu dụng hay chỉ trôi chảy. OrcaRouter không mang theo phần nào của Realtime-Venus; lớp song công ở đây là một bản tải tự lưu trữ và chúng tôi không phục vụ nó. Phần suy luận mà nó bàn giao lại là phần chúng tôi bao phủ: gần 200 mô hình sau một khóa với giá niêm yết của nhà cung cấp, không đội giá, tự động chuyển đổi dự phòng khi một nhà cung cấp thượng nguồn gặp trục trặc, một DSL định tuyến cho phép ghép nhiều mô hình vào một lệnh gọi, và hợp nhất mô hình cho những trường hợp mà phán đoán của một mô hình là chưa đủ. Dấu hiệu ủy quyền là quyết định của frontend; mô hình nào trả lời nó là một lựa chọn cấu hình, và việc giữ lựa chọn đó bên ngoài trọng số là điều cho phép bạn thay đổi nó mà không cần huấn luyện lại bất cứ thứ gì.

Điều gì sẽ giải quyết được nó?
Ba điều sẽ đưa Realtime-Venus từ một bài báo kèm trọng số thành một mô hình mà bất kỳ ai cũng có thể đánh giá. Một nhóm độc lập tái tạo các con số tiếp nối của Full-Duplex-Bench, bởi vì 97% trong điều kiện có backchannel là một con số phi thường và những con số phi thường cần một người đọc thứ hai. Một con số độ trễ được công bố, bởi vì các hệ thống song công toàn phần sống hoặc chết dựa trên thời gian đến âm thanh đầu tiên và hệ thống này chưa nêu mục tiêu. Và tài liệu cho harness, bởi vì thiết kế ủy thác bất đồng bộ là phần duy nhất của bản phát hành này thực sự mới, và hiện tại nó là phần bạn có thể đọc nhưng không dễ áp dụng.
Cho đến lúc đó, mô tả chính xác là hẹp và tẻ nhạt, và đó chính xác là lý do nó đáng được ghi lại: một bản phát hành Apache-2.0 thực sự gồm hai checkpoint 9B full-duplex, được xây dựng trên một backbone mở, với các benchmark tự báo cáo mạnh mẽ, không có xác minh độc lập, không có API và không có thông báo. Mọi thứ phía trên dòng đó đều là suy luận.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
