
Realtime-Venus: pełnodupleksowy model 9B od Ant Group wypuszczony bez premiery
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
12 września 2026 r. na arXiv pojawił się raport techniczny opisujący Realtime-Venus, system interakcji pełnodupleksowej zbudowany z dwóch osobno trenowanych modeli 9B — Realtime-Venus-Omni do interakcji audiowizualnej i Realtime-Venus-Audio do interakcji głosowej — przypisywany zespołowi Venus Team z Ant Group współpracującemu z Tsinghua University. W ciągu kilku dni repozytorium na licencji Apache-2.0 pod adresem inclusionAI/Realtime-Venus na Hugging Face zawierało oba checkpointy jako możliwe do pobrania pliki safetensors BF16, obok strony projektu i towarzyszącego repozytorium GitHub. Nie pojawiła się natomiast część warta uwagi: żadnego wpisu o premierze, żadnej strony produktu, żadnego API, żadnego cennika i nic we własnych serwisach Ant Group, co ogłaszałoby, że cokolwiek z tego istnieje. To wydanie, które dostarczyło wszystko oprócz ogłoszenia, co sprawia, że oddzielenie ustalonych faktów od twierdzeń to cała robota.
Co faktycznie znajduje się na dysku
To repozytorium nie jest atrapą. Zawiera dwa katalogi modeli, każdy z wagami safetensors podzielonymi na shardy, plikiem konfiguracyjnym oraz niestandardowym kodem Hugging Face Transformers, który zgodnie z instrukcją karty należy załadować z trust_remote_code=True. Znajduje się tam plik requirements, folder assets zawierający zasoby do konwersji tokenów na przebiegi falowe i głos referencyjny oraz licencja Apache-2.0 w katalogu głównym. Karta dokumentuje instalację dla Pythona 3.10 z CUDA i FFmpeg, a także zarówno mirror ModelScope, jak i ścieżkę pobierania z Hugging Face. Wagi są prawdziwe, kod jest na miejscu i nic nie stoi na przeszkodzie, abyś mógł je już dziś pobrać.

Dwie nieobecności są równie pouczające jak zawartość. Pierwsza z nich to fakt, że repozytorium wprost stwierdza, iż nie zostało wdrożone przez żadnego dostawcę inferencji — nie ma hostowanego punktu końcowego, opcji serverless ani żadnej platformy zewnętrznej, która by je hostowała. Druga to fakt, że pobrania nie są w ogóle śledzone, co oznacza, że nie ma publicznego sygnału, ile osób je pobrało. Model może na Hugging Face wyglądać na przyjęty lub zignorowany; tego jednego nie da się w ten sposób odczytać.
Dwa punkty kontrolne i to, co je dzieli
Oba są 9B, oba mają wspólny strumieniowy backbone, a różnica między nimi polega na tym, co potrafią postrzegać.
• Realtime-Venus-Omni — audiowizualny checkpoint. Wizualny enkoder SigLIP2 dla strumieniowanych klatek, enkoder audio Whisper-Medium i szkielet językowy Qwen3-8B. Przyjmuje wideo lub obrazy, audio i tekst; zwraca tekst oraz opcjonalnie przebieg fali mowy.
• Realtime-Venus-Audio — ten sam backbone z wyłączoną wizją w momencie ładowania. Dźwięk i tekst na wejściu, tekst i mowa na wyjściu. Istnieje na wypadek, gdy kamera jest nieistotna, a zależy ci na mniejszym zużyciu pamięci i prostszej ścieżce.
• Wspólna specyfikacja — kontekst 40 960 tokenów w obu przypadkach, wagi BF16 w obu, mowa generowana jako dyskretne tokeny S3 dekodowane przez strumieniowy dekoder flow-matching, a nie osobny model zamiany tekstu na mowę doczepiony na końcu.
• Pochodzenie — karta modelu stwierdza, że checkpoint Omni został zaadaptowany z MiniCPM-o 4.5, 9B modelu omni-modalnego, który OpenBMB udostępnił jako open source wcześniej w 2026 r. To nie jest przypis. Oznacza to, że wkład Ant Group to post-training, środowisko uruchomieniowe oraz projekt delegowania nałożone na cudzy strumieniowy backbone, co jest twierdzeniem innym i bardziej szczegółowym niż „nowy model omni 9B”.
Jedyny naprawdę nowy pomysł: delegacja jako zdarzenie strumieniowe pierwszej kategorii
Każdy system pełnodupleksowy w 2026 roku musi rozwiązać tę samą sprzeczność. Sterowanie rozmową odbywa się z granularnością od milisekund do jednej sekundy. Wywołania narzędzi, wyszukiwanie i trudne rozumowanie zajmują od sekund do dziesiątek sekund. Model, który zatrzymuje się, by pomyśleć, przestaje być pełnodupleksowy; model, który nigdy się nie zatrzymuje, nie może użyć narzędzia.
Realtime-Venus odpowiada za pomocą środowiska wykonawczego z podwójną pętlą. Pętla interakcji działa w stałych jednosekundowych fragmentach, nieustannie pobierając cechy audio i wideo, aktualizując stan rozmowy i decydując, czy słuchać, czy mówić, jednocześnie strumieniując tekst i zsynchronizowaną mowę. Nie wstrzymuje się, gdy w tle trwa praca. Druga pętla to scheduler, który artykuł nazywa Realtime-Venus-Harness: gdy frontend uzna, że zadanie wykracza poza to, co może wykonać inline, emituje asynchroniczne delegowanie za pośrednictwem prywatnych znaczników osadzonych we własnej ukrytej sekwencji, a harness wykonuje zadanie w tle i ponownie integruje wynik z trwającym dialogiem.
Szczegół, który sprawia, że to jest czymś więcej niż diagram, to to, co artykuł nazywa przyczynowym przechwytywaniem zadań — delegowane zadanie jest wykonywane względem izolowanej migawki stanu rozmowy, dzięki czemu długotrwałe zadanie działające w tle nie może zostać uszkodzone przez to, że rozmowa toczy się dalej, gdy ono trwa. To właśnie ten tryb awarii sprawia, że większość projektów typu „deleguj i rozmawiaj dalej” zawodzi w praktyce, i to jest najciekawsza rzecz w raporcie.
Uprząż nie znajduje się w wagach. Mieszka w repozytorium GitHub jako osobny komponent, co oznacza, że część, która nadaje architekturze wyróżniający charakter, jest tą częścią, którą musiałbyś samodzielnie złożyć i jej zaufać.
Liczby i dokładnie czyje one są
Wszystkie poniższe wartości pochodzą z raportu technicznego i karty modelu. Żadna z nich nie została odtworzona przez nikogo spoza autorów, żadna strona trzecia nie opublikowała oceny i nie ma wpisu w rankingu, z którym można by je porównać. Należy je traktować jako pomiary samych autorów.
• Benchmarki wideo, Realtime-Venus-Omni — najlepszy wynik w sześciu z ośmiu benchmarków wykorzystanych w raporcie, w tym StreamingBench 70,2, OVO-Bench 64,7 i Daily-Omni 81,3.
• Testy audio, Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 oraz wynik 4,81 w VoiceBench AlpacaEval, który raport opisuje jako dorównujący najlepszemu wynikowi porównawczemu.
• Full-Duplex-Bench v1.5 — odpowiedź na 75% przerwań użytkownika, ze wskaźnikami kontynuacji na poziomie 97% w przypadku sygnałów zwrotnych, 88% w przypadku mowy skierowanej do innych osób i 86% w przypadku mowy w tle. W raporcie stwierdzono, że przewyższa to Gemini 3.1 Live i GPT-4o we wszystkich trzech metrykach kontynuacji.
Wynik Daily-Omni jest tym, nad którym warto się zatrzymać. MiniCPM-o 4.5, model, z którego zaadaptowano ten checkpoint, osiąga 80,2 w tym samym benchmarku. Realtime-Venus-Omni osiąga 81,3. Jeśli obie liczby się potwierdzą, poprawa wynikająca z dużego wysiłku włożonego w post-training i środowisko uruchomieniowe to około jednego punktu w benchmarku, w którym model bazowy był już mocny — co jest realistycznym wynikiem jak na tego typu pracę i znacznie mniej dramatyczną historią niż nagłówek „najlepszy w sześciu z ośmiu”.

Co nie jest ustalone
Lista otwartych pytań jest dłuższa niż lista tych rozstrzygniętych, a to jest uczciwy stan sześciodniowego modelu.
• Nie istnieje żadna niezależna ocena. Nie ma umieszczenia w rankingu Arena, nie ma odtworzenia przez stronę trzecią, nie ma ani jednej zewnętrznej grupy, która opublikowała jakąkolwiek liczbę.
• Brak wartości opóźnienia w milisekundach. Raport opisuje jednosekundowe tempo interakcji, a karta dokumentuje wywołania strumieniowe na sekundę, ale nie opublikowano liczby określającej czas do pierwszego dźwięku, a to właśnie wskaźnik, na podstawie którego ta kategoria jest w rzeczywistości kupowana.
• Brak API i brak ceny, a także żadnej deklaracji, że którekolwiek z nich się pojawi. Nie wiadomo tak naprawdę, czy to produkt oczekujący na premierę, czy artefakt badawczy, który pozostanie jedynie do pobrania.
• Brak wyrażonego zamiaru ze strony dostawcy. Brak ogłoszenia nie jest dowodem na cichą strategię premiery; jest również zgodny z repozytorium opublikowanym na potrzeby artykułu i niczym więcej.
• Brak dowodów z produkcji dla harnessa. To element konstrukcyjny architektury i zarazem najsłabiej udokumentowany.
Dlaczego cicha trasa wciąż się zdarza
To drugi raz w tym roku, kiedy prace modelowe Ant Group trafiły do publicznego odbioru przez repozytorium, a nie premierę. UI-Venus-2-9B, agent GUI tego laboratorium, pojawił się na Hugging Face pod koniec sierpnia 2026 r. bez artykułu, bez strony projektu i bez ogłoszenia — a od tego czasu ukazał się po nim raport. Realtime-Venus pojawił się w odwrotnej kolejności: najpierw raport, repozytorium równolegle, ogłoszenie wciąż wstrzymane.
Ten wzorzec nie jest unikalny dla Ant Group. Zwłaszcza chińskie laboratoria wypuszczały w świat artefakty badawcze i wdrożenia konsumenckie, odkładając ogłoszenie skierowane do deweloperów na później albo pomijając je. Dla każdego, kto śledzi tę dziedzinę, jest to niewygodne, ponieważ zwykły sygnał — wpis o premierze, cennik, strona dokumentacji — to dokładnie ta część, której brakuje. Artefakt jest teraz ogłoszeniem, a uważne przeczytanie go to jedyny sposób, by wiedzieć, co zostało wydane.
Gdybyś chciał to uruchomić
Karta jest wyjątkowo praktyczna jak na tak nowe wydanie. Ładowanie jest standardowe: AutoModel.from_pretrained na lokalnym katalogu checkpointów z zaufanym kodem zdalnym, attention SDPA i bfloat16. Strumieniowanie pełnodupleksowe uruchamia się pojedynczym wywołaniem, które przełącza model w tryb duplex, po czym udokumentowana pętla to jedna sekunda streaming_prefill po której następuje streaming_generate, powtarzana. Pamięć długiego wideo włącza się parametrem memory-minutes ustawionym na czterdzieści i jest opisana jako niewymagająca trenowania, co jest godne uwagi w przypadku możliwości, która zwykle wymaga dostrajania. Dwa zastrzeżenia są udokumentowane, a nie pozostawione do odkrycia: limit liczby klatek, który po cichu obcina długie wideo, chyba że przed zaimportowaniem narzędzi zwiększy się wartość pewnej stałej, oraz wymóg czcionki CJK dla nielacińskich napisów renderowanych do wideo duplex.
To, czego karta ci nie daje, to próg sprzętowy. Model 9B w BF16 to około osiemnastu gigabajtów wag, jeszcze przed uwzględnieniem jakiejkolwiek pamięci aktywacji, co stawia inferencję dwukierunkową w czasie rzeczywistym na poważnym GPU i poza zasięgiem wdrożenia na laptopie, dla którego rodzina MiniCPM-o, z której się wywodzi, była częściowo projektowana.
Jest tu szew, który warto nazwać, bo właśnie tam router faktycznie pasuje. Realtime-Venus deleguje swoją ciężką pracę — wyszukiwanie, złożone rozumowanie, wywołania biznesowych API — do modelu działającego w tle. Ta delegowana część to zwykłe wnioskowanie tekstowe i to ona decyduje, czy twój konwersacyjny frontend jest użyteczny, czy tylko płynny. OrcaRouter nie zawiera niczego z Realtime-Venus; warstwa dupleksowa jest tutaj samodzielnie hostowanym elementem do pobrania i nie świadczymy jej jako usługi. Rozumowanie, które przekazuje dalej, to część, którą obejmujemy: prawie 200 modeli za jednym kluczem w cenie katalogowej dostawcy bez marży, automatyczne przełączanie awaryjne, gdy upstream ma gorszy dzień, DSL routingu, który łączy kilka modeli w jedno wywołanie, oraz fuzja modeli w przypadkach, gdy osąd jednego modelu nie wystarcza. Znacznik delegacji jest decyzją frontendu; to, który model odpowiada, jest wyborem konfiguracyjnym, a trzymanie tego wyboru poza wagami pozwala zmienić go bez ponownego trenowania czegokolwiek.

Co by to rozstrzygnęło
Trzy rzeczy przeniosłyby Realtime-Venus z artykułu z wagami do modelu, który każdy może ocenić. Niezależna grupa odtwarzająca wyniki kontynuacji Full-Duplex-Bench, ponieważ 97% w przypadku backchanneli to niezwykła wartość, a niezwykłe wartości potrzebują drugiego czytelnika. Opublikowana liczba opóźnienia, ponieważ systemy full-duplex zależą od czasu do pierwszego dźwięku, a ten nie podał wartości docelowej. I dokumentacja dla harnessa, ponieważ projekt asynchronicznego delegowania to jedyna część tego wydania, która jest naprawdę nowa, a obecnie to część, o której można przeczytać, ale której niełatwo przyjąć.
Do tego czasu trafny opis jest wąski i mało ekscytujący, i właśnie dlatego warto go zapisać: prawdziwe wydanie Apache-2.0 dwóch 9B checkpointów full-duplex, zbudowanych na otwartym backbone, z mocnymi benchmarkami raportowanymi przez samych twórców, bez niezależnej weryfikacji, bez API i bez ogłoszenia. Wszystko powyżej tej linii to domysły.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
