
Realtime-Venus kontra SeedRealtime: Dwa przeciwstawne sposoby bycia niedostępnym
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus i SeedRealtime to dwie połowy tej samej historii z 2026 roku i obie nie przechodzą przeciwstawnych testów. SeedRealtime to natywnie audiowizualny model pełnodupleksowy ByteDance, uruchomiony w aplikacji Doubao 5 sierpnia 2026 roku za darmo, docierający do publiczności, którą jego twórca opisuje jako liczącą setki milionów — bez API, bez identyfikatora modelu, bez ceny i bez celu dotyczącego opóźnienia. Realtime-Venus to para checkpointów 9B od zespołu Venus Team z Ant Group i Uniwersytetu Tsinghua, opublikowana 12 września 2026 roku na licencji Apache-2.0 wraz z raportem technicznym i bez zapowiedzi, znajdująca się w repozytorium, które każdy inżynier może pobrać, a niemal żaden nie może realistycznie wdrożyć. Jednego z nich nie można wywołać. Drugi można pobrać, a potem odkryć, że nie ma go na czym wywołać. Oba naprawdę znajdują się na granicy tych samych możliwości i żaden nie ma benchmarku, który został odtworzony przez kogokolwiek spoza grona jego własnych autorów.
Dwie wersje „nie możesz tego mieć”
Warto być precyzyjnym, ponieważ sformułowanie „niedostępne” ukrywa prawdziwą różnicę.
SeedRealtime jest niedostępny w taki sposób, w jaki bywa niedostępny produkt konsumencki: istnieje, działa, ma użytkowników, a drzwi są po prostu zamknięte dla deweloperów. Nie ma API, nie ma cennika, nie ma portalu dokumentacji ani podanego harmonogramu jego powstania. Droga ByteDance na rynek wiodła przez aplikację, a aplikacja wystarczała. To, co dostajesz jako twórca, to demo, którego możesz doświadczyć, ale nie możesz go zintegrować.
Realtime-Venus jest niedostępny w taki sposób, w jaki niedostępny jest artefakt badawczy: wagi są publiczne, licencja jest permisywna, kod jest dostępny, a nikt go nie uruchamia. Repozytorium nie zostało wdrożone przez żadnego dostawcę inferencji, a pobrania nie są w ogóle śledzone, więc nie ma publicznego sygnału o adopcji w żadną stronę. Jest dostępny w sensie, który liczy się dla badacza, i niedostępny w sensie, który liczy się dla menedżera produktu.
Wzięte razem, tworzą pytanie, na którym obecnie utknęła cała ta kategoria: modele, które działają, kryją się za aplikacjami konsumenckimi, a modele, które możesz uruchomić, nie są nigdzie wdrożone produkcyjnie.
Oba znajdują się na poziomie, który faktycznie wyróżnia 2026
Przydatnym sposobem odczytywania obszaru czasu rzeczywistego są trzy poziomy. Pierwszy to półdupleksowy głos z doklejoną wizją — asystenci turowi, którzy potrafią widzieć, ale wciąż działają naprzemiennie. Drugi to pełny dupleks audio: słuchanie i mówienie jednocześnie, bez kamery — własny Seeduplex ByteDance, GPT-Live OpenAI, Grok Voice Think Fast 2.0 od xAI. Trzeci to pełny dupleks audiowizualny, w którym percepcja i ekspresja w sposób ciągły obejmują wideo i audio.
SeedRealtime to pierwszy model na trzecim poziomie, który osiągnął wielkoskalowe wdrożenie komercyjne. Realtime-Venus to uczestnik z otwartymi wagami na tym samym poziomie — wideo przez enkoder SigLIP2, audio przez Whisper-Medium, szkielet Qwen3-8B oraz jednosekundowa pętla interakcji, która nigdy nie przestaje postrzegać. Jego karta modelu stwierdza, że został zaadaptowany z MiniCPM-o 4.5, omnimodalnego modelu OpenBMB wydanego wcześniej w 2026 roku, co umieszcza wkład Ant Group w etapie post-trainingu i w środowisku wykonawczym, a nie w architekturze bazowej.
To, co je łączy i co stawia je o klasę wyżej od systemów wyłącznie audio, polega na tym, że żaden z nich nie zatrzymuje się, by popatrzeć. Ciągłe postrzeganie wzrokowe podczas mówienia to zupełnie inna zdolność niż opisywanie pojedynczej klatki, a oba modele zbudowano wokół niej.
Ile warte są liczby każdego z nich

Żaden z modeli nie ma benchmarku strony trzeciej. Dowody nie są jednak równoważne, a różnica ma znaczenie.
• SeedRealtime nie publikuje żadnego benchmarku. To, co oferuje ByteDance, to twierdzenie, że problemy z rytmem dialogu — przerywanie użytkownikowi, odpowiadanie z opóźnieniem, reagowanie na hałas osoby postronnej — zmniejszają się o około połowę w porównaniu z systemem kaskadowym, na podstawie całościowych ocen ludzkich. Dane źródłowe nie są publikowane.
• Liczby poprzednika mają ten sam układ. O Seeduplexie, modelu wyłącznie audio, który ByteDance wprowadził do Doubao w kwietniu 2026 roku, donoszono, że w wielkoskalowym teście A/B o połowę zmniejszył odsetek fałszywych odpowiedzi i fałszywych przerwań, skrócił opóźnienie wykrywania końca wypowiedzi o około 250 milisekund, ograniczył przedwczesne odpowiedzi o 40% i podniósł satysfakcję z rozmowy o 8,34 punktu. Wszystkie dane pochodzą od producenta.
• Realtime-Venus publikuje tabelę. W swoim raporcie twierdzi, że osiąga najlepsze wyniki w sześciu z ośmiu benchmarków wideo, w tym StreamingBench 70,2, OVO-Bench 64,7 i Daily-Omni 81,3, oraz przoduje w MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8 i Speech CMMLU 67,8 w przypadku checkpointu audio.
• Jedno i drugie jest nieodtworzone. Opublikowana tabela, której nikt nie sprawdził, i nieopublikowany test A/B, którego nikt nie może sprawdzić, to różne rodzaje niezweryfikowanych danych. Żadne z nich nie jest dowodem, na którym można oprzeć decyzję zakupową.
Jedynym porównaniem, które warto przeprowadzić w liczbach Realtime-Venus, jest porównanie z jego własnym modelem bazowym. MiniCPM-o 4.5 osiąga 80,2 w Daily-Omni; Realtime-Venus-Omni osiąga 81,3. Jednopunktowy wzrost względem modelu, z którego został zaadaptowany, na benchmarku, z którym ten model już sobie radził, to wiarygodny wynik jak na wysiłek związany z dotrenowaniem i dostrojeniem działania — i znacznie mniejsze twierdzenie niż to, jak brzmi samo w sobie „najlepszy w sześciu z ośmiu”.

Problem naprzemienności mówienia, czyli tam, gdzie tkwi full-duplex
Full-duplex nie jest funkcją związaną z opóźnieniem. To zestaw zachowań: umiejętność rozpoznawania, kiedy pauza oznacza „myślę”, a nie „skończyłem”, odróżnianie rozmowy osoby postronnej od osoby mówiącej do ciebie oraz zachowywanie ciszy podczas backchannelu, zamiast traktowania „mm-hm” jako przerwania.
Podejście SeedRealtime polega na natywnym modelowaniu stanu konwersacji i całkowitej rezygnacji z zewnętrznego detektora aktywności głosowej, tak aby przejmowanie tur było wyuczonym zachowaniem wewnątrz sieci, a nie progiem stosowanym do strumienia audio. To samo założenie architektoniczne przyjmuje Realtime-Venus, a oba rozwiązania są przeciwstawiane systemom kaskadowym, które wymagają osobnego komponentu do decydowania, kto mówi.
Różnica w dowodach polega na tym, że twierdzenie SeedRealtime dotyczy wdrożenia na dużą skalę — setek milionów użytkowników, prawdziwych pokoi, prawdziwego hałasu — podczas gdy twierdzenie Realtime-Venus dotyczy benchmarku. Wyniki Full-Duplex-Bench v1.5 dla Realtime-Venus-Audio — 75% odpowiedzi na przerwania, 97% kontynuacji w przypadku sygnałów podtrzymujących, 88% w przypadku mowy kierowanej do innych i 86% w przypadku mowy w tle, przewyższające Gemini 3.1 Live i GPT-4o pod względem kontynuacji — to najbardziej bezpośrednio istotne liczby, jakie którykolwiek z modeli opublikował dla tego problemu. Są też w całości oparte na własnych deklaracjach, a 97% kontynuacji w przypadku sygnałów podtrzymujących to uderzająca liczba, która zasługuje na drugiego czytelnika, zanim ktokolwiek zacytuje ją jako fakt.
Gdzie każdy z nich zostawia budowniczego
Praktyczna luka nie dotyczy jakości, lecz kształtu oferty.
• SeedRealtime — możesz go wypróbować w Doubao za darmo, a zintegrować go — nigdy. Nie ma ścieżki od „to jest imponujące” do „to jest w moim produkcie”.
• Realtime-Venus — możesz go pobrać, dostroić, uruchomić w środowisku odizolowanym od sieci i sprawdzić każdą warstwę. Koszt to dwa checkpointy 9B w BF16, każdy o wadze około osiemnastu gigabajtów, plus nieprzerwana pętla strumieniowania rozliczana co sekundę, co oznacza węzeł GPU, który nalicza opłaty niezależnie od tego, czy ktokolwiek go wywoła.
• Żadne z nich nie ma opcji hostowanej. Żadnego z nich nie da się wypróbować za pomocą klucza i jednego popołudnia.
Ten ostatni punkt jest powodem, dla którego te dwa modele są bardziej przydatne jako para niż jako przeciwnicy. Wspólnie pokazują, że obie połowy problemu są rozwiązane — możliwości działają, a wagi można udostępnić — pokazując jednocześnie, że nikt jeszcze nie połączył ich w coś, co programista mógłby faktycznie wywołać.
Istnieje obejście, po które sięgnie wiele zespołów, i warto jasno powiedzieć, co ono obejmuje, a czego nie. Jeśli nie możesz uzyskać warstwy głosowej, nadal możesz zbudować część, która myśli. Realtime-Venus deleguje swoją kosztowną pracę — wyszukiwanie, trudne rozumowanie, wywołania biznesowych API — do mechanizmu działającego w tle za pomocą asynchronicznych znaczników delegowania, a ten delegowany etap to zwykłe wnioskowanie tekstowe. OrcaRouter nie oferuje ani Realtime-Venus, ani SeedRealtime; obie warstwy dupleksowe są poza tym, co obsługujemy, i nie hostujemy żadnej z nich. Prawie 200 modeli tekstowych za jednym kluczem w cenie katalogowej dostawcy bez marży to połowa architektury, którą obejmujemy, z automatycznym przełączaniem awaryjnym, dzięki czemu zadanie w tle nie zawodzi, bo jeden z dostawców miał zły dzień, DSL routingu do komponowania kilku modeli w jedno wywołanie, oraz fuzja modeli, gdy osąd pojedynczego modelu nie wystarcza. To nie jest ta część tych systemów, która jest trudna. To ta część, którą faktycznie można kupić.

Co zmieniłoby to porównanie
Trzy wydarzenia rozstrzygnęłyby tę sprawę, a żadne z nich jeszcze nie nastąpiło. Niezależny benchmark Realtime-Venus, ponieważ tabela bez drugiego czytelnika to twierdzenie, a nie wynik. API dla SeedRealtime, ponieważ model z najsilniejszymi dowodami wdrożeniowymi jest obecnie tym, którego nikt nie może używać. I opublikowana wartość opóźnienia któregoś z nich — czas do pierwszego dźwięku to metryka, na podstawie której kupuje się tę kategorię, a w chwili pisania tego tekstu żaden z modeli takiej wartości nie podał.
Do tego czasu uczciwe podsumowanie wygląda tak: SeedRealtime jest dowodem na to, że audiowizualny pełny dupleks działa w skali konsumenckiej, a Realtime-Venus jest dowodem na to, że wagi można otworzyć — i żaden z tych faktów nie przybliża twórcy ani o krok do wypuszczenia produktu. To nie jest krytyka żadnego z tych laboratoriów. To opis kategorii, która rozwiązała problem badawczy, ale jeszcze nie problem dystrybucji.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
