
Realtime-Venus kontra Sesame Preview: to, co możesz dostać, nie jest tym, co jest dobre
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus i Sesame Preview powstały w laboratoriach o całkowicie odmiennych wyobrażeniach na temat tego, do czego służy model głosowy, i z przeciwnych kierunków wpadły w tę samą pułapkę. Sesame Preview to darmowa aplikacja konsumencka — na iOS od maja 2026 r., na Androida od początku sierpnia — z czterema konwersacyjnymi agentami, wyszukiwaniem w sieci na żywo podczas rozmów i głosem, który recenzenci uznali za najlepszy w swojej klasie. Opublikowane otwarte wagi Sesame to inny, mniejszy model, którego sama firma nie przedstawia jako głosu, który usłyszałeś w demie. Realtime-Venus, 9B system pełnodupleksowy od zespołu Venus należącego do Ant Group i Uniwersytetu Tsinghua, obrał przeciwny kierunek: artefakty do pobrania to prawdziwy model, a produktu nie ma w ogóle. W obu przypadkach różnica między tym, co jest dostępne, a tym, co robi wrażenie, jest najbardziej przydatną rzeczą do zrozumienia, zanim cokolwiek zaplanujesz w oparciu o którykolwiek z nich.
Czym każdy z nich właściwie jest

Sesame Preview to produkt. Sesame to założone w 2023 roku laboratorium z San Francisco, założone przez Brendana Iribe’a, Ankita Kumara i Ryana Browna i wspierane przez a16z, Sequoia, Spark oraz Matrix; jego konsumencki asystent głosowy ma cztery osobowości — Maya, Miles, Simone i Charlie — każda o odrębnym temperamencie i głosie. Agent może wyszukiwać w sieci w trakcie rozmowy, tworzyć notatki i przypomnienia oraz wysyłać podsumowanie po rozmowie. Pamięć jest przypisana do agenta i synchronizuje się między wersją internetową a mobilną, gdy jesteś zalogowany, a tryb incognito odczytuje wcześniejsze wspomnienia bez zapisywania nowych. Jest bezpłatny, nie wyświetla reklam, a firma twierdzi, że nie sprzedaje danych.
Realtime-Venus to wydanie badawcze. Dwa checkpointy 9B na licencji Apache-2.0 na Hugging Face — Realtime-Venus-Omni do interakcji audiowizualnej i Realtime-Venus-Audio do interakcji głosowej — plus raport techniczny przesłany do arXiv 12 września 2026 r., strona projektu i towarzyszące repozytorium zawierające komponent Realtime-Venus-Harness. Nie ma aplikacji, API, ceny ani ogłoszenia od dostawcy. Repozytorium nie jest wdrożone przez żadnego dostawcę inferencji, a pobrania nie są śledzone.
Pułapka, w obu kierunkach
Wersja Sesame ma klasyczny kształt open-washingu, a Sesame jest w tej kwestii uczciwsza niż większość. Wydany przez laboratorium checkpoint CSM na licencji Apache-2.0 to bazowy model generowania mowy — szkielet Llama zasilający dekoder kodeka Mimi — a dokumentacja wyraźnie mówi, że nie jest to głos aplikacji ani kompleksowy system mowa-do-mowy. Nie potrafi generować tekstu, a wytrenowano go głównie na danych angielskojęzycznych, przez co ma ograniczone możliwości poza tym językiem. Tym, co napędza Sesame Preview, jest większy model produkcyjny, który nie został udostępniony. Jeśli więc szukałeś głosu z dema, trafiłeś na jego badawcze korzenie, a nie na niego samego. Kiedy jeden z czterech agentów odpowiada na twoje wezwanie, słyszysz coś, czego nie możesz pobrać.
Wersja Realtime-Venus jest lustrzanym odbiciem, i prawdopodobnie dziwniejszym. Wszystko, co opublikowano, jest autentyczne: prawdziwe wagi, prawdziwy kod, prawdziwy raport, permisywna licencja. Brakuje jednak jakiegokolwiek sposobu użycia go, który nie wiąże się z posiadaniem GPU. Dwa checkpointy 9B w BF16 to około osiemnaście gigabajtów wag każdy, jeszcze przed uwzględnieniem pamięci aktywacji, a oba są zaprojektowane do działania w ciągłej, jednosekundowej pętli strumieniowej z wejściem audio i wideo na żywo. To wdrożenie klasy serwerowej. Aplikacja konsumencka, która dostarcza tę samą funkcję na telefon, robi coś, czego to wydanie nawet nie próbuje, a przepaść między modelem do pobrania a modelem, który da się uruchomić, jest dokładnie tym miejscem, w którym utknie większość osób, które go chcą.
Mierzalność to ostrzejsza różnica
Żaden z modeli nie ma niezależnej oceny jakości głosu, ale powody są różne.
• Sesame Preview — brak wpisu w arenie, brak opublikowanej oceny głosu produkcyjnego. Reputacja Sesame Preview opiera się na recenzentach i na wpływie oryginalnego demo na słuchaczy, co jest pewnego rodzaju rzeczywistym dowodem i całkowicie niepoddanym kwantyfikacji.
• CSM-1B — otwarty checkpoint to bazowy model generacyjny; nie jest porównywany z systemami konwersacyjnymi, ponieważ nim nie jest.
• Realtime-Venus — jedna samodzielnie zgłoszona wartość dotycząca głosu, wynik VoiceBench AlpacaEval na poziomie 4,81, który jego raport opisuje jako dorównujący najlepszej wartości porównawczej. Nie oceniła go żadna strona trzecia.
• To, czego nie daje ci żadne z nich — liczby wytworzonej przez kogoś, kto nie ma żadnego interesu w wyniku. Jeśli jakość głosu jest twoim kryterium zakupu, całego porównania nie da się ocenić liczbowo, a uczciwym posunięciem jest posłuchać obu i samemu zdecydować, zamiast zdawać się na tabelę.
Naprzemienność, w której obie strony mają coś do udowodnienia
Reputacja Sesame została zbudowana dokładnie na tym. Demo, które rozsławiło laboratorium, było głosem z oddechem, wahaniem i wyczuciem momentu przerywania — wystarczająco przekonującym, by słuchacze założyli, że po drugiej stronie słuchawki jest człowiek. To twierdzenie o dynamice rozmowy i właśnie na tym opiera się sprzedaż tego produktu.
Realtime-Venus wysuwa to samo twierdzenie, tym razem z liczbami. W Full-Duplex-Bench v1.5 jego checkpoint audio raportuje reagowanie na 75% przerwań użytkownika, przy wskaźnikach kontynuacji wynoszących 97% w przypadku backchanneli, 88% w przypadku mowy kierowanej do innych i 86% w przypadku mowy w tle — miał przewyższać Gemini 3.1 Live i GPT-4o we wszystkich trzech metrykach kontynuacji. Liczby te pochodzą z jego własnego raportu i nikt ich nie zreplikował.
A więc porównanie to demo bez liczby przeciw liczbie bez dema, co jest naprawdę niezręczną sytuacją i uczciwym opisem tego, jak cała ta kategoria obecnie relacjonuje samą siebie. Jedno, co można powiedzieć z pewnością, to że żadne z tych twierdzeń nie przetrwało weryfikacji przez stronę trzecią, a kontynuacja na poziomie 97% w kanałach poufnych jest wystarczająco wysoka, by zasługiwała na taką weryfikację, zanim zostanie przytoczona jako rozstrzygnięta.

Co możesz faktycznie zbudować
Sesame Preview nie daje twórcy niczego. Nie ma API, identyfikatora modelu, cennika ani ogłoszonego planu jego udostępnienia. Połączenia są ograniczone do trzydziestu minut po zalogowaniu, a w innym przypadku do pięciu; angielski jest jedynym oficjalnie obsługiwanym językiem, a agent będzie wyszukiwać informacje i je zapamiętywać, ale nie będzie wykonywać zadań — nie zarezerwuje lotu. Darmowy plan to produkt. To zupełnie dobra oferta konsumencka i ślepy zaułek dla integracji.
Realtime-Venus daje twórcy wszystko oprócz miejsca do uruchomienia. Wagi są objęte liberalną licencją, kod ładuje się za pomocą standardowych wywołań Transformers, w strumieniowanie pełnodupleksowe wchodzi się za pomocą pojedynczego przełączenia metody, a udokumentowana pętla to jedna sekunda strumieniowego prefillu, po której następuje strumieniowe generowanie, powtarzana. Pamięć długich wideo jest włączana parametrem memory-minutes i jest opisywana jako niewymagająca trenowania, co jest nietypowe dla funkcji, która normalnie wymaga dostrajania. Dwa zastrzeżenia są udokumentowane, a nie pozostawione do odkrycia: limit liczby klatek, który po cichu obcina długie wideo, chyba że stała zostanie zwiększona przed importem narzędzia, oraz wymóg czcionki CJK dla nielacińskich napisów renderowanych w wideo duplex.
Czego to wszystko nie zmienia, to fakt, że harness — komponent wykonujący asynchroniczne delegacje, które są najbardziej charakterystyczną częścią architektury — znajduje się w osobnym repozytorium GitHub, jest znacznie słabiej udokumentowany niż model i to właśnie jego gotowość produkcyjną najtrudniej ocenić. W rzeczywistym wdrożeniu odnoga delegacji to zwykłe wnioskowanie tekstowe stojące za konwersacyjnym front endem. OrcaRouter nie zawiera ani Realtime-Venus, ani Sesame Preview; obie warstwy głosowe są poza tym, co oferujemy, i mówimy to wprost, zamiast sugerować relację hostingową, która nie istnieje.Prawie 200 modeli tekstowych za jednym kluczem w cenie katalogowej dostawcy bez marżyto ta połowa tej architektury, którą faktycznie obejmujemy, z automatycznym przełączaniem awaryjnym, dzięki któremu zdelegowane zadanie przetrwa awarię po stronie upstreamu, DSL-em routingu, który łączy kilka modeli w jedno wywołanie, oraz fuzją modeli, gdy osąd jednego modelu nie wystarcza. To jest ta część projektu, którą można kupić, a jego interesująca część nie jest na sprzedaż.

Szczera rekomendacja
Jeśli jesteś konsumentem, który chce najlepiej brzmiącego głosu konwersacyjnego dostępnego obecnie i nie musi go integrować, Sesame Preview jest darmowe, jest dostępne na obu platformach mobilnych, a jego reputacja jest wystarczająco zasłużona, że recenzenci wciąż tak mówią. Korzystaj z niego i ciesz się nim.
Jeśli jesteś badaczem lub zespołem inżynierskim dysponującym odpowiednimi zasobami, który potrzebuje otwartego stosu audiowizualnego pełnego dupleksu, jaki można samodzielnie sprawdzić i dostroić, Realtime-Venus jest jedną z bardzo niewielu rzeczywistych opcji, a to, że jego wyniki benchmarków są raportowane przez samych twórców, nie zmienia faktu, że wagi są naprawdę otwarte, a architektura naprawdę udokumentowana.
Jeśli jesteś zespołem produktowym szukającym warstwy głosowej do wdrożenia w tym kwartale, żadne z tych rozwiązań nie jest twoją odpowiedzią, a użytecznym wnioskiem z tego zestawienia jest to, dlaczego. Jedno laboratorium zbudowało coś doskonałego i zatrzymało dobrą część dla siebie; drugie opublikowało wszystko i pozostawiło ci dostarczenie infrastruktury. Ta kategoria udowodniła, że potrafi stworzyć głos wart słuchania, i jeszcze nie zdecydowała, czy ten głos powinien być możliwy do kupienia w jakiejkolwiek formie innej niż aplikacja.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
