Karta tytułowa hero z napisem 'GPT-Live-1 vs SeedRealtime', podtytułem 'Bardziej ambitny model, którego nie możesz wywołać' i wierszem 'Ogólnie dostępny w API vs tylko w aplikacji Doubao', nad dwoma panelami: lewy pokazuje otwarte drzwi z glifem nawiasu API i plakietką 'API', prawy pokazuje te same drzwi z kłódką w poprzek i plakietką 'NO API', każdy z ikoną audio i kamery łączącą przebieg fali z przysłoną, z logo OrcaRouter nałożonym w rogu.
Guides & Insights

GPT-Live-1 vs SeedRealtime: SeedRealtime to bardziej ambitny model, którego nie można kupić

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Porównanie GPT-Live-1 i SeedRealtime pod kątem możliwości daje niewygodną odpowiedź, ponieważ oba modele nie konkurują na tych samych zasadach. GPT-Live-1 to pełnodupleksowy model głosowy Ope​nAI, udostępniony w ChatGPT 8 lipca 2026 r. i otwarty dla deweloperów poprzez Live Sessions API 10 września 2026 r., z 12 głosami, opublikowaną stawką za minutę i jedną znaczącą luką: obsługa obrazu i wideo jest wyraźnie nieobsługiwana. SeedRealtime, wydany przez zespół Seed firmy ByteDance 5 sierpnia 2026 r., jest zbudowany w całości wokół tej luki. To natywny audiowizualny model pełnodupleksowy, który obserwuje, słucha i mówi w jednej architekturze end-to-end — i jest dostępny wyłącznie w aplikacji konsumenckiej Doubao, bez publicznego API, bez otwartych wag, bez raportu technicznego i bez opublikowanej liczby parametrów.

Co tak naprawdę może postrzegać każde z nich

Najczystszym sposobem, aby zobaczyć tę lukę, jest zapytać, co każdy model wie o pomieszczeniu, w którym się znajduje.

GPT-Live-1 słyszy. To cała powierzchnia wejściowa. Dźwięk i tekst wchodzą, dźwięk i tekst wychodzą, a dokumentacja Ope​nAI wymienia obraz i wideo jako nieobsługiwane. Bardzo dobrze radzi sobie z konwersacyjną mechaniką słuchania — wielokrotnie w ciągu sekundy decyduje, czy dalej słuchać, wstrzymać się, przerwać czy wywołać narzędzie, i utrzymuje pełny dupleks, dzięki czemu przetwarza przychodzący dźwięk, nawet gdy mówi. Zwraca też transkrypcje rozpoznawania mowy razem z dźwiękiem, co jest tym rodzajem nieefektownego szczegółu, który oszczędza tydzień pracy nad integracją.

SeedRealtime słyszy i widzi, w jednym modelu, a nie w potoku. ByteDance opisuje ujednoliconą architekturę, która przetwarza razem dźwięk, wideo i tekst, rozwiązując niejednoznaczności za pomocą kontekstu wizualnego — rozróżniając homofony, rozumiejąc, do czego odnosi się „to”, na podstawie sceny, gestu, spojrzenia i wcześniejszych działań — oraz prowadząc percepcję, rozumienie, podejmowanie decyzji i ekspresję równolegle, a nie sekwencyjnie. Opublikowane demonstracje ByteDance obejmują hałaśliwą kolację grupową, podczas której model musi przypisać głosy do tożsamości, wizytę w muzeum, korygowanie procesu parzenia espresso oraz tłumienie zakłóceń na lotnisku przy jednoczesnym utrzymywaniu pamięci pozaekranowej i wyszukiwaniu w internecie.

• Wejścia — GPT-Live-1 tylko audio i tekst, obraz i wideo wyraźnie nieobsługiwane w porównaniu do SeedRealtime, w którym audio, wideo i tekst są połączone w jednym modelu

• Przełączanie tur — GPT-Live-1 podejmuje decyzje wewnętrznie, wiele razy na sekundę, podczas gdy SeedRealtime przenosi przełączanie tur do wnętrza modelu i całkowicie usuwa zewnętrzny detektor aktywności głosowej

• Proaktywne zachowanie — GPT-Live-1 odpowiada, deleguje i wywołuje narzędzia, natomiast SeedRealtime jest opisywany jako odzywający się bez zachęty, gdy docelowy obiekt pojawi się w polu widzenia

• Dostępność — GPT-Live-1 jest ogólnie dostępny w API OpenAI w cenie 0,05 USD za minutę, w porównaniu z SeedRealtime bezpłatnym w Doubao, bez API i bez przewidywanego terminu jego udostępnienia

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

Jakość dowodów idzie w odwrotnym kierunku niż ambicja

To tutaj porównanie przestaje schlebiać ByteDance.

OpenAI publikuje liczby. Są to jego własne liczby: porównuje GPT-Live-1 z GPT-Realtime-2.1, a nie z konkurentem, i żadne niezależne laboratorium ich nie odtworzyło — 80,1% w interaktywności full-duplex wobec 45,4%, opóźnienie przejmowania tur skrócone z 1,4 sekundy do 0,8, dokładność wywoływania narzędzi z 60% do 87%. To, że badania prowadzi dostawca i nie zostały odtworzone, to prawdziwe zastrzeżenie, i jest to zastrzeżenie, które można przynajmniej przypiąć do liczby.

ByteDance publikuje prawie nic. Główne twierdzenie dotyczące SeedRealtime to kompleksowa ocena ludzka typu end-to-end, która mówi, że zmniejsza o połowę problemy z tempem rozmowy audio-wizualnej w porównaniu z kaskadowymi systemami ASR-plus-vision-plus-TTS — mniej przerwań w połowie zdania, mniej wolnych odpowiedzi po pauzie, mniej fałszywych wyzwolenia przez hałas w tle. Nie podano liczebności próby, metodologii, dokładnej wartości poprawy ani żadnej liczby dotyczącej opóźnień. Nie podano również liczby parametrów ani raportu technicznego.

Wynik jest taki, że model o ciekawszej architekturze jest tym, który można ocenić w najmniejszym stopniu. To nie to samo, co twierdzenie, że działa gorzej — demonstracje są naprawdę uderzające, a opis inżynieryjny dotyczący wejścia audio-wizualnego dzielonego na fragmenty i generowania strumieniowego sugeruje prawdziwy system, a nie demo — ale oznacza to, że każde porównanie jakości tych dwóch jest obecnie porównaniem między udokumentowanym modelem a imponującym wideo.

Dlaczego luka w API to nie szczegół

SeedRealtime został w pełni wdrożony w Doubao od 5 sierpnia 2026 r., zarówno w wersji głosowej, jak i wideo, bezpłatnie. Nie ma punktu końcowego Volcano Engine ani BytePlus, płatnego planu, opublikowanego limitu przydziału ani podanego terminu otwarcia dostępu dla deweloperów. Roadmapa ByteDance wspomina o niższym opóźnieniu, dokładniejszym śledzeniu mówiącego i zadaniach połączonych z narzędziami; nie wspomina o dacie.

Jest jeszcze zastrzeżenie dotyczące dostępu, które dodatkowo to potęguje. Doubao to produkt w pierwszej kolejności kierowany na Chiny kontynentalne i zazwyczaj wymaga numeru komórkowego z Chin kontynentalnych do rejestracji, a nie ogłoszono zlokalizowanej wersji angielskiej. Dla zespołu spoza Chin SeedRealtime nie tylko nie zostało jeszcze uruchomione jako API — jako produkt również jest nieosiągalne.

Zestaw to z obciążeniem integracyjnym samego GPT-Live-1, a kompromis staje się konkretny. API Ope​nAI jest wąskie w sposób, który zaskakuje ludzi: jeden identyfikator modelu, jeden endpoint pod v1/live/sessions, transport WebRTC z obsługą zdarzeń na kanale danych i żadnej ścieżki przez Chat Completions, Responses, Realtime, Batch ani endpointy dostrajania. Limity szybkości są wyrażane w równoczesnych sesjach — 25 na poziomie Tier 1, rosnąc przez 50, 200, 300 i 500 — a nie w żądaniach na minutę, a poziom darmowy nie może w ogóle wywołać modelu. To nowa integracja, ale wciąż integracja, którą możesz zacząć jeszcze dziś po południu.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Dwie odpowiedzi na ten sam problem z delegowaniem

Oba modele odrzucają starą kaskadową konstrukcję, w której rozpoznawanie mowy, model językowy i synteza mowy działają sekwencyjnie, z około 1,7 sekundy martwej ciszy między turami. Odrzucają ją w różny sposób, a ta różnica mówi, który z nich jest stworzony do rozmowy telefonicznej, a który do pracy w pomieszczeniu.

GPT-Live-1 dzieli pracę w pionie. Szybka warstwa głosowa prowadzi rozmowę; wszystko cięższe — wyszukiwanie w sieci, głębsze rozumowanie, praca agentowa — jest przekazywane do osobnego modelu rozumującego przez Responses API, podczas gdy rozmowa trwa. Opublikowany przez Ope​nAI przykład WebRTC podłącza ten backend do GPT-5.6 Terra. Konsekwencją jest to, że połowa odpowiedzialna za myślenie to zwykłe wywołanie modelu tekstowego, rozliczane za token, a więc coś, co można wybierać, wymieniać i trasować niezależnie od warstwy głosowej. W przypadku linii wsparcia to właściwy kształt: głos jest interfejsem, a rozumowanie — produktem.

SeedRealtime trzyma wszystko w jednej sieci i właśnie dzięki temu może przyglądać się gestowi, gdy wypowiedź jest w połowie zdania. To również sprawia, że nie da się go rozłożyć — nie można wymienić połowy odpowiedzialnej za rozumowanie, ponieważ takiej połowy nie ma, a nie można go uruchomić nigdzie indziej, ponieważ nie ma gdzie go uruchomić.

Jeśli dziś budujesz agenta głosowego, ta różnica to cała decyzja. Tylko jeden z tych dwóch jest komponentem, który możesz umieścić w architekturze. GPT-5.6 Terra, backend w przykładzie delegowania Ope​nAI, jest udostępniany przez OrcaRouter w cenie 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych z kontekstem 1 mln tokenów oraz udostępnionymi zarówno /v1/chat/completions, jak i /v1/responses — obok około 190 innych modeli na jednym kluczu, dzięki czemu warstwę rozumowania stojącą za agentem głosowym można rozdzielić, wycenić i przełączyć awaryjnie bez ingerencji w ścieżkę audio. Ani GPT-Live-1, ani SeedRealtime nie są udostępniane przez OrcaRouter; pochodzą wyłącznie od swoich dostawców i żaden router tego nie zmieni.

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

Co zmieniłoby odpowiedź?

Trzy rzeczy, w kolejności prawdopodobieństwa.

• Deweloperskie API ByteDance. Jeśli SeedRealtime pojawi się w Volcano Engine lub BytePlus z opublikowanym cennikiem, przestaje być studium przypadku i staje się produktem naprawdę wyróżniającym się na tle innych — pełny dupleks audiowizualny bez hostowanego konkurenta na Zachodzie. To sygnał, którego należy wypatrywać, a on się nie pojawił.

• Wizja pojawia się w hostowanym API głosowym. Dokumentacja GPT-Live-1 wyraźnie podaje, że obrazy i wideo nie są obsługiwane, co brzmi nie tyle jak przeoczenie, ile jak celowa granica pierwszego wydania. Jeśli OpenAI wprowadzi funkcję wideo, którą demonstruje w innych miejscach ChatGPT, luka w możliwościach, która czyni SeedRealtime interesującym, znacznie się zmniejszy.

• Jakikolwiek niezależny pomiar SeedRealtime. Zewnętrzna wartość opóźnienia lub liczba parametrów pozwoliłyby porównać oba pod względem czegoś innego niż ambicja.

Praktyczny werdykt dla każdego, kto buduje teraz, jest krótki. GPT-Live-1 to jedyny z tych dwóch, który możesz wdrożyć, a w cenie 0,05 USD za minutę rozliczaną co sekundę, z dwunastoma głosami i udokumentowanym punktem końcowym, jest rozsądnym domyślnym wyborem do głosu konwersacyjnego. SeedRealtime to ciekawszy model i całkiem możliwe, że nawet ten o większych możliwościach; jest też jednak na razie demonstracją tego, jak wygląda skonwergowana architektura audiowizualna, a nie produktem, który możesz pokazać klientowi. Zalicz go do rzeczy, którym warto się przyglądać, a nie tych, na których warto budować.