
GPT-Live-1 vs Sesame Preview: Najlepszy głos w tym porównaniu to ten, którego nie można kupić
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod

Zapytaj kogokolwiek, kto używał obu, a ranking nie pozostawia wątpliwości: Sesame Preview to najbardziej przekonujący asystent głosowy, z jakim rozmawiała większość ludzi. To także ten, na którym nie da się budować. GPT-Live-1 i Sesame Preview są nieustannie porównywane — oba prowadzą rozmowę, oba radzą sobie z przerywaniem, oba brzmią jak człowiek, a nie jak automat telefoniczny — ale oferuje się je w przeciwny sposób. GPT-Live-1 to model hostowany, wynajmowany na minuty, publicznie dostępny od 10 września 2026 r. Sesame Preview to darmowa aplikacja konsumencka bez żadnego API, a głos, który robi wrażenie, działa na modelu produkcyjnym, który nigdy nie został wydany.
Czym każdy z nich właściwie jest
• GPT-Live-1 — pełnodupleksowy model głosowy OpenAI, w ChatGPT od 8 lipca 2026 r., w API od 10 września w cenie 0,05 USD za minutę głosu. Dwanaście głosów w API, bez klonowania, bez wprowadzania obrazu lub wideo, transkrypcje i tekst odpowiedzi zwracane przy każdej sesji.
• Sesame Preview — konsumencki asystent głosowy Sesame. Bezpłatny na iOS od maja 2026 r., powszechnie dostępny na Androidzie od początku sierpnia 2026 r., a dodatkowo internetowy podgląd stawiający głos na pierwszym miejscu. Czterej agenci — Maya, Miles, Simone i Charlie — tylko po angielsku, z 30-minutowym limitem rozmowy, który spada do 5 minut po wylogowaniu.
• CSM-1B — otwarta część Sesame: model mowy konwersacyjnej o rozmiarze 1B udostępniony na licencji Apache 2.0 23 kwietnia 2026 r., zbudowany na szkielecie architektury Llama z osobnym dekoderem i kodekiem Mimi firmy Kyutai, generujący 24 kHz monofoniczną mowę angielską z kontekstu około 4K tokenów.
Trzy powyższe wiersze to cały kształt tej decyzji. Jedna firma sprzedaje model w rozliczeniu za minutę. Druga oddaje aplikację za darmo i udostępnia jako open source mniejszy model, który nie jest tym użytym w aplikacji.
Różnica między demem a pobraniem
Sesame wypowiedziało się w tej kwestii wyjątkowo bezpośrednio i jest to absolutnie najważniejszy fakt dla każdego, kto ocenia tę parę. Głos w aplikacji Preview — ten, który odpowiada za viralowe klipy i recenzje „najlepszego w swojej klasie trybu głosowego” — to większy, zamknięty model produkcyjny. CSM-1B to otwarty checkpoint o 1 mld parametrów z tego samego laboratorium, a według oceny osób, które testowały oba, to wyraźnie słabszy głos. Sesje w Preview mają też limity i są dostępne wyłącznie w języku angielskim, a nie ma możliwości wykonywania zadań: agenci rozmawiają, nie rezerwują, nie kupują ani nie składają żadnych dokumentów.
To pozostawia deweloperom realną, ale węższą ofertę: konwersacyjny checkpoint mowy do samodzielnego hostowania, bez opłaty licencyjnej, hostowany przez jednego zewnętrznego dostawcę inferencji za 7 USD za milion znaków — około 0,35 USD za godzinę syntetyzowanego audio — albo bezpłatnie na własnym sprzęcie. Nikt nie opublikował niezależnego benchmarku ani dla głosu Preview, ani dla CSM-1B, więc każda opinia o jakości w którąkolwiek stronę jest wrażeniem słuchowym, a nie pomiarem. Sesame nie opublikowało również publicznego cennika, wersji enterprise ani planu monetyzacji; deklarowany kierunek firmy to partnerstwa badawcze i planowany produkt sprzętowy.

Co można kupić za 0,05 dolara za minutę, czego nie daje darmowa wersja
Argument GPT-Live-1 skierowany do dewelopera nie polega na tym, że brzmi lepiej, bo z tym argumentem nie da się wygrać przeciwko zamkniętemu modelowi, którego nikt nie może zmierzyć. Polega na tym, że tę rzecz można wywołać i ma cenę. Konkretnie, co dostajesz, gdy licznik bije:
• Sesja, którą kontrolujesz — jeden identyfikator modelu, jeden punkt końcowy Live Sessions, opublikowany przykład integracji działający przez WebRTC oraz sesja, którą konfigurujesz za pomocą instrukcji, głosów i bloku delegowania.
• Obsługa przerwań jako udokumentowane zachowanie — 80,1% interaktywności w Full Duplex Bench v1.5 wobec 45,4% dla GPT-Realtime-2.1, przy opóźnieniu przejmowania tury wynoszącym 0,798 sekundy i 87% skuteczności wywoływania narzędzi. Wszystkie trzy to własne liczby OpenAI, opublikowane wraz z wydaniem i nieodtworzone przez nikogo w chwili pisania.
• Wybrany przez Ciebie backend rozumowania — warstwa głosowa przekazuje ciężką pracę przez asynchroniczną granicę do osobnego modelu wskazanego w konfiguracji sesji, który kontynuuje pracę, gdy rozmowa trwa. W przykładzie z dokumentacji OpenAI tym backendem jest GPT-5.6 Terra; na lipcowej premierze konsumenckiej był to GPT-5.5.
• Transkrypcje, tekst odpowiedzi i rozliczanie wzorowane na telefonii — 3,00 USD za godzinę ciągłego otwartego połączenia, rozliczane co sekundę, przy czym 15 sekund inicjalizacji sesji jest zaliczane, a nie doliczane.
Sesame daje ci lepszą rozmowę i żadnej z tych rzeczy. Jeśli budujesz produkt, „lepsza rozmowa, brak API, brak ceny, brak benchmarku, tylko angielski, limit 30 minut” to nie jest porównanie — to lista oczekujących.
Na GPT-Live-1 jest teraz liczba, której nie było w momencie jego premiery konsumenckiej, i stanowi ona uczciwą przeciwwagę dla wszystkiego powyżej. Indeks Speech to Speech firmy Artificial Analysis przyznaje GPT-Live-1 wynik 69,8% — siódme miejsce na jedenaście modeli, za GPT-Realtime-2.1 z 73,9% i za Grok Voice Think Fast 2.0 z 79,0%. Tak więc model, który możesz kupić, również nie jest najlepszym na niezależnej tablicy wyników. To, czego tablica wyników nie może ocenić, jest tym, w czym Sesame faktycznie wygrywa: żaden z jedenastu modeli w tym indeksie nie został oceniony pod kątem tego, jak się z nim rozmawia, a głos Sesame Preview nie ma nigdzie swojego wiersza.

Element stosu, który nie należy do żadnej z firm
Tu oba warianty się zbiegają i tu decyzja przestaje być binarna. Ani Sesame Preview, ani GPT-Live-1 nie jest kompletnym agentem. Agenci Sesame nie wykonują zadań; GPT-Live-1 wprost deleguje wszystko, co wymaga rozumowania, wyszukiwania lub narzędzia, do modelu backendowego. W obu projektach interesująca praca dzieje się za głosem, w zwykłym wywołaniu modelu tekstowego, a ta warstwa jest przenośna w sposób, w jaki warstwa głosowa nie jest — można przenieść backend, nie nagrywając ponownie ani jednego promptu dla modelu mowy.
Ten backend to również miejsce, w którym OrcaRouter jest przydatny, i warto być precyzyjnym co do tego, co obsługujemy, a czego nie. Nie routujemy GPT-Live-1: endpoint Live Sessions należy do OpenAI, a warstwa głosowa jest tam poza naszym zasięgiem. Nie routujemy też produkcyjnego modelu Sesame, z prostszego powodu — nigdy nie został udostępniony jako API. Routujemy natomiast warstwę, której oba produkty przekazują pracę. Około 190 modeli od jedenastu dostawców upstream działa za jednym kluczem w cenie katalogowej dostawcy, bez marży, z automatycznym przełączaniem awaryjnym między dostawcami oraz DSL routingu, który potrafi złożyć kilka modeli w jedno wywołanie. Dla zespołu budującego na nieprzetestowanym interfejsie głosowym właśnie to zabezpieczenie ma znaczenie: warstwę mowy można wymienić lub porzucić, nie zabierając ze sobą warstwy rozumowania, a model, na który postawiłeś w marcu, można zastąpić w czerwcu, edytując jedną linię.
Co obejrzeć
Trzy rzeczy zmieniłyby to porównanie, a żadna z nich nie jest jeszcze w niczyich rękach. API Sesame — nawet płatne — natychmiast zamieniłoby najsilniejszy głos w tej kategorii w opcję, na której da się budować, i postawiłoby realną cenę obok 0,05 USD za GPT-Live-1. Opublikowany benchmark głosu Preview zamieniłby wrażenie słuchowe w liczbę, a niezależne oceny bywają niełaskawe dla głosów, które kiedykolwiek rywalizowały wyłącznie w demach. A pierwsze zewnętrzne odtworzenie wyników OpenAI dotyczących interaktywności i opóźnień rozstrzygnęłoby, czy pełny dupleks to rzeczywista luka w możliwościach, czy dobrze dobrana metoda oceny.
Do tego czasu uczciwy podział wygląda tak. Jeśli wybierasz głos dla siebie, użyj Sesame Preview — jest darmowy, jest lepszy, a preferowanie go nic cię nie kosztuje. Jeśli wybierasz głos do produktu, który musisz wdrożyć, sprzedawać i wspierać, GPT-Live-1 jest jedynym z tych dwóch, który naprawdę możesz kupić, a to, że nie jest tym lepiej brzmiącym, jest ceną wstępu.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
