Główna karta tytułowa dla 'GPT-Live-1 vs Sesame Preview', z podtytułem 'Najlepszy głos tutaj to ten bez API', z plakietką z napisem 'Jeden jest darmowy i zamknięty, jeden jest płatny i wywoływalny' oraz trzema kartami: 'Sesame Preview — darmowa aplikacja, brak API, produkcyjny głos nieopublikowany', 'GPT-Live-1 — $0.05 za minutę głosu, publiczne API od 10 września 2026' i 'Część Sesame, którą można zbudować — CSM-1B, Apache-2.0, 1 mld parametrów, $7 za 1 mln znaków lub self-host', nad paskiem stopki o treści 'Produkcyjny głos Sesame nie ma opublikowanego benchmarku; dane głosowe GPT-Live-1 są raportowane przez OpenAI.' Logo OrcaRouter jest złożone w prawym dolnym rogu.
Guides & Insights

GPT-Live-1 vs Sesame Preview: Najlepszy głos w tym porównaniu to ten, którego nie można kupić

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

Zapytaj kogokolwiek, kto używał obu, a ranking nie pozostawia wątpliwości: Sesame Preview to najbardziej przekonujący asystent głosowy, z jakim rozmawiała większość ludzi. To także ten, na którym nie da się budować. GPT-Live-1 i Sesame Preview są nieustannie porównywane — oba prowadzą rozmowę, oba radzą sobie z przerywaniem, oba brzmią jak człowiek, a nie jak automat telefoniczny — ale oferuje się je w przeciwny sposób. GPT-Live-1 to model hostowany, wynajmowany na minuty, publicznie dostępny od 10 września 2026 r. Sesame Preview to darmowa aplikacja konsumencka bez żadnego API, a głos, który robi wrażenie, działa na modelu produkcyjnym, który nigdy nie został wydany.

Czym każdy z nich właściwie jest

• GPT-Live-1 — pełnodupleksowy model głosowy OpenAI, w ChatGPT od 8 lipca 2026 r., w API od 10 września w cenie 0,05 USD za minutę głosu. Dwanaście głosów w API, bez klonowania, bez wprowadzania obrazu lub wideo, transkrypcje i tekst odpowiedzi zwracane przy każdej sesji.

• Sesame Preview — konsumencki asystent głosowy Sesame. Bezpłatny na iOS od maja 2026 r., powszechnie dostępny na Androidzie od początku sierpnia 2026 r., a dodatkowo internetowy podgląd stawiający głos na pierwszym miejscu. Czterej agenci — Maya, Miles, Simone i Charlie — tylko po angielsku, z 30-minutowym limitem rozmowy, który spada do 5 minut po wylogowaniu.

• CSM-1B — otwarta część Sesame: model mowy konwersacyjnej o rozmiarze 1B udostępniony na licencji Apache 2.0 23 kwietnia 2026 r., zbudowany na szkielecie architektury Llama z osobnym dekoderem i kodekiem Mimi firmy Kyutai, generujący 24 kHz monofoniczną mowę angielską z kontekstu około 4K tokenów.

Trzy powyższe wiersze to cały kształt tej decyzji. Jedna firma sprzedaje model w rozliczeniu za minutę. Druga oddaje aplikację za darmo i udostępnia jako open source mniejszy model, który nie jest tym użytym w aplikacji.

Różnica między demem a pobraniem

Sesame wypowiedziało się w tej kwestii wyjątkowo bezpośrednio i jest to absolutnie najważniejszy fakt dla każdego, kto ocenia tę parę. Głos w aplikacji Preview — ten, który odpowiada za viralowe klipy i recenzje „najlepszego w swojej klasie trybu głosowego” — to większy, zamknięty model produkcyjny. CSM-1B to otwarty checkpoint o 1 mld parametrów z tego samego laboratorium, a według oceny osób, które testowały oba, to wyraźnie słabszy głos. Sesje w Preview mają też limity i są dostępne wyłącznie w języku angielskim, a nie ma możliwości wykonywania zadań: agenci rozmawiają, nie rezerwują, nie kupują ani nie składają żadnych dokumentów.

To pozostawia deweloperom realną, ale węższą ofertę: konwersacyjny checkpoint mowy do samodzielnego hostowania, bez opłaty licencyjnej, hostowany przez jednego zewnętrznego dostawcę inferencji za 7 USD za milion znaków — około 0,35 USD za godzinę syntetyzowanego audio — albo bezpłatnie na własnym sprzęcie. Nikt nie opublikował niezależnego benchmarku ani dla głosu Preview, ani dla CSM-1B, więc każda opinia o jakości w którąkolwiek stronę jest wrażeniem słuchowym, a nie pomiarem. Sesame nie opublikowało również publicznego cennika, wersji enterprise ani planu monetyzacji; deklarowany kierunek firmy to partnerstwa badawcze i planowany produkt sprzętowy.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

Co można kupić za 0,05 dolara za minutę, czego nie daje darmowa wersja

Argument GPT-Live-1 skierowany do dewelopera nie polega na tym, że brzmi lepiej, bo z tym argumentem nie da się wygrać przeciwko zamkniętemu modelowi, którego nikt nie może zmierzyć. Polega na tym, że tę rzecz można wywołać i ma cenę. Konkretnie, co dostajesz, gdy licznik bije:

• Sesja, którą kontrolujesz — jeden identyfikator modelu, jeden punkt końcowy Live Sessions, opublikowany przykład integracji działający przez WebRTC oraz sesja, którą konfigurujesz za pomocą instrukcji, głosów i bloku delegowania.

• Obsługa przerwań jako udokumentowane zachowanie — 80,1% interaktywności w Full Duplex Bench v1.5 wobec 45,4% dla GPT-Realtime-2.1, przy opóźnieniu przejmowania tury wynoszącym 0,798 sekundy i 87% skuteczności wywoływania narzędzi. Wszystkie trzy to własne liczby OpenAI, opublikowane wraz z wydaniem i nieodtworzone przez nikogo w chwili pisania.

• Wybrany przez Ciebie backend rozumowania — warstwa głosowa przekazuje ciężką pracę przez asynchroniczną granicę do osobnego modelu wskazanego w konfiguracji sesji, który kontynuuje pracę, gdy rozmowa trwa. W przykładzie z dokumentacji Ope​nAI tym backendem jest GPT-5.6 Terra; na lipcowej premierze konsumenckiej był to GPT-5.5.

• Transkrypcje, tekst odpowiedzi i rozliczanie wzorowane na telefonii — 3,00 USD za godzinę ciągłego otwartego połączenia, rozliczane co sekundę, przy czym 15 sekund inicjalizacji sesji jest zaliczane, a nie doliczane.

Sesame daje ci lepszą rozmowę i żadnej z tych rzeczy. Jeśli budujesz produkt, „lepsza rozmowa, brak API, brak ceny, brak benchmarku, tylko angielski, limit 30 minut” to nie jest porównanie — to lista oczekujących.

Na GPT-Live-1 jest teraz liczba, której nie było w momencie jego premiery konsumenckiej, i stanowi ona uczciwą przeciwwagę dla wszystkiego powyżej. Indeks Speech to Speech firmy Artificial Analysis przyznaje GPT-Live-1 wynik 69,8% — siódme miejsce na jedenaście modeli, za GPT-Realtime-2.1 z 73,9% i za Grok Voice Think Fast 2.0 z 79,0%. Tak więc model, który możesz kupić, również nie jest najlepszym na niezależnej tablicy wyników. To, czego tablica wyników nie może ocenić, jest tym, w czym Sesame faktycznie wygrywa: żaden z jedenastu modeli w tym indeksie nie został oceniony pod kątem tego, jak się z nim rozmawia, a głos Sesame Preview nie ma nigdzie swojego wiersza.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

Element stosu, który nie należy do żadnej z firm

Tu oba warianty się zbiegają i tu decyzja przestaje być binarna. Ani Sesame Preview, ani GPT-Live-1 nie jest kompletnym agentem. Agenci Sesame nie wykonują zadań; GPT-Live-1 wprost deleguje wszystko, co wymaga rozumowania, wyszukiwania lub narzędzia, do modelu backendowego. W obu projektach interesująca praca dzieje się za głosem, w zwykłym wywołaniu modelu tekstowego, a ta warstwa jest przenośna w sposób, w jaki warstwa głosowa nie jest — można przenieść backend, nie nagrywając ponownie ani jednego promptu dla modelu mowy.

Ten backend to również miejsce, w którym OrcaRouter jest przydatny, i warto być precyzyjnym co do tego, co obsługujemy, a czego nie. Nie routujemy GPT-Live-1: endpoint Live Sessions należy do OpenAI, a warstwa głosowa jest tam poza naszym zasięgiem. Nie routujemy też produkcyjnego modelu Sesame, z prostszego powodu — nigdy nie został udostępniony jako API. Routujemy natomiast warstwę, której oba produkty przekazują pracę. Około 190 modeli od jedenastu dostawców upstream działa za jednym kluczem w cenie katalogowej dostawcy, bez marży, z automatycznym przełączaniem awaryjnym między dostawcami oraz DSL routingu, który potrafi złożyć kilka modeli w jedno wywołanie. Dla zespołu budującego na nieprzetestowanym interfejsie głosowym właśnie to zabezpieczenie ma znaczenie: warstwę mowy można wymienić lub porzucić, nie zabierając ze sobą warstwy rozumowania, a model, na który postawiłeś w marcu, można zastąpić w czerwcu, edytując jedną linię.

Co obejrzeć

Trzy rzeczy zmieniłyby to porównanie, a żadna z nich nie jest jeszcze w niczyich rękach. API Sesame — nawet płatne — natychmiast zamieniłoby najsilniejszy głos w tej kategorii w opcję, na której da się budować, i postawiłoby realną cenę obok 0,05 USD za GPT-Live-1. Opublikowany benchmark głosu Preview zamieniłby wrażenie słuchowe w liczbę, a niezależne oceny bywają niełaskawe dla głosów, które kiedykolwiek rywalizowały wyłącznie w demach. A pierwsze zewnętrzne odtworzenie wyników Ope​nAI dotyczących interaktywności i opóźnień rozstrzygnęłoby, czy pełny dupleks to rzeczywista luka w możliwościach, czy dobrze dobrana metoda oceny.

Do tego czasu uczciwy podział wygląda tak. Jeśli wybierasz głos dla siebie, użyj Sesame Preview — jest darmowy, jest lepszy, a preferowanie go nic cię nie kosztuje. Jeśli wybierasz głos do produktu, który musisz wdrożyć, sprzedawać i wspierać, GPT-Live-1 jest jedynym z tych dwóch, który naprawdę możesz kupić, a to, że nie jest tym lepiej brzmiącym, jest ceną wstępu.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie