
GPT-Live-1 vs Sesame Preview: De beste stem in deze vergelijking is degene die je niet kunt kopen
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen

Vraag het aan iedereen die beide heeft gebruikt, en de rangorde is allesbehalve nipt: Sesame Preview is de meest overtuigende stemassistent die de meeste mensen ooit hebben gesproken. Het is ook degene waarop je niet kunt bouwen. GPT-Live-1 en Sesame Preview worden voortdurend met elkaar vergeleken — beide zijn conversationeel, beide kunnen omgaan met onderbrekingen, beide klinken als een persoon in plaats van een keuzemenu — maar ze worden op tegenovergestelde manieren aangeboden. GPT-Live-1 is een gehost model dat je per minuut huurt, sinds 10 september 2026 publiekelijk aanroepbaar. Sesame Preview is een gratis consumenten-app zonder enige API, en de stem waar mensen van onder de indruk zijn, draait op een productiemodel dat nooit is uitgebracht.
Wat elk daadwerkelijk is
• GPT-Live-1 — OpenAI's full-duplex spraakmodel, sinds 8 juli 2026 in ChatGPT, sinds 10 september in de API voor $0,05 per stemminuut. Twaalf API-stemmen, geen cloning, geen beeld- of video-invoer, transcripten en antwoordtekst worden bij elke sessie geretourneerd.
• Sesame Preview — Sesame's spraakassistent voor consumenten. Sinds mei 2026 gratis op iOS, sinds begin augustus 2026 breed beschikbaar op Android, plus een webpreview waarin spraak vooropstaat. Vier agents — Maya, Miles, Simone en Charlie — alleen Engels, met een limiet van 30 minuten per gesprek die naar 5 minuten gaat wanneer je niet bent ingelogd.
• CSM-1B — het deel van Sesame dat open is: een 1B conversationeel spraakmodel dat op 23 april 2026 onder Apache 2.0 is uitgebracht, gebouwd op een Llama-architectuur-backbone met een afzonderlijke decoder en Kyutai's Mimi-codec, dat 24 kHz mono Engelse spraak produceert vanuit een context van ongeveer 4K tokens.
De drie regels hierboven zijn de volledige vorm van de beslissing. Het ene bedrijf verkoopt een model per minuut. Het andere geeft een app weg en brengt een kleiner model als open source uit dat niet het model in de app is.
De kloof tussen de demo en de download
Sesame is hierover ongewoon direct geweest, en het is het allerbelangrijkste feit voor iedereen die het tweetal beoordeelt. De stem in de Preview-app — degene die de virale clips en de recensies over de 'beste stemmodus in zijn klasse' heeft voortgebracht — is een groter, gesloten productiemodel. CSM-1B is een open checkpoint met 1B parameters van hetzelfde lab, en volgens de beoordeling van mensen die beide hebben gedraaid, is het een duidelijk zwakkere stem. Sessies op Preview zijn ook gemaximeerd en beperkt tot Engels, en er is geen taakuitvoering: de agents praten, ze boeken, kopen of dienen niets in.
Dat laat ontwikkelaars een reëel maar beperkter aanbod: een zelf te hosten checkpoint voor conversationele spraak zonder licentiekosten, gehost door één externe inferentieprovider tegen $7 per miljoen tekens — ongeveer $0,35 per uur gesynthetiseerde audio — of gratis op je eigen hardware. Niemand heeft een onafhankelijke benchmark gepubliceerd van de Preview-stem of van CSM-1B, dus elke kwaliteitsclaim in welke richting dan ook is een luisterindruk, geen meting. Sesame heeft ook geen openbare prijsstelling, geen enterprise-tier en geen monetisatieplan gepubliceerd; de aangegeven richting van het bedrijf is onderzoekspartnerschappen en een gepland hardwareproduct.

Wat $0,05 per minuut biedt dat gratis niet doet
De pitch van GPT-Live-1 aan een ontwikkelaar is niet dat het beter klinkt, want dat argument is onwinbaar tegen een gesloten model dat niemand kan meten. Het is dat het ding aanroepbaar en geprijsd is. Concreet: wat je krijgt terwijl de meter loopt:
• Een sessie die u beheert — één model-ID, één Live Sessions-endpoint, het gepubliceerde integratievoorbeeld dat via WebRTC draait, en een sessie die u configureert met instructies, stemmen en een delegatieblok.
• Onderbrekingsafhandeling als gedocumenteerd gedrag — 80,1% interactiviteit op Full Duplex Bench v1.5 tegenover 45,4% voor GPT-Realtime-2.1, met een latentie van 0,798 seconde bij de beurtwisseling en 87% succes bij het aanroepen van tools. Alle drie zijn OpenAI's eigen cijfers, gepubliceerd bij de release en op het moment van schrijven door niemand gereproduceerd.
• Een reasoning-backend die jij kiest — de stemlaag geeft zwaar werk via een asynchrone grens door aan een afzonderlijk model dat in de sessieconfiguratie wordt genoemd, en dat blijft doorwerken terwijl het gesprek doorgaat. In het documentatievoorbeeld van OpenAI is die backend GPT-5.6 Terra; bij de consumentenlancering in juli was dat GPT-5.5.
• Transcripties, antwoordtekst en telefonie-achtige facturering — $3,00 voor een uur doorlopend open lijn, per seconde in rekening gebracht, waarbij 15 seconden sessie-initialisatie worden gecrediteerd in plaats van toegevoegd.
Sesame geeft je een beter gesprek en geen van die dingen. Als je een product bouwt, is "beter gesprek, geen API, geen prijs, geen benchmark, alleen Engels, limiet van 30 minuten" geen vergelijking — het is een wachtlijst.
Er staat nu een cijfer op GPT-Live-1 dat bij de consumentenlancering nog niet bestond, en het is het eerlijke tegenwicht voor alles hierboven. De Speech to Speech Index van Artificial Analysis geeft GPT-Live-1 een score van 69,8% — zevende van elf modellen, achter GPT-Realtime-2.1 met 73,9% en achter Grok Voice Think Fast 2.0 met 79,0%. Het model dat je kunt kopen is dus ook niet het beste op de onafhankelijke ranglijst. Wat de ranglijst niet kan beoordelen, is precies het punt waarop Sesame eigenlijk wint: geen van de elf modellen op die index werd beoordeeld op hoe het voelt om ermee te praten, en de Sesame Preview-stem heeft nergens een rij.

Het deel van de stack dat van geen van beide bedrijven is
Dit is waar beide opties samenkomen, en waar de beslissing niet langer binair is. Noch Sesame Preview, noch GPT-Live-1 is een volledige agent. De agents van Sesame voeren geen taken uit; GPT-Live-1 delegeert alles wat redeneren, retrieval of een tool vereist, expliciet aan een backendmodel. In beide ontwerpen gebeurt het interessante werk achter de stem, in een gewone tekstmodelaanroep, en die laag is overdraagbaar op een manier waarop de stemlaag dat niet is — je kunt een backend verplaatsen zonder ook maar één prompt voor het spraakmodel opnieuw op te nemen.
Die backend is ook waar OrcaRouter van pas komt, en het loont de moeite precies te zijn over wat we wel en niet aanbieden. We routeren GPT-Live-1 niet: het Live Sessions-endpoint is van OpenAI, en de spraaklaag daar is buiten bereik. We routeren ook het productiemodel van Sesame niet, om de eenvoudiger reden dat het nooit als API is aangeboden. Wat we wel routeren is de laag waaraan beide producten werk uitbesteden. Ongeveer 190 modellen van elf upstream-providers draaien achter één sleutel tegen de listprijs van de provider, zonder opslag, met automatische failover tussen providers en een routing-DSL die meerdere modellen in één aanroep kan samenbrengen. Voor een team dat op een onbewezen spraakfront-end bouwt, is dat de hedge die ertoe doet: de spraaklaag kan worden vervangen of achtergelaten zonder dat de redeneerlaag mee hoeft, en het model waar je in maart op hebt ingezet, kan in juni worden vervangen door één regel aan te passen.
Wat te kijken
Drie dingen zouden deze vergelijking veranderen, en geen ervan is vooralsnog in iemands handen. Een Sesame API — zelfs een betaalde — zou de sterkste stem in de categorie onmiddellijk veranderen in een optie waarop je kunt bouwen, en zou een echte prijs naast de $0,05 van GPT-Live-1 zetten. Een gepubliceerde benchmark van de Preview-stem zou een luisterindruk omzetten in een cijfer, en onafhankelijke evaluaties zijn vaak onvriendelijk voor stemmen die alleen ooit in demo's hebben meegedaan. En de eerste externe reproductie van OpenAI's cijfers voor interactiviteit en latentie zou bepalen of full duplex een echte capaciteitskloof is of een goed gekozen evaluatie.
Tot die tijd is de eerlijke tweedeling deze. Als je een stem voor jezelf kiest, gebruik dan Sesame Preview — het is gratis, het is beter, en het kost je niets om er de voorkeur aan te geven. Als je een stem kiest voor een product dat je moet uitbrengen, verkopen en ondersteunen, is GPT-Live-1 de enige van de twee die je daadwerkelijk kunt kopen, en het feit dat het niet de beter klinkende is, is de toegangsprijs.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
