
Realtime-Venus vs Sesame Preview: Det du kan få är inte det som är bra
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus och Sesame Preview är byggda av labb med helt olika idéer om vad en röstmodell är till för, och de har snubblat in i exakt samma fälla från motsatta håll. Sesame Preview är en kostnadsfri konsumentapp – iOS sedan maj 2026, Android sedan början av augusti – med fyra samtalsagenter, livesökning på webben under samtal och en röst som recensenter har kallat bäst i klassen. De öppna vikter som Sesame publicerade är en annan, mindre modell som företaget självt inte presenterar som rösten du hörde i demon. Realtime-Venus, det full-duplexsystem på 9B från Ant Group's Venus Team och Tsinghua University, gick motsatt väg: de nedladdningsbara artefakterna är det riktiga, och det finns ingen produkt alls. I båda fallen är gapet mellan vad som är tillgängligt och vad som är imponerande det mest användbara att förstå innan du planerar något kring någon av dem.
Vad var och en faktiskt är

Sesame Preview är en produkt. Sesame är ett labb i San Francisco som grundades 2023 av Brendan Iribe, Ankit Kumar och Ryan Brown, med stöd från a16z, Sequoia, Spark och Matrix, och dess röstassistent för konsumenter levereras med fyra personligheter – Maya, Miles, Simone och Charlie – var och en med en distinkt läggning och röst. Agenten kan söka på webben mitt i en konversation, skapa anteckningar och påminnelser samt skicka en sammanfattning efter ett samtal. Minnet är per agent och synkroniseras mellan webb och mobil när du är inloggad, med ett inkognitoläge som läser tidigare minnen utan att skriva nya. Det är gratis, det visar inga annonser, och företaget säger att det inte säljer data.
Realtime-Venus är en forskningsrelease. Två 9B-checkpoints under Apache-2.0 på Hugging Face – Realtime-Venus-Omni för audiovisuell interaktion och Realtime-Venus-Audio för talad interaktion – plus en teknisk rapport som lämnats in till arXiv den 12 september 2026, en projektsida och ett medföljande kodförråd som innehåller komponenten Realtime-Venus-Harness. Det finns ingen app, inget API, inget pris och inget tillkännagivande från leverantören. Kodförrådet driftsätts inte av någon inferensleverantör, och nedladdningar spåras inte.
Fällan, i båda riktningarna
Sesames version är den klassiska open-washing-formen, och Sesame är ärligare om det än de flesta. CSM-checkpointen som labbet släppte under Apache-2.0 är en basmodell för talgenerering – en Llama-stomme som matar en Mimi-codec-avkodare – och dokumentationen är tydlig med att den inte är appens röst och inte ett end-to-end-system för tal-till-tal. Den kan inte generera text, och den är tränad på i huvudsak engelska data med begränsad kapacitet utanför det. Det som driver Sesame Preview är en större produktionsmodell som inte har släppts. Så om du letade efter rösten från demon hittade du forskningslinjen bakom den, inte själva saken. När en av de fyra agenterna svarar på ditt samtal hör du något som du inte kan ladda ner.
Realtime-Venus-versionen är spegelbilden, och möjligen den märkligare. Allt som publiceras är äkta: riktiga vikter, riktig kod, riktig rapport, en tillåtande licens. Det som saknas är något sätt att använda den som inte innebär att äga en GPU. Två 9B-checkpoints i BF16 är ungefär arton gigabyte vikter styck innan aktiveringsminne, och båda är utformade för att köra en kontinuerlig ettsekundsströmningsloop med live-ljud- och videoinmatning. Det är en driftsättning i serverklass. En konsumentapp som levererar samma kapacitet till en telefon gör något som den här utgåvan inte försöker sig på, och gapet mellan en nedladdningsbar modell och en körbar modell är precis där de flesta som vill ha den kommer att fastna.
Mätbarhet är den skarpare skillnaden
Ingen av modellerna har ett oberoende röstkvalitetsbetyg, men anledningarna skiljer sig.
• Sesame Preview — ingen post i arenan, ingen publicerad utvärdering av produktionsrösten. Dess rykte vilar på recensenter och på originaldemons effekt på lyssnarna, vilket är en form av verklig bevisning och helt okvantifierad.
• CSM-1B — den öppna checkpointen är en basgenereringsmodell; den är inte benchmarkad mot konversationssystem eftersom den inte är ett sådant.
• Realtime-Venus — en självrapporterad röstsiffra, ett VoiceBench AlpacaEval-poäng på 4,81 som dess rapport beskriver som matchande det bästa jämförelsetalet. Ingen tredje part har utvärderat den.
• Det som ingen av dem ger dig – en siffra framtagen av någon som inte har något intresse i resultatet. Om röstkvalitet är ditt köpkriterium är hela jämförelsen omöjlig att poängsätta, och det hederliga draget är att lyssna på båda och bestämma själv i stället för att förlita sig på en tabell.
Turtagning, där båda har något att bevisa
Sesames rykte byggdes på exakt detta. Demon som gjorde labbet känt var en röst med andning, tvekan och avbrottstiming som var tillräckligt övertygande för att lyssnarna skulle anta att en person var i luren. Det är ett påstående om samtalsdynamik, och det är vad produkten säljs på.
Realtime-Venus gör samma påstående med siffror bifogade. På Full-Duplex-Bench v1.5 rapporterar dess ljudcheckpoint att den svarar på 75 % av användaravbrott, med fortsättningsfrekvenser på 97 % vid backchannels, 88 % vid tal riktat till andra och 86 % vid bakgrundstal — uppges överträffa Gemini 3.1 Live och GPT-4o på alla tre fortsättningsmått. Dessa siffror kommer från dess egen rapport och ingen har reproducerat dem.
Så jämförelsen är en demo utan siffra mot en siffra utan demo, vilket är en genuint besvärlig position att befinna sig i och en rättvisande beskrivning av hur hela den här kategorin rapporterar om sig själv just nu. Det enda som med säkerhet kan sägas är att inget av påståendena har överlevt en utomstående parts granskning, och 97 % fortsättning under bakkanaler är tillräckligt hög för att förtjäna en sådan innan den citeras som fastställd.

Vad du faktiskt kan bygga
Sesame Preview ger en utvecklare ingenting. Det finns inget API, ingen modellidentifierare, ingen prislista och ingen uttalad plan för en sådan. Samtal begränsas till trettio minuter när man är inloggad och fem annars, engelska är det enda officiellt stödda språket, och agenten kommer att undersöka och komma ihåg men inte utföra uppgifter – den kommer inte att boka flyget. Gratisnivån är produkten. Det är ett alldeles utmärkt erbjudande för konsumenter och en återvändsgränd för integration.
Realtime-Venus ger en byggare allt utom en plats att köra det på. Vikterna har tillåtande licenser, koden laddas med standardanrop till Transformers, full duplex-strömning aktiveras med ett enda metodbyte, och den dokumenterade loopen är en sekund av strömmande prefill följt av strömmande generering, upprepade gånger. Långvideominne aktiveras med en parameter för minnesminuter och beskrivs som träningsfritt, vilket är ovanligt för en funktion som normalt kräver finjustering. Två förbehåll dokumenteras i stället för att lämnas att upptäckas: ett bildtak som tyst trunkerar lång video om inte en konstant höjs före importen av verktyget, och ett krav på CJK-teckensnitt för icke-latinska undertexter som renderas in i duplexvideo.
Det ingen av allt detta ändrar är att harnessen – komponenten som kör de asynkrona delegeringarna, som utgör den mest utmärkande delen av arkitekturen – finns i ett separat GitHub-repositorium, är långt mindre dokumenterad än modellen och är den del vars produktionsberedskap är svårast att bedöma. I en verklig driftsättning är delegeringsbenet vanlig textinferens som sitter bakom ett konversationellt gränssnitt. OrcaRouter har varken Realtime-Venus eller Sesame Preview; båda röstskikten ligger utanför det vi erbjuder, och vi säger det rakt ut i stället för att antyda en hostingrelation som inte finns. Nästan 200 textmodeller bakom en enda nyckel till leverantörens listpris utan påslag är halvan av den arkitekturen som vi faktiskt täcker, med automatisk failover så att en delegerad uppgift överlever ett avbrott uppströms, ett routing-DSL som komponerar flera modeller till ett anrop, och modellfusion där en enda modells omdöme inte räcker. Det är den köpbara delen av en design vars intressanta del inte är till salu.

Den ärliga rekommendationen
Om du är en konsument som vill ha den bäst klingande konversationsrösten som finns tillgänglig idag och inte behöver integrera den, är Sesame Preview gratis, den finns på båda mobilplattformarna, och dess rykte är så välförtjänt att recensenter fortsätter säga det. Använd den och njut av den.
Om du är forskare eller ett ingenjörsteam med goda resurser som behöver en öppen audiovisuell full-duplex-stack som du kan granska och finjustera, är Realtime-Venus ett av de mycket få verkliga alternativen, och att dess benchmarks är egenrapporterade ändrar inte att vikterna är verkligt öppna och arkitekturen är verkligt dokumenterad.
Om du är ett produktteam som letar efter ett röstlager att lansera det här kvartalet, är inget av dem ditt svar, och den användbara lärdomen av att jämföra dem är varför. Ett labb byggde något utmärkt och höll den bra delen stängd; det andra publicerade allt och lät dig stå för infrastrukturen. Kategorin har visat att den kan skapa en röst värd att lyssna på och har ännu inte bestämt om den rösten bör gå att köpa i någon annan form än en app.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
