Hero-titelkort för "Realtime-Venus vs Sesame Preview", med underrubriken "Två labb, samma fälla, motsatta riktningar", med tre kort som lyder "Sesame Preview: gratisapp, fyra agenter, inget API sedan maj 2026", "Realtime-Venus: Apache-2.0-vikter, ingen produkt, inget tillkännagivande" och "Ingen av dem publicerar ett oberoende verifierat röstbetyg", ovanför en sidfotsremsa som lyder "Sesame-funktioner enligt dess egen dokumentation för mobilförhandsvisning; Realtime-Venus-siffror från dess tekniska rapport, ej reproducerade." OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Realtime-Venus vs Sesame Preview: Det du kan få är inte det som är bra

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Realtime-Venus och Sesame Preview är byggda av labb med helt olika idéer om vad en röstmodell är till för, och de har snubblat in i exakt samma fälla från motsatta håll. Sesame Preview är en kostnadsfri konsumentapp – iOS sedan maj 2026, Android sedan början av augusti – med fyra samtalsagenter, livesökning på webben under samtal och en röst som recensenter har kallat bäst i klassen. De öppna vikter som Sesame publicerade är en annan, mindre modell som företaget självt inte presenterar som rösten du hörde i demon. Realtime-Venus, det full-duplexsystem på 9B från Ant Group's Venus Team och Tsinghua University, gick motsatt väg: de nedladdningsbara artefakterna är det riktiga, och det finns ingen produkt alls. I båda fallen är gapet mellan vad som är tillgängligt och vad som är imponerande det mest användbara att förstå innan du planerar något kring någon av dem.

Vad var och en faktiskt är

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview är en produkt. Sesame är ett labb i San Francisco som grundades 2023 av Brendan Iribe, Ankit Kumar och Ryan Brown, med stöd från a16z, Sequoia, Spark och Matrix, och dess röstassistent för konsumenter levereras med fyra personligheter – Maya, Miles, Simone och Charlie – var och en med en distinkt läggning och röst. Agenten kan söka på webben mitt i en konversation, skapa anteckningar och påminnelser samt skicka en sammanfattning efter ett samtal. Minnet är per agent och synkroniseras mellan webb och mobil när du är inloggad, med ett inkognitoläge som läser tidigare minnen utan att skriva nya. Det är gratis, det visar inga annonser, och företaget säger att det inte säljer data.

Realtime-Venus är en forskningsrelease. Två 9B-checkpoints under Apache-2.0 på Hugging Face – Realtime-Venus-Omni för audiovisuell interaktion och Realtime-Venus-Audio för talad interaktion – plus en teknisk rapport som lämnats in till arXiv den 12 september 2026, en projektsida och ett medföljande kodförråd som innehåller komponenten Realtime-Venus-Harness. Det finns ingen app, inget API, inget pris och inget tillkännagivande från leverantören. Kodförrådet driftsätts inte av någon inferensleverantör, och nedladdningar spåras inte.

Fällan, i båda riktningarna

Sesames version är den klassiska open-washing-formen, och Sesame är ärligare om det än de flesta. CSM-checkpointen som labbet släppte under Apache-2.0 är en basmodell för talgenerering – en Llama-stomme som matar en Mimi-codec-avkodare – och dokumentationen är tydlig med att den inte är appens röst och inte ett end-to-end-system för tal-till-tal. Den kan inte generera text, och den är tränad på i huvudsak engelska data med begränsad kapacitet utanför det. Det som driver Sesame Preview är en större produktionsmodell som inte har släppts. Så om du letade efter rösten från demon hittade du forskningslinjen bakom den, inte själva saken. När en av de fyra agenterna svarar på ditt samtal hör du något som du inte kan ladda ner.

Realtime-Venus-versionen är spegelbilden, och möjligen den märkligare. Allt som publiceras är äkta: riktiga vikter, riktig kod, riktig rapport, en tillåtande licens. Det som saknas är något sätt att använda den som inte innebär att äga en GPU. Två 9B-checkpoints i BF16 är ungefär arton gigabyte vikter styck innan aktiveringsminne, och båda är utformade för att köra en kontinuerlig ettsekundsströmningsloop med live-ljud- och videoinmatning. Det är en driftsättning i serverklass. En konsumentapp som levererar samma kapacitet till en telefon gör något som den här utgåvan inte försöker sig på, och gapet mellan en nedladdningsbar modell och en körbar modell är precis där de flesta som vill ha den kommer att fastna.

Mätbarhet är den skarpare skillnaden

Ingen av modellerna har ett oberoende röstkvalitetsbetyg, men anledningarna skiljer sig.

• Sesame Preview — ingen post i arenan, ingen publicerad utvärdering av produktionsrösten. Dess rykte vilar på recensenter och på originaldemons effekt på lyssnarna, vilket är en form av verklig bevisning och helt okvantifierad.

• CSM-1B — den öppna checkpointen är en basgenereringsmodell; den är inte benchmarkad mot konversationssystem eftersom den inte är ett sådant.

• Realtime-Venus — en självrapporterad röstsiffra, ett VoiceBench AlpacaEval-poäng på 4,81 som dess rapport beskriver som matchande det bästa jämförelsetalet. Ingen tredje part har utvärderat den.

• Det som ingen av dem ger dig – en siffra framtagen av någon som inte har något intresse i resultatet. Om röstkvalitet är ditt köpkriterium är hela jämförelsen omöjlig att poängsätta, och det hederliga draget är att lyssna på båda och bestämma själv i stället för att förlita sig på en tabell.

Turtagning, där båda har något att bevisa

Sesames rykte byggdes på exakt detta. Demon som gjorde labbet känt var en röst med andning, tvekan och avbrottstiming som var tillräckligt övertygande för att lyssnarna skulle anta att en person var i luren. Det är ett påstående om samtalsdynamik, och det är vad produkten säljs på.

Realtime-Venus gör samma påstående med siffror bifogade. På Full-Duplex-Bench v1.5 rapporterar dess ljudcheckpoint att den svarar på 75 % av användaravbrott, med fortsättningsfrekvenser på 97 % vid backchannels, 88 % vid tal riktat till andra och 86 % vid bakgrundstal — uppges överträffa Gemini 3.1 Live och GPT-4o på alla tre fortsättningsmått. Dessa siffror kommer från dess egen rapport och ingen har reproducerat dem.

Så jämförelsen är en demo utan siffra mot en siffra utan demo, vilket är en genuint besvärlig position att befinna sig i och en rättvisande beskrivning av hur hela den här kategorin rapporterar om sig själv just nu. Det enda som med säkerhet kan sägas är att inget av påståendena har överlevt en utomstående parts granskning, och 97 % fortsättning under bakkanaler är tillräckligt hög för att förtjäna en sådan innan den citeras som fastställd.

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

Vad du faktiskt kan bygga

Sesame Preview ger en utvecklare ingenting. Det finns inget API, ingen modellidentifierare, ingen prislista och ingen uttalad plan för en sådan. Samtal begränsas till trettio minuter när man är inloggad och fem annars, engelska är det enda officiellt stödda språket, och agenten kommer att undersöka och komma ihåg men inte utföra uppgifter – den kommer inte att boka flyget. Gratisnivån är produkten. Det är ett alldeles utmärkt erbjudande för konsumenter och en återvändsgränd för integration.

Realtime-Venus ger en byggare allt utom en plats att köra det på. Vikterna har tillåtande licenser, koden laddas med standardanrop till Transformers, full duplex-strömning aktiveras med ett enda metodbyte, och den dokumenterade loopen är en sekund av strömmande prefill följt av strömmande generering, upprepade gånger. Långvideominne aktiveras med en parameter för minnesminuter och beskrivs som träningsfritt, vilket är ovanligt för en funktion som normalt kräver finjustering. Två förbehåll dokumenteras i stället för att lämnas att upptäckas: ett bildtak som tyst trunkerar lång video om inte en konstant höjs före importen av verktyget, och ett krav på CJK-teckensnitt för icke-latinska undertexter som renderas in i duplexvideo.

Det ingen av allt detta ändrar är att harnessen – komponenten som kör de asynkrona delegeringarna, som utgör den mest utmärkande delen av arkitekturen – finns i ett separat GitHub-repositorium, är långt mindre dokumenterad än modellen och är den del vars produktionsberedskap är svårast att bedöma. I en verklig driftsättning är delegeringsbenet vanlig textinferens som sitter bakom ett konversationellt gränssnitt. OrcaRouter har varken Realtime-Venus eller Sesame Preview; båda röstskikten ligger utanför det vi erbjuder, och vi säger det rakt ut i stället för att antyda en hostingrelation som inte finns. Nästan 200 textmodeller bakom en enda nyckel till leverantörens listpris utan påslag är halvan av den arkitekturen som vi faktiskt täcker, med automatisk failover så att en delegerad uppgift överlever ett avbrott uppströms, ett routing-DSL som komponerar flera modeller till ett anrop, och modellfusion där en enda modells omdöme inte räcker. Det är den köpbara delen av en design vars intressanta del inte är till salu.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

Den ärliga rekommendationen

Om du är en konsument som vill ha den bäst klingande konversationsrösten som finns tillgänglig idag och inte behöver integrera den, är Sesame Preview gratis, den finns på båda mobilplattformarna, och dess rykte är så välförtjänt att recensenter fortsätter säga det. Använd den och njut av den.

Om du är forskare eller ett ingenjörsteam med goda resurser som behöver en öppen audiovisuell full-duplex-stack som du kan granska och finjustera, är Realtime-Venus ett av de mycket få verkliga alternativen, och att dess benchmarks är egenrapporterade ändrar inte att vikterna är verkligt öppna och arkitekturen är verkligt dokumenterad.

Om du är ett produktteam som letar efter ett röstlager att lansera det här kvartalet, är inget av dem ditt svar, och den användbara lärdomen av att jämföra dem är varför. Ett labb byggde något utmärkt och höll den bra delen stängd; det andra publicerade allt och lät dig stå för infrastrukturen. Kategorin har visat att den kan skapa en röst värd att lyssna på och har ännu inte bestämt om den rösten bör gå att köpa i någon annan form än en app.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen