
Realtime-Venus vs Sesame Preview: la cosa che puoi ottenere non è la cosa che è buona
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus e Sesame Preview sono stati creati da laboratori con idee completamente diverse su a cosa serva un modello vocale, e sono incappati nella stessa identica trappola provenendo da direzioni opposte. Sesame Preview è un'app consumer gratuita — iOS da maggio 2026, Android dall'inizio di agosto — con quattro agenti conversazionali, ricerca web in tempo reale durante le chiamate e una voce che i recensori hanno definito la migliore della categoria. I pesi aperti pubblicati da Sesame sono un modello diverso e più piccolo che l'azienda stessa non presenta come la voce che hai sentito nella demo. Realtime-Venus, il sistema full-duplex da 9B del Venus Team di Ant Group e dell'Università di Tsinghua, ha seguito la direzione opposta: gli artefatti scaricabili sono quelli veri, e non esiste alcun prodotto. In entrambi i casi, il divario tra ciò che è disponibile e ciò che è impressionante è la cosa più utile da capire prima di pianificare qualsiasi cosa basandovi su uno dei due.
Cosa sia in realtà ognuno

Sesame Preview è un prodotto. Sesame è un laboratorio di San Francisco fondato nel 2023 da Brendan Iribe, Ankit Kumar e Ryan Brown, sostenuto da a16z, Sequoia, Spark e Matrix, e il suo assistente vocale per i consumatori include quattro personalità — Maya, Miles, Simone e Charlie — ognuna con un temperamento e una voce distinti. L'agente può cercare sul web durante la conversazione, prendere appunti e impostare promemoria, e inviare un riepilogo dopo una chiamata. La memoria è per agente e si sincronizza tra web e mobile quando hai effettuato l'accesso, con una modalità incognito che legge le memorie passate senza scriberne di nuove. È gratuito, non mostra pubblicità e l'azienda dichiara di non vendere dati.
Realtime-Venus è una release di ricerca. Due checkpoint da 9B con licenza Apache-2.0 su Hugging Face — Realtime-Venus-Omni per l'interazione audiovisiva e Realtime-Venus-Audio per l'interazione vocale — più un rapporto tecnico inviato ad arXiv il 12 settembre 2026, una pagina di progetto e un repository companion che contiene il componente Realtime-Venus-Harness. Non c'è un'app, nessuna API, nessun prezzo e nessun annuncio dal fornitore. Il repository non è distribuito da alcun provider di inferenza e i download non sono tracciati.
La trappola, in entrambe le direzioni
La versione di Sesame è la classica forma di open-washing, e Sesame è più onesta al riguardo di quanto lo siano la maggior parte degli altri. Il checkpoint CSM che il laboratorio ha rilasciato sotto Apache-2.0 è un modello base di generazione vocale — un backbone Llama che alimenta un decoder del codec Mimi — e la documentazione è esplicita sul fatto che non è la voce dell'app né un sistema speech-to-speech end-to-end. Non può generare testo ed è addestrato su dati principalmente in inglese con capacità limitata al di fuori di esso. Ciò che alimenta Sesame Preview è un modello di produzione più grande che non è stato rilasciato. Quindi, se cercavi la voce della demo, hai trovato la sua discendenza di ricerca e non la cosa in sé. Quando uno dei quattro agenti risponde alla tua chiamata, stai ascoltando qualcosa che non puoi scaricare.
La versione di Realtime-Venus è l'immagine speculare, e probabilmente quella più strana. Tutto ciò che è pubblicato è autentico: pesi reali, codice reale, report reale, una licenza permissiva. Ciò che manca è qualsiasi modo di usarlo che non implichi possedere una GPU. Due checkpoint da 9B in BF16 pesano all'incirca diciotto gigabyte di pesi ciascuno prima della memoria di attivazione, ed entrambi sono progettati per eseguire un ciclo di streaming continuo di un secondo con input audio e video in tempo reale. Si tratta di un deployment di classe server. Un'app consumer che distribuisce la stessa capacità su un telefono fa qualcosa che questa release non tenta di fare, e il divario tra un modello scaricabile e uno eseguibile è esattamente il punto in cui la maggior parte delle persone che lo vogliono resterà bloccata.
La misurabilità è la differenza più netta
Nessuno dei due modelli ha un punteggio indipendente della qualità vocale, ma le ragioni differiscono.
• Sesame Preview — nessun ingresso in arena, nessuna valutazione pubblicata della voce di produzione. La sua reputazione si basa sui recensori e sull'effetto della demo originale sugli ascoltatori, che è una prova reale di un certo tipo e del tutto non quantificata.
• CSM-1B — il checkpoint aperto è un modello di generazione di base; non viene valutato in benchmark rispetto a sistemi conversazionali perché non è tale.
• Realtime-Venus — un singolo valore vocale autodichiarato, un punteggio VoiceBench AlpacaEval di 4,81 che il suo report descrive come corrispondente al miglior valore di confronto. Nessuna terza parte lo ha valutato.
• Ciò che nessuno dei due ti dà — un numero prodotto da qualcuno che non ha alcun interesse nel risultato. Se la qualità della voce è il tuo criterio d'acquisto, l'intero confronto è impossibile da valutare, e la mossa onesta è ascoltare entrambi e decidere da solo invece di affidarti a una tabella.
Alternanza dei turni, dove entrambi hanno qualcosa da dimostrare
La reputazione di Sesame è stata costruita esattamente su questo. La demo che ha reso famoso il laboratorio era una voce con respiro, esitazione e tempi di interruzione abbastanza convincenti da far supporre agli ascoltatori che ci fosse una persona in linea. Si tratta di un'affermazione sulle dinamiche conversazionali, ed è ciò su cui viene venduto il prodotto.
Realtime-Venus fa la stessa affermazione, corredata di numeri. Su Full-Duplex-Bench v1.5 il suo checkpoint audio riporta di rispondere al 75% delle interruzioni dell'utente, con tassi di continuazione del 97% in presenza di backchannel, dell'88% in caso di discorso rivolto ad altri e dell'86% in caso di discorso di sottofondo — dichiarato di superare Gemini 3.1 Live e GPT-4o su tutte e tre le metriche di continuazione. Tali cifre provengono dal suo stesso rapporto e nessuno le ha riprodotte.
Quindi il confronto è una demo senza numero contro un numero senza demo, il che è una posizione davvero scomoda in cui trovarsi e una descrizione equa di come questa intera categoria racconta se stessa in questo momento. L'unica cosa che si può dire con certezza è che nessuna delle due affermazioni ha superato il vaglio di una parte esterna, e una continuazione del 97% nei backchannels è abbastanza alta da meritare una verifica esterna prima che venga citata come dato assodato.

Cosa puoi davvero costruire
Sesame Preview non offre nulla a chi sviluppa. Non c'è alcuna API, nessun identificatore di modello, nessun listino prezzi e nessun piano dichiarato per averne una. Le chiamate hanno un limite di trenta minuti quando si è autenticati e di cinque altrimenti, l'inglese è l'unica lingua ufficialmente supportata, e l'agente fa ricerche e ricorda, ma non esegue attività: non prenota il volo. Il piano gratuito è il prodotto. È un'offerta per consumatori del tutto valida e un vicolo cieco per l'integrazione.
Realtime-Venus offre a chi costruisce tutto tranne un posto dove eseguirlo. I pesi sono distribuiti con licenza permissiva, il codice si carica con chiamate standard di Transformers, lo streaming full-duplex si attiva con un singolo cambio di metodo, e il ciclo documentato è un secondo di prefill in streaming seguito da generazione in streaming, ripetuto. La memoria per video lunghi è abilitata con un parametro memory-minutes ed è descritta come training-free, cosa insolita per una capacità che normalmente richiede fine-tuning. Due avvertenze sono documentate anziché lasciate alla scoperta: un limite di frame che tronca silenziosamente i video lunghi a meno che non si aumenti una costante prima dell'import dell'utilità, e un requisito di font CJK per i sottotitoli non latini renderizzati nel video duplex.
Ciò che nulla di tutto questo cambia è che l'harness — il componente che esegue le deleghe asincrone, la parte più distintiva dell'architettura — vive in un repository GitHub separato, è molto meno documentato del modello ed è la parte la cui maturità produttiva è più difficile da valutare. In un deployment reale il ramo della delega è una normale inferenza testuale dietro un front end conversazionale. OrcaRouter non include né Realtime-Venus né Sesame Preview; entrambi i livelli vocali sono al di fuori di ciò che offriamo, e lo diciamo apertamente invece di lasciar intendere un rapporto di hosting che non esiste. Quasi 200 modelli di testo dietro un'unica chiave al prezzo di listino del provider, senza ricarichi è la metà di quell'architettura che copriamo davvero, con failover automatico, così che un'attività delegata sopravviva a un'interruzione a monte, un DSL di routing che combina più modelli in un'unica chiamata e la fusione di modelli quando il giudizio di un solo modello non basta. È la parte acquistabile di un progetto la cui parte interessante non è in vendita.

La raccomandazione onesta
Se sei un consumatore che desidera la voce conversazionale dal suono migliore disponibile oggi e non ha bisogno di integrarla, Sesame Preview è gratuito, è disponibile su entrambe le piattaforme mobili, e la sua reputazione è così meritata che i recensori continuano a dirlo. Usalo e goditelo.
Se sei un ricercatore o un team di ingegneria con ampie risorse che necessita di uno stack audio-visivo full-duplex aperto che puoi ispezionare e mettere a punto, Realtime-Venus è una delle pochissime opzioni realmente valide, e il fatto che i suoi benchmark siano autodichiarati non cambia che i pesi siano davvero aperti e che l'architettura sia davvero documentata.
Se siete un team di prodotto in cerca di un livello vocale da rilasciare questo trimestre, nessuna di queste due soluzioni è la vostra risposta, e l'insegnamento utile che si trae dall'abbinamento è proprio il perché. Un laboratorio ha costruito qualcosa di eccellente e ha tenuto chiusa la parte migliore; l'altro ha pubblicato tutto e ha lasciato a voi il compito di fornire l'infrastruttura. La categoria ha dimostrato di saper creare una voce che vale la pena ascoltare e non ha ancora deciso se quella voce debba essere acquistabile in una forma diversa da un'app.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
