
GPT-Live-1 vs SeedRealtime: SeedRealtime è il modello più ambizioso, e non puoi acquistarlo
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Confrontare GPT-Live-1 e SeedRealtime in termini di capacità produce una risposta scomoda, perché i due modelli non competono sugli stessi termini. GPT-Live-1 è il modello vocale full-duplex di OpenAI, rilasciato all'interno di ChatGPT l'8 luglio 2026 e aperto agli sviluppatori tramite la Live Sessions API il 10 settembre 2026, con 12 voci, una tariffa al minuto pubblicata e una lacuna significativa: l'input di immagini e video è esplicitamente non supportato. SeedRealtime, rilasciato dal team Seed di ByteDance il 5 agosto 2026, è costruito interamente attorno a quella lacuna. È un modello full-duplex audio-visivo nativo che guarda, ascolta e parla in un'unica architettura end-to-end — ed è disponibile solo all'interno dell'app consumer Doubao, senza API pubblica, senza pesi aperti, senza rapporto tecnico e senza un conteggio dei parametri pubblicato.
Ciò che ciascuno può effettivamente percepire
Il modo più chiaro per vedere il divario è chiedere cosa sa ciascun modello della stanza in cui si trova.
GPT-Live-1 sente. Questa è l'intera superficie di input. Audio e testo entrano, audio e testo escono, e la documentazione di OpenAI elenca immagini e video come non supportati. Gestisce le meccaniche conversazionali dell'ascolto estremamente bene — decide molte volte al secondo se continuare ad ascoltare, mettersi in pausa, interrompere o chiamare uno strumento, e mantiene il full duplex, così continua a elaborare l'audio in arrivo mentre parla. Restituisce anche le trascrizioni del riconoscimento vocale insieme all'audio, ed è il tipo di dettaglio poco appariscente che fa risparmiare una settimana di lavoro di integrazione.
SeedRealtime sente e vede, in un unico modello anziché in una pipeline. ByteDance descrive un'architettura unificata che gestisce insieme audio, video e testo, risolvendo l'ambiguità con il contesto visivo — distinguendo gli omofoni, comprendendo a cosa si riferisce "this" da scena, gesto, sguardo e azione precedente — ed eseguendo percezione, comprensione, processo decisionale ed espressione in parallelo anziché in sequenza. Le dimostrazioni pubblicate da ByteDance includono una rumorosa cena di gruppo in cui il modello deve associare le voci alle identità, una visita al museo, la correzione di un flusso di lavoro dell'espresso e la soppressione delle interferenze in un aeroporto mentre mantiene la memoria fuori schermo e fa una ricerca online.
• Input — GPT-Live-1 solo audio e testo, immagine e video esplicitamente non supportati rispetto a SeedRealtime audio, video e testo fusi in un unico modello
• Alternanza dei turni — GPT-Live-1 decide internamente, molte volte al secondo, mentre SeedRealtime sposta l’alternanza dei turni all’interno del modello ed elimina completamente il rilevatore esterno di attività vocale
• Comportamento proattivo — GPT-Live-1 risponde, delega e invoca strumenti, mentre SeedRealtime è descritto come capace di intervenire spontaneamente quando un oggetto target compare nel campo visivo
• Disponibilità — GPT-Live-1 disponibile a livello generale nell'API di OpenAI a 0,05 $ al minuto, contro SeedRealtime gratuito all'interno di Doubao, senza API e senza tempistiche per averne una

La qualità delle prove va nella direzione opposta all'ambizione
È qui che il confronto smette di essere lusinghiero per ByteDance.
OpenAI pubblica dei numeri. Sono i suoi, confrontano GPT-Live-1 con GPT-Realtime-2.1 invece che con un concorrente, e nessun laboratorio indipendente li ha riprodotti: 80,1% di interattività full-duplex contro 45,4%, latenza di turn-taking ridotta da 1,4 secondi a 0,8, accuratezza nel tool-calling dal 60% all'87%. Il fatto che sia il fornitore a condurli e che non siano riprodotti è un caveat reale, ed è un caveat che almeno si può collegare a una cifra.
ByteDance non pubblica quasi nulla. L'affermazione centrale su SeedRealtime è una valutazione umana end-to-end che sostiene che dimezza i problemi di ritmo conversazionale audio-visivo rispetto ai sistemi a cascata ASR + visione + TTS — meno interruzioni a metà frase, meno risposte lente dopo una pausa, meno falsi inneschi dovuti a chiacchiere di sottofondo. Non c'è alcuna dimensione del campione, nessuna metodologia, nessuna cifra esatta per il miglioramento e nessun dato sulla latenza. Non c'è nemmeno un conteggio dei parametri e nessun rapporto tecnico.
Il risultato è che il modello con l'architettura più interessante è quello che si può valutare meno. Questo non equivale a dire che offra prestazioni peggiori — le dimostrazioni sono davvero impressionanti, e la documentazione tecnica sull'input audiovisivo a blocchi e sulla generazione in streaming suggerisce un sistema reale più che una demo — ma significa che qualsiasi confronto tra questi due sulla qualità è attualmente un confronto tra un modello documentato e un video impressionante.
Perché il divario API non è un dettaglio
SeedRealtime è stato distribuito completamente all'interno di Doubao dal 5 agosto 2026, sia in voce sia in video, gratuitamente. Non ha alcun endpoint Volcano Engine o BytePlus, nessun livello a pagamento, nessuna quota pubblicata e nessuna tempistica dichiarata per l'apertura dell'accesso agli sviluppatori. La roadmap di ByteDance menziona una latenza inferiore, un tracciamento del parlante più preciso e attività collegate agli strumenti; non menziona una data.
C’è un’avvertenza sull’accesso che aggrava la situazione. Doubao è un prodotto pensato innanzitutto per la Cina continentale e in genere richiede un numero di cellulare della Cina continentale per registrarsi, senza che sia stata annunciata una versione inglese localizzata. Per un team fuori dalla Cina, SeedRealtime non è semplicemente non lanciato come API: non è raggiungibile nemmeno come prodotto.
Mettilo a confronto con l'onere di integrazione di GPT-Live-1 stesso e il compromesso diventa concreto. L'API di OpenAI è limitata in modi che sorprendono: un solo ID di modello, un solo endpoint su v1/live/sessions, trasporto WebRTC con gestione degli eventi su un data channel, e nessun percorso attraverso Chat Completions, Responses, Realtime, Batch o gli endpoint di fine-tuning. I limiti di frequenza sono espressi in sessioni simultanee — 25 sul Tier 1, salendo a 50, 200, 300 e 500 — anziché in richieste al minuto, e il livello Free non può chiamare affatto il modello. Questa è una nuova integrazione, ed è comunque un'integrazione che puoi iniziare questo pomeriggio.

Due risposte allo stesso problema di delega
Entrambi i modelli rifiutano il vecchio design a cascata, in cui riconoscimento vocale, modello linguistico e sintesi vocale funzionano in sequenza con circa 1,7 secondi di silenzio tra un turno e l'altro. Lo rifiutano in modi diversi, e la differenza ti dice quale è progettato per una telefonata e quale per una stanza.
GPT-Live-1 suddivide il lavoro verticalmente. Un livello vocale veloce gestisce la conversazione; qualsiasi cosa più pesante — ricerca web, ragionamento più approfondito, lavoro agentico — viene affidata a un modello di ragionamento separato tramite l'API Responses mentre la conversazione continua. L'esempio WebRTC pubblicato da OpenAI collega quel backend a GPT-5.6 Terra. La conseguenza è che la metà pensante è una normale chiamata a un modello testuale, con prezzo per token, e quindi qualcosa che puoi scegliere, sostituire e instradare indipendentemente dal livello vocale. Per una linea di supporto, è la forma giusta: la voce è l'interfaccia e il ragionamento è il prodotto.
SeedRealtime tiene tutto in un'unica rete, ed è ciò che le consente di osservare un gesto mentre è a metà frase. È anche ciò che la rende impossibile da scomporre — non puoi sostituire la metà del ragionamento, perché non esiste alcuna metà del ragionamento, e non puoi eseguirla da nessuna parte, perché non c'è nessun posto dove eseguirla.
Se oggi stai costruendo un agente vocale, quella distinzione è l'intera decisione. Solo uno di questi due è un componente che puoi inserire in un'architettura. GPT-5.6 Terra, il backend nell'esempio di delega di OpenAI, è servito tramite OrcaRouter a 2,00 $ per milione di token in input e 12,00 $ per milione di token in output con un contesto di 1M token e con entrambi /v1/chat/completions e /v1/responses esposti — insieme a circa altri 190 modelli su un'unica chiave, così il livello di reasoning dietro un agente vocale può essere suddiviso, prezzato e sottoposto a failover senza toccare il percorso audio. Né GPT-Live-1 né SeedRealtime sono serviti da OrcaRouter; hanno un'unica fonte presso i rispettivi fornitori, e nessun router può cambiarlo.

Cosa cambierebbe la risposta
Tre cose, in ordine di probabilità.
• Un'API per sviluppatori di ByteDance. Se SeedRealtime compare su Volcano Engine o BytePlus con una tariffa pubblicata, smette di essere un caso di studio e diventa un prodotto autenticamente differenziato — full duplex audiovisivo senza concorrenti hosted in Occidente. Questo è il segnale da tenere d'occhio, e non si è ancora manifestato.
• La visione arriva in un'API vocale hosted. La documentazione di GPT-Live-1 è esplicita sul fatto che immagini e video non sono supportati, il che si legge meno come una svista che come un confine deliberato di prima release. Se OpenAI rilascia la superficie video che ha già mostrato altrove in ChatGPT, il divario di capacità che rende interessante SeedRealtime si restringe considerevolmente.
• Qualsiasi misurazione indipendente di SeedRealtime. Un dato di latenza di terze parti o un conteggio dei parametri permetterebbe di confrontare i due su qualcosa di diverso dall'ambizione.
Il verdetto pratico per chiunque stia costruendo adesso è breve. GPT-Live-1 è l'unico dei due che puoi mettere in produzione e, a $0,05 al minuto fatturati al secondo, con dodici voci e un endpoint documentato, è un default ragionevole per la voce conversazionale. SeedRealtime è il modello più interessante e potrebbe benissimo essere anche quello più capace; per il momento, però, è una dimostrazione di come si presenta un'architettura audiovisiva convergente, più che un prodotto da mettere davanti a un cliente. Archivialo alla voce "da tenere d'occhio", non "su cui costruire".
