Une carte de titre principale portant « GPT-Live-1 vs SeedRealtime », avec le sous-titre « Le modèle le plus ambitieux que vous ne pouvez pas appeler » et la ligne « Disponibilité générale dans l’API vs application Doubao uniquement », au-dessus de deux panneaux : à gauche, une porte ouverte avec un glyphe de crochets API et un badge « API » ; à droite, la même porte avec un cadenas en travers et un badge « PAS D’API » ; chacun portant une icône audio et caméra associant une forme d’onde à un diaphragme, avec le logo OrcaRouter incrusté dans le coin.
Guides & Insights

GPT-Live-1 vs SeedRealtime : SeedRealtime est le modèle le plus ambitieux, et vous ne pouvez pas l'acheter

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Comparer GPT-Live-1 et SeedRealtime sur le plan des capacités produit une réponse inconfortable, car les deux modèles ne sont pas en concurrence à armes égales. GPT-Live-1 est le modèle vocal full-duplex d’OpenAI, lancé dans ChatGPT le 8 juillet 2026 et ouvert aux développeurs via l’API Live Sessions le 10 septembre 2026, avec 12 voix, un tarif à la minute publié et une lacune importante : l’entrée d’images et de vidéos n’est explicitement pas prise en charge. SeedRealtime, publié par l’équipe Seed de ByteDance le 5 août 2026, est entièrement construit autour de cette lacune. C’est un modèle full-duplex audiovisuel natif qui regarde, écoute et parle dans une architecture unique de bout en bout — et il n’est disponible que dans l’application grand public Doubao, sans API publique, sans poids ouverts, sans rapport technique et sans nombre de paramètres publié.

Ce que chacun peut réellement percevoir

La façon la plus nette de constater l’écart consiste à demander ce que chaque modèle sait de la pièce dans laquelle il se trouve.

GPT-Live-1 entend. C’est toute la surface d’entrée. L’audio et le texte entrent, l’audio et le texte sortent, et la documentation d’Ope​nAI indique que l’image et la vidéo ne sont pas prises en charge. Il gère extrêmement bien la mécanique conversationnelle de l’écoute — il décide plusieurs fois par seconde s’il doit continuer à écouter, faire une pause, interrompre ou appeler un outil, et il maintient un mode full duplex, de sorte qu’il continue à traiter l’audio entrant pendant qu’il parle. Il renvoie aussi les transcriptions de reconnaissance vocale avec l’audio, ce qui est le genre de détail peu glamour qui fait gagner une semaine de travail d’intégration.

SeedRealtime entend et voit, au sein d’un seul modèle plutôt que dans un pipeline. ByteDance décrit une architecture unifiée qui traite ensemble l’audio, la vidéo et le texte, en levant les ambiguïtés grâce au contexte visuel — distinguer les homophones, comprendre à quoi « this » fait référence à partir de la scène, des gestes, du regard et de l’action antérieure — et en exécutant la perception, la compréhension, la prise de décision et l’expression en parallèle plutôt qu’en séquence. Les démonstrations publiées par ByteDance incluent un dîner de groupe bruyant où le modèle doit associer les voix à des identités, une visite de musée, la correction d’un flux de travail d’espresso, et la suppression des interférences dans un aéroport tout en conservant une mémoire hors écran et en effectuant une recherche en ligne.

• Entrées — GPT-Live-1 audio et texte uniquement, image et vidéo explicitement non prises en charge vs SeedRealtime audio, vidéo et texte fusionnés dans un seul modèle

• Gestion des tours de parole — GPT-Live-1 décide en interne, plusieurs fois par seconde, tandis que SeedRealtime déplace la gestion des tours de parole à l’intérieur du modèle et supprime entièrement le détecteur externe d’activité vocale

• Comportement proactif — GPT-Live-1 répond, délègue et appelle des outils, alors que SeedRealtime est décrit comme prenant la parole spontanément lorsqu'un objet cible apparaît dans son champ de vision

• Disponibilité — GPT-Live-1 en disponibilité générale dans l'API d'Ope​nAI à 0,05 $ la minute, contre SeedRealtime gratuit dans Doubao, sans API ni calendrier pour en proposer une

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

La qualité des preuves va dans le sens opposé à l’ambition.

C'est là que la comparaison cesse de flatter ByteDance.

Ope​nAI publie des chiffres. Ce sont les siens : ils comparent GPT-Live-1 à GPT-Realtime-2.1 plutôt qu’à un concurrent, et aucun laboratoire indépendant ne les a reproduits — 80,1 % d’interactivité full-duplex contre 45,4 %, une latence d’alternance de parole réduite de 1,4 seconde à 0,8, une précision d’appel d’outils passant de 60 % à 87 %. Des chiffres produits par le fournisseur et non reproduits, c’est une vraie réserve, et c’est une réserve que l’on peut au moins rattacher à un chiffre.

ByteDance ne publie presque rien. L’affirmation centrale concernant SeedRealtime est une évaluation humaine de bout en bout selon laquelle il réduit de moitié les problèmes de rythme conversationnel audio-visuel par rapport aux systèmes en cascade ASR-plus-vision-plus-TTS — moins de coupures en milieu de phrase, moins de réponses lentes après une pause, moins de faux déclenchements provoqués par des bavardages en arrière-plan. Il n’y a aucune taille d’échantillon, aucune méthodologie, aucun chiffre exact pour l’amélioration, et aucun chiffre de latence du tout. Il n’y a pas non plus de nombre de paramètres ni de rapport technique.

Le résultat, c'est que le modèle à l'architecture la plus intéressante est celui que l'on peut le moins évaluer. Cela ne revient pas à dire qu'il est moins performant — les démonstrations sont vraiment frappantes, et la description technique autour de l'entrée audio-visuelle segmentée et de la génération en flux suggère un véritable système plutôt qu'une démo — mais cela signifie que toute comparaison de qualité entre ces deux-là est actuellement une comparaison entre un modèle documenté et une vidéo impressionnante.

Pourquoi l'écart d'API n'est pas un détail

SeedRealtime a été entièrement déployé au sein de Doubao depuis le 5 août 2026, en voix comme en vidéo, gratuitement. Il n’a pas de point de terminaison Volcano Engine ou BytePlus, pas d’offre payante, aucun quota publié et aucun calendrier annoncé pour l’ouverture de l’accès aux développeurs. La feuille de route de ByteDance mentionne une latence réduite, un suivi des locuteurs plus précis et des tâches connectées à des outils ; elle ne mentionne pas de date.

Il existe une réserve d’accès qui vient aggraver la situation. Doubao est un produit conçu en priorité pour la Chine continentale et nécessite généralement un numéro de mobile de Chine continentale pour s’inscrire, aucune version anglaise localisée n’ayant été annoncée. Pour une équipe hors de Chine, SeedRealtime n’est pas seulement non lancé en tant qu’API : il n’est pas non plus accessible en tant que produit.

Mettez cela en regard de la charge d’intégration propre à GPT-Live-1, et l’arbitrage devient concret. L’API d’Ope​nAI est étroite d’une manière qui surprend : un seul ID de modèle, un seul point de terminaison à v1/live/sessions, un transport WebRTC avec gestion des événements sur un canal de données, et aucun passage par Chat Completions, Responses, Realtime, Batch ni les points de terminaison de fine-tuning. Les limites de débit sont exprimées en sessions simultanées — 25 au niveau Tier 1, puis 50, 200, 300 et 500 — plutôt qu’en requêtes par minute, et le niveau gratuit ne peut pas du tout appeler le modèle. C’est une nouvelle intégration, et c’est toujours une intégration que vous pouvez commencer cet après-midi.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Deux réponses au même problème de délégation

Les deux modèles rejettent l’ancienne conception en cascade, où la reconnaissance vocale, un modèle de langage et la synthèse vocale s’exécutent en séquence avec environ 1,7 seconde de temps mort entre les tours de parole. Ils la rejettent différemment, et cette différence vous dit lequel est conçu pour un appel téléphonique et lequel est conçu pour une pièce.

GPT-Live-1 répartit le travail verticalement. Une couche vocale rapide assure la conversation ; tout ce qui est plus lourd — recherche web, raisonnement plus approfondi, travail agentique — est confié à un modèle de raisonnement distinct via l'API Responses pendant que la conversation se poursuit. L'exemple WebRTC publié par Ope​nAI connecte ce backend à GPT-5.6 Terra. La conséquence est que la moitié « réflexion » est un appel ordinaire à un modèle textuel, facturé au token, et donc quelque chose que l'on peut choisir, échanger et router indépendamment de la couche vocale. Pour une ligne de support, c'est la bonne configuration : la voix est l'interface et le raisonnement est le produit.

SeedRealtime garde tout dans un seul réseau, ce qui lui permet d'examiner un geste alors qu'il est au milieu d'une phrase. C'est aussi ce qui le rend impossible à décomposer — on ne peut pas remplacer la moitié dédiée au raisonnement, parce qu'il n'y a pas de moitié dédiée au raisonnement, et on ne peut l'exécuter nulle part, parce qu'il n'y a aucun endroit où l'exécuter.

Si vous construisez un agent vocal aujourd'hui, cette distinction est toute la décision. Un seul de ces deux est un composant que vous pouvez intégrer dans une architecture. GPT-5.6 Terra, le backend de l'exemple de délégation d'Ope​nAI, est servi via OrcaRouter à 2,00 $ par million de jetons d'entrée et 12,00 $ par million de jetons de sortie avec un contexte de 1 M de jetons et l'exposition à la fois de /v1/chat/completions et de /v1/responses — aux côtés d'environ 190 autres modèles sur une seule clé, de sorte que le niveau de raisonnement derrière un agent vocal peut être réparti, tarifé et basculé en cas de défaillance sans toucher au chemin audio. Ni GPT-Live-1 ni SeedRealtime ne sont servis par OrcaRouter ; ils proviennent d'une source unique, leurs propres fournisseurs, et aucun routeur ne peut y changer quoi que ce soit.

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

Qu’est-ce qui changerait la réponse ?

Trois choses, par ordre de probabilité.

• Une API de développeur ByteDance. Si SeedRealtime apparaît sur Volcano Engine ou BytePlus avec un tarif publié, il cesse d'être une étude de cas et devient un produit véritablement différencié — duplex intégral audio-visuel sans concurrent hébergé en Occident. C'est le signal à surveiller, et il n'est pas apparu.

• L’arrivée de la vision dans une API vocale hébergée. La documentation de GPT-Live-1 précise explicitement que l’image et la vidéo ne sont pas prises en charge, ce qui ressemble moins à un oubli qu’à une limite délibérée de première version. Si Ope​nAI déploie la surface vidéo qu’elle démontre ailleurs dans ChatGPT, l’écart de capacités qui rend SeedRealtime intéressant se réduit considérablement.

• Toute mesure indépendante de SeedRealtime. Un chiffre de latence fourni par un tiers ou un nombre de paramètres permettrait de comparer les deux sur autre chose que l'ambition.

Le verdict pratique pour quiconque construit maintenant est bref. GPT-Live-1 est le seul des deux que vous pouvez déployer, et à 0,05 $ la minute facturé à la seconde, avec douze voix et un point de terminaison documenté, c’est un choix par défaut raisonnable pour la voix conversationnelle. SeedRealtime est le modèle le plus intéressant et pourrait bien être le plus capable ; c’est aussi, pour le moment, une démonstration de ce à quoi ressemble une architecture audio-visuelle convergée plutôt qu’un produit que vous pouvez mettre devant un client. Classez-le dans ce qu’il faut surveiller, pas dans ce sur quoi il faut construire.