
Realtime-Venus vs SeedRealtime: Twee tegenovergestelde manieren om onbeschikbaar te zijn
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus en SeedRealtime zijn de twee helften van hetzelfde verhaal uit 2026, en ze falen op tegenovergestelde tests. SeedRealtime is het native audiovisuele full-duplexmodel van ByteDance, dat op 5 augustus 2026 gratis werd geactiveerd in de Doubao-app en een publiek bereikt dat zijn maker omschrijft als honderden miljoenen — zonder API, zonder modelidentifier, zonder prijs en zonder latentiedoel. Realtime-Venus is een tweetal 9B-checkpoints van het Venus Team van Ant Group en Tsinghua University, op 12 september 2026 onder Apache-2.0 gepubliceerd met een technisch rapport en zonder aankondiging, in een repository die elke engineer kan downloaden en bijna niemand realistisch kan deployen. Een van beide kun je niet aanroepen. De andere kun je downloaden en dan ontdekken dat je niets hebt om hem op aan te roepen. Beide bevinden zich daadwerkelijk aan de frontier van hetzelfde vermogen, en geen van beide heeft een benchmark die iemand buiten de eigen auteurs heeft gereproduceerd.
Twee varianten van "je kunt het niet krijgen"
Het is de moeite waard precies te zijn, want de uitdrukking "niet beschikbaar" verbergt een wezenlijk verschil.
SeedRealtime is niet beschikbaar op de manier waarop een consumentenproduct niet beschikbaar is: het bestaat, het werkt, het heeft gebruikers, en de deur is simpelweg gesloten voor ontwikkelaars. Er is geen API, geen tariefkaart, geen documentatieportaal en geen aangegeven tijdlijn voor een ervan. De route naar de markt van ByteDance is de app geweest, en de app is voldoende gebleken. Wat je als bouwer krijgt, is een demo die je kunt ervaren en niet kunt integreren.
Realtime-Venus is niet beschikbaar op de manier waarop een onderzoeksartefact niet beschikbaar is: de gewichten zijn openbaar, de licentie is permissief, de code staat er, en niemand draait het. De repository wordt door geen enkele inferentieprovider gedeployed, en downloads worden helemaal niet bijgehouden, dus er is geen publiek signaal van adoptie in welke richting dan ook. Het is beschikbaar in de zin die ertoe doet voor een onderzoeker en niet beschikbaar in de zin die ertoe doet voor een productmanager.
Samengenomen formuleren ze de vraag waarop deze hele categorie momenteel vastzit: de modellen die werken zitten achter consumentenapps, en de modellen die je kunt draaien zijn nergens in productie.
Beide bevinden zich op het niveau dat 2026 daadwerkelijk onderscheidt.
Een nuttige manier om het realtimeveld te begrijpen is in drie niveaus. Het eerste is half-duplex spraak met vision eraan vastgeschroefd — op beurten gebaseerde assistenten die kunnen zien maar toch om de beurt gaan. Het tweede is audio-full-duplex, tegelijk luisteren en spreken zonder camera: ByteDance's eigen Seeduplex, OpenAI's GPT-Live, xAI's Grok Voice Think Fast 2.0. Het derde is audiovisueel full-duplex, waarbij perceptie en expressie zich continu over video en audio uitstrekken.
SeedRealtime is het eerste model op het derde niveau dat grootschalige commerciële uitrol bereikt. Realtime-Venus is een open-weights-nieuwkomer op hetzelfde niveau — video via een SigLIP2-encoder, audio via Whisper-Medium, een Qwen3-8B-backbone, en een interactielus van één seconde die nooit stopt met waarnemen. In de modelkaart staat dat het is aangepast van MiniCPM-o 4.5, het omnimodale model van OpenBMB dat eerder in 2026 werd uitgebracht, waardoor de bijdrage van Ant Group in de post-training en de runtime ligt in plaats van in de basisarchitectuur.
Wat ze gemeen hebben, en wat hen een niveau boven de systemen met alleen audio plaatst, is dat geen van beide pauzeert om te kijken. Continue visuele waarneming tijdens het spreken is een wezenlijk andere capaciteit dan het beschrijven van één enkel frame, en beide modellen zijn eromheen gebouwd.
Wat de nummers van elk waard zijn

Geen van beide modellen heeft een benchmark van derden. Het bewijs is echter niet gelijkwaardig, en het verschil is van belang.
• SeedRealtime publiceert helemaal geen benchmark. Wat ByteDance biedt, is een bewering dat problemen met het gespreksritme — door de gebruiker heen praten, te laat reageren, getriggerd worden door het geluid van een vreemde — met ongeveer de helft afnemen ten opzichte van een cascadesysteem, op basis van end-to-end menselijke evaluaties. De onderliggende data worden niet gepubliceerd.
• De cijfers van de voorganger hebben dezelfde vorm. Seeduplex, het audio-onlymodel dat ByteDance in april 2026 in Doubao uitbracht, zou naar verluidt de percentages valse reacties en valse onderbrekingen halveren, de endpointlatentie met ongeveer 250 milliseconden terugbrengen, voortijdige reacties met 40% verminderen en de gesprekstevredenheid met 8,34 punten verhogen in een grootschalige A/B-test. Allemaal door de leverancier gerapporteerd.
• Realtime-Venus publiceert een tabel. Het bijbehorende rapport claimt de beste scores op zes van de acht videobenchmarks, waaronder StreamingBench 70,2, OVO-Bench 64,7 en Daily-Omni 81,3, en staat aan de leiding bij MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8 en Speech CMMLU 67,8 voor het audiocheckpoint.
• Beide zijn niet gereproduceerd. Een gepubliceerde tabel die niemand heeft gecontroleerd en een niet-gepubliceerde A/B-test die niemand kán controleren, zijn verschillende soorten ongeverifieerd. Geen van beide is bewijs waarop je een inkoopbeslissing kunt baseren.
De enige vergelijking die de moeite waard is binnen de Realtime-Venus-cijfers is met zijn eigen basis. MiniCPM-o 4.5 rapporteert 80,2 op Daily-Omni; Realtime-Venus-Omni rapporteert 81,3. Een winst van één punt ten opzichte van het model waarvan het is afgeleid, op een benchmark die dat model al aankon, is een plausibel resultaat voor een inspanning op het gebied van post-training en runtime — en een veel kleinere claim dan "het beste op zes van de acht" op zichzelf doet vermoeden.

Het beurtwisselingsprobleem, waar full-duplex thuishoort
Full-duplex is geen latentiefunctie. Het is een verzameling gedragingen: weten wanneer een pauze "ik ben aan het nadenken" betekent in plaats van "ik ben klaar", het gesprek van een omstander onderscheiden van de persoon die tegen je praat, en stil blijven tijdens een backchannel in plaats van "mm-hm" als een onderbreking te behandelen.
De aanpak van SeedRealtime is om de gesprekstoestand native te modelleren en de externe voice-activitydetector volledig te laten vallen, zodat beurtwisseling een aangeleerd gedrag binnen het netwerk is in plaats van een drempel die op een audiostream wordt toegepast. Dat is dezelfde architectonische keuze die Realtime-Venus maakt, en beide positioneren zich tegenover de cascadesystemen die een afzonderlijke component nodig hebben om te beslissen wie spreekt.
Waar het bewijs verschilt, is dat de bewering van SeedRealtime gaat over uitrol op schaal — honderden miljoenen gebruikers, echte ruimtes, echt lawaai — terwijl die van Realtime-Venus over een benchmark gaat. De resultaten van Full-Duplex-Bench v1.5 voor Realtime-Venus-Audio — 75% respons op onderbrekingen, 97% voortzetting bij backchannels, 88% bij tot anderen gerichte spraak en 86% bij achtergrondspraak, beter dan Gemini 3.1 Live en GPT-4o op het gebied van voortzetting — zijn de meest direct relevante cijfers die een van beide modellen voor dit probleem heeft gepubliceerd. Ze zijn ook volledig zelfgerapporteerd, en 97% voortzetting bij backchannels is een opvallend cijfer dat een tweede lezer verdient voordat iemand het als feit aanhaalt.
Waar elk van hen een bouwer achterlaat
Het praktische verschil is niet kwaliteit, het is de vorm van het aanbod.
• SeedRealtime — je kunt het gratis ervaren in Doubao en het nooit integreren. Er is geen pad van "dit is indrukwekkend" naar "dit zit in mijn product."
• Realtime-Venus — je kunt het downloaden, fine-tunen, air-gapped draaien en elke laag inspecteren. De kosten zijn twee 9B-checkpoints in BF16 van ruwweg achttien gigabyte aan gewichten per stuk, plus een continue streaming-lus per seconde, wat betekent dat een GPU-node kosten in rekening brengt of er nu wel of niet iemand aanroept.
• Geen van beide heeft een gehoste optie. Geen van beide kan met een sleutel en een middag worden uitgeprobeerd.
Dat laatste punt is de reden waarom de twee modellen nuttiger zijn als paar dan als tegenstanders. Samen tonen ze aan dat beide helften van het probleem zijn opgelost — de capaciteit werkt en de gewichten kunnen worden vrijgegeven — terwijl ze laten zien dat niemand ze nog heeft samengebracht tot iets dat een ontwikkelaar daadwerkelijk kan aanroepen.
Er is een workaround waar veel teams naar zullen grijpen, en het is de moeite waard om duidelijk te zijn over wat die wel en niet dekt. Als je de spraaklaag niet kunt krijgen, kun je nog steeds het deel bouwen dat denkt. Realtime-Venus delegeert zijn dure werk — retrieval, moeilijke redeneertaken, zakelijke API-aanroepen — naar een achtergrond-harness via asynchrone delegatiemarkers, en die gedelegeerde tak is gewone tekstinferentie. OrcaRouter bevat noch Realtime-Venus noch SeedRealtime; beide duplexlagen vallen buiten wat wij leveren, en we hosten geen van beide. Bijna 200 tekstmodellen achter één sleutel tegen de listprijs van de provider zonder opslag is de helft van de architectuur die we wél dekken, met automatische failover zodat een achtergrondtaak niet mislukt omdat één upstream een slechte middag had, een routing-DSL om meerdere modellen tot één aanroep te combineren, en model fusion waar het oordeel van één model niet volstaat. Het is niet het deel van deze systemen dat moeilijk is. Het is het deel dat daadwerkelijk te koop is.

Wat zou deze vergelijking veranderen?
Drie ontwikkelingen zouden het beslechten, en geen ervan heeft zich tot nu toe voorgedaan. Een onafhankelijke benchmark van Realtime-Venus, want een tabel zonder tweede lezer is een bewering en geen resultaat. Een API voor SeedRealtime, want het model met het sterkste bewijs van uitrol is momenteel juist het model dat niemand kan gebruiken. En een gepubliceerd latentiecijfer van een van beide — tijd-tot-eerste-audio is de maatstaf waarop in deze categorie wordt gekocht, en op het moment van schrijven heeft geen van beide modellen er een genoemd.
Tot dan is de eerlijke samenvatting dat SeedRealtime het bewijs is dat audiovisuele full-duplex werkt op consumentenschaal en Realtime-Venus het bewijs dat de gewichten kunnen worden vrijgegeven, en geen van die feiten brengt een bouwer ook maar een stap dichter bij het uitbrengen van een product. Dat is geen kritiek op een van beide labs. Het is een beschrijving van een categorie die het onderzoeksprobleem heeft opgelost en nog niet het distributieprobleem.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
