Hero-titelkaart voor 'Realtime-Venus', met als ondertitel 'Een paper, twee checkpoints en geen aankondiging', met drie kaarten met de tekst 'Realtime-Venus-Omni: 9B, audio-visueel, Apache-2.0', 'Realtime-Venus-Audio: 9B, gesproken interactie' en 'Ontbreekt nog: API, prijs, lanceringsbericht, onafhankelijke benchmark', boven een voetbalk met de tekst 'Alle benchmarkcijfers komen uit het technische rapport; geen enkele is onafhankelijk gereproduceerd.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Realtime-Venus: full-duplex 9B van Ant Group uitgebracht zonder lancering

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 12 september 2026 verscheen op arXiv een technisch rapport dat Realtime-Venus beschreef, een full-duplex interactiesysteem dat is opgebouwd uit twee afzonderlijk getrainde 9B-modellen — Realtime-Venus-Omni voor audiovisuele interactie en Realtime-Venus-Audio voor gesproken interactie — toegeschreven aan het Venus Team bij Ant Group, in samenwerking met Tsinghua University. Binnen enkele dagen bevatte een Apache-2.0-repository onder inclusionAI/Realtime-Venus op Hugging Face beide checkpoints als downloadbare BF16-safetensors, naast een projectpagina en een bijbehorende GitHub-repository. Wat niet verscheen, is het deel dat opvalt: geen lanceringsbericht, geen productpagina, geen API, geen prijslijst, en niets op Ant Groups eigen platforms dat aankondigt dat er überhaupt iets van bestaat. Dit is een release die alles opleverde behalve de aankondiging, waardoor het scheiden van de vaststaande feiten van de claims de hele klus is.

Wat staat er eigenlijk op de schijf

De repository is geen stub. Hij bevat twee modelmappen, elk met gesharde safetensors-gewichten, een config, en de aangepaste Hugging Face Transformers-code die de modelkaart je opdraagt te laden met trust_remote_code=True. Er is een requirements-bestand, een assets-map met de token-to-waveform-resources en een referentiestem, en een Apache-2.0-licentie op het hoogste niveau. De modelkaart documenteert installatie voor Python 3.10 met CUDA en FFmpeg, en zowel een ModelScope-spiegel als een Hugging Face-downloadpad. De gewichten zijn echt, de code is er, en niets weerhoudt je ervan om het vandaag te downloaden.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the header with the Any-to-Any, Transformers, ONNX, Safetensors, English, Chinese, multimodal, audio, video, speech, streaming, full-duplex, long-video and custom-code tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, the model card title reading 'A full-duplex interaction system with asynchronous delegation', rows for project page, ModelScope, arXiv, GitHub and licence, and a right-hand panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Twee afwezigheden zijn even informatief als de inhoud. De eerste is dat de repository ronduit aangeeft dat deze door geen enkele inferentieprovider wordt uitgerold — er is geen gehoste endpoint, geen serverless optie, geen platform van derden dat hem host. De tweede is dat downloads helemaal niet worden bijgehouden, wat betekent dat er geen openbaar signaal is van hoeveel mensen hem hebben opgehaald. Een model kan op Hugging Face als omarmd of genegeerd overkomen; dit model valt op die manier niet te lezen.

De twee controlepunten, en wat hen scheidt

Beide zijn 9B, beide delen een streaming-backbone, en het verschil tussen hen is wat ze kunnen waarnemen.

• Realtime-Venus-Omni — de audiovisuele checkpoint. Een SigLIP2 visuele encoder voor streamingframes, een Whisper-Medium audio-encoder en een Qwen3-8B taalbackbone. Accepteert video of afbeeldingen, audio en tekst; retourneert tekst en, optioneel, een spraakgolfvorm.

• Realtime-Venus-Audio — dezelfde backbone, maar met vision uitgeschakeld bij het laden. Audio en tekst erin, tekst en spraak eruit. Het bestaat voor het geval waarin de camera irrelevant is en je een kleinere geheugenvoetafdruk en het eenvoudigere pad wilt.

• Gedeelde specificatie — een context van 40,960 tokens op beide, BF16-gewichten op beide, spraak gegenereerd als discrete S3-tokens en gedecodeerd door een streaming flow-matching-decoder in plaats van een apart tekst-naar-spraakmodel dat eraan is vastgeschroefd.

• Afstamming — de modelkaart vermeldt dat het Omni-checkpoint is afgeleid van MiniCPM-o 4.5, het 9B omni-modale model dat OpenBMB eerder in 2026 open-source heeft gemaakt. Dat is geen voetnoot. Het betekent dat de bijdrage van Ant Group de post-training, de runtime en het delegatieontwerp zijn die bovenop de streaming-backbone van iemand anders zijn aangebracht, wat een andere en specifiekere bewering is dan "een nieuw 9B omni-model."

Het enige werkelijk nieuwe idee: delegatie als een first-class stream-event

Elk full-duplexsysteem in 2026 moet dezelfde tegenstelling oplossen. Gespreksbesturing werkt op een granulariteit van milliseconden tot één seconde. Toolaanroepen, retrieval en zwaar redeneerwerk duren seconden tot tientallen seconden. Een model dat pauzeert om na te denken, is niet langer full-duplex; een model dat nooit pauzeert, kan geen tool gebruiken.

Realtime-Venus antwoordt met een dual-loop-runtime. De interactielus draait in vaste blokken van één seconde, neemt continu audio- en videokenmerken op, werkt de gespreksstatus bij en beslist of er geluisterd of gesproken moet worden, terwijl tekst en uitgelijnde spraak worden gestreamd. De lus pauzeert niet wanneer er op de achtergrond werk aan de gang is. De tweede lus is een scheduler die het artikel Realtime-Venus-Harness noemt: wanneer de frontend besluit dat een taak meer omvat dan wat deze inline kan doen, zendt deze een asynchrone delegatie uit via private markers die in zijn eigen verborgen sequentie zijn ingebed, en de harness voert de taak op de achtergrond uit en integreert het resultaat weer in de lopende dialoog.

Het detail dat dit meer dan een diagram maakt, is wat het artikel causal task capture noemt — de gedelegeerde taak wordt uitgevoerd tegen een geïsoleerde snapshot van de gespreksstatus, zodat een langlopende achtergrondtaak niet corrupt kan raken doordat het gesprek verdergaat terwijl die draait. Dat is de faalmodus waardoor de meeste ontwerpen met "delegeren en blijven praten" in de praktijk omvallen, en het is het interessantste in het rapport.

Het harnas zit niet in de gewichten. Het bevindt zich in de GitHub-repository als een aparte component, wat betekent dat het deel dat de architectuur onderscheidend maakt, het deel is dat je zelf in elkaar zou moeten zetten en vertrouwen.

De nummers, en precies van wie ze zijn

Elk cijfer hieronder is afkomstig uit het technische rapport en de modelkaart. Niets ervan is door iemand buiten de auteurs gereproduceerd, geen enkele derde partij heeft een evaluatie gepubliceerd, en er is geen leaderboard-vermelding om het tegen te controleren. Lees ze als de eigen metingen van de auteurs.

• Videobenchmarks, Realtime-Venus-Omni — beste score op zes van de acht benchmarks die het rapport gebruikt, waaronder StreamingBench 70,2, OVO-Bench 64,7 en Daily-Omni 81,3.

• Audio-benchmarks, Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8, en een VoiceBench AlpacaEval-score van 4,81 die het rapport omschrijft als overeenkomend met het beste vergelijkingscijfer.

• Full-Duplex-Bench v1.5 — reageert op 75% van de onderbrekingen van gebruikers, met voortzettingspercentages van 97% bij backchannels, 88% bij tot anderen gerichte spraak en 86% bij achtergrondspraak. Het rapport stelt dat dit Gemini 3.1 Live en GPT-4o overtreft op alle drie de voortzettingsmetrieken.

Het Daily-Omni-cijfer is het cijfer waar je even bij stil moet staan. MiniCPM-o 4.5, het model waarvan deze checkpoint is afgeleid, rapporteert 80,2 op dezelfde benchmark. Realtime-Venus-Omni rapporteert 81,3. Als beide cijfers standhouden, is de verbetering van een grote post-training- en runtime-inspanning ongeveer één punt op een benchmark waarop het basismodel al sterk was — wat een realistisch resultaat is voor dit soort werk en een veel minder dramatisch verhaal dan de kop "beste op zes van acht".

A generated scoreboard for 'Realtime-Venus — the scoreboard' showing a single centered card with six rows: Params 9B, Context 40,960 tokens, Licence Apache-2.0, Weight format BF16, Daily-Omni 81.3, Full-Duplex-Bench continuation 97 / 88 / 86, with the footer 'Vendor-reported from the technical report; no independent scores yet.'

Wat is niet vastgesteld

De lijst met open vragen is langer dan de lijst met opgeloste vragen, en dat is de eerlijke stand van zaken bij een model van zes dagen oud.

• Er bestaat geen onafhankelijke evaluatie. Geen arenaplaatsing, geen reproductie door derden, geen enkele externe groep die een cijfer heeft gepubliceerd.

• Geen latencycijfer in milliseconden. Het rapport beschrijft een interactiecadans van één seconde en de kaart documenteert streamingaanroepen per seconde, maar er is geen gepubliceerd time-to-first-audio-cijfer, wat de maatstaf is waarop in deze categorie daadwerkelijk wordt gekocht.

• Geen API en geen prijs, en geen enkele uitspraak dat een van beide eraan komt. Of dit een product is dat nog moet komen of een onderzoeksartefact dat een download zal blijven, is werkelijk onbekend.

• Geen kenbaar gemaakte intentie van de leverancier. Het ontbreken van een aankondiging is geen bewijs van een stille lanceerstrategie; het is ook verenigbaar met een repository die voor een paper is gepubliceerd en niets meer.

• Geen bewijs uit productie voor de harness. Het is de dragende component van de architectuur en de minst gedocumenteerde.

Waarom de stille route blijft gebeuren

Dit is de tweede keer dit jaar dat het modelwerk van Ant Group het publiek bereikt via een repository in plaats van een lancering. UI-Venus-2-9B, de GUI-agent van het lab, verscheen eind augustus 2026 op Hugging Face zonder paper, zonder projectpagina en zonder aankondiging — en is sindsdien gevolgd door een rapport. Realtime-Venus kwam in de omgekeerde volgorde: eerst het rapport, de repository tegelijkertijd, de aankondiging nog steeds achtergehouden.

Het patroon is niet uniek voor Ant Group. Vooral Chinese labs brengen onderzoeksartefacten en consumentenimplementaties de wereld in, terwijl ze de aankondiging voor ontwikkelaars uitstellen of helemaal overslaan. Voor iedereen die het vakgebied volgt, is dit lastig, want het gebruikelijke signaal — een lanceringsbericht, een tariefkaart, een documentatiesite — is precies het deel dat ontbreekt. Het artefact is nu de aankondiging, en het aandachtig lezen ervan is de enige manier om te weten wat er is uitgebracht.

Als je het wilde uitvoeren

De kaart is ongewoon praktisch voor een release die zo nieuw is. Laden is standaard: AutoModel.from_pretrained op de lokale checkpointmap met remote code vertrouwd, SDPA-attentie en bfloat16. Full-duplexstreaming wordt gestart met één aanroep die het model in duplexmodus schakelt, waarna de gedocumenteerde lus één seconde streaming_prefill is, gevolgd door streaming_generate, herhaald. Geheugen voor lange video's wordt ingeschakeld met een parameter memory-minutes ingesteld op veertig en wordt beschreven als trainingvrij, wat opmerkelijk is voor een mogelijkheid die gewoonlijk fine-tuning vereist. Twee kanttekeningen zijn gedocumenteerd in plaats van ontdekt: een framelimiet die lange video's stilzwijgend afkapt tenzij een constante wordt verhoogd voordat de hulpprogramma's worden geïmporteerd, en een CJK-lettertypevereiste voor niet-Latijnse ondertitels die in duplexvideo worden weergegeven.

Wat de kaart je niet geeft, is een hardwareondergrens. Een 9B-model in BF16 is ruwweg achttien gigabyte aan gewichten, nog vóór enig activeringsgeheugen, waardoor realtime duplex-inferentie op een serieuze GPU terechtkomt en buiten het bereik valt van de laptopimplementatie waarvoor de MiniCPM-o-familie waarvan het afstamt deels was ontworpen.

Er is hier een naad die het benoemen waard is, want dat is waar een router werkelijk past. Realtime-Venus besteedt zijn zware werk — retrieval, complexe redeneringen, zakelijke API-calls — uit aan een achtergrondmodel. Dat uitbestede stuk is gewone tekstinferentie, en het is dat stuk dat bepaalt of je conversationele front-end nuttig is of slechts vloeiend. OrcaRouter bevat niets van Realtime-Venus; de duplexlaag hier is een zelfgehoste download en wij bieden die niet aan. De redenering die het uitbesteedt, is het deel dat wij wél dekken: bijna 200 modellen achter één sleutel tegen de listprijs van de provider zonder opslag, automatische failover wanneer een upstream een slechte middag heeft, een routing-DSL die meerdere modellen in één aanroep samenbrengt, en modelfusie voor de gevallen waarin het oordeel van één model niet volstaat. De delegatiemarker is de beslissing van de frontend; welk model erop antwoordt, is een configuratiekeuze, en door die keuze buiten de gewichten te houden, kun je die wijzigen zonder iets te hertrainen.

A screenshot of the GitHub repository inclusionAI/Realtime-Venus, captured 18 September 2026, showing the repository header, the file and folder listing for the Realtime-Venus-Omni and Realtime-Venus-Audio checkpoints and the harness, and the opening section of the README describing the full-duplex interaction system.

Wat zou het beslechten?

Drie dingen zouden Realtime-Venus veranderen van een paper met gewichten in een model dat iedereen kan evalueren. Een onafhankelijke groep die de continuation-cijfers van Full-Duplex-Bench reproduceert, want 97% bij backchannels is een buitengewoon cijfer en buitengewone cijfers hebben een tweede lezer nodig. Een gepubliceerd latentiecijfer, want full-duplexsystemen staan of vallen met time-to-first-audio en dit systeem heeft geen doelstelling genoemd. En documentatie voor de harness, want het asynchrone delegatieontwerp is het enige deel van deze release dat werkelijk nieuw is, en op dit moment is het het deel waarover je kunt lezen maar dat je niet gemakkelijk kunt overnemen.

Tot dan is de nauwkeurige beschrijving beperkt en weinig opwindend, en dat is precies waarom het de moeite waard is om die op te schrijven: een echte Apache-2.0-release van twee 9B full-duplex-checkpoints, gebouwd op een open backbone, met sterke zelfgerapporteerde benchmarks, geen onafhankelijke verificatie, geen API en geen aankondiging. Alles boven die lijn is inferentie.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt