Hero-titelkort för 'Realtime-Venus', med undertexten 'En artikel, två checkpoints och inget tillkännagivande', med tre kort som lyder 'Realtime-Venus-Omni: 9B, audiovisuell, Apache-2.0', 'Realtime-Venus-Audio: 9B, talad interaktion' och 'Saknas fortfarande: API, pris, lanseringsinlägg, oberoende benchmark', ovanför en sidfotsremsa med texten 'Alla benchmark-siffror kommer från den tekniska rapporten; ingen av dem har reproducerats oberoende.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Realtime-Venus: Ant Groups full-duplex 9B släpptes utan lansering

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 12 september 2026 lades en teknisk rapport upp på arXiv som beskriver Realtime-Venus, ett full-duplex interaktionssystem byggt av två separat tränade 9B-modeller – Realtime-Venus-Omni för audiovisuell interaktion och Realtime-Venus-Audio för talad interaktion – tillskrivet Venus Team vid Ant Group i samarbete med Tsinghua University. Inom några dagar innehöll ett Apache-2.0-förråd under inclusionAI/Realtime-Venus på Hugging Face båda checkpoints som nedladdningsbara BF16-safetensors, tillsammans med en projektsida och ett medföljande GitHub-förråd. Det som inte dök upp är det som är värt att lägga märke till: inget lanseringsinlägg, ingen produktsida, inget API, ingen prislista och inget på Ant Groups egna plattformar som tillkännager att något av det existerar. Det här är ett släpp som levererade allt utom tillkännagivandet, vilket gör det till hela uppgiften att skilja de etablerade fakta från påståendena.

Vad finns det egentligen på disken

Repositoriet är inte en stubbe. Det innehåller två modellkataloger, var och en med shardade safetensors-vikter, en konfiguration och den anpassade Hugging Face Transformers-koden som kortet instruerar dig att ladda med trust_remote_code=True. Det finns en requirements-fil, en assets-mapp som innehåller token-till-vågform-resurserna och en referensröst, samt en Apache-2.0-licens på toppnivå. Kortet dokumenterar installation för Python 3.10 med CUDA och FFmpeg, och både en ModelScope-spegel och en nedladdningsväg från Hugging Face. Vikterna är riktiga, koden finns där, och inget hindrar dig från att ladda ner det i dag.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the header with the Any-to-Any, Transformers, ONNX, Safetensors, English, Chinese, multimodal, audio, video, speech, streaming, full-duplex, long-video and custom-code tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, the model card title reading 'A full-duplex interaction system with asynchronous delegation', rows for project page, ModelScope, arXiv, GitHub and licence, and a right-hand panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Två avsaknader är lika informativa som innehållet. Den första är att repositoriet klart och tydligt uppger att det inte driftsätts av någon inferensleverantör – det finns ingen hostad slutpunkt, inget serverlöst alternativ, ingen tredjepartsplattform som tillhandahåller det. Den andra är att nedladdningar inte spåras alls, vilket innebär att det inte finns någon offentlig signal om hur många som har hämtat det. En modell kan framstå som adopterad eller ignorerad på Hugging Face; den här går inte att avläsa på det sättet.

De två kontrollpunkterna, och vad som skiljer dem åt

Båda är 9B, båda delar en streaming-backbone, och skillnaden mellan dem är vad de kan uppfatta.

• Realtime-Venus-Omni — den audiovisuella checkpointen. En visuell encoder av typen SigLIP2 för strömmande bildrutor, en ljudencoder av typen Whisper-Medium och en språkbackbone av typen Qwen3-8B. Tar emot video eller bilder, ljud och text; returnerar text och, valfritt, en talvågform.

• Realtime-Venus-Audio — samma stomme med vision avstängt vid laddning. Ljud och text in, text och tal ut. Den finns för fallet där kameran är irrelevant och du vill ha ett mindre minnesavtryck och den enklare vägen.

• Delad specifikation — 40 960-tokens kontext på båda, BF16-vikter på båda, tal genererat som diskreta S3-token avkodade av en strömmande flow-matching-avkodare i stället för en separat text-till-tal-modell påklistrad i slutet.

• Härstamning – modellkortet anger att Omni-checkpointen är adapterad från MiniCPM-o 4.5, den 9B omnimodala modellen som OpenBMB släppte med öppen källkod tidigare under 2026. Det är inte en fotnot. Det innebär att Ant Groups bidrag är post-träningen, runtime och delegationsdesignen som lagts ovanpå någon annans streaming-backbone, vilket är ett annat och mer specifikt påstående än ”en ny 9B omnimodell”.

Den enda genuint nya idén: delegering som en förstklassig strömhändelse

Varje full-duplexsystem 2026 måste lösa samma motsägelse. Samtalsstyrning sker på millisekund- till ensekundsnivå. Verktygsanrop, hämtning och krävande resonemang tar sekunder till tiotals sekunder. En modell som pausar för att tänka upphör att vara full-duplex; en modell som aldrig pausar kan inte använda ett verktyg.

Realtime-Venus svarar med en runtime med dubbla loopar. Interaktionsloopen körs i fasta ensekundersblock, tar kontinuerligt in ljud- och videofunktioner, uppdaterar konversationstillståndet och avgör om den ska lyssna eller tala, samtidigt som den strömmar text och synkroniserat tal. Den pausar inte när bakgrundsarbete pågår. Den andra loopen är en schemaläggare som artikeln kallar Realtime-Venus-Harness: när frontend bedömer att en uppgift överstiger vad den kan utföra inline, sänder den en asynkron delegering via privata markörer inbäddade i sin egen dolda sekvens, och harnessen utför uppgiften i bakgrunden och återintegrerar resultatet i den pågående dialogen.

Detaljen som gör detta till mer än ett diagram är vad rapporten kallar causal task capture – den delegerade uppgiften körs mot en isolerad ögonblicksbild av konversationens tillstånd, så att en långvarig bakgrundsuppgift inte kan förvanskas av att konversationen fortsätter medan den körs. Det är det felmod som gör att de flesta designer för "delegera och fortsätt prata" fallerar i praktiken, och det är det mest intressanta i rapporten.

Ramverket finns inte i vikterna. Det lever i GitHub-repositoriet som en separat komponent, vilket innebär att den del som gör arkitekturen särpräglad är den del du själv skulle behöva sätta samman och lita på.

Siffrorna, och exakt vems de är

Alla siffror nedan kommer från den tekniska rapporten och modellkortet. Inget av detta har reproducerats av någon utanför författarna, ingen tredje part har publicerat en utvärdering, och det finns ingen resultattavlepost att kontrollera det mot. Läs dem som författarnas egna mätningar.

Videobenchmarks, Realtime-Venus-Omni — bästa resultat på sex av de åtta benchmarks som rapporten använder, inklusive StreamingBench 70,2, OVO-Bench 64,7 och Daily-Omni 81,3.

• Ljudbenchmarks, Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8, och en VoiceBench AlpacaEval-poäng på 4,81 som rapporten beskriver som matchande det bästa jämförelsetalet.

• Full-Duplex-Bench v1.5 — svarar på 75 % av användaravbrott, med fortsättningsfrekvenser på 97 % vid backchannels, 88 % vid tal riktat till andra och 86 % vid bakgrundstal. Rapporten anger att detta överträffar Gemini 3.1 Live och GPT-4o på alla tre fortsättningsmått.

Daily-Omni-siffran är den som är värd att stanna upp vid. MiniCPM-o 4.5, modellen som denna checkpoint är adapterad från, rapporterar 80,2 på samma benchmark. Realtime-Venus-Omni rapporterar 81,3. Om båda siffrorna håller är förbättringen från en omfattande eftertränings- och runtime-insats ungefär en poäng på ett benchmark som basmodellen redan var stark på – vilket är ett realistiskt resultat för den här typen av arbete och en mycket mindre dramatisk historia än rubriken ”bäst på sex av åtta”.

A generated scoreboard for 'Realtime-Venus — the scoreboard' showing a single centered card with six rows: Params 9B, Context 40,960 tokens, Licence Apache-2.0, Weight format BF16, Daily-Omni 81.3, Full-Duplex-Bench continuation 97 / 88 / 86, with the footer 'Vendor-reported from the technical report; no independent scores yet.'

Vad som inte är fastställt

Listan över öppna frågor är längre än listan över avgjorda, och det är det ärliga tillståndet för en modell som är sex dagar gammal.

• Det finns ingen oberoende utvärdering. Inte en arenaplacering, inte en tredjepartsreproduktion, inte en enda utomstående grupp som har publicerat en siffra.

• Ingen latenssiffra i millisekunder. Rapporten beskriver en interaktionskadens på en sekund och kortet dokumenterar strömningsanrop per sekund, men det finns inget publicerat nummer för tid till första ljud, vilket är det mått som den här kategorin faktiskt köps på.

• Inget API och inget pris, och inget uttalande om att något av dem är på väg. Huruvida detta är en produkt som väntar eller en forskningsartefakt som förblir en nedladdning är genuint okänt.

• Inget uttalat syfte från leverantören. Avsaknaden av ett tillkännagivande är inte ett bevis för en tyst lanseringsstrategi; den är också förenlig med ett förråd som publicerats för en artikel och inget mer.

• Inga produktionsbevis för testriggen. Den är arkitekturens bärande komponent och den minst dokumenterade.

Varför den tysta rutten fortsätter att uppstå

Detta är andra gången i år som Ant Groups modellarbete har nått allmänheten via ett repo i stället för en lansering. UI-Venus-2-9B, labbets GUI-agent, dök upp på Hugging Face i slutet av augusti 2026 utan vare sig paper, projektsida eller tillkännagivande – och har sedan dess följts av en rapport. Realtime-Venus kom i omvänd ordning: rapporten först, repot samtidigt, tillkännagivandet fortfarande undanhållet.

Mönstret är inte unikt för Ant Group. Särskilt kinesiska labb har släppt ut forskningsartefakter och konsumentutrullningar i världen medan de lämnat det utvecklarriktade tillkännagivandet till senare, eller hoppat över det. För alla som följer området är detta besvärligt, eftersom den vanliga signalen — ett lanseringsinlägg, ett prisblad, en dokumentationswebbplats — är precis den del som saknas. Artefakten är tillkännagivandet nu, och att läsa den noggrant är det enda sättet att veta vad som har släppts.

Om du ville köra det

Kortet är ovanligt praktiskt för en så ny release. Inläsning är standard: AutoModel.from_pretrained på den lokala checkpoint-katalogen med betrodd fjärrkod, SDPA-attention och bfloat16. Full-duplex-streaming aktiveras med ett enda anrop som växlar modellen till duplexläge, varefter den dokumenterade loopen är en sekund av streaming_prefill följt av streaming_generate, som upprepas. Långvideominne aktiveras med en memory-minutes-parameter inställd på fyrtio och beskrivs som träningsfritt, vilket är anmärkningsvärt för en förmåga som vanligtvis kräver finjustering. Två förbehåll är dokumenterade snarare än upptäckta: en bildrutebegränsning som tyst trunkerar lång video om inte en konstant höjs innan verktygen importeras, och ett krav på CJK-teckensnitt för icke-latinska undertexter som renderas i duplexvideo.

Vad kortet inte ger dig är en lägsta hårdvarunivå. En 9B-modell i BF16 är ungefär arton gigabyte i vikter innan något aktiveringsminne tillkommer, vilket förlägger duplex-inferens i realtid på ett kraftfullt grafikkort och utom räckhåll för den driftsättning på bärbara datorer som MiniCPM-o-familjen, som den härstammar från, delvis var designad för.

Det finns en söm här som är värd att namnge, för det är där en router faktiskt passar in. Realtime-Venus delegerar sitt hårda arbete – hämtning, komplext resonemang, affärs-API-anrop – till en bakgrundsmodell. Det delegerade benet är vanlig textinferens, och det är benet som avgör om din samtalsfront-end är användbar eller bara flytande. OrcaRouter innehåller inget av Realtime-Venus; duplexlagret här är en självhostad nedladdning och vi tillhandahåller det inte. Resonemanget som det skickar vidare är den del vi täcker: nästan 200 modeller bakom en enda nyckel till leverantörens listpris utan påslag, automatisk redundansväxling när en uppströmstjänst har en dålig eftermiddag, ett routing-DSL som komponerar flera modeller till ett anrop, och modellfusion för de fall där en modells omdöme inte räcker. Delegationsmarkören är frontendens beslut; vilken modell som svarar på den är ett konfigurationsval, och att hålla det valet utanför vikterna är det som låter dig ändra det utan att träna om något.

A screenshot of the GitHub repository inclusionAI/Realtime-Venus, captured 18 September 2026, showing the repository header, the file and folder listing for the Realtime-Venus-Omni and Realtime-Venus-Audio checkpoints and the harness, and the opening section of the README describing the full-duplex interaction system.

Vad skulle avgöra det

Tre saker skulle flytta Realtime-Venus från en artikel med vikter till en modell som vem som helst kan utvärdera. En oberoende grupp som reproducerar siffrorna för Full-Duplex-Bench continuation, eftersom 97 % under backchannels är en extraordinär siffra och extraordinära siffror behöver en andra läsare. Ett publicerat latensvärde, eftersom full-duplex-system står och faller med tid till första ljud och detta har inte angett ett mål. Och dokumentation för testramverket, eftersom designen för asynkron delegering är den enda delen av det här släppet som är genuint ny, och just nu är det den del du kan läsa om men inte enkelt ta i bruk.

Fram till dess är den korrekta beskrivningen snäv och föga upphetsande, vilket är precis varför den är värd att skriva ned: ett riktigt Apache-2.0-släpp av två 9B full-duplex-checkpoints, byggda på en öppen stomme, med starka självrapporterade benchmarks, ingen oberoende verifiering, inget API och inget tillkännagivande. Allt ovanför den linjen är slutledning.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen