Huvudtitelkort för "Realtime-Venus vs SeedRealtime", med undertexten "En körs för hundratals miljoner människor. En körs ännu för ingen.", med tre kort som lyder "SeedRealtime: live i Doubao sedan 5 augusti 2026, inget API, inget pris", "Realtime-Venus: Apache-2.0-vikter, ingen driftsättning" och "Båda: noll oberoende reproducerade benchmarks", ovanför en sidfotsremsa med texten "Båda uppsättningarna siffror är rapporterade av leverantören; ingen av dem har reproducerats oberoende." OrcaRouter-logotypen är sammanfogad i det nedre högra hörnet.
Guides & Insights

Realtime-Venus vs SeedRealtime: Två motsatta sätt att vara otillgänglig

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Realtime-Venus och SeedRealtime är de två halvorna av samma 2026-historia, och de misslyckas i motsatta tester. SeedRealtime är ByteDances nativa audiovisuella full-duplexmodell, som aktiverades i Doubao-appen den 5 augusti 2026 utan kostnad och når en publik som dess skapare beskriver som hundratals miljoner – utan API, utan modellidentifierare, utan pris och utan latensmål. Realtime-Venus är ett par 9B-checkpointar från Ant Groups Venus Team och Tsinghua University, publicerade den 12 september 2026 under Apache-2.0 med en teknisk rapport och inget tillkännagivande, och ligger i ett repository som vilken ingenjör som helst kan ladda ned och nästan ingen realistiskt kan driftsätta. Ett av dem kan du inte anropa. Det andra kan du ladda ned och sedan upptäcka att du inte har något att anropa det på. Båda befinner sig verkligen vid frontlinjen för samma förmåga, och ingen av dem har ett benchmark som någon utanför deras egna författare har reproducerat.

Två varianter av "du kan inte få det"

Det är värt att vara precis, eftersom frasen "inte tillgänglig" döljer en verklig skillnad.

SeedRealtime är otillgängligt på det sätt som en konsumentprodukt är otillgänglig: det finns, det fungerar, det har användare, och dörren är helt enkelt stängd för utvecklare. Det finns inget API, ingen prislista, ingen dokumentationsportal och ingen uttalad tidsplan för en sådan. ByteDances väg till marknaden har varit appen, och appen har varit tillräcklig. Det du får som byggare är en demo som du kan uppleva men inte integrera.

Realtime-Venus är otillgängligt på det sätt som ett forskningsartefakt är otillgängligt: vikterna är offentliga, licensen är tillåtande, koden finns där, och ingen kör det. Repositoriet driftsätts inte av någon inferensleverantör, och nedladdningar spåras inte alls, så det finns ingen offentlig signal om användning åt något håll. Det är tillgängligt i den bemärkelse som spelar roll för en forskare och otillgängligt i den bemärkelse som spelar roll för en produktchef.

Tillsammans ramar de in den fråga som hela den här kategorin just nu har fastnat på: de modeller som fungerar ligger bakom konsumentappar, och de modeller du kan köra finns inte i produktion någonstans.

Båda ligger på den nivå som faktiskt särskiljer 2026.

Ett användbart sätt att läsa av realtidsområdet är i tre nivåer. Den första är halvduplex röst med syn påklistrad – turordningsbaserade assistenter som kan se men fortfarande turas om. Den andra är full duplex-ljud, att lyssna och tala samtidigt utan kamera: ByteDances egen Seeduplex, OpenAIs GPT-Live, xAIs Grok Voice Think Fast 2.0. Den tredje är audiovisuell full duplex, där perception och uttryck spänner över video och ljud kontinuerligt.

SeedRealtime är den första modellen på den tredje nivån att nå storskalig kommersiell driftsättning. Realtime-Venus är en aktör med öppna vikter på samma nivå — video via en SigLIP2-kodare, ljud via Whisper-Medium, en Qwen3-8B-stomme och en ensekundsinteraktionsslinga som aldrig slutar uppfatta. Dess modellkort anger att den är anpassad från MiniCPM-o 4.5, OpenBMB:s omnimodala modell som släpptes tidigare under 2026, vilket placerar Ant Groups bidrag i efterträningen och körtiden snarare än i basarkitekturen.

Det de har gemensamt, och det som placerar dem en nivå över de ljudbaserade systemen, är att ingen av dem stannar upp för att titta. Kontinuerlig visuell perception medan den talar är en helt annan förmåga än att beskriva en enskild bildruta, och båda modellerna byggdes kring den.

Vad var och ens siffror är värda

A screenshot of the ByteDance Seed page for SeedRealtime, captured 18 September 2026, showing the page language toggle set to EN, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM' dated August 5, 2026, and the opening overview text stating that the model natively unifies audio, video and text in a single architecture and that end-to-end human evaluations show it halves conversational pacing issues compared with cascaded models.

Ingen av modellerna har ett benchmark från tredje part. Bevisningen är dock inte likvärdig, och skillnaden spelar roll.

• SeedRealtime publicerar ingen benchmark alls. Det ByteDance erbjuder är ett påstående att problem med dialogrytmen — att tala över användaren, svara sent, triggas av en främmande persons ljud — minskar med ungefär hälften jämfört med ett kaskadsystem, enligt mänskliga end-to-end-utvärderingar. Den bakomliggande datan publiceras inte.

• Föregångarens siffror har samma form. Seeduplex, den ljudbaserade modellen som ByteDance släppte i Doubao i april 2026, uppgavs halvera frekvensen av falska svar och falska avbrott, minska slutpunktsfördröjningen med ungefär 250 millisekunder, minska för tidiga svar med 40 % och öka samtalsnöjdheten med 8,34 punkter i ett storskaligt A/B-test. Allt enligt leverantören.

• Realtime-Venus publicerar en tabell. Dess rapport hävdar bästa resultat på sex av åtta videobenchmarkar, inklusive StreamingBench 70,2, OVO-Bench 64,7 och Daily-Omni 81,3, och leder på MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8 och Speech CMMLU 67,8 för ljudcheckpointen.

• Båda är oreproducerade. En publicerad tabell som ingen har granskat och ett opublicerat A/B-test som ingen kan granska är olika typer av overifierade uppgifter. Ingen av dem är bevis som du kan bygga ett upphandlingsbeslut på.

Den enda jämförelse som är värd att göra bland siffrorna för Realtime-Venus är mot dess egen bas. MiniCPM-o 4.5 rapporterar 80,2 på Daily-Omni; Realtime-Venus-Omni rapporterar 81,3. En förbättring med en punkt jämfört med modellen som den anpassades från, på ett benchmark som den modellen redan hanterade, är ett rimligt resultat av en eftertränings- och runtime-insats — och ett mycket mindre påstående än vad "bäst på sex av åtta" låter som på egen hand.

A two-column comparison scoreboard titled 'Realtime-Venus vs SeedRealtime — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no deployment', 'Where it runs: nowhere in production', 'Modality: audio, video and text', 'Benchmarks: self-reported table', 'Context: 40,960 tokens', 'Base model: adapted from MiniCPM-o 4.5'. The right column, labelled SeedRealtime, reads 'Availability: Doubao app only, no API', 'Where it runs: consumer scale since 5 August 2026', 'Modality: audio, video and text', 'Benchmarks: none published, vendor A/B claims', 'Context: not published', 'Base model: not disclosed'. The footer reads 'All figures vendor-reported; neither model has an independently reproduced benchmark.'

Problemet med turntagning, vilket är där full-duplex hör hemma

Full-duplex är inte en latensfunktion. Det är en uppsättning beteenden: att veta när en paus betyder "jag tänker" snarare än "jag är klar", att skilja en kringståendes samtal från personen som talar till dig, och att hålla tyst genom en backchannel i stället för att behandla "mm-hm" som ett avbrott.

SeedRealtimes tillvägagångssätt är att modellera konversationstillstånd nativt och helt slopa den externa röstaktivitetsdetektorn, så att turtagning är ett inlärt beteende i nätverket snarare än en tröskel som tillämpas på en ljudström. Det är samma arkitektoniska åtagande som Realtime-Venus gör, och båda ställs mot kaskadsystemen som behöver en separat komponent för att avgöra vem som talar.

Där evidensen skiljer sig åt är att SeedRealtimes påstående handlar om driftsättning i stor skala – hundratals miljoner användare, riktiga rum, riktigt brus – medan Realtime-Venus påstående gäller ett benchmark. Resultaten från Full-Duplex-Bench v1.5 för Realtime-Venus-Audio – 75 % svar på avbrott, 97 % fortsättning under backchannels, 88 % under tal riktat till andra och 86 % under bakgrundstal, vilket överträffar Gemini 3.1 Live och GPT-4o när det gäller fortsättning – är de mest direkt relevanta siffrorna som någon av modellerna har publicerat för detta problem. De är också helt självrapporterade, och 97 % fortsättning under backchannels är en slående siffra som förtjänar en andra läsare innan någon citerar den som ett faktum.

Där var och en lämnar en byggare

Det praktiska glappet är inte kvalitet, det är erbjudandets utformning.

• SeedRealtime — du kan uppleva det gratis i Doubao och aldrig integrera det. Det finns ingen väg från "det här är imponerande" till "det här finns i min produkt."

• Realtime-Venus – du kan ladda ner den, finjustera den, köra den nätverksisolerat och inspektera varje lager. Kostnaden är två 9B-checkpoints i BF16 på ungefär arton gigabyte vikter vardera, plus en kontinuerlig strömningsloop per sekund, vilket innebär en GPU-nod som debiteras oavsett om någon anropar den eller inte.

• Ingendera har ett hostat alternativ. Ingendera kan testas med en nyckel och en eftermiddag.

Den sista punkten är anledningen till att de två modellerna är mer användbara som ett par än som motståndare. Tillsammans visar de att båda halvorna av problemet är lösta – förmågan fungerar, och vikterna kan släppas – samtidigt som de visar att ingen ännu har satt ihop dem till något som en utvecklare faktiskt kan anropa.

Det finns ett sätt runt problemet som många team kommer att ta till, och det är värt att vara tydlig med vad det täcker och inte täcker. Om du inte kan få röstlagret kan du fortfarande bygga den del som tänker. Realtime-Venus delegerar sitt dyra arbete – hämtning, krävande resonemang, affärs-API-anrop – till ett bakgrundsramverk genom asynkrona delegeringsmarkörer, och den delegerade grenen är vanlig textinferens. OrcaRouter har varken Realtime-Venus eller SeedRealtime; båda duplexlagren ligger utanför vad vi erbjuder, och vi hostar inte någon av dem. Nästan 200 textmodeller bakom en enda nyckel till leverantörens listpris utan påslag är den halva av arkitekturen som vi faktiskt täcker, med automatisk failover så att en bakgrundsuppgift inte misslyckas för att en uppströmsleverantör hade en dålig eftermiddag, ett routing-DSL för att sammanställa flera modeller till ett anrop, och modellfusion där en enskild modells omdöme inte räcker. Det är inte den del av dessa system som är svår. Det är den del som faktiskt går att köpa.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge, the arXiv 2609.13814 badge, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel stating 'This model isn't deployed by any Inference Provider.'

Vad skulle ändra denna jämförelse

Tre utvecklingar skulle avgöra saken, och ingen av dem har ännu inträffat. En oberoende benchmark av Realtime-Venus, eftersom en tabell utan en andra läsare är ett påstående och inte ett resultat. Ett API för SeedRealtime, eftersom modellen med det starkaste beviset för driftsättning för närvarande är den som ingen kan använda. Och en publicerad latenssiffra från någon av dem – tid till första ljud är det mått som den här kategorin köps på, och i skrivande stund har ingen av modellerna angett en.

Fram till dess är den ärliga sammanfattningen att SeedRealtime är beviset för att audiovisuell full duplex fungerar i konsumentskala, och Realtime-Venus är beviset för att vikterna kan öppnas, och inget av dessa faktum för en byggare närmare att lansera en produkt. Det är inte en kritik av något av labben. Det är en beskrivning av en kategori som har löst forskningsproblemet men ännu inte distributionsproblemet.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen