Hero-titelkort för "Realtime-Venus vs Qwen-Audio-3.0-TTS", med underrubriken "En renderare och en lyssnare är inte samma köp", med tre kort som lyder "Qwen-Audio-3.0-TTS-Plus: Elo 1 259, tvåa på Artificial Analysis Provider Voice Arena", "Realtime-Venus: det finns överhuvudtaget inget röstkvalitetsbetyg" och "Indatan är hela skillnaden: enbart text, kontra ljud, video och text", ovanför en sidfotsremsa som lyder "Qwen-siffror enligt Artificial Analysis; Realtime-Venus-siffror från dess tekniska rapport, ej reproducerade." OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Realtime-Venus vs Qwen-Audio-3.0-TTS: Den ena läser ditt manus, den andra måste höra dig

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den frestande jämförelsen mellan Realtime-Venus och Qwen-Audio-3.0-TTS är pris per timme ljud, och den ger ett prydligt svar som är helt fel. Qwen-Audio-3.0-TTS-Plus genererar tal till ungefär 27,6 dollar per miljon tecken, vilket motsvarar nära 1,66 dollar för en timme färdigt ljud. Realtime-Venus, det 9B full-duplex-system som Ant Groups Venus Team byggde tillsammans med Tsinghua University, har inget pris alls eftersom det inte finns någon hostad tjänst – men egenhostat skulle det kosta dig en GPU-nod som körs kontinuerligt, vilket är minst en storleksordning mer per timme. Renderaren vinner på aritmetiken. Aritmetiken mäter två olika produkter: Qwen-Audio-3.0-TTS tar text och returnerar ljud, och Realtime-Venus tar ljud och video och returnerar en konversation. Frågan som faktiskt skiljer dem åt är inte vad de ger som utdata. Det är huruvida något behöver tala tillbaka.

Inmatningen är hela skillnaden

Qwen-Audio-3.0-TTS, som släpptes av Tongyi Lab på Alibaba Cloud den 20 juli 2026, är en talsyntesmodell som exponeras som ett hostat API utan öppna vikter. Text går in via en HTTP-slutpunkt och ljud kommer ut. Det finns ingen väg för ljudinmatning, ingen tur att ta, ingen transkription att returnera och inget begrepp om att bli avbruten – modellen har aldrig hört något. Hela dess kostnadsmodell är en tryckpress: tecken in, ljud ut.

Realtime-Venus är däremot ständigt lyssnande. Den audiovisuella checkpointen har en SigLIP2 visuell encoder för strömmande bildrutor och en Whisper-Medium ljudencoder som matar ett Qwen3-8B-backbone, och båda checkpointarna kör en interaktionsloop på en sekund som kontinuerligt uppdaterar konversationstillståndet och avgör om den ska tala eller förbli tyst. Den producerar tal genom diskreta S3-tokens och en strömmande flow-matching-avkodare i stället för ett separat syntessteg, och den kan returnera text tillsammans med vågformen.

Det är inte en skillnad i funktionalitet. Det är skillnaden mellan en komponent och ett system. Ställ de två sida vid sida, och en av dem kan stoppas in i en pipeline som redan har en taligenkännare och en språkmodell framför sig. Den andra ersätter alla tre.

Ett genomarbetat exempel gör det konkret

Ta en supportlinje. En kund ringer, beskriver ett problem dåligt, pausar mitt i en mening för att hitta ett kontonummer, avbryts av ett meddelande i bakgrunden och ställer sedan en följdfråga innan agenten har svarat klart.

Ett system byggt på Qwen-Audio-3.0-TTS hanterar detta som tre leverantörer och tre fakturor: en igenkännare omvandlar samtalarens tal till text, en språkmodell avgör vad som ska sägas, och Qwen-Audio-3.0-TTS läser upp det. Varje hopp tillför latens, och varje gräns är där prosodin dör. Det kritiska felet är strukturellt — TTS-delen kan inte höra pausen mitt i en mening som den redan talar, så inbrytningen måste hanteras av något framför den.

Realtime-Venus hanterar samma samtal som en enda modell, ingen extern röstaktivitetsdetektor, ingen överlämning. Dess Full-Duplex-Bench v1.5-siffror – 75 % svar på avbrott och fortsättningsfrekvenser på 97 % vid backchannels, 88 % vid tal riktat till andra och 86 % vid bakgrundstal – är exakt de mätvärden som beskriver detta scenario. De är också självrapporterade, från modellens egen tekniska rapport, utan extern reproduktion. Läs dem som ett designpåstående, inte som en mätning.

Röstkvalitet: den ena har ett Elo, den andra har inget

Detta är den mest ensidiga delen av jämförelsen, och den gynnar Alibaba med bred marginal.

• Oberoende poäng — Qwen-Audio-3.0-TTS-Plus ligger tvåa på Artificial Analysis Provider Voice Arena med ett Elo på 1 259 över 1 544 sampel per den 18 september 2026, efter Cartesia Sonic 3.6 på 1 277 och före Inworld Realtime TTS-2 på 1 247 och Speechify Simba 3.2 på 1 241.

• Var det började – arenans egen releasekolumn listar den här modellen som en post i september 2026, vilket är den nivå som för närvarande poängsätts snarare än lanseringsdatumet den 20 juli 2026. När den än har flyttats har den hela tiden legat kvar i topp två.

• Realtime-Venus — ingen arena-post, ingen tredjeparts röstutvärdering, ingenting. Dess enda röstrelaterade siffra är en självrapporterad VoiceBench AlpacaEval-poäng på 4,81 som rapporten beskriver som matchande det bästa jämförelsetalet.

• Vad det innebär – ingen utanför författarna har bedömt huruvida Realtime-Venus låter bra. Det är inte ett minus för den; det är helt enkelt okänt, och okänt skiljer sig från dåligt. Men om röstkvalitet är det som ska levereras, är det bättre att köpa en Elo-betygsatt modell än att förlita sig på en obetygsatt.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

Språk, röster och expressiv kontroll

Alibabas modell är byggd för bredd i framförandet. Den levererar fler än tusen röster, täcker sexton språk inklusive tjugo kinesiska dialektregioner och exponerar 86 inline-taggar för känsla och framförande – en kontrollyta som du skriver in i själva texten, plus instruktioner för framförande i naturligt språk. Utdatat går upp till 48 kHz, upp från 24 kHz i föregående generation, och en enskild syntes kan pågå i upp till tre minuter. Flash-nivån siktar på ungefär 300 millisekunder till första paketet för uppspelning i realtid; Plus-nivån är kvalitetsnivån och genererar med ungefär sexton tecken per sekund, vilket är tillräckligt långsamt för att spela roll i en liveprodukt och osynligt vid batchrendering.

Realtime-Venus har dokumentation på engelska och kinesiska, levererar en referensröst tillsammans med vikterna och ger dig en token-till-vågform-dekoder i stället för ett röstbibliotek. Uttrycksfullhet i Qwen-bemärkelse – taggar, instruktioner, tusen förinställningar – har ingen motsvarighet här. Vad den har i stället är förmågan att ändra sitt framförande som svar på vad den hör, vilket är en annan typ av uttrycksfull kontroll och mycket svårare att få ned på ett specifikationsblad.

Kostnaden för varje väg, ärligt talat

Det finns ett verkligt förbehåll kring Alibaba-siffran innan någon budgeterar utifrån den. Den ofta citerade siffran 27,6 dollar per miljon tecken stämmer inte med Alibabas egen prissida i varje ögonblicksbild, och nivåerna prissätts separat. Kontrollera siffran på kontonivå i stället för att lita på en jämförelsetabell, inklusive den här.

Realtime-Venus har inget listpris eftersom det inte finns något att köpa. Kostnaden är två 9B-checkpoints i BF16 – ungefär arton gigabyte vikter styck innan aktiveringsminne – plus en kontinuerlig streamingloop, vilket innebär en GPU-nod som faktureras per månad oavsett om någon anropar eller inte. Vid jämn volym är det billigare per konversation än ett mätarbaserat röst-API. Vid intermittent volym är det mycket sämre, och skärningspunkten är den enda ekonomiska fråga som spelar roll.

Det finns en tredje väg som många team kommer att hamna på, och den är värd att namnge eftersom den förändrar beslutets form. Om du behåller en kaskad är det enda benet som behöver vara en hostad modell det mellersta – resonemanget. OrcaRouter har varken Qwen-Audio-3.0-TTS eller Realtime-Venus; båda röstlagren ligger utanför det vi erbjuder, och vi säger hellre det än antyder något annat. Resonemangsbenet är det vi faktiskt täcker: nästan 200 textmodeller bakom en nyckel till leverantörens listpris utan påslag, automatisk failover mellan uppströmsleverantörer så att en dålig eftermiddag hos en leverantör inte tappar ett pågående samtal, ett routing-DSL som komponerar flera modeller till ett enda anrop, och modellfusion när ett beslut förtjänar mer än en åsikt. I en kaskad är det benet du helst vill kunna byta utan kontraktsförhandling, och det där en leverantörsprissänkning landar samma dag i stället för vid förnyelse.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Kloning kan slå åt båda hållen

Qwen-Audio-3.0-TTS kan klona en röst från ett kort referensexempel, tvärspråkligt, och dokumenteras vara robust mot brusig eller efterklangsrik indata. Det är den enskilt mest kommersiellt användbara förmågan i jämförelsen och den största ytan för regelefterlevnad. En produkt som kan återge vilken talare som helst från tio sekunders ljud har ett mycket längre svar på "vems röst är det, och vem samtyckte till den" än en som bara någonsin talar i en leverantörs förinställningar.

Realtime-Venus levererar en referensröst tillsammans med vikterna. Du kan klona med den om du har ljudet och träningskörningen, men inget i utgåvan är byggt kring att göra det enkelt – vilket, för en självhostad driftsättning inom en regelefterlevnadsgräns, rimligen är det säkrare standardvalet.

Vilken du faktiskt köper

Köp Qwen-Audio-3.0-TTS när ljudet är utdata. Berättarröst, lokalisering, tillgänglighet, dubbning, alla arbetsflöden där texten finns innan ljudet gör det och kvalitet per renderad timme är måttet. Börja på Flash om uppspelningen är live, gå över till Plus när rösten själv är produkten, och prissätta kloningsarbetsflödet separat från förinställningsbiblioteket.

Välj Realtime-Venus när indata är en person och systemet måste bete sig som en lyssnare. Kameramedveten assistans, handsfri interaktion, allt där en människa kommer att avbryta mitt i en mening och förvänta sig att systemet hanterar det. Avvägningen är skarp: du avstår från en Elo-betygsatt röst, tusen förinställningar och vilket hostat alternativ som helst, och i gengäld får du den enda av de två som kan höra dig.

De flesta produkter vill ha båda, på olika platser. Det de inte bör dela är en kostnadsmodell — pris per timme ljud är rätt mått för exakt en av dessa två modeller, och det är inte den som för konversationen.