Hjältetitelkort för 'GPT-Live-1 vs Qwen-Audio-3.0-TTS', med undertexten 'En håller en konversation, en renderar ett manus', med en badge som lyder 'Inte substitut – olika jobb, olika räkningar' och tre kort: 'Qwen-Audio-3.0-TTS Plus — Elo 1 232, på fjärde plats i AA Provider Voice Arena, 27,6 USD per 1 miljon tecken', 'GPT-Live-1 — 0,05 USD per röstminut, full duplex, 3,00 USD per timme öppen linje' och 'Haken — cirka 16 tecken per sekund på berättarsidan, text in och ljud ut', ovanför en sidfotsremsa som lyder 'Qwen-siffror enligt Artificial Analysis; GPT-Live-1-siffror rapporterade av OpenAI.' OrcaRouter-logotypen är komponerad nere till höger.
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS: Ett samtal och en berättarröst är inte samma post

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

Ställ GPT-Live-1 och Qwen-Audio-3.0-TTS sida vid sida vad gäller pris per timme ljud, och gapet ser avgörande ut: Alibabas Qwen-Audio-3.0-TTS-Plus genererar tal för 27,6 dollar per miljon tecken, ungefär 1,66 dollar ljud per timme, medan OpenAIs GPT-Live-1 debiterar 3,00 dollar för en timme kontinuerlig öppen linje. Berättaren är billigare, så berättaren vinner – förutom att detta är fel jämförelse, och anledningen till att den är fel är det mest användbara någon kan ta med sig från matchningen. Qwen-Audio-3.0-TTS är en text-till-tal-modell. GPT-Live-1 är en full-duplex konversationsmodell. En av dem läser vad du skrev. Den andra måste flera gånger per sekund avgöra om du har slutat prata.

En renderar, en konverserar

Text-till-tal tar text och returnerar ljud. Det finns ingen ljudindata, ingen taltur att ta, ingen föreställning om att bli avbruten och ingen transkription att returnera, eftersom modellen aldrig hörde något. Dess kostnadsmodell är en tryckpress: sidor in, ljud ut, kvalitet och genomströmning är de enda två siffrorna som spelar roll, och du kan mäta båda innan du lanserar.

En full-duplex samtalsmodell bearbetar inkommande ljud medan den producerar utgående ljud. Dess uppgift omfattar de delar av ett samtal som inte har med ord att göra – att pausa när användaren pausar, att fortsätta genom en backchannel som "yeah" i stället för att behandla den som ett avbrott, att lämna ordet mitt i en mening och att utlösa ett verktygsanrop utan att tappa tråden. GPT-Live-1 gör allt detta och returnerar transkriptioner från taligenkänning tillsammans med sessionen, vilket den bara kan göra eftersom den lyssnade hela tiden.

Om din produkt läser artiklar högt, konverterar dokumentation till ljud eller berättar en video, är GPT-Live-1 fel verktyg till fyra gånger priset per timme. Om din produkt tar emot ett telefonsamtal är Qwen-Audio-3.0-TTS en tredjedel av en pipeline som fortfarande behöver en ASR-modell och en språkmodell för att bli ett samtal.

Där Qwen-Audio-3.0-TTS verkligen är det bästa svaret

Argumentet för Alibabas modell är inte marknadsföring. Plus-nivån, som släpptes den 20 juli 2026 av Alibabas Tongyi Lab och gjordes tillgänglig som ett hostat, stängt API via Alibaba Cloud Model Studio, intog förstaplatsen på Artificial Analysis text-till-tal-arena när den lanserades. En topplista är dock ett rörligt mål, och den här har förändrats: i september 2026 ligger Qwen-Audio-3.0-TTS-Plus på fjärde plats på Provider Voice Arena med ett Elo på 1 232 baserat på 2 306 sampel, bakom Cartesia Sonic 3.6 på 1 275, Inworld Realtime TTS-2 på 1 244 och Speechifys Simba 3.2 på 1 233 – tre modeller från augusti och juli som släpptes efter den. En fjärdeplats bland över tjugo, med ledningen förlorad och prisfördelen intakt, är fortfarande en stark position. Det är bara inte den position som lanseringsbevakningen beskrev.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

Den leder inom 10 av de 16 språk den täcker, lägger till 20 kinesiska dialektregioner, stöder röstkloning från korta prover, inklusive tvärspråklig kloning, och har 86 inline-taggar för känsla och framförande.

Förbehållen är tillräckligt specifika för att planera utifrån.

• Genomströmning — Plus genererar ungefär 16 tecken per sekund, jämfört med 30,2 för Simba 3.2, 27 för Gemini 3.1 Flash TTS och runt 120 för Sonic 3.5. Vid batchrendering är detta osynligt; för en liveprodukt är det siffran som avgör din buffert.

• Prisdokumentation — den allmänt citerade siffran 27,6 USD per miljon tecken stämmer inte med Alibabas egen prissida i alla ögonblicksbilder, som vid vissa tillfällen har angett lägre belopp för båda prisnivåerna. Kontrollera den aktuella siffran på kontonivå innan du gör en prognos, inte resultattavlans.

• Röstbibliotek — trots 16 stödda språk består de offentliga förinställda rösterna nästan helt av kinesiska och engelska. De övriga fjorton språken finns via kloningsarbetsflödet snarare än direkt tillgängliga.

• Funktionsstyrning – de 86 inline-känsloetiketterna fungerar endast i envägsströmningsläge, så den uttrycksfulla kontrollen överlever inte alla integrationsvägar.

• Nivåer — Flash siktar på ungefär 300 ms latens för första paketet vid realtidsanvändning; Plus är kvalitetsnivån. De är olika produkter med samma namn, och att välja fel är ett vanligt första misstag.

Den ärliga versionen av kaskadlagförslaget

Här är vad timjämförelsen utelämnar. En konversationsprodukt byggd på en TTS-modell är en kaskad: en ASR-modell omvandlar talet från den som ringer till text, en språkmodell avgör vad som ska sägas, och TTS-modellen läser upp det. Tre leverantörer, tre räkningar, tre latensbudgetar som läggs ihop, och en överlämning vid varje gräns där prosodin dör. TTS-delen kan kosta 1,66 dollar per timme ljud. De andra två delarna är där pengarna och misstagen faktiskt finns — och kaskadmodellen kan inte höra en paus mitt i en mening som den redan talar.

GPT-Live-1 slår samman de tre delarna till en session och en mätare, för 0,05 USD per minut röst, med resonemangsbackenden fakturerad separat. Två detaljer gör att den fakturan förblir korrekt. Sessionsinitiering debiterar 15 sekunder röst i förskott, vilket krediteras mot senare varaktighet i stället för att läggas till den. Och backenden är en andra mätare: varje delegerat resonemangsanrop, verktygsanrop och webbsökning debiteras enligt den modellens normala priser, så att rikta delegeringen mot en frontier-resonerare som söker vid varje tur ger ett dyrt anrop bakom ett billigt röstlager.

Vad de oberoende bedömningsorganen säger om de två är lärorikt just därför att de mäter olika saker och inget av dem smickrar sitt mätobjekt. Qwen-Audio-3.0-TTS-Plus ligger fyra på kvalitet och nära botten på genomströmning. GPT-Live-1 ligger sjua av elva på Artificial Analysis Speech to Speech Index med 69,8 % – bakom GPT-Realtime-2.1 som den ersätter, med 73,9 % – samtidigt som den debiteras i den lägsta änden av indexets intervall för kostnad per timme inljud, 4,42 dollar mot GPT-Realtime-2.1:s 10,75 dollar. Ingen av modellerna tar förstaplatsen i sin egen kategori. Båda är billigare än det de byggdes för att slå.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

Den där andra mätaren är där ett routningslager blir ett designbeslut snarare än en optimering. OrcaRouter har varken GPT-Live-1 eller Qwen-Audio-3.0-TTS — röstlagret ligger i båda fallen utanför vår räckvidd, och vi routar inget av det. Resonemangsbenet är det inte. Ungefär 190 modeller från elva uppströmsleverantörer ligger bakom en nyckel till leverantörens listpris utan påslag, och en leverantörs prissänkning slår igenom samma dag i stället för vid nästa avtalsförnyelse. För en kaskad täcker det mellanbenet direkt: håll två ASR-alternativ och tre resonemangsmotorer bakom en enda slutpunkt, A/B-testa dem mot varandra på verklig trafik, och låt automatisk failover absorbera en dålig eftermiddag uppströms utan att tappa ett samtal.

Röstkloning är Qwen-Audio-3.0-TTS:s mest kommersiellt användbara funktion och dess största yta för regelefterlevnad. Tio sekunders referensljud räcker för att återskapa en talare, tvärspråkligt, vilket är omvälvande för lokalisering och en risk överallt där identitet spelar roll. Ope​nAI släppte GPT-Live-1 helt utan kloning och utan anpassade röster – 12 API-röster att välja bland, och det är hela listan.

Den asymmetrin är lätt att förbise i en funktionsjämförelse och svår att förbise i en riskgranskning. En produkt som bara någonsin talar med en av tolv leverantörsröster har ett mycket kortare svar på "vems röst är det, och vem samtyckte till den" än en produkt som kan återskapa vilken röst som helst från ett prov. Om du behöver kloning är pipeline-beslutet redan fattat åt dig, och frågan blir vad som styr det. Om du inte behöver det är GPT-Live-1:s begränsning värd att läsa som en kontroll du inte behövde bygga.

Vilken ska man köpa

Köp Qwen-Audio-3.0-TTS om utdata är innehåll: berättarröst, lokalisering, tillgänglighetsljud, dubbning eller ett arbetsflöde där texten finns före ljudet och kvalitet per renderad timme är måttet. Börja med Flash om du behöver uppspelning i realtid, gå över till Plus när själva rösten är leveransen, och prissätt kloningsarbetsflödet separat från de förinställda rösterna.

Köp GPT-Live-1 om indata är en person. Supportlinjer, bokningsflöden, intagningsintervjuer, allt där användarens första stavelse kommer medan modellen är mitt i en mening och systemet måste bete sig som en lyssnare snarare än en spelare. Det kostar mer per timme ljud, och det är den enda av de två som kan avbrytas.

De två är komplement långt oftare än rivaler: många produkter vill ha Qwen-Audio-3.0-TTS som läser ett dokument och en duplexmodell som hanterar samtalet som följer. Det de inte bör dela är en kostnadsmodell. Per ljudtimme är rätt mätvärde för exakt en av dem.