Titelkort för artikeln om Speech to Speech-indexet som visar de tre högsta poängen: GPT-Live-1 med GPT-6 Astra vid medelinsats på 81,5, Grok Voice Think Fast 2.0 High på 81,3, och GPT-Live-1 med GPT-5.6 Sol vid låg insats på 80,1
Guides & Insights

GPT-Live-1 toppar Speech to Speech Index med 81,5 – men rankningen tillhör dess backend

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

GPT-Live-1, den full-duplex-röstmodell som först släpptes i ChatGPT den 8 juli 2026, ligger nu först på Artificial Analysis Speech to Speech Index med 81,5 – en rad som bara finns eftersom modellen riktades mot GPT-6 Astra för att sköta sitt tänkande. Kör samma röstfrontend med GPT-5.6 Sol som delegerad backend vid låg resonemangsinsats och den får 80,1, vilket är tredje plats. Andraplatsen, på 81,3, tillhör Grok Voice Think Fast 2.0 High.

Två ärligheter innan siffrorna. Modellen är inte ny: GPT-Live-1 nådde utvecklar-API:et den 10 september 2026, efter två månader som ChatGPT:s standardröst. Det som är nytt, mätt den 15 september, är att en extern utvärderare har betygsatt den – det enda som har saknats i varje redogörelse för den här modellen hittills, inklusive vår egen, där de enda siffrorna som fanns tillgängliga var de som OpenAI publicerade om sig själva. Och marginalen på 0,2 punkter ned till andraplatsen är mindre än gapet på 1,4 punkter mellan GPT-Live-1:s två egna konfigurationer, vilket är den mest användbara siffran på resultattavlan.

Så rubriken "GPT-Live-1 är den bästa röstmodellen" är inte riktigt vad indexet säger. Det säger att GPT-Live-1 med GPT-6 Astra vid medium effort är bäst, med en femtedels poäng, och att valet av backend påverkar resultatet mer än någon konkurrerande modell gör.

Vad indexet faktiskt mäter

Artificial Analysis bygger Speech to Speech Index som ett likaviktat kompositmått av fyra delar: Speech Reasoning, mätt med Big Bench Audio; Agentic Performance, mätt med τ-Voice; Arena Preference, ett parvis Elo för mänskliga preferenser; och Task Success Rate. Endast modeller där alla fyra komponenter finns tillgängliga får ett indexvärde — allt annat visas som ett streck, vilket är varför tabellen har långt fler rader än poäng. Själva indexet lanserades den 23 juni 2026 och har reviderats två gånger sedan dess, senast för att byta ut Conversational Dynamics mot Task Success, så en poäng från en revidering är inte strikt jämförbar med en poäng från en annan.

Ytterligare två metodologiska detaljer spelar roll när du läser rankningen. Arena Elo är fryst vid det värde det hade när en modell först blev publicerbar, så preferenskomponenten belönar tidig ankomst snarare än att vara bäst i dag. Och indexet poängsätter ett helt system snarare än en enskild modell: för GPT-Live-1 omfattar siffran röstfrontenden plus den backendmodell som den lämnar över arbetet till. Det är ett medvetet designval, och det är anledningen till att samma modell förekommer två gånger med olika poäng.

Toppen av fältet, som publicerad:

• GPT-Live-1 (Astra, medium) — index 81,5, etta

• Grok Voice Think Fast 2.0 High — index 81,3, tvåa

• GPT-Live-1 (Sol, låg) — index 80,1, trea

• GPT-Realtime-2.1 High — index 73.9, fjärde

• GPT-Realtime-2 High — index 73,6, femte

• Grok Voice Think Fast 1.0 — index 72.3, sjätte

• Gemini 3.1 Flash Live High — index 71,5, sjunde

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

Som jämförelse ligger modellen som GPT-Live-1 ersätter 7,6 punkter under den. Det är ett verkligt generationsgap, och det är inte omstritt.

0,2-poängssegern kommer från exakt en komponent

Bryt isär sammansättningen och de två ledarna slutar se ut som samma typ av modell. När det gäller delarna, enligt Artificial Analysis:

• Agentisk prestanda (τ-Voice) — GPT-Live-1 67,9 % mot Grok Voice Think Fast 2.0 High 56,5 %

Talresonemang (Big Bench Audio) — 90 % mot 97 %

• Uppgiftsframgångsgrad — 87,4 % mot 94,6 %

• Arena Elo — 1048 mot 1011

• Tid till första ljudet — 1,34 s mot 0,70 s

• Kostnad per timme, backend ingår — 5,83 $ jämfört med 4,80 $

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 vinner två av sex rader och förlorar fyra, men tar ändå hem indexet. Aritmetiken är inget mysterium: gapet i τ-Voice är 11,4 poäng, mycket större än någon annan skillnad i tabellen, och med lika viktning drar det det sammanvägda resultatet över mållinjen. I klartext: GPT-Live-1 är den bättre agenten och Grok Voice Think Fast 2.0 High är den bättre lyssnaren och den snabbare – och indexet råkar vikta det som GPT-Live-1 är bra på tillräckligt tungt för att göra den till etta.

Om din produkt är en röstagent som bokar, löser eller utför transaktioner, är τ-Voice-försprånget på 11,4 punkter siffran som förutsäger din upplevelse. Om din produkt är en konversation som måste kännas omedelbar och aldrig tala över användaren, är tiden till första ljudet på 0,70 sekunder siffran som förutsäger din upplevelse, och Grok vinner den med ungefär en faktor två. När det gäller reglerat uppgiftsutförande finns det en andra varning: Groks uppgiftsframgångsgrad på 94,6 % är den högsta i den synliga tabellen, och GPT-Live-1:s 87,4 % innebär att ungefär en uppgift av åtta inte slutförs. Båda är förbättringar jämfört med den föregående generationen. Ingen av dem är ett löst problem.

Rad #1 är en routingkonfiguration, inte en modell.

Här är delen som förtjänar mer uppmärksamhet än placeringen på topplistan. GPT-Live-1 är ett full-duplex röstlager som hanterar lyssnande, talande, avbrott och turtagning själv, och delegerar resonemang, verktygsanrop och sökning till en separat backendmodell medan samtalet fortsätter. Artificial Analysis betygsatte två av dessa parkombinationer som separata poster. Astra med medelhög ansträngning gav 81,5. Sol med låg ansträngning gav 80,1.

Den där spridningen på 1,4 punkter är hela storyn. Gapet mellan första- och andraplatsen är 0,2 punkter. Gapet mellan GPT-Live-1:s två poängsatta konfigurationer är sju gånger större. Ingenting hos röstmodellen förändrades mellan de raderna – bara vilken modell som skötte tänkandet, och på vilken ansträngningsnivå. En resultattavla som rangordnar system talar korrekt om för dig att konfigurationen är produkten.

De reviderar också vår egen rapportering. Den 11 september 2026 registrerade vi GPT-Live-1 på 69,8 % i detta index, efter både GPT-Realtime-2.1 och Grok. Det var den avläsning som fanns tillgänglig då, och den stödde en rimlig slutsats – att OpenAI hade byggt den bästa samtalsmekaniken och inte den bästa röstagenten. Indexet innehåller nu två delegerade GPT-Live-1-konfigurationer på 81,5 och 80,1. Artificial Analysis publicerar inte någon ändringslogg, och de reviderade indexets komponenter i augusti, så vi kan inte med säkerhet säga huruvida den tidigare siffran var en icke poängsatt eller delvis poängsatt konfiguration eller en körning under den äldre viktningen; det som går att observera är att de delegerade parkopplingarna nu visas som egna kompletta rader, och att svaret förändrades när de gjorde det.

Den praktiska konsekvensen är att "vilken röstmodell" är fel fråga och "vilken röstmodell plus vilken backend, vid vilken ansträngning" är rätt fråga. Det är en routingfråga, och det är den vår egen produkt finns för att besvara. OrcaRouter exponerar GPT-Live-1:s delegationsbackend, GPT-6 Astra, genom samma OpenAI-kompatibla endpoint som 200+ andra modeller, så att byta tankelager är en modell-ID-ändring snarare än en integration. routing-DSL komponerar flera modeller till ett enda anrop, och automatisk failover innebär att en obeprövad kombination inte är en produktionssatsning – om backenden försämras landar begäran någon annanstans i stället för att misslyckas. För att vara precis om vad vi inte gör: GPT-Live-1 finns inte i vår katalog och vi betjänar det inte. Backenden som det delegerar till är en annan sak.

Vad en timme av detta kostar

GPT-Live-1:s front-end faktureras med 0,05 USD per röstminut, debiterat per sekund, vilket motsvarar 3,00 USD för en timme öppen linje. Det är inte hela räkningen: delegerat resonemang, verktygsanrop och webbsökning debiteras separat enligt vad backendmodellen tar betalt. Artificial Analysis mätte den sammanlagda kostnaden, vilket är anledningen till att deras kostnadskolumn är den man ska använda:

• GPT-Live-1 (Sol, low) — $4,47 per timme

• Grok Voice Think Fast 2.0 High — 4,80 $ per timme

• GPT-Live-1 (Astra, medium) — $5,83 per timme

• GPT-Realtime-2.1 High — $10.75 per timme

Vinnaren i rankningen är den dyraste av de tre nuvarande alternativen, och konfigurationen som vann är 30 % dyrare per timme än konfigurationen som kom på tredje plats. Läst åt andra hållet är uppdelningen lärorik: 3,00 dollar av varje timme är röstlagret, och återstoden – 1,47 dollar på Sol, 2,83 dollar på Astra – är backend-tokens. Tankelagret utgör någonstans mellan en tredjedel och hälften av din räkning, vilket är en stor andel för en komponent som resultattavlan behandlar som en fotnot.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

Jämfört med modellen den ersätter är hela familjen dock ungefär halva priset – front-end-priset på 0,05 USD per minut är en verklig sänkning, inte en ompaketering. Eftersom backend-tokens faktureras enligt backend-priser är kostnaden för en GPT-Live-1-driftsättning till största delen en funktion av vilken resonemangsmodell du routar till, och backends kan vara OpenAI:s egna eller tredjepartsmodeller. På OrcaRouter förs dessa backends vidare till leverantörens listpris med 0 % påslag, så en leverantörsprisändring på tankelagret blir aktiv samma dag i stället för vid nästa faktureringscykel.

Vad index inte avgör

Tre förbehåll, angivna av källan snarare än härledda. Både GPT-Live-1-posterna och Grok Voice Think Fast 2.0 High är flaggade som baserade på ett enda försök, vilket är tunt för ett beslut på 0,2 poäng – en ny körning skulle kunna ändra ordningen mellan första- och andraplatsen utan att något förändras hos någon av modellerna. Arena Elo var, som nämnts, fryst vid varje modells första publicerbara mätning. Och indexet har ingen post för hur dessa system beter sig under ett långt samtal: komponenterna är kortsiktiga till sin konstruktion, medan den felmod som faktiskt slår ut röstagenter i produktion är drift under ett samtal på tjugo minuter.

Separat, och från leverantören snarare än indexet: GPT-Live-1:s API släpptes utan bild- eller videoinmatning, utan strukturerade utdata och utan en gratisnivå, och dess hastighetsbegränsningar räknas i samtidiga sessioner snarare än förfrågningar per minut. Det är begränsningar från lanseringsdagen som kanske redan har ändrats; kontrollera dem innan du anpassar designen efter dem.

Vad ska man göra med detta

Om du väljer en arkitektur den här veckan snarare än en modell, belönar indexet det delegerade mönstret för agentiskt arbete och kaskadmönstret för latens. GPT-Live-1 på 81,5 är det starkaste beviset hittills på att dela upp konversation från resonemang är rätt form för uppgiftslösande röstagenter. Grok Voice Think Fast 2.0 High på 81,3, med 0,70 sekunder till första ljud och en uppgiftsframgångsgrad på 94,6 %, är det starkaste beviset på att den delegerade formen inte är den enda som fungerar – och att den ännu inte är den snabbaste.

Beslutet som följer av siffrorna är billigare än det ser ut. Båda konfigurationerna av GPT-Live-1, och modellen som slog den på fyra av sex komponenter, ligger inom $1,36 per timme från varandra. Vid den spridningen är det rätta draget att sluta läsa topplistor och köra dina egna transkript genom båda. Indexet berättar formen på avvägningen; det kan inte berätta vilken sida av den dina användare står på.

Frågor som siffran inbjuder till

Är GPT-Live-1 den bästa röstmodellen just nu?

Med det sammansatta måttet, ja – med 0,2 poäng och med ett enda försök bakom sig. Sett till komponenterna beror det helt på vad du bygger: den leder inom agentisk prestanda och arena-preferens, och ligger efter inom talresonemang, uppgiftsframgång och tid till första ljud. En ledning på 0,2 poäng i det sammansatta måttet som vilar på en enda komponentfördel på 11,4 poäng är en försvarbar förstaplats, inte en avgörande sådan.

Måste du använda GPT-6 Astra för att få 81,5?

För just den raden, ja – 81,5 tillhör GPT-Live-1 konfigurerad med Astra vid medelhög resonemangsansträngning. Sol vid låg ansträngning är ett dokumenterat alternativ på 80,1 och 1,36 USD billigare per timme, och OpenAI stöder att använda tredjepartsmodeller som backend, så posterna på topplistan är två punkter på en kurva snarare än de enda alternativen. Vilken kombination som är bäst för din arbetsbelastning är inte något som ett offentligt index kan svara på åt dig.

Varför fick samma modell 69,8 i vår tidigare genomgång och 81,5 nu?

De två siffrorna avser olika saker. Den tidigare läsningen placerade GPT-Live-1 på indexet som en enda post; den aktuella tabellen har dess två delegerade konfigurationer som separata, fullt poängsatta rader, med Astra-parkopplingen på 81,5 och Sol-parkopplingen på 80,1. Artificial Analysis reviderade indexets komponenter i augusti och publicerar ingen ändringslogg, så behandla deltat som en förändring i vad som mättes snarare än som bevis för att modellen förbättrades – och behandla varje enskild sammansatt poäng för en delegerande modell som ett uttalande om en konfiguration.