GPT-Live-1 Speech to Speech Index 기사용 타이틀 카드로, 상위 세 점수를 보여줍니다: GPT-Live-1은 GPT-6 Astra와 함께 medium effort에서 81.5, Grok Voice Think Fast 2.0 High는 81.3, GPT-Live-1은 GPT-5.6 Sol과 함께 low effort에서 80.1
Guides & Insights

GPT-Live-1, Speech to Speech Index에서 81.5로 1위 — 그러나 그 순위는 백엔드의 몫이다

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-Live-1, 2026년 7월 8일 ChatGPT 내부에 처음 탑재된 전이중 음성 모델은 현재 Artificial Analysis Speech to Speech Index에서 81.5로 1위입니다 — 이 항목은 그 모델이 사고를 수행하도록 GPT-6 Astra에 연결되었기 때문에 존재하는 행입니다. 동일한 음성 프런트 엔드를 GPT-5.6 Sol을 위임된 백엔드로 사용해 낮은 추론 노력으로 실행하면 80.1점을 받아 3위입니다. 2위는 81.3점으로 Grok Voice Think Fast 2.0 High가 차지합니다.

숫자를 내놓기 전에 두 가지 솔직히 밝힐 점이 있다. 이 모델은 새로운 것이 아니다. GPT-Live-1은 ChatGPT의 기본 음성으로 두 달간 쓰인 뒤 2026년 9월 10일 개발자 API에 도달했다. 9월 15일 기준으로 새로운 점은 외부 평가자가 이 모델에 점수를 매겼다는 것이다 — 지금까지 이 모델에 관한 모든 글에서, 우리 글까지 포함해 빠져 있던 바로 그 요소다. 우리 글에서 이용 가능한 수치라곤 OpenAI가 스스로에 대해 발표한 것뿐이었다. 그리고 2위와의 0.2점 차이는 GPT-Live-1 자체의 두 구성 간 1.4점 격차보다 작다. 이는 순위표에서 가장 유용한 숫자다.

그래서 "GPT-Live-1이 최고의 음성 모델이다"라는 헤드라인은 지수가 말하는 바와 꼭 맞지는 않습니다. 지수는 GPT-Live-1이 중간 정도의 노력으로 GPT-6 Astra와 함께 있을 때 0.2점 차이로 그렇다고 말하며, 백엔드 선택이 어떤 경쟁 모델보다도 결과를 더 크게 좌우한다고 말합니다.

지수가 실제로 측정하는 것

Artificial Analysis는 Speech to Speech Index를 네 가지 부분의 동일 가중 복합 지표로 구축합니다. Big Bench Audio로 측정하는 Speech Reasoning, τ-Voice로 측정하는 Agentic Performance, 쌍대 인간 선호 Elo인 Arena Preference, 그리고 Task Success Rate입니다. 네 가지 구성 요소가 모두 제공되는 모델만 지수 값을 받으며 — 그 외에는 모두 대시로 표시됩니다. 이것이 표에 점수보다 행이 훨씬 많은 이유입니다. 이 지수 자체는 2026년 6월 23일에 출시되었고 이후 두 번 개정되었으며, 가장 최근에는 Conversational Dynamics를 Task Success로 교체했기 때문에 한 개정판의 점수는 다른 개정판의 점수와 엄격히 비교할 수 없습니다.

순위를 읽을 때 두 가지 추가 방법론적 세부 사항이 중요합니다. Arena Elo는 모델이 처음 공개 가능해졌을 당시의 값으로 고정되므로, 선호도 구성 요소는 오늘 최고인 것보다 일찍 등장한 것을 보상합니다. 그리고 이 지수는 단일 모델이 아니라 전체 시스템을 평가합니다. GPT-Live-1의 경우, 그 숫자는 음성 프런트 엔드와 함께 작업을 넘겨받는 백엔드 모델까지 포함합니다. 이는 의도적인 설계 선택이며, 같은 모델이 서로 다른 점수로 두 번 나타나는 이유입니다.

발표된 대로, 해당 분야의 최상위:

• GPT-Live-1 (Astra, medium) — 지수 81.5, 1위

• Grok Voice Think Fast 2.0 High — 지수 81.3, 2위

• GPT-Live-1 (Sol, low) — 지수 80.1, 3위

• GPT-Realtime-2.1 High — 지수 73.9, 4위

• GPT-Realtime-2 High — 지수 73.6, 5위

• Grok Voice Think Fast 1.0 — 지수 72.3, 6위

• Gemini 3.1 Flash Live High — 지수 71.5, 일곱 번째

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

규모를 가늠하자면, GPT-Live-1이 대체하는 모델은 그보다 7.6포인트 아래에 있습니다. 이는 실질적인 세대 격차이며, 이는 논란의 여지가 없습니다.

0.2점 차 승리는 정확히 하나의 구성 요소에서 비롯됩니다

합성 지표를 분해해 보면, 두 선두 모델은 더 이상 같은 종류의 모델처럼 보이지 않습니다. 각 구성 요소별로 보면, Artificial Analysis에 따르면:

• 에이전트 성능(τ-Voice) — GPT-Live-1 67.9% vs Grok Voice Think Fast 2.0 High 56.5%

• 음성 추론(Big Bench Audio) — 90% 대 97%

• 작업 성공률 — 87.4% vs 94.6%

• 아레나 Elo — 1048 대 1011

• 첫 오디오까지 걸리는 시간 — 1.34초 vs 0.70초

• 백엔드 포함 시간당 비용 — $5.83 vs $4.80

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1은 여섯 개 라인 중 두 개에서 이기고 네 개에서 지지만, 인덱스에서는 1위를 차지한다. 그 산술은 수수께끼가 아니다. τ-Voice 격차가 11.4점으로, 표에 있는 다른 어떤 격차보다도 훨씬 크며, 동일 가중치에서는 이 격차가 종합 점수를 결승선 너머로 끌어간다. 쉽게 말해, GPT-Live-1은 더 나은 에이전트이고 Grok Voice Think Fast 2.0 High는 더 잘 듣고 더 빠른 쪽이다. 그리고 인덱스는 GPT-Live-1이 잘하는 부분에 충분히 큰 가중치를 두어 그것을 1위로 만든다.

제품이 예약하고, 해결하고, 거래를 수행하는 음성 에이전트라면, 11.4포인트 τ-Voice 우위가 바로 여러분의 경험을 예측하는 숫자입니다. 제품이 즉각적으로 느껴져야 하고 사용자의 말을 절대 끊지 않아야 하는 대화라면, 첫 오디오까지 걸리는 0.70초가 여러분의 경험을 예측하는 숫자이며, Grok이 이를 약 두 배 차이로 앞섭니다. 규제 대상 작업 실행에는 두 번째 경고가 있습니다: Grok의 94.6% 작업 성공률은 공개된 표에서 가장 높고, GPT-Live-1의 87.4%는 대략 8개 작업 중 1개가 완료되지 않는다는 뜻입니다. 둘 다 이전 세대보다 개선된 것입니다. 둘 다 해결된 문제는 아닙니다.

#1 행은 모델이 아니라 라우팅 구성입니다.

여기서 리더보드 순위보다 더 주목할 만한 부분이 있습니다. GPT-Live-1은 듣기, 말하기, 끼어들기, 발언 순서 주고받기를 스스로 처리하고, 대화가 계속되는 동안 추론, 도구 호출, 검색은 별도의 백엔드 모델에 위임하는 전이중 음성 레이어입니다. Artificial Analysis는 그러한 조합 중 두 가지를 별도 항목으로 평가했습니다. Astra는 중간 노력에서 81.5를, Sol은 낮은 노력에서 80.1을 기록했습니다.

그 1.4점 격차가 바로 핵심이다. 1위와 2위의 차이는 0.2점이다. GPT-Live-1의 점수가 매겨진 두 구성 사이의 격차는 그보다 일곱 배 더 크다. 그 행들 사이에서 음성 모델에 관해서는 아무것도 바뀌지 않았다 — 오직 어떤 모델이 사고를 담당했는지, 그리고 어떤 노력 수준이었는지만 바뀌었다. 시스템을 순위 매기는 리더보드는 구성이 곧 제품이라고 정확히 말해 주고 있다.

이는 우리 자체 보도도 수정합니다. 2026년 9월 11일, 우리는 이 지수에서 GPT-Live-1을 69.8%로 기록했으며, 이는 GPT-Realtime-2.1과 Grok 모두에 뒤처지는 수치였습니다. 그것은 당시 확인 가능한 측정치였고, 합리적인 결론을 뒷받침했습니다 — OpenAI가 최고의 대화 메커니즘을 구축했지만 최고의 음성 에이전트를 구축한 것은 아니라는 결론입니다. 이 지수에는 이제 81.5와 80.1의 두 가지 위임된 GPT-Live-1 구성이 포함되어 있습니다. Artificial Analysis는 변경 로그를 공개하지 않고, 8월에 지수의 구성 요소를 수정했기 때문에, 이전 수치가 점수가 매겨지지 않은 구성이었는지, 부분적으로 점수가 매겨진 구성이었는지, 아니면 이전 가중치 아래에서의 실행이었는지 확실히 말할 수 없습니다. 관찰 가능한 점은 위임된 페어링이 이제 각자의 완전한 행으로 나타나며, 그 페어링이 그렇게 나타났을 때 답이 바뀌었다는 점입니다.

실질적인 결론은 "어떤 음성 모델인가"가 잘못된 질문이고, "어떤 음성 모델에 어떤 백엔드를, 어느 정도의 노력으로"가 올바른 질문이라는 것입니다. 그것은 라우팅 문제이며, 바로 우리 제품이 답하기 위해 존재하는 문제입니다. OrcaRouter는 GPT-Live-1의 위임 백엔드인 GPT-6 Astra를 200개 이상의 다른 모델과 동일한 OpenAI 호환 엔드포인트를 통해 노출합니다. 따라서 사고 계층을 교체하는 일은 통합 작업이 아니라 모델 ID를 바꾸는 일입니다. 라우팅 DSL은 여러 모델을 하나의 호출로 구성하며, 자동 장애 조치 덕분에 검증되지 않은 조합이 프로덕션에 대한 도박이 되지 않습니다 — 백엔드가 저하되면 요청은 실패하는 대신 다른 곳으로 전달됩니다. 우리가 하지 않는 일을 분명히 하자면: GPT-Live-1 자체는 우리 카탈로그에 없으며 우리가 제공하지 않습니다. 그것이 위임하는 백엔드는 별개의 문제입니다.

이거 한 시간에 얼마예요?

GPT-Live-1의 프런트 엔드는 음성 1분당 $0.05로 청구되며 초 단위로 과금됩니다. 이는 오픈 라인 1시간에 $3.00입니다. 그것이 전체 청구서는 아닙니다. 위임된 추론, 도구 호출, 웹 검색은 백엔드 모델이 부과하는 요율로 별도로 계량됩니다. Artificial Analysis는 총액 수치를 측정했으며, 그래서 그 비용 열을 사용해야 합니다:

• GPT-Live-1 (Sol, low) — 시간당 $4.47

• Grok Voice Think Fast 2.0 High — 시간당 $4.80

• GPT-Live-1 (Astra, medium) — 시간당 $5.83

• GPT-Realtime-2.1 High — 시간당 $10.75

랭킹 우승자는 현재 세 가지 옵션 중 가장 비싼 것이며, 우승한 구성은 3위를 차지한 구성보다 시간당 30% 더 비쌉니다. 다른 방향에서 보면, 이 분할은 시사하는 바가 큽니다: 매시간 $3.00은 음성 레이어이고, 나머지 — Sol에서 $1.47, Astra에서 $2.83 — 는 백엔드 토큰입니다. 사고 레이어는 청구서의 3분의 1에서 절반 사이 어딘가에 있으며, 이는 리더보드가 각주로 취급하는 구성 요소치고는 큰 비중입니다.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

하지만 대체하는 모델과 비교하면 전체 제품군은 대략 절반 가격입니다 — 분당 $0.05의 프런트 엔드는 재포장이 아니라 진정한 인하입니다. 백엔드 토큰은 백엔드 요율로 청구되므로, GPT-Live-1 배포 비용은 주로 어떤 추론 모델로 라우팅하는지에 따라 결정되며, 백엔드는 OpenAI 자체 모델일 수도 있고 타사 모델일 수도 있습니다. OrcaRouter에서는 이러한 백엔드가 공급자 정가에 0% 마크업으로 전달되므로, 사고 계층의 공급업체 가격 변경은 다음 청구 주기가 아니라 같은 날 바로 적용됩니다.

인덱스가 해결하지 못하는 것

세 가지 주의사항은 추론된 것이 아니라 출처가 밝힌 것이다. GPT-Live-1 항목 두 개와 Grok Voice Think Fast 2.0 High는 모두 단일 시험에 기반한 것으로 표시되어 있는데, 이는 0.2점 차이를 결정하기에는 빈약하다 — 재실행하면 두 모델 자체에는 아무 변화가 없어도 1위와 2위가 뒤바뀔 수 있다. Arena Elo는 언급된 대로 각 모델의 최초 공개 가능 측정치에서 동결되었다. 그리고 이 지수에는 이러한 시스템이 긴 통화에서 어떻게 작동하는지에 대한 항목이 없다: 구성 요소들은 구조상 단기 지평에 맞춰져 있는 반면, 실제로 프로덕션에서 음성 에이전트를 죽이는 실패 모드는 20분 대화에 걸친 드리프트다.

이와 별도로, 그리고 인덱스가 아니라 공급업체에서 확인한 내용입니다: GPT-Live-1의 API는 이미지나 동영상 입력 없이, 구조화된 출력 없이, 무료 티어 없이 출시되었으며, 속도 제한은 분당 요청 수가 아니라 동시 세션 수로 집계됩니다. 이는 출시 당일의 제약 사항으로 이미 바뀌었을 수 있으니, 이를 전제로 설계하기 전에 확인하세요.

이걸 어떻게 해야 할까요?

이번 주에 모델이 아니라 아키텍처를 고르고 있다면, 이 지수는 에이전트 작업에서는 위임 패턴을, 지연 시간에서는 캐스케이드 패턴을 높게 평가합니다. 81.5의 GPT-Live-1은 대화와 추론을 분리하는 것이 작업을 완수하는 음성 에이전트에 맞는 올바른 형태라는 지금까지 가장 강력한 증거입니다. 첫 오디오까지 0.70초, 작업 성공률 94.6%를 기록한 81.3의 Grok Voice Think Fast 2.0 High는 위임형 형태가 작동하는 유일한 방식이 아니며, 아직 가장 빠른 방식도 아니라는 가장 강력한 증거입니다.

숫자에서 나오는 결정은 겉보기보다 비용이 적게 든다. GPT-Live-1의 두 구성과, 6개 구성 요소 중 4개에서 이를 앞선 모델은 서로 시간당 $1.36 이내에 있다. 그 정도 차이라면 올바른 선택은 리더보드 읽기를 그만두고 자신의 트랜스크립트를 양쪽 모두에 돌려보는 것이다. 지표는 트레이드오프의 형태를 알려주지만, 사용자가 그 어느 쪽에 있는지는 알려주지 못한다.

{{1}}숫자가{{/1}} {{2}}불러일으키는{{/2}} {{3}}질문들{{/3}}

GPT-Live-1이 이제 최고의 음성 모델인가요?

종합 점수로 보면, 그렇습니다 — 0.2점 차이고, 그 뒤에는 단 한 번의 시행만 있습니다. 구성 요소별로 보면, 그것은 전적으로 무엇을 만들고 있느냐에 달려 있습니다. 에이전트 성능과 아레나 선호도에서는 앞서고, 음성 추론, 작업 성공률, 첫 오디오까지의 시간에서는 뒤처집니다. 11.4점짜리 구성 요소 우위 하나에 기대고 있는 0.2점 종합 우위는 정당화 가능한 1위이지, 결정적인 1위는 아닙니다.

81.5를 얻으려면 GPT-6 Astra를 꼭 써야 하나요?

바로 그 행에 대해서라면, 네 — 81.5는 중간 추론 노력으로 Astra를 구성한 GPT-Live-1의 값입니다. 낮은 노력의 Sol은 80.1을 기록한, 문서로 확인된 대안이며 시간당 $1.36 더 저렴합니다 그리고 OpenAI는 서드파티 모델을 백엔드로 가져오는 것을 지원하므로, 리더보드 항목들은 유일한 선택지가 아니라 곡선 위의 두 점일 뿐입니다. 어떤 조합이 귀하의 워크로드에 가장 적합한지는 공개 지수가 대신 답해 줄 수 있는 문제가 아닙니다.

이전 커버리지에서는 같은 모델이 왜 69.8점이었는데 지금은 81.5점인가요?

두 수치는 서로 다른 것을 다룹니다. 앞선 판독에서는 GPT-Live-1을 인덱스에 단일 항목으로 배치했습니다. 현재 표에서는 위임된 두 구성을 별도의 완전 채점된 행으로 담고 있으며, Astra 페어링은 81.5, Sol 페어링은 80.1입니다. Artificial Analysis는 8월에 인덱스의 구성요소를 개정했고 변경 로그를 공개하지 않으므로, 델타를 모델이 개선되었다는 증거가 아니라 측정 대상이 바뀐 것으로 취급하고, 위임하는 모델의 단일 종합 점수는 구성에 관한 진술로 취급하십시오.