'GPT-Live-1 vs Grok Voice Think Fast 2.0'이라고 적힌 히어로 타이틀 카드, 부제 '가격 방향이 서로 반대인 두 음성 API', 그리고 '분당 $0.05 vs 분당 $0.08'이라는 문구가 두 개의 패널 위에 있으며, 왼쪽에는 아래쪽 화살표가 있는 가격표와 '$0.05' 레이블, 오른쪽에는 위쪽 화살표가 있는 가격표와 '$0.08' 레이블 및 '+60%' 캡션이 있고, 각각 전이중 오디오 파형 스트립이 포함되며, 모서리에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

GPT-Live-1 vs Grok Voice Think Fast 2.0: 서로 반대 방향으로 가격이 움직이는 두 음성 API

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 맞대결에 관한 가장 유용한 사실은 숫자가 아니라 방향입니다. x​AI가 2026년 7월 말 Gr​ok Voice Think Fast 2.0을 출시했을 때, 분당 오디오 요금을 60% 인상해 Think Fast 1.0이 받던 $0.05에서 $0.08로 올렸습니다. 6주 후인 2026년 9월 10일, Ope​nAI는 GPT-Live-1을 x​AI가 막 포기한 바로 그 가격으로 개발자 API에 공개했습니다. 그 덕분에 두 선도적인 전이중 음성 API를 가격으로 직접 비교할 수 있는 드문 상황이 펼쳐지며, 더 새로운 진입자가 더 저렴한 쪽인 반면, 더 오래되고 더 비싼 모델이 제3자 벤치마크 점수를 등에 업은 쪽입니다.

어떤 벤치마크보다도 앞선 원장

이 둘 모두 전화 형태의 워크로드를 위해 만들어진 음성-대-음성 모델입니다: 고객과의 실시간 대화, 중단, 도구 호출, 그리고 분 단위로 측정되는 청구서. 그 외에는 빠르게 분기됩니다.

• 오디오 분당 가격 — GPT-Live-1 $0.05 vs Grok Voice Think Fast 2.0 $0.08

• 청구 단위 — GPT-Live-1은 다음 분으로 올림하지 않고 초 단위로 청구합니다; Grok Voice Think Fast 2.0은 오디오 1분당 가격이 책정되며 시간당 대략 $4.80로 계산됩니다.

• 릴리스 — GPT-Live-1은 2026년 7월 8일 ChatGPT 내에서 출시되었고 2026년 9월 10일 API에 도달했다; Gr​ok Voice Think Fast 2.0은 2026년 7월 29~30일경에 발표되었으며, 이는 Think Fast 1.0 이후 대략 3개월 뒤였다.

• 엔드포인트 — GPT-Live-1은 WebRTC를 통해 v1/live/sessions에서 Live Sessions 전용이며, Gr​ok Voice Think Fast 2.0은 WebSocket과 WebRTC 모두를 통해 x​AI의 Speech-to-Speech API에서 실행됩니다.

• 도구 표면 — GPT-Live-1은 Responses API를 통해 백엔드 추론 모델에 위임합니다; Gr​ok Voice Think Fast 2.0은 세션 내에서 웹 검색, X 검색, 파일 검색, MCP 서버 및 클라이언트 측 함수를 사용할 수 있습니다.

• 보이스 이식성 — GPT-Live-1은 Ope​nAI의 리마스터링된 12가지 보이스 세트를 사용하고, Gr​ok Voice Think Fast 2.0은 내장 보이스와 사용자 지정 보이스를 지원합니다.

WebSocket 라인은 보기보다 작지만, 마땅히 그래야 할 것보다 더 중요한 비중을 차지한다. 전화 통신 인프라의 상당 부분 — 대부분의 CPaaS 제품 내부에 있는 미디어 스트림 배관 — 은 WebRTC가 아니라 WebSocket을 사용한다. Gr​ok Voice Think Fast 2.0은 그 인프라가 있는 곳에서 그 인프라에 맞춰 동작한다; GPT-Live-1은 그렇지 않으며, WebSocket 전용 통화 경로에서 WebRTC로 가는 것은 설정 플래그가 아니라 진짜 엔지니어링 작업이다.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Grok Voice Think Fast 2.0 - the scoreboard'. The GPT-Live-1 column lists Price $0.05 / minute; Price direction new entrant at $0.05; Transport WebRTC only; Quality evidence vendor-run, unreproduced; Tool calling delegated to backend model; Model ID single fixed ID. The Grok Voice Think Fast 2.0 column lists Price $0.08 / minute; Price direction raised 60% from $0.05; Transport WebSocket + WebRTC; Quality evidence 82.9 third-party speech index; Tool calling in-session search, MCP, functions; Model ID versioned ID plus floating alias. A footer reads 'Grok quality figure is a third-party index; GPT-Live-1 benchmarks are OpenAI's own and unreproduced.'

벤치마크 비대칭성이 진짜 핵심이다

바로 이 지점에서 비교는 더 이상 막상막하가 아니게 되며, 대부분의 분석 글은 두 숫자 묶음을 같은 종류의 증거로 취급함으로써 이 지점을 거꾸로 짚는다.

Gr​ok Voice Think Fast 2.0의 주요 점수는 Artificial Analysis의 Speech-to-Speech Quality Index에서 나온 것으로, 이 제3자 측정은 해당 모델을 82.9%로 평가하며, 이는 버전 1.0의 75.7%에서 상승한 수치로, GPT-Realtime-2.1의 79.1%와 Gemini 3.1 Flash의 69.5%를 앞섭니다. x​AI는 또한 에이전트 행동 부문에서 τ-voice Bench 1위를 보고했으며, 56.5%를 기록해 GPT-Realtime-2.1의 45.7%를 앞섰습니다. 이는 x​AI 모델에 대한 외부에서 실행된 측정 결과입니다.

GPT-Live-1의 헤드라인 점수는 OpenAI 자체의 것이다. 회사는 GPT-Realtime-2.1의 45.4% 대비 80.1%의 전이중 상호작용성, 턴테이킹 지연 시간이 1.4초에서 0.8초로 단축된 점, 도구 호출 정확도가 60%에서 87%로 상승한 점을 보고했다. 그 수치 하나하나는 모두 공급업체가 보고한 것이며, 독립 연구소에서 재현된 적이 없고, 경쟁사와 비교한 것이 아니라 OpenAI 자체의 이전 모델과 OpenAI의 새 모델을 비교한 것이다.

그것은 숫자들을 일축할 이유는 아니다 — 진행 방향은 초기 배포자들이 보고하는 내용과 일치한다 — 하지만 그것은 현재 이용 가능한 유일한 벤더 간 비교가 독립적으로 실행된 테스트에서 xAI의 모델에 유리하다는 점, 그리고 OpenAI의 지연 시간 우위에 대해 이용 가능한 유일한 수치는 OpenAI의 것이라는 점을 의미한다. 0.8초와 0.70초를 실제 대결로 취급하지 마라. 그 두 수치 중 하나만이 결과에 아무런 이해관계가 없는 사람에 의해 측정되었다.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

별칭의 함정, 그리고 가격 인상이 사람들의 허를 찔린 이유

대부분의 릴리스 노트에서는 60% 증가가 반올림 오차에 불과했을 것이다. xAI가 이를 별칭을 통해서도 배포하지 않았다면 말이다. grok-voice-latest 별칭을 가리키는 애플리케이션은 2026년 8월 5일에 새 모델과 인상된 요금을 자동으로 함께 물려받았다. 단, grok-voice-think-fast-1.0을 명시적으로 고정한 경우는 예외였다. 이는 불평이라기보다 이해할 가치가 있는 설계 결정이다. 플로팅 별칭은 무료 업그레이드를 안겨 주지만, 묻지도 않고 단위 경제성까지 바꿔 놓는다.

뻔한 해결책은 보기보다 약하다. Grok Voice Think Fast 1.0 — 분당 $0.05이며 2026년 4월 23일에 출시된 모델 — 은 이제 xAI 자체 모델 목록에서 사용 중단(deprecated)으로 표시된다. 이를 고정(pin)하면 자동 업그레이드로부터 보호받을 수 있지만, 영구적인 더 저렴한 경로라기보다 시간을 벌어 줄 뿐이다. 사용 중단된 모델에는 언젠가 앞으로 다가올 폐기 날짜가 있기 때문이다. 별칭의 일정이 아니라 자신의 일정에 맞춰 마이그레이션을 계획하세요.

가격 체계 자체는 숫자를 확정하기 전에 주의 깊게 읽어 볼 가치가 있습니다. xAI의 모델 페이지에는 버전별 요금이 명시적으로 나와 있습니다 — grok-voice-think-fast-2.0은 오디오 1분당 $0.08, 1시간당 $4.80, 그리고 텍스트 입력당 $0.004 — 반면 같은 페이지의 별도 Voice API 카드에서는 에이전트 가격을 "분당 $0.05부터"라고 광고하는데, 이는 2.0 모델이 청구하는 요금이 아니라 진입점입니다. 마케팅 숫자를 기준으로 용량 계획을 세웠다면, 대략 60%가 부족한 셈입니다.

OpenAI의 모델은 같은 방식으로는 이 문제를 겪지 않습니다. 별칭이 옮겨갈 대상이 없기 때문입니다. GPT-Live-1에는 모델 ID가 정확히 하나뿐이며, gpt-live-1은 자체 기본 스냅샷이기도 합니다. 고정할 날짜별 변형이 없고, 따라서 모델이나 가격을 조용히 바꿀 수 있는 별칭도 없습니다. 그 대가는, 검증된 동작을 고정해 두고 새로운 것이 자리 잡는 동안 그것을 계속 사용할 수도 없다는 점입니다.

두 모델 모두 추론 계층을 음성 계층과 별도로 청구하며, 바로 이 지점에서 대표 요금이 더 이상 전체 비용이 아니게 됩니다. GPT-Live-1의 위임된 Responses 호출은 구성된 백엔드 모델의 일반적인 토큰당 요율로 청구됩니다. xAI는 음성 세션의 텍스트 입력당 $0.004를 추가하고, 여기에 도구 호출, 필요한 경우 분당 약 $0.01의 프로비저닝된 전화번호, 전화 통신 및 스토리지를 분당 오디오 요율 위에 더합니다. 대부분 듣고 가끔 정보를 조회하는 음성 에이전트는 대표 요금에 가깝게 유지되지만, 매 턴마다 도구를 호출하는 에이전트는 그렇지 않으며, 두 에이전트의 비용은 같은 방향으로 벌어지지 않습니다. 위임된 백엔드 설계와 세션 내 도구 설계가 서로 다른 곳에서 토큰을 소모하기 때문입니다.

저희 쪽에서 분당 요금 변동을 주의 깊게 지켜볼 만한 이유는 OrcaRouter가 제공업체의 정가를 마진 없이 그대로 전달하기 때문입니다. 벤더가 공시 요금을 변경하면, 저희 쪽 숫자는 다음 계약 주기가 아니라 같은 날에 바로 바뀝니다.

A screenshot of xAI's developer Models documentation page, showing a Voice API card with an agent price of 'Starting at $0.05 / min' alongside Text to Speech at $15.00 / 1M chars and Speech to Text at $0.10 / hour batch and $0.20 / hour streaming, plus a Grok 4.6 card listing a 500k-token context with $2.00 / 1M input and $6.00 / 1M output tokens, and an Imagine API card for image and video generation.

엔지니어링에서 위임 분할이 당신에게 초래하는 비용

아키텍처를 기준으로, 가격이 아니라 이 둘 중 하나를 선택하는 상황이라면, 결정적인 질문은 그 경계가 어디에 놓이느냐입니다.

xAI의 모델은 도구들을 세션 안에 유지한다. 그게 추론하기 더 단순하다 — 하나의 연결, 하나의 대화, 함수 호출이 일어나는 한 곳 — 그리고 이는 모델이 문장 중간에 검색이 필요하다고 판단하고 기다리는 동안 계속 말을 이어갈 수 있다는 뜻이다.

OpenAI의 모델은 그 작업을 외부로 넘깁니다. 음성 계층은 대화를 계속 살아 있게 유지하고, Responses API를 통해 작업을 별도의 추론 모델에 넘깁니다. 즉, 도구 정의와 검색, 비즈니스 로직이 세션 이벤트 스트림 내부가 아니라 일반적인 텍스트 모델 통합에 존재합니다. 구성 요소는 더 많지만 이식성도 더 높습니다. 위임된 절반은 음성 계층과 독립적으로 교체하고, 가격을 매기고, 장애 조치할 수 있는 평범한 API 호출이기 때문입니다.

그게 중요한 이유는 딱 하나입니다. GPT-Live-1도 Grok Voice Think Fast 2.0도 각자의 공급업체 외에는 어디에서도 서비스되지 않습니다 — 둘 다 단일 소스이고, 라우터는 오디오 쪽에는 도움을 줄 수 없습니다. 라우터가 할 수 있는 일은 실제로 선택할 수 있는 나머지 절반을 통합하는 것입니다. OpenAI 자체의 위임 예시에 등장하는 백엔드인 GPT-5.6 Terra는 OrcaRouter를 통해 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $12.00에 이용할 수 있고, /v1/chat/completions와 /v1/responses가 모두 노출되며, 하나의 키로 약 190개의 다른 모델과 함께 제공됩니다. 음성 에이전트가 턴마다 추론 모델을 호출한다면, 라우팅 레버리지가 있는 항목은 바로 그것입니다.

워크로드별로 나눈 총평

• 분당 가격이 제약 조건이라면, 통화 경로가 이미 WebRTC를 사용한다면, 또는 음성 뒤에 있는 추론 두뇌를 세션의 고정된 일부가 아니라 교체 가능한 텍스트 모델로 두고 싶다면 GPT-Live-1을 선택하세요.

• 도입을 결정하기 전에 독립적으로 검증된 품질을 직접 확인하고 싶거나, 텔레포니 스택이 WebSocket 네이티브이거나, 세션 내 도구 — 특히 X 검색 — 가 부수적인 요소가 아니라 제품의 핵심인 경우에는 Gr​ok Voice Think Fast 2.0을 선택하세요.

• 이미 xAI를 사용 중이라면 별칭을 주시하세요. 버전이 지정된 모델 ID를 고정하는 것만이 다음 자동 요율 변경으로부터 여러분을 지켜주는 유일한 방어책이며, 이러한 원칙은 유동 별칭이 나타나는 어디에나 적용할 가치가 있습니다.

불편하게도 요약하면, 더 저렴한 모델은 제3자 검증이 뒷받침되지 않는 쪽이고, 문서가 더 잘 갖춰진 모델은 막 60% 더 비싸진 쪽이다. 아직 어느 통합도 확정되지 않을 만큼 개발 초기 단계라면, 가장 위험 부담이 적은 선택은 두 모델 모두를 대상으로 프로토타입을 만들어 보는 것이다 — 오디오 경로는 어느 쪽이든 몇백 줄이면 되니까 — 그리고 자신의 전사 품질로 결정하게 하라. 현재 공개된 증거만으로는 결론이 나지 않기 때문이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트