‘GPT-Live-1, API에 도달하다’라는 문구가 적힌 히어로 타이틀 카드가 있고, 부제는 ‘전이중 음성 기준 분당 $0.05’이며, ‘이 모델은 2026년 7월 8일자이고, 개발자 API는 2026년 9월 10일에 출시되었습니다’라는 줄이 있습니다. 또한 양방향으로 굽은 화살표가 있는 두 개의 겹친 오디오 파형이 함께 있으며, 모서리에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

GPT-Live-1, API에 도달하다: 분당 $0.05의 전이중 음성, 그러나 GPT-Realtime-2.1에서 드롭인 방식의 전환 경로는 없다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-Live-1은 9월 10일부로 API에 포함되어 있으며, 실제로 예산을 재편할 숫자는 벤치마크가 아니라 청구 단위입니다. OpenAI의 전이중 음성 모델은 이제 음성 1분당 0.05달러의 정액으로 초 단위로 청구되는데, 비교 대상인 GPT-Realtime-2.1은 오디오 토큰 기준으로 입력 100만 개당 32달러, 출력 100만 개당 64달러로 과금되었습니다. 모델 자체는 새로운 것이 아닙니다. GPT-Live-1은 2026년 7월 8일 ChatGPT 안에서 Advanced Voice Mode의 대체품으로 출시되었습니다. 새로운 점은 개발자들이 마침내 이를 호출할 수 있게 되었다는 것이며, 그 호출 방식은 대부분의 팀이 이미 갖고 있는 Realtime 통합과 거의 닮지 않았다는 것입니다. OpenAI의 자체 문서는 음성 계층을 별도의 추론 백엔드와 짝지으며, 공개된 WebRTC 예시에서 그 백엔드는 GPT-5.6 Terra입니다.

9월 10일에 무엇이 출시되었고, 무엇은 출시되지 않았나요?

API 표면은 설계상 좁습니다. 모델 ID는 gpt-live-1 하나뿐이며, 이는 자체 기본 스냅샷이기도 합니다 — 고정할 날짜별 변형은 없습니다. 엔드포인트도 정확히 하나뿐이며, Live Sessions 엔드포인트는 v1/live/sessions에 있습니다. OpenAIOpe​nAI 플랫폼의 다른 모든 것은 이 모델에 대해 꺼져 있습니다: Chat Completions 없음, Responses 없음, Realtime 없음(번역 및 전사 변형 포함), Assistants 없음, Batch 없음, 파인튜닝 없음, 임베딩 없음, 이미지 또는 비디오 생성 없음, 오디오 음성 또는 전사 엔드포인트 없음, 모더레이션 없음.

입력과 출력은 오디오와 텍스트입니다. 스트리밍과 함수 호출은 지원됩니다; 구조화된 출력, 파인튜닝, 예측 출력은 지원되지 않습니다. 이미지와 비디오 입력은 명시적으로 지원되지 않습니다 — 따라서 OpenAIOpe​nAI가 예고한 "비디오가 포함된 음성" 표면은 이번 릴리스에 포함되지 않습니다. 무료 티어는 이를 전혀 호출할 수 없으며, 속도 제한은 분당 요청 수가 아니라 동시 세션 수로 측정됩니다: 티어 1에서는 25, 티어 2부터 5까지는 50, 200, 300, 500으로 증가합니다.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

그 동시성 프레이밍은 이것이 플러그인 대체품이 아니라는 첫 번째 단서입니다. 동시 라이브 대화 단위로 표시된 속도 제한은 OpenAIOpe​nAI가 규모의 단위를 무엇으로 기대하는지 알려줍니다: 요청이 아니라 전화선입니다.

가격 변경은 더 조용하지만 더 큰 이야기다

분당 정액 청구는 진정한 탈피입니다. 토큰 계량 방식에서는 통화 한 건을 예측하기 위해서도 오디오 소모를 모델링해야 했습니다. 침묵 1초에 토큰이 얼마나 드는지, 에이전트의 말을 계속 덮어 말하는 발신자가 출력 길이를 어떻게 바꾸는지까지요. 분당 $0.05에서는 산수가 곱셈으로 단순해집니다:

• 5분 고객 지원 통화 — 음성 시간 $0.25

• 10분 통화 — $0.50

• 하루 1,000건의 통화에서 평균 4분 — 하루 $200, 대략 한 달에 $6,000

• 1시간 연속 개방 회선 — $3.00

세 가지 세부 사항이 그 점을 더 분명하게 만든다. 첫째, 통화 시간은 다음 정수 분으로 올림되지 않으므로 40초 통화는 5센트 전액이 아니라 약 3.3센트가 든다. 둘째, 세션 초기화는 음성 통화 시간 15초를 선불로 청구하지만, 이는 이후 통화 시간 요금에 대해 크레딧되는 것이지 그 위에 더해지는 것이 아니므로, 15초보다 짧은 통화도 여전히 15초 가격이 된다. 셋째, 음성은 청구서의 절반에 불과하다. 백엔드 추론 모델, 그 도구 호출, 그리고 모든 웹 검색은 해당 모델의 일반 요율로 별도 청구된다. 즉, 위임 대상을 프런티어 추론 모델로 지정하고 매 턴마다 검색하게 하면 "저렴한 음성 모델"도 여전히 비싼 통화를 만들어낼 수 있다.

그 2미터 구조는 라우팅이 더 이상 단순한 편의 기능이기를 그치는 지점입니다. OrcaRouter에서 GPT-Live-1 세션의 백엔드 절반은 그저 또 하나의 모델 호출일 뿐입니다 — 대략 11개 업스트림 제공업체의 190개 모델이 하나의 키 뒤에 있고, 제공업체 정가 그대로 마크업 없이 전달되며, 선택한 백엔드에서 오류가 나거나 타임아웃이 발생하면 자동 페일오버가 작동합니다. 음성 레이어 자체는 라우팅할 수 없습니다. Live Sessions 엔드포인트는 OpenAIOpe​nAI 전용입니다. 음성 레이어가 위임하는 모든 것은 얼마든지 라우팅할 수 있으며, 그것이 바로 발신자가 얼마나 깊이 생각하느냐에 따라 확장되는 절반입니다.

WebRTC 전용 — 당신의 Realtime 코드가 이식되지 않는 이유

이것이 이전에 따르는 실질적인 비용이며, 대부분의 출시 관련 보도는 이 부분을 건너뛴다. GPT-Live-1 세션은 많은 기존 Realtime 통합이 기반으로 삼는 WebSocket 전송 방식이 아니라 WebRTC를 통해 실행된다. GPT-Live 모델 ID로 이전 경로를 시험해 보면 세션에 WebRTC가 필요하다고 대놓고 알려주는 오류가 반환된다.

핸드셰이크는 OpenAI의 WebRTC 가이드에 따르면 다음과 같습니다: 브라우저가 RTCPeerConnection을 열고, 마이크 트랙을 연결하고, 데이터 채널을 열고, offer를 보내기 전에 리스너를 등록한 뒤, 로컬 설명을 설정하고, ICE 수집을 기다린 다음, offer를 자체 서버에 게시합니다. 그러면 서버가 POST /v1/live/sessions를 세션 구성과 함께 호출하고 transport: { type: "webrtc", sdp: ... }를 덧붙입니다. 성공하면 HTTP 201이 반환되며 session.idtransport.sdp를 포함하고, 브라우저는 이를 원격 설명으로 적용합니다. 미디어는 협상된 트랙을 통해 흐르고, 데이터 채널 — 레이블 oai-events — 은 트랜스크립트, 세션 업데이트, 위임된 작업을 전달합니다. 끊으려면 session.close를 보내고 session.closed가 도착할 때까지 계속 읽습니다.

모니터에 붙여 둘 만한 두 가지 주의점이 있습니다. HTTP 호출 자체가 세션을 시작하므로, 데이터 채널로 session.start를 또 보내면 안 됩니다. 또한 해당 채널을 통해 입력 오디오를 추가하거나 출력 오디오 델타를 기다리면 안 됩니다 — audio.format을 구성에서 빼고 SDP가 처리하도록 하세요. 서버 예제는 요청 본문을 64 KB로 제한하고, ICE 수집은 10초 후, 세션 마무리는 15초 후에 타임아웃합니다.

그중 어려운 것은 없습니다. 전부 새로운 코드입니다. 제품이 턴 기반 실시간 에이전트라면 GPT-Live-1로의 마이그레이션은 모델 ID 교체가 아니라 전송 계층 재작성에 위임 재작성을 더한 것입니다 — 오후 작업이 아니라 한 스프린트로 예산을 잡을 만합니다.

벤치마크, 그리고 그것들을 모두 실행한 사람들

아래의 모든 수치는 OpenAIOpe​nAI 자체의 것으로, API 출시와 함께 공개되었으며 이 글을 쓰는 시점에 누구도 독립적으로 재현하지 않았습니다. 이 단서는 여기서 평소보다 더 중요합니다. 왜냐하면 그 차이들은 확정된 사실로 인용될 만큼 충분히 크기 때문입니다.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• 전이중 상호작용성 — GPT-Live-1 80.1% 대 GPT-Realtime-2.1 45.4%

• 발화 순서 지연 — 0.8초 vs 1.4초

• 도구 호출 정확도 — 87% vs 60%

• 뱅킹 음성 상담 벤치마크, 통과율 — 32% 대 12.4%

마지막 줄을 두 번 읽어 보세요. 32%의 통과율은 12.4%에 비하면 큰 개선이지만, 그 평가에서 시스템이 과제의 약 3분의 2를 실패했다는 뜻이기도 합니다. 상호작용성과 도구 호출의 도약은 진정으로 다른 제품을 설명하는 부분이고, 뱅킹 수치는 음성 에이전트가 규제되는 워크플로를 감독 없이 처리하기까지 아직 얼마나 멀리 있는지를 보여주는 솔직한 지표입니다.

고객 증거는 벤치마크 표보다 더 빈약하지만 같은 방향을 가리킨다. Yelp는 전화 기반 예약에 GPT-Live-1을 사용하고 있으며, CTO Alex Levy가 개선된 통화 처리에 관해 인용되었다. 언어 학습 플랫폼 Speak는 이전 턴 기반 시스템보다 끼어들기가 거의 80% 적었다고 보고했다 — 결과에 이해관계가 있는 회사가 자체 보고한 수치이며, 여전히 확보 가능한 가장 구체적인 배포 수치다.

음성 레이어는 프론트엔드입니다; 두뇌는 당신이 선택합니다

이 아키텍처적 승부수는 위임이며, 이는 이번 릴리스에서 라우팅 계층이 자연스럽게 끼어들 수 있는 부분이다. GPT-Live-1은 깊은 사고를 담당하지 않는다. 호출자가 추론, 검색 또는 도구가 필요한 무언가를 물으면, 모델은 그 작업을 비동기 경계를 넘어 별도 백엔드로 넘기고, 그 백엔드는 음성 대화가 계속되는 동안에도 작업을 이어간 뒤 준비되면 답변을 다시 대화에 통합한다.

구성은 명시적이며, 문서 예제를 자세히 읽어 볼 가치가 있습니다. 또한 model: "gpt-live-1" 및 지침과 함께, 세션은 delegation 객체를 포함하며, 그 유형은 responses이고, 그 내부 responses 블록은 백엔드 모델, 자체 지침, 도구들 — 예제에서는 web_search — 그리고 tool_choice를 지정합니다. OpenAI가 공개한 WebRTC 예제에서 해당 백엔드 모델은 GPT-5.6 Terra입니다.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

이것이 바로 이 설계의 진짜 주장이다: 백엔드를 교체하면 음성 모델을 재학습하지 않고도 음성 경험이 더 똑똑해진다. 이는 또한 위임 백엔드가 음성 레이어와는 달리 이식 가능하다는 뜻이기도 하다. OrcaRouter는 gpt-live-1을 제공하지 않는다 — Live Sessions 엔드포인트는 OpenAI 전용이며, 우리는 그중 어느 것도 라우팅하지 않는다. 하지만 위임 쪽은 Responses API를 사용하며, 그쪽은 전적으로 선택에 달려 있다. GPT-5.6 Terra는 OrcaRouter에서 OpenAIOpe​nAI의 정가로 라이브되어 있다 — 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $12.00, Responses 엔드포인트가 노출되어 있으므로 — OpenAIOpe​nAI 자체 예시에 나오는 바로 그 모델을 두 번째 계약이나 SDK 없이 한 번의 호출로 사용할 수 있다.

실무적으로 보면, 이는 백엔드 선택을 구성으로 바꿔 줍니다. 한 줄만 수정하고 통화당 청구액을 지켜보면서 실제 통화 트래픽에서 저렴한 추론 모델과 최전선 추론 모델을 A/B 테스트할 수 있고, 또는 위임 모델을 자동 장애 조치 뒤에 두어 업스트림에 문제가 생긴 오후가 전화선까지 함께 마비시키지 않게 할 수 있습니다. 분당 $0.05를 내는 음성 레이어는 그대로 있으며, 그것이 위임하는 모든 것은 11개 업스트림 제공업체의 약 190개 모델 전반에 걸쳐 하나의 키로 실행되고, 제공업체 정가 그대로, 마크업 없이 처리됩니다.

아직 무엇이 빠졌나요?

• 이미지나 비디오 입력 없음 — 스틸 이미지와 화면 공유는 이번 릴리스에 포함되지 않으므로, 이전 ChatGPT 모드들이 여전히 유지하고 있는 멀티모달 음성 인터페이스는 해결되지 않은 채 남아 있습니다

• 구조화된 출력 없음 — 에이전트에 스키마 검증이 필요한 도구 인수가 필요하다면, 그 검증은 음성 계층이 아니라 백엔드 모델에 있어야 합니다

• 무료 티어 접근도, 파인튜닝도 불가 — 비용과 커스터마이징 모두 유료 티어부터 시작

• 어떤 핵심 수치에 대한 독립적인 평가도 없음 — 위의 모든 수치는 공급업체가 직접 산출한 것

• Tier 1에서 동시 세션 25개의 동시성 상한 — 파일럿에는 넉넉하지만, 첫날 콜센터에는 빠듯함

누가 움직여야 하고, 누가 기다려야 할까요?

텔레포니를 구축하고 있다면 지금 움직여라 — 예약 회선, 약속 예약, 1차 지원 — 그리고 현재 스택이 고전적인 ASR-to-LLM-to-TTS 캐스케이드라면. 지연 시간과 인터럽트 처리는 바로 그 파이프라인이 놓치는 부분이고, 분당 가격은 스프레드시트에 넣을 수 있을 만큼 예측 가능하며, OpenAIOpe​nAI 자체 문서에는 이제 그대로 복사할 수 있는 Twilio 형태의 서버 예시가 포함되어 있다. 이미 Realtime 모델을 사용 중이고 제품이 턴 기반이 아니라 진정한 대화형이라면 역시 지금 움직여라, 인터럽트 처리가 바로 GPT-Realtime-2.1이 가장 취약했던 부분이기 때문이다.

통합이 턴 기반이고 정상 동작한다면 기다리세요. 전송 계층 재작성은 실제 작업이고, 엔드포인트는 다른 것을 지원하지 않으며, 기존 WebSocket 코드를 보존하는 마이그레이션 경로는 없습니다. 사용 사례가 구조화된 도구 출력이나 비디오 입력에 의존한다면 마찬가지로 기다리세요. 둘 다 여기에는 없습니다.

앞으로 몇 주 동안 지켜볼 것: 80.1% 상호작용성 수치의 첫 독립 재현, $0.05 요금이 도입 요금인지 여부, 더 작은 GPT-Live-1 mini가 소비자 측에서 그랬던 것처럼 API에도 도달하는지, 그리고 이미지와 화면 입력이 격차를 좁히는지 여부다. 외부 연구소가 그 평가를 수행하기 전까지, 정직한 요약은 이것이 누구든 개발자에게 출시한 가장 유능한 음성 모델이라는 것이며, 그 주장에 대한 증빙은 그것을 판매하는 사람들이 작성한 셈이다.