기사 'OpenAI의 9월 플랫폼 데이'의 히어로 타이틀 카드. 부제는 'GPT-Live-1, API에 출시, Agents API, 베타로 공개'. '두 발표 모두 2026년 9월 10일자'라고 적힌 배지와 세 개의 카드를 포함하며, 카드에는 각각 'API 내 GPT-Live-1: 음성 1분당 $0.05, Live Sessions 엔드포인트, 단일 모델 ID', 'Agents API: 공개 베타, Codex 하네스, 호스팅 샌드박스 또는 직접 가져오기', '왜 중요한가: 모델은 선택하는 구성 요소가 되고, 하네스는 임대하는 제품이 된다'라고 적혀 있다. 하단 푸터 스트립에는 '음성 수치는 OpenAI가 보고했으며 재현되지 않음; Agents API 가격은 패스스루임.'이라고 적혀 있다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

OpenAI의 9월 플랫폼 데이: Agents API가 베타로 공개되면서 GPT-Live-1이 API에 도달하다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 10일, 두 가지가 Ope​nAI의 플랫폼을 떠났는데, 더 조용한 쪽이 파급력은 더 큽니다. 7월 8일부터 ChatGPT 내부에서 돌아가던 전이중 음성 모델 GPT-Live-1을 이제 개발자들이 음성 1분당 0.05달러에 호출할 수 있습니다. 그와 함께, 보도에서는 훨씬 덜 언급된 Agents API가 공개 베타에 들어갔습니다. Codex를 구동하는 바로 그 하네스를 관리형 샌드박스를 갖춘 호스팅 제품으로 노출한 것입니다. 하나는 더 나은 음성입니다. 다른 하나는 예전에는 에이전트 구축의 어려운 부분이었던 것을 Ope​nAI가 파는 것입니다.

두 수치 모두 이 글의 1차 자료, 즉 OpenAI의 Agents API 발표, API에 GPT-Live-1을 소개한 개발자 커뮤니티 게시물, 그리고 두 자료의 개발자 문서에서 직접 확인한 것이다. 수치가 외부 평가자가 아니라 OpenAI에서 나온 경우에는 아래에 그렇게 표시되어 있다 — 그리고 한 수치는 실제로 외부에서 나온 것인데, 이는 이야기를 약간 바꾼다.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis는 올해 Speech to Speech Index를 발표하기 시작했으며, GPT-Live-1은 그 안에 한 줄을 차지하고 있습니다: 69.8%로, 음성 추론, 에이전트 성능, 아레나 선호도, 과업 성공률을 아우른 가중 평균입니다. 이는 점수를 받은 11개 모델 중 7위에 해당합니다 — 73.9%의 GPT-Realtime-2.1(GPT-Live-1이 대체하는 모델) 뒤이며, 79.0%의 Gr​ok Voice Think Fast 2.0 뒤입니다. 독립적인 스코어보드와 Ope​nAI 자체 벤치마크 표는 같은 이야기를 하지 않으며, 둘 다 사실입니다.

출시된 것들, 당신의 아키텍처를 바꿀 순서대로

• 음성 — GPT-Live-1이 API에 gpt-live-1(으)로 출시되었으며, 음성은 분당 $0.05로 초 단위 청구되고, 백엔드 추론 모델은 자체 요율로 별도 청구됩니다.

• 에이전트 — 에이전트 API는 공개 베타입니다. Ope​nAI는 API 자체에는 추가 요금이 없다고 밝혔으며, 모델 토큰, 도구, 호스팅된 샌드박스 컨테이너 시간에 대한 비용을 지불합니다.

• 샌드박스 — Ope​nAI가 이제 실행 환경을 호스팅하며, Codex 및 ChatGPT와 동일한 샌드박싱 인프라를 재사용하고, 파일, 패키지, 스킬, 플러그인으로 구성할 수 있습니다.

• 환경 — OpenAI 자체 샌드박스 외에도, 팀은 에이전트를 자체 인프라나 베타 파트너 목록에 있는 서드파티 샌드박스 벤더로 연결할 수 있습니다.

음성 릴리스는 모델 스토리다. Agents API는 플랫폼 스토리이며, 플랫폼 스토리야말로 코드베이스의 방향을 조용히 다시 설정하는 이야기다.

Agents API: 하나의 POST로 에이전트 완성

핵심 호출은 POST /v1/agents/sessions이며, Ope​nAI-Beta: agents=v1 헤더와 함께 전송됩니다. 그리고 핵심은 작업, 모델, 도구, 환경만으로 실행 중인 에이전트를 돌려받을 수 있다는 것입니다. SDK는 Python, TypeScript/JavaScript, Go, Java, Ruby를 지원합니다.

단순한 래퍼 그 이상인 이유는 Ope​nAI가 하네스를 제공하는 것이 아니라 직접 운영한다는 데 있다. AgentKit 하네스는 오픈 소스이며 들여다볼 수 있지만, 실제로 돌아가는 사본은 Ope​nAI의 것이다. 장기 세션에 걸친 컨텍스트 압축, 도구 검색, 프로그래밍 방식 도구 호출, MCP 지원, 사용자 정의 함수, 내장 웹 검색, 그리고 동시성 설정이 가능한 서브에이전트 오케스트레이션까지 포함한다. 버전이 매겨진 하네스 기능은 모델 출시와 함께 제공되는데, 이것이 바로 흥미로운 약속이다. 스캐폴딩이 모델과 같은 주기로 움직인다는 것이다.

루프를 유지하는 데 한 분기를 쏟아부은 사람이라면 — 재시도 로직, 컨텍스트 트리밍, 도구 라우팅, 늘 상태가 새는 서브에이전트 팬아웃 — 바로 그것이 진짜 제품이다. 모델 호출이 아니다. 더 이상 직접 작성하지 않게 되는 그 주변의 배관 말이다.

호스팅 샌드박스는 청구서가 따라붙는 부분입니다

코드를 실행하는 에이전트에게는 실행할 공간이 필요합니다. 베타에는 OpenAI가 내놓은 자체 해답이 포함되어 있습니다. 바로 코드를 실행하고, 파일을 다루고, 아티팩트를 생성하며, 패키지와 스킬, 플러그인으로 구성할 수 있는 관리형 샌드박스입니다. 이미 강화된 실행 환경을 갖춘 개발자가 이를 강제로 사용해야 하는 것은 아닙니다. 자체 인프라 가져오기와 이름이 지정된 샌드박스 파트너 세트가 모두 베타에 포함되어 있습니다.

이를 기반으로 구축하기 전에 기록해 둘 만한 운영상 주의사항이 두 가지 있습니다. 베타의 데이터 레지던시는 미국 전용이며, Zero Data Retention은 지원되지 않습니다. 규제 대상 워크로드의 경우 이 두 가지 문구가 이것이 파일럿인지 프로덕션 경로인지를 결정하며, 이는 뒤늦게 발견되기 쉬운 세부 사항입니다.

API 속 GPT-Live-1: 진짜 변화는 분당 정액 과금이다

음성 모델 자체는 새로운 것이 아니다 — 7월 8일 ChatGPT 내에서 Advanced Voice Mode를 대체한 것이지만 — 상업적 형태는 새롭다. Realtime 라인에서는 오디오가 토큰으로 계량되었기 때문에, 이는 통화를 예측하려면 오디오 소모를 모델링해야 함을 의미했다: 침묵 1초에 토큰이 얼마나 소모되는지, 발신자가 에이전트와 겹쳐 말할 때 출력 길이가 어떻게 변하는지. 음성 1분당 $0.05의 정액 요금은 이를 단순한 곱셈으로 축소한다. 연속으로 열린 회선 1시간은 $3.00이다. 하루 1,000건의 통화에서 평균 4분이라면 하루 약 $200이다.

세션은 단일 모델 ID를 사용하는 Live Sessions 엔드포인트에서 실행되며, 고정할 날짜별 스냅샷이 없습니다. 문서에서는 WebRTC, WebSockets, 텔레포니/SIP를 연결 경로로 다루며, 게시된 퀵스타트는 WebRTC 방식을 구축합니다. 청구에는 두 개의 미터가 있고, 그중 하나만 음성입니다. 위임된 모든 추론 호출, 도구 호출, 웹 검색은 백엔드 모델의 일반 요금으로 청구됩니다.

아키텍처의 핵심은 위임이다. GPT-Live-1이 대화를 담당한다 — 매초 여러 번 계속 들을지, 잠시 멈출지, 끼어들지, 아니면 작업을 넘길지 결정하면서 — 그리고 실제 추론이 필요한 모든 것은 비동기 경계를 넘어 별도의 백엔드로 전달하며, 그 백엔드는 음성 대화가 계속되는 동안에도 계속 작업한다. 문서에는 두 가지 모드가 정의되어 있다. Responses 위임은 OpenAI가 지원되는 Responses 모델을 대신 호출하고 대화 컨텍스트를 제공하는 방식이고, 클라이언트 위임은 자체 애플리케이션이 백엔드를 제공하고 실행, 컨텍스트, 그리고 어떤 결과가 음성 계층에 도달할지를 직접 통제하는 방식이다. 공개된 Responses 예시에서 그 백엔드는 GPT-5.6 Terra이며, 자체 지침 및 도구와 함께 delegation 객체에 지정된다. 7월 소비자 출시 당시에는 GPT-5.5였고, 이후 커뮤니티 글들은 GPT-6 Astra를 가리켜 왔다.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

음성 레이어에 관한 모든 헤드라인 수치는 OpenAI 자체 측정치이며, 이 글을 쓰는 시점에 누구도 이를 독립적으로 재현하지 못했다. Full Duplex Bench v1.5 상호작용성에서 80.1% 대 GPT-Realtime-2.1의 45.4%, 턴테이킹 지연 시간 0.798초 대 1.41초, 도구 호출 성공률 87%, 은행 음성 지원 평가 통과율 32% 대 대체하는 모델의 12.4%다. 마지막 두 수치야말로 솔직한 수치다 — 큰 개선이지만, 여전히 규제된 워크플로의 약 3분의 2에서 실패하는 시스템이다. 제3자 고객 증거는 존재하지만 빈약하고 사심이 섞여 있다: 전화 예약 부문의 Yelp, EliseAI, 학습 플랫폼 Speak가 이전 턴 기반 스택보다 중단이 거의 80% 적다고 보고한다.

독립적인 결과는 그다지 호의적이지 않으며, 위 목록 아래가 아니라 그 옆에 나란히 놓을 만하다. Artificial Analysis Speech to Speech Index — 음성 추론, 에이전트 성능, 아레나 선호도, 작업 성공을 아우르는 단일 종합 점수 — 에서 GPT-Live-1은 69.8%로, GPT-Realtime-2.1의 73.9%보다 낮고 Gr​ok Voice Think Fast 2.0의 79.0%보다 훨씬 낮다. 두 결과를 함께 읽으면 제품의 윤곽이 분명해진다: Ope​nAI는 현존하는 최고의 대화 메커니즘을 구축했지만 최고의 음성 에이전트를 구축하지는 못했는데, 추론이 이 지수에서 별도로 점수화되는 모델에 위임되기 때문이다.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

두 개의 공지는 하나의 공지입니다.

함께 읽으면, 이 릴리스들은 동일한 재편을 두 방향에서 설명한다. Agents API는 루프, 샌드박스, 컨텍스트 관리를 호스팅된 제품 안으로 옮긴다. GPT-Live-1은 대화의 표면을, 자신의 사고를 다른 곳에 위임하는 얇은 프런트 엔드로 옮긴다. 두 경우 모두 모델은 당신이 그 주위에 구축하는 대상이기를 그치고 당신이 선택하는 구성 요소가 된다 — 그리고 두 경우 모두, 그 선택은 아키텍처적 헌신이 아니라 구성 한 줄이다.

그것이 바로 라우팅 계층이 자리하는 이음매다. OrcaRouter는 gpt-live-1을 취급하지 않는다. Live Sessions 엔드포인트는 Ope​nAI만의 것이고, 우리는 그중 어느 것도 라우팅하지 않는다. 위임 쪽은 사정이 다르다. 음성 계층이 작업을 넘기는 백엔드는 Responses API를 사용하며, 이는 평범한 모델 호출이다 — Ope​nAI 자체 예시가 이름을 언급한 모델인 GPT-5.6 Terra는 OrcaRouter를 통해 Ope​nAI의 정가, 즉 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $12.00에 이용할 수 있고, Responses 엔드포인트도 노출되어 있다. 클라이언트 위임은 더 나아간다: 애플리케이션이 백엔드를 직접 제공할 수 있게 해주므로, 음성 뒤에 있는 모델은 여러분이 통제하는 어떤 엔드포인트든 될 수 있다. Agents API의 모델 슬롯도 마찬가지다: 하네스는 Ope​nAI의 것이지만 그 안의 모델은 여러분이 계속 선택할 수 있는 부분이며, 열한 개 업스트림 제공자의 약 190개 모델이 제공자 정가 그대로의 하나의 키 뒤에 있으며, 그 위에 추가 마크업이 붙지 않는다.

구체적으로 말하면, 여기서 세 가지가 따라옵니다. 백엔드는 한 줄만 수정하면 실시간 트래픽에서 A/B 테스트할 수 있으며, 이렇게 해서 값싼 리즈너가 전화 회선을 여기에 투입하기 전에 충분히 좋은지 알아낼 수 있습니다. 페일오버는 위임 모델 아래에 둘 수 있어서, 업스트림이 안 좋은 오후를 보내더라도 대화가 함께 중단되지 않습니다. 그리고 라우팅 DSL을 통해 한 번의 호출로 여러 백엔드에 작업을 실행하거나, 모델 퓨전으로 여러 모델 패널이 한꺼번에 답하게 할 수 있습니다. 이는 에이전트의 출력을 단순히 생성하는 것이 아니라 신뢰해야 하는 순간에 유용합니다.

어느 릴리스에도 들어 있지 않은 것은 무엇인가요?

• GPT-Live-1에는 이미지나 동영상 입력이 없습니다 — 이전 ChatGPT 모드들이 갖춘 멀티모달 음성 인터페이스는 여전히 다뤄지지 않고 있습니다.

• 음성 레이어에서는 구조화된 출력이 지원되지 않으므로, 스키마로 검증된 도구 인수는 백엔드 모델에서 강제해야 합니다.

• GPT-Live-1에 대한 무료 티어 액세스는 제공되지 않으며, 속도 제한은 동시 세션 단위로 산정됩니다 — Tier 1에서는 25개, Tier 5에서는 500개까지 늘어납니다.

• Agents API 베타에서는 Zero Data Retention이 제공되지 않으며, 미국 외 지역의 데이터 레지던시도 지원되지 않습니다.

• GPT-Live-1 벤치마크 수치에 대한 독립적 재현은 없음.

OpenAI가 9월 10일에 건 베팅은 개발자들이 하네스는 따로 사고 두뇌는 따로 고르고 싶어 한다는 것이었다. 그중 전반부는 이제 하나의 지출 항목이 되었다. 후반부야말로 앞으로 12개월간 경쟁 압력이 집중될 지점이다. 교체 가능한 모델 슬롯을 갖춘 호스팅 하네스는 그 안에 넣을 수 있는 모델만큼만 좋을 수 있고, 바로 지금 그것은 OpenAI가 혼자서는 통제하지 못하는 스택의 유일한 부분이기 때문이다.

위임 쪽은 이야기가 다릅니다 — 음성 레이어가 작업을 넘기는 백엔드는 평범한 모델 호출이고, GPT-5.6 Terra는 OrcaRouter를 통해 Ope​nAI의 정가로 Responses 엔드포인트가 공개된 상태로 이용할 수 있습니다.