'GPT-Live-1 vs SeedRealtime'이라고 쓰인 히어로 타이틀 카드, 부제목 '당신이 호출할 수 없는 더 야심찬 모델', 그리고 'API에서 일반 제공 vs Doubao 앱 전용'이라는 문구가 두 패널 위에 있으며, 왼쪽 패널은 API 괄호 글리프와 'API' 배지가 있는 열린 출입구를, 오른쪽 패널은 같은 출입구에 자물쇠가 채워진 모습과 'NO API' 배지를 보여줍니다. 각 패널에는 파형과 조리개를 짝지은 오디오 및 카메라 아이콘이 있고, 구석에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

GPT-Live-1 vs SeedRealtime: SeedRealtime는 더 야심찬 모델이며, 구매할 수 없습니다.

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GPT-Live-1과 SeedRealtime을 역량 면에서 비교하면 불편한 답이 나온다. 두 모델은 같은 조건에서 경쟁하고 있지 않기 때문이다. GPT-Live-1은 OpenAI의 전이중 음성 모델로, 2026년 7월 8일 ChatGPT 안에 출시되었고 2026년 9월 10일 Live Sessions API를 통해 개발자에게 공개되었으며, 12개의 음성과 공개된 분당 요금을 갖추고 있다. 하지만 한 가지 중대한 공백이 있다: 이미지와 비디오 입력은 명시적으로 지원되지 않는다. SeedRealtime은 2026년 8월 5일 ByteDance의 Seed 팀이 출시했으며, 전적으로 그 공백을 중심으로 만들어졌다. 이는 하나의 엔드투엔드 아키텍처에서 보고, 듣고, 말하는 네이티브 오디오-비주얼 전이중 모델이다 — 그리고 Doubao 소비자 앱 내에서만 사용할 수 있으며, 공개 API도, 오픈 가중치도, 기술 보고서도, 공개된 파라미터 수도 없다.

각자가 실제로 인지할 수 있는 것

그 격차를 확인하는 가장 명확한 방법은 각 모델이 자신이 있는 방에 대해 무엇을 알고 있는지 묻는 것이다.

GPT-Live-1은 듣는다. 그것이 입력 표면의 전부다. 오디오와 텍스트가 들어가고, 오디오와 텍스트가 나오며, Ope​nAI의 문서에는 이미지와 비디오가 지원되지 않는 것으로 기재되어 있다. 그것은 듣기의 대화적 역학을 극도로 잘 처리한다 — 초당 여러 번 계속 들을지, 멈출지, 끼어들지, 도구를 호출할지 결정하고, 전이중을 유지하므로 말하는 동안에도 들어오는 오디오를 계속 처리한다. 또한 오디오와 함께 음성 인식 전사본을 반환하는데, 이는 통합 작업을 일주일이나 절약해 주는 눈에 띄지 않는 종류의 세부 사항이다.

SeedRealtime는 파이프라인이 아닌 하나의 모델에서 듣고 봅니다. ByteDance는 오디오, 비디오, 텍스트를 함께 처리하고, 시각적 맥락으로 모호성을 해결하며 — 동음이의어를 구분하고, 장면, 제스처, 시선, 이전 행동으로부터 '이것'이 무엇을 가리키는지 이해하고 — 인식, 이해, 의사 결정, 표현을 순차적으로가 아니라 병렬로 실행하는 통합 아키텍처를 설명합니다. ByteDance의 공개된 데모에는 모델이 목소리를 신원에 연결해야 하는 시끄러운 단체 저녁 식사, 박물관 방문, 에스프레소 워크플로 교정, 그리고 오프스크린 기억을 유지하면서 온라인 조회를 하며 공항에서 간섭을 억제하는 사례가 포함됩니다.

• 입력 — GPT-Live-1은 오디오와 텍스트만, 이미지와 비디오는 명시적으로 지원하지 않음 vs SeedRealtime은 오디오, 비디오, 텍스트가 하나의 모델에 융합됨

• 발화 순서 주고받기 — GPT-Live-1은 초당 여러 번 내부적으로 결정하는 반면, SeedRealtime은 발화 순서 주고받기를 모델 내부로 옮기고 외부 음성 활동 감지기를 완전히 제거합니다

• 능동적 행동 — GPT-Live-1은 응답하고 위임하며 도구를 호출하는 반면, SeedRealtime은 목표 객체가 시야에 들어오면 요청받지 않아도 먼저 말을 꺼내는 것으로 설명된다

• 사용 가능성 — GPT-Live-1은 OpenAI API에서 분당 $0.05에 일반 제공되는 반면, SeedRealtime은 Doubao 내에서 무료이고 API도, 그에 대한 일정도 없음

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

증거의 질은 야심과는 정반대 방향으로 흐른다

여기서부터는 그 비교가 ByteDance에게 더 이상 유리하게 작용하지 않는다.

Ope​nAI가 수치를 공개한다. 이는 자체 수치이며, 경쟁사가 아니라 GPT-Live-1을 GPT-Realtime-2.1과 비교한 것이고, 어떤 독립 연구소도 이를 재현하지 못했다 — 전이중 상호작용성에서 80.1% 대 45.4%, 턴테이킹 지연 시간은 1.4초에서 0.8초로, 도구 호출 정확도는 60%에서 87%로. 벤더가 직접 실행했고 재현되지 않았다는 점은 분명한 주의사항이며, 적어도 하나의 수치에 붙일 수 있는 주의사항이다.

ByteDance는 거의 아무것도 공개하지 않는다. SeedRealtime에 관한 핵심 주장은 엔드투엔드 인간 평가로, ASR+비전+TTS를 직렬로 연결한 시스템에 비해 오디오-비주얼 대화 진행 문제를 절반으로 줄인다는 것이다. 즉 문장 중간에 끊기는 경우가 더 적고, 멈춤 후 느린 응답이 더 적고, 배경 잡담으로 인한 잘못된 트리거가 더 적다. 표본 크기도, 방법론도, 개선 폭에 대한 정확한 수치도, 지연 시간 수치도 전혀 없다. 파라미터 수도, 기술 보고서도 없다.

결과적으로, 더 흥미로운 아키텍처를 가진 모델이 바로 가장 평가하기 어려운 모델이다. 그렇다고 해서 그 모델의 성능이 더 나쁘다는 말은 아니다 — 데모는 정말 인상적이며, 청크 단위 오디오-비주얼 입력과 스트리밍 생성에 관한 엔지니어링 설명은 데모라기보다 실제 시스템을 시사한다 — 하지만 그것은 이 둘의 품질 비교가 현재로서는 문서화된 모델과 인상적인 비디오 사이의 비교라는 뜻이다.

API 격차가 사소한 문제가 아닌 이유

SeedRealtime은 2026년 8월 5일부터 Doubao 내에서 음성과 영상 모두에서 무료로 전면 출시되었습니다. Volcano Engine이나 BytePlus 엔드포인트가 없고, 유료 등급도 없으며, 공개된 할당량도 없고, 개발자 액세스 개방에 대한 일정도 밝히지 않았습니다. ByteDance의 로드맵은 더 낮은 지연 시간, 더 정밀한 화자 추적, 도구 연동 작업을 언급하지만 날짜는 언급하지 않습니다.

이를 더욱 가중시키는 접근성 관련 제약이 하나 있습니다. Doubao는 중국 본토 우선 제품으로, 등록하려면 일반적으로 중국 본토 휴대전화 번호가 필요하며, 현지화된 영어 버전은 발표되지 않았습니다. 중국 밖의 팀에게 SeedRealtime은 단순히 API로 출시되지 않은 것이 아니라 — 제품으로서도 접근할 수 없습니다.

그것을 GPT-Live-1 자체의 통합 부담과 비교하면 트레이드오프가 구체화된다. OpenAI의 API는 사람들을 놀라게 할 만큼 좁다: 하나의 모델 ID, v1/live/sessions의 하나의 엔드포인트, 데이터 채널에서 이벤트 처리를 하는 WebRTC 전송, 그리고 Chat Completions, Responses, Realtime, Batch 또는 파인튜닝 엔드포인트를 통한 경로가 없다. 속도 제한은 분당 요청 수가 아니라 동시 세션 수로 표시된다 — Tier 1에서 25개, 50, 200, 300, 500으로 증가한다 — 그리고 Free tier는 모델을 전혀 호출할 수 없다. 그것은 새로운 통합이며, 오늘 오후에 시작할 수 있는 통합이기도 하다.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

같은 위임 문제에 대한 두 가지 답변

두 모델 모두 기존의 캐스케이드 설계를 거부한다. 음성 인식, 언어 모델, 음성 합성이 순차적으로 실행되며 턴 사이에 약 1.7초의 침묵이 있는 설계 말이다. 두 모델은 그것을 서로 다른 방식으로 거부하는데, 그 차이는 어느 쪽이 전화 통화용으로 만들어졌고 어느 쪽이 방을 위해 만들어졌는지 알려준다.

GPT-Live-1은 작업을 수직으로 분할한다. 빠른 음성 레이어가 대화를 담당하고, 더 무거운 것들 — 웹 검색, 더 깊은 추론, 에이전트 작업 — 은 Responses API를 통해 별도의 추론 모델로 넘겨지며 대화는 계속 이어진다. Ope​nAI가 공개한 WebRTC 예제는 그 백엔드를 GPT-5.6 Terra에 연결한다. 그 결과 사고를 담당하는 절반은 토큰당 가격이 매겨지는 평범한 텍스트 모델 호출이며, 따라서 음성 레이어와 독립적으로 선택하고 교체하고 라우팅할 수 있는 대상이 된다. 지원 라인의 경우, 그것이 올바른 형태다: 음성은 인터페이스이고 추론은 제품이다.

SeedRealtime는 모든 것을 하나의 네트워크 안에 유지하는데, 바로 그 덕분에 문장이 아직 진행 중일 때 제스처를 살펴볼 수 있다. 또한 그것은 분해를 불가능하게 만드는 이유이기도 하다 — 추론을 담당하는 절반을 교체할 수 없는데, 추론 절반이라는 게 없기 때문이고, 어디에서도 실행할 수 없는데, 실행할 곳이 없기 때문이다.

오늘 음성 에이전트를 구축하고 있다면, 그 구분이 곧 결정의 전부입니다. 이 둘 중 오직 하나만이 아키텍처에 넣을 수 있는 구성 요소입니다. Ope​nAI의 위임 예시에서 백엔드인 GPT-5.6 Terra는 OrcaRouter를 통해 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $12.00에 제공되며, 1M 토큰 컨텍스트와 /v1/chat/completions 및 /v1/responses가 모두 노출됩니다 — 하나의 키로 약 190개의 다른 모델과 함께, 따라서 음성 에이전트 뒤의 추론 계층은 오디오 경로를 건드리지 않고도 분할하고, 가격을 책정하고, 장애 조치할 수 있습니다. GPT-Live-1도 SeedRealtime도 OrcaRouter에서 제공되지 않습니다. 이들은 자체 공급업체에서 단일 소스로 제공되며, 어떤 라우터도 이를 바꿀 수 없습니다.

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

답을 바꾸는 것은 무엇인가?

세 가지, 가능성 순으로.

• ByteDance의 개발자 API. SeedRealtime이 공개된 요금으로 Volcano Engine이나 BytePlus에 등장한다면, 그것은 더 이상 사례 연구가 아니라 진정으로 차별화된 제품이 된다 — 서구에는 호스팅된 경쟁자가 없는 오디오·비주얼 전이중 제품. 그것이 주목해야 할 신호이며, 아직 나타나지 않았다.

• 호스팅된 음성 API에 비전이 등장한다. GPT-Live-1의 문서는 이미지와 비디오가 지원되지 않는다고 명확히 밝히는데, 이는 간과라기보다 의도적인 첫 출시 경계처럼 읽힌다. Ope​nAI가 ChatGPT의 다른 곳에서 시연해 온 비디오 표면을 출시한다면, SeedRealtime을 흥미롭게 만드는 기능 격차는 상당히 좁아진다.

• SeedRealtime에 대한 독립적인 측정. 제3자의 지연 시간 수치나 파라미터 수치가 있다면, 두 모델을 야심 외의 다른 무언가를 기준으로 비교할 수 있을 것이다.

지금 구축하려는 사람에게 실용적인 결론은 짧습니다. GPT-Live-1은 이 둘 중 배포할 수 있는 유일한 모델이며, 초 단위로 청구되는 분당 $0.05에 12개의 음성과 문서화된 엔드포인트를 갖추고 있어 대화형 음성용 합리적인 기본 선택입니다. SeedRealtime은 더 흥미로운 모델이고 어쩌면 더 뛰어난 모델일 수도 있습니다. 다만 현재로서는 고객 앞에 내놓을 수 있는 제품이라기보다 융합된 오디오-비주얼 아키텍처가 어떤 모습인지 보여주는 데모입니다. 이것은 구축 기반으로 삼을 대상이 아니라 지켜볼 대상으로 분류하십시오.