'Grok Voice Transcribe 2.0 vs GPT Transcribe'라고 적힌 아티클 히어로 카드와 '모델 비교' 배지, '동일한 스트리밍 가격, 다른 정확도'라는 부제목, 그리고 2.7% vs 3.9% 스트리밍 WER, 3.4% vs 6.3% 첫 부분, 1,000분당 $1.67 vs $4.50, 실시간 대비 162x vs 41x를 표시하는 칩이 흰색에서 파란색으로 이어지는 그라데이션 위에 있고, 오른쪽 아래에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Grok Voice Transcribe 2.0 대 GPT Transcribe: 동일한 스트리밍 가격, 다른 정확도

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

그 일치는 거의 지나치게 딱 맞아떨어진다. Artificial Analysis의 AA-WER Streaming 보드에서, 스트리밍 전사 엔드포인트인 Grok Voice Transcribe 2.0과 GPT Live Transcribe는 둘 다 오디오 1,000분당 정확히 $3.33로 표시된다. 2026년 9월 18일 출시된 SpaceXAI의 Grok Voice Transcribe 2.0은 발화 종료 후 0.49초에 단어 오류율 2.7%로 최종 전사본을 반환하고, 첫 부분 전사는 3.4%이다. 2026년 7월 28일 GPT Transcribe와 함께 출시된 GPT Live Transcribe는 최종 전사본을 3.9%로, 첫 부분 전사를 6.3%로 반환한다. 같은 가격에, 최종 전사 정확도 약 1.2포인트와 부분 전사 정확도 2.9포인트가 SpaceXAI에 유리하다. 같은 대결의 배치 쪽은 전혀 우연이 아니다: GPT Transcribe는 1,000분당 $4.50인 반면 Grok Voice Transcribe 2.0은 $1.67로, 녹음 파일 경로에서 63% 차이다.

전사가 더 나아지는 방식에 대한 두 가지 다른 베팅

OpenAI의 정확성에 대한 해답은 문맥입니다. GPT Transcribe와 GPT Live Transcribe는 모두 자유 형식 프롬프트, 키워드 목록, 예상 언어 목록을 받아들이며, Realtime 세션에서는 앞서 전사된 턴들이 이후 턴의 문맥으로 다시 제공됩니다. OpenAI 자체의 Context Aware ASR 벤치마크에서 이러한 조건화는 GPT Live Transcribe의 의미 정확도를 38.5%에서 44.6%로 끌어올렸습니다. 이는 공급업체가 보고한 수치이며, 단어가 정확했는지보다 의미가 살아남았는지를 측정합니다. OpenAI가 제시하는 맞바꿈은 명확합니다. 모델에게 곧 듣게 될 내용에 대한 정보를 주면, 동일한 원시 정확도의 범용 모델보다 사용자의 도메인을 더 잘 전사할 것입니다.

SpaceXAI의 답은 모델 그 자체다. Grok Voice Transcribe 2.0에는 바이어싱 메커니즘—요청당 최대 100개의 핵심 용어, 각각 최대 50자—이 있긴 하지만, 그것은 프롬프트가 아니라 어휘 목록이다. "OrcaRouter"와 "Kubernetes"가 실제 단어라고 알려줄 수는 있지만, 이것이 환불에 관한 지원 통화라는 것을 설명하는 문단을 건네줄 수는 없다. 2.0의 정확도 향상은 대신 재훈련에서 비롯된다: SpaceXAI 자체의 프로덕션 파생 평가 세트에서 단어 오류율은 대화 오디오에서 8.7%에서 3.3%로, 8kHz 전화 통신에서 10.6%에서 7.1%로, 음성 자격 증명에서 7.2%에서 3.2%로, 19개 언어에 걸친 짧은 명령에서 20.6%에서 6.8%로 떨어졌다. 이는 회사 오디오에 대한 회사 수치이며, 외부의 누구도 재현하지 않았고, 기대할 것을 미리 알려주는 데 더 나아진 모델이 아니라 음향 문제를 더 잘 해결하게 된 모델을 설명한다.

실무에서의 차이는 작업 두 번째 시간에 드러납니다. 컨텍스트 조건화 모델은 원시 벤치마크가 시사하는 것보다 훨씬 더 나을 수 있습니다. 어휘와 도메인을 제공한 것은 사용자이기 때문입니다. 또한 사용자가 제공한 키워드를 환각할 수도 있습니다. 프롬프트에 "OrcaRouter"를 넣으면, 그 단어를 명확하게 듣지 못하는 모델도 그것을 산출할 수 있습니다. 핵심 용어 편향 모델은 더 완만하게 성능이 저하됩니다. 편향은 용어가 존재한다고 단정하기보다 그 용어의 확률을 이동시키기 때문입니다. 어느 실패 모드도 리더보드에는 나타나지 않지만, 둘 다 로그에는 나타날 것입니다.

숫자를 나란히

• 최종 전사 정확도(스트리밍) — AA-WER Streaming에서 Grok Voice Transcribe 2.0은 WER 2.7%, GPT Live Transcribe는 3.9%를 기록했으며, 두 수치 모두 Artificial Analysis 기준

• 첫 번째 부분 정확도(스트리밍) — 3.4% vs 6.3%, 비교에서 가장 큰 격차이며 음성 에이전트 동작을 결정하는 항목

• 최종 전사까지 걸리는 시간 — 발화 종료 후 0.49초 대 0.81초, 즉 더 정확한 모델이 확정하는 속도도 더 빠르다는 뜻

• 첫 부분 응답까지의 시간 — 0.49초 vs 0.26초, OpenAI가 완승하는 유일한 지연 시간 열

• 스트리밍 가격 — 둘 모두 1,000분당 $3.33이며, Artificial Analysis가 Grok의 시간당 $0.20과 OpenAI의 분당 $0.017을 기준으로 정규화한 값

• 배치 정확도 (비스트리밍) — Grok Voice Transcribe 2.0은 2.3% AA-WER, GPT Transcribe는 3.31%

• 배치 가격 — 1,000분당 $1.67 대 1,000분당 $4.50, 시간당 $0.10부터 분당 $0.0045 대비

• 배치 처리량 — 실시간 대비 약 162배, 동일 보드에서는 약 41배

그 목록을 하나의 판정이 아니라 두 개의 열로 해석하세요. OpenAI는 첫 부분 지연 시간에서 확실한 차이로 이기며 Grok에는 없는 컨텍스트 메커니즘을 제공합니다. SpaceXAI는 두 모드 모두에서 최종 정확도, 스트리밍에서의 부분 정확도, 처리량, 배치 가격에서 큰 차이로 이깁니다. GPT Live Transcribe가 Grok Voice Transcribe 2.0보다 더 빠르면서 더 정확한 열은 없습니다. 더 빠른 열은 하나뿐이며, 그것은 가장 이른 열입니다.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

당신이 실제로 어느 배치 경로에 있는지

$1.67 대 $4.50 격차는 여기서 가장 모호하지 않은 숫자이며, 그것이 존재하는 이유를 정확히 짚어볼 가치가 있다. OpenAI는 GPT Transcribe를 출시하면서 이 제품 라인의 가격을 GPT-4o Transcribe 시대에서 25% 인하했고, 그 결과 분당 $0.0045가 되었다. SpaceXAI는 버전 1.0에서 2.0으로 넘어갈 때 배치 요금을 시간당 $0.10로 그대로 두었다 — 모델을 개선하고 같은 가격을 받았는데, 이는 하기 더 어려운 일이며 시장이 어디로 가는지에 대한 더 나은 신호다. Microsoft의 MAI-Transcribe-2는 한시적 제안으로 동일한 시간당 $0.10에 출시되었으므로, 1,000분당 $1.67이라는 점은 한 공급업체의 홍보용 숫자가 아니라 배치 전사를 위한 프런티어 랩의 하한선이 되었다.

월 오디오 1만 시간 기준으로, 그 격차는 약 $2,830 대 $450입니다. 팟캐스트 아카이브, 통화 녹음 백로그, 또는 소급 전사되는 미디어 라이브러리의 경우, 가격 차이는 2.3%와 3.31% WER 사이의 정확도 차이를 압도합니다. 스트리밍 에이전트의 경우 두 제품의 비용이 동일하므로 정확도와 지연 시간만이 남은 논쟁거리입니다.

그 요금들 뒤에는 언급할 만한 구조적 차이가 있습니다: Grok Voice Transcribe 2.0은 오디오 시간당 정액 요금을 청구하고, GPT Live Transcribe는 분당 청구하지만, Gemini 3.5 Transcribe Live는 오디오 입력과 텍스트 출력 모두에 대해 토큰당 청구합니다. 이 셋 중 단 하나만이 모델이 말하기로 선택한 내용에 따라 청구서가 달라지게 만듭니다. 예측이 중요할 만큼 사용량이 많다면, 정액 요금이 청구서에 서명하는 사람에게 더 설명하기 쉽습니다 — 그리고 OrcaRouter는 제공업체의 정가를 0% 마크업으로 그대로 전달하기 때문에, OpenAI의 25%와 같은 공급업체 측 인하가 발표되는 당일 우리 쪽에서 바로 적용될 것입니다, 다음 갱신 때가 아니라.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

어느 모델도 아닌 것

GPT Transcribe와 GPT Live Transcribe는 스위치로 전환하는 하나의 제품이 아니라 두 개의 제품입니다. 배치 모델은 완료된 파일, 스트리밍된 파일 전사, Realtime 세션에서 커밋된 턴을 처리하며, OpenAI 자체 집계에 따르면 실시간보다 약 34배 빠르게 오디오를 처리합니다. Artificial Analysis는 자사 하네스에서 41배를 측정합니다. 스트리밍 모델은 분당 $0.017로 더 비싼 쪽이며, 부분 결과에서 오류율이 10배 더 큰 쪽입니다. OpenAI를 선택한다는 것은 그 두 문제 중 어느 쪽을 안고 갈지 선택하는 것입니다. 더 저렴한 엔드포인트는 다른 쪽의 일을 할 수 없기 때문입니다.

Grok Voice Transcribe 2.0은 두 가지 전송 방식을 갖춘 하나의 모델입니다: 동일한 가중치가 /v1/stt를 REST를 통해 최대 500MB 파일에 제공하고, wss://api.x.ai/v1/stt를 WebSocket을 통해 라이브 오디오에 제공하며, 중간 결과는 약 500ms마다 출력됩니다. 스트리밍 요금은 별도로 설계된 제품이 아니라 배치 요금의 정확히 두 배입니다. 즉, 보관된 오디오에서 측정한 정확도가 라이브에서 기대해야 할 정확도입니다. 또한 평가할 두 번째 모델이 없다는 뜻입니다 — 하나의 프롬프트 세트, 하나의 핵심 용어 세트, 하나의 기대치 세트.

기능 동등성은 거의 비슷하지만 완전히 동일하지는 않습니다. 두 모델 모두 단어 수준 타임스탬프를 반환합니다. Grok Voice Transcribe 2.0은 각 단어에 신뢰도 점수를 부여하므로, 전체 전사 내용을 똑같이 신뢰하는 대신 신뢰도가 낮은 구간에 임계값을 적용해 걸러낼 수 있습니다. 두 모델 모두 화자 분리를 수행하며, Grok의 기능은 추가 비용 없이 포함됩니다. 두 모델 모두 숫자, 날짜, 통화, 연락처 정보에 대한 역 텍스트 정규화를 처리합니다. Grok Voice Transcribe 2.0은 최대 8개의 독립 채널에 걸친 다채널 전사, 군더더기 단어 제거, Smart Turn 발화 종료 감지를 추가합니다. GPT Transcribe의 차별화된 추가 기능은 프롬프트 수준의 문맥 조건화와 Realtime 측의 이전 턴 자동 이월입니다. OpenAI는 두 모델 모두에 대해 지원 언어 수를 공개하지 않았습니다. Grok Voice Transcribe 2.0은 수십 개 언어를 문서화하며, 녹음 중 전환과 25개 언어에 걸친 표기 형식 포맷팅을 지원합니다.

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

결정하는 방법, 그리고 그것을 테스트하는 방법

고객이 말을 끝내기 전에 응답해야 하는 음성 에이전트를 구축하고 있다면, 부분 전사 열이 바로 의사결정 변수이며, 이는 두 모델을 깔끔하게 갈라놓습니다: Grok Voice Transcribe 2.0은 부분 전사에서 정확도가 2.9포인트 더 높지만, 이를 생성하는 데 0.23초 더 느립니다. 잘못된 부분 전사가 늦은 것보다 더 나쁘다면 SpaceXAI를 선택하세요 — 라우팅, 에스컬레이션, 규정 준수 트리거 응답. 늦은 부분 전사가 잘못된 것보다 더 나쁘고, 정확도 격차가 좁혀지도록 컨텍스트 메커니즘에 공급할 도메인 어휘가 있다면 OpenAI를 선택하세요. 그런 다음 둘 다 측정하세요, 왜냐하면 8시간의 영어 에이전트 대화에서 두 벤더의 부분 전사 동작이 여러분의 억양, 코덱, 전문용어에서 어느 쪽이 어떻게 작동할지 예측하지 못하기 때문입니다.

파일을 전사하는 경우라면 결정은 훨씬 쉽습니다: 1,000분당 $1.67 대 $4.50, WER 2.3% 대 3.31%로 둘 다 같은 방향을 가리킵니다. 배치 작업에서 GPT Transcribe에 머무를 유일한 이유는 컨텍스트 조건화 메커니즘이 원시 정확도 격차로는 상쇄할 수 없는 무언가를 오디오에 해 주는 경우뿐입니다 — 이는 고도로 도메인 특화된 녹음에서 실제로 가능한 일이며, 검증 가능한 일이기도 합니다.

두 전사 모델 모두 오늘날 OrcaRouter의 카탈로그에 없으므로, 호출 자체는 해당 공급업체의 자체 API로 갑니다. 하나의 OrcaRouter 키 뒤에 있는 것은 전사 결과가 공급하는 모든 것입니다: 에이전트 모델, 요약기, 분류기, 텍스트를 어떻게 처리할지 결정하는 코드입니다. 바로 여기서 두 번째 계약이 보통 등장합니다 — 음성에는 한 공급업체, 그것을 추론하는 모델에는 또 다른 공급업체 — 하지만 그럴 필요는 없습니다. 200개 이상의 모델에 걸친 하나의 키, 공급업체 성능이 저하될 경우 자동 페일오버, 그리고 여러 모델을 통해 요청을 보내고 확정하기 전에 비교하고 싶다면 라우팅 DSL. "우리가 귀하의 전사를 라우팅합니다"보다 작은 주장이지만, 그것이 사실인 주장입니다.

주목할 점은 OpenAI가 컨텍스트보다 정확도를 내세워 답할지 여부다. 이 회사는 지난 1년 동안 전사 모델 세대를 두 번 출시했고 가격을 한 차례 인하했다. 컨텍스트 메커니즘은 정말로 차별화되어 있지만, 원시 전사 성능을 측정하는 리더보드에서는 현재 SpaceXAI와 Microsoft에 모두 뒤처진다. 만약 GPT Transcribe 2가 컨텍스트 메커니즘을 그대로 유지한 채 오류율을 2%대로 낮춰 등장한다면, 이 비교는 배치 쪽에서 하룻밤 사이에 뒤집힌다 — 그리고 이미 동일한 스트리밍 가격은 이를 지켜볼 만한 경쟁으로 만든다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트