
Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: 두 개의 리더보드, 하나의 오해를 부르는 비교
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B는 2025년 8월 14일 CC-BY-4.0으로 공개된 6억 개 매개변수의 FastConformer-TDT 트랜스듀서이며, 1년 넘게 직접 전사를 실행하려는 사람들을 위한 기본 권장 사항이었습니다. Grok Voice Transcribe 2.0은 2026년 9월 18일 출시된 SpaceXAI의 관리형 음성-텍스트 모델로, 배치의 경우 오디오 1시간당 $0.10, 스트리밍의 경우 1시간당 $0.20의 가격이며, Artificial Analysis의 스트리밍 보드에서 최종 단어 오류율 2.7%를 기록합니다. 둘 사이의 비교를 검색하면 Parakeet이 13.7% WER, Grok Voice Transcribe 2.0이 2.7%로 인용된 것을 볼 수 있는데, 이는 관리형 모델이 다섯 배 더 정확해 보이게 만들며 읽기에 진정으로 오해의 소지가 있는 내용입니다. 그 두 숫자는 서로 다른 데이터셋을 기반으로 하고 몇 년 차이로 게시된 서로 다른 Artificial Analysis 지수에서 나온 것이며, 그중 하나는 공급업체 자체의 더 새로운 측정값으로 대체되었습니다. 진짜 비교는 더 흥미롭고, 600메가바이트의 가중치가 API가 할 수 없는 무엇을 얻어 주는지에 관한 것입니다.
13.7%라는 숫자, 그리고 그것을 사용하지 말아야 하는 이유
Artificial Analysis의 2025년 3분기 AI 현황 보고서는 NVIDIA Parakeet TDT를 자사의 AA-WER 지수에서 13.7%로, 11.6%의 Google Chirp 2와 13.2%의 NVIDIA 자체 Canary Qwen에 이어 3위에 올렸습니다. 해당 지수는 VoxPopuli, Earnings-22, AMI-SDM 각각의 약 두 시간 분량을 오디오 길이로 가중 평균한 값이었습니다. 다양한 억양, 도메인 어휘, 까다로운 채널 조건을 갖춘 실제 음성 데이터이기에 이 지수의 모든 수치가 높습니다. 잔향이 있는 방에서 녹음된 원거리 회의 오디오인 AMI-SDM에서 13.7%의 WER은 나쁜 결과가 아닙니다. 이는 까다로운 테스트입니다.
그 지표는 더 이상 그런 형태로 존재하지 않습니다. Artificial Analysis는 이를 AA-WER v2로 재구성했으며, AA-AgentTalk에 50%, VoxPopuli-Cleaned-AA와 Earnings22-Cleaned-AA에 각각 25%의 가중치를 두었고, 오디오는 약 8시간 분량입니다. 그리고 정제와 재가중은 모든 모델의 수치를 상당히 변화시켰습니다. 현재 비스트리밍 리더보드에서 Parakeet TDT 0.6B V3는 다른 오픈웨이트 선두 모델들과 같은, 낮은 한 자릿수 대역에 있으며 13.7% 근처와는 거리가 멉니다. 또한 리더보드 최상위는 약 2%까지 내려와 있습니다. Parakeet에 대해 여전히 13.7%를 인용하는 사람은 폐기된 측정값을 인용하는 것이며, 이를 2026년 스트리밍 수치와 비교한다면 서로 다른 두 리더보드를 비교하는 것이기도 합니다.
정직하게 나란히 놓고 비교할 수 있는 범위는 더 좁다. Open ASR Leaderboard에서 이루어진 NVIDIA 자체 평가는 — 표준 공개 영어 단편 세트를 해당 리더보드의 툴링으로 실행한 — Parakeet TDT 0.6B V3의 평균 WER을 6.32%, RTFx를 3,332.74로, 영어 전용 v2의 평균을 6.05%로 보고한다. Grok Voice Transcribe 2.0의 2.7%는 스트리밍 보드에서의 최종 전사 수치로, 발화 종료 후 측정된 것이며, 에이전트 가중치가 적용된 영어 대화 오디오에 대한 것이다. 서로 다른 세트, 서로 다른 보드, 서로 다른 모드다. 관리형 모델은 두 보드가 공통으로 다루는 오디오에서 매우 정확할 가능성이 높다; 그 우위의 크기는 5배가 아니며, 이를 판가름할 측정치는 아무도 공개하지 않았다.
두 모델이 실제로 어떤 모양인지
아키텍처적 차이는 실용적 차이의 대부분을 설명합니다. Parakeet TDT 0.6B는 토큰-지속시간 트랜스듀서 디코더를 갖춘 FastConformer 인코더입니다 — 이는 토큰과 진행할 프레임 수를 모두 예측하므로 공백을 내보내는 대신 건너뛸 수 있으며, 이것이 효율성의 주요 원천입니다. 25개 유럽 언어에 대한 자동 언어 감지, 단어 및 세그먼트 수준 타임스탬프, 구두점 및 대문자화를 함께 제공하며, 긴 오디오를 처리합니다 — 전체 어텐션으로 최대 24분, 또는 로컬 어텐션으로 약 3시간까지. NeMo 2.2를 통해 제공되며, Apple Silicon을 위한 MLX 경로가 있고, 일반 CPU에서 실행되는 ONNX INT8 빌드도 있습니다.
Grok Voice Transcribe 2.0은 관리형 서비스이므로, 이 비교는 모델과 제품 사이의 비교입니다. 해당 정가에 제품이 포함하는 항목은 다음과 같습니다:
• 스트리밍 — WebSocket을 통한 Grok Voice Transcribe 2.0 네이티브, 첫 부분 전사가 0.49초로 Parakeet TDT 0.6B의 청크 또는 버퍼링 방식과 대비되며, 일급 부분 전사 인터페이스가 없음
• 핵심 용어 바이어싱 — 요청당 최대 100개 핵심 용어 vs Parakeet 기능 아님
• 화자 분리(Diarization) — 요청 가격에 포함되는 항목 vs 직접 추가해야 하는 별도 시스템
• 채널 — 한 번의 요청으로 최대 8개 오디오 채널 vs 패스당 하나의 스트림
• 역텍스트 정규화 — 구두점과 대문자 표기만 지원되는 것과 달리 25개 언어 전반에 걸쳐 포함
• 배포 — us-east-1의 관리형 엔드포인트 vs 다운로드해서 어디서든 실행하고 운영하는 가중치
• 라이선스 — 상업용 API 약관 vs 저작자 표시가 있는 CC-BY-4.0
• 모델 크기 — 비공개 vs 약 6억 개의 파라미터, fp32에서 약 2.4GB 또는 fp16에서 1.2GB
마지막 행은 많은 배포를 좌우하는 행이다. Parakeet TDT 0.6B는 몇 기가바이트 안에 들어가고, INT8 ONNX 경로를 통해 노트북 CPU에서 무난하게 실행되며, 어떤 소비자용 GPU에도 여유롭게 들어간다. 그것은 API가 하는 일의 축소판이 아니다 — 그것은 다른 역량이다. 왜냐하면 그것은 오프라인에서, 기기에서, 네트워크 없이, 시간당 비용 없이 작동하는 음성 전사 기능과 그렇지 않은 기능 사이의 차이이기 때문이다.

아무도 제대로 계산하지 않는 비용 산수
발표되는 비교는 "시간당 $0.10 대 무료"인데, 이는 양쪽 모두에서 틀렸습니다 — API가 비용을 지불하는 유일한 대상이 아니고, 가중치가 절약하는 유일한 대상도 아닙니다.
• 배치 전사 — Grok Voice Transcribe 2.0은 오디오 1시간당 $0.10, 1,000분당 약 $1.67로, 라이선스 비용 없이 GPU 또는 CPU 시간이 드는 Parakeet TDT 0.6B와 대비됩니다
• 스트리밍 — 오디오 1시간당 $0.20, 1,000분당 약 $3.33으로, 공개된 요금이 아니라 자체 동시성 한도가 제약인 자체 호스팅과 대비됩니다.
• 서비스 한도 — 팀당 초당 요청 10건 및 동시 스트리밍 세션 100개 vs 하드웨어가 허용하는 만큼, 속도 제한과 동시성 상한 없음
• 어느 장부에도 없는 비용 — 엔지니어링도, 서빙 스택도, 오토스케일링과 온콜 교대의 대비도, 재시도 로직도, 모델 업데이트도, 피크를 위해 계속 웜 상태로 유지하는 GPU도
소규모에서는 관리형 쪽이 거의 항상 더 저렴합니다. 자체 호스팅 경로의 고정 비용은 사람 한 명이기 때문입니다. 크고 꾸준한 규모에서는 자체 호스팅 쪽이 결정적으로 우세하며, 교차점은 오디오 볼륨이 아니라 활용률의 함수입니다. 계속 바쁘게 돌리는 GPU는 오디오 1시간당 비용이 매우 저렴하지만, 피크 트래픽을 위해 대기 상태로 유지하는 GPU는 그렇지 않습니다. 월 20,000시간을 처리하는 팀은 관리형 배치 경로에 2,000달러를 내고, 자체 호스팅 경로에는 대략 중급 GPU 한 달치 비용에 엔지니어링 시간을 더한 비용을 냅니다. 이는 결코 비슷한 수준이 아닙니다.
이 계산이 잘못 돌아가는 이유는 자체 호스팅 측은 대개 0으로, 관리형 측은 대개 정가로 비교되기 때문입니다. 둘 다 실제 숫자가 아닙니다. 실제로 유효한 것은 Parakeet TDT 0.6B의 3,332 RTFx입니다 — NVIDIA가 데이터센터 하드웨어에서 배치 방식으로 산출한 수치이자, 약속이 아니라 상한으로 다뤄야 하는 값입니다 — 이는 적당한 GPU 한 대가 대부분의 조직이 생성하는 것보다 더 많은 오디오를 처리할 수 있다는 뜻입니다.
Parakeet이 더 이상 정답이 아닌 지점
팀이 오픈 모델을 떠나 관리형 모델로 옮겨 가게 만드는 세 가지 요인이 있는데, 그중 어느 것도 정확성 때문은 아니다.
첫째는 핵심 용어 바이어싱입니다. 전사 내용에 제품명, 성씨, 티커 심볼, 도메인 전문용어가 가득하다면, 바이어싱 메커니즘이 없는 모델은 파인튜닝 외에는 바로잡을 방법 없이 이를 틀리게 됩니다. Grok Voice Transcribe 2.0은 요청당 최대 100개의 핵심 용어를 받아들입니다. Parakeet TDT 0.6B에는 이 기능이 없습니다. 컨택 센터, 의료, 법률 업무에서는 어떤 리더보드가 뭐라고 하든 그 단 하나의 격차만으로도 탈락 사유가 됩니다.
두 번째는 화자 분리입니다. Parakeet은 타임스탬프가 포함된 단어를 제공하지만, 누가 그 말을 했는지는 알려주지 않습니다. 다중 화자 전사는 별도의 화자 분리 모델을 실행하고 그 출력을 정렬해야 한다는 뜻이며, 이는 구성 옵션이라기보다 하나의 프로젝트에 가깝습니다. 관리형 모델은 동일한 요청에서 화자 속성이 부여된 텍스트를 반환합니다.
세 번째는 스트리밍 인터페이스 자체입니다. Parakeet은 충분히 빨라서 사람들이 이를 기반으로 실시간 시스템을 구축합니다 — 오디오를 청크로 나누고, 각 청크에 모델을 실행하고, 출력을 이어 붙이는 식으로요 — 하지만 부분 전사 동작, 발화 종료 감지, 확정(commitment) 의미론은 모두 여러분이 직접 작성하고 유지 관리해야 하는 것들입니다. Grok Voice Transcribe 2.0은 말을 멈춘 뒤 0.49초 만에 첫 부분 결과를 반환하며, 이는 제품 기능으로 제공됩니다.
팀들이 때때로 놀라는 라이선스 세부 사항도 있습니다: Parakeet TDT 0.6B V3는 CC-BY-4.0이며, 이는 상업적 사용을 허용하지만 출처 표시를 요구합니다. 또한 일부 NVIDIA 음성 모델은 이후 벤더 자체의 Open Model License로 전환되었습니다. 제품에 출처 표시가 문제가 된다면, 해당 제품군의 조건이 적용된다고 가정하지 말고 특정 체크포인트의 카드를 읽어 보십시오.

API가 대개 어쨌든 이기는 이유, 그리고 그래서는 안 되는 때
지난 한 해 동안 패턴은 일관적이었습니다. 팀들은 Parakeet TDT 0.6B 같은 오픈 모델로 시작합니다. 무료이고 통제 가능하기 때문이죠. 그러고 나서 기능을 출시한 뒤, 지속적인 비용이 GPU가 아니라 유지보수라는 사실을 깨닫고 관리형 엔드포인트로 이전합니다. 반대 방향의 이전도 일어나는데, 보통 사용량이 임계치를 넘어 시간당 요금이 소유할 수 있는 것에 대한 임대료처럼 보이기 시작할 때입니다.
양방향 모두 모델을 애플리케이션에 직접 연결하면 실행 비용이 많이 듭니다. 그래서 호출 지점을 최대한 평범하게 유지하라는 주장이 나옵니다. OrcaRouter는 단일 OpenAI 호환 키 뒤에 200개 이상의 모델을 제공하며, 제공자 간 자동 장애 조치와 제공자 정가 대비 0% 마크업을 지원합니다. 따라서 자체 호스팅 배포와 관리형 배포가 같은 인터페이스 뒤에 놓일 수 있고, 모델 문자열 하나로 교체할 수 있습니다. 이는 음성 분야에서 평소보다 더 중요합니다. 이 분야에서는 리더보드 선두가 몇 주마다 바뀌고, 단일 리전 관리형 서비스는 곧 단일 리전 장애입니다. 장애 조치 경로가 전사 기능이 전사 장애로 이어지지 않게 해주는 것입니다.
오픈 모델의 처리량을 서빙 스택 없이 원하는 팀에게, 이것은 또한 그 결정의 형태이기도 합니다: 자체 오디오로 Parakeet TDT 0.6B를 벤치마크하고, 같은 오디오로 Grok Voice Transcribe 2.0을 벤치마크한 뒤, 승리한 쪽이 트래픽을 계속 처리하게 하고, 그 위에 어느 벤더의 로고가 붙어 있는지는 더 이상 신경 쓰지 않으면 됩니다.

한 줄 요약을 원한다면: Parakeet TDT 0.6B는 여전히 "내가 이미 소유한 하드웨어에서 시간당 비용 없이 어디서든 무엇이든 전사한다"에 대한 최선의 답이고, Grok Voice Transcribe 2.0은 "아무것도 실행하지 않고 화자 레이블과 내 어휘로 정확하게 전사한다"에 대한 답이다. 격차를 엄청나 보이게 만드는 13.7%라는 수치는 더 이상 쓰이지 않는 측정값이며, 겹치는 오디오에서 WER 1~3포인트가량이라는 솔직한 격차는 운영상의 질문이 결정하게 할 만큼 작다.
