
VibeVoice-ASR-Streaming-7B 대 GPT-Transcribe: OpenAI 파일 엔드포인트와의 라이브 세션 체크포인트
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
이 페이지의 두 모델은 이름이 암시하는 것처럼 서로 경쟁 관계가 아닙니다. 두 모델은 오디오 녹음의 수명 주기에서 서로 다른 시점을 위해 만들어졌으며, 정직한 비교란 사용자의 제품이 어느 시점에 속하는지에 관한 문제입니다. GPT Transcribe는 OpenAI의 비동기 전사 엔드포인트로, 완성된 파일을 업로드하면 실시간보다 약 34배 빠르게 처리하여 전사 결과를 반환합니다. 가격은 오디오 1분당 $0.0045이며, Artificial Analysis의 AA-WER 벤치마크에서 독립적으로 측정된 단어 오류율은 3.31%입니다. VibeVoice-ASR-Streaming-7B는 그 반대 형태입니다. 마이크로소프트 리서치의 스트리밍 체크포인트로, 2026년 9월 2일 MIT 라이선스로 Hugging Face에 조용히 업로드된 이 모델은 오디오가 아직 도착하는 동안 전사하도록 설계되었습니다. 즉, 녹음이 진행됨에 따라 텍스트를 청크 단위로 내보내는 WebSocket 세션입니다. 정확도만으로 두 모델을 비교하는 것은 의미가 없습니다. 한쪽은 검증된 수치가 있는 반면, 다른 쪽은 어떤 수치도 공개하지 않았기 때문입니다.
아래의 모든 내용은 해당 표기에 따라 분류됩니다. GPT Transcribe 수치는 OpenAI가 공개한 가격과 Artificial Analysis의 독립 측정 결과로, 모두 2026년 7월 28일 모델 출시 이후 공개 기록에 있습니다. VibeVoice-ASR-Streaming-7B 측면은 저장소에서 알 수 있는 정보 — 체크포인트 구성, 모델 카드, Microsoft의 스트리밍 문서 — 를 기반으로 한 것으로, 제3자가 이를 벤치마킹하지 않았고 Microsoft가 스트리밍 단어 오류율을 읽을 수 있는 텍스트로 공개하지 않았기 때문입니다.
오디오의 삶 속 두 가지 다른 순간
GPT Transcribe는 이미 발생한 녹음을 위해 설계되었습니다. OpenAI의 엔드포인트는 일반적인 형식(mp3, mp4, mpeg, mpga, m4a, wav, webm)의 오디오 파일을 최대 25MB까지 받아들이고, 처리 후 전체 대본을 반환합니다. 처리 속도는 실제 시간의 약 34배이므로, 1시간 분량의 녹음은 몇 분 안에 처리됩니다. 이것은 배치 방식이며, OpenAI는 그에 맞춰 가격을 책정했습니다: 오디오 1분당 $0.0045, 대략 오디오 1시간당 $0.27입니다. 진정한 실시간이 필요하다면 OpenAI는 별도의 모델을 판매합니다 — GPT Live Transcribe는 분당 $0.017로, 배치 가격의 거의 4배입니다 — 이는 OpenAI 쪽에서 VibeVoice-ASR-Streaming-7B가 하는 일과 가장 가까운 것입니다.
VibeVoice-ASR-Streaming-7B는 그 구분을 반대 방향으로 무너뜨립니다. 즉, 전체 파일도 처리하는 스트리밍 체크포인트입니다. 전처리기 구성은 실시간 계약을 보여줍니다. 24kHz 오디오 입력을 3,200배 압축하여 7.5Hz 토큰 스트림으로 만든 다음, 4프레임 lookahead를 가진 22프레임 청크로 처리합니다. 청크당 약 2.9초의 오디오에 대략 0.5초의 미래 컨텍스트가 포함되며, 각 청크가 해석됨에 따라 텍스트를 내보냅니다. 세션 컨텍스트는 KV 캐시를 통해 전달되므로 긴 세션도 처음부터 다시 계산하지 않습니다. 문서화된 서빙 경로(vLLM 플러그인)는 실시간 세션용 WebSocket 스트림 엔드포인트와 전체 파일용 트랜스크립트 엔드포인트를 노출하므로 동일한 가중치가 두 형태 모두를 처리합니다. 그러나 이 모델이 존재하는 이유는 실시간 처리에 있으며, 호스팅 API가 없으므로 분당 과금도 없습니다. GPU는 직접 준비해야 합니다.

증거 원장은 일방적이다.
GPT Transcribe는 현재 운영 중인 전사(transcription) API 중에서도 가장 면밀하게 측정된 API 중 하나다. Artificial Analysis는 AA-WER 기준 3.31%의 단어 오류율로 약 50개 추적 시스템 중 9위로 평가했으며, 하위 점수에는 알려진 약점이 숨어 있다. 의도적으로 음향이 어려운 Earnings22 세트에서는 6.10%로 떨어진다. 이는 중립적인 리더보드에서 나온 검증되고 재현 가능한 수치이며, 그 자체로 문서화된 한계를 수반한다. 이 모델은 이전 모델인 GPT-4o Transcribe보다 25% 저렴하게 출시되었으며, 같은 벤치마크에서 약 0.7포인트 더 나은 성능을 보였다.
VibeVoice-ASR-Streaming-7B는 어디에도 비교할 만한 수치가 없습니다. 해당 모델 카드는 평가 수치를 이미지로 제공하고 Microsoft의 기술 보고서는 PDF이지만, 본문에서 인용할 수 있는 스트리밍 WER이나 지연 시간 수치는 없으며, 독립적으로 확인할 수 있는 것도 없습니다. VibeVoice 제품군에서 유일한 숫자 기준점은 배치(batch) VibeVoice-ASR 모델 카드에 있는 공급업체 보고 표뿐입니다. 이 표는 8개 영어 테스트 세트에서 평균 7.77% WER, LibriSpeech clean에서 2.20%로, 비스트리밍 모델에 대한 설명이며 이 체크포인트의 정확도로 해석해서는 안 됩니다. 구매 결정을 위해 동료에게 설명할 수 있는 숫자가 필요하다면, 이 비교에서 숫자가 있는 쪽은 한쪽뿐입니다.
각각이 일반 트랜스크립트 외에 반환하는 것
두 모델은 컨텍스트 처리에 대해 서로 다른 선택을 내리며, 바로 여기서 기능 비교가 흥미로워진다. GPT Transcribe의 핵심은 컨텍스트 힌팅이다. 녹음본에 대한 자유 형식 설명, 키워드 및 고유명사 목록, 예상 언어 목록을 전달할 수 있으며, OpenAI는 자체 Context-Aware ASR 벤치마크에서 의미 정확도가 컨텍스트가 없는 경우 41.6%에서 컨텍스트를 적용한 경우 45.2%로 개선되었다고 보고한다. 또한 감지된 언어도 함께 반환한다. 다만 화자 분리(speaker diarization)나 단어 수준 타임스탬프는 제공하지 않는다. OpenAI는 이러한 기능을 위해 별도의 모델을 안내하므로, 사용자가 직접 화자 계층을 구성하지 않는 한 회의록은 구분되지 않는 하나의 텍스트 덩어리로 반환된다.
VibeVoice-ASR-Streaming-7B는 반대의 선택을 한다. 해당 모델 카드는 청크가 처리되는 즉시 누가 무엇을 말했는지 출력하는 스트리밍 화자 속성 출력과, 컨텍스트 프롬프트(--context_info CLI 플래그)를 통한 맞춤형 핫워드를 제공한다고 주장한다. 이것은 GPT Transcribe가 명시적으로 배제한 기능이며, 다중 화자 실시간 오디오에서 두 모델을 서로 바꿔 쓸 수 없는 이유다. 반대급부는 검증이다. GPT Transcribe에서 빠진 기능은 문서화된 제품 결정이지만, VibeVoice가 주장하는 화자 속성은 독립적인 테스트로 확인된 적 없는 모델 카드의 언급일 뿐이다. 타임스탬프에 있어서도 양쪽이 다르다. 비교 대상인 그 경로에서는 어느 쪽도 단어 수준 타임스탬프를 제공하지 않지만, VibeVoice 제품군의 배치 모델은 이를 지원한다.

가격 패턴과 소유권 문제
두 비용 구조는 극명하게 다르며, 어느 쪽이 절대적으로 우월하다고 단정할 수도 없다. GPT Transcribe는 사용량 기반 과금 API다. 오디오 시간당 $0.27, 인프라나 GPU 불필요, 요청당 25MB, 그리고 OpenAI의 운영 보증이 따른다 — 음성 모델을 직접 운영하지 않기 위해 치르는 대가다. VibeVoice-ASR-Streaming-7B는 가중치 자체는 $0이지만 KV 캐시 이전에 bf16 기준 약 18GB이므로, 24GB급 GPU와 microsoft/VibeVoice 데모 코드 또는 vLLM 플러그인, 그리고 자체적인 모니터링과 스케일링이 필요하다. MIT 라이선스는 분당 요금으로는 결코 담아낼 수 없는 차이를 만든다. 가중치는 영구히 보유하고, 미세 조정하고, 자신이 통제하는 하드웨어에서 실행할 수 있으며, 좌석별 과금도 25MB 상한도 없다.
{{1}}언어 지원 범위는 구매자가 원하는 것보다 양측 모두에서 더 모호한 부분이다.{{/1}} {{2}}VibeVoice-ASR-Streaming-7B는 모델 카드에 영어, 중국어, 스페인어, 포르투갈어, 독일어, 일본어, 한국어, 프랑스어, 러시아어, 이탈리아어 등 10개 언어를 명시하며, 이는 배치(batch)용 VibeVoice-ASR의 50개 이상 언어와 대비된다.{{/2}} {{3}}OpenAI는 GPT Transcribe에 대해 이에 상응하는 검증된 언어 목록을 공개하지 않는다.{{/3}} {{4}}출시 자료에서는 22개 Common Voice 언어에 걸쳐 강력한 결과를 보고하지만,{{/4}} {{5}}Earnings22에 대한 감사에서 확인된 음향적 약점은 "지원됨"과 "그 언어의 잡음이 많은 오디오를 처리함"이 서로 다른 주장임을 상기시킨다.{{/5}} {{6}}지원 범위 요구가 넓다면 어느 목록도 확답을 주지 않는다 — 실제 방언을 테스트하라.{{/6}}

결론: 점수가 아니라 레인 기준으로 선택하라.
오디오가 완성된 파일일 때, 한계가 명시된 문서화된 정확도 수치를 원할 때, 또는 자체 음성 인프라를 운영하지 않는 것이 시간당 {{2}}$0.27{{/2}}의 가치가 있을 때는 {{1}}GPT Transcribe{{/1}}를 선택하세요. 그리고 실시간 전송이 거의 4배에 달하는 가격을 정당화할 때만 {{3}}GPT Live Transcribe{{/3}}와 함께 사용하세요. 작업이 실시간이고 다중 화자(multi-speaker)일 때, 대화가 진행되는 동안 트랜스크립트가 도착하기를 원할 때, 화자별 스트리밍 출력을 평가해 볼 만한 기능으로 간주할 때, 또는 측정된 벤치마크보다 오픈 가중치와 데이터 통제권이 더 중요할 때는 {{5}}VibeVoice-ASR-Streaming-7B{{/5}}를 선택하세요.
어느 쪽을 기반으로 구축하든 팀에 드릴 한 가지 구조적 참고 사항: 전사(transcription) 계층은 현재 OrcaRouter가 라우팅하는 대상이 아닙니다. 이 페이지에 있는 음성-텍스트 모델 중 어느 것도 OrcaRouter의 카탈로그에 없으므로 ASR 선택은 전적으로 여러분의 몫입니다. 라우팅이 실질적으로 가져다주는 가치는 트랜스크립트 위의 계층입니다. 실시간 전사 피드는 그것을 소비하는 무언가가 있을 때만 유용합니다. 요약기, 알림 규칙, 음성 에이전트의 플래너 같은 것이 그것이며, OrcaRouter는 바로 그 스택을 하나의 API로 전면 지원합니다. 200개 이상의 모델을 공급업체 목록 가격 그대로, 마크업 없이 중계하고 자동 장애 조치까지 제공합니다. VibeVoice-ASR-Streaming-7B처럼 아직 입증되지 않은 체크포인트를 부담 없이 시도해 볼 수 있게 하는 패턴은 정확히 이것입니다. 여러분의 트랜스크립트를 소비하는 엔드포인트를 교체 가능하게 유지하라는 것입니다. 그러면 아직 벤치마크가 없는 모델도 출시일의 주장이 아니라 여러분 오디오의 실제 증거를 바탕으로 여러분의 트래픽을 얻거나 잃게 됩니다.
