
MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: 같은 $9, 다른 트레이드
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
MAI-Transcribe-2-Streaming과 Gemini 3.5 Transcribe Live는 같은 비용이 들며, 스트리밍 전사기가 무엇을 위한 것인지에 대한 상반된 이론 위에 세워져 있다. 둘 모두 스트리밍 오디오 1,000분당 약 $9.00에 책정된다. 2026년 10월 1일 출시된 Microsoft의 모델은 정밀 도구다. 최종 전사까지 0.13초에 스트리밍 단어 오류율 2.5%를 기록한다고 주장하며, Microsoft 자체 설명에 따르면 최종 및 부분 전사 모두에서 정확도 1위이고, Artificial Analysis의 스트리밍 방법론으로 측정되었지만 아직 해당 리더보드에 행으로 표시되지는 않았다. 다른 모델은 2026년 8월 26일부터 공개 미리보기 상태이며 Live API를 통해 제공되는데, 커버리지 도구다. 스트림 중간 전환을 지원하는 85개 이상 언어, 무료 티어, 그리고 0.40초에 4.00%의 스트리밍 단어 오류율을 갖추었으며, 이는 Artificial Analysis가 이 모델에 대해 측정한 수치다. 어느 쪽도 명백한 선택은 아니며, 그 이유는 두 모델이 실제로 같은 워크로드를 두고 경쟁하는 것이 아니기 때문이다.
다음은 숫자가 실제로 말해주는 그대로의 일대일 비교입니다 — 벤더가 보고한 수치는 표시했고, 트래커 수치는 출처를 밝혔으며, 한 모델이 다른 모델이 전혀 겨루지 않는 차원에서 앞서는 부분도 포함합니다.
한 줄 버전
• 정확도와 지연 시간 — 공개된 수치 기준으로, MAI-Transcribe-2-Streaming에 대해 마이크로소프트는 최종 전사까지 0.0초에 스트리밍 WER 2.5%를 달성한다고 주장하며, 최종 및 부분 전사 모두에서 정확도 1위이고, 첫 부분 전사에서는 0.12초에 2.5%라고 한다. 이에 맞서 Artificial Analysis는 Gemini 3.5 Transcribe Live를 0.40초에 4.00%로 집계하고 있다. 마이크로소프트가 주장하는 우위는 1.5포인트이며, 최종 전사가 확정되기까지는 약 3배 빠르다. 단서는 트래커가 아직 MAI-Transcribe-2-Streaming 자체를 그래프에 올리지 않았다는 점이다 — 리더보드의 현재 1위는 Grok Voice Transcribe 2.0으로 2.73%와 0.49초이고, Muse Voice Transcribe는 3.06%와 0.16초이다 — 따라서 2.5%는 트래커가 실제로 측정하는 경쟁군과 대조해 읽어야 하는 벤더 수치다. 두 모델이 모두 공개하는 축에서는 접전이 아니지만, 그 축의 한쪽만 독립적으로 공개되어 있다.
• 언어 폭 — Gemini 3.5 Transcribe Live. 85개 이상의 언어를 자동 감지하고 세션을 다시 시작하지 않고도 스트림 중간에 언어를 전환하는 기능으로, 이는 Google이 Live API에 대해 내세우는 대표적인 주장입니다. MAI-Transcribe-2-Streaming은 자동 연속 언어 감지로 60개 언어를 지원합니다. Microsoft의 하한선은 더 높고, Google의 상한선은 더 넓으며, 25개 언어 격차는 대부분 단일 언어 스트리밍 모델을 전혀 사용할 수 없는 언어에 있습니다.
• 세션 형태 — Gemini 3.5 Transcribe Live, 그리고 이 대목은 양쪽으로 작용한다. Live API는 10분으로 제한된 WebSocket 세션이므로 음성 에이전트 턴에는 적합하지만 한 시간짜리 회의에는 어색하다. Microsoft는 자사의 스트리밍 모델에 대해 이에 상응하는 세션 상한을 공개하지 않으며, 이는 작업 단위가 대화 턴이 아니라 통화일 경우 중요하다.
• 진입 비용 — Gemini 3.5 Transcribe Live. 무료 티어가 있으며, Google의 혼합 요금은 토큰 기반 가격 책정에서 분당 약 $0.009로 계산됩니다. Microsoft의 오디오 1시간당 $0.54는 Microsoft가 올해 말까지 적용된다고 밝힌 도입 요금이며, 표준 가격은 공개되지 않았습니다 — 9월 배치 출시와 동일한 구조입니다.

정확도 격차가 겉보기보다 큰 이유
1.5포인트의 단어 오류율 격차는 비용을 따져 보기 전까지는 반올림 차이처럼 들린다. 4.00%의 스트리밍 WER에서 Gemini 3.5 Transcribe Live는 1,000단어당 약 40단어를 잘못 인식하고, Microsoft가 주장하는 2.5%에서는 MAI-Transcribe-2-Streaming이 25단어를 잘못 인식한다. 실시간 파이프라인이 만들어 내는 물량, 예컨대 한 달에 5,000시간의 통화를 처리하는 지원 조직은 300,000분이며 대화 속도로 4,500만 단어가 넘는데, 그 차이는 연간 수백만 개의 잘못된 단어로 이어지며, 다운스트림 시스템이 의존하는 엔터티—계정 이름, 티켓 번호, 복용량, 주소—에 집중된다.
지연 시간 차이는 설득하기가 더 어려운 부분입니다. 발화가 끝난 뒤 0.13초 대 0.40초는 실시간 자막 스트림에서는 인지됩니다. 약 0.2초 미만은 동시로 느껴지고, 3분의 1초는 자막이 화자를 뒤쫓는 것으로 느껴집니다. 하지만 인간의 시간 척도로 갱신되는 에이전트 지원 패널에서는 인지되지 않습니다. 사용자가 함께 읽는 사람이라면, 마이크로소프트의 지연 시간 우위가 곧 제품입니다. 사용자가 턴이 끝날 때 최종 전사본을 받는 모델이라면, 그것은 숫자에 불과합니다.
두 수치는 모두 같은 주의 사항을 달고 있으며, 이는 한 번만 짚고 넘어갈 가치가 있습니다. 이는 37개 모델이 포함된 트래킹 보드에서 나온 단일 실행 수치이고, 그 보드에서 1위와 3위의 격차는 1점 미만입니다. 재실행은 배치 보드의 2점 격차가 할 수 없는 방식으로 스트리밍 리더보드 상위권을 뒤바꿀 수 있습니다. 또한 Microsoft의 2.5%는 아직 그 보드에 아예 올라 있지도 않습니다. 그것은 트래커의 방법론으로 측정된 공급업체 주장이며, 이는 트래커가 게시하는 행과는 다른 것입니다.
한계야말로 결정이 실제로 존재하는 곳이다
기능 제한은 벤치마크보다 이 둘을 더 빠르게 구분하며, 둘은 서로 반대 방향으로 나아갑니다.
Gemini 3.5 Transcribe Live에는 문서화된 세 가지 제약이 있습니다: Live API의 10분 세션 상한, 화자 분리 미지원, 단어 수준 타임스탬프 미지원입니다. 첫 번째는 아키텍처적 제약입니다 — WebSocket 세션을 통한 스트리밍은 설계상 한계가 있습니다 — 따라서 장시간 라이브 전사는 세션을 넘나들며 이어 붙여야 하고, 이음새 처리는 사용자에게 맡겨집니다. 나머지 두 가지는 절대적입니다: 제품에서 발화를 특정 화자에게 귀속시키거나 검색 또는 자막 동기화를 위해 단어를 타임스탬프에 배치해야 한다면, Gemini 3.5 Transcribe Live는 어떤 비용을 치러도 이를 지원하지 않습니다.
MAI-Transcribe-2-Streaming의 제약은 문서화가 덜 되어 있는데, 그 자체가 정보입니다. Microsoft는 스트리밍 모델에 대해 화자 분리를 주장하지 않으며 단어 타임스탬프도 주장하지 않습니다. 배치 MAI-Transcribe-2는 화자 분리를 포함하고 단어 수준 타임스탬프를 반환하지만, 그것은 배치 제품이며, 스트리밍 SKU가 이를 상속한다고 가정하는 것은 바로 출시 자료가 방지하기 위해 존재하는 종류의 추론입니다. Microsoft가 실제로 주장하는 것은 지속적인 언어 감지가 가능한 60개 언어와 정확도 대 지연 시간에서의 파레토 프런티어 위치이며, 이 두 가지는 모두 트래커의 데이터와 일치하는 공급업체의 진술입니다.
솔직히 기능을 살펴보면 이렇습니다: 두 스트리밍 모델 모두 화자 분리나 단어 타임스탬프를 공개하지 않습니다. Gemini 3.5 Transcribe Live에는 공개된 세션 상한과 무료 티어가 있고, MAI-Transcribe-2-Streaming에는 공개된 언어 수가 있으며 공개된 상한은 없습니다. 요구 사항에 화자 분리가 포함된다면 이 둘 중 어느 것도 답이 아니며, 앞에 스트리밍 계층을 덧붙인 배치 전사를 보고 있는 것입니다.
가격 동등성이 실제로 말해주는 것
두 공급업체가 서로 반대 방향에서 동일한 1,000분당 $9에 도달한 것은 이 비교에서 가장 흥미로운 사실이다. Google은 Live API 세션에서 토큰 기반 가격 책정을 통해 여기에 도달했다: 오디오 입력은 백만 토큰당 $3.50, 텍스트 출력은 백만 토큰당 $21이며, 분당 약 175개의 텍스트 토큰을 소비하는 것으로 대략 분당 $0.009로 혼합된다. Microsoft는 배치 버전이 $0.10에 실행되는 패밀리의 한 모델에 대해 오디오 시간당 $0.54의 정액 요금을 책정함으로써 여기에 도달했다. 하나는 계량된 실시간 세션이고, 다른 하나는 도입 할인이 적용된 분당 정액 요금이다.
이러한 구조들은 규모를 확장할 때 서로 다르게 작동합니다. 정액 요금제는 예측 가능하고 예산을 세우기 쉽습니다. 토큰 종량제 세션은 모델이 얼마나 많은 답변을 내놓는지, 세션이 열린 채 얼마나 오래 유휴 상태로 있는지에 따라 달라집니다. 대용량 파이프라인에는 정액 요금제가 더 친화적인 청구 방식이고, 프로토타입이나 저용량 기능에는 무료 티어와 토큰당 과금이 더 친화적인 진입점입니다.

두 구조 중 어느 것도 바꾸지 않는 것은 트랜스크립트 위의 계층이다. 어떤 모델이 그것을 생성하든, 라이브 트랜스크립트는 요약, 분류, 삭제, 라우팅의 입력이 되며, 그 단계들은 각자의 비용 및 품질 곡선을 가진다 — 보통 하나가 아니라 여러 모델에 걸쳐 실행된다. 바로 그 계층을 OrcaRouter가 담당한다: 200개 이상의 모델을 아우르는 단일 API, 공급자 정가를 0% 마크업으로 그대로 전달, 자동 장애 조치, 그리고 워크로드별로 트랜스크립트를 서로 다른 모델로 보낼 수 있는 라우팅 DSL. MAI-Transcribe-2-Streaming과 Gemini 3.5 Transcribe Live는 모두 그 명단에 없다 — 이들은 각각 Microsoft와 Google 자체 음성 스택을 통해 제공된다 — 그리고 요점은 이들을 라우팅하는 것이 아니라, 이들 이후의 모든 다운스트림 요소를 이식 가능하게 유지하는 것이다.

어느 걸 고를까?
정확도와 확정 시간이 제품의 핵심일 때는 MAI-Transcribe-2-Streaming을 선택하세요. 사람이 읽는 실시간 자막, 잘못 들린 개체명이 비용을 초래하는 실시간 컴플라이언스나 품질 점수 산정, 또는 Gemini의 10분 상한 때문에 이어 붙여야 하는 긴 세션이 그런 경우입니다. 커버리지가 제품의 핵심일 때는 Gemini 3.5 Transcribe Live를 선택하세요. 사전에 열거할 수 없는 언어 전반에 걸친 글로벌 배포, 스트림 중간 언어 전환, 또는 무료 티어와 토큰당 과금이 약정 부담을 없애 주는 프로토타입이 그런 경우입니다. 둘 다 필요한 팀도 막힌 게 아닙니다. 두 제품은 서로 다른 세션 모델을 가진 다른 API이며, 정직한 아키텍처는 하나로 표준화하기보다 워크로드별로 라우팅하는 것입니다.
이 비교에서 얻을 만한 주장은 마이크로소프트가 이겼다는 것이 아니다. 스트리밍 전사가 이제 가격이 동일한 믿을 만한 최첨단 옵션 두 가지를 갖게 되었다는 점이다. 이는 결정 기준이 "무엇이 사용 가능한가"에서 "이 특정 워크로드에는 무엇이 필요한가"로 옮겨졌다는 뜻이다. 그런 문제를 안고 있는 편이 더 낫다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
