
Granite Speech 5.0 470M TurboCTC: IBM의 Apache-2.0 ASR이 12,600 RTFx를 달성했다고 주장한다
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
Granite Speech 5.0 470M TurboCTC는 IBM의 새로운 음성 배포판에서 실제로 배포가 허용되는 모델로, 이것이 이 모델에 대해 가장 먼저 알아야 할 사실입니다. IBM은 2026년 8월 25일 Hugging Face에 두 개의 영어 음성 인식 체크포인트를 게시했습니다 — Apache 2.0 라이선스의 Granite Speech 5.0 470M TurboCTC와 비상업용 CC-BY-NC-SA-4.0 라이선스의 Granite Speech 5.0 470M TurboCTC-NC입니다. 동일한 4억 7천만 파라미터 아키텍처, 다른 데이터, 반대되는 라이선스입니다. Apache 모델은 IBM이 '기타 사용 사례' — 즉 공급업체 언어로 상업적 프로덕션 — 를 위해 지목하는 모델이며, 헤드라인 수치를 담당하는 모델이기도 합니다. IBM은 단일 NVIDIA H200에서 집계 처리량이 12,600 RTFx 이상이라고 보고하며, 이는 배치 추론으로 초당 3시간 30분 이상의 영어 오디오를 전사하는 것에 해당한다고 설명합니다.
그 속도 수치는 {{1}}하루 전에 나온 벤더의 주장일 뿐이며 어떤 제3자도 재현하지 못한 값이므로, 검증된 사실이 아니라 서류상으로는 강력한 수치로 읽어야 한다{{/1}}. 그럼에도 주목할 가치가 있는 이유는 {{2}}그 배후의 설계{{/2}}에 있다: {{3}}Granite Speech 5.0 TurboCTC는 이전의 모든 Granite Speech 모델이 사용하던 언어 모델 디코더를 제거하고, 연결주의 시간 분류(CTC)로 훈련되며 비자기회귀적으로 디코딩되는 순수 Conformer 인코더만을 남겼다{{/3}}. {{4}}470M 파라미터 모델이 자기보다 몇 배나 큰 모델들을 능가하는 처리량을 주장할 수 있는 것은 토큰 단위 생성 루프가 없기 때문이다{{/4}} — 그리고 그것이 {{5}}이번 릴리스가 단지 벤치마크 표만이 아니라 음성-텍스트 변환 시스템을 구축하는 모든 이에게 중요한 이유다{{/5}}.
실제로 출시된 것
두 개의 체크포인트는 모두 2026년 8월 25일에 ibm-granite Hugging Face 조직에서 공개되었으며, 둘 다 동일한 인코더 전용 아키텍처를 사용하는 영어 전용 ASR입니다:
• Granite Speech 5.0 470M TurboCTC — Apache 2.0, 상업적 사용 허용, 약 60,000시간의 영어 오디오로 학습됨.
• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, 연구 및 비상업적 용도로만 사용 가능, 약 75,000시간의 영어 오디오로 훈련됨.
이 글은 Apache 모델에 관한 내용입니다 — 제품이 법적으로 의존할 수 있는 모델로, 라이선스 이야기가 필요한 부분에서는 -NC 트윈 모델이 함께 언급됩니다. 두 체크포인트 모두 safetensors 형식으로 F32와 BF16으로 제공되며, 둘 다 Hugging Face Transformers에서 AutoModelForCTC와 AutoProcessor를 통해 기본 지원됩니다. 이 기능은 다음 Transformers 릴리스에 포함됩니다. 그 전까지는 Transformers를 소스에서 설치하고, 프로세서와 모델을 로드한 다음, greedy decoding을 실행하면 됩니다. IBM은 또한 브라우저 기반 WebGPU 스트리밍 데모를 제공하는데, 이는 실제로 지연 시간이 얼마나 낮아지는지 가장 빠르게 확인할 수 있는 방법입니다.
아키텍처 승부수: 디코더 없이 인코더만, 초당 12.5토큰
속도 주장의 배경에는 설계 변경이 있습니다. 이전 Granite Speech 릴리스는 음향 인코더를 프로젝터 및 언어 모델 디코더와 결합했지만, 바로 그 디코더가 제거되었습니다. Granite Speech 5.0 470M TurboCTC는 CTC로 훈련된 16계층 Conformer 인코더이며, 추론은 단일 비자기회귀적 탐욕 패스입니다. 샘플링할 것이 없으므로 기다릴 생성 지연 시간도 없습니다.
세 가지 구성 세부사항은 단지 작게 만드는 것이 아니라 빠르게 만듭니다:
• 시간적 서브샘플링 8배. 프런트엔드는 초당 100프레임으로 실행되고, 모델은 초당 12.5토큰을 출력합니다. 로그-멜 프레임을 스태킹하고 스킵한 다음, 처음 두 Conformer 블록에서 스트라이드 합성곱과 풀링 잔차를 사용하여 출력 속도를 세 단계로 각각 1/2씩 줄입니다.
• 문자 대신 서브워드 어휘. 이전 Granite Speech 인코더는 초당 50자를 출력했지만, 5.0은 16,384개 단위의 BPE 어휘(-NC 변형의 SentencePiece)에서 초당 12.5개의 서브워드 토큰을 출력한다. 오디오 1초당 출력 단위가 적을수록 CTC 디코더가 결정해야 할 사항이 줄어든다.
• 자기 조건화 CTC. 중간 Conformer 레이어는 모델 자체의 중간 표현을 정제하며, 이는 디코더가 없어도 작은 인코더가 정확도를 유지하게 해주는 비결이다.
그 모든 내용은 모델 카드와 IBM 기술 문서에 있습니다. 이를 종합하면, 무거운 자기회귀 디코더가 적합하지 않은 노트북, 휴대폰, 스트리밍 파이프라인을 위해 구축된 체크포인트라는 뜻입니다 — 엣지 포지셔닝은 IBM 자체 설명에서도 명확히 드러납니다.
IBM이 주장하는 수치
이 섹션의 모든 내용은 IBM이 보고한 것으로, 2026년 8월 25일 기준 Hugging Face 인프라에서 Open ASR 리더보드의 공개 하네스를 통해 실행되었으며, 독립적으로 재현된 것이 아닙니다. 이를 확정된 사실이 아니라 그럴듯해 보이는 벤더 수치로 취급하십시오:
• 처리량 — 단일 NVIDIA H200에서 배치 추론으로 12,600 RTFx 이상, IBM은 이를 초당 3.5시간 이상의 오디오에 해당한다고 설명합니다. IBM은 이 수치가 이전 Granite Speech 모델보다 20배 이상의 처리량이라고 덧붙입니다. 이는 데이터센터 GPU의 배치 추론 수치이며, 노트북에서 얻을 수 있는 수치가 아닙니다.
• 정확도 — Apache 모델이 Open ASR 리더보드의 공개 영어 단문 테스트 세트에서 기록한 5.00% 종합 단어 오류율(동일 세트에서 -NC 변형은 4.85% 기록). 추론은 Hugging Face의 jobs 인프라를 통해 실행되었고 리더보드의 툴링으로 채점되었으므로, IBM은 새 모델이 공식 테이블에 통합되면 이 수치들이 공식 테이블과 일치할 것으로 기대합니다.
• 원거리장 — FFASR 잡음 및 잔향 리더보드에서 Apache 모델은 정확도 9위, -NC 모델은 5위를 차지했으며, 두 모델은 해당 리더보드에서 가장 빠른 항목입니다 (처리량은 단일 NVIDIA L4에서 측정).
학습 — Apache 모델용 공개 영어 오디오 약 60,000시간을 IBM의 Blue Vela 클러스터에서 NVIDIA H100 8대를 사용하여 10일 만에 완료했습니다.

Apache 2.0이 실제로 당신에게 제공하는 것
이번 릴리스가 특이한 점은 라이선스입니다. 오픈 가중치(open-weight) 음성 모델은 대개 연구용 라이선스나 프로덕션 팀의 법무 부서가 난색을 표하게 만드는 의무 조항과 함께 출시됩니다. 그러나 이번에는 상업적으로 사용할 수 있는 모델이 IBM이 정확도 점수를 약간 더 낮게 매긴 쪽입니다. 총 WER 0.15포인트(5.00% 대 4.85%)를 맞교환하는 대신, 제품에 배포하고 출력을 수익화하며 파인튜닝 후 파생 가중치를 독점 보유하고, 연구 전용 조항에 가로막히지 않고 클라우드 인프라에서 사용할 권리를 얻는 것입니다.
리더보드를 쫓다 보면 그 트레이드를 잘못된 방향으로 하기 쉽습니다. -NC 모델의 4.85%는 약 15,000시간의 추가 학습 데이터(GigaSpeech 및 SPGI Speech)에서 비롯되며, IBM이 말 그대로 "연구 및 비상업적 목적으로만"이라고 표시한 버전입니다. 훌륭한 벤치마크 모델이지만, 제품 의존성으로는 좋지 않습니다. Apache 모델은 정확도를 조금 잃는 대신 상업용 전사 파이프라인, 콜센터 QA 시스템, 또는 엣지 디바이스의 기반이 될 수 있는 능력을 얻습니다. 이 제품군을 평가하고 있다면, 라이선스 결정이 벤치마크 결정보다 우선합니다.

포기하는 것
언어 모델을 제거하는 것은 공짜가 아니며, 모델 카드는 그 손실에 대해 솔직하게 밝히고 있습니다:
• 음성 번역 없음. 이전 Granite Speech 세대는 전사하면서 언어 모델을 거쳐 번역할 수 있었지만, 5.0은 전사 전용입니다.
• 키워드 바이어스 없음. LM은 도메인 용어와 이름에 대한 바이어스도 처리했다. 이 바이어스가 없어지면 서브워드 어휘가 자연스럽게 만들어내는 결과만 보게 된다.
• 영어만 지원됩니다. 이번 릴리스에는 다국어 체크포인트가 없으며, 곧 제공될 조짐도 없습니다.
• 5.00% WER은 단문(short-form) 깨끗한 오디오 기준 수치입니다. FFASR 결과(소음이 있는 원거리 발화에서 9위)는 회의실 및 핸즈프리 사용에 더 현실적인 지표이며, 이는 순위이지 헤드라인 수치가 아닙니다.
한정된 전사 작업(통화 오디오, 회의, 음성 메모, 자막, 받아쓰기)의 경우, 이 중 어느 것도 문제가 되지 않습니다. 만약 하나의 작은 모델이 번역도 하고, 사용자 지정 어휘를 별도의 설정 없이도 안정적으로 전사해 주기를 기대했다면, 그것들이 중요해집니다.
오늘 실행하는 방법
아직 존재하지 않는 클라우드 API는 필요하지 않습니다. 모델은 로컬에서 실행됩니다:
• Transformers를 소스에서 설치하세요(CTC 기능 세트는 아직 최신 릴리스에 없습니다). 그런 다음 AutoModelForCTC와 AutoProcessor, 그리고 greedy decoding을 사용하세요 — 표준 파이프라인입니다. 프로세서는 모델의 디바이스에서 log-mel 특징을 계산할 수 있어 호스트에서 디바이스로의 복사를 절약합니다.
모델 카드 예시는 "ibm-granite/granite-speech-5.0-470m-turboctc" 모델을 사용한 automatic-speech-recognition 파이프라인을 통한 두 줄짜리 코드입니다.
• WebGPU 스트리밍 데모는 브라우저 탭에서 실행되며, 벤치마크 하네스에 오후를 투자하기 전에 지연 시간을 측정하는 가장 빠른 방법입니다.
• 프로덕션 환경에서 실질적인 문제는 서빙입니다. 이 부류의 오픈 ASR 모델은 일반적으로 CPU 또는 소형 GPU에서 배치 스트리밍 추론(batched streaming inference)과 같은 방식으로 실행됩니다. 12,600 RTFx라는 헤드라인 수치는 H200 배치 수치이며, 실제 단일 스트림 노트북 수치는 훨씬 낮을 것입니다. 또한 IBM은 첫 토큰 도달 시간(time-to-first-token) 수치를 발표하지 않았습니다.
그 서빙 레이어는 오픈 ASR의 실제 비용과 복잡성이 자리하는 곳이며, 라우팅 플랫폼이 존재 가치를 증명하는 곳이기도 합니다. OrcaRouter의 모델은 200개 이상의 모델을 아우르는 단일 API로, 공급업체 정가를 0% 마크업으로 그대로 전달합니다. 따라서 공급업체가 가격을 인하하면 그 인하가 당일부터 바로 적용됩니다. 또한 공급업체 간 자동 장애 조치와 여러 모델을 하나의 호출로 구성하는 라우팅 DSL을 제공합니다. 이 중 어떤 것도 Granite Speech 5.0 470M TurboCTC에는 해당되지 않습니다. 두 변형 모델 모두 아직 OrcaRouter에 없기 때문입니다. 가중치는 하루 전에 공개된 것이고, 이를 서빙하는 상용 공급업체도 없습니다. 이와 같은 오픈 음성 모델이 호스팅 경로를 얻을 때 — 또는 이미 나와 있는 호스팅 ASR API와 비교할 때 — 라우팅 레이어는 통합을 다시 작성하지 않고도 모델을 시험해 보고 대체할 수 있는 방법이며, 정가 전달 방식의 가격 책정은 비교의 공정성을 유지해 줍니다.
아직 확인되지 않은 것은 무엇인가?
하루 된 모델은 문서 기록이 짧고, 아직 알려지지 않은 것이 정확히 무엇인지 나열해 볼 가치가 있다:
• 제3자 벤치마크 없음. 12,600 RTFx, 5.00% WER, FFASR 순위는 모두 IBM이 공개 리더보드 하네스를 통해 자체 실행한 결과입니다. 독립적인 제3자가 수치를 발표한 적은 없습니다.
• IBM 호스팅 API는 없습니다. watsonx 모델 페이지도, 관리형 엔드포인트도, 가격 정책도, 그리고 그중 어떤 것이 제공될 날짜도 없습니다.
• 스트리밍 지연 시간 수치가 없습니다. 스트리밍 지원과 WebGPU 데모는 존재하지만, 첫 토큰까지의 시간 및 청크 지연 시간 수치는 없습니다.
• 다른 빠른 오픈 ASR 모델과의 동일한 하니스(harnes) 비교가 없음. 중요한 대결 — Whisper large-v3, NVIDIA Parakeet TDT 0.6B, 그리고 호스팅된 전사 API와의 비교 — 는 아직 누구도 동일한 데이터로 실행하지 않았습니다.
다음에 볼 콘텐츠
단기 신호는 독립적 재현이다. Open ASR 리더보드는 공개되어 있고, 하네스는 표준이며, 가중치는 Hugging Face에 있으므로, 제3자 실행은 며칠 내에 나올 것이다. 5.00%가 유지되는지, 12,600 RTFx가 IBM 자체 배치 설정 밖의 단일 H200에서도 유지되는지 지켜보라. 또 하나 주목할 점은 IBM이 Apache 트윈을 관리형 서비스로 전환하는지 여부다. watsonx 엔드포인트가 생기면 이 모델은 즉시 가장 신뢰할 수 있는 상업적 경로를 가진 오픈 ASR이 될 것이기 때문이다. Granite Speech 5.0 470M TurboCTC는 첫날부터 진정으로 빠르고, 진정으로 허용적인 영어 ASR이며, 검증 이력은 진정으로 빈약하다. 처음 두 가지는 실제이며, 세 번째는 시간 문제다.

