
StepAudio 3 ASR 대 Whisper Large v3 Turbo: 1.7% 대 4.6%, 그리고 아무도 그 테스트를 실행해 본 적이 없다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
원하시는 비교는 존재하지 않습니다. StepAudio 3 ASR 및 Whisper Large v3 Turbo는 비스트리밍 음성-텍스트 변환에 대해 동일한 Artificial Analysis AA-WER 지수에 있습니다 — 4~5.5% 범위의 수치와 비교되는 1.7%의 단어 오류율 — 그리고 2026년 9월 말 현재, 아무도 동일한 오디오에 대한 일대일 비교를 발표하지 않았습니다. StepFun도, Whisper 유지관리자들도, 독립 연구소도 아닙니다. StepFun 자체 문서는 Doubao ASR 2.0, Seed 2.0 Lite 및 HY3.0 ASR Preview와 비교 벤치마크를 제시하며, 이들은 모두 중국어 ASR 제품입니다. Whisper 쪽은 어떤 공급업체도 비교 자료를 전혀 발표하지 않습니다. 왜냐하면 Whisper Large v3 Turbo는 수년간 다운로드 가능했고, 그 수치는 누가 그것을 서비스하느냐에 따라 달라지기 때문입니다.
그래서 이 페이지는 정직한 버전을 보여준다: 둘 다 측정하는 단 하나의 리더보드를 읽고, 비교 가능한 것과 그렇지 않은 것을 구분하며, 증거가 어디서 끝나는지 분명히 밝힌다. 짧게 답하자면 정확도에서의 격차는 실재하며 대략 3점 폭이고, 그 밖의 모든 것 — 가격, 라이선스, 배포 가능성 — 에서의 격차는 반대 방향으로 나타나며 더 크다.
각각이 실제로 무엇인지
StepAudio 3 ASR은 StepFun이 2026년 9월 15일, 다섯 개 모델로 구성된 StepAudio 3 오디오 제품군의 일부로 출시한 호스팅 전사 모델입니다. 단일 스트리밍 엔드포인트를 통해 접근하며, 디코딩 중에는 증분 텍스트를, 마지막에는 최종 전사문을 반환합니다. StepFun은 이를 맥락을 위해 언어 모델을 결합한 전사 기능이라고 설명하며, 의료, 법률, 금융, 자동차, 프로그래밍 오디오와 기존 인식기를 무너뜨리는 입력 — 속삭이는 말, 빠른 말, 연음 발화, 노래, 그리고 배경에 음악이 깔린 오디오 — 에 맞춰 조정되었다고 합니다. 공개 가중치도, 온프레미스 경로도, 어떤 등급에서도 자체 호스팅 옵션도 없습니다. 공개된 목록 요금은 시간당 2.8위안으로, 리더보드 자체의 가격 축에서 1,000분당 약 $6.67에 해당합니다.
Whisper Large v3 Turbo는 OpenAI가 MIT 라이선스로 공개한 오픈 웨이트 모델입니다. 8억 900만 개의 파라미터, 99개 언어를 지원하며, 디코더 레이어 수를 줄인 Whisper large-v3의 가지치기 및 미세 조정 파생 모델입니다. 수백만 번 다운로드되었고, 수많은 플랫폼에서 상용으로 제공되며 자체 하드웨어에서 실행할 수 있습니다. 그 마지막 특성이 바로 이 비교의 전부이며, 정확도 격차가 중요한 유일한 수치가 아닌 이유입니다.
둘 다 측정하는 단 하나의 보드
Artificial Analysis의 AA-WER 지수는 잘못 전사된 단어의 비율을 보고하며, 낮을수록 더 좋습니다. 그리고 이 지수의 버전 2는 세 가지 데이터셋을 혼합합니다: AA-AgentTalk 50%, VoxPopuli-Cleaned-AA 25%, Earnings22-Cleaned-AA 25%. 비스트리밍 보기는 추적하는 71개 모델 중 36개를 보여줍니다. 두 모델 모두 여기에 나타나는데, 이는 대부분의 비교가 주장할 수 있는 것보다 많습니다.
게시판에 나열된 대로 읽으십시오:
• StepAudio 3 ASR — AA-WER 1.7%, 오디오 1,000분당 약 $6.67
• Whisper Large v3 Turbo, 호스팅 엔드포인트 하나 — AA-WER 4.6%, 1,000분당 약 $0.67
• Whisper Large v3 Turbo, 두 번째 호스팅 엔드포인트 — AA-WER 5.5%, 1,000분당 약 $15.00
• Whisper Large v3, 또 다른 오픈 가중치 세대 — 한 엔드포인트에서는 4.1%, 다른 엔드포인트에서는 10.1%
• StepAudio 2.5 ASR, StepFun의 이전 세대 — 4.7%
보드에서 마지막 두 줄이 가장 많은 시사점을 주며, 그 두 줄은 StepFun에 관한 것이 전혀 아니다. 동일한 공개 Whisper 가중치가 한 엔드포인트에서는 4.1%를, 다른 엔드포인트에서는 10.1%를 기록한다. 이는 동일한 파라미터에서 6포인트 차이이며, 전적으로 서빙 방식의 차이, 즉 청킹 전략, 하드웨어, 디코딩 구성, 그리고 각 호스트가 내부 한계보다 긴 오디오를 처리하는 방식에서 비롯된다. 보드 자체의 각주도 이를 뒷받침하며, 데이터셋 중 하나에서는 시간 제한 때문에 일부 모델의 오디오는 약 9분 단위로 청킹되고 다른 모델은 약 30초 단위로 청킹된다고 언급한다.
즉, "StepAudio 3 ASR vs Whisper Large v3 Turbo" 비교는 사실 두 개의 비교가 겹쳐진 것입니다. 모델 대 가중치, 그리고 모델 대 당신이 마침 벤치마크하게 된 엔드포인트. 두 번째는 첫 번째보다 변동 폭이 더 큽니다.

정확도 격차가 어디서 비롯되는지, 그리고 그것을 얼마나 신뢰해야 하는지
단어 오류율 3포인트는 상위 다섯 시스템이 서로 0.6포인트 이내에 몰려 있는 분야에서 큰 격차다. 또한 이는 이 비교에서 제3자가 측정한 유일한 수치이며, 양방향으로 작용하는 실질적인 주의 사항이 따른다.
StepAudio 3 ASR에 반대하여: 이 수치는 혼합 지수이며, 그 혼합의 50%는 에이전트 대화 데이터셋인 AA-AgentTalk입니다. 맥락을 위해 LLM을 붙인 도메인 특화 전사에 맞춰 조정된 모델은 그런 형태의 오디오에 잘 맞습니다. 지수를 낭독 음성이나 방송 뉴스 쪽으로 재가중하면 순위가 더 좁혀질 수 있습니다. 또한 ASR 모델에 대한 공개된 기술 보고서도, 공개된 테스트 세트도, 디코딩 구성도 아직 없고, StepFun 외부의 누구로부터의 재현 가능한 프로토콜도 없습니다.
Whisper Large v3 Turbo와 비교하면: 4.6%는 하나의 호스팅된 엔드포인트에서 나온 수치일 뿐, 모델 자체의 속성이 아니다. 가중치는 고정되어 있고 공개되어 있지만, 점수는 그렇지 않다. 같은 가중치를 도메인에 적합한 청킹과 좋은 디코더 구성으로 신중하게 실행하는 팀은 리더보드의 해당 행보다 의미 있게 더 나은 결과를 낼 수 있다 — 그리고 이를 부주의하게 실행하는 팀은 다른 오픈 가중치 세대가 기록한 10.1%보다 더 나쁜 결과를 낼 수 있다. 솔직히 요약하자면, 이 비교의 오픈 가중치 쪽에는 측정할 수 있는 하한과 노력해서 얻어야 하는 상한이 있다.
빠져 있는 것은 그것을 판가름할 수치다: 두 시스템을 하나의 오디오 세트와 하나의 디코딩 프로토콜로 비교해 공개한 수치 말이다. 아무도 그것을 실행하지 않았고, 누군가 실행하기 전까지 "1.7% vs 4.6%"는 서로 다른 조건에서 얻은 두 측정값을 비교한 것일 뿐, 두 시스템을 서로 맞붙여 측정한 결과가 아니다.
Whisper가 더 큰 차이로 앞서는 나머지 네 가지 차원
정확도는 StepFun이 앞서는 차원입니다. 목록의 나머지 항목에서는 오픈 웨이트 모델이 훨씬 뒤처지며, 바로 이 항목들이 배포가 아예 가능한지 여부를 결정합니다:
• 라이선스 및 가중치 — 809M 파라미터의 MIT 라이선스 오픈 가중치 vs 어떤 티어에서도 가중치가 공개되지 않는 호스팅 API.
• 배포 — 자체 호스팅, 온프레미스, 에어갭, 또는 수십 개의 상용 플랫폼을 통한 방식 vs StepFun의 API만.
• 비용 하한 — 하나의 호스팅 엔드포인트에서 1,000분당 약 $0.67이며, 직접 실행하면 그보다 더 낮습니다. 벤더가 공개한 요율 기준으로는 1,000분당 약 $6.67입니다.
• 데이터 상주성 — 오디오가 귀하가 제어하는 인프라를 절대 벗어나지 않는 방식 vs 오디오가 제3자 엔드포인트로 전송되는 방식
• 통합 리스크 — 가중치를 직접 보유하고 있어 모델이 회수되거나, 가격이 재책정되거나, 지원 중단되는 일이 없습니다. 반면 호스팅 요금은 가격표에 따라 언제든 바뀔 수 있습니다.
• 긴 오디오 동작 — 청킹은 문서화되어 있지 않은 벤더 엔드포인트가 내부적으로 처리하는 방식과 달리, 파일별로 직접 결정하고 조정할 수 있습니다.
그 가격 차이는 더 저렴한 Whisper 엔드포인트 대비 대략 10대 1이며, 이는 StepFun 자체 라인업 내부에서 벌어진 일과 정반대다. 이 모델이 대체하는 StepAudio 2.5 ASR은 시간당 0.15위안으로 책정되었고, 현재 등급은 2.8위안으로 책정되어 있다. StepFun은 정확도를 얻기 위해 전사 요금을 약 19배 인상했는데, 이는 이 모델을 자체 호스팅 오픈 웨이트 모델의 더 비싼 버전이라기보다 그와는 다른 시장에 위치시킨다.

어느 것을 선택해야 할까요
이 구분은 대부분의 맞대결보다 더 깔끔합니다:
• 오디오가 평범하거나, 볼륨이 크거나, 데이터가 여러분의 인프라를 벗어날 수 없거나, 배포가 영구적이고 가격이 안정적이어야 한다면 Whisper Large v3 Turbo를 선택하세요. MIT 라이선스는 그 결정을 되돌릴 권리가 여러분에게 있고 아무도 그것을 되돌릴 수 없다는 뜻입니다.
• 오디오가 정말로 어려운 경우 — 억양이 있거나, 속삭이거나, 노래하거나, 배경 음악이 깔린 경우 — 또는 해당 도메인이 StepFun이 튜닝한 다섯 가지 중 하나라면 StepAudio 3 ASR을 선택하세요. 그것이 바로 프리미엄이 주는 가치이며, 그런 오디오에서는 3포인트의 정확도 차이가 사용 가능한 전사본과 수동 교정 작업 사이의 차이를 만듭니다.
• 오디오가 어느 쪽인지 모른다면, 어느 한쪽으로만 결정하지 마세요. 잘못 선택했을 때의 비용은 비대칭적입니다: 오픈 가중치 경로는 GPU 한 시간의 비용으로 자체 하드웨어에서 테스트할 수 있고, 호스팅 경로는 시도하는 데는 비용이 들지 않지만 통제할 수 없는 요금에 묶이게 됩니다.
하이브리드를 선택해야 한다는 주장은 대부분의 비교에서보다 여기서 더 강하며, 그 이유는 보드에서 나타난 엔드포인트 편차 때문입니다. 동일한 Whisper 가중치가 누가 서빙하느냐에 따라 4.1%에서 10.1%까지 점수가 달라지므로, 실무적으로는 하나의 호스트에 전념하기보다 오픈 웨이트 경로를 둘 이상의 호스트에 걸쳐 라우팅하는 것이 낫습니다. 이는 자동 장애 조치(failover)가 제공하는 것이며, 프로덕션 경로 앞에 호스팅 모델을 두면서도 그 경로 전체를 그 모델에 걸지 않을 수 있게 해 주는 바로 그 메커니즘입니다.
이것이 스택에 어떻게 부합하는지, 그리고 우리가 제공하는 것과 제공하지 않는 것
전사에 무엇을 선택하든, 전사본은 어딘가로 전달됩니다. 요약기, 구조화된 추출, 규정 준수 검사, 검색 인덱스 — 이러한 호출은 일반 텍스트 모델에 도달하며, 이는 오디오 분이 아니라 사용량에 따라 증가하는 청구서의 일부입니다. StepFun 자체의 실시간 모델은 도구 호출과 장시간 작업의 비동기 실행을 내세우는데, 이는 오디오 계층조차도 오디오 모델이 아닌 무언가에 끊임없이 작업을 넘기고 있다는 뜻입니다.
범위를 분명히 밝히자면, 자칫 반대로 암시되기 쉬우니까요. StepAudio 3 ASR도 Whisper Large v3 Turbo도 OrcaRouter에는 없습니다. StepAudio는 StepFun 자체 API를 통해 접근하며, Whisper 가중치는 직접 실행하거나 호스팅 플랫폼으로 가져가면 됩니다. OrcaRouter가 제공하는 것은 전사 결과가 흘러 들어가는 위임 계층입니다 — 하나의 API 뒤에 거의 200개의 텍스트 모델, 자동 장애 조치를 갖추고 있어 다운스트림 호출이 단일 제공자와 함께 죽지 않고, 여러 모델을 하나의 호출로 구성하는 라우팅 DSL, 그리고 한 모델의 판단만으로 충분하지 않을 때의 모델 퓨전을 제공합니다. 제공자가 요금을 공개하는 경우, 그 정가는 마크업 없이 그대로 전달되므로 가격 변경이 발표되는 당일 청구서에 반영됩니다 — 이 비교에 단 한 번의 릴리스로 전사 요금을 19배 인상한 벤더가 포함되어 있다는 점을 고려하면, 이는 가상의 이점이 아닙니다.
정확도 문제에 실제 돈을 쓰려는 참이라면, 비용이 적게 드는 순서는 이렇습니다: 먼저 자체 오디오에서 오픈 가중치를 실행해 보세요. 할 수 있기 때문이고, 그렇게 얻은 수치가 어떤 리더보드의 수치보다 더 관련성이 높기 때문입니다. 그런 다음 남아 있는 격차가 요금의 열 배를 지불할 가치가 있는지 판단하세요. 대부분의 팀은 트래픽의 일부에는 그만한 가치가 있고 나머지에는 그렇지 않다고 판단하게 될 텐데, 이는 모델 선택이라기보다 라우팅 문제입니다.
무엇이 그것을 해결할까요?
공개된 테스트 하나. 두 시스템, 동일한 오디오, 동일한 디코딩 프로토콜, 낭독 음성과 대화 오디오, 그리고 StepFun이 튜닝했다고 주장하는 어려운 사례들 사이의 정직한 구분. 그런 것이 존재하기 전까지, 이 비교는 한쪽은 제3자 지수이고 다른 쪽은 점수가 변동하는 오픈 웨이트 세트일 뿐이며, 이를 해석하는 유일하게 책임 있는 방식은 답이 아니라 출발점으로 보는 것이다.

