
StepAudio 3 ASR vs StepAudio 3: 그런 이름의 모델은 없습니다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
검색: StepAudio 3 — 모델이 아니라 제품군을 찾게 됩니다. StepFun의 2026년 9월 15일 오디오 출시에서는 그 이름 아래 다섯 개 제품을 선보였습니다 — Realtime, ASR, 텍스트 음성 변환, Gen, Music — 그리고 그중 전사 제품인 StepAudio 3 ASR은 이후 리더보드에서 순위를 올려온 제품입니다. StepFun 자체 문서에서 지금까지 출시된 가장 큰 ASR 모델이라고 부르는 등급은 StepAudio 3 ASR Max이고, 백본을 공유하는 대화형 형제 제품은 StepAudio 3 Realtime입니다. "StepAudio 3 ASR"을 "StepAudio 3"과 비교하려는 것이라면, 제품과 제품군을 비교하는 것이며, 답은 실제로 세 가지 중 무엇을 의미했는지에 전적으로 달려 있습니다.
이 페이지가 바로 그 문제를 해결해 줍니다. 이것은 마케팅 비교가 아닙니다 — 위의 세 이름은 각기 다른 가격과 엔드포인트, 그리고 각기 다른 실패 모드를 지니고 있기 때문에, StepAudio 3 사양서를 제대로 읽기 전에 필요한 모호성 해소입니다.
왜 이름이 모호한가
StepFun은 하루 만에 전체 오디오 스택을 출시했고, 명명 규칙은 패밀리 이름을 모든 제품 이름의 어간으로 만들었다. 그것은 출시 슬라이드에서는 깔끔하지만 그 밖의 모든 곳에서는 어색하다. 이는 패밀리 이름을 검색하면 다섯 가지 서로 다른 제품이 뒤섞여 나오며, “StepAudio 3”라고 표시된 벤치마크 행이 그중 어느 것이라도 될 수 있음을 의미한다.
실질적인 결과는, 헤드라인만 보고는 무엇이 측정되었는지 알 수 없다는 것입니다. "StepAudio 3가 전사 리더보드에서 1위를 차지했다"라고 말하는 글은 StepAudio 3 ASR을 설명하는 것입니다. "StepAudio 3가 대화 역동성에서 앞선다"라고 말하는 글은 StepAudio 3 Realtime을 설명하는 것입니다. 둘 다 사실이고, 서로 다른 제품이며, 서로 바꿔 쓸 수 있는 것이 아닙니다.
특히 ASR 라인 안에는 두 번째 모호성이 있습니다. StepFun의 문서는 ASR Max 티어를 지금까지 출시된 가장 큰 ASR 모델로 언급하며, 여기에는 자체 가격과 자체 엔드포인트가 있는 반면, 공개 리더보드 행에는 더 평범한 라벨이 붙어 있습니다. 그것들이 두 이름을 가진 하나의 SKU인지 두 개의 SKU인지 밝혀내는 것이 이 페이지가 할 수 있는 가장 유용한 일이며, 다음 섹션에서 그것을 다룹니다.
그 이름이 의미할 수 있는 세 가지
• StepAudio 3 ASR — 전사 제품입니다. 디코딩하는 동안 점진적 텍스트를 반환하고 마지막에 최종 전사본을 내놓는 스트리밍 엔드포인트입니다. StepFun은 이를 맥락을 위한 언어 모델이 결합된 전사 기능이라고 설명하며, 의료, 법률, 금융, 자동차 및 프로그래밍 오디오와 속삭이는 말, 빠른 말, 연음 발화, 노래, 배경 음악 같은 까다로운 입력에 맞춰 조정했다고 합니다. 비스트리밍 음성-텍스트 변환 부문에서 Artificial Analysis의 AA-WER 지수 1.7% 단어 오류율을 기록한 모델입니다.
• StepAudio 3 ASR Max — StepFun의 문서가 지금까지 가장 큰 ASR 모델이라고 부르는 등급입니다. 시간당 2.8위안의 공개된 정가를 적용합니다. 더 저렴한 전사기가 아니라 ASR 라인의 최상위입니다.
• StepAudio 3 Realtime — 완전 이중(full-duplex) 대화형 모델입니다. 음성을 전사한 뒤 추론하는 체인을 거치는 대신 음성을 직접 추론하며, 전사는 그 과정에서 자연스럽게 나오는 부산물입니다. ASR 제품이 아니며, 전사 작업에서의 정확도는 이 모델이 튜닝된 대상이 아닙니다.
제품군의 다른 모든 것 — TTS, Gen, Music — 은 완전히 다른 작업이며, 전사 비교에는 전혀 포함되어서는 안 됩니다.
ASR과 ASR Max는 같은 모델인가요?
증거는 ‘그렇다’를 가리키며, 확인은 산수다. StepFun은 ASR Max 등급을 시간당 2.8위안으로 표시한다. 대략 7.1위안당 1달러로 환산하면 시간당 약 $0.39, 또는 1,000분당 약 $6.6이다. Artificial Analysis는 이 모델을 자사 리더보드에 1,000분당 $6.67로 표시한다. 공급업체 가격표에서 나온 수치 하나와 제3자 리더보드에서 나온 수치 하나, 이렇게 독립적으로 공개된 두 수치가 서로 1센트 이내로 일치한다. 이는 리더보드 행과 ASR Max 목록 요율이 같은 SKU를 설명한다면 예상할 수 있는 일이다.
그것이 무엇을 증명하고 무엇을 증명하지 않는지는 분명히 해둘 가치가 있다. 그것은 리더보드의 가격 축과 공급업체의 요금표가 같은 가격의 같은 제품을 설명하고 있음을 증명한다. 그것은 리더보드의 1.7%가 당신이 호출할 바로 그 엔드포인트에서 측정되었음을 증명하지는 않는다. 왜냐하면 리더보드가 디코딩 구성이나 실제로 접속한 엔드포인트를 공개하지 않기 때문이다. 그러므로: 같은 제품, 매우 유력함; 같은 측정 조건, 미검증.
확실한 것은 이 라인 안에서의 세대 간 도약이다. StepAudio 2.5 ASR은 같은 리더보드에서 시간당 0.15위안으로 4.7%를 기록한다. 현재 티어는 시간당 2.8위안에 1.7%다. 이는 단어 오류율은 64% 줄고 요금은 약 19배가 되는 셈으로, 이 제품군에서 가장 극명한 트레이드오프이며 업그레이드가 가치가 있는지를 결정하는 바로 그 요소다.

실제로 차이가 나는 차원들
이름이 정해지면 비교는 짧은 목록으로 좁혀집니다. 결정을 바꾸는 것은 바로 이 항목들입니다:
• 정확도 — StepAudio 3 ASR은 논스트리밍에서 AA-WER 1.7%, StepAudio 2.5 ASR은 동일 보드에서 4.7%를 기록했습니다. StepFun이 아닌 Artificial Analysis가 측정했습니다.
• 가격 — 시간당 2.8위안 대 시간당 0.15위안. 둘 다 공급업체 정가 요율이며, 둘 다 현재 적용 중. 약 19배.
• 가중치 — 둘 다 호스팅 API 전용. 패밀리 어디에도 공개 가중치는 없고, 온프레미스 경로도 없으며, 어느 티어에서도 자체 호스팅 옵션이 없습니다.
• 엔드포인트 형태 — 증분 및 최종 텍스트를 반환하는 단일 스트리밍 전사 엔드포인트로, 이전 세대의 동일한 형태와 비교됩니다. 통합 모델에 관해 바뀐 것은 없으므로, 마이그레이션은 재작성이 아니라 모델 식별자 교체입니다.
• 하드 오디오 튜닝 — StepAudio 3 ASR은 속삭이는, 빠른, 연속된, 노래하는 음성을 위해, 그리고 배경 음악이 깔린 오디오를 위해 명시적으로 튜닝되었습니다. 그 튜닝이 바로 제품입니다. 이전 세대는 이를 위해 만들어지지 않았습니다.
• 벤더가 주장한 도메인 개선 — StepFun은 세대 대비 중국어 9.3% 감소, 영어 25.0% 감소, 방언 22.3% 감소, 버티컬 분야 42.1% 감소, 코드 스위칭 27.9% 감소를 보고합니다. 벤더가 보고한 수치이며 재현되지 않았으므로, 방향성 정도로만 취급하십시오.
그 목록에서 눈에 띄게 빠져 있는 것들: 컨텍스트 길이, 오디오 형식 지원, 최대 오디오 길이, 모델 식별자. 이 모델에 대한 StepFun의 공개 문서는 이들을 밝히지 않으며, 그 수치를 인용하는 사람은 다른 무언가를 인용하는 것이다.
ASR과 Realtime 비교야말로 사람들이 진짜 필요로 하는 비교다
전사 제품들 중에서 세대 간이 아니라 제품 간에 고르고 있다면, 흥미로운 맞대결은 ASR 대 ASR Max가 아니라 ASR 대 Realtime입니다. StepFun 자체 기술 자료에 따르면 두 제품은 사전 학습과 중간 학습 단계를 공유하고, 지도 미세 조정 단계에서만 갈라진다고 합니다. 같은 베이스, 다른 미세 조정, 다른 제품입니다.
그 단 하나의 사실에는 실용적인 해석이 있다. 1.7%의 단어 오류율은 ASR 파인튜닝의 속성이다. 그것은 실시간 모델에 대한 약속이 아니다. 실시간 모델은 전사 정확도보다는 턴테이킹, 끼어들기 처리, 음성에 대한 추론을 최적화한다. 여러분의 아키텍처가 실시간 대화의 부수 효과로 전사한다면, 여러분은 1.7%를 사는 것이 아니라 우연히 텍스트를 출력하는 대화형 모델을 사는 것이다.
그 반대도 역시 사실이며 덜 분명하다. ASR 모델은 백본을 공유하기 때문에 제품군에 덧붙여진 작은 전문 모델이 아니다. 그것은 같은 규모의 시스템이며, 다르게 미세 조정된 것이다. 그렇기 때문에 ASR 요금은 시장의 저가 범위에 가까운 것이 아니라 같은 제품군의 나머지와 비슷한 수준이다.
하나를 고른다면 이걸 어떻게 해야 할까요?
세 가지 질문이면 결론이 납니다. 전사가 필요한가요, 대화가 필요한가요? 전사라면 StepAudio 3 ASR이 제품이고 제품군 이름은 잡음입니다. 대화라면 StepAudio 3 Realtime을 원하는 것이며 ASR 벤치마크는 아예 읽고 있을 이유가 없습니다. 그리고 정말 어려운 오디오 — 억양이 있거나, 속삭이거나, 노래로 부르거나, 배경에 음악이 깔린 — 의 전사가 필요하다면, 19배 프리미엄은 그런 경우를 위해 튜닝된 등급의 가격이며, 정직한 테스트는 혼합 지수가 아니라 자신의 실제 오디오입니다.
쉽게 잘못 내릴 수 있는 결정은 전사 계층을 영구적인 것으로 취급하는 것입니다. 무엇을 선택하든, 전사본은 다른 무언가—요약기, 구조화된 추출, 규정 준수 검사, 검색 인덱스—에 대한 입력이며, 그 호출들은 평범한 텍스트 모델에 도착합니다. 그 계층이 오디오 분이 아니라 사용량에 따라 확장되는 계층이며, 처음부터 이식 가능하게 유지할 가치가 있는 계층입니다. OrcaRouter는 거의 200개의 텍스트 모델을 하나의 API 뒤에 배치하며, 제공자 전반에 걸친 자동 장애 조치, 여러 모델을 단일 호출로 구성하는 라우팅 DSL, 하나의 모델로는 판단이 충분하지 않을 때의 모델 융합을 제공합니다. 제공자가 요율을 공개하는 경우, 그 정가는 마크업 없이 그대로 전달되므로, 텍스트 측의 가격 변경은 발표되는 당일 청구서에 반영됩니다.
범위를 분명히 하자면, 이 페이지는 우리가 서비스하지 않는 제품군에 관한 것이므로: OrcaRouter에는 StepAudio 3 엔드포인트가 없습니다. 전사 및 음성 모델은 StepFun 자체 API를 통해 접근합니다. OrcaRouter가 담당하는 것은 전사 이후 다운스트림의 추론 계층이며, 바로 이 지점에서 전환 결정은 내리기에는 저렴하고 미루기에는 비용이 큽니다.

아무도 해결하지 못한 것
네이밍은 해결 가능하다. 성능 주장은 아직 그렇지 않다. ASR 모델에 대해 공개된 기술 보고서가 아직 없고, 공개된 테스트 세트도, 디코딩 구성도, StepFun 외부 누구의 재현 가능한 프로토콜도 없다. 또한 벤더 자체 비교는 오픈 웨이트 기존 강자가 아니라 다른 중국 ASR 제품들을 대상으로 한 것이다. 1.7%는 세 데이터셋을 혼합한 지수에 대한 실제 제3자 측정치이며, 이 모델에 관한 나머지 모든 것은 벤더의 주장이다.
두 가지가 판도를 바꿀 것입니다. 동일한 오디오를 사용한 Whisper Large v3 Turbo와의 정면 비교인데, 아무도 이를 공개하지 않았습니다. 그리고 나머지 제품군에 대한 요금입니다 — StepAudio 3 모델 다섯 개 중 네 개는 출시 당시 여전히 기간 한정 무료 미리보기 가격이었고, 전사와 합성만 공개된 요금을 책정하고 있었습니다. 즉, 오늘 확인할 수 있는 가격표에는 다섯 제품 중 두 개만 포함되어 있습니다.

이것은 오디오 분(minute)이 아니라 사용량에 따라 확장되는 계층이며, 처음부터 이식 가능하게 유지할 가치가 있는 계층입니다. 공급자 간 자동 장애 조치, 여러 개를 하나의 호출로 구성하는 라우팅 DSL, 그리고 모델 하나의 판단만으로 충분하지 않을 때의 모델 융합입니다.
