
StepAudio 3 ASR vs Whisper Large v3 Turbo: 1,7% so với 4,6%, và chưa ai chạy thử nghiệm
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
So sánh mà bạn muốn không tồn tại. StepAudio 3 ASR và Whisper Large v3 Turbo đều nằm trên cùng một chỉ số AA-WER của Artificial Analysis dành cho chuyển giọng nói thành văn bản không streaming — tỷ lệ lỗi từ 1,7% so với các số liệu trong khoảng 4 đến 5,5% — và tính đến cuối tháng 9 năm 2026, chưa ai công bố so sánh đối đầu trên cùng một đoạn âm thanh. Không phải StepFun, không phải nhóm duy trì Whisper, cũng không phải một phòng thí nghiệm độc lập. Tài liệu của chính StepFun đối chiếu hiệu năng với Doubao ASR 2.0, Seed 2.0 Lite và HY3.0 ASR Preview, đều là các sản phẩm ASR Trung Quốc. Phía Whisper hoàn toàn không có nhà cung cấp nào công bố so sánh, vì Whisper Large v3 Turbo đã có thể tải xuống từ nhiều năm nay và các con số của nó phụ thuộc vào ai đang cung cấp nó.
Vậy nên trang này làm phiên bản trung thực: nó đọc bảng duy nhất đo lường cả hai, tách những gì có thể so sánh với những gì không, và nói rõ nơi bằng chứng dừng lại. Câu trả lời ngắn gọn là khoảng cách về độ chính xác là có thật và rộng khoảng ba điểm, còn khoảng cách về mọi thứ khác — giá, giấy phép, khả năng triển khai — lại đi theo hướng ngược lại và lớn hơn.
Thực tế mỗi thứ là gì
StepAudio 3 ASR là một mô hình phiên âm được lưu trữ (hosted) do StepFun phát hành vào ngày 15 tháng 9 năm 2026 như một phần của họ âm thanh StepAudio 3 gồm năm mô hình. Nó được truy cập thông qua một endpoint truyền phát duy nhất, trả về văn bản tăng dần trong quá trình giải mã và bản phiên âm cuối cùng ở phần kết. StepFun mô tả nó là phiên âm có gắn kèm một mô hình ngôn ngữ để bổ sung ngữ cảnh, được tinh chỉnh cho âm thanh y tế, pháp lý, tài chính, ô tô và lập trình, cùng những đầu vào làm khó các bộ nhận dạng thông thường — lời nói thì thầm, nói nhanh, nói liền mạch, hát, và âm thanh có nhạc nền phía dưới. Không có trọng số mở, không có đường triển khai tại chỗ, và không có tùy chọn tự lưu trữ ở bất kỳ gói nào. Mức giá niêm yết được công bố là 2,8 nhân dân tệ mỗi giờ, tương đương khoảng 6,67 đô la Mỹ cho mỗi 1.000 phút theo trục giá của chính bảng xếp hạng.
Whisper Large v3 Turbo là một mô hình trọng số mở do OpenAI phát hành theo giấy phép MIT: 809 triệu tham số, 99 ngôn ngữ, một dẫn xuất đã được cắt tỉa và tinh chỉnh từ Whisper large-v3 với số lớp decoder được giảm bớt. Nó đã được tải xuống hàng triệu lần và được cung cấp thương mại bởi một danh sách dài các nền tảng, đồng thời có thể chạy trên phần cứng của chính bạn. Đặc tính cuối cùng đó chính là toàn bộ phép so sánh, và đó là lý do khoảng cách độ chính xác không phải là con số duy nhất quan trọng.
Bảng duy nhất đo lường cả hai
Chỉ số AA-WER của Artificial Analysis báo cáo tỷ lệ phần trăm các từ bị phiên âm sai, càng thấp càng tốt, và phiên bản 2 của chỉ số này kết hợp ba bộ dữ liệu: AA-AgentTalk chiếm 50%, VoxPopuli-Cleaned-AA chiếm 25%, và Earnings22-Cleaned-AA chiếm 25%. Chế độ xem không truyền trực tuyến hiển thị 36 trong số 71 mô hình mà nó theo dõi. Cả hai mô hình đều xuất hiện trên đó, điều mà hầu hết các so sánh khác không thể khẳng định được.
Đọc như cách hội đồng quản trị liệt kê chúng:
• StepAudio 3 ASR — 1,7% AA-WER, khoảng 6,67 USD cho mỗi 1.000 phút âm thanh
• Whisper Large v3 Turbo, một endpoint được host — 4,6% AA-WER, khoảng 0,67 USD cho mỗi 1.000 phút
• Whisper Large v3 Turbo, một endpoint được host thứ hai — 5,5% AA-WER, khoảng $15.00 mỗi 1.000 phút
• Whisper Large v3, một thế hệ trọng số mở khác — 4,1% trên một endpoint, 10,1% trên một endpoint khác
• StepAudio 2.5 ASR, thế hệ trước của StepFun — 4,7%
Hai dòng cuối cùng là phần mang tính chỉ dẫn nhiều nhất trên bảng, và chúng hoàn toàn không nói về StepFun. Cùng một bộ trọng số Whisper mở đạt 4,1% trên một endpoint và 10,1% trên một endpoint khác. Đó là mức chênh lệch 6 điểm trên cùng các tham số, được tạo ra hoàn toàn bởi những khác biệt trong khâu phục vụ: chiến lược chia đoạn, phần cứng, cấu hình giải mã, và cách mỗi máy chủ xử lý âm thanh dài hơn giới hạn nội bộ của nó. Chú thích của chính bảng cũng nói như vậy, lưu ý rằng với một trong các tập dữ liệu của bảng, một số mô hình có âm thanh bị chia thành khoảng chín phút còn những mô hình khác thành khoảng ba mươi giây, vì giới hạn thời gian.
Điều đó có nghĩa là phép so sánh “StepAudio 3 ASR vs Whisper Large v3 Turbo” thực chất là hai phép so sánh xếp chồng lên nhau. Mô hình đối chiếu với trọng số, và mô hình đối chiếu với bất kỳ endpoint nào mà bạn tình cờ dùng để đo hiệu năng. Phép so sánh thứ hai dao động nhiều hơn phép thứ nhất.

Khoảng cách về độ chính xác đến từ đâu, và nên tin tưởng nó đến mức nào
Ba điểm về tỷ lệ lỗi từ là một khoảng cách lớn trong một lĩnh vực mà năm hệ thống hàng đầu chỉ cách nhau trong vòng 0,6 điểm. Đây cũng là con số duy nhất trong phép so sánh này được một bên thứ ba đo lường, và nó đi kèm với những lưu ý thực sự có thể tác động theo cả hai hướng.
So với StepAudio 3 ASR: con số này là một chỉ số tổng hợp, và thành phần tổng hợp gồm 50% AA-AgentTalk — một tập dữ liệu hội thoại tác nhân. Một mô hình được tinh chỉnh để phiên âm chuyên biệt theo lĩnh vực, có gắn thêm LLM để cung cấp ngữ cảnh, rất phù hợp với dạng âm thanh đó. Nếu điều chỉnh lại trọng số của chỉ số theo hướng giọng đọc hoặc tin tức phát sóng, thứ hạng có thể sít sao hơn. Ngoài ra, vẫn chưa có báo cáo kỹ thuật nào được công bố cho mô hình ASR, chưa có tập kiểm thử nào được phát hành, chưa có cấu hình giải mã và chưa có quy trình tái lập được từ bất kỳ ai ngoài StepFun.
Đối với Whisper Large v3 Turbo: 4,6% là con số của một endpoint được host, không phải thuộc tính của mô hình. Trọng số là cố định và công khai; còn điểm số thì không. Một nhóm chạy cùng bộ trọng số đó một cách cẩn thận, với cách chia đoạn phù hợp với lĩnh vực và cấu hình decoder tốt, có thể đạt kết quả tốt hơn đáng kể so với dòng trên bảng xếp hạng — và một nhóm chạy chúng một cách bất cẩn có thể đạt kết quả tệ hơn 10,1% mà thế hệ trọng số mở khác đã công bố. Tóm tắt trung thực là phía trọng số mở trong so sánh này có một mức sàn bạn có thể đo được và một mức trần bạn phải giành lấy.
Điều còn thiếu là con số có thể phân xử điều đó: cả hai hệ thống, cùng một tập âm thanh, cùng một giao thức giải mã, được công bố. Chưa ai chạy thử, và cho đến khi có ai đó làm vậy, “1.7% vs 4.6%” chỉ là sự so sánh giữa hai phép đo được thực hiện trong những điều kiện khác nhau, chứ không phải là phép đo hai hệ thống đối đầu với nhau.
Bốn khía cạnh còn lại, nơi Whisper thắng nhiều hơn
Độ chính xác là khía cạnh mà StepFun vượt trội. Ở các mục còn lại trong danh sách, mô hình trọng số mở không bám sát được, và đây chính là những mục quyết định liệu một triển khai có khả thi hay không:
• Giấy phép và trọng số — trọng số mở theo giấy phép MIT với 809M tham số so với API được lưu trữ không công bố trọng số ở bất kỳ gói nào.
• Triển khai — tự vận hành, tại chỗ, mạng biệt lập, hoặc thông qua bất kỳ nền tảng thương mại nào trong số hàng chục nền tảng, so với chỉ API của StepFun.
• Mức sàn chi phí — khoảng $0,67 cho mỗi 1.000 phút trên một endpoint được lưu trữ, và còn thấp hơn nữa nếu bạn tự vận hành, so với khoảng $6,67 cho mỗi 1.000 phút theo mức giá công bố của nhà cung cấp.
• Lưu trú dữ liệu — âm thanh không bao giờ rời khỏi hạ tầng do bạn kiểm soát so với âm thanh được gửi đến điểm cuối của bên thứ ba.
• Rủi ro tích hợp — mô hình không thể bị rút lại, định giá lại hoặc ngừng hỗ trợ khi bạn đang dùng, vì bạn nắm giữ trọng số thay vì một mức giá thuê có thể thay đổi theo bảng giá.
• Hành vi với âm thanh dài — việc chia đoạn là quyết định của bạn và có thể được tinh chỉnh theo từng tệp, so với bất cứ điều gì mà endpoint của nhà cung cấp thực hiện nội bộ, vốn không được tài liệu hóa.
Khoảng cách giá đó xấp xỉ mười ăn một so với endpoint Whisper rẻ hơn, và nó là hình ảnh phản chiếu của những gì đã diễn ra bên trong chính dòng sản phẩm StepFun: mô hình mà bản này thay thế, StepAudio 2.5 ASR, từng được niêm yết ở mức 0,15 nhân dân tệ mỗi giờ, còn hạng hiện tại niêm yết ở mức 2,8. StepFun đã tăng giá phiên âm lên khoảng mười chín lần để đổi lấy độ chính xác, điều này đặt nó vào một thị trường khác với một mô hình trọng số mở tự vận hành, chứ không phải một phiên bản đắt hơn của mô hình đó.

Bạn nên chọn cái nào
Sự phân chia này rõ ràng hơn hầu hết các cuộc đối đầu trực tiếp:
• Chọn Whisper Large v3 Turbo nếu âm thanh thông thường, âm lượng cao, dữ liệu không thể rời khỏi hạ tầng của bạn, hoặc bạn cần triển khai lâu dài và giá ổn định. Giấy phép MIT nghĩa là quyết định thuộc về bạn để có thể đảo ngược, và không ai có thể tước đi điều đó.
• Hãy dùng StepAudio 3 ASR nếu âm thanh thực sự khó — có giọng vùng miền, thì thầm, được hát, hoặc có nhạc nền bên dưới — hoặc nếu lĩnh vực đó là một trong năm lĩnh vực mà StepFun đã tinh chỉnh. Đó chính là giá trị mà mức giá cao hơn mang lại, và với loại âm thanh đó, khoảng cách độ chính xác ba điểm chính là sự khác biệt giữa một bản chép lời dùng được và một lượt hiệu chỉnh thủ công.
• Đừng chỉ chọn duy nhất một trong hai, nếu bạn không biết audio của mình thuộc dạng nào. Cái giá của việc chọn sai là bất đối xứng: hướng open-weights có thể được thử nghiệm trên phần cứng của chính bạn với chi phí chỉ bằng một giờ GPU, còn hướng hosted không tốn gì để thử nhưng lại ràng buộc bạn vào một mức giá mà bạn không thể kiểm soát.
Lập luận cho một giải pháp hybrid ở đây mạnh hơn so với hầu hết các so sánh khác, và lý do nằm ở mức chênh lệch endpoint trên bảng xếp hạng. Bởi vì cùng một bộ trọng số Whisper có thể đạt điểm từ 4,1% đến 10,1% tùy thuộc vào ai phục vụ chúng, nước đi thực tế là định tuyến đường open-weights qua nhiều hơn một host thay vì cam kết với một host — đó chính là điều mà failover tự động mang lại, và cũng chính là cơ chế cho phép bạn đặt một mô hình hosted trước một luồng production mà không đặt cược cả luồng vào nó.
Điều này phù hợp với một stack như thế nào, và những gì chúng tôi phục vụ và không phục vụ
Dù bạn chọn gì cho việc phiên âm, bản phiên âm vẫn phải đi đâu đó. Một công cụ tóm tắt, một trích xuất có cấu trúc, một kiểm tra tuân thủ, một chỉ mục tìm kiếm — những lệnh gọi đó đổ vào các mô hình văn bản thông thường, và chúng là phần trong hóa đơn tăng theo mức sử dụng chứ không phải theo số phút âm thanh. Mô hình thời gian thực của chính StepFun quảng cáo khả năng gọi công cụ và thực thi bất đồng bộ các tác vụ dài, nghĩa là ngay cả lớp âm thanh cũng liên tục chuyển việc cho một thứ không phải là mô hình âm thanh.
Để nói rõ về phạm vi, bởi vì rất dễ để ngụ ý điều ngược lại: cả StepAudio 3 ASR lẫn Whisper Large v3 Turbo đều không có trên OrcaRouter. StepAudio được truy cập qua API riêng của StepFun, còn trọng số Whisper là của bạn, để bạn tự chạy hoặc mang lên một nền tảng lưu trữ. Thứ mà OrcaRouter cung cấp là lớp uỷ nhiệm mà bản băng ghi đổ vào — gần 200 mô hình văn bản sau một API duy nhất, với cơ chế tự động chuyển đổi dự phòng để một lời gọi ở hạ nguồn không chết theo một nhà cung cấp duy nhất, một DSL định tuyến cho phép kết hợp nhiều mô hình thành một lời gọi, và hợp nhất mô hình khi phán đoán của một mô hình là chưa đủ. Ở đâu nhà cung cấp công bố một mức giá, giá niêm yết đó được chuyển thẳng qua mà không cộng thêm, nên một thay đổi giá sẽ đến hoá đơn của bạn ngay ngày nó được công bố — và xét rằng so sánh này có một nhà cung cấp đã tăng giá dịch băng ghi của mình lên gấp mười chín lần chỉ trong một bản phát hành, thì đó không phải là một lợi ích giả định.
Nếu bạn sắp chi tiền thật cho câu hỏi về độ chính xác, trình tự tiết kiệm là thế này: trước tiên hãy chạy các trọng số mở trên âm thanh của chính bạn, vì bạn có thể, và vì con số bạn nhận được sẽ liên quan hơn bất kỳ bảng xếp hạng nào. Sau đó quyết định xem khoảng cách còn lại có đáng với mức giá gấp mười lần hay không. Hầu hết các nhóm sẽ thấy rằng nó đáng cho một phần lưu lượng của họ và không đáng cho phần còn lại, và đó là một bài toán định tuyến chứ không phải là lựa chọn mô hình.
Điều gì sẽ giải quyết được nó?
Một thử nghiệm đã được công bố. Cả hai hệ thống, cùng một âm thanh, cùng một giao thức giải mã, một cách phân tách trung thực giữa giọng nói đọc, âm thanh hội thoại và những ca khó mà StepFun tuyên bố đã tinh chỉnh để xử lý. Cho đến khi điều đó tồn tại, sự so sánh chỉ là một chỉ số của bên thứ ba ở một bên và một tập trọng số mở với điểm số có thể thay đổi ở bên kia, và cách duy nhất có trách nhiệm để diễn giải nó là coi nó như một điểm khởi đầu chứ không phải một câu trả lời.

