Một thẻ tiêu đề hero được tạo với tiêu đề chính 'StepAudio 3 ASR vs StepAudio 3' và phụ đề 'Một cái là một mô hình. Cái còn lại là năm sản phẩm với cùng một tên', phía trên chân trang 'Số liệu StepFun như công bố tháng 9 năm 2026.'
Guides & Insights

StepAudio 3 ASR so với StepAudio 3: Không có mô hình nào mang tên đó

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tìm kiếm StepAudio 3 và bạn sẽ thấy một dòng sản phẩm, chứ không phải một mô hình. Bản phát hành âm thanh ngày 15 tháng 9 năm 2026 của StepFun đã đưa năm sản phẩm vào dưới tên đó — Realtime, ASR, chuyển văn bản thành giọng nói, Gen và Music — và sản phẩm phiên âm trong số đó, StepAudio 3 ASR, là sản phẩm đã không ngừng leo bảng xếp hạng kể từ đó. Phiên bản mà tài liệu của chính StepFun gọi là mô hình ASR lớn nhất của họ tính đến nay là StepAudio 3 ASR Max, và người anh em hội thoại dùng chung backbone với nó là StepAudio 3 Realtime. Nếu bạn đang cố so sánh “StepAudio 3 ASR” với “StepAudio 3”, thì bạn đang so sánh một sản phẩm với một dòng sản phẩm, và câu trả lời hoàn toàn phụ thuộc vào việc bạn thực sự muốn nói đến sản phẩm nào trong ba sản phẩm đó.

Trang này giải quyết điều đó. Đây không phải là một so sánh mang tính tiếp thị — mà là sự phân định rõ ràng bạn cần trước khi có thể đọc chính xác bất kỳ bảng thông số kỹ thuật StepAudio 3 nào, bởi vì ba cái tên ở trên mang mức giá khác nhau, các endpoint khác nhau và những kiểu lỗi khác nhau.

Tại sao cái tên lại mơ hồ?

StepFun tung ra toàn bộ ngăn xếp âm thanh trong một ngày, và quy ước đặt tên biến tên dòng sản phẩm thành gốc của mọi tên sản phẩm. Điều đó thì gọn gàng trên slide ra mắt và awkward ở mọi nơi khác. Nghĩa là tìm kiếm tên dòng sản phẩm sẽ trả về hỗn hợp năm sản phẩm khác nhau, và một hàng benchmark được dán nhãn "StepAudio 3" có thể hoàn toàn là bất kỳ sản phẩm nào trong số đó.

Hệ quả thực tế là bạn không thể biết từ một tiêu đề rằng thứ gì đã được đo lường. Một bài đăng nói rằng "StepAudio 3 đứng đầu bảng xếp hạng phiên âm" đang mô tả StepAudio 3 ASR. Một bài đăng nói rằng "StepAudio 3 thắng về động lực hội thoại" đang mô tả StepAudio 3 Realtime. Cả hai đều đúng, chúng là những sản phẩm khác nhau, và chúng không thể thay thế cho nhau.

Có một điểm mơ hồ thứ hai nằm cụ thể bên trong dòng ASR. Tài liệu của StepFun gọi hạng ASR Max là mô hình ASR lớn nhất của hãng tính đến nay, với mức giá riêng và endpoint riêng, trong khi các dòng trên bảng xếp hạng công khai lại mang nhãn đơn giản hơn. Xác định xem đó là một SKU dưới hai tên hay hai SKU là điều hữu ích nhất mà trang này có thể làm, và phần tiếp theo sẽ thực hiện điều đó.

Ba điều mà cái tên có thể có nghĩa

StepAudio 3 ASR — sản phẩm phiên âm. Một endpoint streaming trả về văn bản tăng dần khi giải mã và bản phiên âm cuối cùng ở phần kết. StepFun mô tả nó là phiên âm với một mô hình ngôn ngữ gắn kèm để cung cấp ngữ cảnh, được tinh chỉnh cho âm thanh y tế, pháp lý, tài chính, ô tô và lập trình, cũng như cho các đầu vào khó như giọng nói thì thầm, giọng nói nhanh, lời nói liền mạch, ca hát và nhạc nền. Đây là mô hình đạt tỷ lệ lỗi từ 1,7% trên chỉ số AA-WER của Artificial Analysis cho chuyển giọng nói thành văn bản không streaming.

StepAudio 3 ASR Max — phiên bản mà tài liệu của StepFun gọi là mô hình ASR lớn nhất của hãng tính đến nay. Nó có mức giá niêm yết là 2,8 nhân dân tệ mỗi giờ. Đây không phải là một công cụ phiên âm rẻ hơn; nó là đỉnh cao của dòng ASR.

StepAudio 3 Realtime — mô hình hội thoại song công toàn phần. Nó suy luận trực tiếp trên giọng nói thay vì chạy theo chuỗi phiên âm-rồi-suy luận, và nhờ đó việc phiên âm chỉ là sản phẩm phụ. Đây không phải là một sản phẩm ASR, và độ chính xác của nó trên các tác vụ phiên âm không phải là thứ nó được tinh chỉnh để làm.

Mọi thứ khác trong nhóm — TTS, Gen, Music — hoàn toàn là một công việc khác và không nên xuất hiện trong bất kỳ so sánh phiên âm nào.

ASR và ASR Max có phải là cùng một mô hình không?

Bằng chứng cho thấy là có, và phép kiểm tra là số học. StepFun niêm yết gói ASR Max ở mức 2,8 nhân dân tệ mỗi giờ. Quy đổi theo tỷ giá khoảng 7,1 nhân dân tệ một đô la, tức khoảng 0,39 đô la mỗi giờ, hay khoảng 6,6 đô la cho mỗi 1.000 phút. Artificial Analysis niêm yết mô hình trên bảng xếp hạng của mình ở mức 6,67 đô la cho mỗi 1.000 phút. Hai con số được công bố độc lập, một từ bảng giá của nhà cung cấp và một từ bảng xếp hạng của bên thứ ba, chênh lệch nhau trong vòng một xu. Đó là điều bạn sẽ kỳ vọng nếu hàng trên bảng xếp hạng và mức giá niêm yết ASR Max mô tả cùng một SKU.

Cần phải chính xác về những gì điều đó chứng minh và không chứng minh. Nó chứng minh trục giá của bảng xếp hạng và bảng giá của nhà cung cấp đang mô tả cùng một sản phẩm ở cùng một mức giá. Nó không chứng minh rằng 1,7% của bảng xếp hạng được đo trên đúng endpoint mà bạn sẽ gọi, vì bảng xếp hạng không công bố cấu hình giải mã hay endpoint mà nó đã truy cập. Vậy: cùng một sản phẩm, rất có thể; cùng điều kiện đo lường, chưa được xác minh.

Điều chắc chắn là bước nhảy thế hệ bên trong dòng sản phẩm. StepAudio 2.5 ASR đạt 4,7% trên cùng bảng xếp hạng với 0,15 nhân dân tệ mỗi giờ. Mức hiện tại là 1,7% với 2,8 nhân dân tệ mỗi giờ. Đó là mức giảm 64% tỷ lệ lỗi từ để đổi lấy mức giá cao hơn khoảng mười chín lần — sự đánh đổi rõ rệt nhất trong dòng sản phẩm và là điều quyết định liệu việc nâng cấp có đáng giá hay không.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

Những kích thước thực sự khác biệt

Khi việc đặt tên đã ngã ngũ, so sánh thu gọn lại thành một danh sách ngắn. Đây là những điểm có thể thay đổi quyết định:

• Độ chính xác — StepAudio 3 ASR đạt 1,7% AA-WER ở chế độ không streaming so với StepAudio 2.5 ASR đạt 4,7% trên cùng một bảng đánh giá. Do Artificial Analysis đo lường, không phải do StepFun.

• Giá — 2,8 nhân dân tệ mỗi giờ so với 0,15 nhân dân tệ mỗi giờ. Cả hai đều là giá niêm yết của nhà cung cấp, cả hai đều hiện hành. Khoảng 19 lần.

• Trọng số — chỉ có API được lưu trữ cho cả hai. Không có trọng số mở ở bất kỳ đâu trong dòng sản phẩm, không có lộ trình triển khai tại chỗ, không có tùy chọn tự lưu trữ ở bất kỳ cấp nào.

• Hình dạng endpoint — một endpoint phiên âm streaming duy nhất trả về văn bản tăng dần và văn bản cuối cùng, so với cùng hình dạng đó ở thế hệ trước. Không có gì thay đổi về mô hình tích hợp, nên việc di chuyển chỉ là hoán đổi mã định danh mô hình chứ không phải viết lại.

• Tinh chỉnh cho âm thanh khó — StepAudio 3 ASR được tinh chỉnh dành riêng cho giọng thì thầm, nói nhanh, nói liền mạch và giọng hát, cùng với âm thanh có nhạc nền bên dưới. Việc tinh chỉnh đó chính là sản phẩm; thế hệ trước không được xây dựng cho mục đích này.

• Cải thiện theo lĩnh vực do nhà cung cấp công bố — StepFun báo cáo tiếng Trung giảm 9,3%, tiếng Anh giảm 25,0%, phương ngữ giảm 22,3%, các ngành dọc giảm 42,1% và chuyển mã giảm 27,9% so với thế hệ trước. Do nhà cung cấp báo cáo và chưa được tái lập, nên hãy coi chúng chỉ mang tính định hướng.

Đáng chú ý là những mục không có trong danh sách đó: độ dài ngữ cảnh, hỗ trợ định dạng âm thanh, thời lượng âm thanh tối đa và mã định danh mô hình. Tài liệu công khai của StepFun cho mô hình này không nêu những thông tin đó, và bất kỳ ai trích dẫn những con số ấy đều đang trích dẫn thứ gì đó khác.

ASR vs Realtime mới là so sánh mà mọi người thực sự cần

Nếu bạn đang cân nhắc giữa các sản phẩm phiên âm chứ không phải giữa các thế hệ, thì cặp đối đầu đáng chú ý không phải là ASR với ASR Max — mà là ASR với Realtime. Tài liệu kỹ thuật của chính StepFun cho biết hai mô hình này dùng chung các giai đoạn tiền huấn luyện và trung huấn luyện, và chỉ khác nhau trong quá trình tinh chỉnh có giám sát. Cùng một nền tảng, khác bước tinh chỉnh, khác sản phẩm.

Riêng sự thật đó có một cách hiểu thực tiễn. Tỷ lệ lỗi từ 1,7% là một thuộc tính của bản tinh chỉnh ASR. Đó không phải là một lời hứa về mô hình realtime, vốn tối ưu cho việc luân phiên lượt nói, xử lý ngắt lời và suy luận trên lời nói thay vì độ chính xác của bản ghi. Nếu kiến trúc của bạn phiên âm như một tác dụng phụ của một cuộc trò chuyện trực tiếp, bạn không mua 1,7% — bạn đang mua một mô hình hội thoại mà tình cờ phát ra văn bản.

Điều ngược lại cũng đúng và ít rõ ràng hơn: vì chúng dùng chung một backbone, mô hình ASR không phải là một mô hình chuyên biệt nhỏ được gắn thêm vào dòng sản phẩm. Nó là một hệ thống cùng quy mô, chỉ được tinh chỉnh theo cách khác. Đó là lý do mức giá ASR nằm gần với phần còn lại của dòng sản phẩm thay vì ở gần phân khúc giá rẻ của thị trường.

Làm gì với cái này nếu bạn đang chọn một cái

Ba câu hỏi sẽ giải quyết được điều đó. Bạn cần bản chép lời, hay bạn cần một cuộc trò chuyện? Nếu là bản chép lời, StepAudio 3 ASR chính là sản phẩm và tên dòng sản phẩm chỉ là nhiễu. Nếu là một cuộc trò chuyện, bạn muốn StepAudio 3 Realtime và bạn hoàn toàn không nên đọc các chỉ số đánh giá ASR. Và nếu bạn cần bản chép lời của đoạn âm thanh thực sự khó — có giọng địa phương, thì thầm, hát, hoặc có nhạc phía dưới — thì mức phụ phí gấp 19 lần là cái giá của hạng dịch vụ được tinh chỉnh cho việc đó, và bài kiểm tra trung thực là âm thanh của chính bạn chứ không phải một chỉ số tổng hợp.

Quyết định dễ bị đưa ra sai là coi lớp chuyển ngữ là thứ vĩnh viễn. Dù bạn chọn gì, bản chuyển ngữ cũng là đầu vào cho một thứ khác — một công cụ tóm tắt, một phép trích xuất có cấu trúc, một kiểm tra tuân thủ, một chỉ mục tìm kiếm — và những lệnh gọi đó đều chạy trên các mô hình văn bản thông thường. Đó là lớp mở rộng theo mức sử dụng chứ không phải theo số phút âm thanh, và đó là lớp đáng được giữ khả năng di động ngay từ đầu. OrcaRouter đưa gần 200 mô hình văn bản vào sau một API duy nhất với tính năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến cho phép kết hợp nhiều mô hình thành một lệnh gọi duy nhất, và tính năng hợp nhất mô hình khi phán đoán của một mô hình là chưa đủ. Ở những nơi nhà cung cấp công bố mức giá, giá niêm yết đó được chuyển tiếp nguyên vẹn không thêm phí, nên mọi thay đổi giá ở phía văn bản sẽ đến hóa đơn của bạn ngay ngày nó được công bố.

Nói rõ về phạm vi, vì trang này nói về một dòng mô hình mà chúng tôi không phục vụ: không có endpoint StepAudio 3 nào trên OrcaRouter. Các mô hình phiên âm và giọng nói được truy cập qua API riêng của StepFun. Thứ mà OrcaRouter cung cấp là lớp suy luận nằm sau bản phiên âm, nơi mà quyết định chuyển đổi vừa rẻ để đưa ra vừa đắt nếu trì hoãn.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

Điều mà chưa ai giải quyết được

Việc đặt tên thì có thể giải quyết được. Còn tuyên bố về hiệu năng thì vẫn chưa. Vẫn chưa có báo cáo kỹ thuật nào được công bố cho mô hình ASR, chưa có bộ kiểm thử nào được phát hành, chưa có cấu hình giải mã và chưa có quy trình có thể tái lập từ bất kỳ ai bên ngoài StepFun, và các so sánh của chính nhà cung cấp là với các sản phẩm ASR Trung Quốc khác thay vì với mô hình trọng số mở đang chiếm ưu thế. Con số 1,7% là một phép đo thực tế của bên thứ ba trên một chỉ số hỗn hợp gồm ba bộ dữ liệu; mọi thứ khác về mô hình này đều là tuyên bố của nhà cung cấp.

Hai điều sẽ thay đổi cục diện. Một cuộc đối đầu trực tiếp với Whisper Large v3 Turbo trên cùng một đoạn âm thanh, điều mà chưa ai công bố. Và một mức giá cho phần còn lại của dòng sản phẩm — bốn trong năm mô hình StepAudio 3 vẫn đang ở mức giá dùng thử miễn phí có thời hạn khi ra mắt, và chỉ có phiên âm và tổng hợp giọng nói có mức giá được công bố, nghĩa là bảng giá bạn có thể xem hôm nay chỉ bao gồm hai trong số năm sản phẩm.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

Đó là lớp mở rộng theo mức sử dụng chứ không theo số phút âm thanh, và đây chính là lớp đáng để giữ khả năng di động ngay từ đầu. tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến cho phép kết hợp nhiều thứ thành một lệnh gọi duy nhất, và hợp nhất mô hình khi phán đoán của một mô hình là chưa đủ.