Thẻ tiêu đề chính cho Granite Speech 5.0 470M TurboCTC, hiển thị biểu tượng dạng sóng giọng nói, một huy hiệu ghi 12,600 RTFx trên 1 H200, các nhãn ghi 470M tham số, Encoder-only CTC và Apache 2.0, một phụ đề 'ASR tiếng Anh của IBM theo Apache-2.0', một chân trang ghi 'Phát hành ngày 25 tháng 8 năm 2026', và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Granite Speech 5.0 470M TurboCTC: ASR Apache-2.0 của IBM tuyên bố đạt 12.600 RTFx

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Granite Speech 5.0 470M TurboCTC là mô hình trong đợt phát hành giọng nói mới của IBM {{1}}mà bạn thực sự được phép đưa vào sản phẩm{{/1}}, và đó là điều đầu tiên cần biết về nó. IBM đã đưa hai checkpoint nhận dạng giọng nói tiếng Anh lên Hugging Face vào ngày 25 tháng 8 năm 2026 — Granite Speech 5.0 470M TurboCTC theo giấy phép Apache 2.0 và Granite Speech 5.0 470M TurboCTC-NC theo giấy phép phi thương mại CC-BY-NC-SA-4.0. Cùng kiến trúc 470 triệu tham số, dữ liệu khác nhau, giấy phép trái ngược. Mô hình Apache là mô hình mà IBM hướng đến cho "các trường hợp sử dụng khác" {{1}}— cách nói của nhà cung cấp để chỉ sản xuất thương mại {{2}}— và đây cũng là mô hình mang con số đáng chú ý: {{/2}}IBM báo cáo tổng thông lượng trên 12.600 RTFx trên một NVIDIA H200, tức là phiên âm được hơn ba tiếng rưỡi âm thanh tiếng Anh mỗi giây {{/1}}khi suy luận theo lô.

Con số tốc độ đó chỉ là một tuyên bố của nhà cung cấp, mới một ngày tuổi và chưa được bên thứ ba nào tái lập, vì vậy hãy xem nó như một con số mạnh trên giấy tờ hơn là một sự thật đã được kiểm chứng. Lý do khiến nó vẫn đáng để bạn chú ý là thiết kế đằng sau: Granite Speech 5.0 TurboCTC loại bỏ bộ giải mã mô hình ngôn ngữ mà mọi mô hình Granite Speech trước đó đều sử dụng, để lại một bộ mã hóa Conformer thuần túy được huấn luyện bằng phân loại thời gian kết nối (CTC) và giải mã phi tự hồi quy. Chính việc không có vòng lặp sinh từng token là cách một mô hình 470 triệu tham số có thể tuyên bố thông lượng vượt qua các mô hình lớn gấp nhiều lần kích thước của nó — và đó là lý do bản phát hành này có ý nghĩa với bất kỳ ai đang xây dựng hệ thống chuyển giọng nói thành văn bản, chứ không chỉ riêng với bảng benchmark.

Những gì thực sự đã được phát hành

Hai checkpoint, cả hai đều được phát hành vào ngày 25 tháng 8 năm 2026 trên tổ chức Hugging Face ibm-granite, đều là ASR chỉ hỗ trợ tiếng Anh với cùng kiến trúc encoder-only:

Granite Speech 5.0 470M TurboCTC — Apache 2.0, được phép sử dụng thương mại, được huấn luyện trên khoảng 60.000 giờ âm thanh tiếng Anh.

• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, chỉ dùng cho nghiên cứu và mục đích phi thương mại, được huấn luyện trên khoảng 75.000 giờ âm thanh tiếng Anh.

Bài viết này nói về mô hình Apache — mô hình mà một sản phẩm có thể phụ thuộc hợp pháp — với bản song sinh -NC được nhắc đến khi câu chuyện cấp phép cần đến. Cả hai checkpoint đều được phân phối dưới dạng safetensors ở định dạng F32 và BF16, và cả hai đều được hỗ trợ sẵn trong Hugging Face Transformers thông qua AutoModelForCTC và AutoProcessor. Tính năng này sẽ có mặt trong bản phát hành Transformers tiếp theo; cho đến lúc đó, bạn cài Transformers từ mã nguồn, tải processor và mô hình, rồi chạy giải mã tham lam (greedy decoding). IBM cũng cung cấp liên kết đến một bản demo phát trực tuyến WebGPU trên trình duyệt, đây là cách nhanh nhất để nghe được độ trễ thực sự thấp đến mức nào.

Ván cược kiến trúc: một bộ mã hóa, không có bộ giải mã, 12,5 token mỗi giây

Thay đổi thiết kế chính là câu chuyện đằng sau tuyên bố về tốc độ. Các bản phát hành Granite Speech trước đây kết hợp một bộ mã hóa âm thanh với một bộ chiếu và một bộ giải mã mô hình ngôn ngữ, và chính bộ giải mã đó đã bị loại bỏ. Granite Speech 5.0 470M TurboCTC là một bộ mã hóa Conformer 16 lớp được huấn luyện bằng CTC, và suy luận chỉ là một lượt tham lam phi tự hồi quy duy nhất. Không có gì để lấy mẫu, nên không có độ trễ tạo sinh nào phải chờ đợi.

Ba chi tiết cấu hình làm cho nó nhanh chứ không chỉ nhỏ gọn:

• Lấy mẫu con theo thời gian với hệ số 8. Phần tiền xử lý chạy ở 100 khung hình mỗi giây; mô hình xuất ra 12,5 token mỗi giây. Việc xếp chồng và bỏ qua các khung log-mel, sau đó là các phép tích chập có bước trượt và các phần dư được gộp trong hai khối Conformer đầu tiên, làm giảm tốc độ đầu ra qua ba giai đoạn 2x.

• Từ vựng subword thay vì ký tự. Các bộ mã hóa Granite Speech trước đây phát ra 50 ký tự mỗi giây; phiên bản 5.0 phát ra 12,5 token subword mỗi giây từ từ vựng BPE gồm 16.384 đơn vị (SentencePiece trong biến thể -NC). Số đơn vị đầu ra trên mỗi giây âm thanh ít hơn đồng nghĩa với việc bộ giải mã CTC có ít quyết định phải đưa ra hơn.

• CTC tự điều kiện hóa. Lớp Conformer ở giữa tinh chỉnh các biểu diễn trung gian của chính mô hình, đây là thủ thuật giúp bộ mã hóa nhỏ duy trì độ chính xác khi bộ giải mã không còn.

Tất cả những điều đó đều nằm trong thẻ mô hình và bản mô tả kỹ thuật của IBM. Tóm lại, đây là một checkpoint được xây dựng cho laptop, điện thoại và các đường ống truyền phát trực tuyến — nơi mà một bộ giải mã tự hồi quy nặng nề sẽ không phù hợp — định vị tại biên được nêu rõ trong chính mô tả của IBM.

Những con số mà IBM đang tuyên bố

Mọi thứ trong phần này đều do IBM báo cáo, được chạy qua bộ công cụ công khai của bảng xếp hạng Open ASR trên hạ tầng Hugging Face tính đến ngày 25 tháng 8 năm 2026, và không được tái tạo độc lập. Hãy coi chúng là số liệu từ nhà cung cấp trông có vẻ đáng tin cậy, chứ không phải sự thật đã được xác nhận:

• Thông lượng — hơn 12.600 RTFx trên một NVIDIA H200 duy nhất với suy luận theo lô, mà IBM diễn giải là hơn 3,5 giờ âm thanh mỗi giây. IBM cũng cho biết thêm rằng con số này gấp hơn 20 lần thông lượng của các mô hình Granite Speech trước đó. Đây là con số đo trên GPU trung tâm dữ liệu với suy luận theo lô, không phải thứ mà một chiếc laptop có thể mang lại.

• Độ chính xác — {{1}}tỷ lệ lỗi từ tổng hợp 5,00%{{/1}} cho {{2}}mô hình Apache{{/2}} trên {{3}}các bộ kiểm tra dạng ngắn tiếng Anh công khai{{/3}} của {{4}}bảng xếp hạng Open ASR{{/4}} ({{5}}biến thể -NC đạt 4,85%{{/5}} trên {{6}}cùng các bộ dữ liệu{{/6}}). {{7}}Quá trình suy luận{{/7}} được chạy qua {{8}}hạ tầng jobs của Hugging Face{{/8}} và được chấm điểm bằng {{9}}công cụ của bảng xếp hạng{{/9}}, vì vậy IBM kỳ vọng các kết quả này sẽ khớp với bảng chính thức sau khi các mô hình mới được tích hợp vào đó.

• Trường xa — trên bảng xếp hạng FFASR về nhiễu và vang, mô hình Apache xếp thứ chín về độ chính xác và mô hình -NC xếp thứ năm, và hai mô hình này là các mục nhanh nhất trên bảng đó (thông lượng được đo trên một NVIDIA L4 duy nhất).

• Đào tạo — khoảng 60.000 giờ âm thanh tiếng Anh công khai cho mô hình Apache, được thực hiện trong mười ngày trên tám NVIDIA H100 tại cụm Blue Vela của IBM.

A generated single-column scoreboard titled 'Granite Speech 5.0 470M TurboCTC — the scoreboard' with rows reading Release Aug 25 2026, License Apache 2.0, Params 470M, Speed 12,600 RTFx (1 H200), WER 5.00% Open ASR, FFASR rank 9 fastest on board, and a footer reading 'IBM-reported as of Aug 25 2026; not yet independently reproduced.'

Apache 2.0 thực sự mang lại cho bạn điều gì

Giấy phép là điểm khiến bản phát hành này trở nên khác biệt. Các mô hình giọng nói trọng số mở thường được phát hành dưới giấy phép nghiên cứu hoặc kèm các nghĩa vụ khiến bộ phận pháp lý của đội sản xuất phải e ngại; ở đây, phiên bản dùng được cho mục đích thương mại lại là phiên bản mà IBM chấm điểm độ chính xác thấp hơn một chút. Bạn đánh đổi 0,15 điểm WER gộp (5,00% so với 4,85%) để có quyền triển khai trong sản phẩm, kiếm tiền từ đầu ra, tinh chỉnh và giữ riêng các trọng số phái sinh của mình, đồng thời sử dụng trong hạ tầng đám mây mà không bị điều khoản chỉ dành cho nghiên cứu cản trở.

Việc đánh đổi đó rất dễ đi sai hướng nếu bạn chạy theo bảng xếp hạng. Con số 4,85% của mô hình -NC đến từ khoảng 15.000 giờ dữ liệu huấn luyện bổ sung (GigaSpeech và SPGI Speech), và đây là phiên bản mà IBM gọi thẳng là “chỉ dành cho mục đích nghiên cứu và phi thương mại”. Nó là một mô hình benchmark tốt nhưng lại là một sự phụ thuộc tồi cho sản phẩm. Mô hình Apache mất đi một chút độ chính xác nhưng có được khả năng làm nền tảng cho một pipeline phiên âm thương mại, hệ thống QA của trung tâm chăm sóc khách hàng, hoặc thiết bị biên. Nếu bạn đang đánh giá dòng sản phẩm này, quyết định về giấy phép cần được đưa ra trước quyết định về benchmark.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 license tag, the automatic-speech-recognition and English pipeline tags, a model card summary describing a compact 470 million parameter English ASR model trained on approximately 60,000 hours of English audio using CTC with non-autoregressive greedy decoding, and an Open ASR leaderboard evaluation line dated August 25 2026.

Những gì bạn từ bỏ

Việc loại bỏ mô hình ngôn ngữ không phải là không có cái giá phải trả, và model card trung thực về những cắt giảm:

• Không có tính năng dịch giọng nói. Các thế hệ Granite Speech trước đây có thể chuyển qua mô hình ngôn ngữ để dịch trong khi phiên âm; phiên bản 5.0 chỉ phiên âm.

• Không có thiên vị từ khóa. LM cũng xử lý việc thiên vị đối với các thuật ngữ và tên trong lĩnh vực; khi điều này không còn, bạn sẽ nhận được bất cứ thứ gì mà từ vựng subword tạo ra một cách tự nhiên.

• Chỉ có tiếng Anh. Không có điểm kiểm tra đa ngôn ngữ trong bản phát hành này và không có dấu hiệu nào cho thấy sẽ có trong thời gian tới.

• Mức WER 5,00% là con số cho dạng ngắn, âm thanh sạch. Kết quả FFASR (thứ chín, trên giọng nói nhiễu ở trường xa) là chỉ báo thực tế hơn cho việc sử dụng trong phòng họp và rảnh tay, và nó là thứ hạng, không phải con số nổi bật.

Đối với một công việc phiên âm chuyên biệt — âm thanh cuộc gọi, cuộc họp, ghi chú thoại, phụ đề, đọc chính tả — không có yếu tố nào trong số này là rào cản. Chúng trở nên quan trọng nếu bạn hy vọng một mô hình nhỏ cũng có thể dịch, hoặc sẽ phiên âm một cách đáng tin cậy một từ vựng tùy chỉnh ngay khi sử dụng.

Cách chạy nó hôm nay

Bạn không cần một cloud API chưa tồn tại. Mô hình chạy cục bộ:

• Cài đặt Transformers từ mã nguồn (bộ tính năng CTC chưa có trong bản phát hành mới nhất), sau đó dùng AutoModelForCTC cùng AutoProcessor và giải mã tham lam — quy trình chuẩn. Bộ xử lý có thể tính toán các đặc trưng log-mel ngay trên thiết bị của mô hình, giúp tiết kiệm một lần sao chép từ host sang thiết bị.

• Ví dụ về thẻ mô hình chỉ là một đoạn mã hai dòng thông qua pipeline: automatic-speech-recognition với mô hình "ibm-granite/granite-speech-5.0-470m-turboctc".

• Một bản demo truyền phát WebGPU chạy trong tab trình duyệt và là cách nhanh nhất để đánh giá độ trễ trước khi bạn dành cả buổi chiều cho một khung đo điểm chuẩn.

• Đối với sản xuất, câu hỏi thực tế là việc phục vụ mô hình. {{1}}Các mô hình ASR nguồn mở thuộc nhóm này thường được chạy trên CPU hoặc một GPU nhỏ với kiểu suy luận trực tuyến theo lô{{/1}} — {{2}}con số 12.600 RTFx nổi bật là số liệu batch H200{{/2}}; con số thực tế cho một luồng đơn trên laptop sẽ thấp hơn nhiều, và IBM chưa công bố số liệu về thời gian đến token đầu tiên.

Lớp phục vụ đó chính là nơi tập trung chi phí và độ phức tạp thực sự của ASR mã nguồn mở, và cũng là nơi một nền tảng định tuyến chứng tỏ giá trị của mình. Mô hình của OrcaRouter là một API duy nhất bao phủ hơn 200 mô hình, với giá niêm yết của nhà cung cấp được truyền thẳng qua với mức phụ giá 0% — nên khi một nhà cung cấp hạ giá, mức hạ đó có hiệu lực ngay trong ngày — cùng với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và một DSL định tuyến để kết hợp nhiều mô hình thành một lệnh gọi duy nhất. Không điều nào trong số đó áp dụng cụ thể cho Granite Speech 5.0 470M TurboCTC, vì cả hai biến thể đều chưa có trên OrcaRouter: trọng số mới ra đời một ngày và chưa có nhà cung cấp thương mại nào đang phục vụ chúng. Khi một mô hình giọng nói mã nguồn mở như thế này có được đường dẫn lưu trữ — hoặc khi bạn so sánh nó với các API ASR lưu trữ đã có sẵn — thì một lớp định tuyến chính là cách để bạn dùng thử và chuyển đổi dự phòng mà không cần viết lại phần tích hợp, và cơ chế định giá truyền thẳng chính là thứ giữ cho sự so sánh được trung thực.

Điều gì vẫn chưa được xác nhận?

Một mô hình mới một ngày tuổi có dấu vết tài liệu ngắn ngủi, và thật đáng để liệt kê chính xác những gì chưa được biết:

• Không có điểm chuẩn của bên thứ ba. Các chỉ số 12.600 RTFx, WER 5,00%, và xếp hạng FFASR đều là kết quả do chính IBM chạy qua hệ thống bảng xếp hạng công khai. Không có bên độc lập nào công bố số liệu.

• Không có API do IBM lưu trữ. Không có trang mô hình watsonx, không có endpoint được quản lý, không có giá cả và không có ngày ra mắt cho bất kỳ điều nào trong số đó.

• Không có số liệu về độ trễ phát trực tuyến. Hỗ trợ phát trực tuyến và bản demo WebGPU là có; nhưng số liệu về thời gian đến token đầu tiên và độ trễ từng khối thì không.

• Chưa có so sánh cùng khung kiểm thử nào với các mô hình ASR mã nguồn mở nhanh khác. Các cuộc đối đầu quan trọng — với Whisper large-v3, NVIDIA Parakeet TDT 0.6B, và các API phiên âm lưu trữ — vẫn chưa được ai chạy trên cùng một tập dữ liệu.

Xem gì tiếp theo

Các tín hiệu ngắn hạn là các bản tái lập độc lập. Bảng xếp hạng Open ASR được công khai, bộ harness là chuẩn, và các trọng số nằm trên Hugging Face, nên một lần chạy của bên thứ ba sẽ xuất hiện trong vài ngày tới — hãy theo dõi xem {{1}}5.00%{{/1}} có giữ vững không và liệu {{2}}12,600 RTFx{{/2}} có sống sót trên một chiếc {{3}}H200{{/3}} đơn lẻ bên ngoài môi trường batch của IBM hay không. Điều cần theo dõi tiếp theo là liệu IBM có biến bản song sinh Apache thành một dịch vụ được quản lý hay không, vì một endpoint watsonx sẽ ngay lập tức đưa sản phẩm này trở thành mô hình ASR mở có hướng thương mại hóa đáng tin cậy nhất. Granite Speech 5.0 470M TurboCTC, ngay từ ngày đầu, là một giải pháp ASR tiếng Anh thực sự nhanh, có giấy phép thực sự cởi mở, và một dấu vết xác minh thực sự mỏng. Hai điều đầu tiên là có thật; điều thứ ba chỉ là vấn đề thời gian.

A generated infographic titled '3.5 hours of audio in 1 second' showing an H200 GPU card, an audio stack and a finished transcript connected by arrows, with tags reading over 12,600 RTFx, batched inference, Apache 2.0, and IBM-reported Aug 25 2026, and the OrcaRouter logo in the bottom-right corner.
© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube