Thẻ hero của bài viết hiển thị 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC' với huy hiệu 'SO SÁNH MÔ HÌNH' và phụ đề 'thông lượng so với độ trễ', cùng các chip ghi 12,600 RTFx, 2.7% streaming WER, 470M params và $0.20 mỗi giờ streaming, trên nền gradient từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Grok Voice Transcribe 2.0 so với Granite Speech 5.0 470M TurboCTC: 12.600× thời gian thực đạt mốc nửa giây

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Granite Speech 5.0 470M TurboCTC phiên âm khoảng 3,5 giờ âm thanh mỗi giây trên một H200 duy nhất, còn Grok Voice Transcribe 2.0 trả về bản phiên âm một phần đầu tiên 0,49 giây sau khi bạn ngừng nói. Hai con số đó thường được đặt cạnh nhau trong các bài so sánh như thể chúng là cùng một loại phép đo, nhưng chúng không hề là cùng một loại phép đo — một là con số thông lượng theo lô của trung tâm dữ liệu không gắn với độ trễ, còn cái kia là con số độ trễ của một mô hình mà chưa ai công bố thông lượng. IBM phát hành Granite Speech 5.0 470M TurboCTC vào ngày 25 tháng 8 năm 2026 theo Apache 2.0, loại bỏ hoàn toàn bộ giải mã của mô hình ngôn ngữ và giải mã bằng một lượt CTC phi tự hồi quy duy nhất. SpaceXAI ra mắt Grok Voice Transcribe 2.0 vào ngày 18 tháng 9 năm 2026 dưới dạng API được quản lý với giá $0,10 mỗi giờ âm thanh cho batch và $0,20 mỗi giờ cho streaming. Cả hai đều là những mô hình phiên âm xuất sắc giải quyết hai nửa đối lập của cùng một vấn đề, và việc chọn giữa chúng trở nên dễ hơn khi bạn ngừng so sánh trực tiếp các con số.

12,600× thời gian thực, và những từ bổ nghĩa cho nó

Con số của Granite là 12.600 RTFx, được đo trên một NVIDIA H200 duy nhất với suy luận theo lô — con số của IBM, được công bố khi ra mắt và chưa từng được tái lập độc lập kể từ đó. RTFx là tỷ lệ giữa thời lượng âm thanh và thời gian xử lý, nên 12.600 nghĩa là khoảng 3,5 giờ âm thanh cho mỗi giây đồng hồ thực. Cách diễn đạt của chính IBM là con số này cao hơn 20 lần thông lượng của các bản phát hành Granite Speech trước đó, và đây mới là điều thực sự đáng bàn ở đây: tốc độ tăng lên nhờ cắt bỏ bớt công việc, chứ không phải nhờ bổ sung phần cứng.

Điều nó không phải là một con số độ trễ. Một tác vụ theo lô xử lý xong 3,5 giờ âm thanh mỗi giây vẫn có thể mất nhiều thời gian để trả về token đầu tiên của bất kỳ tệp riêng lẻ nào, tùy thuộc vào cách lô được tập hợp và bạn nạp bao nhiêu âm thanh vào nó trước khi nó bắt đầu. IBM không công bố bất kỳ số liệu độ trễ nào cho TurboCTC. Trên bảng xếp hạng far-field, hai checkpoint là hai mục nhanh nhất, nhưng thông lượng ở đó được đo trên một NVIDIA L4 duy nhất, vốn là một bộ tăng tốc gần kề trung tâm dữ liệu chứ không phải điện thoại.

Lý do điều này quan trọng là mô hình được định vị rõ ràng cho máy tính xách tay, điện thoại và thiết bị biên — theo cách định khung của chính IBM — và chưa ai công bố hiệu năng đơn luồng trên bất kỳ thiết bị nào trong số đó. Cho đến khi có ai đó làm điều đó, hãy coi “12,600×” là một tuyên bố về việc bạn có thể xử lý một đợt chạy bù trên GPU thuê rẻ đến mức nào, một khẳng định thực sự có giá trị và được chứng minh vững chắc, chứ không phải là tuyên bố về việc một người dùng nhận lại một câu nhanh đến mức nào.

Những gì IBM đã loại bỏ, và cái giá mà bạn phải trả

TurboCTC là một thiết kế chỉ có bộ mã hóa: một bộ mã hóa âm thanh Conformer 16 lớp được huấn luyện bằng CTC, được giải mã tham lam trong một lượt không tự hồi quy, với lớp đầu ra subword gồm 16.384 đơn vị. Không có mô hình ngôn ngữ nào trong vòng lặp. Đó là nguồn gốc của tốc độ và cũng là nguồn gốc của những cắt giảm về khả năng, và chúng không hề nhỏ. So với các mô hình Granite Speech trước đó, TurboCTC loại bỏ dịch giọng nói, loại bỏ thiên lệch từ khóa, và không đi kèm dấu thời gian hay công cụ dấu câu.

Đặt điều đó bên cạnh những gì mô hình được quản lý bao gồm ở mức giá niêm yết của nó, và hình dạng của giao dịch trở nên cụ thể:

• Ưu tiên thuật ngữ khóa — Granite Speech 5.0 470M TurboCTC không có, so với tối đa 100 thuật ngữ khóa mỗi yêu cầu trên Grok Voice Transcribe 2.0

• Dấu thời gian ở cấp độ từ — không đi kèm với TurboCTC so với được bao gồm cùng điểm tin cậy

• Dịch giọng nói — có trong các mô hình Granite Speech trước đó, bị loại bỏ ở đây so với không được cung cấp theo cả hai cách

• Phạm vi ngôn ngữ — chỉ tiếng Anh so với tự động phát hiện trên một tập đầu vào đa ngôn ngữ rộng khắp với hỗ trợ định dạng bằng 25 ngôn ngữ

• Diarization — một vấn đề riêng mà bạn tự giải quyết so với việc được bao gồm trong giá của yêu cầu

• Kênh — một luồng mỗi lượt xử lý so với tối đa tám kênh âm thanh trong một yêu cầu

• Chuẩn hóa văn bản — không có so với chuẩn hóa văn bản nghịch đảo, chuyển ngày tháng, tiền tệ và số điện thoại dạng nói thành dạng viết

• Triển khai — trọng số bạn tải xuống và chạy so với một endpoint được quản lý ở us-east-1

Hãy đọc danh sách đó như một bản mô tả hai sản phẩm khác nhau, chứ không phải một bảng điểm. Việc loại bỏ phân tách người nói, thiên lệch và chuẩn hóa chính là thứ đã đánh đổi để có được thông lượng. Một đợt backfill theo lô 40.000 bản ghi cuộc gọi vào chỉ mục tìm kiếm không cần dấu thời gian hay lượt nói — nó cần rẻ và cần hoàn thành — và với công việc đó, những tính năng bị thiếu không phải là thiếu, mà là trọng lượng đã bị gỡ bỏ.

Điều ngược lại đúng với bất kỳ thứ gì trực tiếp. Nếu bạn đang xây dựng một tác nhân thoại, danh sách thuật ngữ khóa là cách để "Kubernetes", "Granola" và tên khách hàng được viết đúng chính tả, và một trình phiên âm không có cơ chế định hướng sẽ luôn ghi sai chúng, không có cách nào khắc phục ngoài việc tinh chỉnh, vốn là một dự án khác với một ngân sách khác. Tính năng còn thiếu duy nhất đó khiến TurboCTC không phù hợp với một số khối lượng công việc và không liên quan đến những khối lượng công việc khác, đó là lý do tại sao so sánh mô hình ít hữu ích hơn so sánh khối lượng công việc.

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

Việc so sánh độ chính xác không thể được thực hiện một cách rạch ròi

IBM báo cáo tỷ lệ lỗi từ tổng hợp là 5,00% cho checkpoint Apache 2.0 và 4,85% cho phiên bản anh em phi thương mại trên Open ASR Leaderboard, trên các bộ dạng ngắn tiếng Anh công khai. Đó là các con số batch trên một bảng xếp hạng mà các đánh giá bao gồm AMI và Earnings22 cùng các bộ hội thoại dạng dài, và chúng do nhà cung cấp báo cáo — đã chạy qua công cụ của bảng xếp hạng nhưng chưa được đưa vào bảng chính thức, bảng này cũng bao gồm các bộ kiểm thử riêng tư. Phân tích chi tiết theo từng bộ được công bố trên thẻ mô hình đáng để đọc, vì mức trung bình che giấu nhiều thứ: LS Clean 1,42%, LS Other 2,66%, SPGISpeech 3,18%, Voxpopuli-Cleaned-AA 4,88%, Earnings22-Cleaned-AA-chunked 6,69%, AMI-Cleaned 7,52% và Gigaspeech-Cleaned 8,67%, trung bình đúng 5,00%. Cùng thẻ đó dẫn mức RTFx trung bình là 13.042,98 đo trên một H200 — cao hơn con số 12.600 mà bài đăng ra mắt của IBM sử dụng, và cả hai con số đều là của công ty, từ cùng một tuần, trên cùng một phần cứng.

Con số 2,7% cho bản chép lời cuối cùng của Grok Voice Transcribe 2.0 không phải là một phép đo có thể so sánh được. Nó đến từ bảng AA-WER Streaming của Artificial Analysis, một tổ hợp có trọng số gồm AA-AgentTalk chiếm 50%, VoxPopuli chiếm 25% và Earnings22 chiếm 25% — khoảng tám giờ âm thanh hội thoại tiếng Anh có trọng số theo tác nhân, được đo qua một giao diện streaming. Các bộ dữ liệu khác nhau, cách đánh trọng số khác nhau, chế độ hoạt động khác nhau. Đặt 2,7% bên cạnh 5,00% và kết luận rằng mô hình được quản lý chính xác gần gấp đôi là sai lầm phổ biến nhất có thể mắc phải trong phép so sánh này.

Điều có thể nói một cách trung thực thì hẹp hơn và vẫn hữu ích. Cả hai mô hình đều mạnh trên loại âm thanh mà mỗi mô hình được đo. Grok Voice Transcribe 2.0 dẫn đầu một bảng xếp hạng streaming do bên độc lập vận hành mà các mô hình khác cũng được đo trên đó, khiến thứ hạng của nó có thể kiểm chứng ngay cả khi giá trị chính xác của nó không thể mang sang bối cảnh khác. Granite Speech 5.0 470M TurboCTC có WER tổng hợp trên các bộ ASR mở tiêu chuẩn và, một cách tách biệt, một kết quả far-field trong đó checkpoint phi thương mại xếp thứ năm về độ chính xác còn bản Apache xếp thứ chín — được đo trên giọng nói nhiễu và vang, điều kiện khó nhất trong bộ và có thể nói là điều trung thực nhất trong số liệu của cả hai mô hình.

Nếu âm thanh của bạn là giọng đọc tiếng Anh sạch, khoảng cách độ chính xác giữa hai mô hình này có thể sẽ nhỏ hơn so với điều mà vị trí trên bảng xếp hạng gợi ý. Nếu đó là âm thanh nhiễu, mang giọng vùng miền, qua điện thoại hoặc không phải tiếng Anh, thì cả hai bảng xếp hạng đều không cho bạn biết nhiều, và bộ kiểm thử của riêng bạn mới là công cụ duy nhất làm được điều đó.

Tạ tự do đối lại 1,67 đô la một giờ

So sánh chi phí là chỗ duy nhất thực sự dễ phân biệt hai mô hình này, và con số mà người ta thường viện dẫn lại sai theo cả hai hướng.

• Phiên âm hàng loạt — Grok Voice Transcribe 2.0 với $0.10 mỗi giờ âm thanh, hoặc khoảng $1.67 mỗi 1.000 phút so với Granite Speech 5.0 470M TurboCTC không tốn chi phí giấy phép, cộng thêm thời gian GPU

• Phát trực tuyến — 0,20 USD mỗi giờ âm thanh, khoảng 3,33 USD mỗi 1.000 phút, so với việc IBM không công bố phương án phát trực tuyến có máy chủ lưu trữ nào

• Giấy phép — một API thương mại không kèm trọng số so với Apache 2.0 cho checkpoint chính và CC-BY-NC-SA-4.0 cho phiên bản phi thương mại chính xác hơn

"Miễn phí" đang gánh vác rất nhiều thứ ở hàng đầu tiên đó. Một mô hình chỉ có encoder 470M đủ nhỏ để chạy trên phần cứng khiêm tốn — đó chính là mục tiêu của thiết kế, và là lý do IBM huấn luyện nó trong mười ngày trên tám chiếc H100 rồi phát hành với `transformers>=5.16.0` cùng một bản demo WebGPU — nhưng vẫn có người phải trả tiền cho GPU, ngăn xếp phục vụ, tự động mở rộng, các lần thử lại và ca trực on-call. Ở khối lượng nhỏ, mức giá dịch vụ được quản lý thường rẻ hơn thời gian kỹ thuật. Ở khối lượng lớn và ổn định, con đường thuê phần cứng lại thắng thế, và điểm giao nhau phụ thuộc vào mức sử dụng của bạn chứ không phải khối lượng âm thanh: một GPU mà bạn giữ bận liên tục thì rẻ theo giờ, còn một GPU bạn giữ luôn nóng để đáp ứng lưu lượng đỉnh thì không.

Một chi tiết về giấy phép đáng được nêu ra trước khi bất kỳ ai thiết kế hệ thống dựa trên nó. Checkpoint chính xác hơn trong hai checkpoint, cái đạt 4,85% WER, là bản phi thương mại theo CC-BY-NC-SA-4.0. Checkpoint Apache 2.0 là bản 5,00%, và đó là bản bạn được phép đưa vào sản phẩm. Đó là mức chênh lệch độ chính xác 0,15 điểm đổi lấy quyền được sử dụng mô hình, và điều đó cũng có nghĩa là bất kỳ so sánh nào trích dẫn 4,85% cho "Granite Speech 5.0" rồi sau đó bàn về triển khai thương mại đều đang trích dẫn sai checkpoint.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

Quy tắc quyết định

Ba câu hỏi phân biệt hai mô hình này nhanh hơn bất kỳ bảng benchmark nào.

Bản chép lời có được sử dụng trực tiếp, trong khi người nói vẫn đang nói không? Nếu có, TurboCTC không phải là ứng viên — không phải vì nó chậm, mà vì nó không có giao diện truyền luồng và không có đầu ra từng phần, và một bản chép lời từng phần là một cam kết kiến trúc khác với một lần giải mã theo lô nhanh. Nếu không, lợi thế thông lượng trở thành toàn bộ câu chuyện và mô hình của IBM rất khó bị đánh bại về chi phí cho mỗi giờ âm thanh được xử lý.

Công việc có cần từ vựng chuyên ngành không? Nếu có, một mô hình có tính năng biasing mặc nhiên sẽ thắng, và việc TurboCTC thiếu biasing theo thuật ngữ khóa là điều đủ để bị loại chứ không chỉ gây bất tiện. Nếu không, bạn đang trả tiền cho một tính năng mà bạn sẽ không dùng ở phía managed.

Âm thanh có phải là giọng đọc tiếng Anh trên phần cứng ổn không? Nếu có, cả hai đều mạnh và lựa chọn là ở khâu vận hành. Nếu không, cả hai bo mạch đều không cung cấp thông tin và chỉ đánh giá của riêng bạn mới quan trọng.

Dù kết quả ra sao, lớp vận hành chính là nơi quyết định này trở nên rẻ. OrcaRouter đưa hơn 200 mô hình vào sau một khóa tương thích OpenAI với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, nhờ đó một endpoint giọng nói được quản lý ở một vùng gặp trục trặc vào buổi chiều sẽ không còn là sự cố của bạn, và giá niêm yết của nhà cung cấp được chuyển nguyên qua với mức đánh thêm 0% — nghĩa là thay đổi giá của nhà cung cấp hoặc một checkpoint mới sẽ có hiệu lực ở phía chúng tôi ngay trong cùng ngày. Với một workload mà câu trả lời đúng thực sự chưa rõ ràng, điều đó loại bỏ chi phí của việc chọn sai: hãy benchmark cả hai với chính âm thanh của bạn qua một endpoint, giữ lại mô hình thắng, và đổi chuỗi mô hình khi mô hình tiếp theo ra mắt.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

Nói ngắn gọn: Granite Speech 5.0 470M TurboCTC là câu trả lời tốt hơn cho "phiên âm mọi thứ chúng ta từng ghi lại, với chi phí thấp, trên phần cứng do chúng ta kiểm soát", còn Grok Voice Transcribe 2.0 là câu trả lời tốt hơn cho "phiên âm việc này ngay khi nó diễn ra, một cách chính xác, mà không cần chúng ta vận hành ngăn xếp phục vụ". Con số gây chú ý 12.600× và con số gây chú ý 0,49 giây đều đúng, và không cái nào là bằng chứng về cái kia.