Thẻ hero của bài viết hiển thị 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe' với nhãn 'SO SÁNH MÔ HÌNH' và phụ đề 'ngôi vương 17 ngày và một phần tư giây', cùng các chip ghi 2,7% so với 3,1% WER cuối cùng, 0,49 giây so với 0,16 giây sau khi nói, $0,20 so với $0,18 mỗi giờ streaming và batch với giá bằng một nửa, trên nền gradient từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Grok Voice Transcribe 2.0 so với Muse Voice Transcribe: Một triều đại 17 ngày và một phần tư giây

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 1 tháng 9 năm 2026, Meta cho biết Muse Voice Transcribe đã giành vị trí đầu tiên trong đánh giá nhận dạng giọng nói theo luồng của Artificial Analysis với tỷ lệ lỗi từ cuối cùng là 3,1%, và tuyên bố đó đã đứng vững không bị thách thức trong mười bảy ngày. Vào ngày 18 tháng 9, SpaceXAI phát hành Grok Voice Transcribe 2.0 với 2,7% trên cùng bảng xếp hạng và chiếm lấy vị trí đó. Hai mô hình, một bảng xếp hạng, cách nhau mười bảy ngày — và phép so sánh thú vị hơn không phải là khoảng cách 0,4 điểm về độ chính xác, bởi vì mô hình của Meta vẫn nhanh hơn khoảng ba lần để hoàn tất một câu: 0,16 giây sau khi kết thúc lời nói, so với 0,49 giây của Grok Voice Transcribe 2.0. Muse Voice Transcribe là một mô hình cảm nhận âm thanh thời gian thực do Meta Superintelligence Labs xây dựng để chạy bên trong các sản phẩm của chính Meta, nơi một phần tư giây là sự khác biệt giữa một trợ lý mang lại cảm giác hiện diện và một trợ lý mang lại cảm giác chậm chạp. Grok Voice Transcribe 2.0 là một API chuyển lời nói thành văn bản được xây dựng để bất kỳ ai cũng có thể gọi, với mức giá khiến công việc xử lý theo lô trở nên khả thi. Cả hai con số đều do nhà cung cấp công bố trong ngày ra mắt, và chỉ một trong hai kể từ đó đã được đưa lên một bảng công khai một cách độc lập.

Bảng xếp hạng thực sự nói gì vào lúc này

Bảng AA-WER Streaming là một tổ hợp có trọng số — AA-AgentTalk chiếm 50%, VoxPopuli 25%, Earnings22 25%, khoảng tám giờ âm thanh tiếng Anh phần lớn mang dạng tác nhân — và cả hai mô hình đều được đo trên đó, chính điều này khiến đây trở thành một cuộc đối đầu trực tiếp hiếm hoi mà các con số ít nhất là có thể so sánh được với nhau. Đặt cạnh nhau, bao gồm cả các số liệu do nhà cung cấp báo cáo:

• Độ chính xác bản ghi cuối cùng — Grok Voice Transcribe 2.0 đạt WER 2,7% so với Muse Voice Transcribe đạt 3,1%

• Độ chính xác của bản ghi chép từng phần đầu tiên — 3,4% so với 3,6%

• Thời gian đến phần đầu tiên — 0,49 giây so với 0,13 giây

• Thời gian từ khi kết thúc bài nói đến bản ghi cuối cùng — 0,49 giây so với 0,16 giây

• Tỷ lệ lỗi phân tách người nói — được bao gồm, không có số liệu nào được công bố so với mức trung bình 17,5% trong đánh giá của Meta

Hãy đọc riêng các hàng độ chính xác và các hàng độ trễ, vì chúng chỉ theo hai hướng ngược nhau và cả hai đều đúng. Về độ chính xác, hai mô hình chênh nhau trong khoảng bốn phần mười điểm đối với bản ghi cuối cùng và hai phần mười đối với các kết quả tạm thời đầu tiên — một khoảng cách đủ nhỏ để nó sẽ đảo chiều ở bản phát hành tiếp theo của một trong hai công ty, và đủ nhỏ để không một người hợp lý nào nên chọn giữa chúng dựa trên điều đó. Về độ trễ, chúng không hề gần nhau. Mô hình của Meta trả về kết quả tạm thời trong khoảng một phần tám giây và hoàn tất trong khoảng một phần sáu giây, so với khoảng nửa giây ở cả hai hướng đối với mô hình của SpaceXAI.

Đó là toàn bộ sự so sánh gói gọn trong một dòng: Grok Voice Transcribe 2.0 đánh đổi độ trễ để mua độ chính xác, còn Muse Voice Transcribe làm ngược lại. SpaceXAI đã giảm tỷ lệ lỗi first-partial từ 18.3% ở phiên bản 1.0 xuống 3.4% ở bản 2.0, và cái giá phải trả là tăng từ 0.25 giây lên 0.49 giây trên cùng thước đo. Mô hình của Meta được thiết kế theo hướng ngược lại, với các đoạn âm thanh 80 mili giây và một độ trễ thích ứng được học bằng tăng cường, thứ quyết định thời gian chờ trước khi chốt thành văn bản — một cơ chế có mục đích duy nhất là giữ độ chính xác trong khi vẫn đảm bảo tốc độ chốt nhanh. Không lựa chọn nào là sai lầm. Chúng là câu trả lời cho những câu hỏi khác nhau.

Bạn đang hỏi câu hỏi nào vậy?

Nếu bản chép lời làm đầu vào cho một tác nhân thoại phải phản hồi trong một khoảng dừng hội thoại, thì 0,16 giây và 0,49 giây là những sản phẩm khác nhau. Con người khi luân phiên lượt nói chấp nhận khoảng trễ vài trăm mili giây trước khi tương tác bắt đầu có cảm giác không ổn, và ngân sách độ trễ được chia sẻ — chép lời, rồi suy luận, rồi tổng hợp giọng nói. Một mô hình trả lại bản chép lời cuối cùng trong một phần sáu giây sẽ chừa chỗ cho phần còn lại của quy trình; một mô hình mất nửa giây sẽ tiêu tốn phần lớn ngân sách trước khi mô hình kịp nghĩ về bất cứ điều gì. Đó là điều Meta nhắm đến khi xây dựng, và đó là lý do mô hình chạy bên trong Meta AI trên Mac và bên trong Muse Code thay vì được cung cấp chủ yếu như một điểm cuối cho quy trình của người khác.

Nếu bản ghi chép là một tài liệu — một bản ghi âm cuộc gọi, một cuộc họp, một thư viện video, một kho lưu trữ tuân thủ — thì nửa giây chẳng là gì, khoảng cách về độ chính xác cũng vẫn chẳng là gì, và con số duy nhất quan trọng là chi phí cho một giờ âm thanh. Đó chính là chỗ hai yếu tố này khác biệt rõ rệt, và theo một hướng khiến những người chỉ nhìn vào tốc độ truyền phát phải ngạc nhiên.

Giá bằng một nửa khi xử lý theo lô, cao hơn một phần mười khi xử lý luồng.

Meta niêm yết Muse Voice Transcribe ở mức 0,18 đô la mỗi giờ âm thanh, tương đương 3,00 đô la cho mỗi 1.000 phút. Grok Voice Transcribe 2.0 niêm yết ở mức 0,10 đô la mỗi giờ cho xử lý theo lô và 0,20 đô la mỗi giờ cho truyền trực tuyến. Vậy:

• Phát trực tuyến — Grok Voice Transcribe 2.0 với giá 0,20 USD mỗi giờ so với Muse Voice Transcribe ở mức 0,18 USD, vì vậy Meta rẻ hơn khoảng 10%

• Theo lô hoặc bản ghi — 0,10 USD mỗi giờ so với 0,18 USD, nên SpaceXAI rẻ hơn 44%

• Được bao gồm ở mức giá niêm yết — phân tách người nói, mốc thời gian cho từng từ với độ tin cậy, thiên lệch theo thuật ngữ chính và chuẩn hóa văn bản nghịch đảo ở phía SpaceXAI so với phiên âm trực tuyến, phân tách người nói và phát hiện điểm cuối như một mô hình ở phía Meta

• Gói miễn phí hay tự vận hành — cả hai đều không

Một nhóm chỉ toàn phát trực tuyến nên không quan tâm giữa chúng về giá và nên chọn dựa trên độ trễ, nghĩa là chọn Meta. Một nhóm có bất kỳ khối lượng âm thanh đã ghi âm đáng kể nào nên xem hàng batch, vì $0,08 một giờ sẽ cộng dồn: 5.000 giờ một tháng là $500 ở một bên và $900 ở bên kia, và khác biệt về độ chính xác giữa chúng nhỏ hơn cả phần làm tròn của mỗi con số.

Vị thế cấp phép giống hệt nhau ở khía cạnh quan trọng và khác nhau ở khía cạnh không quan trọng. Cả hai đều là trọng số đóng — Muse Voice Transcribe là độc quyền và chỉ có sẵn thông qua API do Meta lưu trữ, còn Grok Voice Transcribe 2.0 là API thương mại không có bản tải về. Cả hai đều không phải lựa chọn nếu yêu cầu của bạn là âm thanh không bao giờ rời khỏi hạ tầng do bạn kiểm soát, và cả hai đều khiến bạn dễ bị tổn thương trước việc nhà cung cấp thay đổi giá, phiên bản mô hình hoặc lịch ngừng hỗ trợ của họ ngay dưới chân bạn. Đó là một cân nhắc thực tế chứ không phải giả định: Grok Voice Transcribe 1.0 đã nằm trên lộ trình ngừng hỗ trợ chưa đầy hai tuần sau khi bản kế nhiệm của nó ra mắt.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

Phân tách người nói, tính năng mà không bên nào trong số họ đề cao

Cả hai mô hình đều thực hiện việc gán người nói trong một lượt xử lý duy nhất, việc mà hai năm trước vốn là một hệ thống riêng được gắn thêm vào sau đó, và sự so sánh ở đây đặc biệt cụ thể vì Meta đã công bố một con số còn SpaceXAI thì không.

Meta báo cáo tỷ lệ lỗi phân tách người nói trung bình là 17,5% trong đánh giá của mình, xử lý được 20 người nói trở lên mà không cần hậu xử lý, và xử lý họ như một phần của mô hình truyền trực tuyến thay vì như một bước hạ nguồn — câu hỏi "ai nói gì" đến cùng với văn bản chứ không phải sau đó. Điều đó thực sự khó làm trong bối cảnh truyền trực tuyến, nơi một lượt nói chỉ có thể được nhận diện khi bạn đã nghe đủ phần đó, và 17,5% là một con số thật với một lưu ý thật: đó là con số của chính Meta, được lấy trung bình trên một tập đánh giá do Meta chọn.

Mô hình của SpaceXAI bao gồm tính năng phân tách người nói mà không tốn thêm chi phí và cũng hỗ trợ tối đa tám kênh âm thanh độc lập trong một yêu cầu, đây là một cách giải quyết vấn đề tương tự theo cách khác — nếu âm thanh của bạn đến dưới dạng các kênh riêng biệt cho từng người tham gia, điều mà điện thoại trung tâm liên lạc thường làm, thì việc tách kênh đáng tin cậy hơn so với phân tách người nói và không cần đến tỷ lệ lỗi nào cả. Nếu âm thanh của bạn đến dưới dạng một luồng hỗn hợp, bạn phụ thuộc vào chất lượng phân tách người nói, và chỉ một trong hai nhà cung cấp này đã cho bạn biết đó là gì.

Có một khác biệt ở tầng thứ hai đáng lưu ý: Muse Voice Transcribe coi phân tách người nói, phiên âm và phát hiện điểm kết thúc là một mô hình duy nhất tạo ra một đầu ra, nghĩa là các thành phần không thể lỗi một cách độc lập. Grok Voice Transcribe 2.0 cho phép bạn xem kênh, thuật ngữ chính và phân tách người nói như những đòn bẩy riêng biệt. Một mô hình duy nhất thì dễ vận hành hơn và khó gỡ lỗi hơn.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

Các ngôn ngữ, và điểm mà hai thẻ mô hình không còn có thể so sánh được nữa

Meta đã huấn luyện Muse Voice Transcribe trên hơn 70 ngôn ngữ và kiểm chứng kỹ lưỡng 25 trong số đó khi ra mắt, với khả năng chuyển mã tự nhiên trong và giữa các câu cùng hỗ trợ âm thanh dài hơn một giờ. Grok Voice Transcribe 2.0 xử lý việc tự động nhận diện ngôn ngữ với khả năng chuyển đổi ngay trong lúc ghi âm và áp dụng chuẩn hóa văn bản nghịch đảo — ngày tháng, tiền tệ, số điện thoại và địa chỉ email dạng nói được hiển thị ở dạng viết — trên 25 ngôn ngữ.

Sự trùng lặp là 25 ngôn ngữ được xác minh rộng rãi ở một bên và 25 ngôn ngữ chuẩn hóa ở bên kia, và hai tập hợp này không phải cùng 25 ngôn ngữ và cả hai nhà cung cấp đều chưa công bố danh sách. "70+ ngôn ngữ được huấn luyện" và "25 ngôn ngữ có hỗ trợ định dạng" không phải là những tuyên bố có thể so sánh được và không nên bị trừ đi lẫn nhau. Điều có thể nói là Meta đang đưa ra một tuyên bố đa ngôn ngữ rộng hơn và SpaceXAI đang đưa ra một tuyên bố hẹp hơn nhưng mang tính vận hành cao hơn: phát hiện ngôn ngữ là điều kiện tối thiểu, và định dạng những gì mô hình đã nghe thành thứ mà hệ thống hạ nguồn có thể phân tích là phần khiến các tích hợp bị hỏng khi nó bị thiếu.

Sự lựa chọn, và lý do có thể bạn không phải là người đưa ra nó

Bỏ qua phần marketing, quyết định chỉ còn gọn trong ba câu. Chọn Muse Voice Transcribe nếu bản ghi được dùng trực tiếp trong một cuộc trò chuyện, vì 0,16 giây không phải là chuyện nhỏ. Chọn Grok Voice Transcribe 2.0 nếu bạn có âm thanh đã ghi với khối lượng lớn, vì một nửa giá theo lô cũng không phải là chuyện nhỏ. Nếu bạn không cần cả hai thái cực, hãy chọn dựa trên bất cứ điều gì khác ràng buộc bạn — khu vực, hợp đồng, tích hợp sẵn có — vì khác biệt về độ chính xác sẽ không định đoạt được điều đó.

Điều phức tạp là một trong hai mô hình này không thực sự được bán theo nghĩa thông thường. Muse Voice Transcribe tồn tại để khiến trợ lý của chính Meta cảm thấy nhanh nhạy, và nó có mặt thông qua Meta Model API phần lớn là vì Meta đã quyết định rằng giá trị hệ sinh thái của việc được tiếp xúc vượt quá giá trị của tính độc quyền. Điều đó có thể thay đổi, và có thể thay đổi nhanh chóng: Meta đã dành chính tuần đó để mở nền tảng kết nối của Muse cho các nhà phát triển bên thứ ba, cho thấy một công ty đang đầu tư vào kênh phân phối của riêng mình thay vì trở thành nhà cung cấp trung lập cho kênh của tất cả những người khác. Xây dựng sự phụ thuộc vận hành vào mô hình nội bộ của đối thủ là một canh bạc rằng các điều khoản sẽ không thay đổi, và canh bạc đó có thành tích lịch sử tồi tệ.

Sự bất đối xứng đó chính là lý lẽ để không hard-code bất kỳ cái nào trong hai. OrcaRouter cung cấp hơn 200 mô hình đằng sau một khóa duy nhất tương thích với OpenAI, với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp và mức markup 0% trên giá niêm yết của nhà cung cấp — nên khi SpaceXAI chuyển mặc định sang 2.0 và ngừng hỗ trợ 1.0, hoặc khi Meta định vị lại API giọng nói của mình, thay đổi chỉ là một chuỗi mô hình chứ không phải một dự án di trú. Với một hạng mục mà vị trí dẫn đầu đã đổi chủ hai lần trong ba tuần, lớp định tuyến là phần của ngăn xếp nên ổn định, còn mô hình là phần không nên ổn định.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Điều đáng theo dõi trong tháng tới: liệu Artificial Analysis có đo lại Muse Voice Transcribe trên bảng streaming hay không, giờ đây khi Grok Voice Transcribe 2.0 đã soán ngôi nó. Con số 3,1% của Meta và 2,7% của SpaceXAI đều được công bố khi ra mắt, nhưng chỉ số của SpaceXAI được xác minh độc lập. Nếu con số của Meta vẫn đứng vững khi có người chạy lại, khoảng cách độ chính xác sẽ nhỏ đúng như vẻ ngoài, và khoảng cách độ trễ sẽ quyết định tất cả. Nếu không, triều đại mười bảy ngày chính là toàn bộ câu chuyện.