Thẻ hero bài viết ghi 'Daily AI Brief — September 19' với huy hiệu 'TIN TỨC' và phụ đề 'Grok Voice Transcribe 2.0 phát hành, và Meta mở Muse', với các chip ghi $0.10 mỗi giờ batch, 2.7% WER streaming, 3.4% partial đầu tiên và Muse connectors live, trên nền gradient trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Engineering & Research

Bản tin AI hằng ngày, ngày 19 tháng 9: Grok Voice Transcribe 2.0 chính thức ra mắt và Meta mở Muse cho các nhà phát triển

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Grok Voice Transcribe 2.0 đã ra mắt trong Grok Voice API kể từ ngày 18 tháng 9 năm 2026, với mức giá 0,10 đô la mỗi giờ âm thanh cho phiên âm ghi sẵn và 0,20 đô la mỗi giờ cho truyền trực tuyến — mức giá tương tự mà SpaceXAI đã tính cho phiên bản 1.0. Cùng tuần đó, Meta đã mở nền tảng kết nối Muse cho các nhà phát triển bên ngoài, cho phép bất kỳ dịch vụ nào công khai API hiện có của mình và để tác nhân Muse của Meta gọi nó thay mặt người dùng. Những tiêu đề đó trông có vẻ không liên quan từ hai công ty khác nhau về hai sản phẩm khác nhau, và trong phần lớn hai năm qua, chúng đã từng như vậy. Đọc cùng nhau, chúng là cùng một câu chuyện: phiên âm đang trở thành một đầu vào, và cuộc chiến đã chuyển sang việc ai sở hữu lệnh gọi tiêu thụ nó.

Hãy bắt đầu với giá cả, vì đó là phần mà người đọc có thể hành động ngay hôm nay. Tiếp theo là độ chính xác, vốn là thật nhưng hẹp hơn so với cách định khung khi ra mắt gợi ý. Sau đó là phần về Meta, phần sẽ trở nên quan trọng trong sáu tháng nữa.

Giá cố định, và điều đó có nghĩa gì nếu bạn đã trả tiền cho dịch vụ chép lời

Grok Voice Transcribe 2.0 có cùng mức giá như 1.0. Không phải “khởi điểm từ” cùng mức, không phải mức khuyến mại sẽ hết hạn — mà giống hệt nhau, ở mức 0,10 USD mỗi giờ âm thanh cho công việc theo lô và 0,20 USD mỗi giờ cho streaming, tương đương 1,67 USD và 3,33 USD cho mỗi 1.000 phút. Phân tách người nói, dấu thời gian ở cấp độ từ kèm điểm tin cậy, chuẩn hóa văn bản nghịch đảo, loại bỏ từ đệm và thiên lệch theo thuật ngữ khóa đều nằm trong mức giá đó thay vì được bán thêm như các tiện ích bổ sung, điều này không phải là chuẩn mực cho hạng mục này.

Tác động thực tế mang tính số học hơn là kịch tính. Một nhóm phiên âm 5.000 giờ âm thanh trung tâm liên hệ mỗi tháng trả $500 cho luồng xử lý theo lô dù theo cách nào, và mô hình mới cho ra cùng khối lượng với tỷ lệ lỗi thấp hơn đáng kể. Không có gì trong việc chuyển đổi làm thay đổi số tiền bạn phải trả, và đó chính xác là lý do việc chuyển đổi dễ biện minh: không có quyết định chi phí nào phải đưa ra, chỉ có một quyết định về chất lượng, và chất lượng đã tăng lên.

Các tích hợp hiện có chuyển sang bằng cách truyền grok-voice-transcribe-2.0 làm tham số model trên /v1/stt, hoặc bằng cách chọn nó khi phiên WebSocket được mở để truyền phát trực tuyến. Không thay đổi schema, không có endpoint mới, không mã hóa lại pipeline âm thanh của bạn. SpaceXAI hiện vẫn để 1.0 làm mặc định, vì vậy một tích hợp không bao giờ chạm đến tham số model sẽ tiếp tục nhận phiên bản cũ cho đến khi công ty đảo nó — điều mà họ nói sẽ xảy ra trong vài tuần tới, cùng với việc ngừng hỗ trợ 1.0. Khoảng thời gian đó đáng để sử dụng một cách có chủ đích: trỏ một bản sao shadow của âm thanh production của bạn vào 2.0 và so sánh khác biệt các bản chép lời với những gì bạn phát hành hôm nay, bởi vì một khi mặc định đảo, bạn sẽ chạy nó dù bạn có kiểm thử hay không.

Phần còn lại của bảng thông số kỹ thuật không thay đổi về cấu trúc và đáng để biết nếu bạn đang định cỡ một triển khai thay vì chỉ đánh giá độ chính xác: 12 định dạng âm thanh đầu vào từ âm thanh điện thoại 8 kHz đến 48 kHz, tối đa tám kênh âm thanh độc lập trong một yêu cầu, 100 thuật ngữ khóa mỗi yêu cầu cho từ vựng chuyên ngành, tự động phát hiện ngôn ngữ với khả năng chuyển đổi giữa chừng khi đang ghi âm, và chuẩn hóa văn bản nghịch đảo trên 25 ngôn ngữ để ngày tháng, tiền tệ, số điện thoại và địa chỉ email được nói ra trở thành văn bản viết theo cách con người sẽ viết chúng. Các giới hạn dịch vụ là 10 yêu cầu mỗi giây và 100 phiên truyền phát đồng thời mỗi đội, và dịch vụ chạy trong một khu vực duy nhất — us-east-1 — đây là dòng duy nhất trên bảng khiến một đội vận hành sản xuất phải chững lại, bởi vì API giọng nói một khu vực là một sự cố ngừng dịch vụ một khu vực.

Nơi độ chính xác thực sự đã thay đổi

Tuyên bố khi ra mắt là “chính xác gấp đôi”, và những con số cơ sở thì cụ thể hơn và ít đồng nhất hơn cách diễn đạt đó. Trên bảng AA-WER Streaming của Artificial Analysis, vốn là phép đo độc lập ở đây, hai phiên bản khác biệt như sau:

• Độ chính xác của bản ghi cuối cùng — Grok Voice Transcribe 2.0 đạt tỷ lệ lỗi từ 2,7% so với Grok Voice Transcribe 1.0 là 3,9%, cả hai đều được đo sau khi người nói dừng lại

• Độ chính xác của bản ghi chép từng phần đầu tiên — 3,4% WER so với 18,3%, đây là khoảng cách đơn lẻ lớn nhất giữa hai phiên bản, bỏ xa các khoảng cách khác

• Thời gian để có bản ghi cuối cùng — 0,49 giây so với 0,37 giây, vì vậy 2.0 chậm hơn ở chỉ số này chứ không phải nhanh hơn

• Thời gian đến lần khớp một phần đầu tiên — 0,49 giây so với 0,25 giây, cùng một giao dịch theo hướng ngược lại

Cặp cuối cùng đó là thứ thú vị nhất trên bảng. Grok Voice Transcribe 2.0 đã đánh đổi khoảng một phần tư giây độ trễ, ở cả hai chiều, để lấy độ chính xác. Với một voice agent, đó là một cái giá thực sự — đó là sự khác biệt giữa một khoảng dừng tự nhiên và một khoảng dừng mà người gọi nhận ra — còn với một pipeline xử lý theo lô thì nó vô hình. Cải thiện ở first-partial mới là thứ thay đổi những gì bạn có thể xây dựng, vì bản ghi một phần chính là văn bản mà agent có thể dùng để suy luận trong lúc người gọi vẫn đang nói. Đi từ 18,3% xuống 3,4% ở con số đó là sự khác biệt giữa việc một partial chỉ là một gợi ý thô và việc một partial trở nên dùng được. Bản ghi cuối cùng đi từ 3,9% xuống 2,7% là một cải thiện tốt mà không người dùng nào sẽ nhận ra.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the 'Speech to Text' heading, the line 'Transcribe audio files into text with a single API call, or stream audio in real time over WebSocket', and a Python quick-start code block that posts an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0 alongside a keyterm parameter.

SpaceXAI cũng đã công bố bốn đánh giá nội bộ, và chúng đáng để đọc cùng với nhãn đi kèm — đây là những con số của chính công ty về audio của chính họ, không được tái lập độc lập:

• Cuộc gọi hỗ trợ khách hàng 8 kHz — WER 10,6% ở phiên bản 1.0 giảm xuống 7,1% ở phiên bản 2.0

• Cuộc trò chuyện với Grok — giảm từ 8,7% xuống 3,3%

Thông tin xác thực được đọc thành tiếng, nghĩa là tên, email và chi tiết tài khoản được đọc to — giảm từ 7,2% xuống 3,2%

• Các cụm từ ngắn trên 19 ngôn ngữ — từ 20,6% xuống 6,8%

Hàng 8 kHz là hàng đáng lưu tâm. Âm thanh điện thoại là đầu vào phổ biến khó nhất trong hạng mục này và là loại mà hầu hết người mua ở trung tâm liên hệ thực sự có, và mức giảm từ 10,6% xuống 7,1% ở chỉ số này có ý nghĩa lớn hơn đối với những người mua đó so với con số nổi bật trên bảng.

Tuyên bố trên bảng xếp hạng, đọc một cách trung thực

SpaceXAI cho biết mô hình đứng đầu trong số 32 mô hình streaming về độ chính xác. Bảng của Artificial Analysis thực sự đặt nó ở vị trí đầu tiên trên cả bảng xếp hạng bản ghi cuối cùng và bản ghi từng phần đầu tiên — nhưng trang bảng chỉ biểu diễn 27 trong số 33 mô hình, vì vậy “32” là con số do chính công ty đưa ra, và bảng xếp hạng nằm trên một tập hợp mà người đọc nên hiểu rõ cấu trúc của nó. AA-WER Streaming là một tổ hợp có trọng số của ba bộ dữ liệu tiếng Anh: AA-AgentTalk chiếm 50%, VoxPopuli chiếm 25% và Earnings22 chiếm 25%, tổng cộng khoảng tám giờ âm thanh, và nó nghiêng mạnh về lời nói hội thoại kiểu agent. Nó không đo lường các giọng, codec điện thoại, từ vựng theo lĩnh vực hay âm thanh trung tâm cuộc gọi đa kênh theo bất kỳ cách có cấu trúc nào.

Chẳng điều nào trong số đó khiến con số trở nên sai. Nó khiến con số trở nên cụ thể. Một mô hình dẫn đầu bảng xếp hạng tiếng Anh có trọng số theo agent-talk là lựa chọn đúng cho âm thanh tiếng Anh mang dạng agent-talk, và lý do trung thực để tin rằng kết quả 8 kHz là đánh giá nội bộ của nhà cung cấp chứ không phải bảng xếp hạng công khai. Người mua có hồ sơ âm thanh khác nên kiểm thử trên chính âm thanh của họ thay vì đọc bảng xếp hạng như một phán quyết tổng quát — điều đó đúng trước lần ra mắt này và sẽ đúng sau lần ra mắt tiếp theo.

A generated infographic titled 'Grok Voice Transcribe 2.0 — what changed from 1.0', showing two columns of four rows: final transcript 3.9% to 2.7% WER, first partial 18.3% to 3.4% WER, time to first partial 0.25s to 0.49s, and streaming price $0.20 per hour unchanged, with a footer reading 'Board figures per Artificial Analysis AA-WER Streaming; internal evaluations vendor-reported.'

Meta mở trình kết nối Muse cho các nhà phát triển

Câu chuyện thứ hai của tuần này là của Meta. Muse, agent cá nhân mà Meta ra mắt vào ngày 8 tháng 9 trên iOS, Android, muse.ai và WhatsApp, giờ đây chấp nhận các connector của bên thứ ba: một dịch vụ công khai API của mình, còn Muse cung cấp agent, trình duyệt và ngữ cảnh người dùng để biến API đó thành thứ mà một người có thể gọi lên chỉ bằng cách yêu cầu. Cách Meta định vị điều này là sự phân chia công việc — bạn mang đến API, chúng tôi mang đến ý định và người dùng. Những connector đầu tiên được nêu tên là Notion và công cụ ghi chú cuộc họp Granola, bên cạnh những cái mà chính Meta đã phát hành.

Cần phải chính xác về việc đây là gì và không phải là gì. Đây không phải là một giao thức xuyên tác nhân mở. Việc xây dựng một trình kết nối giúp bạn có được sự phân phối bên trong cơ sở người dùng của chính Muse và không ở đâu khác; việc xây dựng dựa trên một giao thức mở giúp bạn tiếp cận mọi tác nhân tương thích và không có cơ sở người dùng cụ thể nào. Meta cũng chưa công bố những phần mà nhà phát triển cần để lập kế hoạch — quy trình xét duyệt trình kết nối, bề mặt tích hợp kỹ thuật, cách Muse chọn giữa hai trình kết nối trùng lặp, hoặc cách nhà phát triển đo lường liệu một trình kết nối có thực sự thúc đẩy bất kỳ việc sử dụng nào hay không.

Điều không còn phải nghi ngờ là hướng đi. Muse chạy agent của từng người dùng trong máy ảo riêng với trình duyệt riêng và một lớp đánh giá riêng phía trước các hành động gửi ra ngoài, đồng thời nó giữ các token thay thế thay vì khóa API thật. Kiến trúc đó chỉ hợp lý nếu kế hoạch là để agent gọi rất nhiều thứ. API phiên âm nằm trong số những thứ mà một agent gọi, và Meta có sản phẩm riêng của mình — Muse Voice Transcribe, mô hình thời gian thực mà Meta phát hành vào đầu tháng 9 với mức 0,18 USD mỗi giờ âm thanh. Một nền tảng sở hữu cả agent lẫn mô hình giọng nói có lý do hiển nhiên để định tuyến lưu lượng của chính mình đến mô hình của chính mình, và các nhà phát triển xây dựng trên các connector nên giả định đó là mặc định, trừ khi có điều gì đó khiến nó không còn là mặc định.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Streaming filter selected, showing the WER Index - Final Transcription, Latency and Price highlight cards, the 'See Non-streaming Benchmarks' toggle, and the AA-WER Streaming Index versus Time to Final Transcription chart.

Điều mà một đội ngũ phát hành tính năng giọng nói trong tháng này thực sự nên làm

Cả hai câu chuyện đều chỉ về cùng một hướng. Độ chính xác của nhận dạng giọng nói đang hội tụ — ba mô hình nằm trong khoảng một điểm rưỡi của nhau trên cùng một bảng xếp hạng trong vòng ba tuần — và những yếu tố khác biệt còn lại là giá, độ trễ, giấy phép và ai kiểm soát việc định tuyến. Điều đó khiến việc chọn nơi gửi yêu cầu phiên âm của bạn trở nên hệ trọng hơn việc chọn mô hình nào trả lời nó, bởi vì bạn sẽ muốn thay đổi câu trả lời đó vài lần trong năm tới.

Đây là lớp mà OrcaRouter nằm trong. Một khóa API duy nhất bao phủ hơn 200 mô hình phía sau các endpoint tương thích với OpenAI, với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, nhờ đó một dịch vụ giọng nói ở một khu vực đang gặp trục trặc buổi chiều sẽ không còn trở thành sự cố gián đoạn của bạn. Chúng tôi chuyển nguyên giá niêm yết của nhà cung cấp với 0% markup, nghĩa là việc nhà cung cấp giảm giá hoặc có phiên bản mô hình mới sẽ có hiệu lực ở phía chúng tôi ngay trong ngày, thay vì phải chờ định giá lại. Và vì mọi mô hình đều nằm sau một hợp đồng duy nhất, việc chuyển khối lượng công việc phiên âm từ mô hình này sang mô hình khác chỉ là thay đổi chuỗi mô hình, thay vì phải mua sắm thêm lần thứ hai.

Ba hành động cụ thể cho tuần này. Nếu bạn đang dùng Grok Voice Transcribe 1.0, hãy shadow-test 2.0 trên chính âm thanh của bạn ngay bây giờ, khi 1.0 vẫn là mặc định và bạn vẫn kiểm soát được việc chuyển đổi. Nếu bạn đang đánh giá truyền phát giọng nói cho một agent, hãy đo time-to-first-partial trên ngân sách độ trễ của riêng bạn thay vì tin vào bảng xếp hạng của bất kỳ ai — một phần tư giây mà mô hình này bỏ ra để mua độ chính xác hoặc chẳng là gì cả, hoặc là chí mạng, tùy vào việc agent của bạn làm gì với văn bản. Và nếu bạn đang xây dựng bất cứ thứ gì mà một agent cá nhân có thể một ngày nào đó sẽ gọi tới, hãy theo dõi sát chương trình connector Muse, vì lập luận về phân phối mà nó đưa ra mạnh hơn chi tiết kỹ thuật mà nó đi kèm khi phát hành.