
Grok Voice Transcribe 2.0 chiếm vị trí số 1 về độ chính xác streaming với mức giá không đổi
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 là mô hình chuyển giọng nói thành văn bản mà SpaceXAI phát hành vào ngày 18 tháng 9 năm 2026, và con số duy nhất đáng quan tâm về nó không phải là con số mà bài đăng ra mắt nhấn mạnh. Mà là con số này: bản chép lời từng phần đầu tiên — văn bản mà một tác nhân thoại thực sự có thể hành động dựa trên đó trong khi người gọi vẫn đang bị nói át — đã giảm từ tỷ lệ lỗi từ 18,3% ở Grok Voice Transcribe 1.0 xuống 3,4%. Đó là phép đo trên bảng AA-WER Streaming của Artificial Analysis, nơi mô hình mới hiện đứng đầu ở cả bảng xếp hạng Bản chép lời cuối cùng (Final Transcript) (2,7% WER, 0,49 giây sau khi kết thúc lời nói) và bảng xếp hạng Bản chép lời từng phần đầu tiên (First Partial Transcript) (3,4%, 0,49 giây). Độ chính xác của bản chép lời cuối cùng cũng được cải thiện, từ 3,9% xuống 2,7%, mức cải thiện này là thật nhưng khiêm tốn. Bước nhảy vọt ở bản chép lời từng phần mới là thứ thay đổi những gì bạn có thể xây dựng.
Thực sự thì có gì đã thay đổi giữa 1.0 và 2.0
Hai phiên bản là cùng một sản phẩm trong cùng một API, và SpaceXAI không thay đổi gì ở giao diện: Grok Voice Transcribe 2.0 được chọn bằng cách truyền grok-voice-transcribe-2.0 cho /v1/stt thay vì grok-voice-transcribe-1.0, hoặc bằng cách chọn nó khi kết nối WebSocket được tạo cho streaming. Các tích hợp hiện có mà bỏ qua tham số model vẫn tiếp tục nhận 1.0 cho đến khi SpaceXAI đổi giá trị mặc định, điều mà công ty cho biết sẽ diễn ra trong vài tuần tới, song song với việc ngừng hỗ trợ phiên bản cũ hơn. Cho đến lúc đó, 2.0 là tùy chọn tự nguyện và 1.0 có thể được ghim một cách có chủ đích, và đây chính là cách làm đúng đắn cho một thay đổi như thế này: bạn có thể A/B nó trên chính âm thanh của mình trước khi nó trở thành mặc định trong môi trường sản xuất, dù bạn có yêu cầu hay không.
Các con số của Artificial Analysis, khi đặt cạnh nhau để đối chiếu, kể một câu chuyện cụ thể hơn nhiều so với "chính xác gấp đôi":
• Độ chính xác bản ghi cuối cùng — Grok Voice Transcribe 2.0 đạt 2,7% WER so với Grok Voice Transcribe 1.0 đạt 3,9% trên AA-WER Streaming, cả hai đều được đo sau khi kết thúc lời nói
• Độ chính xác của bản chép lời từng phần đầu tiên — 3,4% WER so với 18,3%, chênh lệch đơn lẻ lớn nhất giữa hai phiên bản
• Thời gian để có bản ghi cuối cùng — 0,49 giây so với 0,37 giây, vì vậy mô hình mới chốt kết quả chậm hơn mô hình mà nó thay thế
• Thời gian đến partial đầu tiên — 0,49 giây so với 0,25 giây, cũng chậm hơn tương tự
• Độ chính xác theo lô (không truyền phát) — 2,3% AA-WER trên bảng xếp hạng không truyền phát của Artificial Analysis, so với 4,07% đối với Whisper Large v3 và 3,31% đối với GPT Transcribe
• Thông lượng theo lô — khoảng 162× thời gian thực trên cùng một bo mạch, thấp hơn mức 333× của MAI-Transcribe-2 và cao hơn mức 88× của Gemini 3.5 Transcribe
Dòng thứ tư và thứ năm đó chính là lời cảnh báo trung thực trong bản phát hành này. SpaceXAI đã dùng độ trễ để mua độ chính xác. Mô hình mới chậm hơn khoảng một phần ba giây khi trả về kết quả tạm thời đầu tiên và bản phiên âm cuối cùng so với phiên bản 1.0. Trên một bảng xếp hạng nơi Deepgram Flux trả về kết quả tạm thời trong 0,02 giây và Soniox v5 trong 0,05 giây, Grok Voice Transcribe 2.0 hoàn toàn không cạnh tranh về tốc độ — nó cạnh tranh ở việc đúng, và nó thắng sự đánh đổi đó với cách biệt lớn. Việc đó có phải là sự đánh đổi đúng hay không phụ thuộc hoàn toàn vào việc ứng dụng của bạn là một voice agent trực tiếp cần bắt đầu đáp lời, hay một pipeline phiên âm nơi nửa giây là vô hình.

Tuyên bố "chính xác gấp đôi", đã được kiểm chứng
Thông điệp chính của SpaceXAI là 2.0 chính xác gấp đôi 1.0 với cùng mức giá, và bảng đánh giá của chính họ củng cố điều đó trên các bộ dữ liệu họ đã chọn. Với các cuộc gọi hỗ trợ khách hàng tiếng Anh ở 8 kHz, tỷ lệ lỗi từ giảm từ 10,6% xuống 7,1%. Với các cuộc trò chuyện với Grok, từ 8,7% xuống 3,3%. Với thông tin xác thực bằng giọng nói — mã tài khoản, số điện thoại, địa chỉ email — từ 7,2% xuống 3,2%. Với các lệnh ngắn trên 19 ngôn ngữ, từ 20,6% xuống 6,8%, tức giảm lỗi khoảng hai phần ba. Bốn bộ dữ liệu đó được lấy từ lưu lượng sản xuất của SpaceXAI và các so sánh là của chính SpaceXAI; chưa có ai bên ngoài công ty tái lập được chúng. Hãy coi bảng này như một bản đồ về nơi mô hình đã được tinh chỉnh, chứ không phải như một bảo đảm chính xác tổng quát.
Kết quả của Artificial Analysis là phần không do nhà cung cấp báo cáo: một khung kiểm thử độc lập chạy trên khoảng tám giờ âm thanh, với trọng số 50% dành cho tập AA-AgentTalk riêng tư và 25% cho mỗi tập VoxPopuli và Earnings22. Nó hỗ trợ một tuyên bố hẹp hơn nhưng hữu ích hơn so với "chính xác gấp đôi" — rằng trên tổ hợp cụ thể đó, mô hình này là bộ phiên âm dạng streaming chính xác nhất từng được đo lường. Một điểm đáng lưu ý: bài đăng của SpaceXAI mô tả vị trí thứ nhất "trong số 32 mô hình streaming", trong khi chính trang bảng xếp hạng chỉ hiển thị 27 trong số 33 mô hình. Thứ hạng là thật; số lượng mô hình trong bài quảng cáo là con số của công ty, không phải của bảng xếp hạng.
Cũng cần nói rõ vị trí đầu tiên trên AA-WER Streaming bao gồm và không bao gồm những gì. Bảng xếp hạng này nghiêng về tiếng Anh và nặng về hội thoại của tác nhân. Nó không đo giọng của bạn, codec của bạn, từ vựng chuyên ngành của bạn, hay âm thanh tám kênh từ tổng đài của bạn. Một mô hình đứng đầu bảng đó vẫn có thể thua đậm trên các bản ghi âm của bạn, và đó chính xác là lý do vì sao cửa sổ đăng ký tham gia lại quan trọng.

Giá cả không thay đổi, và đó là sự thật lớn thứ hai ở đây
Grok Voice Transcribe 2.0 có mức giá bằng mức giá của 1.0: 0,10 USD mỗi giờ âm thanh cho batch và các tệp ghi âm qua REST endpoint, 0,20 USD mỗi giờ âm thanh cho streaming qua WebSocket. Trên bảng giá của Artificial Analysis, SKU streaming ở mức 3,33 USD mỗi 1.000 phút và SKU batch ở mức 1,67 USD — cùng mức giá batch mà Microsoft đang áp cho MAI-Transcribe-2, và chỉ bằng khoảng một phần ba mức giá mà ElevenLabs Scribe v2 Realtime tính cho mỗi phút streaming.
Diarization, dấu thời gian ở cấp từ kèm điểm tin cậy và ưu tiên thuật ngữ khóa đều được bao gồm trong mức giá đó thay vì tính phí riêng, điều này không phổ biến trên thị trường này. Gemini 3.5 Transcribe Live tính phí theo token cho cả đầu vào âm thanh lẫn đầu ra văn bản, nên chi phí của bạn biến động theo lượng mô hình nói ra, chứ không chỉ theo thời lượng âm thanh đã chạy. Mức giá cố định theo giờ dễ dự báo hơn và dễ so sánh hơn giữa các nhà cung cấp — và vì OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức đánh dấu 0%, thay đổi về mức giá đó từ phía nhà cung cấp sẽ hiển thị ở phía chúng tôi ngay trong cùng ngày thay vì sau một chu kỳ định giá lại.
Những gì API thực sự cung cấp cho bạn
Danh sách tính năng thì phong phú và phần lớn là kế thừa chứ không phải mới, điều này đáng để lưu ý nếu bạn đang đánh giá bản nâng cấp chỉ dựa trên các tính năng:
• Xử lý theo lô và truyền trực tuyến trong cùng một mô hình — REST cho các tệp ghi âm lên tới 500 MB, WebSocket tại wss://api.x.ai/v1/stt với kết quả tạm thời được phát ra khoảng mỗi 500 ms
• Bao gồm phân tách người nói, cùng với phiên âm đa kênh cho tối đa 8 kênh độc lập
• Dấu thời gian ở cấp độ từ mang điểm tin cậy, để bạn có thể đặt ngưỡng cho các đoạn có độ tin cậy thấp thay vì tin tưởng toàn bộ bản ghi như nhau
• Thiên lệch theo thuật ngữ khóa tối đa 100 thuật ngữ chuyên ngành mỗi yêu cầu, mỗi thuật ngữ tối đa 50 ký tự
• Chuẩn hóa văn bản nghịch đảo cho số, ngày tháng, đơn vị tiền tệ, số điện thoại và địa chỉ email, với định dạng dạng viết được hỗ trợ trên 25 ngôn ngữ
• Loại bỏ từ đệm và phát hiện kết thúc lượt bằng Smart Turn, nhắm thẳng vào các agent thoại
• Tự động phát hiện ngôn ngữ với khả năng chuyển đổi ngôn ngữ ngay giữa lúc ghi âm chỉ trong một lượt xử lý duy nhất, hỗ trợ 12 định dạng âm thanh và tần số lấy mẫu từ 8 kHz đến 48 kHz
• Giới hạn dịch vụ 10 yêu cầu mỗi giây trên cả REST và streaming, cùng 100 phiên streaming đồng thời cho mỗi nhóm, được lưu trữ tại us-east-1
Lưu ý vận hành duy nhất không có trong danh sách tính năng: dịch vụ chạy trong một khu vực duy nhất. Nếu âm thanh của bạn bắt nguồn từ ngoài Hoa Kỳ, chặng mạng giờ là một phần trong ngân sách độ trễ của bạn, và AA-WER Streaming đưa độ trễ mạng vào tính toán thời gian của mình một cách rõ ràng. SpaceXAI cung cấp các điều khoản không lưu giữ dữ liệu và viện dẫn SOC 2 Type II, BAAs cùng các lựa chọn lưu trú dữ liệu tại EU, nên câu chuyện tuân thủ có phần phát triển hơn câu chuyện địa lý.

Ai nên ra đi, và điều gì cần theo dõi
Nếu bạn đã dùng Grok Voice Transcribe 1.0 và ứng dụng của bạn xử lý các bản phiên âm tạm thời — phát hiện lượt nói, ngắt lời, phản hồi tác nhân trực tiếp — thì khoảng cách độ chính xác của bản tạm thời từ 18.3% xuống 3.4% đủ lớn để việc thử nghiệm 2.0 không còn là tùy chọn. Con số đó đi từ "thường sai" sang "thường đúng" chính là khác biệt giữa một bản phiên âm tạm thời mà bạn có thể định tuyến dựa trên đó và một bản mà bạn chỉ có thể hiển thị. Nếu ứng dụng của bạn chờ các bản phiên âm cuối cùng trên các tệp ghi âm, cải thiện là có thật nhưng nhỏ hơn, và 0.12 giây độ trễ chốt tăng thêm chính là cái giá của nó.
Nếu bạn đang dùng một nhà cung cấp hoàn toàn khác, lý do để xem xét bản phát hành này không phải là thứ hạng trên bảng xếp hạng — mà là việc một phòng thí nghiệm tiên phong vừa cải thiện mô hình phiên âm của mình với biên độ lớn mà không tăng giá, đó là dáng vẻ của một thị trường khi độ chính xác không còn là thứ bạn tính phí. Con đường nâng cấp cũng là loại rẻ nhất: một tham số, không thay đổi mã, không hợp đồng mới, và có thể ghim phiên bản nếu có lỗi.
Điều cần theo dõi tiếp theo là việc chuyển sang mặc định. Khi SpaceXAI đặt 2.0 làm mặc định và bắt đầu ngừng hỗ trợ 1.0, mọi tích hợp chưa từng truyền tham số model sẽ đồng loạt chuyển sang model mới, bao gồm cả thay đổi về độ trễ. Các nhóm phụ thuộc vào timing partial 0,25 giây cũ nên ghim phiên bản ngay bây giờ thay vì phát hiện thay đổi đó trên môi trường production. Điều thứ hai cần theo dõi là khả năng tái lập độc lập: mục của Artificial Analysis là một phép đo thực, nhưng đó chỉ là một bảng đo trên một bản mix âm thanh duy nhất, và chưa có bên thứ ba nào công bố một lần chạy so sánh tương đương 1.0 với 2.0 trên audio production.
