
Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: Làn streaming thuộc về một trong hai
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 và Gemini 3.5 Transcribe là hai mô hình chuyển giọng nói thành văn bản tiên tiến mới nhất đến từ các phòng thí nghiệm đối thủ, và cách trung thực để so sánh chúng là thừa nhận ngay từ đầu rằng chúng không được xây dựng cho cùng một công việc. Grok Voice Transcribe 2.0 của SpaceXAI, ra mắt ngày 18 tháng 9 năm 2026, là một mô hình ưu tiên truyền trực tuyến có kèm chế độ theo lô: nó đứng đầu bảng AA-WER Streaming với tỷ lệ lỗi từ 2,7% đối với bản chép cuối cùng và 3,4% đối với các phần từng phần đầu tiên, cả hai đều xuất hiện 0,49 giây sau khi kết thúc lời nói. Gemini 3.5 Transcribe, ra mắt ngày 26 tháng 8 năm 2026, là một mô hình ưu tiên theo lô có kèm một SKU truyền trực tuyến, và hai nửa của nó hành xử rất khác nhau — đường dẫn ghi trước đo được 2,6% AA-WER trên bảng không truyền trực tuyến của Artificial Analysis, trong khi endpoint gemini-3.5-transcribe-live riêng biệt đo được 4,0% trên bảng truyền trực tuyến ở mức 0,40 giây. Đặt bốn con số đó cạnh nhau và hình dạng của cuộc đối đầu này là hiển nhiên: chúng gần nhau về độ chính xác ở nơi Gemini 3.5 Transcribe mạnh, và chúng không gần nhau ở nơi Grok Voice Transcribe 2.0 mạnh.
Làn duy nhất mà cả hai cùng chiến đấu.
Cả hai mô hình đều có thể phiên âm âm thanh trực tiếp, vì vậy streaming là lĩnh vực duy nhất mà so sánh trực diện thực sự có ý nghĩa. Ở đó, Grok Voice Transcribe 2.0 dẫn trước Gemini 3.5 Transcribe Live 1,3 điểm về độ chính xác của bản phiên âm cuối cùng — WER 2,7% so với 4,0% trên cùng một harness, cùng khoảng tám giờ âm thanh và cùng trọng số 50/25/25 trên AA-AgentTalk, VoxPopuli và Earnings22. Đó không phải là khác biệt do làm tròn; ở các mức lỗi đó, đại khái là thừa thêm một từ sai trong mỗi bảy mươi lăm từ được mô hình của Google phiên âm. Ở các bản phiên âm từng phần đầu tiên, khoảng cách còn lớn hơn, 3,4% so với 5,8%, và phiên âm từng phần là những bản mà một tác nhân thoại trực tiếp phải hành động dựa trên đó trước khi người nói nói xong.
Về độ trễ, lợi thế lại đảo chiều, và đây là phần của so sánh thường bị bỏ qua. Gemini 3.5 Transcribe Live trả về bản ghi cuối cùng 0,40 giây sau khi kết thúc lời nói, so với 0,49 giây của Grok, và bản ghi một phần đầu tiên trong 0,25 giây so với 0,49 giây của Grok — nhanh gần gấp đôi để có từ đầu tiên dùng được. Không mô hình nào cạnh tranh với nhóm thực sự nhanh của bảng này, nơi Deepgram Flux đạt 0,02 giây và Soniox v5 đạt 0,05 giây, nhưng giữa hai mô hình này, sự đánh đổi là rõ ràng: Google nói nhanh hơn, SpaceXAI có nhiều khả năng đúng hơn khi nói. Đối với một tác nhân luân phiên lượt không được nói chồng lên người gọi, 0,24 giây độ trễ một phần tăng thêm là một chi phí thực sự mà lợi thế về độ chính xác phải biện minh.

Nơi Gemini 3.5 Transcribe thực sự chiếm ưu thế
Độ bao phủ ngôn ngữ là điểm rõ ràng nhất, và cách biệt không hề nhỏ. Mô hình của Google xử lý hơn 85 ngôn ngữ; Grok Voice Transcribe 2.0 hỗ trợ hàng chục ngôn ngữ, với định dạng dạng viết — tức chuẩn hóa văn bản nghịch đảo, chuyển số, ngày tháng, tiền tệ và địa chỉ email được nói thành dạng viết của chúng — được tài liệu hóa trên 25 ngôn ngữ. Nếu âm thanh của bạn là tiếng Bồ Đào Nha, tiếng Việt, hoặc hỗn hợp chuyển mã hai ngôn ngữ trong cùng một câu, thì câu hỏi mô hình nào chính xác hơn trên bảng xếp hạng Artificial Analysis phần lớn chỉ mang tính học thuật, vì bảng đó thiên về tiếng Anh và nặng về hội thoại kiểu agent. Google báo cáo WER trên FLEURS trong bộ dữ liệu đa ngôn ngữ của riêng mình là 5.50% khi streaming và 5.04% khi non-streaming; đây là các số liệu do nhà cung cấp báo cáo và chưa được tái lập độc lập, nhưng ít nhất có mô tả trường hợp đa ngôn ngữ.
Lợi thế thứ hai là gói miễn phí. Gemini 3.5 Transcribe cung cấp token đầu vào và đầu ra miễn phí trên API của Google, với lưu ý rằng nội dung thuộc gói miễn phí được dùng để cải thiện các sản phẩm của Google, còn nội dung thuộc gói trả phí thì không. Đối với một bản nguyên mẫu, một dự án phụ, hoặc một công cụ nội bộ xử lý loại âm thanh mà bạn sẽ không bỏ tiền ra để phiên âm, thì đó là một lựa chọn thực sự mà không nhà cung cấp tính theo giờ nào có thể sánh bằng. Grok Voice Transcribe 2.0 tính phí ngay từ giờ âm thanh đầu tiên.
Và điều thứ ba là Gemini 3.5 Transcribe là một mô hình đa phương thức tổng quát với chế độ phiên âm, chứ không phải một dịch vụ ASR được xây dựng chuyên biệt. Nó có thể được gợi lệnh, có thể nhận văn bản làm ngữ cảnh, và nó nằm trong cùng bề mặt API với mọi thứ khác mà Google phát hành. Nếu phiên âm chỉ là một bước trong một pipeline mà còn cần suy luận trên bản phiên âm, thì việc giữ cả hai trong một lần gọi mô hình có giá trị mà tỷ lệ lỗi theo từng từ không thể nắm bắt được.
Cách tính giá, trên mỗi nghìn phút
Artificial Analysis chuẩn hóa cả hai mô hình về chi phí cho mỗi 1.000 phút âm thanh, đây là cách duy nhất để so sánh mức giá cố định theo giờ với việc tính phí theo token:
• Theo lô, ghi âm trước — Grok Voice Transcribe 2.0 với $1.67 mỗi 1,000 phút ($0.10/giờ) so với Gemini 3.5 Transcribe với $5.00 mỗi 1,000 phút ($0.30/giờ, từ $2.00 mỗi 1M đầu vào và $12.00 mỗi 1M token đầu ra)
• Truyền phát — Grok Voice Transcribe 2.0 ở mức 3,33 USD mỗi 1.000 phút (0,20 USD/giờ) so với Gemini 3.5 Transcribe Live ở mức khoảng 5,40 USD mỗi 1.000 phút, được tính gộp từ 3,50 USD mỗi 1 triệu token đầu vào âm thanh và 21,00 USD mỗi 1 triệu token đầu ra văn bản
• Thông lượng theo lô — Grok Voice Transcribe 2.0 ở mức xấp xỉ 162 lần thời gian thực so với Gemini 3.5 Transcribe ở mức xấp xỉ 88 lần trên cùng một bo mạch, vì vậy mô hình rẻ hơn cũng là mô hình nhanh hơn cho công việc xử lý tệp
• Giới hạn phiên trực tiếp — Grok Voice Transcribe 2.0 truyền qua WebSocket mà không có mức trần phiên nào được công bố ngoài 100 phiên đồng thời mỗi nhóm, so với Gemini 3.5 Transcribe Live bị giới hạn ở 10 phút mỗi phiên
Dòng cuối cùng đó là chi tiết vận hành quyết định nhiều kiến trúc hơn cả những con số về độ chính xác. Mức trần 10 phút cho một phiên trực tiếp nghĩa là các cuộc gọi dài, cuộc họp dài và luồng phát trực tiếp dài đều phải bị cắt khúc rồi thiết lập lại, và mỗi lần thiết lập lại là một mối nối nơi ngữ cảnh bị đánh mất. Endpoint streaming của Grok mang mức trần kích thước tệp 500 MB trên đường xử lý theo lô và giới hạn đồng thời 100 phiên cho mỗi nhóm trên đường streaming, một kiểu ràng buộc khác — thông lượng chứ không phải thời lượng.
Cách tính phí theo token đáng để tìm hiểu trước khi bạn chốt về phía Google, vì nó biến hóa đơn của bạn thành hàm của hai biến thay vì một. Gemini tính phí riêng cho đầu vào âm thanh và đầu ra văn bản, nên một model tạo định dạng dài dòng hoặc lặp lại sẽ tốn hơn model không làm vậy, và một ngôn ngữ có từ dài hơn sẽ tốn hơn ngôn ngữ có từ ngắn hơn. Mức phí cố định theo giờ của Grok không thay đổi theo bất kỳ điều nào ở trên. Với khối lượng công việc lớn, mức phí cố định dễ dự báo hơn, và vì OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức markup 0%, thay đổi từ phía một trong hai nhà cung cấp sẽ đến hóa đơn của bạn ngay ngày diễn ra thay vì vào lần gia hạn hợp đồng tiếp theo.

Các dạng tính năng: mỗi dạng từ chối làm điều gì
Danh sách năng lực khác biệt nhiều hơn mức mà các con số độ chính xác gợi ý, và những lỗ hổng nằm ở đúng những chỗ quan trọng đối với từng ứng dụng cụ thể:
• Phân tách người nói — được bao gồm không mất thêm chi phí trên Grok Voice Transcribe 2.0; không được hỗ trợ trên Gemini 3.5 Transcribe Live, do đó, bản ghi trực tiếp có gán nhãn người nói hoàn toàn không có sẵn trên endpoint đó
• Dấu thời gian ở cấp độ từ — Grok Voice Transcribe 2.0 trả về chúng kèm điểm tin cậy cho từng từ; Gemini 3.5 Transcribe Live không trả về gì, điều này loại trừ việc ngưỡng hóa độ tin cậy và căn chỉnh phụ đề chính xác
• Âm thanh đa kênh — Grok Voice Transcribe 2.0 phiên âm tối đa 8 kênh độc lập trong một lần chạy; Gemini 3.5 Transcribe Live không có tính năng tương đương, vì vậy các bản ghi cuộc gọi đa kênh cần phiên riêng cho từng kênh
• Thiên lệch theo thuật ngữ khóa — Grok Voice Transcribe 2.0 chấp nhận tối đa 100 thuật ngữ chuyên ngành mỗi yêu cầu; Gemini 3.5 Transcribe chấp nhận từ vựng tùy chỉnh và gợi ý ngôn ngữ tùy chọn
• Hạ tầng cho voice-agent — Grok Voice Transcribe 2.0 đã có tính năng loại bỏ từ đệm và phát hiện kết thúc lượt nói bằng Smart Turn; Gemini 3.5 Transcribe Live đáp ứng kịch bản streaming nhưng để logic lượt nói cho ứng dụng tự xử lý
• Xử lý đầu vào — Grok Voice Transcribe 2.0 hỗ trợ tải tệp trực tiếp lên đến 500 MB với 12 định dạng âm thanh; đường dẫn ghi âm sẵn của Gemini 3.5 Transcribe yêu cầu URL HTTPS công khai với giới hạn 15 phút và 300 MB, và không thể kết hợp chế độ Smart formatting của nó với dấu thời gian từ hoặc nhãn người nói
Mô hình trong danh sách đó là SpaceXAI đã xây dựng một sản phẩm phiên âm còn Google đã xây dựng một năng lực phiên âm. Phân tách người nói, dấu thời gian, tách kênh và phát hiện lượt nói là những tính năng bạn cần khi phiên âm chính là toàn bộ ứng dụng; khả năng đặt prompt, độ phủ ngôn ngữ và một API cho mọi thứ là những gì bạn muốn khi phiên âm chỉ là một bước bên trong một ứng dụng lớn hơn. Không danh sách nào tốt hơn một cách trừu tượng, và một đội chỉ chọn dựa trên độ chính xác sẽ bỏ lỡ bộ tính năng mà họ không cần.

Chọn giữa chúng, và điều gì làm thay đổi câu trả lời
Hãy dùng Grok Voice Transcribe 2.0 khi bản ghi phải chính xác trong lúc âm thanh vẫn đang phát: luân phiên lượt nói giữa các nhân viên trực tiếp, phụ đề thời gian thực không được phép sai, các luồng trung tâm liên hệ nơi việc gán nhãn người nói và tách kênh là một phần của yêu cầu, hoặc bất kỳ quy trình xử lý hàng loạt nào mà $1,67 cho mỗi 1.000 phút và thông lượng gấp 162 lần đều quan trọng. Hãy dùng Gemini 3.5 Transcribe khi âm thanh đa ngôn ngữ ở một ngôn ngữ nằm ngoài bộ ngôn ngữ đã được Grok tài liệu hóa, khi bản ghi cấp dữ liệu cho một mô hình cũng phải suy luận về nó, khi bạn muốn có một gói miễn phí để thử nghiệm nguyên mẫu, hoặc khi chỉ số AA-WER 2,6% của luồng xử lý hàng loạt đơn giản là đủ cho việc bạn đang làm và độ phủ ngôn ngữ tăng thêm đáng giá hơn mức chênh lệch giá.
Điều mà hầu hết các nhóm thực sự làm ở đây không phải là chọn một mô hình. Cả hai mô hình đều có thể truy cập được thông qua một khóa API OrcaRouter cùng với hơn 200 mô hình khác, nghĩa là bạn có thể định tuyến lưu lượng tác nhân trực tiếp đến Grok Voice Transcribe 2.0 và các kho lưu trữ đa ngôn ngữ dài đến Gemini 3.5 Transcribe mà không cần duy trì hai hợp đồng nhà cung cấp, hai mối quan hệ thanh toán và hai bộ thông tin xác thực. Đó cũng là cách bạn giải quyết câu hỏi về độ chính xác cho âm thanh của chính mình: chạy cả hai trên cùng các bản ghi, so sánh các bản chép lời mà bạn thực sự nhận được, và để DSL định tuyến gửi lưu lượng đến nơi nó thuộc về. Bảng xếp hạng cho bạn biết mô hình nào thắng trên tám giờ hội thoại tác nhân tiếng Anh của người khác; chỉ âm thanh của chính bạn mới cho bạn biết mô hình nào thắng trên âm thanh của bạn.
Câu hỏi mở vẫn là điều gì sẽ xảy ra với khoảng cách streaming đó khi Google chỉnh sửa endpoint Live trong lần tới. Gemini 3.5 Transcribe Live ra mắt ở bản xem trước công khai và con số 4,0% của nó được đo khoảng một ngày sau khi có thể gọi được — một tín hiệu sớm mạnh mẽ, nhưng chưa có nhiều thời gian để ổn định như con số Grok mà nó hiện đang xếp sau. Nếu Google thu hẹp khoảng cách streaming 1,3 điểm trong khi vẫn giữ độ trễ partial 0,25 giây, thì sự đánh đổi sẽ không còn là đánh đổi nữa và lợi thế của Grok thu hẹp lại chỉ còn giá và tính năng. Cho đến lúc đó, sự phân tách vẫn rạch ròi: các partial nhanh nhất thuộc về Google, những partial chính xác nhất thuộc về SpaceXAI, và không có mô hình nào trên bảng có cả hai.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
