
Grok Voice Transcribe 2.0 so với GPT Transcribe: Cùng mức giá streaming, độ chính xác lại khác
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sự trùng hợp gần như quá hoàn hảo. Trên bảng xếp hạng AA-WER Streaming của Artificial Analysis, Grok Voice Transcribe 2.0 và GPT Live Transcribe — endpoint phiên âm streaming — đều niêm yết ở mức chính xác $3,33 cho mỗi 1.000 phút âm thanh. Grok Voice Transcribe 2.0 của SpaceXAI, phát hành ngày 18 tháng 9 năm 2026, trả về bản phiên âm cuối cùng với tỷ lệ lỗi từ 2,7%, sau 0,49 giây kể từ khi kết thúc giọng nói, và bản phiên âm từng phần đầu tiên ở mức 3,4%. GPT Live Transcribe, ra mắt cùng với GPT Transcribe vào ngày 28 tháng 7 năm 2026, trả về bản phiên âm cuối cùng ở mức 3,9% và bản phiên âm từng phần đầu tiên ở mức 6,3%. Cùng mức giá, với khoảng 1,2 điểm độ chính xác bản phiên âm cuối cùng và 2,9 điểm độ chính xác bản phiên âm từng phần có lợi cho SpaceXAI. Phía batch của cùng cuộc đối đầu này hoàn toàn không phải là sự trùng hợp: GPT Transcribe có giá $4,50 mỗi 1.000 phút so với $1,67 của Grok Voice Transcribe 2.0, mức chênh lệch 63% trên đường xử lý tệp ghi âm.
Hai canh bạc khác nhau về cách phiên âm trở nên tốt hơn
Câu trả lời của OpenAI cho vấn đề độ chính xác là ngữ cảnh. GPT Transcribe và GPT Live Transcribe đều chấp nhận prompt dạng tự do, danh sách từ khóa và danh sách ngôn ngữ dự kiến, và trong các phiên Realtime, những lượt đã được phiên âm trước đó được đưa trở lại làm ngữ cảnh cho những lượt sau. Trên chuẩn đánh giá Context Aware ASR của chính OpenAI, việc điều kiện hóa đó đã nâng độ chính xác ngữ nghĩa của GPT Live Transcribe từ 38,5% lên 44,6% — một con số do nhà cung cấp báo cáo, và là con số đo xem ý nghĩa có được giữ nguyên hay không thay vì đo xem các từ có đúng hay không. Sự đánh đổi mà OpenAI đang đưa ra rất rõ ràng: hãy cung cấp cho mô hình thông tin về những gì nó sắp nghe, và nó sẽ phiên âm trong lĩnh vực của bạn tốt hơn mức mà một mô hình tổng quát có cùng độ chính xác thô sẽ làm.
Câu trả lời của SpaceXAI chính là mô hình. Grok Voice Transcribe 2.0 quả thực có một cơ chế thiên lệch — tối đa 100 thuật ngữ khóa mỗi yêu cầu, mỗi thuật ngữ tối đa 50 ký tự — nhưng đó là một danh sách từ vựng, không phải một prompt. Bạn có thể nói với nó rằng "OrcaRouter" và "Kubernetes" là những từ có thật; bạn không thể đưa cho nó một đoạn văn giải thích rằng đây là một cuộc gọi hỗ trợ về việc hoàn tiền. Thay vào đó, cải thiện độ chính xác trong 2.0 đến từ việc huấn luyện lại: trên các bộ đánh giá bắt nguồn từ dữ liệu sản xuất của chính SpaceXAI, tỷ lệ lỗi từ đã giảm từ 8,7% xuống 3,3% trên âm thanh hội thoại, từ 10,6% xuống 7,1% trên điện thoại 8 kHz, từ 7,2% xuống 3,2% trên thông tin xác thực đọc thành tiếng, và từ 20,6% xuống 6,8% trên các lệnh ngắn trong 19 ngôn ngữ. Đó là những con số của công ty trên chính âm thanh của công ty, chưa được bất kỳ ai bên ngoài công ty tái lập, và chúng mô tả một mô hình đã trở nên giỏi hơn ở bài toán âm học, chứ không phải một mô hình đã trở nên giỏi hơn ở việc được cho biết trước cần mong đợi điều gì.
Khác biệt thực tế lộ ra vào giờ làm việc thứ hai. Một mô hình được điều kiện hóa theo ngữ cảnh có thể tốt hơn hẳn so với mức mà điểm chuẩn thô của nó gợi ý, bởi vì bạn đã cung cấp từ vựng và miền chuyên môn. Nó cũng có thể ảo giác ra chính những từ khóa bạn đã cung cấp: đưa "OrcaRouter" vào prompt và một mô hình không nghe rõ từ đó có thể vẫn tạo ra nó. Một mô hình thiên lệch theo từ khóa chính suy giảm mượt mà hơn, bởi vì việc tạo thiên lệch làm dịch chuyển xác suất của một thuật ngữ thay vì khẳng định rằng nó hiện diện. Cả hai kiểu hỏng hóc này đều không xuất hiện trên bảng xếp hạng, và cả hai sẽ xuất hiện trong nhật ký của bạn.
Các con số, nằm cạnh nhau
• Độ chính xác bản chép lời cuối cùng (streaming) — Grok Voice Transcribe 2.0 đạt 2,7% WER so với GPT Live Transcribe đạt 3,9% trên AA-WER Streaming, cả hai theo Artificial Analysis
• Độ chính xác của kết quả từng phần đầu tiên (streaming) — 3,4% so với 6,3%, khoảng cách lớn nhất trong phép so sánh và là yếu tố quyết định hành vi của voice agent
• Thời gian đến bản ghi cuối cùng — 0,49 giây so với 0,81 giây sau khi kết thúc lời nói, vì vậy mô hình chính xác hơn cũng là mô hình chốt bản ghi cuối cùng nhanh hơn
• Thời gian đến kết quả một phần đầu tiên — 0,49 giây so với 0,26 giây, cột độ trễ duy nhất mà OpenAI thắng hoàn toàn
• Giá streaming — 3,33 USD cho mỗi 1.000 phút đối với cả hai, được chuẩn hóa bởi Artificial Analysis từ mức 0,20 USD/giờ của Grok và 0,017 USD/phút của OpenAI
• Độ chính xác theo lô (không truyền trực tiếp) — Grok Voice Transcribe 2.0 đạt 2,3% AA-WER so với GPT Transcribe đạt 3,31%
• Giá theo lô — 1,67 USD mỗi 1.000 phút so với 4,50 USD mỗi 1.000 phút, từ 0,10 USD/giờ so với 0,0045 USD/phút
• Thông lượng theo lô — khoảng 162× thời gian thực so với khoảng 41× trên cùng một bo mạch
Hãy đọc danh sách đó như hai cột thay vì một kết luận duy nhất. OpenAI thắng về độ trễ của kết quả một phần đầu tiên với cách biệt rõ ràng và cung cấp một cơ chế ngữ cảnh mà Grok không có. SpaceXAI thắng về độ chính xác cuối cùng ở cả hai chế độ, độ chính xác từng phần khi streaming, thông lượng và giá theo lô với cách biệt lớn. Không có cột nào mà GPT Live Transcribe vừa nhanh hơn vừa chính xác hơn Grok Voice Transcribe 2.0; có một cột mà nó nhanh hơn, và đó là cột sớm nhất.

Bạn thực sự đang ở đường dẫn batch nào
Khoảng cách $1,67 so với $4,50 là con số rõ ràng nhất ở đây, và thật đáng để nói chính xác vì sao nó tồn tại. OpenAI đã giảm giá dòng sản phẩm này 25% khi ra mắt GPT Transcribe, từ thời GPT-4o Transcribe, và kết quả là $0,0045 mỗi phút. SpaceXAI giữ nguyên mức giá theo lô ở $0,10 mỗi giờ khi chuyển từ phiên bản 1.0 lên 2.0 — họ cải thiện mô hình và vẫn thu cùng mức giá, một việc khó làm hơn và là tín hiệu tốt hơn về việc thị trường đang đi về đâu. MAI-Transcribe-2 của Microsoft cũng có mức giá y hệt $0,10 mỗi giờ như một ưu đãi có thời hạn, vì vậy mức $1,67 cho 1.000 phút đã trở thành mức sàn của các phòng thí nghiệm tiên phong cho phiên âm theo lô, chứ không phải là con số khuyến mãi của một nhà cung cấp.
Ở mức mười nghìn giờ âm thanh mỗi tháng, khoảng cách đó là khoảng 2.830 đô la so với 450 đô la. Đối với một kho lưu trữ podcast, một tồn đọng bản ghi cuộc gọi, hay một thư viện media đang được phiên âm hồi tố, chênh lệch giá lấn át mọi khác biệt về độ chính xác giữa 2,3% và 3,31% WER. Đối với một streaming agent, nơi hai sản phẩm có cùng chi phí, độ chính xác và độ trễ là những thứ duy nhất còn lại để tranh luận.
Có một khác biệt về cấu trúc đằng sau những mức giá đó đáng để gọi tên: Grok Voice Transcribe 2.0 tính mức giá cố định theo giờ âm thanh, còn GPT Live Transcribe tính theo phút, nhưng Gemini 3.5 Transcribe Live tính theo token cho cả đầu vào âm thanh lẫn đầu ra văn bản. Chỉ một trong ba dịch vụ đó khiến hóa đơn của bạn phụ thuộc vào những gì mô hình chọn để nói. Nếu khối lượng của bạn đủ lớn để việc dự báo trở nên quan trọng, mức giá cố định sẽ dễ bảo vệ hơn trước người ký hóa đơn — và vì OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức markup 0%, một đợt giảm giá từ phía nhà cung cấp như mức 25% của OpenAI sẽ có hiệu lực ngay ở phía chúng tôi trong cùng ngày được công bố, chứ không phải đến kỳ gia hạn tiếp theo.

Điều mà cả hai mô hình đều không phải là
GPT Transcribe và GPT Live Transcribe là hai sản phẩm, không phải một sản phẩm có công tắc chuyển đổi. Mô hình theo lô xử lý các tệp đã hoàn tất, bản ghi từ tệp được truyền trực tuyến và các lượt đã chốt trong phiên Realtime, đồng thời xử lý âm thanh nhanh hơn khoảng 34 lần so với thời gian thực theo chính số liệu của OpenAI — Artificial Analysis đo được 41× trên harness của họ. Mô hình truyền trực tuyến là mô hình đắt hơn ở mức 0,017 đô la mỗi phút và là mô hình có tỷ lệ lỗi trên các bản ghi tạm lớn hơn gấp 10 lần. Chọn OpenAI nghĩa là chọn xem bạn đang gặp vấn đề nào trong hai vấn đề đó, vì endpoint rẻ hơn không thể làm công việc của cái kia.
Grok Voice Transcribe 2.0 là một mô hình với hai phương thức truyền tải: cùng một bộ trọng số phục vụ /v1/stt qua REST cho các tệp lên tới 500 MB và wss://api.x.ai/v1/stt qua WebSocket cho âm thanh trực tiếp, với các kết quả tạm thời được phát ra khoảng mỗi 500 ms. Tốc độ phát trực tuyến chính xác gấp đôi tốc độ xử lý theo lô chứ không phải là một sản phẩm được thiết kế riêng, điều đó có nghĩa là độ chính xác bạn đo được trên âm thanh lưu trữ của mình cũng chính là độ chính xác bạn nên mong đợi khi chạy trực tiếp. Điều đó cũng có nghĩa là không có mô hình thứ hai để đánh giá — một bộ lời nhắc, một bộ thuật ngữ chính, một bộ kỳ vọng.
Mức tương đương tính năng đã khá sát nhưng chưa hoàn toàn đồng nhất. Cả hai đều trả về dấu thời gian ở cấp độ từ; Grok Voice Transcribe 2.0 gắn điểm tin cậy cho từng từ, cho phép bạn đặt ngưỡng cho những đoạn có độ tin cậy thấp thay vì tin tưởng toàn bộ bản ghi như nhau. Cả hai đều thực hiện phân tách người nói, và tính năng này của Grok được bao gồm miễn phí. Cả hai đều xử lý chuẩn hóa văn bản nghịch đảo cho số, ngày tháng, tiền tệ và thông tin liên hệ. Grok Voice Transcribe 2.0 bổ sung tính năng phiên âm đa kênh trên tối đa 8 kênh độc lập, loại bỏ từ đệm và phát hiện kết thúc lượt nói Smart Turn; những bổ sung đặc trưng của GPT Transcribe là điều kiện hóa ngữ cảnh ở cấp độ prompt và, ở phía Realtime, tự động chuyển tiếp các lượt nói trước đó. OpenAI chưa công bố số lượng ngôn ngữ được hỗ trợ cho cả hai mô hình; Grok Voice Transcribe 2.0 ghi nhận hàng chục ngôn ngữ với khả năng chuyển đổi giữa chừng khi ghi âm và định dạng dạng viết trên 25 ngôn ngữ.

Cách quyết định và cách kiểm tra nó
Nếu bạn đang xây dựng một voice agent phải phản hồi trước khi người gọi nói xong, thì cột bản ghi tạm thời (partial transcript) chính là biến quyết định của bạn, và nó phân tách hai mô hình một cách rõ ràng: Grok Voice Transcribe 2.0 chính xác hơn 2,9 điểm ở các đoạn partial nhưng tạo ra chúng chậm hơn 0,23 giây. Hãy chọn SpaceXAI nếu một partial sai còn tệ hơn một partial đến muộn — định tuyến, chuyển cấp, các phản hồi kích hoạt bởi tuân thủ. Hãy chọn OpenAI nếu một partial đến muộn còn tệ hơn một partial sai, và nếu bạn có vốn từ vựng chuyên ngành để nạp vào cơ chế ngữ cảnh nhằm thu hẹp khoảng cách độ chính xác. Sau đó hãy đo cả hai, bởi vì hành vi partial-transcript của cả hai nhà cung cấp trên tám giờ hội thoại tiếng Anh của agent không dự đoán được cái mà mỗi bên sẽ làm với giọng của bạn, codec của bạn và thuật ngữ riêng của bạn.
Nếu bạn đang phiên âm tệp, quyết định sẽ dễ hơn nhiều: 1,67 đô-la so với 4,50 đô-la cho mỗi 1.000 phút và 2,3% so với 3,31% WER, cả hai đều cùng chỉ về một hướng. Lý do duy nhất để tiếp tục dùng GPT Transcribe cho công việc theo lô là nếu cơ chế điều kiện hóa theo ngữ cảnh đang làm được điều gì đó cho âm thanh của bạn mà khoảng cách độ chính xác thô không thể bù đắp — đây là một khả năng có thật với các bản ghi có tính chuyên biệt theo lĩnh vực cao, và là một khả năng có thể kiểm chứng.
Cả hai mô hình phiên âm đều chưa có trong danh mục của OrcaRouter, nên bản thân các lệnh gọi sẽ đi thẳng đến API riêng của nhà cung cấp. Thứ thực sự nằm sau một khóa OrcaRouter là mọi thứ mà bản phiên âm đổ vào: mô hình tác tử, bộ tóm tắt, bộ phân loại, đoạn mã quyết định sẽ làm gì với văn bản đó. Đó chính là nơi hợp đồng thứ hai thường xuất hiện — một nhà cung cấp cho phần giọng nói, một nhà cung cấp khác cho mô hình suy luận trên đó — và điều đó không nhất thiết phải như vậy. Một khóa dùng cho hơn 200 mô hình, tự động chuyển đổi dự phòng nếu một nhà cung cấp suy giảm, và DSL định tuyến nếu bạn muốn gửi một yêu cầu qua nhiều mô hình rồi so sánh trước khi quyết định. Đây là một tuyên bố khiêm tốn hơn so với "chúng tôi định tuyến bản phiên âm của bạn", và đó mới là điều đúng sự thật.
Điều đáng theo dõi là liệu OpenAI có trả lời về độ chính xác thay vì ngữ cảnh hay không. Công ty hiện đã ra mắt hai thế hệ phiên âm trong một năm và một lần cắt giảm giá; cơ chế ngữ cảnh thực sự tạo ra khác biệt, nhưng trên bảng xếp hạng đo lường khả năng phiên âm thô, hiện tại nó đang đứng sau cả SpaceXAI và Microsoft. Nếu GPT Transcribe 2 ra đời với cơ chế ngữ cảnh còn nguyên vẹn và tỷ lệ lỗi được giảm xuống mức 2%, thì so sánh này sẽ đảo chiều ở phía xử lý theo lô chỉ sau một đêm — và mức giá phát trực tuyến, vốn đã tương đương, khiến đây trở thành một cuộc đua đáng theo dõi.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
