Thẻ hero của bài viết với nội dung 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo', cùng nhãn 'SO SÁNH MÔ HÌNH' và tiêu đề phụ 'Điều mà bản cơ sở miễn phí vẫn làm tốt hơn', với các chip hiển thị 2.7% so với 4.07% WER, $0.20 mỗi giờ so với trọng số MIT, 0.49 giây so với 1-5 giây, tự lưu trữ và được quản lý so với sở hữu riêng, trên nền chuyển sắc từ trắng sang xanh dương với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Grok Voice Transcribe 2.0 so với Whisper Large v3 Turbo: Baseline miễn phí vẫn làm tốt hơn ở điểm nào

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Whisper Large v3 Turbo đã là câu trả lời mặc định cho câu "chúng ta cần chuyển lời nói thành văn bản" kể từ khi nó được phát hành theo giấy phép MIT vào ngày 1 tháng 10 năm 2024, và không có gì ở Grok Voice Transcribe 2.0 làm thay đổi lý do vì sao lại như vậy. Mô hình mới của SpaceXAI, ra mắt ngày 18 tháng 9 năm 2026, thực sự là một công cụ chuyển lời nói thành văn bản tốt hơn hẳn, với cách biệt lớn — tỷ lệ lỗi từ 2.7% đối với bản chép lời cuối cùng và 3.4% đối với các bản chép một phần đầu tiên trên bảng AA-WER Streaming của Artificial Analysis, so với con số 4.07% của dòng Whisper trên bảng không streaming, trong khi bản thân Turbo thường kém hơn vài phần mười điểm phần trăm so với Large v3 đầy đủ mà nó được chưng cất từ đó. Nó cũng được định giá $0.10 mỗi giờ âm thanh cho xử lý theo lô và $0.20 mỗi giờ cho streaming. Whisper Large v3 Turbo là một tệp 1.6 GB với 809 triệu tham số, chạy trên phần cứng của riêng bạn, không đo đếm gì, không gửi âm thanh đến bất kỳ đâu, và không có giới hạn tốc độ, không có giới hạn đồng thời và không có lịch ngừng hỗ trợ. Sự so sánh không phải là giữa một mô hình tốt hơn và một mô hình kém hơn. Mà là giữa việc thuê độ chính xác và việc sở hữu một thành phần.

Cửa sổ ba mươi hai giây chính là toàn bộ kiến trúc

Whisper Large v3 Turbo kế thừa cấu trúc của mọi mô hình Whisper: âm thanh được xử lý theo các cửa sổ cố định 30 giây, bộ mã hóa chạy một lần cho mỗi cửa sổ, và bộ giải mã xuất văn bản cho phân đoạn đó. Turbo đã khiến việc đó rẻ hơn — bốn lớp giải mã thay vì ba mươi hai, nhanh hơn khoảng 8× so với Large v3, VRAM khoảng 6 GB thay vì 10 — nhưng nó không thay đổi hình dạng. Không có khái niệm "câu cho đến thời điểm này" bên trong mô hình, bởi vì không có trạng thái được lưu giữ xuyên suốt các cửa sổ.

Chỉ một sự thật thiết kế duy nhất đó lý giải mọi thứ về sau. Không có streaming gốc, vì streaming đòi hỏi phải cam kết tạo đầu ra từng phần ngay giữa lời nói và mô hình không có cơ chế nào để làm điều đó. Các triển khai Whisper thời gian thực vẫn tồn tại, nhưng chúng là chia đoạn cộng với phát hiện hoạt động giọng nói cộng với một lớp ghép nối mà ai đó đã viết và hiện đang duy trì, và độ trễ sinh ra từ pipeline đó được đo bằng giây thay vì nửa giây mà Grok Voice Transcribe 2.0 đạt được. Không có phân tách người nói, vì phân tách là một bài toán riêng về ai đang nói chứ không phải điều được nói. Và biến thể Turbo cụ thể trả về văn bản thuần — không có dấu thời gian, không có điểm tin cậy, không có chuẩn hóa văn bản nghịch đảo để biến các số và địa chỉ email được nói thành dạng viết.

Grok Voice Transcribe 2.0 được xây dựng theo cách ngược lại. Streaming là hình thức truyền tải chính, batch chỉ là chính bộ trọng số đó nằm sau một REST endpoint, và danh sách tính năng đọc lên như một bản liệt kê những thứ Whisper giao lại cho ứng dụng tự xử lý: mốc thời gian ở cấp từ kèm độ tin cậy cho từng từ, phân tách người nói được tích hợp sẵn không tốn thêm chi phí, phiên âm đa kênh trên tối đa 8 kênh độc lập, thiên lệch theo thuật ngữ khóa với tối đa 100 thuật ngữ chuyên ngành mỗi yêu cầu, chuẩn hóa văn bản nghịch đảo trên 25 ngôn ngữ, loại bỏ từ đệm, và phát hiện kết thúc lượt nói Smart Turn cho voice agent. Nếu bạn từng phải duy trì một pipeline chia đoạn và ghép nối quanh Whisper, thì danh sách đó chính là bản mô tả đoạn mã bạn đã viết.

Khoảng cách về độ chính xác, và lý do vì sao nó nhỏ hơn vẻ bề ngoài

• Độ chính xác bản chép lời cuối cùng (streaming) — Grok Voice Transcribe 2.0 đạt 2.7% WER trên AA-WER Streaming so với việc không có mục Whisper Large v3 Turbo, vì mô hình không thể stream một cách native

Độ chính xác theo lô — Grok Voice Transcribe 2.0 đạt 2,29% AA-WER so với Whisper Large v3 ở mức 4,07% trên bảng xếp hạng không streaming của Artificial Analysis, với Turbo thường thấp hơn 0,4 đến 0,6 điểm so với bản Large v3 đầy đủ trong các thử nghiệm độc lập

• Âm thanh tiếng Anh sạch — Whisper Large v3 Turbo đạt khoảng 2,1% WER trên LibriSpeech test-clean và khoảng 4,2% trên test-other, vì vậy với giọng nói chất lượng phòng thu, khoảng cách so với API tiên tiến thu hẹp đến mức gần như bằng không

• Âm thanh thực tế — các benchmark độc lập tương tự đánh giá Turbo ở mức khoảng 4,6% trong các cuộc gọi công việc có hai người nói và 8–12% trên âm thanh nhiễu, đây chính là điểm mà lợi thế của mô hình tiên phong bắt đầu nới rộng.

• Thông lượng theo lô — Grok Voice Transcribe 2.0 đạt khoảng 162× thời gian thực so với Whisper Large v3 Turbo ở mức khoảng 80× trên một GPU tiêu dùng khiêm tốn duy nhất, với phần cứng phục vụ nhanh hơn có thể đạt gấp nhiều lần mức đó

• Độ trễ truyền phát — 0,49 giây để có kết quả từng phần đầu tiên trên Grok Voice Transcribe 2.0 so với 1–5 giây đối với các pipeline truyền phát Whisper tự vận hành, vốn là mã keo cộng với VAD chứ không phải năng lực của mô hình

Cách đọc trung thực về danh sách đó là lập luận về độ chính xác để trả tiền là có thật nhưng có điều kiện. Với tiếng Anh sạch, một người nói, được ghi âm tốt, Whisper Large v3 Turbo đủ gần đến mức sự khác biệt hiếm khi thay đổi kết quả. Trên điện thoại 8 kHz, âm thanh tổng đài ồn ào, giọng nói mang trọng âm và các cụm từ ngắn đặc thù theo lĩnh vực — đúng những tập dữ liệu mà SpaceXAI đã tinh chỉnh 2.0 dựa trên, nơi các số liệu do chính họ công bố chuyển từ 10,6% xuống 7,1% trên điện thoại và từ 20,6% xuống 6,8% trên các lệnh ngắn đa ngôn ngữ — khoảng cách trở thành sự khác biệt giữa một bản ghi mà bạn có thể dùng để định tuyến và một bản ghi mà bạn phải đọc. Đó là các số liệu do công ty báo cáo trên âm thanh của công ty, chưa được bất kỳ ai bên ngoài SpaceXAI tái tạo, và hướng mà chúng chỉ ra nhất quán với mọi thử nghiệm độc lập về Whisper trên âm thanh bị suy giảm chất lượng.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

So sánh chi phí không phải là $0,10 so với $0

Giấy phép của Whisper chẳng tốn đồng nào; nhưng vận hành nó thì có. Một instance GPU chứa mô hình 1,6 GB trong 6 GB VRAM và phiên âm với tốc độ khoảng 80 lần thời gian thực mới chính là khoản chi phí thực sự, và với mức giá GPU đám mây thông thường, con số đó rơi vào cùng bậc độ lớn với các API được host cho khối lượng công việc liên tục — với ngoại lệ quan trọng là bạn vẫn phải trả tiền cho năng lực tính toán dù âm thanh có chạy qua hay không. Các endpoint Whisper được host tồn tại với đủ mức giá, từ dưới 1,20 USD cho 1.000 phút ở đầu rẻ nhất cho đến vài đô la, và sự chênh lệch này là một lời nhắc hữu ích rằng "Whisper" là một mô hình, chứ không phải một mức cam kết dịch vụ. Bảng giá chuẩn hóa của Artificial Analysis xếp các endpoint Whisper Large v3 được host rẻ nhất ở mức 0,50 USD và 1,15 USD cho 1.000 phút, cả hai đều thấp hơn mức giá theo lô 1,67 USD của Grok Voice Transcribe 2.0 — nhưng không endpoint nào trong số đó là của bạn, và cả hai đều đi kèm giới hạn tốc độ cùng chính sách lưu trữ của người khác.

Nơi việc tự vận hành thắng áp đảo là ở khối lượng với dạng bùng nổ từng đợt. Một kho lưu trữ nội dung nghe nhìn mười nghìn giờ tốn cùng một chi phí trên GPU của riêng bạn dù bạn xử lý trong một tuần hay một năm, và không có đồng hồ tính theo giờ nào chạy trong lúc bạn quyết định. Một pipeline tuân thủ mà không bao giờ được gửi âm thanh ra ngoài mạng thì không có lựa chọn thay thế dạng dịch vụ thuê ngoài ở bất kỳ mức giá nào, vì yêu cầu này mang tính kiến trúc chứ không phải tài chính. Và việc tinh chỉnh chỉ khả dụng với bạn nếu bạn nắm giữ trọng số: giấy phép MIT của Whisper cho phép bạn lấy mô hình 809M tham số và điều chỉnh nó cho một người nói duy nhất, một giọng duy nhất, hoặc một từ vựng miền hẹp, một năng lực mà không API nào cung cấp ở bất kỳ mức giá nào.

Mặt đối lập là giá của một mô hình được lưu trữ có thể thay đổi ngay dưới chân bạn. SpaceXAI giữ nguyên mức giá khi chuyển từ 1.0 lên 2.0 — một cải tiến mô hình với mức giá không đổi — và MAI-Transcribe-2 của Microsoft có mức giá y hệt $0.10 mỗi giờ âm thanh, điều này cho bạn biết mức sàn của các mô hình tiên tiến nằm ở đâu. Nếu bạn định tuyến qua OrcaRouter, những mức giá niêm yết đó được chuyển nguyên với 0% phụ trội, nên khi nhà cung cấp cắt giảm giá, hóa đơn của bạn nhận được thay đổi ngay trong ngày hôm đó thay vì sau một chu kỳ định giá lại. Đó là một lợi thế thực sự của phía thuê trong phép so sánh này, và đáng để cân nhắc với việc phía miễn phí chẳng bao giờ gửi cho bạn hóa đơn nào cả.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

Mỗi cái thực sự được dùng để làm gì

Hãy giữ Whisper Large v3 Turbo khi âm thanh đã là một tệp, âm lượng cao hoặc không đều, các bản ghi tương đối sạch, và hoặc dữ liệu không thể rời khỏi mạng của bạn hoặc ngân sách không thể chịu nổi mức tính phí theo giờ. Nó vẫn là lựa chọn đúng cho lưu trữ ngoại tuyến, phiên âm ở biên và trên thiết bị, nơi mô hình 1,6 GB được lượng tử hóa xuống để vừa, các pipeline theo lô nơi thông lượng là ràng buộc thay vì độ trễ, và bất kỳ dự án nào nơi tinh chỉnh trên âm thanh của chính bạn là con đường dẫn đến độ chính xác bạn cần. Bộ công cụ xung quanh nó — whisper.cpp cho biên, faster-whisper cho sản xuất, các bản dựng GGUF cho bộ nhớ hạn chế — đã có hai năm được cộng đồng tôi luyện phía sau, một dạng độ tin cậy mà không API hai ngày tuổi nào có được.

Chuyển sang Grok Voice Transcribe 2.0 khi âm thanh vẫn đang được truyền đến, khi các bản ghi bị suy giảm chất lượng, khi bạn cần biết ai đã nói và nói lúc nào, khi từ vựng chuyên ngành phải được định hướng (bias) thay vì tinh chỉnh (fine-tuned), hoặc khi ứng dụng hành động dựa trên bản chép lời một phần trước khi người nói nói xong. Lộ trình nâng cấp chỉ là một tham số trên một tích hợp hiện có và một thao tác ghim phiên bản trở lại 1.0 nếu xảy ra sự cố, điều này khiến việc dùng thử trở nên ít tốn kém. Đáng lưu ý rằng việc di chuyển ngược không hề rẻ: mã được viết dựa trên API streaming có phân tách người nói (diarization) và phát hiện lượt nói (turn detection) không thể chuyển đổi một cách suôn sẻ thành mô hình batch chỉ trả về văn bản thuần, đó là một lý do để kiểm chứng đường dẫn hosted trên một phần âm thanh thực tế của bạn trước khi cam kết đưa một pipeline vào đó.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Nơi quyết định thực sự được đưa ra

Hầu hết các đội ngũ vận hành Whisper ở bất kỳ quy mô nào đều không lựa chọn giữa hai mô hình này, mà đang chạy một giải pháp kết hợp: Whisper cho kho lưu trữ vì nó miễn phí và đủ tốt với âm thanh sạch, một API tiên tiến cho luồng trực tiếp vì không có gì khác truyền trực tuyến ở mức partial WER 3,4%, và một mô hình thứ ba ở hạ nguồn để tóm tắt, phân loại hoặc hành động dựa trên văn bản đầu ra. Bước thứ ba đó chính là nơi sự cồng kềnh thường phát sinh — thêm một hợp đồng nhà cung cấp cho mô hình suy luận, thêm một bộ thông tin xác thực, thêm một hạn mức tốc độ phải theo dõi. OrcaRouter thu gọn lớp đó lại: một khóa duy nhất dùng cho hơn 200 mô hình, tự động chuyển đổi dự phòng khi một nhà cung cấp suy giảm, và một DSL định tuyến nếu bạn muốn gửi cùng một bản ghi qua nhiều mô hình rồi so sánh trước khi chọn một. Bản thân các lệnh gọi phiên âm vẫn đi đến nhà cung cấp mà bạn đã chọn; thứ ngừng nhân lên chính là mọi thứ diễn ra sau đó.

Điều cần để mắt tới ở phía Whisper không phải là một checkpoint mới — dòng họ này chưa hề thay đổi kể từ Turbo, và sự chú ý của OpenAI đã chuyển sang dòng GPT Transcribe. Mà là lớp phục vụ. Mỗi năm, bộ công cụ tự vận hành lại nhanh hơn và phần cứng mà nó cần lại nhỏ hơn, và mỗi cải tiến ở đó đều thu hẹp dần lý do để trả tiền theo giờ. Điều cần để mắt tới ở phía SpaceXAI là việc đảo mặc định: khi 2.0 trở thành mặc định và 1.0 bị ngừng hỗ trợ, mọi tích hợp chưa từng nêu tên model sẽ chuyển dịch cùng một lúc, độ trễ cũng vậy. Cả hai diễn biến đều không làm thay đổi sự phân tách căn bản. Một model bạn sở hữu và tinh chỉnh, một model bạn thuê và gọi, và câu trả lời trung thực rằng hầu hết các stack production rốt cuộc đều chạy cả hai.