Thẻ tiêu đề hero cho 'Gemini 3.5 Transcribe so với Whisper Large v3 Turbo' với phụ đề 'đường cơ sở có cần được thay thế không?', hiển thị thẻ API được quản lý ở bên trái có nhãn Gemini 3.5 Transcribe với WER 2,6% không streaming và thẻ trọng số mở ở bên phải có nhãn Whisper Large v3 Turbo với LibriSpeech clean 2,1%, kèm huy hiệu MIT và tag 809M, cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Gemini 3.5 Transcribe so với Whisper Large v3 Turbo: liệu đường cơ sở có cần được thay thế?

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Whisper Large v3 Turbo là mô hình mà cụm từ "speech-to-text" mặc định hướng đến trong phần lớn ngành công nghiệp, còn Gemini 3.​5 Transcribe là mô hình phiên âm đầu tiên của Go​ogle được tiếp thị một cách tường minh như một đối thủ cạnh tranh với chuẩn cơ sở đó thay vì chỉ là một API giọng nói thông thường. Gemini 3.​5 Transcribe, đang trong giai đoạn xem trước công khai kể từ ngày 26 tháng 8 năm 2026, định hình lại phiên âm thành một tác vụ suy luận — nó xử lý các lần tự sửa, định dạng đầu ra, gán nhận diện người nói và tự gọi các mô hình G​emini khác. Whisper Large v3 Turbo là bản chưng cất 809 triệu tham số của Ope​nAI từ Whisper Large-v3, được cấp phép MIT, có thể tự lưu trữ, hỗ trợ 99 ngôn ngữ và nhanh hơn khoảng bốn đến tám lần so với mô hình gốc tùy thuộc vào phần cứng. Một bên là lớp trí thông minh được quản lý trên nền âm thanh; bên còn lại là một thành phần miễn phí, được hiểu rõ mà bạn có thể chạy ở bất cứ đâu. Câu hỏi trang này ra đời để trả lời hẹp hơn và hữu ích hơn câu hỏi "cái nào tốt hơn": khi nào chuẩn cơ sở không còn đủ tốt?

Đường cơ sở, phòng khi bạn quên nó tốt đến mức nào

Whisper Large v3 Turbo xứng đáng với trạng thái mặc định của nó, vì vậy luận điểm ủng hộ nó sẽ được trình bày trước:

• Nó chạy ở bất cứ đâu — giấy phép MIT, trọng số mở, cài đặt được trên máy tính xách tay, một GPU duy nhất hoặc một hàm serverless. Không ràng buộc nhà cung cấp, không tính phí theo mức sử dụng, không dữ liệu rời khỏi mạng của bạn.

• Nó nhanh — bộ giải mã đã chưng cất (32 lớp encoder, 4 lớp decoder, giảm từ 32) khiến nó nhanh hơn khoảng bốn lần so với Whisper Large-v3 trên phần cứng thông thường, nhanh hơn nữa trên một số loại, đồng thời giữ được phần lớn độ chính xác. Con số của chính OpenAI là khoảng tám lần trên A100.

Nó hỗ trợ phiên âm cho 99 ngôn ngữ, nhiều hơn con số 85+ của Gemini 3.5 Transcribe.

• Độ chính xác của nó được ghi nhận rõ ràng: 2.1% WER trên LibriSpeech test-clean, 4.2% trên test-other, 9.1% trên Common Voice English — những con số đã được tái lập trong cộng đồng suốt nhiều năm.

• Hệ sinh thái vô cùng rộng lớn — faster-whisper, whisper.cpp, ONNX exports, và mọi framework suy luận bạn đang sử dụng. Nếu bạn có thể chạy một mô hình, bạn có thể chạy được mô hình này.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

Đối với việc phiên âm hàng loạt tiếng Anh và gần tiếng Anh ở quy mô lớn, Whisper Large v3 Turbo là lựa chọn đương nhiệm vì những lý do mang tính cấu trúc mà không một khoảng cách điểm chuẩn nào có thể dễ dàng lật đổ: nó miễn phí, nó là của bạn, và nó có mặt ở khắp mọi nơi.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Những gì Gemini 3.5 Transcribe bổ sung thêm

Giá trị của kẻ thách thức có quản lý không nằm ở việc nó vượt qua đường cơ sở trên tiếng Anh chuẩn — đó là một cuộc chiến mà con số thậm chí chưa thể phân định rõ ràng. Giá trị của nó nằm ở công việc diễn ra phía trên ngôn từ, điều mà Whisper hoàn toàn không làm:

• Gán nhận diện người nói — hỗ trợ tối đa ba người nói kèm dấu thời gian ở cấp độ từ, trong mô hình cơ sở. Whisper phiên âm một luồng lời nói duy nhất; nó không có khái niệm về việc ai nói điều gì.

Định dạng thông minh — loại bỏ những chỗ nói ngập ngừng, xử lý các lần tự sửa, áp dụng dấu câu và viết hoa. Whisper trả về nguyên văn lời nói, kể cả những tiếng ậm ừ.

• Từ vựng tùy chỉnh — thiên về biệt ngữ và cách viết bất thường. Whisper không có cơ chế như vậy; bạn phải xử lý hậu kỳ hoặc tinh chỉnh.

• Function calling — bản ghi có thể được chuyển giao cho các mô hình Gemini khác, biến việc phiên âm thành một bước trong agent pipeline thay vì là đầu ra cuối cùng.

• Phiên dài — khoảng một giờ âm thanh trong một lần xử lý (bối cảnh 96K theo báo chí đưa tin) so với nhu cầu thực tế của Whisper là phải chia nhỏ và ghép nối các tệp dài.

Đó là một sản phẩm khác. Đó là cái mà Google gọi là "phiên âm thông minh," và là phần của sự so sánh không phụ thuộc vào phép toán điểm chuẩn.

Câu hỏi về độ chính xác mà chưa ai có thể trả lời rõ ràng

Các con số nổi bật của hai mô hình thực ra không đối đầu trực tiếp với nhau. Chỉ số non-streaming WER 2,6% của Gemini {{1}}3.​5{{/1}} Transcribe là một phép đo của Artificial Analysis được Go{{2}}​{{/2}}ogle trích dẫn, tính trên hơn 85 ngôn ngữ. Còn mức 2,1% trên LibriSpeech test-clean của Whisper Large v3 Turbo là một chỉ số benchmark tiếng Anh trong bài báo về chưng cất (distillation) của chính Ope{{3}}​{{/3}}nAI, đã được tái lập rộng rãi. Ngữ liệu khác nhau, độ phủ ngôn ngữ khác nhau, nhà cung cấp khác nhau. Điều có thể nói một cách trung thực là: trên tiếng Anh sạch, mô hình nguồn mở đối chứng và mô hình quản lý thách thức có vẻ tương đương nhau, và lợi thế của mô hình quản lý nằm ở các tính năng đa ngôn ngữ và cấu trúc, chứ không phải ở một chiến thắng WER tiếng Anh đã được chứng minh. Tài liệu ra mắt của Go{{2}}​{{/2}}ogle không có cuộc đối đầu trực tiếp nào với các mô hình họ Whisper, và một phép so sánh đối kháng độc lập vẫn chưa tồn tại vì Gemini {{1}}3.​5{{/1}} Transcribe mới công khai được một ngày. Cho đến khi điều đó xuất hiện, ngôi vương độ chính xác vẫn chưa có chủ, và bất kỳ bài viết nào — kể cả bài này — tuyên bố một bên thắng WER dựa trên hai con số này đều là quá đà.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Chi phí: miễn phí để chạy so với $0.005 mỗi phút

{{1}}Whisper Large v3 Turbo{{/1}} có chi phí phần cứng và không có đồng hồ tính phí. Chạy nó trên một GPU bạn đã có sẵn thì chi phí cận biên cho mỗi phút phiên âm gần như bằng không; còn nếu thuê GPU thì chi phí chính là giá của instance trong thời gian nó hoạt động. {{2}}Gemini 3.​5 Transcribe{{/2}} tính phí khoảng $0,005 mỗi phút âm thanh ở mức giá gộp, SKU live thì khoảng $0,009 mỗi phút và có một bậc miễn phí. Với một nghìn giờ âm thanh, con số đó vào khoảng $300 tính theo đồng hồ của {{KEEP}}G​emini{{/KEEP}}, so với vài đô la thời gian GPU trên baseline nguồn mở. Khoảng cách đó chính là câu chuyện chi phí thực sự của cuộc đối đầu này, và đó là lý do vì sao baseline sẽ giữ vị thế mặc định cho các tác vụ xử lý hàng loạt tiếng Anh khối lượng lớn trong một thời gian dài. Bài toán kinh tế của mô hình được quản lý chỉ khép lại khi các tính năng nó gói kèm — diarization, định dạng, kiểm soát từ vựng — tự chúng cũng sẽ tốn thời gian kỹ thuật của bạn để lắp ráp trên nền Whisper.

Ngôn ngữ và phát trực tuyến

Whisper Large v3 Turbo liệt kê 99 ngôn ngữ so với 85+ của Gemini, nhưng câu chuyện đa ngôn ngữ thực tế lại khác: Whisper phiên âm tất cả 99 ngôn ngữ trong một lần mà không cần tự động phát hiện, và độ chính xác của nó giảm nhiều nhất đối với các ngôn ngữ ít tài nguyên và nhiều nhiễu — đây là sự đánh đổi của một mô hình chưng cất (distilled). Gemini tự động phát hiện trong số 85+ ngôn ngữ của mình và Google nhấn mạnh các trọng âm và phương ngữ vùng miền. Đối với phát trực tuyến, Whisper không có mô hình thời gian thực gốc; các triển khai thời gian thực sử dụng faster-whisper và các framework tương tự trên phần cứng của bạn, trong khi Gemini 3.5 Transcribe có một endpoint trực tiếp được thiết kế riêng với độ trễ dưới một giây được công bố và mức giá tương ứng. Nếu khối lượng công việc của bạn là trực tiếp và đa ngôn ngữ, endpoint được quản lý sẽ đơn giản hơn để vận hành; nếu là xử lý hàng loạt và tiếng Anh, mô hình nền mở sẽ rẻ hơn.

Phán quyết, dù sao đi nữa

Whisper Large v3 Turbo vẫn là lựa chọn mặc định phù hợp cho việc phiên âm tiếng Anh hàng loạt ở quy mô lớn, cho bất cứ thứ gì phải chạy trên hạ tầng của chính bạn, và cho các đội ngũ muốn một artifact đóng băng, có thể kiểm toán. Gemini 3.​5 Transcribe là lựa chọn đúng khi bản phiên âm cần phải vượt trên cả lời nói — nhãn người nói, định dạng gọn gàng, từ vựng chuyên ngành, phạm vi đa ngôn ngữ, hoặc một agent hook — và khi bạn sẵn sàng trả tiền theo mức sử dụng cho những tính năng đó. Cả hai cùng tồn tại, và mô hình giúp sự cùng tồn tại đó trở nên rẻ chính là ranh giới định tuyến: bộ phiên âm phù hợp với audio, rồi đến lớp LLM quyết định điều gì xảy ra với văn bản. Lớp đó chính là thứ mà OrcaRouter vận hành — một API trên 200+ mô hình, tự động chuyển đổi dự phòng giữa các nhà cung cấp, và một DSL định tuyến để kết hợp nhiều mô hình trong một lần gọi. Cả hai mô hình nhận dạng giọng nói đều không được lưu trữ phía chúng tôi; lựa chọn phiên âm nằm giữa GPU của bạn và đồng hồ tính phí của Go​ogle, và cả hai sẽ còn tồn tại lâu dài.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube