Thẻ tiêu đề hero cho 'Phiên âm thông minh với Gemini 3.5 Transcribe' hiển thị dạng sóng âm thanh chuyển thành văn bản có định dạng, quả địa cầu đánh dấu 85+ ngôn ngữ, chip nhãn người nói, các con số chính 2.6% WER không phát trực tuyến và ~$0.005/phút theo mức giá kết hợp, cùng logo OrcaRouter ở góc dưới bên phải.
Engineering & Research

Phiên âm thông minh với Gemini 3.5 Transcribe

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Gemini 3.​5 Transcribe đã bước vào giai đoạn xem trước công khai vào ngày 26 tháng 8 năm 2026, và đây là mô hình chuyển giọng nói thành văn bản đầu tiên của Go​ogle thực sự được bán như một mô hình G​emini: bạn gọi nó thông qua G​emini API với một mã mô hình, âm thanh được định giá theo token, và Go​ogle trích dẫn chi phí mỗi phút âm thanh trên trang giá của mình. Chi tiết cuối cùng đó là thứ mà các bài viết cho người tiêu dùng lướt qua. Những câu chuyện trong ngày ra mắt xoay quanh việc loại bỏ từ đệm và chỉnh sửa giọng nói trong Gboard, nhưng điều thực sự thay đổi đối với các nhà phát triển là phiên âm giờ đây nằm trên cùng một bề mặt API như phần còn lại của dòng G​emini, với việc gán người nói và dấu mốc thời gian theo từng từ trong mô hình cơ sở thay vì trong một tiện ích bổ sung riêng. Bài viết này đọc giống như một tài liệu tham khảo API, vì đó là khoảng trống mà làn sóng phủ sóng đầu tiên bỏ ngỏ.

Hai lưu ý trước để những con số dưới đây không gây hiểu lầm. Go​ogle không gọi Gemini 3.​5 Transcribe là "mô hình chuyển giọng nói thành văn bản chính xác nhất mà chúng tôi có" — tuyên bố là mô hình chính xác nhất cho các tương tác thoại thông minh, đây là một tuyên bố khác, và sự khác biệt này có ý nghĩa khi bạn đọc các số liệu WER. Và mọi thứ ở đây mô tả bản xem trước công khai: hai ID mô hình, giá cả và các số liệu benchmark là những gì Go​ogle cung cấp hôm nay, và tất cả có thể thay đổi trước khi GA.

Hai đường dẫn API — và các ID mô hình cần nhớ

Gemini 3.5 Transcribe được cung cấp dưới dạng hai endpoint, và việc chọn đúng endpoint là quyết định kiến trúc đầu tiên mà một nhóm phải đưa ra:

• gemini-3-5-transcribe — luồng xử lý bản ghi sẵn qua Interactions API. Gửi một tệp lên, bạn sẽ nhận lại bản phiên âm kèm thông tin gán nhãn người nói (tối đa ba người nói; trên ba người là tính năng thử nghiệm) và mốc thời gian ở cấp độ từ. Đây là công cụ chủ lực cho xử lý hàng loạt và bất đồng bộ.

• gemini-3-5-transcribe-live — đường dẫn thời gian thực qua Live API. Truyền phát hai chiều với độ trễ dưới một giây, hướng tới hội thoại trực tiếp, phụ đề và giao diện điều khiển bằng giọng nói.

Sự phân chia này phản ánh cách bố trí của toàn bộ gia đình G​emini Audio, và điều đó quan trọng vì "live" là một SKU riêng biệt với mức giá riêng. Một số bài đọc sớm về đợt ra mắt này giả định rằng một mẫu máy đảm nhận cả hai chức năng; thực tế không phải vậy.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

'Phiên âm thông minh' thực sự có nghĩa là gì

Bài đăng ra mắt của Go​ogle diễn giải điều này như là việc vượt ra ngoài độ chính xác ngữ âm để hướng tới sự hiểu biết. Các tính năng tiếp nối từ cách diễn giải đó mới là những thứ cần đánh giá, chứ không phải bản thân cách diễn giải:

• Xử lý sự không trôi chảy — các tiếng "um" và "ah" bị loại bỏ, và những lần tự sửa lỗi được giải quyết. "Hãy gặp nhau vào thứ Ba — không, thứ Tư" được phiên âm thành ngày đã được sửa, chứ không phải là bản ghi của một phát ngôn bắt đầu sai. Đó là một quyết định mà mô hình đưa ra, và theo nghĩa đó Google gọi nó là thông minh.

• Tự động định dạng — đầu ra được trả về dưới dạng văn bản trau chuốt: dấu câu, cách viết hoa và cấu trúc đoạn văn được áp dụng, không phải luồng token thô.

• Nhận dạng nhiều người nói — tối đa ba người nói được gán trong bản ghi âm có sẵn với mốc thời gian ở cấp độ từ; từ ba người nói trở lên là thử nghiệm. Tính năng này nằm ngay trong mô hình cơ sở thay vì là một dịch vụ diarization riêng biệt.

• Từ vựng tùy chỉnh — bạn có thể ưu tiên nhận dạng các thuật ngữ chuyên ngành, tên sản phẩm và cách viết bất thường bằng cách cung cấp một từ vựng, đây là cơ chế dành cho các lĩnh vực chuyên sâu.

• Hơn 85 ngôn ngữ — tự động phát hiện, với giọng vùng miền và phương ngữ được nêu rõ ràng.

• Function calling — mô hình có thể ủy thác các tác vụ như tạo hình ảnh hoặc phân tích tệp cho các mô hình G​emini khác, biến việc phiên âm thành một thành phần của một tác nhân lớn hơn thay vì là một bước cuối cùng.

• Trích xuất thực thể — Google khẳng định hiệu suất mạnh mẽ trên âm thanh nhiễu trong thế giới thực và trên các thực thể chữ và số như mã bưu chính và ID đơn hàng.

Báo chí cũng đưa tin về cửa sổ ngữ cảnh 96.000 token (khoảng một giờ âm thanh cuộc họp mà không cần chia nhỏ) và khả năng phát hiện cảm xúc. Cả hai đều khớp với cách giới thiệu khi ra mắt, nhưng thẻ mô hình mà Go​ogle công bố không nêu bật chúng, nên hãy coi chúng là thông tin được báo cáo thay vì đã được xác nhận cho đến khi bảng thông số kỹ thuật GA xuất hiện.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Các số độ chính xác, được gắn nhãn

Các số liệu WER mà Go​ogle trích dẫn đến từ Artificial Analysis: tỷ lệ lỗi từ trung bình là 4,0% cho phiên âm streaming và 2,6% cho phiên âm non-streaming. Trên bộ chuẩn đa ngôn ngữ FLEURS, Go​ogle báo cáo WER 5,50% cho streaming và 5,04% cho non-streaming. Go​ogle cũng tuyên bố cải thiện 70% về thời gian hoàn tất phiên âm so với phiên bản tiền nhiệm Chirp 3.

Cách đọc trung thực: đây là các phép đo độc lập theo nghĩa Artificial Analysis không phải là Google, nhưng chúng là các phép đo do Google lựa chọn, được công bố bên trong thông báo của chính Google, về một mô hình mới chỉ có thể gọi được trong một ngày. Chưa ai bên ngoài Google chạy một bài so sánh trực diện đối kháng với các mô hình trọng số mở mà hầu hết các đội ngũ thường so sánh nó, và các tài liệu ra mắt không chứa bất kỳ so sánh trực tiếp nào với dòng Whisper hay dòng Parakeet của NVIDIA. Con số nhanh hơn 70% so với Chirp-3 chỉ là tuyên bố của nhà cung cấp, hết. Hãy coi 2,6% và 4,0% là các tín hiệu ban đầu mạnh, không phải sự thật đã được xác lập.

Chi phí là bao nhiêu

Trang giá của Google hiển thị từng mô hình theo token và theo số phút âm thanh ước tính. Đối với gemini-3-5-transcribe, mức giá kết hợp ước tính khoảng $0.005 mỗi phút âm thanh theo giá niêm yết — đầu vào khoảng $0.003/phút, đầu ra khoảng $0.002/phút. Đối với gemini-3-5-transcribe-live, mức giá kết hợp ước tính khoảng $0.009 mỗi phút. Cả hai đều có bậc miễn phí hiện nay.

Những con số theo phút đó được ước tính từ tốc độ token giả định (25 token âm thanh mỗi giây đầu vào, 175 token văn bản mỗi phút đầu ra), vì vậy chúng sẽ thay đổi nếu Go{{1}}​{{/1}}ogle thay đổi cách hạch toán token. Điều vững chắc là nguyên tắc: giá niêm yết chính là giá. Đó chính xác là nguyên tắc mà bộ định tuyến chuyển tiếp giá như OrcaRouter vận hành — markup 0%, giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn — vì vậy nếu Go{{1}}​{{/1}}ogle giảm giá phiên âm trong giai đoạn từ bản xem trước đến GA, mức giảm sẽ có hiệu lực phía chúng tôi ngay trong ngày, chứ không phải sau khi một nhà phân phối cập nhật bảng giá.

Nơi nó đang được triển khai

Đối với nhà phát triển, bản xem trước công khai hôm nay có nghĩa là hai bề mặt: {{1}}G​emini API trong Go​ogle AI Studio{{/1}} và {{2}}G​emini Enterprise Agent Platform{{/2}} cho khối lượng công việc doanh nghiệp. Về phía người dùng, {{3}}Gemini 3.​5 Transcribe{{/3}} đã hỗ trợ tính năng đọc chính tả {{4}}Rambler{{/4}} trong {{5}}Gboard trên Android{{/5}} và {{6}}ứng dụng G​emini trên macOS{{/6}}. Tiếp theo là {{7}}Chrome{{/7}} — {{8}}nói để gõ trong mọi trường nhập liệu trên web{{/8}} — sau đó là {{9}}Search Live{{/9}}, {{10}}G​emini Live{{/10}}, {{11}}Docs{{/11}}, {{12}}Keep{{/12}} và {{13}}Gmail{{/13}}. Đối với một nhóm đang đánh giá nó, câu trả lời thực tế đơn giản hơn: nó có thể gọi được từ mã nguồn ngay hôm nay, bằng tiếng Anh, tại các khu vực nơi {{14}}G​emini API khả dụng{{/14}}.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Điều này có ý nghĩa gì đối với pipeline của bạn

Điều thực sự mới mẻ không phải là một con số WER. Mà là việc Go​ogle giờ bán dịch vụ phiên âm kèm hai tính năng mà trước đây các nhóm phải tự lắp ghép — nhãn người nói và timestamp theo từng từ — ngay trong mô hình cơ sở, trên một API G​emini hỗ trợ function calling. Nếu bạn từng dựng một pipeline ghi chú cuộc họp có phân tách người nói từ một bộ phiên âm đơn thuần cộng một bộ phân tách người nói riêng cùng một bước định dạng, thì đây là mô hình Go​ogle đầu tiên gộp tất cả các bước đó lại. Câu hỏi bỏ ngỏ là mức WER 2,6% ở chế độ non-streaming có trụ vững với audio của chính bạn hay không, và cho đến khi có một bản tái lập độc lập được công bố, động thái có trách nhiệm của một nhóm sản xuất là chạy thử một mẫu thật qua API thay vì dự trù ngân sách theo các benchmark mà Go​ogle lựa chọn. Với khối công việc LLM chạy trên bản phiên âm — tóm tắt, trích xuất có cấu trúc, các mục hành động — đó là tầng mà định tuyến chứng tỏ giá trị của nó, và cũng là tầng mà OrcaRouter bao phủ: một API cho hơn 200 mô hình, tự động failover giữa các nhà cung cấp, và một DSL định tuyến ghép nhiều mô hình thành một lời gọi duy nhất. Còn riêng bước phiên âm, bạn nên tự kiểm thử bằng audio của mình trước khi tin vào con số giật tít của bất kỳ ai.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube