Thẻ tiêu đề ghi 'Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate' với phụ đề 'Một bên tung ra một con số, bên kia tung ra một tấm bản đồ'.
Guides & Insights

Qwen3.8-LiveTranslate so với Gemini 3.5 Live Translate: Một bên phát hành một con số, bên kia phát hành một bản đồ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình dịch giọng nói theo thời gian thực hàng đầu không đồng thuận về việc chúng sẵn sàng được đo lường bằng tiêu chí nào, và sự bất đồng đó hữu ích hơn bất kỳ so sánh thông số kỹ thuật nào. Qwen3.8-LiveTranslate, được phát hành ngày 19 tháng 9 năm 2026, dẫn đầu bằng một con số cứng duy nhất: độ trễ trung bình 2,3 giây, giảm từ 2,8 ở thế hệ trước. Gemini 3.5 Live Translate, mô hình giọng nói sang giọng nói của nhà cung cấp được công bố vào tháng 6 năm 2026 và vẫn mang mã mô hình bản xem trước, dẫn đầu bằng độ phủ — hơn 70 ngôn ngữ, tự động phát hiện, chuyển đổi giữa cuộc trò chuyện và tích hợp vào các ứng dụng Translate và Meet của nhà cung cấp. Một công ty công bố một con số độ trễ mà họ có thể bị ràng buộc phải đạt. Công ty kia công bố một con số về số lượng ngôn ngữ. Nếu bạn đang cân nhắc chọn giữa hai mô hình, việc hiểu vì sao đó là hai kiểu cam kết khác nhau quan trọng hơn việc danh sách nào dài hơn.

Hai kiến trúc chỉ đồng thuận về mục tiêu, ngoài ra không đồng thuận gì khác.

Cả hai mô hình đều tồn tại để triệt tiêu cùng một hành vi: kiểu trình phiên dịch theo lượt, vốn chờ bạn nói xong một câu rồi mới nói bất cứ điều gì. Chính khoảng dừng đó là thứ khiến phiên dịch bằng máy mang cảm giác như phiên dịch bằng máy.

Qwen3.8-LiveTranslate đạt được điều đó với kiến trúc Interleave trên nền tảng Hybrid MoE, được chia thành mô-đun Thinker có chức năng gộp âm thanh, video, văn bản nguồn và bản dịch thành một chuỗi nhân quả duy nhất, và mô-đun Talker tái tổng hợp bản dịch theo âm sắc của người nói gốc. Tuyên bố là việc hợp nhất nhận dạng, dịch và tổng hợp thành một chuỗi duy nhất loại bỏ độ trễ và mất mát ngữ nghĩa mà một pipeline ba giai đoạn phải trả giá ở mỗi ranh giới mô-đun.

Gemini 3.5 Live Translate giữ cùng quan điểm end-to-end từ hướng ngược lại: nó được xây dựng trên Gemini 3 Pro dưới dạng một mô hình âm thanh sang âm thanh gốc, truyền phát liên tục qua Gemini Live API thay vì thực thi một chuỗi ASR → MT → TTS rời rạc. Trong thực tế, bạn duy trì một WebSocket song hướng liên tục, đẩy các đoạn âm thanh 100 ms lên và kéo các đoạn âm thanh đã dịch xuống. Không mô hình nào làm điều cũ. Cả hai giờ đều làm điều mới. Những khác biệt đều nằm ở các chi tiết bậc hai.

So sánh độ trễ không phải là một sự ngang bằng như nó trông có vẻ.

Google mô tả Gemini 3.5 Live Translate là "chậm hơn người nói vài giây". Hãng chưa công bố một con số LAAL, hay bất kỳ chỉ số độ trễ có tên, có thể tái lập nào khác, cho mô hình này. Qwen đã công bố 2,3 giây và định nghĩa ý nghĩa của con số đó.

Sự bất đối xứng này thường bị quy gọn thành “cả hai đều vào khoảng hai đến ba giây.” Cách diễn giải đó không được bất kỳ điều gì mà một trong hai công ty đã nói ủng hộ. Cụm từ của Google tương thích với 2 giây và tương thích với 4; công ty chỉ đơn giản là từ chối bị ghim chặt. Phép so sánh thực sự có thể được thực hiện ngày hôm nay là:

Chỉ số độ trễ được công bố — Qwen3.8-LiveTranslate: LAAL 2,3 giây, theo công bố của nhà cung cấp. Gemini 3.5 Live Translate: không công bố.

Đo lường độ trễ độc lập — không có bên nào, đối với cả hai mô hình. Chưa có bên thứ ba nào công bố so sánh trực tiếp.

Kết luận trung thực là về độ trễ, Qwen đã đưa ra một tuyên bố có thể bị chứng minh là sai, còn Google đã đưa ra một tuyên bố mơ hồ. Đó là một điểm có lợi cho Qwen về tính minh bạch và đúng không điểm nào có lợi cho nó về hiệu năng cho đến khi ai đó đo lường cả hai. Nếu độ trễ là yếu tố quyết định đối với việc triển khai của bạn, thì tình trạng bằng chứng hiện tại không ủng hộ quyết định mua hàng theo bất kỳ hướng nào.

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: latency LAAL 2.3s, languages 60 source and 29 spoken, speaker ID real-time diarization, input audio plus image, status generally available, watermark none stated. Gemini 3.5 Live Translate column: latency not published, languages 70-plus supported, speaker ID weak turn-taking, input audio only, status preview, watermark SynthID on all audio. Footer reads 'Qwen figures vendor-reported; Gemini per Google docs. No independent head-to-head.'

60 ngôn ngữ so với hơn 70 là bảng điểm sai

Các con số thống kê về ngôn ngữ được trích dẫn liên tục và chúng gây hiểu lầm theo cả hai hướng.

Qwen3.8-LiveTranslate nhận diện 60 ngôn ngữ nguồn và tạo đầu ra bằng giọng nói ở 29 trong số đó. Gemini 3.5 Live Translate hỗ trợ hơn 70 ngôn ngữ với khả năng tự động phát hiện, và trong Google Meet, con số đó mở rộng lên hơn 2.000 tổ hợp ngôn ngữ, trong khi giới hạn trước đây là dịch dựa trên tiếng Anh sang năm ngôn ngữ.

Hãy đọc kỹ con số thứ hai trước khi coi đó là một thắng lợi gấp ba. Con số hơn 2.000 của Google đếm các cặp có thứ tự — mỗi ngôn ngữ nguồn ghép với mỗi ngôn ngữ đích — đây là một thước đo độ phủ chính đáng và thực sự hữu ích, nhưng không thể so sánh với cách đếm từng ngôn ngữ riêng lẻ. Và danh sách của Google, dù rộng hơn, vẫn nghiêng mạnh về những ngôn ngữ có đông người nói: tiếng Afrikaans, tiếng Ả Rập, tiếng Bengal, tiếng Hà Lan, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Hindi, tiếng Indonesia, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Mã Lai, tiếng Ba Tư, tiếng Ba Lan, tiếng Bồ Đào Nha, tiếng Nga, tiếng Tây Ban Nha, tiếng Swahili, tiếng Tamil, tiếng Telugu, tiếng Thái, tiếng Thổ Nhĩ Kỳ, tiếng Ukraina, tiếng Urdu, tiếng Việt, tiếng Zulu. 29 ngôn ngữ có đầu ra bằng giọng nói của Qwen thậm chí còn hẹp hơn, và danh sách của cả hai nhà cung cấp đều không phải là câu trả lời nghiêm túc cho phần đuôi dài — những phương ngữ khu vực và ngôn ngữ ít tài nguyên, nơi các công cụ phiên dịch xưa nay đã thất bại nặng nề nhất. Cả hai công ty đều nói rằng họ đang giải quyết vấn đề đó. Chưa hãng nào đưa nó ra thị trường.

Nơi hai thứ đó thực sự tách hướng: căn phòng đầy người.

Điểm duy nhất mà các mô hình đưa ra những cam kết thực sự khác biệt là khả năng xử lý nhiều người nói, và đây là khác biệt có khả năng quyết định một triển khai thực tế nhất.

Qwen3.8-LiveTranslate đi kèm tính năng phân tách người nói theo thời gian thực: mỗi câu được gán cho một người nói ngay khi xuất hiện, và việc nhân bản giọng nói được mô tả là ổn định qua các lượt đổi thoại. Qwen tự báo cáo tỷ lệ lỗi phân tách người nói là 9,7% trên bộ kiểm thử dài nhiều người nói của chính mình, so với 30,6% của Seed LiveInterpret 2.0 — đây là so sánh do nhà cung cấp thực hiện trên một đánh giá do nhà cung cấp chạy, nên hãy coi đó là một tuyên bố kèm con số hơn là một kết quả. Mô hình cũng phát ra văn bản nguồn và bản dịch trên cùng một dòng thời gian, điều này giúp có thể tạo phụ đề song ngữ đồng bộ mà không cần một lượt căn chỉnh riêng.

Gemini 3.5 Live Translate lại nhấn mạnh theo hướng ngược lại. Điểm mạnh được ghi nhận của nó là bảo toàn ngữ điệu — giữ nguyên cao độ, nhịp độ, ngữ điệu và sắc thái cảm xúc của người nói, để giọng dịch mang cảm giác của bản gốc. Điểm yếu được ghi nhận của nó nằm đúng ở những chỗ mà phân tách người nói (diarization) sẽ hữu ích: nhân bản giọng nói không nhất quán, có thể trôi lệch sau những khoảng dừng dài hoặc gán nhầm giới tính; khả năng luân phiên lượt nói yếu, không có tín hiệu rõ ràng về kết thúc câu; gặp khó khăn với giọng địa phương nặng và với các cặp ngôn ngữ gần gũi như tiếng Tây Ban Nha và tiếng Bồ Đào Nha; và xử lý tiếng ồn nền chưa hoàn hảo. Google cũng giới hạn các phiên chỉ có âm thanh ở mức 15 phút trừ khi được gia hạn, và đóng dấu mọi luồng âm thanh được tạo bằng thủy vân SynthID hiện chưa thể gỡ bỏ.

Gán nhãn nhiều người nói — Qwen: phân tách người nói theo thời gian thực, công bố DER 9,7%. Gemini: được ghi nhận là yếu trong việc luân phiên lượt nói, không có công bố về phân tách người nói.

Độ trung thực giọng nói — Qwen: tái tạo âm sắc gốc thông qua mô-đun Talker. Gemini: bảo toàn ngữ điệu, cao độ và nhịp điệu; đã ghi nhận hiện tượng lệch khi nhân bản giọng.

Đầu ra song ngữ — Qwen: bản gốc và bản dịch được phát ra trên cùng một dòng thời gian. Gemini: phiên âm đầu vào và đầu ra tùy chọn, được cấu hình theo từng phiên.

Gắn watermark — Qwen: không nêu rõ. Gemini: SynthID trên mọi âm thanh được tạo, không có cách gỡ bỏ.

Độ dài phiên — Qwen: không được nêu rõ. Gemini: giới hạn 15 phút cho các phiên chỉ có âm thanh.

Các loại đầu vào — Qwen: âm thanh và hình ảnh. Gemini: chỉ âm thanh, không có đầu vào văn bản.

Screenshot of Google's own Gemini Live API documentation for live translation, showing the speech-to-speech streaming setup, the supported-language list, and the documented session constraints for the preview model.

Chi phí thực tế để vận hành mỗi thứ

Qwen3.8-LiveTranslate được tính giá theo một triệu token thông qua WebSocket Realtime API. Tại khu vực Singapore: 7,50 USD cho đầu vào âm thanh, 0,55 USD cho đầu vào hình ảnh, 20,00 USD cho đầu ra văn bản, 30,00 USD cho đầu ra âm thanh. Tại Bắc Kinh: 40 ¥ / 3,3 ¥ / 100 ¥ / 160 ¥ mỗi triệu token — tương đương khoảng 5,65 USD / 0,47 USD / 14,13 USD / 22,61 USD. Ngữ cảnh của mô hình là 53.248 token, và giới hạn tần suất là 10 yêu cầu mỗi phút cùng 100.000 token mỗi phút ở cả hai khu vực.

Mức trần 10 RPM đó là con số quan trọng nhất trong bảng giá. Các điều khoản thương mại của Gemini 3.5 Live Translate không được công bố theo cùng một cách, và bản thân điều đó là một tín hiệu về độ chín muồi: Google đang phân phối nó thông qua Live API và AI Studio ở dạng bản xem trước công khai, Google Meet ở dạng bản xem trước riêng tư cho một số khách hàng Workspace được chọn, và ứng dụng Translate trên Android và iOS. Giá của bản xem trước và giới hạn tốc độ của bản xem trước có thể thay đổi mà không cần thông báo, và Google chưa cam kết một ngày GA.

Vậy nên, so sánh chi phí hiện tại là giữa một mô hình có giá được công bố và mức trần đồng thời cứng, và một mô hình không có giá được công bố cùng mức trần không xác định. Nếu bạn cần lập mô hình kinh tế đơn vị trong quý này, chỉ một trong số đó là có thể đưa vào ngân sách.

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint and the published per-million-token pricing for audio input, image input, text output and audio output.

Một cuộc kiểm tra độc lập sẽ phải cho thấy điều gì

Tất cả những điều ở trên đều được xây dựng từ chính thông báo của hai nhà cung cấp, bởi vì chưa có ai chạy thử hai mô hình này đối đầu với nhau. Một kết quả thực sự có thể phân định cuộc so tài này cần bốn thứ, và chưa có thứ nào trong số đó tồn tại:

• LAAL được đo theo cùng một cách trên cả hai mô hình, trên cùng một đoạn âm thanh, trong cùng các cặp ngôn ngữ — con số 2,3 giây của Qwen không thể so sánh với bất cứ điều gì mà Google đã từ chối công bố.

• Tỷ lệ lỗi phân tách người nói trên một kho ngữ liệu đa người nói được chia sẻ, chứ không phải trên bộ Omnilingua-MSpeaker của riêng Qwen.

• Độ ổn định của việc nhân bản giọng nói qua các phiên dài, đây là điểm mà tài liệu của chính Gemini đánh dấu sự trôi dạt và Qwen đưa ra tuyên bố mạnh mẽ nhất.

• Hành vi tại các giới hạn đồng thời — liệu 10 RPM của Qwen có trụ vững dưới tải cuộc họp thực tế hay không và liệu hạn ngạch bản xem trước của Gemini có sống sót khi tiếp xúc với môi trường sản xuất hay không.

Cho đến khi bài kiểm tra đó tồn tại, lập trường có thể bảo vệ được là hẹp: Qwen đã công bố nhiều hơn và hứa hẹn những điều cụ thể hơn; Google có độ phủ ngôn ngữ rộng hơn và dấu chân phân phối mà không một mô hình chỉ có API nào có thể sánh bằng.

Chọn cái nào?

Hãy tập trung vào hình dạng của vấn đề bạn đang gặp, chứ không phải vào bảng điểm, bởi vì bảng điểm vẫn chưa đáng tin.

Nếu khối lượng công việc của bạn mang tính đa bên và việc quy kết quan trọng — phiên âm cuộc họp, một buổi toạ đàm, một phiên toà, bất cứ thứ gì mà việc biết ai đã nói ra một câu đã được dịch là một phần của giá trị — thì Qwen3.8-LiveTranslate là cái duy nhất trong hai cái tuyên bố có năng lực đó, và điểm yếu trong việc luân phiên lượt nói đã được ghi nhận của Gemini cũng chỉ về cùng một hướng. Nếu khối lượng công việc của bạn thuộc dạng đa ngôn ngữ rộng, hướng tới người tiêu dùng và đã nằm trong hệ sinh thái của Google, thì hơn 70 ngôn ngữ của Gemini 3.5 Live Translate cùng sự hiện diện của nó trong ứng dụng Translate và Meet là những lợi thế mà không đối thủ chỉ có API nào sánh được về mặt phân phối.

Nếu bạn đang xây dựng một sản phẩm thay vì mua một bản demo, hãy lưu ý rằng cả hai đều là những chuyên gia hẹp. Cả hai đều không chạy vòng lặp agent, không tóm tắt, và Qwen3.8-LiveTranslate nói rõ rằng nó không hỗ trợ gọi hàm, không có đầu ra có cấu trúc, không có bộ nhớ đệm ngữ cảnh và không hỗ trợ tinh chỉnh. Trình phiên dịch là phần đầu trong pipeline của bạn, không phải toàn bộ pipeline. OrcaRouter hiện tại không phải là nơi để gọi một trong hai mô hình dịch — cả hai đều không có trong danh mục của chúng tôi, và chúng tôi thà nói rõ điều đó còn hơn ngụ ý điều ngược lại. Điều chúng tôi cung cấp là nửa phần ngăn xếp chịu trách nhiệm tiêu thụ bản ghi: một khóa duy nhất dùng cho hơn 200 mô hình ở mức giá niêm yết của nhà cung cấp, không cộng thêm markup nào, để trình tóm tắt, bộ đảm bảo bảng thuật ngữ hoặc agent hạ nguồn đọc bản ghi đó có thể được hoán đổi hoặc chuyển sang dự phòng mà không cần đụng đến hợp đồng với nhà cung cấp thứ hai.

Đáy của nó

Qwen3.8-LiveTranslate và Gemini 3.5 Live Translate tương đồng với nhau đến mức ở những yếu tố cơ bản, khiến hoạt động tiếp thị trở thành điểm khác biệt: một bên công bố con số độ trễ và bảng giá, bên kia công bố bản đồ ngôn ngữ và một hệ sinh thái. Cả hai đều chưa từng được đưa ra kiểm nghiệm độc lập. Phiên bản đáng đọc của cuộc so tài này là phiên bản được viết ra sau khi có ai đó chạy thử cả hai trên cùng một đoạn âm thanh — và với tốc độ phát triển chóng mặt của hạng mục này, điều đó có thể không còn xa.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày