Thẻ tiêu đề ghi Qwen3.8-LiveTranslate với phụ đề 'Nửa giây giúp phiên dịch AI đạt tốc độ của con người' và ba ô số liệu: độ trễ trung bình từ 2,8 giây xuống 2,3 giây, 60 ngôn ngữ nguồn, 29 ngôn ngữ đầu ra dạng nói.
Engineering & Research

Gặp gỡ Qwen3.8-LiveTranslate: Nửa giây đưa phiên dịch AI lên nhịp độ con người

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen3.8-LiveTranslate ra mắt ngày 19 tháng 9 năm 2026, và toàn bộ thông báo quy gọn lại thành một phép trừ. Độ trễ trung bình — LAAL, khoảng lệch trung bình giữa lúc một từ rời khỏi miệng người nói và lúc bản dịch của nó tới tai người nghe — giảm từ 2,8 giây ở thế hệ trước xuống còn 2,3 giây. Phiên dịch viên chuyên nghiệp làm việc với khoảng cách tai–miệng vào khoảng 2 đến 3 giây. Đó là toàn bộ câu chuyện: không phải việc một cỗ máy đã trở nên nhanh hơn, mà là độ trễ của nó giờ đây nằm trong dải mà người nghe không còn nhận ra có máy móc nữa. Các số liệu công bố khi ra mắt cho thấy chất lượng dịch FLEURS của thế hệ trước đạt 83,0 xCOMET-XXL; thế hệ này được tuyên bố đạt 85,7. Cả hai con số đều của nhà cung cấp, được tạo ra trên chính thiết lập đánh giá của nhà cung cấp, và chưa có bên độc lập nào tái lập được chúng — đó là lưu ý quan trọng nhất trong bài viết này.

Điều khiến bản phát hành này đáng đọc kỹ hơn cả tiêu đề là cơ chế. Qwen đã không cắt giảm độ trễ bằng cách làm ra một bộ nhận dạng nhanh hơn hay một bộ tổng hợp gọn nhẹ hơn. Nó đã xóa bỏ các đường nối giữa chúng.

Điều thực sự đã thay đổi: các đường nối đã biến mất

Phiên dịch đồng thời cổ điển là một pipeline ba giai đoạn đã được lắp ráp theo cùng một cách suốt một thập kỷ: nhận dạng giọng nói tự động phiên âm luồng âm thanh, dịch máy chuyển đổi bản phiên âm, và chuyển văn bản thành giọng nói đọc to kết quả. Mỗi giai đoạn là một mô hình riêng với ngân sách độ trễ riêng, và mỗi lần chuyển giao đều đánh mất thứ gì đó — ngữ điệu ở giai đoạn đầu, danh tính người nói ở giai đoạn thứ ba, và vài trăm mili giây cố định ở mọi ranh giới nơi một mô-đun phải chờ đủ token để tự tin.

Qwen3.8-LiveTranslate thay thế kiến trúc xếp tầng đó bằng thứ mà nhà cung cấp gọi là kiến trúc Interleave, được xây dựng trên xương sống Hybrid MoE, chia thành hai mô-đun phối hợp với nhau:

Thinker — sắp xếp video, âm thanh, văn bản nguồn và bản dịch thành một chuỗi nhân quả duy nhất, đan xen theo thứ tự thời gian, và tạo ra sự hiểu biết cùng bản dịch theo quy trình đầu-cuối chỉ trong một lượt thay vì ba lượt.

Talker — nhận văn bản đã dịch cùng với âm thanh gốc và tổng hợp giọng nói giữ nguyên âm sắc của người nói nguồn, nhờ đó có thể nhận ra giọng lồng tiếng chính là người đã nói.

Luận điểm kiến trúc cho rằng vì nhận dạng, dịch và tổng hợp cùng chia sẻ một khung mô hình hóa chuỗi duy nhất thay vì truyền thông điệp qua các ranh giới mô-đun, hệ thống không còn phải trả "thuế liên mô-đun" hai lần cho mỗi phát ngôn. Đó là một cách giải thích hợp lý về nguồn gốc của 0,5 giây, và nó cũng đúng kiểu tuyên bố rẻ để khẳng định nhưng đắt để kiểm chứng. Hãy coi đó là lời giải thích của nhà cung cấp, không phải một kết quả đã được thiết lập.

Ba khả năng thực sự mới

Phạm vi ngôn ngữ không thay đổi: 60 ngôn ngữ nguồn được nhận diện, 29 ngôn ngữ có sẵn cho đầu ra bằng giọng nói — số lượng giống hệt Qwen3.5-LiveTranslate. Những bổ sung thú vị đều xoay quanh điều xảy ra khi có nhiều hơn một người đang nói.

Phân tách người nói theo thời gian thực — mỗi câu được gán cho một người nói ngay khi được nói ra, và việc tái tạo âm sắc giọng nói được mô tả là ổn định hơn qua các lượt đổi người nói. Qwen tự báo cáo tỷ lệ lỗi phân tách người nói là 9,7% trên bộ kiểm thử dài có nhiều người nói của riêng mình, so với 30,6% của Seed LiveInterpret 2.0. Cả hai con số đều do Qwen cung cấp.

Bản gốc và bản dịch trong cùng một khung — mô hình xuất ra bản bóc băng gốc và văn bản đã dịch trên cùng một dòng thời gian, chính điều này tạo nên cặp phụ đề song ngữ trên màn hình mà không cần thêm một lượt căn chỉnh thứ hai.

Khử nhập nhằng nhờ ngữ cảnh dài — ngữ cảnh trước đó được giữ lại và mang tiếp về sau, để tên riêng, kính ngữ và thuật ngữ chuyên ngành luôn nhất quán. Đây là điều quan trọng nhất trên thực tế: kiểu thất bại kinh điển của phiên dịch đồng thời không phải là dịch sai một từ, mà là cùng một người lại được thể hiện theo ba cách khác nhau trong một cuộc họp.

Phân tách người nói chính là hạng mục thực sự tạo nên khác biệt ở đây. Gemini 3.5 Live Translate, mô hình giọng nói sang giọng nói thời gian thực mang tính cạnh tranh của Google, đã được ghi nhận là gặp khó khăn với việc luân phiên lượt nói — nó có thể vật lộn để biết khi nào một người nói đã thực sự dừng lại. Qwen đang tuyên bố đặc tính ngược lại như một tính năng. Không công ty nào đã công bố một so sánh đối đầu có thể phân định điều đó.

Screenshot of Alibaba Qwen team's own announcement page for Qwen3.8-LiveTranslate, showing the release headline, the Interleave architecture description with Thinker and Talker modules, and the stated average lagging figure of 2.3 seconds.

Đọc các tuyên bố benchmark một cách trung thực

Qwen được thử nghiệm trên hai bộ, và chúng đáng được tách riêng vì chúng đo lường những thứ khác nhau.

FLEURS, 70 hướng ngôn ngữ — chuẩn đánh giá âm thanh đa ngôn ngữ công khai, được sử dụng rộng rãi. Qwen tuyên bố dẫn đầu so với cả phiên bản tiền nhiệm của mình lẫn những gì hãng gọi là các hệ thống phiên dịch thời gian thực chủ đạo hiện nay về chất lượng dịch, độ trễ trung bình, độ chính xác nhận dạng giọng nói và chất lượng tổng hợp giọng nói. So sánh 85,7 so với 83,0 trên xCOMET-XXL nằm ở đây.

Omnilingua-MSpeaker, 14 hướng ngôn ngữ — bộ đánh giá âm thanh dài nhiều người nói của chính Qwen. Công ty tuyên bố độ trung thực, độ trôi chảy và độ súc tích tốt hơn cùng tỷ lệ lỗi phân tách người nói thấp hơn. Một bộ đánh giá do nhà cung cấp tự xây dựng không phải là vô giá trị, nhưng nó cũng không phải là bằng chứng: nó được thiết kế bởi chính những người có mô hình đang được chấm điểm trên đó.

Tóm tắt trung thực là FLEURS là thật và công khai, nên con số 85.7 ít nhất về nguyên tắc có thể kiểm chứng được; Omnilingua-MSpeaker thì không, nên chiến thắng về diarization vẫn chỉ là một tuyên bố cho đến khi có ai đó chạy lại nó. Không có bên thứ ba nào công bố các con số của Qwen3.8-LiveTranslate tại thời điểm viết bài, và mô hình này mới chỉ vài giờ tuổi.

API tốn bao nhiêu, và một con số sẽ khiến bạn phải trả giá

Qwen3.8-LiveTranslate có trọng số đóng và chỉ chạy qua API. Nó hoạt động qua WebSocket Realtime API dưới mã mô hình qwen3.8-livetranslate-flash-realtime, chứ không qua một endpoint HTTP thông thường. Giá được tính theo mỗi triệu token, và vì token âm thanh có mật độ dày đặc, mức giá niêm yết trông đáng kinh ngạc khi đặt cạnh các mô hình văn bản cho đến khi bạn nhớ ra token âm thanh là gì:

Khu vực Singapore — đầu vào âm thanh $7,50, đầu vào hình ảnh $0,55, đầu ra văn bản $20,00, đầu ra âm thanh $30,00 cho mỗi triệu token.

Khu vực Bắc Kinh — ¥40 cho đầu vào âm thanh, ¥3,3 cho đầu vào hình ảnh, ¥100 cho đầu ra văn bản, ¥160 cho đầu ra âm thanh trên mỗi triệu token, tương đương khoảng $5,65 / $0,47 / $14,13 / $22,61 theo tỷ giá hiện tại.

Ngữ cảnh — tổng cộng 53.248 token, được chia thành tối đa 49.152 đầu vào và tối đa 4.096 đầu ra.

Giới hạn tốc độ — 10 yêu cầu mỗi phút và 100.000 token mỗi phút, giống hệt nhau ở cả hai khu vực.

Giới hạn tốc độ đó chính là con số cần nhấn mạnh. Mười yêu cầu mỗi phút là hào phóng đối với một vài phòng họp, nhưng còn lâu mới đủ cho một triển khai tổng đài chăm sóc khách hàng hay một buổi phát trực tiếp với hàng nghìn luồng đồng thời. Qwen đã giữ giá giao diện gần như không đổi so với thế hệ trước — mức giá ở Bắc Kinh không thay đổi và Singapore rẻ hơn một chút — nhưng một mô hình vốn đã sẵn sàng về mặt kiến trúc để mở rộng quy mô lại được cấp phát như một bản xem trước. Bất kỳ ai đang lên kế hoạch cho lưu lượng sản xuất nên coi mức trần 10 RPM là ràng buộc quyết định, chứ không phải giá trên mỗi token.

Single-column scoreboard for Qwen3.8-LiveTranslate listing average lag (LAAL) 2.3 seconds, languages 60 source and 29 spoken, context 53,248 tokens, input audio plus image, output text plus audio, and weights closed and API-only, with a footer reading 'All figures vendor-reported; no independent replication yet.'

Gọi nó không giống như gọi một mô hình trò chuyện

Realtime API hoạt động theo hướng sự kiện, đây là một mô hình tư duy khác biệt so với một endpoint completion. Bạn mở một socket, nhận session.created, sau đó gửi một sự kiện session.update để cấu hình phiên trước khi bất kỳ âm thanh nào được truyền đi.

target_languagebắt buộc và phải được đặt trước đoạn âm thanh đầu tiên — không có giá trị đích mặc định ngầm định.

source_language là tùy chọn và mặc định là tự động phát hiện.

output_modalities chọn ["text"] cho bản ghi chỉ văn bản hoặc ["text","audio"] cho giọng nói đã dịch.

input_audio_buffer.append mang các khối PCM được mã hóa base64 lên; response.text.deltaresponse.audio.delta được gửi trả xuống, với response.done đánh dấu kết thúc một lượt.

Hai lưu ý thực tế. Thứ nhất, trình duyệt không thể đặt Authorization header trong một bắt tay WebSocket, vì vậy kết nối phải được mở ở phía máy chủ và âm thanh được chuyển tiếp đến máy khách qua socket của riêng bạn — đây không phải là thứ bạn nối trực tiếp vào giao diện người dùng. Thứ hai, Qwen cảnh báo rõ rằng tập tham số và sự kiện khác với thế hệ LiveTranslate trước đó, nên mọi mã được viết cho Qwen3.5-LiveTranslate cần được kiểm tra lại thay vì chỉ trỏ lại. Một endpoint dùng thử miễn phí đang chạy tại omni.qwen.ai/live-translate nếu bạn muốn nghe độ trễ trước khi dành thời gian kỹ thuật.

Những gì nó cố ý không làm

Qwen liệt kê một loạt năng lực là không khả dụng, và danh sách ấy thật sự làm sáng tỏ. Không gọi hàm. Không đầu ra có cấu trúc. Không tìm kiếm web. Không tiếp nối tiền tố, lưu đệm ngữ cảnh, hay suy luận theo lô. Không tinh chỉnh.

Đây là một chuyên gia, không phải một người đa năng đang đóng vai phiên dịch. Nó sẽ không chạy vòng lặp agent của bạn, và cũng sẽ không phải là mô hình tóm tắt cuộc họp. Hãy thiết kế cho phù hợp: trình phiên dịch tạo ra bản ghi chép và luồng âm thanh đã dịch, còn mọi thứ nằm sau đó — bộ trích xuất đầu việc, bộ đảm bảo tuân thủ bảng thuật ngữ, phần ghi ngược vào CRM — là việc của một mô hình văn bản riêng.

Sự phân chia đó chính là nơi một router khẳng định được giá trị của mình. Bản thân Qwen3.8-LiveTranslate có sẵn thông qua API của chính nhà cung cấp và một số nền tảng bên thứ ba; hiện nay nó chưa có trong danh mục của OrcaRouter, và chúng tôi sẽ không giả vờ rằng có. Điều OrcaRouter thực sự cung cấp là toàn bộ hệ sinh thái xung quanh — bao gồm cả mô hình chủ lực Qwen3.8-Max của chính Alibaba, một mô hình mixture-of-experts thưa với 2,4 nghìn tỷ tham số, ngữ cảnh 1 triệu token, với mức giá 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, được tính theo giá niêm yết của nhà cung cấp và không cộng thêm bất kỳ khoản chênh lệch nào. Việc giữ trình phiên dịch và các mô hình tiêu thụ đầu ra của nó phía sau một endpoint và một khóa duy nhất đồng nghĩa với việc pipeline phiên âm không cần thêm hợp đồng thứ hai khi bạn thay mô hình tóm tắt, còn cơ chế chuyển đổi dự phòng tự động sẽ giữ cho nửa hạ nguồn của hệ thống luôn hoạt động khi một nhà cung cấp đơn lẻ gặp trục trặc — và với 10 yêu cầu mỗi phút, đó là một tình huống đáng để lên kế hoạch trước thay vì để rồi phát hiện ra.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

Xem gì tiếp theo

Hai điều sẽ biến bản phát hành này từ một khẳng định được lập luận chặt chẽ thành một sự thật đã được khẳng định. Thứ nhất là một phép đo độ trễ độc lập: LAAL là một chỉ số được định nghĩa rõ ràng, và bất kỳ ai có endpoint thử nghiệm cùng một bộ thiết bị bấm giờ đều có thể tạo ra một con số mà Qwen không phải tác giả. Thứ hai là lộ trình do chính Qwen công bố — tiến gần hơn đến giới hạn độ trễ, bộ nhớ dài hạn xuyên phiên, và độ phủ cho các ngôn ngữ đuôi dài cùng phương ngữ khu vực. Mục đuôi dài chính là điều cần buộc họ phải chịu trách nhiệm, bởi 60 ngôn ngữ nguồn là một con số đáng nể nhưng lại âm thầm loại trừ phần lớn người nói trên thế giới, và khoảng cách giữa một bản demo chạy được với tiếng Quan Thoại lẫn tiếng Anh và một bản chạy được với tiếng Yoruba hay tiếng Quechua chính là nơi các sản phẩm phiên dịch thời gian thực từ trước đến nay thường mắc kẹt.

Hiện tại, quan điểm hợp lý là Qwen3.8-LiveTranslate là mô hình phiên dịch đồng thời đầu tiên mà con số chủ đạo của nó được đặt trong tương quan so sánh với các phiên dịch viên con người, thay vì so với chính phiên bản tiền nhiệm của nó — và cách đặt vấn đề đó là một bài kiểm tra khó vượt qua hơn nhiều so với bài kiểm tra mà nó thay thế. Nó vẫn chưa vượt qua được. Nó mới chỉ tự nguyện dấn thân mà thôi.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày