
Qwen3.8-LiveTranslate so với Qwen 3.8: Một cuộc va chạm tên gọi, không phải một cuộc so tài công bằng
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tìm kiếm một trong những mô hình này và bạn sẽ được hiển thị mô hình còn lại. Qwen3.8-LiveTranslate, phát hành ngày 19 tháng 9 năm 2026, và Qwen3.8-Max — mô hình mà hầu hết mọi người muốn nói đến khi họ viết "Qwen 3.8" không có hậu tố, được cung cấp rộng rãi từ ngày 3 tháng 8 năm 2026 và được làm mới thành Qwen3.8-Max-0902 vào ngày 2 tháng 9 — chia sẻ một tiền tố thế hệ và gần như không chia sẻ gì khác. Một cái là hệ thống phiên dịch đồng thời nhận âm thanh vào và trả ra âm thanh cùng văn bản đã dịch, được tính phí qua WebSocket dưới ID qwen3.8-livetranslate-flash-realtime. Cái còn lại là một mô hình tổng quát mixture-of-experts thưa với 2,4 nghìn tỷ tham số, có cửa sổ ngữ cảnh 1M token, và hoàn toàn không thể nghe được bất cứ thứ gì. Đặt chúng đối đầu trực tiếp với nhau là một lỗi phạm trù, và việc có quá nhiều người đi đến lỗi đó chính là câu chuyện thực sự ở đây: nhà cung cấp hiện phát hành ít nhất bốn thứ khác biệt dưới cái tên Qwen 3.8, và cách đặt tên không cho bạn biết bạn muốn cái nào.
Thực tế mỗi thứ là gì
Thế hệ Qwen 3.8 được phát hành theo từng lớp trong suốt nửa cuối năm 2026, và các lớp này không thể hoán đổi cho nhau.
Qwen3.8-Max là mẫu flagship được lưu trữ: một mô hình MoE thưa với tổng cộng khoảng 2,4 nghìn tỷ tham số và khoảng 95 tỷ tham số hoạt động mỗi lượt truyền xuôi, ngữ cảnh 1 triệu token, cùng đầu vào văn bản, hình ảnh và video với đầu ra chỉ dạng văn bản. Mức giá là 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, với lượt đọc bộ đệm ở mức 0,250 USD mỗi triệu. Điểm số do nhà cung cấp báo cáo đặt mô hình ở mức 86,6 trên Terminal-Bench 2.1, 92,6 trên GPQA Diamond, 67,7 trên SWE-bench Pro và 43,6 trên Humanity's Last Exam.
Qwen3.8-2.4T-A95B là bản phát hành trọng số mở của cùng thế hệ đó, được công bố vào ngày 12 tháng 8 năm 2026: 512 chuyên gia định tuyến trải khắp 92 lớp, với 69 lớp trong số đó sử dụng attention tuyến tính, và khoảng 4,89 TB trọng số. Đây là mô hình mà hầu hết mọi người ám chỉ khi nói "Qwen 3.8", tức là khi họ đang nói về việc tự chạy một thứ gì đó thay vì gọi API.
Qwen3.8-27B là checkpoint mở nhỏ trong cùng dòng mô hình, và Qwen3.8-LiveTranslate là mô hình chuyên biệt — một trình thông dịch theo kiến trúc Interleave, được xây dựng trên thiết kế Hybrid MoE Thinker–Talker, nhận diện 60 ngôn ngữ nguồn và có 29 ngôn ngữ hỗ trợ đầu ra bằng giọng nói.
Trục phân tách chúng không phải là kích thước. Mà là phương thức. Qwen3.8-Max không có đường đầu vào âm thanh và hoàn toàn không có đầu ra âm thanh. Yêu cầu nó diễn giải một cuộc trò chuyện trực tiếp không phải là chuyện đưa ra lời nhắc tốt hơn; năng lực đó không nằm trong mô hình.
So sánh thông số kỹ thuật
Đặt cạnh nhau, hai mẫu này hầu như không trùng nhau ở bất kỳ khía cạnh nào mà người mua quan tâm:
• Công việc chính — Qwen3.8-LiveTranslate: dịch đồng thời giọng nói sang giọng nói. Qwen3.8-Max: lập luận tổng quát, lập trình, công việc văn bản dạng tác tử và đa phương thức.
• Phương thức đầu vào — Qwen3.8-LiveTranslate: âm thanh và hình ảnh. Qwen3.8-Max: văn bản, hình ảnh và video.
• Phương thức đầu ra — Qwen3.8-LiveTranslate: văn bản và âm thanh tổng hợp. Qwen3.8-Max: chỉ văn bản.
• Cửa sổ ngữ cảnh — Qwen3.8-LiveTranslate: 53,248 token (49,152 vào / 4,096 ra). Qwen3.8-Max: 1,000,000 token.
• Trọng số — Qwen3.8-LiveTranslate: đóng, chỉ có API. Qwen3.8-Max: được lưu trữ, cùng với người anh em mở Qwen3.8-2.4T-A95B được công bố trong cùng thế hệ.
• Giới hạn tốc độ — Qwen3.8-LiveTranslate: 10 yêu cầu và 100.000 token mỗi phút. Qwen3.8-Max: thông lượng lưu trữ tiêu chuẩn, không có giới hạn thời gian thực theo từng yêu cầu.
Sự chênh lệch về ngữ cảnh chính là điều khiến mọi người ngạc nhiên. Qwen3.8-Max nắm giữ một triệu token; trình phiên dịch chỉ giữ khoảng năm phần trăm con số đó. Nhưng một trình phiên dịch thời gian thực không cần ngữ cảnh dài — nó cần một bộ nhớ ngắn và cực kỳ nhanh. Mức trần đầu vào 49.152 token của nó được thiết kế để mang vài phút gần nhất của cuộc hội thoại về phía trước nhằm giữ tên và thuật ngữ nhất quán, đúng chính xác công việc mà "khử nhập nhằng theo ngữ cảnh dài" đảm nhiệm. Đánh giá trình phiên dịch qua con số ngữ cảnh của nó cũng giống như đánh giá động cơ đua qua bình nhiên liệu.

Tại sao việc so sánh giá lại là một cái bẫy
Nếu tính theo mỗi triệu token, mô hình thông dịch có vẻ đắt hơn hẳn so với mô hình chủ lực: 7,50 USD mỗi triệu token đầu vào âm thanh so với 2,00 USD mỗi triệu token đầu vào văn bản, và 30,00 USD mỗi triệu token đầu ra âm thanh so với 6,00 USD mỗi triệu token đầu ra văn bản.
So sánh đó là vô nghĩa, và đó là sai lầm phổ biến nhất khi bàn về loại mô hình này. Token âm thanh và token văn bản không phải là cùng một đơn vị. Giọng nói được mã hóa thành token âm thanh với mật độ không có mối liên hệ nào với cùng nội dung đó khi được viết ra — một phút hội thoại tiêu tốn lượng token âm thanh nhiều hơn hẳn so với lượng token văn bản mà bản chép lời của nó tiêu tốn, và âm thanh đầu ra còn bổ sung thêm một luồng thứ hai chồng lên trên. Việc đặt hai tốc độ đó cạnh nhau ngụ ý một tỷ lệ chi phí không hề tồn tại trên thực tế.
Sự khác biệt về cấu trúc quan trọng hơn sự khác biệt về giá. Qwen tính phí trình thông dịch theo token, trong khi phần lớn thị trường giọng nói thời gian thực tính phí theo phút của phiên. Hai mô hình định giá đó hành xử hoàn toàn khác nhau khi âm thanh của bạn trở nên nhỏ hơn, phiên của bạn ngắn hơn hoặc người nói tạm dừng — cách tính theo phút vẫn tính tiền cho khoảng lặng, còn cách tính theo token thì không. Nếu bạn đang xây dựng một mô hình chi phí, câu hỏi không phải là mức giá nào thấp hơn; mà là cách tính nào bất lợi cho hình thái sử dụng của bạn. Và hãy lưu ý sự phân tách theo khu vực: giá ở Bắc Kinh là ¥40 / ¥3,3 / ¥100 / ¥160 mỗi triệu cho đầu vào âm thanh, đầu vào hình ảnh, đầu ra văn bản và đầu ra âm thanh tương ứng, thấp hơn đáng kể so với mức giá ở Singapore, đây là kiểu khác biệt chỉ trở nên rõ ràng khi bạn so sánh hai bên theo từng dòng.
Một điểm nữa có lợi cho interpreter về chi phí: Qwen giữ các mức giá này gần như không đổi so với Qwen3.5-LiveTranslate, với Bắc Kinh không thay đổi và Singapore rẻ hơn một chút. Một thế hệ mới ra đời mà không tăng giá thì không phải là chuyện bình thường trên thị trường này.
Trọng số mở so với chỉ API mới là ranh giới thực sự.
Nếu bạn đang chọn giữa hai lựa chọn này dựa trên nguyên tắc chứ không phải dựa trên khả năng, thì yếu tố quyết định là vấn đề cấp phép.
Qwen3.8-Max hiện được cung cấp dưới dạng dịch vụ lưu trữ (hosted), và trọng số thuộc lớp Max của thế hệ này đã được mã nguồn mở với tên Qwen3.8-2.4T-A95B vào tháng 8. Con đường đó tồn tại, nhưng không phải là con đường dễ dàng: 4,89 TB trọng số là phần cứng trung tâm dữ liệu, và giấy phép trọng số mở yêu cầu các tổ chức có doanh thu trên 50 triệu USD trong một khoảng thời gian mười hai tháng phải xin giấy phép thương mại từ Alibaba Cloud.
Qwen3.8-LiveTranslate không có con đường như vậy. Nó là mô hình trọng số đóng và chỉ dùng qua API, chỉ có thể truy cập thông qua WebSocket Realtime API, vốn yêu cầu target_language phải được đặt trong một sự kiện session.update trước khi bất kỳ luồng âm thanh nào được truyền đi, không hỗ trợ gọi hàm, không có đầu ra có cấu trúc, không có bộ nhớ đệm ngữ cảnh, không có suy luận theo lô và không có tinh chỉnh. Nếu yêu cầu của bạn là chạy trình phiên dịch trên phần cứng của riêng bạn, thì mô hình này không đáp ứng được, và không lượng công sức kỹ thuật nào có thể thay đổi điều đó.
Điều đó quan trọng đối với một kiểu người mua cụ thể: những người không thể gửi âm thanh cho bên thứ ba — bệnh viện, công ty luật, nhà thầu chính phủ. Với tất cả những người khác, câu hỏi thực tế là liệu trình phiên dịch có đủ tốt để biện minh cho sự phụ thuộc hay không, và câu trả lời cho điều đó là một phép đo mà Qwen vẫn chưa cho phép ai thực hiện.

Chọn theo công việc, không phải theo tên
Câu trả lời đúng cho "Qwen3.8-LiveTranslate hay Qwen 3.8" là có lẽ bạn cần câu trả lời cho một câu hỏi khác.
• Nếu công việc là phiên dịch trực tiếp — một cuộc họp, một cuộc gọi, một buổi phát sóng — chỉ một trong số này có thể làm được, và đó không phải là mẫu chủ lực.
• Nếu công việc là tóm tắt những gì đã được nói, trích xuất các đầu việc cần làm, trả lời câu hỏi về bản ghi, hoặc viết phần tiếp nối — chỉ mô hình chủ lực mới làm được, và nó không phải là mô hình phiên dịch.
• Nếu công việc bao gồm cả hai, bạn đang xây dựng một pipeline, và bạn sẽ phải trả tiền cho hai nhà cung cấp với hai hợp đồng và hai bộ thông tin xác thực trừ khi bạn hợp nhất một cách có chủ đích.
Trường hợp thứ ba đó là trường hợp phổ biến, và đó là lúc việc chạy cả hai nửa phía sau một endpoint duy nhất không còn là sự tiện lợi nữa mà bắt đầu trở thành kiến trúc. Qwen3.8-Max có trên OrcaRouter với mức giá niêm yết của nhà cung cấp là $2.00 mỗi triệu đầu vào và $6.00 mỗi triệu đầu ra với không cộng thêm markup nào, vì vậy việc Qwen giảm giá sẽ đến hóa đơn của bạn ngay trong cùng ngày thay vì vào lần gia hạn hợp đồng tiếp theo, và chuyển đổi dự phòng tự động có nghĩa là nửa tóm tắt của pipeline không bị ngừng hoạt động khi một nhà cung cấp gặp sự cố trong một giờ nào đó.
Để nói rõ về nửa còn lại, vì sự phân biệt này rất quan trọng: Qwen3.8-LiveTranslate không nằm trong danh mục của chúng tôi. Nó có sẵn thông qua Model Studio API của chính Alibaba và endpoint dùng thử của nhà cung cấp tại omni.qwen.ai/live-translate, và chúng tôi sẽ không ám chỉ rằng mình định tuyến một mô hình mà chúng tôi không có. Điều bạn có thể đặt đằng sau một khóa duy nhất ngay hôm nay là ngăn xếp hạ nguồn — những mô hình tiêu thụ những gì trình thông dịch tạo ra.

Vấn đề đặt tên chính là phát hiện thực sự
Bốn mô hình, một tiền tố, không có quy ước hậu tố nào mà người đọc có thể dựa vào. "Qwen 3.8" được hiểu là mô hình chủ lực được lưu trữ, checkpoint mở 2,4T, mô hình nhỏ 27B, hoặc trình phiên dịch, tùy thuộc vào ai đang gõ và họ đọc gì gần nhất. Các bảng benchmark đã công bố không giúp ích gì, vì mô hình chủ lực có chúng còn trình phiên dịch thì hầu như không: Qwen3.8-Max có thể được đánh giá trên Terminal-Bench hoặc GPQA Diamond, trong khi bằng chứng về Qwen3.8-LiveTranslate là average lagging 2,3 giây, chỉ số 85,7 xCOMET-XXL trên FLEURS do nhà cung cấp báo cáo, và tỷ lệ lỗi tách người nói 9,7% do tự báo cáo mà không có tái lập độc lập.
Vậy nên, phép so sánh mà trang này tồn tại để trả lời thực chất là một lời cảnh báo. Trước khi bạn so sánh Qwen 3.8 với bất cứ thứ gì, hãy xác định bạn đang nói đến Qwen 3.8 nào. Nếu nó nhận âm thanh, thì đó là trình phiên dịch, và nó là một chuyên gia bạn mua cho một công việc. Nếu nó nhận video, thì đó là flagship, và nó là một mẫu tổng quát bạn mua cho hai mươi việc còn lại. Bất kỳ đánh giá nào trộn lẫn chúng sẽ đưa ra một kết luận chẳng hề nói về cái nào trong hai.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
