Thẻ tiêu đề hero cho phần so sánh 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni' với dòng eyebrow 'Cách nhau mười tám tháng - từ tháng 3 năm 2025 đến tháng 9 năm 2026', phụ đề 'Gấp ba mươi lần ngữ cảnh, một giờ media thay vì vài giây - và một điều mà mô hình cũ làm được nhưng mô hình mới thì không', cùng ba chip số liệu ghi 'Ngữ cảnh: 32K đến 1M', 'Media mỗi lượt gọi: vài giây đến 1 giờ', và 'Đầu ra giọng nói: chỉ có ở mô hình 2025'.
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18 tháng sau, bản nâng cấp đã mất đi giọng nói

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là sự thật khiến phép so sánh này thú vị hơn hẳn một lần làm mới theo thế hệ. Mẫu cũ biết nói, còn mẫu mới thì không. Qwen2.5-Omni, ra mắt vào tháng 3 năm 2025, nhận văn bản, hình ảnh, âm thanh và video làm đầu vào và trả lời bằng văn bản hoặc bằng giọng nói tự nhiên dạng truyền phát, trong một mô hình end-to-end duy nhất mà bạn có thể tải về. Qwen3.8-Omni-Flash, ra mắt ngày 18 tháng 9 năm 2026, tiếp nhận cùng bốn phương thức trên một cửa sổ ngữ cảnh lớn hơn ba mươi lần, xử lý trọn một giờ âm thanh-video liên tục trong khi tổ tiên của nó chỉ đảm đương được vài giây, và chỉ trả về văn bản. Mười tám tháng làm việc đã đổi lấy khả năng tiếp nhận rộng hơn hẳn và từ bỏ kênh đầu ra. Đó là tiến bộ hay là một sự đánh đổi phụ thuộc hoàn toàn vào việc bạn đang dùng mẫu cũ để làm gì — và câu trả lời tách ra rõ ràng thành hai.

Các số liệu về Qwen2.5-Omni là của nhà cung cấp, lấy từ tài liệu phát hành tháng 3 năm 2025 của họ, và mười tám tháng triển khai rộng rãi đã phần nào kiểm chứng chúng. Các số liệu về Qwen3.8-Omni-Flash cũng là của Alibaba, lấy từ tài liệu ra mắt được công bố chỉ vài giờ trước khi bài này được viết, và chưa có nội dung nào trong đó được tái lập một cách độc lập. Khi một khẳng định đến từ một nhà phê bình chứ không phải nhà cung cấp, nó sẽ được ghi nguồn đúng như vậy. Một sự thật mang tính cấu trúc không cần kiểm chứng cũng chính là điều hệ trọng nhất: Qwen2.5-Omni là mô hình trọng số mở và có thể tải xuống, còn Qwen3.8-Omni-Flash thì không.

Qwen2.5-Omni là gì, và vì sao nó lại quan trọng

Khi được phát hành vào ngày 26 tháng 3 năm 2025, Qwen2.5-Omni là mô hình đa phương thức toàn diện đầu-cuối đầu tiên trong dòng sản phẩm — bản phát hành giới thiệu nó như câu trả lời cho vấn đề "vườn thú các chuyên gia", nơi chuyển âm, thị giác và giọng nói đều cần một mô hình riêng và một lớp keo kết nối riêng. Mô hình 7B xử lý cả bốn phương thức đầu vào và cả đầu ra văn bản lẫn giọng nói, tuyên bố đạt kết quả tiên tiến nhất trên chuẩn đánh giá hợp nhất OmniBench, vượt Gemini-1.5-Pro, và báo cáo điểm chất lượng tạo giọng nói là 4.51 mà Alibaba mô tả là ngang tầm con người. Một phiên bản 3B đi theo cùng kiến trúc.

Phần kỹ thuật giúp nó vận hành đáng được gọi tên, vì mô hình mới không sử dụng nó. Thinker-Talker chia công việc thành hai phần: một transformer Thinker hợp nhất các bộ mã hóa âm thanh và hình ảnh rồi tạo ra ngữ nghĩa và văn bản, trong khi một Talker truyền phát các token giọng nói từ các trạng thái ẩn của Thinker, chia sẻ toàn bộ lịch sử hội thoại. RoPE đa phương thức căn chỉnh theo thời gian (TMRoPE) xen kẽ các vị trí video và âm thanh để hai luồng giữ đồng bộ. Truyền phát theo khối cho phép các bộ mã hóa thực hiện nhận thức trong khi mô hình ngôn ngữ xử lý các chuỗi dài, điều này giúp phản hồi bằng giọng nói có độ trễ thấp trở nên khả thi. Hai giọng nói cố định đi kèm với nó, Chelsie và Ethan.

Các ràng buộc cũng hoàn toàn có thật. Ngữ cảnh là 32.768 token. Bộ nhớ mới là giới hạn ràng buộc, nhiều hơn hẳn so với năng lực tính toán: chính các bảng của Alibaba cho thấy suy luận BF16 với FlashAttention-2 cần khoảng 31GB bộ nhớ GPU cho video 15 giây, 42GB cho 30 giây và 60GB cho trọn một phút. Một phút video, trên mô hình 7B, trên một trong những GPU đơn lớn nhất mà bạn có thể thuê. Con số đó là con số cần khắc ghi, bởi vì nó là con số mà mô hình năm 2026 được tạo ra để đập tan.

Qwen3.8-Omni-Flash là gì

Mô hình mới mang tính omni-modal bản địa thay vì được lắp ghép — được xây dựng trực tiếp trên Qwen3.8-Flash dòng kiến trúc chứ không phải như một LLM văn bản có gắn thêm các bộ mã hóa nhận thức, đây là một khác biệt về cấu trúc chứ không chỉ là một nhãn thế hệ. Nó tiếp nhận văn bản, hình ảnh, âm thanh và video, bao gồm âm thanh stereo và âm thanh không gian bốn kênh, và trả về văn bản trong ngữ cảnh một triệu token với đầu vào tối đa khoảng 991K, đầu ra tối đa 131K và ngân sách suy luận 262K. Nó xử lý tối đa một giờ âm thanh-video liên tục mỗi lần gọi. Nhận dạng giọng nói bao phủ 74 ngôn ngữ, còn việc tạo giọng nói cho 29 ngôn ngữ được đảm nhiệm bởi các công cụ xung quanh chứ không phải bởi mô hình. Nó có mặt trên nền tảng Qianwen AI và Alibaba Cloud Model Studio với id qwen3-8-omni-flash, ở mức 0,15 USD mỗi triệu token đầu vào và 0,47 USD mỗi triệu token đầu ra, với đầu vào được lưu đệm ở mức 0,016 USD.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Mười tám tháng, từng chiều một.

• Ngữ cảnh — Qwen2.5-Omni 32,768 token so với Qwen3.8-Omni-Flash ở một triệu, tăng khoảng ba mươi lần.

• Thời lượng media — số giây video, bị giới hạn bởi bộ nhớ GPU, so với một giờ âm thanh-video liên tục trong một cuộc gọi được lưu trữ duy nhất.

• Đầu ra — văn bản kèm giọng nói tự nhiên dạng streaming trên mô hình cũ; chỉ văn bản trên mô hình mới.

• Triển khai — Qwen2.5-Omni là mô hình trọng số mở theo giấy phép Apache-2.0, có thể tải xuống từ Hugging Face và ModelScope; Qwen3.8-Omni-Flash chỉ hỗ trợ API và chưa công bố phát hành trọng số.

• Phần cứng — 7 tỷ tham số cần tới ~60GB bộ nhớ GPU cho một phút video, so với một endpoint được host sẵn mà bạn không phải tự cung cấp hạ tầng gì cả.

• Giá — mô hình cũ khiến bạn tốn một GPU; mô hình mới chỉ tốn 0,15 đô la cho mỗi triệu token đầu vào, và Alibaba tuyên bố âm thanh đầu vào mỗi giờ rẻ hơn 98% so với thế hệ Qwen3.5-Omni-Plus mà nó thay thế.

• Tạo giọng nói — hai giọng cố định vào năm 2025, so với 29 ngôn ngữ của tính năng tạo giọng nói trong bộ công cụ năm 2026, không có phần nào do chính mô hình tạo ra.

Thương vụ không ai quảng cáo

Đọc hai bảng thông số cùng nhau và hình hài của mười tám tháng qua trở nên rõ ràng. Alibaba đã dành khoảng thời gian đó để giải quyết khâu tiếp nhận — một mô hình có thể hấp thụ bao nhiêu dữ liệu phương tiện, với chi phí rẻ đến đâu, và nó có thể tự mình đảm nhiệm bao nhiêu phần trong việc ra quyết định. Qwen3.8-Omni-Flash là một thành tựu vang dội trên trục đó. Chế độ Agentic Understanding, trong đó mô hình tự chọn lấy mẫu những gì thay vì xử lý từng khung hình, cắt giảm số token mỗi truy vấn từ 145.736 xuống 79.117 đồng thời nâng độ chính xác trên OmniVideoBench từ 63,4 lên 67,8, và nhà cung cấp báo cáo lỗi phân tách người nói trên AliMeeting giảm mạnh từ 88,11 xuống 3,35.

Điều mà khoảng thời gian này không ưu tiên chính là đầu ra. Chiêu độc đáo định hình của mô hình 2025 — một mô hình duy nhất nghe bạn và trả lời thành tiếng, từ đầu đến cuối, không cần bộ tổng hợp giọng nói riêng — không có phiên bản kế nhiệm ở đây. Nếu bạn đã xây dựng một tác nhân thoại, một quy trình lồng tiếng hay một công cụ hỗ trợ tiếp cận trên Talker của Qwen2.5-Omni, thì mô hình 2026 không phải là một bản nâng cấp của nó; đó là một thành phần mà bạn sẽ phải gắn thêm một giai đoạn chuyển văn bản thành giọng nói mới vào, làm tăng độ trễ và thêm một nhà cung cấp cho một quy trình trước đây không có cả hai. Tài liệu ra mắt nói thẳng về điều này nếu bạn đọc kỹ dòng về phương thức, nhưng đó không phải là tiêu đề chính, và bất kỳ ai chuyển đổi với giả định rằng "omni" mang cùng ý nghĩa trong cả hai bản phát hành sẽ phát hiện ra sự khác biệt ngay trong môi trường vận hành.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Tại sao mẫu 2025 vẫn còn việc làm

Ba lý do, và không lý do nào là hoài niệm. Thứ nhất là giọng nói, như trên. Thứ hai là trọng số mở: ngữ cảnh 32K và kích thước 7B sẽ chạy trên phần cứng bạn kiểm soát, ngoại tuyến, không có dữ liệu nào rời khỏi tòa nhà và không có đồng hồ tính theo token — lựa chọn duy nhất nếu âm thanh của bạn chịu quy định về lưu trú dữ liệu hoặc ngân sách độ trễ của bạn không cho phép một vòng khứ hồi. Thứ ba là chi phí ở khối lượng rất thấp. Một GPU bạn đã sở hữu thì miễn phí ở mức biên; mức $0.15 mỗi triệu token của mô hình được lưu trữ là rẻ nhưng không phải bằng không, và chi phí cố định để cấp phát cho nó là có thật đối với một khối lượng công việc chỉ chạy hai lần một tuần.

Lập luận phản bác là những ràng buộc của mô hình cũ càng siết chặt hơn theo từng năm. Một phút video, 32K ngữ cảnh, và không có gọi công cụ hay đầu ra có cấu trúc trong một thế giới mà agent là hình thức triển khai mặc định — đó là một phạm vi hẹp. Đối với một pipeline phải nạp các cuộc họp đã ghi âm, Qwen3.8-Omni-Flash không chỉ tốt hơn — nó là sự khác biệt giữa làm được và không làm được, bởi mô hình năm 2025 đơn giản là không thể chứa nổi lượng đầu vào đó.

Thật đáng để nói cụ thể xem những trọng số cũ còn sống được bao lâu, bởi vì "kế thừa" chưa nói hết được giá trị của chúng. Kho lưu trữ Qwen2.5-Omni-7B đã ghi nhận 343.676 lượt tải xuống trong tháng trước khi chúng tôi kiểm tra vào ngày 18 tháng 9 năm 2026, cùng với khoảng một trăm Space cộng đồng và hàng chục bản tinh chỉnh, adapter và lượng tử hóa được xây dựng dựa trên đó. Dù mô hình chủ lực có làm gì đi nữa, một lượng lớn người dùng vẫn đang triển khai trên mô hình 2025 — và đáng chú ý là Hugging Face không liệt kê nhà cung cấp suy luận nào triển khai nó, nghĩa là gần như toàn bộ mức sử dụng đó đều là tự lưu trữ.

Mô hình mới cải thiện mô hình cũ.

Chi tiết kỳ lạ nhất và thuyết phục nhất trong buổi ra mắt lại nằm sâu gần cuối các tài liệu. Trong một thử nghiệm mà Alibaba mô tả là một mô hình tối ưu hóa một mô hình, Qwen3.8-Omni-Flash đã tự động cải thiện khả năng nhận dạng giọng nói phương ngữ Tứ Xuyên của Qwen2.5-Omni-3B — người anh em nhỏ của mô hình mà nó trên danh nghĩa đang thay thế — kéo giảm tỷ lệ lỗi ký tự từ 25.79% xuống 15.30% trong vòng mười hai giờ và tạo ra 3,413 mẫu huấn luyện qua bốn vòng.

Đó là một lập luận thuyết phục hơn cho mô hình mới hơn so với bất kỳ benchmark nào trong bản phát hành, và nó định hình lại mối quan hệ giữa hai mô hình. Mô hình 2026 không chỉ là bản thay thế cho mô hình 2025; nó là một công cụ giúp các trọng số 2025 trở nên tốt hơn. Nếu bạn đang vận hành Qwen2.5-Omni trong môi trường sản xuất cho một ngôn ngữ hoặc phương ngữ mà nó xử lý kém, con đường thực tế có thể là giữ nguyên triển khai và dùng mô hình mới để xây dựng dữ liệu huấn luyện, thay vì di chuyển khối lượng công việc. Tuy nhiên, lưu ý rằng đây là một minh chứng do nhà cung cấp báo cáo, không có phương pháp luận nào được công bố, và nên được xem như một giai thoại đáng khích lệ hơn là một công thức có thể tái lập.

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

Nếu bạn đang di chuyển

Quyết định hiếm khi chỉ xoay quanh một mô hình. Một nhóm rời bỏ mô hình omni tự vận hành đang chọn giữa ba hướng: ở lại với trọng số mở và tiếp tục cấp phát hạ tầng, chuyển sang API của nhà cung cấp và từ bỏ quyền kiểm soát, hoặc tách khối lượng công việc ra để chỉ phần cần tiếp nhận một triệu token mới đi đến mô hình được host. Phương án thứ ba thường đúng và cũng là phương án mà người ta bỏ qua, vì nó nghe có vẻ nhiều việc hơn thực tế — bản fine-tune theo phương ngữ mà bạn dành một tháng để làm không cần phải bị vứt bỏ chỉ vì giai đoạn tóm tắt cuộc họp đã chuyển đi.

Điểm mà định tuyến phát huy tác dụng là ở những mối nối. OrcaRouter mang đến cho bạn một khóa duy nhất dùng cho hơn 200 mô hình, với mức chênh giá 0% so với giá niêm yết của nhà cung cấp và khả năng chuyển đổi dự phòng tự động nếu một endpoint suy giảm hiệu năng, nghĩa là nửa chạy trên dịch vụ lưu trữ của một pipeline tách rời sẽ không cần hợp đồng riêng, mã máy khách riêng và hệ thống giám sát riêng trước khi bạn biết liệu khối lượng công việc có đáng để đầu tư vào bất kỳ thứ nào trong số đó hay không. Nói rõ về những gì chúng tôi không làm: cả hai mô hình omni đều không nằm trong danh mục của chúng tôi — cả hai đều chạy trên nền tảng của Alibaba hoặc trên phần cứng của chính bạn — vì vậy đây là quyết định định tuyến mà bạn đưa ra xoay quanh các mô hình, chứ không phải thông qua chúng tôi.

Ai nên di chuyển, và ai không nên

Hãy chuyển nếu khối lượng công việc của bạn là âm thanh hoặc video dài, nếu 32K ngữ cảnh là thứ đang khiến một pipeline không thể tồn tại, nếu bạn cần hành vi agentic trên media, hoặc nếu phân tách người nói ở quy mô lớn là vấn đề bạn đang gặp. Hãy ở lại nếu bạn cần mô hình nói, nếu âm thanh của bạn không thể rời khỏi hạ tầng của bạn, nếu bạn phụ thuộc vào trọng số Qwen2.5-Omni cụ thể mà bạn đã tinh chỉnh, hoặc nếu lưu lượng cuộc gọi của bạn đủ thấp để một GPU bạn sở hữu vẫn lợi hơn so với trả tiền theo đồng hồ đo.

Tóm tắt khó chịu là đây không hẳn là một bản thay thế, mà đúng hơn là một nhánh rẽ trong dòng sản phẩm. Alibaba đã dành mười tám tháng để xây dựng mô hình tiếp nhận tốt nhất có thể và vẫn chưa xây dựng được bản kế nhiệm cho nửa đầu ra. Nếu công việc của bạn nằm ở phía tiếp nhận, việc nâng cấp gần như là bắt buộc. Nếu công việc của bạn nằm ở phía đầu ra, mô hình 2025 vẫn là thứ mới nhất làm được điều bạn cần — và điều đó đáng để biết trước khi bạn lên kế hoạch di trú mà sẽ âm thầm xóa mất một năng lực mà bạn phụ thuộc vào.