
Qwen3.8-Omni-Flash đã ra mắt: Ngữ cảnh 1 triệu token, âm thanh rẻ hơn 98%, chỉ xuất văn bản
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Buổi ra mắt đã mở Qwen3.8-Omni-Flash cho khách hàng API ngay hôm nay, 18 tháng 9 năm 2026, và con số mà nó dẫn đầu là một hóa đơn chứ không phải điểm số. Tính theo mỗi giờ âm thanh đầu vào, Qwen cho biết mô hình mới tốn ít hơn 98% so với mô hình tiền nhiệm Qwen3.5-Omni-Plus; tính theo mỗi giờ âm thanh và video kết hợp, ít hơn 93%. Mọi thứ khác trong thông báo đều bắt nguồn từ cách định khung đó. Qwen3.8-Omni-Flash là một mô hình omni-modal nguyên bản — nhận văn bản, hình ảnh, âm thanh và video, ngữ cảnh một triệu token, tối đa một giờ âm thanh-video liên tục trong một lần gọi — và Alibaba đang bán nó không phải như một công cụ mô tả phương tiện tốt hơn mà như mô hình Qwen đầu tiên được xây dựng để hành động trên đó. Khẩu hiệu là "Omni Senses. Agentic Delivery." Điểm đáng lưu ý, được nói thẳng trong cùng những tài liệu ấy, là mô hình chỉ trả lời bằng văn bản: nó nghe và nhìn, chứ không nói.
Không có nội dung nào dưới đây được kiểm chứng độc lập. Mô hình mới ra đời được vài giờ, vẫn chưa có bất kỳ đánh giá nào từ bên thứ ba về nó, và mọi chỉ số benchmark lẫn mức giá trong tài liệu ra mắt đều là của chính Alibaba. Ở đâu một con số do nhà cung cấp báo cáo, bài viết này nói rõ điều đó ngay trong câu chứa con số ấy; ở đâu một nhận định đến từ người phê bình thay vì từ nhà cung cấp, nó đều được ghi rõ nguồn. Điều duy nhất là thứ có thể kiểm chứng độc lập ngay hôm nay — rằng mô hình đang hoạt động trên các nền tảng của Alibaba chứ không nằm trong danh mục của bất kỳ ai khác — lại chính là điều mà buổi ra mắt ít muốn nhắc đến nhất.
Những gì thực sự đã được phát hành
Bảng thông số kỹ thuật sạch một cách bất thường đối với một màn ra mắt đa phương thức toàn diện, và bản thân điều đó đã là câu chuyện: thế hệ trước của các mô hình toàn diện trong dòng sản phẩm này được ghép nối từ các bộ mã hóa nhận thức riêng biệt gắn thêm vào một LLM văn bản, còn mô hình này được xây dựng trực tiếp trên Qwen3.8-Flash dòng kiến trúc, với các phương thức được xử lý một cách nguyên bản thay vì bị ghép thêm vào.
• Đầu vào — văn bản, hình ảnh, âm thanh và video, chấp nhận âm thanh không gian stereo và bốn kênh; đầu ra chỉ là văn bản.
• Ngữ cảnh — một triệu token, với đầu vào tối đa khoảng 991K (khoảng 983K ở chế độ suy nghĩ), đầu ra tối đa 131K, và ngân sách suy luận đạt tới 262K.
• Thời lượng — tối đa một giờ âm thanh hoặc âm thanh-hình ảnh liên tục cho mỗi cuộc gọi, đây chính là con số cho phép hiện thực hóa các trường hợp sử dụng cuộc họp và video dài mà không cần chia nhỏ.
• Phạm vi bao phủ giọng nói — nhận dạng trên 74 ngôn ngữ và tạo giọng nói trên 29 ngôn ngữ trong bộ công cụ đi kèm; một bài viết bằng tiếng Trung về bản phát hành này nêu 113 ngôn ngữ và phương ngữ cho đầu vào âm thanh.
• Tính khả dụng — nền tảng AI Qianwen và Alibaba Cloud Model Studio (Bailian), theo API id qwen3-8-omni-flash. Trọng số không được phát hành. Một biến thể Realtime được mô tả là mô hình omni-modal đầu tiên có khả năng định vị nguồn âm thanh.

98% là một tuyên bố về chi phí, và phép tính đằng sau nó đáng để xem xét
Việc giảm 98% chi phí cho một giờ âm thanh là một con số lớn hơn nhiều so với mức giảm 98% giá của một token, và khoảng cách giữa hai điều đó chính là nơi bản thông báo này phát huy tác dụng. Con số tính theo giờ được suy ra bằng cách định giá một mẫu hai phút rồi nhân với ba mươi, với video được lấy mẫu ở 720p và một khung hình mỗi giây. Đó là một cách hợp lý để báo giá cho một khối lượng công việc sản xuất, đồng thời cũng là một mô tả về những gì mô hình được yêu cầu quan sát: một khung hình mỗi giây đủ để biết người ta đã nói gì và đại khái điều gì đã diễn ra trên màn hình, nhưng còn xa mới đủ để kiểm tra các thao tác ở cấp độ khung hình, đánh giá chất lượng dựng phim, hay phát hiện một lỗi chỉ xuất hiện trong một khung hình duy nhất. Hai thay đổi đang được nhân với nhau — một đợt giảm đơn giá thực sự, và một chính sách lấy mẫu hung hăng hơn nhiều — và chỉ có thay đổi đầu tiên là một cải tiến của mô hình.
Bản thân các mức đơn giá là cụ thể. Giá quốc tế được báo ở mức $0.15 cho mỗi triệu token đầu vào, $0.016 cho mỗi triệu token đầu vào được lưu đệm, và $0.47 cho mỗi triệu token đầu ra. Giá Bailian trong nước được báo ở mức ¥0.8 mỗi triệu cho đầu vào đa phương thức, giảm từ khoảng ¥18. Lưu ý rằng hệ thống tính phí quốc tế và đại lục là tách biệt và các con số không thể hoán đổi cho nhau; bất cứ ai so sánh trực tiếp chúng sẽ nhận được câu trả lời sai.
Đây là phần của bản phát hành mà ở đó việc định tuyến quan trọng hơn mức thường lệ. OrcaRouter chuyển thẳng giá niêm yết của nhà cung cấp với mức phụ trội 0%, nên một đợt giảm giá từ nhà cung cấp như thế này sẽ đến tay khách hàng ngay ngày nó được áp dụng, thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Một so sánh thực sự có thể kiểm chứng đã có sẵn ngay trong danh mục của chính chúng tôi: Qwen3.8-Flash, mô hình đa phương thức được xây dựng song hành với mô hình này, hiện đã có thể định tuyến với mức $0,15 cho mỗi triệu token đầu vào và $0,47 cho mỗi triệu token đầu ra — đúng bằng mức giá niêm yết mà Alibaba đang đưa ra cho mô hình omni mới — và nó đã mang 2,47 tỷ token lưu lượng qua API của chúng tôi trong bảy ngày trước khi bài viết này ra đời, một thước đo hợp lý cho thấy phân khúc này đã có sức hút lớn đến mức nào. Bản thân mô hình omni thì chưa có trong danh mục của chúng tôi, và cho đến khi có, nó chỉ chạy trên các nền tảng của chính Alibaba mà thôi, không nơi nào khác. Chúng tôi sẽ không giả vờ điều ngược lại.
Mỗi benchmark trong đợt ra mắt đều so sánh một thứ duy nhất.
Điểm đáng chú ý là mức cải thiện trung bình hơn 26% trên khoảng 30 đánh giá — và mỗi một trong số những đánh giá đó đều so với Qwen3.5-Omni-Plus. Đó là mốc so sánh phù hợp cho một màn ra mắt, và là một mốc hẹp: nó cho bạn biết dòng sản phẩm đã tiến bộ, chứ không cho biết dòng này đã đạt đến đâu so với bất cứ thứ gì bạn có thể đang trả tiền để dùng.
Các số liệu riêng lẻ, tất cả đều do nhà cung cấp báo cáo: WildClawBench-MM 71.0, tăng 36,5 điểm và là mức tăng lớn nhất trong toàn bộ nhóm; UniClawBench 69.6; AgenticVBench tăng 22,3 điểm lên 36,8; LongAudioSpan 82.7, tăng 8,3; OmniVideoBench 63.4, tăng 9,6; OmniCap-IF 28.2. Cặp gây ấn tượng mạnh nhất là phân tách người nói trên AliMeeting, nơi tỷ lệ lỗi giảm từ 88.11 xuống 3.35 và cpWER từ 89.61 xuống 17.18 — một bước nhảy lớn đến mức đáng phải soi xét hơn là được tung hô. Một phân tích kỹ thuật bằng tiếng Trung về đợt ra mắt lập luận đúng như vậy, cho rằng phần lớn mức cải thiện đến từ kỹ thuật front-end và phân tách người nói bao quanh mô hình chứ không phải từ năng lực suy luận của chính mô hình, đồng thời cảnh báo rằng hệ thống này đọc ra như thể chuyên về nghe với khả năng suy luận video sâu tương đối yếu hơn. Đó là cách nhìn của một nhà phê bình, không phải một lần tái lập có đo lường, nhưng độ lớn của mức chênh lệch chính là lý do để ghi nhớ điều đó.

Con số khác đáng để ghi nhớ lại không phải là một điểm số. Trong chế độ mà Alibaba gọi là Agentic Understanding, mô hình tự quyết định xem cần nhìn và nghe những gì thay vì xử lý từng khung hình, thu thập bằng chứng theo các vòng từ thô đến tinh. Trên OmniVideoBench, chế độ đó nâng độ chính xác từ 63.4 lên 67.8 đồng thời cắt giảm token trên mỗi truy vấn từ 145,736 xuống 79,117 — mức giảm 45.7%. Độ chính xác tăng lên và chi phí giảm xuống cùng một lúc là tuyên bố mạnh mẽ nhất trong bản phát hành này, và đó cũng là tuyên bố ủng hộ trực tiếp nhất cho định hướng agentic.
Sự so sánh với Gemini hẹp hơn so với những gì mà phạm vi đưa tin gợi ý.
Định vị của Alibaba là năng lực âm thanh-hình ảnh "tiệm cận" Gemini 3.8 Flash trong khi hiệu năng âm thanh tổng thể vượt trội hơn. Gạt bỏ phần diễn đạt, các so sánh do nhà cung cấp báo cáo trông như sau. WildClawBench-MM: 71,0 so với 58,9. SpotSoundBench: 67,2 so với 39,7. MMAU: 81,8 so với 76,9. DailyOmni: 85,1 so với 84,0. Đó là những khoảng cách thực sự về âm thanh và khả năng sử dụng công cụ lấy âm thanh làm trung tâm. Chúng cũng mang tính chọn lọc. Trên AgenticVBench, bảng thuần suy luận video, thứ tự đảo ngược — Gemini ở mức 45,0 so với 36,8 của Qwen — và chính tài liệu của Alibaba cũng thừa nhận Gemini vẫn dẫn đầu một số bài kiểm tra hiểu video. Một cách tóm tắt hợp lý là Qwen đã chiếm được nửa phần âm thanh của omni và vẫn còn kém ở nửa phần video, đây là một khẳng định khác với khẳng định mà các tiêu đề đã chạy theo.
“Mô hình omni-modal đầu tiên của Qwen” cần một từ bổ nghĩa
Cách đặt vấn đề rằng Qwen3.8-Omni-Flash là mô hình omni-modal đầu tiên của Qwen đã lan truyền rộng rãi hôm nay và đáng để nói chính xác, bởi vì dòng này có một mô hình ra đời trước đó có cơ sở chính đáng để nhận danh hiệu đó. Qwen2.5-Omni, một mô hình trọng số mở 7B được phát hành vào tháng 3 năm 2025 theo kiến trúc Thinker-Talker, cũng nhận văn bản, hình ảnh, âm thanh và video làm đầu vào — và nó tạo ra giọng nói cũng như văn bản. Điều thực sự đầu tiên ở đây là tính bản địa của omni-modality: một mô hình được xây dựng trên nền tảng Qwen3.8-Flash thay vì một LLM văn bản có gắn các bộ mã hóa tri giác, cộng với một đề cương thiết kế ưu tiên agent. Cả hai nhận định đều đúng; chỉ một trong số chúng là điều được lặp lại. Nếu bạn đang đánh giá mô hình với giả định rằng chưa từng có mô hình omni nào của Qwen tồn tại trước tuần này, bạn sẽ định giá sai lộ trình nâng cấp từ Qwen2.5-Omni, đây là so sánh mà chúng tôi đã viết riêng.
Bộ công cụ mới là nơi lời khẳng định về tính agentic thực sự nằm ở.
Hai thứ đã ra mắt cùng với mô hình, và chúng quan trọng hơn những gì tấm thẻ mô hình (model card) gợi ý, bởi chính chúng là thứ biến khả năng cảm nhận thành kết quả bàn giao. Qwen-MM-Plugins là một bộ plugin đa phương thức dành cho các agent harness, mang lại cho một agent bên ngoài khả năng hiểu hình ảnh, âm thanh, video và tài liệu, cùng bộ nhớ video dài và khả năng chỉnh sửa video; nó quảng cáo hỗ trợ Codex, Claude Code, Qwen Code, Gemini CLI và một số công cụ khác, đồng thời cung cấp các công cụ có tên cụ thể, bao gồm Video2Note, thứ biến hàng giờ video thành ghi chú PDF có minh họa. Qwen-Live Harness là một runtime mã nguồn mở cho tương tác omni-modal liên tục theo thời gian thực, đóng vai trò lớp điều phối nơi người dùng trò chuyện trực tiếp và giao những công việc nặng hơn cho các agent chạy nền. Một lưu ý từ các bài đưa tin ngày ra mắt: trang GitHub của Qwen-Live Harness đã trả về lỗi 404 khi Gigazine kiểm tra, nên hãy coi bộ công cụ này là mới được công bố chứ chưa được xác minh cho đến khi các kho mã hoạt động trở lại.
Câu mà buổi ra mắt chôn vùi: nó không lên tiếng.
Đối với một mô hình mà phiên bản tiền nhiệm của nó tạo ra giọng nói, việc Qwen3.8-Omni-Flash chỉ nhận đầu vào đa phương thức và chỉ xuất ra văn bản là dòng quan trọng nhất trong bản đặc tả, vậy mà nó lại xuất hiện trong các tài liệu phần lớn như một chú thích cuối trang. Điều đó có nghĩa là mô hình không thể được đưa thẳng vào một sản phẩm chuyển giọng nói thành giọng nói. Bất kỳ sản phẩm lồng tiếng, tác nhân giọng nói hay hội thoại thời gian thực nào được xây dựng trên nó đều cần một công đoạn chuyển văn bản thành giọng nói bên ngoài và, đối với video, cần một bộ kết xuất bên ngoài — đó chính xác là lý do bộ plugin và giàn thử nghiệm trực tiếp tồn tại. Hệ quả thực tế là một pipeline có nhiều bộ phận chuyển động hơn so với "một mô hình omni duy nhất", cùng độ trễ phải được tính toán ngân sách cho tất cả chúng.
Có một minh chứng tinh tế về khoảng cách, và về việc mô hình này giỏi ở điểm nào, được ẩn trong bản phát hành. Trong một thí nghiệm "mô hình tối ưu hóa mô hình", Qwen3.8-Omni-Flash đã tự động cải thiện khả năng nhận dạng phương ngữ Tứ Xuyên của Qwen2.5-Omni-3B, giảm tỷ lệ lỗi ký tự từ 25,79% xuống 15,30% trong vòng mười hai giờ và xây dựng 3.413 mẫu huấn luyện qua bốn vòng. Một mô hình có thể chẩn đoán và sửa chữa cách xử lý phương ngữ của một mô hình đàn em nhỏ hơn đang làm điều mà một API phiên âm không thể làm. Đó, chứ không phải bảng điểm chuẩn, mới là lập luận rõ ràng nhất cho ý nghĩa của "agentic" ở đây.

Điều gì sẽ thay đổi nhận định của chúng ta?
Thực trạng trung thực là đây là một đợt ra mắt được đặc tả kỹ lưỡng với câu chuyện giá hấp dẫn, không có đánh giá độc lập, và ít nhất một hạn chế mang tính cấu trúc mà thông báo nói giảm nói tránh. Ba điều sẽ khép lại câu chuyện này. Một mục trên Artificial Analysis hoặc LMArena sẽ biến số liệu của nhà cung cấp thành những con số có thể so sánh được, và hiện chưa có mục nào như vậy. Một bài kiểm tra của bên thứ ba về mức giảm 45,7% token — tuyên bố rằng độ chính xác tăng lên trong khi chi phí giảm xuống — sẽ xác nhận kết quả hữu ích nhất và ít hào nhoáng nhất trong thông cáo. Và việc đo lường độc lập phân tách người nói của AliMeeting sẽ cho thấy liệu mức giảm 88 điểm thuộc về mô hình hay thuộc về quy trình bao quanh nó.
Cho đến lúc đó, cách xử lý hợp lý là cách áp dụng cho bất kỳ mô hình nào trong ngày đầu tiên của nó: đáng để thử nghiệm, không đáng để đặt cược cả một quy trình sản xuất vào đó. Nếu bạn đã định tuyến qua OrcaRouter, nước đi thực tế là giữ khối lượng công việc trên những mô hình bạn đã đo lường, và coi Qwen3.8-Omni-Flash như một ứng viên để thử sức đối đầu với chúng trên chính âm thanh và video của bạn, thay vì trên bảng điểm chuẩn của bất kỳ nhà cung cấp nào. Nếu trường hợp sử dụng của bạn là phân tích cuộc họp hoặc phương tiện truyền thông dạng dài bằng tiếng Trung và tiếng Anh, lợi thế kinh tế token ở đây đủ mạnh để biện minh cho việc thử nghiệm ngay bây giờ.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
