
Qwen3.8-Omni-Flash so với Qwen 3.8: Một bản chuyên dụng so với một bản flagship
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 196 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Nếu bạn muốn bản ngắn gọn: Qwen3.8-Omni-Flash rẻ hơn khoảng mười ba lần trên mỗi token so với Qwen 3.8 và là mô hình duy nhất trong hai mô hình được thiết kế để xử lý trọn một giờ âm thanh-video mà không bị nghẽn — trong khi Qwen 3.8, lõi mở 2,4 nghìn tỷ tham số ở đỉnh cao của dòng Qwen3.8, là mô hình bạn dùng khi câu trả lời phải đúng thay vì rẻ, và là mô hình duy nhất trong hai mô hình mà bạn có thể tải trọng số về. Cả hai chia sẻ cùng độ dài ngữ cảnh, cùng tên dòng họ và cùng cửa sổ ra mắt từ tháng Tám đến tháng Chín. Chúng không thay thế được cho nhau, và toàn bộ giá trị của phép so sánh này nằm ở việc biết bạn thực sự đang đặt câu hỏi nào.
Nói chính xác về tên gọi, bởi vì dòng sản phẩm này khá đông đúc. Qwen 3.8ở đây có nghĩa là lõi mở mixture-of-experts 2.4T-A95B — mô hình đằng sau endpoint Qwen3.8-Max, mà Alibaba đã công bố vào ngày 3 tháng 8 năm 2026 và phát hành trọng số vào ngày 12 tháng 8, và được Artificial Analysis xếp chỉ số 40trên Intelligence Index của mình. Qwen3.8-Omni-Flashlà mô hình omni-modal gốc mà Alibaba đưa vào dịch vụ API ngày 18 tháng 9 năm 2026, được xây dựng trên dòng kiến trúc Qwen3.8-Flash, nhận đầu vào là văn bản, hình ảnh, âm thanh và video rồi trả về văn bản. Mọi thông tin về mô hình chủ lực đều do nhà cung cấp báo cáo hoặc được lập chỉ số độc lập, như đã nêu; mọi thông tin về mô hình omni chỉ do nhà cung cấp báo cáo, bởi vì nó mới ra đời được vài giờ và chưa ai ngoài Alibaba đo lường nó.
Hai mẫu, một dòng, hai định hướng thiết kế trái ngược
Điều dễ mắc phải là đọc nội dung này như một mô hình lớn và một mô hình nhỏ cùng thế hệ, giống như cách bạn đọc Qwen3.8-Max so với Qwen3.8-Flash. Cách đọc đó sai theo một kiểu gây tốn tiền. Qwen 3.8 lõi là một cỗ máy suy luận mà tình cờ chấp nhận hình ảnh và video; thông lượng của nó được đo bằng token mỗi giây trên những bài toán khó, giá của nó được đặt để phản ánh chi phí tính toán của một lượt lan truyền xuôi với 95 tỷ tham số hoạt động, và bảng đánh giá của nó là một danh sách các bảng xếp hạng suy luận và lập trình. Qwen3.8-Omni-Flash là một cỗ máy tri giác và hành động mà tình cờ biết suy luận; giá của nó được đặt dựa trên chi phí nạp hàng giờ phương tiện, và bảng đánh giá của nó là một danh sách các bảng xếp hạng âm thanh, video và gọi công cụ. Một cái được tối ưu cho chiều sâu trên mỗi token. Cái kia được tối ưu cho số token trên mỗi giờ nội dung.
Sự khác biệt đó thể hiện rõ nét nhất ở một điểm mà các tài liệu tiếp thị không hề nhắc tới. Cả hai mô hình đều tiếp nhận khoảng một triệu token và đều tiếp nhận video. Nhưng Qwen3.8-Omni-Flash được thiết kế một cách tường minh xoay quanh bài toán thời lượng — lên tới một giờ liên tục âm thanh-hình ảnh trong một lần gọi duy nhất, với chế độ Agentic Understanding, trong đó mô hình tự chọn lấy mẫu những gì thay vì xử lý từng khung hình, nhờ đó cắt giảm số token mỗi truy vấn từ 145,736 xuống 79,117 đồng thời nâng độ chính xác trên OmniVideoBench từ 63.4 lên 67.8. Qwen 3.8 không có cơ chế tương đương nào được công bố. Nạp cho nó hai giờ video là điều khả thi trên lý thuyết; nhưng làm được điều đó với mức chi phí mà một bộ phận tài chính có thể chấp nhận lại là một câu chuyện khác, và đó chính là câu hỏi mà mô hình omni này được tạo ra để trả lời.
Những khía cạnh thực sự quyết định điều đó
• Giá — Qwen3.8-Omni-Flash $0.15 mỗi triệu đầu vào và $0.47 mỗi triệu đầu ra, so với Qwen 3.8 ở mức $2.00 và $6.00. Đọc bộ nhớ đệm: $0.016 so với $0.25.
• Trọng số mở — Qwen 3.8 công bố trọng số vào ngày 12 tháng 8 năm 2026 theo một giấy phép tùy chỉnh; Qwen3.8-Omni-Flash chỉ có qua API và Alibaba chưa cho biết sẽ phát hành nó.
• Ngữ cảnh — một triệu token ở cả hai phía; đầu vào tối đa 991K trên mô hình omni, với đầu ra tối đa 131K và ngân sách suy luận 262K.
• Thời lượng phương tiện — lên đến một giờ âm thanh-hình ảnh liên tục trong một cuộc gọi omni duy nhất; sản phẩm chủ lực được ghi nhận là hỗ trợ đầu vào video mà không kèm theo thông tin chi phí theo giờ.
• Phương thức đầu ra — văn bản ở cả hai phía. Không bên nào tạo ra giọng nói, bất chấp xuất thân của mô hình omni.
• Điểm số độc lập — Qwen 3.8 đạt 40 trên Chỉ số Trí tuệ Artificial Analysis. Qwen3.8-Omni-Flash vẫn chưa có bất kỳ điểm số độc lập nào.

Vì sao các bảng benchmark không thể giải quyết được vấn đề này
Không có bảng đối đầu trực tiếp nào, và sẽ không sớm có một bảng như vậy. Tài liệu ra mắt của Alibaba cho Qwen3.8-Omni-Flash chỉ đánh giá nó so với Qwen3.5-Omni-Plus, phiên bản tiền nhiệm trực tiếp của nó, và so với Gemini 3.8 Flash; các con số của mô hình chủ lực đến từ một bộ đánh giá suy luận và lập trình hoàn toàn khác. Hai bảng không chia sẻ một hàng nào. Bất kỳ ai công bố một bảng đặt chúng cạnh nhau trên cùng một trục đều đã tự dựng nên trục đó.
Điều có thể nói một cách trung thực thì mang tính định hướng. Dựa trên chính các số liệu của nhà cung cấp, mô hình omni là một bước tiến lớn so với dòng omni mà nó thay thế — mức tăng trung bình trên 26% qua khoảng ba mươi đánh giá, với WildClawBench-MM ở 71,0, UniClawBench ở 69,6, LongAudioSpan ở 82,7 — và là một bước tiến thực sự nhưng chỉ một phần so với Gemini 3.8 Flash, khi nó dẫn đầu ở các bảng thiên về âm thanh như SpotSoundBench (67,2 so với 39,7) và MMAU (81,8 so với 76,9) và xếp sau ở AgenticVBench thuần suy luận video (36,8 so với 45,0). Về phía mô hình hàng đầu, điểm Index 40 của Qwen 3.8 là một phép đo độc lập và đáng giá hơn bất kỳ điều nào ở trên. Đó là những loại bằng chứng khác nhau và không nên được lấy trung bình cộng với nhau.

Một so sánh chi phí được tính toán đầy đủ, cùng với giả định được nêu rõ
Lấy một job phân tích tài liệu dài và video: 300.000 token đầu vào và 20.000 token đầu ra, một dạng hợp lý cho một cuộc họp được ghi lại dài chín mươi phút có slide. Trên Qwen3.8-Omni-Flash thì đó là 300.000 × 0,15 USD mỗi triệu = 0,045 USD đầu vào và 20.000 × 0,47 USD mỗi triệu = 0,0094 USD đầu ra, vậy khoảng 5,4 xu. Trên Qwen 3.8 thì cùng lệnh gọi đó là 300.000 × 2,00 USD mỗi triệu = 0,60 USD và 20.000 × 6,00 USD mỗi triệu = 0,12 USD, hay khoảng 72 xu. Nhỉnh hơn mười ba lần chi phí cho cùng số lượng token.
Con số thay đổi quyết định không phải là tỷ lệ mà là khối lượng. Với một trăm công việc như vậy mỗi ngày, đó là khoảng 5 đô la một ngày so với khoảng 72 đô la một ngày — sự khác biệt giữa một tính năng bạn phát hành và một tính năng bạn thu hẹp phạm vi. Nhưng nếu tác vụ là một phép trích xuất khó từ một hợp đồng 300K-token, nơi một câu trả lời sai tốn một giờ để con người kiểm duyệt, thì mức phụ trội gấp 13 lần không đáng kể và mô hình suy luận mạnh hơn sẽ thắng ở lỗi đầu tiên mà nó không mắc phải. Hãy xác lập giả định trước khi bạn nhìn vào dòng giá, chứ không phải sau đó.
Nơi mỗi cái thực sự giành chiến thắng
Qwen3.8-Omni-Flash thắng ở bất cứ thứ gì được đo bằng giờ. Phiên âm cuộc họp với phân tách người nói và trích xuất nhiệm vụ tiếp theo, tóm tắt video dài, báo cáo nghiên cứu nghe nhìn, quy trình tạo chú thích, và bất kỳ agent nào phải tự quyết định phút nào của bản ghi là quan trọng. Cải thiện phân tách người nói do nhà cung cấp báo cáo — tỷ lệ lỗi người nói của AliMeeting giảm từ 88,11 xuống 3,35 — là kiểu chênh lệch biến một quy trình được con người xem xét thành quy trình tự động, dù một phân tích kỹ thuật bằng tiếng Trung về buổi ra mắt lập luận rằng phần lớn mức cải thiện đó đến từ kỹ thuật front-end và phân tách người nói bao quanh mô hình chứ không phải từ chính mô hình, nên hãy đo kiểm trên âm thanh của riêng bạn trước khi bạn loại bỏ bước con người xem xét. Mô hình omni cũng thắng một cách đơn giản về giá cho bất kỳ khối lượng công việc văn bản lớn nào mà chất lượng văn bản của nó đủ tốt, điều mà Alibaba tuyên bố là tương đương với các mô hình chỉ có văn bản cùng kích thước — một tuyên bố chưa được tái lập, và đáng để kiểm chứng thay vì mặc định tin.
Qwen 3.8 thắng ở mọi nơi mà đầu ra được đánh giá thay vì đếm: suy luận khó, công việc agentic dài hạn, công việc lập trình quy mô lớn, phân tích tài liệu hàng triệu token nơi bản tổng hợp chính là sản phẩm. Nó cũng thắng ở một khía cạnh chẳng liên quan gì đến các bài benchmark — đó là trọng số mở. Nếu ràng buộc của bạn là nơi lưu trú dữ liệu, triển khai tại chỗ, tinh chỉnh, hay đơn giản là không muốn có nhà cung cấp nằm trong đường dẫn suy luận, thì mô hình omni hoàn toàn không phải là một lựa chọn, và không có lợi thế về giá nào bù đắp được khoảng cách đó. Chính ràng buộc duy nhất ấy quyết định nhiều triển khai thực tế hơn tất cả những con số nêu trên.
Chạy chúng mà không có hai hợp đồng
Trở ngại thực tế trong một so sánh như thế này hiếm khi nằm ở việc chọn mô hình; mà là bạn phải tích hợp hai nhà cung cấp, hai mối quan hệ thanh toán và hai bộ mã phía client chỉ để biết xem mình muốn cái nào. Qwen3.8-Max — điểm cuối mang lõi mở 2,4 nghìn tỷ tham số — đã hoạt động trên OrcaRouter dưới mã mô hình qwen/qwen3.8-max, với giá 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra, cùng ngữ cảnh một triệu token và đầu vào văn bản, hình ảnh, video, song song với hơn 200 mô hình khác trên cùng một khóa ở mức giá niêm yết của nhà cung cấp, không phụ phí 0% và tự động chuyển đổi dự phòng giữa các nhà cung cấp nếu một điểm cuối bị suy giảm. Qwen3.8-Omni-Flash không nằm trong danh mục đó — nó chạy trên các nền tảng riêng của Alibaba — nên cấu hình trung thực nhất hiện nay là mô hình chủ lực trên tuyến của chúng tôi và mô hình omni được gọi trực tiếp, với lớp định tuyến cho bạn một chỗ để đặt mô hình thua cuộc sau khi bạn đã chạy thử.

Phán quyết
Chọn Qwen3.8-Omni-Flash khi đầu vào dài, đầu ra ngắn và khối lượng khiến đơn giá trở thành ràng buộc quyết định. Chọn Qwen 3.8 khi đầu vào dày đặc, đầu ra chính là sản phẩm và tính đúng đắn hoặc khả năng kiểm soát triển khai là điều không thể thương lượng. Vùng chồng lấn — hiểu video — là nơi duy nhất tồn tại một cuộc đối đầu trực tiếp thực sự, và trong vùng đó mô hình omni nắm lợi thế về chi phí và thời lượng trong khi mô hình chủ lực nắm lợi thế về suy luận và trọng số mở. Hãy chạy cả hai trên dữ liệu của chính bạn trước khi cam kết; mô hình omni chưa có đánh giá độc lập, và lợi thế giá trong ngày ra mắt đúng là kiểu điều đáng để xác nhận bằng hóa đơn thay vì một thông báo.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
