
Qwen3.8-Omni-Flash sau năm ngày: Một cánh cửa, không có trọng số, và những điểm số đầu tiên không phải của Alibaba
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Năm ngày sau khi nhà cung cấp mở Qwen3.8-Omni-Flash cho khách hàng API, mô hình vẫn chỉ có đúng một nơi trú ngụ. Nó chạy trên nền tảng Qianwen của chính nhà cung cấp và trên dịch vụ đám mây Bailian của họ; các danh sách bên thứ ba đã xuất hiện kể từ khi ra mắt chỉ là proxy đứng trước chính những endpoint đó, chứ không phải một nơi thứ hai mà mô hình tồn tại. Chưa có trọng số nào được phát hành. Các con số ngày ra mắt — giảm 98% chi phí cho một giờ âm thanh, mức tăng trung bình 26% so với Qwen3.5-Omni-Plus, một triệu token ngữ cảnh, đầu ra chỉ văn bản — vẫn là của chính nhà cung cấp và chưa được tái lập. Điều thực sự thay đổi trong năm ngày qua không phải là mô hình mà là bối cảnh xung quanh nó: một lớp mỏng điểm số bên thứ ba đã xuất hiện, hỗ trợ framework có ngay từ ngày đầu tiên, và phép so sánh mà ai cũng đang hướng tới là với Gemini 3.8 Flash chứ không phải Qwen3.8-Flash mà mô hình này được xây dựng cùng. Mỗi điều trong số đó đáng được nhìn kỹ hơn so với mức mà bài đưa tin ra mắt đã dành cho nó.
Cánh cửa này là một cánh cửa tốt, và nó là cánh cửa duy nhất.
Độ sẵn có đã mở rộng mà không trở thành nhiều nguồn. Mô hình đáp lại nguyên trạng một yêu cầu có dạng OpenAI, nghĩa là mã client hiện có phần lớn vẫn hoạt động; thứ bị hỏng là endpoint, vì máy chủ quốc tế và Trung Quốc đại lục là những dịch vụ riêng biệt với tính phí riêng. Mã trỏ đến mặc định sẽ hoặc thất bại, hoặc bị tính phí sai đơn vị tiền tệ, và câu chuyện giá theo giờ chỉ đúng ở phía quốc tế. Các thư viện client mã nguồn mở đã phát hành hỗ trợ ngay từ ngày đầu cho mô hình, điều này thật sự hữu ích và cũng không phải là nhà cung cấp thứ hai: một thư viện giao tiếp với Bailian là lớp bọc tiện lợi quanh cùng một nguồn cung duy nhất.
Đó là rủi ro mang tính cấu trúc đáng để gọi tên. Một mô hình đơn nguồn không có đường dự phòng. Nếu endpoint bị giới hạn tần suất, suy giảm chất lượng, hay một khu vực ngừng hoạt động, thì không có nơi nào để chuyển sang, và thư viện client có hỗ trợ đến đâu cũng không thay đổi được điều đó. Đây cũng là lý do chúng tôi nói rõ lập trường của chính mình thay vì ám chỉ điều ngược lại: Qwen3.8-Omni-Flash không nằm trong danh mục của chúng tôi. Chúng tôi không lưu trữ mô hình này, và một người đọc đăng ký với kỳ vọng định tuyến nó sẽ bị dẫn dắt sai. Thứ có thể định tuyến được là phần còn lại của dòng mô hình — Qwen3.8-Flash và Qwen3.8-Max đều đang hoạt động trên API của chúng tôi — và OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp với mức chênh lệch 0%, nên khi giá omni của Alibaba thay đổi, hoặc vào ngày mô hình omni trở nên khả dụng để định tuyến, thay đổi đó sẽ đến với khách hàng ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo.

Những điểm số đầu tiên không phải của Alibaba thì thưa thớt, và chúng chẳng có gì hay ho.
Không có gì về mô hình này trên Artificial Analysis, và chính sự vắng mặt đó mới là tiêu đề trung thực sau năm ngày ra mắt: những bảng xếp hạng mà ai cũng trích dẫn cho các mô hình lân cận vẫn chưa có một dòng nào dành cho mô hình omni. Khoảng trống ấy đã được lấp đầy bằng một thứ khác. Một nền tảng đánh giá của bên thứ ba đã bắt đầu công bố các lượt chạy thử đối với mô hình này, và bản tóm tắt của nó đáng để đọc chính vì những gì nó không nói ra. Nó báo cáo phân loại email đạt độ chính xác 99,0% (bách phân vị thứ 86), đạo đức đạt 95,0% (bách phân vị thứ 23), và lập luận đạt 56,0%, mức mà nó xếp vào bách phân vị thứ 28 và gọi là một điểm yếu đáng chú ý; tốc độ nằm ở bách phân vị thứ 21, chi phí ở bách phân vị thứ 58, với tỷ lệ thành công tổng thể là 89%.
Hãy thực sự thận trọng với những dữ liệu đó, và không chỉ vì mẫu quá nhỏ. Cũng chính trang đó ghi ngày phát hành của mô hình là 20 tháng 9, tức hai ngày sau khi Alibaba tung ra nó, không đưa ra ngày chạy cho bất kỳ kết quả nào, và hiển thị một bảng benchmark trống bên dưới phần tóm tắt mô tả những con số mà bảng không hề chứa. Đó là đặc điểm của một bộ khung đánh giá ban đầu, được giám sát lỏng lẻo, chứ không phải một đánh giá có đo lường đầy đủ, và cách diễn giải trung thực là đây mới chỉ là những điểm dữ liệu đầu tiên không đến từ nhà cung cấp, chứ không phải những điểm dữ liệu đáng tin cậy đầu tiên. Chúng là lý do để bạn tự kiểm thử mô hình, không phải lý do để kết luận bất cứ điều gì. Tuy nhiên, hướng đi này nhất quán với điều mà chính tài liệu của nhà cung cấp ngụ ý bằng cách không nhắc tới: đây là một mô hình về nhận thức và media dài, và các bảng đánh giá nặng về suy luận không phải là nơi nó hướng tới.
Cũng có một cái bẫy trong các kết quả tìm kiếm sẽ khiến nhiều người mắc phải trong vài tuần tới. Qwen 3.8, mô hình văn bản, có Artificial Analysis Intelligence Index ở mức bốn mươi mấy, và con số đó đã được trích dẫn trong hơn một bản tóm tắt như thể nó mô tả mô hình omni. Không phải vậy. Chúng là những mô hình khác nhau với những nhiệm vụ khác nhau, và mô hình omni vẫn chưa có chỉ số nào cả.

Bảng benchmark vẫn chỉ là một nhà cung cấp tự so sánh với chính mình
Con số ra mắt — mức cải thiện trung bình hơn 26% trên khoảng ba mươi phép đánh giá — hoàn toàn được đo so với Qwen3.5-Omni-Plus. Điều đó cho bạn biết dòng mô hình này đã tiến bộ. Nó không cho bạn biết mô hình đứng ở đâu so với bất cứ thứ gì bạn có thể đang phải trả tiền, và những so sánh chọn lọc được lan truyền kèm theo cũng không lấp được khoảng cách đó. Bức tranh do nhà cung cấp báo cáo so với Gemini 3.8 Flash là một thắng lợi thực sự trên các bảng đo âm thanh và là một thất bại trên những bảng đo công việc video mang tính tác tử: WildClawBench-MM 71.0 so với 58.9 và SpotSoundBench 67.2 so với 39.7 ở một bên, AgenticVBench 36.8 so với 45.0 và OmniGAIA 74.0 so với 78.6 ở bên kia. Cách diễn đạt trong bản tóm tắt của chính Alibaba — hiệu năng âm thanh-hình ảnh "đang tiến gần" Gemini, hiệu năng âm thanh tổng thể vượt qua nó — thận trọng hơn những tiêu đề mà nó tạo ra, và phiên bản thận trọng mới là phiên bản chính xác.
• Ngữ cảnh — 1 triệu token, với đầu vào tối đa khoảng 991K (khoảng 983K ở chế độ suy nghĩ) và đầu ra tối đa 131K.
• Phương thức — đầu vào văn bản, hình ảnh, âm thanh và video; chỉ xuất văn bản. Không tạo giọng nói trong mô hình cơ sở.
• Thời lượng — tối đa một giờ âm thanh hoặc âm thanh-hình ảnh liên tục cho mỗi cuộc gọi, đây chính là điều giúp cho công việc với cuộc họp và phương tiện dài trở nên khả thi mà không cần chia thành từng đoạn.
• Phạm vi ngôn ngữ — khả năng nhận dạng trên 74 ngôn ngữ cùng 39 phương ngữ Trung Quốc trong các tài liệu ra mắt, với những con số rộng hơn (113 ngôn ngữ và phương ngữ) được nêu ở nơi khác cho đầu vào âm thanh.
• Chi tiết đầu vào — chấp nhận âm thanh không gian stereo và bốn kênh, với biến thể Realtime được mô tả là mô hình đa phương thức đầu tiên có thể định vị mục tiêu bằng âm thanh của nó.
Giá — 0,15 USD mỗi triệu token đầu vào, 0,016 USD cho token được cache, 0,47 USD cho đầu ra ở phía quốc tế, cùng một bảng giá riêng cho đại lục không thể so sánh trực tiếp.
Con số 98% là có thật, và đó không phải là hóa đơn của bạn
Theo chính phương pháp luận của Alibaba — mẫu hai phút nhân với ba mươi, video được lấy mẫu ở 720p và một khung hình mỗi giây — một giờ âm thanh đầu vào giảm từ 0,28 USD xuống dưới 0,01 USD, và một giờ âm thanh kết hợp video giảm từ 3,27 USD xuống 0,20 USD. Đó là những mức giảm lớn, cụ thể, do nhà cung cấp báo cáo, và chúng là mức giảm trên một hạng mục chi phí. Phép tính thực sự quan trọng là hạng mục đó chiếm bao nhiêu phần trong khối lượng công việc của bạn. Một pipeline dành phần lớn token cho đầu ra, cho ngữ cảnh được lưu đệm, hoặc cho các khung hình video được lấy mẫu dày hơn một khung mỗi giây sẽ thấy mức phần trăm thay đổi trên hóa đơn nhỏ hơn nhiều so với lời hứa ở tiêu đề, và tiêu đề nói về âm thanh đầu vào, không phải về tổng thể. Thêm đầu ra chỉ có văn bản và khoảng cách lại nới rộng: bất cứ thứ gì phải đáp lại bằng giọng nói đều cần một mô hình thứ hai, và mô hình đó được tính phí riêng.
Đây là phần của bức tranh nơi định tuyến chứng tỏ được giá trị của mình. Giá trị của một bộ định tuyến pass-through không nằm ở mức giảm giá — mà là bạn trả đúng bảng giá của chính nhà cung cấp, và rằng một khối lượng công việc có thể được trải trên nhiều mô hình để một mô hình đơn nguồn trở thành một thành phần thay vì một mối phụ thuộc. Một mô hình omni, thứ duy nhất bạn có thể gọi, chính là một điểm lỗi duy nhất ở cả tầng khả dụng lẫn tầng định giá.

Năm ngày sản xuất sẽ thực sự cho bạn biết điều gì
Ba điều sẽ giải quyết các câu hỏi còn bỏ ngỏ. Việc đo lường độc lập kết quả phân tách người nói trên AliMeeting — tỷ lệ lỗi giảm từ 88,11 xuống 3,35 và cpWER từ 89,61 xuống 17,18 — sẽ cho thấy điều đó thuộc về mô hình hay thuộc về kỹ thuật phân tách người nói và front-end bao quanh nó, nơi mà ít nhất một phân tích kỹ thuật của Trung Quốc cho rằng phần lớn mức cải thiện đến từ đó. Một bài kiểm thử được tái lập về mức giảm token của chế độ agentic, khi độ chính xác tăng từ 63,4 lên 67,8 trên OmniVideoBench trong lúc số token trên mỗi truy vấn giảm từ 145.736 xuống 79.117, sẽ xác nhận tuyên bố hữu ích nhất trong bản phát hành: rằng mô hình có thể trở nên tốt hơn và rẻ hơn cùng lúc. Và một dòng trên Artificial Analysis hoặc arena sẽ biến mọi con số nhà cung cấp ở trên thành thứ có thể so sánh được, điều này là điều kiện tiên quyết để mô hình được chọn thay vì chỉ được thử.
Cho đến lúc đó, cách ứng xử hợp lý là cách áp dụng cho bất kỳ mô hình năm ngày tuổi nào chỉ có một host và không có đánh giá độc lập: đáng để đo trên âm thanh và video của chính bạn, không đáng để trở thành con đường duy nhất xuyên qua pipeline của bạn. Nếu khối lượng công việc của bạn là phân tích cuộc họp hoặc phương tiện truyền thông dạng dài bằng tiếng Trung hoặc tiếng Anh và chi phí của bạn bị chi phối bởi số giờ đầu vào thay vì token đầu ra, thì kinh tế ở đây đủ mạnh để biện minh cho một thử nghiệm trong tuần này. Nếu khối lượng công việc của bạn cần đầu ra giọng nói, hoặc cần phương án dự phòng khi một nhà cung cấp suy giảm, thì mô hình ở trạng thái hiện nay không thể là toàn bộ câu trả lời — và không có lượng hỗ trợ framework ngày-zero nào thay đổi được điều đó.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
