
Gemini 3.5 Flash-Lite vs Qwen 3.8: Ngựa thồ giá rẻ vs Flagship 2.4T
- qwenMỚIQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 trên 1 triệu token · 56 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3150Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 200 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
Khi bản so sánh này được viết lần đầu, nó mất cân bằng một cách bất thường: Gemini 3.5 Flash-Lite là một sản phẩm thực sự, có thể mua được và Qwen 3.8 là bản xem trước có kiểm soát, không có giá, không có điểm chuẩn, và không có trọng số. Có rất ít thứ để so sánh.
Đó không còn là tình hình nữa. Qwen3.8-Max đã đạt đến trạng thái sẵn sàng chung vào ngày 3 tháng 8 năm 2026 với một bảng giá đã công bố là $2 / $6 cho mỗi triệu token, một điểm cuối tương thích với OpenAI và DashScope, và một bảng điểm chuẩn đầy đủ. Nó là tự phục vụ, có thể lập ngân sách, và đang hoạt động — bao gồm trên OrcaRouter. Vì vậy, bài viết này đã được viết lại từ đầu, bởi vì sự so sánh trung thực ngày nay không phải là "mô hình đang vận chuyển so với sản phẩm không tồn tại." Đó là một sự thực sự cấp so sánh: con ngựa thồ thông lượng cao rẻ nhất của Google so với hạm lớn nhất của Alibaba.
Lưu ý cho các nhà phát triển — hai cái này nằm ở hai đầu đối diện của đường cong chi phí, vì vậy câu hỏi đúng là khối lượng công việc của bạn thuộc bậc nào. OrcaRouter đứng trước hơn 200 mô hình đằng sau một endpoint tương thích OpenAI, nên bạn có thể thử cả hai trên cùng một tác vụ mà không cần kết nối hai SDK.
Kết luận ngắn gọn. Các mô hình này không thực sự cạnh tranh với nhau — chúng là câu trả lời cho những câu hỏi khác nhau. Flash-Lite là một mô hình hiệu quả: Artificial Analysis Index 36, $0,30 / $2,50 mỗi 1 triệu token, khoảng 490 token/giây, được cung cấp rộng rãi. Mô hình này được thiết kế để xử lý mọi yêu cầu với chi phí không đáng kể. Qwen3.8-Max là mô hình chủ lực: ~2,4 nghìn tỷ tham số, ngữ cảnh 1 triệu token với mức giá cố định, hỗ trợ gốc cho đầu vào hình ảnh và video, cùng các điểm số tự công bố mang dáng dấp tiên phong (GPQA Diamond 92,6, Terminal-Bench 2.1 86,6) — với mức giá $2 / $6, tức gấp 6,7 lần giá đầu vào của Flash-Lite. Flash-Lite là lựa chọn mặc định phù hợp cho phân loại, định tuyến và trích xuất khối lượng lớn. Qwen3.8-Max là mô hình bạn chuyển lên khi một tác vụ thực sự cần khả năng suy luận tiên phong, một triệu token ngữ cảnh hoặc đầu vào phi văn bản. Một lưu ý duy nhất vẫn không thay đổi: Qwen vẫn chưa có điểm benchmark độc lập.
Những điểm chính rút ra
• Qwen 3.8 hiện đã được phát hành rộng rãi — kể từ ngày 3 tháng 8 năm 2026, sản phẩm đã công bố bảng giá, cho phép truy cập tự phục vụ và cung cấp bảng benchmark. Cách mô tả trước đây về bản xem trước có kiểm soát truy cập và không thể dự trù ngân sách giờ đã lỗi thời.
• Flash-Lite rẻ hơn đáng kể: $0.30 / $2.50 trên mỗi 1M so với Qwen là $2 / $6 — khoảng 6.7× ở đầu vào và 2.4× ở đầu ra.
• Flash-Lite nhanh hơn nhiều: khoảng 490 tokens/sec, được thiết kế cho các tác vụ thông lượng cao. Qwen3.8-Max cho thấy thời gian đến token đầu tiên ở phân vị p50 là 1.64s trong dữ liệu telemetry 7 ngày của OrcaRouter nhưng là một mô hình lớn và toàn diện.
• Flash-Lite có điểm số duy nhất được kiểm toán: Artificial Analysis Index 36. Qwen3.8-Max vẫn chưa được chấm điểm bởi mọi nhà đánh giá độc lập, mặc dù Alibaba hiện công bố số liệu của riêng mình.
• Qwen thắng thuyết phục về mặt năng lực: một ngữ cảnh 1M token được tính phí cố định không phụ phí cho prompt dài, cùng với đầu vào văn bản/hình ảnh/video và OmniDocBench 1.5 92.1 để phân tích tài liệu. Flash-Lite là một mô hình hiệu quả nhỏ.
• Trọng số mở: Qwen's được hứa hẹn trong tuần này (chưa có giấy phép), cùng với một Qwen3.8-27B được báo cáo chạy trong ~17GB VRAM. Flash-Lite đã đóng cửa vĩnh viễn.
Ghi chú về độ chính xác: mọi số liệu chất lượng của Qwen3.8-Max đều do Alibaba công bố và chưa được bên thứ ba xác minh. Các số liệu về Gemini 3.5 Flash-Lite đến từ Artificial Analysis. Giá Qwen là biểu giá GA từ Alibaba Model Studio và thay thế quyền truy cập thời kỳ xem trước được mô tả trong các phiên bản trước của bài viết này.
Thông số kỹ thuật và giá, đặt cạnh nhau
• Nhà sản xuất / trạng thái — Flash-Lite: Google; khả dụng chung; Qwen3.8-Max: Alibaba; GA (ngày 3 tháng 8, 2026)
• Định vị — Flash-Lite: tầng hiệu quả giá rẻ, thông lượng cao; Qwen3.8-Max: tham vọng dẫn đầu / tiên phong
• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Vẫn chưa được chấm điểm
• Điểm số do hãng công bố — Flash-Lite: thứ hạng do bên thứ ba đo lường; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (tất cả do Alibaba công bố)
• Giá (trên 1M, vào / ra) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, cố định trên ngữ cảnh 1M; đầu vào được lưu trữ $0.25
• Tốc độ — Flash-Lite: ~490 tok/sec (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64s (Telemetry 7 ngày của OrcaRouter)
• Bối cảnh — Flash-Lite: ngữ cảnh tầng hiệu quả; Qwen3.8-Max: 1 triệu token (983,616 khi có suy luận; đầu ra tối đa 131,072)
• Phương thức — Flash-Lite: mô hình hiệu quả tập trung vào văn bản; Qwen3.8-Max: văn bản, hình ảnh, video đầu vào → văn bản đầu ra
• Trọng số — Flash-Lite: đóng, chỉ API; Qwen3.8-Max: được hứa hẹn trong tuần, chưa có giấy phép
• Truy cập ngay hôm nay — Flash-Lite: API tiêu chuẩn, tự phục vụ; Qwen3.8-Max: API tiêu chuẩn, tự phục vụ (Model Studio, DashScope, OrcaRouter)
Được trình bày theo cách này, kết quả hoàn toàn khác so với trước đây. Cột của Qwen không còn trống — nó đã đầy, và ở nhiều hàng, nó là lựa chọn mạnh hơn. Thay cho khung so sánh cũ "thứ đã biết rõ so với lời hứa" là một khoảng cách đẳng cấp rõ ràng: Flash-Lite rẻ hơn khoảng 6.7× về chi phí đầu vào và nhanh hơn khoảng 13× về thông lượng, trong khi Qwen cung cấp ngữ cảnh đa phương thức với một triệu token và khả năng suy luận cấp tiên phong được tuyên bố. Cả hai đều là những sản phẩm chính đáng; chúng chỉ phục vụ những công việc khác nhau.
Hàng duy nhất mà lời cảnh báo cũ vẫn còn đúng là dòng benchmark. Chỉ số Index 36 của Flash-Lite được Artificial Analysis đo trên một bảng xếp hạng công khai. Mọi con số của Qwen — GPQA Diamond 92,6, Terminal-Bench 86,6 và phần còn lại — đều do Alibaba tự tạo ra trên hệ thống đo lường riêng của họ. Đó thực sự là một cải thiện so với việc không công bố gì, nhưng đó không phải là xác minh từ bên thứ ba, và các phòng nghiên cứu thường công bố những benchmark mà họ chiến thắng.

Index 36 so với một flagship chưa được chấm điểm: nói thật khi đọc điều này
Thật hấp dẫn khi đem Index 36 của Flash-Lite đối đầu với GPQA Diamond 92.6 của Qwen và tuyên bố một trận đè bẹp. Điều đó sẽ là một sai lầm về phạm trù trên hai phương diện.
Đầu tiên, Artificial Analysis Intelligence Index là một chỉ số tổng hợp trên nhiều tác vụ; còn GPQA Diamond là một bài kiểm tra khoa học sau đại học đơn lẻ. Chúng không nằm trên cùng một thang đo và không thể trừ cho nhau.
Thứ hai, và quan trọng hơn, Flash-Lite chưa bao giờ được thiết kế để đạt điểm cao. Điểm Index 36 chính là mức điểm của một mô hình hiệu quả. Mục tiêu kỹ thuật của Google là một mô hình đủ rẻ và đủ nhanh để đặt trước mọi yêu cầu đến — định tuyến ticket, phân loại, trích xuất, tóm tắt ở quy mô lớn — nơi mà một mô hình hàng đầu sẽ là phi lý về mặt kinh tế. Đánh giá nó so với một mô hình chủ lực 2.4T về trần suy luận sẽ bỏ lỡ mục đích của nó.
Điều chúng ta có thể nói là hẹp hơn và hữu ích hơn. Qwen3.8-Max rất có thể là mô hình có năng lực vượt trội hơn đáng kể — các con số tự báo cáo của nó cao hơn nhiều so với những gì một mô hình Index-36 tạo ra, và bước nhảy FrontierSWE lên 73.5 từ mức 40.7 của phiên bản tiền nhiệm cho thấy tiến bộ thực sự. Nhưng "rất có thể" vẫn là một suy luận, vì chưa có nhà đánh giá độc lập nào chấm điểm nó. Để có bối cảnh, phiên bản tiền nhiệm Qwen3.7-Max đạt 46 trên AA Index — cao hơn mức 36 của Flash-Lite, nhưng còn xa mới tới mức tiên phong — nên bước nhảy thế hệ mà Alibaba ngụ ý là lớn và chưa được kiểm chứng.
Hệ quả thực tế: nếu tác vụ của bạn là loại Flash-Lite đã hoàn thành đúng, trần năng lực cao hơn của Qwen chẳng đáng giá gì với bạn và bạn sẽ phải trả gấp 6,7× cho nó. Trần năng lực chỉ thực sự có ý nghĩa khi Flash-Lite đang thất bại.
Chi phí thực tế: khoảng cách giữa các bậc qua số liệu
Hãy xem xét một tác vụ phân loại khối lượng lớn: 2.000 token đầu vào, 200 token đầu ra, chạy 500.000 lần mỗi ngày — một dạng bài toán sàng lọc hỗ trợ hoặc định tuyến nội dung thực tế.
• Flash-Lite: mỗi lần gọi, 0.002M × $0.30 = $0.0006, cộng thêm 0.0002M × $2.50 = $0.0005. ≈ $0.0011 mỗi lần gọi → ~$550/ngày.
• Qwen3.8-Max: mỗi lần gọi, 0.002M × $2 = $0.004, cộng 0.0002M × $6 = $0.0012. ≈ $0.0052 mỗi lần gọi → ~$2,600/ngày.
• Hàng tháng: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — mức chênh lệch $61,500 cho cùng khối lượng tác vụ.
Ở quy mô đó, lựa chọn phân khúc là hạng mục chi phí lớn nhất trong hệ thống, và rất khó để biện minh cho việc dùng một mẫu flagship cho công việc mà một mô hình hiệu quả đã xử lý được. Đây chính xác là tình huống mà Flash-Lite được tạo ra để phục vụ.
Bây giờ hãy đảo ngược nó. Thực hiện một tác vụ tài liệu dài: 600,000 token ngữ cảnh, 5,000 token đầu ra, 200 lần mỗi ngày.
• Qwen3.8-Max: 0,6M × $2 = $1,20, cộng với 0,005M × $6 = $0,03. ≈ $1,23 mỗi lần gọi, không có phụ phí cho prompt dài — và khoảng $0,18 nếu ngữ cảnh được lưu cache với giá $0,25/1M.
• Flash-Lite hoàn toàn không thể định giá cho dạng này, bởi vì ngữ cảnh gọi đơn 600,000 token không phải là thứ mà một mô hình thuộc tầng hiệu suất được xây dựng để chứa.
Vậy nên câu trả lời đảo ngược hoàn toàn theo hình dạng khối lượng công việc, đó mới là bài học thực sự. Flash-Lite thắng áp đảo trong các tác vụ ngữ cảnh ngắn, khối lượng lớn. Qwen thắng ở mọi thứ đòi hỏi một triệu token hoặc đầu vào phi văn bản, nơi Flash-Lite không phải là lựa chọn rẻ hơn mà đơn giản là không phải là một lựa chọn.

Các kịch bản: gói nào phù hợp
Hỗ trợ phân loại và định tuyến ở quy mô lớn. Rõ ràng là Flash-Lite. Index 36 đủ để phân loại, và với chi phí khoảng $0.0011 mỗi lần gọi, bạn có thể chạy nó trên mọi ticket. Chỉ chuyển tiếp phần nhỏ mơ hồ lên mô hình lớn hơn.
Phân tích toàn bộ hợp đồng hoặc hồ sơ nộp.Qwen3.8-Max. Với ngữ cảnh 1M giá trọn gói, một tài liệu 400 trang được xử lý trong một lần gọi mà không phụ phí và không chia nhỏ, và điểm tự công bố OmniDocBench 1.5 92.1 của nó nhắm chính xác vào công việc này.
Pipeline ảnh chụp màn hình, biểu đồ hoặc video. Qwen3.8-Max, theo mặc định — nó chấp nhận đầu vào hình ảnh và video và đạt OSWorld-Verified 86.1 khi điều khiển GUI thực tế. Flash-Lite không phải là lựa chọn cho đầu vào phi văn bản.
Lập trình tác tử.Qwen3.8-Max ở các con số được công bố (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), với lưu ý rằng không con số nào được xác minh độc lập và điểm tự công bố yếu nhất của nó là IFBench 82.8 về khả năng tuân theo chỉ dẫn — một rủi ro thực sự cho các pipeline phân tích đầu ra của từng bước.
Kiến trúc hai tầng. Thông thường, câu trả lời đúng là cả hai: Flash-Lite là bước xử lý đầu tiên với chi phí thấp cho mọi yêu cầu, còn Qwen3.8-Max là đường leo thang cho phần nhỏ cần một triệu token, một hình ảnh hoặc khả năng suy luận thực sự. Mô hình này nắm bắt được hầu hết lợi thế chi phí của Flash-Lite trong khi vẫn duy trì một tùy chọn tiên tiến.
Tự lưu trữ và tính mở
Flash-Lite đã bị đóng cửa và chỉ hoạt động qua API, vĩnh viễn — không có cách tự lưu trữ.
Trọng số của Qwen3.8-Max được hứa hẹn sẽ ra mắt trong tuần này, nhưng mô hình hàng đầu không phải là mục tiêu thực tế: khoảng 1.2TB ở mức 4-bit so với khoảng 141GB mỗi H200 có nghĩa là cần tám hoặc nhiều hơn các bộ tăng tốc cao cấp, và Alibaba vẫn chưa công bố số lượng tham số hoạt động, vì vậy thông lượng mà khoản chi đó mang lại là không thể mô hình hóa được. Ngoài ra vẫn chưa có văn bản giấy phép, điều đó có nghĩa là khả năng sử dụng thương mại về mặt chính thức vẫn chưa được xác định.
Được công bố đồng thời, Qwen3.8-27Bmới là bản phát hành thực sự quan trọng cho các kế hoạch triển khai tại chỗ. Cũng chuyển sang dạng trọng số mở và được báo cáo là chạy trong khoảng 17GB VRAM, đây là một lựa chọn tự lưu trữ thực thụ — và đáng chú ý là, một đối thủ cạnh tranh gần hơn nhiều với phân khúc hiệu quả của Flash-Lite so với flagship 2.4T.
Câu hỏi thường gặp
Hôm nay tôi có thể sử dụng Qwen 3.8 không?
Vâng. Qwen3.8-Max đã chính thức phát hành rộng rãi vào ngày 3 tháng 8 năm 2026 với mức giá công bố là $2 / $6 cho mỗi 1 triệu token và điểm cuối tương thích với OpenAI và DashScope. Dịch vụ này tự phục vụ qua Alibaba Model Studio, DashScope và OrcaRouter. Các phiên bản trước của bài viết này mô tả một bản xem trước có kiểm soát; thông tin đó đã lỗi thời.
Cái nào rẻ hơn?
Gemini 3.5 Flash-Lite vượt trội hơn hẳn: $0,30 / $2,50 mỗi 1M so với $2 / $6 của Qwen3.8-Max — rẻ hơn khoảng 6,7 lần cho đầu vào và 2,4 lần cho đầu ra. Với các tác vụ khối lượng lớn, ngữ cảnh ngắn, sự khác biệt đó lấn át mọi yếu tố khác.
Cái nào tốt hơn?
Chúng thuộc các phân khúc khác nhau. Flash-Lite có điểm được kiểm toán duy nhất (AA Index 36) nhưng được xây dựng để đạt thông lượng chi phí thấp, không phải để suy luận. Qwen3.8-Max rất có thể mạnh hơn nhiều — GPQA Diamond 92.6 và Terminal-Bench 2.1 86.6 do tự báo cáo mang dáng dấp tiên phong — nhưng nó không có điểm chuẩn độc lập nào, vì vậy đó vẫn chỉ là một suy luận chứ không phải một kết quả được đo lường.
Cái nào nhanh hơn?
Flash-Lite, một cách đáng kể. Artificial Analysis đo được khoảng 490 token/giây, đó chính là mục đích thiết kế của nó ở phân khúc hiệu quả. Qwen3.8-Max cho thấy thời gian đến token đầu tiên (time-to-first-token) phân vị p50 là 1,64 giây trong dữ liệu đo từ xa 7 ngày của OrcaRouter, nhưng đây là một mô hình lớn và toàn diện, và các nhà đánh giá thời kỳ xem trước nhận thấy nó chậm trên các bản dựng agentic dài.
Qwen 3.8 hiện đã có open weights chưa?
Chưa đâu. Alibaba cho biết các trọng số flagship sẽ về trong tuần này, nhưng vẫn chưa có giấy phép, model card, hay kho lưu trữ. Ngay cả khi được phát hành, mô hình 2.4T cần tám GPU lớp H200 trở lên. Qwen3.8-27B được công bố cùng lúc, được cho là tốn ~17GB VRAM, mới là lựa chọn tự lưu trữ thực tế.
Tôi có nên sử dụng cả hai không?
Thường là có. Mô hình hai tầng — Flash-Lite làm bước xử lý đầu tiên giá rẻ cho mọi yêu cầu, Qwen3.8-Max làm kênh xử lý nâng cao cho các tác vụ ngữ cảnh dài, đa phương thức hoặc thực sự khó — giữ lại phần lớn lợi thế chi phí của Flash-Lite trong khi cho bạn một lựa chọn tiên phong khi nó thực sự xứng đáng với số tiền bỏ ra.
Hôm nay tôi nên chọn cái nào để đưa vào sản xuất?
Flash-Lite dành cho các tác vụ thuần văn bản, ngữ cảnh ngắn, khối lượng lớn mà Index 36 là đủ — nó rẻ, nhanh, đã được kiểm định và chứng minh. Qwen3.8-Max khi khối lượng công việc cần ngữ cảnh triệu token, đầu vào hình ảnh hoặc video, hoặc khả năng suy luận mà Flash-Lite rõ ràng không đáp ứng nổi. Cả hai hiện đều thực sự có thể triển khai được — điều vốn không đúng khi bản so sánh này lần đầu được viết.
Kết luận
Gemini 3.5 Flash-Lite so với Qwen 3.8từng là sự so sánh giữa một sản phẩm và một thông báo. Giờ thì không còn nữa. Kể từ ngày 3 tháng 8 năm 2026, Qwen3.8-Max đã được phát hành rộng rãi, có giá công khai, tự phục vụ và có tài liệu đầy đủ — vì vậy, cách trình bày trung thực là một quyết định về tier chứ không phải về mức độ sẵn sàng.
Flash-Lite vẫn là lựa chọn mặc định đúng đắn cho công việc mà nó được tạo ra: với $0,30 / $2,50 và tốc độ ~490 token/giây, nó chạy trên mọi yêu cầu chỉ với chi phí không đáng kể, và Index 36 đã được kiểm toán của nó hoàn toàn đủ cho việc phân loại, định tuyến và trích xuất. Qwen3.8-Max là bậc nâng cấp — ngữ cảnh triệu token với mức giá cố định, hỗ trợ đầu vào hình ảnh và video gốc, và khả năng suy luận tiên phong được công bố — với chi phí đầu vào cao gấp khoảng 6,7 lần. Điểm yếu chưa được giải quyết duy nhất của nó vẫn như trước: chưa có đơn vị đánh giá độc lập nào chấm điểm nó, vì vậy chất lượng của nó chỉ dựa trên số liệu của chính Alibaba. Hãy theo dõi điểm Intelligence Index độc lập đầu tiên và bộ trọng số Qwen3.8-27B, những thứ sẽ cạnh tranh trực tiếp hơn nhiều với phân khúc của Flash-Lite. Trong lúc đó, hãy chọn theo hình dạng khối lượng công việc — và cân nhắc chạy cả hai.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
