
Qwen 3.7 Flash: Mô hình thị giác giá rẻ như cent của Alibaba cho các tác nhân thực sự nhìn vào màn hình
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
Đội ngũ Qwen của Alibaba đã dành hai năm qua để tung ra hàng loạt mô hình trên gần như mọi phân khúc giá và năng lực có thể tưởng tượng được, và vào ngày 27 tháng 7 năm 2026, một mô hình khác đã âm thầm xuất hiện dưới dạng một mục API thương mại: qwen/qwen3.7-flash. Nó đến mà không có sự hoành tráng của một buổi ra mắt sản phẩm chủ lực, và Alibaba đã không công bố báo cáo kỹ thuật, bộ điểm chuẩn hay sơ đồ kiến trúc nào cho nó. Điều mà nó mang đến là một mô tả quan trọng đối với các nhà phát triển hơn nhiều so với một điểm số bảng xếp hạng khác: một mô hình suy luận thị giác-ngôn ngữ, cửa sổ ngữ cảnh 1 triệu token, và mức giá thấp đến mức gần như không đáng để tính là một khoản mục.
Sự kết hợp đó — giá rẻ, ngữ cảnh khổng lồ, và "nhìn" được hình ảnh một cách tự nhiên — đưa Qwen 3.7 Flash thẳng vào một hạng mục đã trở thành một trong những hạng mục cạnh tranh nhất và hữu ích nhất trong toàn bộ thị trường mô hình: con ngựa thồ đa phương thức chi phí thấp. Đây không phải là những mô hình thắng bảng xếp hạng benchmark. Chúng là những mô hình được gọi hàng chục triệu lần mỗi ngày bên trong các vòng lặp agent, quy trình tự động hóa trình duyệt và công cụ hỗ trợ, bởi vì với chi phí đầu vào $0,03 và đầu ra $0,13 cho mỗi triệu token, chi phí về cơ bản không còn là ràng buộc trong thiết kế.
Bài viết này là bản giải thích đầu tiên: Qwen 3.7 Flash thực sự là gì, Alibaba đã công bố điều gì (và quan trọng là, điều gì họ chưa công bố), cách các yếu tố kinh tế được phản ánh qua phép tính token thực tế, và vị trí của nó bên cạnh phần còn lại của gia đình Qwen — bao gồm cả Qwen 3.8 và Qwen 3.7 Max lớn hơn nhiều — cũng như so với các đối thủ đa phương thức giá rẻ như Gemini 3.5 Flash-Lite. Chúng tôi cũng sẽ phân tích cách một lớp định tuyến như OrcaRouter coi một mô hình như thế này: không phải là mô hình chủ lực, mà là một tầng mặc định âm thầm hấp thụ phần lớn lưu lượng đa phương thức.
Tóm tắt: Dài quá, không đọc
Qwen 3.7 Flash là mô hình ngôn ngữ-thị giác từ nhóm Qwen của Alibaba, được liệt kê dưới mã mô hình qwen/qwen3.7-flash kể từ ngày 27 tháng 7 năm 2026. Mô hình được xây dựng cho các tác nhân đa phương thức, lập trình trực quan, tìm kiếm và tương tác máy tính/giao diện người dùng, với các điểm mạnh được công bố về nhận dạng vật thể và hiểu biết không gian. Nó hỗ trợ cửa sổ ngữ cảnh 1.000.000 token và có giá 0,03 USD cho mỗi triệu token đầu vào và 0,13 USD cho mỗi triệu token đầu ra — nằm trong số các mô hình có khả năng thị giác rẻ nhất hiện có. Độ dài đầu ra tối đa, số tham số chính xác và kiến trúc không được công bố chính thức; suy đoán từ cộng đồng chỉ ra một thiết kế hỗn hợp chuyên gia nhỏ và có thể là tiền thân cho bản phát hành Qwen 3.7 trọng số mở, nhưng điều đó chưa được xác nhận. Đây là một mô hình riêng biệt, nhỏ hơn và rẻ hơn so với cả Qwen 3.8 (mô hình chủ lực trọng số mở 2,4 nghìn tỷ tham số được Alibaba công bố riêng) và Qwen 3.7 Max (mô hình chủ lực lớn hơn trong cùng thế hệ này). Chưa có bộ đánh giá chuẩn độc lập nào — kể cả Artificial Analysis — chấm điểm nó, vì vậy hãy coi các tuyên bố về chất lượng là sớm và chưa được kiểm chứng cho đến khi có số liệu từ bên thứ ba.

Những điểm chính rút ra
• Qwen 3.7 Flash là mô hình thị giác-ngôn ngữ, không chỉ văn bản — nó được định vị cho các tác vụ agent đa phương thức, lập trình trực quan, tìm kiếm và sử dụng máy tính, không phải trò chuyện thông thường.
• Giá là $0.03/1M token đầu vào và $0.13/1M token đầu ra, gần tương đương với mức rẻ nhất của các mô hình đa phương thức tiên tiến nhất trên thị trường hiện nay.
• Cửa sổ ngữ cảnh là 1 triệu token, điều này quan trọng hơn đối với các phiên tác nhân có nhiều hình ảnh và nhiều lượt tương tác so với tưởng tượng, vì hình ảnh và ảnh chụp màn hình tiêu thụ token nhanh chóng.
Ghi chú định giá của danh sách cho biết rằng với bộ nhớ đệm lời nhắc trên ngữ cảnh lặp lại, chi phí hiệu quả có thể thấp hơn từ 60-80% so với giá niêm yết — một đòn bẩy quan trọng cho các vòng lặp agent lặp lại cùng một lời nhắc hệ thống hoặc lịch sử ảnh chụp màn hình.
• Alibaba chưa công bố số token đầu ra tối đa, số lượng tham số hoặc thông tin chi tiết về kiến trúc; bất kỳ điều gì cụ thể hơn bạn đọc ở nơi khác đều là suy luận của cộng đồng, không phải tiết lộ của nhà cung cấp.
• Nó không phải là Qwen 3.8 (mô hình hàng đầu có trọng số mở 2.4T) và cũng không phải là Qwen 3.7 Max (mô hình hàng đầu đóng lớn hơn trong cùng đợt phát hành) — bỏ qua sự giống nhau về tên gọi, đây là ba mô hình khác nhau với ba nhiệm vụ khác nhau.
• Không có tổ chức đánh giá độc lập nào, bao gồm Artificial Analysis, đã công bố điểm số cho Qwen 3.7 Flash tại thời điểm viết bài này — chất lượng thực sự chưa được kiểm chứng ngoài mô tả của nhà cung cấp.
Qwen 3.7 Flash thực sự là gì
Hãy gạt bỏ quy ước đặt tên và Qwen 3.7 Flash là câu trả lời của Alibaba cho một câu hỏi mà mọi phòng thí nghiệm lớn hiện đều đã đặt ra: một mô hình trông như thế nào khi toàn bộ bản thiết kế của nó chỉ là "xử lý hình ảnh, tác nhân, lưu lượng cao với chi phí rẻ nhất có thể mà không trở nên vô dụng"? Google đã trả lời bằng các bậc Gemini Flash và Flash-Lite. OpenAI trả lời bằng các dòng mini và nano của mình. Câu trả lời của Alibaba, trong thế hệ này, là Qwen 3.7 Flash.
Mô tả chính thức tập trung vào bốn trường hợp sử dụng: tác nhân đa phương thức, lập trình trực quan, tìm kiếm, và tương tác máy tính hoặc giao diện người dùng. Đó là một danh sách rất có chủ đích. Nó không phải là "giỏi viết sáng tạo" hay "suy luận mạnh mẽ về các bài toán olympic" — mà là danh sách các công việc mà một mô hình cần nhìn vào ảnh chụp màn hình, trang web, một phần giao diện người dùng, hoặc một sự khác biệt mã được hiển thị trực quan, và sau đó hành động dựa trên đó. Alibaba cũng nêu bật nhận dạng đối tượng và hiểu biết không gian như những thế mạnh cụ thể, phù hợp với khung tương tác sử dụng máy tính và giao diện người dùng: một tác nhân sắp nhấp vào nút, đọc bố cục, hoặc điều hướng màn hình cần biết vị trí của các vật thể, không chỉ nội dung của chúng.
Cần phải nói rõ ràng về ý nghĩa của "suy luận" trong ngữ cảnh này. Qwen 3.7 Flash được mô tả là một mô hình suy luận ngôn ngữ-hình ảnh, nghĩa là nó được kỳ vọng sẽ thực hiện các nhiệm vụ trực quan nhiều bước thay vì chỉ chú thích một bức ảnh hoặc trả lời một câu hỏi tra cứu đơn lẻ. Đó là sự khác biệt giữa "mô tả ảnh chụp màn hình này" và "đây là ảnh chụp màn hình một biểu mẫu có ba lỗi xác thực — hãy tìm ra vấn đề và cho tôi biết trường nào cần sửa trước."
Thông số kỹ thuật và trọng tâm Đa phương thức-Tác nhân
Đây là danh sách đầy đủ những gì thực sự được xác nhận, so với những gì không.
Đã xác nhận:Nhà sản xuất là đội ngũ Qwen của Alibaba. Mô hình được liệt kê dưới ID mô hình qwen/qwen3.7-flash, hoạt động từ ngày 27 tháng 7 năm 2026. Nó hỗ trợ đầu vào đa phương thức (thị giác và ngôn ngữ). Cửa sổ ngữ cảnh là 1.000.000 token. Giá là 0,03 USD cho mỗi 1 triệu token đầu vào và 0,13 USD cho mỗi 1 triệu token đầu ra. Ghi chú về giá trong danh sách chỉ ra rằng bộ đệm lời nhắc (prompt caching) trên ngữ cảnh lặp lại có thể giảm chi phí thực xuống 60-80% so với giá niêm yết cho các khối lượng công việc tái sử dụng cùng một hệ thống hướng dẫn hoặc hình ảnh tham chiếu qua các lần gọi — một chi tiết rất quan trọng đối với các vòng lặp tác tử gửi lại cùng một lịch sử ảnh chụp màn hình hoặc lược đồ công cụ trong mỗi lượt.
Không được tiết lộ:Giới hạn token đầu ra tối đa. Số lượng tham số chính xác. Kiến trúc (dense vs. mixture-of-experts). Thành phần dữ liệu huấn luyện. Bất kỳ điểm chuẩn nội bộ nào.
Suy đoán của cộng đồng (hãy gọi nó như vậy, vì chỉ có thế thôi):Với cái tên "Flash", mức giá cạnh tranh và cách thức Alibaba đã áp dụng cho các thế hệ Qwen trước, một số nhà quan sát nghi ngờ rằng Qwen 3.7 Flash sử dụng kiến trúc mixture-of-experts nhỏ được tối ưu hóa cho chi phí tính toán trên mỗi token thấp, và nó có thể là một bước xem trước hoặc chưng cất trước khi phát hành Qwen 3.7 dạng open-weight, tương tự như các biến thể "flash" hay "turbo" của Qwen trước đây đôi khi đi trước các bản phát hành mở rộng hơn. Những điều này chưa được Alibaba xác nhận. Hãy coi đó là phỏng đoán có cơ sở, không phải sự thật, cho đến khi có báo cáo kỹ thuật chính thức hoặc thẻ mô hình nói khác đi.
Việc thiếu một con số đầu ra tối đa được công bố đáng được lưu ý đối với bất kỳ ai đang xây dựng dựa trên mô hình này: nếu trường hợp sử dụng của bạn tạo ra các đầu ra có cấu trúc dài (tải trọng JSON lớn, tạo mã nhiều tệp, bản ghi dài), hãy kiểm tra ngưỡng đầu ra thực tế bằng thực nghiệm trước khi cam kết sử dụng trong sản xuất, vì bạn không thể kiểm tra tài liệu về một con số không tồn tại.
Ví dụ Tính Giá Cụ Thể: Chi Phí Thực Tế Là Bao Nhiêu
Những con số nhỏ như thế này rất dễ bị bỏ qua, vì vậy hãy làm phép tính một cách chính xác.
Với $0,03 cho mỗi 1M token đầu vào và $0,13 cho mỗi 1M token đầu ra, một cuộc gọi với 2.000 token đầu vào (một ảnh chụp màn hình có kích thước vừa phải cộng với một hướng dẫn ngắn) và 300 token đầu ra (một câu trả lời có cấu trúc) có chi phí: 2.000/1.000.000 × $0,03 = $0,00006 cho đầu vào, cộng với 300/1.000.000 × $0,13 = $0,000039 cho đầu ra. Tổng cộng: khoảng $0,0001 mỗi cuộc gọi — một phần trăm của một xu.
Hãy mở rộng con số đó lên quy mô lớn. Chạy 1 triệu cuộc gọi như vậy — một mức tải hàng ngày hợp lý cho một sản phẩm agent cỡ trung thực hiện phân tích ảnh chụp màn hình hoặc kiểm tra trạng thái UI — và kết quả là: 1,000,000 × 2,000 = 2 tỷ token đầu vào × $0.03/1M = $60, cộng với 1,000,000 × 300 = 300 triệu token đầu ra × $0.13/1M = $39. Tổng cộng: khoảng $99 cho một triệu cuộc gọi vision-agent. Ngay cả trước khi bổ sung bộ nhớ đệm prompt (mà các ghi chú trong trang thông tin sản phẩm cho thấy có thể cắt giảm 60-80% cho các tác vụ có ngữ cảnh lặp lại), đây là con số mà hầu hết các nhóm có thể phê duyệt mà không cần họp ngân sách.
Bây giờ hãy so sánh một kịch bản nặng hơn: một agent sử dụng máy tính duy trì một ngữ cảnh liên tục 50.000 token (ảnh chụp màn hình, lịch sử hành động, kết quả công cụ) và tạo ra 500 token hành động mỗi bước, chạy 100.000 lần mỗi ngày. Chi phí đầu vào: 100.000 × 50.000 = 5 tỷ token × $0.03/1M = $150/ngày. Chi phí đầu ra: 100.000 × 500 = 50 triệu token × $0.13/1M = $6.50/ngày. Tức là khoảng $156/ngày, hay khoảng $4.700/tháng, cho một khối lượng công việc đại lý ngữ cảnh dài khá mạnh — và đó là trước khi áp dụng bất kỳ giảm giá bộ nhớ đệm nào cho các phần lặp lại của ngữ cảnh 50K đó, mà trong một vòng lặp sử dụng máy tính (cùng lời nhắc hệ thống, cùng định nghĩa công cụ, trạng thái màn hình chồng lấn) chính xác là loại khối lượng công việc mà bộ nhớ đệm lời nhắc được xây dựng để phục vụ.

Hướng dẫn tình huống thực tế
Các tác vụ thị giác khối lượng lớn
Hãy hình dung một pipeline phân loại sản phẩm cần phân loại, gắn thẻ và trích xuất thuộc tính từ vài trăm nghìn hình ảnh sản phẩm mỗi ngày — đây chính xác là loại khối lượng công việc mà chi phí mỗi token tăng nhanh đến mức phá vỡ ngân sách trên một mô hình thị giác tầm trung nhưng vẫn ở mức giá phải chăng với mức giá của Qwen 3.7 Flash. Nhận diện đối tượng và hiểu không gian, hai khả năng mà Alibaba đề cập rõ ràng, tương ứng trực tiếp với "có gì trong hình ảnh này, nó ở đâu và tình trạng của nó như thế nào."
Lập trình trực quan
"Mã hóa trực quan" như một trường hợp sử dụng được đặt tên gợi ý các quy trình làm việc như: cung cấp cho mô hình một ảnh chụp màn hình của giao diện người dùng đã hiển thị cùng với mã thành phần cơ bản, và yêu cầu nó phát hiện sự không khớp, hoặc lấy một bản xuất Figma và nhận lại một bản triển khai đầu tiên. Đây là một danh mục nhiệm vụ đặc biệt trừng phạt các mô hình mã chỉ văn bản — bạn có thể mô tả một lỗi bố cục bằng lời, nhưng một mô hình thực sự có thể nhìn thấy phần đệm bị hỏng hoặc nút căn chỉnh sai sẽ chẩn đoán nhanh hơn và đáng tin cậy hơn.
Tác nhân / Sử dụng máy tính
Đây là trường hợp sử dụng chính. Một tác tử sử dụng máy tính phải nhìn vào màn hình, hiểu những gì có thể nhấp được, quyết định hành động và lặp lại — thường là hàng chục bước cho mỗi tác vụ. Về mặt kinh tế, điều này rất khắc nghiệt đối với các mô hình đắt tiền: một tác vụ tự động hóa trình duyệt hoặc máy tính để bàn 30 bước, mỗi bước mang một ảnh chụp màn hình mới, có thể tiêu tốn hàng trăm nghìn token trước khi hoàn thành. Với giá của mô hình tiên tiến, đó là tiền thật cho mỗi tác vụ; với giá của Qwen 3.7 Flash, việc chạy hàng nghìn phiên như vậy mỗi ngày vẫn nằm trong tầm ngân sách của một nhóm nhỏ.
Tìm kiếm
Tìm kiếm trực quan — so khớp một hình ảnh với một kho dữ liệu, xác minh rằng kết quả truy xuất thực sự khớp với một bức ảnh tham chiếu, hoặc neo một truy vấn tìm kiếm vào một ảnh chụp màn hình mà người dùng đang xem — được hưởng lợi từ sự kết hợp giữa ngữ cảnh lớn (để chứa nhiều hình ảnh ứng viên hoặc một bộ tài liệu đã truy xuất dài) và chi phí mỗi lần gọi thấp (vì các vòng lặp tìm kiếm và xác minh thường đồng nghĩa với nhiều lần gọi mô hình cho mỗi truy vấn của người dùng, chứ không chỉ một lần).
Cách truy cập và sử dụng Qwen 3.7 Flash
Qwen 3.7 Flash được gọi bằng định danh mô hình qwen/qwen3.7-flash, và nó hoạt động với bất kỳ công cụ tương thích OpenAI nào — nghĩa là các tích hợp kiểu chat-completions hoặc responses hiện có có thể trỏ tới nó chỉ với một thay đổi tên mô hình mà không cần viết lại mã khách. Đây cũng là nơi một lớp định tuyến như OrcaRouter trở nên thực tế thay vì lý thuyết: thay vì mã hóa cứng một mô hình duy nhất vào mọi dịch vụ, một endpoint tương thích OpenAI thống nhất cho phép bạn đặt một mô hình đa phương thức rẻ và có năng lực làm tầng mặc định cho lưu lượng thị giác và tác nhân, đồng thời dành các mô hình suy luận đắt tiền hơn cho tập hợp con các yêu cầu thực sự cần chúng. Đối với một mô hình có toàn bộ đề xuất giá trị là "rất rẻ, khá có năng lực, chưa được kiểm chứng ở biên giới," kiểu định tuyến phân tầng đó — rẻ theo mặc định, leo thang khi cần — được cho là cách triển khai đúng đắn trong sản xuất thay vì đặt cược toàn bộ đường ống vào một mô hình chưa được xác minh.
Định dạng yêu cầu đa phương thức tiêu chuẩn được áp dụng: đầu vào hình ảnh cùng với văn bản trong cùng một tin nhắn, cửa sổ ngữ cảnh lớn cho các phiên nhiều hình ảnh hoặc nhiều lượt, và tính phí theo token được hiển thị rõ ràng trong bảng điều khiển sử dụng. Hãy kiểm tra giới hạn chiều dài đầu ra thực tế cho khối lượng công việc của bạn trước khi dựa vào nó, vì mức tối đa không được công bố.
Những hạn chế trung thực và những điều chưa được xác nhận
Để nói thẳng về điều thực sự chưa rõ ở đây: tính đến thời điểm viết bài, chưa có dữ liệu điểm chuẩn độc lập nào về Qwen 3.7 Flash từ Artificial Analysis hay bất kỳ đơn vị đánh giá tương đương nào. Mọi thông tin về chất lượng của nó — mức độ hoạt động thực tế trên khả năng suy luận hình ảnh, độ tin cậy cho các tác vụ đa bước có tính tác nhân, khả năng chống lại các yếu tố gây nhiễu trong các tình huống ngữ cảnh dài — hiện chỉ được hỗ trợ bởi ngôn ngữ định vị của riêng Alibaba, chứ không phải bởi bên thứ ba chạy nó qua một bộ kiểm thử tiêu chuẩn. Mô tả của nhà cung cấp và xác minh độc lập không phải là một, và độc giả nên cân nhắc khả năng của mô hình này cho đến khi có xác minh đó.
Ngoài các bài benchmark, Alibaba vẫn chưa công bố kiến trúc, số tham số hoặc độ dài đầu ra tối đa. Giả thuyết "MoE nhỏ, có thể là tiền thân của Qwen 3.7 mã nguồn mở" đang lan truyền trong cộng đồng là một phỏng đoán hợp lý dựa trên các mẫu đặt tên và giá cả, nhưng đó chỉ là suy đoán, không phải điều Alibaba đã xác nhận. Nếu tính minh bạch của mô hình (kiến trúc được công bố, trọng số mở, báo cáo kỹ thuật) là yêu cầu cho trường hợp sử dụng của bạn, thì Qwen 3.7 Flash hiện không đáp ứng được tiêu chuẩn đó — đây là mô hình đóng, chỉ dùng qua API với tài liệu công khai tối thiểu ngoài danh sách API.
So sánh: Qwen 3.8, Qwen 3.7 Max, và Cheap Rivals
Cách đặt tên ở đây dễ gây nhầm lẫn, vì vậy cần phải chính xác. Qwen 3.8 là flagship mã nguồn mở được Alibaba công bố riêng, được cho là xây dựng dựa trên thiết kế 2,4 nghìn tỷ tham số — một mô hình khác biệt cơ bản với mục đích khác: một mô hình đa năng, mã nguồn mở, lớn, nhằm cạnh tranh ở biên giới, không phải một tầng đa phương thức giá rẻ. Qwen 3.7 Max là flagship đóng lớn hơn, được cho là có khả năng cao hơn trong cùng đợt phát hành "3.7" này — mô hình bạn sẽ dùng đến khi một nhiệm vụ cần chất lượng tối đa bất kể chi phí. Qwen 3.7 Flash, chủ đề của bài viết này, là điểm thứ ba và rẻ nhất trong chòm sao đó: nhỏ hơn, nhanh hơn, rẻ hơn đáng kể, và được giới hạn cụ thể cho khối lượng công việc đa phương thức tác nhân thay vì xuất sắc đa năng. Đừng cho rằng khả năng hoặc hành vi được truyền qua giữa ba mô hình này chỉ vì hai trong số chúng có chung một số phiên bản — chúng là những mô hình khác nhau với các công việc khác nhau.
Khi so sánh với các đối thủ bên ngoài, sự so sánh gần nhất là của Google Gemini 3.5 Flash-Lite, chiếm cùng một phân khúc: một tầng chi phí thấp, đa phương thức, thông lượng cao được thiết kế chính xác cho loại khối lượng công việc được mô tả ở trên. Cả hai mô hình cạnh tranh chủ yếu trên cùng các trục — giá mỗi token, độ dài ngữ cảnh và xử lý đa phương thức — hơn là trên các điểm chuẩn suy luận thô, vì cả hai đều không được định vị là mô hình suy luận tiên tiến. Nếu không có dữ liệu điểm chuẩn độc lập cho Qwen 3.7 Flash, một tuyên bố về chất lượng đối đầu với Gemini 3.5 Flash-Lite không phải là điều mà bài viết này có thể đưa ra một cách có trách nhiệm; điều có thể nói là giá của Qwen 3.7 Flash cạnh tranh hoặc thấp hơn tầng đó, và cửa sổ ngữ cảnh 1M của nó rất hào phóng cho một mô hình trong khung chi phí này, chính xác là loại khoảng cách khiến cho các tầng đa phương thức giá rẻ đáng để thử nghiệm một cách thực nghiệm với khối lượng công việc của bạn thay vì chỉ chọn dựa trên giá cả.
Câu hỏi thường gặp
Qwen 3.7 Flash là gì?
Đây là mô hình suy luận ngôn ngữ-thị giác từ nhóm Qwen của Alibaba, được xây dựng cho các tác nhân đa phương thức, lập trình trực quan, tìm kiếm và tương tác máy tính/giao diện người dùng, được liệt kê dưới ID mô hình qwen/qwen3.7-flash kể từ ngày 27 tháng 7 năm 2026.
Qwen 3.7 Flash có giá bao nhiêu?
0,03 USD cho mỗi 1 triệu token đầu vào và 0,13 USD cho mỗi 1 triệu token đầu ra — nằm trong số các mô hình hỗ trợ thị giác rẻ nhất hiện có, với bảng giá còn ghi chú rằng có thể được giảm thêm 60–80% nhờ bộ nhớ đệm lời nhắc (prompt caching) đối với ngữ cảnh lặp lại.
Cửa sổ ngữ cảnh là gì?
1.000.000 token.
Qwen 3.7 Flash có giống Qwen 3.8 không?
Không. Qwen 3.8 là mô hình hàng đầu mã nguồn mở với 2,4 nghìn tỷ tham số do Alibaba công bố riêng biệt. Qwen 3.7 Flash là mô hình đa phương thức đóng nhỏ hơn, rẻ hơn nhiều với mục đích khác. Chúng không nên bị nhầm lẫn mặc dù cả hai đều thuộc dòng Qwen của Alibaba.
Qwen 3.7 Flash có giống Qwen 3.7 Max không?
Không. Qwen 3.7 Max là mẫu flagship lớn hơn trong cùng đợt phát hành "3.7". Qwen 3.7 Flash là phiên bản nhỏ hơn, nhanh hơn, rẻ hơn nhiều nhắm đến các tác vụ đa phương tiện và tác nhân khối lượng lớn thay vì đầu ra chất lượng tối đa.
Qwen 3.7 Flash có hỗ trợ hình ảnh không?
Đúng vậy, đó là một mô hình ngôn ngữ thị giác — nó chấp nhận đầu vào đa phương thức (hình ảnh và văn bản) và được định vị cụ thể xung quanh các tác vụ thị giác như nhận dạng đối tượng, hiểu không gian, lập trình thị giác và tương tác máy tính/giao diện người dùng.
Độ dài đầu ra tối đa là bao nhiêu?
Không được Alibaba công bố chính thức. Bất kỳ ai xây dựng khối lượng công việc sản xuất nên kiểm tra trực tiếp giới hạn đầu ra thực tế thay vì giả định một con số.
Mô hình Qwen 3.7 Flash có phải là mô hình hỗn hợp chuyên gia không?
Chưa được xác nhận. Một số trong cộng đồng suy đoán rằng nó sử dụng kiến trúc MoE nhỏ dựa trên mô hình định giá và cách đặt tên của nó, nhưng Alibaba chưa công bố chi tiết kiến trúc, vì vậy điều này vẫn chỉ là suy đoán chứ không phải sự thật.
Nó so sánh thế nào với Gemini 3.5 Flash-Lite?
Cả hai đều chiếm cùng một bậc đa phương thức chi phí thấp, thông lượng cao và chủ yếu cạnh tranh về giá cả và độ dài ngữ cảnh hơn là các điểm chuẩn suy luận thô. Hiện chưa có dữ liệu điểm chuẩn độc lập nào để đưa ra so sánh chất lượng chính xác cho Qwen 3.7 Flash.
Tôi có thể truy cập Qwen 3.7 Flash ở đâu?
Sử dụng model ID qwen/qwen3.7-flash qua bất kỳ client tương thích OpenAI nào, hoặc thông qua một lớp định tuyến như OrcaRouter có thể đặt nó làm tầng đa phương thức rẻ mặc định bên cạnh các model khác.
Qwen 3.7 Flash có tốt không?
Chưa được kiểm chứng độc lập tính đến thời điểm viết bài này — chưa có tổ chức đánh giá bên thứ ba nào, kể cả Artificial Analysis, công bố điểm số cho nó. Giá trị của nó nằm ở giá cả và kích thước ngữ cảnh, chứ không phải lợi thế về chất lượng đã được chứng minh, vì vậy bạn nên thử nghiệm thực tế với khối lượng công việc cụ thể của mình trước khi quyết định.

Kết luận
Qwen 3.7 Flash không cố gắng giành vị trí dẫn đầu bảng xếp hạng, và Alibaba cũng không cung cấp cho ai tài liệu để kiểm tra dù có muốn. Điều mà nó thực sự hướng tới là giúp các khối lượng công việc về thị giác và tác tử — phân tích ảnh chụp màn hình, kiểm tra mã nguồn trực quan, vòng lặp tương tác với máy tính, tìm kiếm trực quan — trở nên đủ rẻ để chi phí không còn là lý do bạn từ chối xây dựng tính năng đó. Với mức giá $0,03/$0,13 cho mỗi triệu token và ngữ cảnh 1 triệu token, các yếu tố kinh tế thực sự hỗ trợ lưu lượng tác tử đa phương thức khối lượng lớn, luôn bật theo cách mà ít mô hình ở bất kỳ cấp chất lượng nào có thể sánh kịp. Điểm hạn chế là sự trung thực về những khoảng trống: không có điểm chuẩn độc lập, không có kiến trúc hoặc độ dài đầu ra tối đa được tiết lộ, và sự không chắc chắn thực sự về cách nó đối đầu với các đối thủ cấp thấp đã có uy tín như Gemini 3.5 Flash-Lite. Hãy coi nó như một lựa chọn mặc định đầy hứa hẹn và cực kỳ phải chăng cho các khối lượng công việc tác tử đa phương thức đáng thử nghiệm ngay bây giờ — và hãy tách biệt rõ ràng trong đầu bạn với cả Qwen 3.8 và Qwen 3.7 Max, vốn là những mô hình khác nhau giải quyết những vấn đề khác nhau hoàn toàn.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
