Qwen3.5 Flash — trò chuyện đa phương thức (văn bản/hình ảnh/video) tối ưu hóa chi phí, ngữ cảnh 1M.
Qwen3.5 Flash là mô hình ngôn ngữ đa phương thức thuộc dòng Qwen, được thiết kế để suy luận nhanh và chi phí thấp. Mô hình chấp nhận đầu vào dạng văn bản, hình ảnh và video, đồng thời tạo ra phản hồi…
Qwen3.5 Flash chấp nhận đầu vào là văn bản, hình ảnh (bao gồm nhiều hình ảnh trong một yêu cầu) và video. Đối với video, mô hình có thể xử lý các khung hình hoặc toàn bộ tệp video trong giới hạn ngữ cảnh. Nó xử lý các loại phương tiện này cùng nhau trong một lệnh gọi API duy nhất, cho phép thực hiện các tác vụ như mô tả một cảnh video, trả lời câu hỏi về một hình ảnh, hoặc kết hợp hướng dẫn văn bản với nội dung trực quan. Độ dài video chính xác được hỗ trợ phụ thuộc vào việc trích xuất khung hình và phân bổ token trong cửa sổ ngữ cảnh 1M.
Mô hình này vượt trội trong các tác vụ yêu cầu ngữ cảnh lớn và đầu vào đa phương thức. Ví dụ bao gồm tóm tắt các bản ghi video dài, trích xuất dữ liệu có cấu trúc từ tài liệu được quét có hình ảnh, và xây dựng các tác nhân hội thoại tham chiếu đến ngữ cảnh trực quan. Nó cũng hiệu quả cho xử lý hàng loạt thông lượng cao, nơi chi phí thấp trên mỗi token (đặc biệt là đầu vào) làm cho nó kinh tế cho hàng triệu truy vấn. Đối với các tác vụ chỉ văn bản đơn giản, một mô hình chỉ văn bản rẻ hơn có thể tiết kiệm chi phí hơn nữa.
Đối với các tác vụ thuần văn bản và không yêu cầu khả năng đa phương thức, một mô hình nhỏ hơn hoặc chỉ xử lý văn bản với chi phí thấp hơn có thể tiết kiệm chi phí hơn. Thế mạnh của Qwen3.5 Flash nằm ở khả năng đa phương thức và ngữ cảnh dài; nếu ứng dụng của bạn chỉ cần hoàn thành văn bản ngắn, các mô hình như text-davinci hoặc các biến thể Qwen nhỏ hơn có thể tiết kiệm chi phí. Tương tự, nếu bạn không cần toàn bộ ngữ cảnh 1M, một mô hình có cửa sổ nhỏ hơn có thể giảm độ trễ và chi phí.
'Flash' chỉ định rằng mô hình này đánh đổi một phần độ chính xác benchmark để có suy luận nhanh hơn và chi phí tính toán thấp hơn. So với các mô hình lớn hơn của Qwen (ví dụ: Qwen3.5-72B), nó sử dụng kiến trúc hiệu quả hơn với ít tham số hơn. Điểm benchmark được Qwen công bố nhưng không được cung cấp trong mục danh mục này. Trong thực tế, nó hoạt động cạnh tranh trong các tác vụ hiểu đa phương thức trong khi duy trì độ trễ thấp hơn mỗi yêu cầu, khiến nó phù hợp cho các ứng dụng thời gian thực.
Độ trễ phụ thuộc vào kích thước đầu vào, độ dài đầu ra và tải máy chủ. Vì Qwen3.5 Flash được thiết kế để tối ưu tốc độ, nó thường trả về phản hồi nhanh hơn các mô hình lớn hơn như Qwen3.5-72B với cùng số lượng token. Số token/giây chính xác không được cung cấp trong danh mục. Người dùng có thể kiểm tra hiệu suất thông qua endpoint của OrcaRouter để đo độ trễ thực tế cho trường hợp sử dụng cụ thể của mình. Cửa sổ ngữ cảnh 1M có thể gây ra chi phí xử lý bổ sung cho các đầu vào rất dài.
Điểm mạnh bao gồm đầu vào đa phương thức, ngữ cảnh rất lớn, 65K token đầu ra và chi phí thấp trên mỗi token. Mô hình xử lý tốt các tài liệu dài và video. Hạn chế: độ chính xác không cao nhất đối với các tác vụ suy luận phức tạp hoặc toán học so với các mô hình tiên tiến lớn hơn. Nó cũng có thể gặp khó khăn với các hướng dẫn nhiều bước tinh tế. Đối với các tác vụ yêu cầu chất lượng đầu ra hàng đầu, hãy cân nhắc mô hình Qwen lớn hơn hoặc dòng GPT-4o. Kiến trúc 'Flash' ưu tiên thông lượng và chi phí hơn độ chính xác tối đa.
Giá là $0.10 cho mỗi 1 triệu token đầu vào (token văn bản, hình ảnh hoặc video) và $0.40 cho mỗi 1 triệu token đầu ra. Các mức giá này được tính theo giá của nhà cung cấp, không có phụ phí từ OrcaRouter. Không có phí bổ sung cho cổng API. Mức giá này được chuyển trực tiếp, nghĩa là người dùng cuối trả cùng mức giá như khi gọi API của chính nhà cung cấp, không có bất kỳ khoản phụ phí nào từ OrcaRouter. Việc đếm token tuân theo quy tắc token hóa tiêu chuẩn cho từng phương thức.
Giá token đầu vào ($0.10/1M) rất cạnh tranh so với các mô hình đa phương thức khác. Ví dụ, nhiều mô hình đa phương thức lớn tính phí $2-10 cho mỗi triệu token đầu vào. Giá đầu ra ($0.40/1M) cũng thấp. Tuy nhiên, do mô hình có cửa sổ ngữ cảnh 1M, việc xử lý các đầu vào rất dài có thể dẫn đến tổng chi phí cao dù tỷ lệ trên mỗi token thấp. Người dùng nên cân bằng độ dài ngữ cảnh với số lượng yêu cầu. Đối với đầu vào ngắn, các mô hình nhỏ hơn có thể mang lại chi phí tuyệt đối thậm chí còn thấp hơn.
Mục danh mục không chỉ rõ liệu có hỗ trợ bộ nhớ đệm cho Qwen3.5 Flash trên OrcaRouter hay không. Người dùng nên tham khảo tài liệu của OrcaRouter để biết chi tiết về các tính năng prompt caching hoặc response caching. Nếu không hỗ trợ bộ nhớ đệm, các đầu vào giống hệt nhau lặp lại sẽ tốn toàn bộ chi phí token mỗi lần. Đối với xử lý hàng loạt, hãy cân nhắc loại bỏ trùng lặp đầu vào hoặc sử dụng bộ nhớ đệm cục bộ để giảm số lượng lệnh gọi API. Giá vẫn theo biểu phí của nhà cung cấp, không có phụ phí bất kể trạng thái bộ nhớ đệm.
Sử dụng endpoint tương thích với OpenAI tại https://api.orcarouter.ai/v1. Đặt tham số model thành "qwen/qwen3.5-flash" trong yêu cầu của bạn. Cung cấp một khóa API từ OrcaRouter. Định dạng yêu cầu khớp với API chat completions của OpenAI, hỗ trợ các vai trò (system, user, assistant) và nội dung đa phương thức sử dụng mảng "content" với "type": "image_url" hoặc "type": "text". Đối với video, bạn có thể cần trích xuất các khung hình và truyền chúng dưới dạng hình ảnh. Tham khảo tài liệu của OrcaRouter để biết hướng dẫn xử lý video chính xác.
Các tham số tương thích với OpenAI tiêu chuẩn: temperature, top_p, max_tokens (tối đa 65536), chuỗi dừng (stop sequences), presence_penalty, frequency_penalty và seed. Tham số max_tokens được giới hạn ở mức 65536 để phù hợp với đầu ra tối đa của mô hình. Mô hình hỗ trợ phát trực tuyến (streaming) qua stream: true. Bạn cũng có thể đặt ID người dùng để theo dõi. Đối với các yêu cầu đa phương thức, hãy bao gồm nội dung hình ảnh hoặc video trong tin nhắn của người dùng. Mô hình chấp nhận tối đa cửa sổ ngữ cảnh gồm 1.048.576 token tổng cộng qua tất cả các lượt.
Nếu bạn đã sử dụng SDK Python của OpenAI, hãy thay đổi base_url thành https://api.orcarouter.ai/v1 và cập nhật tên mô hình thành "qwen/qwen3.5-flash". Xác thực sử dụng khóa API OrcaRouter thay vì khóa OpenAI. Cấu trúc yêu cầu và phản hồi giống hệt nhau. Để di chuyển từ các nhà cung cấp khác, hãy sử dụng định dạng chat completions. Đảm bảo rằng các lời nhắc hệ thống và nội dung đa phương thức của bạn được định dạng theo quy ước của OpenAI. Không cần thay đổi mã nào ngoài endpoint và tên mô hình.
Vâng, API OrcaRouter hỗ trợ tin nhắn hệ thống, tin nhắn người dùng và tin nhắn trợ lý trong các cuộc hội thoại nhiều lượt. Lịch sử hội thoại đầy đủ được tính vào cửa sổ ngữ cảnh 1.048.576 token. Mô hình xử lý nội dung đa phương thức trong tin nhắn người dùng. Đối với video, bạn có thể gửi nhiều khung hình dưới dạng ảnh trong một tin nhắn người dùng duy nhất. Mô hình duy trì ngữ cảnh qua các lượt, do đó bạn có thể có các tương tác kéo dài với lịch sử dài, miễn là tổng số token vẫn dưới giới hạn.
Qwen3.5 Flash là một lựa chọn nhỏ hơn, nhanh hơn và rẻ hơn so với các mô hình Qwen lớn hơn như Qwen3.5-72B hay Qwen3.5-32B. Nó hy sinh một phần độ chính xác benchmark để đạt độ trễ thấp hơn và chi phí thấp hơn. Nó hỗ trợ đầu vào đa phương thức và cửa sổ ngữ cảnh lớn (1M) giống như các phiên bản lớn hơn. Đối với các tác vụ yêu cầu lý luận tiên tiến, các mô hình lớn hơn được ưu tiên. Đối với các ứng dụng có khối lượng lớn hoặc thời gian thực mà tốc độ và chi phí quan trọng hơn, Flash là lựa chọn tốt hơn.
GPT-4o cung cấp độ chính xác cao hơn trên nhiều benchmark về suy luận và đa phương thức, nhưng với mức giá cao hơn đáng kể (thường là $2.50 cho mỗi triệu token đầu vào đối với GPT-4o và $0.15 cho GPT-4o mini). Qwen3.5 Flash rẻ hơn ($0.10 đầu vào) và có cửa sổ ngữ cảnh lớn hơn (1M so với 128K của GPT-4o). Giới hạn token đầu ra của nó (65K) cũng vượt quá GPT-4o mini (16K). Đối với các ứng dụng nhạy cảm về chi phí với đầu vào rất dài, Qwen3.5 Flash có thể kinh tế hơn trong khi vẫn cung cấp khả năng hiểu đa phương thức tốt.
Claude 3 Haiku và Gemini 1.5 Flash là các mô hình 'flash' tương tự. Claude 3 Haiku chỉ hỗ trợ văn bản và có giá $0.25 trên một triệu token đầu vào. Gemini 1.5 Flash hỗ trợ đầu vào đa phương thức và có cửa sổ ngữ cảnh 1 triệu token, được định giá $0.075 trên một triệu token đầu vào. Khả năng hỗ trợ đa phương thức và cửa sổ ngữ cảnh 1 triệu token của Qwen3.5 Flash đặt nó vào phân khúc tương tự, với giá đầu ra ($0.40/1M) cao hơn Gemini Flash ($0.30/1M) nhưng thấp hơn Haiku ($1.25/1M). Hiệu suất benchmark thay đổi tùy theo tác vụ.
OrcaRouter lưu trữ các mô hình mã nguồn mở như Llama 3.1 8B và Mistral 7B. Qwen3.5 Flash là một mô hình độc quyền, nhưng nó cạnh tranh về chi phí và khả năng. Các mô hình mã nguồn mở thường có chi phí trên mỗi token thấp hơn hoặc bằng không (bạn chỉ trả cho tính toán), nhưng chúng có thể yêu cầu nhiều công sức kỹ thuật hơn để thiết lập. Qwen3.5 Flash cung cấp một API được quản lý với zero markup, cửa sổ ngữ cảnh 1M và hỗ trợ đa phương thức mà hầu hết các mô hình mã nguồn mở thiếu. Đây là một giải pháp trung gian tốt giữa tính linh hoạt của mã nguồn mở và chất lượng độc quyền.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Đầu vào / 1M tokens | $0.100 |
| Đầu ra / 1M tokens | $0.400 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/qwen/qwen3.5-flashMở @misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash