Qwen3-VL 8B Thinking — mô hình lý luận ngôn ngữ-thị giác nhỏ, trọng số mở, 8 tỷ tham số, ngữ cảnh 128k.
Qwen3 VL 8B Thinking là mô hình ngôn ngữ đa phương thức 8 tỷ tham số do nhóm Qwen tại Alibaba Cloud phát triển, được lưu trữ trên OrcaRouter dưới nhà cung cấp qwen. Mô hình này thuộc họ mô hình thị…
Qwen3 VL 8B Thinking xuất sắc trong việc trả lời câu hỏi trực quan, đặc biệt khi câu hỏi liên quan đến nhiều đối tượng, mối quan hệ không gian hoặc văn bản được nhúng trong hình ảnh (ví dụ: biển báo đường phố, hóa đơn). Nó cũng có thể xử lý các tác vụ hiểu video, chẳng hạn như tóm tắt một đoạn clip ngắn, xác định hành động hoặc trả lời các câu hỏi về các mốc thời gian cụ thể. Phân tích tài liệu là một trường hợp sử dụng mạnh: trích xuất thông tin từ các tệp PDF có chứa cả văn bản và biểu đồ, hoặc từ các biểu mẫu được quét. Cửa sổ ngữ cảnh dài của nó làm cho nó phù hợp để xử lý các tài liệu lớn (ví dụ: PDF hơn 100 trang) với các chèn hình ảnh không thường xuyên, miễn là tổng đầu vào được token hóa ở dưới 131K.
Nếu trường hợp sử dụng của bạn hoàn toàn dựa trên văn bản và không liên quan đến hình ảnh hay video, thì một mô hình chỉ xử lý văn bản chuyên dụng (ví dụ: Qwen3-8B hoặc một biến thể Llama có kích thước tương tự) có thể sẽ tiết kiệm chi phí hơn. Các mô hình đa phương thức phải chịu thêm chi phí xử lý đầu vào hình ảnh, và giá mỗi token cho Qwen3 VL 8B Thinking ($0.18 đầu vào, $2.10 đầu ra trên một triệu token) có thể cao hơn nhiều so với các lựa chọn thay thế chỉ xử lý văn bản. Ngoài ra, nếu tác vụ của bạn là phân loại hoặc trích xuất đơn giản từ các hình ảnh rất ngắn, một mô hình ngôn ngữ-thị giác nhỏ hơn với độ trễ và chi phí thấp hơn (ví dụ: Qwen2 VL 2B) có thể đáp ứng đủ mà không làm giảm hiệu suất.
Có, mô hình có thể chấp nhận nhiều hình ảnh xen kẽ với văn bản trong một lần gọi API, miễn là tổng số token (token hình ảnh cộng token văn bản) nằm trong cửa sổ ngữ cảnh 131,072. Mỗi hình ảnh được mã hóa thành một số token thay đổi tùy theo độ phân giải và độ phức tạp. API tương thích OpenAI của OrcaRouter cho phép bạn gửi nhiều URL hình ảnh hoặc hình ảnh được mã hóa base64 trong mảng nội dung. Không có giới hạn cứng về số lượng hình ảnh ngoài ràng buộc ngữ cảnh. Đối với video, bạn thường trích xuất các khung hình chính và gửi chúng dưới dạng các hình ảnh riêng biệt cùng với một lời nhắc văn bản.
Giống như tất cả các mô hình đa phương thức, Qwen3 VL 8B Thinking có thể tạo ra ảo giác về chi tiết trong hình ảnh hoặc video, đặc biệt là với độ phân giải thấp hoặc nội dung mơ hồ. Mô hình này không được thiết kế cho phát trực tiếp video thời gian thực; nó xử lý các khung hình tĩnh theo từng tập. Kích thước tham số 8B có nghĩa là nó có thể kém chính xác hơn trên các lĩnh vực chuyên môn cao (ví dụ: hình ảnh y tế, hình ảnh vệ tinh) so với các mô hình lớn hơn (ví dụ: mô hình ngôn ngữ-thị giác 70B-100B+). Mô hình không hỗ trợ đầu vào âm thanh. Quá trình suy luận có thể làm tăng độ dài đầu ra, vì vậy hãy tính toán ngân sách cho các token đầu ra phù hợp. Cuối cùng, mô hình được tối ưu hóa cho tiếng Anh nhưng có thể xử lý các ngôn ngữ khác với hiệu quả khác nhau.
Các điểm số benchmark cụ thể cho Qwen3 VL 8B Thinking trên các bài đánh giá đa phương thức tiêu chuẩn (ví dụ: MMMU, MathVista, VideoMME) chưa được cung cấp trong các dữ kiện hiện có. Người dùng nên tham khảo thẻ mô hình chính thức của Qwen hoặc bài báo nghiên cứu để có kết quả đã công bố sau này. Nhìn chung, dòng Qwen3 VL đã thể hiện hiệu suất cạnh tranh trên các tác vụ thị giác-ngôn ngữ so với các mô hình 7B-8B tham số khác. Biến thể "Thinking" được kỳ vọng sẽ cải thiện các benchmark nặng về lý luận như chuỗi suy nghĩ trực quan. Vì chưa có điểm số công khai, bạn nên thử nghiệm mô hình trên tập dữ liệu đại diện của riêng mình để đánh giá mức độ phù hợp.
Dữ liệu độ trễ cho mô hình cụ thể này trên hạ tầng của OrcaRouter chưa được tiết lộ. Theo nguyên tắc chung, một mô hình đa phương thức 8B tham số sẽ có độ trễ cao hơn so với mô hình văn bản thuần túy cùng kích thước do quá trình mã hóa hình ảnh. Đầu vào video làm tăng độ trễ hơn nữa vì cần xử lý thêm khung hình. Trên các cụm GPU hiệu suất cao (ví dụ: A100, H100), thời gian đến token đầu tiên điển hình cho mô hình 8B nằm trong khoảng từ vài trăm mili giây đến vài giây, tùy thuộc vào độ dài đầu vào và kích thước batch. Tốc độ sinh token đầu ra thường được đo bằng hàng chục token mỗi giây. Các giá trị này chỉ mang tính định tính; hiệu suất thực tế phụ thuộc vào việc cung cấp tài nguyên và tải hiện tại của OrcaRouter.
Điểm mạnh: Mô hình xử lý được ngữ cảnh đa phương thức dài (131K token), cho phép đầu ra lớn (tối đa 40K token) và xử lý ba loại đầu vào. Khả năng suy luận giúp cải thiện lý luận trong các tác vụ yêu cầu suy diễn từng bước. Mô hình có mức giá cạnh tranh so với các mô hình đa phương thức 8B khác. Hạn chế: Mô hình chưa được đánh giá chuẩn so với các mô hình tiên tiến nhất trên nhiều bảng xếp hạng công khai. Thông lượng đầu ra tối đa có thể thấp hơn các mô hình nhỏ hơn. Mô hình không được tối ưu cho tạo hình ảnh sáng tạo (chỉ xuất văn bản). Người dùng không nên cho rằng không có ảo giác trong các tác vụ thị giác. Xử lý video bị giới hạn ở việc trích xuất dựa trên khung hình thay vì phân tích liên tục.
Qwen3 VL 8B Thinking được tính phí theo token với giá của nhà cung cấp, không tăng thêm. Token đầu vào có giá $0.18 trên 1 triệu token. Token đầu ra có giá $2.10 trên 1 triệu token. Không có phí hạ tầng bổ sung, không có chi phí cơ bản cho mỗi yêu cầu và không có đăng ký hàng tháng. Giá áp dụng như nhau cho tất cả các phương thức đầu vào (văn bản, hình ảnh, video); mỗi phương thức được token hóa và tính phí theo tỷ lệ đầu vào. OrcaRouter không tính phụ phí nào vượt quá mức giá đã nêu. Ví dụ: xử lý một hình ảnh được token hóa thành 2,000 token đầu vào sẽ có chi phí đầu vào là 2,000 * ($0.18 / 1M) = $0.00036. Chi phí đầu ra được tính tương tự.
Mỗi hình ảnh được mã hóa thành một số lượng token thay đổi dựa trên kích thước và mức độ nén. Hình ảnh có độ phân giải cao có thể tiêu tốn hàng nghìn token. Video được xử lý bằng cách trích xuất khung hình (thường là một khung hình trên vài giây) và mã hóa từng khung hình như một hình ảnh; do đó, chi phí token tăng tuyến tính theo thời lượng video và tốc độ khung hình. Người dùng có thể kiểm soát chi phí bằng cách thay đổi kích thước hình ảnh hoặc giảm số lượng khung hình. Không có phí riêng cho việc mã hóa phương tiện ngoài chi phí token. Chi phí đầu ra chỉ phụ thuộc vào số lượng token văn bản được tạo ra. Đối với video dài, token đầu vào có thể nhanh chóng tiến gần đến giới hạn 131K, làm tăng chi phí cho mỗi yêu cầu.
Theo thông tin được cung cấp, không có chiết khấu cho việc sử dụng theo lô hoặc cam kết trả trước. OrcaRouter hiện không cung cấp bộ nhớ đệm token để giảm chi phí cho các yêu cầu hoặc hình ảnh lặp lại. Tất cả các yêu cầu được tính phí theo token theo thời gian thực với mức giá tiêu chuẩn. Nếu nhà cung cấp (qwen) giới thiệu giá bậc chiết khấu trong tương lai, OrcaRouter sẽ chuyển khoản tiết kiệm đó mà không tính thêm phí. Người dùng được khuyến khích theo dõi trang giá của OrcaRouter để cập nhật. Đối với các trường hợp sử dụng khối lượng lớn, hãy cân nhắc làm việc trực tiếp với OrcaRouter để thảo luận về giá theo khối lượng tiềm năng.
So với các mô hình đa phương thức lớn hơn (ví dụ: GPT-4V, Gemini 1.5 Pro), Qwen3 VL 8B Thinking có chi phí trên mỗi token thấp hơn đáng kể: các mô hình đó thường tốn $2–$10+ cho mỗi triệu token đầu vào. Trong số các mô hình ngôn ngữ-thị giác 7B-8B tham số, mức giá này tương đương với mức giá thông thường (Qwen2 VL 7B có giá đầu vào khoảng $0.10–$0.20, đầu ra $1–$2). Chi phí token đầu ra ($2.10 mỗi triệu) cao hơn so với một số mô hình 8B thuần văn bản (ví dụ: $0.20 mỗi triệu đầu ra), phản ánh chi phí suy luận tăng thêm. Nếu bạn có thể sử dụng mô hình nhỏ hơn (ví dụ: 2B–4B tham số), chi phí có thể thấp hơn 50–90%, nhưng khả năng sẽ giảm.
Bạn gọi Qwen3 VL 8B Thinking bằng cách gửi yêu cầu POST đến điểm cuối tương thích với OpenAI của OrcaRouter tại https://api.orcarouter.ai/v1/chat/completions. Đặt tham số model thành "qwen/qwen3-vl-8b-thinking". Bao gồm khóa API của bạn trong header Authorization dưới dạng "Bearer <key>". Nội dung yêu cầu tuân theo lược đồ chat completions của OpenAI. Đối với đầu vào đa phương thức, cấu trúc nội dung tin nhắn thành một mảng các đối tượng: một đối tượng có type "text" cho prompt văn bản, và một đối tượng có type "image_url" cho mỗi hình ảnh (với URL hoặc dữ liệu base64). Video có thể được gửi dưới dạng nhiều mục image_url đại diện cho các khung hình. Phản hồi tuân theo cấu trúc OpenAI tiêu chuẩn với tất cả văn bản được tạo trong mảng choices.
Tất cả các tham số hoàn thiện chat tiêu chuẩn của OpenAI đều được hỗ trợ: temperature (0–2, mặc định 1.0), top_p (0–1, mặc định 1.0), max_tokens (lên đến 40960), chuỗi dừng (stop sequences), frequency_penalty, presence_penalty, logprobs, và n (số lượng hoàn thiện). Mô hình không hỗ trợ streaming? OrcaRouter có khả năng hỗ trợ streaming khi streaming=true được đặt; hãy kiểm tra tài liệu của nhà cung cấp. Tham số tools (gọi hàm) có thể được hỗ trợ nếu nhà cung cấp cơ bản cho phép; hiện tại không được đảm bảo. System prompt được cho phép. User IDs có thể được truyền vào để giám sát. Đảm bảo bạn ở trong cửa sổ ngữ cảnh 131072 token bằng cách theo dõi số lượng token trước khi gửi.
Nếu bạn hiện đang sử dụng cùng một mô hình từ một nhà cung cấp API khác (ví dụ: trực tiếp từ Alibaba Cloud), việc di chuyển sang OrcaRouter rất đơn giản: thay đổi base URL thành https://api.orcarouter.ai/v1, cập nhật chuỗi mô hình thành "qwen/qwen3-vl-8b-thinking", và thay thế API key bằng khóa API của OrcaRouter. Không cần thay đổi mã nào khác vì OrcaRouter sử dụng giao diện tương thích hoàn toàn với OpenAI. Lưu ý rằng mức sử dụng token và giá sẽ dựa trên biểu giá của OrcaRouter (được chuyển tiếp mà không tăng thêm phí). Bạn có thể cần điều chỉnh các công cụ giám sát chi phí của mình để phản ánh mức giá mới.
Tính năng streaming có sẵn thông qua API của OrcaRouter. Đặt tham số stream thành true trong yêu cầu của bạn. Phản hồi sẽ là một luồng Server-Sent Events (SSE) với các delta của các token được tạo ra. Điều này hữu ích cho hiển thị thời gian thực. Lưu ý rằng đối với biến thể "Thinking", quá trình suy nghĩ có thể gây ra độ trễ lâu hơn trước token đầu tiên, nhưng streaming vẫn sẽ gửi các token gia tăng khi chúng được tạo ra. Định dạng luồng tuân theo đặc tả streaming của OpenAI, với các sự kiện loại "chat.completion.chunk". Mỗi chunk chứa một delta với nội dung hoặc vai trò của token.
Qwen3 VL 8B Thinking là phiên bản kế thừa của Qwen2 VL 7B, với số lượng tham số gần tương đương (8B so với 7B) nhưng kiến trúc được cải thiện để hỗ trợ ngữ cảnh dài hơn (131K so với 32K của Qwen2 VL 7B). Nó cũng bổ sung khả năng "Thinking" cho suy luận từng bước, điều mà Qwen2 VL không có. Độ dài đầu ra tối đa đã tăng từ 2048 token (Qwen2 VL 7B) lên 40960 token. Giá cho Qwen3 VL 8B Thinking cao hơn một chút cho mỗi token so với Qwen2 VL 7B (có chi phí khoảng $0.15 đầu vào, $1.80 đầu ra trên một triệu token), phản ánh các khả năng được bổ sung và ngữ cảnh lớn hơn. Người dùng nâng cấp lên nên mong đợi hiệu suất tốt hơn trên các tác vụ suy luận phức tạp.
GPT-4o mini là mô hình đa phương thức hàng đầu từ OpenAI với cửa sổ ngữ cảnh 128K. Nó có số lượng tham số lớn hơn đáng kể (không rõ, nhưng ước tính >70B) và nhìn chung đạt độ chính xác cao hơn trên các chuẩn mực tiêu chuẩn. Tuy nhiên, Qwen3 VL 8B Thinking rẻ hơn đáng kể: GPT-4o mini có giá $0.15 cho mỗi triệu token đầu vào và $0.60 cho mỗi triệu token đầu ra, thực tế thấp hơn so với $0.18 đầu vào và $2.10 đầu ra của Qwen3? Chờ đã, kiểm tra: đầu vào GPT-4o mini là $0.15, đầu ra $0.60 — rẻ hơn Qwen3 VL 8B Thinking? Thực tế đầu ra rẻ hơn nhiều. Vậy chi phí không thấp hơn trên toàn diện. Nhưng Qwen3 hỗ trợ video và đầu ra dài hơn (40960 so với 16384 của GPT-4o mini). Cửa sổ ngữ cảnh tương tự. Sự lựa chọn phụ thuộc vào độ chính xác yêu cầu và ngân sách; Qwen3 phù hợp cho các đầu ra rất dài và triển khai mã nguồn mở.
Llama 3.2 11B Vision là mô hình đa phương thức 11B tham số với cửa sổ ngữ cảnh 128K và tối đa 8K token đầu ra. Qwen3 VL 8B Thinking có số lượng tham số nhỏ hơn nhưng đầu ra tối đa lớn hơn nhiều (40960 so với 8000) và bao gồm khả năng suy luận. Cả hai đều hỗ trợ đầu vào văn bản và hình ảnh, nhưng Llama 3.2 11B không hỗ trợ video một cách nguyên bản. Giá của Llama qua các nhà cung cấp tương tự nhau, khoảng $0,15–$0,20 đầu vào, $0,60–$1,00 đầu ra trên mỗi triệu token, khiến Qwen3 đắt hơn về đầu ra. Đối với các tác vụ yêu cầu văn bản tạo ra rất dài (ví dụ: viết báo cáo từ video), Qwen3 phù hợp hơn. Đối với các tác vụ ngắn, nhạy cảm về chi phí, Llama 3.2 11B có thể được ưu tiên hơn.
Gemini 1.5 Flash là một mô hình đa phương thức nhanh, hiệu quả về chi phí với cửa sổ ngữ cảnh 1M (lên đến 2M), hỗ trợ hình ảnh, video và âm thanh. Nó rẻ hơn Qwen3 VL 8B Thinking (Gemini Flash có chi phí $0.075 đầu vào, $0.30 đầu ra trên mỗi triệu token) và nhanh hơn. Tuy nhiên, Qwen3 VL 8B Thinking cung cấp quy trình suy luận có thể cải thiện khả năng lập luận trong các tác vụ thị giác khó, và đầu ra tối đa của nó lớn hơn nhiều (40K so với 8K của Gemini Flash). Nếu ứng dụng của bạn yêu cầu suy luận từng bước và đầu ra dài, Qwen3 là lựa chọn tốt hơn. Đối với thông lượng cao và độ trễ thấp, Gemini Flash thường vượt trội hơn. Ngoài ra, Qwen3 có thể được ưu tiên khi chủ quyền dữ liệu yêu cầu triển khai tự lưu trữ hoặc không phụ thuộc vào nhà cung cấp.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Đầu vào / 1M tokens | $0.180 |
| Đầu ra / 1M tokens | $2.10 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingMở @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking