Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
Thị giácCông cụJSONSuy luận
bởi Qwen · 2025-10-14

Qwen3-VL 8B Thinking — mô hình lý luận ngôn ngữ-thị giác nhỏ, trọng số mở, 8 tỷ tham số, ngữ cảnh 128k.

Điểm cuối:/v1/chat/completions
ngữ cảnh131.1K token
Đầu ra tối đa41K
Đầu vàotext + image + video
Đầu ratext
TTFT p505.00 s
ĐẦU VÀO$0.18/ 1M token
ĐẦU RA$2.10/ 1M token
TTFT p505.00 s7 ngày
p95 TTFT8.55 s7 ngày
LƯU LƯỢNG108.8Ktokens / 7 ngày

Qwen3 VL 8B Thinking là mô hình ngôn ngữ đa phương thức 8 tỷ tham số do nhóm Qwen tại Alibaba Cloud phát triển, được lưu trữ trên OrcaRouter dưới nhà cung cấp qwen. Mô hình này thuộc họ mô hình thị…

Qwen3 VL 8B Thinking là gì?

Ai nên sử dụng mô hình này?

Nó hỗ trợ những phương thức nào?

Biến thể 'Thinking' khác với Qwen3 VL tiêu chuẩn như thế nào?

Mã ví dụ

Gọi từ bất kỳ SDK nào

Tương thích OpenAI — giữ nguyên SDK bạn đang dùng

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Tham số được hỗ trợ

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Giá

Đầu vào / 1M tokens$0.180
Đầu ra / 1M tokens$2.10
Tiền tệUSD

Máy tính chi phí

Token / tháng10MM
Tỷ lệ đầu vào70%%
Ước tính / tháng $7.56

Ước tính theo giá niêm yết

Công cụ ước tính token & chi phí

Token đầu vào: 17Chi phí mỗi yêu cầu: $0.001053

Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.

Hiệu suất

TTFT p50
5.00 s
Tốc độ đầu ra
64.6 tok/s
p95 TTFT
8.55 s
Tỷ lệ lỗi
0%

Benchmark công khai

So sánh

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Đầu vào $/M$0.18$0.86$0.17$0.12
Đầu ra $/M$2.10$3.44$1.03$0.69
Ngữ cảnh131K262K33K1.0M
Chất lượng4/108/108/108/10
So sánh song songSo sánh song songSo sánh song songSo sánh song song

Câu hỏi thường gặp

Chi phí cho mỗi triệu token của Qwen3 VL 8B Thinking trên OrcaRouter là bao nhiêu?
Token đầu vào: $0,18 trên 1 triệu token. Token đầu ra: $2,10 trên 1 triệu token. Đây là mức giá của nhà cung cấp được chuyển qua với mức chênh lệch 0%.
Cửa sổ ngữ cảnh và số lượng token đầu ra tối đa là gì?
Cửa sổ ngữ cảnh là 131.072 token. Số token đầu ra tối đa là 40.960 token.
Các điểm mạnh chính của mô hình này là gì?
Nó xử lý ba phương thức đầu vào (văn bản, hình ảnh, video), cung cấp một ngữ cảnh và độ dài đầu ra lớn, và bao gồm khả năng suy nghĩ (chuỗi suy luận) giúp cải thiện hiệu suất trong các tác vụ suy luận phức tạp.
Mô hình này so sánh như thế nào với Qwen2 VL 7B?
Nó có ngữ cảnh lớn hơn (131K so với 32K), đầu ra tối đa lớn hơn (40K so với 2K) và bổ sung khả năng suy luận. Giá cả cao hơn một chút nhưng cung cấp khả năng lập luận và hiểu đa phương thức được cải thiện.
OrcaRouter có lưu vào bộ nhớ đệm bất kỳ dữ liệu người dùng nào khi sử dụng mô hình này không?
OrcaRouter không báo cáo bất kỳ cơ chế lưu đệm nào lưu trữ lời nhắc hoặc hình ảnh; xử lý dữ liệu tuân theo các thông lệ API tiêu chuẩn. Hãy tham khảo chính sách bảo mật của OrcaRouter để biết chi tiết.
Làm thế nào để gọi mô hình này thông qua API tương thích với OpenAI?
Gửi một yêu cầu POST đến https://api.orcarouter.ai/v1/chat/completions với model "qwen/qwen3-vl-8b-thinking" và khóa API của bạn. Sử dụng một mảng nội dung với các mục text và image_url cho đầu vào đa phương thức.
Mô hình có thể xử lý đầu vào video không?
Có, video được chấp nhận bằng cách gửi các khung hình đã trích xuất dưới dạng các mục image_url riêng biệt. Mô hình không có hỗ trợ codec video gốc; nó hoạt động trên các bộ khung hình tĩnh.
Có giới hạn nào về số lượng hình ảnh mỗi yêu cầu không?
Không, ngoại trừ tổng số token (bao gồm token văn bản và hình ảnh) phải nằm trong giới hạn ngữ cảnh 131,072. Không có giới hạn riêng cho hình ảnh.
Tôi có thể sử dụng ngôn ngữ lập trình hoặc thư viện nào để truy cập mô hình này qua OrcaRouter?
Bất kỳ ngôn ngữ nào hỗ trợ yêu cầu HTTP và định dạng API OpenAI. Python với thư viện openai, JavaScript với fetch, v.v. Chỉ cần đặt URL cơ sở và ID mô hình.
Phiên bản tư duy (thinking variant) có luôn trả về chuỗi suy luận (chain-of-thought reasoning) không?
Mô hình này sử dụng suy luận từng bước bên trong trước khi đưa ra câu trả lời cuối cùng, nhưng đầu ra bạn thấy là phản hồi hoàn chỉnh. Bạn không thể trích xuất các token suy luận trung gian một cách riêng lẻ.

Nhúng huy hiệu này

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50qua OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking trên OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Thẻ mô hình dạng dữ liệu

GET /api/public/models/qwen/qwen3-vl-8b-thinkingMở
Máy đọc được:/llms.txt/llms-full.txt