Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisãoFerramentasJSONRaciocínio
por Qwen · 2025-10-14

Qwen3-VL 8B Thinking — modelo de raciocínio visão-linguagem pequeno de peso aberto, 8B parâmetros, contexto de 128k.

ctx131.1K tokens
Saída máx.41K
Entradatext + image + video
Saídatext
p50 TTFT5.00 s
ENTRADA$0.18/ 1M tokens
SAÍDA$2.10/ 1M tokens
p50 TTFT5.00 s7 d
p95 TTFT8.55 s7 d
TRÁFEGO108.8Ktokens / 7 d

Qwen3 VL 8B Thinking é um modelo multimodal de linguagem com 8 bilhões de parâmetros, desenvolvido pela equipe Qwen na Alibaba Cloud, hospedado no OrcaRouter sob o provedor qwen. Pertence à família…

O que é Qwen3 VL 8B Thinking?

Quem deve usar este modelo?

Quais modalidades ele suporta?

Como a variante 'Thinking' difere do Qwen3 VL padrão?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Preços

Entrada / 1M tokens$0.180
Saída / 1M tokens$2.10
MoedaUSD

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $7.56

Estimativa com base no preço de tabela

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.001053

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
5.00 s
Velocidade de saída
64.6 tok/s
p95 TTFT
8.55 s
Taxa de erro
0%

Benchmarks públicos

Fonte: Design Arena

Comparativo

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Entrada $/M$0.18$0.86$0.17$0.12
Saída $/M$2.10$3.44$1.03$0.69
Contexto131K262K33K1.0M
Qualidade4/108/108/108/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Qual é o custo por milhão de tokens para Qwen3 VL 8B Thinking no OrcaRouter?
Tokens de entrada: $0.18 por 1 milhão de tokens. Tokens de saída: $2.10 por 1 milhão de tokens. Estas são as taxas do provedor repassadas sem margem de lucro.
Qual é a janela de contexto e o número máximo de tokens de saída?
A janela de contexto é de 131,072 tokens. O máximo de tokens de saída é de 40,960 tokens.
Quais são os principais pontos fortes deste modelo?
Ela lida com três modalidades de entrada (texto, imagem, vídeo), oferece um grande contexto e comprimento de saída, e inclui uma capacidade de raciocínio (cadeia de pensamento) que melhora o desempenho em tarefas complexas de raciocínio.
Como este modelo se compara ao Qwen2 VL 7B?
Possui um contexto maior (131K vs 32K), saída máxima maior (40K vs 2K) e adiciona capacidades de raciocínio. O preço é ligeiramente mais alto, mas oferece raciocínio aprimorado e compreensão multimodal.
O OrcaRouter armazena em cache algum dado do usuário ao usar este modelo?
OrcaRouter não relata nenhum mecanismo de cache que armazene prompts ou imagens; a manipulação de dados segue práticas padrão de API. Consulte a política de privacidade da OrcaRouter para obter detalhes.
Como faço para chamar este modelo por meio de uma API compatível com OpenAI?
Envie um POST para https://api.orcarouter.ai/v1/chat/completions com o modelo "qwen/qwen3-vl-8b-thinking" e sua chave de API. Use um array de conteúdo com entradas text e image_url para entrada multimodal.
O modelo pode processar entrada de vídeo?
Sim, o vídeo é aceito enviando quadros extraídos como entradas image_url separadas. O modelo não possui suporte nativo a codec de vídeo; ele funciona em conjuntos de quadros estáticos.
Existe alguma restrição quanto ao número de imagens por solicitação?
Não, exceto que o total de tokens (incluindo tokens de texto e imagem) deve estar dentro do limite de contexto de 131.072. Não há limite separado para imagens.
Quais linguagens de programação ou bibliotecas posso usar para acessar este modelo via OrcaRouter?
Qualquer linguagem que suporte requisições HTTP e o formato da API OpenAI. Python com a biblioteca openai, JavaScript com fetch, etc. Basta definir a URL base e o ID do modelo.
Não. A variante thinking pode gerar internamente uma cadeia de raciocínio, mas a exibição depende da configuração da API ou do contexto. Em alguns casos, apenas a resposta final é fornecida.
O modelo usa internamente raciocínio passo a passo antes de gerar a resposta final, mas a saída que você vê é a resposta completa. Você não pode extrair os tokens de pensamento intermediários separadamente.

Incorporar este selo

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking no OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Ficha do modelo como dados

GET /api/public/models/qwen/qwen3-vl-8b-thinkingAbrir
Legível por máquina:/llms.txt/llms-full.txt