Qwen3-VL 8B Thinking — modelo de raciocínio visão-linguagem pequeno de peso aberto, 8B parâmetros, contexto de 128k.
Qwen3 VL 8B Thinking é um modelo multimodal de linguagem com 8 bilhões de parâmetros, desenvolvido pela equipe Qwen na Alibaba Cloud, hospedado no OrcaRouter sob o provedor qwen. Pertence à família…
O Qwen3 VL 8B Thinking é excelente em responder a perguntas visuais, especialmente quando a pergunta envolve múltiplos objetos, relações espaciais ou texto incorporado em imagens (por exemplo, placas de rua, recibos). Ele também pode lidar com tarefas de compreensão de vídeos, como resumir um clipe curto, identificar ações ou responder a perguntas sobre timestamps específicos. A análise de documentos é um caso de uso forte: extrair informações de PDFs que contêm tanto texto quanto gráficos, ou de formulários digitalizados. Sua janela de contexto longa o torna adequado para processar documentos grandes (por exemplo, PDFs com mais de 100 páginas) com inserções ocasionais de imagens, desde que a entrada total tokenizada permaneça abaixo de 131K.
Se seu caso de uso for puramente baseado em texto e não envolver imagens ou vídeo, um modelo dedicado apenas a texto (por exemplo, Qwen3-8B ou uma variante Llama de tamanho similar) provavelmente será mais econômico. Modelos multimodais incorrem em sobrecarga adicional para codificar entradas visuais, e o preço por token para Qwen3 VL 8B Thinking ($0,18 de entrada, $2,10 de saída por milhão de tokens) pode ser mais alto do que muitas alternativas apenas de texto. Além disso, se sua tarefa for classificação simples ou extração de imagens muito curtas, um modelo de visão-linguagem menor com menor latência e custo (por exemplo, Qwen2 VL 2B) pode ser suficiente sem sacrificar o desempenho.
Sim, o modelo pode aceitar múltiplas imagens intercaladas com texto em uma única chamada de API, desde que a contagem total de tokens (tokens de imagem mais tokens de texto) permaneça dentro da janela de contexto de 131.072. Cada imagem é codificada em um número variável de tokens dependendo de sua resolução e complexidade. A API compatível com OpenAI do OrcaRouter permite que você envie múltiplas URLs de imagem ou imagens codificadas em base64 no array de conteúdo. Não há um limite rígido no número de imagens além da restrição de contexto. Para vídeo, normalmente você extrairia quadros-chave e os enviaria como imagens separadas junto com um prompt de texto.
Como todos os modelos multimodais, Qwen3 VL 8B Thinking pode alucinar detalhes em imagens ou vídeo, especialmente com baixa resolução ou conteúdo ambíguo. Não foi projetado para streaming de vídeo em tempo real; ele processa conjuntos estáticos de quadros. O tamanho do parâmetro 8B significa que pode ser menos preciso em domínios altamente especializados (por exemplo, imagens médicas, imagens de satélite) do que modelos maiores (por exemplo, modelos de visão-linguagem de 70B-100B+). Não suporta entrada de áudio. O processo de pensamento pode inflar o comprimento da saída, portanto, planeje os tokens de saída de acordo. Finalmente, é otimizado para inglês, mas pode lidar com outros idiomas com eficácia variável.
As pontuações específicas do benchmark para o Qwen3 VL 8B Thinking em avaliações multimodais padrão (por exemplo, MMMU, MathVista, VideoMME) não foram fornecidas nos fatos disponíveis. Os usuários devem consultar o cartão do modelo oficial Qwen ou o artigo de pesquisa para resultados eventualmente publicados. Em geral, a série Qwen3 VL demonstrou desempenho competitivo em tarefas de visão-linguagem em comparação com outros modelos de parâmetros 7B-8B. Espera-se que a variante "Thinking" melhore benchmarks com uso intenso de raciocínio, como a cadeia de pensamento visual. Sem pontuações públicas, é aconselhável testar o modelo em seu próprio conjunto de dados representativo para avaliar sua adequação.
Os dados de latência para este modelo específico na infraestrutura da OrcaRouter não foram divulgados. Como regra geral, um modelo multimodal de 8B parâmetros terá latência maior do que um modelo de texto puro do mesmo tamanho devido à codificação visual. A entrada de vídeo aumenta ainda mais a latência devido ao processamento adicional de quadros. Em clusters de GPU de alto desempenho (por exemplo, A100, H100), o tempo típico até o primeiro token para um modelo de 8B está na faixa de algumas centenas de milissegundos a alguns segundos, dependendo do comprimento da entrada e do tamanho do lote. A velocidade de geração de tokens de saída geralmente é medida em dezenas de tokens por segundo. Esses valores são qualitativos; o desempenho real depende do provisionamento e da carga atuais da OrcaRouter.
Pontos fortes: O modelo lida com longos contextos multimodais (131K tokens), permite saídas grandes (até 40K tokens) e processa três tipos de entrada. Sua capacidade de pensamento melhora o raciocínio em tarefas que exigem dedução passo a passo. Tem um preço competitivo para um modelo multimodal de 8B. Limitações: Não foi avaliado em comparação com os modelos de fronteira mais recentes em muitos rankings públicos. Sua taxa de saída máxima pode ser menor do que a de modelos menores. Não é otimizado para geração criativa de imagens (produz apenas texto). Os usuários não devem presumir alucinação zero em tarefas visuais. O processamento de vídeo é limitado à extração baseada em quadros, em vez de análise contínua.
Qwen3 VL 8B Thinking é cobrado por token à taxa do provedor, sem nenhum acréscimo. Tokens de entrada custam $0,18 por 1 milhão de tokens. Tokens de saída custam $2,10 por 1 milhão de tokens. Não há taxa de infraestrutura adicional, custo base por requisição nem assinatura mensal. O preço se aplica igualmente a todas as modalidades de entrada (texto, imagem, vídeo); cada modalidade é tokenizada e cobrada pela taxa de entrada. A OrcaRouter não cobra nenhum prêmio sobre a taxa cotada. Por exemplo, processar uma imagem que tokeniza em 2.000 tokens de entrada custaria 2.000 * ($0,18 / 1M) = $0,00036 em custo de entrada. O custo de saída é calculado de forma similar.
Cada imagem é codificada em um número variável de tokens com base em suas dimensões e nível de compressão. Imagens de alta resolução podem consumir milhares de tokens. O vídeo é tratado extraindo quadros (tipicamente um quadro a cada poucos segundos) e codificando cada quadro como uma imagem; assim, o custo em tokens escala linearmente com a duração do vídeo e a taxa de quadros. Os usuários podem controlar o custo redimensionando imagens ou reduzindo a contagem de quadros. Não há taxa separada para codificação de mídia além do custo em tokens. O custo de saída depende apenas do número de tokens de texto gerados. Para vídeos longos, os tokens de entrada podem rapidamente se aproximar do limite de 131K, aumentando o custo por solicitação.
Com base nas informações fornecidas, não há descontos para uso em lote ou compromissos pré-pagos. O OrcaRouter não oferece atualmente cache de tokens que reduziria custos para prompts ou imagens repetidos. Todas as solicitações são cobradas por token em tempo real na tarifa padrão. Se o provedor (qwen) introduzir preços diferenciados por nível no futuro, o OrcaRouter repassará essas economias sem margem de lucro. Os usuários são incentivados a monitorar a página de preços do OrcaRouter para quaisquer atualizações. Para casos de uso de alto volume, considere trabalhar diretamente com o OrcaRouter para discutir possíveis preços por volume.
Comparado a modelos multimodais maiores (por exemplo, GPT-4V, Gemini 1.5 Pro), o Qwen3 VL 8B Thinking é significativamente mais barato por token: esses modelos geralmente custam $2–$10+ por milhão de tokens de entrada. Entre modelos de linguagem-visão de 7B-8B parâmetros, ele está alinhado com o preço típico (Qwen2 VL 7B custa aproximadamente $0.10–$0.20 de entrada, $1–$2 de saída). O custo por token de saída ($2.10 por milhão) é maior do que alguns modelos de texto puro 8B (por exemplo, $0.20 por milhão de saída), refletindo a carga adicional de raciocínio. Se você puder usar um modelo menor (por exemplo, 2B–4B parâmetros), os custos podem ser 50–90% menores, mas com capacidade reduzida.
Você chama o Qwen3 VL 8B Thinking enviando uma requisição POST para o endpoint compatível com OpenAI do OrcaRouter em https://api.orcarouter.ai/v1/chat/completions. Defina o parâmetro model como "qwen/qwen3-vl-8b-thinking". Inclua sua chave de API no cabeçalho Authorization como "Bearer <key>". O corpo da requisição segue o esquema de chat completions da OpenAI. Para entrada multimodal, estruture o conteúdo da mensagem como um array de objetos: um com type "text" para o prompt de texto, e um com type "image_url" para cada imagem (com URL ou dados base64). O vídeo pode ser enviado como múltiplas entradas image_url representando quadros. A resposta segue a estrutura padrão da OpenAI com todo o texto gerado no array choices.
Todos os parâmetros padrão de chat completion da OpenAI são suportados: temperature (0–2, padrão 1.0), top_p (0–1, padrão 1.0), max_tokens (até 40960), stop sequences, frequency_penalty, presence_penalty, logprobs e n (número de completions). O modelo não suporta streaming? OrcaRouter provavelmente suporta streaming quando streaming=true é definido; consulte a documentação do provedor. O parâmetro tools (function calling) pode ser suportado se o provedor subjacente o habilitar; atualmente não é garantido. O system prompt é permitido. IDs de usuário podem ser passados para monitoramento. Certifique-se de permanecer dentro da janela de contexto de 131072 tokens monitorando as contagens de tokens antes de enviar.
Se você está atualmente usando o mesmo modelo de um provedor de API diferente (por exemplo, diretamente da Alibaba Cloud), a migração para o OrcaRouter é simples: altere a URL base para https://api.orcarouter.ai/v1, atualize a string do modelo para "qwen/qwen3-vl-8b-thinking" e substitua a chave da API por uma chave da API do OrcaRouter. Nenhuma outra alteração no código é necessária porque o OrcaRouter usa exatamente a mesma interface compatível com OpenAI. Esteja ciente de que o uso de tokens e os preços serão baseados nas taxas do OrcaRouter (que são repassadas sem margem de lucro). Talvez seja necessário ajustar suas ferramentas de monitoramento de custos para refletir os novos preços.
O streaming está disponível através da API do OrcaRouter. Defina o parâmetro stream como true em sua solicitação. A resposta será um fluxo Server-Sent Events (SSE) com deltas dos tokens gerados. Isso é útil para exibição em tempo real. Observe que, para a variante "Thinking", o processo de pensamento pode introduzir atrasos mais longos antes do primeiro token, mas o streaming ainda enviará tokens incrementais à medida que são produzidos. O formato do fluxo segue a especificação de streaming da OpenAI, com eventos do tipo "chat.completion.chunk". Cada chunk contém um delta com o conteúdo ou função do token.
Qwen3 VL 8B Thinking é o sucessor do Qwen2 VL 7B, com aproximadamente a mesma contagem de parâmetros (8B vs 7B), mas com arquitetura melhorada para contexto mais longo (131K vs 32K para Qwen2 VL 7B). Ele também adiciona a capacidade de "Thinking" para raciocínio passo a passo, que não estava presente no Qwen2 VL. O comprimento máximo de saída aumentou de 2048 tokens (Qwen2 VL 7B) para 40960 tokens. O preço do Qwen3 VL 8B Thinking é ligeiramente maior por token do que o Qwen2 VL 7B (que custa aproximadamente $0.15 de entrada, $1.80 de saída por milhão de tokens), refletindo as capacidades adicionadas e o contexto maior. Usuários que atualizarem devem esperar melhor desempenho em tarefas de raciocínio complexo.
GPT-4o mini é um modelo multimodal emblemático da OpenAI com uma janela de contexto de 128K. Ele tem significativamente mais parâmetros (desconhecido, mas estimado em >70B) e geralmente alcança maior precisão em benchmarks padrão. No entanto, o Qwen3 VL 8B Thinking é substancialmente mais barato: GPT-4o mini custa $0.15 por milhão de tokens de entrada e $0.60 por milhão de tokens de saída, o que é na verdade menor que os $0.18 de entrada e $2.10 de saída do Qwen3? Espere, verifique: a entrada do GPT-4o mini é $0.15, saída $0.60 — mais barato que o Qwen3 VL 8B Thinking? Na verdade, a saída é muito mais barata. Portanto, o custo não é menor em todos os aspectos. Mas o Qwen3 suporta vídeo e saída mais longa (40960 vs 16384 para GPT-4o mini). As janelas de contexto são semelhantes. A escolha depende da precisão necessária e do orçamento; o Qwen3 é um nicho para saídas muito longas e implantação de código aberto.
O Llama 3.2 11B Vision é um modelo multimodal de 11B parâmetros com janela de contexto de 128K e máximo de 8K tokens de saída. O Qwen3 VL 8B Thinking tem uma contagem menor de parâmetros, mas um máximo de saída muito maior (40960 vs 8000) e inclui capacidades de raciocínio. Ambos suportam entrada de texto e imagem, mas o Llama 3.2 11B não suporta vídeo nativamente. O preço do Llama pelos provedores é similar, cerca de US$ 0,15–US$ 0,20 por milhão de tokens de entrada e US$ 0,60–US$ 1,00 de saída, tornando o Qwen3 mais caro na saída. Para tarefas que exigem texto gerado muito longo (por exemplo, redação de relatórios a partir de vídeo), o Qwen3 é mais adequado. Para tarefas mais curtas e sensíveis a custo, o Llama 3.2 11B pode ser preferível.
O Gemini 1.5 Flash é um modelo multimodal rápido e econômico com uma janela de contexto de 1M (até 2M), suportando imagem, vídeo e áudio. Ele é mais barato que o Qwen3 VL 8B Thinking (Gemini Flash custa $0,075 de entrada, $0,30 de saída por milhão de tokens) e mais rápido. No entanto, o Qwen3 VL 8B Thinking oferece um processo de pensamento que pode melhorar o raciocínio em tarefas visuais desafiadoras, e sua saída máxima é muito maior (40K vs 8K do Gemini Flash). Se sua aplicação requer raciocínio passo a passo e saídas longas, o Qwen3 é a melhor escolha. Para alto rendimento e baixa latência, o Gemini Flash é geralmente superior. Além disso, o Qwen3 pode ser preferido quando a soberania de dados requer implantação auto-hospedada ou independente de provedor.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Entrada / 1M tokens | $0.180 |
| Saída / 1M tokens | $2.10 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingAbrir @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking