Qwen3-VL 235B-A22B Instruct — modelo de visão-linguagem de peso aberto, 235B total / 22B parâmetros ativos, contexto de 256k, sem modo de pensamento.
Qwen3 VL 235B A22B Instruct é uma variante de visão-linguagem da série de modelos Qwen3, desenvolvida pela Alibaba Cloud. Ela utiliza um design de mistura de especialistas (MoE) com 235 bilhões de…
O modelo se destaca em tarefas onde imagens e texto interagem. Ele pode responder perguntas sobre o conteúdo de uma imagem, descrever cenas detalhadamente, ler texto de documentos ou placas e raciocinar sobre relações entre objetos em uma imagem. Também lida com múltiplas imagens em uma única conversa, permitindo análise comparativa ou raciocínio sequencial. O ajuste de instrução permite que o modelo siga prompts multimodais complexos, como "Explique por que este gráfico mostra uma tendência" ou "Extraia todos os valores numéricos desta tabela." Essas capacidades derivam da grande arquitetura MoE e do treinamento especializado em visão-linguagem.
Sendo uma variante Instruct, o modelo foi ajustado para seguir instruções do usuário com alta fidelidade tanto em prompts somente texto quanto multimodais. Ele pode lidar com diálogos de múltiplas rodadas onde imagens são introduzidas incrementalmente, manter contexto ao longo de várias trocas e seguir instruções de formatação (por exemplo, saída como JSON, marcadores ou passo a passo). Tem bom desempenho em tarefas que exigem adesão a restrições, como 'Responda apenas se a imagem contiver um cachorro.' Isso o torna adequado para aplicações onde um comportamento consistente e de obediência a regras é importante.
Para tarefas apenas de texto, sem componente visual, o modelo 235B MoE pode ser exagerado; modelos densos menores ou outras variantes de Qwen apenas para texto seriam mais econômicos. Da mesma forma, se suas imagens são simples (por exemplo, logotipos básicos, objetos únicos) ou você precisa de uma taxa de transferência extremamente alta com orçamento limitado, um modelo de visão menor, como o Qwen2-VL 7B, pode ser suficiente. Este modelo é mais justificado quando você precisa lidar com imagens complexas de alta resolução, documentos com texto denso ou tarefas que exigem raciocínio multimodal profundo. No OrcaRouter, você pode comparar preços e alternar IDs de modelo facilmente.
Não. O Qwen3 VL 235B A22B Instruct é um modelo de geração de texto que aceita imagens como entrada apenas. Ele não gera imagens, áudio ou qualquer outra modalidade. A saída é sempre uma string de texto. Se você precisar de geração de imagens, deve usar um modelo separado. A força deste modelo está em compreender e raciocinar sobre a entrada visual. Ele pode, por exemplo, descrever como uma imagem se parece ou responder perguntas sobre ela, mas não pode criar, editar ou transformar imagens por si só.
A pontuação relatada do MMLU-Pro para este modelo é 82,3. O MMLU-Pro é uma versão aprimorada do benchmark Massive Multitask Language Understanding, abrangendo 57 disciplinas em STEM, humanidades e ciências sociais. Uma pontuação de 82,3 indica forte conhecimento geral e raciocínio em diversos tópicos. É uma métrica agregada única; o desempenho pode variar por assunto. Essa pontuação coloca o modelo entre os melhores de sua classe de tamanho, especialmente considerando a arquitetura MoE que ativa apenas uma fração de seus parâmetros totais por consulta.
Os pontos fortes incluem alta precisão em benchmarks de raciocínio multimodal, forte seguimento de instruções e eficiência de custo em relação a modelos densos de contagem total de parâmetros semelhante. O design MoE permite escalar capacidade sem custo computacional proporcional. As limitações incluem maior custo absoluto em comparação com modelos menores, potencial para latência aumentada devido ao grande número de parâmetros totais (mesmo que apenas 22B estejam ativos, o modelo completo deve ser carregado na memória). Também pode ocasionalmente alucinar detalhes finos em imagens ou falhar em entradas visuais altamente ambíguas. O desempenho em tarefas de domínio específico (por exemplo, imagens médicas) não é garantido.
A velocidade de inferência depende do backend de hardware usado pelo OrcaRouter e da carga atual. Como um modelo MoE com 235 bilhões de parâmetros totais, ele requer uma quantidade significativa de memória GPU, embora apenas 22 bilhões de parâmetros sejam ativados por token. Isso geralmente resulta em latência maior por requisição em comparação com modelos densos menores (por exemplo, 7B-70B parâmetros). A taxa de transferência também é influenciada pelo tamanho do lote e pelo comprimento da sequência. Para aplicações sensíveis à latência, considere usar um modelo menor ou otimizar para prompts mais curtos. O OrcaRouter não fornece garantias específicas de latência, mas busca uma capacidade de resposta de nível de produção.
OrcaRouter cobra exatamente a tarifa listada pelo provedor: $0,40 por 1 milhão de tokens de entrada e $1,60 por 1 milhão de tokens de saída. Não há margem adicional. Tanto os tokens de entrada quanto os de saída são contados de acordo com as regras de tokenização da OpenAI, que podem diferir ligeiramente do tokenizador interno do modelo. Imagens também são cobradas como tokens com base em suas dimensões e nível de detalhe, seguindo a política do provedor. Você pode estimar os custos multiplicando seu uso esperado de tokens por essas tarifas.
O custo por token é maior do que modelos menores ou densos, mas a arquitetura MoE oferece mais capacidade por parâmetro ativo do que um modelo denso de tamanho ativo equivalente. Para tarefas multimodais complexas, este modelo pode concluir a tarefa com menos tokens ou com maior precisão, potencialmente reduzindo o gasto total. No entanto, para tarefas simples, um modelo mais barato reduziria os custos. No OrcaRouter, você pode alternar modelos em tempo real, permitindo usar este modelo apenas quando necessário. Não há compromissos mínimos mensais ou taxas ocultas.
Atualmente, o OrcaRouter não divulga políticas específicas de cache para este modelo. O cache em nível de token pode ser aplicado pelo provedor subjacente, mas não é garantido. Não há descontos por volume ou preços escalonados mencionados; as tarifas são fixas por token. Para usuários de alto volume, pode valer a pena entrar em contato com o suporte do OrcaRouter para possíveis acordos personalizados. Em geral, os preços são transparentes e baseados no uso.
As imagens são convertidas em uma contagem de tokens com base em sua resolução e configuração de detalhes. A fórmula exata é definida pelo provedor (Qwen) e pode variar. Normalmente, imagens de maior resolução consomem mais tokens. O OrcaRouter repassa a tokenização do provedor sem alterações. Você pode controlar os custos redimensionando imagens ou usando o modo de baixo detalhe, se o modelo suportar. Sempre consulte a documentação do provedor para o cálculo preciso dos tokens de imagem. Os tokens de entrada para imagens são contados na taxa de US$ 0,40 por milhão.
Você envia uma solicitação POST para https://api.orcarouter.ai/v1/chat/completions com um payload JSON compatível com OpenAI. Defina o campo model como "qwen/qwen3-vl-235b-a22b-instruct". Inclua um array messages onde cada mensagem pode conter texto e/ou conteúdo de imagem. Para imagens, use o formato padrão de conteúdo de imagem da OpenAI (URL ou base64). A autenticação é feita via um token Bearer (sua chave de API). Exemplos de parâmetros: temperature, max_tokens, top_p e sequências de stop funcionam de forma idêntica à API da OpenAI. A documentação da OrcaRouter fornece detalhes completos.
Todos os parâmetros padrão de conclusão de chat são suportados: temperature (0-2, padrão 1), top_p (0-1, padrão 1), max_tokens (número de tokens de saída), stop (lista de strings), presence_penalty, frequency_penalty e seed para reprodutibilidade. O modelo também respeita mensagens de sistema para definir comportamento. Para solicitações multimodais, você inclui uma parte de imagem no conteúdo de uma mensagem de usuário. Não há parâmetros específicos do modelo expostos; a API é mantida genérica para compatibilidade. Se você precisar controlar o roteamento MoE, isso é tratado internamente.
Sim. Como o OrcaRouter usa o formato da API da OpenAI, a migração é simples. Substitua sua URL base e ID de modelo existentes pelo endpoint do OrcaRouter e por "qwen/qwen3-vl-235b-a22b-instruct". Certifique-se de que sua chave de API seja válida e que você tenha créditos suficientes. O formato da mensagem para imagens é idêntico ao da OpenAI (usando o tipo de conteúdo 'image_url'). Talvez seja necessário ajustar as estimativas de contagem de tokens devido à tokenização diferente. Nenhuma alteração na lógica da sua aplicação é necessária além do endpoint e do nome do modelo.
Qwen3 VL 235B A22B Instruct e GPT-4V ambos lidam com entradas multimodais. Principais diferenças: Qwen3 VL usa MoE com 22B parâmetros ativos, enquanto GPT-4V é um modelo denso proprietário de tamanho não divulgado. O preço do Qwen3 VL através do OrcaRouter é de $0,40/$1,60 por milhão de tokens, que é significativamente menor que as taxas típicas do GPT-4V. As pontuações de benchmarks não são diretamente comparáveis porque o MMLU-Pro e outros testes usam subconjuntos diferentes. O GPT-4V tem um suporte de ecossistema mais amplo, mas o Qwen3 VL oferece uma vantagem de custo para cargas de trabalho multimodais de alto volume no OrcaRouter.
Claude 3.5 Sonnet é um modelo denso da Anthropic com fortes capacidades de texto e visão. Ele não utiliza MoE, portanto sua capacidade total é menor que os parâmetros totais do Qwen3 VL, mas sua capacidade ativa por inferência é maior que 22B. O preço do Claude 3.5 Sonnet é geralmente maior por token (aproximadamente $3.00/$15.00 por milhão de tokens). O Qwen3 VL oferece um custo muito menor para tarefas multimodais. No entanto, os modelos Claude têm uma janela de contexto maior (200K tokens). A escolha depende do orçamento, das necessidades de comprimento de contexto e do provedor preferido.
OrcaRouter provavelmente oferece outros modelos Qwen, como Qwen2.5 7B, Qwen2.5 72B ou variantes Qwen2-VL. O Qwen3 VL 235B A22B Instruct é o maior modelo multimodal MoE da linha Qwen. Em comparação com o Qwen2-VL 72B, ele tem mais parâmetros totais e uma arquitetura MoE, o que pode proporcionar melhor desempenho em tarefas complexas, mantendo um custo de inferência razoável. É mais caro por token do que modelos Qwen menores, mas pode ser econômico se reduzir a necessidade de múltiplas chamadas ou alto consumo de tokens.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Entrada / 1M tokens | $0.400 |
| Saída / 1M tokens | $1.60 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructAbrir @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct