Qwen3.5 122B-A10B — MoE de peso aberto multimodal (texto/imagem/vídeo), 122B total / 10B parâmetros ativos, 32k de contexto (modo visual).
O Qwen3.5-122B-A10B é um modelo de linguagem de grande porte da série Qwen, desenvolvido pela Alibaba Cloud. Ele utiliza uma arquitetura de mistura de especialistas (MoE), na qual apenas 10 bilhões…
Com base em suas arquiteturas e pontuação de benchmark, Qwen3.5-122B-A10B se destaca em tarefas que envolvem raciocínio de múltiplas etapas, uso de ferramentas e seguimento de instruções. A pontuação τ²-Bench de 93,6 indica um desempenho forte em um benchmark que exige que o modelo planeje e execute sequências de ações usando ferramentas (por exemplo, calculadoras, mecanismos de busca, interpretadores de código). Isso o torna adequado para construir agentes autônomos que precisam interagir com sistemas externos. O modelo também lida com entradas multimodais, portanto tarefas como raciocínio visual, análise de documentos com imagens incorporadas ou sumarização de vídeo estão entre seus pontos fortes. Além disso, seu grande limite de saída permite gerar explicações detalhadas, complementações de código ou dados estruturados em uma única resposta. Desenvolvedores que trabalham em chatbots complexos, assistentes de codificação ou ferramentas de análise de pesquisa podem considerar este modelo eficaz.
Embora o Qwen3.5-122B-A10B seja poderoso, não é a opção mais custo-eficiente para todos os casos de uso. Se sua tarefa é uma classificação simples, geração de texto curto ou um Q&A direto que não exija raciocínio em várias etapas ou compreensão multimodal, você pode obter resultados satisfatórios com um modelo menor, como o Qwen-7B ou um modelo não multimodal. Esses modelos podem ser mais rápidos e mais baratos por token. Além disso, se suas necessidades de contexto forem muito pequenas (por exemplo, menos de 1.000 tokens), a sobrecarga relativa de usar um modelo de 122B parâmetros pode não valer a pena. O OrcaRouter oferece uma gama de modelos com diferentes preços e características de desempenho. Você pode experimentar modelos menores primeiro e atualizar apenas se a qualidade for insuficiente. Além disso, se você não precisar do limite de saída de 65K, um modelo com uma saída mais curta pode ser suficiente.
O modelo possui uma janela de contexto de 32.768 tokens e uma saída máxima de 65.536 tokens, o que permite lidar com cadeias de raciocínio estendidas e instruções longas. A alta pontuação no τ²-Bench sugere que ele consegue manter coerência ao longo de várias etapas e seguir corretamente instruções complexas que envolvem lógica condicional, chamadas de ferramentas e ramificações. Na prática, usuários relataram que os modelos da série Qwen3.5 são competitivos com outros modelos de última geração em tarefas como resolução de problemas matemáticos, geração de código e quebra-cabeças lógicos. No entanto, como todos os modelos grandes, o desempenho pode degradar se o contexto estiver repleto de informações irrelevantes ou se as instruções forem ambíguas. Recomenda-se a engenharia de prompt para orientar o modelo de forma eficaz. O modelo também pode ter dificuldade com documentos muito longos (próximos ao limite de contexto) onde precisa lembrar detalhes do início.
A entrada multimodal (texto + imagem/vídeo) permite diversas aplicações práticas. Na análise de documentos, o modelo pode ler tanto o texto quanto gráficos, diagramas ou assinaturas incorporados em um PDF ou imagem. Por exemplo, pode extrair dados de uma tabela digitalizada ou interpretar um gráfico. Em respostas visuais a perguntas, o modelo pode responder perguntas sobre uma fotografia ou ilustração. Na análise de vídeo, pode processar quadros para descrever cenas ou rastrear mudanças ao longo do tempo. Os desenvolvedores podem criar ferramentas para acessibilidade (por exemplo, descrevendo imagens para usuários com deficiência visual) ou automação (por exemplo, analisando capturas de tela de IU). Como o modelo é acessado via OrcaRouter, essas capacidades podem ser integradas em aplicativos existentes com as mesmas chamadas de API usadas para prompts apenas de texto, simplesmente incluindo image_url ou video_url no conteúdo da mensagem.
O único benchmark divulgado para este modelo é o τ²-Bench, onde obteve 93,6. O τ²-Bench é projetado para avaliar a capacidade de um modelo em usar ferramentas e concluir tarefas de várias etapas em um ambiente simulado. Uma pontuação de 93,6 indica que o modelo consegue concluir corretamente uma alta proporção dessas tarefas. Para contexto, essa pontuação é competitiva com outros modelos de última geração no mesmo benchmark. No entanto, as pontuações de benchmark nem sempre se traduzem em desempenho no mundo real, pois as tarefas podem variar em dificuldade e o benchmark pode não cobrir todos os domínios. Os usuários devem realizar suas próprias avaliações em suas tarefas específicas. Nenhuma outra pontuação de benchmark (por exemplo, MMLU, HumanEval ou benchmarks multimodais) é fornecida nos fatos disponíveis, portanto, não é possível comparar este modelo em um conjunto mais amplo de métricas padrão.
**Pontos fortes:** O modelo alcança uma pontuação alta em um benchmark de uso de ferramentas, sugerindo forte raciocínio e capacidade de seguir instruções. Sua capacidade multimodal e grande limite de saída o tornam versátil. A arquitetura MoE pode proporcionar um bom equilíbrio entre desempenho e eficiência (pelo menos em comparação com um modelo denso de parâmetros totais semelhantes). **Limitações:** O modelo tem uma janela de contexto de apenas 32.768 tokens, o que é moderado em comparação com alguns modelos que oferecem 100K ou mais. Os parâmetros ativados (10B) são relativamente baixos para um modelo de seu tamanho total, o que pode limitar o desempenho em tarefas muito complexas. Não há informações disponíveis sobre latência, throughput ou requisitos de hardware. Além disso, por ser um modelo novo, o ecossistema da comunidade (por exemplo, scripts de fine-tuning, ferramentas de quantização) pode ser menos desenvolvido do que para modelos mais estabelecidos. Os usuários devem testar o modelo minuciosamente.
Não há números específicos de latência ou throughput disponíveis para este modelo no OrcaRouter. A velocidade da inferência depende de fatores como o comprimento da entrada, o comprimento da saída, o tamanho do lote e o hardware subjacente que o OrcaRouter aloca. Modelos MoE podem ter velocidade variável porque o mecanismo de roteamento pode ativar diferentes especialistas para diferentes tokens. Geralmente, modelos com 10B parâmetros ativados podem gerar em velocidades moderadas em GPUs modernas, mas o total de 122B parâmetros na memória pode levar a um maior uso de memória e tempos de preenchimento mais longos. Se a baixa latência for crítica, talvez você queira testar o modelo com seus prompts típicos. A API do OrcaRouter retorna timestamps e métricas de desempenho nos cabeçalhos de resposta que podem ajudar a medir a velocidade. Para aplicações sensíveis à latência, considere usar um modelo menor se a tarefa permitir.
Os fatos disponíveis incluem apenas um único benchmark: τ²-Bench. Benchmarks comuns como MMLU (conhecimento), HumanEval (código), GSM8K (matemática) ou benchmarks multimodais como MMBench não são fornecidos. Isso dificulta a avaliação do desempenho do modelo em tarefas que não são relacionadas a ferramentas. Por exemplo, se sua aplicação exige precisão factual, você gostaria de saber seu desempenho no MMLU. Da mesma forma, para tarefas multimodais, pontuações em um benchmark de raciocínio visual seriam úteis. A ausência dessas pontuações não implica desempenho ruim, mas significa que os usuários devem realizar suas próprias avaliações. O OrcaRouter pode fornecer resultados de benchmark adicionais mediante solicitação ou na documentação. Até que mais dados estejam disponíveis, é aconselhável comparar o modelo qualitativamente com outros em seu domínio específico.
Os detalhes de preço para Qwen3.5-122B-A10B no OrcaRouter não são fornecidos explicitamente nas informações disponíveis. Normalmente, o OrcaRouter cobra por token tanto para entrada quanto para saída, com taxas separadas para tokens de prompt e tokens gerados. Entradas multimodais (imagens/vídeo) são cobradas como equivalentes de token com base no número de blocos de imagem ou quadros de vídeo processados. Alguns provedores também oferecem taxas com desconto para acertos de cache se o usuário repetir o mesmo prompt. Para obter preços exatos, os usuários devem consultar a página de preços do OrcaRouter ou entrar em contato com a equipe de vendas. Como este modelo tem 122B parâmetros totais e é multimodal, seu preço por token pode ser mais alto do que o de modelos menores ou apenas de texto. É importante considerar o custo do token para imagens/vídeo ao estimar as despesas totais para uma tarefa.
Usar um modelo maior como o Qwen3.5-122B-A10B geralmente incorre em custos por token mais altos do que modelos menores. No entanto, se o modelo puder resolver uma tarefa em menos etapas ou com menos tokens devido às suas capacidades, o custo total ainda pode ser competitivo. O grande limite de saída (65.536 tokens) pode ser tanto um benefício quanto um risco de custo: gerar saídas longas pode acumular rapidamente custos de tokens. Além disso, entradas multimodais consomem mais tokens por prompt do que prompts apenas de texto. Por exemplo, uma única imagem de alta resolução pode custar centenas de tokens. Se sua tarefa não exigir todas as capacidades do modelo, você pode economizar dinheiro escolhendo um modelo menor. O OrcaRouter provavelmente fornece painéis de uso e controles de custo, como definir um número máximo de tokens de saída ou alertas de orçamento, que podem ajudar a gerenciar despesas.
Os fatos disponíveis não mencionam descontos de cache para este modelo no OrcaRouter. Muitos provedores de inferência oferecem cache de prompt, onde texto repetido em prompts de sistema ou mensagens de usuário é armazenado temporariamente e cobrado a uma taxa mais baixa. Se o OrcaRouter suportar cache, isso poderia reduzir custos para aplicações que usam prompts estáticos longos (por exemplo, instruções de sistema, descrições de personagens). No entanto, sem documentação específica, não deve ser assumido. Os usuários podem verificar os cabeçalhos de resposta da API para indicadores de cache hit se o cache for implementado. Para minimizar custos, você pode projetar prompts para evitar repetir os mesmos longos prefixos separando instruções estáticas do conteúdo dinâmico. Além disso, considere usar janelas de contexto mais curtas ou omitir imagens desnecessárias quando possível.
Para usar o Qwen3.5-122B-A10B, envie uma requisição POST para o endpoint da API OrcaRouter em https://api.orcarouter.ai/v1/chat/completions. Defina o parâmetro model como "qwen/qwen3.5-122b-a10b". A API é totalmente compatível com o formato de chat completions da OpenAI, então você pode usar as mesmas bibliotecas cliente (ex.: biblioteca Python openai) alterando a URL base e a chave de API. O corpo da requisição inclui messages (cada uma com role e content) e, opcionalmente, parâmetros como temperature, max_tokens, top_p, etc. Para entrada multimodal, use um bloco de conteúdo com type: "image_url" para imagens ou o tratamento específico de vídeo do modelo (provavelmente via frames codificados em base64 ou uma URL). A API retornará uma resposta JSON com o texto gerado e metadados de uso (contagens de tokens). A documentação do OrcaRouter fornece mais detalhes sobre os parâmetros suportados.
O modelo suporta os parâmetros de chat padrão: temperature (padrão tipicamente 0.7), top_p (padrão 0.9), max_tokens (até a saída máxima do modelo de 65,536), presence_penalty, frequency_penalty e stop sequences. O limite da janela de contexto é de 32,768 tokens, que inclui todas as mensagens, imagens e quadros de vídeo. Se o total de tokens exceder esse limite, a API retornará um erro ou truncará a entrada (dependendo das configurações). O parâmetro max_tokens não pode exceder 65,536. Para requisições multimodais, note que imagens e vídeos adicionam tokens; a taxa de conversão exata não é fornecida, mas vídeos de alta resolução ou longos podem consumir rapidamente a janela de contexto. O OrcaRouter também pode suportar o modo de streaming, onde as respostas são transmitidas token por token, o que é útil para aplicações em tempo real. Consulte a referência da API para opções adicionais como logprobs ou tools.
Migrating é simples: substitua sua URL base por https://api.orcarouter.ai/v1, use o ID do modelo "qwen/qwen3.5-122b-a10b" e forneça sua chave de API da OrcaRouter. O formato da requisição é idêntico ao da API de chat completions da OpenAI. Por exemplo, em Python com a biblioteca openai, você pode definir client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'). Em seguida, chame client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...). Se sua aplicação usa function calling ou tools, note que o modelo as suporta, pois é treinado no τ²-Bench, que envolve uso de ferramentas. No entanto, a sintaxe exata da chamada de ferramenta pode diferir da da OpenAI; a OrcaRouter provavelmente suporta o formato da OpenAI, mas teste para confirmar. Para entradas multimodais, seu código existente que envia image_url nas mensagens pode funcionar, desde que o modelo suporte esse formato.
Dentro da família Qwen, este modelo está entre modelos densos menores (por exemplo, Qwen-7B, Qwen-14B) e os maiores modelos MoE (por exemplo, Qwen3.5-235B). Comparado a modelos densos, este modelo MoE pode acessar um conjunto maior de parâmetros totais, mas ativa apenas uma fração por token, o que pode permitir especialistas mais especializados. Isso pode levar a um melhor desempenho em várias tarefas, especialmente aquelas que exigem conhecimento diversificado. No entanto, modelos densos menores podem ser mais rápidos e mais baratos para tarefas restritas. Comparado ao maior Qwen3.5-235B, este modelo provavelmente tem desempenho inferior, mas é mais eficiente. O suporte multimodal é uma característica comum da geração Qwen3.5; versões anteriores (Qwen2, Qwen1) eram apenas texto. Os usuários devem comparar os resultados de benchmark em suas tarefas específicas para decidir qual modelo se adapta melhor.
Comparações diretas são difíceis sem benchmarks abrangentes. Qwen3.5-122B-A10B alcança 93.6 no τ²-Bench, o que é um resultado forte para tarefas de uso de ferramentas. Como referência, pontuações semelhantes nesse benchmark para outros modelos não são fornecidas, mas é considerada uma capacidade de alto nível. Em termos de arquitetura, os modelos Llama são densos e mais simples, enquanto os modelos Claude possuem arquiteturas proprietárias diferentes. O Qwen3.5 oferece entrada multimodal (imagem/vídeo) que o Claude suporta, mas o Llama 3.2 e 3.1 são apenas texto (exceto por algumas variantes de visão). A janela de contexto de 32K é menor que os 100K ou 200K do Claude, mas comparável aos 128K do Llama 3.1? Não exatamente; não devemos inventar números. Para código e raciocínio, muitos modelos são competitivos. A vantagem deste modelo pode ser seu ajuste específico para uso de ferramentas (alta pontuação no τ²-Bench) e eficiência multimodal MoE. No entanto, Claude e Llama têm ecossistemas maiores e mais suporte da comunidade.
Poucos modelos combinam entrada multimodal, uma grande janela de contexto, um grande limite de saída e uma alta pontuação τ²-Bench em um único pacote. A série Qwen3.5 foi projetada para ser um modelo robusto de propósito geral com fortes habilidades de raciocínio e uso de ferramentas. A arquitetura MoE com 122B total e 10B ativos permite que ela armazene muito conhecimento enquanto mantém custos de inferência mais baixos que um modelo denso de 122B. Dito isso, outros modelos MoE como Mixtral 8x7B (total 47B, ativos 13B) têm diferentes compensações. O Qwen3.5-122B-A10B tem uma contagem total de parâmetros muito maior, mas menos parâmetros ativos por token (10B vs. 13B). O suporte multimodal é um diferencial; Mixtral é apenas texto. No espaço MoE multimodal, modelos como Qwen-VL ou outros existem, mas geralmente têm janelas de contexto menores. Este modelo é posicionado como uma opção robusta para desenvolvedores que precisam de um único modelo para tarefas diversas, multimodais e com uso intensivo de ferramentas no OrcaRouter.
Escolha o Qwen3.5-122B-A10B se sua aplicação exigir tanto compreensão multimodal quanto raciocínio complexo de múltiplas etapas, e você precisar do grande limite de saída para gerar respostas longas. Também é uma boa escolha se você estiver construindo sistemas agentivos que usam ferramentas, dado seu alto escore τ²-Bench. Se sua tarefa for apenas texto e não precisar da capacidade extra, um modelo mais barato como Llama 3.1 70B ou Qwen-14B pode ser suficiente. Se você precisar de uma janela de contexto maior (por exemplo, >100K tokens), considere modelos projetados especificamente para contexto longo. Se você precisar de menor latência, um modelo menor ou denso pode ser melhor. Como o OrcaRouter oferece muitos modelos, você pode avaliar vários por meio da mesma API para encontrar o melhor ajuste para seus objetivos de custo e qualidade. O ID do modelo é qwen/qwen3.5-122b-a10b.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Nível | Entrada / 1M tokens | Saída / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Nível selecionado pela contagem de tokens de entrada de cada solicitação | ||
Estimativa com base no preço de tabela
Preços por níveis — esta estimativa usa as tarifas do nível base.
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/qwen/qwen3.5-122b-a10bAbrir @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b