Qwen3.5 Flash — chat multimodal (texto/imagem/vídeo) otimizado para custo, contexto de 1M.
Qwen3.5 Flash é um modelo de linguagem multimodal da família Qwen, projetado para inferência rápida e baixo custo. Ele aceita entradas de texto, imagem e vídeo e gera respostas em texto. Sua janela…
Qwen3.5 Flash aceita texto, imagens (incluindo múltiplas imagens por solicitação) e entradas de vídeo. Para vídeo, o modelo pode ingerir quadros ou arquivos de vídeo inteiros até o limite de contexto. Ele processa essas modalidades juntas em uma única chamada de API, permitindo tarefas como descrever uma cena de vídeo, responder perguntas sobre uma imagem ou combinar instruções de texto com conteúdo visual. A duração exata do vídeo suportada depende da extração de quadros e do orçamento de tokens dentro da janela de contexto de 1M.
O modelo se destaca em tarefas que exigem grande contexto e entrada multimodal. Exemplos incluem resumir transcrições longas de vídeo, extrair dados estruturados de documentos digitalizados com imagens e construir agentes conversacionais que referenciam contexto visual. Também é eficaz para processamento em lote de alta taxa de transferência, onde o baixo custo por token (especialmente de entrada) torna-o econômico para milhões de consultas. Para tarefas simples apenas com texto, um modelo mais barato apenas de texto pode ser ainda mais econômico.
Para tarefas puramente baseadas em texto que não exigem capacidade multimodal, um modelo menor ou apenas de texto com preço mais baixo pode ser mais econômico. O ponto forte do Qwen3.5 Flash está em suas habilidades multimodais e de contexto longo; se sua aplicação necessita apenas de complementos de texto curtos, modelos como text-davinci ou variantes menores do Qwen podem economizar dinheiro. Da mesma forma, se você não precisa do contexto completo de 1M, um modelo com janela menor pode reduzir latência e custos.
A designação 'Flash' indica que este modelo troca alguma precisão de benchmark por inferência mais rápida e menor custo computacional. Em comparação com os modelos maiores da Qwen (por exemplo, Qwen3.5-72B), ele usa uma arquitetura mais eficiente com menos parâmetros. As pontuações de benchmark são publicadas pela Qwen, mas não fornecidas nesta entrada de catálogo. Na prática, ele tem desempenho competitivo em tarefas de compreensão multimodal, mantendo menor latência por requisição, tornando-o adequado para aplicações em tempo real.
A latência depende do tamanho da entrada, do comprimento da saída e da carga do servidor. Como o Qwen3.5 Flash foi projetado para velocidade, ele geralmente retorna respostas mais rápido do que modelos maiores, como o Qwen3.5-72B, para contagens equivalentes de tokens. Os números exatos de tokens por segundo não são fornecidos no catálogo. Os usuários podem testar o desempenho por meio do endpoint do OrcaRouter para medir a latência real para seu caso de uso específico. A janela de contexto de 1M pode introduzir sobrecarga de processamento para entradas muito longas.
Os pontos fortes incluem entrada multimodal, contexto muito grande, 65 mil tokens de saída e baixo custo por token. O modelo lida bem com documentos longos e vídeos. Limitações: não é o mais preciso em tarefas de raciocínio complexo ou matemática em comparação com modelos de fronteira maiores. Também pode ter dificuldades com instruções complexas de múltiplas etapas. Para tarefas onde a qualidade de saída de ponta é crítica, considere um modelo maior da classe Qwen ou GPT-4o. A arquitetura 'Flash' prioriza a taxa de transferência e o custo em vez da precisão máxima.
O preço é de $0,10 por 1 milhão de tokens de entrada (tokens de texto, imagem ou vídeo) e $0,40 por 1 milhão de tokens de saída. Essas taxas são cobradas à taxa do provedor, sem margem de lucro da OrcaRouter. Não há taxas adicionais para o gateway da API. Este preço é repassado diretamente, ou seja, o usuário final paga o mesmo que se estivesse chamando a própria API do provedor, sem qualquer sobretaxa da OrcaRouter. A contagem de tokens segue a tokenização padrão para cada modalidade.
O preço do token de entrada ($0.10/1M) é muito competitivo entre os modelos multimodais. Por exemplo, muitos modelos multimodais grandes cobram $2-10 por milhão de tokens de entrada. O preço de saída ($0.40/1M) também é baixo. No entanto, como o modelo tem uma janela de contexto de 1M, processar entradas muito longas pode resultar em alto custo total apesar da baixa taxa por token. Os usuários devem equilibrar o comprimento do contexto com o número de solicitações. Para entradas curtas, modelos menores podem oferecer um custo absoluto ainda menor.
A entrada do catálogo não especifica se o caching está disponível para Qwen3.5 Flash no OrcaRouter. Os usuários devem consultar a documentação do OrcaRouter para obter detalhes sobre os recursos de caching de prompt ou caching de resposta. Se o caching não for suportado, entradas idênticas repetidas incorrerão em custos totais de token cada vez. Para processamento em lote, considere deduplicar entradas ou usar um cache local para reduzir as chamadas de API. Os preços permanecem nas taxas do provedor sem acréscimo, independentemente do status do caching.
Use o endpoint compatível com OpenAI em https://api.orcarouter.ai/v1. Defina o parâmetro model como "qwen/qwen3.5-flash" na sua requisição. Forneça uma chave de API do OrcaRouter. O formato da requisição corresponde à API de chat completions do OpenAI, suportando papéis (system, user, assistant) e conteúdo multimodal usando o array "content" com "type": "image_url" ou "type": "text". Para vídeo, você pode precisar extrair quadros e passá-los como imagens. Consulte a documentação do OrcaRouter para diretrizes exatas de manipulação de vídeo.
Parâmetros padrão compatíveis com OpenAI: temperature, top_p, max_tokens (até 65536), stop sequences, presence_penalty, frequency_penalty e seed. O parâmetro max_tokens é limitado a 65536 para corresponder à saída máxima do modelo. O modelo suporta streaming via stream: true. Você também pode definir IDs de usuário para rastreamento. Para solicitações multimodais, inclua o conteúdo de imagem ou vídeo na mensagem do usuário. O modelo aceita até a janela de contexto de 1,048,576 tokens no total em todas as interações.
Se você já usa o SDK Python da OpenAI, altere a base_url para https://api.orcarouter.ai/v1 e atualize o nome do modelo para "qwen/qwen3.5-flash". A autenticação usa uma chave de API do OrcaRouter em vez de uma chave da OpenAI. As estruturas de requisição e resposta são idênticas. Para migração de outros provedores, use o formato de chat completions. Certifique-se de que seus prompts de sistema e conteúdo multimodal estejam formatados conforme as convenções da OpenAI. Nenhuma alteração de código além do endpoint e do nome do modelo é necessária.
Sim, a API do OrcaRouter suporta mensagens de sistema, mensagens do usuário e mensagens do assistente em uma conversa de múltiplas etapas. O histórico completo da conversa conta contra a janela de contexto de 1.048.576 tokens. O modelo processa conteúdo multimodal em mensagens do usuário. Para vídeo, você pode enviar múltiplos quadros como imagens em uma única mensagem do usuário. O modelo mantém o contexto ao longo das etapas, permitindo interações estendidas com históricos longos, desde que o total de tokens permaneça abaixo do limite.
O Qwen3.5 Flash é uma alternativa menor, mais rápida e mais barata aos modelos Qwen maiores, como o Qwen3.5-72B ou Qwen3.5-32B. Ele sacrifica alguma precisão em benchmarks em troca de menor latência e custo. Compartilha o mesmo suporte multimodal de entrada e grande janela de contexto (1M) que seus irmãos maiores. Para tarefas que exigem raciocínio de ponta, os modelos maiores são preferidos. Para aplicações de alto volume ou tempo real, onde velocidade e custo importam mais, o Flash é a melhor escolha.
O GPT-4o oferece maior precisão em muitos benchmarks de raciocínio e multimodais, mas a um preço significativamente mais alto (tipicamente $2,50 por milhão de tokens de entrada para GPT-4o e $0,15 para GPT-4o mini). O Qwen3.5 Flash é mais barato ($0,10 de entrada) e possui uma janela de contexto maior (1M vs 128K para GPT-4o). Seu limite de tokens de saída (65K) também excede o GPT-4o mini (16K). Para aplicações sensíveis ao custo com entradas muito longas, o Qwen3.5 Flash pode ser mais econômico, enquanto ainda oferece boa compreensão multimodal.
Claude 3 Haiku e Gemini 1.5 Flash são modelos 'flash' semelhantes. Claude 3 Haiku é apenas texto e custa $0,25 por milhão de tokens de entrada. Gemini 1.5 Flash suporta entrada multimodal e tem uma janela de contexto de 1M, custando $0,075 por milhão de tokens de entrada. O suporte multimodal e o contexto de 1M do Qwen3.5 Flash o colocam em um nível semelhante, com preço de saída ($0,40/1M) mais alto que o Gemini Flash ($0,30/1M), mas mais baixo que o Haiku ($1,25/1M). O desempenho em benchmarks varia conforme a tarefa.
O OrcaRouter hospeda modelos de código aberto como Llama 3.1 8B e Mistral 7B. O Qwen3.5 Flash é um modelo proprietário, mas compete em custo e capacidade. Modelos de código aberto geralmente têm custo por token menor ou nenhum (você paga apenas pelo processamento), mas podem exigir mais engenharia para configurar. O Qwen3.5 Flash oferece uma API gerenciada com margem zero, uma janela de contexto de 1M e suporte multimodal que a maioria dos modelos de código aberto não possui. É um bom meio-termo entre a flexibilidade do código aberto e a qualidade proprietária.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Entrada / 1M tokens | $0.100 |
| Saída / 1M tokens | $0.400 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/qwen/qwen3.5-flashAbrir @misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash