Qwen3.7 Flash

qwen/qwen3.7-flash
NovoDestaque
VisãoFerramentasJSONRaciocínio
por Qwen · 2026-07-27

Qwen3.7 Flash é o modelo rápido e extremamente econômico da Alibaba na família Qwen3.7, posicionado abaixo do Qwen3.7-Plus e do Qwen3.7-Max como o nível de alta vazão. Ele é nativamente multimodal no lado da entrada — aceitando texto, imagens e vídeo com saída de texto — e oferece uma janela de contexto de 1M de tokens com até 64K tokens de saída, de modo que documentos longos, capturas de tela e quadros de vídeo permanecem acessíveis mesmo com o preço do nível Flash. Por aproximadamente US$ 0,03 por milhão de tokens de entrada no nível básico, é um dos modelos multimodais de contexto de 1M mais baratos disponíveis, tornando-o uma escolha natural para classificação, extração, roteamento, sumarização, agentes leves e qualquer pipeline executado em volume muito alto. Ele suporta modo de raciocínio, chamada nativa de ferramentas, saídas estruturadas via response_format e os controles de amostragem usuais (temperature / top_p / seed / logprobs). Observe que o preço é escalonado por comprimento do prompt: os custos aumentam acima de 32K e novamente acima de 256K tokens de entrada, portanto, agrupar requisições curtas é materialmente mais barato do que preencher as longas. Use o Flash como o cavalo de batalha de volume e escale para Qwen3.7-Plus ou Max quando uma tarefa realmente precisar de mais capacidade.

ctx1M tokens
Saída máx.65K
Entradatext + image + video
Saídatext
p50 TTFT2.83 s
ENTRADA$0.03/ 1M tokens
SAÍDA$0.13/ 1M tokens
p50 TTFT2.83 s7 d
p95 TTFT9.64 s7 d
TRÁFEGO13.5Mtokens / 7 d

Qwen3.7 Flash é um modelo de linguagem multimodal criado pela equipe Qwen e disponibilizado por meio do OrcaRouter. Ele processa entradas de texto, imagem e vídeo e suporta uma janela de contexto de…

O que é o Qwen3.7 Flash e quem deve usá-lo?

Quais modalidades de entrada o Qwen3.7 Flash suporta?

Qual é o tamanho da janela de contexto do Qwen3.7 Flash?

Como o Qwen3.7 Flash é acessado através do OrcaRouter?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.7-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • include_reasoning
  • logprobs
  • max_tokens
  • presence_penalty
  • reasoning
  • response_format
  • seed
  • temperature
  • tool_choice
  • tools
  • top_logprobs
  • top_p

Preços

NívelEntrada / 1M tokensSaída / 1M tokensLeitura de cache / 1MEscrita de cache / 1M
32K$0.030$0.130$0.0060$0.038
256K$0.100$0.400$0.020$0.125
$0.200$0.800$0.040$0.250
Nível selecionado pela contagem de tokens de entrada de cada solicitação

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $0.600 · Com cache de prompt $0.516

Estimativa com base no preço de tabela

Preços por níveis — esta estimativa usa as tarifas do nível base.

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.000065

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
2.83 s
Velocidade de saída
333 tok/s
p95 TTFT
9.64 s
Taxa de erro
0%

Benchmarks públicos

Fonte: Design Arena

Atividade da comunidade

Do que os desenvolvedores estão falando esta semana

Hacker News0 menções · 7 d

Comparativo

Qwen3.7 Flashqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Entrada $/M$0.03$0.86$0.17$0.12
Saída $/M$0.13$3.44$1.03$0.69
Contexto1.0M262K33K1.0M
Qualidade7/108/108/108/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Quanto custa o Qwen3.7 Flash no OrcaRouter?
Não há preços específicos para o Qwen3.7 Flash fornecidos nos fatos disponíveis. O OrcaRouter geralmente cobra por token para entrada e saída. Como um modelo Flash, é provável que tenha um preço mais baixo do que os modelos principais. Visite a página de preços do OrcaRouter ou entre em contato com o suporte para obter tarifas atuais.
Qual é o tamanho da janela de contexto do Qwen3.7 Flash?
A janela de contexto é de 1,000,000 tokens. Isso permite que o modelo processe documentos muito longos, conversas extensas ou grandes conjuntos de imagens/vídeos em um único prompt.
Quais são os pontos fortes do Qwen3.7 Flash?
Suas vantagens incluem um contexto de 1 milhão de tokens, suporte a entrada multimodal (texto, imagem, vídeo), máximo de 65 mil tokens de saída e uma arquitetura 'Flash' otimizada que equilibra velocidade e custo. É bem adequada para análise de documentos longos e compreensão multimodal.
Como o Qwen3.7 Flash se compara ao GPT-4o-mini?
O Qwen3.7 Flash oferece uma janela de contexto significativamente maior (1M vs. 128k) e saída máxima mais alta (65k vs. 16k). O GPT-4o-mini pode ter um suporte mais amplo de ecossistema. Nem preços nem benchmarks são fornecidos para comparação direta.
O OrcaRouter armazena prompts em cache para reduzir custos?
OrcaRouter pode oferecer cache de prompt, mas sua política específica para Qwen3.7 Flash não está detalhada nos fatos. Verifique a documentação do OrcaRouter para indicadores de cache hit e informações de desconto.
Como faço para chamar Qwen3.7 Flash usando uma API compatível com OpenAI?
Defina a URL base para https://api.orcarouter.ai/v1 e use o ID do modelo "qwen/qwen3.7-flash". Inclua sua chave de API do OrcaRouter. O endpoint de chat completions funciona com parâmetros padrão do OpenAI. Para entrada multimodal, adicione objetos de imagem ou vídeo no array de conteúdo da mensagem.
Quais modalidades de entrada o Qwen3.7 Flash suporta?
Suporta entradas de texto, imagem e vídeo. Isso permite tarefas como analisar imagens junto com texto, resumir vídeos e combinar múltiplos tipos de mídia em um único prompt.
Posso ajustar o Qwen3.7 Flash com meus próprios dados?
Os fatos disponíveis não mencionam capacidades de ajuste fino. Como um modelo acessado por API através do OrcaRouter, o ajuste fino provavelmente não é suportado. Para ajuste fino personalizado, considere alternativas de código aberto.
Qual é o comprimento máximo de saída do Qwen3.7 Flash?
A saída máxima é de 65.536 tokens. Isso permite a geração de respostas, relatórios ou códigos muito longos em uma única chamada de API.
Como lidar com entradas de vídeo com o Qwen3.7 Flash?
Detalhes específicos de manipulação de vídeo não são fornecidos. Normalmente, as entradas de vídeo são processadas como sequências de quadros. Você pode precisar pré-processar vídeos em uma série de imagens e passá-las como URLs de imagem ou dados base64. Consulte a documentação do OrcaRouter para obter a formatação exata.

Incorporar este selo

Qwen: Qwen3.7 Flash$0.03/M in2828ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.7-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg" alt="Qwen: Qwen3.7 Flash no OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3.7 Flash](https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.7-flash)

Ficha do modelo como dados

GET /api/public/models/qwen/qwen3.7-flashAbrir
Legível por máquina:/llms.txt/llms-full.txt