Qwen 3.7 Flash: Modelo de Visão Cent-Cheap da Alibaba para Agentes que Realmente Olham para Telas
Guides & Insights

Qwen 3.7 Flash: Modelo de Visão Cent-Cheap da Alibaba para Agentes que Realmente Olham para Telas

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A equipe Qwen da Alibaba passou os últimos dois anos lançando um portfólio denso de modelos em praticamente todos os níveis de preço e capacidade imagináveis, e em 27 de julho de 2026, outro modelo chegou discretamente como uma listagem de API comercial: qwen/qwen3.7-flash. Ele não chegou com a pompa de um lançamento flagship, e a Alibaba não publicou um relatório técnico, suíte de benchmarks ou diagrama de arquitetura para ele. O que ele trouxe foi uma descrição que importa muito mais para desenvolvedores do que mais uma pontuação de leaderboard: um modelo de raciocínio visão-linguagem, uma janela de contexto de 1 milhão de tokens e um preço tão baixo que mal aparece como item de linha.

Essa combinação — barato, contexto enorme e "enxerga" imagens nativamente — coloca o Qwen 3.7 Flash diretamente em uma categoria que se tornou uma das mais competitivas e mais úteis em todo o mercado de modelos: o burro de carga multimodal de baixo custo. Esses não são os modelos que vencem tabelas de benchmark. Eles são os modelos que são chamados dez milhões de vezes por dia dentro de loops de agentes, pipelines de automação de navegadores e ferramentas de suporte, porque a $0,03 de entrada e $0,13 de saída por milhão de tokens, o custo basicamente deixa de ser uma restrição de design.

Esta peça é um guia de primeira análise: {{1}}o que o Qwen 3.7 Flash realmente é{{/1}}, {{2}}o que a Alibaba divulgou (e, principalmente, o que não divulgou){{/2}}, como a economia se desenrola com a matemática real de tokens e onde ele se encaixa ao lado do restante da família Qwen — incluindo o muito maior Qwen 3.8 e o Qwen 3.7 Max — e contra rivais multimodais baratos como o Gemini 3.5 Flash-Lite. Também vamos percorrer como uma camada de roteamento como o OrcaRouter trata um modelo assim: não como um modelo herói, mas como um nível padrão que absorve silenciosamente a maior parte do tráfego multimodal.

TL;DR

O Qwen 3.7 Flash é um modelo de visão-linguagem da equipe Qwen da Alibaba, listado sob o ID de modelo qwen/qwen3.7-flash desde 27 de julho de 2026. Foi construído para agentes multimodais, codificação visual, busca e interação com computador/interface de usuário, com alegados pontos fortes em reconhecimento de objetos e compreensão espacial. Ele suporta uma janela de contexto de 1.000.000 de tokens e tem preço de US$ 0,03 por 1M de tokens de entrada e US$ 0,13 por 1M de tokens de saída — entre os modelos com capacidade de visão mais baratos disponíveis em qualquer lugar. O comprimento máximo de saída, a contagem exata de parâmetros e a arquitetura não são divulgados oficialmente; a especulação da comunidade aponta para um pequeno design de mistura de especialistas e um possível precursor de um lançamento do Qwen 3.7 de pesos abertos, mas isso não é confirmado. É um modelo distinto, menor e mais barato em relação tanto ao Qwen 3.8 (o carro-chefe de pesos abertos com 2,4T de parâmetros anunciado separadamente pela Alibaba) quanto ao Qwen 3.7 Max (o carro-chefe maior desta mesma geração). Nenhum conjunto de benchmarks independente — incluindo o Artificial Analysis — o avaliou ainda, portanto trate as alegações de qualidade como prematuras e não comprovadas até que existam números de terceiros.

Principais conclusões

• Qwen 3.7 Flash é visão-linguagem, não apenas texto — é posicionado para agentes multimodais, codificação visual, busca e tarefas de uso de computador, não para chat geral.

• O preço é de $0.03/1M de tokens de entrada e $0.13/1M de tokens de saída, aproximadamente alinhado com o nível mais barato de modelos multimodais próximos da fronteira disponíveis no mercado atualmente.

• A janela de contexto é de 1 milhão de tokens, o que importa mais para sessões de agente com muitas imagens e várias interações do que parece, já que imagens e capturas de tela consomem tokens rapidamente.

As notas de preço do anúncio afirmam que, com cache de prompt em contexto repetido, o custo efetivo pode ficar 60-80% abaixo do preço de tabela — uma alavanca significativa para loops de agentes que repetem o mesmo prompt de sistema ou histórico de capturas de tela.

• A Alibaba não publicou o número máximo de tokens de saída, a contagem de parâmetros ou detalhes de arquitetura; qualquer coisa mais específica que você ler em outro lugar é inferência da comunidade, não divulgação do fornecedor.

• Não é o Qwen 3.8 (o carro-chefe de pesos abertos de 2,4T) nem o Qwen 3.7 Max (o carro-chefe fechado maior na mesma onda de lançamento) — apesar da semelhança nos nomes, esses são três modelos diferentes com três funções diferentes.

• Nenhuma organização independente de benchmark, incluindo a Artificial Analysis, publicou pontuações para o Qwen 3.7 Flash até o momento desta redação — a qualidade é genuinamente não comprovada fora da descrição do fornecedor.

O que Qwen 3.7 Flash realmente é

Deixando de lado a convenção de nomenclatura, o Qwen 3.7 Flash é a resposta da Alibaba para uma pergunta que todos os grandes laboratórios já fizeram: como é um modelo quando seu briefing inteiro é "lidar com tráfego visual, agentivo e de alto volume da forma mais barata possível sem ser inútil"? O Google respondeu com as camadas Gemini Flash e Flash-Lite. A OpenAI respondeu com suas linhas mini e nano. A resposta da Alibaba, nesta geração, é o Qwen 3.7 Flash.

A descrição oficial gira em torno de quatro casos de uso: agentes multimodais, codificação visual, busca e interação com computador ou interface do usuário. Essa é uma lista muito intencional. Não é "ótimo para escrita criativa" ou "raciocínio forte em problemas de olimpíada de matemática" — é uma lista de tarefas em que o modelo precisa olhar para uma captura de tela, uma página web, um pedaço de interface ou uma diferença de código renderizada visualmente, e então agir com base nisso. A Alibaba também destaca o reconhecimento de objetos e a compreensão espacial como pontos fortes específicos, o que está alinhado com o enquadramento de uso do computador e interação com interface: um agente que vai clicar em botões, ler layouts ou navegar por uma tela precisa saber onde as coisas estão, não apenas o que elas dizem.

Vale a pena ser explícito sobre o que "raciocínio" significa neste contexto. O Qwen 3.7 Flash é descrito como um modelo de raciocínio visão-linguagem, o que significa que se espera que ele resolva tarefas visuais de múltiplas etapas, em vez de apenas legendar uma imagem ou responder a uma única pergunta de consulta. Essa é a diferença entre "descreva esta captura de tela" e "aqui está uma captura de tela de um formulário com três erros de validação — descubra o que está errado e me diga qual campo corrigir primeiro."

Especificações e o Foco Multimodal-Agente

Aqui está a lista completa do que está realmente confirmado, versus o que não está.

Confirmado:O fabricante é a equipe Qwen da Alibaba. Está listado sob o ID de modelo qwen/qwen3.7-flash, disponível desde 27 de julho de 2026. Aceita entrada multimodal (visão e linguagem). A janela de contexto é de 1.000.000 de tokens. O preço é de US$ 0,03 por 1M de tokens de entrada e US$ 0,13 por 1M de tokens de saída. As notas de preço da própria listagem indicam que o cache de prompts em contexto repetido pode reduzir o custo efetivo em 60-80% em relação ao preço de tabela para cargas de trabalho que reutilizam as mesmas instruções de sistema ou imagens de referência entre chamadas — um detalhe que importa muito para loops de agentes que reenviam o mesmo histórico de capturas de tela ou esquema de ferramentas a cada turno.

Não divulgado: Limite máximo de tokens de saída. Número exato de parâmetros. Arquitetura (densa vs. mistura de especialistas). Composição dos dados de treinamento. Quaisquer pontuações de benchmark próprias.

Especulação da comunidade (identifique-a como tal, porque é só isso que é): Dado o nome "Flash", o preço agressivo e o padrão que a Alibaba seguiu com gerações anteriores do Qwen, alguns observadores suspeitam que o Qwen 3.7 Flash utiliza uma arquitetura small mixture-of-experts otimizada para baixo custo computacional por token, e que pode ser uma prévia ou etapa de destilação antes de um eventual lançamento do Qwen 3.7 com pesos abertos, espelhando como variantes anteriores do Qwen "flash" ou "turbo" às vezes precederam lançamentos abertos mais amplos. Nada disso é confirmado pela Alibaba. Trate isso como um palpite fundamentado, não como fato, até que um relatório técnico oficial ou ficha do modelo diga o contrário.

A ausência de um valor máximo de saída publicado merece atenção para quem está desenvolvendo com este modelo: se o seu caso de uso produz saídas estruturadas longas (grandes cargas de JSON, geração de código com múltiplos arquivos, transcrições longas), teste o teto real de saída empiricamente antes de se comprometer com ele em produção, já que você não pode consultar a documentação para um número que não está lá.

Exemplo Prático de Precificação: Quanto Isso Realmente Custa

Números tão pequenos são fáceis de ignorar, então vamos fazer a aritmética corretamente.

A $0.03 por 1M de tokens de entrada e $0.13 por 1M de tokens de saída, uma única chamada com 2,000 tokens de entrada (uma captura de tela de tamanho decente mais uma instrução curta) e 300 tokens de saída (uma resposta estruturada) custa: 2,000/1,000,000 × $0.03 = $0.00006 para entrada, mais 300/1,000,000 × $0.13 = $0.000039 para saída. Total: aproximadamente $0.0001 por chamada — um centésimo de centavo.

Escalone isso para volume. Execute 1 milhão dessas chamadas — uma carga diária plausível para um produto agêntico de médio porte que faz análise de capturas de tela ou verificações de estado de UI — e você chega a: 1.000.000 × 2.000 = 2 bilhões de tokens de entrada × US$ 0,03/1M = US$ 60, mais 1.000.000 × 300 = 300 milhões de tokens de saída × US$ 0,13/1M = US$ 39. Total: cerca de US$ 99 por um milhão de chamadas de agente de visão. Mesmo antes de adicionar cache de prompt (que as notas da listagem sugerem poder reduzir isso em 60-80% para cargas de trabalho com contexto repetido), é um número que a maioria das equipes pode aprovar sem reunião de orçamento.

Agora compare um cenário mais pesado: um agente de uso de computador que mantém um contexto contínuo de 50.000 tokens (capturas de tela, histórico de ações, resultados de ferramentas) e gera 500 tokens de ação por etapa, executado 100.000 vezes por dia. Custo de entrada: 100.000 × 50.000 = 5 bilhões de tokens × $0,03/1M = $150/dia. Custo de saída: 100.000 × 500 = 50 milhões de tokens × $0,13/1M = $6,50/dia. Isso é aproximadamente $156/dia, ou cerca de $4.700/mês, para uma carga de trabalho agêntica de contexto longo bastante agressiva — e isso antes de qualquer desconto de cache nas partes repetidas desse contexto de 50K, que em um loop de uso de computador (mesmo prompt do sistema, mesmas definições de ferramentas, estado de tela sobreposto) é exatamente o tipo de carga de trabalho para o qual o prompt caching foi criado.

Walkthroughs de Cenários do Mundo Real

Tarefas de visão de alto volume

Imagine um pipeline de catalogação de produtos que precisa classificar, etiquetar e extrair atributos de algumas centenas de milhares de imagens de produtos por dia — este é exatamente o tipo de carga de trabalho onde o custo por token se multiplica rápido o suficiente para quebrar um orçamento em um modelo de visão de nível médio, mas permanece confortavelmente acessível com o preço do Qwen 3.7 Flash. Reconhecimento de objetos e compreensão espacial, as duas capacidades que a Alibaba menciona explicitamente, mapeiam diretamente para "o que está nesta imagem, onde está e em que condição está?"

Codificação Visual

"Codificação visual" como um caso de uso nomeado sugere fluxos de trabalho como: alimentar o modelo com uma captura de tela de uma interface renderizada mais o código do componente subjacente, e pedir que ele identifique a incompatibilidade, ou pegar uma exportação do Figma e obter uma implementação de primeira passagem. Esta é uma categoria de tarefa que especificamente penaliza modelos de código apenas de texto — você pode descrever um bug de layout em palavras, mas um modelo que realmente possa ver o padding quebrado ou o botão desalinhado diagnosticará mais rápido e de forma mais confiável.

Agente / Uso de Computador

Este é o caso de uso principal. Um agente de uso computacional precisa olhar para uma tela, entender o que é clicável, decidir uma ação e repetir — muitas vezes por dezenas de passos por tarefa. A economia aqui é brutal para modelos caros: uma tarefa de automação de navegador ou desktop com 30 passos, cada passo carregando uma nova captura de tela, pode acumular centenas de milhares de tokens antes que a tarefa seja concluída. Nos preços de modelos de fronteira, isso é dinheiro de verdade por tarefa; nos preços do Qwen 3.7 Flash, executar milhares dessas sessões por dia permanece dentro do orçamento de uma pequena equipe.

Pesquisa visual — combinar uma imagem contra um corpus, verificar que um resultado recuperado realmente corresponde a uma foto de referência, ou fundamentar uma consulta de pesquisa em uma captura de tela do que o usuário está vendo — se beneficia da mesma combinação de grande contexto (para conter múltiplas imagens candidatas ou um longo conjunto de documentos recuperados) e baixo custo por chamada (porque loops de pesquisa e verificação geralmente significam muitas chamadas de modelo por consulta de usuário, não apenas uma).

Como Acessar e Usar o Qwen 3.7 Flash

O Qwen 3.7 Flash é chamado com o identificador de modelo qwen/qwen3.7-flash, e funciona com qualquer ferramenta compatível com OpenAI — o que significa que integrações existentes no estilo chat-completions ou responses podem apontar para ele com uma mudança no nome do modelo e sem reescrever o código do cliente. É também aqui que uma camada de roteamento como a OrcaRouter se torna prática em vez de teórica: em vez de codificar um único modelo em cada serviço, um endpoint unificado compatível com OpenAI permite definir um modelo multimodal barato e capaz como sua camada padrão para tráfego de visão e agentes, e reservar modelos de raciocínio mais caros para o subconjunto de solicitações que realmente precisam deles. Para um modelo cuja proposta de valor inteira é "muito barato, bastante capaz, não comprovado na fronteira", esse tipo de roteamento em camadas — barato por padrão, escalar quando necessário — é, sem dúvida, a forma correta de implantá-lo em produção em vez de apostar todo um pipeline em um único modelo não verificado.

A formatação padrão de solicitações multimodais se aplica: entradas de imagem junto com texto na mesma mensagem, janelas de contexto amplas para sessões com múltiplas imagens ou múltiplas etapas, e cobrança por token que aparece claramente nos painéis de uso. Teste o limite prático de comprimento de saída para sua carga de trabalho antes de depender dele, já que o máximo não é publicado.

Limitações Honestas e o que não está Confirmado

Para ser direto sobre o que é genuinamente desconhecido aqui: não há dados de benchmark independentes sobre o Qwen 3.7 Flash da Artificial Analysis ou de qualquer avaliador comparável até o momento. Tudo sobre sua qualidade — quão bem ele realmente se sai em raciocínio visual, quão confiável é para tarefas agentivas de múltiplas etapas, como ele se comporta diante de distratores em cenários de contexto longo — é atualmente suportado apenas pela própria linguagem de posicionamento da Alibaba, não por um terceiro executando-o em um conjunto de testes padronizado. A descrição do fornecedor e a verificação independente não são a mesma coisa, e os leitores devem ponderar as capacidades deste modelo de acordo até que essa verificação exista.

Além dos benchmarks, a Alibaba não divulgou a arquitetura, a contagem de parâmetros ou o comprimento máximo de saída. A teoria de "MoE pequeno, possível precursor de um Qwen 3.7 de pesos abertos" que circula na comunidade é um palpite razoável baseado em padrões de nomenclatura e preços, mas é especulação, não algo que a Alibaba tenha confirmado. Se a transparência do modelo (arquitetura publicada, pesos abertos, um relatório técnico) é um requisito para o seu caso de uso, o Qwen 3.7 Flash atualmente não atende a esse critério — é um modelo fechado, apenas via API, com documentação pública mínima além da sua listagem na API.

Comparação: Qwen 3.8, Qwen 3.7 Max e Rivais Baratos

A nomenclatura aqui confunde as pessoas, então vale a pena ser preciso. Qwen 3.8 é o carro-chefe de pesos abertos anunciado separadamente pela Alibaba, supostamente construído em torno de um design de 2,4 trilhões de parâmetros — um modelo fundamentalmente diferente com um propósito diferente: um modelo grande, aberto e de propósito geral destinado a competir na vanguarda, não um nível barato de utilidade multimodal. Qwen 3.7 Max é o carro-chefe fechado maior e presumivelmente mais capaz dentro desta mesma onda de lançamento "3.7" — o modelo que você usaria quando uma tarefa exige qualidade máxima independentemente do custo. Qwen 3.7 Flash, o assunto deste artigo, é o terceiro e mais barato ponto nessa constelação: menor, mais rápido, dramaticamente mais barato e focado especificamente em cargas de trabalho multimodais-agênticas em vez de excelência de propósito geral. Não presuma que a capacidade ou o comportamento se transferem entre esses três só porque dois deles compartilham um número de versão — são modelos diferentes com trabalhos diferentes.

Em comparação com a concorrência externa, a comparação mais próxima é o da Google Gemini 3.5 Flash-Lite, que ocupa um nicho semelhante: uma camada de baixo custo, multimodal e de alto rendimento, projetada exatamente para o tipo de cargas de trabalho em volume descritas acima. Ambos os modelos competem principalmente nos mesmos eixos — preço por token, comprimento de contexto e manipulação multimodal — em vez de em benchmarks de raciocínio puro, já que nenhum deles é posicionado como um modelo de raciocínio de fronteira. Sem dados de benchmark independentes para o Qwen 3.7 Flash, uma alegação de qualidade comparativa frente ao Gemini 3.5 Flash-Lite não é algo que este artigo possa fazer de forma responsável; o que se pode dizer é que o preço do Qwen 3.7 Flash é competitivo com ou abaixo dessa camada, e sua janela de contexto de 1M é generosa para um modelo nessa faixa de custo, que é exatamente o tipo de lacuna que torna as camadas multimodais baratas dignas de teste empírico contra sua própria carga de trabalho, em vez de escolher apenas com base no preço.

Perguntas Frequentes

O que é o Qwen 3.7 Flash?

É um modelo de raciocínio visão-linguagem da equipe Qwen da Alibaba, construído para agentes multimodais, codificação visual, pesquisa e interação com computador/interface de usuário, listado sob o ID de modelo qwen/qwen3.7-flash desde 27 de julho de 2026.

Quanto custa o Qwen 3.7 Flash?

US$ 0,03 por 1 milhão de tokens de entrada e US$ 0,13 por 1 milhão de tokens de saída — entre os modelos com capacidade de visão mais baratos atualmente disponíveis, com a listagem indicando que descontos adicionais de 60-80% são possíveis por meio de cache de prompt em contexto repetido.

O que é a janela de contexto?

1.000.000 tokens.

O Qwen 3.7 Flash é o mesmo que o Qwen 3.8?

Não. O Qwen 3.8 é o modelo principal de peso aberto com 2,4 trilhões de parâmetros anunciado separadamente pela Alibaba. O Qwen 3.7 Flash é um modelo multimodal fechado, muito menor e mais barato, com um propósito diferente. Eles não devem ser confundidos, embora ambos sejam da linha Qwen da Alibaba.

O Qwen 3.7 Flash é o mesmo que Qwen 3.7 Max?

Não. O Qwen 3.7 Max é o modelo flagship maior na mesma onda de lançamento "3.7". O Qwen 3.7 Flash é o nível menor, mais rápido e muito mais barato, voltado para tarefas multimodais e agentivas de alto volume, em vez de saída de máxima qualidade.

O Qwen 3.7 Flash suporta imagens?

Sim, é um modelo de visão-linguagem — ele aceita entrada multimodal (imagem e texto) e é especificamente posicionado em torno de tarefas visuais como reconhecimento de objetos, compreensão espacial, codificação visual e interação computador/UI.

Qual é o comprimento máximo de saída?

Não divulgado oficialmente pela Alibaba. Quem estiver desenvolvendo uma carga de trabalho de produção deve testar o teto prático de saída diretamente, em vez de assumir um número.

Qwen 3.7 Flash é um modelo de mistura de especialistas?

Não confirmado. Alguns na comunidade especulam que ele usa uma pequena arquitetura MoE com base em seu padrão de preços e nomenclatura, mas a Alibaba não publicou detalhes da arquitetura, então isso permanece especulação, não fato.

Como isso se compara ao Gemini 3.5 Flash-Lite?

Ambas ocupam um nível multimodal semelhante de baixo custo e alto rendimento e competem principalmente em preço e comprimento de contexto, em vez de benchmarks de raciocínio bruto. Ainda não há dados independentes de benchmark para fazer uma comparação definitiva de qualidade para o Qwen 3.7 Flash.

Onde posso acessar o Qwen 3.7 Flash?

Usando o ID do modelo qwen/qwen3.7-flash via qualquer cliente compatível com OpenAI, ou através de uma camada de roteamento como OrcaRouter que pode defini-lo como uma camada multimodal barata padrão junto com outros modelos.

O Qwen 3.7 Flash é bom?

Não comprovado independentemente até o momento desta redação — nenhuma organização de benchmarking de terceiros, incluindo a Artificial Analysis, publicou pontuações para ele. Sua proposta de valor é preço e tamanho do contexto, não uma vantagem de qualidade demonstrada, então vale a pena testá-lo empiricamente contra sua carga de trabalho específica antes de se comprometer.

Resultado final

O Qwen 3.7 Flash não está tentando vencer um ranking, e a Alibaba não forneceu a documentação para ninguém verificar, mesmo que quisesse. O que ele tenta fazer é tornar cargas de trabalho de visão e agente — análise de capturas de tela, verificações visuais de código, loops de uso de computador, pesquisa visual — baratas o suficiente para que o custo deixe de ser o motivo pelo qual você não implementa o recurso. A US$ 0,03/US$ 0,13 por milhão de tokens, com um contexto de 1 milhão de tokens, a economia realmente suporta tráfego multimodal de agente em alto volume e sempre ativo, de uma forma que poucos modelos, em qualquer nível de qualidade, conseguem igualar. A ressalva é a honestidade sobre as lacunas: nenhum benchmark independente, nenhuma arquitetura ou comprimento máximo de saída divulgados, e uma incerteza real sobre como ele se sai contra rivais estabelecidos de baixo custo, como o Gemini 3.5 Flash-Lite. Trate-o como um padrão promissor e extremamente acessível para cargas de trabalho multimodais de agente que vale a pena testar agora — e mantenha-o claramente separado em sua mente tanto do Qwen 3.8 quanto do Qwen 3.7 Max, que são modelos diferentes resolvendo problemas completamente diferentes.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente