Snapshot de 2 de setembro de 2026 do Qwen3.8 Max, o principal modelo de raciocínio multimodal da Alibaba: entrada de texto + imagem + vídeo, saída de texto, contexto de 1M tokens. Mesmas capacidades e preços do modelo base; fixe-o para comportamento reproduzível.
Qwen3.8 Max (0902) is a model entry on OrcaRouter from provider qwen, published with the model ID qwen/qwen3.8-max-0902. The notation 0902 is shown in the listing, but the supplied facts do not…
O modelo suporta uma janela de contexto de 1.000.000 de tokens. Esse é o total de entrada que o modelo pode processar em uma única solicitação, incluindo o conteúdo de texto, imagem e vídeo no prompt. Nenhum limite adicional é informado nos dados, portanto, os limites práticos dependem de como o OrcaRouter e o provedor impõem a tokenização e os tempos limite de solicitação. Para textos longos, 1.000.000 de tokens permite que muitos documentos extensos sejam incluídos em um único prompt, reduzindo a necessidade de dividir ou resumir antes de chamar o modelo. Para vídeo, os dados não informam quantos tokens são consumidos por segundo, por quadro ou por arquivo de vídeo, então você deve estimar com base em metadados ou em chamadas de teste. Também é importante lembrar que o tamanho da janela de contexto não indica o quão preciso o modelo é em um prompt de 1.000.000 de tokens; nenhum dado de benchmark é fornecido. Se a sua aplicação exigir qualidade exata em contextos longos, avalie com uma amostra dos seus próprios documentos antes de colocar em produção.
Com texto, imagem e vídeo aceitos como entradas, o modelo pode ser solicitado a raciocinar sobre material de origem que combina esses tipos na mesma solicitação. Exemplos incluem ler instruções em texto, examinar uma imagem e recorrer a um vídeo ao produzir uma resposta. A ficha técnica do provedor não lista capacidades específicas de tarefas, como OCR, detecção de objetos ou raciocínio temporal de vídeo; portanto, esses comportamentos não devem ser assumidos. O que se pode esperar do modelo depende principalmente de suas habilidades treinadas, que não estão documentadas nas informações fornecidas. A opção segura é usá-lo para tarefas que exigem uma saída de texto a partir de um prompt de modalidade mista e que possam tolerar o custo de armazenar imagens e vídeo como tokens de entrada. Se uma carga de trabalho for somente texto, outro modelo sem entrada de imagem e vídeo pode ser mais simples. Se uma tarefa exigir operações exatas de vídeo em nível de timestamp, a ficha do modelo não fornece evidências de que esse comportamento seja confiável.
Escolher um modelo mais barato faz sentido quando a tarefa não exige os recursos que definem esta listagem. Uma pergunta de texto curto não precisa de um contexto de 1.000.000 de tokens nem de um limite máximo de saída de 131.072 tokens. Um fluxo de trabalho somente com texto não precisa de entrada de imagem ou vídeo. A OrcaRouter cobra por este modelo US$ 2,00 por 1.000.000 de tokens de entrada e US$ 6,00 por 1.000.000 de tokens de saída. Se uma alternativa mais barata tiver preços por token mais baixos e suporte adequado de contexto e modalidade, ela reduzirá o custo. Não há benchmarks de qualidade ou velocidade nos fatos fornecidos, portanto escolher este modelo em vez de outros modelos não pode ser justificado por precisão medida; deve ser justificado por requisitos explícitos do produto: contexto grande, entrada mista de texto/imagem/vídeo ou saída longa em uma única geração. Como o preço de entrada se aplica a todos os tokens do contexto, chamadas com contexto muito grande podem custar mais do que chamadas menores, mesmo quando a pergunta do usuário é curta; portanto, evite preencher os prompts com conteúdo desnecessário.
As informações do modelo fornecidas para o Qwen3.8 Max (0902) não incluem pontuações de benchmark, conjuntos de avaliação ou números de acurácia. Por esse motivo, qualquer afirmação sobre a qualidade do modelo seria especulação, e o OrcaRouter não publica pontuações inferidas. Se você precisar de um número para comparar candidatos, execute seus próprios testes em entradas representativas, incluindo os casos de imagem e vídeo que você espera enviar. Um benchmark como um teste público de conhecimento não lhe diria quão bem o modelo lida com um prompt de vídeo específico de 1.000.000 de tokens. Tenha em mente que um nome de modelo como Max é um rótulo, não evidência de qualidade. As características mensuráveis nesta listagem são a janela de contexto, o comprimento máximo de saída, as modalidades de entrada e o preço. Esses atributos determinam se uma carga de trabalho é compatível, mas não descrevem acurácia, profundidade de raciocínio, seguimento de instruções nem comportamento de segurança. Trate a capacidade nessas áreas como não verificada, a menos que você realize uma avaliação.
Os fatos do modelo não fornecem taxas de tokens por segundo, números de tempo até o primeiro token, orientação de tempo limite de solicitação ou qualquer outra medição de desempenho. A OrcaRouter não declara um valor de latência para este modelo de provedor. A velocidade dependerá da infraestrutura de serviço do provedor, do tamanho da entrada e da quantidade de saída solicitada. Uma entrada de 1.000.000 de tokens e uma saída de 131.072 tokens provavelmente levarão mais tempo do que uma solicitação curta, mas a listagem não fornece uma relação exata. A entrada de vídeo também pode piorar a latência, pois precisa ser processada em tokens antes que o modelo possa processá-la; os fatos não quantificam essa etapa. Os revisores não devem presumir que um preço baixo por token implica decodificação rápida. A única decisão relacionada à velocidade suportada pelos fatos é testar tamanhos de solicitação representativos sob sua carga esperada. Não infira adequação em tempo real com base no tamanho da janela de contexto ou no nome do modelo.
Os pontos fortes declarados são estruturais. O modelo possui uma janela de contexto de 1.000.000 de tokens, um elevado limite máximo de saída de 131.072 tokens e aceita entradas de texto, imagem e vídeo. Esses recursos são úteis para aplicações que precisam de uma única chamada do modelo para observar um grande ou variado conjunto de material antes de escrever uma resposta longa. As limitações também são mais fáceis de declarar a partir dos fatos do que os pontos fortes. Não há benchmarks de qualidade publicados, portanto, precisão, raciocínio e segurança não estão documentados. Não há uma listagem separada para os dados de treinamento, notas de versão ou metodologia de atualização por trás do rótulo 0902. A entrada de imagem e vídeo não garante compreensão visual ou temporal exata. Os limites de contexto e de saída são máximos, não são recomendações de uso; saídas muito grandes podem ser caras, a US$ 6,00 por 1.000.000 de tokens de saída. Uma solicitação que preenche o contexto de 1.000.000 tokens consumiria US$ 2,00 em tokens de entrada antes que qualquer saída seja gerada, o que representa um custo operacional significativo.
Os preços unitários listados são de $2.00 para cada 1,000,000 de tokens de entrada e $6.00 para cada 1,000,000 de tokens de saída. O OrcaRouter cobra o modelo pela taxa do provedor, sem nenhum markup; portanto, o preço informado é a taxa do provedor repassada integralmente. Os tokens de entrada incluem os tokens de texto, imagem e vídeo enviados no prompt. Os tokens de saída são os tokens de resposta gerados. Com essas taxas, 1,000,000 de tokens de entrada custam $2.00, e 1,000,000 de tokens de saída custam $6.00. Uma solicitação menor custa proporcionalmente menos: 100,000 tokens de entrada custariam $0.20, e 100,000 tokens de saída custariam $0.60, desde que esses valores sejam medidos pelo provedor. A ficha do modelo não inclui preços separados para entrada em cache, solicitações em lote ou camadas interativas; portanto, não se deve presumir a existência de tais preços. As contagens exatas de tokens cobrados devem ser verificadas na resposta de uso do OrcaRouter ou nos logs de cada chamada.
Quando a OrcaRouter afirma que um modelo é cobrado à taxa do provedor com margem zero, isso significa que a OrcaRouter não está adicionando sua própria taxa por token sobre a taxa do provedor para esta listagem. O valor final pelo uso de tokens deve, portanto, ser baseado nos preços declarados de US$ 2,00 por 1.000.000 de tokens de entrada e US$ 6,00 por 1.000.000 de tokens de saída. Isso não significa necessariamente que a fatura final não tenha outros encargos; impostos ou taxas em nível de conta podem ser aplicados dependendo do seu acordo, mas nenhuma dessas taxas está documentada nesses fatos. Também não significa que o modelo seja gratuito para servir, pois a taxa por token ainda se aplica. Ao comparar provedores, o preço exibido pela OrcaRouter para este modelo deve representar as mesmas unidades desta listagem. Se um gateway diferente apresentar outro preço, a diferença está na estrutura de cobrança, não em uma alteração na janela de contexto do modelo.
O gerenciamento de custos deve começar pelo comprimento do prompt. Como a entrada custa $2.00 por 1,000,000 de tokens, cada token adicional aumenta o custo de entrada, e cada imagem ou vídeo enviado em uma solicitação é convertido em tokens usando regras não fornecidas nesta listagem. Remover material de origem irrelevante pode reduzir o custo. A saída custa três vezes o preço unitário da entrada, portanto limitar o comprimento da saída solicitada também controla o custo. Um modelo com limite de saída de 131,072 tokens pode gerar respostas que custam dinheiro; a $6.00 por 1,000,000 de tokens, 131,072 tokens de saída custariam cerca de $0.79 apenas em tokens de saída. Gerar essa quantidade de tokens não é automático, porque o prompt controla o tamanho da resposta. Não há preço de cache publicado para este modelo, portanto não presuma que contextos repetidos recebem desconto. A ausência de preços de cache ou de lote nos dados não é prova de que tais opções não existem; isso simplesmente significa que elas não fazem parte desta listagem.
Qwen3.8 Max (0902) é exposto por meio da API compatível com OpenAI do OrcaRouter. Defina a URL base do cliente como https://api.orcarouter.ai/v1 e use o ID exato do modelo qwen/qwen3.8-max-0902. Com um SDK compatível com OpenAI, a estrutura da solicitação é basicamente a mesma de qualquer chamada de chat-completions: passe uma chave de API para o OrcaRouter, a URL base acima e o ID do modelo no corpo da requisição. Não use um nome genérico como Qwen3.8 Max ou qwen3.8; a listagem exige qwen/qwen3.8-max-0902. O mesmo ID de modelo deve ser usado em solicitações HTTP diretas à URL base, onde o caminho (path) e o payload seguem o contrato compatível com OpenAI exposto pelo OrcaRouter. Por ser compatível com OpenAI, o código existente escrito para chat completions da OpenAI normalmente pode ser migrado alterando os parâmetros base_url e model, embora os detalhes de autenticação devam atender aos requisitos do OrcaRouter.
For an OpenAI-compatible chat completion, parameters such as model, messages, and output token limit are handled like other compatible models. The facts give a maximum output of 131,072 tokens, so if you set an output limit, it should be no higher than 131,072; the default output limit is not stated in the facts. Temperature, top-p, stop, and other sampling parameters are not documented in the supplied model facts, so follow OrcaRouter's API documentation and standard OpenAI parameter semantics. For image and video input, use the multimodal content format expected by OrcaRouter's API; the facts do not provide a sample. If the API returns an error about unsupported parameter names, check whether your SDK is sending legacy parameters. The context window is 1,000,000 tokens, so the prompt must keep all input tokens, including image and video tokens, below that limit. Responses count separately against the 131,072-token maximum.
Como o OrcaRouter oferece uma API compatível com OpenAI em https://api.orcarouter.ai/v1, a migração é principalmente uma mudança de configuração. Substitua a URL base por https://api.orcarouter.ai/v1, substitua o campo da chave de API por uma chave da OrcaRouter e defina o modelo como qwen/qwen3.8-max-0902. Se o seu código utiliza uma biblioteca de cliente compatível com OpenAI, atualize o base_url e a api_key do cliente e mantenha a maioria das estruturas de mensagem intactas, supondo que o formato multimodal corresponda a este modelo. As especificações do modelo não indicam se ele suporta todos os parâmetros específicos da OpenAI; portanto, antes de migrar, revise os parâmetros que o seu aplicativo envia. Além disso, como o limite de contexto é de 1.000.000 e a saída máxima é de 131.072, ajuste a lógica de truncamento de requisições para esses limites. Qualquer código existente que tenha codificado de forma fixa um comprimento máximo de contexto diferente pode precisar ser atualizado. Por fim, confirme se as expectativas de tratamento de dados do seu aplicativo estão alinhadas com os termos da OrcaRouter, pois as próprias especificações do modelo não abordam a retenção de dados.
A principal base de comparação é o contrato de entrada. O Qwen3.8 Max (0902) aceita texto, imagem e vídeo, portanto, uma alternativa somente de texto eliminaria essas modalidades. Se a sua carga de trabalho real contém apenas texto, um modelo somente de texto com contexto suficientemente grande provavelmente é um ajuste mais direto e pode ter preços diferentes. Os fatos do modelo não incluem comparações de precisão ou velocidade com qualquer outro modelo, portanto, você não pode escolher com base em pontuações públicas de qualidade. Você pode comparar atributos estruturais: uma alternativa somente de texto pode ter um contexto menor, um limite de saída mais curto ou um preço de entrada mais baixo. A OrcaRouter cobra por este modelo $2,00 na entrada e $6,00 na saída por 1.000.000 de tokens. O fato de ter entrada de imagem e vídeo é útil apenas se essas entradas forem utilizadas. Se essas entradas não forem utilizadas, você pode estar pagando por capacidade multimodal que é irrelevante para a tarefa.
Escolha o Qwen3.8 Max (0902) quando o perfil da tarefa corresponder aos recursos listados. Primeiro, você precisa de um contexto de 1.000.000 de tokens porque o material de origem não pode ser encurtado para caber em uma janela menor. Segundo, você precisa de entrada de imagem e vídeo no mesmo prompt, ou espera essas modalidades em solicitações futuras. Terceiro, você deseja um máximo de saída de até 131.072 tokens. Se sua carga de trabalho não tiver nenhum desses requisitos, muitos dos benefícios desta listagem não serão utilizados. Não a escolha porque o nome Max parece forte; a listagem não contém evidências de benchmark. Como o OrcaRouter expõe os modelos por meio da mesma API compatível com OpenAI, trocar os IDs dos modelos é fácil, então você pode testar este modelo contra outro candidato em sua própria tarefa. Lembre-se apenas de que os preços de entrada e saída diferem, e nenhum preço de cache é especificado para este modelo.
Ao comparar custos, primeiro normalize para a mesma base de tokens. Este modelo usa US$ 2,00 por 1.000.000 de tokens de entrada e US$ 6,00 por 1.000.000 de tokens de saída, repassados do provedor sem margem de lucro. Um modelo concorrente com preço por token de entrada mais baixo pode, na prática, ser mais barato para uma solicitação de contexto completo, mas a janela de contexto e a saída máxima também devem ser consideradas. Por exemplo, uma solicitação de 1.000.000 de tokens pode usar o contexto completo deste modelo em uma única chamada; um modelo com janela de contexto de 200.000 tokens exigiria várias chamadas, e as passagens adicionais de saída ou resumo podem alterar o preço total. Os fatos fornecidos não apresentam valores objetivos de precisão ou latência, portanto, qualquer comparação de custo por resposta correta deve vir dos seus próprios testes. Verifique também se um modelo concorrente cobra separadamente por tokens de imagem ou vídeo, pois isso não está descrito aqui. Em caso de dúvida, execute uma carga de trabalho típica no OrcaRouter e compare o uso medido de tokens e a qualidade das respostas, em vez de confiar apenas nos preços de tabela.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrada / 1M tokens | $2.00 |
| Saída / 1M tokens | $6.00 |
| Leitura de cache / 1M | $0.250 |
| Escrita de cache / 1M | $2.50 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/qwen/qwen3.8-max-0902Abrir @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902