Instantánea con fecha del 2 de septiembre de 2026 de Qwen3.8 Max, el modelo insignia de razonamiento multimodal de Alibaba: texto + imagen + video como entrada, texto como salida, contexto de 1M de tokens. Mismas capacidades y precios que el modelo base; fíjala para obtener un comportamiento reproducible.
Qwen3.8 Max (0902) es una entrada de modelo en OrcaRouter del proveedor qwen, publicada con el ID de modelo qwen/qwen3.8-max-0902. La notación 0902 aparece en el listado, pero los datos…
El modelo admite una ventana de contexto de 1.000.000 de tokens. Esa es la cantidad total de entrada a la que el modelo puede atender en una sola solicitud, incluido el contenido de texto, imagen y video del prompt. No se indica ningún límite adicional en los datos, por lo que los límites prácticos dependen de cómo OrcaRouter y el proveedor aplican la tokenización y los tiempos de espera de las solicitudes. Para texto largo, 1.000.000 de tokens permite incluir muchos documentos extensos en un solo prompt, lo que reduce la necesidad de fragmentar o resumir antes de llamar al modelo. Para video, los datos no especifican cuántos tokens se consumen por segundo, por fotograma o por archivo de video, por lo que debe estimarlo a partir de los metadatos o de llamadas de prueba. También es importante recordar que el tamaño de la ventana de contexto no indica cuán preciso es el modelo con un prompt de 1.000.000 de tokens; no se proporcionan datos de evaluación comparativa. Si su aplicación necesita una calidad exacta de contexto largo, evalúe con una muestra de sus propios documentos antes de implementarla en producción.
Con texto, imagen y video aceptados como entradas, se le puede pedir al modelo que razone sobre material fuente que combine esos tipos en la misma solicitud. Los ejemplos incluyen leer instrucciones en texto, examinar una imagen y consultar un video al producir una respuesta. La hoja de datos del proveedor no lista capacidades específicas de tareas como OCR, detección de objetos o razonamiento temporal de video, por lo que no se deben asumir esos comportamientos. Lo que se puede esperar del modelo depende principalmente de sus habilidades entrenadas, que no están documentadas en los datos proporcionados. El diseño seguro es usarlo para tareas que requieran una salida de texto a partir de un mensaje de modalidad mixta y que puedan tolerar el costo de almacenar imágenes y video como tokens de entrada. Si una carga de trabajo es solo de texto, otro modelo sin entrada de imagen y video podría ser más simple. Si una tarea necesita operaciones de video precisas a nivel de marca de tiempo, la tarjeta del modelo no da evidencia de si tal comportamiento es confiable.
Elegir un modelo más económico tiene sentido cuando la tarea no requiere las funciones que definen este listado. Una pregunta de texto corto no necesita un contexto de 1,000,000 de tokens ni un límite de salida de 131,072 tokens. Un flujo de trabajo solo de texto no necesita entrada de imágenes ni vídeo. OrcaRouter factura este modelo a $2.00 por cada 1,000,000 de tokens de entrada y $6.00 por cada 1,000,000 de tokens de salida. Si una alternativa más barata tiene precios por token más bajos y soporte adecuado de contexto y modalidad, reducirá el costo. No hay puntos de referencia de calidad o velocidad en los hechos proporcionados, por lo que elegir este modelo sobre otros no puede justificarse por una precisión medida; debe justificarse por requisitos explícitos del producto: contexto amplio, entrada mixta de texto/imagen/vídeo o salida larga en una sola generación. Dado que el precio de entrada se aplica a cada token del contexto, las llamadas con contextos muy grandes pueden costar más que las llamadas más pequeñas incluso cuando la pregunta del usuario es corta, así que evita rellenar las indicaciones.
Los datos del modelo proporcionados para Qwen3.8 Max (0902) no incluyen puntuaciones de referencia, conjuntos de evaluación ni cifras de precisión. Por ese motivo, cualquier afirmación sobre la calidad del modelo sería especulación, y OrcaRouter no publica puntuaciones inferidas. Si necesita una cifra para comparar candidatos, ejecute sus propias pruebas con entradas representativas, incluidos los casos de imagen y video que espera enviar. Una referencia como una prueba de conocimiento pública no le indicaría qué tan bien maneja el modelo un prompt de video específico de 1,000,000 de tokens. Tenga en cuenta que un nombre de modelo como Max es una etiqueta, no evidencia de calidad. Los aspectos medibles en este listado son la ventana de contexto, la longitud máxima de salida, las modalidades de entrada y el precio. Esos atributos afectan si una carga de trabajo encaja, pero no describen precisión, profundidad de razonamiento, seguimiento de instrucciones ni comportamiento de seguridad. Considere que la capacidad en esas áreas no está verificada a menos que usted realice una evaluación.
Los datos del modelo no proporcionan tasas de tokens por segundo, cifras de tiempo hasta el primer token, orientación sobre tiempos de espera de solicitudes ni ninguna otra medición de rendimiento. OrcaRouter no declara una cifra de latencia para este modelo de proveedor. La velocidad dependerá de la infraestructura de servicio del proveedor, del tamaño de la entrada y de la cantidad de salida solicitada. Una entrada de 1,000,000 de tokens y una salida de 131,072 tokens probablemente tarden más que una solicitud corta, pero el listado no ofrece ninguna relación exacta. La entrada de video también puede aumentar la latencia, ya que debe procesarse en tokens antes de que el modelo pueda atenderla; los datos no cuantifican ese paso. Los revisores no deben asumir que un precio bajo por token implica una decodificación rápida. La única decisión relacionada con la velocidad respaldada por los datos es probar tamaños de solicitud representativos bajo su carga esperada. No infiera la idoneidad en tiempo real a partir del tamaño de la ventana de contexto ni del nombre del modelo.
Las fortalezas declaradas son estructurales. El modelo tiene una ventana de contexto de 1,000,000 de tokens, un elevado máximo de salida de 131,072 tokens, y acepta entradas de texto, imagen y video. Estas son útiles para aplicaciones que necesitan una sola llamada al modelo para observar un cuerpo de material grande o mixto antes de escribir una respuesta larga. Las limitaciones también son más fáciles de exponer a partir de los hechos que las fortalezas. No hay puntos de referencia de calidad publicados, por lo que la precisión, el razonamiento y la seguridad no están documentados. No hay una lista separada para los datos de entrenamiento, las notas de la versión o la metodología de actualización detrás de la etiqueta 0902. La entrada de imágenes y videos no garantiza una comprensión visual o temporal exacta. Los límites de contexto y de salida son máximos, no un uso recomendado; las salidas muy grandes pueden ser costosas a $6.00 por 1,000,000 de tokens de salida. Una solicitud que llene el contexto de 1,000,000 de tokens consumiría $2.00 en tokens de entrada antes de que se genere cualquier salida, lo que supone un costo operativo significativo.
Los precios unitarios indicados son de $2.00 por cada 1,000,000 de tokens de entrada y $6.00 por cada 1,000,000 de tokens de salida. OrcaRouter factura el modelo a la tarifa del proveedor sin margen adicional, por lo que el precio indicado es la tarifa del proveedor transmitida directamente. Los tokens de entrada incluyen los tokens de texto, imagen y video enviados en el prompt. Los tokens de salida son los tokens de respuesta generados. A estas tarifas, 1,000,000 de tokens de entrada cuestan $2.00; 1,000,000 de tokens de salida cuestan $6.00. Una solicitud más pequeña cuesta proporcionalmente menos: 100,000 tokens de entrada serían $0.20 y 100,000 tokens de salida serían $0.60, siempre que esas cantidades sean medidas por el proveedor. La tarjeta del modelo no incluye precios separados para entrada en caché, solicitudes por lotes o niveles interactivos, por lo que no se debe asumir tales precios. Los recuentos exactos de tokens facturados deben verificarse en la respuesta de uso o en los registros de OrcaRouter para cada llamada.
Cuando OrcaRouter indica que un modelo se factura a la tarifa del proveedor sin margen de beneficio, significa que OrcaRouter no añade su propia comisión por token además de la tarifa del proveedor para este listado. Por lo tanto, el importe final por el uso de tokens debe basarse en los precios indicados de $2.00 por entrada y $6.00 por salida por cada 1,000,000 de tokens. Eso no significa necesariamente que la factura final no incluya otros cargos; es posible que se apliquen impuestos o comisiones a nivel de cuenta según tu acuerdo, pero en estos datos no se documenta ninguna comisión de ese tipo. Tampoco significa que el modelo sea gratuito de servir, porque la tarifa por token sigue aplicándose. Al comparar proveedores, el precio que OrcaRouter muestra para este modelo debería representar las mismas unidades que este listado. Si otra pasarela cotiza otro precio, la diferencia es la estructura de facturación, no un cambio en la ventana de contexto del modelo.
La gestión de costos debe comenzar con la longitud del prompt. Dado que la entrada cuesta $2.00 por cada 1,000,000 de tokens, cada token adicional incrementa el cargo de entrada, y cada imagen o video enviado en una solicitud se convierte en tokens usando reglas no proporcionadas en este listado. Recortar material de origen irrelevante puede reducir el costo. La salida cuesta tres veces el precio unitario de la entrada, por lo que limitar la longitud de la salida solicitada también controla el costo. Un modelo con un límite de salida de 131,072 tokens puede generar respuestas que cuestan dinero; a $6.00 por cada 1,000,000 de tokens, 131,072 tokens de salida costarían alrededor de $0.79 solo en tokens de salida. Generar esa cantidad de tokens no es automático, porque el prompt controla el tamaño de la respuesta. No hay un precio de caché publicado para este modelo, así que no asuma que el contexto repetido recibe un descuento. La ausencia de precios de caché o de procesamiento por lotes en la información no es prueba de que tales opciones no existan; simplemente significa que no forman parte de este listado.
Qwen3.8 Max (0902) se expone a través de la API compatible con OpenAI de OrcaRouter. Configura la URL base del cliente en https://api.orcarouter.ai/v1 y usa el ID de modelo exacto qwen/qwen3.8-max-0902. Con un SDK compatible con OpenAI, la estructura de la solicitud es básicamente la misma que en cualquier llamada de chat-completions: pasa una clave de API para OrcaRouter, la URL base indicada arriba y el ID de modelo en el cuerpo. No uses un nombre genérico como Qwen3.8 Max o qwen3.8; el listado requiere qwen/qwen3.8-max-0902. El mismo ID de modelo se debe usar en las solicitudes HTTP directas a la URL base, donde la ruta y el payload siguen el contrato compatible con OpenAI expuesto por OrcaRouter. Debido a que es compatible con OpenAI, el código existente escrito para chat completions de OpenAI normalmente se puede migrar cambiando los parámetros base_url y model, aunque los detalles de autenticación deben cumplir los requisitos de OrcaRouter.
Para una finalización de chat compatible con OpenAI, parámetros como model, messages y el límite de tokens de salida se manejan igual que en otros modelos compatibles. Los datos indican un máximo de salida de 131 072 tokens, por lo que si estableces un límite de salida, no debe superar los 131 072; el límite de salida predeterminado no se indica en los datos. La temperatura, top-p, stop y otros parámetros de muestreo no están documentados en los datos del modelo proporcionados, así que sigue la documentación de la API de OrcaRouter y la semántica estándar de los parámetros de OpenAI. Para entrada de imágenes y vídeo, usa el formato de contenido multimodal que espera la API de OrcaRouter; los datos no proporcionan un ejemplo. Si la API devuelve un error sobre nombres de parámetros no admitidos, comprueba si tu SDK está enviando parámetros heredados. La ventana de contexto es de 1 000 000 de tokens, por lo que el prompt debe mantener todos los tokens de entrada, incluidos los tokens de imagen y vídeo, por debajo de ese límite. Las respuestas se cuentan por separado contra el máximo de 131 072 tokens.
Dado que OrcaRouter ofrece una API compatible con OpenAI en https://api.orcarouter.ai/v1, la migración es principalmente un cambio de configuración. Reemplace la URL base por https://api.orcarouter.ai/v1, reemplace el campo de clave de API por una clave de OrcaRouter, y establezca el modelo en qwen/qwen3.8-max-0902. Si su código utiliza una biblioteca cliente compatible con OpenAI, actualice el base_url y la api_key del cliente y mantenga intactas la mayoría de las estructuras de mensajes, asumiendo que el formato multimodal coincide con este modelo. Los hechos no indican si este modelo admite todos los parámetros específicos de OpenAI, por lo que antes de migrar, revise los parámetros que su aplicación envía. Además, dado que el límite de contexto es de 1.000.000 y la salida máxima es de 131.072, ajuste la lógica de truncamiento de solicitudes a esos límites. Cualquier código existente que tenga codificado un límite máximo de contexto diferente puede necesitar ser actualizado. Finalmente, confirme que las expectativas de manejo de datos de su aplicación se alinean con los términos de OrcaRouter, porque los hechos del modelo en sí no discuten la retención de datos.
El principal criterio de comparación son los tipos de entrada admitidos. Qwen3.8 Max (0902) acepta texto, imagen y video, por lo que una alternativa de solo texto eliminaría esas modalidades. Si su carga de trabajo real contiene solo texto, un modelo de solo texto con un contexto lo bastante amplio probablemente se ajuste mejor y puede tener un precio diferente. Los datos del modelo no incluyen comparaciones de precisión ni de velocidad con ningún otro modelo, por lo que no es posible elegir basándose en puntuaciones públicas de calidad. Se pueden comparar atributos estructurales: una alternativa de solo texto puede tener un contexto más pequeño, un límite de salida más corto o un precio de entrada más bajo. OrcaRouter factura este modelo a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. El hecho de que acepte entrada de imagen y video solo es útil si dichas entradas se utilizan. Si no se utilizan, es posible que se esté pagando por capacidad multimodal irrelevante para la tarea.
Elija Qwen3.8 Max (0902) cuando el perfil de la tarea coincida con las características enumeradas. Primero, necesita un contexto de 1,000,000 de tokens porque el material fuente no se puede acortar para caber en una ventana más pequeña. Segundo, necesita entrada de imagen y video en el mismo prompt, o espera esas modalidades en solicitudes futuras. Tercero, desea un máximo de salida de hasta 131,072 tokens. Si su carga de trabajo no tiene ninguno de esos requisitos, muchos de los beneficios de este listado no se utilizan. No lo elija porque el nombre Max parezca fuerte; el listado no contiene evidencia de benchmarks. Dado que OrcaRouter expone los modelos a través de la misma API compatible con OpenAI, intercambiar los ID de los modelos es fácil, por lo que puede probar este modelo contra otro candidato en su propia tarea. Solo recuerde que los precios de entrada y salida difieren, y no se especifica ningún precio de caché para este modelo.
Al comparar costos, primero normalice a la misma base de tokens. Este modelo usa $2.00 por 1,000,000 de tokens de entrada y $6.00 por 1,000,000 de tokens de salida, transmitidos del proveedor a margen cero. Un modelo competidor con un precio por token de entrada más bajo puede resultar más barato para una solicitud de contexto completo, pero también deben considerarse la ventana de contexto y la salida máxima. Por ejemplo, una solicitud de 1,000,000 de tokens puede usar el contexto completo de este modelo en una sola llamada; un modelo con una ventana de contexto de 200,000 tokens requeriría múltiples llamadas, y las pasadas adicionales de salida o resumen pueden cambiar el precio total. Los hechos proporcionados no ofrecen valores objetivos de precisión o latencia, por lo que cualquier comparación de costo por respuesta correcta debe basarse en sus propias pruebas. También verifique si un modelo competidor impone cargos separados por tokens de imagen o video, porque esos no se describen aquí. En caso de duda, ejecute una carga de trabajo típica en OrcaRouter y compare el uso de tokens medido y la calidad de respuesta en lugar de depender solo de los precios de lista.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrada / 1M tokens | $2.00 |
| Salida / 1M tokens | $6.00 |
| Lectura caché / 1M | $0.250 |
| Escritura caché / 1M | $2.50 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/qwen/qwen3.8-max-0902Abrir @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902