Qwen3-VL 235B-A22B Instruct — modelo de lenguaje y visión de pesos abiertos, 235B total / 22B parámetros activos, contexto de 256k, sin modo de pensamiento.
Qwen3 VL 235B A22B Instruct es una variante de lenguaje visual de la serie de modelos Qwen3, desarrollado por Alibaba Cloud. Utiliza un diseño de mezcla de expertos con 235 mil millones de parámetros…
El modelo sobresale en tareas donde las imágenes y el texto interactúan. Puede responder preguntas sobre el contenido de una imagen, describir escenas en detalle, leer texto de documentos o letreros, y razonar sobre las relaciones entre objetos en una imagen. También maneja múltiples imágenes en una sola conversación, lo que permite análisis comparativos o razonamiento secuencial. El ajuste por instrucciones permite que el modelo siga indicaciones multimodales complejas, como "Explica por qué este gráfico muestra una tendencia" o "Extrae todos los valores numéricos de esta tabla". Estas capacidades provienen del gran backbone MoE y del entrenamiento especializado en visión y lenguaje.
Al ser una variante Instruct, el modelo ha sido ajustado para seguir las instrucciones del usuario con alta fidelidad tanto en indicaciones solo de texto como multimodales. Puede manejar diálogos de múltiples turnos donde las imágenes se introducen de forma incremental, mantener el contexto a lo largo de varios intercambios y seguir instrucciones de formato (por ejemplo, salida como JSON, puntos de viñeta o paso a paso). Se desempeña bien en tareas que requieren adherencia a restricciones, como 'Responder solo si la imagen contiene un perro.' Esto lo hace adecuado para aplicaciones donde el comportamiento coherente y el seguimiento de reglas son importantes.
Para tareas exclusivamente de texto sin componente visual, el modelo MoE de 235B puede ser excesivo; modelos densos más pequeños u otras variantes de Qwen solo texto serían más rentables. De manera similar, si tus imágenes son simples (p. ej., logotipos básicos, objetos individuales) o necesitas un rendimiento extremadamente alto con un presupuesto limitado, un modelo de visión más pequeño como Qwen2-VL 7B podría ser suficiente. Este modelo se justifica más cuando necesitas manejar imágenes complejas y de alta resolución, documentos con texto denso o tareas que requieren un razonamiento multimodal profundo. En OrcaRouter, puedes comparar precios y cambiar de ID de modelo fácilmente.
No. Qwen3 VL 235B A22B Instruct es un modelo de generación de texto que acepta imágenes solo como entrada. No genera imágenes, audio ni ninguna otra modalidad. La salida siempre es una cadena de texto. Si necesitas generación de imágenes, deberías usar un modelo aparte. La fortaleza de este modelo radica en la comprensión y el razonamiento sobre la entrada visual. Por ejemplo, puede describir cómo se ve una imagen o responder preguntas sobre ella, pero no puede crear, editar ni transformar imágenes por sí mismo.
La puntuación MMLU-Pro reportada para este modelo es 82.3. MMLU-Pro es una versión mejorada del benchmark Massive Multitask Language Understanding, que abarca 57 materias en STEM, humanidades y ciencias sociales. Una puntuación de 82.3 indica un sólido conocimiento general y razonamiento en temas diversos. Es un agregado de un solo número; el rendimiento puede variar por materia. Esta puntuación sitúa al modelo entre los mejores de su clase de tamaño, especialmente considerando la arquitectura MoE que activa solo una fracción de sus parámetros totales por consulta.
Las fortalezas incluyen alta precisión en benchmarks de razonamiento multimodal, buen seguimiento de instrucciones y eficiencia de costos en relación con modelos densos de similar cantidad total de parámetros. El diseño MoE permite escalar la capacidad sin un costo computacional proporcional. Las limitaciones incluyen un costo absoluto más alto en comparación con modelos más pequeños, posible aumento de latencia debido al gran número de parámetros totales (aunque solo 22B están activos, el modelo completo debe cargarse en memoria). También puede alucinar ocasionalmente detalles finos en imágenes o fallar en entradas visuales muy ambiguas. No se garantiza el rendimiento en tareas de dominios específicos (por ejemplo, imágenes médicas).
La velocidad de inferencia depende del backend de hardware utilizado por OrcaRouter y de la carga actual. Al ser un modelo MoE con 235 mil millones de parámetros totales, requiere una cantidad significativa de memoria GPU, aunque solo se activen 22 mil millones de parámetros por token. Esto generalmente resulta en una latencia por solicitud más alta en comparación con modelos densos más pequeños (p. ej., parámetros 7B-70B). El rendimiento también se ve influenciado por el tamaño del lote y la longitud de la secuencia. Para aplicaciones sensibles a la latencia, considere utilizar un modelo más pequeño u optimizar para indicaciones más cortas. OrcaRouter no proporciona garantías de latencia específicas, pero busca una capacidad de respuesta de grado de producción.
OrcaRouter cobra exactamente la tarifa indicada por el proveedor: $0.40 por cada 1 millón de tokens de entrada y $1.60 por cada 1 millón de tokens de salida. No hay ningún margen adicional. Tanto los tokens de entrada como los de salida se cuentan según las reglas de tokenización de OpenAI, que pueden diferir ligeramente del tokenizador interno del modelo. Las imágenes también se facturan como tokens según sus dimensiones y nivel de detalle, siguiendo la política del proveedor. Puede estimar los costos multiplicando su uso esperado de tokens por estas tarifas.
El costo por token es más alto que el de modelos más pequeños o densos, pero la arquitectura MoE proporciona más capacidad por parámetro activo que un modelo denso de tamaño activo equivalente. Para tareas multimodales complejas, este modelo puede completar la tarea con menos tokens o con mayor precisión, lo que potencialmente reduce el gasto total. Sin embargo, para tareas simples, un modelo más barato reduciría los costos. En OrcaRouter, puedes cambiar de modelos sobre la marcha, lo que te permite usar este modelo solo cuando sea necesario. No hay compromisos mínimos mensuales ni tarifas ocultas.
OrcaRouter no divulga actualmente políticas específicas de almacenamiento en caché para este modelo. El proveedor subyacente puede aplicar almacenamiento en caché a nivel de token, pero no está garantizado. No se mencionan descuentos por volumen ni precios escalonados; las tarifas son planas por token. Para usuarios de alto volumen, puede valer la pena contactar al soporte de OrcaRouter para posibles acuerdos personalizados. En general, los precios son transparentes y basados en el uso.
Las imágenes se convierten en un recuento de tokens según su resolución y configuración de detalle. La fórmula exacta la define el proveedor (Qwen) y puede variar. Generalmente, las imágenes de mayor resolución consumen más tokens. OrcaRouter transmite la tokenización del proveedor sin alteraciones. Puedes controlar los costos redimensionando las imágenes o usando el modo de bajo detalle si el modelo lo admite. Siempre consulta la documentación del proveedor para el cálculo preciso de tokens de imagen. Los tokens de entrada para las imágenes se contabilizan dentro de la tarifa de $0.40 por millón.
Envías una solicitud POST a https://api.orcarouter.ai/v1/chat/completions con un payload JSON compatible con OpenAI. Establece el campo model en "qwen/qwen3-vl-235b-a22b-instruct". Incluye un array messages donde cada mensaje puede contener texto y/o contenido de imagen. Para las imágenes, usa el formato estándar de contenido de imagen de OpenAI (URL o base64). La autenticación se realiza mediante un token Bearer (tu clave API). Los parámetros de ejemplo: temperature, max_tokens, top_p y secuencias de stop funcionan de manera idéntica a la API de OpenAI. La documentación de OrcaRouter proporciona detalles completos.
Todos los parámetros estándar de finalización de chat son compatibles: temperature (0-2, predeterminado 1), top_p (0-1, predeterminado 1), max_tokens (número de tokens de salida), stop (lista de cadenas), presence_penalty, frequency_penalty y seed para reproducibilidad. El modelo también respeta los mensajes del sistema para configurar el comportamiento. Para solicitudes multimodales, se incluye una parte de imagen en el contenido de un mensaje de usuario. No hay parámetros específicos del modelo expuestos; la API se mantiene genérica para la compatibilidad. Si necesita controlar el enrutamiento MoE, esto se maneja internamente.
Sí. Debido a que OrcaRouter utiliza el formato de API de OpenAI, la migración es sencilla. Reemplace su URL base y ID de modelo existentes por el endpoint de OrcaRouter y "qwen/qwen3-vl-235b-a22b-instruct". Asegúrese de que su clave API sea válida y de que tenga suficientes créditos. El formato de mensaje para imágenes es idéntico al de OpenAI (usando el tipo de contenido 'image_url'). Es posible que deba ajustar las estimaciones de recuento de tokens debido a una tokenización diferente. No se requieren cambios en la lógica de su aplicación más allá del endpoint y el nombre del modelo.
Qwen3 VL 235B A22B Instruct y GPT-4V manejan entradas multimodales. Diferencias clave: Qwen3 VL usa MoE con 22B parámetros activos, mientras que GPT-4V es un modelo denso propietario de tamaño no revelado. El precio de Qwen3 VL a través de OrcaRouter es de $0.40/$1.60 por millón de tokens, significativamente menor que las tarifas típicas de GPT-4V. Los puntajes de referencia no son directamente comparables porque MMLU-Pro y otras pruebas usan subconjuntos diferentes. GPT-4V tiene un ecosistema más amplio, pero Qwen3 VL ofrece una ventaja de costo para cargas de trabajo multimodales de alto volumen en OrcaRouter.
Claude 3.5 Sonnet es un modelo denso de Anthropic con sólidas capacidades de texto y visión. No utiliza MoE, por lo que su capacidad total es menor que la del total de parámetros de Qwen3 VL, pero su capacidad activa por inferencia es superior a 22B. El precio de Claude 3.5 Sonnet es generalmente más alto por token (aproximadamente $3.00/$15.00 por millón de tokens). Qwen3 VL ofrece un costo mucho más bajo para tareas multimodales. Sin embargo, los modelos Claude tienen una ventana de contexto más grande (200K tokens). La elección depende del presupuesto, las necesidades de longitud de contexto y el proveedor preferido.
Es probable que OrcaRouter ofrezca otros modelos Qwen, como Qwen2.5 7B, Qwen2.5 72B o variantes Qwen2-VL. El Qwen3 VL 235B A22B Instruct es el modelo multimodal MoE más grande de la línea Qwen. En comparación con Qwen2-VL 72B, tiene más parámetros totales y una arquitectura MoE, lo que puede brindar un mejor rendimiento en tareas complejas mientras mantiene un costo de inferencia razonable. Es más caro por token que los modelos Qwen más pequeños, pero puede resultar rentable si reduce la necesidad de múltiples llamadas o un alto consumo de tokens.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Entrada / 1M tokens | $0.400 |
| Salida / 1M tokens | $1.60 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructAbrir @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct