Qwen3-VL 8B Thinking — pequeño modelo de razonamiento de visión-lenguaje open-weight, 8B parámetros, contexto de 128k.
Qwen3 VL 8B Thinking es un modelo de lenguaje multimodal de 8 mil millones de parámetros desarrollado por el equipo Qwen de Alibaba Cloud, alojado en OrcaRouter bajo el proveedor qwen. Pertenece a la…
Qwen3 VL 8B Thinking sobresale en la respuesta a preguntas visuales, especialmente cuando la pregunta involucra múltiples objetos, relaciones espaciales o texto incrustado en imágenes (e.g., señales de tráfico, recibos). También puede manejar tareas de comprensión de video, como resumir un clip corto, identificar acciones o responder preguntas sobre marcas de tiempo específicas. El análisis de documentos es un caso de uso fuerte: extraer información de PDFs que contienen tanto texto como gráficos, o de formularios escaneados. Su ventana de contexto larga lo hace adecuado para procesar documentos grandes (e.g., PDFs de más de 100 páginas) con inserciones ocasionales de imágenes, siempre que la entrada tokenizada total se mantenga por debajo de 131K.
Si tu caso de uso es puramente textual y no involucra imágenes o video, es probable que un modelo exclusivamente de texto (por ejemplo, Qwen3-8B o una variante de Llama de tamaño similar) sea más rentable. Los modelos multimodales conllevan una sobrecarga adicional por la codificación de entradas visuales, y el precio por token de Qwen3 VL 8B Thinking ($0.18 por entrada, $2.10 por salida por millón de tokens) puede ser más alto que muchas alternativas solo de texto. Adicionalmente, si tu tarea es clasificación o extracción simple a partir de imágenes muy breves, un modelo más pequeño de visión y lenguaje con menor latencia y costo (por ejemplo, Qwen2 VL 2B) podría ser suficiente sin sacrificar rendimiento.
Sí, el modelo puede aceptar múltiples imágenes intercaladas con texto en una sola llamada a la API, siempre que el recuento total de tokens (tokens de imagen más tokens de texto) se mantenga dentro de la ventana de contexto de 131,072. Cada imagen se codifica en un número variable de tokens dependiendo de su resolución y complejidad. La API compatible con OpenAI de OrcaRouter permite enviar múltiples URL de imágenes o imágenes codificadas en base64 en el array de contenido. No hay un límite estricto en la cantidad de imágenes más allá de la restricción de contexto. Para video, normalmente extraerías fotogramas clave y los enviarías como imágenes separadas junto con un mensaje de texto.
Como todos los modelos multimodales, Qwen3 VL 8B Thinking puede alucinar detalles en imágenes o videos, especialmente con baja resolución o contenido ambiguo. No está diseñado para transmisión de video en tiempo real; procesa conjuntos estáticos de fotogramas. El tamaño de parámetro de 8B significa que puede ser menos preciso en dominios altamente especializados (p. ej., imágenes médicas, imágenes satelitales) que modelos más grandes (p. ej., modelos de lenguaje-visión de 70B-100B+). No admite entrada de audio. El proceso de pensamiento puede inflar la longitud de la salida, por lo tanto, presupuesta los tokens de salida en consecuencia. Finalmente, está optimizado para inglés pero puede manejar otros idiomas con una efectividad variable.
Las puntuaciones específicas de referencia para Qwen3 VL 8B Thinking en evaluaciones multimodales estándar (p. ej., MMMU, MathVista, VideoMME) no se han proporcionado en los hechos disponibles. Los usuarios deben consultar la tarjeta del modelo oficial de Qwen o el artículo de investigación para conocer los resultados publicados eventuales. En general, la serie Qwen3 VL ha demostrado un rendimiento competitivo en tareas de visión-lenguaje en comparación con otros modelos de parámetros 7B-8B. Se espera que la variante "Thinking" mejore los benchmarks que requieren mucho razonamiento, como la cadena de pensamiento visual. Sin puntuaciones públicas, es recomendable probar el modelo en su propio conjunto de datos representativo para evaluar su idoneidad.
Los datos de latencia para este modelo específico en la infraestructura de OrcaRouter no han sido divulgados. Como regla general, un modelo multimodal de 8B parámetros tendrá una latencia mayor que un modelo de texto puro del mismo tamaño debido a la codificación visual. La entrada de video aumenta aún más la latencia debido al procesamiento adicional de fotogramas. En clústeres de GPU de alto rendimiento (p. ej., A100, H100), el tiempo típico hasta el primer token para un modelo de 8B está en el rango de unos pocos cientos de milisegundos a unos pocos segundos, dependiendo de la longitud de la entrada y del tamaño del lote. La velocidad de generación de tokens de salida generalmente se mide en decenas de tokens por segundo. Estos valores son cualitativos; el rendimiento real depende del aprovisionamiento y la carga actuales de OrcaRouter.
Fortalezas: El modelo maneja contextos multimodales largos (131K tokens), permite salidas grandes (hasta 40K tokens) y procesa tres tipos de entrada. Su capacidad de razonamiento mejora el razonamiento en tareas que requieren deducción paso a paso. Tiene un precio competitivo para un modelo multimodal de 8B. Limitaciones: No ha sido evaluado comparativamente frente a los modelos frontier más recientes en muchos rankings públicos. Su rendimiento máximo de salida puede ser menor que el de modelos más pequeños. No está optimizado para la generación creativa de imágenes (solo genera texto). Los usuarios no deben asumir que no hay alucinaciones en tareas visuales. El procesamiento de video se limita a la extracción basada en fotogramas en lugar de análisis continuo.
Qwen3 VL 8B Thinking se factura por token a la tarifa del proveedor sin margen adicional. Los tokens de entrada cuestan $0.18 por cada 1 millón de tokens. Los tokens de salida cuestan $2.10 por cada 1 millón de tokens. No hay tarifa adicional por infraestructura, ni costo base por solicitud, ni suscripción mensual. El precio se aplica por igual a todas las modalidades de entrada (texto, imagen, video); cada modalidad se tokeniza y se cobra según la tarifa de entrada. OrcaRouter no cobra ninguna prima adicional sobre la tarifa indicada. Por ejemplo, procesar una imagen que se tokeniza en 2000 tokens de entrada costaría 2000 * ($0.18 / 1M) = $0.00036 en costo de entrada. El costo de salida se calcula de manera similar.
Cada imagen se codifica en un número variable de tokens según sus dimensiones y nivel de compresión. Las imágenes de alta resolución pueden consumir miles de tokens. El video se maneja extrayendo fotogramas (normalmente uno cada pocos segundos) y codificando cada fotograma como una imagen; por lo tanto, el costo en tokens escala linealmente con la duración del video y la frecuencia de fotogramas. Los usuarios pueden controlar el costo redimensionando las imágenes o reduciendo el número de fotogramas. No hay una tarifa separada por codificar contenido multimedia más allá del costo en tokens. El costo de salida depende únicamente del número de tokens de texto generados. Para videos largos, los tokens de entrada pueden acercarse rápidamente al límite de 131K, lo que aumenta el costo por solicitud.
Según la información proporcionada, no hay descuentos por uso por lotes ni compromisos prepagos. OrcaRouter actualmente no ofrece almacenamiento en caché de tokens que reduzca los costos de indicaciones o imágenes repetidas. Todas las solicitudes se facturan por token en tiempo real a la tarifa estándar. Si el proveedor (qwen) introduce precios escalonados con descuento en el futuro, OrcaRouter transmitirá esos ahorros sin margen adicional. Se recomienda a los usuarios monitorear la página de precios de OrcaRouter para conocer cualquier actualización. Para casos de uso de alto volumen, considere trabajar directamente con OrcaRouter para discutir posibles precios por volumen.
En comparación con modelos multimodales más grandes (por ejemplo, GPT-4V, Gemini 1.5 Pro), Qwen3 VL 8B Thinking es significativamente más barato por token: esos modelos suelen costar $2–$10+ por millón de tokens de entrada. Entre los modelos de visión-lenguaje con 7B-8B parámetros, está en línea con los precios típicos (Qwen2 VL 7B cuesta aproximadamente $0.10–$0.20 de entrada, $1–$2 de salida). El costo por token de salida ($2.10 por millón) es más alto que el de algunos modelos puros de texto de 8B (por ejemplo, $0.20 por millón de salida), lo que refleja la sobrecarga adicional de razonamiento. Si puedes usar un modelo más pequeño (por ejemplo, 2B–4B parámetros), los costos pueden ser 50–90% más bajos, pero con una capacidad reducida.
Usted llama a Qwen3 VL 8B Thinking enviando una solicitud POST al endpoint compatible con OpenAI de OrcaRouter en https://api.orcarouter.ai/v1/chat/completions. Establezca el parámetro model en "qwen/qwen3-vl-8b-thinking". Incluya su clave API en el encabezado Authorization como "Bearer <key>". El cuerpo de la solicitud sigue el esquema de completaciones de chat de OpenAI. Para entrada multimodal, estructure el contenido del mensaje como un arreglo de objetos: uno con type "text" para el prompt de texto, y uno con type "image_url" para cada imagen (con una URL o datos en base64). El video se puede enviar como múltiples entradas image_url que representan fotogramas. La respuesta sigue la estructura estándar de OpenAI con todo el texto generado en el arreglo choices.
Todos los parámetros estándar de finalización de chat de OpenAI son compatibles: temperature (0–2, predeterminado 1.0), top_p (0–1, predeterminado 1.0), max_tokens (hasta 40960), stop sequences, frequency_penalty, presence_penalty, logprobs y n (número de finalizaciones). ¿El modelo no admite streaming? OrcaRouter probablemente admite streaming cuando se establece streaming=true; consulte la documentación del proveedor. El parámetro tools (function calling) puede ser compatible si el proveedor subyacente lo habilita; actualmente no está garantizado. Se permite el system prompt. Se pueden pasar IDs de usuario para monitoreo. Asegúrese de mantenerse dentro de la ventana de contexto de 131072 tokens monitoreando el recuento de tokens antes de enviar.
Si actualmente estás utilizando el mismo modelo de un proveedor de API diferente (por ejemplo, directamente de Alibaba Cloud), la migración a OrcaRouter es sencilla: cambia la URL base a https://api.orcarouter.ai/v1, actualiza la cadena del modelo a "qwen/qwen3-vl-8b-thinking" y reemplaza la clave API por una clave API de OrcaRouter. No es necesario realizar otros cambios en el código porque OrcaRouter utiliza exactamente la misma interfaz compatible con OpenAI. Ten en cuenta que el uso de tokens y los precios se basarán en las tarifas de OrcaRouter (que se transmiten sin margen de beneficio). Es posible que debas ajustar tus herramientas de monitoreo de costos para reflejar los nuevos precios.
Streaming está disponible a través de la API de OrcaRouter. Establece el parámetro stream en true en tu solicitud. La respuesta será un flujo SSE (Server-Sent Events) con deltas de los tokens generados. Esto es útil para la visualización en tiempo real. Ten en cuenta que para la variante "Thinking", el proceso de razonamiento puede introducir retrasos más largos antes del primer token, pero el streaming seguirá enviando tokens incrementales a medida que se produzcan. El formato de streaming sigue la especificación de streaming de OpenAI, con eventos de tipo "chat.completion.chunk". Cada fragmento contiene un delta con el contenido o rol del token.
Qwen3 VL 8B Thinking es el sucesor de Qwen2 VL 7B, con aproximadamente el mismo número de parámetros (8B vs 7B) pero una arquitectura mejorada para contexto más largo (131K vs 32K para Qwen2 VL 7B). También añade la capacidad "Thinking" para razonamiento paso a paso, que no estaba presente en Qwen2 VL. La longitud máxima de salida ha aumentado de 2048 tokens (Qwen2 VL 7B) a 40960 tokens. El precio de Qwen3 VL 8B Thinking es ligeramente más alto por token que el de Qwen2 VL 7B (que cuesta aproximadamente $0.15 por entrada, $1.80 por salida por millón de tokens), lo que refleja las capacidades añadidas y el contexto más amplio. Los usuarios que actualicen deben esperar un mejor rendimiento en tareas de razonamiento complejas.
GPT-4o mini es un modelo multimodal insignia de OpenAI con una ventana de contexto de 128K. Tiene significativamente más parámetros (desconocido, pero estimado >70B) y generalmente logra mayor precisión en pruebas de referencia estándar. Sin embargo, Qwen3 VL 8B Thinking es sustancialmente más barato: GPT-4o mini cuesta $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida, lo que en realidad es más bajo que los $0.18 de entrada y $2.10 de salida de Qwen3? Espera, revisa: la entrada de GPT-4o mini es $0.15, la salida $0.60 — ¿más barato que Qwen3 VL 8B Thinking? En realidad, la salida es mucho más barata. Por lo tanto, el costo no es más bajo en todos los aspectos. Pero Qwen3 admite video y salidas más largas (40960 vs 16384 para GPT-4o mini). Las ventanas de contexto son similares. La elección depende de la precisión requerida y el presupuesto; Qwen3 es un nicho para salidas muy largas y despliegue de código abierto.
Llama 3.2 11B Vision es un modelo multimodal de 11B parámetros con una ventana de contexto de 128K y un máximo de 8K tokens de salida. Qwen3 VL 8B Thinking tiene un número menor de parámetros, pero una salida máxima mucho mayor (40960 frente a 8000) e incluye capacidades de razonamiento. Ambos admiten entrada de texto e imagen, pero Llama 3.2 11B no admite video de forma nativa. El precio de Llama a través de proveedores es similar, alrededor de $0.15–$0.20 de entrada y $0.60–$1.00 de salida por millón de tokens, lo que hace que Qwen3 sea más caro en la salida. Para tareas que requieren texto generado muy largo (p. ej., redacción de informes a partir de video), Qwen3 es más adecuado. Para tareas más cortas y sensibles al coste, Llama 3.2 11B puede preferirse.
Gemini 1.5 Flash es un modelo multimodal rápido y rentable con una ventana de contexto de 1M (hasta 2M), compatible con imágenes, video y audio. Es más barato que Qwen3 VL 8B Thinking (Gemini Flash cuesta $0.075 de entrada, $0.30 de salida por millón de tokens) y más rápido. Sin embargo, Qwen3 VL 8B Thinking ofrece un proceso de razonamiento que puede mejorar el razonamiento en tareas visuales desafiantes, y su salida máxima es mucho mayor (40K frente a 8K para Gemini Flash). Si su aplicación requiere razonamiento paso a paso y salidas largas, Qwen3 es una mejor opción. Para alto rendimiento y baja latencia, Gemini Flash suele ser superior. Además, Qwen3 puede ser preferido cuando la soberanía de datos requiere implementación autoalojada o independiente del proveedor.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Entrada / 1M tokens | $0.180 |
| Salida / 1M tokens | $2.10 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingAbrir @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking