Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisiónHerramientasJSONRazonamiento
por Qwen · 2025-10-14

Qwen3-VL 8B Thinking — pequeño modelo de razonamiento de visión-lenguaje open-weight, 8B parámetros, contexto de 128k.

ctx131.1K tokens
Salida máx.41K
Entradatext + image + video
Salidatext
p50 TTFT5.00 s
ENTRADA$0.18/ 1M tokens
SALIDA$2.10/ 1M tokens
p50 TTFT5.00 s7 d
p95 TTFT8.55 s7 d
TRÁFICO108.8Ktokens / 7 d

Qwen3 VL 8B Thinking es un modelo de lenguaje multimodal de 8 mil millones de parámetros desarrollado por el equipo Qwen de Alibaba Cloud, alojado en OrcaRouter bajo el proveedor qwen. Pertenece a la…

¿Qué es Qwen3 VL 8B Thinking?

¿Quién debería usar este modelo?

¿Qué modalidades soporta?

¿En qué se diferencia la variante 'Thinking' de la Qwen3 VL estándar?

Ejemplos de código

Llama desde cualquier SDK

Compatible con OpenAI: conserva tu SDK actual

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parámetros admitidos

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Precios

Entrada / 1M tokens$0.180
Salida / 1M tokens$2.10
MonedaUSD

Calculadora de costes

Tokens / mes10MM
Proporción de entrada70%%
Estimado / mes $7.56

Estimación según precio de lista

Estimador de tokens y coste

Tokens de entrada: 18Coste por solicitud: $0.001053

Solo una estimación: el número real de tokens depende del tokenizador del proveedor.

Rendimiento

p50 TTFT
5.00 s
Velocidad de salida
64.6 tok/s
p95 TTFT
8.55 s
Tasa de error
0%

Pruebas de referencia públicas

Fuente: Design Arena

Comparativa

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Entrada $/M$0.18$0.86$0.17$0.12
Salida $/M$2.10$3.44$1.03$0.69
Contexto131K262K33K1.0M
Calidad4/108/108/108/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

Preguntas frecuentes

¿Cuál es el costo por millón de tokens para Qwen3 VL 8B Thinking en OrcaRouter?
Tokens de entrada: $0.18 por 1 millón de tokens. Tokens de salida: $2.10 por 1 millón de tokens. Estas son las tarifas del proveedor transmitidas sin margen de beneficio adicional.
¿Cuál es la ventana de contexto y el número máximo de tokens de salida?
La ventana de contexto es de 131,072 tokens. El máximo de tokens de salida es de 40,960 tokens.
¿Cuáles son las principales fortalezas de este modelo?
Maneja tres modalidades de entrada (texto, imagen, video), ofrece un contexto amplio y una longitud de salida grande, e incluye una capacidad de pensamiento (cadena de pensamiento) que mejora el rendimiento en tareas complejas de razonamiento.
¿Cómo se compara este modelo con Qwen2 VL 7B?
Tiene un contexto más amplio (131K vs 32K), una salida máxima más grande (40K vs 2K) y añade capacidades de pensamiento. El precio es ligeramente más alto, pero ofrece un razonamiento mejorado y una comprensión multimodal.
¿OrcaRouter almacena en caché algún dato de usuario al usar este modelo?
OrcaRouter no informa de ningún mecanismo de almacenamiento en caché que guarde prompts o imágenes; el manejo de datos sigue las prácticas estándar de API. Consulte la política de privacidad de OrcaRouter para obtener más detalles.
¿Cómo llamo a este modelo a través de una API compatible con OpenAI?
Envía un POST a https://api.orcarouter.ai/v1/chat/completions con el modelo "qwen/qwen3-vl-8b-thinking" y tu clave API. Usa un array de contenido con entradas de texto y image_url para entrada multimodal.
¿Puede el modelo procesar entrada de video?
Sí, el video se acepta enviando fotogramas extraídos como entradas separadas de image_url. El modelo no tiene soporte nativo de códec de video; funciona en conjuntos de fotogramas estáticos.
¿Hay alguna restricción en el número de imágenes por solicitud?
No, excepto que el recuento total de tokens (incluyendo tokens de texto e imagen) debe estar dentro del límite de contexto de 131,072. No hay un límite de imagen separado.
¿Qué lenguajes de programación o librerías puedo usar para acceder a este modelo mediante OrcaRouter?
Cualquier lenguaje que admita solicitudes HTTP y el formato de la API de OpenAI. Python con la biblioteca openai, JavaScript con fetch, etc. Solo tienes que configurar la URL base y el ID del modelo.
Sí. La variante de pensamiento siempre devuelve un razonamiento encadenado (chain-of-thought), generando paso a paso el proceso lógico antes de proporcionar la respuesta final.
El modelo utiliza internamente un razonamiento paso a paso antes de generar la respuesta final, pero el resultado que ves es la respuesta completa. No puedes extraer los tokens de pensamiento intermedio por separado.

Insertar esta insignia

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50vía OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking en OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Ficha del modelo como datos

GET /api/public/models/qwen/qwen3-vl-8b-thinkingAbrir
Legible por máquina:/llms.txt/llms-full.txt