Qwen3.5 Flash — chat multimodal (texto/imagen/video) optimizado para costo, contexto de 1M.
Qwen3.5 Flash es un modelo de lenguaje multimodal de la familia Qwen, diseñado para inferencia rápida y bajo costo. Acepta entradas de texto, imagen y video, y genera respuestas de texto. Su ventana…
Qwen3.5 Flash acepta texto, imágenes (incluyendo múltiples imágenes por solicitud) y entradas de video. Para video, el modelo puede ingerir fotogramas o archivos de video completos hasta el límite de contexto. Procesa estas modalidades juntas en una sola llamada API, permitiendo tareas como describir una escena de video, responder preguntas sobre una imagen o combinar instrucciones de texto con contenido visual. La duración exacta del video compatible depende de la extracción de fotogramas y la asignación de tokens dentro de la ventana de contexto de 1M.
El modelo se destaca en tareas que requieren un amplio contexto y entrada multimodal. Algunos ejemplos incluyen resumir transcripciones de videos largos, extraer datos estructurados de documentos escaneados con imágenes y construir agentes conversacionales que hagan referencia al contexto visual. También es efectivo para el procesamiento por lotes de alto rendimiento, donde el bajo costo por token (especialmente de entrada) lo hace económico para millones de consultas. Para tareas simples de solo texto, un modelo más barato y exclusivamente textual puede ser aún más rentable.
Para tareas puramente basadas en texto que no requieren capacidad multimodal, un modelo más pequeño o solo de texto con precios más bajos puede ser más rentable. La fortaleza de Qwen3.5 Flash radica en sus capacidades multimodales y de contexto largo; si tu aplicación solo necesita completaciones de texto corto, modelos como text-davinci o variantes más pequeñas de Qwen pueden ahorrar dinero. Del mismo modo, si no necesitas el contexto completo de 1M, un modelo con una ventana más pequeña podría reducir la latencia y el costo.
La designación 'Flash' indica que este modelo intercambia algo de precisión en benchmarks por una inferencia más rápida y un menor costo computacional. En comparación con los modelos más grandes de Qwen (por ejemplo, Qwen3.5-72B), utiliza una arquitectura más eficiente con menos parámetros. Las puntuaciones de los benchmarks son publicadas por Qwen pero no se proporcionan en esta entrada del catálogo. En la práctica, rinde de manera competitiva en tareas de comprensión multimodal mientras mantiene una latencia más baja por solicitud, lo que lo hace adecuado para aplicaciones en tiempo real.
La latencia depende del tamaño de entrada, la longitud de salida y la carga del servidor. Debido a que Qwen3.5 Flash está diseñado para la velocidad, generalmente devuelve respuestas más rápido que modelos más grandes como Qwen3.5-72B para cantidades equivalentes de tokens. Las cifras exactas de tokens por segundo no se proporcionan en el catálogo. Los usuarios pueden probar el rendimiento a través del endpoint de OrcaRouter para medir la latencia real para su caso de uso específico. La ventana de contexto de 1M puede introducir sobrecarga de procesamiento para entradas muy largas.
Las fortalezas incluyen entrada multimodal, contexto muy grande, 65K tokens de salida y bajo costo por token. El modelo maneja bien documentos largos y videos. Limitaciones: no es el más preciso en tareas de razonamiento complejo o matemáticas en comparación con modelos frontera más grandes. También puede tener dificultades con instrucciones matizadas de múltiples pasos. Para tareas donde la calidad de salida de última generación es crítica, considere un modelo Qwen más grande o de clase GPT-4o. La arquitectura 'Flash' prioriza el rendimiento y el costo sobre la precisión máxima.
El precio es de $0.10 por 1 millón de tokens de entrada (tokens de texto, imagen o video) y $0.40 por 1 millón de tokens de salida. Estas tarifas se facturan según la tarifa del proveedor sin margen adicional por parte de OrcaRouter. No hay cargos adicionales por la puerta de enlace API. Este precio se transmite directamente, lo que significa que el usuario final paga lo mismo que si llamara a la propia API del proveedor, sin ningún recargo de OrcaRouter. El conteo de tokens sigue la tokenización estándar para cada modalidad.
El precio del token de entrada ($0.10/1M) es muy competitivo entre los modelos multimodales. Por ejemplo, muchos modelos multimodales grandes cobran $2-10 por millón de tokens de entrada. El precio de salida ($0.40/1M) también es bajo. Sin embargo, debido a que el modelo tiene una ventana de contexto de 1M, procesar entradas muy largas puede resultar en un costo total alto a pesar de la baja tarifa por token. Los usuarios deben equilibrar la longitud del contexto con la cantidad de solicitudes. Para entradas cortas, los modelos más pequeños pueden ofrecer un costo absoluto aún menor.
La entrada del catálogo no especifica si el almacenamiento en caché está disponible para Qwen3.5 Flash en OrcaRouter. Los usuarios deben consultar la documentación de OrcaRouter para obtener detalles sobre las funciones de almacenamiento en caché de prompts o respuestas. Si no se admite el almacenamiento en caché, las entradas idénticas repetidas incurrirán en costos completos de tokens cada vez. Para el procesamiento por lotes, considere desduplicar las entradas o usar un caché local para reducir las llamadas a la API. El precio se mantiene según las tarifas del proveedor sin recargo, independientemente del estado de almacenamiento en caché.
Usa el endpoint compatible con OpenAI en https://api.orcarouter.ai/v1. Establece el parámetro "model" como "qwen/qwen3.5-flash" en tu solicitud. Proporciona una clave de API de OrcaRouter. El formato de solicitud coincide con la API de chat completions de OpenAI, admitiendo roles (system, user, assistant) y contenido multimodal mediante el arreglo "content" con "type": "image_url" o "type": "text". Para video, es posible que necesites extraer fotogramas y pasarlos como imágenes. Consulta la documentación de OrcaRouter para conocer las pautas exactas de manejo de video.
Parámetros estándar compatibles con OpenAI: temperature, top_p, max_tokens (hasta 65536), secuencias de parada, presence_penalty, frequency_penalty y seed. El parámetro max_tokens tiene un límite máximo de 65536 para coincidir con la salida máxima del modelo. El modelo admite transmisión en streaming mediante stream: true. También puede establecer identificadores de usuario para el seguimiento. Para solicitudes multimodales, incluya el contenido de imagen o video dentro del mensaje del usuario. El modelo acepta hasta la ventana de contexto de 1,048,576 tokens en total en todas las interacciones.
Si ya usas el SDK de Python de OpenAI, cambia la base_url a https://api.orcarouter.ai/v1 y actualiza el nombre del modelo a "qwen/qwen3.5-flash". La autenticación utiliza una clave de API de OrcaRouter en lugar de una clave de OpenAI. Las estructuras de solicitud y respuesta son idénticas. Para la migración desde otros proveedores, utiliza el formato de chat completions. Asegúrate de que los prompts del sistema y el contenido multimodal estén formateados según las convenciones de OpenAI. No se requieren cambios en el código más allá del endpoint y el nombre del modelo.
Sí, la API de OrcaRouter admite mensajes de sistema, mensajes de usuario y mensajes de asistente en una conversación de múltiples turnos. El historial completo de la conversación cuenta en contra de la ventana de contexto de 1,048,576 tokens. El modelo procesa contenido multimodal en los mensajes de usuario. Para videos, puede enviar múltiples fotogramas como imágenes en un solo mensaje de usuario. El modelo mantiene el contexto a lo largo de los turnos, por lo que puede tener interacciones extendidas con historiales largos, siempre que el total de tokens se mantenga por debajo del límite.
Qwen3.5 Flash es una alternativa más pequeña, más rápida y más barata que modelos Qwen más grandes como Qwen3.5-72B o Qwen3.5-32B. Sacrifica algo de precisión en los benchmarks para obtener menor latencia y costo. Comparte el mismo soporte de entrada multimodal y gran ventana de contexto (1M) que sus hermanos mayores. Para tareas que requieren razonamiento de última generación, los modelos más grandes son preferibles. Para aplicaciones de alto volumen o tiempo real donde la velocidad y el costo importan más, Flash es la mejor opción.
GPT-4o ofrece mayor precisión en muchos benchmarks de razonamiento y multimodales, pero a un precio significativamente más alto (típicamente $2.50 por millón de tokens de entrada para GPT-4o y $0.15 para GPT-4o mini). Qwen3.5 Flash es más barato ($0.10 por entrada) y tiene una ventana de contexto más grande (1M vs 128K para GPT-4o). Su límite de tokens de salida (65K) también supera al de GPT-4o mini (16K). Para aplicaciones sensibles al costo con entradas muy largas, Qwen3.5 Flash puede ser más económico mientras sigue proporcionando una buena comprensión multimodal.
Claude 3 Haiku y Gemini 1.5 Flash son modelos 'flash' similares. Claude 3 Haiku es solo texto y tiene un precio de $0.25 por millón de tokens de entrada. Gemini 1.5 Flash admite entrada multimodal y tiene una ventana de contexto de 1M, con un precio de $0.075 por millón de tokens de entrada. El soporte multimodal de Qwen3.5 Flash y su contexto de 1M lo sitúan en un nivel similar, con un precio de salida ($0.40/1M) más alto que Gemini Flash ($0.30/1M) pero más bajo que Haiku ($1.25/1M). El rendimiento en los benchmarks varía según la tarea.
OrcaRouter aloja modelos de código abierto como Llama 3.1 8B y Mistral 7B. Qwen3.5 Flash es un modelo propietario, pero compite en costo y capacidad. Los modelos de código abierto suelen tener un costo por token menor o nulo (solo pagas por el cómputo), pero pueden requerir más trabajo de ingeniería para su configuración. Qwen3.5 Flash ofrece una API gestionada sin margen de beneficio, una ventana de contexto de 1M y soporte multimodal del que carecen la mayoría de los modelos de código abierto. Es un buen punto intermedio entre la flexibilidad del código abierto y la calidad del software propietario.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Entrada / 1M tokens | $0.100 |
| Salida / 1M tokens | $0.400 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/qwen/qwen3.5-flashAbrir @misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash