Qwen3.5 122B-A10B — MoE multimodal (texto/imagen/video) de peso abierto, 122B total / 10B parámetros activos, contexto de 32k (modo de visión).
Qwen3.5-122B-A10B es un modelo de lenguaje grande de la serie Qwen de Alibaba Cloud. Utiliza una arquitectura de mezcla de expertos (MoE) donde solo se activan 10 mil millones de parámetros por paso…
Según sus arquitecturas y puntuación de referencia, Qwen3.5-122B-A10B sobresale en tareas que implican razonamiento de múltiples pasos, uso de herramientas y seguimiento de instrucciones. La puntuación τ²-Bench de 93.6 indica un rendimiento sólido en un punto de referencia que requiere que el modelo planifique y ejecute secuencias de acciones utilizando herramientas (por ejemplo, calculadoras, motores de búsqueda, intérpretes de código). Esto lo hace adecuado para construir agentes autónomos que necesiten interactuar con sistemas externos. El modelo también maneja entradas multimodales, por lo que tareas como razonamiento visual, análisis de documentos con imágenes incrustadas o resumen de video están dentro de sus fortalezas. Además, su gran límite de salida le permite generar explicaciones exhaustivas, completaciones de código o datos estructurados en una sola respuesta. Los desarrolladores que trabajan en chatbots complejos, asistentes de codificación o herramientas de análisis de investigación pueden encontrar este modelo efectivo.
While Qwen3.5-122B-A10B es potente, no es la opción más rentable para todos los casos de uso. Si tu tarea es una clasificación simple, generación de texto corto o una pregunta-respuesta directa que no requiera razonamiento de varios pasos ni comprensión multimodal, puedes obtener resultados satisfactorios con un modelo más pequeño como Qwen-7B o un modelo no multimodal. Esos modelos pueden ser más rápidos y más baratos por token. Además, si tus necesidades de contexto son muy reducidas (p. ej., menos de 1000 tokens), la sobrecarga relativa de usar un modelo de 122B parámetros puede no valer la pena. OrcaRouter ofrece una gama de modelos con diferentes precios y características de rendimiento. Puedes experimentar primero con modelos más pequeños y actualizar solo si la calidad es insuficiente. Asimismo, si no necesitas el límite de salida de 65K, puede bastar con un modelo de salida más corta.
El modelo tiene una ventana de contexto de 32,768 tokens y una salida máxima de 65,536 tokens, lo que le permite manejar cadenas de razonamiento extendidas e instrucciones largas. La alta puntuación τ²-Bench sugiere que puede mantener coherencia a lo largo de múltiples pasos y seguir correctamente instrucciones complejas que involucran lógica condicional, llamadas a herramientas y bifurcaciones. En la práctica, los usuarios han informado que los modelos de la serie Qwen3.5 son competitivos con otros modelos de última generación en tareas como resolución de problemas matemáticos, generación de código y acertijos lógicos. Sin embargo, como todos los modelos grandes, el rendimiento puede degradarse si el contexto está lleno de información irrelevante o si las instrucciones son ambiguas. Se recomienda la ingeniería de prompts para guiar el modelo de manera efectiva. El modelo también puede tener dificultades con documentos muy largos (cerca del límite de contexto) donde debe recordar detalles desde el principio.
La entrada multimodal (texto + imagen/video) permite varias aplicaciones prácticas. En el análisis de documentos, el modelo puede leer tanto el texto como los gráficos, diagramas o firmas integrados en un PDF o imagen. Por ejemplo, puede extraer datos de una tabla escaneada o interpretar un gráfico. En la respuesta a preguntas visuales, el modelo puede responder preguntas sobre una fotografía o ilustración. En el análisis de video, puede procesar fotogramas para describir escenas o rastrear cambios a lo largo del tiempo. Los desarrolladores pueden crear herramientas para accesibilidad (por ejemplo, describir imágenes para usuarios con discapacidad visual) o automatización (por ejemplo, analizar capturas de pantalla de interfaz de usuario). Debido a que se accede al modelo a través de OrcaRouter, estas capacidades se pueden integrar en aplicaciones existentes con las mismas llamadas API utilizadas para indicaciones solo de texto, simplemente incluyendo image_url o video_url en el contenido del mensaje.
El único benchmark público para este modelo es el τ²-Bench, donde obtuvo una puntuación de 93.6. τ²-Bench está diseñado para evaluar la capacidad de un modelo para usar herramientas y completar tareas de múltiples pasos en un entorno simulado. Una puntuación de 93.6 indica que el modelo puede completar correctamente una alta proporción de estas tareas. En contexto, esta puntuación es competitiva con otros modelos de última generación en el mismo benchmark. Sin embargo, las puntuaciones de los benchmarks no siempre se traducen en rendimiento en el mundo real, ya que las tareas pueden variar en dificultad y el benchmark puede no cubrir todos los dominios. Los usuarios deben realizar sus propias evaluaciones en sus tareas específicas. No se proporcionan otras puntuaciones de benchmarks (por ejemplo, MMLU, HumanEval o benchmarks multimodales) en los datos disponibles, por lo que no es posible comparar este modelo en un conjunto más amplio de métricas estándar.
Fortalezas: El modelo obtiene una puntuación alta en un benchmark de uso de herramientas, lo que sugiere un fuerte razonamiento y seguimiento de instrucciones. Su capacidad multimodal y gran límite de salida lo hacen versátil. La arquitectura MoE puede proporcionar un buen equilibrio entre rendimiento y eficiencia (al menos en comparación con un modelo denso de parámetros totales similares). Limitaciones: El modelo tiene una ventana de contexto de solo 32,768 tokens, lo cual es moderado en comparación con algunos modelos que ofrecen 100K o más. Los parámetros activados (10B) son relativamente bajos para un modelo de su tamaño total, lo que podría limitar el rendimiento en tareas muy complejas. No hay información disponible sobre latencia, rendimiento o requisitos de hardware. Además, debido a que el modelo es nuevo, el ecosistema de la comunidad (por ejemplo, scripts de ajuste fino, herramientas de cuantización) puede estar menos desarrollado que para modelos más establecidos. Los usuarios deben probar el modelo a fondo.
No hay cifras específicas de latencia o rendimiento disponibles para este modelo en OrcaRouter. La velocidad de inferencia depende de factores como la longitud de entrada, la longitud de salida, el tamaño del lote y el hardware subyacente que OrcaRouter asigna. Los modelos MoE pueden tener velocidad variable porque el mecanismo de enrutamiento puede activar diferentes expertos para diferentes tokens. En general, los modelos con 10B parámetros activados pueden generar a velocidades moderadas en GPUs modernas, pero los 122B parámetros totales en memoria pueden provocar un mayor uso de memoria y tiempos de prellenado más largos. Si la baja latencia es crítica, es posible que desees probar el modelo con tus indicaciones típicas. La API de OrcaRouter devuelve marcas de tiempo y métricas de rendimiento en los encabezados de respuesta que pueden ayudarte a medir la velocidad. Para aplicaciones sensibles a la latencia, considera usar un modelo más pequeño si la tarea lo permite.
Los hechos disponibles solo incluyen un único punto de referencia: τ²-Bench. No se proporcionan puntos de referencia comunes como MMLU (conocimiento), HumanEval (código), GSM8K (matemáticas) o puntos de referencia multimodales como MMBench. Esto dificulta evaluar el rendimiento del modelo en tareas que no están relacionadas con herramientas. Por ejemplo, si su aplicación requiere precisión factual, querría conocer su rendimiento en MMLU. De manera similar, para tareas multimodales, serían útiles las puntuaciones en un punto de referencia de razonamiento visual. La ausencia de estas puntuaciones no implica un rendimiento deficiente, pero significa que los usuarios deben realizar sus propias evaluaciones. OrcaRouter puede proporcionar resultados adicionales de puntos de referencia previa solicitud o en la documentación. Hasta que haya más datos disponibles, es recomendable comparar el modelo cualitativamente con otros en su dominio específico.
Los detalles de precios para Qwen3.5-122B-A10B en OrcaRouter no se proporcionan explícitamente en los datos disponibles. Normalmente, OrcaRouter cobra por token tanto para entrada como para salida, con tarifas separadas para tokens de prompt y tokens generados. Las entradas multimodales (imágenes/video) se facturan como equivalentes de token según la cantidad de bloques de imagen o fotogramas de video procesados. Algunos proveedores también ofrecen tarifas con descuento para aciertos de caché si el usuario repite el mismo prompt. Para obtener precios exactos, los usuarios deben consultar la página de precios de OrcaRouter o contactar a su equipo de ventas. Debido a que este modelo tiene 122B parámetros totales y es multimodal, su precio por token puede ser más alto que el de modelos más pequeños o solo de texto. Es importante considerar el costo de token para imágenes/video al estimar los gastos totales de una tarea.
Usar un modelo más grande como Qwen3.5-122B-A10B normalmente incurre en costos más altos por token que los modelos más pequeños. Sin embargo, si el modelo puede resolver una tarea en menos pasos o con menos tokens gracias a sus capacidades, el costo total aún puede ser competitivo. El amplio límite de salida (65,536 tokens) puede ser tanto un beneficio como un riesgo de costo: generar salidas largas puede acumular rápidamente costos de tokens. Además, las entradas multimodales consumen más tokens por prompt que las entradas solo de texto. Por ejemplo, una sola imagen de alta resolución puede costar cientos de tokens. Si tu tarea no requiere todas las capacidades del modelo, puedes ahorrar dinero eligiendo un modelo más pequeño. OrcaRouter probablemente ofrece paneles de uso y controles de costos, como establecer un número máximo de tokens de salida o alertas de presupuesto, lo que puede ayudar a gestionar los gastos.
Los hechos disponibles no mencionan ningún descuento por caché para este modelo en OrcaRouter. Muchos proveedores de inferencia ofrecen almacenamiento en caché de consultas (prompt caching), donde el texto repetido en las instrucciones del sistema o mensajes de usuario se almacena temporalmente y se factura a una tarifa más baja. Si OrcaRouter admite el caché, esto podría reducir los costos para aplicaciones que usan consultas estáticas largas (por ejemplo, instrucciones del sistema, descripciones de personajes). Sin embargo, sin documentación específica, no debe asumirse. Los usuarios pueden revisar los encabezados de respuesta de la API en busca de indicadores de acierto de caché si el almacenamiento en caché está implementado. Para minimizar costos, puede diseñar las consultas evitando repetir los mismos prefijos largos, separando las instrucciones estáticas del contenido dinámico. También considere usar ventanas de contexto más cortas u omitir imágenes innecesarias cuando sea posible.
Para usar Qwen3.5-122B-A10B, envía una solicitud POST al endpoint de la API de OrcaRouter en https://api.orcarouter.ai/v1/chat/completions. Establece el parámetro model en "qwen/qwen3.5-122b-a10b". La API es totalmente compatible con el formato de chat completions de OpenAI, por lo que puedes usar las mismas bibliotecas cliente (por ejemplo, la biblioteca openai de Python) cambiando la URL base y la clave API. El cuerpo de la solicitud incluye messages (cada uno con un role y content), y opcionalmente parámetros como temperature, max_tokens, top_p, etc. Para entrada multimodal, usa un bloque de contenido con type: "image_url" para imágenes o el manejo específico de video del modelo (probablemente mediante fotogramas codificados en base64 o una URL). La API devolverá una respuesta JSON con el texto generado y metadatos de uso (conteos de tokens). La documentación de OrcaRouter proporciona más detalles sobre los parámetros compatibles.
El modelo admite los parámetros estándar de chat: temperature (por defecto generalmente 0.7), top_p (por defecto 0.9), max_tokens (hasta el máximo de salida del modelo de 65,536), presence_penalty, frequency_penalty y secuencias de parada. El límite de la ventana de contexto es de 32,768 tokens, lo que incluye todos los mensajes, imágenes y fotogramas de video. Si el recuento total de tokens supera este límite, la API devolverá un error o truncará la entrada (según la configuración). El parámetro max_tokens no puede exceder 65,536. Para solicitudes multimodales, tenga en cuenta que las imágenes y los videos añaden tokens; no se proporciona la tasa de conversión exacta, pero las imágenes de alta resolución o los videos largos pueden consumir rápidamente la ventana de contexto. OrcaRouter también puede admitir el modo de transmisión, donde las respuestas se transmiten token por token, lo cual es útil para aplicaciones en tiempo real. Consulte la referencia de la API para opciones adicionales como logprobs o tools.
La migración es sencilla: reemplaza tu URL base por https://api.orcarouter.ai/v1, usa el ID de modelo "qwen/qwen3.5-122b-a10b" y proporciona tu clave API de OrcaRouter. El formato de solicitud es idéntico al de la API de chat completions de OpenAI. Por ejemplo, en Python con la librería openai, puedes configurar `client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='tu_clave')`. Luego llama a `client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...)`. Si tu aplicación usa function calling o herramientas, ten en cuenta que el modelo las soporta, ya que fue entrenado en τ²-Bench, que implica uso de herramientas. Sin embargo, la sintaxis exacta de las llamadas a herramientas puede diferir de la de OpenAI; OrcaRouter probablemente soporta el formato de OpenAI, pero verifícalo para confirmar. En cuanto a entradas multimodales, tu código existente que envía `image_url` en los mensajes podría funcionar siempre que el modelo soporte ese formato.
Dentro de la familia Qwen, este modelo se sitúa entre los modelos densos más pequeños (p. ej., Qwen-7B, Qwen-14B) y los modelos MoE más grandes (p. ej., Qwen3.5-235B). En comparación con los modelos densos, este modelo MoE puede acceder a un conjunto de parámetros total más grande, pero activa solo una fracción por token, lo que puede permitir expertos más especializados. Esto puede llevar a un mejor rendimiento en una variedad de tareas, especialmente aquellas que requieren conocimientos diversos. Sin embargo, los modelos densos más pequeños pueden ser más rápidos y económicos para tareas específicas. En comparación con el Qwen3.5-235B más grande, este modelo probablemente tenga un rendimiento inferior, pero sea más eficiente. El soporte multimodal es una característica común de la generación Qwen3.5; las versiones anteriores (Qwen2, Qwen1) eran solo de texto. Los usuarios deben comparar los resultados de los benchmarks en sus tareas específicas para decidir qué modelo se adapta mejor.
Las comparaciones directas son difíciles sin puntos de referencia exhaustivos. Qwen3.5-122B-A10B alcanza 93.6 en τ²-Bench, lo cual es un resultado sólido para tareas de uso de herramientas. Como referencia, no se proporcionan puntuaciones similares en ese punto de referencia para otros modelos, pero se considera una capacidad de alto nivel. En cuanto a la arquitectura, los modelos Llama son densos y más simples, mientras que los modelos Claude tienen arquitecturas propietarias diferentes. Qwen3.5 ofrece entrada multimodal (imagen/video) que Claude soporta, pero Llama 3.2 y 3.1 son solo de texto (excepto algunas variantes de visión). La ventana de contexto de 32K es más pequeña que la de Claude de 100K o 200K, pero comparable a los 128K de Llama 3.1? No exactamente; no debemos inventar números. Para código y razonamiento, muchos modelos son competitivos. La ventaja de este modelo puede ser su ajuste específico para uso de herramientas (alta puntuación en τ²-Bench) y la eficiencia multimodal MoE. Sin embargo, Claude y Llama tienen ecosistemas más grandes y más apoyo de la comunidad.
Pocos modelos combinan entrada multimodal, una ventana de contexto grande, un límite de salida grande y una puntuación alta en τ²-Bench en un solo paquete. La serie Qwen3.5 está diseñada para ser un modelo de propósito general capaz con sólidas habilidades de razonamiento y uso de herramientas. La arquitectura MoE con 122B totales y 10B activos le permite acumular mucho conocimiento mientras mantiene los costos de inferencia más bajos que un modelo denso de 122B. Dicho esto, otros modelos MoE como Mixtral 8x7B (total 47B, activos 13B) tienen diferentes compensaciones. Qwen3.5-122B-A10B tiene un recuento total de parámetros mucho mayor pero menos parámetros activos por token (10B frente a 13B). El soporte multimodal es un diferenciador; Mixtral es solo texto. En el espacio MoE multimodal, existen modelos como Qwen-VL u otros, pero a menudo tienen ventanas de contexto más pequeñas. Este modelo se posiciona como una opción sólida para desarrolladores que necesitan un solo modelo para tareas diversas, multimodales y con uso intensivo de herramientas en OrcaRouter.
Elige Qwen3.5-122B-A10B si tu aplicación requiere tanto comprensión multimodal como razonamiento complejo de varios pasos, y necesitas el límite de salida grande para generar respuestas largas. También es una buena opción si estás construyendo sistemas agénticos que utilizan herramientas, dado su alto puntaje τ²-Bench. Si tu tarea es solo de texto y no necesita la capacidad adicional, un modelo más económico como Llama 3.1 70B o Qwen-14B puede ser suficiente. Si necesitas una ventana de contexto más grande (p. ej., >100K tokens), considera modelos diseñados específicamente para contextos largos. Si necesitas menor latencia, un modelo más pequeño o denso puede ser mejor. Dado que OrcaRouter ofrece muchos modelos, puedes evaluar varios a través de la misma API para encontrar el mejor ajuste para tus objetivos de costo y calidad. El ID del modelo es qwen/qwen3.5-122b-a10b.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Nivel | Entrada / 1M tokens | Salida / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| El nivel se selecciona por el número de tokens de entrada de cada solicitud | ||
Estimación según precio de lista
Precios por niveles: esta estimación usa las tarifas del nivel base.
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/qwen/qwen3.5-122b-a10bAbrir @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b