Una versión sin pérdidas y sin censura de Qwen3.6 35B A3B que conserva las capacidades del modelo original mientras elimina el comportamiento de rechazo. Diseñada para desarrolladores, investigadores de IA y flujos de trabajo avanzados de agentes que requieren resultados sin restricciones del modelo sin comprometer el razonamiento, la codificación, el rendimiento multilingüe ni el uso de herramientas. La variante Aggressive está completamente desbloqueada y diseñada para proporcionar respuestas directas y completas en una amplia gama de instrucciones. Aunque el modelo puede añadir ocasionalmente breves descargos informativos heredados del entrenamiento del modelo base, estos no son rechazos y el contenido solicitado se genera igualmente en su totalidad. Ideal para investigación en IA, pruebas de seguridad, red teaming, desarrollo de agentes, asistentes de codificación y otras aplicaciones avanzadas de IA que se beneficien de la máxima flexibilidad en los resultados. El acceso a este modelo está restringido y está destinado a investigadores de seguridad, equipos rojos, investigadores de seguridad de IA y otros profesionales cualificados que realicen investigaciones, evaluaciones y pruebas legítimas.
Este modelo es una variante de Mezcla de Expertos de la serie Qwen3.6, desarrollado originalmente por Alibaba Cloud y alojado por el proveedor Obsidian en OrcaRouter. Tiene 35 mil millones de…
Este modelo destaca en tareas que se benefician de un amplio contexto y comprensión multimodal. Para texto, puede resumir o responder preguntas sobre documentos de hasta 262,144 tokens de longitud, como libros completos o informes extensos. Para imágenes y videos, puede extraer información detallada y combinarla con contexto textual. Su naturaleza sin censura permite generar contenido creativo sin las restricciones de seguridad típicas, útil para la generación de historias, juegos de rol u otros escenarios donde los filtros restrictivos no son deseados. Su diseño MoE proporciona inferencia rápida en comparación con modelos densos de tamaño total similar, lo que lo hace práctico para aplicaciones en tiempo real cuando se despliega eficientemente. Las capacidades multilingües se heredan de la familia Qwen3.6, admitiendo muchos idiomas.
La etiqueta "uncensored" significa que el modelo ha recibido un entrenamiento de alineación reducido en comparación con los puntos de control estándar de Qwen3.6. Esto puede dar lugar a resultados que estén menos filtrados en cuanto a contenido dañino, ofensivo o controvertido. Los usuarios deben probar el modelo exhaustivamente en su caso de uso específico para asegurarse de que los resultados cumplan con sus estándares. La falta de censura puede ser beneficiosa para tareas como escritura creativa, juegos de rol sin censura o investigación sobre temas sensibles donde se desea una generación neutral. Sin embargo, también significa que el modelo puede producir contenido que viole las políticas de contenido típicas. OrcaRouter no afirma tener ningún filtrado de seguridad adicional; el comportamiento base del modelo es lo que obtienes.
Si tu tarea implica entradas cortas (por ejemplo, unos pocos cientos de tokens), clasificación simple o solo requiere comprensión básica del lenguaje, modelos más pequeños y económicos como Qwen2.5-7B o GPT-4o-mini pueden ser más rentables. Las fortalezas de este modelo son más evidentes al manejar contextos muy largos (más de 10K tokens) o entradas multimodales. Para tareas de texto puro de menos de 8K tokens sin necesidad de capacidad de imagen/video, puedes ahorrar dinero usando un modelo pequeño dedicado. Además, si tu aplicación requiere un filtrado de contenido estricto, la naturaleza sin censura podría obligarte a agregar una capa de moderación externa, añadiendo costo.
El modelo acepta entradas de imagen y video además de texto. Para imágenes, puede proporcionar datos de imagen codificados en base64 o URL (mediante el arreglo de contenido de la API con tipo "image_url"). Para videos, la API probablemente acepta fotogramas de video como secuencias de imágenes o URL de archivos de video; el formato exacto debe verificarse en la documentación de OrcaRouter. El modelo procesa estas entradas visuales junto con el texto para generar respuestas. La ventana de contexto de 262,144 tokens se aplica al recuento combinado de tokens de todas las modalidades de entrada. Tenga en cuenta que el procesamiento de imágenes y videos consume tokens proporcionalmente a la resolución visual y la duración, por lo que las entradas más grandes reducirán la capacidad de texto disponible.
El proveedor no proporcionó puntuaciones específicas de referencia para este modelo. La serie Qwen3.6 generalmente ofrece un rendimiento competitivo en evaluaciones de contexto largo como L-Eval y RULER, y en tareas multimodales como MMMU y MathVista, pero no se publican cifras exactas para esta variante sin censura de 35B A3B. Los usuarios interesados en el rendimiento empírico deberían realizar sus propias evaluaciones en conjuntos de datos representativos. La arquitectura MoE con 3B parámetros activados a menudo produce resultados comparables a modelos densos de tamaño activo similar, mientras que los costos totales de almacenamiento y memoria son más altos debido a los 35B parámetros completos.
La velocidad y latencia dependen de varios factores: la longitud de entrada, la longitud de salida, la carga del servidor y la configuración del hardware. Dado que el modelo activa solo 3B parámetros por token, se espera que sea más rápido que un modelo denso de 35B, con tasas de generación comparables a modelos como GPT-3.5 (aunque no se proporcionan cifras exactas). La infraestructura de OrcaRouter a través de Obsidian puede ofrecer latencia variable; los usuarios pueden probar con sus propias cargas de trabajo. Para escenarios de contexto largo (por ejemplo, más de 100K tokens), el tiempo de relleno aumenta linealmente con la longitud de entrada. La generación de tokens de salida suele ser el principal contribuyente a la latencia. No se establece un acuerdo de nivel de servicio (SLA) para la velocidad.
Las fortalezas del modelo incluyen su gran ventana de contexto de 262K, que permite procesar libros completos o transcripciones de videos de varias horas en una sola pasada. El diseño MoE ofrece un buen equilibrio entre capacidad y velocidad de inferencia. La entrada multimodal permite tareas que combinan datos textuales y visuales. La naturaleza sin censura permite generar contenido que otros modelos podrían rechazar. El soporte multilingüe cubre docenas de idiomas. El precio es competitivo para un modelo de esta capacidad: $0.31/M de entrada y $4.21/M de salida, sin margen de beneficio.
Las limitaciones incluyen la falta de números de referencia publicados, lo que dificulta evaluar el rendimiento relativo. La naturaleza sin censura puede producir resultados no deseados sin moderación adicional. El recuento de parámetros activados de 3B significa que puede no igualar el poder de razonamiento bruto de modelos densos más grandes (por ejemplo, GPT-4) en tareas lógicas complejas. Las capacidades multimodales pueden ser menos refinadas que las de modelos dedicados de visión y lenguaje. Modalidades de entrada como la tokenización de video podrían reducir el contexto efectivo para el texto. No se garantizan capacidades de transmisión ni de uso de herramientas. Finalmente, la dependencia del proveedor externo Obsidian significa que la disponibilidad y el tiempo de actividad no están bajo el control de OrcaRouter.
Los precios son transparentes: $0.31 por millón de tokens de entrada y $4.21 por millón de tokens de salida. Estas son las tarifas exactas del proveedor Obsidian, sin margen adicional añadido por OrcaRouter. Los tokens de entrada incluyen todo el texto y los tokens visuales (para imágenes y videos). Los tokens de salida son el texto generado. No hay tarifa por solicitud ni se requiere suscripción. Solo pagas por los tokens consumidos. El precio es por 1M de tokens, por lo que las solicitudes pequeñas cuestan fracciones de centavo. No se anuncia ningún nivel gratuito ni prueba.
No se han revelado descuentos, beneficios de almacenamiento en caché ni precios por volumen para este modelo. Las tarifas indicadas son fijas por token. A diferencia de algunos proveedores que ofrecen precios reducidos para tokens de entrada en caché, OrcaRouter aplica la misma tarifa de entrada independientemente de la repetición. Para un uso muy elevado, puede contactar a OrcaRouter para posibles acuerdos personalizados, pero no se documenta ningún descuento estándar. La política de margen cero garantiza que está pagando exactamente lo que Obsidian cobra, sin tarifas ocultas.
Modelos multimodales de contexto largo comparables de otros proveedores suelen costar más: por ejemplo, el GPT-4 Turbo de OpenAI cuesta $10/1M de entrada y $30/1M de salida, mientras que Claude 3.5 Sonnet cuesta $3/1M de entrada y $15/1M de salida. Este modelo es notablemente más barato a $0.31/$4.21. Sin embargo, esos modelos ofrecen capacidades diferentes (por ejemplo, uso de herramientas, puntos de referencia de razonamiento más altos). El precio más bajo refleja la arquitectura MoE y el hecho de que es un modelo no censurado alojado por un tercero. Si requiere confiabilidad garantizada, mayor seguridad o funciones avanzadas como llamadas a funciones, el costo adicional puede estar justificado.
Para usar el modelo, envíe una solicitud POST a https://api.orcarouter.ai/v1/chat/completions (o el endpoint apropiado según la API compatible con OpenAI de OrcaRouter). Incluya el encabezado "Authorization: Bearer YOUR_API_KEY". En el cuerpo de la solicitud, establezca "model": "obsidian/Qwen3.6-35B-A3B". Pase los mensajes en el formato estándar de OpenAI: un arreglo de objetos con "role" y "content". Para contenido multimodal, use un arreglo content con tipo "text" y "image_url" (o equivalente de video). Ejemplo con cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe esta imagen"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
Puede usar parámetros típicos compatibles con OpenAI: temperature (predeterminado 1.0), top_p (0.9), max_tokens (el valor predeterminado varía, se recomienda establecerlo explícitamente), secuencias de parada, frequency_penalty, presence_penalty y seed para reproducibilidad. El modelo admite transmisión en flujo (streaming) mediante "stream": true para recibir respuestas token por token. Para entradas multimodales, la API espera arreglos de contenido con tipo "image_url" y opcionalmente "video_url" (consulte la documentación de OrcaRouter para el formato exacto de video). El límite de ventana de contexto de 262,144 tokens se aplica al número total de tokens en los mensajes más la respuesta. Si excede el límite, obtendrá un error de longitud de contexto; puede ajustar "max_tokens" o truncar los mensajes.
Para aprovechar el contexto de 262K, estructura tus indicaciones para incluir el documento completo o el historial de la conversación. Ten en cuenta que cada token en la entrada cuenta hacia el costo y los límites. Para entradas muy largas, considera dividir o resumir antes de enviar, aunque el modelo está diseñado para manejar el contexto completo. Usa el parámetro 'max_tokens' para controlar la longitud de la salida. Si encuentras errores de tiempo de espera, habilita la transmisión continua para obtener resultados parciales más rápido. OrcaRouter puede tener sus propios ajustes de tiempo de espera; contacta al soporte si es necesario. El modelo no admite mensajes de sistema de una manera especial; trátalos como un mensaje de usuario o asistente con el rol 'system' (formato estándar de OpenAI).
Migrar desde proveedores como OpenAI o Anthropic implica cambiar la URL base a https://api.orcarouter.ai/v1 y actualizar el ID del modelo. Si tu código usa el cliente Python de OpenAI, establece client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") y luego usa client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). El formato del mensaje y los nombres de los parámetros son idénticos. No se requieren cambios en la lógica del prompt. Nota que las formas de los objetos de respuesta también son compatibles, por lo que el código de análisis existente debería funcionar. Prueba primero con una solicitud pequeña para asegurar la autenticación y facturación adecuadas.
En comparación con Qwen3.6-72B (denso), este modelo utiliza MoE y, por lo tanto, tiene un costo de inferencia por token más bajo, pero puede tener una capacidad bruta ligeramente inferior. El contexto de 262K es mayor que los 128K de Qwen2.5. En comparación con Qwen3.6-32B (quizás denso), este modelo ofrece entrada multimodal que esas versiones anteriores quizás no tenían. La variante "uncensored" es única; las versiones estándar de Qwen tienen alineación. Si necesitas seguridad estricta, elige el Qwen3.6 normal. En cuanto al precio, este modelo es más barato que muchos modelos densos de Qwen en otras plataformas.
GPT-4o y Claude 3.5 Sonnet son modelos propietarios con un amplio entrenamiento en seguridad, puntuaciones más altas en benchmarks de razonamiento y codificación, y soportan uso de herramientas, visión y contexto grande (200K para Claude). Este modelo ofrece un contexto más grande (262K) y entrada multimodal a un precio significativamente más bajo. Sin embargo, carece de las funciones avanzadas, la fiabilidad y la consistencia de rendimiento de esos modelos. Para aplicaciones donde el costo es una preocupación principal y puedes aceptar cierto compromiso en la calidad, este modelo es una buena alternativa. Si necesitas razonamiento de primer nivel o llamadas a funciones, los modelos premium valen el costo adicional.
Este modelo es mejor cuando necesitas: (1) un contexto muy largo (262K tokens) a bajo costo; (2) entrada multimodal (imágenes/video) sin pagar precios premium; (3) generación de texto sin censura donde los filtros de contenido interferirían; (4) inferencia rápida en relación con el número total de parámetros debido a la activación de MoE. Es un fuerte candidato para investigación, extracción de datos, escritura creativa y cualquier tarea que se beneficie de un alto contexto y un bajo costo por token. Si necesitas características avanzadas como llamadas a herramientas, salidas estructuradas o alta fiabilidad, considera otros modelos.
| Entrada / 1M tokens | $0.310 |
| Salida / 1M tokens | $4.21 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BAbrir @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B