Una tarjeta de título generada encabezada por 'TwIL-LM3-Pro vs Qwen 3.8', con el subtítulo 'La comparación que la tarjeta ejecutó realmente', con dos tarjetas redondeadas que dicen 'TwIL-LM3-Pro - 3.66B, local, no comercial' y 'Qwen3.8-Max - alojado, contexto de 1M, $2 / $6'. Una línea de pie de página dice 'webAI medido frente a Qwen3-8B, no Qwen3.8-Max'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

TwIL-LM3-Pro vs Qwen 3.8: Un desajuste, y la comparación que realmente importa

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

TwIL-LM3-Pro y Qwen3.8-Max no pertenecen a la misma página, y la razón no es que uno sea mejor. Es que el caso publicado a favor del modelo de lógica formal de 3.66B de webAI se basa en una comparación contra un modelo Qwen, y el modelo Qwen en cuestión no es el que nombra el titular. Las tablas del Track A y el Track B de webAI miden TwIL-LM3-Pro contra Qwen3-8B, un modelo denso de 8B de pesos abiertos de una generación anterior, y no le prestan ninguna atención a Qwen3.8-Max: no porque TwIL-LM3-Pro fuera a ganar, sino porque Qwen3.8-Max es el sistema alojado insignia de Alibaba, un modelo disperso de mezcla de expertos reportado en 2.4 billones de parámetros con aproximadamente 95 mil millones activos por token, una ventana de contexto multimodal de un millón de tokens y una tarifa de $2.00 por millón de tokens de entrada y $6.00 por millón de salida. Poner un GGUF de portátil de 2.09 GiB junto a eso es un error de categoría disfrazado de página de comparación.

Así que esta pieza hace dos cosas. Corrige la comparación que los resultados de búsqueda entienden mal y luego responde la versión de la pregunta que un lector probablemente realmente tiene: dado que un modelo de frontera está a una llamada de API de distancia y un especialista en lógica formal se ejecuta en tu propia máquina, ¿cuándo se gana cada uno su lugar?

El modelo que la tarjeta realmente midió

La comparación relevante es con Qwen3-8B, y el propio resumen que hace webAI de ella es más modesto de lo que sugieren los análisis de segunda mano. La macro gate en dominio de TwIL-LM3-Pro es 0.5539 frente a 0.5336 de Qwen3-8B, y la tarjeta del modelo contiene la frase que una página de marketing habría eliminado: la ventaja en la gate es 0.020, «menor que el ruido de muestreo con n = 200 por carril — así que léase eso como paridad, no como una victoria».

Donde la comparación no es cara o cruz: strict-7, 0.2879 frente a 0.2093, una fila que no usa crédito de coincidencia laxa en ningún punto y que, por lo tanto, no puede fabricarse mediante el formato. Opción múltiple estricta, 0.4100 frente a 0.0000. Inducción de reglas, 0.4195 frente a 0.3680. Y la proporción de parámetros —3.66B frente a aproximadamente 8B—, que es toda la afirmación de «menos de la mitad del tamaño».

En la suite reservada, webAI es aún más directo: "TwIL-LM3-Pro no lo supera". La macro de los diez conjuntos de datos es 0.7901, a la par de su propia base Granite y por detrás del 0.8493 de Qwen3-8B. Un especialista pequeño que empata con un modelo general del doble de su tamaño en lógica formal y pierde frente a él en capacidad general es la forma esperada, y reportarlo así es lo que hace creíble la cifra strict-7.

Qué es realmente Qwen3.8-Max

Qwen3.8-Max no es una iteración de Qwen3-8B. Es el nivel premium de Alibaba y, en la página de catálogo de OrcaRouter, aparece como `qwen/qwen3.8-max` con una fecha de lanzamiento del 3 de agosto de 2026, una ventana de contexto de un millón de tokens, entrada de texto, imagen y video, salida de texto, y compatibilidad total con el modo de pensamiento, llamada a funciones, herramientas integradas y salidas estructuradas. Se ofrece a través de paneles compatibles con OpenAI, compatibles con Anthropic y nativos en cinco regiones, y el modo de pensamiento se activa o desactiva con el parámetro `enable_thinking`. La tarifa es de $2.00 por millón de tokens de entrada y $6.00 por millón de salida.

Se publicó una instantánea con fecha, `qwen/qwen3.8-max-0902`, el 2 de septiembre de 2026 con las mismas capacidades y el mismo precio, publicada específicamente para que el comportamiento pueda fijarse y así lograr ejecuciones reproducibles. Si vas a desarrollar con Qwen3.8-Max para algo de larga duración, ese identificador de instantánea es el que conviene poner en la configuración en lugar del alias cambiante.

Fíjate en lo que está ausente de esa descripción: una cifra de parámetros que puedas descargar, un archivo de licencia y cualquier vía para ejecutarlo por tu cuenta. Qwen3.8-Max es un producto alojado. La cobertura periodística en el momento del lanzamiento informó de pesos abiertos prometidos para la semana siguiente, y el enfoque de techsy —«2,4T de parámetros, contexto de 1M, aún sin pesos»— es el estado que un lector debería verificar en lugar de dar por sentado, porque una promesa reportada en el lanzamiento no es un checkpoint publicado.

Cuatro dimensiones, y ninguna de ellas está cerca.

• Parámetros — TwIL-LM3-Pro 3.66B denso, todos activos frente a Qwen3.8-Max reportado en 2.4T totales en un diseño disperso de mezcla de expertos con aproximadamente 95B activos por token. Tres órdenes de magnitud en el total, dos en los activos.

• Dónde se ejecuta — TwIL-LM3-Pro se descarga como bf16 a 6.82 GiB o un GGUF Q4_K_M de 2.09 GiB para CPU o 4 GB de VRAM, frente a Qwen3.8-Max, que solo existe como endpoint alojado.

• Contexto — TwIL-LM3-Pro 131.072 tokens, heredado de su base Granite y nunca validado más allá de 8.192 en su propia evaluación frente a Qwen3.8-Max con 1.000.000 tokens.

• Modalidades — texto de entrada, texto de salida frente a texto, imagen y video de entrada, texto de salida.

• Licencia — webAI Non-Commercial License ver. 1.0, con un acuerdo aparte requerido para el uso que genere ingresos, frente a una API comercial alojada sin pesos que licenciar.

• Costo — TwIL-LM3-Pro: sin tarifa por token y sin endpoint alojado, frente a los $2.00 por millón de tokens de entrada y $6.00 por millón de salida de Qwen3.8-Max, con una tarifa de entrada en caché de alrededor de $0.25 por millón.

Un modelo de 3,66B es barato porque es pequeño, y es pequeño porque hace una sola cosa. Qwen3.8-Max es caro porque es general y está alojado. Ninguna de las dos tarifas es un veredicto.

La pregunta detrás de la pregunta

Si eliminamos la confusión de nombres, queda una pregunta de ingeniería, y es una buena: si un modelo alojado de frontera puede razonar sobre lógica formal, ¿por qué ejecutar siquiera un especialista estrecho?

Tres razones se sostienen. La primera es la licencia y la red: un grupo de investigación no comercial, un entorno aislado de la red o una pasada de etiquetado por lotes que tiene que ejecutarse en un portátil sin conectividad no pueden llamar a un endpoint alojado, y un GGUF de 2,09 GiB responde directamente a esa restricción. La segunda es la estructura de costos en función del volumen — un trabajo de etiquetado de lógica formal sobre un millón de entradas cortas paga por token en un modelo de frontera alojado y no paga nada más que tiempo de reloj en uno local. La tercera es la forma de la salida: TwIL-LM3-Pro se ajustó para emitir estructuras verificables por máquina en lugar de prosa, y para etiquetas de implicación y análisis semánticos eso es un pipeline más pequeño que preguntarle a un modelo general y analizar su respuesta.

En cambio, el caso de Qwen3.8-Max es simple. Ve imágenes y video, admite un millón de tokens, maneja herramientas y salida estructurada mediante una API documentada, y cuenta con benchmarks publicados y evaluaciones independientes que lo respaldan. Nada de lo que ofrece un especialista de nicho amenaza eso; ambos responden a conjuntos de restricciones diferentes.

El stack que usa ambos

El patrón que sobrevive al contacto con un pipeline real es de dos niveles, y no es exótico. Un modelo frontera alojado lee la entrada desordenada —una página de libro de texto escaneada, una fuente de modalidad mixta, una especificación larga— y la convierte en texto estructurado limpio. Ese texto va a un modelo de lógica formal local cuyo trabajo entero es emitir una etiqueta, un parseo o una crítica de Lean sobre hardware que posees. El veredicto sobre si ese segundo nivel vale su costo de mantenimiento es la comparación al estilo strict-7, no la compuerta, porque un especialista se gana su lugar en los carriles donde la métrica no tiene espacio para puntuaciones caritativas.

También hay una pista que merece la pena tomar de la propia ficha de webAI: el pipeline se ejecutó sobre cinco modelos base distintos, con solo el coeficiente de fusión cambiando por modelo, y webAI reporta el resultado de cada uno, incluidos los que menos se movieron. Eso es una afirmación más sólida sobre una receta que cualquier línea de benchmark, y es el tipo de evidencia que te dice que un método generaliza en lugar de que un checkpoint tuvo suerte.

¿Qué es enrutable aquí y qué no lo es?

Este es el único lugar donde los dos modelos aparecen honestamente en la misma frase. Qwen3.8-Max es una ruta: se sirve a través de OrcaRouter como `qwen/qwen3.8-max`, y dado que la plataforma transfiere el precio de lista del proveedor con un 0% de recargo, la tarifa de $2.00/$6.00 es la del propio proveedor y una rebaja de precio del proveedor se aplica el mismo día en lugar de tras un ciclo de contrato. La instantánea fechada `qwen/qwen3.8-max-0902` se puede enrutar junto a él, de modo que fijar un id de modelo reproducible es una decisión de configuración y no una relación con un proveedor aparte.

TwIL-LM3-Pro no es una ruta, y sería deshonesto insinuar lo contrario. Tiene licencia no comercial y no cuenta con un endpoint alojado publicado, y la forma actual de usarlo es descargar el checkpoint y ejecutarlo tú mismo. Lo que el enrutador hace por un pipeline construido en torno a él es el trabajo de texto circundante —la expansión de prompts, la generación de corpus y la pasada de filtrado—, que se ejecuta en el mismo endpoint compatible con OpenAI contra más de 200 modelos, así que cambiar el modelo que genera datos de evaluación por el modelo que califica no cuesta más que editar la configuración, con conmutación por error automática para mantener vivo un lote largo cuando un proveedor falla temporalmente.

El uso más defendible de los dos juntos es exactamente ese: un nivel de frontera enrutable que hace razonamiento general y extracción estructurada, un especialista descargado que hace el juicio de lógica formal, y una única clave para todo lo que hay en medio.

¿Qué modelo comparar, y cuándo?

Si estás evaluando modelos pequeños de lógica formal, el Qwen que merece colocarse junto a TwIL-LM3-Pro es Qwen3-8B, y webAI ya ha publicado esa comparación con las advertencias correspondientes. Si estás eligiendo dónde ejecutar una carga de trabajo de producción, Qwen3.8-Max es una decisión completamente distinta —un sistema de frontera alojado, con tarifa por uso y sin descarga— y la pregunta correcta no es cuál es mejor, sino qué restricción es la que limita: conectividad y licencia por un lado; contexto, modalidad y escala por el otro. La mayoría de los sistemas reales terminan necesitando ambas respuestas.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario