
Tiny Aya Base 32K vs Tiny Aya En-Thinker: Padre e Hijo, No Rivales
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Dos repositorios de Hugging Face, cuatro fragmentos de safetensors cada uno, y los tamaños de los fragmentos coinciden al byte — 1.998.698.496 / 1.996.494.056 / 1.996.494.088 / 708.852.792. Tiny Aya Base 32K y Tiny Aya En-Thinker no son las respuestas de dos laboratorios a la misma pregunta. Son la misma arquitectura Cohere2 de 3,35B en dos etapas distintas, y la propia tarjeta del modelo de Cohere Labs lo dice abiertamente: el checkpoint base “se utiliza como modelo base para Tiny Aya L2-Thinker y Tiny Aya En-Thinker”.
Eso hace que el habitual planteamiento cara a cara sea erróneo. No estás eligiendo entre dos modelos multilingües de 3B que compiten entre sí. Estás eligiendo entre un punto de partida y uno terminado —y la pregunta interesante es qué aportó realmente la etapa de post-entrenamiento que hay entre ellos, cuánto costó, y si alguno de los dos es utilizable para lo que tienes en mente, dado que ambos están bajo la misma licencia no comercial y ninguno tiene un solo benchmark publicado.
La única frase que resuelve la relación
Normalmente, una comparativa de tipo «vs» tiene que inferir la relación entre dos checkpoints a partir de la arquitectura y el número de parámetros. Aquí no hace falta.
La tarjeta de Tiny Aya Base 32K lo dice claramente, y vale la pena leer con atención por dónde está situada la frase: no en una nota al pie, sino en el resumen del modelo, entre la descripción del checkpoint y los créditos de los desarrolladores:
"Este es un modelo base preentrenado y no ha sido ajustado con instrucciones ni alineado con preferencias. Este checkpoint se utiliza como modelo base para Tiny Aya L2-Thinker y Tiny Aya En-Thinker."
Lo que hace que eso merezca un párrafo es la inconsistencia que pone de manifiesto. La propia ficha de En-Thinker no nombra Base 32K. Su línea final remite a los lectores a "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — y tiny-aya-base es el checkpoint de febrero, documentado con contexto de 8K, no la variante de 32K que dice ser el modelo padre de En-Thinker. En-Thinker afirma 32K en su propia ficha. No se puede post-entrenar un modelo para que tenga una ventana cuatro veces más amplia que la ventana con la que fue preentrenado. Así que la base de 8K nunca iba a ser la respuesta, y la afirmación de la base de 32K encaja con la aritmética, mientras que la propia referencia de En-Thinker no.
La explicación más probable es prosaica: Base 32K se subió el 8 de septiembre de 2026, seis días después de los Thinkers, así que la ficha de En-Thinker se escribió antes de que existiera su matriz y no se ha actualizado desde entonces. Es una inferencia a partir de las marcas de tiempo, no una declaración del proveedor, pero es la lectura que exige el menor número de suposiciones, y significa que el documento más reciente de la familia es el más informativo.

Dimensión a dimensión
Todo lo que aparece a continuación es lo que declaran ambas tarjetas, menos la duplicación: ambas son 3.35B, BF16, solo texto, Cohere2ForCausalLM, CC-BY-NC-4.0, con acceso restringido y sin benchmarks.
• Etapa — Tiny Aya Base 32K es una base preentrenada, "no ajustada a instrucciones ni alineada con preferencias"; Tiny Aya En-Thinker está postentrenada con datos de razonamiento multilingües con trazas de razonamiento en inglés.
• Plantilla de chat — Base 32K no incluye ningún chat_template.jinja en absoluto; En-Thinker sí incluye una, y su ficha dedica una sección entera a cómo representa los turnos.
• Estilo de prompts — El propio ejemplo de Base 32K es de completado (prompt = "La capital de España es"); En-Thinker espera apply_chat_template() con una lista de mensajes.
• Modo de razonamiento — Base 32K no tiene modo de razonamiento; En-Thinker es de doble modo, añade /think de forma predeterminada y emite un rastro de pensamiento en inglés, o /no_think con enable_thinking=False para obtener una respuesta directa.
• Alcance de idiomas — La ficha de Base 32K afirma entrenamiento en más de 70 idiomas y nombra 67 explícitamente; En-Thinker cubre "44 idiomas más el inglés" con trazas de razonamiento en inglés, extendiéndose a más de 20 adicionales mediante datos adicionales de instrucción sin razonamiento.
• Huella de arquitectura — idéntica. Los mismos cuatro tamaños de shard, el mismo número de parámetros, la misma longitud del archivo de configuración.
• Contexto — entrada de 32K más salida en ambas tarjetas. Ninguna de las dos es verificable: ambas configuraciones están detrás de la barrera de licencia.
• Benchmarks — ninguno en ninguna de las dos fichas. No existe ninguna evaluación de terceros de ninguno de los dos modelos.
• Tracción — Base 32K muestra cero descargas y un «me gusta»; En-Thinker muestra siete descargas y dos «me gusta». Ninguno aparece en el catálogo de un proveedor de inferencia.
Lo que aportó el paso de post-entrenamiento
Tres cosas, todas ellas conductuales más que estructurales.
El primero es una interfaz utilizable. Un checkpoint sin plantilla de chat no es un modelo al que se le envía un prompt; es un modelo que se continúa. Cada conversación que mantengas con Base 32K tienes que serializarla tú mismo en texto, y la tarjeta lo dice: «los prompts deben usar completado de texto en lugar de una plantilla de chat. Se recomienda un postentrenamiento adicional antes de desplegarlo como asistente conversacional». En-Thinker ya ha tomado esa decisión por ti, hasta la disposición de los tokens.
El segundo es el razonamiento como interruptor. /think y /no_think de En-Thinker permiten que los mismos pesos produzcan una cadena de pensamiento visible entre etiquetas de pensamiento o respondan directamente, y la tarjeta documenta cómo pasar un bloque de pensamiento previo de vuelta a la conversación como un turno de asistente. Eso es un artefacto posterior al entrenamiento — no hay nada en un checkpoint base que responda a ello.
El tercero es la apuesta de diseño en el centro de En-Thinker: que el razonamiento ocurre en inglés incluso cuando la pregunta y la respuesta están en otro idioma. La tarjeta dice explícitamente que esto lo distingue de Tiny Aya L2-Thinker, «que piensa en el mismo idioma que el prompt». Que planificar en un idioma de altos recursos y responder en uno de bajos recursos realmente ayude es una pregunta de investigación abierta, y En-Thinker existe para que la gente lo ponga a prueba en lugar de darlo por resuelto. Base 32K, al no tener ningún modo de razonamiento, guarda silencio sobre la cuestión —que es precisamente por lo que es el control adecuado para cualquiera que intente responderla.

Cuánto costó el paso de post-entrenamiento
La respuesta sincera es que nadie puede cuantificarlo, porque no se ha evaluado ninguno de los dos modelos en nada. Pero las dos tarjetas juntas insinúan dónde reside la disyuntiva, y no es donde uno esperaría.
No se trata de cobertura de idiomas. El estrecho alcance de razonamiento de En-Thinker, de 44 idiomas más el inglés, es una propiedad de sus datos de entrenamiento de razonamiento, y la ficha dice que la cobertura se extiende a más de 20 idiomas adicionales "mediante datos de instrucción adicionales sin razonamiento" — así que el modelo aún los maneja, solo que sin la ruta de pensamiento. Tampoco es la ventana de contexto; ambos afirman 32K.
Se trata de la amplitud del comportamiento. La ficha de Base 32K enumera «preentrenamiento continuado, ajuste por instrucciones e investigación sobre modelado de lenguaje multilingüe y de contexto largo» como usos previstos, con la generación de texto multilingüe, el resumen, la traducción y la adaptación translingüística mencionados como aplicaciones posteriores. La ficha de En-Thinker es más acotada: «tareas de matemáticas, ciencias y razonamiento general, así como el seguimiento de instrucciones y la generación abierta multilingüe». Un checkpoint postentrenado tiene una postura definida de un modo en que un checkpoint base no la tiene, y la limitación que señala la ficha de Base 32K —«las tareas de razonamiento de cadena de pensamiento, como las matemáticas multilingües, son comparativamente más débiles»— es exactamente la debilidad que el postentrenamiento se propuso corregir.
Así que la familia se lee como una división del trabajo en lugar de una competencia. La base es amplia y está sin terminar; En-Thinker es estrecho y está terminado; y el texto de la propia tarjeta base lo llama por lo que es: el sustrato del que se moldearon ambos Thinkers.
La licencia es la restricción que realmente vincula.
Ambos modelos tienen licencia CC-BY-NC-4.0, con la Política de uso aceptable de Cohere Labs añadida por encima; ambos están detrás de la misma puerta que te pide aceptar los términos y registrarte antes de descargar los archivos, y ambos dirigen las consultas comerciales a Cohere Sales.
Vale la pena decirlo antes de cualquier comparación técnica, porque resuelve la cuestión para una gran parte de los lectores. Si el plan es un producto comercial, ninguno de los checkpoints es candidato sin una conversación con Cohere, y ninguna cantidad de comportamiento de contexto largo o flexibilidad del modo de razonamiento cambia eso. Cuando lo no comercial es genuinamente aceptable —trabajo académico, investigación interna, un arnés de benchmark, una comparación con tu propio modelo—, la licencia es irrelevante y la elección técnica constituye toda la decisión.
Ninguno de los dos ha sido sometido a pruebas comparativas. Aun así, aquí se explica cómo elegir.
La ausencia de números es real y no se va a resolver leyendo con más atención. Ambas tarjetas no hacen ninguna afirmación de rendimiento, ninguna tabla de clasificación incluye a ninguno de los dos modelos, y ninguno tiene un proveedor de inferencia detrás — lo que significa que ningún proveedor ha publicado el rendimiento o los precios que normalmente sustituyen a un benchmark. Lo que puedes hacer es centrarte en la estructura, donde la evidencia es sólida.
• Elige Tiny Aya Base 32K si vas a entrenar. El preentrenamiento continuado, el ajuste por instrucciones o una adaptación de dominio sobre un modelo multilingüe de 3,35B es aquello para lo que la ficha dice que sirve, y partir de un checkpoint base significa que no estás peleando contra un post-entrenamiento que no elegiste. La ventana de 32K también admite investigación de contexto largo que la base de 8K de febrero no podía.
• Elige Tiny Aya En-Thinker si quieres pedirle algo hoy. Es el único de los dos que mantendrá una conversación, y el único que tiene un modo de razonamiento, en absoluto.
• Elige ambos si la pregunta es científica más que práctica. El par es una comparación controlada —misma arquitectura, mismo tamaño, misma ventana, diferenciándose principalmente en si ocurrió el post-entrenamiento— para preguntar si los rastros de razonamiento en inglés mejoran las respuestas multilingües. Esa es la pregunta que En-Thinker se lanzó para permitir que la gente explorara, y su propio padre es la línea base más limpia.

Una nota práctica sobre la evaluación de cualquiera de los dos: son checkpoints de investigación no comprobados y sin historial de despliegue, y una descarga de 6,7 GB en BF16 más tiempo de GPU es un costo real que gastar en un modelo que nunca se ha ejecutado de forma independiente. Ejecutar esa comparación a través de un único endpoint en lugar de levantar los pesos de cada candidato es más barato: OrcaRouter ofrece 195 modelos detrás de una sola API con 0 % de recargo sobre los precios de lista de los proveedores y conmutación por error automática entre proveedores, así que un checkpoint de investigación que solo estás probando nunca queda en una ruta de producción. Tiny Aya no está ahí y nosotros no lo alojamos; el punto es solo que los modelos contra los que lo probarías en su mayoría sí están.
¿Qué resolvería esto?
Dos cosas, y ambas son baratas de publicar para Cohere Labs y costosas de producir para cualquier otro.
El primero es un benchmark —cualquier benchmark—. Una sola evaluación de razonamiento multilingüe ejecutada en ambos checkpoints convertiría a toda la familia de «declarado en la ficha» a «medido», y respondería de inmediato si el diseño de pensamiento en inglés supera al mismo modelo sin post-entrenamiento, que es la pregunta de investigación en torno a la cual está construido el lanzamiento.
El segundo es un archivo de configuración. La afirmación de 32K en ambas tarjetas es inverificable mientras los repositorios estén restringidos, y la diferencia entre un entrenamiento de preentrenamiento de contexto genuinamente largo y una extensión de codificación posicional aplicada a un checkpoint de 8K es grande en la práctica, aunque ambos produzcan un modelo que acepta 32K tokens. Abrir los dos archivos de configuración cerraría esa brecha de una manera que ningún material de marketing puede.
Hasta entonces, la respuesta precisa a "Tiny Aya Base 32K o Tiny Aya En-Thinker" es que la comparación es real, pero la competencia no. Los mismos pesos, la misma ventana, la misma licencia, el mismo silencio de todos los que no los han descargado — uno de ellos solo tiene la plantilla de chat y las etiquetas de pensamiento, y el otro es aquello de lo que fue hecho.
