
North Small Translate 1.0 vs. Hy-MT2: dos traductores MoE, una brecha de evidencia
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Ambas familias se construyeron sobre la misma apuesta —que una red de mezcla de expertos dispersa con postentrenamiento para traducción supera a un modelo de propósito general al que se le pide traducir—, y llegaron a ella desde direcciones opuestas. Hy-MT2, la familia de traducción de tres modelos de Tencent Hunyuan encabezada por el Hy-MT2-30B-A3B MoE, se publicó como código abierto el 21 de mayo de 2026 bajo Apache 2.0 con un informe técnico, un benchmark de código abierto y una tabla comparativa completa. North Small Translate 1.0, el traductor MoE de Cohere de 218 mil millones de parámetros y 25 mil millones activos, se documentó en una nota de versión fechada el 9 de septiembre de 2026, y su evidencia de calidad se reduce a un único número sin ninguna métrica asociada. Las arquitecturas riman. La documentación no, y esa diferencia es lo más útil que hay que entender antes de elegir cualquiera de las dos.
Una familia, tres tamaños frente a un único modelo grande
Hy-MT2 no es un único modelo, sino una familia: un modelo denso de 1.8B para trabajo en dispositivo, un modelo denso de 7B para una sola GPU y el MoE de 30B-A3B como buque insignia, con tres mil millones de parámetros activos por token. Los tres son Apache 2.0, sin restricciones, y se publican junto con cuantizaciones FP8, GGUF, de 2 bits y de 1.25 bits, además del benchmark de seguimiento de instrucciones IFMTBench y un artículo complementario. Tencent informa que la familia traduce entre 33 idiomas, además de cinco lenguas minoritarias y dialectos.
North Small Translate 1.0 es un único punto en el espacio de tamaños, y uno grande: 218B de parámetros totales, 25B activos, 128 expertos con ocho activados por token, además de expertos compartidos, y atención que alterna en una proporción de 3:1 entre capas de ventana deslizante (ventana de 4.096, RoPE) y capas globales que no llevan embeddings posicionales. Su ventana es de 16K de entrada y 16K de salida en inglés y otros 49 idiomas, con árabe estándar moderno, alemán, francés, japonés, coreano, ruso y ucraniano designados como de nivel uno. Cabe destacar que la forma no es nueva —Command A+ de Cohere, de mayo de 2026, usó la misma configuración de 218B/25B—, lo que convierte esto en un postentrenamiento especializado en traducción de un núcleo existente en lugar de una arquitectura nueva.
• Parámetros — North Small Translate 1.0: 218B en total / 25B activos frente a Hy-MT2-30B-A3B: 30B en total / 3B activos, con hermanos densos de 1.8B y 7B
• Contexto — 16K de entrada y 16K de salida frente a una ventana de trabajo de 8K, la configuración anuncia hasta 262.144 posiciones
• Idiomas — 50 (inglés + 49) frente a 33 más 5 lenguas minoritarias y dialectos
• Licencia — CC BY-NC 4.0, uso comercial a través de Model Vault frente a Apache 2.0, sin barreras de acceso
• Evidencia publicada — una única cifra anónima de WMT26, datos reportados por el proveedor frente a un informe técnico, un benchmark abierto y resultados con nombre en FLORES-200, WMT25 GEMBA y XCOMET-XXL
• Servicio — vLLM con cohere_melody>=0.9.0, se recomienda decodificación greedy frente a transformers, vLLM, SGLang y llama.cpp
• Anunciado — 9 de septiembre de 2026 (pesos con acceso restringido en Hugging Face desde el 14 de agosto) vs. 21 de mayo de 2026

La brecha de evidencia es la verdadera historia
El lanzamiento de Tencent llegó con pruebas. Hay un artículo en arXiv, un benchmark que la empresa escribió y publicó como código abierto específicamente para medir el seguimiento de instrucciones de traducción, y una tabla de resultados que nombra a sus competidores. FLORES-200 de inglés a X sitúa al 30B-A3B en 93,85 frente a Gemini 3.1 Pro con 94,42 y GPT-5.5 con 94,16. La métrica GEMBA de la era WMT25 lo sitúa en 84,34 —la puntuación más alta en la propia comparación de Tencent, por delante de GPT-5.5 con 83,41 y 83,29 en sus dos modos, Gemini 3.1 Pro con 82,23, DeepSeek-V4-Pro con 81,99 y Kimi K2.6 con 81,68. XCOMET-XXL lo sitúa en 62,89, por detrás de su propio modelo hermano de 7B. En IFMTBench alcanza un 85,7 % de seguimiento de instrucciones general, con una subpuntuación de 91,94 % que se queda a una centésima de punto de Gemini 3.1 Pro y otra subpuntuación, 85,55 %, en la que supera directamente al modelo Gemini 3.1 Pro.
Cada una de esas es una medición propia de Tencent y ninguna ha sido reproducida de forma independiente. Pero tienen nombre, son comparables y son falsables — un lector sabe exactamente qué prueba ejecutar para rebatirlas.
La nota de publicación de Cohere ofrece una sola cifra: WMT26 83.60, que sube a 84.36 bajo lo que denomina un flujo de trabajo de traducción agéntico de múltiples pasadas. No se nombra ninguna métrica en ninguna parte de la ficha del modelo ni en la documentación. No se ha publicado ninguna página de resultados de WMT26 para este modelo. El corpus de entrenamiento, el recuento de tokens y el canal de datos no se revelan, mientras que el informe técnico de 2025 de Command A Translate había descrito en detalle una técnica de filtrado por dificultad. Nada de eso es evidencia de un modelo peor. Es evidencia de menos evidencia, lo cual es algo distinto e importa igual cuando estás decidiendo qué poner en producción.
La vara de medir compartida que ninguna de las partes ha publicado en realidad
Hay un único punto de contacto real entre ambas, y merece un párrafo porque es el único lugar donde podría darse una comparación justa. Tencent es socio de WMT26, patrocina una tarea de traducción de subtítulos de vídeo con premios financiados por Hunyuan. La única cifra publicada por Cohere es una cifra de WMT26. Así que ambas organizaciones están dentro del mismo ciclo de evaluación de 2026, y la única métrica en la que podría resolverse una comparación directa es precisamente aquella en la que solo una de ellas ha publicado algo —y lo ha publicado sin nombrar la métrica.
Esa es la brecha que hay que vigilar. Si Cohere asigna un nombre de métrica al 83.60, o si las páginas de resultados de WMT26 incluyen un sistema North Small Translate, la comparación se vuelve real. Hasta entonces, contraponer los números de FLORES-200 y GEMBA de Tencent con la cifra de WMT26 sin etiquetar de Cohere sería una fabricación disfrazada de análisis.

Licencia e implementación
Hy-MT2 es Apache 2.0 sin gating: uso comercial, ajuste fino, derivados y redistribución, todo sin necesidad de conversación. North Small Translate 1.0 es CC BY-NC 4.0, gratuito para uso no comercial, con el despliegue comercial canalizado a través de Model Vault de Cohere a un precio que no se publica. Para cualquier cosa que se entregue a clientes, esa diferencia resuelve la decisión antes de leer los benchmarks.
La historia del hardware sigue el mismo patrón a la inversa. Hy-MT2 abarca desde una compilación cuantizada de 440 MB que se ejecuta en un teléfono móvil hasta el 30B-A3B, cuyos tres mil millones de parámetros activos mantienen modesto el cómputo por token para su nivel de calidad; los entornos de ejecución cubren transformers, vLLM, SGLang y llama.cpp. North Small Translate 1.0 publica el hardware mínimo por checkpoint —cuatro B200 u ocho H100 para BF16, dos B200 o cuatro H100 para FP8, una B200 o dos H100 para NVFP4 W4A16— y recomienda la decodificación greedy para igualar producción. La ventaja compensatoria de Cohere es que el modelo se ejecuta en el nivel gratuito de su API Chat V2, gratis para claves de prueba y de producción hasta alcanzar los límites de velocidad, por lo que evaluarlo no cuesta nada.
¿Deberías cambiar, y a qué?
La cuestión del cambio es genuinamente asimétrica aquí. Pasar de Hy-MT2 a North Small Translate 1.0 no es una mejora de rendimiento que puedas justificar actualmente — es una apuesta por un modelo cuya única afirmación pública es un solo número, sopesada frente a una familia con un informe publicado y una licencia desplegable. Lo que sí vale la pena hacer es evaluar: al modelo de Cohere se puede llamar gratis, cubre cincuenta idiomas, incluido un conjunto europeo más amplio, y te da 16K de salida por pasada, algo que la ventana de trabajo de 8K de Hy-MT2 no ofrece.
Esa evaluación es el caso en el que una capa de enrutamiento se gana su lugar, porque la respuesta honesta para la mayoría de los stacks multilingües es que ambos modelos se quedan. OrcaRouter pone un catálogo de más de 200 modelos detrás de una sola clave, así que probar un segundo modelo de traducción es un cambio de configuración y no un segundo contrato con un proveedor ni un cambio de código: apuntas el mismo cliente compatible con OpenAI a un id de modelo distinto y comparas con tu propio texto. El precio de lista del proveedor se traslada con un 0 % de recargo, así que un cambio de precio del proveedor alojado está activo en nuestro lado el mismo día, sin ningún margen añadido por encima, y las cadenas de conmutación por error mantienen producción en el modelo que ya funciona mientras se evalúa el nuevo. Ni North Small Translate 1.0 ni Hy-MT2 están hoy en nuestro catálogo, así que esto no es una recomendación de comprar ninguno de los dos a nosotros: es el argumento para no fijar la decisión de forma rígida antes de haber hecho la prueba.

El veredicto
El Hy-MT2 de Tencent es la opción más segura y, según la evidencia, no hay comparación: Apache 2.0, tres tamaños, un artículo, un benchmark abierto, cuatro suites de evaluación con nombre y una alianza con WMT26. El North Small Translate 1.0 de Cohere es el más interesante: 218 mil millones de parámetros de MoE específicos para traducción tras una ventana de salida de 16K y cincuenta idiomas, un nivel de evaluación gratuito y un 83.60 que nadie fuera de Cohere ha verificado.
Si necesitas una decisión este trimestre, elige a la familia que tiene las pruebas. Si tienes un corpus y una semana, haz pasar una parte por el nivel gratuito y averigua si el 83.60 sin nombre de Cohere significa algo en tus documentos — porque esa es una pregunta que ninguna tabla de proveedor responderá por ti, y el único número que Cohere decidió publicar es precisamente el que se negó a nombrar.
