Tarjeta hero titulada «North Small Translate 1.0 vs Hy-MT2», con el subtítulo «Dos traductores MoE, una brecha de evidencia», encima de dos tarjetas: North Small Translate 1.0 (218B MoE / 25B activos, una única cifra WMT26 sin identificar) y Hy-MT2-30B-A3B (30B MoE / 3B activos, artículo, benchmark, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs. Hy-MT2: dos traductores MoE, una brecha de evidencia

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ambas familias se construyeron sobre la misma apuesta —que una red de mezcla de expertos dispersa con postentrenamiento para traducción supera a un modelo de propósito general al que se le pide traducir—, y llegaron a ella desde direcciones opuestas. Hy-MT2, la familia de traducción de tres modelos de Tencent Hunyuan encabezada por el Hy-MT2-30B-A3B MoE, se publicó como código abierto el 21 de mayo de 2026 bajo Apache 2.0 con un informe técnico, un benchmark de código abierto y una tabla comparativa completa. North Small Translate 1.0, el traductor MoE de Cohere de 218 mil millones de parámetros y 25 mil millones activos, se documentó en una nota de versión fechada el 9 de septiembre de 2026, y su evidencia de calidad se reduce a un único número sin ninguna métrica asociada. Las arquitecturas riman. La documentación no, y esa diferencia es lo más útil que hay que entender antes de elegir cualquiera de las dos.

Una familia, tres tamaños frente a un único modelo grande

Hy-MT2 no es un único modelo, sino una familia: un modelo denso de 1.8B para trabajo en dispositivo, un modelo denso de 7B para una sola GPU y el MoE de 30B-A3B como buque insignia, con tres mil millones de parámetros activos por token. Los tres son Apache 2.0, sin restricciones, y se publican junto con cuantizaciones FP8, GGUF, de 2 bits y de 1.25 bits, además del benchmark de seguimiento de instrucciones IFMTBench y un artículo complementario. Tencent informa que la familia traduce entre 33 idiomas, además de cinco lenguas minoritarias y dialectos.

North Small Translate 1.0 es un único punto en el espacio de tamaños, y uno grande: 218B de parámetros totales, 25B activos, 128 expertos con ocho activados por token, además de expertos compartidos, y atención que alterna en una proporción de 3:1 entre capas de ventana deslizante (ventana de 4.096, RoPE) y capas globales que no llevan embeddings posicionales. Su ventana es de 16K de entrada y 16K de salida en inglés y otros 49 idiomas, con árabe estándar moderno, alemán, francés, japonés, coreano, ruso y ucraniano designados como de nivel uno. Cabe destacar que la forma no es nueva —Command A+ de Cohere, de mayo de 2026, usó la misma configuración de 218B/25B—, lo que convierte esto en un postentrenamiento especializado en traducción de un núcleo existente en lugar de una arquitectura nueva.

Parámetros — North Small Translate 1.0: 218B en total / 25B activos frente a Hy-MT2-30B-A3B: 30B en total / 3B activos, con hermanos densos de 1.8B y 7B

Contexto — 16K de entrada y 16K de salida frente a una ventana de trabajo de 8K, la configuración anuncia hasta 262.144 posiciones

Idiomas — 50 (inglés + 49) frente a 33 más 5 lenguas minoritarias y dialectos

Licencia — CC BY-NC 4.0, uso comercial a través de Model Vault frente a Apache 2.0, sin barreras de acceso

Evidencia publicada — una única cifra anónima de WMT26, datos reportados por el proveedor frente a un informe técnico, un benchmark abierto y resultados con nombre en FLORES-200, WMT25 GEMBA y XCOMET-XXL

Servicio — vLLM con cohere_melody>=0.9.0, se recomienda decodificación greedy frente a transformers, vLLM, SGLang y llama.cpp

Anunciado — 9 de septiembre de 2026 (pesos con acceso restringido en Hugging Face desde el 14 de agosto) vs. 21 de mayo de 2026

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

La brecha de evidencia es la verdadera historia

El lanzamiento de Tencent llegó con pruebas. Hay un artículo en arXiv, un benchmark que la empresa escribió y publicó como código abierto específicamente para medir el seguimiento de instrucciones de traducción, y una tabla de resultados que nombra a sus competidores. FLORES-200 de inglés a X sitúa al 30B-A3B en 93,85 frente a Gemini 3.1 Pro con 94,42 y GPT-5.5 con 94,16. La métrica GEMBA de la era WMT25 lo sitúa en 84,34 —la puntuación más alta en la propia comparación de Tencent, por delante de GPT-5.5 con 83,41 y 83,29 en sus dos modos, Gemini 3.1 Pro con 82,23, DeepSeek-V4-Pro con 81,99 y Kimi K2.6 con 81,68. XCOMET-XXL lo sitúa en 62,89, por detrás de su propio modelo hermano de 7B. En IFMTBench alcanza un 85,7 % de seguimiento de instrucciones general, con una subpuntuación de 91,94 % que se queda a una centésima de punto de Gemini 3.1 Pro y otra subpuntuación, 85,55 %, en la que supera directamente al modelo Gemini 3.1 Pro.

Cada una de esas es una medición propia de Tencent y ninguna ha sido reproducida de forma independiente. Pero tienen nombre, son comparables y son falsables — un lector sabe exactamente qué prueba ejecutar para rebatirlas.

La nota de publicación de Cohere ofrece una sola cifra: WMT26 83.60, que sube a 84.36 bajo lo que denomina un flujo de trabajo de traducción agéntico de múltiples pasadas. No se nombra ninguna métrica en ninguna parte de la ficha del modelo ni en la documentación. No se ha publicado ninguna página de resultados de WMT26 para este modelo. El corpus de entrenamiento, el recuento de tokens y el canal de datos no se revelan, mientras que el informe técnico de 2025 de Command A Translate había descrito en detalle una técnica de filtrado por dificultad. Nada de eso es evidencia de un modelo peor. Es evidencia de menos evidencia, lo cual es algo distinto e importa igual cuando estás decidiendo qué poner en producción.

La vara de medir compartida que ninguna de las partes ha publicado en realidad

Hay un único punto de contacto real entre ambas, y merece un párrafo porque es el único lugar donde podría darse una comparación justa. Tencent es socio de WMT26, patrocina una tarea de traducción de subtítulos de vídeo con premios financiados por Hunyuan. La única cifra publicada por Cohere es una cifra de WMT26. Así que ambas organizaciones están dentro del mismo ciclo de evaluación de 2026, y la única métrica en la que podría resolverse una comparación directa es precisamente aquella en la que solo una de ellas ha publicado algo —y lo ha publicado sin nombrar la métrica.

Esa es la brecha que hay que vigilar. Si Cohere asigna un nombre de métrica al 83.60, o si las páginas de resultados de WMT26 incluyen un sistema North Small Translate, la comparación se vuelve real. Hasta entonces, contraponer los números de FLORES-200 y GEMBA de Tencent con la cifra de WMT26 sin etiquetar de Cohere sería una fabricación disfrazada de análisis.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Licencia e implementación

Hy-MT2 es Apache 2.0 sin gating: uso comercial, ajuste fino, derivados y redistribución, todo sin necesidad de conversación. North Small Translate 1.0 es CC BY-NC 4.0, gratuito para uso no comercial, con el despliegue comercial canalizado a través de Model Vault de Cohere a un precio que no se publica. Para cualquier cosa que se entregue a clientes, esa diferencia resuelve la decisión antes de leer los benchmarks.

La historia del hardware sigue el mismo patrón a la inversa. Hy-MT2 abarca desde una compilación cuantizada de 440 MB que se ejecuta en un teléfono móvil hasta el 30B-A3B, cuyos tres mil millones de parámetros activos mantienen modesto el cómputo por token para su nivel de calidad; los entornos de ejecución cubren transformers, vLLM, SGLang y llama.cpp. North Small Translate 1.0 publica el hardware mínimo por checkpoint —cuatro B200 u ocho H100 para BF16, dos B200 o cuatro H100 para FP8, una B200 o dos H100 para NVFP4 W4A16— y recomienda la decodificación greedy para igualar producción. La ventaja compensatoria de Cohere es que el modelo se ejecuta en el nivel gratuito de su API Chat V2, gratis para claves de prueba y de producción hasta alcanzar los límites de velocidad, por lo que evaluarlo no cuesta nada.

¿Deberías cambiar, y a qué?

La cuestión del cambio es genuinamente asimétrica aquí. Pasar de Hy-MT2 a North Small Translate 1.0 no es una mejora de rendimiento que puedas justificar actualmente — es una apuesta por un modelo cuya única afirmación pública es un solo número, sopesada frente a una familia con un informe publicado y una licencia desplegable. Lo que sí vale la pena hacer es evaluar: al modelo de Cohere se puede llamar gratis, cubre cincuenta idiomas, incluido un conjunto europeo más amplio, y te da 16K de salida por pasada, algo que la ventana de trabajo de 8K de Hy-MT2 no ofrece.

Esa evaluación es el caso en el que una capa de enrutamiento se gana su lugar, porque la respuesta honesta para la mayoría de los stacks multilingües es que ambos modelos se quedan. OrcaRouter pone un catálogo de más de 200 modelos detrás de una sola clave, así que probar un segundo modelo de traducción es un cambio de configuración y no un segundo contrato con un proveedor ni un cambio de código: apuntas el mismo cliente compatible con OpenAI a un id de modelo distinto y comparas con tu propio texto. El precio de lista del proveedor se traslada con un 0 % de recargo, así que un cambio de precio del proveedor alojado está activo en nuestro lado el mismo día, sin ningún margen añadido por encima, y las cadenas de conmutación por error mantienen producción en el modelo que ya funciona mientras se evalúa el nuevo. Ni North Small Translate 1.0 ni Hy-MT2 están hoy en nuestro catálogo, así que esto no es una recomendación de comprar ninguno de los dos a nosotros: es el argumento para no fijar la decisión de forma rígida antes de haber hecho la prueba.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

El veredicto

El Hy-MT2 de Tencent es la opción más segura y, según la evidencia, no hay comparación: Apache 2.0, tres tamaños, un artículo, un benchmark abierto, cuatro suites de evaluación con nombre y una alianza con WMT26. El North Small Translate 1.0 de Cohere es el más interesante: 218 mil millones de parámetros de MoE específicos para traducción tras una ventana de salida de 16K y cincuenta idiomas, un nivel de evaluación gratuito y un 83.60 que nadie fuera de Cohere ha verificado.

Si necesitas una decisión este trimestre, elige a la familia que tiene las pruebas. Si tienes un corpus y una semana, haz pasar una parte por el nivel gratuito y averigua si el 83.60 sin nombre de Cohere significa algo en tus documentos — porque esa es una pregunta que ninguna tabla de proveedor responderá por ti, y el único número que Cohere decidió publicar es precisamente el que se negó a nombrar.