Tarjeta principal titulada "North Small Translate 1.0 vs Hy-MT2-7B" con el subtítulo "Una GPU contra dos B200s", sobre dos tarjetas: North Small Translate 1.0 (218B MoE / 25B activos, CC BY-NC 4.0) y Hy-MT2-7B (8B denso, unos 16 GB de VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: Una GPU contra dos B200s

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El enfrentamiento más parejo en traducción abierta en este momento también podría ser el menos obvio. Hy-MT2-7B es el hijo mediano de la familia de traducción de Tencent Hunyuan, publicado como código abierto bajo Apache 2.0 el 21 de mayo de 2026, y se ejecuta en una sola RTX 4090 o A100 con unos 16 GB de VRAM. North Small Translate 1.0 es el traductor de Cohere con mezcla dispersa de expertos y 218 mil millones de parámetros, documentado en las notas de la versión de la empresa del 9 de septiembre de 2026, con un despliegue mínimo de dos B200 en FP8 o una B200 en su forma NVFP4 W4A16. Ambos son especialistas en traducción. Ambos son actuales. Uno de ellos se puede servir desde una estación de trabajo, y ese único hecho reencuadra toda la comparación, porque el benchmark donde más querrían ser evaluados en igualdad de condiciones no existe.

Empieza por el sobre, no por las puntuaciones

El costo de despliegue es la dimensión que decide la mayoría de las integraciones reales y, aquí, los dos modelos no están ni cerca. Hy-MT2-7B es un modelo denso HunYuanDenseV1 de aproximadamente ocho mil millones de parámetros, con compilaciones FP8 y GGUF publicadas, además de versiones MLX de 8 bits de la comunidad para Apple silicon. Las notas de despliegue de Tencent enumeran transformers 5.6.0 o posterior, vLLM, SGLang y llama.cpp como entornos de ejecución compatibles, y la guía de inferencia limita la generación a 8192 tokens, aunque la configuración anuncia hasta 262.144 posiciones. Una única GPU moderna de consumo o de estación de trabajo es suficiente.

North Small Translate 1.0 es un tipo diferente de objeto. Sus 218B parámetros totales con 25B activos se reparten entre 128 expertos con ocho activos por token más expertos compartidos, y Cohere publica el hardware mínimo para cada uno de sus tres checkpoints: cuatro B200 o ocho H100 para BF16, dos B200 o cuatro H100 para FP8, un B200 o dos H100 para la compilación NVFP4 W4A16. El servicio se ejecuta a través de vLLM con cohere_melody>=0.9.0, y Cohere recomienda decodificación greedy para igualar la producción. La salida lleva <|START_TEXT|> y <|END_TEXT|> marcadores que no están registrados como tokens especiales.

Forma — North Small Translate 1.0: 218B en total / 25B activos de MoE disperso, 128 expertos frente a Hy-MT2-7B: denso, aproximadamente 8B

Contexto — 16K de entrada y 16K de salida frente a una ventana de trabajo de 8K, la configuración anuncia hasta 262.144 posiciones

Hardware mínimo — 1×B200 en W4A16, 2×B200 o 4×H100 en FP8 frente a una única GPU de la clase RTX 4090 en ~16GB

Formatos publicados — BF16, FP8, NVFP4 W4A16 vs base, FP8, GGUF, más MLX 8-bit de la comunidad

Idiomas — 50 (inglés + 49) frente a 33 idiomas más 5 lenguas minoritarias y dialectos

Licencia — CC BY-NC 4.0, uso comercial a través de Model Vault frente a Apache 2.0, sin barreras de acceso

Calidad reportada — WMT26 83.60, métrica sin nombre, reportado por el proveedor frente a tablas de proveedores nombrados en FLORES-200, WMT25 GEMBA, XCOMET-XXL e IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

El problema de referencia

Este es el núcleo honesto de esta comparación: no podemos clasificar estos dos modelos uno frente al otro, y quien te diga lo contrario se está inventando un número. Tencent publicó cuatro evaluaciones con nombre. En traducción de inglés a X de FLORES-200, el 7B obtiene 93.52, por detrás del 94.42 de Gemini 3.1 Pro y del 94.16 de GPT-5.5, pero lo bastante cerca como para ser relevante. En la métrica GEMBA adyacente a WMT25, obtiene 82.24 frente al 84.34 del 30B-A3B y al 83.41 de GPT-5.5. En XCOMET-XXL lidera todo en la tabla comparativa de Tencent con 63.86 — por delante de Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro y Kimi K2.6. En la puntuación de seguimiento de instrucciones de IFMTBench, alcanza el 83.14 %. Todas estas son cifras de la propia Tencent, ninguna ha sido reproducida de forma independiente, y siguen siendo mucho más de lo que ha ofrecido Cohere.

Cohere publicó una única cifra: una puntuación de 83,60 en WMT26, que asciende a 84,36 bajo un flujo de trabajo agéntico de múltiples pasadas. No se nombra ninguna métrica en la ficha del modelo ni en la nota de lanzamiento, y no se ha publicado ninguna página de resultados de WMT26 para este modelo. Esa asimetría no es prueba de que el modelo de Cohere sea más débil o más fuerte. Significa que la comparación que más desea un lector —misma prueba, misma métrica, ambos modelos— no puede hacerse a partir de evidencia pública, y la dispersión de cuatro puntos dentro de las propias dos cifras de Cohere (de 83,60 a 84,36) ya es mayor que la mayoría de las diferencias en la tabla de Tencent.

Idiomas y el documento extenso

North Small Translate 1.0 cubre cincuenta idiomas y variantes locales, con el árabe estándar moderno, el alemán, el francés, el japonés, el coreano, el ruso y el ucraniano designados de nivel uno, y acepta y emite 16.000 tokens en ambos lados. Hy-MT2-7B cubre treinta y tres idiomas más cinco lenguas minoritarias y dialectos, incluidos el tibetano, el uigur y el cantonés. Ninguna de las dos listas es un superconjunto de la otra —Tencent llega al cantonés y al uigur, Cohere llega a un conjunto más amplio de configuraciones regionales europeas—, por lo que una implementación multilingüe puede descubrir que necesita ambas solo por motivos de cobertura.

La ventana de salida es la diferencia más discreta. Dieciséis mil tokens de salida significan un documento de procedimiento completo en una sola pasada, con terminología y registro consistentes en todo el documento porque el modelo lo vio todo. Una ventana de 8K no lo hace, y la solución provisional oración por oración reintroduce exactamente los problemas de consistencia entre segmentos que benchmarks de seguimiento de instrucciones de traducción como IFMTBench fueron creados para medir.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

La licencia, de nuevo, decide más que la tabla

North Small Translate 1.0 es CC BY-NC 4.0. Los pesos son gratuitos para trabajo no comercial, y el despliegue comercial se realiza a través del Model Vault de Cohere bajo una licencia adquirida sin precio publicado. Hy-MT2-7B es Apache 2.0 y sin restricciones — el uso comercial, el ajuste fino y las obras derivadas están permitidos sin necesidad de hablar con nadie. Para un producto comercial, el orden de las operaciones se escribe solo: Hy-MT2-7B es desplegable hoy y el modelo de Cohere es evaluable hoy, y ninguna fila de benchmark cambia ese orden.

La ventaja compensatoria de Cohere es el nivel gratuito. North Small Translate 1.0 funciona en el nivel gratuito de Chat V2, gratis tanto para claves de prueba como de producción hasta que se alcancen los límites de velocidad, por lo que una evaluación no cuesta nada más que tiempo. Hy-MT2-7B tiene una API comercial alojada —Tencent fijó el precio del nivel alojado de la familia en aproximadamente $0,044 por millón de tokens de entrada y $0,177 por millón de tokens de salida—, y el autoalojamiento en tu propia GPU es la vía verdaderamente gratuita.

Qué implica realmente el "multi-pass"

La decisión de Cohere de publicar tanto un 83.60 como un 84.36 es el detalle más informativo de su nota de lanzamiento, porque indica que la empresa cree que un flujo de trabajo supera a una sola llamada. Esa es la misma apuesta que hizo Tencent con un mecanismo distinto: su modelo insignia 30B-A3B gana en GEMBA y XCOMET, mientras que Gemini 3.1 Pro gana en FLORES-200, lo que significa que el mejor sistema no es un modelo, sino un panel. La fusión de modelos de OrcaRouter ejecuta varios modelos como un panel y concilia sus respuestas dentro de una sola llamada, lo que es la versión a nivel de plataforma de la idea de múltiples pasadas que ambos proveedores persiguen, y se compone con el lado del enrutamiento, donde una sola clave cubre un catálogo de más de 200 modelos al precio de lista del proveedor con 0% de recargo, así que un cambio de precio de un proveedor repercute en nuestro lado el mismo día en lugar de en la próxima renovación del contrato.

Ese enfoque también resuelve el problema de la evidencia con el que abría este artículo. Cuando dos proveedores publican benchmarks que no se solapan y ninguno cuenta con una evaluación independiente, la forma de elegir no es confiar en una tabla. Es ejecutar ambos con tus propios documentos y dejar que la discrepancia salga a la luz sobre texto real, que es exactamente para lo que sirven un panel y una cadena de conmutación por error.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

¿Cuál, y cuándo?

Si necesitas un modelo de traducción que funcione en hardware que ya posees, en un producto comercial, sin mantener una conversación sobre licencias, Hy-MT2-7B gana solo por la fuerza de su envoltura — y sus resultados publicados por el proveedor, aunque no estén reproducidos, al menos están nombrados, son comparables y cercanos a la frontera. Si traduces documentos largos a los cincuenta idiomas de Cohere, necesitas 16K de salida consistente por pasada, y tienes ya sea un presupuesto de dos B200 o la disposición de ejecutar la evaluación en el nivel gratuito de Cohere antes de decidir, North Small Translate 1.0 es la máquina más capaz en todos los ejes divulgados.

Lo que ninguno de los dos modelos hace es eliminar la necesidad de hacer pruebas. Cohere te ha dado un único número sin nombre y una forma gratuita de comprobarlo. Tencent te ha dado una tabla y una descarga del tamaño de una GPU. El 83,60 es una promesa, no un resultado —y el único lugar donde esa promesa se resuelve es en tu propio corpus.