Tarjeta principal titulada "North Small Translate 1.0 vs Hy-MT2-1.8B" con el subtítulo "218GB de modelo frente a 440MB", encima de dos tarjetas: North Small Translate 1.0 (218B MoE, 2x B200 como mínimo) y Hy-MT2-1.8B (1.8B denso, 440MB, se ejecuta en un teléfono) con un icono de contorno de teléfono.
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-1.8B: 218 GB de modelo frente a 440 MB

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Uno de estos cabe en un teléfono. Hy-MT2-1.8B, el modelo de traducción en dispositivo de Tencent Hunyuan, publicado como código abierto bajo Apache 2.0 el 21 de mayo de 2026, se reduce a 440 megabytes con la cuantización de 1,25 bits de AngelSlim y se ejecuta en el silicio para teléfonos de Apple, Qualcomm y MediaTek. North Small Translate 1.0, el modelo de mezcla de expertos de 218 mil millones de parámetros que Cohere documentó en sus notas de versión el 9 de septiembre de 2026, incluye un conjunto de pesos FP8 del orden de 218 gigabytes y exige como mínimo dos B200. Eso es aproximadamente quinientas veces el almacenamiento para uno de ellos, y la pregunta interesante no es cuál es mejor, sino para qué sirve realmente cada uno y qué licencia te permite distribuirlo.

La diferencia de tamaño no es una diferencia de calidad

Es tentador interpretar 218B frente a 1.8B como una clasificación directa de capacidad. No lo es, por dos razones. La primera es que North Small Translate 1.0 es un modelo disperso de mezcla de expertos con solo 25 mil millones de parámetros activos por token, por lo que el cómputo por token está en una liga distinta a la del número de parámetros. La segunda es que los dos modelos se optimizaron con objetivos diferentes: el 1.8B de Tencent se diseñó para ser lo suficientemente pequeño como para ejecutarse sin conexión en un teléfono móvil, y el modelo de Cohere se diseñó para mantener un documento entero en el contexto y traducirlo como una unidad.

Esa diferencia resulta legible en las ventanas de contexto. La configuración de Hy-MT2-1.8B anuncia hasta 262.144 posiciones, pero la propia guía de inferencia de Tencent limita la generación a 8.192 tokens; la ventana de trabajo práctica es de 8K. North Small Translate 1.0 documenta 16K de entrada y 16K de salida, lo que duplica la ventana de entrada y, más importante aún, supone 16K completos de salida. Si tu unidad de trabajo es un manual de servicio, ese presupuesto de salida es la característica clave. Si tu unidad de trabajo es un mensaje de chat, es irrelevante.

Parámetros totales — North Small Translate 1.0: 218B MoE, 25B activos frente a Hy-MT2-1.8B: 1.8B densos

Contexto — 16K de entrada y 16K de salida frente a una ventana de trabajo de 8K (la configuración anuncia hasta 262.144 posiciones; la guía de Tencent indica 8.192)

Idiomas — 50 (inglés + 49) frente a 33 idiomas más 5 lenguas minoritarias y dialectos

Licencia — CC BY-NC 4.0, uso comercial a través de Model Vault frente a Apache 2.0, sin barreras de acceso

Huella cuantizada — FP8 ~218GB, NVFP4 W4A16 ~109GB frente a 440MB en 1,25 bits, FP8 y GGUF también publicados

Hardware mínimo — 2×B200 o 4×H100 en FP8 frente a un teléfono móvil

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

Lo que Tencent realmente lanzó en los 1.8B

El 1.8B es el miembro más pequeño de una familia de tres modelos —1.8B, 7B y un buque insignia MoE de 30B-A3B—, todos lanzados juntos con un benchmark complementario llamado IFMTBench que mide el seguimiento de instrucciones de traducción en lugar de la calidad de traducción en bruto. Tencent publicó cuantizaciones FP8, GGUF, de 2 bits y de 1,25 bits junto con los pesos base, y la versión de 1,25 bits es la que produce la cifra de 440MB y una mejora de velocidad de inferencia declarada de 1,5x respecto a la generación anterior Hy-MT1.5. El servicio es compatible con transformers 5.6.0 y versiones posteriores, vLLM, SGLang y llama.cpp, con la ruta GGUF dependiendo de un kernel STQ incluido en llama.cpp. El muestreo recomendado es temperature 0.7, top_p 0.6, top_k 20, penalización por repetición 1.05, y no hay un prompt de sistema predeterminado —lo inverso del enfoque de Cohere.

También, a diferencia de North Small Translate 1.0, es un modelo con adopción visible. El repositorio de Hugging Face se ha descargado más de 23.000 veces y tiene alrededor de 1.200 me gusta. El repositorio principal de Cohere mostraba 26 descargas y cero me gusta cuando se escribió esto.

La licencia es la diferencia más marcada

Esta es la parte que debería decidir más despliegues que la tabla de referencia. Hy-MT2-1.8B es Apache 2.0 sin restricciones de acceso —uso comercial, ajuste fino, obras derivadas, redistribución, todo permitido—. North Small Translate 1.0 es CC BY-NC 4.0: los pesos son gratuitos para uso no comercial, y el despliegue comercial requiere una licencia adquirida a través de Model Vault de Cohere, para la cual no se publica ningún precio.

Dicho claramente: si estás construyendo un producto, el modelo de Tencent es el que puedes lanzar hoy sin necesidad de una conversación, y el de Cohere es el que solo puedes evaluar. Esa asimetría no hace que el modelo de Cohere sea peor, pero cambia el orden de las operaciones: evalúas el de Cohere y puedes desplegar el de Tencent.

La evidencia sobre la calidad es asimétrica, y ambas partes son reportadas por el proveedor.

Ninguno de los dos modelos cuenta con una evaluación independiente que lo respalde, así que toma cada cifra que aparece aquí como una afirmación de su creador. La diferencia está en cuánto han puesto sobre la mesa los creadores. Tencent publicó una tabla comparativa completa y un informe técnico: en la traducción de inglés a X de FLORES-200, Hy-MT2-1.8B registra 90,00 frente a los 94,42 de Gemini 3.1 Pro y los 94,16 de GPT-5.5 —modestamente por detrás de los modelos de frontera, pero a unos pocos puntos, y proveniente de un modelo que cabe en un teléfono. En la puntuación global de seguimiento de instrucciones de IFMTBench, el 1.8B se sitúa en 69,36 %, muy por detrás de su propio hermano 30B-A3B, con 85,7 %, y de Gemini 3.1 Pro, con 89,08 %, lo cual es la lectura honesta del compromiso: el modelo diminuto sigue las instrucciones de formato y terminología de manera mucho menos fiable de lo que traduce.

Cohere publicó una cifra — una puntuación de WMT26 de 83.60, que asciende a 84.36 con un flujo de trabajo agéntico de múltiples pasadas — sin ningún nombre de métrica adjunto y sin una página de resultados de WMT26 con la que verificarla. Esa no es una comparación que podamos hacer. Un solo número sin nombre no se puede confrontar con una tabla de benchmarks con nombre, y fingir lo contrario sería lo más engañoso que este artículo podría hacer.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

El contrapeso de Tencent es que sus cifras provienen de algún lugar que un lector puede inspeccionar. El repositorio de Hy-MT2 publica la descripción general de la familia, los tres tamaños de modelo y los entornos de ejecución que admite cada uno junto con la tabla de referencia, lo que hace que las cifras de FLORES-200 e IFMTBench puedan verificarse en absoluto, y lo que hace que el único número sin nombre de Cohere destaque por contraste.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Cuánto cuesta llamar a cada uno

El modelo 1.8B de Tencent tiene una API comercial alojada que se lanzó en agosto de 2026, con un precio de aproximadamente $0.044 por millón de tokens de entrada y $0.177 por millón de tokens de salida — barato en términos absolutos, y con precio por token. El modelo de Cohere funciona en el nivel gratuito de Chat V2, gratis para claves de prueba y de producción hasta que se alcanzan los límites de velocidad, por lo que el coste de evaluación es cero, pero el coste de producción es un contrato que hay que negociar. El autoalojamiento cambia la aritmética por completo: 440MB en un teléfono móvil frente a dos B200s, lo que supone una diferencia medida en órdenes de magnitud en lugar de porcentajes.

La razón por la que vale la pena mencionar esa brecha en un artículo sobre una plataforma de enrutamiento es que el nivel barato y el nivel caro no son competidores: son dos posiciones dentro de una cascada, y las cascadas son precisamente para lo que sirve un enrutador. OrcaRouter transfiere el precio de lista del proveedor con un 0 % de margen, por lo que una rebaja de precio de un proveedor en un endpoint de traducción alojado se refleja en nuestro lado el mismo día, sin margen de intermediario que renegociar, y las cadenas de conmutación por error permiten que un modelo más pequeño absorba la mayor parte del tráfico mientras que un modelo más pesado asume las solicitudes en las que aquel falla. Prueba primero el barato, escala en los casos difíciles y deja que la capa de enrutamiento sea la que sostenga la política en lugar del código de tu aplicación.

Cuál deberías elegir

Si tu traducción se realiza en un dispositivo, sin conexión, con un presupuesto de almacenamiento por megabyte, o dentro de un producto comercial sin interés en negociar una licencia, Hy-MT2-1.8B es la respuesta y North Small Translate 1.0 no entra en consideración. Si tu unidad de trabajo es un documento largo en uno de los cincuenta idiomas que admite Cohere, si necesitas 16K de salida en una sola pasada, y si una licencia comercial es algo que tu organización está dispuesta a comprar, entonces el modelo de Cohere es la máquina más capaz en todas las dimensiones divulgadas — con la salvedad de que su calidad se basa en una única cifra no reproducida.

Y para la mayoría de los equipos, la respuesta honesta es ambas, en ese orden: el modelo de 440MB hace el trabajo rutinario a un costo ínfimo, el modelo de 218B se encarga de los documentos que importan, y la decisión sobre qué solicitud va a dónde es una regla de enrutamiento y no una reescritura. La brecha entre estos dos modelos no es una brecha que deba cerrarse. Es un espectro que debe aprovecharse.