
Tencent HY-MT2 1.8B obtiene una API alojada: el traductor de 440MB de Tencent llega a la nube
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 426 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Tencent HY-MT2 1.8B, el miembro compacto de la familia de traducción Hy-MT2 que Tencent Hunyuan publicó como código abierto el 21 de mayo de 2026, ahora se puede invocar a través de una API comercial alojada en lugar de solo autohospedada: la publicación de la API del modelo se activó el 20 de agosto de 2026, a aproximadamente 0,044 $ por millón de tokens de entrada y 0,177 $ por millón de tokens de salida. Esa fecha de publicación importa más de lo habitual, porque el 1.8B nunca fue simplemente otro checkpoint abierto: es el modelo que Tencent construyó para demostrar que un modelo de traducción cuantizado de 440 MB puede ejecutarse por completo en un teléfono, y en los tres meses desde el lanzamiento de código abierto también se ha incluido en el miniprograma HyTranslate de Tencent y en las aplicaciones de iOS y Android que le siguieron. Este artículo trata sobre qué cambia el lanzamiento de la API alojada, qué es realmente el modelo y en qué cifras deberías confiar.
Qué cambió realmente el 20 de agosto
Hasta ahora, usar Tencent HY-MT2 1.8B implicaba una de dos cosas: cargar tú mismo los pesos Apache-2.0 en transformers, vLLM, SGLang o llama.cpp, o usar los productos de traducción de consumo de Tencent. La API alojada es una tercera vía: envías texto por HTTP y Tencent Cloud sirve el endpoint de 1.8B. El modelo conserva su contexto de 8192 tokens y una salida máxima de 4096 tokens, solo procesa texto, y tiene un precio de aproximadamente 0,044 dólares por millón de tokens de entrada y 0,177 dólares por millón de tokens de salida. Para equipos cuyo volumen de traducción es irregular, eso elimina la barrera de "tener que operar una GPU" para probar el modelo.

La otra mitad de la historia son las aplicaciones. El miniprograma HyTranslate se lanzó junto con la versión de código abierto en mayo, con entrada de voz, ajustes predefinidos de estilo y modo sin conexión. Las aplicaciones para iOS y Android — que descargan el modelo en el dispositivo para traducir sin conexión a la red — ya se han publicado. El modelo de 1.8B es el caballo de batalla de esa historia sin conexión: con la cuantización extrema de 1.25 bits de AngelSlim, se reduce a unos 440 MB de almacenamiento y se ejecuta localmente en los chips de teléfonos de Apple, Qualcomm y MediaTek, con Tencent informando de una inferencia 1.5 veces más rápida que la compilación de 4 bits de la generación anterior en un Apple A15.
¿Qué es el 1.8B?
HY-MT2-1.8B es un LM causal denso, solo decoder, construido sobre la arquitectura hunyuan_v1_dense — alrededor de 2 mil millones de parámetros en la práctica a pesar del nombre 1.8B — con una plantilla de chat y sin aviso de sistema predeterminado. Traduce entre 33 idiomas más cinco pares de lenguas minoritarias y dialectos, incluidos chino, inglés, japonés, coreano, francés, español, ruso, árabe, tailandés, vietnamita, indonesio, hindi, bengalí, tamil, y los pares de dialectos tibetano, uigur, kazajo, mongol y cantonés. A diferencia de los modelos clásicos de traducción codificador-decodificador, está ajustado por instrucciones: se le solicita con el idioma de destino e instrucciones opcionales, y puede preservar la estructura JSON y HTML, respetar un glosario, ajustarse a un registro y usar el contexto circundante para desambiguar. Esa clase de capacidad es la que comparten los modelos hermanos 7B y 30B-A3B, y la que el punto de referencia IFMTBench de Tencent fue lanzado para evaluar.
Dónde se sitúan los benchmarks
Las afirmaciones sobre calidad merecen leerse con atención porque casi todas son de Tencent y no han sido reproducidas por un laboratorio independiente hasta el momento de redactar este texto. Tencent reporta que HY-MT2-1.8B alcanza el 89,9 % de la puntuación media de FLORES-200 de Gemini 3.1 Pro (el de 7B con el 97,9 %, el de 30B-A3B con el 98,6 %), el 96,7 % del resultado de Gemini en su conjunto de pruebas del mundo real de estilo GEMBA y el 96,2 % en DomainMTBench en ocho dominios profesionales. Alguna cobertura de prensa redondeó a la baja la cifra de FLORES-200 hasta el 88,1 %; el README del proveedor indica el 89,9 %. Tencent también afirma que el modelo de 1.8B, en general, supera a las principales API comerciales de traducción de proveedores como Microsoft y Doubao. Aún no existen reproducciones independientes, por lo que conviene tratar todo eso como evidencia direccional reportada por el proveedor, no como un hecho auditado. Lo que no depende del proveedor: el conjunto de idiomas 33+5 es fijo, la licencia Apache-2.0 es real y un checkpoint cuantizado de 440MB que se ejecuta en un teléfono es observable de forma independiente.

Cómo lo usarías, y cuánto cuesta
• Autohospedado — pesos bajo licencia Apache-2.0 de Hugging Face o ModelScope; se ejecuta con transformers (>=5.6.0), vLLM, SGLang o compilaciones GGUF de llama.cpp. El costo es tu factura de GPU; la compilación de 1.25 bits se ejecuta en dispositivos de clase CPU.

• API alojada — Tencent Cloud ofrece el modelo de 1.8B a aproximadamente $0.044 por millón de tokens de entrada y $0.177 por millón de tokens de salida al momento de escribir esto; la API propia del proveedor y varias plataformas de terceros lo ofrecen.
• Consumidor — el miniprograma de HyTranslate y las aplicaciones para iOS/Android, incluida la traducción sin conexión mediante el modelo descargado en el dispositivo.
Muestreo recomendado para el modelo 1.8B: temperatura 0.7, top-p 0.6, top-k 20, penalización de repetición 1.05, máximo de tokens 4096.
Si estás construyendo un pipeline de traducción en lugar de lanzar una app de consumo, {{1}}lo interesante de un modelo como este es que su precio es un objetivo en movimiento{{/1}} — Tencent ya recortó la tarifa de su API Hy-MT2-Pro en junio. {{2}}Ese es exactamente el escenario para el que existe un router con margen del 0%{{/2}}: {{3}}como el paso directo se hace al precio de lista del proveedor, un recorte de precio del proveedor se refleja en la factura del mismo día en lugar de después de que tu gateway reajuste precios{{/3}}. {{4}}El modelo en sí no está en el catálogo de OrcaRouter al momento de escribir esto, así que tendrías que autoalojar los pesos o llamar directamente a la API de Tencent Cloud{{/4}}; {{5}}el argumento de conmutación por error y clave única aplica al stack de traducción más amplio que construirías alrededor de él{{/5}}, donde {{6}}mezclar un modelo pequeño en el dispositivo para tráfico masivo barato con un modelo más grande para pares difíciles es el tipo de composición que el enrutamiento fue diseñado para expresar{{/6}}.
El resultado final
Tencent HY-MT2 1.8B ya resultaba interesante en mayo como traductor Apache-2.0 del tamaño de un teléfono; la inclusión del 20 de agosto en la lista de API alojada lo convierte en un candidato para los equipos que quieran evaluarlo sin tener que montar infraestructura. Las cifras de calidad son las reportadas por el proveedor, el conjunto de idiomas es deliberadamente generalista en lugar de maximalista, y la huella en el dispositivo es lo que realmente lo distingue. Si tus pares de idiomas están dentro de sus 33, ahora es más barato que nunca comprobar si las afirmaciones se cumplen con tu contenido.
