Una tarjeta de título principal para 'Tencent Hy-MT2-7B ahora tiene una API alojada' con el subtítulo 'Lo que cambia un traductor de $0.295 por millón de tokens de salida', que muestra un icono de servicio en la nube, un glifo de traducción, una línea de conector de API y una etiqueta de precio con $0.074 / $0.295 por 1M de tokens, con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Tencent Hy-MT2-7B ahora tiene una API alojada: lo que cambia con un traductor de $0,295 por millón de tokens de salida

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tencent Hy-MT2-7B, el modelo de traducción de código abierto que Tencent Hunyuan publicó el 21 de mayo de 2026, se ha vuelto invocable a través de una API alojada esta semana: alrededor del 19 de agosto de 2026, el modelo denso de 7B se lanzó en el endpoint alojado de Tencent Cloud a 0,074 $ por millón de tokens de entrada y 0,295 $ por millón de tokens de salida, con una ventana de contexto de 8.192 tokens. No llegó solo: Tencent Hy-MT2-1.8B y Tencent Hy-MT2-30B-A3B aparecieron en el mismo backend en el plazo de un día. Los pesos han estado en Hugging Face y ModelScope durante tres meses; lo nuevo es que un equipo ahora puede invocarlo sin alquilar una GPU, compilar llama.cpp desde el código fuente ni distribuir la cadena de herramientas de 1,25 bits en el dispositivo. Para una carga de trabajo de traducción, esa es la diferencia entre un experimento y una decisión de producto.

Lo que acaba de lanzarse

El endpoint comercial es propio de Tencent Cloud, expuesto a través de la API del proveedor y de varias plataformas de terceros. Los tres tamaños se ejecutan en un contexto de 8K con completaciones de 4096 tokens; los tres aceptan salida estructurada mediante un esquema JSON en su campo response_format, y ninguno implementa llamadas a funciones. La especificación práctica, en una línea por dimensión:

Tencent Hy-MT2-7B — 0,074 $ de entrada / 0,295 $ de salida por 1M de tokens, contexto de 8.192, denso ~7B, compatible con salida estructurada, sin llamadas a herramientas.

Tencent Hy-MT2-1.8B — $0.044 de entrada / $0.177 de salida por 1M de tokens, contexto de 8,192, 1.8B denso, sin llamadas a herramientas.

Tencent Hy-MT2-30B-A3B — $0.074 entrada / $0.295 salida por 1M de tokens, contexto de 8,192, MoE 30B total / 3B activos, admite salida estructurada, sin llamadas a herramientas.

El precio destacado es la tasa de salida del modelo 7B: menos de tres décimas de centavo por cada mil tokens de salida, para un modelo que, según Tencent, se defiende frente a modelos un orden de magnitud más grandes. La traducción es una de las pocas cargas de trabajo de LLM en las que los tokens de salida representan casi la totalidad de la factura, por lo que el precio de salida es el número que determina si un pipeline es viable a gran escala.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

El modelo detrás del endpoint

Hy-MT2 es la familia de "pensamiento rápido" de Tencent: en lugar de dedicar largas cadenas de razonamiento a cada frase, está diseñado para reaccionar como lo haría un traductor profesional: delibera cuando el texto de origen es ambiguo y es rápido cuando no lo es. El 7B es el punto medio equilibrado de la familia, un modelo denso con licencia Apache-2.0 que cubre 33 idiomas más cinco pares de lenguas minoritarias y dialectos chinos (entre ellos, tibetano, kazajo, mongol, uigur y cantonés). Lo que lo distingue de un LLM genérico que traduce es el seguimiento de instrucciones: mantiene un término del glosario a lo largo de un documento, aplica un estilo especificado, deja intactos los delimitadores y las claves JSON, y acepta instrucciones de personalización en lenguaje sencillo. Tencent lanzó IFMTBench, un benchmark abierto precisamente para esa habilidad, junto con los pesos, y la cara de consumo —el miniprograma Tencent Hy Translate, con aplicaciones para iOS y Android en preparación— está construida sobre esta familia.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

Los números, con el asterisco adjunto

Todo lo que sigue es la evaluación propia de Tencent, publicada en la ficha del modelo y en el informe adjunto; nada de ello ha sido reproducido de forma independiente al momento de escribir esto. En la pista de traducción general XX⇔XX de FLORES-200, el modelo de 7B obtiene 86.89 XCOMET-XXL, que Tencent sitúa en aproximadamente el 97.9 % de Gemini 3.1 Pro (Think). En su modo de «pensamiento rápido», se afirma que supera a los modelos generales de código abierto, incluidos DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B y Gemma4-26B-A4B. En WMT25 sus puntuaciones mejoran en todos los aspectos con respecto a la generación anterior: 63.86/71.21/82.24 frente a los 61.59/68.85/75.91 de Hy-MT1.5-7B, con la mayor mejora en GEMBA; y en DomainMTBench (finanzas, política, educación) registra 94.92 XCOMET / 92.79 GEMBA. Su seguimiento de instrucciones es donde más visiblemente se diferencia de los LM de traducción de hace un año: 89.73 simple / 72.67 complejo / 83.14 total en IFMTBench.

Qué cambia una API alojada en un pipeline de traducción

Autoalojar el 7B es genuinamente fácil en lo que respecta a estas cosas — se ejecuta en una sola A100 o RTX 4090, y existen versiones cuantizadas FP8 y GGUF. Pero "fácil de autoalojar" no es "cero operaciones". La ruta GGUF actualmente depende de llama.cpp con el kernel STQ de Tencent, la ruta FP8 necesita la pila correcta, y alguien tiene que supervisarlo. Un endpoint alojado quita todo eso de la mesa: sin GPU, sin compilación de kernel, sin planificación de capacidad, y un precio por token fijo independientemente de la utilización. Para un equipo que procesa millones de frases traducidas al día, esa previsibilidad importa más que el benchmark principal — y es la razón por la que esta semana importa más que el lanzamiento de mayo.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

La pregunta sobre el enrutamiento que nadie se hace todavía

Debido a que el modelo tiene apenas tres días del lado de la API, la forma realista de adoptarlo es la misma con la que se adopta a cualquier proveedor nuevo: ponerlo detrás de una regla de enrutamiento con failover automático, para que un endpoint sin probar nunca pueda tumbar una ruta de producción, y dejar que el volumen decida si se gana un lugar permanente. Ese es precisamente el patrón que el DSL de enrutamiento de OrcaRouter compone entre los más de 200 modelos que sí tenemos — y vale la pena ser precisos aquí: Tencent Hy-MT2-7B no está en el catálogo de OrcaRouter al momento de escribir esto, así que esta no es una historia de "pásalo por nosotros". Lo que sí es pertinente es el modelo de precios. OrcaRouter traslada el precio de lista de cada proveedor con un margen del 0%, así que cuando un proveedor baja la tarifa, la rebaja está activa en la plataforma ese mismo día. Para una carga de trabajo de traducción de alto volumen, la pregunta que hay que hacerle a cualquier endpoint no es "cuál es el precio del portal hoy", sino "cuál es el precio de lista real por token que cobra el proveedor, y hay algo entre eso y yo". A $0.295 por millón de tokens de salida, Tencent Hy-MT2-7B acaba de hacer interesante esa pregunta.

Qué ver a continuación

De esta semana se derivan tres cosas. Primero, los modelos hermanos 1.8B y 30B-A3B ahora se pueden invocar por igual, por lo que la decisión de «qué tamaño» es una cuestión real de API, no una decisión de autoalojamiento (la familia tiene sus propias páginas de comparación, pero la versión corta es: 1.8B para uso en el dispositivo y el nivel más económico, 30B-A3B para dominios de nivel profesional, 7B en el medio). Segundo, la colaboración de Tencent con WMT26 ofrece premios a los equipos que usen los modelos Hy-MT en las tareas de Traducción Automática General y Traducción de Subtítulos de Vídeo — una señal de que Tencent pretende que esta familia sea el estándar abierto de traducción en la TA competitiva. Tercero, las aplicaciones para iOS y Android con inferencia en el dispositivo, si se lanzan como se anunció, convertirán al 1.8B en el modelo de traducción abierto más instalado del mundo. La API alojada es la parte que cambió esta semana; la trayectoria de la familia se fijó en mayo.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube