
Tencent Hy-MT2-7B ahora tiene una API alojada: lo que cambia con un traductor de $0,295 por millón de tokens de salida
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Tencent Hy-MT2-7B, el modelo de traducción de código abierto que Tencent Hunyuan publicó el 21 de mayo de 2026, se ha vuelto invocable a través de una API alojada esta semana: alrededor del 19 de agosto de 2026, el modelo denso de 7B se lanzó en el endpoint alojado de Tencent Cloud a 0,074 $ por millón de tokens de entrada y 0,295 $ por millón de tokens de salida, con una ventana de contexto de 8.192 tokens. No llegó solo: Tencent Hy-MT2-1.8B y Tencent Hy-MT2-30B-A3B aparecieron en el mismo backend en el plazo de un día. Los pesos han estado en Hugging Face y ModelScope durante tres meses; lo nuevo es que un equipo ahora puede invocarlo sin alquilar una GPU, compilar llama.cpp desde el código fuente ni distribuir la cadena de herramientas de 1,25 bits en el dispositivo. Para una carga de trabajo de traducción, esa es la diferencia entre un experimento y una decisión de producto.
Lo que acaba de lanzarse
El endpoint comercial es propio de Tencent Cloud, expuesto a través de la API del proveedor y de varias plataformas de terceros. Los tres tamaños se ejecutan en un contexto de 8K con completaciones de 4096 tokens; los tres aceptan salida estructurada mediante un esquema JSON en su campo response_format, y ninguno implementa llamadas a funciones. La especificación práctica, en una línea por dimensión:
• Tencent Hy-MT2-7B — 0,074 $ de entrada / 0,295 $ de salida por 1M de tokens, contexto de 8.192, denso ~7B, compatible con salida estructurada, sin llamadas a herramientas.
• Tencent Hy-MT2-1.8B — $0.044 de entrada / $0.177 de salida por 1M de tokens, contexto de 8,192, 1.8B denso, sin llamadas a herramientas.
• Tencent Hy-MT2-30B-A3B — $0.074 entrada / $0.295 salida por 1M de tokens, contexto de 8,192, MoE 30B total / 3B activos, admite salida estructurada, sin llamadas a herramientas.
El precio destacado es la tasa de salida del modelo 7B: menos de tres décimas de centavo por cada mil tokens de salida, para un modelo que, según Tencent, se defiende frente a modelos un orden de magnitud más grandes. La traducción es una de las pocas cargas de trabajo de LLM en las que los tokens de salida representan casi la totalidad de la factura, por lo que el precio de salida es el número que determina si un pipeline es viable a gran escala.

El modelo detrás del endpoint
Hy-MT2 es la familia de "pensamiento rápido" de Tencent: en lugar de dedicar largas cadenas de razonamiento a cada frase, está diseñado para reaccionar como lo haría un traductor profesional: delibera cuando el texto de origen es ambiguo y es rápido cuando no lo es. El 7B es el punto medio equilibrado de la familia, un modelo denso con licencia Apache-2.0 que cubre 33 idiomas más cinco pares de lenguas minoritarias y dialectos chinos (entre ellos, tibetano, kazajo, mongol, uigur y cantonés). Lo que lo distingue de un LLM genérico que traduce es el seguimiento de instrucciones: mantiene un término del glosario a lo largo de un documento, aplica un estilo especificado, deja intactos los delimitadores y las claves JSON, y acepta instrucciones de personalización en lenguaje sencillo. Tencent lanzó IFMTBench, un benchmark abierto precisamente para esa habilidad, junto con los pesos, y la cara de consumo —el miniprograma Tencent Hy Translate, con aplicaciones para iOS y Android en preparación— está construida sobre esta familia.

Los números, con el asterisco adjunto
Todo lo que sigue es la evaluación propia de Tencent, publicada en la ficha del modelo y en el informe adjunto; nada de ello ha sido reproducido de forma independiente al momento de escribir esto. En la pista de traducción general XX⇔XX de FLORES-200, el modelo de 7B obtiene 86.89 XCOMET-XXL, que Tencent sitúa en aproximadamente el 97.9 % de Gemini 3.1 Pro (Think). En su modo de «pensamiento rápido», se afirma que supera a los modelos generales de código abierto, incluidos DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B y Gemma4-26B-A4B. En WMT25 sus puntuaciones mejoran en todos los aspectos con respecto a la generación anterior: 63.86/71.21/82.24 frente a los 61.59/68.85/75.91 de Hy-MT1.5-7B, con la mayor mejora en GEMBA; y en DomainMTBench (finanzas, política, educación) registra 94.92 XCOMET / 92.79 GEMBA. Su seguimiento de instrucciones es donde más visiblemente se diferencia de los LM de traducción de hace un año: 89.73 simple / 72.67 complejo / 83.14 total en IFMTBench.
Qué cambia una API alojada en un pipeline de traducción
Autoalojar el 7B es genuinamente fácil en lo que respecta a estas cosas — se ejecuta en una sola A100 o RTX 4090, y existen versiones cuantizadas FP8 y GGUF. Pero "fácil de autoalojar" no es "cero operaciones". La ruta GGUF actualmente depende de llama.cpp con el kernel STQ de Tencent, la ruta FP8 necesita la pila correcta, y alguien tiene que supervisarlo. Un endpoint alojado quita todo eso de la mesa: sin GPU, sin compilación de kernel, sin planificación de capacidad, y un precio por token fijo independientemente de la utilización. Para un equipo que procesa millones de frases traducidas al día, esa previsibilidad importa más que el benchmark principal — y es la razón por la que esta semana importa más que el lanzamiento de mayo.

La pregunta sobre el enrutamiento que nadie se hace todavía
Debido a que el modelo tiene apenas tres días del lado de la API, la forma realista de adoptarlo es la misma con la que se adopta a cualquier proveedor nuevo: ponerlo detrás de una regla de enrutamiento con failover automático, para que un endpoint sin probar nunca pueda tumbar una ruta de producción, y dejar que el volumen decida si se gana un lugar permanente. Ese es precisamente el patrón que el DSL de enrutamiento de OrcaRouter compone entre los más de 200 modelos que sí tenemos — y vale la pena ser precisos aquí: Tencent Hy-MT2-7B no está en el catálogo de OrcaRouter al momento de escribir esto, así que esta no es una historia de "pásalo por nosotros". Lo que sí es pertinente es el modelo de precios. OrcaRouter traslada el precio de lista de cada proveedor con un margen del 0%, así que cuando un proveedor baja la tarifa, la rebaja está activa en la plataforma ese mismo día. Para una carga de trabajo de traducción de alto volumen, la pregunta que hay que hacerle a cualquier endpoint no es "cuál es el precio del portal hoy", sino "cuál es el precio de lista real por token que cobra el proveedor, y hay algo entre eso y yo". A $0.295 por millón de tokens de salida, Tencent Hy-MT2-7B acaba de hacer interesante esa pregunta.
Qué ver a continuación
De esta semana se derivan tres cosas. Primero, los modelos hermanos 1.8B y 30B-A3B ahora se pueden invocar por igual, por lo que la decisión de «qué tamaño» es una cuestión real de API, no una decisión de autoalojamiento (la familia tiene sus propias páginas de comparación, pero la versión corta es: 1.8B para uso en el dispositivo y el nivel más económico, 30B-A3B para dominios de nivel profesional, 7B en el medio). Segundo, la colaboración de Tencent con WMT26 ofrece premios a los equipos que usen los modelos Hy-MT en las tareas de Traducción Automática General y Traducción de Subtítulos de Vídeo — una señal de que Tencent pretende que esta familia sea el estándar abierto de traducción en la TA competitiva. Tercero, las aplicaciones para iOS y Android con inferencia en el dispositivo, si se lanzan como se anunció, convertirán al 1.8B en el modelo de traducción abierto más instalado del mundo. La API alojada es la parte que cambió esta semana; la trayectoria de la familia se fijó en mayo.
