
Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: La opción de calidad del lado del servidor o un traductor de 440MB en cada teléfono
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Tencent Hy-MT2-7B y Tencent Hy-MT2-1.8B son los dos extremos de la misma familia, publicados conjuntamente como código abierto el {{1}}21 de mayo de 2026{{/1}}, y ambos se han vuelto invocables a través de APIs alojadas esta semana — el 7B {{2}}alrededor del 19 de agosto{{/2}} y el 1.8B {{3}}un día después{{/3}}, cada uno servido por Tencent Cloud. No son competidores en el sentido habitual, porque apenas se superponen en su propósito. El 7B es la opción de calidad: un modelo denso que se ejecuta en una sola GPU o en una API {{4}}a $0.074 por millón de tokens de entrada y $0.295 por millón de tokens de salida{{/4}}. El 1.8B es la opción para el dispositivo: un modelo cuantizado a 440 megabytes que se ejecuta en un teléfono, totalmente sin conexión, {{5}}a $0.044 / $0.177 por millón{{/5}} en el nivel de API. Si tienes que elegir entre ellos, la respuesta viene determinada principalmente por dónde debe realizarse la traducción — y solo en segundo lugar por los benchmarks, que están mucho más cerca de lo que sugiere la brecha de parámetros, que es cuatro veces mayor.
La respuesta en una línea
Elige el modelo de 7B cuando la traducción ocurre en un centro de datos y quieres la mejor calidad por dólar de servidor — en una API o en una GPU de clase A100. Elige el de 1.8B cuando la traducción tiene que ocurrir en un dispositivo, sin conexión, o al menor costo posible por token. Si ambos viven en la misma nube y el presupuesto no es el factor decisivo, el 7B gana en calidad. Si el contenido es confidencial, regulado, o necesita funcionar sin red, el 1.8B es el único de los dos que puede.
Especificaciones, lado a lado
• Parámetros — 7B dense vs 1.8B dense.
• Huella cuantizada — FP8 y GGUF hasta unos pocos GB frente a 440MB mediante cuantización AngelSlim de 1.25 bits.
• FLORES-200 (XX⇔XX) — 86,89 frente a 79,77 XCOMET-XXL, aproximadamente el 97,9% frente al 89,9% de Gemini 3.1 Pro (Think), según lo reportado por el proveedor.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B supera a las APIs comerciales de Microsoft y Doubao en las tres métricas.
• DomainMTBench (GEMBA) — 92.79 frente a 91.08, reportado por el proveedor.
• Precio de API — $0.074 / $0.295 frente a $0.044 / $0.177 por 1M de tokens (entrada/salida).
• Contexto — ambos 8,192 tokens.
• Despliegue — una A100 / RTX 4090 o API en la nube frente a chips integrados de Apple, Qualcomm y MediaTek, sin conexión.

La brecha de calidad es real, pero más estrecha que la brecha de tamaño.
Todo lo siguiente es una evaluación propia de Tencent, no reproducida. En FLORES-200, el 7B se sitúa ocho puntos XCOMET por delante del 1.8B (86,89 frente a 79,77), que es la brecha sobre la que se construye el posicionamiento {{1}}"balanced" versus "on-device"{{/1}}. Pero en DomainMTBench — el punto de referencia de traducción por dominios que cubre finanzas, política y educación — el 1.8B se queda a 1,7 puntos GEMBA del 7B (91,08 frente a 92,79). Y el desempeño del 1.8B frente al resto del mundo es el detalle que no deja de sorprender: Tencent informa de que supera a las API de traducción comerciales de Microsoft y Doubao en las tres métricas de WMT25, y deja atrás a Tower-Plus-72B, un modelo cuarenta veces mayor. Así pues, en textos de dominio común, el modelo pequeño está mucho más cerca de su hermano mayor de lo que sugeriría la diferencia de cuatro veces en parámetros. La verdadera ventaja del 7B se manifiesta en la cola de la traducción general y en instrucciones difíciles, donde su ventaja en FLORES y sus puntuaciones más altas en tareas complejas de IFMTBench ponen una clara distancia entre ambos.
El fork de despliegue.
El 7B necesita infraestructura — ya sea una API en la nube o una sola GPU de clase A100, con las operaciones habituales asociadas. El 1.8B, con 440MB gracias a la cuantización de 1.25 bits de AngelSlim, se ejecuta en los mismos chips que una aplicación de teléfono típica, es 1.5× más rápido que la generación anterior Hy-MT1.5 y no necesita red en absoluto. Eso convierte la privacidad de una característica en un valor por defecto: para contratos, historiales médicos o cualquier cosa regulada, los datos nunca salen del dispositivo, una propiedad que ningún precio por token puede comprar del lado del servidor. La contrapartida se aprecia en la traducción general estilo FLORES, donde la capacidad adicional del 7B se nota — y en cualquier instrucción lo bastante compleja como para poner a prueba el total de 83.14 de IFMTBench del 1.8B frente al techo más alto del 7B.

El cálculo de costos
En el nivel de API, ambos modelos son económicos; el de 1.8B es más barato. A $0.044 / $0.177 frente a $0.074 / $0.295 por millón, el modelo pequeño cuesta alrededor de un 40% menos que el de 7B en ambos lados de la factura: con un millón de tokens de salida al día, son unos $70 al día frente a $118. En el dispositivo, el de 1.8B cuesta cero por token, que es la cifra que domina cualquier comparación de servidores a gran volumen. El contraargumento del de 7B no es el precio, sino el margen de maniobra: si tu corpus se inclina hacia lo técnico, lo legal o lo cargado de instrucciones, el margen de calidad del de 7B es exactamente el tipo de cosa que se traduce en menos retraducciones, y las retraducciones son el costo unitario real en la MT profesional.

Enrutando los dos tamaños
Ninguno de los dos modelos está en el catálogo de OrcaRouter al momento de escribir esto, así que el marco honesto es que ambos se sirven a través de la propia nube de Tencent y de varias plataformas de terceros. El enfrentamiento igualmente enseña la lección de enrutamiento en torno a la cual está construido este blog: cuando dos modelos se superponen en capacidad pero difieren en precio y latencia, el despliegue racional no es "elegir uno" sino "enrutar por carga de trabajo" — la porción de alto volumen y baja dificultad al modelo pequeño y barato, la porción difícil al modelo de calidad, con conmutación por error automática para que una caída en cualquiera de ellos nunca detenga el pipeline. Ese es precisamente el patrón que el DSL de enrutamiento de OrcaRouter compone entre los más de 200 modelos que sí tenemos, con el precio de lista de cada proveedor pasado a través con un margen del 0%. Si la familia de traducción de Tencent se une al catálogo, es el próximo inquilino natural.
El veredicto
Si la traducción ocurre en tu centro de datos, usa Tencent Hy-MT2-7B — en la API si quieres cero operaciones, en una sola GPU si quieres ser dueño de ella — y deja de leer. Si la traducción tiene que ocurrir en un dispositivo, sin conexión, o bajo un requisito de confidencialidad, usa Tencent Hy-MT2-1.8B y la huella de 440MB gana por definición. El único caso realmente difícil es una carga de trabajo en la nube de volumen medio donde tanto la calidad del 7B como el precio del 1.8B son defendibles. Ahí, no decidas basándote en los benchmarks del proveedor: la brecha reportada de GEMBA es de menos de dos puntos, así que ejecuta ambos con tu propio texto de dominio y deja que tus datos elijan.
