
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: ¿El punto óptimo denso o el buque insignia MoE al mismo precio?
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Esta es la sorpresa que se esconde en el centro de este enfrentamiento: Tencent Hy-MT2-7B, un modelo denso de 7B, y Tencent Hy-MT2-30B-A3B, el modelo insignia de mezcla de expertos con 30 mil millones de parámetros en total y aproximadamente 3 mil millones activos, ambos se volvieron invocables a través de API alojadas esta semana — el 7B alrededor del 19 de agosto de 2026, el 30B-A3B un día después, ambos servidos por Tencent Cloud — al mismo precio exacto: $0.074 por millón de tokens de entrada y $0.295 por millón de salida. La familia se publicó como código abierto conjuntamente el 21 de mayo de 2026, así que ninguno de los modelos es nuevo; el precio idéntico de la API es lo que hace que esta comparación sea realmente extraña. Por lo general, el modelo más grande cuesta más y uno sopesa la prima frente a la ganancia. Aquí, el modelo insignia no cuesta nada extra por token, y la decisión se reduce a una sola pregunta: ¿qué, si acaso algo, sacrifica el 7B por ser denso y pequeño?
La sorpresa del mismo precio
La paridad de precios del 30B-A3B es la ganga de MoE haciendo su trabajo. Su arquitectura almacena 30B de conocimiento pero activa solo unos 3B por token, por lo que Tencent Cloud puede ofrecerlo a la misma tarifa por token que el 7B: mismos $0.074 / $0.295, mismo contexto de 8,192 tokens, mismo soporte de salida estructurada, misma limitación de no soportar llamadas a funciones. En la API, el modelo "profesional" no es más caro. La trampa se traslada a otro lugar: a la huella de memoria, la complejidad de servicio y la latencia, donde el diseño más denso y simple del 7B tiene ventajas estructurales que un precio por token no puede expresar.
Especificaciones, lado a lado
• Arquitectura — densa ~7B frente a MoE 30B en total / ~3B activos.
• Precio de API — $0.074 / $0.295 frente a $0.074 / $0.295 por 1M de tokens (idéntico).
• Contexto — ambos 8,192 tokens.
• Posicionamiento — punto óptimo equilibrado frente al buque insignia de grado profesional.
• FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9 % de Gemini 3.1 Pro (Think); 30B-A3B: la mejor puntuación de traducción general de la familia (cifras reportadas por el proveedor).
• DeepSeek / Kimi comparación — ambos superan a DeepSeek-V4-Pro y Kimi K2.6 en modo de pensamiento rápido, según informa el proveedor.
• Huella — una sola A100 / RTX 4090 frente a pesos de escala 30B (una versión cuantizada de clase 18GB en disco y más en VRAM).
• Predeterminados de inferencia — temp 0.7, top_p 0.6, top_k 20 frente a temp 0.7, top_p 1.0, top_k -1.

Donde el 30B-A3B realmente gana
Tencent posiciona el 30B-A3B como el miembro de grado profesional de la familia, y la evidencia que publica respalda esa etiqueta para un tipo específico de texto. En material con alto contenido de dominio —cláusulas legales, texto médico, documentación técnica— su línea GEMBA en DomainMTBench es la más fuerte de la familia, reportada en alrededor del 99% de la línea base de Gemini 2.5 Pro, y su puntuación de traducción general supera a la del 7B en la propia curva FLORES de la familia. Ese 27B latente de conocimiento adicional es exactamente el tipo de capacidad que se manifiesta cuando una frase lleva terminología densa en lugar de prosa ordinaria: la cláusula de un contrato "la indemnización sobrevivirá a la terminación" no exige mucho a un modelo de 7B, pero un documento completo de M&A con un glosario sí. El 30B-A3B es también la apuesta más segura para los pares de chino a lenguas minoritarias (tibetano, uigur, mongol), donde Tencent reporta sus mejores cifras.
Donde el 7B gana de todos modos
Las ventajas del 7B son operativas y reales. Primero, el autoalojamiento: el 7B cabe en una sola A100 o RTX 4090 y tiene la cobertura de frameworks más amplia: Transformers, vLLM, SGLang y llama.cpp vía GGUF están todos probados. El 30B-A3B, incluso cuantizado, requiere VRAM a escala de centro de datos y menos personas lo han sometido a stacks de servidores de producción. Segundo, latencia y simplicidad de servicio: un 7B denso es más fácil de mantener activo, y su muestreo recomendado está más cerca de un decode estándar. Tercero, en la API, el precio idéntico significa que el 7B cuesta exactamente lo mismo por token que el modelo insignia — así que la única razón para elegir el modelo más pequeño es que, para texto general limpio, la brecha de calidad es demasiado sutil para notarse. El 7B ya alcanza aproximadamente el 97,9% de Gemini 3.1 Pro (Think) en FLORES-200; los puntos extra del modelo insignia se sitúan en la parte alta de una curva donde cada uno es más difícil de apreciar en la práctica.
La brecha, medida con honestidad
Todo lo de las dos últimas secciones es evaluación propia de Tencent, y la forma honesta de leerlo es que los dos modelos están lo bastante cerca en traducción ordinaria como para que tu corpus decida. En texto general limpio, la puntuación del 7B de ~97,9 % de Gemini significa que el margen del modelo insignia se mide en pequeñas fracciones de XCOMET: reales en una tabla de clasificación, difíciles de notar en un ticket de soporte. En texto de dominio denso y pares de idiomas minoritarios, las ventajas reportadas del insignia en GEMBA y FLORES son exactamente donde un traductor profesional (humano o modelo) se gana el sustento, y donde una retraducción resulta más cara. No existe ningún benchmark independiente para ninguno de los dos modelos al momento de escribir esto; lo único en lo que coinciden ambas fichas de los proveedores es que cada tamaño supera a DeepSeek-V4-Pro y Kimi K2.6 en el modo de pensamiento rápido de la familia.

Dirigiendo a la familia
Ninguno de los dos modelos está en el catálogo de OrcaRouter al momento de escribir esto, por lo que ambos se sirven a través de la nube propia de Tencent y varias plataformas de terceros. La lección de enrutamiento sigue siendo la práctica. Debido a que los precios de la API son idénticos, este es un caso de libro de texto para el enrutamiento de cargas de trabajo en lugar de una selección única: envíe la porción de traducción general de alto volumen al 7B y la porción densa y de dominio intensivo al 30B-A3B, con conmutación por error automática para que un pico de latencia en el endpoint MoE nunca detenga el pipeline. Ese es el patrón que el DSL de enrutamiento de OrcaRouter compone entre los más de 200 modelos que sí ofrecemos: despacho ponderado por costo, precio de lista del proveedor trasladado con margen del 0% — y se adapta a esta familia mejor que a la mayoría, porque el proveedor ha fijado el precio de los dos niveles para que la división sea económicamente neutral.
El veredicto
A precios de API idénticos, la respuesta por defecto es la 7B: mismo costo por token, más simple de autoalojar, y muy cerca en texto general. Elija la 30B-A3B cuando el corpus sea profesionalmente denso — legal, médico, técnico o traducción de lenguas minoritarias — donde la ventaja de dominio reportada por el buque insignia justifica la mayor huella y la latencia. Y si su carga de trabajo es una mezcla de ambos, no elija: enrute el segmento general a la 7B y el segmento difícil al buque insignia. Eso no es un compromiso entre los dos; es la única manera de obtener ambos al precio que Tencent estableció.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
