{{1}}Una tarjeta de título principal para 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B'{{/1}} {{2}}con el subtítulo 'El punto óptimo denso o el buque insignia MoE al mismo precio'{{/2}} {{3}}que muestra dos iconos de pila de modelos con un signo igual entre ellos y dos chips de precio idénticos etiquetados con $0.074 / $0.295{{/3}} {{4}}con el logotipo de OrcaRouter en la esquina inferior derecha.{{/4}}
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: ¿El punto óptimo denso o el buque insignia MoE al mismo precio?

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Esta es la sorpresa que se esconde en el centro de este enfrentamiento: Tencent Hy-MT2-7B, un modelo denso de 7B, y Tencent Hy-MT2-30B-A3B, el modelo insignia de mezcla de expertos con 30 mil millones de parámetros en total y aproximadamente 3 mil millones activos, ambos se volvieron invocables a través de API alojadas esta semana — el 7B alrededor del 19 de agosto de 2026, el 30B-A3B un día después, ambos servidos por Tencent Cloud — al mismo precio exacto: $0.074 por millón de tokens de entrada y $0.295 por millón de salida. La familia se publicó como código abierto conjuntamente el 21 de mayo de 2026, así que ninguno de los modelos es nuevo; el precio idéntico de la API es lo que hace que esta comparación sea realmente extraña. Por lo general, el modelo más grande cuesta más y uno sopesa la prima frente a la ganancia. Aquí, el modelo insignia no cuesta nada extra por token, y la decisión se reduce a una sola pregunta: ¿qué, si acaso algo, sacrifica el 7B por ser denso y pequeño?

La sorpresa del mismo precio

La paridad de precios del 30B-A3B es la ganga de MoE haciendo su trabajo. Su arquitectura almacena 30B de conocimiento pero activa solo unos 3B por token, por lo que Tencent Cloud puede ofrecerlo a la misma tarifa por token que el 7B: mismos $0.074 / $0.295, mismo contexto de 8,192 tokens, mismo soporte de salida estructurada, misma limitación de no soportar llamadas a funciones. En la API, el modelo "profesional" no es más caro. La trampa se traslada a otro lugar: a la huella de memoria, la complejidad de servicio y la latencia, donde el diseño más denso y simple del 7B tiene ventajas estructurales que un precio por token no puede expresar.

Especificaciones, lado a lado

Arquitectura — densa ~7B frente a MoE 30B en total / ~3B activos.

Precio de API — $0.074 / $0.295 frente a $0.074 / $0.295 por 1M de tokens (idéntico).

Contexto — ambos 8,192 tokens.

Posicionamiento — punto óptimo equilibrado frente al buque insignia de grado profesional.

FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9 % de Gemini 3.1 Pro (Think); 30B-A3B: la mejor puntuación de traducción general de la familia (cifras reportadas por el proveedor).

Deep​Seek / K​imi comparación — ambos superan a DeepSeek-V4-Pro y Kimi K2.6 en modo de pensamiento rápido, según informa el proveedor.

Huella — una sola A100 / RTX 4090 frente a pesos de escala 30B (una versión cuantizada de clase 18GB en disco y más en VRAM).

Predeterminados de inferencia — temp 0.7, top_p 0.6, top_k 20 frente a temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Donde el 30B-A3B realmente gana

Tencent posiciona el 30B-A3B como el miembro de grado profesional de la familia, y la evidencia que publica respalda esa etiqueta para un tipo específico de texto. En material con alto contenido de dominio —cláusulas legales, texto médico, documentación técnica— su línea GEMBA en DomainMTBench es la más fuerte de la familia, reportada en alrededor del 99% de la línea base de Gemini 2.5 Pro, y su puntuación de traducción general supera a la del 7B en la propia curva FLORES de la familia. Ese 27B latente de conocimiento adicional es exactamente el tipo de capacidad que se manifiesta cuando una frase lleva terminología densa en lugar de prosa ordinaria: la cláusula de un contrato "la indemnización sobrevivirá a la terminación" no exige mucho a un modelo de 7B, pero un documento completo de M&A con un glosario sí. El 30B-A3B es también la apuesta más segura para los pares de chino a lenguas minoritarias (tibetano, uigur, mongol), donde Tencent reporta sus mejores cifras.

Donde el 7B gana de todos modos

Las ventajas del 7B son operativas y reales. Primero, el autoalojamiento: el 7B cabe en una sola A100 o RTX 4090 y tiene la cobertura de frameworks más amplia: Transformers, vLLM, SGLang y llama.cpp vía GGUF están todos probados. El 30B-A3B, incluso cuantizado, requiere VRAM a escala de centro de datos y menos personas lo han sometido a stacks de servidores de producción. Segundo, latencia y simplicidad de servicio: un 7B denso es más fácil de mantener activo, y su muestreo recomendado está más cerca de un decode estándar. Tercero, en la API, el precio idéntico significa que el 7B cuesta exactamente lo mismo por token que el modelo insignia — así que la única razón para elegir el modelo más pequeño es que, para texto general limpio, la brecha de calidad es demasiado sutil para notarse. El 7B ya alcanza aproximadamente el 97,9% de Gemini 3.1 Pro (Think) en FLORES-200; los puntos extra del modelo insignia se sitúan en la parte alta de una curva donde cada uno es más difícil de apreciar en la práctica.

La brecha, medida con honestidad

Todo lo de las dos últimas secciones es evaluación propia de Tencent, y la forma honesta de leerlo es que los dos modelos están lo bastante cerca en traducción ordinaria como para que tu corpus decida. En texto general limpio, la puntuación del 7B de ~97,9 % de Gemini significa que el margen del modelo insignia se mide en pequeñas fracciones de XCOMET: reales en una tabla de clasificación, difíciles de notar en un ticket de soporte. En texto de dominio denso y pares de idiomas minoritarios, las ventajas reportadas del insignia en GEMBA y FLORES son exactamente donde un traductor profesional (humano o modelo) se gana el sustento, y donde una retraducción resulta más cara. No existe ningún benchmark independiente para ninguno de los dos modelos al momento de escribir esto; lo único en lo que coinciden ambas fichas de los proveedores es que cada tamaño supera a DeepSeek-V4-Pro y Kimi K2.6 en el modo de pensamiento rápido de la familia.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Dirigiendo a la familia

Ninguno de los dos modelos está en el catálogo de OrcaRouter al momento de escribir esto, por lo que ambos se sirven a través de la nube propia de Tencent y varias plataformas de terceros. La lección de enrutamiento sigue siendo la práctica. Debido a que los precios de la API son idénticos, este es un caso de libro de texto para el enrutamiento de cargas de trabajo en lugar de una selección única: envíe la porción de traducción general de alto volumen al 7B y la porción densa y de dominio intensivo al 30B-A3B, con conmutación por error automática para que un pico de latencia en el endpoint MoE nunca detenga el pipeline. Ese es el patrón que el DSL de enrutamiento de OrcaRouter compone entre los más de 200 modelos que sí ofrecemos: despacho ponderado por costo, precio de lista del proveedor trasladado con margen del 0% — y se adapta a esta familia mejor que a la mayoría, porque el proveedor ha fijado el precio de los dos niveles para que la división sea económicamente neutral.

El veredicto

A precios de API idénticos, la respuesta por defecto es la 7B: mismo costo por token, más simple de autoalojar, y muy cerca en texto general. Elija la 30B-A3B cuando el corpus sea profesionalmente denso — legal, médico, técnico o traducción de lenguas minoritarias — donde la ventaja de dominio reportada por el buque insignia justifica la mayor huella y la latencia. Y si su carga de trabajo es una mezcla de ambos, no elija: enrute el segmento general a la 7B y el segmento difícil al buque insignia. Eso no es un compromiso entre los dos; es la única manera de obtener ambos al precio que Tencent estableció.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube