
Tencent HY4 Preview vs tencent-hy3: seis veces el precio, y lo que realmente ofrece el salto
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0166Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
Tencent HY4 Preview es el primer modelo de la familia Hunyuan que hace que su propio predecesor parezca barato a propósito: Tencent lo lista a seis veces el precio de entrada de tencent-hy3 y cuatro veces y media su precio de salida, y la presentación de lanzamiento sostiene que la prima está justificada. Publicado y de código abierto el 28 de agosto de 2026, Tencent HY4 Preview reporta una puntuación de ingeniería de software en DeepSWE que más que duplica el 28.0 de Hy3, un 85.4 en manejo de terminal en Terminal-Bench 2.1, y una ventana de contexto que salta de 256K a más de un millón de tokens. tencent-hy3, que se hizo oficial el 6 de julio, es el caballo de batalla maduro de la familia: 295B de parámetros totales, 21B activos, una cuarta parte del contexto y un precio más cercano a un error de redondeo. No es un duelo que la hoja de especificaciones deje reñido. La cuestión es si la diferencia vale el dinero para lo que realmente ejecutas, y la respuesta se divide según la carga de trabajo.
El marcador: donde los dos realmente divergen.
Cada benchmark en los materiales de Tencent es reportado por el propio proveedor — ejecutado en los entornos de evaluación de Tencent en el lanzamiento de cada modelo, sin reproducción por parte de un laboratorio independiente, y para el modelo insignia, el modelo ha sido público por menos de un día. Trata las puntuaciones como el techo que Tencent cree haber alcanzado, y pondera el patrón más que cualquier cifra individual. El patrón es inconfundible, y se concentra en trabajo de ingeniería agéntica más que en conocimiento general:
• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. Este es el mayor salto individual en el emparejamiento, más que una duplicación en un benchmark de ingeniería de software a escala de repositorio, y es el número que separa un modelo de chat de un modelo al que le entregas un código base completo.
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, que Tencent dice que empata con Claude Opus 5 y supera a DeepSeek V4 Pro. tencent-hy3: 71.7, según se informó en su lanzamiento en julio. Llevar una terminal real a completar tareas de múltiples pasos es exactamente el tipo de trabajo de largo horizonte en el que Hy3 era más débil.
• Toolathlon-Verified — Tencent HY4 Preview: 74,1, que Tencent afirma que supera a Qwen 3.8 Max y GPT-5.6 Sol. No se publicó ninguna cifra comparable de Hy3.
• Prueba interna a ciegas — 163 expertos puntuaron 203 tareas de ingeniería con 2.99/4.00 para Tencent HY4 Preview, superando ligeramente el 2.92 de GLM-5.3 y el 2.94 de Kimi K3. Esto son los revisores de Tencent evaluando las tareas de Tencent; trátalo como orientativo.

El hilo conductor: las mejoras están en el manejo de terminal, la llamada de herramientas y las tareas a escala de repositorio — el posicionamiento de productividad que Tencent ha estado promoviendo desde Hy3, ahora con la capacidad de cómputo para respaldarlo.
La prima de precio, línea por línea
Aquí es donde la comparación deja de tratarse de alardear. Los precios de lista de Tencent, por millón de tokens:
Tencent HY4 Preview: 6 yuan (~US$0,85). tencent-hy3: 1 yuan (~US$0,14). Seis veces.
• Salida — Tencent HY4 Preview: 18 yuan (~US$2.50). tencent-hy3: 4 yuan (~US$0.56). Cuatro veces y media.
• Acierto de caché — Tencent HY4 Preview: 0.3 yuan. tencent-hy3: 0.25 yuan. Casi lo mismo, lo cual importa más de lo que parece, porque los bucles agénticos reenvían constantemente el mismo prompt del sistema y el prefijo de la conversación.
Ejecute una carga de trabajo realista de codificación agéntica a través del número combinado — digamos 20 millones de tokens de entrada y 4 millones de tokens de salida al mes, un presupuesto de agente para un único desarrollador ocupado. Tencent HY4 Preview: 120 yuanes más 72 yuanes, unos 192 yuanes (~US$27). tencent-hy3: 20 yuanes más 16 yuanes, unos 36 yuanes (~US$5). El modelo insignia cuesta cinco veces o más de ejecutar con la misma mezcla de tokens — y pedirá más tokens de salida por tarea, porque piensa durante más tiempo.
Eso no es una razón para evitar {{1}}Tencent HY4 Preview{{/1}}; el {{2}}salto DeepSWE{{/2}} es exactamente el tipo de capacidad {{3}}por la que se paga una prima{{/3}}. Es una razón para {{4}}cotizar la carga de trabajo antes de enrutarla{{/4}}. Y es ahí donde la capa de enrutamiento demuestra su valor: {{5}}tencent-hy3{{/5}} ya está en {{6}}OrcaRouter{{/6}} al precio de lista del proveedor — {{7}}margen del 0%{{/7}}, así que el número que ves es el precio del propio proveedor que presta el servicio, no una versión revendida y con margen — con {{8}}conmutación automática entre proveedores{{/8}}, y un {{9}}cambio de precio del proveedor entra en vigor en nuestro lado el mismo día{{/9}}.
Cuatro veces el contexto, el doble de cómputo activo
• Arquitectura — Tencent HY4 Preview: 770B en total, 49B activos de MoE. tencent-hy3: 295B en total, 21B activos. El modelo insignia aplica aproximadamente 2,3 veces más de cómputo en cada token.
• Ventana de contexto — Tencent HY4 Preview: más de 1 millón de tokens. tencent-hy3: 256K. Un repositorio completo o un lote de documentos financieros cabe en la ventana del modelo insignia como una sola solicitud; en Hy3, la misma tarea requiere fragmentación, recuperación o un bucle de agente.
• Control de razonamiento — tencent-hy3 incluye una configuración de reasoning_effort por solicitud (no_think, low, high) más una capa de decodificación especulativa que lo mantiene rápido. Tencent HY4 Preview, según la propia admisión de Tencent, tiende a pensar largamente antes de la primera salida y a sobre-verificarse en tareas complejas: quemando tokens para volver a comprobar el trabajo que ya ha hecho.
Esa última línea es la diferencia que realmente importa para usos sensibles a la latencia. A Hy3 se le puede indicar que responda directamente; Tencent HY4 Preview, al menos en esta forma inicial, a menudo no puede evitar pensar. Para un chat de baja latencia o un pipeline de extracción de alto rendimiento, la capacidad extra del modelo insignia se desperdicia y su pensamiento extra es un impuesto. Para un trabajo de ingeniería por lotes fuera de línea, ese impuesto es exactamente lo que permite obtener la mejor respuesta.
El impuesto de la vista previa: lo que Hy3 todavía tiene.
"Preview" está en el nombre de Tencent HY4 Preview y se comporta como tal. No hay entrada visual ni multimodal: el modelo es solo texto, así que cualquier cosa relacionada con imágenes o vídeos se queda en el modelo que ya uses para eso. La prueba gratuita de dos semanas en WorkBuddy y CodeBuddy es una muestra, no un plan. Tencent ha sido explícito en que esta es una iteración temprana de Hy4, con mejoras de preentrenamiento y postentrenamiento aún por llegar, a un ritmo que ha producido una versión importante aproximadamente cada dos meses desde febrero. Benchmarks independientes para el modelo insignia: ninguno todavía, en ningún sitio.
tencent-hy3 es todo lo contrario. Es una versión oficial y estable que ha estado en producción desde julio. Su nivel gratuito funciona hasta el 30 de septiembre. Sus niveles de razonamiento te ofrecen un control gradual en lugar de un temperamento, y su capa de decodificación especulativa y 21B de parámetros activos lo convierten en la mitad económica, rápida y predecible de esta familia: el modelo que configuras en la ruta predeterminada y del que te olvidas.

Quién debería elegir cuál
Elige Tencent HY4 Preview cuando el trabajo sea el punto central — una tarea difícil de ingeniería de software, un contexto a escala de repositorio, un flujo de trabajo agéntico donde una mejor respuesta justifica cinco veces la factura de tokens y puedes permitirte la latencia de un modelo que piensa antes de hablar. Elige tencent-hy3 cuando el trabajo sea la restricción — alto rendimiento, baja latencia, un presupuesto ajustado, o cualquier tarea donde quieras que el modelo responda en lugar de deliberar.
El patrón práctico para un emparejamiento como este es la escalada: enrutar el modelo barato y controlable en la ruta predeterminada y escalar al modelo insignia solo cuando la tarea lo exija. Para eso sirve el DSL de enrutamiento de OrcaRouter: componer varios modelos en una sola llamada para que la política sea configuración y no código, y la conmutación por error automática hace que la ruta de Hy3 siga sirviendo incluso cuando un proveedor se degrada. OrcaRouter aún no enruta Tencent HY4 Preview; Tencent no ha abierto el modelo a la inferencia de terceros, así que por ahora se ejecuta en el endpoint de Tencent Cloud TokenHub del propio proveedor y en implementaciones autoalojadas de los pesos abiertos. tencent-hy3, mientras tanto, está hoy en el catálogo al precio de lista del proveedor, y el día en que el modelo insignia se abra, se integrará en la misma capa de enrutamiento de la misma manera, convirtiendo el cambio de un modelo a otro en una modificación de una sola línea en lugar de una reescritura.

El veredicto es aburrido en el mejor sentido: el buque insignia vale la prima por exactamente el trabajo para el que está valorado, y el caballo de batalla sigue siendo la opción correcta para todo lo que simplemente necesita hacerse. La brecha de precio de seis veces es real, la brecha de DeepSWE de 28 a 64 es real, y ninguna anula a la otra — solo tienes que saber cuál estás comprando.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
