Una tarjeta de título principal para el lanzamiento de código abierto de Tencent Hy4 Preview. Un título centrado dice: «Tencent Hy4 Preview — abierto, 770B MoE, contexto de 1M». Debajo, fichas de especificaciones clave: «770B total / 49B activo (MoE)», «ventana de contexto de 1M», «Licencia Apache 2.0», «¥6 / ¥18 por MTok». Una línea de pie de página dice: «Pesos abiertos · API de TokenHub · WorkBuddy / CodeBuddy / Yuanbao / ima». El logotipo de OrcaRouter se compone en la esquina inferior derecha.
Guides & Insights

La vista previa de Tencent Hy4 ya está disponible: un MoE de 770B con contexto de un millón de tokens a ¥6 por millón de tokens de entrada.

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tencent Hy4 Preview, lanzado y de código abierto el 28 de agosto de 2026, es el tercer modelo insignia de Tencent en seis meses, y es el que deja de ser un hito de investigación y pasa a ser un evento de precios. Es un modelo de mezcla de expertos con 770 mil millones de parámetros — 49 mil millones activos por token — y una ventana de contexto nativa de un millón de tokens, publicado bajo la Licencia Apache 2.0 tanto en BF16 como en FP8, descargable hoy desde Hugging Face, GitHub, ModelScope y GitCode. Y Tencent lo ha fijado en 6 yuanes por millón de tokens de entrada y 18 yuanes por millón de tokens de salida, aproximadamente US$0,83 y US$2,50, lo que sitúa un modelo de pesos abiertos de primer nivel por debajo de casi todos los modelos frontera cerrados del mercado. Un solo lanzamiento, tres caras: pesos abiertos que puedes ejecutar tú mismo, una API en TokenHub de Tencent Cloud, y los mismos pesos ya integrados en los propios productos de Tencent: WorkBuddy, CodeBuddy, Yuanbao e ima. Esto es lo que realmente se ha publicado, lo que Tencent afirma que puntúa, y lo que nadie ha verificado todavía.

La historia de la ingeniería importa más que el número de parámetros, porque cada pieza es una palanca de costos. El modelo tiene 78 capas de profundidad: la primera capa es una red feed-forward densa estándar, y las 77 restantes son capas MoE con 256 expertos enrutados más un experto compartido cada una, que activan los 8 mejores expertos enrutados por token. Esa proporción de dispersión de aproximadamente 16:1 es lo que hace que un modelo de 770B sea asequible de servir: solo una porción de 49B trabaja en cada token. Una capa dedicada de predicción multi-token (10B parámetros, 0.7B activos) permite la decodificación especulativa, y la pila de atención utiliza DeepSeek Sparse Attention con compuerta y un IndexCache para mantener bajo control el uso de memoria en contextos largos. El razonamiento se puede alternar entre un modo de pensamiento prolongado code>high/code> y un modo de ahorro de tokens code>no_think/code>. Estos son los detalles que determinan si el precio anunciado sobrevive al contacto con una carga de trabajo real, no si el modelo puede escribir un haiku.

La ficha técnica, anotada

Lee las notas de la versión línea por línea, porque cada línea cambia silenciosamente lo que un modelo de pesos abiertos tiene permitido hacer.

• Parámetros — 770B en total, 49B activos por token, una relación de dispersión de ~16:1 que mantiene el costo de servicio en un rango que un equipo pequeño realmente puede permitirse.

• Contexto — una ventana nativa de 1,048,576 tokens, cuatro veces los 256K de Hy3. Un repositorio completo, una refactorización de múltiples archivos, un paquete financiero de 72 documentos — problemas de una sola solicitud.

• Licencia — Apache License 2.0 tanto para el original BF16 como para la versión cuantizada FP8, lo que significa autoalojamiento, ajuste fino y uso comercial sin cláusula de propiedad.

Stack de inferencia — Tencent enumera vLLM y SGLang como los frameworks de servido compatibles, los dos en los que el ecosistema de pesos abiertos realmente se estandariza.

• API — El endpoint TokenHub de Tencent Cloud a ¥6 por millón de tokens de entrada, ¥18 por millón de tokens de salida, ¥0.3 por millón en aciertos de caché.

• Integración de producto: los mismos pesos que Tencent incluye en WorkBuddy, CodeBuddy (nacional e internacional), Yuanbao e ima son los que puedes descargar y ejecutar. CodeBuddy ofrece una prueba gratuita de dos semanas del modelo en su lanzamiento.

Tencent también reporta una cifra de ingeniería de inferencia que rara vez aparece en una nota de lanzamiento: una mejora del 31,8 % en el rendimiento de extremo a extremo gracias a la fusión de operadores y la optimización de la comunicación. Ese es el tipo de detalle que separa un modelo que un laboratorio publica como artefacto de investigación de un modelo del que una empresa espera que reciba tráfico de producción. Desde el primer día, también es exactamente el tipo de afirmación que nadie fuera de Tencent ha medido todavía.

Las puntuaciones que merecen citarse

Todos los benchmarks que Tencent ha publicado para Tencent Hy4 Preview son reportados por el proveedor: ejecutados en el propio entorno de evaluación de Tencent, no reproducidos por ningún laboratorio independiente, y el modelo ha sido público durante menos de un día. Léelos como el techo que Tencent cree haber alcanzado.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent scores: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 28, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

La cifra principal es Terminal Bench 2.1, una prueba de lo bien que un modelo maneja una terminal real mientras programa. Tencent reporta 85.4, que según afirma empata con Claude Opus 5 y supera a DeepSeek V4 Pro, y que supera a su propio predecesor Hy3 por 14.6 puntos. Ese único número está haciendo mucho trabajo: es la afirmación que sitúa a un modelo de pesos abiertos a la par con los modelos cerrados de frontera más caros en una prueba difícil de codificación agéntica, y es la afirmación que más necesita confirmación independiente. El resto de la tabla interna: DeepSWE salta de 28.0 en Hy3 a 64.3, lo que Tencent describe como "reduciendo gradualmente la brecha" con los modelos de primer nivel; Toolathlon-Verified, una prueba de llamada a herramientas, se sitúa en 74.1; APEX-Agents pass@1 en 37.1, un pelo detrás del 37.2 de Kimi K3; SWE-bench Pro en 65.7 y SWE-bench Multilingual en 82.9. En una prueba interna a ciegas separada, 163 expertos puntuaron 203 tareas de ingeniería con 2.99 sobre 4.00, superando ligeramente el 2.92 de GLM-5.3 y el 2.94 de Kimi K3.

Dos patrones se destacan. Primero, todo número fuerte corresponde a trabajo de ingeniería agéntica — manejo de terminal, llamada a herramientas, tareas a escala de repositorio — y ninguno a chat genérico o conocimiento, lo que concuerda con el posicionamiento de Tencent del modelo como "construido para la productividad" en ingeniería de software, oficina y análisis de datos, desarrollo de juegos e investigación científica. Segundo, Tencent se cuida de describir a DeepSWE y al resto como reduciendo, no cerrando, brechas. La única afirmación de paridad limpia y comercializable es el empate en Terminal Bench 2.1, y es la afirmación que más vale la pena probar con tu propia carga de trabajo.

Lo que realmente compra ¥6 por millón

El precio es donde el lanzamiento deja de ser interesante y empieza a ser disruptivo. A 18 yuanes por millón de tokens de salida — unos 2,50 dólares estadounidenses — una sesión larga de codificación agéntica que consume un millón de tokens de salida cuesta aproximadamente una décima parte de lo que costaría la misma sesión en un modelo frontera cerrado de primer nivel, y la tasa de acierto de caché de 0,3 yuanes hace que los prompts de sistema reenviados y los prefijos de conversación de un bucle agéntico sean drásticamente más baratos que el almacenamiento en caché de la mayoría de los competidores. La propia demo de Tencent muestra al modelo procesando 72 documentos financieros en una sola pasada; a estos precios, ese tipo de lote es un trabajo diario asequible en lugar de una partida presupuestaria.

Este también es el punto donde la capa de enrutamiento cambia las matemáticas, y vale la pena ser precisos al respecto. OrcaRouter aún no enruta Tencent Hy4 Preview — Tencent no ha abierto este modelo a plataformas de inferencia de terceros, así que se ejecuta en el endpoint TokenHub de Tencent Cloud y en despliegues autoalojados de los pesos abiertos, y no afirmamos servir lo que no servimos. Pero la disciplina que hace que un recorte de precio importe es la misma sobre la que opera el resto del catálogo: OrcaRouter traslada los precios de lista de los proveedores con cero margen, así que cuando un proveedor fija un token en 6 yuanes, el número que pagas en nuestra plataforma es 6 yuanes, no una versión revendida y con margen — y el día en que un proveedor cambia un precio, el cambio está activo en nuestra plataforma ese mismo día. Una API para más de 200 modelos, conmutación automática por error entre proveedores cuando uno falla, y un DSL de enrutamiento para componer modelos en una sola llamada: ese es el mecanismo que transportará Tencent Hy4 Preview en el momento en que Tencent lo abra, y es el mecanismo que ya puedes usar para ejecutar un modelo nuevo y no probado junto a uno probado sin apostar tu ruta de producción por ninguno de los dos.

A screenshot of the OrcaRouter model catalog page (www.orcarouter.ai/models, captured August 28, 2026) showing a browsable grid of AI models with pricing and provider information, headed '198 models — 16 providers — one API key, one bill'. It illustrates the one-API catalog through which vendor list-price pass-through and automatic failover operate.

Las afirmaciones que merecen una segunda lectura.

Dos cosas en el material de lanzamiento tratan sobre cómo se construyó el modelo, no sobre qué puntuación obtuvo, y merecen atención por separado.

El primero es el bucle de auto-mejora. Tencent dice que Tencent Hy4 Preview participó en su propia investigación y desarrollo — se utilizó para optimizar los métodos de entrenamiento, la estrategia de datos, los sistemas de evaluación y los operadores de bajo nivel que lo produjeron. Ese es un ciclo inicial recursivo de auto-mejora: un modelo que ayuda a diseñar la siguiente versión de sí mismo, y Tencent lo publica como una capacidad ya disponible. Es una afirmación importante, y está completamente auto-reportada.

El segundo es un resultado matemático. Tencent informa de que el modelo amplió el límite inferior conocido del problema de Blaschke–Lebesgue — una cuestión abierta desde hace mucho tiempo en geometría convexa sobre el cuerpo de ancho constante de volumen mínimo — de 0,380799 a 0,41104, acercándolo a aproximadamente un 2% de la conjetura del tetraedro de Meissner. Tencent también informa de una aceleración de 2.0x en una simulación de bicapa de fosfolípidos de 32 512 átomos, reduciéndola a 54,9 milisegundos por paso. Resultados como estos normalmente le consiguen a un modelo su propio artículo; aquí son puntos destacados de lanzamiento, y como todo lo demás del primer día, son la propia versión de Tencent.

Las brechas honestas

Tencent enumera las limitaciones conocidas sin rodeos. No hay entrada de visión ni multimodal: Tencent Hy4 Preview es un modelo de texto, y punto, así que cualquier cosa relacionada con imágenes o vídeos pertenece a otro modelo. Tencent también señala un arranque lento en tareas complejas —pensamiento prolongado antes de la primera salida— y una tendencia a la autoverificación excesiva, quemando tokens al comprobar dos veces un trabajo ya hecho. Esa combinación es exactamente lo que no se necesita para un chat sensible a la latencia y exactamente tolerable para trabajo de ingeniería por lotes sin conexión, lo que indica dónde espera Tencent que lo ejecutes.

Y la ausencia más importante es la verificación. Aún no hay puntuaciones independientes para Tencent Hy4 Preview en ningún sitio —ni en una tabla pública de clasificación, ni en un laboratorio de evaluación externo. El modelo es demasiado nuevo. La prueba ciega de expertos internos es una señal útil sobre cómo los propios revisores de Tencent lo ven frente a GLM-5.3 y Kimi K3, pero son los revisores de Tencent evaluando las tareas de Tencent. Todo lo que está más allá de la hoja de especificaciones es una afirmación a la espera de una comprobación.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

Cómo probarlo de verdad hoy

El camino práctico es corto. Descarga los pesos desde Hugging Face, GitHub, ModelScope o GitCode y sírvelos con vLLM o SGLang; llama a la API TokenHub de Tencent Cloud si quieres un endpoint alojado al precio de lista; o úsalo dentro de CodeBuddy o WorkBuddy, donde Tencent está ofreciendo una prueba gratuita de dos semanas. El acceso gratuito al modelo Hy3 dura hasta el 30 de septiembre, y el propio ritmo de Tencent — aproximadamente una iteración importante cada dos meses — apunta a un lanzamiento completo de Hy4 no mucho después de la vista previa.

El resumen honesto: un modelo de pesos abiertos, de 770 mil millones de parámetros y contexto de un millón, a ¥6 por millón de tokens de entrada, es algo real que existe hoy en día, y el punto de referencia más sólido asociado a él es una afirmación del proveedor sobre un empate con un modelo frontera cerrado que nadie ha reproducido todavía. Descárgalo, ejecuta la prueba que realmente te importa y deja que la evidencia decida si el precio sigue siendo la historia.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube