Tarjeta de título principal para Tencent Hy4 Preview. Un título centrado dice 'Tencent Hy4 Preview — open weights, day-zero vLLM'. Una línea de subtítulo dice '770B MoE · 49B active · 1M context'. Cuatro chips de especificaciones dicen 'Open weights (Apache 2.0)', 'vLLM + SGLang day zero', '8x GPU serving (FP8)', '¥6 / ¥18 per MTok'. Una línea de pie dice 'Released Aug 28, 2026 · Runs in vLLM'. El logotipo de OrcaRouter está superpuesto en la esquina inferior derecha.
Guides & Insights

Tencent Hy4 Preview se ejecuta en vLLM desde el primer día: el MoE de pesos abiertos de 770B que realmente puedes servir

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Cuando Tencent Hy4 Preview se lanzó el 28 de agosto de 2026, hizo algo que la mayoría de los buques insignia de clase fronteriza se saltan el primer día: llegó funcionando. Junto con los pesos abiertos, Tencent y el equipo de vLLM publicaron una imagen Docker preconstruida, una receta oficial de servido y soporte integrado del framework en el propio vLLM, por lo que el modelo de pesos abiertos más grande que ha producido la línea Hunyuan — 770 mil millones de parámetros en total, 49 mil millones activos por token — estaba disponible detrás de un endpoint compatible con OpenAI en tus propias GPU en cuestión de horas tras el anuncio. Esa historia de ejecución desde el día cero es la noticia de este artículo, porque "funciona en vLLM" no es una nota al pie para un modelo de este tamaño. Es la diferencia entre un comunicado de prensa y algo que puedes poner en producción.

El resto del lanzamiento es el habitual paquete en formato de vista previa, y las advertencias importan tanto como las cifras. Tencent califica a Tencent Hy4 Preview como una iteración temprana, señala el razonamiento excesivamente largo y la autoverificación excesiva como comportamiento conocido, y publica una tabla de benchmarks totalmente autoinformada — ningún laboratorio independiente lo ha puntuado todavía, y el modelo tiene dos días de antigüedad al momento de escribir esto. Nada de eso cambia el titular práctico: los pesos son Apache 2.0, la ventana de contexto es de 1 millón de tokens, y el soporte de vLLM desde el primer día significa que la ruta de autoalojamiento es real, no aspiracional.

Qué es realmente Tencent Hy4 Preview

Tencent posiciona Tencent Hy4 Preview como el sucesor de Hy3 (295B en total, contexto de 256K), duplicando aproximadamente la capacidad activa y cuadruplicando la ventana de contexto. La arquitectura merece leerse línea por línea, porque cada línea cambia lo que un modelo de pesos abiertos puede hacer en tu hardware.

— Arquitectura — Mixture-of-Experts con 770B de parámetros totales y 49B activos por token en 78 capas. La primera capa es densa; las otras 77 enrutan cada token a través de 256 expertos enrutados más un experto compartido, activando los 8 principales. Esa relación de dispersión de aproximadamente 16:1 es lo que mantiene el costo de inferencia en un rango que un equipo serio realmente puede ejecutar.

• Ventana de contexto — 1.048.576 tokens nativos, una de las más amplias de cualquier modelo de pesos abiertos. Un repositorio completo, una refactorización de varios archivos, un lote de documentos extensos: problemas de una sola solicitud.

• Atención — Atención Dispersa Profunda con Compuerta (Gated DSA) con IndexCache, un diseño de atención dispersa que calcula un índice disperso nuevo en solo 21 de las 78 capas y lo reutiliza en las otras 57. Por eso servirlo no es solo un "vLLM más grande" — necesita un backend que entienda la atención dispersa.

Decodificación especulativa integrada — una capa MTP (predicción de múltiples tokens), con aproximadamente 10B de parámetros en total / 0,7B activos, se encuentra dentro del modelo, por lo que vLLM y SGLang pueden generar tokens de borrador sin tener que alojar un modelo de borrador por separado.

• Pesos — Apache 2.0, en checkpoints tanto BF16 como FP8, publicados en Hugging Face, ModelScope, GitCode y CNB.

Qué significa realmente "day-zero vLLM"

El soporte de framework fusionado el día del lanzamiento es el evento concreto detrás de la señal: el cambio en vLLM que añade Tencent Hy4 Preview (PR #54160) llegó en la misma ventana que el lanzamiento, y la receta oficial apunta a vLLM 0.29.0 o superior. En la práctica, eso significa que la ruta de servicio es un solo comando, no una semana de depuración del kernel.

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

Las banderas importan, y cada una se corresponde con algo en el modelo en lugar de ser plantilla:

• --attention-backend FLASHMLA_SPARSE — requerido, no opcional. La atención dispersa Gated DSA de Tencent Hy4 Preview no se ejecuta correctamente en los backends densos predeterminados, y esta bandera es la que establece la receta oficial.

• {{KEEP}}--speculative-config '{"num_speculative_tokens":3,"method":"mtp"}'{{/KEEP}} — activa la capa MTP integrada del modelo para decodificación especulativa, con tres tokens de borrador de anticipación. No es necesario desplegar ningún modelo de borrador por separado.

• --tool-call-parser hy_v4 y --reasoning-parser hy_v4 — los analizadores personalizados que le indican al servidor cómo Tencent Hy4 Preview emite las llamadas a herramientas y su cadena de pensamiento, con --enable-auto-tool-choice permitiendo que el modelo decida cuándo llamar a las herramientas.

Tencent recomienda una temperatura de 0.9 y top_p de 1.0 para el muestreo. El razonamiento usa por defecto un esfuerzo de cadena de pensamiento "alto" orientado a matemáticas, programación y tareas complejas; si quieres una respuesta directa sin el pensamiento prolongado, pasas un esfuerzo de razonamiento no_think en la solicitud en lugar de intercambiar pesos.

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

El soporte desde el día cero no es exclusivo de vLLM, lo cual es notable para un lanzamiento tan reciente. SGLang lanzó una imagen multiarquitectura preconstruida (lmsysorg/sglang:hy4-preview) con decodificación especulativa estilo NEXTN el mismo día, y el ecosistema Ascend logró soporte desde el día cero a través de vLLM-Ascend usando pesos cuantizados W8A8 en 16 NPU Atlas 800I A3. Los lanzamientos de pesos abiertos suelen tardar semanas en que el ecosistema de servidores se ponga al día; este tardó horas.

Las puntuaciones que merecen citarse

Cada benchmark que Tencent publicó para Tencent Hy4 Preview es reportado por el proveedor — ejecutado en el propio entorno de evaluación de Tencent, sin reproducción por ningún laboratorio independiente, y el modelo ha sido público durante dos días. Léelos como el techo que Tencent cree haber alcanzado, no como un hecho establecido. La verificación independiente no existirá hasta que un tercero lo ejecute; nada en las tablas de clasificación públicas refleja este modelo todavía.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

La cifra principal es Terminal Bench 2.1, una prueba de lo bien que un modelo maneja una terminal real mientras programa. Tencent informa que Tencent Hy4 Preview obtiene 85.4, lo que, según afirma, empata con Claude Opus 5 y supera a DeepSeek V4 Pro, y supera a su propio predecesor Hy3 por 14.6 puntos. Ese único número sostiene el lanzamiento: es la afirmación que coloca a un modelo de pesos abiertos a la par con los modelos frontera cerrados más caros en una difícil prueba de codificación agéntica, y es la afirmación que más necesita confirmación independiente.

El resto de la tabla interna, todos números propios de Tencent: DeepSWE, un benchmark de ingeniería de software, salta de 28.0 en Hy3 a 64.3. SWE-bench Pro se sitúa en 65.7 y SWE-bench Multilingual en 82.9. En Toolathlon-Verified, una prueba de llamada a herramientas, Tencent reporta 74.1, que, según afirma, supera a Qwen 3.8 Max y GPT-5.6 Sol y se acerca a Kimi K3 y Claude Opus 5. En APEX-Agents pass@1 se sitúa en 37.1, un pelo por detrás de los 37.2 de Kimi K3. Y en una evaluación ciega interna separada, 163 expertos reclutados por Tencent puntuaron 203 tareas de ingeniería con 2.99 sobre 4.00, superando por poco los 2.92 de GLM-5.3 y los 2.94 de Kimi K3.

Dos patrones merecen ser señalados. Cada cifra fuerte está en el trabajo de ingeniería agéntica — manejo de terminal, llamada de herramientas, tareas a escala de repositorio — y ninguna en conocimiento o razonamiento genéricos, lo que encaja con el posicionamiento de productividad más que ser una coincidencia. Y Tencent describe a DeepSWE y a los demás como reduciendo, no cerrando, brechas; la única afirmación de paridad limpia y comercializable es el empate en Terminal Bench 2.1, y es la afirmación que más vale la pena poner a prueba con tu propia carga de trabajo.

Lo que realmente cuesta ejecutarlo

Las matemáticas del autoalojamiento son lo primero sobre lo que hay que ser honesto. Este no es un modelo de una sola GPU ni un modelo de escritorio. El checkpoint FP8 se acerca a un terabyte de pesos, y la receta oficial presupone paralelismo tensorial de 8 — ocho GPU de alto ancho de banda con interconexiones rápidas (el hardware de referencia de Tencent para FP8 es 8×B300, y el BF16 completo requiere 16×B200). Si no tienes esa infraestructura, no vas a autoalojarlo de forma económica, y el backend de atención dispersa significa que no hay atajo para la memoria de la caché KV en un contexto de 1M de tokens.

Un complemento de la semana de lanzamiento cambia parte de ese cálculo para los equipos que quieren los pesos abiertos sin el tamaño del modelo insignia. El equipo Hy de Tencent lanzó una compilación GGUF comprimida de Tencent Hy4 Preview, reduciendo el lanzamiento de ~1,5 TB en BF16 a aproximadamente 200 GiB con un esquema de cuantización mixta por capas que llama MIX-STQ1_0: los tensores de experto en bloque bajan a unos 1,3 bits, mientras que las capas críticas para el flujo residual mantienen mayor precisión. En las evaluaciones propias de Tencent, el movimiento en precisión es pequeño — SWE-bench Multilingual de 82.9 a 81.3, MCP Atlas de 83.7 a 83.2, IFBench de 73.5 a 72.5 — un intercambio que el proveedor denomina casi sin pérdidas. Esos son los números de Tencent en la configuración de Tencent, aún no reproducidos hasta ahora. Un modelo de 200 GiB sigue sin ser un modelo de una sola GPU, pero es una apuesta significativamente menor que un punto de control FP8 de casi un terabyte, y pone la ruta de pesos abiertos al alcance de un nodo multi-GPU más pequeño de lo que supone la receta de ocho B300.

El camino de la API es donde el precio se vuelve interesante. En TokenHub de Tencent Cloud, Tencent Hy4 Preview se ofrece a 6 yuanes (~US$0,83) por millón de tokens de entrada, 18 yuanes (~US$2,50) por millón de tokens de salida y 0,3 yuanes (~US$0,04) por millón de tokens para aciertos de caché. La salida a unos $2,50 por millón está muy por debajo del precio de salida de $25 por millón de un modelo de frontera cerrado de primer nivel, y la barata tasa de aciertos de caché hace que los bucles agénticos largos — donde el mismo prompt del sistema y los prefijos de conversación se reenvían constantemente — sean inusualmente asequibles.

Tencent también ofrece acceso gratuito durante dos semanas a Tencent Hy4 Preview dentro de WorkBuddy y CodeBuddy mientras el modelo sea nuevo, así que la forma más barata de probarlo esta semana es gratis — y es en WorkBuddy donde el posicionamiento de productividad se vuelve concreto. En cualquier conversación de WorkBuddy, el selector de modelo alterna entre Hy3 y Hy4 Preview, de modo que la división entre el trabajo de productividad de oficina y análisis, por un lado, y la programación, por el otro, es una elección por tarea y no una decisión de despliegue. Esa división coincide con el objetivo que Tencent le marcó al modelo, y las pruebas prácticas en WorkBuddy lo muestran resolviendo artefactos complejos de una sola pasada: un prototipo de juego low-poly jugable a partir de un solo prompt, una revisión trimestral completa de negocio ensamblada a partir de diez archivos adjuntos sin ninguna intervención manual y, en la demo para testers que circuló esta semana, una simulación de agujero negro. Estas son observaciones de la comunidad sobre la propia app de Tencent, no puntos de referencia del proveedor, pero son las primeras señales prácticas de lo que el modelo hace en tareas reales de múltiples pasos, y son gratis de reproducir antes de gastar nada.

La decisión de costo es exactamente donde una capa de enrutamiento cambia el cálculo, y seremos honestos sobre nuestra propia parte en ello: OrcaRouter aún no enruta Tencent Hy4 Preview, porque Tencent no ha abierto este modelo a plataformas de inferencia de terceros — se ejecuta en el endpoint TokenHub propio de Tencent Cloud y en despliegues autoalojados de los pesos abiertos, y no afirmamos servir lo que no servimos. Lo que la capa de enrutamiento aporta es el marco de decisión que lo rodea. Si estás eligiendo entre un nodo de 8 GPU y una API, la misma disciplina de traslado directo que sigue el resto del catálogo se aplica el día en que Tencent lo abra: OrcaRouter transmite los precios de lista de los proveedores sin margen alguno, de modo que una baja de precio del proveedor está activa en nuestro lado el mismo día en lugar de ser revendida y encarecida. Y para un modelo de dos días cuya única evidencia son los benchmarks de su proveedor, el failover automático es la forma segura de probarlo — pon el modelo probado en tu ruta crítica y Tencent Hy4 Preview a su lado, intercambiándolo en tareas donde su perfil de costo gane y revirtiendo en el momento en que no lo haga, todo a través de una sola API y una sola clave.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

Los límites que no caben en una ficha técnica

Tencent enumera las limitaciones conocidas sin rodeos, y deberían condicionar cualquier decisión de despliegue. Tencent Hy4 Preview es un modelo de texto, y punto: sin entrada visual ni multimodal, así que cualquier cosa relacionada con imágenes o vídeos pertenece a un modelo distinto. Tencent también señala un comportamiento de arranque lento en tareas complejas (larga reflexión antes de la primera salida) y una tendencia a sobre-verificarse, quemando tokens al volver a comprobar el trabajo que ya ha hecho. Esa combinación es exactamente inadecuada para chat sensible a la latencia y exactamente tolerable para trabajo de ingeniería por lotes sin conexión, lo que te dice dónde espera Tencent que lo ejecutes.

Dos afirmaciones del material de lanzamiento merecen atención aparte porque tratan sobre cómo se construyó el modelo, no sobre qué puntuación obtuvo. Tencent afirma que Tencent Hy4 Preview participó en su propio desarrollo: ayudó a optimizar los métodos de entrenamiento, la estrategia de datos, los marcos de evaluación y los operadores de bajo nivel que lo produjeron, un bucle temprano de auto-mejora recursiva — y que optimizó autónomamente su propio sistema de inferencia para lograr una mejora del 31.8% en el rendimiento de extremo a extremo respecto a la línea base. En el ámbito científico, Tencent informa que mejoró el límite inferior conocido del problema de Blaschke–Lebesgue en geometría convexa, de 0.380799 a 0.41104, y logró una aceleración de 2.0x en una simulación de bicapa de fosfolípidos de 32,512 átomos, reduciendo el tiempo a 54.9 milisegundos por paso. Como todo lo demás del primer día, esto es el relato de la propia Tencent.

Y la ausencia más importante es la verificación. Todavía no hay puntuaciones independientes para Tencent Hy4 Preview en ningún sitio — ni en una clasificación pública, ni de un laboratorio de evaluación externo, ni una entrada en Artificial Analysis. El modelo es demasiado nuevo para eso. La prueba ciega interna de expertos es una señal útil sobre cómo los propios revisores de Tencent lo ven frente a GLM-5.3 y Kimi K3, pero son revisores de Tencent en tareas de Tencent. Todo lo que va más allá de la ficha técnica es una afirmación a la espera de verificación.

¿Quién debería ejecutar Tencent Hy4 Preview esta semana?

La respuesta honesta se divide en tres grupos esta semana, y uno de ellos no necesita hardware en absoluto. Si solo quieres sentir lo que hace Tencent Hy4 Preview, el acceso gratuito a WorkBuddy es el camino más rápido: sin GPU, sin clave de API, abre una conversación, cambia el selector de modelo a Hy4 preview y asígnale una tarea de Work o Coding. Si tienes GPUs y ejecutas cargas de trabajo de ingeniería por lotes — tareas agénticas de horizonte largo, análisis a escala de repositorio, evaluación offline — el modelo merece una prueba seria ahora mismo: los pesos están abiertos, la ventana de contexto es a escala de repositorio, la vía vLLM es un solo comando, y la build GGUF de la semana de lanzamiento baja el listón de hardware para una prueba. Si ejecutas chat de producción sensible a la latencia, o cualquier cosa multimodal, o cualquier cosa donde no puedas permitirte un modelo cuya única evidencia son los benchmarks de su propio proveedor, espera: Tencent ha iterado aproximadamente cada dos meses desde febrero, y ya ha dicho que el próximo lote de modelos Hy4 viene, así que la preview es explícitamente una iteración temprana.

Para todos los demás, la postura útil es un patrón de enrutamiento: pruébalo junto a un modelo en el que ya confíes, a un costo del que puedas alejarte, y escálalo solo donde sus cifras se sostengan en tu propia carga de trabajo. Para eso existe un enrutador: el día en que Tencent abra este modelo a la inferencia de terceros, se unirá al catálogo de una sola API, con más de 200 modelos y precios de lista traspasados, como cualquier otro, y las herramientas de conmutación por error y composición ya estarán en su lugar. Hasta entonces, los pesos están en Hugging Face, la API en Tencent Cloud y la prueba gratuita en WorkBuddy — y la afirmación de que un modelo de pesos abiertos alcanzó el nivel superior de codificación agéntica por fin tiene un número específico adjunto. El número es de Tencent. La prueba es tuya.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube