Tarjeta de título que dice GPT-6 Astra vs Tencent HY4 Preview, con la bajada "Los números de un modelo los ha comprobado otra persona. Los del otro no, y 64.000 tokens de salida es donde se acaba el lado barato", sobre una ilustración generada de un cubo certificado sellado junto a un cubo abierto con capas visibles
Guides & Insights

GPT-6 Astra vs. Tencent HY4 Preview: un modelo tiene un registro de auditoría y el otro tiene una tabla de benchmarks

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tencent HY4 Preview y GPT-6 Astrason las dos rutas más baratas hacia la codificación agéntica casi de frontera disponibles hoy si uno se fía de las cifras de los propios proveedores, y son los dos modelos menos comparables de ese nivel si se atiende a las cifras de cualquier otro. Tencent HY4 Preview se publicó y se liberó como código abierto el 28 de agosto de 2026 bajo Apache 2.0, a 0,834 $ por millón de tokens de entrada y 2,501 $ por millón de tokens de salida, con una arquitectura de mezcla de expertos de 770.000 millones de parámetros, una ventana de contexto que supera el millón de tokens y un límite de salida de 64.000 tokens. GPT-6 Astra está disponible de forma general desde el 3 de septiembre de 2026 a 10,00 $ y 50,00 $, con una ventana de 1.050.000 tokens y una salida máxima de 128.000. Los puntos fuertes de Astra están respaldados por ocho evaluaciones de terceros publicadas; los de HY4 Preview están respaldados por las propias pruebas de Tencent en terminal, llamada de herramientas y evaluación a ciegas, y por nada más. Esa asimetría no significa que el modelo más barato sea más débil. Significa que una de estas dos comparaciones se puede verificar y la otra hay que creerla, y las decisiones prácticas difieren en consecuencia.

Lo que realmente te aporta la versión Apache 2.0

La licencia es la parte de este enfrentamiento que una tabla de precios no puede expresar. Tencent HY4 Preview no es un teaser alojado con branding de pesos abiertos — los pesos se pueden descargar desde Hugging Face, GitHub, ModelScope y GitCode, lo que significa que el modelo sobrevive a cualquier decisión que Tencent tome sobre sus propios precios, su propio endpoint o su propio interés continuado en servirlo.

• Arquitectura — 770B de parámetros totales, 49B activos por token, 78 capas, 256 expertos enrutados más un experto compartido, y una capa nativa de predicción de múltiples tokens para decodificación especulativabr /> • Características de servicio — 54,6 tokens de salida por segundo y una mediana de 6,26 segundos hasta el primer token, medidas en las rutas de OrcaRouter durante una ventana móvil de siete díasbr /> • Contexto y límite — una ventana de 1.048.576 tokens frente a una salida máxima de 64.000 tokensbr /> • Superficie de entrada — solo texto; sin imagen, sin archivos, sin audiobr /> • Control de razonamiento — tres niveles, alto, bajo y ninguno, con alto como predeterminado, además de una recomendación de muestreo documentada de temperatura 0.9 y top_p 1.0br /> • Fiabilidad — una tasa de error del 2,8% en la misma ventana de siete días, frente al 10,3% en la ruta de Astra

Ese último par de cifras es lo más útil para tomar medidas en esta página, y es el tipo de dato que ningún proveedor publica sobre su propio modelo. Las puntuaciones independientes de benchmark de Astra son más altas y su ruta ha estado fallando aproximadamente una de cada diez solicitudes durante la última semana, mientras que un modelo sin ninguna puntuación independiente ha estado fallando una de cada treinta y cinco. Ninguna de las dos cifras es una afirmación sobre los modelos en sí —las tasas de error miden la ruta, los límites de velocidad y el upstream, no los pesos—, pero son las cifras que un sistema de producción realmente experimenta.

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

Donde las cifras de Tencent se pueden contrastar con las de otro

Esto es, en lo que respecta a la evidencia publicada, una oportunidad verdaderamente inusual: tanto Astra como HY4 Preview tienen una cifra de Terminal-Bench 2.1, y solo una de ellas está reportada por el proveedor.

• Terminal-Bench 2.1, operando una terminal real — GPT-6 Astra 88.4, evaluado de forma independiente; Tencent HY4 Preview 85.4, reportado por el proveedorbr /> • Llamada a herramientas — Astra 41.4 en τ²-Banking, evaluado de forma independiente; HY4 Preview 74.1 en Toolathlon-Verified, reportado por el proveedor, en una prueba diferentebr /> • Ingeniería de software — HY4 Preview 64.3 en DeepSWE, una subida desde 28.0 en su predecesor Hy3, reportado por el proveedorbr /> • Tareas de agentes — HY4 Preview 37.1 pass@1 en APEX-Agents, reportado por el proveedorbr /> • Preferencia humana — un promedio de 2.99 sobre 4.00 en 203 tareas de ingeniería calificadas por 163 expertos, ejecutado por el proveedor, frente a GLM-5.3 con 2.92 y Kimi K3 con 2.94br /> • Índice independiente — GPT-6 Astra 54.7 en Intelligence Index y 96.1 en GPQA Diamond, de terceros; no existe un índice equivalente para HY4 Preview

La fila de Terminal-Bench es la que merece detenerse a analizar. Una diferencia de 3 puntos entre un 88,4 independiente y un 85,4 reportado por el proveedor está muy dentro del rango que pueden producir un arnés diferente, un andamiaje diferente o una temperatura de muestreo diferente, lo que significa que la lectura honesta no es "Astra es tres puntos mejor", sino "el modelo de pesos abiertos más barato de este nivel está afirmando paridad, y la afirmación es al menos plausible". El propio planteamiento de Tencent es cuidadoso en este punto: describe a DeepSWE como "cerrando gradualmente la brecha" en lugar de cerrarla, y su única afirmación de paridad clara —el empate en Terminal-Bench con un modelo cerrado de primer nivel de otro proveedor— es exactamente la afirmación que más necesita una segunda medición.

También hay un cambio que vale la pena conocer, porque mueve la economía en lugar de las puntuaciones. El 7 de septiembre de 2026, Tencent introdujo una optimización en la compilación de vista previa en vivo que, según afirma, reduce los turnos de razonamiento y el consumo de tokens por tarea en trabajos complejos. Como el modelo factura por token, menos tokens por tarea finalizada reducen el costo de la tarea aunque la tarifa por token no haya cambiado. La magnitud de ese ahorro es una medición de la propia Tencent y nadie fuera de Tencent la ha reproducido, pero el mecanismo es real y es la razón por la que una vista previa publicada en agosto puede resultar materialmente más barata de operar en octubre de lo que sugería su texto de lanzamiento.

El límite de 64.000 tokens es la especificación que determina los despliegues.

A mitad de la hoja de especificaciones está la restricción que muerde primero, y no es la calidad. La salida máxima de HY4 Preview es de 64.000 tokens frente a los 128.000 de Astra, en un modelo cuyo propósito declarado son los agentes de programación y las cadenas largas de uso de herramientas. Un archivo generado, un parche de varios archivos, un informe estructurado largo: estas son las salidas que chocan contra un techo y, en una ejecución de agente, el fallo no es una respuesta un poco peor, sino una truncada que el pipeline circundante tiene que detectar y gestionar.

Ambos modelos toman aproximadamente un millón de tokens de entrada, así que el caso de lectura de documentos es un verdadero empate. La diferencia está enteramente en el lado de la generación, y es un factor de dos en vez de un error de redondeo. Súmale la diferencia en la superficie de entrada —Astra acepta imágenes y archivos, HY4 Preview es solo texto— y el panorama que emerge es una división del trabajo nítida en lugar de una clasificación: el modelo de pesos abiertos para bucles de agentes de texto de entrada y texto de salida donde el entregable es una llamada a herramienta o un diff, y el modelo cerrado para cualquier cosa que tenga que mirar algo o escribir algo largo.

Lo que aporta una tasa de salida 20× mayor, línea por línea

• Precio de entrada — Tencent HY4 Preview $0.834 por 1M frente a GPT-6 Astra $10.00, aproximadamente 12×br /> • Precio de salida — HY4 Preview $2.501 por 1M frente a Astra $50.00, aproximadamente 20×br /> • Entrada en caché — HY4 Preview $0.042 por 1M frente a Astra $1.00, aproximadamente 24×br /> • Tramo por solicitud larga — Astra vuelve a fijar el precio de toda la solicitud por encima de 272,000 tokens de entrada a $20.00 y $75.00; la ficha de HY4 Preview no tiene un tramo equivalentebr /> • Tarifa de entrada efectiva en un prompt de 400,000 tokens — HY4 Preview sin cambios en $0.834 frente a Astra $20.00, aproximadamente 24×br /> • Coste por millón de tokens de un bucle de agente habitual, con una proporción de 4:1 entre entrada y salida — HY4 Preview aproximadamente $1.17 frente a Astra aproximadamente $18.00br /> • Coste de un mes de 100 millones de tokens con la misma proporción — HY4 Preview aproximadamente $117 frente a Astra aproximadamente $1,800

La línea de entrada en caché es la que escala peor para el lado caro, porque los bucles de agentes reenvían el mismo system prompt y el prefijo de conversación en cada turno. Con $0,042 frente a $1,00, los tokens más baratos de un bucle largo son 24 veces más baratos en el modelo de Tencent, que es precisamente la carga de trabajo donde una pequeña diferencia por token se acumula más rápido. El costo por tarea, la métrica que zanjaría esto de forma limpia, no lo publica Tencent en absoluto, así que la única manera de obtener el número que importa es ejecutar ambos modelos con tu propio conjunto de tareas y leer el objeto de uso.

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

Lo que un router añade aquí, con las tasas de error a mano

Ambos modelos están en el catálogo de OrcaRouter — tencent/hy4-preview y openai/gpt-6-astra — detrás de un único endpoint compatible con OpenAI, cada uno a la tarifa de lista de su propio proveedor, transferida con un 0% de margen. Ese último detalle importa más en este par que en la mayoría, porque la tarifa de lista del modelo de Tencent se publica en yuanes: las cifras en dólares de arriba son la tarifa convertida que realmente ves, no un margen de revendedor, y si Tencent cambia el precio, el cambio se aplica aquí el mismo día en lugar de en la próxima renovación del contrato.

El DSL de enrutamiento es donde los dos modelos dejan de ser alternativas. La regla natural para este par es el escalado en la salida: envía el bucle al modelo barato y, cuando una respuesta vuelva truncada contra el techo de 64,000 tokens o falle tu verificación de esquema, reintenta ese paso contra openai/gpt-6-astra, que tiene el doble de espacio de salida. La conmutación por error automática es la otra mitad del argumento, y no es teórica cuando una de las dos rutas ha estado fallando en una de cada diez solicitudes durante la última semana — una ejecución larga de agente fijada a un solo modelo muere con su contexto acumulado, y ninguno de estos modelos es lo bastante barato como para volver a ejecutarlo desde el principio por accidente.

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

¿Qué cambiaría esta comparación?

Tres cosas, en orden de cuánto moverían la aguja. Una evaluación independiente de HY4 Preview: el modelo lleva seis semanas siendo público, no tiene un índice de terceros, ni una cifra reproducida de Terminal-Bench ni una cifra de costo por tarea, y la única evaluación ciega realizada por el proveedor es la única fuente de datos sobre preferencias humanas que existe. Un costo publicado por tarea completada para ambos modelos, que reemplazaría cada ratio de este artículo con un solo número. Y una decisión de Tencent sobre inferencia de terceros, porque cualquiera puede servir los pesos bajo Apache 2.0, y en el momento en que hosts de la competencia pongan en marcha HY4 Preview, el precio del lado barato de esta comparación se convierte en un mercado en lugar de una lista de precios.

Hasta entonces, el resumen utilizable es más limitado que la publicación de lanzamiento de cualquiera de los proveedores y más honesto que un marcador: GPT-6 Astra es el modelo cuyas afirmaciones de capacidad se han verificado, con el doble de límite de salida y una ruta que ha estado fallando una solicitud de cada diez. Tencent HY4 Preview es el modelo cuyas afirmaciones de capacidad no se han verificado, con una arquitectura publicada, una licencia abierta, un tercio del precio y una tasa de error mucho menor en la misma ventana. Si tu trabajo es texto de entrada, texto de salida y cabe dentro de 64.000 tokens generados, el modelo más barato no es una solución de compromiso: es la respuesta correcta, y el registro de auditoría es lo único a lo que renuncias.

La regla natural para este par es escalar en la salida: envía el bucle al modelo económico y, cuando una respuesta vuelva truncada contra el límite de 64.000 tokens o no pase tu validación de esquema, reintenta ese paso contra openai/gpt-6-astra, que tiene el doble de espacio de salida.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario