Tarjeta de título generada para Agora-2 vs Grok 4.6, con el subtítulo «1200 agentes LLM y el simulador que no usa ninguno». Tres tarjetas: «Grok 4.6: índice AA 44, $2/$6 por 1M, $0,50 en caché»; «Agora-2: 16 políticas de agentes RL, sin LLM en el bucle»; «Agora-2: tick de 30 Hz, 4 GPU RTX PRO 4500 por sesión». El pie de página dice: «Cifras de Agora-2 del propio informe de Odyssey, no reproducidas; Grok 4.6 según Artificial Analysis».
Guides & Insights

Agora-2 vs Grok 4.6: la cuestión de la política de agentes — 1.200 agentes LLM, y el simulador que no usa ninguno de los dos

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Aquí hay un número que cuesta dinero. La investigación de METR sobre el incidente de Hugging Face de julio de 2026 contabilizó aproximadamente 1.200 agentes coordinados dentro de una única ejecución de evaluación. A Grok 4.6 tarifa de precios — 2,00 $ por millón de tokens de entrada, 6,00 $ por millón de salida —, una flota de ese tamaño, generando transcripciones largas durante seis días, es una factura que un equipo bien financiado puede absorber. Al precio del modelo al que recurrirías de otro modo, no lo es. Esa es la verdadera propuesta de producto de Grok 4.6, y es la misma afirmación que Agora-2 contradice en silencio: cuando Odyssey presentó su modelo de mundo multiagente el 21 de septiembre de 2026 — una vista previa jugable que genera entornos compartidos para hasta 20 humanos y agentes de IA —, los agentes que contenía resultaron no ser modelos de lenguaje en absoluto. En su lugar, Odyssey entrenó pequeñas políticas de aprendizaje por refuerzo. La pregunta interesante que plantea este emparejamiento no es cuál es mejor. Es por qué el laboratorio se saltó el LLM.

La tarjeta de tarifas, en la unidad que importa para las flotas

Grok 4.6 se lanzó el 12 de agosto de 2026 como el nivel frontier de xAI: una ventana de contexto de 500.000 tokens, entrada de texto, imágenes y archivos, esfuerzo de razonamiento configurable, llamada nativa a herramientas, salidas estructuradas y un Artificial Analysis Intelligence Index de 44 en el índice v4.3.2 — el mismo índice que sitúa a GPT-5.6 Sol en 47 y a Kimi K3 en 44. Artificial Analysis le otorga 94,9 en GPQA Diamond, y es el modelo que xAI incluye como "Latest" en su propia documentación para desarrolladores. Se sirve como un modelo OpenAI Responses de primera clase, que es el punto práctico: los frameworks de agentes lo adoptan cambiando una URL base, no escribiendo un adaptador.

Pero la cifra interesante es la combinación de $2/$6 con la ventana de contexto. Los bucles de agentes de horizonte largo son cargas de trabajo ingratas: decenas de miles de tokens de salida acumulada de herramientas por agente por hora, la mayor parte redundante. La tarifa de lectura de caché de Grok 4.6 es de $0.50 por millón, una cuarta parte de su precio de entrada, que es lo que hace que una ejecución de mil agentes sea aritméticamente plausible en lugar de meramente posible. Nótese el límite de nivel: los prompts de más de 200K tokens se facturan al doble de la tarifa base, por lo que un agente que acumula un historial largo duplica silenciosamente su propio costo.

• Precio — Agora-2 no tiene precio publicado, solo vista previa en el navegador, frente a Grok 4.6 $2.00/$6.00 por 1M, $0.50 por lectura en caché, el doble por encima de 200K de entrada

• Contexto — el estado compartido de Agora-2 más el historial acotado por vista frente a los 500.000 tokens de Grok 4.6

• Puntuación independiente — Agora-2: ninguna publicada frente a Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• Razonamiento — Agora-2 no aplicable, no es un modelo de lenguaje; frente a Grok 4.6, esfuerzo configurable y llamada nativa a herramientas

• Acceso — vista previa jugable de Agora-2, sin API, sin pesos vs la API propietaria de Grok 4.6

• Hardware — Agora-2, cuatro GPU RTX PRO 4500 para cuatro vistas concurrentes frente a Grok 4.6, un endpoint alojado

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Por qué Odyssey no puso un LLM en la arena

El atajo obvio, si estás construyendo un mundo donde dieciséis agentes de IA se enfrentan a cuatro humanos, es conectar un modelo de texto capaz a los controles y dejarlo jugar. Odyssey no hizo eso, y su informe técnico explica por qué en la tabla de configuración. La política del agente en Agora-2 es una política recurrente escalar y espacial que consume un historial de dieciséis observaciones y emite una acción cada cuatro ticks de simulación a través de catorce ramas de movimiento discretas. La simulación misma avanza sobre una base temporal de ticks de 30 Hz. Un modelo al que se le pide tomar una decisión treinta veces por segundo, desde una vista parcialmente observada, con un vocabulario fijo de acciones de bajo nivel, no es un problema de razonamiento — es un problema de control, y los problemas de control se resuelven entrenando una política pequeña, no pidiéndoselo a un modelo de frontera de contexto de 500K.

Vale la pena decirlo con claridad porque es el error de concepto más común sobre la categoría de los modelos del mundo. Agora-2 no compite con Grok 4.6 por la misma ranura en un sistema. Ocupa la ranura inferior: el entorno en el que se entrena y se evalúa la política. La arquitectura del informe es explícita sobre la división: un modelo de simulación predice cómo las acciones combinadas cambian el estado compartido, un servidor de mundo las aplica, y un modelo de renderizado por vista genera la perspectiva de 640×480 propia de cada participante a partir de ese estado. Ningún modelo de texto aparece en ningún punto del bucle de interacción.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Donde sí aparece un modelo como Grok 4.6 es un nivel más arriba: como lo que escribe el andamiaje de evaluación, analiza las transcripciones o impulsa al agente que usa herramientas cuyo comportamiento intentas estudiar. Ese es precisamente el papel que desempeñó GPT-5.6 Sol en la investigación de METR —alrededor del 5% de la flota, y el analista que lee los registros—, y es el papel que el precio y la ventana de contexto de Grok 4.6 abaratan.

La brecha de evidencia es más amplia aquí que en la mayoría de estos enfrentamientos.

La puntuación de índice de Grok 4.6 se mide de forma independiente, su tabla de tarifas está publicada y su ventana de contexto está documentada. Las cifras de Agora-2 provienen de un informe elaborado por Team Odyssey y que nadie ha reproducido. En treinta clips de monitorización, su renderizador de prefijo estructurado alcanza 30,11 dB de PSNR frente a 20,67 dB de una línea base VAE —una comparación que el propio informe advierte que se da entre sistemas completos con presupuestos de entrenamiento no equiparables, no una prueba de arquitectura aislada. Su benchmark de condicionamiento, que muestra una reducción del 45,8 % en el tiempo del denoiser frente a la atención cruzada, utiliza denoisers inicializados aleatoriamente sobre entradas sintéticas y mide el coste de ejecución, no la calidad de la imagen.

Luego, la sección de limitaciones, que es inusualmente directa. Las cifras declaradas de 15 actualizaciones latentes y 30 fotogramas mostrados por segundo son objetivos. La tasa de fotogramas sostenida y la latencia entre la entrada y la visualización durante la interacción en vivo con múltiples agentes "no se han evaluado cuantitativamente". La calidad visual a largo plazo, la concordancia entre vistas y el cumplimiento de las acciones de extremo a extremo figuran como no evaluados. El entorno requiere un motor de juego instrumentado con geometría explícita y un vocabulario de apariencia fijo, y la transferencia a nuevos recursos, reglas o entornos no se ha probado. Lea esa lista antes de leer cualquier cifra de titular sobre Agora-2.

¿Cuál pertenece a tu stack?

Si hoy ejecutas o estudias sistemas multiagente, Grok 4.6 es el componente que realmente puedes desplegar: un modelo de texto de clase frontera a una tarifa que hace asequibles las grandes flotas de agentes, con una puntuación publicada y una superficie de API documentada. En OrcaRouter se ofrece al propio precio de lista de xAI, sin recargo alguno, así que los $2/$6 anteriores y cualquier cambio futuro de tarifa llegan a tu factura el mismo día en que ocurren, con conmutación automática por error si el endpoint primario se degrada. Ambos hechos importan específicamente para cargas de trabajo de flotas: mil agentes son mil oportunidades de topar con un proveedor degradado, y un recargo sobre los $6 de salida es un recargo multiplicado por toda tu ejecución.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 no es infraestructura desplegable y no lo alojamos — no hay API, ni pesos ni precio, solo la propia vista previa jugable de Odyssey. Lo que ofrece es un tipo distinto de valor: un entorno controlado para la investigación sobre interacciones que el informe de METR muestra que ahora es urgente, a un costo de cuatro GPU RTX PRO 4500 para cuatro vistas concurrentes en lugar de una factura de API. El veredicto honesto es que estos dos no compiten. Grok 4.6 es el cerebro de políticas que puedes comprar por token hoy; Agora-2 es una propuesta sobre dónde probar qué ocurre cuando miles de esos cerebros se encuentran. El segundo es más investigación interesante y menos producto terminado, y el propio informe de Odyssey es de una claridad refrescante sobre qué partes de él siguen siendo objetivos.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario