
Agora-2 vs Grok 4.6: la cuestión de la política de agentes — 1.200 agentes LLM, y el simulador que no usa ninguno de los dos
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Aquí hay un número que cuesta dinero. La investigación de METR sobre el incidente de Hugging Face de julio de 2026 contabilizó aproximadamente 1.200 agentes coordinados dentro de una única ejecución de evaluación. A Grok 4.6 tarifa de precios — 2,00 $ por millón de tokens de entrada, 6,00 $ por millón de salida —, una flota de ese tamaño, generando transcripciones largas durante seis días, es una factura que un equipo bien financiado puede absorber. Al precio del modelo al que recurrirías de otro modo, no lo es. Esa es la verdadera propuesta de producto de Grok 4.6, y es la misma afirmación que Agora-2 contradice en silencio: cuando Odyssey presentó su modelo de mundo multiagente el 21 de septiembre de 2026 — una vista previa jugable que genera entornos compartidos para hasta 20 humanos y agentes de IA —, los agentes que contenía resultaron no ser modelos de lenguaje en absoluto. En su lugar, Odyssey entrenó pequeñas políticas de aprendizaje por refuerzo. La pregunta interesante que plantea este emparejamiento no es cuál es mejor. Es por qué el laboratorio se saltó el LLM.
La tarjeta de tarifas, en la unidad que importa para las flotas
Grok 4.6 se lanzó el 12 de agosto de 2026 como el nivel frontier de xAI: una ventana de contexto de 500.000 tokens, entrada de texto, imágenes y archivos, esfuerzo de razonamiento configurable, llamada nativa a herramientas, salidas estructuradas y un Artificial Analysis Intelligence Index de 44 en el índice v4.3.2 — el mismo índice que sitúa a GPT-5.6 Sol en 47 y a Kimi K3 en 44. Artificial Analysis le otorga 94,9 en GPQA Diamond, y es el modelo que xAI incluye como "Latest" en su propia documentación para desarrolladores. Se sirve como un modelo OpenAI Responses de primera clase, que es el punto práctico: los frameworks de agentes lo adoptan cambiando una URL base, no escribiendo un adaptador.
Pero la cifra interesante es la combinación de $2/$6 con la ventana de contexto. Los bucles de agentes de horizonte largo son cargas de trabajo ingratas: decenas de miles de tokens de salida acumulada de herramientas por agente por hora, la mayor parte redundante. La tarifa de lectura de caché de Grok 4.6 es de $0.50 por millón, una cuarta parte de su precio de entrada, que es lo que hace que una ejecución de mil agentes sea aritméticamente plausible en lugar de meramente posible. Nótese el límite de nivel: los prompts de más de 200K tokens se facturan al doble de la tarifa base, por lo que un agente que acumula un historial largo duplica silenciosamente su propio costo.
• Precio — Agora-2 no tiene precio publicado, solo vista previa en el navegador, frente a Grok 4.6 $2.00/$6.00 por 1M, $0.50 por lectura en caché, el doble por encima de 200K de entrada
• Contexto — el estado compartido de Agora-2 más el historial acotado por vista frente a los 500.000 tokens de Grok 4.6
• Puntuación independiente — Agora-2: ninguna publicada frente a Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• Razonamiento — Agora-2 no aplicable, no es un modelo de lenguaje; frente a Grok 4.6, esfuerzo configurable y llamada nativa a herramientas
• Acceso — vista previa jugable de Agora-2, sin API, sin pesos vs la API propietaria de Grok 4.6
• Hardware — Agora-2, cuatro GPU RTX PRO 4500 para cuatro vistas concurrentes frente a Grok 4.6, un endpoint alojado

Por qué Odyssey no puso un LLM en la arena
El atajo obvio, si estás construyendo un mundo donde dieciséis agentes de IA se enfrentan a cuatro humanos, es conectar un modelo de texto capaz a los controles y dejarlo jugar. Odyssey no hizo eso, y su informe técnico explica por qué en la tabla de configuración. La política del agente en Agora-2 es una política recurrente escalar y espacial que consume un historial de dieciséis observaciones y emite una acción cada cuatro ticks de simulación a través de catorce ramas de movimiento discretas. La simulación misma avanza sobre una base temporal de ticks de 30 Hz. Un modelo al que se le pide tomar una decisión treinta veces por segundo, desde una vista parcialmente observada, con un vocabulario fijo de acciones de bajo nivel, no es un problema de razonamiento — es un problema de control, y los problemas de control se resuelven entrenando una política pequeña, no pidiéndoselo a un modelo de frontera de contexto de 500K.
Vale la pena decirlo con claridad porque es el error de concepto más común sobre la categoría de los modelos del mundo. Agora-2 no compite con Grok 4.6 por la misma ranura en un sistema. Ocupa la ranura inferior: el entorno en el que se entrena y se evalúa la política. La arquitectura del informe es explícita sobre la división: un modelo de simulación predice cómo las acciones combinadas cambian el estado compartido, un servidor de mundo las aplica, y un modelo de renderizado por vista genera la perspectiva de 640×480 propia de cada participante a partir de ese estado. Ningún modelo de texto aparece en ningún punto del bucle de interacción.

Donde sí aparece un modelo como Grok 4.6 es un nivel más arriba: como lo que escribe el andamiaje de evaluación, analiza las transcripciones o impulsa al agente que usa herramientas cuyo comportamiento intentas estudiar. Ese es precisamente el papel que desempeñó GPT-5.6 Sol en la investigación de METR —alrededor del 5% de la flota, y el analista que lee los registros—, y es el papel que el precio y la ventana de contexto de Grok 4.6 abaratan.
La brecha de evidencia es más amplia aquí que en la mayoría de estos enfrentamientos.
La puntuación de índice de Grok 4.6 se mide de forma independiente, su tabla de tarifas está publicada y su ventana de contexto está documentada. Las cifras de Agora-2 provienen de un informe elaborado por Team Odyssey y que nadie ha reproducido. En treinta clips de monitorización, su renderizador de prefijo estructurado alcanza 30,11 dB de PSNR frente a 20,67 dB de una línea base VAE —una comparación que el propio informe advierte que se da entre sistemas completos con presupuestos de entrenamiento no equiparables, no una prueba de arquitectura aislada. Su benchmark de condicionamiento, que muestra una reducción del 45,8 % en el tiempo del denoiser frente a la atención cruzada, utiliza denoisers inicializados aleatoriamente sobre entradas sintéticas y mide el coste de ejecución, no la calidad de la imagen.
Luego, la sección de limitaciones, que es inusualmente directa. Las cifras declaradas de 15 actualizaciones latentes y 30 fotogramas mostrados por segundo son objetivos. La tasa de fotogramas sostenida y la latencia entre la entrada y la visualización durante la interacción en vivo con múltiples agentes "no se han evaluado cuantitativamente". La calidad visual a largo plazo, la concordancia entre vistas y el cumplimiento de las acciones de extremo a extremo figuran como no evaluados. El entorno requiere un motor de juego instrumentado con geometría explícita y un vocabulario de apariencia fijo, y la transferencia a nuevos recursos, reglas o entornos no se ha probado. Lea esa lista antes de leer cualquier cifra de titular sobre Agora-2.
¿Cuál pertenece a tu stack?
Si hoy ejecutas o estudias sistemas multiagente, Grok 4.6 es el componente que realmente puedes desplegar: un modelo de texto de clase frontera a una tarifa que hace asequibles las grandes flotas de agentes, con una puntuación publicada y una superficie de API documentada. En OrcaRouter se ofrece al propio precio de lista de xAI, sin recargo alguno, así que los $2/$6 anteriores y cualquier cambio futuro de tarifa llegan a tu factura el mismo día en que ocurren, con conmutación automática por error si el endpoint primario se degrada. Ambos hechos importan específicamente para cargas de trabajo de flotas: mil agentes son mil oportunidades de topar con un proveedor degradado, y un recargo sobre los $6 de salida es un recargo multiplicado por toda tu ejecución.

Agora-2 no es infraestructura desplegable y no lo alojamos — no hay API, ni pesos ni precio, solo la propia vista previa jugable de Odyssey. Lo que ofrece es un tipo distinto de valor: un entorno controlado para la investigación sobre interacciones que el informe de METR muestra que ahora es urgente, a un costo de cuatro GPU RTX PRO 4500 para cuatro vistas concurrentes en lugar de una factura de API. El veredicto honesto es que estos dos no compiten. Grok 4.6 es el cerebro de políticas que puedes comprar por token hoy; Agora-2 es una propuesta sobre dónde probar qué ocurre cuando miles de esos cerebros se encuentran. El segundo es más investigación interesante y menos producto terminado, y el propio informe de Odyssey es de una claridad refrescante sobre qué partes de él siguen siendo objetivos.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
