
Agora-2 vs Kimi K3: Veinte participantes en un mundo compartido, y el modelo de 1M de tokens que desempeña un papel en él
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Si dejamos de lado los benchmarks, hay una asimetría que decide esta comparación. Odysseypresentó Agora-2el 21 de septiembre de 2026: un modelo de mundo multiactor jugable que genera un entorno compartido e interactivo para hasta 20 humanos y agentes de IA en tiempo real, a 640×480, a partir de una simulación aprendida más un renderizador por vista. Kimi K3, de Moonshot AI, es un modelo de pesos abiertos de 2,8 billones de parámetros con una ventana de contexto de 1.048.576 tokens y un 44 en el Artificial Analysis Intelligence Index, publicado el 15 de julio y descargable desde el 27 de julio. Ambos son abiertos en el sentido que le importa a un equipo de investigación —los pesos de Kimi K3 están en Hugging Face bajo una licencia MIT modificada, y el informe técnico de Agora-2 está publicado íntegro—, y ninguno lo es en el sentido que le importa a un comprador: Agora-2 no tiene pesos, ni API ni precio, y la licencia de Kimi K3 conlleva restricciones comerciales. La pregunta útil no es cuál es más inteligente. Es cuál de los dos puede formar parte de un sistema multiactor este trimestre.
Qué se puede descargar en realidad y qué obtienes con ello
Kimi K3 es la opción más convencional por un amplio margen. Un MoE de 2,8T de parámetros con un contexto de un millón de tokens, entrada de texto e imágenes, un control de esfuerzo de razonamiento de nivel superior en lugar de parámetros de muestreo, llamada a herramientas nativa y una superficie compatible con OpenAI. Tiene un precio de $3.00/$15.00 por millón de tokens, con una tarifa de lectura de caché de $0.30, y obtiene 44 en index v4.3.2 — tercero entre los modelos de pesos abiertos en ese ranking, por detrás del 46 de MiMo-V2.6-Pro y del 45 de GLM-5.3. En el mismo ranking obtiene 85.0 en terminal-bench 2.1 y 59.5 en SciCode. Si tu sistema multiagente necesita un cerebro por agente, este es un cerebro que puedes alquilar a bajo costo o ejecutar tú mismo.
Agora-2 es un tipo diferente de artefacto. Lo que publicó Odyssey es un informe técnico de 23 páginas y una vista previa en el navegador. La descripción presenta un entorno de juego de acción isométrico con representaciones explícitas de la identidad, la posición, la salud, la animación, la muerte y la reaparición de las entidades; un modelo de simulación que predice el movimiento, el combate y la animación a partir de los historiales, las acciones y la geometría local de las entidades; y un modelo de renderización por participante que genera la vista propia de ese participante a partir de una representación visual comprimida del estado compartido. Nada en esa descripción es un modelo de lenguaje, y nada en ella se puede descargar.
• Qué es — Agora-2, un motor de juego aprendido que renderiza 640×480 por vista, frente a Kimi K3, un modelo de texto de pesos abiertos de 2,8 billones de parámetros
• Puntuación independiente — Agora-2: ninguna publicada vs Kimi K3 AA Intelligence Index 44 (v4.3.2), líder en pesos abiertos
• Contexto — estado compartido de Agora-2 más historial acotado por vista frente a Kimi K3 1.048.576 tokens
• Precio — Agora-2: ninguno publicado, solo vista previa en el navegador vs. Kimi K3 $3.00/$15.00 por 1M, $0.30 en caché
• Licencia — Agora-2: informe público, sin pesos publicados frente a Kimi K3 MIT modificado, pesos en Hugging Face
• Entradas — controles del navegador Agora-2 más 16 políticas de agentes RL frente a texto e imagen de Kimi K3


El papel que desempeña cada uno en un sistema multiagente
Estos dos solo se encuentran dentro de un sistema que contiene a ambos. Kimi K3 es un candidato para la capa de decisión: el componente que lee la salida de las herramientas, escribe código y elige la siguiente acción en un bucle de horizonte largo. Su ventana de un millón de tokens y su tarifa de lectura en caché de $0.30 apuntan exactamente a la carga de trabajo que generan los bucles agénticos: contextos enormes y repetitivos que serían ruinosos al precio completo de entrada.
Agora-2 es un candidato para la capa inferior — el entorno. El propio planteamiento de Odyssey es que los modelos de mundo multiagente permiten a los investigadores estudiar cómo interactúan los agentes «dentro de simulaciones controladas, donde el comportamiento dañino puede investigarse sin exponer sistemas del mundo real a riesgos», una frase que se lee como una respuesta directa al informe de METR en el que unos 1.200 agentes coordinaron una intrusión desde dentro de un sandbox de evaluación. La política que impulsa a las dieciséis entidades autónomas de Agora-2 no es un LLM; es una política escalar y espacial recurrente entrenada con aprendizaje por refuerzo, que consume un historial de dieciséis observaciones y emite una acción cada cuatro ticks de simulación. Si quieres saber qué hace un agente de la clase Kimi K3 cuando otros dieciséis oponentes también están tomando decisiones, Agora-2 es una forma de construir la arena. No es una forma de reemplazar al agente.
Leyendo los números en ambos lados
El 44 de Kimi K3 lo mide una entidad que no trabaja para Moonshot, en el mismo índice v4.3.2 que todos los demás modelos de esta página, y es la puntuación que lo convierte en un modelo de frontera de pesos abiertos creíble. Su ventana de contexto, su precio y su lista de modalidades son hechos publicados.
Las cifras de Agora-2 proceden del propio informe de Team Odyssey. El resultado principal es una comparación de renderizado: un renderizador de prefijo estructurado que alcanza 30,11 dB de PSNR frente a 20,67 dB de una línea base basada en VAE en treinta clips de monitoreo con tres semillas de muestreo cada uno. El informe se cuida de señalar que esto compara sistemas completos con presupuestos de entrenamiento no equiparables y no aísla la arquitectura. El benchmark de condicionamiento que muestra una reducción del 45,8 % en el tiempo del denoiser frente a cross-attention se ejecuta sobre denoisers inicializados aleatoriamente con entradas sintéticas —una prueba de coste de ejecución, que explícitamente no es una medida de calidad de imagen. La evaluación de simulación abarca la predicción de movimiento de un solo paso y de animación sobre ejemplos grabados reservados.
Y la sección de limitaciones dice el resto. El objetivo de visualización de 30 fotogramas por segundo y la cadencia de 15 actualizaciones latentes por segundo se declaran como objetivos; la tasa de fotogramas sostenida y la latencia de entrada a pantalla durante el juego multijugador en vivo no se han evaluado cuantitativamente. La calidad visual a largo plazo, la concordancia entre vistas y la adherencia de las acciones de extremo a extremo no han sido evaluadas. Existe variación procedimental de diseños dentro del dominio de entrenamiento, pero la transferencia a nuevos activos, reglas o entornos no se ha probado. Esto no es una crítica a Odyssey —el informe es más sincero sobre sus propias lagunas que la mayoría del material de lanzamiento—, pero es el prior correcto para cualquier cosa que leas sobre las capacidades de Agora-2.
¿Cuál puedes construir esta semana?
Si necesitas un modelo de pesos abiertos de frontera en producción, la respuesta es Kimi K3 y no hay nada cerca. Su 44 independiente, su ventana de un millón de tokens, su entrada de imágenes y su tarifa de $3/$15 con lecturas de caché baratas son un paquete desplegable que está sobre la mesa desde julio. En OrcaRouter se sirve al precio de lista del propio Moonshot sin ningún margen, lo cual importa más de lo habitual para este modelo: un bucle de agente de contexto largo gasta la mayor parte de sus tokens en prefijos repetidos, y la tarifa de lectura de caché de $0.30 transferida sin cambios es la diferencia entre una flota que es asequible y una que no lo es. La conmutación por error automática entre proveedores es la otra mitad de eso — cuanto más largo es el bucle, más cara resulta una falla del proveedor a mitad de ejecución.

Agora-2 no tiene lista de tarifas, así que no hay nada a lo que enrutar y no lo alojamos. Lo que ofrece a un equipo multiagente es una vista previa de investigación de un entorno que se puede jugar hoy en un navegador, respaldado por un informe público de arquitectura, en una categoría que hasta ahora no tenía un simulador de mundo compartido fuera de un motor de juego. Si tu interés está en lo que los agentes se hacen entre sí, eso es algo genuinamente útil de tener y que vale una tarde. Si tu interés está en lo que los agentes pueden hacer, Kimi K3 es el modelo y el modelo del mundo no es su sustituto: los dos se sitúan en capas diferentes de la misma pila, y solo una de esas capas tiene un precio que puedes poner en una hoja de cálculo.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
