
Agora-2 vs MiniMax M3: Una GPU por participante, o trece centavos por millón de tokens
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Dos formas de ejecutar una multitud de agentes, con precios en dos monedas distintas. MiniMax M3 cuesta $0,30 por millón de tokens de entrada y $1,20 por millón de salida — una tarifa que convierte un experimento de mil agentes en una línea de presupuesto y no en una ronda de financiación. Agora-2, el modelo de mundo multiagente Odyssey presentado en vista previa el 21 de septiembre de 2026, cuesta una NVIDIA RTX PRO 4500 por cada vista de participante: una sesión de cuatro jugadores se ejecuta en cuatro GPU, con un modelo de renderizado por tarjeta que genera la perspectiva 640×480 de ese jugador, y una de esas cuatro tarjetas también soporta la simulación compartida y las dieciséis políticas de agentes autónomos. La cifra de MiniMax M3 es por token y escala según cuánto piensen tus agentes. La cifra de Agora-2 es por par de ojos y escala según cuántos participantes simultáneos pongas en el mundo. Compararlas es comparar un presupuesto de razonamiento con un presupuesto de renderizado y, para cualquiera que planifique un estudio multiagente en 2026, eso resulta ser lo útil que conviene hacer.
El lado del token del libro mayor
MiniMax M3 es el buque insignia de pesos abiertos de MiniMax, lanzado el 31 de mayo de 2026: un modelo de mezcla de expertos disperso de 428 mil millones de parámetros con aproximadamente 23 mil millones de parámetros activos por token, una ventana de contexto de 1.048.576 tokens de la cual MiniMax garantiza 512K utilizables, texto, imagen y vídeo, y una puntuación de 29 en el Artificial Analysis Intelligence Index v4.3.2. Obtiene 83,5 en BrowseComp y 76,1 en BankerTool en cifras del proveedor —números propios de MiniMax, no reproducidos aquí—, y Artificial Analysis lo mide en 145 tokens de salida por segundo, el décimo modelo más rápido de esa clasificación.
El número relevante para las flotas de agentes, sin embargo, es la tasa de lectura de caché: $0.06 por millón de tokens en caché, una quinta parte del precio de entrada. Los bucles de agentes están dominados por el prefijo —el mismo mensaje de sistema, los mismos esquemas de herramientas, el mismo historial acumulativo, reenviado en cada turno—, por lo que el coste efectivo de un bucle se acerca mucho más a $0.06 que a $0.30 para la mayor parte de sus tokens. Esa es la aritmética que hace que una ejecución de 1.200 agentes, del tipo que METR documentó dentro de la evaluación ExploitGym de OpenAI de julio de 2026, sea algo que un grupo de investigación pueda reproducir de verdad en lugar de limitarse a leer sobre ello.
El lado de la GPU del balance
La estructura de costos de Agora-2 se revela en su propio apéndice de implementación, y es refrescantemente concreta. Una RTX PRO 4500 Blackwell Server Edition por vista. Cuatro para una sesión de cuatro jugadores. Esas tarjetas generan la vista de cada participante a un objetivo de quince actualizaciones latentes y treinta fotogramas mostrados por segundo a 640×480, y la simulación avanza con un tick de 30 Hz. El informe también proporciona la escala de entrenamiento para el trabajo en torno: un lote global efectivo de 128 a través de 32 GPU B200.
Traducido a la misma unidad que MiniMax M3, eso es una GPU de centro de datos por participante concurrente, más la simulación compartida que va sobre una de ellas. Es un coste fijo al que no le importa cuánto deliberen tus agentes y que no baja cuando se quedan callados. Se derivan dos consecuencias, y apuntan en direcciones opuestas. Con pocos participantes y un razonamiento intensivo por agente, el modelo de tokens es obviamente más barato: pagas céntimos por pensar y nada por el segundo agente en la sala. Con muchos participantes e interacción densa, la aritmética se invierte: veinte participantes concurrentes en un mundo compartido son veinte GPUs, una cifra que no crece con el número de tokens que gasta cada uno.
• Unidad de costo — Agora-2 una RTX PRO 4500 por vista de participante frente a MiniMax M3 $0,30/$1,20 por 1 M de tokens
• Lecturas de caché — Agora-2 no aplicable, sin facturación por tokens frente a MiniMax M3 $0.06 por 1 M en caché
• Puntuación independiente — Agora-2: ninguna publicada vs. MiniMax M3 AA Intelligence Index 29 (v4.3.2)
• Contexto — estado compartido de Agora-2 más historial acotado por vista frente a los 1.048.576 tokens de MiniMax M3, 512K garantizados
• Salida — vídeo Agora-2 de 640×480 a un objetivo de 30 fps frente a texto de MiniMax M3
• Acceso — vista previa en navegador de Agora-2, sin API, sin pesos vs MiniMax M3 con pesos abiertos, licencia comunitaria, API


Por qué los dos costos no son sustitutos
Es tentador interpretar esto como una disyuntiva, y no lo es. MiniMax M3 es un cerebro de política: lee una situación parcialmente observada, razona, llama a herramientas y emite una acción. Agora-2 es un entorno en el que las acciones tienen consecuencias visibles para otros participantes: un modelo de simulación que predice cómo las acciones combinadas cambian el estado compartido, un servidor de mundo que las aplica, y renderizadores por vista para que cada participante vea el mismo mundo desde su propia perspectiva. Las dieciséis entidades autónomas de Odyssey no están impulsadas por ningún modelo de lenguaje; son políticas recurrentes escalares y espaciales entrenadas con aprendizaje por refuerzo, que consumen un historial de dieciséis observaciones y actúan cada cuatro ticks de simulación. Esa elección de diseño es la señal reveladora. A treinta ticks por segundo, decidir qué hacer es un problema de control, y los problemas de control se resuelven entrenando una política pequeña en lugar de llamar a una API.
Así que el planteamiento honesto para un equipo que planifica trabajo multiagente es que estos viven en capas diferentes y necesitas un presupuesto para cada una. La capa de razonamiento es barata y elástica, y puedes buscar la mejor oferta. La capa de entorno, si quieres algo distinto de un motor de juego, actualmente es una vista previa de investigación con una huella con forma de GPU y sin API publicada. Ambos hechos son lo bastante nuevos —M3 desde mayo, Agora-2 desde septiembre— como para que casi nadie tenga todavía un modelo de costos para la combinación.
Qué está verificado y qué es un objetivo
La puntuación independiente de MiniMax M3, la ventana de contexto, las modalidades y el precio son datos publicados y verificables hoy. Sus cifras de BrowseComp y BankerToolBench están reportadas por el proveedor y deberían etiquetarse como tales siempre que las cites.
Los números de Agora-2 provienen enteramente del informe técnico de Team Odyssey y nadie fuera de la empresa los ha reproducido. Su resultado de renderizado —30,11 dB de PSNR para el renderizador de prefijo estructurado frente a 20,67 dB para una línea base VAE en treinta clips de monitoreo— es una comparación de sistemas completos con presupuestos de entrenamiento no equiparables, como señala el propio informe. Su reducción del 45,8 % en el tiempo del denoiser frente a la atención cruzada proviene de denoisers inicializados aleatoriamente sobre entradas sintéticas y mide el costo de ejecución, no la calidad de imagen. Y su sección de limitaciones afirma claramente que las tasas de quince actualizaciones por segundo y treinta fotogramas por segundo son objetivos; que la tasa de fotogramas sostenida y la latencia de entrada a pantalla durante la interacción multiagente en vivo "no se han evaluado cuantitativamente"; que la calidad visual a largo horizonte, la concordancia entre vistas y la adherencia a las acciones de extremo a extremo siguen sin evaluarse; que el entorno necesita un motor instrumentado con geometría explícita y un vocabulario de apariencia fijo; y que la transferencia más allá del dominio de entrenamiento no se ha probado. Cualquiera que construya un modelo de costos con una GPU por vista debería leer esa sección primero, porque el rendimiento por GPU es exactamente lo que no se ha medido.
La llamada
Si estás construyendo flotas de agentes — muchos modelos, bucles largos, llamadas a herramientas, sin renderizado — MiniMax M3 es la forma creíble más barata de hacerlo a escala, y la tarifa de lectura de caché es el número que decide tu factura. Se enruta en OrcaRouter al precio de lista del propio MiniMax sin margen, así que la tarifa de caché de $0.06 es lo que pagas, con failover entre proveedores si un endpoint se degrada a mitad de ejecución. Para las flotas en concreto, el pass-through importa más de lo habitual: un margen de revendedor sobre los tokens en caché es un margen multiplicado por cada turno de cada agente.

Agora-2 no es algo a lo que se pueda enrutar —no hay API, ni precio ni pesos, solo la vista previa en navegador de Odyssey— y no lo alojamos. Lo que sí es, es el primer simulador de mundo compartido construido específicamente para que se pueda observar cómo interactúan muchos participantes, humanos y sintéticos, en condiciones controladas, y el informe que lo acompaña es inusualmente franco sobre lo lejos que está actualmente de ser un producto. Si tu problema es razonar a escala, MiniMax M3 ya está disponible y es barato. Si tu problema es qué ocurre cuando mil de esos razonadores comparten un mundo, Odyssey ha construido la arena y ha dejado las mediciones difíciles para que las ejecute otro.
