
Apodex 1.1, explicado: un 44 en el Índice de Inteligencia, fuerza agéntica real — y un inconveniente sobre la fiabilidad del conocimiento.
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Apodex 1.1 tiene una semana de antigüedad, es propietario y hasta esta semana era sobre todo una curiosidad de laboratorio. Entonces Artificial Analysis publicó su primera evaluación independiente del modelo —la primera de Apodex en la plataforma— y el marcador hizo algo inusual: Apodex 1.1 obtuvo un 44 en el Índice de Inteligencia de Artificial Analysis, ocupando el puesto #11 de 177, mientras que registró puntuaciones de trabajo agéntico que superaron a todos los modelos de su nivel de inteligencia, incluidos DeepSeek V4 Pro, Qwen3.7 Max y Kimi K2.6. El mismo informe sacó a la luz un segundo número, más feo: un registro de fiabilidad del conocimiento lo bastante débil como para cambiar la decisión de ejecutar trabajo real sobre él. Su hermano de pesos abiertos, Apodex 1.1 Mini, es el modelo que la mayoría de la gente puede ejecutar realmente. Esto es lo que dice la evaluación, lo que no dice y a quién debería importarle.
Apodex, la empresa de IA fundada por Chen Tianqiao, lanzó la familia el 24 de agosto de 2026, junto con un artículo de arXiv con 70 autores, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). El modelo insignia es propietario — aproximadamente 397B de parámetros, según el informe del proveedor — construido en torno a la tesis de que el verdadero cuello de botella para los agentes no es la inteligencia bruta sino el entorno en el que operan. Apodex 1.1 se entrenó, por tanto, para trabajar directamente con archivos, búsqueda y código en horizontes prolongados, con una plataforma de ejecución compartida ("AgentOS") que coordina hasta 150 subagentes en paralelo y mantiene un registro de trazabilidad de cada paso. La parte abierta es el modelo hermano: Apodex 1.1 Mini, un MoE de clase 35B ajustado a partir del modelo de Alibaba Qwen3.5-35B-A3B, publicado bajo Apache-2.0 con una plataforma de agente complementaria llamada FrontierAgent. El modelo completo solo llega a través de la API y el banco de trabajo en línea de Apodex; el Mini se autoaloja o nada.
Qué significa un 44 en el Índice de Inteligencia
El Índice de Inteligencia de Artificial Analysis es un agregado ponderado de la suite de pruebas de referencia de la plataforma, incluyendo evaluaciones agénticas como GDPval-AA v2 y Terminal-Bench, además de componentes de razonamiento, matemáticas y conocimiento. Una puntuación de 44 sitúa a Apodex 1.1 en el puesto #11 de 177 modelos, muy por encima de la mediana de 18. También coloca al modelo en un nivel concurrido e interesante: Kimi K2.6 (45), MiniMax-M3 (45) e Inkling (42) se encuentran a tres puntos de distancia, y Apodex 1.1 es el único de ese grupo cuyo nombre era desconocido para la mayoría de los usuarios de IA hace una semana. Artificial Analysis señala que la página cubre la versión de razonamiento del modelo y que también puede existir una variante sin razonamiento.

La puntuación del índice principal no es donde este modelo resulta interesante. Es interesante por dónde se sitúan sus fortalezas y debilidades en relación con esa puntuación — y eso es lo que la comparación por niveles hace concreto.
Donde rinde por encima de su categoría: evaluaciones de agentes y de trabajo de conocimiento
En los dos componentes del Índice que miden el trabajo agéntico del mundo real, Apodex 1.1 supera a sus vecinos de 44 puntos. En GDPval-AA v2 — un punto de referencia que evalúa la capacidad de un agente para completar tareas realistas de estilo oficinista de principio a fin — Apodex 1.1 registra un Elo de 1348, por delante de DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) y Kimi K2.6 (1202). En TerminalBench v2.1, que prueba a un agente trabajando en una terminal, obtiene un 70%, por delante de Kimi K2.6 (66%) y justo detrás de Qwen3.7 Max (75%). Esos son números independientes, ejecutados por Artificial Analysis, y son la evidencia más sólida en el informe de que el entrenamiento centrado en el entorno funciona.
Las afirmaciones de benchmark del propio proveedor van más allá, y deben leerse como cifras reportadas por el proveedor hasta que alguien las reproduzca: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% con herramientas, DeepSearchQA 92.4%, FrontierFinance 54.3 y FrontierScience-Research 63.3. Lo que hace creíble el perfil agéntico, y no una mera exageración, es la arquitectura que hay detrás: el escalado del entorno (ampliar la diversidad de entornos de archivos ejecutables, de búsqueda y de código utilizados en el entrenamiento) y el escalado de la coordinación agéntica (entrenar al modelo para descomponer tareas de horizonte largo, delegar trabajo paralelo, integrar resultados asíncronos y replanificar). El modo «Agent Team» genera hasta 150 subagentes en tareas de recuperación y síntesis, y un paso de verificación integrado («Statement Review») comprueba las conclusiones antes de entregarlas. En otras palabras: es un modelo diseñado para equivocarse, revisarse a sí mismo y corregir las cosas, no para recitar hechos de memoria.
El costo oculto de toda esa agencia: la verbosidad
Ese diseño aparece en la tabla de eficiencia de costos de Artificial Analysis como la debilidad más clara del modelo tras el conocimiento: es muy verboso. Ejecutar el Intelligence Index completo consumió 180M de tokens de salida — frente a una mediana de 67M — y aproximadamente 17,000 tokens de salida por tarea de referencia, frente a unos 9,400 para Qwen3.7 Max y 8,100 para MiniMax-M3. En total, la evaluación completa costó $618.41 en gasto de API, según Artificial Analysis.

El precio que genera esa factura: $0.30 por millón de tokens de entrada y $3.00 por millón de salida — un precio de acierto de caché de $0.03 en entrada almacenada en caché, un 90% de descuento — que se combina para dar unos $0.38 por millón en una mezcla típica de 7:2:1 caché/entrada/salida. Ambos precios por token superan las medianas de la plataforma ($0.25 entrada, $0.90 salida). Sin embargo, la estimación de costo por tarea de Artificial Analysis todavía sitúa a Apodex 1.1 en aproximadamente $0.05 por tarea de referencia, más barato que Qwen3.7 Max (~$0.07) y Kimi K2.6 (~$0.06). La conciliación importa a la hora de presupuestar: sus tokens son lo bastante baratos como para que incluso una verbosidad alta siga siendo competitiva por tarea — el riesgo de costo es el volumen, no la tarifa. Si pones un agente de larga duración en esto, la factura depende de cuánto hable, y habla mucho.
Una nota de precios antes de que hagas tu presupuesto: $0.30/$3.00 es la lista propia del proveedor. Una plataforma de enrutamiento que transmite los precios de lista de los proveedores con un margen del 0% cobra exactamente esa cifra, y cualquier futura reducción de precios de Apodex aparece el mismo día en que se anuncia.
El problema: un historial débil de confiabilidad del conocimiento
He aquí el número que la cobertura del lanzamiento en su mayoría pasa por alto. En AA-Omniscience, la sonda de fiabilidad del conocimiento de Artificial Analysis, Apodex 1.1 obtiene -21.9. Intenta responder el 87% de las preguntas en lugar de declinar, pero solo acierta el 32%, y su tasa de alucinación es del 78.4%. Para un modelo posicionado como un solucionador de alta exigencia, eso es una grave doble personalidad: fuerte en ejecución agéntica, débil en conocimiento fundamentado.
Los dos hechos están conectados, no son contradictorios. Los benchmarks agénticos recompensan {{1}}actuar en un entorno — emitir llamadas a herramientas, iterar, recuperarse — {{/1}}así que un modelo puede obtener una buena puntuación allí y tener una recuperación deficiente, {{2}}porque el entorno es el que recuerda.{{/2}} El diseño incluso lo asume: {{3}}{{KEEP}}Statement Review{{/KEEP}}{{/3}} existe para comprobar las salidas, y el banco de trabajo está construido en torno a la verificación, no en torno a que el modelo acierte de memoria. La lectura práctica es contundente: no apuntes Apodex 1.1 a tareas que dependan de que recupere hechos de sus propios pesos. Apúntalo a tareas de horizonte largo donde su trabajo pueda comprobarse contra archivos, código y fuentes — y {{4}}verifica la entrega.{{/4}}
El hermano abierto: Apodex 1.1 Mini y FrontierAgent
Si la puerta cerrada del buque insignia es un problema, la mitad abierta de la familia es el contrapeso. Apodex 1.1 Mini es un MoE de ~35B en total / ~3B activos, ajustado a partir de Qwen3.5-35B-A3B (una base de Alibaba publicada como código abierto en febrero de 2026), lanzado bajo Apache-2.0 con una ventana de contexto de 262K y variantes FP8, FP4 y GPTQ-Int4 en Hugging Face. Su dato principal reportado por el proveedor es 50.2 en FrontierFinance (primero en la propia comparativa de Apodex) y 27.7 en APEX-Agents con el harness Agent Team habilitado. Y FrontierAgent — el runtime de código abierto que lo acompaña — es genuinamente el artefacto interesante: un harness basado en terminal con modos ReAct y Agent Team, trabajo de archivos en sandbox, compuertas de aprobación, puntos de control y trazas, todo conectado a cualquier endpoint compatible con OpenAI.
Dos cosas que conviene saber antes de autoalojarlo. Primero, el Mini es un fine-tune, no un modelo frontera: lee sus cifras de benchmark igual que leerías la tabla del proveedor del modelo insignia: comparaciones no reproducidas, con harness incluido y elegidas por el proveedor. Segundo, su comportamiento hereda el modelo base: si quieres comprobar si el Qwen3.5-35B-A3B subyacente ya hace tu tarea, no necesitas una GPU ni un stack de servidores para averiguarlo; el modelo base está a una sola llamada de API.
¿Quién debería usar Apodex 1.1 hoy?
El buque insignia está en una fase temprana, es cerrado y, por ahora, solo está en la API propia del proveedor y en el banco de trabajo en línea; Apodex dice que una mayor disponibilidad de la API llegará a través de las principales plataformas, pero los pesos no están abiertos. Eso restringe quién puede actuar en el marcador de esta semana: los equipos que ya están en el banco de trabajo de Apodex, o que estén dispuestos a registrarse para obtener una clave de API de primera parte. El Mini es la vía más accesible, pero implica autoalojamiento.

Donde el modelo realmente se gana su lugar: pipelines agénticos de horizonte largo donde las salidas se verifican en etapas posteriores — bancos de trabajo de investigación, tareas de múltiples pasos con archivos y herramientas, trabajo en terminal — y donde el perfil de costo de ~$0.05 por tarea sobrevive a la verbosidad. Donde todavía no pertenece: cualquier cosa que dependa de que el conocimiento propio del modelo sea confiable, o una ruta de producción que no pueda tolerar que un modelo no probado de siete días de antigüedad se comporte mal. Para exactamente esa situación, una capa de enrutamiento es el envoltorio correcto. Una API para más de 200 modelos significa que el Qwen3.5-35B-A3B base ya se puede invocar al precio de lista, un Mini autoalojado puede ubicarse detrás del mismo enrutador con conmutación automática por error, y un recién llegado inestable no puede tumbar una ruta de producción — cuando rinde por debajo de lo esperado, la solicitud se redirige a un proveedor saludable en su lugar.
Qué ver a continuación
Esta evaluación es una primera lectura, no un veredicto. Tres cosas decidirán si Apodex 1.1 importa dentro de un mes: la reproducción independiente de las afirmaciones agénticas del proveedor (las cifras de GDPval y TerminalBench gestionadas por Artificial Analysis son las únicas que no ha producido el propio Apodex); si la brecha de fiabilidad del conocimiento se reduce en una variante sin razonamiento o en una versión posterior; y si el modelo aparece en más APIs y en más tablas de clasificación independientes, momento en el que el 44 y el -21.9 pasan a ser problema de otro. Para un modelo de siete días con este perfil dividido, es prácticamente todo lo que se puede pedir: una ventaja agéntica real, un precio honesto y una debilidad que conoces antes de registrarte.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
