
Ornith-1.5: La familia de modelos de peso abierto que escribe su propio currículo de entrenamiento — y afirma superar a Claude Opus 4.8
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
Ornith-1.5, la familia de pesos abiertos de Ornith AI que afirma superar a Claude Opus 4.8 en cuatro puntos de referencia, se lanzó el 19 de agosto de 2026 — y lo que realmente vale la pena examinar es el bucle de entrenamiento, no el número de parámetros. La familia consta de tres modelos: Ornith-1.5-397B, un buque insignia de mezcla de expertos con 397 mil millones de parámetros; Ornith-1.5-35B-A3B, un MoE de 35B que activa 3 mil millones de parámetros por token; y Ornith-1.5-9B, un modelo denso de 9B con una versión móvil cuantizada. Todas las puntuaciones destacadas aquí son proporcionadas por el proveedor: los números provienen de las ejecuciones de evaluación de la propia Ornith AI, promediadas sobre cinco, y el único rastreador externo con perfil — BenchLM — etiqueta las 18 filas de sus puntos de referencia como reportadas por el proveedor y mantiene a la familia sin clasificar hasta que exista cobertura independiente. Esto es lo que realmente se lanzó, lo que "auto-mejora" significa de verdad, y lo que puedes ejecutar hoy.
Lo que se lanzó: tres escalas, licencia MIT, sin API
Ornith AI —el grupo detrás de los pesos abiertos de Ornith-1.0 y vinculado al trabajo de DeepReinforce en sistemas multiagente para programación competitiva (GrandCode) y optimización de kernels de GPU (CUDA-L2)— publicó la familia en Hugging Face bajo licencia MIT, con cuantizaciones FP8, GGUF, MLX y NVFP4 junto con los checkpoints sin procesar. Una ventana de contexto de 256K (262 144 tokens) aplica a toda la familia. No hay API alojada de primer proveedor ni precio por token; es un lanzamiento para autoalojamiento o ejecución local, y el informe de lanzamiento lo dice claramente.
Las tres escalas apuntan a tres realidades diferentes:
• Ornith-1.5-397B — la "apuesta de frontera abierta": un MoE de 397B dirigido a la frontera cerrada en cargas de trabajo agénticas y de codificación.
• Ornith-1.5-35B-A3B — un MoE de 35B que activa solo 3B de parámetros por token, para el punto intermedio: capacidad cercana a la de un modelo insignia con una fracción del costo de inferencia por token de un modelo denso de 35B.
• Ornith-1.5-9B — un 9B denso para uso local y en el dispositivo, además de una compilación cuantizada de Ornith-1.5-9B-Mobile que, según el proveedor, está lista para su implementación en iPhone y Android.

La página de lanzamiento anterior es todo el anuncio: un informe técnico más que una publicación de marketing, lo que es coherente con el perfil del laboratorio.
La afirmación sobre la superación personal, decodificada
Ornith-1.0, lanzado en junio de 2026, enseñó a un modelo a generar el andamiaje alrededor de las tareas de codificación: el arnés, la descomposición, la orquestación. Ornith-1.5 extiende ese bucle a la generación de tareas en sí misma. En el entrenamiento, el modelo ahora hace tres cosas:
• Proponer nuevas tareas de entrenamiento más difíciles.
• Generar el andamiaje específico de la tarea utilizado para resolver y evaluar esas tareas.
• Producir rollouts de soluciones que se conviertan en su siguiente ronda de datos de entrenamiento.
La recompensa fluye a través de las tres etapas, optimizada conjuntamente con GRPO. Cada tarea propuesta se evalúa según su validez (debe ser ejecutable y verificable), dificultad de frontera (la tasa de éxito objetivo se fija en 0,2 — tareas que el modelo normalmente falla pero de las que aún puede aprender) y novedad (diversidad respecto a todo lo ya visto). El andamiaje recibe su propia recompensa por alineación, fidelidad de la recompensa y resistencia al hackeo de recompensas, y el pipeline incluye salvaguardas contra el hackeo: restricciones para tocar el entorno de prueba, monitoreo de acceso a rutas restringidas y un modelo de adjudicación congelado que anula resultados anómalos.
La importante advertencia está en la palabra «self-improvement»: describe el procedimiento de entrenamiento, no el artefacto. El modelo descargado no se reentrena a sí mismo en tu portátil. Lo que obtienes es un modelo cuyos datos de entrenamiento fueron, inusualmente, generados por versiones anteriores de sí mismo — que es exactamente el tipo de afirmación que vale la pena poner a prueba antes de que se convierta en dogma.
El benchmark afirma, etiquetado honestamente
Todos los números de esta sección son propios de Ornith AI, provenientes del informe de lanzamiento, promediados en cinco ejecuciones, y no reproducidos de forma independiente. Las cuatro victorias declaradas del buque insignia sobre Claude Opus 4.8:
• Terminal-Bench 2.1 (entorno Terminus-2): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 vs 85.8
• WideSearch: 80.8 vs 72.9
• BrowseComp: 86.6 vs 84.3
Lee eso como afirmaciones del proveedor, no como hechos. El único benchmark insignia en el que Ornith AI no afirma una victoria es DeepSWE, 56.0 frente a los 59.0 de Claude Opus 4.8: el informe lo presenta como "a la par", que es la forma honesta de leer una derrota. Otras cifras insignia del mismo informe: HLE 44.6 sin herramientas y 56.1 con ellas, GPQA Diamond 92.8 y SWE-bench Pro 65.1.
Los dos modelos más pequeños también son fuertes sobre el papel: Ornith-1.5-35B-A3B reporta SWE-bench Verified 79.0 y Terminal-Bench 2.1 (harness de Claude Code) 68.5, mientras que Ornith-1.5-9B reporta SWE-bench Verified 70.6 y Terminal-Bench 2.1 47.0. Frente a otros modelos de pesos abiertos en el mismo informe, Ornith AI compara el 86.1 de Terminal-Bench / 56.0 de DeepSWE del modelo de 397B con el 82.7 / 54.4 de DeepSeek-V4-Flash-0731 y el 81.0 / 46.2 de GLM-5.2.

El único marcador independiente — y por qué sigue siendo provisional
El perfil de BenchLM para Ornith-1.5-397B es actualmente la única página de terceros sobre el modelo. Su titular: una puntuación pública de 68,5 sobre 100, clasificado en el puesto #20 de 221, con Agentic como la categoría más fuerte en el #13. Pero lea la letra pequeña, porque está haciendo un trabajo real: las 18 filas de referencia están marcadas como reportadas por el proveedor, y el perfil afirma que el modelo "aún no tiene suficiente cobertura con fuentes para una posición verificada". Una posición sin clasificar en la lista verificada no es un veredicto en contra del modelo; es una declaración de que nadie lo ha ejecutado de forma independiente todavía, que es exactamente lo que cabría esperar de un lanzamiento de hace unos días.

Esa es la brecha entre los dos números en este artículo: el 86.1 de Terminal-Bench del proveedor es una afirmación, y el 68.5 de BenchLM es una puntuación construida enteramente a partir de filas reportadas por el proveedor. Ninguna de las dos es una medición independiente. El primer laboratorio que ejecute Ornith-1.5-397B a través de un arnés público — SWE-bench Verified en un conjunto controlado, Terminal-Bench en una versión fija del arnés — producirá el primer número que cuenta.
Lo que realmente puedes ejecutar hoy
Se trata de un lanzamiento de pesos abiertos, así que "ejecutarlo" significa descargar los pesos. El catálogo de Ollama ya lista ornith-1.5:9b (una compilación de ~6.6 GB) y ornith-1.5:35b (una compilación de ~23 GB), ambos con contexto de 256K; la compilación de 9B también incluye soporte de entrada de imágenes en la entrada del catálogo. El de 397B es una categoría diferente de problema: un MoE de 397 mil millones de parámetros no es un modelo para portátiles, y cualquier implementación seria implica múltiples GPU y orquestación real.
El punto óptimo práctico para la mayoría de los equipos es el Ornith-1.5-35B-A3B: 3B de parámetros activos por token brindan la capacidad de un MoE a una fracción del costo por token de un denso 35B, y la compilación de Ollama de 23 GB se ejecuta en una sola tarjeta de alta VRAM o en un pequeño clúster. El 9B es el que pones en un teléfono.
Esa propiedad de "3B active" es también donde la economía del enrutamiento se vuelve interesante. Los MoEs con parámetros activos tienen un precio muy inferior a su tamaño total, y cuando los proveedores adoptan un modelo así, el precio por token tiende a bajar rápido — que es el caso al comprar a través de un enrutador que transmite los precios de lista de los proveedores con un margen del 0%, en lugar de un proveedor único con el que negocias una vez. OrcaRouter hace exactamente eso con más de 200 modelos, por lo que un recorte de precio de un proveedor en un nuevo modelo de pesos abiertos se refleja en nuestro lado el mismo día. Y para un modelo que se lanzó únicamente con benchmarks del proveedor, el argumento de la conmutación por error es el que más importa: una capa de enrutamiento te permite apuntar una ruta de prueba a un modelo recién salido y recurrir a uno probado en cuanto se atasca — probar una versión no probada sin comprometer una ruta de producción con ella.
¿Qué falta todavía?
• No hay API alojada. Si quieres Ornith-1.5 como servicio, todavía no existe; todas las opciones son autoalojadas o locales.
• Sin evaluación independiente. BenchLM mantiene la familia sin clasificar; ningún laboratorio ha publicado una ejecución controlada.
• No hay precios que considerar. No hay tarifa por token, por lo que el caso de la "frontera abierta barata" se trata enteramente de la economía de tu propia GPU.
• Los harnesses están mezclados. Terminal-Bench tiene múltiples variantes, y los propios números del informe las abarcan: el 86.1 del 397B está en el harness Terminus-2, el 68.5 del 35B en el harness Claude Code. Diferentes harnesses son juegos diferentes, lo que hace que la comparación de manzanas con manzanas sea más difícil de lo que sugiere la tabla principal.
Qué ver a continuación
La historia que perdura no es que «un modelo abierto supere a Claude Opus 4.8» — esa es una afirmación sin verificar de hace un día. Es que un laboratorio ha cerrado el bucle con datos de entrenamiento autogenerados y ha publicado los pesos para su escrutinio, y esa es la parte que vale la pena observar. Lo que convertiría esto de un lanzamiento prometedor en uno confiable: una primera ejecución independiente del 397B en SWE-bench Verified y un entorno de pruebas de Terminal-Bench corregido; el código de evaluación que realmente se publique; y una ruta alojada que aparezca para que el perfil de costos del 35B-A3B pueda medirse frente a sus afirmaciones. Si las cifras se mantienen, Ornith-1.5-35B-A3B es la historia de precio/rendimiento de pesos abiertos del trimestre. Si no lo hacen, la parte honesta — el método de automejora y los pesos MIT — sobrevive en cualquier caso.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
