Um cartão de título principal para o vídeo explicativo de lançamento do Ornith-1.5, com o título 'Ornith-1.5 — Pesos Abertos, Autoaperfeiçoamento', o subtítulo 'Uma família de modelos que escreve seu próprio currículo de treinamento — 397B MoE · 35B-A3B · 9B', e três chips de modelo ligados por uma seta de loop circular sugerindo um ciclo de autoaperfeiçoamento, com o logotipo do OrcaRouter inserido no canto.
Guides & Insights

Ornith-1.5: A família de modelos de peso aberto que escreve seu próprio currículo de treinamento — e afirma superar o Claude Opus 4.8

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ornith-1.5, a família de pesos abertos da Ornith AI que afirma superar o Claude Opus 4.8 em quatro benchmarks, foi lançada em 19 de agosto de 2026 — e o que realmente vale a pena observar é o loop de treinamento, não a contagem de parâmetros. A família é composta por três modelos: Ornith-1.5-397B, um carro-chefe de mistura de especialistas com 397 bilhões de parâmetros; Ornith-1.5-35B-A3B, um MoE de 35B que ativa 3 bilhões de parâmetros por token; e Ornith-1.5-9B, um modelo denso de 9B com versão móvel quantizada. Todos os números de destaque aqui são relatados pelo fornecedor: eles vêm das execuções de avaliação da própria Ornith AI, com média de cinco execuções, e o único rastreador de terceiros com perfil — BenchLM — rotula todas as 18 linhas de benchmark como relatadas pelo provedor e mantém a família sem classificação até que exista cobertura independente. Aqui está o que realmente foi lançado, o que "auto-melhoria" realmente significa e o que você pode executar hoje.

O que foi lançado: três escalas, licença MIT, sem API.

Ornith AI — o grupo por trás dos pesos abertos do Ornith-1.0 e associado ao trabalho DeepReinforce em sistemas multiagente de programação competitiva (GrandCode) e otimização de kernels de GPU (CUDA-L2) — lançou a família no Hugging Face sob licença MIT, com quantizações FP8, GGUF, MLX e NVFP4 junto aos checkpoints brutos. Uma janela de contexto de 256K (262.144 tokens) se aplica a toda a família. Não há API hospedada de primeira parte nem preço por token; este é um lançamento para auto-hospedagem ou execução local, e o relatório de lançamento afirma isso claramente.

As três escalas visam três realidades diferentes:

• Ornith-1.5-397B — a "aposta de fronteira aberta": um MoE de 397B voltado para a fronteira fechada em cargas de trabalho agênticas e de codificação.

• Ornith-1.5-35B-A3B — um MoE de 35B que ativa apenas 3B parâmetros por token, para o meio-termo: capacidade quase topo de linha com uma fração do custo de inferência por token de um modelo denso de 35B.

• Ornith-1.5-9B — um modelo denso de 9B para uso local e no dispositivo, além de uma versão quantizada Ornith-1.5-9B-Mobile que o fornecedor afirma estar pronta para implantação em iPhone e Android.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

A página de lançamento acima é o anúncio completo: um relatório técnico em vez de uma postagem de marketing, o que é consistente com o perfil do laboratório.

A alegação de autoaperfeiçoamento, decifrada

Ornith-1.0, lançado em junho de 2026, ensinou um modelo a gerar o arcabouço em torno de tarefas de codificação — o harness, a decomposição, a orquestração. Ornith-1.5 estende esse ciclo à própria geração de tarefas. No treinamento, o modelo agora faz três coisas:

• Proponha novas tarefas de treinamento mais difíceis.

Gere o scaffold específico da tarefa usado para resolver e avaliar essas tarefas.

• Produza rollouts de soluções que se tornam sua próxima rodada de dados de treinamento.

A recompensa flui por todas as três etapas, otimizada conjuntamente com o GRPO. Cada tarefa proposta é avaliada quanto à validade (deve ser executável e verificável), à dificuldade de fronteira (a taxa alvo de sucesso da solução é definida em 0,2 — tarefas em que o modelo normalmente falha, mas das quais ainda pode aprender) e à novidade (diversidade em relação a tudo o que já foi visto). O scaffold recebe sua própria recompensa por alinhamento, fidelidade da recompensa e resistência a reward hacking, e o pipeline inclui salvaguardas anti-hacking: restrições à manipulação do ambiente de teste, monitoramento de acesso a caminhos restritos e um modelo de adjudicação congelado que substitui resultados anômalos.

A ressalva importante está na palavra "autoaperfeiçoamento": ela descreve o procedimento de treinamento, não o artefato. O modelo baixado não se retreina no seu laptop. O que você obtém é um modelo cujos dados de treinamento foram, de forma incomum, gerados por versões anteriores de si mesmo — o que é exatamente o tipo de afirmação que vale a pena testar antes de se tornar dogma.

A referência afirma, rotulada honestamente

Todos os números nesta seção são próprios da Ornith AI, do relatório de lançamento, com média de cinco execuções, e não foram reproduzidos de forma independente. As quatro vitórias alegadas do carro-chefe sobre o Claude Opus 4.8:

• Terminal-Bench 2.1 (harness Terminus-2): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 vs 85.8

• WideSearch: 80.8 vs 72.9

• BrowseComp: 86.6 vs 84.3

Interprete-as como afirmações do fornecedor, não como fatos. O único benchmark principal em que a Ornith AI não reivindica vitória é o DeepSWE, 56,0 contra 59,0 do Claude Opus 4.8 — o relatório o descreve como "a par", que é a forma honesta de ler uma derrota. Outros números principais do mesmo relatório: HLE 44,6 sem ferramentas e 56,1 com elas, GPQA Diamond 92,8 e SWE-bench Pro 65,1.

Os dois menores também são fortes no papel: o Ornith-1.5-35B-A3B reporta SWE-bench Verified 79.0 e Terminal-Bench 2.1 (harness do Claude Code) 68.5, enquanto o Ornith-1.5-9B reporta SWE-bench Verified 70.6 e Terminal-Bench 2.1 47.0. Em comparação com outros modelos de pesos abertos no mesmo relatório, a Ornith AI compara os 86.1 Terminal-Bench / 56.0 DeepSWE do 397B com os 82.7 / 54.4 do DeepSeek-V4-Flash-0731 e os 81.0 / 46.2 do GLM-5.2.

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

O único placar independente — e por que ainda é provisório

O perfil do BenchLM para o Ornith-1.5-397B é atualmente a única página de terceiros sobre o modelo. Seu título: uma pontuação pública de 68.5 em 100, classificada em #20 de 221, com Agentic como a categoria mais forte em #13. Mas leia as letras miúdas, porque ele está fazendo um trabalho real — todas as 18 linhas de benchmark estão marcadas como relatadas pelo provedor, e o perfil afirma que o modelo "ainda não tem cobertura suficiente com fontes para uma posição verificada." Uma posição não classificada na lista verificada não é um veredicto contra o modelo; é uma declaração de que ninguém o executou de forma independente ainda, o que é exatamente o que se espera de um lançamento de poucos dias.

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

Essa é a diferença entre os dois números neste artigo: o {{1}}Terminal-Bench 86.1 do fornecedor{{/1}} é uma {{2}}alegação{{/2}}, e o {{3}}68.5 do BenchLM{{/3}} é uma {{4}}pontuação{{/4}} construída inteiramente com base em linhas {{5}}relatadas pelo fornecedor{{/5}}. Nenhum dos dois é uma {{6}}medição independente{{/6}}. O primeiro laboratório a executar o {{7}}Ornith-1.5-397B{{/7}} por meio de uma ferramenta pública — {{8}}SWE-bench Verified{{/8}} em um conjunto controlado, {{9}}Terminal-Bench{{/9}} em uma versão fixa da ferramenta — produzirá o {{10}}primeiro número que conta{{/10}}.

O que você pode realmente executar hoje

Este é um lançamento de pesos abertos, então "executá-lo" significa baixar os pesos. O catálogo do Ollama já lista ornith-1.5:9b (uma compilação de ~6,6 GB) e ornith-1.5:35b (uma compilação de ~23 GB), ambos com contexto de 256K; a compilação de 9B também possui suporte a entrada de imagens na entrada do catálogo. O 397B é uma categoria diferente de problema: um MoE com 397B de parâmetros não é um modelo para laptop, e qualquer implantação séria significa múltiplas GPUs e orquestração de verdade.

O ponto ideal prático para a maioria das equipes é o Ornith-1.5-35B-A3B:{{1}} 3B de parâmetros ativos por token oferece a capacidade de um MoE a uma fração do custo por token de um denso de 35B,{{/1}} e o build de 23 GB do Ollama roda em uma única placa com bastante VRAM ou em um pequeno cluster.{{2}} O 9B é o que você coloca em um celular.{{/2}}

Essa propriedade "3B active" é também onde a economia do roteamento fica interessante. MoEs de parâmetros ativos custam muito abaixo do seu tamanho total, e quando provedores adotam um modelo assim, o preço por token tende a cair rapidamente — que é o caso de comprar por um roteador que repassa os preços de tabela dos provedores com margem de 0%, em vez de um único fornecedor com quem você negocia uma vez. O OrcaRouter faz exatamente isso com mais de 200 modelos, então um corte de preço de um provedor em um novo modelo de pesos abertos entra no ar no mesmo dia. E para um modelo lançado apenas com benchmarks do fornecedor, o argumento de failover é o mais importante: uma camada de roteamento permite apontar um caminho de teste para um modelo novo e voltar para um comprovado no momento em que ele travar — testar uma versão não comprovada sem apostar um caminho de produção nela.

O que ainda falta

• Sem API hospedada. Se você quer Ornith-1.5 como serviço, ele ainda não existe; toda opção é auto-hospedada ou local.

• Nenhuma avaliação independente. A BenchLM mantém a família sem classificação; nenhum laboratório publicou uma execução controlada.

• Sem preços a considerar. Não há taxa de token, então o caso da "fronteira aberta barata" é inteiramente sobre a economia da sua própria GPU.

• Os harnesses são misturados. O Terminal-Bench tem múltiplas variantes, e os números do próprio relatório se distribuem entre elas: o 86.1 do 397B está no harness Terminus-2, o 68.5 do 35B no harness Claude Code. Harnesses diferentes são jogos diferentes, o que torna a comparação direta mais difícil do que a tabela principal sugere.

O que assistir em seguida

A história duradoura não é "modelo aberto vence Claude Opus 4.8" — isso é uma alegação não auditada de um dia atrás. É que um laboratório fechou o ciclo com dados de treinamento autogerados e publicou os pesos para escrutínio, e essa é a parte que merece atenção. O que transformaria isso de um lançamento promissor em um confiável: uma primeira execução independente do 397B no SWE-bench Verified e um harness corrigido do Terminal-Bench; o código de avaliação de fato disponibilizado; e uma rota hospedada surgindo para que o perfil de custo do 35B-A3B possa ser medido em relação às suas alegações. Se os números se confirmarem, o Ornith-1.5-35B-A3B é a história de preço/desempenho de pesos abertos do trimestre. Se não se confirmarem, a parte honesta — o método de autoaprimoramento e os pesos MIT — sobrevive de qualquer forma.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente