
Ornith-1.5: A família de modelos de peso aberto que escreve seu próprio currículo de treinamento — e afirma superar o Claude Opus 4.8
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 218 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 123 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 931 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 101 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Ornith-1.5, a família de pesos abertos da Ornith AI que afirma superar o Claude Opus 4.8 em quatro benchmarks, foi lançada em 19 de agosto de 2026 — e o que realmente vale a pena observar é o loop de treinamento, não a contagem de parâmetros. A família é composta por três modelos: Ornith-1.5-397B, um carro-chefe de mistura de especialistas com 397 bilhões de parâmetros; Ornith-1.5-35B-A3B, um MoE de 35B que ativa 3 bilhões de parâmetros por token; e Ornith-1.5-9B, um modelo denso de 9B com versão móvel quantizada. Todos os números de destaque aqui são relatados pelo fornecedor: eles vêm das execuções de avaliação da própria Ornith AI, com média de cinco execuções, e o único rastreador de terceiros com perfil — BenchLM — rotula todas as 18 linhas de benchmark como relatadas pelo provedor e mantém a família sem classificação até que exista cobertura independente. Aqui está o que realmente foi lançado, o que "auto-melhoria" realmente significa e o que você pode executar hoje.
O que foi lançado: três escalas, licença MIT, sem API.
Ornith AI — o grupo por trás dos pesos abertos do Ornith-1.0 e associado ao trabalho DeepReinforce em sistemas multiagente de programação competitiva (GrandCode) e otimização de kernels de GPU (CUDA-L2) — lançou a família no Hugging Face sob licença MIT, com quantizações FP8, GGUF, MLX e NVFP4 junto aos checkpoints brutos. Uma janela de contexto de 256K (262.144 tokens) se aplica a toda a família. Não há API hospedada de primeira parte nem preço por token; este é um lançamento para auto-hospedagem ou execução local, e o relatório de lançamento afirma isso claramente.
As três escalas visam três realidades diferentes:
• Ornith-1.5-397B — a "aposta de fronteira aberta": um MoE de 397B voltado para a fronteira fechada em cargas de trabalho agênticas e de codificação.
• Ornith-1.5-35B-A3B — um MoE de 35B que ativa apenas 3B parâmetros por token, para o meio-termo: capacidade quase topo de linha com uma fração do custo de inferência por token de um modelo denso de 35B.
• Ornith-1.5-9B — um modelo denso de 9B para uso local e no dispositivo, além de uma versão quantizada Ornith-1.5-9B-Mobile que o fornecedor afirma estar pronta para implantação em iPhone e Android.

A página de lançamento acima é o anúncio completo: um relatório técnico em vez de uma postagem de marketing, o que é consistente com o perfil do laboratório.
A alegação de autoaperfeiçoamento, decifrada
Ornith-1.0, lançado em junho de 2026, ensinou um modelo a gerar o arcabouço em torno de tarefas de codificação — o harness, a decomposição, a orquestração. Ornith-1.5 estende esse ciclo à própria geração de tarefas. No treinamento, o modelo agora faz três coisas:
• Proponha novas tarefas de treinamento mais difíceis.
Gere o scaffold específico da tarefa usado para resolver e avaliar essas tarefas.
• Produza rollouts de soluções que se tornam sua próxima rodada de dados de treinamento.
A recompensa flui por todas as três etapas, otimizada conjuntamente com o GRPO. Cada tarefa proposta é avaliada quanto à validade (deve ser executável e verificável), à dificuldade de fronteira (a taxa alvo de sucesso da solução é definida em 0,2 — tarefas em que o modelo normalmente falha, mas das quais ainda pode aprender) e à novidade (diversidade em relação a tudo o que já foi visto). O scaffold recebe sua própria recompensa por alinhamento, fidelidade da recompensa e resistência a reward hacking, e o pipeline inclui salvaguardas anti-hacking: restrições à manipulação do ambiente de teste, monitoramento de acesso a caminhos restritos e um modelo de adjudicação congelado que substitui resultados anômalos.
A ressalva importante está na palavra "autoaperfeiçoamento": ela descreve o procedimento de treinamento, não o artefato. O modelo baixado não se retreina no seu laptop. O que você obtém é um modelo cujos dados de treinamento foram, de forma incomum, gerados por versões anteriores de si mesmo — o que é exatamente o tipo de afirmação que vale a pena testar antes de se tornar dogma.
A referência afirma, rotulada honestamente
Todos os números nesta seção são próprios da Ornith AI, do relatório de lançamento, com média de cinco execuções, e não foram reproduzidos de forma independente. As quatro vitórias alegadas do carro-chefe sobre o Claude Opus 4.8:
• Terminal-Bench 2.1 (harness Terminus-2): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 vs 85.8
• WideSearch: 80.8 vs 72.9
• BrowseComp: 86.6 vs 84.3
Interprete-as como afirmações do fornecedor, não como fatos. O único benchmark principal em que a Ornith AI não reivindica vitória é o DeepSWE, 56,0 contra 59,0 do Claude Opus 4.8 — o relatório o descreve como "a par", que é a forma honesta de ler uma derrota. Outros números principais do mesmo relatório: HLE 44,6 sem ferramentas e 56,1 com elas, GPQA Diamond 92,8 e SWE-bench Pro 65,1.
Os dois menores também são fortes no papel: o Ornith-1.5-35B-A3B reporta SWE-bench Verified 79.0 e Terminal-Bench 2.1 (harness do Claude Code) 68.5, enquanto o Ornith-1.5-9B reporta SWE-bench Verified 70.6 e Terminal-Bench 2.1 47.0. Em comparação com outros modelos de pesos abertos no mesmo relatório, a Ornith AI compara os 86.1 Terminal-Bench / 56.0 DeepSWE do 397B com os 82.7 / 54.4 do DeepSeek-V4-Flash-0731 e os 81.0 / 46.2 do GLM-5.2.

O único placar independente — e por que ainda é provisório
O perfil do BenchLM para o Ornith-1.5-397B é atualmente a única página de terceiros sobre o modelo. Seu título: uma pontuação pública de 68.5 em 100, classificada em #20 de 221, com Agentic como a categoria mais forte em #13. Mas leia as letras miúdas, porque ele está fazendo um trabalho real — todas as 18 linhas de benchmark estão marcadas como relatadas pelo provedor, e o perfil afirma que o modelo "ainda não tem cobertura suficiente com fontes para uma posição verificada." Uma posição não classificada na lista verificada não é um veredicto contra o modelo; é uma declaração de que ninguém o executou de forma independente ainda, o que é exatamente o que se espera de um lançamento de poucos dias.

Essa é a diferença entre os dois números neste artigo: o {{1}}Terminal-Bench 86.1 do fornecedor{{/1}} é uma {{2}}alegação{{/2}}, e o {{3}}68.5 do BenchLM{{/3}} é uma {{4}}pontuação{{/4}} construída inteiramente com base em linhas {{5}}relatadas pelo fornecedor{{/5}}. Nenhum dos dois é uma {{6}}medição independente{{/6}}. O primeiro laboratório a executar o {{7}}Ornith-1.5-397B{{/7}} por meio de uma ferramenta pública — {{8}}SWE-bench Verified{{/8}} em um conjunto controlado, {{9}}Terminal-Bench{{/9}} em uma versão fixa da ferramenta — produzirá o {{10}}primeiro número que conta{{/10}}.
O que você pode realmente executar hoje
Este é um lançamento de pesos abertos, então "executá-lo" significa baixar os pesos. O catálogo do Ollama já lista ornith-1.5:9b (uma compilação de ~6,6 GB) e ornith-1.5:35b (uma compilação de ~23 GB), ambos com contexto de 256K; a compilação de 9B também possui suporte a entrada de imagens na entrada do catálogo. O 397B é uma categoria diferente de problema: um MoE com 397B de parâmetros não é um modelo para laptop, e qualquer implantação séria significa múltiplas GPUs e orquestração de verdade.
O ponto ideal prático para a maioria das equipes é o Ornith-1.5-35B-A3B:{{1}} 3B de parâmetros ativos por token oferece a capacidade de um MoE a uma fração do custo por token de um denso de 35B,{{/1}} e o build de 23 GB do Ollama roda em uma única placa com bastante VRAM ou em um pequeno cluster.{{2}} O 9B é o que você coloca em um celular.{{/2}}
Essa propriedade "3B active" é também onde a economia do roteamento fica interessante. MoEs de parâmetros ativos custam muito abaixo do seu tamanho total, e quando provedores adotam um modelo assim, o preço por token tende a cair rapidamente — que é o caso de comprar por um roteador que repassa os preços de tabela dos provedores com margem de 0%, em vez de um único fornecedor com quem você negocia uma vez. O OrcaRouter faz exatamente isso com mais de 200 modelos, então um corte de preço de um provedor em um novo modelo de pesos abertos entra no ar no mesmo dia. E para um modelo lançado apenas com benchmarks do fornecedor, o argumento de failover é o mais importante: uma camada de roteamento permite apontar um caminho de teste para um modelo novo e voltar para um comprovado no momento em que ele travar — testar uma versão não comprovada sem apostar um caminho de produção nela.
O que ainda falta
• Sem API hospedada. Se você quer Ornith-1.5 como serviço, ele ainda não existe; toda opção é auto-hospedada ou local.
• Nenhuma avaliação independente. A BenchLM mantém a família sem classificação; nenhum laboratório publicou uma execução controlada.
• Sem preços a considerar. Não há taxa de token, então o caso da "fronteira aberta barata" é inteiramente sobre a economia da sua própria GPU.
• Os harnesses são misturados. O Terminal-Bench tem múltiplas variantes, e os números do próprio relatório se distribuem entre elas: o 86.1 do 397B está no harness Terminus-2, o 68.5 do 35B no harness Claude Code. Harnesses diferentes são jogos diferentes, o que torna a comparação direta mais difícil do que a tabela principal sugere.
O que assistir em seguida
A história duradoura não é "modelo aberto vence Claude Opus 4.8" — isso é uma alegação não auditada de um dia atrás. É que um laboratório fechou o ciclo com dados de treinamento autogerados e publicou os pesos para escrutínio, e essa é a parte que merece atenção. O que transformaria isso de um lançamento promissor em um confiável: uma primeira execução independente do 397B no SWE-bench Verified e um harness corrigido do Terminal-Bench; o código de avaliação de fato disponibilizado; e uma rota hospedada surgindo para que o perfil de custo do 35B-A3B possa ser medido em relação às suas alegações. Se os números se confirmarem, o Ornith-1.5-35B-A3B é a história de preço/desempenho de pesos abertos do trimestre. Se não se confirmarem, a parte honesta — o método de autoaprimoramento e os pesos MIT — sobrevive de qualquer forma.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
