Une carte-titre principale pour l'explicatif de lancement d'Ornith-1.5, avec le titre « Ornith-1.5 — Open Weights, Self-Improving », le sous-titre « A model family that writes its own training curriculum — 397B MoE · 35B-A3B · 9B », et trois pastilles de modèle reliées par une flèche en boucle circulaire évoquant un cycle d'auto-amélioration, avec le logo OrcaRouter incrusté dans le coin.
Guides & Insights

Ornith-1.5 : la famille de modèles à poids ouverts qui écrit son propre programme d'entraînement — et prétend surpasser Claude Opus 4.8

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ornith-1.5, la famille open-weight d'Ornith AI qui prétend battre Claude Opus 4.8 sur quatre benchmarks, est sortie le 19 août 2026 — et ce qui mérite qu'on s'y arrête, c'est la boucle d'entraînement, pas le nombre de paramètres. La famille comprend trois modèles : Ornith-1.5-397B, un fleuron mixture-of-experts de 397 milliards de paramètres ; Ornith-1.5-35B-A3B, un MoE de 35B qui active 3 milliards de paramètres par token ; et Ornith-1.5-9B, un modèle dense de 9B avec une version mobile quantifiée. Tous les scores mis en avant ici sont rapportés par le fournisseur : les chiffres proviennent des propres exécutions d'évaluation d'Ornith AI, moyennés sur cinq, et le seul tracker tiers avec un profil — BenchLM — marque les 18 lignes de benchmark comme rapportées par le fournisseur et maintient la famille non classée jusqu'à ce qu'une couverture indépendante existe. Voici ce qui a réellement été publié, ce que « auto-améliorant » signifie vraiment, et ce que vous pouvez exécuter dès aujourd'hui.

Ce qui a été livré : trois échelles, licence MIT, pas d'API.

Ornith AI — le groupe derrière les poids ouverts Ornith-1.0 et associé aux travaux DeepReinforce sur les systèmes multi-agents de programmation compétitive (GrandCode) et l'optimisation de noyaux GPU (CUDA-L2) — a publié la famille sur Hugging Face sous licence MIT, avec des quantifications FP8, GGUF, MLX et NVFP4 en plus des checkpoints bruts. Une fenêtre de contexte de 256K (262 144 jetons) s'applique à toute la famille. Il n'y a pas d'API hébergée par l'éditeur ni de prix par jeton ; il s'agit d'une version auto-hébergée ou destinée à un runtime local, et le rapport de lancement le dit sans détour.

Les trois échelles ciblent trois réalités différentes :

• Ornith-1.5-397B — la "tentative de frontière ouverte" : un MoE de 397B visant la frontière fermée sur les charges de travail agentiques et de codage.

• Ornith-1.5-35B-A3B — un MoE de 35B n'activant que 3B de paramètres par jeton, pour un juste milieu : des capacités proches du haut de gamme avec une fraction du coût d'inférence par jeton d'un modèle dense de 35B.

• Ornith-1.5-9B — un modèle dense de 9B pour une utilisation locale et sur appareil, ainsi qu'une version quantifiée Ornith-1.5-9B-Mobile que le fournisseur dit être prête à déployer sur iPhone et Android.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

La page de lancement ci-dessus constitue l'intégralité de l'annonce : un rapport technique plutôt qu'un post marketing, ce qui est cohérent avec le profil du laboratoire.

L'affirmation sur le développement personnel, décodée

Ornith-1.0, sorti en juin 2026, a appris à un modèle à générer l’échafaudage autour des tâches de codage — le harnais, la décomposition, l’orchestration. Ornith-1.5 étend cette boucle à la génération de tâches elle-même. Lors de l’entraînement, le modèle fait désormais trois choses :

Proposez de nouvelles tâches d'entraînement plus difficiles.

Générer le scaffold spécifique à la tâche utilisé pour résoudre et évaluer ces tâches.

• Produire des rollouts de solutions qui deviennent sa prochaine série de données d'entraînement.

La récompense circule à travers les trois étapes, optimisée conjointement avec GRPO. Chaque tâche proposée est notée selon sa validité (elle doit être exécutable et vérifiable), sa difficulté de pointe (le taux de réussite cible est fixé à 0,2 — des tâches que le modèle échoue généralement mais dont il peut encore apprendre), et sa nouveauté (la diversité par rapport à tout ce qui a déjà été vu). L'échafaudage reçoit sa propre récompense pour l'alignement, la fidélité de la récompense et la résistance au piratage de récompense, et le pipeline comprend des garde-fous anti-piratage : des restrictions sur l'accès à l'environnement de test, une surveillance de l'accès aux chemins restreints, et un modèle d'arbitrage figé qui remplace les résultats anormaux.

La mise en garde importante réside dans le mot « auto-amélioration » : il décrit la procédure d'entraînement, pas l'artefact. Le modèle téléchargé ne se ré-entraîne pas sur votre ordinateur portable. Ce que vous obtenez, c'est un modèle dont les données d'entraînement ont été, de manière inhabituelle, générées par des versions antérieures de lui-même — ce qui est exactement le genre d'affirmation qu'il vaut la peine de tester avant qu'elle ne devienne un dogme.

Les affirmations du benchmark, honnêtement étiquetées.

Tous les chiffres de cette section proviennent d'Ornith AI, issus du rapport de lancement, moyennés sur cinq exécutions, et n'ont pas été reproduits de manière indépendante. Les quatre victoires revendiquées par le produit phare sur Claude Opus 4.8 :

• Terminal-Bench 2.1 (harnais Terminus-2) : Ornith-1.5-397B 86.1 contre Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 contre 85.8

• WideSearch : 80,8 contre 72,9

• BrowseComp : 86,6 contre 84,3

Considérez-les comme des affirmations du fournisseur, pas comme des faits. Le seul benchmark phare pour lequel Ornith AI ne revendique pas de victoire est DeepSWE, 56,0 contre 59,0 pour Claude Opus 4.8 — le rapport le présente comme « à égalité », ce qui est la façon honnête de lire une défaite. Autres chiffres phares du même rapport : HLE 44,6 sans outils et 56,1 avec, GPQA Diamond 92,8, et SWE-bench Pro 65,1.

Les deux plus petits sont aussi solides sur le papier : Ornith-1.5-35B-A3B annonce 79,0 sur SWE-bench Verified et 68,5 sur Terminal-Bench 2.1 (harness Claude Code), tandis qu'Ornith-1.5-9B annonce 70,6 sur SWE-bench Verified et 47,0 sur Terminal-Bench 2.1. Face aux autres modèles à poids ouverts du même rapport, Ornith AI compare les scores du 397B (86,1 Terminal-Bench / 56,0 DeepSWE) à ceux de DeepSeek-V4-Flash-0731 (82,7 / 54,4) et de GLM-5.2 (81,0 / 46,2).

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

Le seul tableau de bord indépendant — et pourquoi il est encore provisoire

Le profil de BenchLM pour Ornith-1.5-397B est actuellement la seule page tierce sur le modèle. Son titre : un score public de 68,5 sur 100, classé #20 sur 221, avec Agentic comme catégorie la plus forte, à la 13e place. Mais lisez les mentions en petits caractères, car ce profil fait un vrai travail — les 18 lignes de benchmark sont toutes marquées comme déclarées par le fournisseur, et le profil indique que le modèle « ne dispose pas encore d'une couverture sourcée suffisante pour une position vérifiée ». Une position non classée sur la liste vérifiée n'est pas un verdict contre le modèle ; c'est une déclaration indiquant que personne ne l'a encore exécuté de manière indépendante, ce qui est exactement ce à quoi on peut s'attendre pour une sortie vieille de quelques jours.

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

Voilà l'écart entre les deux chiffres de cet article : le 86,1 du fournisseur sur Terminal-Bench est une affirmation, et le 68,5 de BenchLM est un score entièrement construit sur des lignes rapportées par le fournisseur. Ni l'un ni l'autre n'est une mesure indépendante. Le premier laboratoire à faire passer Ornith-1.5-397B dans un harnais public — SWE-bench Verified sur un ensemble contrôlé, Terminal-Bench sur une version fixée du harnais — produira le premier chiffre qui compte.

Ce que vous pouvez réellement exécuter aujourd'hui

Ceci est une version à poids ouverts, donc « l’exécuter » signifie télécharger les poids. Le catalogue Ollama liste déjà ornith-1.5:9b (une version d’environ 6,6 Go) et ornith-1.5:35b (une version d’environ 23 Go), tous deux avec un contexte de 256K ; la version 9B inclut également la prise en charge des entrées d’image dans l’entrée du catalogue. Le 397B est une catégorie de problème différente : un MoE de 397B de paramètres n’est pas un modèle pour ordinateur portable, et tout déploiement sérieux implique plusieurs GPU et une véritable orchestration.

Le juste milieu pratique pour la plupart des équipes est l'Ornith-1.5-35B-A3B : 3B de paramètres actifs par jeton offre la capacité d'un MoE pour une fraction du coût par jeton d'un 35B dense, et la version Ollama de 23 Go tourne sur une seule carte à VRAM élevée ou un petit cluster. Le 9B est celui qu'on met sur un téléphone.

Cette propriété « 3B active » est aussi ce qui rend l'économie du routage intéressante. Les MoE à paramètres actifs sont tarifés bien en dessous de leur taille totale, et lorsque les fournisseurs adoptent un tel modèle, le prix par jeton tend à chuter rapidement — c'est le cas lors d'un achat via un routeur qui transmet les prix catalogue des fournisseurs avec une marge de 0 %, plutôt qu'auprès d'un fournisseur unique avec lequel vous négociez une fois. OrcaRouter fait exactement cela sur plus de 200 modèles, de sorte qu'une baisse de prix d'un fournisseur sur un nouveau modèle à poids ouverts est répercutée chez nous le jour même. Et pour un modèle fourni avec uniquement des benchmarks du fournisseur, l'argument du basculement est primordial : une couche de routage permet de diriger un chemin de test vers un tout nouveau modèle et de revenir à un modèle éprouvé dès qu'il cale — essayer une version non éprouvée sans y engager un chemin de production.

Qu'est-ce qui manque encore ?

• Pas d'API hébergée. Si vous voulez Ornith-1.5 en tant que service, cela n'existe pas encore ; chaque option est auto-hébergée ou locale.

• Aucune évaluation indépendante. BenchLM laisse la famille non classée ; aucun laboratoire n'a publié d'exécution contrôlée.

• Aucune tarification à considérer. Il n’y a pas de taux par jeton, donc le cas de la « frontière ouverte bon marché » repose entièrement sur les aspects économiques de votre propre GPU.

• Les harnais sont mixtes. Terminal-Bench comporte plusieurs variantes, et les chiffres du rapport s'étalent sur celles-ci : le 86,1 du 397B provient du harnais Terminus-2, le 68,5 du 35B provient du harnais Claude Code. Différents harnais, différents jeux, ce qui rend la comparaison de pommes à pommes plus difficile que ne le laisse suggérer le tableau principal.

Que regarder ensuite

La véritable histoire n'est pas « un modèle ouvert bat Claude Opus 4.8 » — c'est une affirmation non vérifiée vieille d'un jour. C'est qu'un laboratoire a bouclé la boucle sur des données d'entraînement auto-générées et publié les poids pour examen, et c'est cela qui mérite l'attention. Les éléments qui feraient passer cette version de prometteuse à digne de confiance : une première exécution indépendante du 397B sur SWE-bench Verified et un harnais Terminal-Bench corrigé ; le code d'évaluation réellement diffusé ; et l'apparition d'une route hébergée permettant de mesurer le profil de coût du 35B-A3B par rapport à ses affirmations. Si les chiffres tiennent, Ornith-1.5-35B-A3B est l'histoire prix/performance du trimestre dans le domaine des poids ouverts. S'ils ne tiennent pas, la partie honnête — la méthode d'auto-amélioration et les poids MIT — survit dans les deux cas.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube