Титульная карточка для эксплейнера запуска Ornith-1.5, с заголовком «Ornith-1.5 — открытые веса, самосовершенствование», подзаголовком «Семейство моделей, которое само пишет свою учебную программу — 397B MoE · 35B-A3B · 9B», и тремя чипами моделей, связанными круговой стрелкой, символизирующей цикл самосовершенствования, с логотипом OrcaRouter, размещённым в углу.
Guides & Insights

Ornith-1.5: семейство моделей с открытыми весами, которое само создаёт собственную учебную программу — и заявляет, что превосходит Claude Opus 4.8

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ornith-1.5 — семейство с открытыми весами от Ornith AI, которое, как утверждается, превосходит Claude Opus 4.8 по четырём бенчмаркам, — вышло 19 августа 2026 года, и то, на чём действительно стоит остановиться, — это цикл обучения, а не количество параметров. В семейство входят три модели: Ornith-1.5-397B, флагманская модель со смесью экспертов на 397 миллиардов параметров; Ornith-1.5-35B-A3B, модель MoE на 35B, активирующая 3 миллиарда параметров на токен; и Ornith-1.5-9B, плотная модель на 9B с квантованной мобильной сборкой. Все ключевые показатели здесь заявлены производителем: цифры взяты из собственных прогонов оценки Ornith AI и усреднены по пяти запускам, а единственный сторонний трекер с профилем — BenchLM — помечает все 18 своих строк бенчмарков как указанные провайдером и не ранжирует семейство до появления независимого тестирования. Вот что действительно вышло, что на самом деле означает «самоулучшение» и что вы можете запустить уже сегодня.

Что вышло: три шкалы, лицензия MIT, без API.

Ornith AI — группа, стоящая за моделью Ornith-1.0 с открытыми весами и связанная с работой DeepReinforce над мультиагентными системами для спортивного программирования (GrandCode) и оптимизацией GPU-ядер (CUDA-L2), — выпустила семейство моделей на Hugging Face под лицензией MIT, с квантизациями FP8, GGUF, MLX и NVFP4 вместе с исходными чекпоинтами. Окно контекста 256K (262 144 токена) применяется ко всему семейству. Собственного хостируемого API и цены за токены нет; это релиз для самостоятельного хостинга или локального запуска, и об этом прямо сказано в анонсе.

Три шкалы нацелены на три разные реальности:

• {{1}}Ornith-1.5-397B — «открытая заявка на frontier»: модель MoE на 397B параметров, нацеленная на закрытый frontier в агентных и кодовых нагрузках.{{/1}}

• Ornith-1.5-35B-A3B — 35B-модель MoE, активирующая лишь 3B параметров на токен, что даёт золотую середину: производительность, близкую к флагманской, при затратах на инференс на токен, составляющих лишь долю затрат плотной 35B-модели.

• Ornith-1.5-9B — плотная 9B-модель для локального использования и работы на устройстве, плюс квантованная сборка Ornith-1.5-9B-Mobile, которую, по словам вендора, можно сразу разворачивать на iPhone и Android.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

Приведённая выше страница запуска является полным объявлением: это технический отчёт, а не маркетинговый пост, что соответствует профилю лаборатории.

Утверждение о самосовершенствовании, расшифрованное

Ornith-1.0, выпущенный в июне 2026 года, научил модель генерировать каркас вокруг задач кодирования — обвязку, декомпозицию, оркестрацию. Ornith-1.5 расширяет этот цикл до самой генерации задач. При обучении модель теперь делает три вещи:

• Предложите новые, более сложные тренировочные задачи.

• Сгенерируйте специфичный для задачи каркас, используемый для решения и оценки этих задач.

• Создавайте развёртывания решений, которые становятся следующим раундом обучающих данных.

Вознаграждение проходит через все три этапа, которые совместно оптимизируются с помощью GRPO. Каждая предложенная задача оценивается по валидности (она должна быть выполнимой и проверяемой), сложности на границе возможностей (целевой показатель успешного решения установлен на 0,2 — задачи, которые модель обычно не решает, но на которых всё же может учиться) и новизне (разнообразию относительно всего уже виденного). Каркас получает собственное вознаграждение за согласованность, точность вознаграждения и устойчивость к взлому вознаграждения, а конвейер включает защитные механизмы от взлома: ограничения на доступ к тестовой среде, мониторинг обращений к ограниченным путям и замороженную модель арбитража, которая переопределяет аномальные результаты.

Важная оговорка кроется в слове «самосовершенствование»: оно описывает процедуру обучения, а не артефакт. Скачанная модель не переобучается на вашем ноутбуке. Вы получаете модель, чьи обучающие данные, что необычно, были сгенерированы более ранними версиями самой себя — что как раз и есть то утверждение, которое стоит проверить, прежде чем оно станет догмой.

Бенчмарк заявляет, честно помеченный.

Все числа в этом разделе являются собственными данными Ornith AI, взятыми из отчёта о запуске, усреднёнными по пяти прогонам и не воспроизведёнными независимо. Четыре заявленных преимущества флагманской модели над Claude Opus 4.8:

• Terminal-Bench 2.1 (харнесс Terminus-2): Ornith-1.5-397B 86.1 против Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 против 85.8

• WideSearch: 80.8 против 72.9

• BrowseComp: 86.6 vs 84.3

Воспринимайте это как заявления вендора, а не факты. Единственный флагманский бенчмарк, где Ornith AI не заявляет о победе, — это DeepSWE: 56,0 против 59,0 у Claude Opus 4.8. В отчёте это подаётся как «наравне», что является честным способом прочитать поражение. Другие флагманские показатели из того же отчёта: HLE 44,6 без инструментов и 56,1 с ними, GPQA Diamond 92,8 и SWE-bench Pro 65,1.

Две меньшие модели тоже сильны на бумаге: Ornith-1.5-35B-A3B показывает SWE-bench Verified 79.0 и Terminal-Bench 2.1 (средство Claude Code) 68.5, а Ornith-1.5-9B показывает SWE-bench Verified 70.6 и Terminal-Bench 2.1 47.0. Сравнивая с другими моделями с открытыми весами в том же отчёте, Ornith AI сопоставляет показатели 397B — 86.1 Terminal-Bench / 56.0 DeepSWE — с показателями DeepSeek-V4-Flash-0731 — 82.7 / 54.4 — и GLM-5.2 — 81.0 / 46.2.

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

Единственное независимое табло — и почему оно всё ещё предварительное

{{1}}Профиль BenchLM для Ornith-1.5-397B — единственная сторонняя страница об этой модели.{{/1}} Её заголовок: публичный балл 68,5 из 100, 20-е место из 221, с Agentic как самой сильной категорией — 13-е место.{{2}} Но стоит прочитать мелкий шрифт, потому что там идёт настоящая работа — все 18 строк бенчмарков помечены как предоставленные провайдером,{{/2}} и в профиле указано, что у модели «пока недостаточно проверенного покрытия для подтверждённой позиции».{{3}} Непозиционированная строка в проверенном списке — не приговор модели;{{/3}} это утверждение, что никто ещё не запускал её независимо,{{4}} а это ровно то, чего можно ожидать от релиза, которому всего несколько дней.{{/4}}

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

Это и есть разрыв между двумя числами в этой статье: 86.1 Terminal-Bench от вендора — это заявление, а 68.5 от BenchLM — это оценка, полностью построенная на строках, предоставленных вендором. Ни то, ни другое не является независимым измерением. Первая лаборатория, которая прогонит Ornith-1.5-397B через публичный харнесс — SWE-bench Verified на контролируемом наборе, Terminal-Bench на фиксированной версии харнесса — получит первое число, которое имеет значение.

Что вы можете реально запустить сегодня

Это релиз с открытыми весами, так что «запустить» означает скачать веса. В каталоге Ollama уже есть ornith-1.5:9b (сборка ~6,6 ГБ) и ornith-1.5:35b (сборка ~23 ГБ), обе с контекстом 256K; в записи каталога для сборки 9B также указана поддержка ввода изображений. Модель 397B — это другая категория задачи: MoE с 397B параметров — не модель для ноутбука, и любое серьёзное развёртывание требует нескольких GPU и настоящей оркестрации.

Практическая золотая середина для большинства команд — это Ornith-1.5-35B-A3B: 3B активных параметров на токен дают возможности MoE за небольшую долю затрат на токен плотной модели на 35B, а сборка Ollama на 23 ГБ работает на одной карте с большим объёмом видеопамяти или на небольшом кластере. А 9B — это та, которую ставят на телефон.

Свойство «3B active» — это также то, где экономика маршрутизации становится интересной. MoE с активными параметрами стоят значительно дешевле, чем их полный размер, и когда провайдеры принимают такую модель, цена за токен имеет тенденцию быстро падать — что и происходит при покупке через маршрутизатор, который передаёт цены провайдеров без наценки, а не через единого вендора, с которым вы ведёте переговоры один раз. OrcaRouter делает именно это для более чем 200 моделей, поэтому снижение цены провайдером на новую модель с открытыми весами вступает в силу на нашей стороне в тот же день. А для модели, которая поставляется только с бенчмарками вендора, аргумент об отказоустойчивости важнее всего: слой маршрутизации позволяет направить тестовый трафик на совершенно новую модель и переключиться на проверенную в тот момент, когда она начинает давать сбои — пробуя непроверенный релиз, не ставя на него производственный трафик.

Чего всё ещё не хватает

• Нет размещенного API. Если вам нужен Ornith-1.5 как сервис, его пока не существует; каждый вариант — это самостоятельный хостинг или локальный запуск.

• Независимой оценки нет. BenchLM оставляет семейство без рейтинга; ни одна лаборатория не опубликовала контролируемый прогон.

• Не нужно думать о ценообразовании. Нет тарифа за токены, поэтому случай «дешёвого открытого фронтира» полностью сводится к экономике ваших собственных GPU.

• Стенды неоднородны. Terminal-Bench имеет несколько вариантов, и собственные цифры отчёта распределены по ним: результат 86.1 модели 397B получен на стенде Terminus-2, а результат 68.5 модели 35B — на стенде Claude Code. Разные стенды — это разные игры, что делает корректное сравнение более сложным, чем предполагает сводная таблица.

Что посмотреть дальше

Суть не в том, что «открытая модель превосходит Claude Opus 4.8», — это непроверенное утверждение, которому день от роду. А в том, что лаборатория замкнула цикл на самогенерируемых обучающих данных и опубликовала веса для проверки, — и именно за этим стоит наблюдать. Что превратило бы этот релиз из многообещающего в заслуживающий доверия: первый независимый прогон 397B на SWE-bench Verified и исправленный испытательный стенд Terminal-Bench; реально поставляемый код оценки; и появление хостированного маршрута, чтобы профиль затрат 35B-A3B можно было сверить с заявленным. Если цифры подтвердятся, Ornith-1.5-35B-A3B станет историей квартала о соотношении цены и производительности среди открытых весов. Если нет — честная часть, то есть метод самоулучшения и веса под лицензией MIT, — выживет в любом случае.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube