
Ornith-1.5: семейство моделей с открытыми весами, которое само создаёт собственную учебную программу — и заявляет, что превосходит Claude Opus 4.8
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
Ornith-1.5 — семейство с открытыми весами от Ornith AI, которое, как утверждается, превосходит Claude Opus 4.8 по четырём бенчмаркам, — вышло 19 августа 2026 года, и то, на чём действительно стоит остановиться, — это цикл обучения, а не количество параметров. В семейство входят три модели: Ornith-1.5-397B, флагманская модель со смесью экспертов на 397 миллиардов параметров; Ornith-1.5-35B-A3B, модель MoE на 35B, активирующая 3 миллиарда параметров на токен; и Ornith-1.5-9B, плотная модель на 9B с квантованной мобильной сборкой. Все ключевые показатели здесь заявлены производителем: цифры взяты из собственных прогонов оценки Ornith AI и усреднены по пяти запускам, а единственный сторонний трекер с профилем — BenchLM — помечает все 18 своих строк бенчмарков как указанные провайдером и не ранжирует семейство до появления независимого тестирования. Вот что действительно вышло, что на самом деле означает «самоулучшение» и что вы можете запустить уже сегодня.
Что вышло: три шкалы, лицензия MIT, без API.
Ornith AI — группа, стоящая за моделью Ornith-1.0 с открытыми весами и связанная с работой DeepReinforce над мультиагентными системами для спортивного программирования (GrandCode) и оптимизацией GPU-ядер (CUDA-L2), — выпустила семейство моделей на Hugging Face под лицензией MIT, с квантизациями FP8, GGUF, MLX и NVFP4 вместе с исходными чекпоинтами. Окно контекста 256K (262 144 токена) применяется ко всему семейству. Собственного хостируемого API и цены за токены нет; это релиз для самостоятельного хостинга или локального запуска, и об этом прямо сказано в анонсе.
Три шкалы нацелены на три разные реальности:
• {{1}}Ornith-1.5-397B — «открытая заявка на frontier»: модель MoE на 397B параметров, нацеленная на закрытый frontier в агентных и кодовых нагрузках.{{/1}}
• Ornith-1.5-35B-A3B — 35B-модель MoE, активирующая лишь 3B параметров на токен, что даёт золотую середину: производительность, близкую к флагманской, при затратах на инференс на токен, составляющих лишь долю затрат плотной 35B-модели.
• Ornith-1.5-9B — плотная 9B-модель для локального использования и работы на устройстве, плюс квантованная сборка Ornith-1.5-9B-Mobile, которую, по словам вендора, можно сразу разворачивать на iPhone и Android.

Приведённая выше страница запуска является полным объявлением: это технический отчёт, а не маркетинговый пост, что соответствует профилю лаборатории.
Утверждение о самосовершенствовании, расшифрованное
Ornith-1.0, выпущенный в июне 2026 года, научил модель генерировать каркас вокруг задач кодирования — обвязку, декомпозицию, оркестрацию. Ornith-1.5 расширяет этот цикл до самой генерации задач. При обучении модель теперь делает три вещи:
• Предложите новые, более сложные тренировочные задачи.
• Сгенерируйте специфичный для задачи каркас, используемый для решения и оценки этих задач.
• Создавайте развёртывания решений, которые становятся следующим раундом обучающих данных.
Вознаграждение проходит через все три этапа, которые совместно оптимизируются с помощью GRPO. Каждая предложенная задача оценивается по валидности (она должна быть выполнимой и проверяемой), сложности на границе возможностей (целевой показатель успешного решения установлен на 0,2 — задачи, которые модель обычно не решает, но на которых всё же может учиться) и новизне (разнообразию относительно всего уже виденного). Каркас получает собственное вознаграждение за согласованность, точность вознаграждения и устойчивость к взлому вознаграждения, а конвейер включает защитные механизмы от взлома: ограничения на доступ к тестовой среде, мониторинг обращений к ограниченным путям и замороженную модель арбитража, которая переопределяет аномальные результаты.
Важная оговорка кроется в слове «самосовершенствование»: оно описывает процедуру обучения, а не артефакт. Скачанная модель не переобучается на вашем ноутбуке. Вы получаете модель, чьи обучающие данные, что необычно, были сгенерированы более ранними версиями самой себя — что как раз и есть то утверждение, которое стоит проверить, прежде чем оно станет догмой.
Бенчмарк заявляет, честно помеченный.
Все числа в этом разделе являются собственными данными Ornith AI, взятыми из отчёта о запуске, усреднёнными по пяти прогонам и не воспроизведёнными независимо. Четыре заявленных преимущества флагманской модели над Claude Opus 4.8:
• Terminal-Bench 2.1 (харнесс Terminus-2): Ornith-1.5-397B 86.1 против Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 против 85.8
• WideSearch: 80.8 против 72.9
• BrowseComp: 86.6 vs 84.3
Воспринимайте это как заявления вендора, а не факты. Единственный флагманский бенчмарк, где Ornith AI не заявляет о победе, — это DeepSWE: 56,0 против 59,0 у Claude Opus 4.8. В отчёте это подаётся как «наравне», что является честным способом прочитать поражение. Другие флагманские показатели из того же отчёта: HLE 44,6 без инструментов и 56,1 с ними, GPQA Diamond 92,8 и SWE-bench Pro 65,1.
Две меньшие модели тоже сильны на бумаге: Ornith-1.5-35B-A3B показывает SWE-bench Verified 79.0 и Terminal-Bench 2.1 (средство Claude Code) 68.5, а Ornith-1.5-9B показывает SWE-bench Verified 70.6 и Terminal-Bench 2.1 47.0. Сравнивая с другими моделями с открытыми весами в том же отчёте, Ornith AI сопоставляет показатели 397B — 86.1 Terminal-Bench / 56.0 DeepSWE — с показателями DeepSeek-V4-Flash-0731 — 82.7 / 54.4 — и GLM-5.2 — 81.0 / 46.2.

Единственное независимое табло — и почему оно всё ещё предварительное
{{1}}Профиль BenchLM для Ornith-1.5-397B — единственная сторонняя страница об этой модели.{{/1}} Её заголовок: публичный балл 68,5 из 100, 20-е место из 221, с Agentic как самой сильной категорией — 13-е место.{{2}} Но стоит прочитать мелкий шрифт, потому что там идёт настоящая работа — все 18 строк бенчмарков помечены как предоставленные провайдером,{{/2}} и в профиле указано, что у модели «пока недостаточно проверенного покрытия для подтверждённой позиции».{{3}} Непозиционированная строка в проверенном списке — не приговор модели;{{/3}} это утверждение, что никто ещё не запускал её независимо,{{4}} а это ровно то, чего можно ожидать от релиза, которому всего несколько дней.{{/4}}

Это и есть разрыв между двумя числами в этой статье: 86.1 Terminal-Bench от вендора — это заявление, а 68.5 от BenchLM — это оценка, полностью построенная на строках, предоставленных вендором. Ни то, ни другое не является независимым измерением. Первая лаборатория, которая прогонит Ornith-1.5-397B через публичный харнесс — SWE-bench Verified на контролируемом наборе, Terminal-Bench на фиксированной версии харнесса — получит первое число, которое имеет значение.
Что вы можете реально запустить сегодня
Это релиз с открытыми весами, так что «запустить» означает скачать веса. В каталоге Ollama уже есть ornith-1.5:9b (сборка ~6,6 ГБ) и ornith-1.5:35b (сборка ~23 ГБ), обе с контекстом 256K; в записи каталога для сборки 9B также указана поддержка ввода изображений. Модель 397B — это другая категория задачи: MoE с 397B параметров — не модель для ноутбука, и любое серьёзное развёртывание требует нескольких GPU и настоящей оркестрации.
Практическая золотая середина для большинства команд — это Ornith-1.5-35B-A3B: 3B активных параметров на токен дают возможности MoE за небольшую долю затрат на токен плотной модели на 35B, а сборка Ollama на 23 ГБ работает на одной карте с большим объёмом видеопамяти или на небольшом кластере. А 9B — это та, которую ставят на телефон.
Свойство «3B active» — это также то, где экономика маршрутизации становится интересной. MoE с активными параметрами стоят значительно дешевле, чем их полный размер, и когда провайдеры принимают такую модель, цена за токен имеет тенденцию быстро падать — что и происходит при покупке через маршрутизатор, который передаёт цены провайдеров без наценки, а не через единого вендора, с которым вы ведёте переговоры один раз. OrcaRouter делает именно это для более чем 200 моделей, поэтому снижение цены провайдером на новую модель с открытыми весами вступает в силу на нашей стороне в тот же день. А для модели, которая поставляется только с бенчмарками вендора, аргумент об отказоустойчивости важнее всего: слой маршрутизации позволяет направить тестовый трафик на совершенно новую модель и переключиться на проверенную в тот момент, когда она начинает давать сбои — пробуя непроверенный релиз, не ставя на него производственный трафик.
Чего всё ещё не хватает
• Нет размещенного API. Если вам нужен Ornith-1.5 как сервис, его пока не существует; каждый вариант — это самостоятельный хостинг или локальный запуск.
• Независимой оценки нет. BenchLM оставляет семейство без рейтинга; ни одна лаборатория не опубликовала контролируемый прогон.
• Не нужно думать о ценообразовании. Нет тарифа за токены, поэтому случай «дешёвого открытого фронтира» полностью сводится к экономике ваших собственных GPU.
• Стенды неоднородны. Terminal-Bench имеет несколько вариантов, и собственные цифры отчёта распределены по ним: результат 86.1 модели 397B получен на стенде Terminus-2, а результат 68.5 модели 35B — на стенде Claude Code. Разные стенды — это разные игры, что делает корректное сравнение более сложным, чем предполагает сводная таблица.
Что посмотреть дальше
Суть не в том, что «открытая модель превосходит Claude Opus 4.8», — это непроверенное утверждение, которому день от роду. А в том, что лаборатория замкнула цикл на самогенерируемых обучающих данных и опубликовала веса для проверки, — и именно за этим стоит наблюдать. Что превратило бы этот релиз из многообещающего в заслуживающий доверия: первый независимый прогон 397B на SWE-bench Verified и исправленный испытательный стенд Terminal-Bench; реально поставляемый код оценки; и появление хостированного маршрута, чтобы профиль затрат 35B-A3B можно было сверить с заявленным. Если цифры подтвердятся, Ornith-1.5-35B-A3B станет историей квартала о соотношении цены и производительности среди открытых весов. Если нет — честная часть, то есть метод самоулучшения и веса под лицензией MIT, — выживет в любом случае.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
