Ornith-1.5 론칭 익스플레이너용 히어로 타이틀 카드. 타이틀은 'Ornith-1.5 — 오픈 웨이트, 자가 개선', 서브타이틀은 '자체 훈련 커리큘럼을 작성하는 모델 패밀리 — 397B MoE · 35B-A3B · 9B'이며, 자가 개선 사이클을 암시하는 원형 루프 화살표로 연결된 세 개의 모델 칩과 모서리에 합성된 OrcaRouter 로고를 포함한다.
Guides & Insights

Ornith-1.5: 자체 학습 커리큘럼을 작성하는 오픈 웨이트 모델 제품군 — Claude Opus 4.8을 능가한다고 주장

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월 19일에 출시된 Ornith-1.5는 Ornith AI의 오픈 가중치 제품군으로, 네 가지 벤치마크에서 Claude Opus 4.8을 능가한다고 주장합니다. — 그리고 여기서 주목할 만한 점은 파라미터 수가 아니라 학습 루프입니다. 제품군은 세 가지 모델로 구성됩니다: 3,970억 개의 파라미터를 가진 혼합 전문가(MoE) 플래그십인 Ornith-1.5-397B; 토큰당 30억 개의 파라미터를 활성화하는 350억 규모 MoE인 Ornith-1.5-35B-A3B; 그리고 양자화된 모바일 빌드를 갖춘 90억 규모의 덴스 모델인 Ornith-1.5-9B입니다. 여기에 있는 모든 주요 점수는 공급업체가 보고한 것입니다: 수치는 Ornith AI 자체 평가 실행에서 나온 것으로 5회 평균이며, 프로필을 갖춘 유일한 제3자 추적 사이트인 BenchLM은 벤치마크의 18개 행 전체를 공급업체 보고로 분류하고 독립적인 검증이 있을 때까지 이 제품군을 순위에서 제외합니다. 실제로 출시된 것, '자기 개선'이 실제로 의미하는 바, 그리고 오늘 실행할 수 있는 것을 소개합니다.

출시된 것: 세 가지 스케일, MIT 라이선스, API 없음

Ornith AI — 오픈 가중치 Ornith-1.0을 개발한 그룹이자, 경쟁 프로그래밍 멀티 에이전트 시스템(GrandCode) 및 GPU 커널 최적화(CUDA-L2)에 관한 DeepReinforce 작업으로 알려진 그룹 — 이 제품군을 MIT 라이선스로 Hugging Face에 공개했다. 원본 체크포인트와 함께 FP8, GGUF, MLX, NVFP4 양자화 버전도 포함된다. 256K 컨텍스트 창(262,144 토큰)은 제품군 전체에 적용된다. 자사 호스팅 API도 토큰 가격도 없다. 이는 자체 호스팅 또는 로컬 런타임용 출시이며, 출시 보고서에도 그렇게 명시되어 있다.

세 가지 척도는 세 가지 서로 다른 현실을 겨냥한다:

• Ornith-1.5-397B — "오픈 프론티어 도전": 에이전트 및 코딩 워크로드에서 폐쇄형 프론티어를 겨냥한 397B MoE.

• Ornith-1.5-35B-A3B — 토큰당 3B 파라미터만 활성화하는 35B MoE로, 중간 지점을 겨냥합니다: 밀집형 35B의 토큰당 추론 비용의 일부만으로 플래그십에 가까운 성능을 제공합니다.

• Ornith-1.5-9B — 로컬 및 온디바이스 사용을 위한 밀집 9B, 그리고 공급업체가 iPhone과 Android에 배포할 준비가 완료되었다고 밝힌 양자화된 Ornith-1.5-9B-Mobile 빌드.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

위의 출시 페이지가 전체 발표 내용입니다. 마케팅 게시물이라기보다는 기술 보고서에 가깝고, 이는 연구소의 성격과 일치합니다.

자기계발 주장, 해독

2026년 6월에 출시된 Ornith-1.0은 모델이 코딩 작업을 둘러싼 스캐폴딩, 즉 하네스, 분해, 오케스트레이션을 생성하도록 학습시켰습니다. Ornith-1.5는 이러한 루프를 작업 생성 자체로 확장합니다. 이제 훈련에서 모델은 세 가지를 수행합니다:

• 더 어려운 새로운 훈련 과제를 제안하세요.

해당 작업들을 해결하고 평가하는 데 사용되는 작업별 스캐폴드를 생성하십시오.

• 다음 훈련 데이터가 될 솔루션 롤아웃을 생성한다.

보상은 세 단계 모두를 통해 흐르며, GRPO로 공동 최적화됩니다. 각 제안된 작업은 유효성(실행 가능하고 검증 가능해야 함), 프런티어 난이도(목표 솔루션 성공률은 0.2로 설정됨 — 모델이 보통 실패하지만 여전히 학습할 수 있는 작업), 그리고 참신성(이미 본 모든 것과의 다양성)으로 점수가 매겨집니다. 스캐폴드는 정렬, 보상 충실성, 그리고 보상 해킹에 대한 저항에 대해 자체 보상을 받습니다. 파이프라인에는 안티 해킹 보호 장치가 포함됩니다: 테스트 환경 조작에 대한 제한, 제한된 경로 접근에 대한 모니터링, 그리고 이상 결과를 무효화하는 동결된 판정 모델입니다.

중요한 주의사항은 "자기 개선"이라는 단어에 있습니다. 이는 훈련 절차를 설명하는 것이지, 산출물을 설명하는 것이 아닙니다. 다운로드한 모델은 사용자의 노트북에서 스스로 재훈련하지 않습니다. 여러분이 얻는 것은 훈련 데이터가 특이하게도 이전 버전의 모델 자체에 의해 생성된 모델입니다. 이것은 바로 교리가 되기 전에 검증해 볼 가치가 있는 주장입니다.

벤치마크는 정직하게 표시된 주장이다.

이 섹션의 모든 수치는 Ornith AI 자체 데이터로, 출시 보고서에서 가져왔고, 다섯 번의 실행을 평균한 것이며, 독립적으로 재현된 것이 아닙니다. 주력 모델이 Claude Opus 4.8에 대해 주장하는 네 가지 우위:

• Terminal-Bench 2.1 (Terminus-2 harness): Ornith-1.5-397B 86.1 대 Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 vs 85.8

• WideSearch: 80.8 대 72.9

• BrowseComp: 86.6 대 84.3

그것들은 사실이 아니라 벤더의 주장으로 읽어야 한다. Ornith AI가 승리를 주장하지 않는 유일한 주요 벤치마크는 DeepSWE로, 56.0 대 Claude Opus 4.8의 59.0이다 — 보고서는 이를 "on par"로 표현하는데, 이는 패배를 정직하게 읽는 방식이다. 같은 보고서의 다른 주요 수치: 도구 없이 HLE 44.6, 도구 사용 시 56.1, GPQA Diamond 92.8, 그리고 SWE-bench Pro 65.1.

더 작은 두 모델도 서류상 강력합니다: Ornith-1.5-35B-A3B는 SWE-bench Verified 79.0, Terminal-Bench 2.1(Claude Code 하네스) 68.5를 보고했으며, Ornith-1.5-9B는 SWE-bench Verified 70.6, Terminal-Bench 2.1 47.0을 보고했습니다. 같은 보고서의 다른 오픈 가중치 모델과 비교하면, Ornith AI는 397B의 Terminal-Bench 86.1 / DeepSWE 56.0을 DeepSeek-V4-Flash-0731의 82.7 / 54.4 및 GLM-5.2의 81.0 / 46.2와 비교합니다.

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

유일한 독립 스코어보드 — 그리고 그것이 여전히 잠정적인 이유

BenchLM의 Ornith-1.5-397B 프로필은 현재 이 모델에 대한 유일한 서드파티 페이지입니다. 헤드라인: 100점 만점에 공개 점수 68.5점, 221개 중 20위, Agentic이 13위로 가장 강한 카테고리입니다. 하지만 세부 조항을 읽어보세요. 거기에는 실질적인 내용이 있기 때문입니다. 벤치마크의 18개 행 모두 공급자 보고로 표시되어 있으며, 프로필은 모델이 "검증된 순위를 위한 충분한 출처 범위를 아직 확보하지 못했다"고 명시합니다. 검증된 목록에서 순위가 매겨지지 않은 것은 모델에 대한 부정적인 평결이 아니라 아직 아무도 독립적으로 실행하지 않았다는 진술이며, 이는 출시된 지 며칠 된 모델에서 정확히 기대할 수 있는 것입니다.

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

이것이 이 기사에서 두 숫자 사이의 격차입니다: 벤더의 86.1 Terminal-Bench는 주장이고, BenchLM의 68.5는 전적으로 벤더가 보고한 행에 기반해 만들어진 점수입니다. 둘 다 독립적인 측정이 아닙니다. Ornith-1.5-397B를 공개 하니스 — 통제된 집합에 대한 SWE-bench Verified, 고정된 하니스 버전의 Terminal-Bench — 로 실행하는 첫 번째 연구소가 비로소 의미 있는 첫 번째 숫자를 만들어낼 것입니다.

오늘 실제로 실행할 수 있는 것

이것은 오픈 가중치(open-weights) 릴리스이므로 "실행한다"는 것은 가중치를 받아온다는 뜻입니다. Ollama 카탈로그에는 이미 ornith-1.5:9b(약 6.6GB 빌드)와 ornith-1.5:35b(약 23GB 빌드)가 등록되어 있으며, 둘 다 256K 컨텍스트를 지원합니다. 9B 빌드에는 카탈로그 항목에 이미지 입력 지원도 포함되어 있습니다. 397B는 다른 범주의 문제입니다. 397B 파라미터 MoE는 노트북용 모델이 아니며, 제대로 배포하려면 다중 GPU와 실제 오케스트레이션이 필요합니다.

{{1}}대부분의 팀에게 가장 실용적인 최적 지점은 Ornith-1.5-35B-A3B입니다. 토큰당 3B 활성 파라미터는 dense 35B의 토큰당 비용의 일부만으로 MoE의 성능을 제공하며, 23GB Ollama 빌드는 단일 고VRAM 카드 또는 소규모 클러스터에서 실행됩니다.{{/1}} {{2}}9B는 휴대폰에 탑재하는 모델입니다.{{/2}}

그 "3B active" 속성은 라우팅 경제성이 흥미로워지는 지점이기도 합니다. 활성 파라미터 MoE는 전체 규모 대비 훨씬 낮은 가격으로 책정되며, 공급업체가 이런 모델을 채택하면 토큰당 가격이 빠르게 떨어지는 경향이 있습니다. 이는 단 한 번 협상하는 단일 공급업체가 아니라, 공급업체 정가를 0% 마크업으로 그대로 전달하는 라우터를 통해 구매할 때 해당되는 경우입니다. OrcaRouter는 200개 이상의 모델에 걸쳐 정확히 그렇게 하므로, 새로운 오픈 가중치 모델의 공급업체 가격 인하가 당일 우리 쪽에 반영됩니다. 그리고 공급업체 벤치마크만 딸려 나온 모델의 경우 장애 조치(failover) 논거가 가장 중요합니다. 라우팅 계층을 사용하면 테스트 경로를 새 모델로 지정하고, 그 모델이 멈추는 즉시 검증된 모델로 대체할 수 있습니다. 즉, 프로덕션 경로를 걸지 않고 검증되지 않은 릴리스를 시도할 수 있습니다.

아직 무엇이 빠졌나요?

• 호스팅 API는 없습니다. Ornith-1.5를 서비스로 원한다면, 아직 존재하지 않습니다. 모든 옵션은 자체 호스팅 또는 로컬입니다.

• 독립적인 평가 없음. BenchLM은 해당 제품군을 순위에 올리지 않은 채로 두고 있으며, 어떤 연구소도 통제된 실행 결과를 발표하지 않았다.

• 가격에 대해 고민할 필요가 없습니다. 토큰 요금이 없으므로 '저렴한 개방형 프론티어' 사례는 전적으로 자체 GPU 경제성에 달려 있습니다.

• 하네스가 혼합되어 있습니다. Terminal-Bench에는 여러 변형이 있으며, 보고서의 수치 자체도 그 변형들에 걸쳐 있습니다. 397B의 86.1은 Terminus-2 하네스에, 35B의 68.5는 Claude Code 하네스에 해당합니다. 서로 다른 하네스는 서로 다른 게임이므로, 동일한 기준의 비교가 표제 표가 시사하는 것보다 더 어렵습니다.

다음에 볼 콘텐츠

오래 남을 이야기는 '오픈 모델이 Claude Opus 4.8을 이겼다'는 것이 아니다. 그것은 하루 된 검증되지 않은 주장일 뿐이다. 핵심은 한 연구소가 자체 생성한 학습 데이터로 루프를 닫고, 검증을 위해 가중치를 공개했다는 것이며, 바로 그 부분이 지켜볼 만하다. 이것을 유망한 릴리스에서 신뢰할 수 있는 릴리스로 바꿔줄 것들: 397B에 대한 SWE-bench Verified 첫 독립 실행과 수정된 Terminal-Bench 하네스, 실제로 배포되는 평가 코드, 그리고 35B-A3B의 비용 프로필이 주장과 비교해 측정될 수 있도록 호스팅된 경로가 등장하는 것이다. 수치가 유지된다면, Ornith-1.5-35B-A3B는 이번 분기의 오픈 가중치 가격/성능 스토리가 될 것이다. 그렇지 않더라도, 정직한 부분 — 자기 개선 방법과 MIT 가중치 — 는 어느 쪽이든 살아남는다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube