Kartu judul hero untuk penjelasan peluncuran Ornith-1.5, dengan judul 'Ornith-1.5 — Open Weights, Self-Improving', subjudul 'Keluarga model yang menulis kurikulum pelatihannya sendiri — 397B MoE · 35B-A3B · 9B', dan tiga chip model yang dihubungkan oleh panah melingkar yang menunjukkan siklus peningkatan diri, dengan logo OrcaRouter yang dipadukan di pojok.
Guides & Insights

Ornith-1.5: Keluarga Model Open-Weight yang Menulis Kurikulum Pelatihannya Sendiri — dan Mengklaim Mengalahkan Claude Opus 4.8

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ornith-1.5, keluarga open-weight dari Ornith AI yang mengklaim mengalahkan Claude Opus 4.8 pada empat benchmark, dirilis pada 19 Agustus 2026 — dan hal yang patut disimak adalah pelatihan loop-nya, bukan jumlah parameternya. Keluarga ini terdiri dari tiga model: Ornith-1.5-397B, andalan mixture-of-experts dengan 397 miliar parameter; Ornith-1.5-35B-A3B, MoE 35B yang mengaktifkan 3 miliar parameter per token; dan Ornith-1.5-9B, model dense 9B dengan build mobile terkuantisasi. Setiap skor utama di sini dilaporkan oleh vendor: angka-angka tersebut berasal dari evaluasi internal Ornith AI, dirata-ratakan dari lima kali percobaan, dan satu-satunya pelacak pihak ketiga dengan profil — BenchLM — melabeli semua 18 baris benchmark-nya sebagai laporan penyedia dan tidak memberi peringkat pada keluarga ini sampai ada liputan independen. Berikut adalah apa yang sebenarnya dirilis, apa arti sebenarnya dari "self-improving", dan apa yang bisa Anda jalankan hari ini.

Yang dirilis: tiga skala, lisensi MIT, tanpa API

Ornith AI — grup di balik model open-weights Ornith-1.0 dan terkait dengan pekerjaan DeepReinforce pada sistem multi-agen pemrograman kompetitif (GrandCode) dan optimasi kernel GPU (CUDA-L2) — merilis keluarga model ini di Hugging Face dengan lisensi MIT, dengan kuantisasi FP8, GGUF, MLX, dan NVFP4 di samping checkpoint mentahnya. Jendela konteks 256K (262.144 token) berlaku untuk seluruh keluarga. Tidak ada API yang dihosting pihak pertama dan tidak ada harga token; ini adalah rilis untuk self-host atau runtime lokal, dan laporan peluncurannya menyatakan demikian dengan jelas.

Ketiga skala tersebut menyasar tiga realitas yang berbeda:

• Ornith-1.5-397B — "tawaran frontier terbuka": MoE 397B yang membidik frontier tertutup pada beban kerja agentik dan coding.

• Ornith-1.5-35B-A3B — MoE 35B yang hanya mengaktifkan 3B parameter per token, sebagai jalan tengah: kemampuan mendekati kelas unggulan dengan biaya inferensi per token yang hanya sebagian kecil dari biaya model dense 35B.

• Ornith-1.5-9B — model padat 9B untuk penggunaan lokal dan di perangkat, plus build Ornith-1.5-9B-Mobile terkuantisasi yang menurut vendor siap digunakan di iPhone dan Android.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

Halaman peluncuran di atas adalah keseluruhan pengumumannya: laporan teknis, bukan posting pemasaran, yang konsisten dengan profil lab tersebut.

Klaim pengembangan diri, diuraikan

Ornith-1.0, dirilis pada Juni 2026, mengajarkan model untuk menghasilkan kerangka di sekitar tugas pengkodean — harness, dekomposisi, orkestrasi. Ornith-1.5 memperluas lingkaran itu ke generasi tugas itu sendiri. Dalam pelatihan, model sekarang melakukan tiga hal:

• Usulkan tugas pelatihan baru yang lebih sulit.

Hasilkan kerangka kerja khusus tugas yang digunakan untuk menyelesaikan dan mengevaluasi tugas-tugas tersebut.

• Menghasilkan rollout solusi yang menjadi putaran data pelatihan berikutnya.

Reward mengalir melalui ketiga tahap, dioptimalkan secara bersama dengan GRPO. Setiap tugas yang diusulkan diberi skor berdasarkan validitas (harus dapat dieksekusi dan diverifikasi), kesulitan frontier (tingkat keberhasilan solusi target ditetapkan pada 0,2 — tugas yang biasanya gagal dilakukan model tetapi masih dapat dipelajari), dan kebaruan (keragaman dari segala hal yang telah dilihat sebelumnya). Scaffold menerima reward-nya sendiri untuk penyelarasan, kesetiaan reward, dan ketahanan terhadap reward hacking, dan pipeline menyertakan pengaman anti-hacking: pembatasan terhadap akses lingkungan pengujian, pemantauan akses jalur terbatas, dan model adjudikasi yang dibekukan yang menimpa hasil yang anomali.

Peringatan pentingnya terletak pada kata "perbaikan diri": kata itu menggambarkan prosedur pelatihan, bukan artefaknya. Model yang diunduh tidak melatih ulang dirinya sendiri di laptop Anda. Yang Anda dapatkan adalah model yang data pelatihannya, secara tidak biasa, dihasilkan oleh versi-versi sebelumnya dari dirinya sendiri — yang justru merupakan jenis klaim yang layak diuji sebelum menjadi dogma.

Tolok ukur tersebut mengklaim, diberi label jujur.

Semua angka di bagian ini adalah milik Ornith AI sendiri, dari laporan peluncuran, dirata-rata dari lima kali penjalanan, dan tidak direproduksi secara independen. Empat kemenangan yang diklaim oleh model unggulan atas Claude Opus 4.8:

• Terminal-Bench 2.1 (kerangka Terminus-2): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 vs 85.8

• WideSearch: 80.8 vs 72.9

• BrowseComp: 86.6 vs 84.3

Bacalah itu sebagai klaim vendor, bukan fakta. Satu-satunya tolok ukur unggulan di mana Ornith AI tidak mengklaim kemenangan adalah DeepSWE, 56.0 berbanding 59.0 milik Claude Opus 4.8 — laporan tersebut membingkainya sebagai "seimbang," yang merupakan cara jujur untuk membaca kekalahan. Angka unggulan lainnya dari laporan yang sama: HLE 44.6 tanpa alat dan 56.1 dengan alat, GPQA Diamond 92.8, dan SWE-bench Pro 65.1.

Dua yang lebih kecil juga kuat di atas kertas: Ornith-1.5-35B-A3B melaporkan SWE-bench Verified 79.0 dan Terminal-Bench 2.1 (harness Claude Code) 68.5, sementara Ornith-1.5-9B melaporkan SWE-bench Verified 70.6 dan Terminal-Bench 2.1 47.0. Dibandingkan dengan model open-weights lain dalam laporan yang sama, Ornith AI membandingkan 397B yang memiliki 86.1 Terminal-Bench / 56.0 DeepSWE dengan DeepSeek-V4-Flash-0731 yang 82.7 / 54.4 dan GLM-5.2 yang 81.0 / 46.2.

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

Satu-satunya papan skor independen — dan mengapa ia masih bersifat sementara

Profil BenchLM untuk Ornith-1.5-397B saat ini adalah satu-satunya halaman pihak ketiga tentang model tersebut. Judul utamanya: skor publik 68,5 dari 100, peringkat #20 dari 221, dengan Agentic sebagai kategori terkuat di #13. Tetapi baca catatan kecilnya, karena ini melakukan pekerjaan nyata — semua 18 baris tolok ukur ditandai dilaporkan penyedia, dan profil tersebut menyatakan bahwa model "belum memiliki cakupan bersumber yang cukup untuk posisi terverifikasi." Posisi tanpa peringkat pada daftar terverifikasi bukanlah vonis terhadap model; itu adalah pernyataan bahwa belum ada yang menjalankannya secara independen, yang persis seperti yang Anda harapkan untuk rilis yang baru berusia beberapa hari.

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

Itulah kesenjangan antara dua angka dalam artikel ini: Terminal-Bench 86.1 milik vendor hanyalah klaim, dan skor 68.5 dari BenchLM dibangun sepenuhnya dari baris yang dilaporkan vendor. Keduanya bukan pengukuran independen. Laboratorium pertama yang menjalankan Ornith-1.5-397B melalui harness publik — SWE-bench Verified pada set yang terkontrol, Terminal-Bench pada versi harness tetap — akan menghasilkan angka pertama yang berarti.

Yang benar-benar dapat Anda jalankan hari ini

Ini adalah rilis dengan bobot terbuka, jadi "menjalankannya" berarti menarik bobotnya. Katalog Ollama sudah mencantumkan ornith-1.5:9b (build ~6.6 GB) dan ornith-1.5:35b (build ~23 GB), keduanya dengan konteks 256K; build 9B juga mendukung input gambar di entri katalog. 397B adalah kategori masalah yang berbeda: MoE dengan 397 miliar parameter bukanlah model laptop, dan penerapan yang serius berarti membutuhkan banyak GPU dan orkestrasi yang sesungguhnya.

Titik optimal yang praktis bagi sebagian besar tim adalah Ornith-1.5-35B-A3B: 3B parameter aktif per token memberikan kapabilitas MoE dengan biaya per-token yang hanya sebagian kecil dari model dense 35B, dan build Ollama 23 GB berjalan pada satu kartu VRAM tinggi atau cluster kecil. Yang 9B adalah yang Anda pasang di ponsel.

Properti "3B active" itu juga menjadi titik menarik dalam ekonomi routing. MoE dengan parameter aktif dibanderol jauh di bawah ukuran totalnya, dan ketika penyedia mengadopsi model seperti ini, harga per token cenderung turun cepat — seperti halnya jika membeli melalui router yang meneruskan harga daftar penyedia dengan markup 0%, bukan dari satu vendor yang hanya Anda negosiasikan sekali. OrcaRouter melakukan hal itu di 200+ model, sehingga pemotongan harga penyedia pada model open-weights baru langsung berlaku di sisi kami pada hari yang sama. Dan untuk model yang dirilis tanpa apa pun selain tolok ukur vendor, argumen failover menjadi yang paling penting: lapisan routing memungkinkan Anda mengarahkan jalur uji ke model baru dan kembali ke model yang sudah terbukti begitu model tersebut tersendat — mencoba rilis yang belum teruji tanpa mempertaruhkan jalur produksi padanya.

Apa yang masih kurang?

• Tidak ada API yang di-hosting. Jika Anda menginginkan Ornith-1.5 sebagai layanan, layanan tersebut belum tersedia; semua pilihannya adalah host mandiri atau lokal.

• Tidak ada evaluasi independen. BenchLM membuat keluarga ini tetap tidak diperingkat; tidak ada laboratorium yang menerbitkan uji coba terkendali.

• Tidak ada penetapan harga yang perlu dipikirkan. Tidak ada tarif token, jadi kasus "perbatasan terbuka yang murah" sepenuhnya tentang ekonomi GPU Anda sendiri.

Harness-nya tercampur. Terminal-Bench memiliki beberapa varian, dan angka-angka dalam laporan itu sendiri mencakup semuanya: skor 86.1 dari 397B ada di harness Terminus-2, sedangkan skor 68.5 dari 35B ada di harness Claude Code. Harness yang berbeda adalah permainan yang berbeda, yang membuat perbandingan apel-dengan-apel menjadi lebih sulit daripada yang tersirat dari tabel utama.

Tontonan Berikutnya

Kisah yang bertahan lama bukanlah {{1}}model terbuka mengalahkan Claude Opus 4.8{{/1}} — itu klaim yang belum diaudit dan baru berumur sehari. Yang bertahan adalah bahwa {{2}}sebuah laboratorium telah menutup siklus data pelatihan yang dihasilkan sendiri dan menerbitkan bobotnya untuk diteliti{{/2}}, dan itulah bagian yang layak diperhatikan. Hal-hal yang akan mengubah ini dari rilis yang menjanjikan menjadi rilis yang tepercaya: {{3}}uji coba independen pertama model 397B pada SWE-bench Verified dan harness Terminal-Bench yang diperbaiki{{/3}}; {{4}}kode evaluasi yang benar-benar dirilis{{/4}}; dan {{5}}tersedianya rute yang dihosting sehingga profil biaya 35B-A3B dapat diukur terhadap klaimnya{{/5}}. Jika angka-angkanya bertahan, {{6}}Ornith-1.5-35B-A3B adalah kisah harga/kinerja bobot terbuka di kuartal ini{{/6}}. Jika tidak, bagian yang jujur — {{7}}metode peningkatan diri dan bobot MIT{{/7}} — tetap bertahan apa pun yang terjadi.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube