Papan Peringkat Model AI

Diperingkat berdasarkan lalu lintas produksi nyata OrcaRouter dan suara komunitas di Battle Mode — bukan tolok ukur yang dilaporkan vendor.

Diperbarui 2026-09-235 sumber buktiModel baru masuk daftar dalam 48 jam
Diukur pada lalu lintas nyata
100.0%
Tingkat keberhasilan tertinggi (7 hari)
Meta: Muse Spark 1.1
156 ms
Latensi p50 tercepat
Orca: OrcaVerify Text 1.0 (Free)
80.1%
Tingkat kemenangan komunitas tertinggi
Qwen3.7 Max (2026-05-20)

Peringkat konsolidasi

Satu peringkat gabungan per model — suara LMArena, benchmark independen, adopsi ekosistem, dan bukti produksi OrcaRouter, dengan bobot publik yang tetap. Model baru masuk sejak hari pertama berdasarkan bukti eksternal.

PeringkatModelSkor gabunganKeandalan$/1M campuranKecepatanMomentumBukti
#1OpenAI: GPT-5.4 Pro81.199.46% · 10000ms$165.00$60 → $270 per 1M tokens132 token per detikAA 66.0Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).Win 58.7%Tingkat kemenangan Blind Battle OrcaRouter — suara buta komunitas kami.
#2DeepSeek: DeepSeek V4.1 Flash78.699.90% · 2541ms$0.38$0.15 → $0.6 per 1M tokens185 token per detikAA 39.5Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 13.5%Pangsa token OpenRouter — adopsi ekosistem nyata.
#3OpenAI: GPT-6 Astra75.899.30% · 10000ms$30.00$10 → $50 per 1M tokens55 token per detikAA 52.7Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 1.4%Pangsa token OpenRouter — adopsi ekosistem nyata.
#4Anthropic: Claude Opus 5.573.4100.00% · 10000ms$12.00$4 → $20 per 1M tokens4489 token per detikAA 57.6Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 0.0%Pangsa token OpenRouter — adopsi ekosistem nyata.
#5Anthropic: Claude Opus 572.699.37% · 6164ms$15.00$5 → $25 per 1M tokens85 token per detikAA 50.8Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 0.9%Pangsa token OpenRouter — adopsi ekosistem nyata.
#6Anthropic: Claude Fable 5.172.399.32% · 8022ms$30.00$10 → $50 per 1M tokens61 token per detikAA 53.4Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 0.4%Pangsa token OpenRouter — adopsi ekosistem nyata.
#7Z.ai: GLM 5.372.199.86% · 3904ms$2.61$1.26 → $3.96 per 1M tokens74 token per detikAA 44.8Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 2.4%Pangsa token OpenRouter — adopsi ekosistem nyata.
#8OpenAI: GPT-5.6 Luna72.199.88% · 1632ms$0.70$0.2 → $1.2 per 1M tokens110 token per detikAA 37.3Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 6.6%Pangsa token OpenRouter — adopsi ekosistem nyata.
#9Z.ai: GLM 5.3 Flash71.599.55% · 6866ms$0.16$0.075 → $0.25 per 1M tokens95 token per detikArena 1472Elo komunitas LMArena — suara buta di arena teks (CC-BY-4.0).AA 41.8Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 13.9%Pangsa token OpenRouter — adopsi ekosistem nyata.
#10OpenAI: GPT-5.6 Sol71.499.42% · 10000ms$12.00$4 → $20 per 1M tokens1625 token per detikAA 47.0Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 1.4%Pangsa token OpenRouter — adopsi ekosistem nyata.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Pangsa 20 teratas menurut lab
openai 25.0%anthropic 20.0%z-ai 15.0%google 10.0%Lainnya 30.0%
40%
Preferensi manusia
LMArena · Bradley–Terry
30%
Benchmark independen
Artificial Analysis · SWE-bench
20%
Bukti produksi
OrcaRouter Blind Battle win rate
10%
Adopsi ekosistem
OpenRouter token share

Duel langsung

Tingkat kemenangan berpasangan di Battle Mode — seberapa sering setiap model mengalahkan tiap lawan secara langsung.

Tolok ukur — kecerdasan vs harga

Skor kecerdasan independen diplot terhadap harga input. Garis putus-putus adalah frontier Pareto harga/kecerdasan.

Duel Buta

Dua jawaban anonim, satu suara. Battle Anda mengisi bobot 20% bukti produksi dalam peringkat konsolidasi.

⚔️ Duel Buta

Dua model anonim menjawab prompt yang sama. Baca keduanya, pilih pemenangnya, lalu lihat siapa menulis apa — suaramu memengaruhi peringkat di atas.

Metodologi — cara papan peringkat ini bekerja

Setiap angka di halaman ini diukur, tidak pernah dilaporkan sendiri oleh vendor. Inilah metode lengkap di balik peringkat gabungan — aturan yang sama untuk setiap model, setiap hari.

Satu skor gabungan, bobot publik yang tetap

Setiap model mendapat skor komposit dari empat keluarga bukti independen: preferensi manusia secara buta 40%, benchmark independen 30%, bukti produksi OrcaRouter 20%, dan adopsi ekosistem 10%. Bobotnya tetap dan publik — tanpa penyesuaian editorial, tanpa penempatan berbayar, tanpa pengajuan vendor.

Sumber tiap keluarga bukti

Preferensi manusia berasal dari Elo komunitas LMArena — suara berpasangan secara buta di arena teks dan visi (CC-BY-4.0). Benchmark independen menggabungkan Artificial Analysis (Intelligence Index plus coding, matematika, GPQA Diamond, dan τ²-Bench) dengan SWE-bench Verified, porsi issue GitHub nyata yang terselesaikan. Bukti produksi adalah tingkat kemenangan Blind Battle milik OrcaRouter sendiri. Adopsi memakai porsi token yang dipublikasikan OpenRouter. Tingkat keberhasilan, latensi, dan throughput ditampilkan di samping tiap model sebagai konteks — tidak pernah memengaruhi peringkat.

Cara skor menjadi sebanding

Sumber menilai pada skala berbeda (Elo, indeks 0–100, % terselesaikan), jadi tiap sinyal distandardisasi terhadap papan saat ini dan dipetakan ke 0–100: 50 adalah rata-rata papan dan tiap 15 poin setara satu simpangan baku, dibatasi di ujung. Sebuah model butuh minimal dua keluarga bukti independen agar bisa diperingkat, dan papan menampilkan 25 teratas menurut skor komposit.

Papan per kasus penggunaan

Papan teks, coding, visi, matematika, penalaran, dan agen menjalankan ulang campuran yang sama pada sinyal yang sesuai segmennya — coding memakai benchmark coding dan SWE-bench Verified, visi memakai arena visi LMArena — dan Blind Battle hanya memasangkan model dalam segmen yang sama.

Kesegaran dan fair play

Umpan eksternal disegarkan setiap hari dan telemetri internal berjalan langsung; model baru masuk berdasarkan bukti eksternal dalam 48 jam setelah rilis. Angka yang dilaporkan sendiri oleh vendor tidak pernah dipakai, keramaian komunitas hanya ditampilkan sebagai konteks dan tak pernah memengaruhi peringkat, dan setiap sumber eksternal dicantumkan di bawah papan.

Pertanyaan umum

Bagaimana peringkat model AI dihitung?

Setiap model mendapat skor gabungan dari empat kelompok bukti — preferensi manusia secara buta (LMArena), benchmark independen (Artificial Analysis, SWE-bench), keandalan produksi OrcaRouter, dan adopsi ekosistem (OpenRouter) — dengan bobot publik tetap 40 / 30 / 20 / 10.

Mengapa model yang baru rilis sudah punya peringkat?

Model baru masuk ke papan berdasarkan bukti eksternal dalam 48 jam setelah rilis. Peringkat semakin kokoh seiring bertambahnya battle komunitas dan trafik produksi.

Seberapa sering peringkat diperbarui?

Sumber eksternal diperbarui harian dan telemetri OrcaRouter berjalan live; tanggal pembaruan tampil di bagian atas.

Mengapa sebuah model tidak ada di papan?

Sebuah model memerlukan setidaknya dua sumber bukti independen untuk masuk peringkat, dan papan menampilkan 25 teratas berdasarkan skor komposit — model dengan bukti tipis tetap tidak tercantum sampai sumber lain mencakupnya.

Apakah tiap kasus penggunaan diberi peringkat terpisah?

Ya — tombol di atas tabel gabungan berpindah antara papan teks, coding, visi, matematika, penalaran, dan agen, dan battle hanya memasangkan model yang setara.

Kapan peringkat model baru menjadi kokoh?

Begitu sebuah model memiliki tiga keluarga bukti, termasuk data battle dan trafik milik OrcaRouter sendiri, peringkatnya bertumpu pada gabungan penuh, bukan hanya pada bukti eksternal.

Dari mana datanya?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, peringkat OpenRouter, plus telemetri produksi OrcaRouter — semuanya diatribusikan di bawah papan.

Bisakah vendor memanipulasi peringkat?

Sulit: bobot terbuka, tanpa angka klaim sendiri, dan blind battle plus trafik nyata menjangkar setiap skor.

Bisakah saya mengekspor atau menyematkan data ini?

Bisa — ekspor JSON/CSV, lencana peringkat yang dapat disematkan, dan RSS perubahan peringkat gratis dengan atribusi. Tautan ada di bagian bawah halaman.

Model baru, perubahan peringkat, dan rilis — ikuti kami:X · @OrcaRouterDiscord