Papan Peringkat Model AI

Diperingkat berdasarkan lalu lintas produksi nyata OrcaRouter dan suara komunitas di Battle Mode — bukan tolok ukur yang dilaporkan vendor.

Diperbarui 2026-08-095 sumber buktiModel baru masuk daftar dalam 48 jam
Diukur pada lalu lintas nyata
100.0%
Tingkat keberhasilan tertinggi (7 hari)
openai/gpt-4-turbo-2024-04-09
450 ms
Latensi p50 tercepat
OpenAI: GPT-4o (2024-08-06)
80.1%
Tingkat kemenangan komunitas tertinggi
Qwen3.7 Max (2026-05-20)

Peringkat konsolidasi

Satu peringkat gabungan per model — suara LMArena, benchmark independen, adopsi ekosistem, dan bukti produksi OrcaRouter, dengan bobot publik yang tetap. Model baru masuk sejak hari pertama berdasarkan bukti eksternal.

PeringkatModelSkor gabunganKeandalan$/1M campuranVolumeMomentumBukti
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 1.9%Pangsa token OpenRouter — adopsi ekosistem nyata.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 6.7%Pangsa token OpenRouter — adopsi ekosistem nyata.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).Win 58.7%Tingkat kemenangan Blind Battle OrcaRouter — suara buta komunitas kami.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 2.0%Pangsa token OpenRouter — adopsi ekosistem nyata.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 4.9%Pangsa token OpenRouter — adopsi ekosistem nyata.Win 63.6%Tingkat kemenangan Blind Battle OrcaRouter — suara buta komunitas kami.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 0.9%Pangsa token OpenRouter — adopsi ekosistem nyata.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 0.1%Pangsa token OpenRouter — adopsi ekosistem nyata.Win 80.1%Tingkat kemenangan Blind Battle OrcaRouter — suara buta komunitas kami.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 1.2%Pangsa token OpenRouter — adopsi ekosistem nyata.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494Elo komunitas LMArena — suara buta di arena teks (CC-BY-4.0).AA 62.1Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 0.3%Pangsa token OpenRouter — adopsi ekosistem nyata.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480Elo komunitas LMArena — suara buta di arena teks (CC-BY-4.0).AA 51.6Indeks kecerdasan Artificial Analysis — benchmark gabungan independen (0–100).OR 3.5%Pangsa token OpenRouter — adopsi ekosistem nyata.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Porsi token per lab
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Lainnya 6.8%
40%
Preferensi manusia
LMArena · Bradley–Terry
30%
Benchmark independen
Artificial Analysis · SWE-bench
20%
Bukti produksi
OrcaRouter battles & traffic
10%
Adopsi ekosistem
OpenRouter token share

Duel langsung

Tingkat kemenangan berpasangan di Battle Mode — seberapa sering setiap model mengalahkan tiap lawan secara langsung.

Tolok ukur — kecerdasan vs harga

Skor kecerdasan independen diplot terhadap harga input. Garis putus-putus adalah frontier Pareto harga/kecerdasan.

Duel Buta

Dua jawaban anonim, satu suara. Battle Anda mengisi bobot 20% bukti produksi dalam peringkat konsolidasi.

⚔️ Duel Buta

Dua model anonim menjawab prompt yang sama. Baca keduanya, pilih pemenangnya, lalu lihat siapa menulis apa — suaramu memengaruhi peringkat di atas.

Metodologi — cara papan peringkat ini bekerja

Setiap angka di halaman ini diukur, tidak pernah dilaporkan sendiri oleh vendor. Inilah metode lengkap di balik peringkat gabungan — aturan yang sama untuk setiap model, setiap hari.

Satu skor gabungan, bobot publik yang tetap

Setiap model mendapat skor komposit dari empat keluarga bukti independen: preferensi manusia secara buta 40%, benchmark independen 30%, bukti produksi OrcaRouter 20%, dan adopsi ekosistem 10%. Bobotnya tetap dan publik — tanpa penyesuaian editorial, tanpa penempatan berbayar, tanpa pengajuan vendor.

Sumber tiap keluarga bukti

Preferensi manusia berasal dari Elo komunitas LMArena — suara berpasangan secara buta di arena teks dan visi (CC-BY-4.0). Benchmark independen menggabungkan Artificial Analysis (Intelligence Index plus coding, matematika, GPQA Diamond, dan τ²-Bench) dengan SWE-bench Verified, porsi issue GitHub nyata yang terselesaikan. Bukti produksi adalah milik OrcaRouter sendiri: tingkat kemenangan Blind Battle plus telemetri gateway langsung — tingkat keberhasilan, latensi, dan volume token yang dirutekan. Adopsi memakai porsi token yang dipublikasikan OpenRouter.

Cara skor menjadi sebanding

Sumber menilai pada skala berbeda (Elo, indeks 0–100, % terselesaikan), jadi tiap sinyal distandardisasi terhadap papan saat ini dan dipetakan ke 0–100: 50 adalah rata-rata papan dan tiap 15 poin setara satu simpangan baku, dibatasi di ujung. Sebuah model butuh minimal dua keluarga bukti independen agar bisa diperingkat, dan papan menampilkan 25 teratas menurut skor komposit.

Papan per kasus penggunaan

Papan teks, coding, visi, matematika, penalaran, dan agen menjalankan ulang campuran yang sama pada sinyal yang sesuai segmennya — coding memakai benchmark coding dan SWE-bench Verified, visi memakai arena visi LMArena — dan Blind Battle hanya memasangkan model dalam segmen yang sama.

Kesegaran dan fair play

Umpan eksternal disegarkan setiap hari dan telemetri internal berjalan langsung; model baru masuk berdasarkan bukti eksternal dalam 48 jam setelah rilis. Angka yang dilaporkan sendiri oleh vendor tidak pernah dipakai, keramaian komunitas hanya ditampilkan sebagai konteks dan tak pernah memengaruhi peringkat, dan setiap sumber eksternal dicantumkan di bawah papan.

Pertanyaan umum

Bagaimana peringkat model AI dihitung?

Setiap model mendapat skor gabungan dari empat kelompok bukti — preferensi manusia secara buta (LMArena), benchmark independen (Artificial Analysis, SWE-bench), keandalan produksi OrcaRouter, dan adopsi ekosistem (OpenRouter) — dengan bobot publik tetap 40 / 30 / 20 / 10.

Mengapa model yang baru rilis sudah punya peringkat?

Model baru masuk ke papan berdasarkan bukti eksternal dalam 48 jam setelah rilis. Peringkat semakin kokoh seiring bertambahnya battle komunitas dan trafik produksi.

Seberapa sering peringkat diperbarui?

Sumber eksternal diperbarui harian dan telemetri OrcaRouter berjalan live; tanggal pembaruan tampil di bagian atas.

Mengapa sebuah model tidak ada di papan?

Sebuah model memerlukan setidaknya dua sumber bukti independen untuk masuk peringkat, dan papan menampilkan 25 teratas berdasarkan skor komposit — model dengan bukti tipis tetap tidak tercantum sampai sumber lain mencakupnya.

Apakah tiap kasus penggunaan diberi peringkat terpisah?

Ya — tombol di atas tabel gabungan berpindah antara papan teks, coding, visi, matematika, penalaran, dan agen, dan battle hanya memasangkan model yang setara.

Kapan peringkat model baru menjadi kokoh?

Begitu sebuah model memiliki tiga keluarga bukti, termasuk data battle dan trafik milik OrcaRouter sendiri, peringkatnya bertumpu pada gabungan penuh, bukan hanya pada bukti eksternal.

Dari mana datanya?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, peringkat OpenRouter, plus telemetri produksi OrcaRouter — semuanya diatribusikan di bawah papan.

Bisakah vendor memanipulasi peringkat?

Sulit: bobot terbuka, tanpa angka klaim sendiri, dan blind battle plus trafik nyata menjangkar setiap skor.

Bisakah saya mengekspor atau menyematkan data ini?

Bisa — ekspor JSON/CSV, lencana peringkat yang dapat disematkan, dan RSS perubahan peringkat gratis dengan atribusi. Tautan ada di bagian bawah halaman.

Model baru, perubahan peringkat, dan rilis — ikuti kami:X · @OrcaRouterDiscord