Kartu judul hero bertuliskan 'Apa Itu Router LLM?' dengan subjudul 'Lapisan pemilih model, matematika sebenarnya, dan kapan harus melewatinya', menampilkan tiga kartu membulat berlabel SATU ENDPOINT, NILAI & RUTE, dan FAILOVER pada latar belakang putih dengan aksen biru dan cyan serta logo OrcaRouter yang dikomposit di kanan bawah.
Guides & Insights

Apa Itu LLM Router? Lapisan Pemilih Model, Matematika Sebenarnya, dan Kapan Harus Melewatkannya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Router LLM adalah lapisan perangkat lunak yang berada di antara aplikasi Anda dan penyedia model, dan untuk setiap permintaan ia memutuskan model mana yang akan menjawabnya — model murah dan cepat seperti DeepSeek V4 Flash ketika tugasnya mudah, model frontier seperti Claude Opus 5 ketika tugasnya benar-benar sulit. Intinya adalah uang: DeepSeek V4 Flash berbiaya $0,09 per juta token input dan Claude Opus 5 berbiaya $5,00, tarif langsung dari penyedia sebagaimana tercantum dalam katalog model OrcaRouter pada 2026-08-10 — perbedaan 55× pada panggilan yang sama. Kirim 80% lalu lintas Anda yang mudah ke model yang lebih murah dan biarkan 20% yang sulit tetap di model yang lebih mahal, dan Anda menarik tuas biaya tunggal terbesar yang tidak pernah disentuh sebagian besar tim.

Apa sebenarnya router LLM itu

Buanglah pemasaran, dan sebuah model router memiliki tiga tugas, semuanya membosankan dan semuanya berharga. Ia adalah satu titik akhir: kode Anda memanggil satu URL yang kompatibel dengan OpenAI, bukan satu SDK per penyedia. Ia menilai permintaan, memperkirakan seberapa sulitnya, dan merutekannya: pekerjaan mudah ke model murah, penalaran yang benar-benar sulit ke model frontier. Dan ia melakukan failover: jika penyedia yang dipilih membatasi laju permintaan Anda atau mengembalikan 5xx, router akan mencoba lagi ke model yang sehat tanpa aplikasi Anda pernah melihat kesalahan tersebut.

Tahap pengambilan keputusan adalah tempat router berbeda-beda, dan spektrumnya sudah dikenal. Router berbasis aturan mencocokkan kata kunci atau panjang prompt ke model — dalam waktu kurang dari satu milidetik, dapat diprediksi, namun rapuh ketika harga atau model berubah. Router semantik menyematkan prompt dan merutekan berdasarkan makna, sehingga "berapa saldo saya?" dan "berapa banyak uang yang saya miliki" berada di jalur yang sama. Router yang dipelajari mengamati lalu lintas nyata dan beralih ke model mana pun yang unggul dalam kualitas per dolar. Mekanisme masing-masing — termasuk rentang akurasi dari berbagai jenis pengklasifikasi dan mode otomatis yang menilai setiap prompt — dibahas secara lengkap dalam panduan kami, Auto Router for LLMs; di sini intinya adalah bahwa kecerdasan perutean berada pada sebuah spektrum, dan titik mana yang Anda perlukan adalah keputusan produk, bukan daftar fitur.

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

Jika Anda juga pernah melihat "AI router" digunakan untuk perangkat keras Wi-Fi yang memiliki NPU di dalamnya — itu adalah produk berbeda yang kebetulan berbagi nama yang sama, dan kami menguraikan benturan tersebut dalam panduan AI router kami. Segala sesuatu dalam artikel ini membahas tentang kategori perangkat lunak.

Selisih harga itulah yang membuatnya menguntungkan.

Sebuah router hanya berguna jika harga model-modelnya berbeda jauh, dan saat ini perbedaannya sangat besar. Semua tarif di bawah ini adalah harga langsung dari penyedia per 1 juta token dari katalog model OrcaRouter, yang dibaca pada 2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

Baca perbedaannya dan argumennya tersusun dengan sendirinya. DeepSeek V4 Flash seharga $0,09 dibandingkan Claude Opus 5 seharga $5,00 berarti selisih sekitar 55× hanya pada token input saja, dan kesenjangan antara tingkatan murah dan tingkatan terdepan kini menjadi fitur permanen pasar, bukan sekadar diskon sekali jalan. Jika lalu lintas Anda merupakan campuran umum — mayoritas permintaan pendek yang terspesifikasi dengan baik dan minoritas penalaran yang benar-benar sulit — menjalankan semuanya di tingkatan terdepan berarti membayar harga tertinggi untuk 80% bagian yang mudah.

Di sinilah hasil halaman pertama saat ini untuk "llm router" mengecewakan Anda. Entri glosarium Decagon, misalnya, mengutip "GPT-4o, Claude 3.5 Sonnet dan Gemini 1.5 Pro" seharga "$5–15 per juta token input" — model yang menjadi standar dua tahun lalu dengan harga kira-kira dua kali lipat harga hari ini. Pasar bergerak; definisinya tidak. Itulah satu-satunya alasan terbesar untuk tidak mempercayai penjelasan router LLM tanpa tanggal di dalamnya.

Apa yang sebenarnya dikatakan oleh riset tentang tabungan

Perhitungan di atas nyata, dan begitu pula penelitiannya — tetapi gambaran yang jujur adalah rentang, bukan angka tunggal.

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

Ini adalah perhitungan aritmetika yang sudah dikerjakan, dengan asumsi yang dinyatakan agar Anda dapat menyesuaikannya. Bot dukungan yang menangani 100.000 percakapan per bulan, masing-masing mengirim 1.000 token input dan menghasilkan 200 token output: menjalankan semuanya di Claude Sonnet 5 menghabiskan biaya sekitar $400 per bulan. Alihkan 80% yang mudah ke DeepSeek V4 Flash dan pertahankan 20% yang sulit di Claude Sonnet 5, dan lalu lintas yang sama menghabiskan biaya sekitar $90 — kira-kira 78% lebih murah, sebelum adanya caching prompt, yang akan memperlebar selisihnya lebih jauh.

Kesimpulan utamanya: routing agresif menghemat 60–85% ketika sebagian besar lalu lintas Anda mudah, routing seimbang menghemat 35–45%, dan bahkan routing konservatif menghemat 10–15%. Angka pasti untuk Anda adalah karakteristik dari lalu lintas Anda, diukur pada prompt Anda sendiri — bukan konstanta yang bisa Anda salin dari postingan blog.

Tiga biaya yang disembunyikan routing

Dua biaya yang tidak dicantumkan siapa pun pada entri glosarium adalah latensi dan akurasi, dan ada biaya ketiga yang lebih samar.

Latensi. Setiap permintaan yang dirutekan membayar pajak klasifikasi sebelum model bahkan mulai. Pengklasifikasi berbasis aturan berada di bawah satu milidetik; model embedding atau pengklasifikasi kecil menambah sekitar 50–200ms; pengklasifikasi domain terlatih lebih banyak. Router yang baik menyembunyikan sebagian besar ini dengan mengklasifikasikan sambil menyiapkan permintaan upstream, dan satu endpoint routing produksi mengukur overhead ujung-ke-ujung sekitar 55ms median — di bawah 1% dari waktu respons normal. Tetapi jika lalu lintas Anda real-time — agen suara, UI yang harus menjawab dalam 300ms — hop routing dalam ratusan milidetik dapat menjadi perbedaan antara dapat digunakan dan tidak. Batasan tunggal itu adalah alasan paling umum tim dengan kasus penggunaan routing yang sah memutuskan untuk tidak merutekan.

Akurasi. Sebuah router hanya sebagus penilaian yang digunakannya untuk merutekan. Sebuah pengklasifikasi yang dilatih pada benchmark umum bisa dengan percaya diri keliru tentang domain Anda: tugas peringkasan yang "mudah" bagi Anda mungkin mudah bagi model frontier dan mustahil bagi model murah. Mode kegagalannya senyap — pengguna hanya mendapatkan keluaran yang lebih buruk dan tidak ada yang mencatatnya — itulah sebabnya setiap router yang kredibel dilengkapi dengan lantai kualitas atau mode seimbang.

Invalidasi cache. Baik OpenAI maupun Anthropic mendiskon prefiks prompt yang berulang, biasanya sekitar 90% potongan token input saat membaca cache. Jika lapisan perutean Anda menulis ulang, mengubah urutan, atau menyuntikkan stempel waktu yang berubah-ubah ke dalam prompt, hal itu akan membatalkan prefiks tersebut dan membuang diskon itu. Router yang baik meneruskan prompt byte demi byte dan membiarkan caching milik penyedia bekerja.

Rekomendasinya: router terkelola dengan standar kualitas minimum.

Jika Anda menjalankan lebih dari satu model dalam produksi, lalu lintas Anda merupakan campuran dari yang mudah dan yang sulit, dan volume Anda cukup besar sehingga satu persen pun adalah uang nyata, maka rekomendasinya adalah router terkelola yang menjaga kualitas minimum dan tidak mengenakan markup pada token. Produk kami sendiri adalah OrcaRouter, dan itulah yang dapat kami bahas secara rinci; daftar periksa berikut berlaku untuk router mana pun yang Anda evaluasi.

Mode otomatis OrcaRouter — meminta nama model orcarouter/auto pada endpoint standar yang kompatibel dengan OpenAI — menilai setiap prompt dan merutekannya ke 200+ model. Ia menyertakan empat kebijakan perutean dengan Balanced sebagai default: Cheapest mengirim ke model dengan biaya terendah yang dapat menjawab; Balanced mengirim ke model termurah yang memenuhi standar kualitas; Quality mengirim ke model dengan skor tertinggi tanpa memandang harga; Adaptive belajar dari lalu lintas langsung Anda dan mengubah perutean seiring berjalannya waktu. Penilaian diukur dalam waktu kurang dari satu milidetik, total latensi tambahan tetap di bawah 50ms, dan jika penyedia yang dipilih melakukan rate-limit atau error, router melakukan failover di tengah aliran ke model yang sehat dalam waktu di bawah 50ms. Tidak ada markup di lapisan mana pun: Anda membayar setiap penyedia sesuai harga publikasi yang tepat — angka $0.09 atau $5.00 di atas adalah yang Anda bayar — dan perutean itu sendiri gratis.

Dalam hal akurasi, papan peringkat RouterArena Juni 2026 memberi skor OrcaRouter sebesar 75.5% dibandingkan alternatif terdekat yang dilacak sebesar 74.0% (menurut orcarouter.ai). Satu papan peringkat bukanlah bukti apa pun — anggap itu sebagai satu titik data dan jalankan evaluasi Anda sendiri pada prompt Anda sendiri sebelum mempercayakan lalu lintas produksi ke router mana pun, termasuk punya kami. Dan jika Anda mencoba memutuskan apakah Anda memerlukan fitur router atau fitur gateway sama sekali, perbedaan antara router dan gateway dijelaskan dalam panduan kami, AI API Gateway in 2026.

Saat rekomendasi ini salah

Skip list yang jujur, dinyatakan secara sederhana:

Versi singkatnya

Router LLM adalah lapisan yang memilih model mana yang menjawab setiap permintaan — murah dan cepat untuk mayoritas permintaan mudah, model frontier untuk minoritas sulit, dengan failover ketika penyedia layanan gagal. Ini akan menguntungkan ketika model-model Anda berbeda jauh dalam harga (DeepSeek V4 Flash seharga $0,09 dibanding Claude Opus 5 seharga $5,00 per 1 juta token input adalah selisih 55×) dan lalu lintas Anda merupakan campuran antara mudah dan sulit. Penelitian menempatkan batas atas penghematan sekitar 85% di belakang batas kualitas minimum, dan batas bawahnya adalah apa pun yang dikatakan eval Anda. Ini memakan latensi dan sebagian kendali akurasi, dan merupakan jawaban yang salah untuk toko model tunggal, anggaran latensi di bawah 300ms, pengeluaran kecil, serta tim yang tidak dapat mengukur kualitas keluaran. Ketika memang tepat, jalankan di belakang batas kualitas minimum tanpa markup token, arahkan sebagian lalu lintas terlebih dahulu, dan baca log routing sebelum Anda mempercayai penghematan tersebut.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube