Kimi K3 adalah model unggulan Moonshot AI dan rilis paling canggihnya hingga saat ini — model Mixture-of-Experts dengan 2,8 triliun parameter yang dibangun untuk pengkodean jangka panjang dan pekerjaan pengetahuan ujung-ke-ujung. Model ini menggabungkan jendela konteks 1M token dengan pemahaman visual asli, menerima input teks dan gambar dengan output teks, dan dirancang untuk tetap koheren di seluruh sesi agen yang sangat panjang. Moonshot memposisikan K3 untuk skenario agen pemrograman seperti Codex, Claude Code, Cline, dan RooCode, serta penalaran mendalam dan pekerjaan pengetahuan. Model ini mengekspos kontrol reasoning_effort tingkat atas dan pemanggilan alat asli, serta berbicara dalam format API OpenAI untuk integrasi langsung. Perhatikan bahwa K3 tidak menerima parameter sampling (no temperature / top_p / seed) — kedalaman penalaran dikendalikan melalui reasoning_effort sebagai gantinya.
MoonshotAI Kimi K3 adalah model bahasa besar yang dikembangkan oleh MoonshotAI, sebuah perusahaan AI asal China. Model ini mendukung jendela konteks sebesar 1.048.576 token dan menerima input berupa…
Kemampuan utama Kimi K3 adalah memproses jendela konteks hingga 1.048.576 token, memungkinkannya untuk menyertakan seluruh novel, manual teknis yang panjang, atau riwayat percakapan ekstensif dalam satu perintah. Model ini juga menerima gambar, memungkinkan penalaran multimodal. Model ini dapat melakukan tugas-tugas seperti perangkuman, menjawab pertanyaan, dan pembuatan teks pada input yang sangat panjang. Ia mampu memahami instruksi kompleks dan mengikutinya dalam urutan yang panjang. Ia mendukung parameter API yang kompatibel dengan OpenAI seperti temperature, max_tokens, top_p, dan urutan stop melalui OrcaRouter.
Kimi K3 paling baik digunakan ketika tugas secara inheren memerlukan konteks yang sangat besar—misalnya, menganalisis dokumen sepanjang 1.000 halaman sekaligus, atau mempertahankan percakapan dengan riwayat lengkap ratusan pesan. Untuk masukan yang lebih pendek, biaya per token yang lebih tinggi ($3/$15 per juta) mungkin tidak sepadan. Model yang lebih murah dengan jendela konteks yang lebih kecil dapat menangani sebagian besar tugas tipikal dengan lebih efisien. Gunakan Kimi K3 hanya ketika tugas memerlukan jendela konteks penuh untuk menghindari pemotongan atau beberapa langkah potong-dan-rangkum.
Kimi K3 unggul dalam tugas-tugas di mana informasi tersebar di teks yang sangat panjang atau mencakup gambar. Contohnya termasuk mengekstrak fakta kunci dari laporan sepanjang buku, menjawab pertanyaan tentang basis kode lengkap, membandingkan beberapa makalah penelitian, atau menganalisis serangkaian diagram. Ia juga dapat mempertahankan konsistensi sepanjang dialog panjang. Kekuatannya terletak pada kemampuannya untuk memperhatikan semua bagian konteks secara bersamaan, sehingga mengurangi kebutuhan akan pencarian atau pemotongan eksternal.
Meskipun Kimi K3 memiliki jendela konteks yang besar, ia mungkin tidak selalu berkinerja sebaik model yang lebih kecil dan disetel dengan baik pada tugas-tugas yang sempit. Konteks yang besar juga dapat meningkatkan latensi dan biaya komputasi. Keterbatasan pasti (misalnya, resolusi gambar maksimum, jenis file yang didukung, kemahiran bahasa) tidak disebutkan dalam fakta yang diberikan tetapi melekat pada desain model. Pengguna harus sadar bahwa perintah yang sangat panjang menggunakan banyak token dan karenanya menimbulkan biaya yang lebih tinggi. Model diakses melalui OrcaRouter; waktu aktif penyedia dan waktu respons berlaku.
Fakta yang disediakan tidak mencakup skor tolok ukur spesifik untuk Kimi K3. Umumnya, model konteks besar dievaluasi pada tugas seperti uji Needle in a Haystack, QA dokumen panjang, dan peringkasan. MoonshotAI mungkin telah mempublikasikan hasil; pengguna harus berkonsultasi dengan dokumentasi resmi. Kinerja model pada tolok ukur NLP standar (misalnya, MMLU, GSM8K) tidak disebutkan. Kami merekomendasikan untuk menguji Kimi K3 pada set evaluasi Anda sendiri untuk mengukur efektivitasnya bagi kasus penggunaan Anda.
Jendela konteks 1.048.576 token berarti model dapat memproses sekitar 1,5 juta kata bahasa Inggris atau 800.000 karakter bahasa Mandarin dalam satu langkah. Dalam praktiknya, ini memungkinkan penanganan seluruh buku, log percakapan yang ekstensif, atau data multimodal dengan banyak gambar. Namun, tidak semua token mungkin dimanfaatkan secara merata; mekanisme perhatian terkadang lebih fokus pada bagian yang baru atau menonjol. Kemampuan model untuk mengambil informasi dari tengah-tengah konteks yang panjang dapat diuji. Kinerja pada tugas semacam itu seringkali lebih baik daripada model dengan konteks yang lebih kecil, tetapi mungkin masih memiliki ruang untuk perbaikan.
Latency dan throughput tidak disebutkan dalam fakta yang diberikan. Model dengan jendela konteks yang sangat besar umumnya membutuhkan waktu lebih lama untuk memproses setiap permintaan karena mekanisme attention berskala secara kuadrat dengan panjang sekuens. Untuk keluaran penuh 1M token, perkirakan latensi yang tinggi. Melalui OrcaRouter, Anda dapat mengatur max_tokens untuk membatasi panjang keluaran dan mengontrol waktu respons. Untuk aplikasi real-time, pertimbangkan menggunakan model yang lebih kecil. Pemrosesan batch untuk tugas yang lebih panjang mungkin lebih praktis. Kinerja aktual akan tergantung pada infrastruktur penyedia dan beban saat ini.
Kimi K3's large context window adalah kekuatan sekaligus tantangan. Model ini mungkin tidak seakurat model khusus dalam tugas yang memerlukan penalaran tepat pada input pendek. Kualitasnya mungkin lebih rendah di bidang seperti penulisan kreatif atau pembuatan kode dibandingkan dengan model yang disesuaikan untuk tugas-tugas tersebut. Selain itu, biaya per token relatif tinggi, sehingga menggunakannya untuk perintah pendek tidak efisien. Model ini masih relatif baru; stabilitas jangka panjang dan dukungan dari MoonshotAI merupakan faktor yang perlu dipertimbangkan.
Kimi K3 dibanderol dengan harga $3,00 per 1 juta token input dan $15,00 per 1 juta token output. Ini adalah tarif penyedia tanpa markup yang ditambahkan oleh OrcaRouter. Token input mencakup token teks dan gambar (gambar ditagih berdasarkan ekuivalen tokennya). Token output adalah token apa pun yang dihasilkan oleh model. Tidak ada biaya tambahan selain biaya per token. Harga dapat berubah oleh penyedia, tetapi OrcaRouter menyalurkan tarif tanpa menambahkan margin.
Karena Kimi K3 dapat menangani konteks yang sangat panjang, ia dapat menggantikan beberapa panggilan API yang diperlukan dengan model konteks yang lebih kecil, berpotensi mengurangi biaya keseluruhan untuk tugas-tugas yang memerlukan pemrosesan dokumen penuh. Namun, setiap token lebih mahal daripada banyak model kompak. Misalnya, input 1M-token seharga $3,00 adalah tetap, sementara model yang lebih kecil mungkin berharga $0,15 per juta tetapi memerlukan beberapa panggilan untuk memproses data yang sama. Pertukaran antara kesederhanaan dan biaya per token. Pengguna harus memperkirakan total penggunaan token per tugas.
Fakta yang diberikan tidak menyebutkan adanya caching atau diskon volume untuk Kimi K3 di OrcaRouter. Harga bersifat per-token sesuai tagihan penyedia. OrcaRouter mungkin menawarkan fitur seperti pencatatan permintaan atau percobaan ulang, tetapi tidak ada pengurangan harga spesifik yang disebutkan. Pengguna harus memeriksa harga terkini OrcaRouter untuk pembaruan. Secara umum, pengguna dengan volume tinggi dapat bernegosiasi langsung dengan penyedia, tetapi melalui OrcaRouter, tarif yang tercantum berlaku.
Gambar dikonversi menjadi token untuk keperluan penagihan. Tokenisasi gambar yang tepat bergantung pada resolusinya dan algoritma penyedia. Biasanya, gambar standar (misalnya, 1024x1024) mungkin memakan biaya sekitar ratusan token. Karena harga input Kimi K3 adalah $3,00 per 1 juta token, menyertakan gambar dalam prompt meningkatkan jumlah token input dan karenanya biaya. Untuk beban kerja dengan banyak gambar, total biaya dapat bertambah dengan cepat. Disarankan untuk memperkecil ukuran gambar atau hanya menyertakan gambar yang relevan untuk mengendalikan biaya.
Kimi K3 diakses melalui API yang kompatibel dengan OpenAI milik OrcaRouter. Anda mengirim permintaan HTTP POST ke https://api.orcarouter.ai/v1/chat/completions dengan parameter model diatur ke "kimi/kimi-k3". Format permintaan identik dengan API Chat Completions OpenAI: sertakan array messages dengan peran system, user, dan assistant. Untuk input gambar, gunakan array konten dengan tipe "image_url". Pastikan Anda memiliki kunci API dari OrcaRouter. Tidak diperlukan konfigurasi khusus; parameter standar seperti temperature, max_tokens, top_p, dan stop didukung.
Melalui OrcaRouter, Kimi K3 mendukung parameter yang kompatibel dengan OpenAI standar: temperature (default 0.7), max_tokens (hingga batas output model, yang tidak ditentukan tetapi kemungkinan kurang dari 32K), top_p, frequency_penalty, presence_penalty, stop sequences, dan n (jumlah completions). Model ini juga menerima parameter stream untuk output real-time. Untuk input gambar, Anda dapat menggunakan format konten multimodal. Parameter yang tidak didukung akan diabaikan. Jendela konteks yang besar memungkinkan pengaturan max_tokens yang tinggi untuk output panjang, tetapi perhatikan biaya.
Migrasi mudah dilakukan jika Anda sudah menggunakan API yang kompatibel dengan OpenAI. Ubah URL dasar menjadi https://api.orcarouter.ai/v1, perbarui ID model menjadi "kimi/kimi-k3", dan atur kunci API OrcaRouter Anda. Tidak perlu perubahan kode jika Anda menggunakan format pesan yang sama. Untuk dukungan gambar, pastikan prompt Anda menyertakan URL gambar atau data base64. Anda mungkin perlu menyesuaikan max_tokens dan parameter lainnya agar sesuai dengan kemampuan model. Uji dengan sampel kecil terlebih dahulu untuk memverifikasi kualitas dan biaya output.
Anda memerlukan kunci API dari OrcaRouter. Sertakan kunci tersebut dalam header Authorization sebagai Bearer YOUR_API_KEY. OrcaRouter mengelola autentikasi dan penagihan. Demi keamanan, jangan bagikan kunci Anda. OrcaRouter juga dapat mendukung rotasi kunci API. Tidak ada autentikasi tambahan yang diperlukan dari MoonshotAI. Semua permintaan melewati infrastruktur OrcaRouter, yang menangani pembatasan laju dan penanganan kesalahan. Pastikan permintaan Anda mematuhi persyaratan layanan OrcaRouter.
Kimi K3 menawarkan jendela konteks sebesar 1.048.576 token, yang termasuk salah satu yang terbesar yang tersedia. Ini sebanding dengan model dari penyedia lain yang juga mendukung konteks jutaan token. Harganya yang $3/$15 per juta token bersifat kompetitif. Tidak seperti beberapa model, Kimi K3 mendukung input multimodal (teks dan gambar). Pembeda utama adalah bahwa ini diakses melalui OrcaRouter tanpa markup. Jika dibandingkan dengan model seperti GPT-4 Turbo (konteks 128K, biaya lebih tinggi), Kimi K3 mungkin lebih murah untuk urutan yang sangat panjang tetapi mungkin memiliki profil kualitas yang berbeda. Perbandingan tolok ukur tidak disediakan.
Pilih Kimi K3 ketika tugas memerlukan jendela konteks besar penuh—misalnya, menganalisis dokumen 500 halaman dalam satu bagian, atau menyertakan banyak gambar dalam satu prompt. Model yang lebih murah dengan jendela konteks yang lebih kecil (mis., 128K token) mungkin memaksa Anda untuk memotong input, sehingga kehilangan referensi silang. Jika tugas dapat dipisah tanpa kehilangan kualitas, model yang lebih murah lebih disukai karena biaya per token yang lebih rendah. Juga pertimbangkan apakah kekuatan spesifik model (multimodal, konteks panjang) sangat penting.
Fakta yang diberikan hanya mencakup Kimi K3. MoonshotAI memiliki model sebelumnya seperti Kimi dan Kimi K2. Kimi K3 adalah yang terbaru dengan jendela konteks yang lebih besar dan dukungan multimodal. Model sebelumnya kemungkinan memiliki konteks yang lebih kecil dan mungkin tidak menerima gambar. Harga untuk model lain tidak diberikan. Bagi pengguna lama model-model MoonshotAI yang lebih lama, meningkatkan ke Kimi K3 menawarkan kemampuan yang lebih luas tetapi dengan biaya per token yang lebih tinggi. Keputusan tergantung pada apakah konteks yang lebih besar dan input gambar sepadan dengan premi yang dibayarkan.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Input / 1M token | $3.00 |
| Output / 1M token | $15.00 |
| Baca cache / 1M | $0.300 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/kimi/kimi-k3Buka @misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3