Kimi K3

kimi/kimi-k3
Unggulan
VisiAlatJSONPenalaran
oleh MoonshotAI · 2026-07-15

Kimi K3 adalah model unggulan Moonshot AI dan rilis paling canggihnya hingga saat ini — model Mixture-of-Experts dengan 2,8 triliun parameter yang dibangun untuk pengkodean jangka panjang dan pekerjaan pengetahuan ujung-ke-ujung. Model ini menggabungkan jendela konteks 1M token dengan pemahaman visual asli, menerima input teks dan gambar dengan output teks, dan dirancang untuk tetap koheren di seluruh sesi agen yang sangat panjang. Moonshot memposisikan K3 untuk skenario agen pemrograman seperti Codex, Claude Code, Cline, dan RooCode, serta penalaran mendalam dan pekerjaan pengetahuan. Model ini mengekspos kontrol reasoning_effort tingkat atas dan pemanggilan alat asli, serta berbicara dalam format API OpenAI untuk integrasi langsung. Perhatikan bahwa K3 tidak menerima parameter sampling (no temperature / top_p / seed) — kedalaman penalaran dikendalikan melalui reasoning_effort sebagai gantinya.

ctx1M token
Masukantext + image
Keluarantext
p50 TTFT6.25 s
INPUT$3.00/ 1M token
OUTPUT$15.00/ 1M token
p50 TTFT6.25 s7h
p95 TTFT10.00 s7h
LALU LINTAS12237.0Mtoken / 7h

MoonshotAI Kimi K3 adalah model bahasa besar yang dikembangkan oleh MoonshotAI, sebuah perusahaan AI asal China. Model ini mendukung jendela konteks sebesar 1.048.576 token dan menerima input berupa…

Apa itu MoonshotAI Kimi K3?

Untuk siapa Kimi K3 dirancang?

Bagaimana Kimi K3 menangani input multimodal?

Kinerja seperti apa yang dapat diharapkan dari Kimi K3?

Contoh kode

Panggil dari SDK apa pun

Kompatibel OpenAI — pakai SDK Anda yang sekarang

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="kimi/kimi-k3",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parameter yang didukung

  • frequency_penalty
  • include_reasoning
  • max_tokens
  • presence_penalty
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • structured_outputs
  • tool_choice
  • tools

Harga

Input / 1M token$3.00
Output / 1M token$15.00
Baca cache / 1M$0.300
Mata uangUSD

Kalkulator biaya

Token / bulan10MM
Porsi input70%%
Perkiraan / bulan $66.00 · Dengan cache prompt $56.55

Perkiraan berdasarkan harga daftar

Estimator token & biaya

Token masukan: 17Biaya per permintaan: $0.007551

Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.

Performa

p50 TTFT
6.25 s
Kecepatan output
37.6 tok/s
p95 TTFT
10.00 s
Tingkat kesalahan
66.6%

Benchmark publik

76.2
AA Coding
Lebih baik dari 96% model yang dibandingkan
#6 dari 134
59.7
AA Intelligence
Lebih baik dari 94% model yang dibandingkan
#8 dari 136
GPQA Diamond
93.5
Humanity's Last Exam
46.9
Long-Context Recall
82.7
SciCode
58.7
tau_banking
46.0
terminalbench_v2_1
85.0
Sumber: artificialanalysis.ai

Perbincangan komunitas

Yang dibicarakan developer minggu ini

Hacker News4 sebutan · 7 hr

Perbandingan

Kimi K3kimi/kimi-k2.6Kimi K2.7 Codekimi/kimi-k2.5
Input $/M$3.00$0.95$0.95$0.60
Output $/M$15.00$4.00$4.00$3.00
Konteks1.0M262K262K262K
Kualitas9/108/108/107/10
Bandingkan berdampinganBandingkan berdampinganBandingkan berdampinganBandingkan berdampingan

FAQ

Berapa biaya untuk menggunakan Kimi K3?
Kimi K3 dibanderol seharga $3,00 per 1 juta token input dan $15,00 per 1 juta token output. Ini adalah tarif penyedia tanpa markup. Token input mencakup token teks dan gambar. Token output adalah token yang dihasilkan.
Berapa ukuran jendela konteks dari Kimi K3?
Kimi K3 memiliki jendela konteks sebanyak 1.048.576 token. Ini kira-kira setara dengan 1,5 juta kata bahasa Inggris atau 800.000 karakter bahasa Mandarin. Jendela ini dapat menangani dokumen yang sangat panjang atau riwayat yang ekstensif dalam satu permintaan.
Apa kelebihan utama Kimi K3?
Kekuatan utamanya adalah jendela konteks yang sangat besar dan dukungan multimodal (teks dan gambar). Unggul dalam tugas-tugas yang memerlukan pemrosesan urutan panjang, seperti analisis buku panjang, pemahaman basis kode yang ekstensif, dan penalaran multimodal di banyak gambar.
Bagaimana perbandingan Kimi K3 dengan GPT-4 Turbo?
Kimi K3 memiliki jendela konteks yang lebih besar (1M vs 128K) dan mendukung gambar dengan biaya lebih rendah per token. GPT-4 Turbo biasanya memiliki kinerja yang lebih kuat pada tolok ukur yang sempit. Pilihan terbaik tergantung pada kebutuhan panjang konteks dan ekspektasi kualitas tugas Anda.
Apakah OrcaRouter menyimpan atau melatih data saya saat menggunakan Kimi K3?
OrcaRouter tidak melatih data Anda. Prompt Anda diteruskan ke penyedia (MoonshotAI) untuk inferensi. Kebijakan penanganan data dari MoonshotAI berlaku. OrcaRouter dapat menyimpan log untuk tujuan operasional tetapi tidak menggunakan data pelanggan untuk peningkatan model.
Bagaimana cara memanggil Kimi K3 melalui API kompatibel OpenAI milik OrcaRouter?
Kirim permintaan ke https://api.orcarouter.ai/v1/chat/completions dengan ID model "kimi/kimi-k3". Gunakan format Chat Completions standar dengan array messages. Untuk gambar, gunakan tipe konten "image_url". Sertakan kunci API OrcaRouter Anda di header Authorization.
Berapa latensi yang diharapkan untuk Kimi K3?
Angka latensi yang tepat tidak diberikan. Karena model mendukung konteks yang sangat panjang, waktu pemrosesan meningkat seiring panjang input. Untuk input 1M-token, perkirakan latensi yang jauh lebih tinggi dibandingkan dengan input yang lebih pendek. Gunakan streaming untuk mendapatkan respons parsial lebih cepat.
Bisakah saya menggunakan Kimi K3 untuk aplikasi real-time?
Penggunaan secara real-time dimungkinkan tetapi latensi mungkin tinggi untuk konteks besar. Ini lebih cocok untuk pemrosesan batch offline seperti analisis dokumen. Untuk aplikasi interaktif, pertimbangkan untuk mengatur max_tokens kecil dan membatasi panjang input.
Format dan ukuran gambar apa yang didukung oleh Kimi K3?
Fakta yang diberikan tidak menyebutkan format gambar yang didukung atau resolusi maksimum. Dalam praktiknya, sebagian besar model multimodal menerima format umum seperti JPEG, PNG, dan WebP. Untuk hasil terbaik, gunakan gambar dengan resolusi sedang dan hindari file yang sangat besar untuk mengontrol biaya token.
Bagaimana cara memperkirakan penggunaan token untuk input tertentu?
OrcaRouter tidak menyediakan tokenizer, tetapi Anda dapat menggunakan API yang mengembalikan jumlah token atau memperkirakan dengan pustaka seperti tiktoken (untuk OpenAI) dengan hati-hati. Untuk gambar, asumsikan jumlah token tetap per gambar berdasarkan resolusi. Uji dengan contoh input untuk mengukur penggunaan sebenarnya.

Sematkan lencana ini

MoonshotAI: Kimi K3$3.00/M in6254ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/kimi/kimi-k3" target="_blank"> <img src="https://www.orcarouter.ai/embed/kimi/kimi-k3.svg" alt="MoonshotAI: Kimi K3 di OrcaRouter" /> </a>
Markdown [![MoonshotAI: Kimi K3](https://www.orcarouter.ai/embed/kimi/kimi-k3.svg)](https://www.orcarouter.ai/models/kimi/kimi-k3)

Kartu model sebagai data

GET /api/public/models/kimi/kimi-k3Buka