Kartu hero berjudul Claude Sonnet 5.5 vs Kimi K3, dengan subjudul tidak ada model yang akan menerima pengaturan temperature Anda, dengan pil bertuliskan $2 / $10 tertutup vs $3 / $15 bobot terbuka, Indeks 56 vs 44, dan keduanya tidak menerima temperature, serta footer yang mengutip Artificial Analysis v4.3.2 dan harga vendor.
Guides & Insights

Claude Sonnet 5.5 vs Kimi K3: Tidak Ada Model yang Akan Menerima Pengaturan Temperature Anda

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Berikut adalah perbandingan di mana kedua model sepakat tentang sesuatu yang akan merusak kode Anda, apa pun pilihan Anda. Claude Sonnet 5.5, yang dirilis pada 28 September 2026, menolak setiap permintaan yang menetapkan temperature, top_p atau top_k ke nilai non-default dengan error 400. Kimi K3, tersedia secara umum dari Moonshot AI sejak pertengahan Juli 2026, tidak menerima parameter sampling sama sekali — tidak ada temperature, tidak ada top_p, tidak ada seed — dan hanya mengekspos kedalaman penalaran melalui reasoning_effort kontrol. Dua laboratorium berbeda, dua arsitektur berbeda, satu kesimpulan yang sama: kenop sampling yang masih biasa diatur oleh sebagian besar integrasi karena kebiasaan sudah hilang di keduanya.

Itu bukan perbandingan yang ditulis orang. Perbandingan yang semua orang tulis adalah harga: Kimi K3 dengan $3 per juta token input dan $15 output versus Claude Sonnet 5.5 dengan $2 dan $10, yang merupakan kemenangan jelas bagi Anthro​pic di daftar tarif. Namun Kimi K3 adalah model mixture-of-experts open-weight dengan 2,8 triliun parameter yang dapat Anda unduh dan jalankan di dalam batas Anda sendiri, dan Claude Sonnet 5.5 adalah model tertutup yang tersedia di empat cloud. Antara model tertutup yang lebih murah dan model yang dapat diunduh yang lebih mahal, keputusannya sama sekali tidak dibuat berdasarkan harga per token.

Apa masing-masingnya, dalam satu paragraf masing-masing.

Claude Sonnet 5.5 adalah model kedua dalam generasi 5.5 Anthropic, menyusul Claude Opus 5.5 ke Claude API lima hari setelah peluncuran itu. Model ini tersedia sebagai claude-sonnet-5-5 di seluruh Claude API, Amazon Bedrock, Google Cloud, dan Microsoft Foundry, mempertahankan jendela konteks 1M token dan batas keluaran sinkron 128K, serta mempertahankan harga Claude Sonnet 5 secara persis: $2 input, $10 output, $0,20 per juta untuk pembacaan cache. Pemikiran adaptif aktif secara default pada tinggi. Model ini tersedia dengan retensi data nol, dan Artificial Analysis memberinya Intelligence Index 56 pada revisi v4.3.2 — peringkat ketiga dari 216 model yang diukurnya.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Kimi K3 adalah model unggulan Moonshot AI: model mixture-of-experts berparameter 2,8 triliun yang mengaktifkan sekitar 104 miliar parameter per token, dengan jendela konteks 1 juta token dan pemahaman visual native. Model ini dibuat untuk pengodean jangka panjang dan kerja pengetahuan bertahap, dan Moonshot memposisikannya secara eksplisit untuk harness agen pemrograman. Model ini berbicara dalam format OpenAI API, mengekspos reasoning_effort sebagai satu-satunya kontrol penalarannya, dan berbobot terbuka di bawah Lisensi Kimi K3 — yang bukan hal yang sama dengan sumber terbuka, dan perbedaannya adalah bagian yang perlu dibaca sebelum Anda membangun di atasnya.

Kartu tarif, dan angka di bawahnya.

Sejajarkan keduanya pada dimensi yang menentukan sebuah RUU, bukan judul berita:

• Harga input — Claude Sonnet 5.5 $2 per juta vs Kimi K3 $3 per juta

• Harga output — Claude Sonnet 5.5 $10 per juta vs Kimi K3 $15 per juta

• Pembacaan cache — $0.20 per juta vs $0.30 per juta

• Jendela konteks — 1.000.000 token vs 1.048.576 token

• Bobot — proprietari, empat platform yang dihosting vs open-weight di bawah Lisensi Kimi K3

• Indeks Kecerdasan — Claude Sonnet 5.5 56 vs Kimi K3 44 pada revisi v4.3.2 yang sama

• Biaya per tugas Intelligence Index — Claude Sonnet 5.5 $7.60 vs Kimi K3 $2.00

• Verbositas pada Index — Claude Sonnet 5.5 410M token keluaran vs Kimi K3 160M

Pasangan terakhir itu adalah pembalikan yang layak direnungkan. Model Anthropic 50% lebih murah untuk input dan sepertiga lebih murah untuk output, tetapi tetap memakan biaya 3,8 kali lebih besar untuk menyelesaikan evaluasi yang sama, karena menghabiskan 2,6 kali token untuk mencapainya. Pada skor komposit, model itu juga mencetak skor dua belas poin lebih tinggi, jadi ini bukan kasus model boros yang tidak mendapatkan apa pun. Ini adalah kasus dua model yang perilaku biayanya tidak dapat dibandingkan hanya dengan membaca dua kartu tarif, itulah sebabnya angka tugas indeks ada.

Tidak satu pun dari jumlah token tersebut akan menjadi jumlah token Anda. Dokumentasi Moonshot sendiri mencatat bahwa kedalaman penalaran K3 diatur oleh reasoning_effort bukan melalui sampling, dan hal yang sama secara efektif berlaku untuk parameter effort Claude Sonnet 5.5 — jadi pada kedua model, tuas tunggal terbesar pada tagihan Anda adalah pengaturan effort, bukan negosiasi harga.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

Error 400, secara rinci

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

Penolakan bersama terhadap parameter sampling adalah tumpang tindih yang paling praktis di sini, karena itulah kegagalan yang muncul keesokan paginya setelah model ditukar.

Pada Claude Sonnet 5.5, aturannya eksplisit dan tidak kenal ampun. Nilai non-default untuk temperature, top_p atau top_k mengembalikan 400. Mengirim thinking: {"type": "disabled"} mengembalikan 400 yang menunjuk ke between_tools, pengaturan thinking terendah yang baru, yang diterima pada effort low, medium, dan high tetapi ditolak pada xhigh atau max. Penggunaan alat secara paksa — tool_choice yang diatur ke "any" atau ke alat bernama — mengembalikan 400 dengan pesan "tool_choice: type \"tool\" and \"any\" are not supported for this model", dan solusinya adalah auto plus penggunaan alat yang ketat atau output terstruktur. Terlebih lagi: blok thinking sekarang terikat pada model dan akun yang menghasilkannya, sehingga percakapan dapat dipindahkan dari Claude Sonnet 5 ke Sonnet 5.5 dengan penalarannya tetap utuh tetapi tidak dapat membawa penalaran itu ke keluarga model yang berbeda, dan prefiks yang diedit dapat mengubah replay menjadi 400.

Pada Kimi K3, permukaannya lebih kecil tetapi konsekuensinya serupa. Tidak ada parameter sampling untuk dikirim, jadi klien mana pun yang meng-hard-code salah satunya sudah mengirim parameter yang tidak dibaca oleh model. Kedalaman penalaran adalah bidang reasoning_effort tingkat atas sebagai gantinya.

Kedua perubahan mengarah ke arah yang sama: pendekatan kenop deterministik untuk mengendalikan prompt kini digantikan oleh dial effort di sisi model. Pipeline apa pun yang menala dirinya dengan temperature 0,2 dan seed tetap harus ditata ulang berdasarkan tingkat effort pada kedua model ini, dan penataan ulang itulah migrasinya.

Apa yang sebenarnya Anda dapatkan dari open weights di sini

Alasan untuk mempertimbangkan Kimi K3 dibandingkan model tertutup yang lebih murah dan berskor lebih tinggi bukanlah kemampuan dan bukan pula harga. Melainkan batasnya.

Menjalankan K3 di dalam infrastruktur Anda sendiri berarti prompt, dokumen, dan output tidak pernah meninggalkan jaringan yang Anda kendalikan, yang merupakan pembahasan kepatuhan yang berbeda dari perjanjian retensi nol data dengan vendor. Ini juga berarti model tidak dapat dipensiunkan secara sepihak tanpa bisa Anda cegah — Claude Sonnet 5.5 disertai komitmen pensiun dari Anthropic tidak lebih cepat dari 28 September 2027, sedangkan checkpoint yang diunduh tidak memiliki tanggal semacam itu. Dan ini berarti kurva biaya marjinal menjadi datar: setelah perangkat keras, token gratis, dan itulah satu-satunya struktur di mana model dengan 2,8 triliun parameter bisa menjadi opsi murah.

Lisensi itulah yang sebenarnya Anda tanda tangani. Kimi K3 bersifat open-weight, bukan open-source, dan Moonshot tidak menggunakan istilah yang terakhir. Lisensi Kimi K3 luas untuk sebagian besar penggunaan, tetapi bisnis model-as-a-service yang berada di atas ambang pendapatan bergulir memerlukan perjanjian komersial terpisah, dan produk yang melampaui ambang pengguna atau pendapatan yang besar harus menampilkan atribusi "Kimi K3". Menyebutnya berlisensi MIT adalah ketidakakuratan era K2 yang masih beredar. Jika Anda berencana membangun di atas bobot model alih-alih memanggil API, ini adalah tinjauan hukum, bukan sekadar catatan kaki.

Dan bobotnya cukup besar sehingga hosting mandiri merupakan keputusan modal. MoE berparameter 2,8T dengan sekitar 104B parameter aktif bukanlah penerapan server tunggal, dan upaya yang diperlukan untuk menyiapkannya adalah biaya sebenarnya dari opsi ini — biaya yang jauh lebih besar daripada perbedaan $5 per juta dalam tarif output.

Di mana OrcaRouter cocok

Sebagian besar tim yang mengevaluasi keduanya tidak ingin memilih antara API terkelola dan pengadaan perangkat keras. Mereka ingin merutekan.

OrcaRouter adalah satu endpoint yang kompatibel dengan OpenAI untuk lebih dari 200 model, dengan harga daftar penyedia yang diteruskan dan tanpa markup, sehingga perubahan tarif vendor di sisi mana pun berlaku pada hari yang sama, bukan pada siklus invoice berikutnya. Kimi K3 telah ada dalam katalog sejak Juli dengan harga $3 / $15 milik Moonshot sendiri, dengan waktu token pertama p50 terukur sekitar delapan detik dan sekitar 371,9 juta token melewatinya dalam sepekan terakhir. Claude Sonnet 5 — model yang masih digunakan oleh sebagian besar lalu lintas Claude API, dengan kecepatan terukur 150 token output per detik — telah dapat dirutekan sejak 30 Juni dengan harga $2 / $10 milik Anthropic.

Claude Sonnet 5.5 belum ada di katalog kami. Jika memang demikian, katakan saja dan carilah jalan lain: API milik vendor sendiri adalah cara mengaksesnya, dan cara mengujinya tanpa berkomitmen adalah persentase trafik di balik failover otomatis, dengan Claude Sonnet 5 atau Kimi K3 sebagai fallbackJika alasan Anda melihat K3 adalah batasannya, bukan tarifnya, bobotnya dapat diunduh hari ini dan API-nya hanyalah solusi sementara — yang merupakan keputusan tentang infrastruktur Anda, bukan tentang perbandingan model.

Kesimpulannya, dibagi berdasarkan apa yang sebenarnya Anda beli

Pilih Claude Sonnet 5.5 ketika pekerjaannya berkonteks panjang dan berat keluaran, ketika yang dibeli adalah dua belas poin indeks komposit, dan ketika API terkelola dengan retensi data nol lolos tinjauan Anda. Anggarkan untuk kebiasaan token — 410M token pada Index dibandingkan 160M milik K3 adalah pengganda yang nyata — dan anggarkan sehari untuk perubahan tool-use dan thinking-block.

Pilih Kimi K3 ketika batas menjadi persyaratannya, ketika Anda menginginkan checkpoint yang tidak dapat dipensiunkan oleh vendor mana pun, atau ketika beban kerja Anda adalah pengodean agentic bervolume tinggi, tempat $2,00 per tugas indeks dibandingkan $7,60 terus berlipat. Terimalah bahwa ini adalah model 2,8T parameter untuk dihosting, bahwa lisensinya memiliki klausul atribusi dan pendapatan, dan bahwa skornya berada di bawah tingkatan Anthropic pada komposit.

Yang tidak bisa dihindari oleh pilihan mana pun adalah paragraf pertama: parameter sampling sudah hilang pada keduanya, dan tombol effort adalah kontrol yang menggantikannya. Apa pun dari kedua pilihan ini yang Anda pilih, itulah perubahan yang dibutuhkan kode Anda.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari