Inkling-Small-1
Guides & Insights

Inkling-Small: Model Seperempat Ukuran yang Mengalahkan Model Andalannya Sendiri, dan Masih Tertinggal dari Index

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Thinking Machines Lab menghabiskan dua minggu setelah merilis model open-weights pertamanya untuk membangun model yang seperempat ukurannya, dan pada papan skor lab itu sendiri, model yang lebih kecil menang. Inkling-Small melaporkan 80.2% pada SWE-bench Verified dibandingkan dengan Inkling yang mencapai 77.6%, 89.5% pada GPQA Diamond dibandingkan dengan 87.2%, 64.7% pada Terminal-Bench 2.1 dibandingkan dengan 63.8%, dan 31.6% pada Humanity's Last Exam dibandingkan dengan 29.7% — dari 276B total parameter dengan 12B aktif, bukan 975B dengan 41B. Dari angka-angka utama yang dimiliki bersama oleh kedua kartu model, model andalan 975B hanya unggul dalam satu: AIME 2026, dengan selisih 1.6 poin.

Kemudian Artificial Analysis menjalankan keduanya secara independen dan menempatkan Inkling-Small pada 40 dalam Intelligence Index-nya dibandingkan dengan Inkling yang 41 — model yang lebih kecil itu satu poin di belakang. Kedua hasil tersebut nyata, dan ruang di antara keduanya adalah hal yang paling berguna dalam peluncuran ini. Semua yang di bawah ini memisahkan apa yang dilaporkan Thinking Machines tentang modelnya sendiri dari apa yang diukur oleh pihak lain: angka dari vendor berasal dari pengumuman dan dua kartu model Hugging Face, angka independen dari hasil uji Artificial Analysis sendiri, serta angka harga dan konteks dari data endpoint langsung OpenRouter, yang diperiksa pada hari tulisan ini dibuat. Ketika ketiganya tidak sepakat — dan mereka memang tidak sepakat pada panjang konteks — kami mengatakannya daripada memilih angka yang menyanjung.

Apa yang sebenarnya dirilis pada 30 Juli

Inkling-Small adalah transformer sparse mixture-of-experts: total 276 miliar parameter, 12 miliar aktif per token, 42 lapisan, dengan setiap token dirutekan ke 6 dari 256 pakar ditambah 2 pakar bersama yang aktif pada semuanya. Atensi berselang-seling antara lapisan lokal dan global. Bobotnya tersedia di Hugging Face di bawah lisensi Apache 2.0 tanpa batasan komersial, model ini dapat disesuaikan (fine-tune) melalui Tinker API milik Thinking Machines, dan Anda dapat berinteraksi dengannya melalui teks, gambar, dan audio di Tinker Playground. Lab tersebut menyatakan bahwa model ini dilatih pada sistem NVIDIA GB300 NVL72.

Inkling-Small-2

Multimodalitas memang bawaan, bukan sekadar tempelan, dan kartunya luar biasa spesifik tentang caranya. Tidak ada encoder visi atau audio terpisah: audio masuk sebagai spektrogram dMel, gambar sebagai patch 40×40 piksel yang dilewatkan melalui hMLP empat lapis, dan keduanya langsung disematkan ke aliran token yang sama dengan teks. Input berupa teks, gambar, dan audio; outputnya hanya teks, yang perlu dinyatakan secara gamblang karena "multimodal" sering dibaca sebagai "bisa berbicara" — cukup sering hingga bisa membuat sore menjadi buruk. Upaya berpikir adalah kenop dengan lima pengaturan — minimal, rendah, sedang, tinggi, sangat tinggi — sehingga bobot yang sama dapat dijalankan secara hemat atau secara intensif.

Bagian menarik dari resep ini adalah pasca-pelatihan. Inkling-Small didistilasi secara on-policy dengan Inkling penuh sebagai gurunya, lalu diberikan sekitar dua minggu lagi pembelajaran penguatan yang ditingkatkan skalanya pada pengodean agentik. Urutan tersebut menjelaskan bentuk hasilnya: siswa tersebut mewarisi kompetensi umum gurunya, lalu mendapat pelatihan tambahan tepat pada sumbu yang kini membuatnya mengungguli gurunya.

Papan skor yang diterbitkan Thinking Machines

Benchmark vendor hanyalah pemasaran sampai ada yang mereproduksinya, jadi anggaplah bagian ini sebagai klaim lab, bukan sebagai hasil yang telah diverifikasi. Ini tetap merupakan kumpulan yang luas, dan keluasannya justru kurang menguntungkan bagi produk unggulan.

Inkling-Small-3

Di luar empat angka yang dibagikan, kartu tersebut melengkapi sisa gambaran — semua perolehan angka Thinking Machines sendiri:

Pekerjaan agentik — 1269 Elo pada GDPval-AA v2, sebuah tolok ukur tugas ekonomi realistis, bukan teka-teki.

Bagan dan dokumen — 77,4% pada CharXiv RQ, meningkat menjadi 81,3% ketika model diizinkan untuk menulis dan menjalankan Python. Lonjakan 3,9 poin tersebut merupakan petunjuk berguna bahwa akses alat memberi lebih banyak pada pekerjaan penalaran visual daripada rekayasa prompt.

Vision — 74.0% pada MMMU Pro, sedikit di atas 73.5% milik Inkling.

Audio — 90.1% VoiceBench dan 77.0% MMAU, keduanya sedikit di bawah 91.4% dan 77.2% milik flagship. Audio adalah salah satu dari dua bagian di mana penyusutan jelas mengorbankan sesuatu.

Keamanan — 98.4% StrongREJECT dan 96.9% pada prompt jinak FORTRESS, tetapi 71.6% pada FORTRESS adversarial dibanding 78.0% pada model unggulan. Itulah biaya lainnya: penurunan 6,4 poin dalam ketahanan adversarial, yang lebih penting daripada keuntungan pengodean apa pun jika model tersebut akan ditempatkan di belakang kotak teks publik.

Peramalan — Indeks Brier 61.3 ± 0.46 di ForecastBench tanpa akses pencarian, dan skor Brier 0.1238 ± 0.0086 di Prophet Arena. Bahkan sekadar mencantumkan batas kesalahan saja sudah lebih disiplin daripada kebanyakan postingan peluncuran.

Satu celah: kartu produk unggulan mencantumkan 54.3% pada SWE-bench Pro, versi yang lebih sulit dari SWE-bench Verified. Kartu Inkling-Small tidak melaporkan SWE-bench Pro. Mengingat betapa menonjolnya angka Verified ditampilkan, ketidakhadirannya itulah angka yang paling ingin kami lihat diisi.

Apa yang justru dikatakan oleh indeks independen

Artificial Analysis menempatkan Inkling-Small di angka 40 pada versi 4.1 Indeks Intelijen-nya, satu poin di bawah Inkling di angka 41. Indeks tersebut merupakan gabungan dari sembilan evaluasi — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, dan AA-LCR — dan daftar itu menjelaskan sebagian besar kontradiksi yang tampak. Hanya dua dari sembilan evaluasi yang tumpang tindih dengan tampilan penalaran di kartu Thinking Machines. Sisanya lebih berbobot pada penggunaan alat agentik, pengambilan konteks panjang, dan ketahanan terhadap halusinasi, dan sebuah model dapat memenangkan tolok ukur yang dipilih lab untuk dipublikasikan sambil kalah pada tolok ukur yang dipilih pihak ketiga untuk dijalankan. Tidak ada pihak yang berbohong; mereka mengukur hal yang berbeda.

Inkling-Small-4

Ada juga detail dalam cetakan kecil yang nilainya melebihi judul satu poin: Artificial Analysis mencantumkan entri unggulannya sebagai Inkling (xhigh) — pengaturan upaya berpikir tertingginya — sementara baris Inkling-Small tidak memiliki akhiran upaya. Jadi keunggulan satu poin dari model unggulan dicatat dengan kenop penalaran diputar penuh. Jika pencocokan upaya mengubah perbandingan itu sedikit saja, argumen terakhir untuk model yang lebih besar berdasarkan kapabilitas saja akan ikut hilang.

Dalam hal kecepatan dan biaya, data independennya sama sekali tidak mendekati, dan di sini ia memihak model kecil dengan selisih yang tidak dapat disampaikan oleh tabel tolok ukur mana pun:

Kecepatan output — 133 token per detik dibandingkan 80 untuk Inkling (xhigh). Artificial Analysis menempatkan Inkling-Small di peringkat #7 dari 101 model dalam kelasnya pada kecepatan, dengan median kelas 66.

Waktu hingga token pertama — 1.63s dibanding 1.84s. Keunggulan nyata namun kecil.

Harga gabungan per 1M token — $0.22 dibandingkan $0.72 pada pembobotan mereka. Kira-kira sepertiga biayanya, untuk satu poin indeks lebih rendah.

Intelligence rank — #15 of 101, against a class median score of 25. Comfortably above average, nowhere near the frontier.

Kata-kata — dan inilah masalahnya. Ia menghabiskan 130M token output untuk melewati indeks, dibandingkan dengan median 100M. Ringkasan Artificial Analysis sendiri menyebutnya "sangat cepat, namun agak bertele-tele." Ia berpikir sekitar 30% lebih banyak daripada biasanya, yang diam-diam menggerus sebagian diskon per token.

Catatan pembukuan kecil, karena siapa pun yang membandingkan sumber akan menemukannya: Artificial Analysis mencantumkan jumlah parameter sebagai 266B total, sementara pengumuman, kedua kartu model, dan OpenRouter semuanya menyebut 276B. Kami telah menggunakan 276B di seluruhnya. Itu tidak mengubah kesimpulan apa pun, tetapi ini adalah jenis perbedaan yang perlu diketahui sebelum Anda mengutip angka dalam dokumen desain.

Apa yang sebenarnya dapat Anda sewa hari ini, yang bukan seperti yang tertulis di lembar spesifikasi.

Kesenjangan antara pengumuman open-weights dan endpoint yang dapat digunakan adalah titik di mana sebagian besar liputan peluncuran berhenti memperhatikan. Thinking Machines mengiklankan jendela konteks hingga 1M token, dan Artificial Analysis juga mencantumkan 1M. Di OpenRouter, kedua penyedia yang saat ini melayani Inkling-Small membatasinya pada 524,288 token — setengah dari angka yang diiklankan. Itu bukanlah kontradiksi, melainkan perbedaan antara apa yang didukung arsitektur dan apa yang telah diterapkan di produksi. Sebagai perbandingan, Inkling andalan memang memiliki satu endpoint dengan 1.048.576 token penuh, meskipun endpoint yang sama membatasi completion hingga 32.768 token.

Sisa gambaran langsungnya, yang dibaca dari data endpoint OpenRouter:

Dua penyedia, dua harga — $0.45 per 1M input dan $1.20 per 1M output dari satu penyedia, $0.50 dan $1.20 dari penyedia lainnya. Artificial Analysis mencantumkan tarif pihak pertama Thinking Machines sendiri lebih rendah lagi, yaitu $0.30 dan $1.20, dengan input cache sebesar $0.06. Hosting pihak ketiga mengenakan biaya tambahan 50–67% untuk input dengan bobot yang sama.

Caching prompt — $0,10 per 1 juta token input yang di-cache melalui OpenRouter, dibandingkan $0,17 untuk model flagship.

Presisi numerik yang Anda sewa bukanlah presisi numerik yang di-benchmark — kartu model mencantumkan BF16 dan NVFP4. Endpoint yang lebih murah menyajikan fp8; endpoint yang lain tidak mendeklarasikan kuantisasi sama sekali. Skor benchmark vendor tidak diukur pada penyajian fp8 dari bobot-bobot ini, dan efek kuantisasi pada proses agentik yang panjang justru merupakan hal yang tidak akan mampu ditahan oleh margin Terminal-Bench 0,9 poin. Jika Anda mereproduksi sebuah angka, sebutkan endpoint mana yang Anda gunakan.

Cakupan fitur tidak merata antar penyedia — kedua endpoint mengekspos reasoning dan reasoning_effort, sehingga dial pemikiran lima tingkat berfungsi. Namun hanya satu yang mengiklankan tool calling dan logprobs, dan saat ini tidak ada yang mengiklankan response_format, parameter mode JSON/structured-output. Inkling andalan memiliki endpoint yang mendukungnya. Jika pipeline Anda bergantung pada JSON dengan skema ketat, inilah detail yang akan menggigit di hari pertama, dan ini adalah keterbatasan penyedia, bukan keterbatasan model.

Batas atas penyelesaian — 262.144 token pada endpoint fp8; yang lainnya menyatakan tanpa batas.

Kasus biaya, berdasarkan jumlah token yang terukur

Harga per juta adalah cara yang buruk untuk membandingkan model penalaran, karena variabel utamanya adalah berapa banyak token yang mereka habiskan untuk berpikir. Artificial Analysis menerbitkan pengeluaran aktual, yang merupakan instrumen yang jauh lebih baik: menjalankan Inkling-Small melalui Intelligence Index lengkap menghabiskan sekitar 130M token keluaran dan biayanya $192.37, yang berarti sekitar $0.07 per tugas pada rata-rata tertimbang mereka.

Bandingkan itu dengan pengukuran yang sama untuk model yang sebenarnya digunakan orang: DeepSeek V4 Flash seharga $0.03 per tugas, gpt-oss-120b seharga $0.08, Gemini 3.6 Flash seharga $0.56, GLM-5.2 seharga $0.57, Kimi K3 seharga $0.86, GPT-5.6 Sol seharga $1.23, Claude Opus 5 seharga $2.34, Claude Fable 5 seharga $3.15. Inkling-Small adalah model termurah kedua dalam grup tersebut dan sekitar 18× lebih murah per tugas dibandingkan GPT-5.6 Sol, yang skornya 59 berbanding 40.

Ada juga cara yang lebih sederhana untuk melihat mengapa harga turun di titik tersebut. Parameter aktif turun dari 41B menjadi 12B, faktor 3,4. Harga output turun dari $4,05 menjadi $1,20 per juta, faktor 3,375. Harga sewa sparse MoE pada dasarnya hanyalah komputasi per token-nya, dan Thinking Machines menetapkan harga sesuai dengan itu, bukan berdasarkan benchmark.

Satu catatan praktis jika Anda menjalankan perbandingan itu sendiri: Inkling-Small saat ini tidak ada dalam katalog OrcaRouter, jadi Anda akan menyewanya dari endpoint-nya sendiri. Model tertutup yang akan Anda bandingkan dengannya — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash, dan lainnya dalam daftar itu — berada di OrcaRouter di balik satu kunci di markup 0%, yang berarti Anda membayar harga daftar setiap penyedia tanpa biaya tambahan. Hal itu penting khususnya untuk model biaya: angka yang Anda masukkan ke spreadsheet adalah angka yang ditagihkan, dan ketika penyedia memangkas harga, itu berlaku di sisi kami pada hari yang sama, bukan setelah negosiasi ulang. Failover otomatis antarpenyedia mencakup separuh lain dari evaluasi, yaitu lengan baseline yang mati di tengah proses dan diam-diam meracuni angka Anda.

Di mana sebenarnya posisinya di antara model-model open-weight

Dibandingkan dengan produk unggulan, Inkling-Small tampak seperti sebuah kemenangan. Dibandingkan dengan para kompetitornya, ia tampak seperti model open-weights papan tengah yang solid, dan liputan peluncurannya sebagian besar melewatkan pembacaan kedua.

Pada Artificial Analysis Intelligence Index, model-model yang berada di depan kedua Inklings termasuk Claude Opus 5 dengan 61, Claude Fable 5 dengan 60, GPT-5.6 Sol dengan 59, Kimi K3 dengan 57, Grok 4.5 dengan 54, GLM-5.2 dan Muse Spark 1.1 dengan 51, serta Gemini 3.6 Flash dengan 50. Itu sudah diduga — itu adalah sistem-sistem terdepan, sebagian besar tertutup, dan beberapa di antaranya sangat besar.

Yang seharusnya benar-benar mengubah keputusan adalah DeepSeek V4 Flash, yang mencetak 50 berbanding 40 milik Inkling-Small pada total 284B dan 13B aktif — praktis kelas ukuran yang sama dan tawaran open-weights yang sama, dengan biaya kurang dari setengah per tugas. Jika yang Anda inginkan adalah model open-weight mumpuni termurah, angka-angka independen menunjuk ke sana, bukan ke sini. Model ini juga, tidak seperti Inkling-Small, tersedia melalui OrcaRouter, sehingga menguji alternatif tersebut terhadap beban kerja Anda sendiri hanyalah perubahan string model, bukan proses pengadaan.

Apa yang dimiliki Inkling-Small tetapi tidak dimiliki DeepSeek V4 Flash adalah input audio dan gambar native dalam bobot yang sama, dial pemikiran lima tingkat, dan fine-tuning Tinker dari lab yang melatihnya. Itu semua adalah pembeda nyata untuk agen multimodal, dan itulah alasan jujur untuk memilihnya — bukan skor indeks.

Siapa yang harus pindah, dan siapa yang harus tetap tinggal

Keputusan tersebut terbagi dengan rapi, yang cukup tidak biasa untuk layak dinyatakan demikian.

Move from Inkling to Inkling-Small if you are running coding agents. The vendor numbers favour the small model on SWE-bench Verified and Terminal-Bench, the extra agentic RL is the documented reason, and it costs about a third as much and returns tokens 1.66× faster. Paying 3.3× for one index point measured at maximum thinking effort is a hard case to make.

Pilih jika biaya per tugas penalaran adalah kendala yang mengikat dan Anda bisa menerima skor 40 pada indeks. $0,07 per tugas dengan tarif cache-hit $0,06 per juta pada endpoint first-party adalah penetapan harga yang agresif untuk model dengan audio dan visi native.

Pindahlah jika Anda melakukan fine-tuning. Model 276B/12B jauh lebih murah untuk diadaptasi dan dilayani daripada 975B/41B, dan Tinker mendukung keduanya.

Tetap gunakan Inkling jika Anda membutuhkan audio berdurasi panjang. Ini adalah kemunduran paling tajam dalam rilis ini dan tersembunyi di kartu model: model unggulan merekomendasikan input audio di bawah 20 menit, sedangkan kartu Inkling-Small merekomendasikan di bawah 2 menit. Pemangkasan sepuluh kali lipat. Jika Anda melakukan transkripsi atau penalaran atas rapat-rapat, model kecil ini bukan pengganti langsung dengan harga berapa pun.

Tetaplah jika Anda memerlukan konteks melebihi 512K dari endpoint yang dihosting, atau hasil generasi yang lebih panjang dari 262K token. Saat ini hanya model unggulan yang memiliki endpoint yang melayani satu juta token penuh.

Tetaplah jika Anda memerlukan JSON dengan skema yang ditegakkan tanpa menulis loop validasi dan percobaan ulang sendiri, sampai penyedia menyediakan response_format untuk model kecil.

Pertahankan jika ketahanan adversarial bersifat fundamental. 71,6% berbanding 78,0% pada FORTRESS adversarial adalah arah yang salah untuk apa pun yang dihadapi pengguna, dan itu adalah angka milik lab itu sendiri.

Tiga pertanyaan yang masih terbuka dari liputan peluncuran

Apakah Inkling-Small hanyalah Inkling yang didestilasi?

Sebagian, dan bagian yang tidak terwarisi itulah yang penting. Distilasi on-policy dengan Inkling sebagai pengajar adalah satu tahap pasca-pelatihan, jadi banyak kemampuan umum yang benar-benar diwarisi. Tetapi ini adalah model dengan arsitektur terpisah — 42 lapisan berbanding 66 milik model andalan, dengan topologi perutean yang sama, yaitu 6 pakar aktif dari 256 ditambah 2 pakar bersama, yang berarti para pakarnya lebih sempit, bukan lebih sedikit. Dan model ini menerima sekitar dua minggu RL pengodean agenik yang tidak pernah diterima oleh pengajarnya. Tahap terakhir itulah mengapa murid hasil distilasi mengungguli pengajarnya pada tolok ukur pengodean, yang seharusnya tidak terjadi.

Apakah realistis bagi saya untuk melakukan self-host?

Hanya pada perangkat keras yang serius. 276B parameter kira-kira 276GB bobot pada 8-bit dan sekitar 552GB pada BF16, sebelum cache KV apa pun — node multi-GPU bagaimanapun juga, bukan workstation. Keuntungan dari sparse MoE adalah biaya inferensi, bukan jejak memori; Anda menyimpan semua 276B dan menghitung dengan 12B. Kartu tersebut menyebutkan SGLang, vLLM, TokenSpeed, Unsloth, dan Hugging Face Transformers sebagai jalur penyajian yang didukung dan mendaftarkan numerik BF16 dan NVFP4. Perhatikan juga bahwa kedua endpoint yang di-hosting saat ini menyajikan versi terkuantisasi, jadi "model yang sama" yang di-host sendiri pada BF16 tidak akan berperilaku identik dengan API yang Anda uji.

Apakah 975B Inkling masih memiliki alasan untuk tetap ada?

Tiga, dan semuanya sempit: konteks 1M-token penuh yang dilayani, input audio lebih dari dua menit, dan perilaku keamanan adversarial yang lebih baik. Perlu dicatat, "ia lebih pintar" tidak dengan yakin ada dalam daftar itu — satu poin indeks pada upaya berpikir maksimum, melawan serangkaian tolok ukur vendor yang sebagian besar dimenangkan model yang lebih kecil, bukanlah argumen kapabilitas. Dua minggu setelah meluncurkan flagship 975B, Thinking Machines merilis model yang membuatnya sulit untuk direkomendasikan. Itu adalah keterusterangan yang tidak biasa atau kecepatan yang tidak biasa, dan bagaimanapun juga itu adalah pertanda baik tentang lab tersebut.

Tontonan Berikutnya

Tiga hal akan menentukan bagaimana rilis ini menua. Apakah sebuah endpoint muncul melayani konteks 1M yang diiklankan, yang akan menghilangkan keunggulan paling jelas yang tersisa dari model unggulan tersebut. Apakah ada yang mempublikasikan perbandingan independen yang setara upayanya antara kedua model, yang merupakan satu-satunya cara untuk mengetahui apakah poin indeks itu nyata. Dan apakah rekomendasi audio 2 menit merupakan keterbatasan pelatihan atau default penyajian — karena jika itu yang terakhir, alasan terbesar untuk tetap menggunakan model yang lebih besar akan lenyap. Sampai saat itu, ringkasan yang jujur adalah bahwa Thinking Machines mengirimkan model yang harganya sepertiga, dua pertiga lebih cepat, lebih baik dalam pengkodean berdasarkan buktinya sendiri, sedikit tertinggal dalam skor agregat independen, dan jelas tertinggal dari pesaing seukuran yang sebagian besar liputan tidak menyebutkan.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube