
Tinjauan Model AI Inkling: Model Open-Weights Pertama dari Thinking Machines, Diuji dan Dijelaskan
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1653Kecerdasan69Koding60Matematika
Ini Ulasan model Inkling AI mengamati secara mendalam rilis debut dari Thinking Machines Lab, startup yang dipimpin oleh mantan CTO OpenAI, Mira Murati. Inkling adalah model multimodal Mixture-of-Experts (MoE) dengan bobot terbuka, jendela konteks 1 juta token, dan kenop "upaya berpikir" yang dapat dikontrol. Model ini cepat, murah untuk di-host sendiri, dan dibangun untuk kustomisasi daripada dominasi papan peringkat. Di bawah ini, kami memisahkan tolok ukur yang dilaporkan sendiri oleh vendor dari pengukuran independen, membahas arsitekturnya, menunjukkan cara menjalankannya, dan menjelaskan secara tepat siapa yang seharusnya (dan tidak seharusnya) mengadopsinya.
Per: 2026-07-16 — satu hari setelah peluncuran. Ini adalah tinjauan berbasis riset; belum ada pengujian jangka panjang langsung untuk model baru mana pun, dan kami menandai setiap angka yang belum terverifikasi di bawah ini.
Sebuah catatan untuk pembangun: jika Anda ingin mencoba Inkling bersama model-model lain, OrcaRouter menyediakan model yang tersedia melalui API dengan satu titik akhir yang kompatibel dengan OpenAI, sehingga Anda dapat membandingkan dan beralih tanpa integrasi baru.
- TL;DR verdict:Inkling adalah model terbuka yang benar-benar cakap dan efisien, yang unggul dalam fine-tuning dan penerapan yang sensitif terhadap biaya, namun bukan pemimpin frontier dan pembuatnya mengatakannya secara terbuka. Jika Anda menginginkan basis yang dapat disesuaikan dan bebas royalti dengan jendela konteks yang sangat besar, ini adalah salah satu peluncuran paling menarik tahun 2026. Jika Anda menginginkan model tunggal terkuat yang tersedia, carilah di tempat lain.
- Apa itu: Model penalaran MoE dengan bobot terbuka (Apache 2.0). Untuk siapa: Praktisi yang ingin melakukan fine-tuning dan self-hosting daripada membayar API frontier tertutup.
Poin-poin penting
Pembuat & tanggal: Thinking Machines Lab; dirilis pada 15 Juli 2026 sebagai model pertama lab tersebut.
Arsitektur: Sparse MoE, 975B total / 41B parameter aktif, 66 lapisan, hingga konteks 1M token dalam bobot (256K melalui API yang dihosting).
Lisensi: Apache 2.0 — bobot penuh di Hugging Face, gratis untuk penggunaan komersial dan hosting mandiri.
Posisi yang jujur: Perusahaan secara terus terang menyatakan bahwa model tersebut “bukan model terkuat yang tersedia saat ini, baik tertutup maupun terbuka.”
Skor independen: 41/100 pada Artificial Analysis Intelligence Index — #10 dari 97 model, dan di depan beberapa rekan terbuka (lihat rekonsiliasi di bawah).
Biaya: Bobot bebas royalti untuk dihosting sendiri; akses yang dihosting mulai sekitar $1.87 / 1M token masukan.
Peringatan: Hampir semua tolok ukur utama dilaporkan sendiri oleh vendor dan tidak diaudit secara independen.
Siapa di balik Inkling
- Kotak Pendiri.Inkling adalah model pertama dari Thinking Machines Lab (thinkingmachines.ai), didirikan oleh Mira Murati, sebelumnya Chief Technology Officer di OpenAI. Laboratorium beroperasi secara relatif rahasia sebelum peluncuran ini dan telah mengambil sikap open-weights yang kontras dengan pendekatan closed-flagship dari mantan majikan Murati. Thinking Machines melakukan tidak memonetisasi model itu sendiri — pendapatan mengalir melalui Tinker platform fine-tuning dan mitra hosting pihak ketiga. Model bisnis itu penting untuk memahami Inkling: bobotnya adalah jalur masuk gratis, dan perusahaan mendapatkan keuntungan saat Anda menyesuaikan atau menskalakan.
Apa itu Inkling?
Inkling adalah model bahasa dan penalaran besar dengan bobot terbuka, multimodal, Mixture-of-Experts, yang diumumkan oleh Thinking Machines Lab pada 15 Juli 2026 dan dirilis di bawah lisensi permisif Apache 2.0 lisensi dengan bobot penuh di Hugging Face.
Yang membuat peluncuran ini menonjol adalah cara penyajiannya. Alih-alih mengklaim mahkota terdepan, Thinking Machines menggambarkan Inkling sebagai model terbuka yang serbaguna, efisien, dan dapat disesuaikan. Dalam pengakuan yang sangat jujur untuk hari peluncuran, perusahaan menyatakan bahwa Inkling“bukan model terkuat yang tersedia saat ini, baik yang tertutup maupun terbuka.” Kejujuran itu menetapkan nada untuk seluruh ulasan ini: Inkling adalah alat yang dirancang untuk diadaptasi, dihosting sendiri, dan di-fine-tune, bukan trofi tolok ukur.
Liputan dari Fortune dan TechCrunch menggemakan pembacaan ini. TechCrunch berpendapat Inkling tidak mengancam OpenAI, Anthropic, atau Google di tingkat frontier, tetapi justru menekan lapisan tengah penyedia hosting bobot terbuka dan platform fine-tuning. Forbes membingkai strategi bobot terbuka Murati sebagai lebih dekat ke buku pedoman model terbuka China (DeepSeek, Qwen, Kimi) daripada ke andalan tertutup AS — narasi bobot terbuka AS versus China yang mengalir di sebagian besar komentar peluncuran.
Arsitektur dan spesifikasi
Di balik layar, Inkling adalah transformer sparse Mixture-of-Experts. Hanya sebagian dari parameternya yang aktif per token, yang membuat inferensi tetap efisien meskipun jumlah total parameter besar. Detailnya didokumentasikan di kartu model resmi dan blog Hugging Face.
Total parameter: 975B
Parameter aktif: 41B (sparse MoE)
Lapisan: transformer hanya dekoder 66 lapis
Pakar: 256 rute + 2 bersama; 6 dari 256 rute per token (2 bersama selalu aktif)
Perutean: Sigmoid / aux-loss-free
Perhatian: Hybrid, jendela geser 5:1 (lokal) ke global; 8 kepala KV
Pengkodean posisi: Dipelajari embedding posisi relatif (bukan RoPE)
Multimodalitas: Tanpa encoderaudio sebagai spektrogram dMel, gambar sebagai petak 40×40, dimasukkan langsung
Ekstra: Konvolusi pendek (SConv); lapisan MTP untuk decoding spekulatif
Numerik: BF16, MXFP8, NVFP4 (NVFP4 checkpoint untuk NVIDIA Blackwell)
Jendela konteks: Hingga 1.000.000 token dalam bobot (256K di API yang di-host)
Varian yang lebih kecil: Inkling-Small, total 276B / 12B aktif (pratinjau, bobot belum dirilis)

Beberapa pilihan desain membedakan Inkling dari vanilla MoE:
Tata letak ahli. Dengan 256 ahli yang dialihkan ditambah 2 ahli bersama, dan 6 ahli yang dialihkan diaktifkan per token, pasangan bersama tersebut bertindak sebagai “penampung ahli” yang selalu aktif yang menangkap komputasi umum sementara ahli yang dialihkan melakukan spesialisasi. Perutean sigmoid bebas kerugian tambahan menghindari istilah penalti penyeimbangan beban yang digunakan oleh banyak desain MoE.
Embedding posisi relatif, bukan RoPE. Kebanyakan model konteks panjang modern mengandalkan rotary embeddings; sebaliknya, Inkling menggunakan embedding posisi relatif yang dipelajari, sebuah pilihan yang tidak biasa pada skala ini.
Multimodalitas tanpa encoder. Alih-alih menambahkan encoder vision/audio terpisah, Inkling langsung memasukkan patch gambar 40×40 dan spektrogram audio dMel ke dalam tumpukan transformer. Ini menyederhanakan pipeline dan merupakan bagian dari mengapa model ini digambarkan sebagai multimodal secara alami.
MTP untuk decoding spekulatif. Lapisan Multi-token-prediction (MTP) bertindak sebagai perancang bawaan, mempercepat generasi tanpa model draf terpisah.
Catatan editor — tambahkan visual:Diagram blok berlabel dari satu lapisan Inkling — perhatian jendela geser vs global (5:1), router pakar 256+2 dengan 6 pakar aktif yang disorot, SConv, dan kepala perancang MTP.
Pelatihan dan dial "usaha berpikir"
Inkling dilatih awal pada 45 triliun token multimodal yang mencakup teks, gambar, audio, dan video, menggunakan optimizer hibrida (Muon untuk bobot matriks besar, Adam untuk sisanya) pada sistem NVIDIA GB300 NVL72. Pelatihan lanjutan menggunakan pembelajaran penguatan asinkron skala besar yang diskalakan melebihi 30M+ rollouts dalam dua sesi panjang berkelanjutan, yang diinisialisasi dari fine-tuning terawasi awal pada data sintetis.
Fitur khasnya adalah parameter usaha penalaran yang dapat dikontrol, yang ditunjukkan dari sekitar 0,2 hingga 0,99, di mana nilai yang lebih tinggi berarti lebih banyak penalaran dan lebih banyak biaya. Hal ini memungkinkan operator menukar latensi dan pengeluaran dengan kedalaman pemikiran. Semua tolok ukur di bawah ini dijalankan pada Usaha = 0,99.
Upaya berpikir yang dapat dikendalikan: panduan operasional
Dalam deployment, kontrol upaya diekspos sebagai enum reasoning_effort dengan level-level none / minimal / low / medium / high / xhigh / max. Tidak ada satu pengaturan yang “benar” — ini adalah tuas langsung untuk trade-off antara latensi, biaya, dan kualitas. Gunakan tabel di bawah ini sebagai peta awal (panduan relatif; kualitas setara benchmark diukur di puncak rentang):
tidak ada / minimal. Latensi relatif & biaya token: Terendah; Terbaik untuk: Klasifikasi, ekstraksi, pemformatan, perutean, lem pengambilan
rendah. Latensi relatif & biaya token: Rendah; Terbaik untuk: Tanya Jawab singkat, peringkasan sederhana, pekerjaan batch volume tinggi
sedang. Latensi relatif dan biaya token: Sedang; Terbaik untuk: Obrolan umum, penyusunan draf, sebagian besar panggilan alat agen
tinggi. Latensi relatif & biaya token: Lebih tinggi; Terbaik untuk: Penalaran multi-langkah, pembuatan kode, analisis
xhigh / maks. Latensi relatif & biaya token: Tertinggi; Terbaik untuk: Matematika sulit, penalaran gaya kompetisi, kesetaraan tolok ukur (Effort=0.99)

Bisakah Anda menjalankannya secara lokal? Perangkat keras dan VRAM
Karena Inkling adalah model dengan parameter 975B, “lokal” secara realistis berarti server multi-GPU, bukan laptop. Perkiraan persyaratan (berdasarkan liputan peluncuran dan peralatan komunitas):
BF16 (penuh). Kira-kira VRAM agregat: ~2 TB; Contoh konfigurasi: 8× NVIDIA B300, atau 16× H200
NVFP4 (dikuantisasi). Perkiraan VRAM agregat: ~600 GB; Contoh konfigurasi: 4× NVIDIA B300, atau 8× H200
GGUF (komunitas). Perkiraan total VRAM: Bervariasi tergantung kuantisasi; Contoh konfigurasi: Build Unsloth GGUF tersedia untuk jejak yang lebih kecil/terkuantisasi
NVFP4 checkpoint — yang dikirim khusus untuk NVIDIA Blackwell — memotong biaya memori sekitar dua pertiga dibandingkan BF16, yang merupakan perbedaan antara node B300 8-GPU dan 4-GPU. Bagi sebagian besar tim, ini masih mengarah pada penyedia yang di-host atau node GPU yang disewa daripada perangkat keras yang dimiliki. Kuantisasi Unsloth GGUF memperluas jangkauan lebih jauh ke bawah tangga perangkat keras untuk eksperimen, dengan mengorbankan kualitas.
Mulai Cepat Deployment
Inkling mengekspos sebuah API yang kompatibel dengan OpenAI, sehingga sebagian besar kode klien yang ada dapat berfungsi sebagai pengganti langsung dengan URL dasar dan nama model yang diubah. Tiga jalur penyajian umum:
vLLM — server perintah tunggal (bawaan ke port 8000):
vllm serve thinkingmachines/Inkling --port 8000
# lalu panggil endpoint yang kompatibel dengan OpenAI di http://localhost:8000/v1
SGLang — shard di 8 GPU (secara default port 30000):
python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000
Hugging Face transformers — muat melalui multimodal auto class:
from transformers import AutoModelForMultimodalLM, AutoProcessor
model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# atur reasoning_effort dalam {none, minimal, low, medium, high, xhigh, max}
Karena endpoint ini kompatibel dengan OpenAI, memigrasikan aplikasi yang sudah ada biasanya hanya masalah mengarahkan SDK Anda ke base URL yang baru dan mengatur reasoning_effort sesuai selera. Runtime tambahan saat peluncuran termasuk TokenSpeed dan Unsloth.
Di mana menjalankannya: ketersediaan penyedia inferensi
Jika Anda lebih memilih tidak mengelola GPU, beberapa mitra menghosting Inkling. Opsi “Run Inkling on X” saat peluncuran:
Tinker (Thinking Machines). Peran: Penyetelan halus; Catatan: 64K dan 256K opsi konteks; diskon peluncuran waktu terbatas 50% (berbayar)
Together AI. Peran: Inferensi yang dihosting; Catatan: endpoint yang kompatibel dengan OpenAI
Fireworks. Peran: Inferensi yang dihosting; Catatan: —
Modal. Peran: Inferensi yang dihosting / GPU tanpa server; Catatan: —
Databricks. Peran: Inferensi yang dihosting; Catatan: melalui Unity AI Gateway
Baseten. Peran: Inferensi yang dihosting; Catatan: —
Tolok ukur: klaim vendor vs. pengukuran independen
Ini adalah bagian terpenting dari setiap yang jujur Inkling review 2026, karena angka-angka tersebut berasal dari dua tempat yang sangat berbeda.
Pengungkapan: Dengan satu-satunya pengecualian pada Artificial Analysis Index, setiap tolok ukur Inkling di bawah ini adalah yang dilaporkan sendiri oleh vendor saat peluncuran (Effort = 0.99, temperature 1.0) dan telah belum diaudit secara independen. Angka kompetitor bersumber dari pihak ketiga (MarkTechPost, Artificial Analysis) atau dijalankan ulang oleh Thinking Machines, dan juga belum diaudit secara independen di sini. Beberapa angka memiliki kualifikasi harness atau subset. Perlakukan semuanya sebagai indikatif, bukan kebenaran mutlak.
Skor laporan mandiri vendor
Menurut materi peluncuran Thinking Machines sendiri:
AIME 2026 (matematika): 97.1%
GPQA Diamond (penalaran sains): 87.2%
SWE-bench Terverifikasi (pengkodean, harness hanya bash): 77.6%
SWE-bench Pro (Public): 54.3%
MMMU Pro (multimodal): 73.3%
VoiceBench (audio): 91.4%
MMAU (audio): 77.2%
IFBench (mengikuti instruksi): 79.8%
Terminal Bench 2.1 (agentic terminal): 63.8
FORTRESS Adversarial: 78.0%
SimpleQA Terverifikasi: 43.9%
Di atas kertas, angka-angka ini terlihat kuat, terutama angka penalaran matematika dan sains. Tetapi perusahaan tersebut melakukan benchmarking pada Inkling terhadap versi pesaing masa depan (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 ProKimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) menggunakan skor yang dihasilkan sendiri oleh perusahaan tersebut. Angka-angka pesaing tersebut mungkin tidak sesuai dengan angka yang dilaporkan oleh para pesaing itu sendiri, sehingga perbandingan head-to-head harus dibaca dengan hati-hati.
Multi-model head-to-head (pesaing dengan bobot terbuka)
Perbandingan paling jelas dari Inkling melawan model open-weight lainnya berasal daritabel perbandingan MarkTechPost (direproduksi di bawah, dikaitkan dengan MarkTechPost). Ini berguna tepatnya karena menempatkan para pesaing dalam satu bingkai:
HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%
AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%
SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%
Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%
FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%
MarkTechPost. Tidak diaudit secara independen.
Pola ini jelas dan konsisten dengan kerendahan hati Thinking Machines sendiri. Inkling unggul dalam FORTRESS (keamanan adversarial) dan mengalahkan Nemotron 3 Ultra di semua lini, tetapi ia tertinggal dari GLM 5.2, Kimi K2.6, dan DeepSeek V4 Pro dalam HLE, SWE-bench Verified, dan terutama Terminal Bench 2.1 (63,8% vs 82,7% milik GLM 5.2). Jika pengkodean agen dan tugas terminal adalah prioritas Anda, model terbuka China terdepan saat ini lebih unggul.
Pengukuran independen (Artificial Analysis)
Untuk bacaan yang lebih netral, Artificial Analysis mengevaluasi Inkling pada 2026-07-15 dan menempatkannya di 41/100 pada Intelligence Index-nya, peringkat #10 dari 97 model. Dua poin tentang cara membaca peringkat tersebut secara adil:
Ini adalah pertunjukan model terbuka yang kuat, bukan peringkat #1 secara keseluruhan. Menurut Artificial Analysis, indeks Inkling’s sebesar 41 berada di depan Nemotron 3 Ultra (38), Gemma 4 31B (29), dan gpt-oss-120b (24) — jadi di antara rekan-rekan dengan bobot terbuka, ini kompetitif hingga terdepan. Namun #10 dari 97 berarti sembilan model berperingkat lebih tinggi secara keseluruhan, konsisten dengan kerangka “mampu, bukan terdepan”.
Efisiensi adalah keunggulannya. Artificial Analysis mencatat efisiensi token yang kuat — sekitar 25K token untuk menyelesaikan set evaluasinya dibandingkan dengan 37–43K untuk model pembanding — dan Elo GDPval-AA v2 sebesar 1238, di depan Kimi (1190) dan DeepSeek V4 Flash (1189), ditambah keunggulan kecil (+2) pada AA-Omniscience.
Kecepatan keluaran terukur 72,7 token/detik dengan waktu hingga token pertama 1,75 detik. Singkatnya: posisi sepuluh besar yang terhormat, dan yang benar-benar efisien — tetapi sengaja kami hindari untuk melebih-lebihkannya sebagai kemenangan papan peringkat.

Kemampuan multimodal dan konteks panjang
Inkling menerima teks (UTF-8), gambar (40px hingga 4096px melalui encoder patch hierarkis), dan audio (WAV 16kHz, hingga sekitar 20 menit, menggunakan enkoding token diskrit). Output hanya berupa teks — tidak ada generasi gambar atau audio, jadi rencanakan untuk model pemahaman, bukan model generasi. Video digunakan saat pretraining tetapi tidak input yang didukung atau dievaluasi saat peluncuran, jadi jangan rencanakan untuk itu sekarang.
Kemampuan utama adalah jendela konteks 1 juta token dalam bobot yang dirilis, yang membuka pintu untuk analisis kode seluruh repositori, sintesis dokumen panjang, dan sesi agen multi-putaran diperpanjang tanpa pemotongan agresif. Catatan nuansa praktis: API yang dihosting menyediakan hingga 256K token, sehingga 1M penuh adalah fitur self-host saat ini. Dikombinasikan dengan desain perhatian jendela geser dan decoding spekulatif, cerita konteks panjang tetap menjadi salah satu titik penjualan paling praktis dari Inkling.
Harga, tingkatan, dan total biaya kepemilikan
Inkling benar-benar terbuka. Bobot penuh (sebuah checkpoint BF16 ditambah checkpoint NVFP4) ada di Hugging Face di bawah Apache 2.0, sehingga self-hosting bebas royalti — Anda hanya membayar untuk komputasi. Thinking Machines tidak memonetisasi model itu sendiri; pendapatan mengalir melalui Tinker dan host pihak ketiga.
Harga per-token yang dihosting (per Artificial Analysis), berdasarkan tingkat konteks:
64K. Input / 1M: $1.87; Input cache / 1M: $0.374; Output / 1M: $4.68
256K. Masukan / 1M: $3.74; Masukan cache / 1M: $0.748; Keluaran / 1M: $9.36
Mencerminkan diskon peluncuran 50% untuk waktu terbatas; angka pasti per token Tinker ada di dokumentasi dan akan berubah.
Self-host vs API — bagaimana cara berpikir tentang TCO. Ekonomi bergantung pada volume dan utilisasi:
API (Tinker / mitra): biaya tetap nol, bayar per token, mulai hampir instan. Terbaik untuk volume rendah atau tidak menentu, atau saat membuat prototipe.
Host mandiri (GPU sewa atau milik sendiri): Anda membayar untuk sebuah node GPU 4–8 baik sibuk atau tidak, tetapi biaya token marjinal mendekati listrik mentah. Karena Inkling hanya mengaktifkan 41B parameter dan hemat token (~25K vs 37–43K per set Artificial Analysis), throughput per jam-GPU menguntungkan, dan beban kerja yang berat dan stabil dapat menjadi jauh lebih murah daripada harga API per token setelah node dimanfaatkan dengan baik. Komentar seputar peluncuran menyatakan bahwa host mandiri bobot terbuka sekitar 40–60% lebih murah daripada penggunaan API tertutup yang sebanding dalam skala besar — klaim arah, bukan angka yang diaudit.
Catatan editor — tambahkan visual: Grafik titik impas — volume token bulanan (sumbu x) vs total biaya (sumbu y) dengan tiga garis: API Frontier tertutup, API yang dihosting Inkling, dan Inkling yang di-host sendiri di node GPU sewaan — menunjukkan titik persilangan tempat hosting sendiri menang.
Keamanan, penyelarasan, dan sensor
Keamanan adalah salah satu cerita yang lebih kuat dan lebih terdiferensiasi dari Inkling. Pada FORTRESS adversarial tolok ukur ia mendapat skor 78.0% — yang terbaik di antara model open-weight dalam perbandingan MarkTechPost, unggul dari GLM 5.2 (71.3%), Kimi K2.6 (65.6%), dan jauh unggul dari DeepSeek V4 Pro (36.0%). Thinking Machines juga menekankan ketidakpastian yang dikalibrasi dalam keluaran model.
Liputan VentureBeat menyoroti properti terkait: ketahanan terhadap sensor. Digabungkan dengan lisensi Apache 2.0 yang permisif, ini memposisikan Inkling sebagai model terbuka yang dapat diselaraskan oleh tim dengan kebijakan mereka sendiri daripada mewarisi rezim konten opak yang diterapkan vendor — pertimbangan penting untuk penyebaran yang diatur atau spesifik wilayah. Seperti biasa dengan model hari peluncuran, tidak ada tim merah independen atau audit keamanan pihak ketiga yang muncul pada saat penulisan, jadi perlakukan petunjuk FORTRESS sebagai bersumber dari vendor/pihak ketiga daripada disertifikasi secara eksternal.
Haruskah Anda melakukan fine-tune pada Inkling?
Penyesuaian halus bisa dibilang adalah alasan Inkling untuk ada. Sebuah kerangka keputusan cepat:
Sesuaikan (melalui Tinker atau pipeline Anda sendiri) jika: Anda memiliki data kepemilikan, domain yang sempit, atau tugas di mana model khusus yang lebih kecil mengalahkan model umum; Anda perlu memiliki bobot; atau Anda ingin menanamkan nada, format, atau kebijakan tertentu. Opsi konteks 64K/256K Tinker dan diskon peluncuran menurunkan hambatan.
Gunakan saja model dasar (self-host atau API) jika: tugas Anda bersifat umum, volume Anda rendah, atau Anda belum memvalidasi bahwa fine-tuning menggerakkan metrik Anda. Rekayasa prompt plus dial reasoning_effort sering kali cukup membantu.
Cari yang lain jika: Anda memerlukan pengkodean agenik tingkat frontier saat ini (GLM 5.2 dan Kimi K2.6 memimpin pada tolok ukur tersebut) atau Anda memerlukan jaminan kualitas yang diaudit secara independen.
Kelebihan dan kekurangan
Kelebihan
Bobot terbuka penuh di bawah Apache 2.0, bebas royalti untuk dihosting sendiri dan gratis untuk penggunaan komersial.
MoE jarang yang efisien (hanya 41B aktif) ditambah efisiensi token yang kuat menjaga biaya dan kecepatan inferensi tetap kompetitif.
Masif konteks 1M token dalam bobot (256K melalui API).
Multimodalitas sejati (teks, gambar, audio masukan).
Dial upaya penalaran yang dapat dikendalikan (tidak ada → maks) untuk trade-off biaya/kualitas secara langsung.
Keamanan adversarial bobot terbuka terbaik di kelasnya (FORTRESS 78,0%, menurut MarkTechPost) dan “ketahanan terhadap sensor.”
Posisi independen yang kuat — peringkat 10 teratas dari 97 pada Indeks Analisis Buatan, mengungguli Nemotron 3 Ultra, Gemma 4 31B, dan gpt-oss-120b.
Kekurangan
Secara eksplisit bukan sebuah model frontier, berdasarkan pengakuan pembuatnya sendiri.
Tertinggal di belakang pesaing terbuka terkemuka (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) pada tolok ukur agen dan pengkodean (Terminal Bench 2.1, SWE-bench Verified, HLE).
Sebagian besar tolok ukur dilaporkan sendiri oleh vendor dan tidak diaudit secara independen.
Keluaran hanya teks; tidak ada pembuatan gambar/audio; tidak ada masukan video saat diluncurkan; Inkling-Small masih dalam pratinjau.
Penggunaan “lokal” yang sesungguhnya membutuhkan node multi-GPU (~600GB VRAM bahkan jika dikuantisasi).
Tidak ada tinjauan independen yang substantif, kritis, atau keselamatan/tim merah yang muncul saat peluncuran.
Siapa yang harus menggunakan Inkling?
Inkling sangat cocok jika Anda seorang praktisi atau tim yang ingin memiliki dan menyesuaikan model Anda daripada menyewa API tertutup. Kasus penggunaan ideal meliputi:
Tim penyetelan halusmembangun model khusus domain melalui Tinker atau pipeline mereka sendiri.
Deploymen volume tinggi yang sensitif terhadap biaya di mana hosting sendiri bebas royalti mengalahkan harga per-token frontier.
Beban kerja konteks panjang seperti asisten kode di seluruh repositori, analisis dokumen, dan sesi agen panjang.
Aplikasi multimodal yang membutuhkan pemahaman gabungan teks, gambar, dan audio.
Penyebaran yang sensitif terhadap kebijakan yang menginginkan basis terbuka yang sangat aman dan tahan sensor untuk menyelaraskan diri.
Ini adalah pilihan yang buruk jika Anda membutuhkan kemampuan penalaran atau performa coding agen yang paling kuat, membutuhkan input video atau output generatif, atau memerlukan tolok ukur yang diaudit secara independen sebelum penerapan.
Kesimpulan dan rating akhir
Mari kita hadapi gajah di dalam ruangan secara langsung: Inkling bukanlah model terkuat yang tersedia saat ini, dan Thinking Machines mengatakan hal itu. Dibaca secara sinis, itu adalah patokan yang rendah. Dibaca secara adil, itulah intinya — Inkling dioptimalkan untuk tujuan yang berbeda daripada memuncaki papan peringkat. Ia efisien (41B aktif, ~25K-token anggaran tugas), berlisensi terbuka (Apache 2.0), aman menurut standar open-weight (FORTRESS 78%), dan dibangun untuk di-fine-tune dan dihosting sendiri. Kombinasi itu menjadikannya salah satu peluncuran model terbuka yang lebih bijaksana pada tahun 2026, meskipun ia tertinggal dari GLM 5.2 dan Kimi K2.6 pada tolok ukur agen dan pengkodean yang paling sulit.
Tanda bintang yang tersisa adalah tolok ukur yang sebagian besar dilaporkan sendiri dan tidak adanya tinjauan kritis independen sedini ini. Namun untuk audiens yang dituju — pembangun yang menghargai kepemilikan, kustomisasi, kontrol biaya, dan jendela konteks yang besar daripada hak membual yang terdepan — Inkling memberikan yang dijanjikan.
Rating: 4 dari 5 untuk audiens targetnya yaitu para pembangun dan penala; lebih rendah jika Anda berbelanja secara ketat untuk kemampuan frontier.
FAQ
Apa itu Inkling dan siapa yang membuatnya? Inkling adalah model pertama dari Thinking Machines Lab, perusahaan rintisan AI yang dipimpin oleh Mira Murati (mantan CTO OpenAI). Model ini diluncurkan pada 15 Juli 2026 sebagai model penalaran Mixture-of-Experts multimodal dengan bobot terbuka.
Apakah Inkling adalah model AI terbaik? Tidak, dan perusahaan tidak mengklaim demikian — mereka menyatakan Inkling “bukan model terkuat yang tersedia saat ini, baik yang tertutup maupun terbuka.” Pengukuran independen (Artificial Analysis) menempatkannya di peringkat #10 dari 97 secara keseluruhan, meskipun memimpin beberapa pesaing terbuka.
Berapa banyak parameter yang dimiliki Inkling, dan berapa jendela konteksnya? Total 975B dengan 41B aktif (sparse MoE), di 66 lapisan. Jendela konteks hingga 1,000,000 token pada bobot yang dirilis, dan hingga 256K pada API yang dihosting.
Apakah Inkling bersifat sumber terbuka, dan apa lisensinya? Bobot dirilis di bawah Apache 2.0, yang mengizinkan penggunaan komersial dan hosting sendiri. Ini adalah “open weights” — bobot model penuh ada di Hugging Face.
Apakah Inkling gratis digunakan? Bobotnya gratis dan bebas royalti untuk di-host sendiri. Fine-tuning di Tinker dan inferensi yang dihosting melalui penyedia seperti Together AI, Fireworks, Modal, Databricks, atau Baseten adalah layanan berbayar. Akses yang dihosting mulai dari sekitar $1.87 / 1M token input (diskon peluncuran terbatas).
Bagaimana cara menjalankan atau mengunduh Inkling, dan perangkat keras apa yang saya perlukan?Unduh bobot dari Hugging Face dan sajikan dengan vLLM, SGLang, atau Hugging Face transformers melalui API yang kompatibel dengan OpenAI. Perkirakan sekitar ~2TB VRAM agregat untuk BF16 (8× B300 / 16× H200) atau ~600GB untuk checkpoint terkuantisasi NVFP4 (4× B300 / 8× H200). Build GGUF Unsloth komunitas menurunkan batasan untuk eksperimen.
Bagaimana cara melakukan fine-tune pada Inkling? Gunakan Thinking Machines’ Tinker platform, yang menawarkan opsi konteks 64K dan 256K serta diskon peluncuran 50% untuk waktu terbatas, atau lakukan fine-tune pada bobot terbuka di pipeline Anda sendiri.
Apa itu controllable thinking effort?Sebuah pengaturan reasoning_effort (none / minimal / low / medium / high / xhigh / max) yang menukar latensi dan biaya token dengan kedalaman penalaran. Usaha rendah cocok untuk klasifikasi dan ekstraksi; usaha maksimal cocok untuk matematika sulit dan sesuai dengan konfigurasi benchmark (Effort=0.99).
Bagaimana perbandingan Inkling dengan Kimi, GLM, DeepSeek, dan Nemotron? Per perbandingan MarkTechPost, Inkling unggul dalam FORTRESS (keamanan) dan mengalahkan Nemotron 3 Ultra secara luas, tetapi tertinggal dari GLM 5.2, Kimi K2.6, dan DeepSeek V4 Pro pada Terminal Bench 2.1, SWE-bench Verified, dan HLE. Ini kompetitif tetapi bukan model terbuka terkuat dalam agentic coding.
Dapatkah Inkling memproses gambar, audio, dan video? Ia menerima teks, gambar (40px–4096px), dan audio (16kHz WAV, hingga ~20 menit) sebagai masukan. Keluaran hanya teks — tidak ada pembuatan gambar atau audio. Video digunakan dalam pra-pelatihan tetapi bukan merupakan masukan yang didukung saat peluncuran.
Apakah skor benchmark Inkling dapat diandalkan? Perlakukan dengan hati-hati. Selain dari Artificial Analysis Intelligence Index yang independen, angka-angka utama dilaporkan sendiri oleh vendor saat peluncuran dan tidak diaudit secara independen. Angka pesaing berasal dari pihak ketiga (MarkTechPost) atau dijalankan ulang oleh Thinking Machines dan mungkin tidak cocok dengan angka yang dilaporkan sendiri oleh para pesaing.
Apa itu Inkling-Small, dan apa yang ada di peta jalan? Inkling-Small adalah varian yang lebih kecil (total 276B / 12B aktif). Saat peluncuran, masih dalam pratinjau, dengan bobot yang belum dirilis. Model utama sudah mengirimkan lapisan MTP untuk decoding spekulatif.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
