
Kimi Linear Semakin Menyebar: Setiap Model yang Dapat Kami Verifikasi Benar-benar Menjalankan KDA
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 198 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1653Kecerdasan69Koding60Matematika
"Wow! Kimi-Linear semakin banyak diadopsi! Ini seperti model eksternal ketiga yang saya lihat." Itulah seluruh isi unggahan tersebut — satu baris dari @teortaxesTex pada 5 Agustus 2026, dengan tangkapan layar yang dilampirkan dan tidak ada satu pun model yang disebutkan. Tautan singkat di dalamnya mengarah ke gambar, bukan ke repositori, jadi tidak ada yang bisa diklik dan tidak ada yang bisa menguatkan klaim itu. Klaim itu tetap bisa diperiksa, dan dampaknya lebih besar daripada yang tersirat dari satu baris: jika lab selain Moonshot AI kini membangun di atas desain atensi di balik Kimi-Linear-48B-A3B-Instruct dan Kimi K3, maka Kimi Delta Attention tidak lagi menjadi trik internal satu lab dan mulai menjadi komponen yang diadopsi pihak lain. Jadi kami mencari model-modelnya, bukan tangkapan layarnya. Jawaban singkatnya: kasus terkuatnya adalah Ling-3.0-flash, yang kartu modelnya sendiri menggambarkan tumpukan 5:1 dari lapisan KDA dan MLA; kasus yang paling berguna adalah checkpoint riset dari lab AS yang mengukur berapa biaya KDA murni; dan pada skala frontier, di luar Moonshot, belum ada yang merilisnya.
Apa klaim tersebut, dan apa yang bukan
Satu praktisi, satu tangkapan layar, tanpa nama model, tanpa bukti penguat. Itulah seluruh dasar bukti untuk "mulai diadopsi," dan ini seharusnya dibaca sebagai dorongan untuk mengecek, bukan sebagai berita. Kami tidak dapat mereproduksi tangkapan layar tersebut, jadi tidak ada apa pun di bawah ini yang merupakan konfirmasi atasnya — semua yang berikut adalah apa yang ditunjukkan metadata model publik pada 5 Agustus 2026, saat kami menyisirnya, ditambah apa yang dikatakan setiap lab dalam kartu modelnya sendiri. Jika sebuah angka berasal dari pengukuran vendor itu sendiri, angka itu diberi label demikian, karena dalam cerita khusus ini hampir semua angka utamanya memang seperti itu.
Satu layar di Kimi Linear, karena "adopsi" berarti mengadopsi ini.
Kimi Linear adalah arsitektur attention, diterbitkan oleh Tim Kimi sebagai arXiv 2510.26692 pada 30 Oktober 2025, bukan sebuah produk. Intinya adalah Kimi Delta Attention (KDA), yang mengambil Gated DeltaNet dan mengganti coarse forget gate-nya dengan decay per-kanal yang lebih halus dan terperinci, sehingga state berulang belajar apa yang harus dipertahankan kanal demi kanal, bukan secara menyeluruh. Pembaruannya disusun ulang ke dalam bentuk Diagonal-Plus-Low-Rank yang ter-chunk, khususnya agar dapat diproses oleh tensor core alih-alih membiarkannya menganggur. Pembingkaian perangkat keras itulah inti desainnya: attention linear selalu murah secara teori, dan biasanya mengecewakan dalam praktik.
Checkpoint yang dirilis — Kimi-Linear-48B-A3B-Base dan Kimi-Linear-48B-A3B-Instruct — memiliki total 48B parameter dengan 3B aktif, jendela konteks 1M token, dan lisensi MIT. Lapisan berselang-seling sekitar 3:1, dua puluh lapisan KDA berbanding tujuh lapisan Multi-Head Latent Attention, sehingga tiga dari empat lapisan merupakan jenis recurrent yang murah dan setiap lapisan keempat mempertahankan perhatian global yang tepat.
Apa yang dilaporkan Moonshot, semuanya diukur terhadap baseline MLA penuh yang dilatih dengan resep identik — angka vendor, tidak direproduksi secara independen:
• Throughput decoding — hingga 6x lebih cepat waktu per token keluaran pada konteks 1M dibandingkan MLA penuh
• KV cache — hingga 75% lebih kecil, di situlah throughput berasal.
• Konteks panjang — RULER pada 128k: 84.3 untuk Kimi Linear dengan percepatan 3.98x, dibandingkan 81.3 untuk baseline MLA
• Konteks pendek — MMLU-Pro pada 4k: 51.0 berbanding 47.2 untuk baseline MLA dan 47.9 untuk hibrida Gated DeltaNet, dengan kecepatan yang hampir sama dengan attention penuh, sehingga desain ini tidak membeli kecepatan konteks panjang dengan mengorbankan kualitas konteks pendek.
• Ablasi pra-pelatihan — hibrida 3:1 mencapai perplexity validasi 5.65, sedangkan full attention berada di 5.77
Batas yang jujur dari semua itu: bukti baseline yang sepadan berhenti pada 48B. Tidak ada yang membangun kembaran full-attention 2.8T dari Kimi K3 untuk dibandingkan, dan pada pemeriksaan fakta akhir Juli 2026 terhadap klaim arsitektur K3, belum ada probe recall konteks panjang yang independen dan bebas jalan pintas yang dipublikasikan untuk kedua model. Kisah efisiensinya didukung dengan baik. Kisah "mengungguli full attention" didukung pada skala penelitian oleh lab yang menulis makalah tersebut.

Traction, sejauh ini, terlihat seperti unduhan daripada seperti arsitektur orang lain: 98,164 unduhan dalam sebulan terakhir, 570 suka, satu penyedia inferensi terdaftar di Hugging Face, dan pohon model dengan 2 adapter, 8 fine-tune, dan 24 kuantisasi. Populer, jelas. Disalin adalah pertanyaan yang berbeda.
Kasus adopsi terkuat: Ling-3.0-flash
Ling-3.0-flash adalah model yang mewujudkan klaim tersebut. Kartu Hugging Face-nya menjelaskan arsitektur hybrid linear attention native yang dibangun dari tumpukan bergantian 5:1 antara Kimi Delta Attention dan MLA — 35 lapisan KDA untuk 7 lapisan gated MLA — pada model Mixture-of-Experts dengan 124B parameter dan 5,1B aktif per token, konteks 256K yang dilatih secara progresif dari 8K ke 32K ke 256K, serta lisensi MIT. Itu bukan mainan riset dari penghobi; itu adalah model produksi dari laboratorium mapan, dan model tersebut menyebutkan modul attention Moonshot dalam deskripsi arsitekturnya sendiri.
Ini juga lebih agresif dalam hal ini daripada Moonshot. Moonshot menyimpan satu lapisan perhatian eksak dalam empat; Ling-3.0-flash menyimpan satu dalam enam. Jika sebuah desain adalah kelemahan, Anda melakukan lindung nilai; Anda tidak menggunakan lebih sedikit lapisan global daripada para penemunya. Jika dibaca bersama generasi sebelumnya, itu adalah sebuah perubahan: survei arsitektur Februari 2026 yang mengkatalogkan kelas model ini mencatat flagship Ling sebelumnya menggunakan Lightning Attention yang dipasangkan dengan MLA pada rasio 7:1. Mekanismenya berubah antar generasi, dan arah perubahannya menuju KDA.
Dua peringatan yang tidak akan kami tutup-tutupi. Ini adalah laporan dari kartu model: kami membaca deskripsi arsitektur repositori itu sendiri dan konfigurasinya, yang mendeklarasikan tipe model kustom bailing_hybrid dengan implementasi BailingMoeV3 — kami tidak mengaudit kernel untuk memastikan bahwa matematikanya adalah KDA, bukan sekadar terinspirasi oleh KDA. Dan repositori itu sama sekali tidak memiliki tag KDA; yang muncul dalam pencarian tag adalah konversi GGUF pihak ketiga yang diberi label oleh orang lain. Ini adalah peringatan yang berguna tentang metode, dan langsung mengarah ke dua bagian berikutnya.
Arcee AI melakukan eksperimen yang Moonshot tidak lakukan.
Penggunaan eksternal KDA yang paling informatif sebenarnya bukanlah sebuah produk sama sekali. Sekitar enam minggu setelah makalah Kimi Linear, pada pertengahan Desember 2025, Arcee AI menerbitkan dua checkpoint riset berlisensi Apache-2.0 — AFM-4.5B-Base-KDA-Only dan AFM-4.5B-Base-KDA-NoPE — di bawah implementasi ArceeKDAForCausalLM mereka sendiri, yang secara eksplisit diberi tag kimi-delta-attention. Pertanyaan mereka adalah pertanyaan yang sengaja dihindari oleh desain hibrida Moonshot: dapatkah attention penuh diganti sepenuhnya? Maka mereka mengonversi seluruh 24 lapisan attention menjadi KDA, tanpa menyisakan lapisan attention global, dan mendistilasi hasilnya dari AFM-4.5B-Base asli sebagai guru pada panjang sekuens 32k.
Hasil yang mereka laporkan, guru versus siswa KDA murni:
• MMLU — 63.1 ke 55.8, penurunan nyata namun masih bisa diatasi.
• GSM8K — 52.1 menjadi 26.8, kira-kira berkurang setengah
• HellaSwag — 78.0 hingga 74.3, hampir utuh

Bentuk kerusakan itu adalah bagian yang menarik. Pengetahuan luas dan kelanjutan akal sehat sebagian besar bertahan ketika didorong melalui status berulang berukuran tetap. Aritmetika multi-langkah, yang membutuhkan pengambilan tepat hasil antara yang ditulis model beberapa langkah lalu, tidak bertahan. Arcee juga melaporkan bahwa degradasi konteks panjang terjadi secara halus, tanpa penurunan tajam. Secara keseluruhan, ini adalah bukti publik paling jelas mengapa setiap penerapan KDA yang serius bersifat hibrida: lapisan global satu-dari-empat milik Moonshot dan satu-dari-enam milik Ant bukanlah rasa takut, melainkan bagian yang menjaga aritmetika tersebut.
Apa yang bukan ini: sebuah vonis tentang KDA dalam skala besar. Ini adalah distilasi 4.5B, bukan proses pra-pelatihan, dan distilasi ke dalam arsitektur yang berubah kehilangan hal-hal yang tidak akan hilang jika dilatih dari awal. Bacalah ini sebagai ablasi yang tidak ada insentif bagi vendor untuk mempublikasikannya — dari lab independen yang tidak memiliki kepentingan atas jawabannya.
Long tail: sekumpulan repo KDA kecil dalam satu minggu
Di bawah dua kasus serius itu terdapat sebaran kasus-kasus kecil, dan tanggal-tanggal itulah yang membuatnya layak disebutkan. NEXIVON-1B-BASE, diunggah pada 31 Juli 2026, menyatakan tipe modelnya secara harfiah sebagai kda — Apache-2.0, 285 unduhan, tanpa like. qingyi-kda-0.6b, pada minggu yang sama, adalah finetune Qwen3-0.6B-Base yang menyertakan implementasi qingyi_kda khusus. Scrapegoat-Tiny-Coder, juga pada minggu itu, menggabungkan tag kda dengan desain "dual-track parallel attention" miliknya sendiri. Dua lagi, maccy-106m-base dan maccy-96m-16k-base, diberi tag kimi-delta-attention pada 27 dan 28 Juli.
Tak satu pun dari ini penting dengan sendirinya — jumlah suka satu digit, penulis tak dikenal, jumlah parameter skala riset. Secara kolektif, hal-hal ini mungkin yang dihitung dalam catatan "model eksternal ketiga yang saya lihat", dan kita tidak dapat memastikan tiga yang mana, karena unggahan tersebut tidak menyebutkan satu pun. Sinyalnya bukan pada model-modelnya, melainkan pada sepuluh hari: empat pelatihan kecil yang independen menggunakan KDA dalam satu setengah minggu, yang terjadi ketika sebuah kernel berhenti menjadi artefak riset dan menjadi sesuatu yang bisa Anda masukkan ke dalam skrip pelatihan selama satu akhir pekan.
Apa yang tidak ditemukan oleh sapuan
Kami menanyai Hugging Face untuk setiap repositori yang memuat tipe model kimi_linear. Jumlahnya ada 47. Semua kecuali tiga memiliki kata "Kimi" pada namanya, dan yang bukan milik Moonshot sendiri adalah turunan, bukan pengadopsi: kuantisasi AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF, dan MLX pada setiap kedalaman bit; varian REAP 35B dengan pemangkasan expert (expert-pruned) dari Cerebras; dan build FlagRelease FlagOS dari checkpoint Instruct untuk akselerator NVIDIA, MetaX, dan Hygon. Kelompok terakhir itu benar-benar menarik karena alasan berbeda — seseorang telah melakukan pekerjaan untuk membuat KDA berjalan di silikon dalam negeri Tiongkok — tetapi tidak ada satu pun yang merupakan lab lain yang mendesain model lain.
Tidak ada model berskala frontier di luar Moonshot yang mendeklarasikan KDA. Ling-3.0-flash dengan total 124B dan 5.1B aktif adalah batas tertinggi adopsi eksternal saat ini.
Dan metode ini memiliki celah yang pantas diberi nama, karena bertentangan dengan hasil negatif kita sendiri. Lab yang mengimplementasikan ulang KDA mendaftarkan tipe modelnya sendiri — arcee_kda, qingyi_kda, bailing_hybrid — sehingga sapuan tag secara sistematis kurang menghitung tepat para pengadopsi yang kita cari, dan sebuah model dapat menggunakan mekanisme tersebut tanpa pernah menulis "KDA" di kartunya. Ketidakhadiran dari sebuah tag adalah bukti lemah, bukan bukti. Jika ada pengadopsi diam keempat atau kelima, justru beginilah cara mereka tetap tidak terlihat.
Semua orang lain memilih linear attention yang berbeda.
The reason "Kimi Linear is gaining adoption" is a story at all is that, for most of 2026, it wasn't. Hybrid linear attention swept the open-weight field — but not this variant of it. Per the architecture surveys published in February 2026: Qwen3-Next 80B-A3B and Qwen3.5-397B-A17B both pair Gated DeltaNet with gated attention at 3:1, meaning Qwen3.5-397B-A17B runs 45 recurrent layers against 15 full-attention ones out of 60. The previous Ling flagship used Lightning Attention with MLA at 7:1. Nemotron 3 Nano 30B-A3B and Super 120B-A12B are Mamba-2 hybrids, with just 6 attention layers in a 52-layer stack and 8 in an 88-layer stack respectively. GLM-5 stayed with MLA and added sparse attention on top. MiniMax-M2.5 went the other way entirely and kept plain multi-head attention, reportedly for reliability. And Kimi K2.5, Moonshot's own flagship before K3, was MLA — the lab published KDA in October 2025 and did not put it in its frontier model until July 2026.
Jadi kategori menang dan varian tidak. Semua orang setuju tiga perempat dari lapisan Anda bisa rekuren; tidak ada yang sepakat tentang rekurensi yang mana. Pembeda KDA adalah gerbang peluruhan per saluran, dan biayanya adalah Anda memerlukan kernel kustom dan perpipaan cache-prefix-nya daripada jalur Gated DeltaNet yang sudah dimiliki setengah ekosistem. Sampai bulan ini, satu lab membayar biaya itu.
Adopsi yang telah terjadi berada pada stack serving.
{{1}}Arsitektur tidak menyebar karena elegan; arsitektur menyebar ketika infrastruktur membuatnya murah.{{/1}} {{2}}Bagian itu sudah selesai untuk KDA, dan itu terjadi lebih cepat daripada adopsi model-card.{{/2}} {{3}}Baik vLLM maupun SGLang merilis dukungan sejak hari pertama{{/3}} {{4}}saat bobot Kimi K3 dirilis pada 27 Juli 2026,{{/4}} {{5}}dengan Moonshot meng-upstream implementasi prefix-caching KDA-nya ke dalam vLLM itu sendiri, alih-alih memelihara fork.{{/5}} {{6}}SGLang merilis kernel KDA dan Gated DeltaNet yang terfusi dan melaporkan kapasitas KV logis naik dari 1,5M menjadi 12,2M token pada perangkat keras yang identik{{/6}} {{7}}— pengukuran mereka sendiri, dan angka efisiensi pihak ketiga paling konkret dalam seluruh kisah ini.{{/7}} {{8}}Kernel referensi tersebut berada di fla-core, yang dapat diimpor oleh sesi pelatihan kecil mana pun.{{/8}}
Itulah perbedaan antara Arcee yang membutuhkan upaya penelitian yang disengaja pada Desember 2025 dan empat repo anonim yang dengan santai mendeklarasikan KDA dalam satu minggu di bulan Juli 2026. Mekanisme tersebut menjadi dependensi yang Anda pasang. Apakah yang terdepan akan mengikuti adalah pertanyaan terpisah, tetapi argumen hambatan terhadap KDA sebagian besar telah menguap.
Apa bedanya jika Anda hanya membeli token?
Tidak ada apa pun tentang kode Anda. Anda tidak pernah memanggil KDA; Anda mengalaminya sebagai biaya konteks satu juta token dan berapa lama token pertama muncul. Kimi K3 adalah model tempat hal itu terlihat secara komersial hari ini — di OrcaRouter, harganya $3,00 per juta token masukan dan $15,00 per juta token keluaran, dengan konteks penuh 1 juta token serta p50 waktu-ke-token-pertama terukur 8,88 detik selama tujuh hari terakhir. Ekonomi itulah, pada dasarnya, yang dibeli oleh hibrida KDA 3:1: melayani konteks satu juta token dengan harga yang sekadar mahal, bukan mustahil.

Checkpoint penelitian adalah hal yang berbeda. Kimi-Linear-48B-A3B-Instruct dilisensikan di bawah MIT dengan satu penyedia inferensi yang tercantum di halaman Hugging Face-nya, dan tidak ada di OrcaRouter — jika Anda ingin menjalankannya, itu berarti self-hosting atau penyedia tersebut. Perhitungan untuk self-hosting lebih ramah daripada yang disarankan oleh jumlah parameter: bobot 48B dalam bf16 kira-kira 96 GB, jadi dua kartu 80 GB, sementara konversi MLX dan GGUF 4-bit berada di sekitar 25-30 GB dan muat di satu kartu atau Mac dengan spesifikasi yang baik. Ling-3.0-flash juga tidak ada di OrcaRouter saat ini. Kami tidak akan berpura-pura sebaliknya untuk membuat poin tentang routing.
Di mana routing benar-benar penting adalah biaya dari salah taruhan arsitektur. Model attention linear hibrida adalah kelas yang persis di mana tabel tolok ukur vendor dan beban kerja Anda bisa tidak sejalan — status berulang berukuran tetap gagal pada pola pengambilan yang tidak diekspos oleh skor agregat apa pun, itulah pelajaran dari angka GSM8K yang berkurang setengah itu. Menjalankan perbandingan melalui satu kunci API di lebih dari 200 model berarti pengujiannya adalah perubahan string model, bukan siklus pengadaan, dengan harga daftar penyedia dan markup 0% dari sisi kami, serta failover otomatis sehingga model konteks panjang yang masih Anda evaluasi tidak menjadi titik kegagalan tunggal dalam jalur produksi. Cobalah pada lalu lintas konteks panjang Anda sendiri selama sehari. Itu jawaban yang lebih murah daripada tabel tolok ukur mana pun, termasuk milik kami.
Pertanyaan yang benar-benar layak ditanyakan
Apakah Kimi Linear sama dengan Kimi K3?
Tidak, dan menganggap keduanya sama adalah kesalahan paling umum dalam liputan keduanya. Kimi Linear adalah makalah arsitektur plus model penelitian 48B-total, 3B-aktif dengan konteks 1M, dirilis di bawah lisensi MIT pada akhir 2025 untuk menunjukkan bahwa hibrida yang sarat-KDA mengalahkan MLA penuh pada pelatihan yang setara. Kimi K3 adalah andalan Moonshot dengan 2,8 triliun parameter dari Juli 2026 — 104B aktif, multimodal asli, konteks 1M — yang membawa ide KDA-3:1 ke skala frontier dan menambahkan Attention Residuals, trik terpisah yang menurut laporan lab menghasilkan sekitar 25% efisiensi pelatihan dengan biaya tambahan di bawah 2%. Mekanisme yang sama, skala, kemampuan, dan harga yang sepenuhnya berbeda. Tolok ukur dari yang satu memberi tahu Anda sangat sedikit tentang yang lain.
Mengapa sebuah lab memilih KDA daripada Gated DeltaNet, padahal kebanyakan memilih Gated DeltaNet?
KDA adalah penyempurnaan ketat dari Gated DeltaNet, jadi pertanyaannya apakah penyempurnaan itu sepadan dengan biaya peralihan. Penyempurnaan tersebut adalah gerbangnya: Gated DeltaNet meluruhkan memori berulangnya dengan satu skalar per langkah, sedangkan KDA mempelajari peluruhan per saluran fitur, yang memungkinkan status menyimpan nama variabel pada sepuluh ribu token sambil membuang kalimat tempat nama itu muncul. Ablasi Moonshot menempatkannya pada sekitar 0,12 perplexity validasi pada 48B, dan formulasi DPLR terpotongnya ditulis untuk menjaga inti tensor tetap sibuk, sehingga ekspresivitas tambahan itu tidak mengorbankan throughput yang dihasilkannya. Sebaliknya, Gated DeltaNet sudah memiliki dukungan kernel dan kerangka kerja yang luas sebelum keduanya menjadi tren, yang bernilai waktu rekayasa nyata. Jawaban tahun 2026 sebagian besar adalah "tidak sepadan." Ling-3.0-flash adalah taruhan produksi skala besar pertama yang sebaliknya.
Haruskah semua ini mengubah apa yang saya terapkan pada kuartal ini?
Hanya jika Anda menggunakan konteks yang sangat panjang. Jika prompt Anda di bawah sekitar 32k token, attention linear hibrida adalah detail implementasi yang tidak berpengaruh pada pilihan model Anda; pilih berdasarkan kualitas, harga, dan latensi seperti biasa. Jika Anda mendorong hingga 128k dan seterusnya, perlu diketahui bahwa model yang menjaga biaya Anda tetap masuk akal pada panjang tersebut semakin banyak merupakan hibrida KDA, dan skor konteks panjang yang dipublikasikan adalah benchmark agregat, bukan probe recall yang adversarial. Uji retrieval pada panjang konteks nyata Anda daripada mempercayai skor RULER. Saran itu akan sama persis jika mekanismenya adalah Gated DeltaNet atau Mamba-2.
Di mana ini meninggalkan klaim
Arahnya benar, dan lebih kecil daripada yang terdengar. Yang dapat diverifikasi pada 5 Agustus 2026 adalah satu model produksi dari lab mapan, sepasang riset dari lab AS independen yang menerbitkan kekurangannya secara jujur, beberapa repos sub-1B dari sepuluh hari terakhir, dan ekosistem serving yang telah menyerap kernel tersebut. Itu lebih dari sekadar "trik satu lab" dan jauh dari sebuah standar. Angka yang perlu diperhatikan bukan tiga model eksternal — melainkan apakah rilis open-weight frontier berikutnya dari lab yang bukan Moonshot menyertakan per-channel gating, dan apakah siapa pun di luar Moonshot akan pernah menerbitkan probe recall yang menguji apa yang sebenarnya dilupakan oleh state berukuran tetap. Keduanya akan memberi tahu Anda lebih banyak daripada sekadar tangkapan layar lain.
