Kartu judul yang dihasilkan berjudul 'TwIL-LM3-Pro', bersubjudul 'Model Logika Formal 3,66B', dengan tiga kartu statistik bersudut membulat bertuliskan '3,66B parameter', '2,09 GiB Q4_K_M' dan 'konteks 131.072 token'. Baris footer berbunyi 'Tolok ukur vendor: webAI Track A / Track B harness.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

TwIL-LM3-Pro: Model Logika Formal 3,66B yang Dikirim melalui Permintaan Email

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

TwIL-LM3-Pro adalah model penalaran dengan 3,66 miliar parameter dari webAI, yang dibangun khusus untuk logika formal alih-alih untuk percakapan umum, dan model ini telah ada di Hugging Face sejak 3 September 2026. Ini bukan rilis baru, dan framing yang beredar di sekitarnya minggu ini — bahwa webAI "telah merilis model 3,66B" — terlambat satu bulan dibandingkan bobotnya. Yang sebenarnya berubah dalam beberapa hari terakhir lebih kecil dan lebih berguna: checkpoint-nya direvisi pada 30 September, dan pada 1 Oktober webAI menerbitkan build LiteRT-LM dari model tersebut untuk inferensi di perangkat Android dan iOS. Jadi pertanyaan yang menarik bukanlah apa itu TwIL-LM3-Pro, melainkan apakah Anda bisa mendapatkannya, dan jawabannya bergantung pada saluran distribusi mana dari tiga saluran yang sedang Anda tempati — karena salah satunya adalah formulir.

Perbedaan itu lebih penting daripada biasanya, karena TwIL-LM3-Pro bukan produk yang bisa begitu saja Anda panggil. Ini adalah checkpoint yang Anda unduh, jalankan di perangkat keras Anda sendiri, dan setujui ketentuan lisensi yang melarang penggunaan komersial. Perbandingan yang ditawarkan oleh kartu modelnya sendiri — dengan Qwen3-8B, model dengan parameter lebih dari dua kali lipat — memang nyata, tetapi itu adalah perbandingan tolok ukur yang dijalankan vendor pada harness buatan vendor, dan kartu model itu sendiri menyatakannya di lebih banyak tempat daripada kebanyakan. Artikel ini membaca kartu tersebut dengan saksama dan memisahkan apa yang diukur webAI dari apa yang dimiliki orang lain.

Apa sebenarnya model itu

` block before answering and was evaluated with greedy decoding at a 2,048-token budget." No markers present? User mentions markers but none in text. We just translate. Need be careful: "dense Granite decoder" -> "dekoder Granite padat"? "dense" in model architecture maybe "dense" keep? Indonesian often "dense" or "padat". "Granite decoder" -> "dekoder Granite". "40 attention heads against 8 key-value heads" -> "40 kepala atensi terhadap 8 kepala key-value" or "head atensi". Use "head" maybe. "hidden size" -> "ukuran tersembunyi". "parameter count" -> "jumlah parameter". "real total" -> "total sebenarnya". "context window" -> "jendela konteks". "carried through unchanged" -> "dibawa tanpa perubahan". "emits a `<think>…</think>` block before answering" -> "memancarkan blok `<think>…</think>` sebelum menjawab" or "menghasilkan". "evaluated with greedy decoding at a 2,048-token budget" -> "dievaluasi dengan dekode greedy pada anggaran 2.048 token". Need preserve backticks exactly? Translation should keep code spans exactly, including `GraniteForCausalLM`, `granite-4.2-3b`, `<think>…</think>`. Also numbers with commas? In Indonesian decimal? But numbers 2,560 and 3,659,737,600. Could preserve as is or convert? Usually Indonesian uses period for thousands, comma decimal. But if we convert, it changes exact numbers? The instruction preserve URLs and brand/product names, not necessarily number formatting. But "byte-for-byte markers" irrelevant. Better preserve numeric formatting? Hmm target Indonesian localization often 2.560 and 3.659.737.600. But if technical exact, perhaps keep commas? User likely expects Indonesian with commas maybe. However numbers in text are English format. Translation to Indonesian could use Indonesian format: 2.560, 3.659.737.600, 131.072, 2.048. But "3.66B" -> 3,66B? In Indonesian decimal comma. "3,66B" maybe. But preserving "3.66B" maybe safer because product spec. The task says professional software-localization engine. We should localize number formatting. But risk altering exact numbers? It's okay if standard. Yet "3.66B" is shorthand. Indonesian: "3,66B" with comma? Might be "3,66 miliar". But parameter count "3,66B" maybe understood. Hmm. Also "TwIL-LM3-Pro" keep. "Granite" keep. "IBM's" -> "IBM". "derived from" -> "diturunkan dari". "base model's" -> "model dasar". "unchanged" -> "tanpa perubahan". "before answering" -> "sebelum menjawab". "was evaluated" -> "dievaluasi". "greedy decoding" -> "dekode greedy" or "penguraian greedy"? In ML Indonesian often "greedy decoding" kept or "dekode greedy". "at a 2,048-token budget" -> "dengan anggaran 2.048 token". "It emits" -> "Model ini mengeluarkan". Good. Need no markers. Just output translation. Let's compose: "TwIL-LM3-Pro adalah dekoder Granite padat — `GraniteForCausalLM`, 40 lapisan, ukuran tersembunyi 2.560, 40 kepala atensi terhadap 8 kepala key-value — yang diturunkan dari `granite-4.2-3b` milik IBM. Jumlah parameter 3,66B adalah total sebenarnya, 3.659.737.600, dan jendela konteksnya adalah 131.072 token milik model dasar yang dibawa tanpa perubahan. Model ini mengeluarkan blok `<think>…</think>` sebelum menjawab dan dievaluasi dengan dekode greedy pada anggaran 2.048 token." Check "dense Granite decoder" maybe "dekoder Granite dense" since dense model type. Could say "dekoder Granite padat" fine. "40 attention heads against 8 key-value heads" in Indonesian: "40 head atensi terhadap 8 head key-value" maybe more standard than kepala. If translate "heads" as "kepala" in attention, common? In Indonesian ML, "attention head" often "kepala atensi" or "head atensi". I'll use "head atensi" maybe. The phrase "40 attention heads against 8 key-value heads" means 40 query heads and 8 KV heads (GQA). "terhadap" good. "key-value" keep. "hidden size" -> "ukuran hidden" maybe. "ukuran tersembunyi" okay. Need ensure backticks preserved. `<think>…</think>` exactly, ellipsis char. Good. Output only.TwIL-LM3-Pro adalah dekoder Granite padat — `GraniteForCausalLM`, 40 lapisan, ukuran tersembunyi 2.560, 40 head atensi terhadap 8 head key-value — yang diturunkan dari `granite-4.2-3b` milik IBM. Jumlah parameter 3,66B adalah total sebenarnya, 3.659.737.600, dan jendela konteksnya adalah 131.072 token milik model dasar yang dibawa tanpa perubahan. Model ini mengeluarkan blok `<think>…</think>` sebelum menjawab dan dievaluasi dengan dekode greedy pada anggaran 2.048 token.

Tumpukan pasca-pelatihan adalah bagian yang sebenarnya ingin webAI Anda lihat, dan dokumentasinya luar biasa lengkap untuk model sebesar ini: fine-tuning terawasi LoRA rank-64 pada korpus logika formal sintetis, distilasi multipath untuk menghasilkan beberapa jejak penalaran per prompt, fusi checkpoint di ruang parameter alih-alih mengambil checkpoint akhir, interpolasi WiSE-FT pada α = 0,15 yang digabungkan kembali ke arah basis terpra-latih dengan TIES dan DARE-SLERP, dan terakhir tahap GRPO berbobot entropi — webAI menyebutnya MGPO — terhadap verifier programatik, dijalankan hingga langkah 2580, yang merupakan checkpoint yang dirilis.

Artefak yang diterbitkan adalah kebijakan hasil penggabungan, bukan adaptor LoRA, dan itulah detail praktisnya: Anda dapat menjalankannya sebagai model mandiri, dalam bf16 pada 6,82 GiB, atau sebagai Q4_K_M GGUF pada 2,09 GiB di CPU atau VRAM 4 GB. Itulah klaim "berjalan di laptop", dan itulah satu-satunya klaim di seluruh kartu yang dapat diverifikasi dengan mudah sehingga layak dipercaya.

Perbandingan Qwen3-8B, baca dengan cermat

Judul utama yang webAI pasang pada model tersebut adalah bahwa TwIL-LM3-Pro mencapai puncak baris-baris ringkasan Track A-nya sendiri pada 3,66B parameter. Keempat baris ringkasan itu adalah gate makro sebesar 0,5539, strict-7 sebesar 0,2879, rata-rata enam lane sebesar 0,5389, dan macro_primary sebesar 0,5875. Dibandingkan dengan Qwen3-8B, gate makro adalah 0,5539 versus 0,5336 — dan kartu model itu sendiri menulis kalimat yang akan dihapus oleh halaman pemasaran: "keunggulan gate atas Qwen3-8B adalah 0,020 — lebih kecil daripada noise pengambilan sampel pada n = 200 per lane — jadi anggaplah yang itu sebagai paritas, bukan kemenangan."

Itu adalah satu-satunya baris terpenting di halaman ini. Cara webAI sendiri membingkai hasil utamanya adalah bahwa itu seri. Di mana perbandingannya tidak seri:

• Strict-7 — TwIL-LM3-Pro 0.2879 vs Qwen3-8B 0.2093, dan baris ini tidak menggunakan kredit kecocokan longgar di mana pun, sehingga tidak mungkin dihasilkan oleh keberuntungan pemformatan.

• MCQ Ketat — TwIL-LM3-Pro 0,4100 vs Qwen3-8B 0,0000, kesenjangan jalur terlebar dari sebelas baris yang dilaporkan.

• Induksi aturan — TwIL-LM3-Pro 0.4195 vs Qwen3-8B 0.3680.

• Kesesuaian korpus — perplexity `lm_corpus` terendah di antara semua arm pada 2,3130, dengan Qwen3-8B pada 2,5478.

• Parameter — 3,66B vs sekitar 8B, yang menjadi seluruh dasar untuk klaim "kurang dari setengah parameter".

Dua catatan menyertai tabel itu, dan webAI menyebutkan keduanya. Generasi Track A dari TwIL-LM3-Pro rata-rata 1.902 token dan 24,2% di antaranya mencapai batas panjang, dibandingkan 564 token untuk pendahulunya sendiri, TwIL-LM3; istilah yang dipakai kartu untuk selisih yang dihasilkan adalah "indikatif, bukan pasti." Dan angka throughput dalam tabel diukur pada sesi yang lebih baru dengan vLLM yang lebih baru (0.19.1) daripada kolom pembanding (0.11.2), sehingga baris token per detik dapat dibandingkan satu sama lain dan hanya secara perkiraan dengan sisanya.

Di mana itu tidak menang

Pada held-out suite, kartu model itu terus terang: "TwIL-LM3-Pro tidak memimpinnya." Makro 10-dataset-nya adalah 0,7901, secara statistik setara dengan model dasarnya sendiri pada 0,7942, dan jauh di belakang Qwen3-8B pada 0,8493 serta gpt-oss-120b pada 0,8689. Makro 14-dataset-nya sebesar 0,7425 mengalahkan model dasarnya dengan selisih 0,0093, dan seluruh keunggulan itu berasal dari BBH-logic (0,9540 versus 0,9013 milik model dasarnya) — singkirkan satu baris itu dan model ini rata-rata 0,7263 pada tiga belas sisanya, di bawah 0,7350 milik VibeThinker-3B.

Ada tiga titik lemah yang benar-benar ada di dalam spesialisasi, semuanya diungkapkan: kecocokan persis terjemahan FOL pada 0,0100, `procedural` pada 0,1200 secara ketat, dan kecocokan persis penguraian semantik pada 0,0000. Induksi aturan hanya mengurai 56,5% dari keluarannya. Dan model ini bertele-tele secara bawaan — sekitar 792 token per jawaban Track B dibandingkan 482 untuk pendahulunya — yang merupakan biaya, bukan kemampuan.

Tidak ada satu pun dari ini yang merupakan kritik terhadap rilis tersebut. Beginilah bentuk model card yang ditulis dengan baik, dan inilah alasan angka-angka di sini bisa dikutip sama sekali.

Tiga cara untuk mendapatkannya, dan salah satunya adalah formulir.

Situasi distribusi adalah berita aktual minggu ini dan layak dinyatakan secara tepat.

Bobot-bobotnya ada di Hugging Face, tanpa pembatasan akses, di bawah webAI Non-Commercial License ver. 1.0 — yang mengizinkan penggunaan untuk riset dan pribadi serta mengharuskan perjanjian terpisah dengan webAI untuk penerapan yang menghasilkan pendapatan. Lisensi itu merupakan kendala yang mengikat pada keseluruhan rilis, dan itulah sebabnya TwIL-LM3-Pro bukan model yang bisa begitu saja diadopsi oleh sebagian besar tim produk.

webAI mengatakan keluarga ini telah melewati setengah juta unduhan dalam sebulan, angka yang dipublikasikan perusahaan dalam pengumumannya sendiri dan belum diaudit secara independen. Unduhan checkpoint gratis non-komersial bukanlah proksi untuk penggunaan produksi, dan webAI tidak menyajikannya sebagai proksi.

Sementara itu, platform milik vendor sendiri bukanlah endpoint publik. webAI menggambarkan dirinya sebagai platform enterprise yang menghadirkan AI ke data Anda, dengan aplikasi model yang mengutamakan lokal (local-first), dan jalur komersialnya adalah kesepakatan enterprise alih-alih daftar tarif per token yang dipublikasikan. TwIL-LM3-Pro juga tidak ada di platform inferensi pihak ketiga besar yang mengindeks checkpoint terbuka — kami sudah memeriksa, dan model itu juga tidak ada dalam katalog OrcaRouter — jadi jawaban praktis untuk "dari mana saya memanggil ini melalui API" adalah bahwa saat ini sebagian besar Anda tidak melakukannya; Anda mengunduhnya.

Kanal ketiga adalah yang baru. Repositori `Twil-LM3-Pro-LiteRT-LM` muncul pada 1 Oktober 2026, membawa artefak `.litertlm` dan ditandai untuk Android dan iOS — pengemasan runtime LiteRT-LM milik webAI sendiri dari hal yang sama. Apakah build tersebut mewarisi lisensi non-komersial adalah pertanyaan yang harus dijawab sebelum membuat rencana seputar hal itu, karena repositori induknya memang mewarisinya.

Mengapa spesialis logika formal pada skala ini layak diperhatikan

Alasan rilis ini terus muncul kembali bukanlah tabel benchmark. Alasannya adalah webAI menerbitkan seluruh pipeline, menjalankan resep identik pada lima model dasar yang berbeda, dan melaporkan apa yang terjadi. Tabel perbandingan keluarga mencatat pergerakan macro-gate Track A sebesar +0,012 hingga +0,145 bergantung pada model dasarnya, dengan suite held-out tetap berada dalam rentang ±0,013 — versi bukti tertulis dari "ini menggeneralisasi." Koefisien tunggal yang dipilih per model adalah bobot merge, yang di-sweep berdasarkan performa held-out: 0,15 untuk SmolLM3, 0,20 untuk Granite dan basis TwIL, 0,50 untuk VibeThinker-3B.

Itu adalah resep yang dapat dipakai ulang untuk mengubah model umum yang kecil menjadi spesialis yang sempit tanpa merusak apa yang sudah diketahuinya, diterbitkan dengan hasil-hasil negatif yang dilampirkan. Bagi siapa pun yang membutuhkan label entailment, formalisasi pernyataan Lean, atau parse semantik alih-alih prosa yang lancar, GGUF 2,09 GiB yang berjalan offline tanpa biaya per panggilan dan tanpa ketergantungan jaringan adalah proposisi yang berbeda dari model hosted mana pun, apa pun yang dikatakan tabel Elo.

Pertanyaan terbuka yang tersisa adalah apakah bobot-bobot tersebut akan pernah muncul di bawah lisensi yang mengizinkan penggunaan komersial, dan apakah port LiteRT-LM dirilis dengan pembatasan yang sama. Sampai saat itu, TwIL-LM3-Pro adalah artefak riset dengan kartu model yang luar biasa jujur — yang bukanlah hal kecil.

A generated single-column scoreboard headed 'TwIL-LM3-Pro - the scoreboard' with six rows: Macro gate 0.5539; Strict-7 0.2879; Strict MCQ 0.4100; Rule induction 0.4195; Held-out 10-set macro 0.7901; Parameters 3.66B dense. A footer line reads 'All figures vendor-reported by webAI; no independent evaluation yet.' The OrcaRouter logo is composited in the bottom-right corner.

Jika Anda membutuhkan kemampuan ini di lingkungan produksi hari ini

Untuk penerapan komersial, lisensi—bukan tolok ukur—yang menjadi penghambat, dan pengganti praktisnya adalah model hosted yang dapat Anda arahkan.satu endpoint yang kompatibel dengan OpenAI di depan lebih dari 200 model pada harga daftar penyedia tanpa tambahan markup, sehingga pemotongan harga vendor berlaku pada hari yang sama, bukan setelah siklus kontrak. Untuk beberapa tempat di mana checkpoint logika formal kecil benar-benar cocok — pelabelan batch offline, proses entailment air-gapped, langkah prapemrosesan yang outputnya berupa label, bukan prosa — pembagian yang jujur adalah menjalankan model lokal di tempat beban kerjanya adalah teks-ke-label, dan mengarahkan penalaran di sekitarnya, ekspansi prompt, dan QA ke model hosted dengan kunci yang sama.

Satu peringatan yang layak diulang secara khusus di bagian ini: dengan failover otomatis, Anda juga dapat mengarahkan ke sebuah model sebelum Anda memercayainya di jalur produksi, dan melakukan rollback dengan mengedit aturan routing alih-alih men-deploy ulang. Itulah pola yang cocok untuk model seperti ini ketika status komersialnya belum terselesaikan.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the tags for Text Generation, Transformers, Safetensors, GGUF, English, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.

Apa yang harus ditonton

Tiga hal akan mengubah kisah ini. Perubahan lisensi, atau port LiteRT-LM yang berlisensi jelas, akan memindahkan TwIL-LM3-Pro dari artefak riset menjadi komponen yang dapat diterapkan. Kemunculan di platform inferensi terkelola utama akan memberinya API yang sesungguhnya. Dan evaluasi independen — siapa pun selain webAI yang menjalankan harness Track A — akan memberi tahu kita apakah keunggulan strict-7 atas Qwen3-8B bertahan saat diukur oleh seseorang yang tidak membangun harness tersebut. Tak satu pun dari ketiganya telah terjadi, dan kartu model ini cukup jujur sehingga Anda dapat melihat dengan tepat apa yang perlu tetap berlaku agar ketiganya berdampak.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro-LiteRT-LM, created 1 October 2026, showing the tags TextGeneration, LiteRT-LM, on-device, android, ios, granite, granite-4.2 and reasoning, and the card text describing TwIL-LM3-Pro converted to Google's LiteRT-LM (.litertlm) format for on-device inference, requiring LiteRT-LM 0.16 or newer, preserving the ChatML prompt format and pre-opening the think block.