Kartu judul yang dihasilkan bertajuk 'TwIL-LM3-Pro vs LFM2.5 2.6B Base', dengan subjudul 'Satu Sudah Selesai, yang Lain Adalah Titik Awal', dengan dua kartu membulat bertuliskan 'TwIL-LM3-Pro - pasca-latih dan digabungkan' dan 'LFM2.5 2.6B Base - checkpoint pra-latih'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

TwIL-LM3-Pro vs LFM2.5 2.6B Base: Satu Sudah Selesai, yang Lain Adalah Titik Awal

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal yang paling mengungkap tentang perbandingan yang dipublikasikan antara TwIL-LM3-Pro dan LFM2.5 2.6B Base adalah bahwa webAI sama sekali tidak mempublikasikan perbandingan terhadap versi 2.6B. Tabel Track A dan Track B webAI mempertemukan spesialis logika formal 3,66B miliknya dengan berbagai model — basis Granite miliknya sendiri, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — dan entri Liquid AI yang mereka pilih adalah LFM2.5-8B-A1B, bukan yang 2.6B. Model 2.6B yang memang muncul di tabel adalah `LFM2-2.6B`, generasi sebelumnya, yang merupakan model berbeda dengan proses pra-pelatihan yang berbeda. Kelalaian itu bukan kekhilafan. LFM2.5 2.6B Base adalah checkpoint pra-pelatihan tanpa penyetelan instruksi, dan tolok ukur pengikutan instruksi bukanlah ujian yang dirancang untuk dijalaninya.

Jadi halaman ini membandingkan artefak yang sudah selesai dengan bahan mentah. Pembingkaian bergaya Aion — satu model memiliki skor dan yang lain tidak — cocok, tetapi alasannya lebih spesifik dan lebih menarik: yang satu telah menjalani pasca-pelatihan dan digabungkan, yang lain sengaja berhenti sebelum pasca-pelatihan, dan dua dokumen yang mendeskripsikannya sengaja menjawab pertanyaan yang berbeda.

Dua jumlah parameter yang bukan pengukuran yang sama

TwIL-LM3-Pro memiliki 3,66B parameter, dense, semuanya aktif pada setiap token. Model ini berasal dari `ibm-granite/granite-4.2-3b` melalui fine-tuning LoRA, distilasi multipath, fusi checkpoint, penggabungan WiSE-FT kembali ke base, dan tahap GRPO berbobot entropi — dan artefak yang dikirim webAI adalah kebijakan yang digabungkan, bukan adaptor LoRA, sehingga dapat berjalan secara mandiri.

LFM2.5 2.6B Base memiliki 2,69 miliar parameter pada 30 lapisan: 22 blok konvolusi pendek berpagar ganda yang diselang-seling dengan 8 lapisan grouped-query attention. Desain hibrida conv/attention itu adalah arsitektur on-device milik Liquid, dan itulah alasan angka throughput keluarga ini seperti itu, bukan hanya fungsi dari jumlah parameter. Model ini dilatih pada 34 triliun token dengan kosakata 128.000 token dan memiliki jendela konteks 131.072 token.

Kedua angka tersebut berada dalam kisaran sekitar 36% satu sama lain dan diperoleh melalui arsitektur yang sepenuhnya berbeda, jadi baik "3.66B mengalahkan 2.69B" maupun sebaliknya tidak berarti apa-apa sebagai klaim kualitas. Kartu model webAI sendiri menyampaikan poin ini secara tidak langsung ketika menolak membandingkan perplexity korpus lintas tokenizer — kosakata TwIL-LM3-Pro adalah 100.352, kosakata LFM2.5-2.6B adalah 128.000, dan perplexity dihitung per token.

Apa yang dihapus oleh "Base", dan mengapa itu mengubah papan skor

Liquid AI menerbitkan LFM2.5 2.6B dalam dua bentuk: checkpoint pasca-pelatihan, yang disetel untuk beban kerja agentik di harness agen populer, dan Base, yang dijelaskan dalam kartunya sendiri sebagai "checkpoint teks-saja pra-terlatih, yang digunakan untuk membuat semua varian LFM2.5-2.6B." Base adalah input untuk fine-tuning, bukan produk. Ia tidak memiliki penyetelan instruksi, tidak memiliki templat chat yang layak disebut, dan tidak ada evaluasi yang dipublikasikan — karena mengevaluasi model dasar pada tugas mengikuti instruksi mengukur hal yang salah.

Posisi TwIL-LM3-Pro adalah kebalikannya. Seluruh nilainya terletak pada stack pasca-pelatihan: webAI melaporkan bahwa pada harness-nya sendiri, pipeline tersebut mengangkat gerbang makro dalam-domain dari 0,4313 base-nya menjadi 0,5539, dengan makro 10-dataset held-out tetap stabil (0,7942 ke 0,7901) alih-alih runtuh. Retensi held-out adalah bagian yang sulit dari pasca-pelatihan spesialis, dan itulah bagian yang tidak dapat dijawab oleh Base.

Di sinilah juga perbandingan ukuran dalam tabel webAI membuahkan hasil. TwIL-LM3-Pro dilaporkan unggul atas LFM2.5-8B-A1B pada kedua makro held-out — 0,7901 versus 0,7884 pada kumpulan sepuluh dataset, 0,7425 versus 0,7378 pada empat belas dataset — dengan jumlah parameter kurang dari setengah model MoE tersebut. Itu adalah hasil setara yang sesungguhnya, dan tersedia justru karena LFM2.5-8B-A1B adalah model pasca-terlatih yang dapat dijalankan melalui harness instruksi. Base tidak bisa, itulah sebabnya 2.6B tidak pernah mendapat kolom.

Dimensi yang layak diselaraskan

• Parameter — TwIL-LM3-Pro 3.66B padat vs LFM2.5 2.6B Base 2.69B (30 lapisan: 22 conv + 8 GQA).

• Pasca-pelatihan — LoRA SFT, distilasi, penggabungan WiSE-FT, dan GRPO pada langkah 2580 vs tidak ada; Base adalah keluaran pra-pelatihan secara desain.

• Jendela konteks — 131,072 token untuk keduanya, diwarisi dari basis masing-masing.

• Kosakata — 100.352 token vs 128.000, itulah sebabnya perplexity mereka tidak dapat dibandingkan.

• Bahasa — hanya bahasa Inggris vs tujuh belas bahasa, termasuk Arab, Tionghoa, Jepang, Korea, Spanyol, dan Thai.

• Format berpikir — TwIL-LM3-Pro menghasilkan blok `<think>` secara bawaan dan menalar secara panjang (rata-rata 1.902 token dalam domain, 24,2% generasi mencapai batas panjang) vs checkpoint dasar tanpa format instruksi sama sekali.

• Lisensi — webAI Non-Commercial License ver. 1.0 vs Liquid's LFM Open License v1.0.

• Untuk apa — endpoint inferensi logika formal vs titik awal fine-tuning.

Baris-baris konteks itu pantas mendapatkan catatan kaki yang disediakan kedua model: masing-masing membawa 131.072 token sejak prapelatihan, dan tidak ada vendor pun yang memvalidasi perilaku konteks panjang — kartu TwIL-LM3-Pro menyatakan bahwa setiap skor yang dipublikasikan diukur di dalam jendela 8.192 token. Angka yang cocok di sini diwarisi, bukan dibuktikan.

Lisensi, dan untuk apa masing-masing secara hukum

Lisensi Non-Komersial webAI milik TwIL-LM3-Pro mengizinkan penggunaan untuk riset dan pribadi serta mensyaratkan perjanjian terpisah dengan webAI untuk penerapan yang menghasilkan pendapatan. LFM2.5 2.6B Base dirilis di bawah LFM Open License v1.0 milik Liquid sendiri, yang oleh API Hugging Face dilaporkan sebagai `license: other`, bukan sebagai pengenal SPDX standar — bacalah berkas lisensinya sebelum membuat rencana berdasarkan lisensi tersebut, karena ketentuannya milik Liquid sendiri dan bukan templat yang diakui.

Kedua lisensi itu bukan Apache 2.0, dan merupakan kesalahan untuk menganggap "bobot terbuka" sebagai sinonim dari "permisif secara komersial." Perbedaan praktis antara keduanya terletak pada apa yang dilindungi oleh lisensi-lisensi tersebut: peneliti nonkomersial dapat menggunakan keduanya, perusahaan yang membangun produk perlu memeriksa keduanya, dan seluruh tujuan Base — yaitu di-fine-tune menjadi produk orang lain — membuat ketentuan persisnya lebih berdampak daripada yang terlihat.

Di mana masing-masing berada dalam tumpukan

Base adalah pilihan yang tepat ketika Anda berniat untuk melatih. Jika masalah Anda adalah tugas pelabelan yang sempit, classification head yang spesifik domain, atau fine-tune pada beberapa ribu contoh berlabel, memulai dari checkpoint pra-terlatih 2,69B dengan kosakata multibahasa yang luas dan arsitektur conv hibrida yang dirancang untuk throughput adalah keputusan rekayasa yang masuk akal, dan biaya pasca-pelatihan yang akan Anda lewati adalah biaya yang justru sengaja Anda bayarkan sebagai gantinya.

TwIL-LM3-Pro adalah pilihan yang tepat ketika Anda tidak berniat melakukan pelatihan dan tugasnya sudah berupa logika formal. Label entailment, formalisasi pernyataan Lean, parse semantik, dan kritik bukti adalah tugas-tugas yang menjadi sasaran seluruh pipeline-nya, dan memulai dari checkpoint yang sudah melalui tahap merge dan reinforcement akan menghemat satu bagian dari ini yang benar-benar sulit direproduksi — menjaga agar suite held-out tetap setara sambil memperoleh peningkatan di dalam domain.

Kesalahannya adalah menafsirkan "3.66B post-trained specialist" sebagai lebih baik secara mutlak daripada "2.69B base checkpoint." Keduanya berada pada tahap yang berbeda dalam lini produksi yang sama.

Melayani mereka, atau melayani di sekitar mereka

Tidak ada satu pun dari kedua model itu yang menjadi rute dalam katalog OrcaRouter saat ini, dan alasannya berbeda untuk masing-masing. TwIL-LM3-Pro dilisensikan secara non-komersial dan tidak memiliki endpoint terkelola; LFM2.5 2.6B Base adalah artefak fine-tuning yang tidak akan disajikan siapa pun sebagai endpoint inferensi secara sengaja. Tempat sebuah router menemukan perannya adalah satu lapisan di atasnya, dalam pekerjaan yang mengelilingi seorang spesialis: menghasilkan dan menyaring data pelatihan yang akan Anda fine-tune pada Base, memperluas prompt yang akan Anda umpankan ke model logika formal, dan menilai keluarannya. Semua itu adalah panggilan teks, dan semuanya berjalan melalui satu endpoint yang kompatibel dengan OpenAI untuk 200+ model pada harga daftar penyedia dengan tambahan markup 0%, sehingga pemotongan harga dari penyedia langsung berlaku di hari yang sama dan beralih dari satu model pembuatan data ke model lain hanyalah soal mengubah konfigurasi, bukan menjalin hubungan dengan vendor kedua.

Failover otomatis lebih penting daripada biasanya dalam pipeline fine-tuning, karena pekerjaan batch yang mati di 80% membuang seluruh proses. Satu kunci di seluruh model generasi, dengan fallback yang mengirim ulang saat terjadi error penyedia, adalah bagian infrastruktur yang lebih kecil daripada tiga integrasi API.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Yang mana, ditentukan oleh niat Anda

Jika Anda sedang melatih, pilih Base. Jika Anda melakukan inferensi pada logika formal dan lisensinya mengizinkan penggunaan Anda, pilih TwIL-LM3-Pro. Jika Anda memerlukan model kecil yang mengikuti instruksi hari ini dan tidak ada dari kedua batasan itu yang cocok, gunakan saudara post-trained dari LFM2.5 2.6B — model yang benar-benar diterbitkan Liquid untuk tujuan itu — dan sisakan Base untuk fine-tuning yang memang sudah Anda rencanakan.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.