
ARTEMIS vs LFM2.5-2.6B-Base: checkpoint yang tidak dapat menjalankan tugas itu, dan harness yang membutuhkannya untuk melakukannya
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Empat item berada di peta jalan ARTEMIS Google, dan tepat satu di antaranya memerlukan model yang jelas belum ada: model visi-bahasa ringan di perangkat, untuk otomasi berlatensi rendah yang mengutamakan privasi. Kandidat yang jelas untuk pekerjaan semacam itu adalah sesuatu di kelas ukuran LFM2.5-2.6B-Base — checkpoint pra-terlatih 2,69 miliar parameter milik Liquid AI, diterbitkan sebagai bobot terbuka dengan konteks 131.072 token dan jejak yang cukup kecil untuk ponsel. Namun sebagaimana dirilis, model itu juga tidak mampu mengisi slot tersebut, dan alasannya layak dipahami sebelum ada yang menempatkan keduanya dalam tabel perbandingan. ARTEMIS Google adalah harness otomasi Android berbahasa alami, di-open-source-kan di bawah Apache 2.0 pada Agustus 2026, yang mengendalikan ponsel sungguhan melalui ADB dan mengklaim tingkat penyelesaian 99%+ pada benchmark AndroidWorld dari Google Research. LFM2.5-2.6B-Base adalah materi pra-terlatih mentah tanpa penyetelan instruksi, tanpa templat obrolan, dan — secara sengaja — tanpa benchmark yang dipublikasikan, ditujukan untuk tim yang akan melakukan post-training sendiri. Yang satu adalah perangkat lunak jadi dengan masalah model yang belum selesai. Yang lain adalah bobot yang belum selesai dengan masalah lisensi yang sudah selesai. Keduanya bukan pengganti satu sama lain, dan tempat keduanya benar-benar bertemu bukanlah tempat yang Anda duga.
Apa sebenarnya LFM2.5-2.6B-Base itu
Hapus brandingnya dan itu adalah fondasi yang dibangun dengan cermat untuk pekerjaan di perangkat, dengan spesifikasi yang terdengar seperti seseorang mengoptimalkan bandwidth memori alih-alih posisi papan peringkat.
• Ukuran — 2,69B parameter dalam bfloat16 dalam satu shard ~5,39 GB, dipasarkan sebagai "2.6B".
• Arsitektur — 30 lapisan dalam pemisahan hibrida: 22 blok konvolusi pendek bergerbang ganda di atas 8 lapisan atensi grouped-query, lebar tersembunyi 2048, 32 kepala atensi berbanding 8 kepala KV, embedding terikat. Kelas code>Lfm2ForCausalLM/code> yang sama dengan generasi sebelumnya, sehingga tidak diperlukan kode pemodelan kustom.
• Pelatihan — sekitar 34 triliun token, dengan fase pelatihan pertengahan yang khusus untuk perluasan konteks.
• Kosakata — 128.000 token, digandakan pada generasi ini untuk menangani aksara non-Latin dengan lebih baik. Sekitar 262 juta parameter, kira-kira sepersepuluh dari model, berada di embedding terikat.
• Konteks — kartu model dan konfigurasi tidak sepakat di sini, dan ini penting untuk diketahui: dokumentasinya menyebutkan 131.072 token sementara code>config.json/code> menetapkan code>max_position_embeddings/code> menjadi 128.000. Perhitungkan 128K dan anggap apa pun di atasnya sebagai belum terverifikasi.
• Bahasa — enam belas: Inggris, Arab, Tionghoa, Prancis, Jerman, Hindi, Indonesia, Italia, Jepang, Korea, Polandia, Portugis, Rusia, Spanyol, Thai, Vietnam.
• Tolok ukur — tidak ada. Liquid tidak menerbitkan evaluasi apa pun untuk checkpoint dasarnya, dan kartu model menyebut penghilangan itu sebagai hal yang disengaja: artefak ini ada untuk dilatih lebih lanjut (post-training), bukan untuk diukur dalam kondisi mentahnya.
Baris terakhir itu adalah inti dari rilis ini, dan itu juga alasan mengapa perbandingan "X vs LFM2.5-2.6B-Base" harus ditangani dengan hati-hati. Checkpoint base tidak punya pendapat tentang apa pun. Minta ia merencanakan alur kerja Android dan ia akan melanjutkan teks Anda secara probabilistik, karena ia tidak pernah diajari untuk menjawab. Kartu ini merekomendasikannya hanya untuk kasus yang memerlukan fine-tuning berat: asisten khusus bahasa, asisten khusus domain di sektor teregulasi, pelatihan pada data proprietary, atau sebagai siswa distilasi. Untuk apa pun yang siap pakai, termasuk pemanggilan alat, Liquid mengarahkan Anda ke LFM2.5-2.6B yang telah dilatih lanjut sebagai gantinya.

Apa yang ARTEMIS butuhkan dari sebuah model, yang bukan apa yang ditawarkan checkpoint dasar
ARTEMIS adalah loop kendali dengan dua mode. Flash adalah siklus reaktif amati-dan-bertindak pada sekitar 3–5 detik per langkah. Pro adalah graf multi-agen pada sekitar 15–40 detik per langkah, dengan sebuah Perencana yang memegang rencana Markdown yang hidup, sebuah Operator dengan perangkat alat lengkap, dan sebuah Pemeriksa hanya-baca yang memverifikasi titik pemeriksaan pada empat tingkat, dari code>off/code>code>strict/code>. Kedua mode menuntut hal yang sama dari model di bawahnya: lihat tangkapan layar, pilih satu tindakan dari perangkat alat yang tetap, lalu lakukan lagi dalam satu atau dua detik, seratus kali, tanpa kehilangan alur.
Itu adalah permintaan yang menuntut — mengikuti instruksi dalam skema yang kaku, pemahaman visual yang berlandaskan bukti, dan koherensi jangka panjang — dan itu justru merupakan kumpulan keterampilan yang belum diberikan kepada checkpoint dasar. Backend yang diuji milik ARTEMIS sendiri adalah model yang dihosting: Gemini, Claude, GPT-4o, Qwen-VL. Semuanya disetel dengan instruksi untuk penggunaan alat, dan semuanya berukuran besar.
Jadi, kesenjangannya bukan soal ukuran. Model pasca-dilatih 2,6B dapat menjalankan loop pemanggilan alat — saudara pasca-dilatih Liquid sendiri mengklaim mengungguli Gemma 4 E2B-it dan E4B-it di semua evaluasi kemampuan mengikuti instruksinya dan hampir semua evaluasi penggunaan alatnya, meskipun angka-angka itu dilaporkan vendor tanpa verifikasi independen. Kesenjangannya adalah bahwa checkpoint dasar tidak pernah menerima pelatihan semacam itu, sehingga sama sekali tidak dapat dimasukkan ke dalam harness.
Lisensi adalah perbedaan yang lebih tajam
Di sinilah pertandingan itu sebenarnya ditentukan, dan inilah bagian yang paling sering dilewatkan oleh kebanyakan perbandingan.
• ARTEMIS — Apache 2.0. Gunakan secara komersial, fork, sertakan di dalam produk, tanpa syarat pendapatan. Satu-satunya kewajiban adalah mempertahankan pemberitahuan dan menyatakan perubahan Anda, sebuah kewajiban yang harus diperbaiki secara publik oleh proyek itu sendiri pada September 2026 setelah Minitap menuduh bahwa 228 dari 229 file ARTEMIS cocok dengan proyek Apache-2.0 code>mobile-use/code> miliknya dan bahwa nama penulis telah dihapus melalui force-push. Repositori kini mencantumkan kredit Minitap.
• LFM2.5-2.6B-Base — LFM Open License, lisensi khusus bukan Apache atau MIT. Di bawah $10M pendapatan tahunan, hibahnya luas, abadi, dan bebas royalti. Pada atau di atas ambang tersebut, lisensi tidak mencakup penggunaan komersial sama sekali, dan Anda harus menghubungi Liquid. Detail penting bagi siapa pun yang membangun di atasnya: karya turunan mewarisi ketentuan yang sama. Checkpoint yang Anda post-train bukanlah hal baru yang Anda miliki sepenuhnya — ia meneruskan lisensi yang dikondisikan pada pendapatan tersebut, dengan pengecualian untuk organisasi nirlaba yang memenuhi syarat.
Bandingkan kedua fakta itu secara berdampingan, dan keputusannya berbalik tergantung siapa Anda. Perusahaan yang sudah mendapat pendanaan yang ingin merilis agen di sisi ponsel memiliki harness Apache-2.0 yang dapat digunakannya dengan bebas dan sebuah checkpoint yang mungkin sama sekali tidak dapat digunakannya secara komersial. Pengembang individu atau startup di bawah ambang batas memiliki keduanya, dan lisensinya hanya catatan kaki. Tak satu pun vendor bersikap tidak wajar — Liquid adalah perusahaan yang melindungi tier komersialnya, Google membuka source perkakas pengujiannya — tetapi "open weights" dan "open weights" bukanlah izin yang sama, dan perbandingan yang berhenti pada jumlah parameter tidak akan memberi tahu Anda mana yang Anda miliki.

Keluarga itu, karena checkpoint dasarnya adalah pintu yang salah untuk memasukinya
Jika tujuannya adalah agen Android di perangkat, tiga model bersaudara lebih penting daripada model dasarnya, dan yang sebenarnya dibutuhkan peta jalan ARTEMIS bukanlah yang tampak jelas.
• LFM2.5-2.6B — saudara agentik yang telah menjalani pasca-pelatihan. Throughput yang dilaporkan vendor sekitar 30 token per detik pada perangkat keras kelas ponsel, 113 pada Ryzen AI Max+ 395, dan 220 pada Apple M5 Max, berjalan di bawah 2,5 GB.
• LFM2.5-VL-3B — model edge penglihatan-bahasa, dibangun di atas basis yang sama dengan encoder SigLIP2 400M NaFlex, dengan presisi grounding@1 yang dilaporkan vendor naik dari 57,1 ke 87,9 pada RefCOCO dan, menurut Liquid, performa pada elemen UI di layar yang mengalahkan model Gemma yang jauh lebih besar dan hanya terpaut 0,7% dari Qwen 3.5 4,7B. Belum diverifikasi, tetapi ini satu-satunya anggota keluarga ini yang dapat melihat layar.
• LFM2.5-230M — tier ekstraksi dan klasifikasi, secara eksplisit tidak direkomendasikan untuk pekerjaan yang berat penalaran.
Kesimpulan tidak nyaman bagi checkpoint dasar dalam pertarungan ini adalah: item peta jalan ARTEMIS adalah persyaratan visi, basisnya hanya teks, dan anggota keluarga yang mengisi slot tersebut adalah varian VL yang sudah diberikan baik encoder visi maupun pasca-pelatihan. Peran checkpoint dasar dalam stack otomatisasi Android bukanlah untuk mengendalikan ponsel. Peran itu adalah menjadi bahan mentah di bawah model kecil mana pun yang pada akhirnya mengendalikan ponsel.
Di titik mereka memang bertemu: roda gila yang belum pernah dibuat siapa pun
Inilah satu koneksi yang nyata dan bukan retoris, dan arahnya justru terbalik dari arah yang biasa. Fitur ARTEMIS yang paling diremehkan bukanlah agennya — melainkan buangannya. Setiap proses menangkap stack crash, tangkapan layar keyframe, catatan sesi langkah-langkah terkompresi, dan laporan diagnostik, dan Pro membuka “insiden eksekusi” setiap kali suatu tindakan gagal dan menyimpannya dalam konteks hingga keberhasilan di kemudian hari menyelesaikannya. Itu adalah korpus berlabel yang tepat berisi momen-momen ketika persepsi agen UI salah.
Pasangkan itu dengan sebuah checkpoint yang seluruh tujuannya adalah post-training dan Anda memiliki loop yang jelas: jalankan harness pada model yang dihosting, kumpulkan trace tempat ia tersandung pada aplikasi Anda, lalu fine-tune model 2.6B tepat pada frame-frame tersebut. Inilah jenis dataset proprietary yang dikutip oleh kartu milik Liquid sendiri sebagai justifikasi untuk merilis checkpoint dasar sejak awal — "melatih pada data Anda sendiri" — dan lisensi yang dibatasi pendapatan berarti ini adalah jalur yang masuk akal bagi tim di bawah ambang batas dan memerlukan percakapan bagi tim di atasnya.
Untuk bersikap eksplisit tentang status gagasan itu: tidak seorang pun telah mempublikasikan loop ini, tidak ada vendor yang menyarankannya, dan tidak ada bukti bahwa salah satu dari kedua pihak telah mengujinya. Ini adalah proposal, bukan hasil, dan harus dibaca sebagai proposal. Tetapi ini adalah satu-satunya kerangka di mana kedua artefak ini menjadi kolaborator, bukan sebuah kekeliruan kategori.
Jika Anda sampai ke tahap penyetelan halus, kumpulan pembanding adalah separuh masalah lainnya. LFM2.5-2.6B-Base tidak ada di katalog kami — tidak ada varian LFM2.5 pun yang ada — jadi checkpoint itu berasal dari distribusi milik Liquid sendiri dan host pihak ketiga yang biasa. Di sinilah katalog dengan perutean membuktikan nilainya: membandingkan hasil penyetelan halus Anda dengan model-model yang harus dikalahkannya dalam penggunaan alat, dengan satu kunci dan satu tagihan, serta failover agar sore buruk penyedia tidak menjadi sore buruk evaluasi Anda. Itu adalah hal yang benar-benar berguna untuk dimiliki ketika inti dari latihan ini adalah adu langsung yang ingin Anda tindak lanjuti.

Jadi, yang mana yang jadi masalahmu?
Jika Anda memiliki aplikasi Android dan ingin aplikasi itu diuji secara otomatis pada kuartal ini, Anda menginginkan ARTEMIS, dan LFM2.5-2.6B-Base bukan bagian dari jawabannya — Anda akan menjalankan ARTEMIS terhadap model visi yang dihosting, membayar per langkah, dan item roadmap tentang VLM on-device pada akhirnya akan datang dan menyelesaikan masalah biaya yang belum Anda ukur.
Jika Anda membangun produk yang harus berjalan di ponsel tanpa jaringan, Anda menginginkan jalur model kecil, dan LFM2.5-2.6B-Base adalah awal dari proyek itu, bukan bagian mana pun dari solusinya: Anda akan melakukan post-training terhadapnya, Anda akan membaca LFM Open License dibandingkan dengan proyeksi pendapatan Anda sebelum menulis skrip pelatihan pertama, dan jika agen Anda perlu melihat layar, Anda akan berakhir di varian VL sebagai gantinya.
Satu hal yang tidak boleh dilakukan adalah menempatkan keduanya berdampingan, menyatakan harness lebih mampu, lalu lanjut saja. Perbandingan yang berguna adalah antara dua stack lengkap — model hosted plus harness, versus model kecil yang di-fine-tune plus framework yang Anda bangun — dan hanya salah satunya yang memiliki tingkat keberhasilan yang dipublikasikan pada benchmark publik, yang nilainya persis sama dengan fakta bahwa yang satunya lagi tidak memiliki tagihan cloud sama sekali.
Tempat katalog yang dirutekan membuktikan nilainya adalah saat membandingkan fine-tune Anda dengan model-model yang harus dikalahkannya dalam penggunaan alat, pada satu kunci dan satu tagihan, dengan failover sehingga sore buruk seorang penyedia tidak menjadi sore buruk evaluasi Anda.
LFM2.5-2.6B-Base tidak ada di katalog kami — tidak ada varian LFM2.5 — jadi checkpoint itu berasal dari distribusi Liquid sendiri dan host pihak ketiga yang biasa.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
