Kartu judul yang dihasilkan berjudul 'TwIL-LM3-Pro vs Qwen 3.8', dengan subjudul 'Perbandingan yang Sebenarnya Dijalankan oleh Kartu Tersebut', dengan dua kartu membulat bertuliskan 'TwIL-LM3-Pro - 3.66B, lokal, non-komersial' dan 'Qwen3.8-Max - di-hosting, konteks 1M, $2 / $6'. Baris footer berbunyi 'webAI diukur terhadap Qwen3-8B, bukan Qwen3.8-Max.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

TwIL-LM3-Pro vs Qwen 3.8: Sebuah Ketidakcocokan, dan Perbandingan yang Benar-Benar Penting

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

TwIL-LM3-Pro dan Qwen3.8-Max tidak pantas berada di halaman yang sama, dan alasannya bukan karena salah satunya lebih baik. Alasannya adalah bahwa argumentasi yang dipublikasikan untuk model logika formal 3,66B milik webAI dibangun di atas perbandingan dengan model Qwen — dan model Qwen yang dimaksud bukan model yang disebutkan dalam judul. Tabel Track A dan Track B mengukur TwIL-LM3-Pro terhadap Qwen3-8B, model dense 8B dengan bobot terbuka dari generasi sebelumnya, dan sama sekali tidak memberi perhatian pada Qwen3.8-Max: bukan karena TwIL-LM3-Pro akan menang, melainkan karena Qwen3.8-Max adalah sistem hosted unggulan Alibaba, model sparse mixture-of-experts yang dilaporkan memiliki 2,4 triliun parameter dengan sekitar 95 miliar parameter aktif per token, jendela konteks multimodal satu juta token, dan daftar tarif US$2,00 per juta token masukan dan US$6,00 per juta token keluaran. Menempatkan GGUF laptop berukuran 2,09 GiB di sampingnya adalah kesalahan kategori yang dikemas sebagai halaman versus.

Jadi, tulisan ini melakukan dua hal. Tulisan ini mengoreksi perbandingan yang salah dalam hasil pencarian, lalu menjawab versi pertanyaan yang kemungkinan benar-benar dimiliki pembaca: mengingat model frontier hanya berjarak satu panggilan API dan spesialis logika formal berjalan di mesin Anda sendiri, kapan masing-masing layak mendapat tempatnya?

Model yang sebenarnya diukur oleh kartu tersebut

Perbandingan yang relevan adalah dengan Qwen3-8B, dan ringkasan webAI sendiri tentangnya lebih moderat daripada yang disiratkan oleh tulisan-tulisan sekunder. Gate makro dalam-domain TwIL-LM3-Pro adalah 0.5539 versus 0.5336 milik Qwen3-8B, dan kartu model memuat kalimat yang akan dihapus oleh halaman pemasaran: keunggulan gate itu adalah 0.020, "lebih kecil daripada derau pencuplikan pada n = 200 per lajur — jadi anggap itu paritas, bukan kemenangan."

Ketika perbandingannya bukan sekadar lempar koin: strict-7, 0,2879 versus 0,2093, baris yang tidak menggunakan kredit kecocokan longgar di mana pun dan karena itu tidak dapat dibuat-buat melalui pemformatan. Pilihan ganda ketat, 0,4100 versus 0,0000. Induksi aturan, 0,4195 versus 0,3680. Dan rasio parameter — 3,66B versus sekitar 8B — yang merupakan inti klaim "kurang dari setengah ukurannya".

Pada rangkaian held-out, webAI bahkan lebih blak-blakan: "TwIL-LM3-Pro tidak memimpinnya." Makro sepuluh dataset adalah 0,7901, setara dengan basis Granite-nya sendiri dan di belakang 0,8493 milik Qwen3-8B. Spesialis kecil yang menyamai model umum dua kali ukurannya dalam logika formal dan kalah darinya dalam kemampuan umum adalah bentuk yang diharapkan, dan melaporkannya seperti itu yang membuat angka strict-7 kredibel.

Apa sebenarnya Qwen3.8-Max itu

Qwen3.8-Max bukanlah iterasi dari Qwen3-8B. Ini adalah tier premium milik Alibaba, dan pada halaman katalog OrcaRouter muncul sebagai `qwen/qwen3.8-max` dengan tanggal rilis 3 Agustus 2026, jendela konteks satu juta token, masukan teks, gambar, dan video, keluaran teks, serta dukungan penuh untuk mode berpikir, pemanggilan fungsi, alat bawaan, dan keluaran terstruktur. Layanan ini tersedia di dasbor yang kompatibel dengan OpenAI, kompatibel dengan Anthropic, dan dasbor native di lima wilayah, dan mode berpikir dapat diaktifkan atau dinonaktifkan dengan parameter `enable_thinking`. Tarifnya adalah $2,00 per juta token masukan dan $6,00 per juta token keluaran.

Snapshot bertanggal, `qwen/qwen3.8-max-0902`, diterbitkan pada 2 September 2026 dengan kemampuan yang sama dan harga yang sama, diterbitkan secara khusus agar perilakunya dapat dipatok untuk proses yang dapat direproduksi. Jika Anda membangun dengan Qwen3.8-Max untuk kebutuhan jangka panjang, pengenal snapshot itulah yang perlu dimasukkan ke konfigurasi, bukan alias yang terus berubah.

Perhatikan apa yang tidak ada dari deskripsi itu: jumlah parameter yang dapat Anda unduh, file lisensi, dan jalur apa pun untuk menjalankannya sendiri. Qwen3.8-Max adalah produk yang dihosting. Liputan jurnalistik saat peluncuran melaporkan bobot terbuka yang dijanjikan untuk minggu berikutnya, dan pembingkaian techsy — "2.4T parameter, konteks 1M, belum ada bobot" — adalah keadaan yang harus diverifikasi pembaca alih-alih diasumsikan, karena janji yang dilaporkan saat peluncuran bukanlah checkpoint yang dipublikasikan.

Empat dimensi, dan tidak ada satupun yang dekat

• Parameter — TwIL-LM3-Pro 3,66B dense, semuanya aktif vs Qwen3.8-Max dilaporkan pada total 2,4T dalam desain sparse mixture-of-experts dengan sekitar 95B aktif per token. Tiga orde besaran pada total, dua pada yang aktif.

• Tempatnya berjalan — TwIL-LM3-Pro diunduh sebagai bf16 sebesar 6,82 GiB atau Q4_K_M GGUF sebesar 2,09 GiB untuk CPU atau VRAM 4 GB, sedangkan Qwen3.8-Max hanya tersedia sebagai endpoint yang dihosting.

• Konteks — TwIL-LM3-Pro 131.072 token, diwarisi dari basis Granite-nya dan tidak pernah divalidasi melebihi 8.192 dalam evaluasinya sendiri dibandingkan dengan Qwen3.8-Max pada 1.000.000 token.

• Modalitas — teks masuk, teks keluar vs teks, gambar, dan video masuk, teks keluar.

• Lisensi — webAI Non-Commercial License ver. 1.0, dengan perjanjian terpisah yang diperlukan untuk penggunaan yang menghasilkan pendapatan vs API komersial yang dihosting tanpa bobot untuk dilisensikan.

• Biaya — TwIL-LM3-Pro: tanpa biaya per token dan tanpa endpoint yang dihosting, dibandingkan dengan Qwen3.8-Max yang mengenakan $2.00 per juta token input dan $6.00 per juta token output, dengan tarif input yang di-cache sekitar $0.25 per juta.

Model 3.66B murah karena kecil, dan kecil karena hanya melakukan satu hal. Qwen3.8-Max mahal karena bersifat umum dan di-hosting. Tak satu pun dari tarif itu merupakan vonis.

Pertanyaan di balik pertanyaan

Singkirkan kebingungan penamaan, dan tersisa sebuah pertanyaan rekayasa, dan itu pertanyaan yang bagus: jika model terhosting terdepan dapat bernalar tentang logika formal, mengapa harus menjalankan spesialis yang sempit sama sekali?

Tiga alasan yang tetap valid. Yang pertama adalah lisensi dan jaringan: kelompok riset non-komersial, lingkungan air-gapped, atau proses pelabelan batch yang harus berjalan di laptop tanpa konektivitas tidak dapat memanggil endpoint yang dihosting, dan GGUF 2,09 GiB menjawab kendala itu secara langsung. Yang kedua adalah struktur biaya terhadap volume — pekerjaan pelabelan logika formal atas satu juta input pendek membayar per token pada model frontier yang dihosting dan tidak membayar apa pun selain waktu nyata pada model lokal. Yang ketiga adalah bentuk keluaran: TwIL-LM3-Pro disetel untuk menghasilkan struktur yang dapat diperiksa mesin alih-alih prosa, dan untuk label entailment dan parse semantik, itu adalah pipeline yang lebih kecil daripada meminta model umum dan mengurai jawabannya.

Sebaliknya, kasus Qwen3.8-Max sederhana. Ia dapat melihat gambar dan video, ia menampung satu juta token, ia menangani alat dan keluaran terstruktur melalui API yang terdokumentasi, dan ia memiliki tolok ukur yang dipublikasikan serta evaluasi independen yang mendukungnya. Tidak ada apa pun pada spesialis yang sempit yang mengancam hal itu; keduanya menjawab rangkaian batasan yang berbeda.

Stack yang menggunakan keduanya

Pola yang bertahan saat bersentuhan dengan pipeline nyata adalah pola dua tingkat, dan itu tidak eksotis. Model terdepan yang dihosting membaca input berantakan — halaman buku teks hasil pindaian, sumber dengan modalitas campuran, spesifikasi panjang — dan mengubahnya menjadi teks terstruktur yang bersih. Teks itu masuk ke model logika formal lokal yang seluruh tugasnya adalah mengeluarkan label, hasil parse, atau kritik Lean di perangkat keras yang Anda miliki. Putusan tentang apakah tingkat kedua itu sepadan dengan biaya pemeliharaannya adalah perbandingan bergaya strict-7, bukan gerbang, karena spesialis mendapatkan tempatnya di jalur-jalur tempat metrik tidak memiliki ruang untuk penilaian yang longgar.

Ada juga isyarat yang layak diambil dari card milik webAI sendiri: pipeline ini dijalankan pada lima model dasar yang berbeda, dengan hanya koefisien merge yang berubah per model, dan webAI melaporkan hasil untuk masing-masingnya, termasuk yang perubahannya paling kecil. Itu adalah klaim yang lebih kuat tentang sebuah resep daripada satu baris benchmark mana pun, dan itulah jenis bukti yang memberi tahu Anda bahwa suatu metode dapat digeneralisasi, bukan bahwa satu checkpoint kebetulan beruntung.

Apa yang dapat dirutekan di sini, dan apa yang tidak

Inilah satu-satunya tempat di mana kedua model itu benar-benar berada dalam satu kalimat yang sama. Qwen3.8-Max adalah sebuah rute: model ini dilayani melalui OrcaRouter sebagai `qwen/qwen3.8-max`, dan karena platform meneruskan harga daftar penyedia dengan tambahan markup 0%, tarif $2.00/$6.00 adalah milik vendor sendiri dan pemotongan harga vendor langsung berlaku pada hari yang sama, bukan setelah siklus kontrak. Snapshot `qwen/qwen3.8-max-0902` yang bertanggal dapat dirutekan bersama model tersebut, sehingga menyematkan id model yang dapat direproduksi menjadi pilihan konfigurasi, bukan hubungan vendor yang terpisah.

TwIL-LM3-Pro bukanlah sebuah rute, dan tidak jujur untuk menyiratkan sebaliknya. Lisensinya non-komersial tanpa endpoint hosted yang dipublikasikan, dan cara menggunakannya saat ini adalah mengunduh checkpoint dan menjalankannya sendiri. Yang dilakukan router untuk pipeline yang dibangun di sekitarnya adalah pekerjaan teks di sekelilingnya — perluasan prompt, pembuatan korpus, tahap penyaringan — yang berjalan pada endpoint yang kompatibel dengan OpenAI yang sama terhadap lebih dari 200 model, sehingga menukar model yang menghasilkan data evaluasi dengan model yang menilainya tidak memerlukan apa pun selain mengubah konfigurasi, dengan failover otomatis untuk menjaga batch panjang tetap berjalan saat penyedia tersendat.

Penggunaan paling dapat dipertahankan dari keduanya secara bersamaan adalah tepat itu: tier frontier yang dapat dirutekan untuk melakukan penalaran umum dan ekstraksi terstruktur, spesialis yang diunduh untuk melakukan penilaian logika formal, dan satu kunci untuk segala hal di antaranya.

Model mana yang harus dibandingkan, dan kapan

Jika Anda mengevaluasi model logika formal yang kecil, Qwen yang layak disandingkan dengan TwIL-LM3-Pro adalah Qwen3-8B, dan webAI telah menerbitkan perbandingan itu beserta catatan-catatannya. Jika Anda memilih tempat untuk menjalankan beban kerja produksi, Qwen3.8-Max adalah keputusan yang sama sekali berbeda — sistem terdepan yang dihosting dengan daftar tarif dan tanpa unduhan — dan pertanyaan yang tepat bukanlah mana yang lebih baik, melainkan kendala mana yang mengikat: konektivitas dan lisensi di satu sisi, konteks, modalitas, dan skala di sisi lain. Sebagian besar sistem nyata pada akhirnya membutuhkan kedua jawaban itu.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari