Gemini 3.5 Flash-Lite vs Qwen 3.8: Kuda Kerja Murah vs Flagship 2.4T
Guides & Insights

Gemini 3.5 Flash-Lite vs Qwen 3.8: Kuda Kerja Murah vs Flagship 2.4T

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ketika perbandingan ini pertama kali ditulis, hasilnya timpang dengan cara yang tidak biasa: Gemini 3.5 Flash-Lite adalah produk nyata yang dapat dibeli dan Qwen 3.8 adalah pratinjau tertutup tanpa harga, tanpa tolok ukur, dan tanpa bobot. Hanya ada sedikit yang bisa dibandingkan.

Itu bukan lagi situasinya. Qwen3.8-Max mencapai ketersediaan umum pada 3 Agustus 2026 dengan daftar harga yang dipublikasikan sebesar $2 / $6 per juta token, endpoint yang kompatibel dengan OpenAI dan DashScope, serta tabel benchmark lengkap. Layanan ini dapat diakses secara mandiri, dapat dianggarkan, dan sudah aktif — termasuk di OrcaRouter. Jadi artikel ini telah ditulis ulang dari nol, karena perbandingan yang jujur saat ini bukanlah "model yang sudah dirilis versus vaporware." Ini benar-benar tier perbandingan: kuda kerja ber-throughput tinggi termurah dari Google melawan flagship terbesar milik Alibaba.

Catatan untuk para pengembang — keduanya berada di ujung yang berlawanan dari kurva biaya, jadi pertanyaan yang tepat adalah di tingkat mana beban kerja Anda berada. OrcaRouter menyediakan 200+ model di belakang satu endpoint yang kompatibel dengan OpenAI, sehingga Anda dapat menguji keduanya pada tugas yang sama tanpa harus menyambungkan dua SDK.

Ringkasan singkat. Model-model ini sebenarnya tidak bersaing — keduanya menjawab pertanyaan yang berbeda. Flash-Lite adalah model efisiensi: Artificial Analysis Index 36, $0.30 / $2.50 per 1M, kira-kira 490 token/detik, tersedia secara umum. Model ini dibuat untuk berjalan pada setiap permintaan dengan biaya yang dapat diabaikan. Qwen3.8-Max adalah model unggulan: ~2.4T parameter, konteks 1M-token dengan tarif datar, masukan gambar dan video asli, serta skor setara frontier yang dilaporkan sendiri (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — dengan biaya $2 / $6, yang 6.7× tarif masukan Flash-Lite. Flash-Lite adalah pilihan default yang tepat untuk klasifikasi volume tinggi, routing, dan ekstraksi. Qwen3.8-Max adalah yang Anda gunakan ketika sebuah tugas benar-benar membutuhkan penalaran frontier, konteks satu juta token, atau masukan non-teks. Satu catatan yang tidak berubah: Qwen masih belum memiliki skor benchmark independen.

Poin-poin penting

Qwen 3.8 kini tersedia secara umum — per 3 Agustus 2026, versi ini telah menerbitkan harga, akses swalayan, dan tabel benchmark. Penggambaran sebelumnya sebagai pratinjau terbatas tanpa anggaran kini sudah usang.

Flash-Lite jauh lebih murah: $0.30 / $2.50 per 1M dibandingkan dengan Qwen's $2 / $6 — sekitar 6.7× pada input dan 2.4× pada output.

Flash-Lite jauh lebih cepat: sekitar 490 tokens/sec, dibuat untuk pekerjaan dengan throughput tinggi. Qwen3.8-Max menunjukkan p50 time-to-first-token sebesar 1.64s dalam telemetri 7 hari OrcaRouter, tetapi merupakan model yang besar dan menyeluruh.

Flash-Lite memiliki satu-satunya skor yang diaudit: Artificial Analysis Index 36. Qwen3.8-Max tetap belum dinilai oleh setiap evaluator independen, meskipun Alibaba kini menerbitkan angka-angkanya sendiri.

Qwen menang telak dalam hal kemampuan: sebuah konteks 1M-token dengan tarif flat tanpa biaya tambahan untuk prompt panjang, plus input teks/gambar/video, dan OmniDocBench 1.5 92.1 untuk penguraian dokumen. Flash-Lite adalah model efisiensi kecil.

Bobot terbuka:Qwen dijanjikan minggu ini (belum ada lisensinya), ditambah Qwen3.8-27B yang dilaporkan berjalan di ~17GB VRAM. Flash-Lite ditutup permanen.

Catatan akurasi: semua angka kualitas Qwen3.8-Max dilaporkan oleh Alibaba dan belum diverifikasi oleh pihak ketiga. Angka Gemini 3.5 Flash-Lite berasal dari Artificial Analysis. Penetapan harga Qwen adalah kartu tarif GA dari Alibaba Model Studio dan menggantikan akses era pratinjau yang dijelaskan dalam versi-versi sebelumnya dari artikel ini.

Spesifikasi dan harga, berdampingan

• Pembuat / status — Flash-Lite: Google; umumnya tersedia; Qwen3.8-Max: Alibaba; GA (3 Agustus 2026)

• Posisi — Flash-Lite: tingkat efisiensi murah dengan throughput tinggi; Qwen3.8-Max: andalan / ambisi terdepan

• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Belum diberi skor

• Skor yang dilaporkan vendor — Flash-Lite: standing diukur oleh pihak ketiga; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (semua dilaporkan oleh Alibaba)

• Harga (per 1M, input/output) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, datar di seluruh konteks 1M; input cache $0.25

• Kecepatan — Flash-Lite: ~490 token/detik (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1,64 detik (telemetri OrcaRouter 7 hari)

• Konteks — Flash-Lite: konteks tingkat efisiensi; Qwen3.8-Max: 1M token (983.616 dengan mode berpikir; output maksimum 131.072)

• Modalitas — Flash-Lite: model efisiensi yang berfokus pada teks; Qwen3.8-Max: teks, gambar, video masuk → teks keluar

• Bobot — Flash-Lite: tertutup, khusus API; Qwen3.8-Max: dijanjikan dalam minggu ini, belum ada lisensi

• Akses hari ini — Flash-Lite: API standar, layanan mandiri; Qwen3.8-Max: API standar, layanan mandiri (Model Studio, DashScope, OrcaRouter)

Disusun dengan cara ini, temuannya benar-benar berbeda dari sebelumnya. Kolom Qwen tidak lagi kosong — kolom itu penuh, dan pada beberapa baris, Qwen menjadi entri yang lebih kuat. Yang menggantikan bingkai lama "kuantitas yang diketahui versus janji" adalah kesenjangan tingkat yang jelas: Flash-Lite kira-kira 6.7× lebih murah untuk input dan sekitar 13× lebih cepat dalam hal throughput, sementara Qwen menawarkan konteks multimodal sejuta token dan penalaran klaim tingkat terdepan. Keduanya adalah produk yang sah; keduanya hanya melayani pekerjaan yang berbeda.

Satu-satunya baris di mana peringatan lama masih berlaku adalah baris benchmark. Indeks 36 Flash-Lite diukur oleh Artificial Analysis pada papan peringkat publik. Setiap angka Qwen — GPQA Diamond 92.6, Terminal-Bench 86.6, dan lainnya — dihasilkan oleh Alibaba dengan harness miliknya sendiri. Itu adalah peningkatan nyata dibandingkan tidak menerbitkan apa pun, tetapi itu bukan verifikasi pihak ketiga, dan laboratorium menerbitkan benchmark yang mereka menangkan.

Index 36 vs flagship yang belum dinilai: membaca ini dengan jujur

Sungguh menggoda untuk membandingkan Index 36 milik Flash-Lite dengan GPQA Diamond 92.6 milik Qwen dan menyatakan kemenangan telak. Itu akan menjadi kesalahan kategori dua kali lipat.

Pertama, Artificial Analysis Intelligence Index adalah gabungan dari banyak tugas; GPQA Diamond adalah satu tes sains tingkat pascasarjana. Keduanya tidak berada pada skala yang sama dan tidak dapat dikurangkan satu sama lain.

Kedua, dan yang lebih penting, Flash-Lite tidak pernah dirancang untuk meraih skor tinggi. Indeks 36 adalah seperti apa model efisiensi itu. Tujuan rekayasa Google adalah model yang cukup murah dan cepat untuk ditempatkan di depan setiap permintaan masuk — perutean tiket, klasifikasi, ekstraksi, peringkasan dalam volume besar — di mana model mutakhir akan menjadi tidak masuk akal secara ekonomi. Menilainya terhadap flagship 2.4T pada batas penalaran melewatkan tujuan sebenarnya.

Apa yang dapat kami katakan lebih sempit dan lebih berguna. Qwen3.8-Max kemungkinan besar adalah model yang jauh lebih cakap — angka yang dilaporkannya sendiri jauh di atas yang akan dihasilkan model Index-36, dan lompatan FrontierSWE menjadi 73,5 dari 40,7 milik pendahulunya menunjukkan kemajuan nyata. Tetapi "sangat mungkin" tetaplah sebuah inferensi, karena belum ada evaluator independen yang memberinya skor. Sebagai konteks, pendahulu Qwen3.7-Max mencetak 46 pada Indeks AA — lebih tinggi dari 36 milik Flash-Lite, tetapi jauh dari level terdepan — jadi lompatan generasi yang tersirat dari Alibaba besar dan belum terverifikasi.

Konsekuensi praktisnya: jika tugas Anda adalah salah satu yang Flash-Lite sudah selesaikan dengan benar, batas atas Qwen yang lebih tinggi tidak ada artinya bagi Anda dan Anda akan membayar 6.7× untuk itu. Batas atas hanya penting ketika Flash-Lite benar-benar gagal.

Biaya dalam praktik: kesenjangan tier dalam angka

Ambil contoh pekerjaan klasifikasi bervolume tinggi: 2.000 token input, 200 token output, dijalankan 500.000 kali sehari — bentuk triase dukungan atau perutean konten yang realistis.

Flash-Lite: per panggilan, 0.002M × $0.30 = $0.0006, ditambah 0.0002M × $2.50 = $0.0005. ≈ $0.0011 per panggilan → ~$550/hari.

Qwen3.8-Max: per panggilan, 0.002M × $2 = $0.004, ditambah 0.0002M × $6 = $0.0012. ≈ $0.0052 per panggilan → ~$2.600/hari.

• Bulanan: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — selisih $61,500 untuk volume tugas yang sama.

Pada skala tersebut, pilihan tier adalah satu pos terbesar dalam sistem, dan sangat sulit untuk membenarkan flagship untuk pekerjaan yang ditangani oleh model efisiensi. Inilah skenario yang Flash-Lite dirancang untuk.

Sekarang balikkan. Ambil tugas dokumen panjang: 600.000 token konteks, 5.000 token keluaran, 200 kali sehari.

Qwen3.8-Max: 0.6M × $2 = $1.20, ditambah 0.005M × $6 = $0.03. ≈ $1.23 per panggilan, tanpa biaya tambahan untuk prompt panjang — dan kira-kira $0.18 jika konteks disimpan dalam cache dengan harga $0.25/1M.

Flash-Litetidak dapat diberi harga untuk bentuk ini sama sekali, karena model kelas efisiensi tidak dirancang untuk menampung konteks panggilan tunggal 600.000 token.

Jadi jawabannya berubah total tergantung bentuk beban kerja—itulah pelajaran sebenarnya. Flash-Lite menang telak untuk pekerjaan bervolume tinggi dengan konteks pendek. Qwen menang untuk hal apa pun yang membutuhkan satu juta token atau input non-teks, di mana Flash-Lite bukanlah opsi yang lebih murah, melainkan memang bukan opsi sama sekali.

Skenario: tingkat mana yang cocok

Triage dukungan dan perutean secara massal. Flash-Lite, tentu saja. Indeks 36 sudah cukup untuk klasifikasi, dan dengan sekitar $0.0011 per panggilan, Anda dapat menjalankannya pada setiap tiket. Eskalasikan hanya minoritas yang ambigu ke model yang lebih besar.

Analisis kontrak atau pengarsipan dokumen secara menyeluruh. Qwen3.8-Max. Konteks tarif tetap 1M berarti dokumen 400 halaman dapat diproses dalam satu panggilan tanpa biaya tambahan dan tanpa pemecahan, dan nilai 92.1 di OmniDocBench 1.5 yang dilaporkan sendiri memang menyasar persis pekerjaan seperti ini.

Pipeline tangkapan layar, bagan, atau video. Qwen3.8-Max, secara default — ia menerima masukan gambar dan video serta melaporkan OSWorld-Verified 86.1 dalam mengoperasikan GUI nyata. Flash-Lite bukan kandidat untuk masukan non-teks.

Pengodean agentik.Qwen3.8-Max pada angka yang diklaim (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), dengan catatan bahwa tidak ada yang diverifikasi secara independen dan skor yang dilaporkan sendiri paling lemahnya adalah IFBench 82.8 pada kepatuhan instruksi — risiko nyata untuk pipeline yang mengurai keluaran setiap langkah.

Arsitektur dua tingkat. Sering kali jawaban yang benar adalah keduanya: Flash-Lite sebagai langkah pertama yang murah untuk setiap permintaan, Qwen3.8-Max sebagai jalur eskalasi untuk sebagian kecil yang membutuhkan satu juta token, gambar, atau penalaran yang sesungguhnya. Pola tersebut menangkap sebagian besar keunggulan biaya Flash-Lite sambil tetap menyediakan opsi frontier.

Hosting mandiri dan keterbukaan

Flash-Lite bersifat tertutup dan hanya melalui API, secara permanen — tidak ada jalur self-host.

Bobot Qwen3.8-Max dijanjikan tersedia dalam pekan ini, tetapi model andalannya bukan target yang realistis: kira-kira 1.2TB pada 4-bit dibandingkan dengan sekitar 141GB per H200 berarti delapan atau lebih akselerator kelas atas, dan Alibaba masih belum mengungkapkan jumlah parameter aktif, sehingga throughput yang dapat diperoleh dengan pengeluaran tersebut tidak dapat dimodelkan. Juga belum ada teks lisensi, yang berarti kelayakan komersial secara formal belum ditentukan.

Diumumkan secara bersamaan, Qwen3.8-27B adalah rilis yang sebenarnya penting untuk rencana on-premise. Juga bersifat open-weights dan dilaporkan berjalan dalam sekitar 17GB VRAM, ini adalah opsi self-hosting yang sesungguhnya — dan, yang perlu dicatat, pesaing yang jauh lebih dekat dengan ceruk efisiensi Flash-Lite dibandingkan flagship 2.4T.

FAQ

Bisakah saya menggunakan Qwen 3.8 hari ini?

Ya. Qwen3.8-Max mencapai ketersediaan umum pada 3 Agustus 2026 dengan harga yang dipublikasikan sebesar $2 / $6 per 1 juta token dan endpoint yang kompatibel dengan OpenAI dan DashScope. Layanan ini bersifat swalayan melalui Alibaba Model Studio, DashScope, dan OrcaRouter. Versi awal artikel ini menggambarkan pratinjau terbatas; itu sudah usang.

Yang mana yang lebih murah?

Gemini 3.5 Flash-Lite, dengan selisih yang jauh: $0,30 / $2,50 per 1M dibandingkan dengan $2 / $6 milik Qwen3.8-Max — kira-kira 6,7× lebih murah untuk input dan 2,4× untuk output. Pada pekerjaan bervolume tinggi dengan konteks pendek, perbedaan itu mendominasi semua pertimbangan lainnya.

Mana yang lebih baik?

Mereka berada di tingkatan yang berbeda. Flash-Lite memiliki satu-satunya skor yang diaudit (AA Index 36) tetapi dibuat untuk throughput murah, bukan untuk penalaran. Qwen3.8-Max kemungkinan besar jauh lebih mumpuni — skor GPQA Diamond 92.6 dan Terminal-Bench 2.1 86.6 yang dilaporkan sendiri berada di level frontier — tetapi tidak memiliki tolok ukur independen, sehingga itu tetap merupakan inferensi, bukan hasil terukur.

Mana yang lebih cepat?

Flash-Lite, secara substansial. Artificial Analysis mengukur sekitar 490 token/detik, yang memang menjadi tujuan desain tingkat efisiensinya. Qwen3.8-Max menunjukkan p50 waktu hingga token pertama sebesar 1,64 detik dalam telemetri 7 hari OrcaRouter, tetapi model ini besar dan menyeluruh, dan para peninjau era pratinjau menemukannya lambat pada build agen jangka panjang.

Apakah Qwen 3.8 sekarang sudah memiliki open weights?

Belum. Alibaba mengatakan bobot model unggulan akan tiba dalam minggu ini, tetapi masih belum ada lisensi, kartu model, atau repositori. Bahkan setelah dirilis, model 2.4T membutuhkan delapan atau lebih GPU kelas H200. Qwen3.8-27B yang diumumkan secara bersamaan, dilaporkan membutuhkan ~17GB VRAM, adalah opsi hosting mandiri yang praktis.

Haruskah saya menggunakan keduanya?

Sering kali ya. Pengaturan dua tingkat — Flash-Lite sebagai jalur pertama yang ekonomis untuk setiap permintaan, Qwen3.8-Max sebagai jalur eskalasi untuk tugas konteks panjang, multimodal, atau yang benar-benar sulit — mempertahankan sebagian besar keunggulan biaya Flash-Lite sambil memberi Anda opsi frontier yang sepadan dengan harganya.

Mana yang harus saya pilih untuk produksi hari ini?

Flash-Lite untuk pekerjaan bervolume tinggi, konteks pendek, dan hanya teks di mana Index 36 sudah memadai — murah, cepat, diaudit, dan terbukti. Qwen3.8-Max ketika beban kerja membutuhkan konteks satu juta token, masukan gambar atau video, atau penalaran yang jelas-jelas gagal dilakukan Flash-Lite. Keduanya kini benar-benar dapat digunakan, yang belum berlaku saat perbandingan ini pertama kali ditulis.

Intinya

Gemini 3.5 Flash-Lite vs Qwen 3.8 Dulu ini adalah perbandingan antara sebuah produk dan sebuah pengumuman. Sekarang tidak lagi. Sejak 3 Agustus 2026, Qwen3.8-Max tersedia secara umum, memiliki harga, dapat digunakan secara mandiri, dan terdokumentasi — jadi cara pandang yang jujur adalah keputusan tingkatan, bukan keputusan kesiapan.

Flash-Lite tetap menjadi default yang tepat untuk pekerjaan yang dibuat untuk itu: dengan $0.30 / $2.50 dan ~490 token/detik, ia berjalan pada setiap permintaan dengan biaya yang sangat kecil, dan Index 36 yang telah diaudit sepenuhnya memadai untuk klasifikasi, perutean, dan ekstraksi. Qwen3.8-Max adalah tingkat eskalasi — konteks tarif tetap satu juta token, input gambar dan video asli, dan penalaran frontier yang diklaim — dengan biaya input sekitar 6.7× lipat. Satu kelemahannya yang belum teratasi sama seperti sebelumnya: belum ada evaluator independen yang menilainya, sehingga kasus kualitasnya bertumpu pada tabel Alibaba sendiri. Perhatikan skor Intelligence Index independen pertama dan bobot Qwen3.8-27B, yang akan bersaing jauh lebih langsung dengan niche Flash-Lite. Sementara itu, pilih berdasarkan bentuk beban kerja — dan pertimbangkan untuk menjalankan keduanya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube